程曼祺
我们想回到最开始的时候,聊聊你整个的经历。其实你之前也很少接受采访,所以我觉得这是一个很好的机会,可以从头聊一聊。每一个时间点,你做的事情和一些选择都挺有代表性的。
回顾这几年的历程,如果让你讲一下自己在人工智能领域的探索,第一个在你脑海中出现的场景或者时刻是什么?
曹越
我觉得第一个场景,应该还是决定做 AI,或者在那个时候可能还更偏机器学习,到后来比较幸运地去做深度学习的那个时刻。
程曼祺
那很早吧?是不是上本科的时候?
曹越
1. 从机器学习走向深度学习
对,大概是 2014 年左右。那个时候坦率地说比较幸运。实际上在国内,深度学习那时候不怎么火,而且还有一批很有代表性的国内老教授,他们当年是做机器学习的,甚至有教授在自己的主页上直接写:我不做超过两层的神经网络。
程曼祺
2014 年你是大几?
曹越
我大四。相当于在读 PhD 阶段,刚好遇到了可以做深度学习的这个时代。
当时我的 mentor 去 Berkeley visit,发现硅谷所有人都在讨论深度学习。大家没有那么多 legacy,不会觉得“我不应该做太深的神经网络”。当时我所在的研究组,应该也算是国内最早一批买了卡、但卡很少,然后开始做深度学习的组。
2. 加入传奇视觉研究组
后来大概 2017、2018 年,我去了 MSRA 的视觉组。
程曼祺
这个组是一个我觉得在国内非常有代表性的、非常传奇的组。
曹越
对,包括他们从 2014、2015、2016 年陆续做出来的 ResNet。当然那批人可能在 2016、2017 年也陆续出来创业了。
我大概在 2017 到 2018 年加入那个组,先实习,后来留下来,继续做计算机视觉、多模态和预训练方面的工作。
我觉得这个组坦率地说,的确有一些传承。从我自己的视角来看,我觉得我最受益的有几点。
第一点,你要去做最受关注的 topic,这个 topic 最好还是一个你明确感受到还有很大机会的 topic,而不是一个已经收敛的 topic。
但这个事情有点微妙:一个东西如果最受关注,它就非常火,对吧?那非常火的东西,有可能也已经有些滞后了。所以第一点和第二点要联合起来看:最受关注的另外一面,可能意味着它就是最重要的、这个领域里最重要的 topic,但这个 topic 还有没有前进空间,这是一个需要提前做判断的点。
程曼祺
那你们怎么判断?
曹越
我觉得这还真的是有一些直觉。你可以认为,当你真的在一个行业里做了一段时间,思考过很多关于这个行业的问题之后,你就知道:“这个方向可能只有一些非常微妙的基础信号,但在你这里已经是非常剧烈的信号了。”
程曼祺
我们可以讲一个具体的例子。你们当时 2021 年拿到 ICCV 最佳论文的 Swin Transformer,最开始的 idea 是把 Transformer 用到视觉领域,对吧?
曹越
对。
程曼祺
像这种想法你是怎么来的?
曹越
3. Transformer 进入视觉世界
实际上 Transformer 大概是 2017 年出现的。在我看来,Transformer 的普及,至少在整个视觉和多模态方向上,有两个阶段。
第一个阶段是计算机视觉。计算机视觉发展了很多年,卷积神经网络在那个阶段非常 dominant,几乎统治了整个领域。所以在 2017 年 Transformer 刚出现的时候,我所在的研究组就是最早把 Transformer 应用到计算机视觉方向的组之一。
但那个时候,大家对 Transformer 这个结构的认知还比较浅。大家会去看,Transformer 里面有哪些设计是之前没见过的,然后把它借用到现有的卷积神经网络里。包括 2017 年那篇文章的标题,就是《Attention Is All You Need》。我刚进组的时候,也是在做这个方向,把里面的 Attention Block 应用到卷积神经网络里。
Transformer 是整个网络结构,里面可能有注意力模块,也有 FFN 等等。我们当时是把 Attention Block 应用到卷积神经网络里。这个问题解决起来也比较简单:卷积神经网络天然就是局部的,它的感受野,也就是每个地方能够看多远,是有限制的;但 Attention 提供了一种相对低成本地扩大感受野的方案。
所以最早的时候,大家探索的都是怎么用 Attention 来弥补卷积神经网络的缺陷。
当然还有另外一条路线,做的人更少:能不能用 Attention Block 直接替代卷积?其实在 2018、2019 年的时候,我们研究组已经在做这样的工作了。但那个时候大家还是觉得,我应该 follow 之前比如 ResNet 的整个结构,只是把里面的卷积替换成 Attention Block。这是第一个阶段。
第二个阶段,我觉得最重要的是 2020 年下半年出现的两篇工作。
第一篇是 ImageGPT,还是 OpenAI 做的。他们在做完 GPT-3 之后,非常暴力地把 GPT 应用到了计算机视觉里面。但因为这项工作过于暴力,效果也没有那么好,所以大家可能都看过那篇 paper,但我觉得大多数人没有真正理解它为什么要这么做。那篇文章如果我没记错,应该是 2020 年 6 月。
第二篇是 ViT,也就是 Vision Transformer,是 Google 的一个组做的,大概 2020 年 10 月出来。ViT 把 ImageGPT 里面一个不太 work 的部分改掉了:ImageGPT 是直接在像素上做 self-attention,计算效率很低;ViT 把像素变成一个 patch。你可以把它理解成一个词,比如一个 16×16 的像素块,一组局部像素。
它的核心贡献就是这个。做完之后,它把这个方法应用在图像分类任务上,比如 ImageNet 图像分类,并且取得了不错的效果。
我们也是最早关注到这项工作的团队之一。我觉得在那个时间点,对于视觉方向来说,最核心的认知迭代就是:我们不应该再拘泥于过去由卷积神经网络不断迭代出来的结构,而应该看看能不能把 Transformer 的整个结构应用到计算机视觉里。
ViT 相当于证明了,在图像分类里可以这么做。其他任务能不能做,我不知道,但至少图像分类可以。
所以当时我们的第一个判断是:如果我们能基于 Transformer 的宏观结构,设计出一个对大多数计算机视觉任务都比较适配的网络结构,而且效果还比较好,那它可能就可以直接替代过去基于 ResNet、基于卷积神经网络的整套网络结构。
程曼祺
所以 Swin Transformer 的出发点就是:我不仅可以把 Transformer 的结构用来做分类,还可以做其他常见的视觉任务。
曹越
对,包括目标检测、语义分割等更细颗粒度的任务。同时,图像分类的结果能不能做得更好?
计算机视觉任务的复杂度还是比较高的。在那个时候你可以认为,不同任务从网络结构来看,都是一个系统,并不是一个简单、容易理解的网络结构。那你怎么样把这个最基础的、做表征学习的网络结构,替代成一个下一代网络结构?
我们本身也是最早研究 Transformer 结构的团队之一,对计算机视觉里最关键的 topic,包括图像分类、目标检测和预训练这些任务都非常熟悉。所以在看到 ViT 之后,我们最早看到了这样一个机会。
我觉得那个时间点,当你发现这个机会的时候,能够明确感受到它是一个非常大的机会。
首先,网络结构是深度学习领域最受关注的 topic。第二,它是一个非常基础的单元。如果你真的做出了一个非常好的网络结构,那可能对所有视觉 task 都能带来比较大的提升。
第三,确实有机会设计出一个打破大家过去“计算机视觉必须使用卷积”这一想法的网络结构,设计出一个以 Transformer 结构为核心的网络,然后最终把它用到各个视觉任务里。
当时我们确实看到了这个机会,于是就在组里投入了很多资源,最终把这件事情做成了。
同期除了我们之外,也有一些组看到了类似的机会。我个人认为,这里最关键的还是我们当时意识到这是一个非常大的机会,并且把组里能够参与这个项目的人都拉进来,大家一起把项目做到极致。
在各个维度上做到极致。你可能比同期的工作,在最终展现出来的效果上,各个维度都有显著提升,质量完全不一样。
程曼祺
一方面,你看到一个想法,体现的是大家判断力的竞争:你认为什么问题重要。其次是你把它做出来的效果,执行到什么程度,资源是不是给够了。
曹越
是的。我觉得这里学到的最重要的一点就是,这两者都足够重要。
你要有能力嗅到这个机会;第二,你要有组织能力,真的能抓住这个机会。这两者缺一不可。
不能说每天看到什么 topic 火,就进去做一波,但可能在第二步里做得并不好。这群人依然可以 leverage 到注意力资源,因为只要在这个阶段做出一个大家感兴趣的东西,大家都会关注。
但如果你做得不 solid、不极致,就很难经得起时间考验,很难 stand the test of time。真正想看到很大的机会并且抓住它,这两者都缺一不可。
但这两者有时候也挺冲突的,有时候确实是不同类型的人。
程曼祺
因为你总在看机会,可能就不能把一件事做得特别 solid,总在看新的东西。
曹越
是的。但我认识一些朋友,很属于第二类人。他每做一个 topic,都把这个 topic 做得特别扎实。
他钻进一个 topic 之后,会花很多时间研究,最后做得很好。但等他做出来的时候,可能发现这波风已经过去了。因为他做事情太过扎实,所以总是很难在机会出现的第一时间把握住机会。
从做事的维度上,有时候反而不赶趟。但如果他比较幸运,碰到了一个机会,并且抓住了,他也能做出非常出色的工作。只是你看他的大多数工作,可能都没赶上时机,但那些工作的质量都不错。
程曼祺
其实现代 AI 的研究机构和组织,也有点像公司运营,有一些共通的部分,对吧?它涉及很多人的协作,以及我们到底选什么方向、在不同方向上投入多少。
曹越
对。不过我觉得,这更像是至少在 2020、2021 年,OpenAI 出现之前,大家的一些做事方法论。
4. 从论文走向系统
对我自己来说,大概 2021 年左右有了一个比较大的 mindset shift,这也是促使我离开 MSRA、加入智源研究院的原因。
程曼祺
可以讲讲吗?
曹越
我认为之前那种做事方法论的天花板还是比较明显。即使你可以做出很出色的 paper,甚至拿到 Best Paper,但我当时的第一感受是:我们去看 OpenAI 的工作,去看 DeepMind 的工作,他们能够做出非常非常厉害的东西。
比如 DeepMind 做 AlphaFold,最后可以拿诺贝尔奖。其实我感觉其中 AI 部分还是非常重的。同样都是做 AI 的,为什么他们能拿诺贝尔奖?
程曼祺
拿的是化学奖。AlphaFold 获得的是诺贝尔化学奖。
曹越
对。所以这会激发你去想,为什么他们能做出这样的工作?
AlphaFold 是一个例子。另一个例子是,当时我在 MSRA 主要还是做计算机视觉和动作识别相关的工作。2021 年初,OpenAI 放出了两个工作,DALL·E 1 和 CLIP。
我觉得那两篇工作已经非常能说明问题了,但我身边真正研究“为什么 OpenAI 能做出这样的工作,并且给这样的工作以符合它们影响力的评价”的人并不多。
大多数人的第一反应可能是:“这个工作我好像 touch 不到。”或者:“它需要的算力太多了。OpenAI 有足够多的算力,我们没有算力,所以这套东西跟我们没什么关系。”于是也不会花很多时间去研究它。
但至少对我自己来说,当我看到 DALL·E 1 和 CLIP 的时候,还是非常惊讶。如果你能放下自己的 ego,仔细研究这两份工作,我觉得它们非常能说明问题:它们的做事方法论、mindset 和组织形态,和至少当时我们做 paper 的感觉,差别非常大。
程曼祺
你可以总结一下,当时看到的他们的组织方法论和 mindset 是什么吗?
曹越
有几点。
第一点,我觉得当时大多数国内研究组还是 paper-driven,最后能不能做出一个 paper、能不能发表,是核心驱动力。
这本身会带来很多问题。Paper 有作者列表,谁是一作、谁是二作、谁是三作?本质上,它就没有那么鼓励合作。
其实我们当时在 MSRA 的研究组,一定程度上已经意识到了这方面的问题,也在努力做组织上的变化和调整,mindset 上也在调整,但这个变化没有那么快。
所以第一点是,大多数国内研究组还是 paper-driven。
第二点,当你很关注 paper 的时候,有时就会受审稿人的 taste 影响。审稿人总会问,这篇 paper 有什么 novelty、有什么创新性、方法上有什么创新。这是大家最容易问的问题。
那你肯定会去 optimize 这件事:我是不是应该提出一个新的东西,把故事讲得新一点,让别人觉得这个东西挺有意思。
但 OpenAI 他们的方法看起来反而都非常简单。他们的工作很多时候不是从“我在方法侧有什么 trick”这个维度出发。我觉得这有点像是,当你的基础方法论和目标不同,你思考问题的方式也不一样。
很多人的解决方式,更像是:能不能设计出一个 scalable 的、能够最大化利用算力的系统来解决这个问题,而不是能不能在方法上搞一些 trick 来解决问题。
这是第二个很大的不同。
第三个不同是组织上的不同。我觉得这些都是一脉相承的。
如果你是一个 paper-driven 的组织,那大概率组织就要比较小。很多时候学生是你的主要合作对象。学生当然也很好,他们可能很有主动性,希望博士毕业,但你很难让他们进行真正的协作。
如果你真的要打造一个 scalable system,需要的人是很多样的:有人爬数据,有人洗数据,有人 train model,有人研究模型怎么高效地 train 起来,有人负责评测,包括最后怎么做 PR。
这整套所需要的人,和小作坊式的组织完全不一样。而且你需要这群人拥有类似的 mindset:希望把这个 system 做好,而不是希望在最后发表的 paper 里成为 first author 或 second author。
这就使得组织形态非常不一样。
但至少在 2021 年,我还不知道这种组织形态到底该怎么构建。后来我发现,这就是创业公司。本质上就是创业公司。
程曼祺
所以你当时想的是,想做出更厉害的成果。你关注的其实是怎么把这件事做成,以及背后的组织形态和做事方法。
曹越
对。我想知道,为什么 OpenAI 能做出这么厉害的东西,为什么 DeepMind 能做出这么厉害的东西?它们和我当时所在的组织、或者我身边看到的组织之间,差别到底是什么?
当时还有一个很大的 barrier,可能大家不一定记得,就是疫情。
从 2020 年到 ChatGPT 出来之前,大概两年多的时间里,疫情是一个很大的 barrier,使得国内和硅谷之间的 communication 没有那么多。
当时我们在微软研究院,和比如 Raman [?] 那边有一些交流,但也仅限于远程。大家面对面的交流活动少了很多,很多学术会议也远程开了好几年。
我觉得这也促成了这样一个情况:实际上从 2020 年开始,OpenAI 已经展现出了非常不一样的成果,但因为大家之间的交流受到影响,如果一个人没有办法放下自己的 ego、充分研究他们,也没有更多信息促使你去做这件事,就更容易被自己的知识茧房限制。
所以对我来说,当时最关键的问题就是:为什么他们能做出这么厉害的东西?我们到底应该打造一个什么样的组织?身边应该有什么样的人,能够一起把这样的事情做成?
这就是我在加入智源之前,大概从 2021 年到 2022 年花最多时间研究和思考的问题。
程曼祺
但你当时并没有想创业。你当时想的其实还是一种新型研究机构。
曹越
对。我觉得那个时间点,我对创业这件事的认知和理解也没有那么深,身边也没有很多人创业。
程曼祺
那你可以讲讲,智源当时是什么状态,让你觉得从微软亚研院去智源,更能实现你想要的做事方式?
曹越
我觉得智源是国内最早一批拥抱 OpenAI 方法论、拥抱大模型的组织,也是一个新型研发机构。本质上,它可以不以发论文作为核心指标。
在我那个时间点的认知里,我认为它是国内最像 OpenAI 的组织。相似度可能没有那么高,但已经是最像的了。这是我加入智源的核心原因。
首先,他们的自由度比较高。其次,智源在那个阶段很早就提出要有比较大的算力集群。可能在 2022 年中,智源就有一个 1,500 张 A100 连在一起的集群。在国内那个时间点,超过 1,000 张卡的集群都非常少。
所以它首先是一个比较宽松的科研环境。你可以筛选出一些有创业 mindset 的人,和你一起探索更前沿的项目。
但目标不是提出更先进的方法,而是大家构建一个 system,像 DALL·E、CLIP 这样的 system,最后取得很不错的成果。
智源当时还有另外一个目标,就是开源开放。我们可以把模型开源出去,让更多人用到这些模型。
所以在那个阶段,对我来说,智源非常符合我当时对 OpenAI 的想象,是一个很好的探索组织。
程曼祺
后来王慧文是怎么认识你们的?
曹越
5. ChatGPT 点燃创业机会
我加入智源是在 ChatGPT 出来之前。加入一段时间之后,ChatGPT 就出来了。我觉得国内的形势瞬间发生了巨大变化。
之前大家可能也没有觉得 OpenAI 有多厉害,甚至有人会想:“我加入智源到底是不是一个正确选项?”毕竟 MSRA 看起来是一个很有传承、很有 impact 的组织,而智源当时还是相对早期的状态。
但 ChatGPT 出来之后,大家都觉得:“原来 OpenAI 这么厉害。”因为中美之间交流变少,再加上各方面原因,导致它之前积累的势能在那一刻突然被释放出来。
所以大家看到 ChatGPT 之后,都处在一个非常兴奋的状态。
后来王慧文发了朋友圈,发了一个英雄帖。
程曼祺
对,本来国内热度已经很不错了,但那个是真正点燃国内大模型热潮的事件。
因为你们是校友,之前并不认识,是吗?
曹越
对。王慧文在清华也开过创业相关的课,但我没有去听过。
程曼祺
那在 ChatGPT 出来之后、认识老王之前,你一直在思考,这个事件会给国内带来什么变化?
曹越
对。我觉得答案还是比较明确的:这是一个巨大机会,而且还处在机会非常早期的阶段。
2023 年初,微软有一篇文章叫《Sparks of AGI》,大家看到了最早的 AGI 火花。但实际上大家也认为,在那个阶段距离后面真正的 AGI 还有很多问题,还有很大的提升空间。
这意味着它是一个会给世界带来巨大变革的技术,但技术本身还处在早期阶段。
而且在那个时间点,我认为它并没有那么强烈地要求你必须是做计算机视觉、做多模态、做语言模型或者做 NLP 的人,才能去做某个特定 task。
我研究 OpenAI 一段时间之后,认为 OpenAI 展现出来的方法论,和传统的这几个领域都不一样。一句话表达,就是你怎么样设计一个 scalable 的 system,使它可以最大化地压榨算力。
但在过去,即使你在 NLP 领域,也可能是围绕一个任务去做。围绕这个任务,有时会加入一些对任务有用、但并不本质的人为先验。
至少当时我的认知是,OpenAI 的方法论非常不一样。所以我当时觉得,这应该是一个巨大的变量和机会。
我也在想,自己能够以什么样的形态参与到这件事里。首先,你可能需要拥有做模型的能力,而且不只是 reproduce,还要有前沿探索能力。因为哪怕当时只是 reproduce,也需要探索。
程曼祺
因为它是闭源模型。
曹越
对。OpenAI 早期有一些开源的东西,但即使它开源了模型,你要 reproduce 也会遇到很多问题,还有数据、训练方法等。
所以你要怎么把模型做出来?如果要做一家公司的话,钱从哪里来?看起来这是一个需要巨大算力投入的事情,那算力从哪里来?后续产品化应该怎么做?如果是一家创业公司,战略应该怎么制定?组织应该怎么搭建?
在那个时间点,我觉得这个事情复杂度非常高,但它明确是一个非常大的机会。
程曼祺
你说的那个时间点,是 2022 年 11 月到 2023 年几月份?
曹越
大概到 3 月份。
程曼祺
所以你当时已经想过创业?
曹越
琢磨过这个事情。只是琢磨之后觉得,这件事本质上复杂度比较高。
我当时拥有的能力,主要是构建一个能够 train model 的组织,也知道怎么去 train model。但实际上缺少的东西还是非常多。
后来老王发了英雄帖,和他聊过之后,我个人的感受是有点一拍即合。
程曼祺
是有人介绍你们认识的吗?
曹越
对。他应该是在国内非常广泛地和各种各样的人聊天。
我觉得他当时的一些动作非常厉害。他通过人与人之间的 connection,把国内当时在深度学习领域做得相对比较好的一批人都聊了一遍。
他和一个人聊完之后,会问:“如果你觉得在你的领域,或者相关领域里,我最应该再和谁聊?”让对方推荐两三个人。通过这种方式,他很快就把国内相对 solid 的一批人都聊过了。
程曼祺
我有个比较好奇的问题。当时他有聊到梁文锋吗?
曹越
好像有,但我记得不那么清楚。因为那个时候我和梁文锋聊过。2023 年 3 月,我其实只和老王、梁文锋聊过。
程曼祺
你当时和梁文锋聊是什么契机?
曹越
是他找过来。他自己找过来。
我想那个时候 DeepSeek 还没有正式成立,他在想怎么参与这件事情。在国内,他应该也把很多研究者都聊了一遍,我和他也聊了一次。
但我见他的时候,其实已经答应老王了。见他的那一刻,我已经答应老王了。
程曼祺
所以你是跟老王很快达成共识,后来一起做了。
你说和老王一拍即合,具体是哪些方面比较契合?
曹越
首先,决策时间并不久。对我来说应该就是 3 月份。从第一次见他到最终决策,前后可能就几周,速度还是比较快的。
第一点,我之前对创业圈没有那么了解。第一次见老王时,我觉得收获非常多,明显能感觉到这个人非常强,能从他身上学到很多东西。他的认知很深,很多时候他说的一些东西,明显蕴含着很深的道理,但你可能还需要花时间去仔细琢磨。
程曼祺
比如说什么?
曹越
我可以说一个到现在还印象深刻的问题。
我自己在很长一段时间都在思考:为什么中国没有出现像 OpenAI 这样的组织?我在国内找了一圈,觉得可能只有智源和它有一些相似之处。
我很困惑,为什么没有这样的组织。但我对互联网行业的理解肯定没有那么深。见老王时,我也问了他这个问题。
他很快给了我一个答案,我觉得这是一个非常有深度的答案。他说,是因为国内这些互联网公司,或者说我们的发展阶段,导致我们“不够富”。
这个问题我花了很长时间去想。现在我只能努力表达自己的理解。
当我们本身处在追赶阶段时,前面是有目标的。你能看到谁做了什么,谁比较明确地在前面。这个时候,你只需要以更快的速度追上他,所以最关键的是效率创新。
你做的事情确定性相对较高,主要需要效率创新。很长一段时间里,我们的发展阶段都是这样。
但当你在各种行业里越来越接近前沿时,前面几乎没人了,没有谁比你显著更靠前。就像是,你距离它越远,方向感越强;但距离它越近,方向感就越弱。
因为如果它是领先者,它可能本来就在做 exploration,它也不知道哪个方向更对。
当我们处在追赶阶段,有很多相关现象。比如说“不够富”,我觉得这是一种表现。
另外一种表现是,在这个阶段,ROI 最高的还是效率创新、模式创新,而不是原创创新。
但当发展阶段越来越接近前沿,各个维度上的 mindset 可能都需要发生变化。
比如创投圈、投资圈,大家的 mindset 是不是也要变化?以前大家追求的是:“这件事我已经看明白了,只需要通过模式创新把它做成”,或者 copy to China。未来这种情况可能会越来越少。
当你有一个原创 idea 时,投资人愿不愿意投资,愿不愿意支持?我觉得整个结构都会发生变化。
对创业者来说,要求也会变化。当你真正站在最前沿时,所需要的能力,和你在后面追赶时所需要的能力,也非常不一样。
很多时候会有很多失败的 case,但最终可能从失败里涌现出成功的例子。这就会让大家,包括社会,对失败的容忍度发生变化。
包括失败的公司应该怎么退出,这些方面都会变化。整个链路都需要发生变化。
当我们越来越接近最前沿时,老王当时说的,我可能表达得不一定精准,但我记得就是“不够富”。
单论这个观点,我在今年年初回头看的时候,觉得已经有了一些变化。
2023 年时,当然也可能是我对整个行业了解不够丰富,但那时候我举目望去,没有看到哪家公司真的做出了特别原创的创新。
但到了 2025 年,我觉得很多事情慢慢开始发生变化,包括《哪吒》这样的电影、《黑神话:悟空》、DeepSeek、宇树。我觉得这些都是很有代表性的 moment。
刚刚过去两年,如果再看过去 5 年、10 年,会发生什么事情?我对未来还是非常乐观的,但我明确感受到,我们正在经历这样一个 transition,未来类似的事件可能会越来越多。
程曼祺
你在 2023 年 3 月问过梁文锋这个问题吗?为什么中国没有出现像 OpenAI 这样的组织?
曹越
这个我确实有点记不得了。如果我没记错,梁文锋当时的想法就是,希望在国内做一个这样的机构。
在相当长一段时间里,可能对商业化的要求,至少在这个组织内部,并没有那么高。
程曼祺
现在回头看很有意思。你和老王聊,老王说没有出现是因为“不够富”;你和梁文锋聊,梁文锋刚好就是一个在做这件事情之前已经积累了一定财富的人,可以让他没有商业化压力地做这件事。
曹越
是的。包括梁老板在自己的访谈里也会说,他认为中国需要越来越多原创式的创新。
2023 年 3 月见到老王时,我的感受就是,他非常强,认知很深,至少在那个阶段,比我接触到的绝大多数人都深得多。
而且我明显感觉到,他一方面有很多实战经验,另一方面又能从中抽象出很多方法论。对他而言,他对很多方法论是真的有自己的理解。
他不像一个背过《孙子兵法》,却不知道应该怎么用、在什么情况下 work 的人。他在很多实战过程中,已经有过这方面的实践。
程曼祺
你觉得光年之外这段经历,最大的收获和学到的东西是什么?它后来对你自己创业有什么影响?
曹越
对我来说,最大的收获肯定是在老王这样非常强的企业家身边,和他 close 地合作了一段时间。我们在这个阶段有很多判断,也做了很多动作,比如招什么样的算法同学。
在那个阶段,我们最看重的算法人才,抢得最厉害的其实是 DeepSeek。当时的方法论是,招毕业 3 到 5 年内,或者即将毕业的 PhD。
这是一群本身还非常强、在一线、能力也很出色的人,但并不那么在意他们之前到底是做 NLP、通信,还是其他方向。
有点像是,他们的素质和状态都处在巅峰。学习 language model 可能是很快的事情,几个月就能学到很不错的水平。
所以当时我们想 hire 的核心 candidates,大概就是这样的画像。
程曼祺
哪些判断是从那段经历一直延续到现在、你觉得仍然正确的?哪些是经过那次经历之后,你会调整做法的?
曹越
我觉得对人的判断,基本上是一脉相承的。
不同组织意识到这一点的时间不太一样。有些组织在 2023 年就已经用这种 mindset 招人,有些组织可能到 2024 年,甚至直到今天,还不是用这种 mindset 吸引人才。
另外一个 lesson 是,CEO 的压力非常大,所以要照顾好自己的身体,这一点非常重要。
程曼祺
有什么方法吗?
曹越
我觉得 CEO 比较容易焦虑,这肯定有一些方法。
对我来说最 work 的方式,就是思考一些人生层面的大问题,比如死亡。
你会想,再厉害的人可能非常非常厉害,但到了七八十岁,可能只是比别人多活一点,最终都会面对这个 topic。
在这个过程中,你到底在焦虑什么?这些焦虑是不是真的有意义?它会促使你关注这个过程中最重要的问题,而不是那些情绪上让你焦虑的东西。
程曼祺
你说今年 3 月又和梁文锋聊了一次。你们见面之后,你感觉焦虑相对缓解了,是因为什么?
曹越
我觉得他不太受到外界情绪的影响。
2025 年 1、2 月,DeepSeek 突然爆火,大家都很亢奋、很兴奋。但我见他时,他还挺平静。
也有可能他本身就是一个很安静的人,但反正他很平静。我的感受是,他并没有太受到外界这些事情的影响,虽然他一定受到了一些影响。
这给我很大的震撼。因为他们在那个阶段外界影响力巨大,但他还能保持非常平稳、坚持本心的状态。
我觉得做到这件事情非常难,需要很多要素。
我回来之后,就把朋友圈或者一些可能给你输入 noise 的渠道,平时尽量少关注。因为如果你把时间花在这些渠道上,自然而然会受到情绪面的影响,而不去关注最本质的东西。
程曼祺
回到光年之外这件事。它结束的时候,至少对外界来说非常突然。你当时是什么感受?
曹越
对我来说肯定没有那么突然。
程曼祺
那你有什么心情或情绪吗?
曹越
其实有点想不起来了。
程曼祺
你会因为这种事情产生比较大的情绪波动吗?
曹越
我觉得那个阶段没能继续往前走,肯定还是会有失落。但整体还是能稳得住。
而且在那个过程中,我和袁老师也有很多 responsibility,包括怎么让组织里的同学更好地完成后续工作,让整个过程成为一个比较 smooth 的 transition。
所以很长一段时间里,还是需要把这些事情处理好。
程曼祺
其实前后你们都很忙,有很多事情需要处理。
曹越
对。很多事情都 drive 着你,要把对大家的责任履行好。
程曼祺
当你自己相对空下来,可以静下来想很多事情时,大概是 2023 年什么时候?
曹越
大概 8 月。
程曼祺
当时你在想什么?创业这个想法是什么时候产生和成型的?
曹越
6. 选择 AI 视频赛道
那个时间点,我在想下一个阶段应该去做什么,所以广泛地看:这个阶段应该自己出来创业,还是加入一家公司的团队。
后来还是决定,想看看能不能自己出来创业。
当时也看了一些不同的方向,但最终决定做 AI 视频。
程曼祺
可以讲一下整个逻辑吗?一个是为什么选择创业,另一个是在不同方向里为什么选择视频生成?
曹越
那个阶段主要还是在看,有什么事情会让自己觉得比较兴奋,以及做这件事有没有合适的团队支撑。
有点像先去考虑,到底有哪些事情可以做。
包括加入一家大模型公司、train language model,还有更多方向。那个阶段 Character.AI 这种方向也比较热,很多人都在看;还有 agent、AI 视频等方向。
当你去看这些方向时,我觉得 AI 视频一下子就显得比其他方向更有意思。
程曼祺
为什么?
曹越
有几点。
第一,它还处在比较早期的阶段。2023 年 8 月,确实是一个非常早期、萌芽的阶段。因为那时候 Sora 还没有出现。
但我明确知道,视频模型是一个有很大发展空间的方向,只是还处于非常早期。
程曼祺
它符合你之前选择研究方向的逻辑吗?受关注,而且还有很大空间。
曹越
符合。首先它的 upside 肯定非常大。哪怕只看技术侧,upside 也非常大。
另外,它处在相对早期的阶段,所以从技术侧讲,这是一个不错的切入时间。
商业侧也是一个商业天花板非常高的方向。它解锁不同能力,就能解锁不同场景和需求,而且可以持续很长时间。
有些方向你去琢磨时,会明显感觉到,AI 视频在那个时间点是一个让我比较兴奋的方向。
程曼祺
你当时不想加入其他公司的原因是什么?
曹越
在那个阶段接触了一些公司之后,我的感受是,光年还是一个非常好的组织,但大多数公司至少在那个阶段,不如光年的组织形态。
我也不知道这个心态对不对,但你很难决定加入一家这样的公司。
老王最早搭建的组织,底层原理非常扎实,是一个可以支撑很长时间的组织。虽然早期一定会经历相当长的混乱阶段,但最关键的是,他当时找的人都非常对。
包括产品的人,我觉得也有他自己的品味和找人的方法论。技术侧的人,在各个维度上不输任何一家公司。
光年之外当时在 infra、模型、产品、商业化、融资、资本等方面都非常完整。所以最早的盘子看起来非常 solid。
但老王身体上没法坚持。再去看其他公司的时候,你就会觉得,这家公司好像差很多东西。
程曼祺
一方面是你觉得没有办法下决心加入一家公司。那创业这件事本身对你的吸引力是什么?
曹越
当你思考创业时,会有一种终于找到了适合自己的赛道的感觉。
我之前的经历对我来说都是很好的 practice,包括科研经历。其实我是一个非常不典型的 researcher,应该能感觉到。
很多 researcher 是能够把一件事情钻深、钻透,把事情搞明白。但我反而是相对更关注事情本身、关注领域的发展。
程曼祺
你也比较关注人和团队。
曹越
对。但很多 researcher 都是一个人做很长时间。虽然我很幸运,research 做得也还不错,但我并没有非常强烈的冲动,想去清华北大拿一个教职。
我一直在思考,自己到底是一个什么样的人。
后来最核心的自我觉察是,我发现我是一个比较 ambitious 的人。这是我很底层的驱动力。
程曼祺
更完整地说,ambitious 指的是什么?是想做成一件事,还是想赢,或者是什么?
曹越
是希望做成一件有影响力的事情。
是不是我自己定义的倒无所谓,但我希望自己越来越接近做成一件对世界产生很大影响的事情。
这件事的另一面,至少在那个时间点,我的认知是要极致地追求个人成长。
芒格说过一句话:如果你想取得很大的成绩,努力的方向就是让自己配得上这个成绩。
所以另一面就是,当你能够对事物建立深刻认知,对自己的能力进行充分训练,从而有能力给世界做出有巨大价值的事情。
我回溯自己过去 5 到 10 年的各种决策,发现原来都是 ambitious 在驱动我。
比如 Swin Transformer 做得很不错,但当我看到 OpenAI 的 CLIP 和 DALL·E 时,有些人的第一反应可能是:“这个事情我做不了,那我就说它不好。”
我的第一反应反而是:为什么我们做不了?为什么我们不行?是真的因为我们比较菜、不够聪明,还是有其他原因?
换一个视角,当你看到和自己 skill set 比较接近的人,能够做成非常伟大的事情时,你的感受是:为什么我们做不了?
而且你心里的答案肯定不是“你不行”,也肯定不是“你菜”,而是觉得应该找到一个更好的方式去做。
当然,我也不觉得自己是特别聪明的人,但我会觉得,聪明肯定不是最主要的因素。一定是某些因素导致了结果。
换一个视角,你肯定会希望,能不能 build up 一个组织,最终做成这样的事情。
比如从 MSRA 去智源,更像是在想:能不能 build up 一个像 OpenAI 一样的组织,做成这样的事情。
但当时在国内没有任何 reference。之前国内没有这样的组织,你也不知道到底缺什么。
当我了解创业这件事之后,就突然感觉这个事情好像什么都对上了。
它首先需要一个人具备比较全面的能力,天花板非常高,能做成的事情也非常多样,对一个人的考验也是地狱模式。
它也会促使你进行极致的个人成长。
程曼祺
你有没有想过,为什么自己没有更早想到创业?比如在那段自我觉察的时间里。
曹越
我想过,为什么当时从 MSRA 没有直接去 OpenAI。
程曼祺
你当时是有机会去,还是根本没有直接机会?
曹越
我没有尝试。我觉得首先是因为你在那个时间点的认知,还达不到那个水平。
程曼祺
当时没有想过去尝试?
曹越
对。你在那样的认知水平下,还是没办法做出这样的决策。
当时 Swin Transformer 还有一个作者刘泽,他后来去了 xAI。
程曼祺
他是因为出国留学,所以自然去了,还是也有其他原因?
曹越
我觉得和阶段也有点不一样。2022 年时,这件事更 non-consensus;但 ChatGPT 出来之后,就没那么 non-consensus 了。
如果从国内有能力去,我觉得很多人都会去。之前也有人从国内,比如清华读完 PhD 之后去 OpenAI。当然我自己也有很多学生在 OpenAI 或 xAI。
本质上 ChatGPT 出来之后,这件事已经变得很共识了。加入这些公司,我觉得没有问题。
但对我来说,在那个阶段更大程度上是进入了“是不是要被创业这件事本身吸引”的状态。
有没有更早意识到创业,我觉得有点像:当你身处一件事情之中时,很难抽象出来看这个问题。
我 2019 年 PhD 毕业,在 MSRA 也没待几年,后来又去了智源。之前从清华去 MSRA,也是因为 MSRA 的那个组做过非常有影响力的 research。
每次决策,都是源于我底层对 impact 的追求,以及我本身是一个 ambitious 的人。
程曼祺
你正式开始做 Sand.ai,选择 AI 视频这个方向,和它不在大语言模型公司的主轴上有关吗?比如竞争上、商业上,生存概率可能更大?
曹越
竞争肯定是一个维度,但我觉得竞争并不是创业的主轴。
坦率说,它本质上还是回到最开始聊到的:AI 视频是一个技术天花板和商业天花板都非常高的方向,而且在那个阶段,甚至连好的模型都没有,很适合一个有模型背景的人切入。
程曼祺
当时如果直接做大语言模型、做一家新公司,是不是有点晚了?
曹越
我觉得那个时间点肯定比较晚。
程曼祺
你们正式成立应该是在 2024 年初,对吧?
曹越
对。
程曼祺
到你们发布第一个模型 Magi-1,是 2025 年 4 月左右。为什么花了一年多?
曹越
整体来看,是因为当时我们选择了自回归路线。
我们在做路线选择、最后推进这件事的过程中,一开始低估了这条路线本身的难度。
程曼祺
自回归是什么?刚才你讲到 Transformer 用到视觉里的几个阶段,自回归应该是更后面,或者之前就出现过,但最近大家又开始讨论。你可以讲一下这个脉络吗?
曹越
如果完全去看自回归和 diffusion model,早期大家做自回归,还是希望把图像、视频生成和语言模型紧密结合在一起,端到端地做到这一点。
程曼祺
最早是什么时候开始尝试的?
曹越
更早,可能 2020、2021 年,GPT 出现之后,很多人就这么做。但那个时候探索都比较浅,而且因为它需要和语言模型结合,导致当时这个方向的效果不够好。
自回归的出发点,是希望在一个模型结构里同时处理语言、图像和视频。
到 2024 年我们用自回归模型做视频生成时,思路是:视频这种数据类型天然是按照时间顺序播放的,这和语言有类似特点。语言也是人按照顺序去看的。
最终能够最大化压缩语言的训练方式,是预测下一个 token。理解了这个问题之后,你会意识到,对于视频而言,最大化压缩视频信息的方式,是不是也可以按照时间顺序进行预测?
哪怕到今天,我认为这个直觉应该还是比较对的。
但当你真正要做这件事情时,并没有一个好的 reference,不知道这件事应该怎么做。所以在这个过程中,不只是算法侧,包括 infra 和 code design,都需要做很多从零到一的工作。
对于一个刚搭建的团队而言,如果你要在这方面做得非常 heavy,可能整个公司里最关键的人都要投入到这个方向,才能把它做好。
但如果你真的要把自回归的能力发展到极致,还需要在很多方面投入足够的人,比如数据、训练过程本身、评测和后训练。
如果主要的人都投入到自回归相关的部分,其他部分就可能出现人手短缺。但如果你想最大化发挥自回归的优势,就要在各个维度都做到足够好,才能训出一个足够好的自回归模型。
所以至少在那个时间段,我低估了一个刚刚搭建的团队,做一个过于创新的工作时,整个过程的难度。
程曼祺
你们在发布 Magi-1 之前,组织大概有多少人?
曹越
大概 30、40 人。
程曼祺
从成立到发布,差不多 13、14 个月。这里面有没有一些决策点?如果复盘的话,中间是不是有时间可以选另一种做法,不用这么新的模型,但更快拿出一个东西?
如果你认为时间窗口是半年,必须拿出一个很不错的模型,做事 mindset 可能会不一样。
曹越
我觉得那个阶段对业务侧没有足够深刻的认知,也是另外一个原因。
比如 Magi-1 发布之后,我们后续不是也做了一定程度上的调整吗?更 focus 在从业务需求出发,看应该迭代一个什么样的模型,去 deliver 业务侧的需求。
但组织里也沉淀出了能力,我们依然能 train 出很不错的基础模型。
在这个阶段,我们希望做好以人为中心的视频,包括人物说话和表演的能力。
那怎么更快速地达成这个目标?算法侧也要更快速地迭代,去达成这个目标。
这和至少我们做 Magi-1 时的 mindset 不太一样。
程曼祺
你觉得视频生成领域,之前已经有一些时间窗口关闭了吗?
曹越
具体到某些方向,我觉得还好。
纯画面的生成,之前已经卷到相对收敛的阶段,看起来是这样。单个素材片段的生成,尤其是纯画面、纯 video 的单个素材生成,之前可能已经卷到了一定阶段。
但今年大家涌现出来的,是音画同出,以及音画同出带来的新可能性,包括叙事。这些都是之前的视频模型没有的能力。
程曼祺
所以你们现在可以赶下一趟。你们新的模型就是音画同出。
曹越
对。音画同出,而且天然更偏创作者端,可以生成非常真实的人物视频。
对创作者而言,它可以生成这样的内容;对 C 端而言,它能让用户以较低门槛生成一个可以被别人,比如朋友们消费的视频。
程曼祺
刚好我们约这个时间点,是在前几天 OpenAI 刚发布 Sora 2 和 Sora App。它具备你刚才说的一些特点,包括音画同出,C 端用户也可以玩起来。
你第一时间使用了这个产品,用完之后最大的感受是什么?
曹越
7. Sora 2 带来认知迭代
首先,我认为它不管从模型效果还是产品层面,都是一个比较端到端的产品。
它发布了一个新的模型,这个模型同时拥有音画同出能力,以及保持人物 ID 生成视频的能力。
第三点非常关键:它在大约 10 秒的时长里,可以有一个基础叙事。它拥有切镜头的能力,从而使最终生成的视频有一种基础的叙事感。
对我来说,最惊艳的还是第三点。
前两点,比如音画同出,可能在今年 5 月 Google 发布 Veo 3 时,就已经有类似能力。至于保持人物 ID,不管是更早的生图模型还是生视频模型,其实都是一个非常重要、但已经被广泛研究过的问题。
程曼祺
你可以稍微展开讲一下。保持人物 ID,指的是人物一致性,对吧?
曹越
保持人物 ID,指的是,比如你给一个人物拍一张照片,或者拍多个角度的照片,同时录制他的音色,那么在生成的视频里,这个人物出现时,就会以这个人物的形象出现。
如果这个人物说话,声音也会根据你给定的音色来生成。所以它和刚才说的第一点是结合在一起的。
音画同出之后,有声音、有音色,再加上视频画面,才是完整的人物 ID。
程曼祺
所以你不仅要保持人物的形象,也要保持他的音色。
曹越
对。当模型只能生成视频画面时,保持人物 ID 实际上只是保持人物形象,还没有人物音色。
当模型可以同时生成画面和声音时,就不仅需要保持形象,也需要保持音色。
这至少是之前没有的能力——同时保持人物形象和音色。但它确实是在模型具备音画同出能力之后,才需要给人物同时提供形象和音色。
程曼祺
最让你惊艳的还是第三点:它在 10 秒里有叙事能力,有分镜。
曹越
对。之前有一些模型也可以在大约 10 秒的视频里生成多个镜头,但这些镜头之间的叙事关系,并没有那么好控制,也远没有现在这么惊艳。
可以简单理解成,之前大家认为,如果要生成一个 10 秒、具有叙事的视频,需要用 agent 方案解决一段视频里的叙事能力;单个视频模型可能只需要渲染某个镜头的画面,最多加上声音。
所以很多人认为,叙事能力需要通过 agent 来解决。
但 OpenAI 在这一点上很有创新,相当于端到端解决了模型直接生成叙事短片的能力。
这对我来说也是一次认知迭代。
程曼祺
这个认知迭代,是因为它在技术上做到这件事让你觉得新,还是因为它把这件事作为目标让你觉得新?也可以分开说。
曹越
让一个系统生成一段有叙事的短片,本身当然是一个目标。但这个目标是通过产品研发实现,还是直接用一个模型端到端实现?
程曼祺
我指的是,它用模型端到端实现,并且把这个作为目标。
曹越
对,这确实是一个非常新的点,但我觉得也有很多前置条件。
第一个前置条件是,当视频模型本身不出声音时,它生成的内容不直接拥有 C 端消费属性。
你生成一段 5 秒、没有声音的 clip,对普通人来说可能没有办法消费,它其实是半成品。
但当模型可以同时生成视频和声音时,它生成的视频 clip 就已经有消费属性了,普通人可以看,也可以玩。
这是第一个条件。只有真正做出这个能力之后,你才会意识到,模型可以直接生成一个 C 端能消费的视频。
如果还停留在上一个阶段,手里没有音画同出的模型,最直接的思考可能是:视频模型只是整个流程的一小部分,我还需要重度的人参与。
人来做最早的脚本设计、分镜设计,再去生图、图生视频,然后配音、配乐,通过人完成整个过程。
这也是过去从去年年初 Sora 出现之后,大多数人的工作流程。
从这个 workflow 出发,自然会想到:能不能用一个 agent 替代其中的人?
也就是说,语言模型负责脚本,分镜模型负责分镜,生图模型负责生图,图生视频,再由配音、配乐模型完成后续流程。它是一个模型系统,最终生成一段几十秒的叙事短片。
如果观察现有 workflow,很容易用这种方案去解决。
但 OpenAI 相当于是在说:我的叙事能力为什么不能让模型直接端到端生成?
我觉得这是一个很大的变化,对我来说也是。
程曼祺
你觉得 OpenAI 是怎么做到这一点的?很多人认为应该用 agent 做的事情,它用一个模型端到端做了。
曹越
从我自己的视角看,这是他们组织能力的一种体现。
它是一个从产品到模型,在我看来垂直整合做得比较好的组织,最终展现出来的结果。
传统意义上,当产品侧想完成某个能力时,第一反应是:能不能通过模型组合和研发方案达到目标,而不是能不能把这个能力直接做到模型里,能不能用一个 model 端到端解决这个问题。
我不确定这是不是 OpenAI 从成立之初就有的理念,但这可能是他们组织里很多人共同拥有的方法论、做事方式和解决问题的哲学:如果问题可以端到端解决,就更倾向于用端到端方案解决。
首先要假设,系统最终是不是需要直接生成一段 10 秒、20 秒或 30 秒的叙事短片。如果需要,那么第二个问题就是,这个方案阶段性地用模型组合实现,还是有可能让一个模型直接拥有这个能力。
如果有机会,就可以有一条分支,专门有人去探索这个方向。探索出结果之后,就可以把这种能力释放出来。
我觉得更像是按照这种方式迭代出来的。
程曼祺
所以你说这是一个大的组织逻辑。
如果具体到 Sora 2,它可能是用什么技术实现的?还是以前的 DiT 架构吗?还是模型结构上有一些新的变化?
曹越
首先,他们的报告肯定写得非常模糊。它不像 Sora 1,至少还会说使用 diffusion 加 transformer 的结构来实现。现在已经不太说技术细节,只说实现了什么效果。
我自己的感受是,现在还很难判断它是纯 diffusion 模型,还是自回归模型。但我觉得它的基础应该是 diffusion 模型,这一点相对比较确定。
至于它是双向 diffusion 还是单向 diffusion,目前暂时没有定论。
从技术角度看,我觉得它能够生成有叙事能力的短片,在现有技术条件下应该是可行的,并不是说他们内部有一些石破天惊的 idea,只是没有对外展示。
实际上,在 Sora 2 出来之前,就已经有模型拥有切镜头的能力。
所以更像是:原本一个 10 秒视频里可以有 3 到 5 个甚至更多镜头,现在让这些镜头更有叙事性。
切镜头本身是一种能力,但要把镜头切得好,让普通人更愿意消费,我觉得是一个模型侧的优化方向。
让模型本身具有切镜头能力,并不是不可实现的。因此从模型能力的角度,这些都还比较可预期。
对我来说,最本质的还是认知迭代:他们从产品侧有了这个需求之后,最终通过模型迭代来实现这个需求。
他们就是要一个叙事短片,这个需求可以回传给模型团队。模型团队会说,我们先对齐什么叫叙事短片,然后设定一个 benchmark,明确最终要实现什么能力,再通过数据、模型和训练过程优化,让模型真正拥有这个能力。
我觉得这是他们组织能力的一种体现。
程曼祺
所以让你最惊艳的,不是某个具体功能或产品形态,而是你推测它背后是怎样通过组织机制实现产品创新的。
曹越
对。这是让我最惊讶的一点。虽然我并不知道他们具体是怎么实现的,但这和回看大语言模型时代时出现的情况很像。
2020 年 6 月,GPT-3 出现。真正理解 GPT-3 意义的人,对这个模型大概的能力边界有相对明确的预期,但大多数人没有。
有了 GPT-3 之后,他们后半段做的是什么?是让这个模型变得普通人可用,把它 align 到普通人更容易使用的 interface 上。
这其实也是一种垂直整合能力。它更像是从需求层面思考,应该怎样使用这个模型。
于是有了 InstructGPT,之后又有整个 post-training 过程,包括 SFT 和 RL。
这个过程是从一个基础模型,到让大多数人更方便使用的模型。我觉得这可能是他们较早体现出的产品 sense,也体现了从模型到产品端到端优化的能力,或者说组织上的垂直整合能力。
这次在 Sora 2 上,他们再次证明组织里拥有这方面的能力。这是一个很 impressive 的组织能力。
程曼祺
其实说到模型能力,我觉得 OpenAI 并没有甩开其他同样在第一梯队的公司。
Google 的 Veo 3 之前就已经可以音画同出。Meta 在 9 月 25 日,也就是 Sora App 上线 4 天前,在 Meta AI 里发布了一个 AI 短视频功能,叫 Vibes,但完全没有人讨论。
曹越
Vibes 事实上也没有吸引大多数人的注意力。
我们去看,Vibes 更像是一种垂直缝合的能力:看看组织里有哪些能力,老板认为要做一个这样的东西,于是把这些能力缝合成一个产品让大家使用。
它看起来什么都有,但没有真正意义上的价值主张,也没有让大家留下印象的 sell point。
OpenAI 则是更有机地把模型侧能力和产品结合起来。
关键有几点。
首先,音画同出让生成的视频本身具有可消费性,这是基础。
第二,它可以保持人物 ID 来生成视频,降低了用户生成视频的门槛。让大多数人玩起来,最关键的就是降低门槛。
他们就基于这个能力,设计了 Cameo 这样的产品 feature。
程曼祺
而且 ID 有社交属性。比如你认识一个人,就可以和他合拍。
最开始上面最多的可能是赛罗奥特曼,因为他是大家都认识的人;后来就会把真实的朋友拉进来。
曹越
对。我觉得这里有熟人关系,也能看出他们很担心 deepfake 风险。
但我觉得 OpenAI 在这个问题上也有一些取舍。比如你可以说,让肯尼迪总统怎么样,让马丁·路德·金怎么样;一些名人的脸还是可以使用的,它并没有完全禁止。
我觉得他们发现这类内容会非常火,也确实非常火。
这更像是他们在训练模型的过程中,不可避免地使用了一些版权类型的数据。多模态大模型如果能够准确标注这里面的人是谁,那么最终模型就具备了这样的能力:即使你不上传这个人物的 ID 和音色,它依然可以比较准确地生成这个人物和角色。
他们发现了这个情况之后,并没有大力禁止。因为这种内容确实很有传播性。
另外,如果只是生成一个 10 秒的单个镜头,可消费性可能还不够强。当这 10 秒具有叙事属性时,内容本身就更具可消费性;门槛又低,还可以和朋友一起玩;生成质量也不错。
这些共同构成了它这次大规模传播的基础。
程曼祺
你们刚好也会在 10 月 11 日发布新的模型。可以讲讲新模型的特点吗?
曹越
首先,它拥有音画同出的能力。我们主要 focus 在人物的说话和表演上。
为什么 focus 在这个场景,其实很直接。视频模型具备音画同出能力之前,大多数模型都只有画面。
这时有几个观察。
第一,它主要能满足的场景,如果看叙事片子的制作,主要是一些空镜,以及传统意义上的 B-roll,也就是场景、空镜、转场等内容。当然,它也能满足一些纯视觉的画面生成。
但在叙事场景里,它本质上只能满足 B-roll。为什么不能满足 A-roll?因为 A-roll 里有很多画面是人物,而人物出现时,很多时候会有情绪表演和说话。
当你只生成画面时,人物整体看起来很假。特别是先生成画面,再用后置 lip sync 对口型,看起来会很怪、很假。
很多时候大家也说不上来到底哪里有问题,但就是很难跨过普通人的视频消费门槛,很难跨过恐怖谷。
基于这样的观察,我们也和很多叙事内容行业的从业者交流,包括一些做 AI 短剧的公司。我们问他们,现在模型侧最大的卡点是什么。
非常多人给出的第一个答案都是:人物太假,演员没有表演。
所以我们从需求出发,发现大家消费的绝大多数视频里,超过一半、甚至更多的画面都是人,但现有视频生成模型里,人物的表现力非常差。
那怎么解决?我们就从需求出发思考:应该把人做好。怎么把人做好?大多数有人物的场景里,人物可能都在说话,那就先把最高频的场景解决好。
这是我们最开始的出发点。
程曼祺
你们是在什么时候把这个作为这一代模型的出发点?
曹越
今年年终的时候吧,年终。
程曼祺
这和现在 Sora 2 呈现出来的特点挺相似。
曹越
对。Cameo 的核心就是人物、人物说话和表演。
这是我们觉得在那个时间点非常关键的洞察。
程曼祺
这个洞察在当时是行业里大家都能看见的,还是一个选择和判断,并不是所有人都把它当作重点?
曹越
从现在的结果来看,并不是大家都把它当作重点。
我觉得这一定程度上体现了,你到底是从需求出发思考问题,还是绝对从技术出发思考问题。
我们当时认为,应该更多从需求出发。去看需求点时,要判断哪些最刚性,哪些有可能被解决。
对我们这样的组织来说,最核心的是,只要真的能够和用户在一起,了解他的需求,同时拥有技术判断,知道什么能实现、什么不能实现、什么实现起来更难,那么就更容易找到需求和模型的 fit。
程曼祺
所以你们也是音画同出,但比较聚焦人物说话。
曹越
对。
另外一个特点是,因为我们的场景比较聚焦,所以生成视频的成本比较低。
我们觉得现在很多场景里,如果做一部 AI 短剧,即使表现还不太好,它和实拍之间的成本差距也没有那么大。
你肯定知道这个行业的一些情况。比如实拍一集是多少钱,用 AI 做一集,之前成本比较高时大概是多少?
曹越
之前实拍最早可能是 10 万元左右一部。一部大概多长时间?可能 60 到 100 分钟。
后来成本卷起来了。我说的 10 万元左右,可能是 2021 年左右的价格;到 2023 年,成本卷到大概 30、40 万元一部。中间可能还有更高的时候,但现在好像也回落了一些,大概就在这个区间。
如果用 AI 做,可能每分钟是 2,000 到 5,000 元。60 到 100 分钟,可能也在 20 万元人民币左右。
但最大的挑战是,即使成本是这样,生成质量也还无法和实拍真正 compete。
可以理解为,AI 短剧,特别是偏实拍类型的短剧,还没有跨过用户的消费门槛。
前面提到的人物表演不够好,是其中一个原因。还有其他类似需求,但我们觉得人物表演可能是最关键的需求,所以想率先把这个问题解决。
程曼祺
你们当时做的时候,思路还不是在模型里直接把分镜和叙事做进去,对吗?
曹越
对。坦率说,在看到 Sora 2 之前,我没有意识到应该把叙事端到端地做到模型里,或者说没有意识到应该在那个阶段做,可能还需要更长时间。
之前的认知是,如果要做一个 C 端视频产品,可能还会考虑叙事是不是应该通过额外的 agent 模型解决。
至少之前的思考锚点是这样。
但 OpenAI 现在相当于是在 10 秒这个尺度下,直接让模型生成叙事内容。从我的感觉看,从 10 秒扩展到 20、30 秒,技术上并不是特别难。
当然,也有可能它前面有一个 language model,先把 script 写好。
程曼祺
完全有可能。现在大家的使用体验是,有时候你写得越细,效果反而越不好。
曹越
对。我也是这个感觉。反而让模型自己发挥,效果可能更好。
它内部可能仍然有一个类似 language model 的东西来写 script,但具体怎么实现就不知道了。
本质上,我觉得 OpenAI 最强的模型大家可能还没有使用。它们确实是为这个 C 端产品定制了一个模型。
在很长一段时间里,大家只能生成 360p 的视频。对专业创作者来说,这可能不可想象,低于 1080p 都不想用。
但如果面向 C 端,最大的困难是怎么 cover 成本。如果模型本身不是那么大,能够让很多人都玩起来,就要思考 C 端需求是什么。
大多数 C 端需求可能是 for fun,并不需要特别高的清晰度。
还有一个容易被忽略的点:当模型可以音画同出时,360p 还是 1080p,主要只是画面质量下降,声音并不会下降。它的声音可能和 1080p 视频里的声音一样。
一旦模型可以音画同出,声音质量其实保持得很好。换一个视角,如果声音是沉浸感里非常重要的一部分,这个部分并没有被大幅削弱。
程曼祺
而且我觉得,它为 C 端定制的速度也很重要。
作为用户,我觉得它现在还是有点慢。比之前一些产品快,但仍然有点慢。
曹越
对。它大概生成一个视频需要几分钟,可能在 1 到 3 分钟之间。
对于 C 端来说,这应该也是一个比较痛的点。大家可能对分辨率要求没那么高,当然越高越好,但生成速度要足够快。
如果 10 秒就能生成一个,和需要 1 分钟,体验完全不一样。
程曼祺
如果 10 秒能生成一个,我可以多做 10 倍。
不过他们现在也限制了单日生成额度,从一开始每人 100 条,降到每天只能生成 30 条。
曹越
因为产品完全免费,相当于一直在花钱补贴。
但我觉得成本可能还不是最大问题。换一个视角,如果真的能留住用户,留存做得不错,后续成本还是有很多办法解决。
很多大的 C 端产品早期都非常花钱、非常烧钱,后期商业化最终也找到了合适的路径。
程曼祺
你刚才讲到,做第二代模型时要更多从需求出发。那你们这个模型想服务的人是谁?
曹越
现在这个模型实际上可以服务两类人群。
我们最开始思考的是,整个视频创作链条里,还有哪些问题没有被解决。
它天然适合叙事场景,也就是需要人物表演的场景,适合服务这类创作者,包括 AI 短剧公司。这是第一个大的品类,是相对专业的创作者。
当视频里人物的表演很强时,它可能不只在叙事场景下有用。比如做一个事物讲解,即使是投放素材,有表现力的人物也比没有表现力好。
广告、宣传片也都可以使用。所有出现人物的视频片段,都有可能用这个模型生成更有表现力的人物,包括他的说话和表演。
这是第一个大的品类。
第二个大的品类,刚才其实也讨论到了,就是 Sora 2 的 To C 场景。
我们的模型在公司内部已经玩了一段时间。当你发现视频可以音画同出时,对普通人来说,它还真是一个挺有趣的 for fun 工具。
就像大家在群里聊天,你一句我一句。更娱乐化的场景里,大家可以发表情包。
但在过去,你很难定制一个表情包。很多时候你只有二十个常用表情包,偶尔更新一下。
当你真的可以生成一个人物音画同出的视频内容时,在这个场域下,你就可以“斗视频”。
之前需要用一段话表达的内容,情感可能没那么充沛。现在可以生成一个视频片段,和对方在这个过程中 play。
我们发现,对普通人来说,这个过程很容易玩起来。它天然就是一个适合社交传播的场景。
程曼祺
你们要做相应的产品吗?
曹越
这确实也是我们在考虑的。
程曼祺
你们新模型的发布时间是之前就定好的,刚好赶上 Sora 2。整体来看,对你们是好的影响还是不好的影响?
曹越
整体来讲还是好的影响。
我的感受是,它让大家真正意识到音画同出对于视频生成这个方向的重要性,对这个方向和行业都有很大帮助。
程曼祺
它对你们的决策有具体影响吗?刚才你提到,你们在考虑要不要做一个给普通人使用的产品,甚至可能是 App。
曹越
在 Sora 2 出来之前,我们就在讨论这个事情,因为它太自然了。
我们内部还举办过“斗视频大赛”,给大家颁奖。它的可玩性确实很高。
程曼祺
冠军做了什么样的视频?
曹越
我们有不同类型的奖项,比如“最具电影感奖”“一定火奖”。
它的门槛非常低。你只需要给一张图片,再输入一段台词,告诉它这段台词的情绪,它就能非常有表现力地表达出来。
当时我们就在考虑,是不是应该把它作为一个 C 端玩法,让大家玩起来。
如果做 C 端,肯定要降低分辨率。做 270p 或 360p 可能就够了,因为在微信里传播,其实不需要那么高分辨率。
所以这个事情在 Sora 2 出来之前,我们就已经在讨论了。
程曼祺
现在的结论是什么?
曹越
确实在计划里。
我们 10 月 11 日发布的产品,首先是让大家充分体验模型能力。进一步做 C 端,本质上很有可能是一个 App,但定位还需要花更多时间打磨清楚。
它也是一个从模型到产品的端到端设计。OpenAI 做这件事,给了大家很多思路。
程曼祺
我觉得 OpenAI 做这件事还有一个影响,就是会让特别大的公司也来做。
我指的是那些在这个领域投入比较多的超级巨头。你觉得这会对你们有影响吗?
如果没有 Sora 2,你们那个可以用来“斗视频”的 App,可能还能自己发展一段时间;但现在所有巨头都会来卷这个东西。
曹越
整个视频方向还是非常受重视的,所以确实很难“猥琐发育”。
但坦率说,大公司看起来投入很大,动作却没有那么快。我觉得这里仍然有很多机会和空间。
换一个视角,Sora 2 展现出来的到底是不是一个真正的 C 端平台机会,本身也是非常值得思考的问题。
当然,对很多特别有钱的大公司来说,可能不需要思考这个问题,看到机会,砸钱就行。
程曼祺
前段时间我和 Lovart 的陈明聊过。Sora 出来之后,我又和他聊了一次。
他的逻辑是,这件事哪怕只有 10% 或 20% 的机会,大厂也会觉得,如果不投入,可能会疯掉。
曹越
对,错过的代价会特别大。
它们本身很有钱,资金成本很低,所以看到机会就冲。
但我自己的感觉是,能不能出现新的 C 端平台,可能有两个直接条件。
一个是它到底是不是一种新的内容形态;另一个是有没有新的渠道、新的传播链路。
现在看,确实有一些苗头,但距离真正的 C 端平台长什么样,仍然有很大不确定性。
程曼祺
按照你说的两个条件来看 Sora 2:内容形态和渠道,你怎么看?
曹越
目前还没有看到它在这两个部分有非常大的颠覆可能。
到现在为止,Sora 2 可能还是更像一个工具。做好视频之后,大多数人还是会把它发布到朋友圈、小红书、抖音、视频号、快手这些平台。
所以它能不能真正成为一个平台,还是一个问题。
当它不是一种新内容时,做好内容就可以去现有平台发布。这个时候它的价值还是工具属性更强,还没有体现出 C 端消费级平台的属性。
你做出来的还是一个 10 秒视频,那为什么不去这些平台发布?
程曼祺
你会观察哪些指标变化,来判断它未来有没有可能成为 C 端平台?
曹越
我觉得最关键的是留存。
它到底满足了哪一部分人的相对长期、相对刚性的需求?留存率是最关键的。
特别在早期,可能不一定需要那么多用户。短期来了很多用户,也能帮助你更快找到适合这个形态的人群。
至于它能不能成为一个 C 端大平台,我觉得现在没有人有答案。
它现在是一个非常天然的社区状态,但对创作者没有什么激励,除了点赞、别人 remix 你的内容,或者收到一个通知。
他们还有很多问题要解决,比如限制每天的创作数量。我觉得这和成本高度相关。
视频即使只有 10 秒,生成成本也很贵,可能比语言模型还贵。
程曼祺
从 Magi-1 的创新技术驱动,到现在强调从需求出发、把需求和模型训练做更深结合,这个转变是怎么发生的?
曹越
8. 从技术驱动走向垂直整合
这个转变的核心,对创业公司来说,是要跑通 PMF,也就是跑通第一曲线。
如果过于强调技术驱动,有可能很难做到技术和需求的 fit。
怎么平衡技术侧迭代和从需求出发满足需求,我觉得这是最困难的部分。
如果完全从需求出发做迭代,技术可能会落后。你既要在技术侧保持一定程度的先进性,又要让做出来的东西在这个阶段有业务意义。
这就是 balance 的核心优化方向。
程曼祺
你对 Magi-1 原来的期待是什么?
曹越
一开始做这件事,肯定希望它能够给公司带来业务价值。
但它发布得相对比较晚。
程曼祺
所以有用户吗?
曹越
最终还是希望能带来商业化价值。
那个阶段它本身是一个非常新颖的技术路线,一方面在技术侧获得了很多好评。刚好当时 ICLR 开会期间,虽然我们没有去,但后来了解到,线下有很多关于 Magi-1 的讨论。
在技术圈里有很多传播,GitHub 上也有很多 star。
另一方面,因为很多人被这个方向吸引,关注到了这个领域,所以最开始用户侧有几十万注册用户。
但在那个阶段没有带来明确的商业化数字。
程曼祺
这和你最开始的预期不一样?
曹越
我觉得最开始那个时间点,对这个部分的认知也不够明确,还没有完全闭环。
程曼祺
所以这个反馈让你更深入地思考,刚才说的 PMF 到底怎么实现。
曹越
对,就是这个 feedback。
大家从 2023 年开始一直在讲 PMF,但这里有一个很大的难题。
这个阶段本质上是技术驱动的时代。真正懂 PMF 的那群人,可能是产品经理,或者之前做产品、商业的人。他们也需要花时间理解模型、模型的能力边界,以及模型到底往哪个方向发展。
做模型的人,过去不一定花很多时间做业务、理解业务。特别是最 top 的那批人,也需要花时间学习怎么做好产品、怎么做好商业。
两边都要弥补另一边的 know-how,才能帮助一家公司跑得更好。
对我们来说,我自己花了很多时间和各种各样的人交流,学习产品化、商业化和组织怎么做。
到现在,我的认知是,这里需要一个更端到端优化的组织,也就是一个垂直整合的组织。
程曼祺
你是在什么阶段密集学习这些事情的?
曹越
创业之后非常密集。
比如 Magi-1 发布之后,它给了一个非常明确的 feedback。你知道哪些部分做得不错,哪些部分不够好;接下来要怎么调整;调整之后再做下一次决策,然后得到新的 feedback。
这里有两个层面。
一个层面是和人交流时,对方能带给你很多框架性的东西,比如产品大概应该怎么做。
但具体到你当前公司应该怎么做,很难直接从谁那里学到,因为这需要自己体验,是体感上的东西。
框架层面的东西可以相对快地学到,但更细颗粒度的东西,需要花时间一点一点学习。
你可以和很厉害、很成功的 founder 学,也可以和自己差不多、还在训练和打磨的人学习。
最直接的,是去理解 AI 视频和哪些产业有高度结合的可能,然后和这些产业的人深入交流。
持续交流之后,你会知道短剧赛道是怎么回事,短视频赛道是怎么回事,广告行业是怎么回事,C 端是怎么回事。
这样你才能判断,在这个阶段应该往哪个方向做。
比如 Sora 2 出来后,社交到底是怎么回事。你可能之前已经对这个东西有相对深刻的理解,事情出现之后,就能快速 get 到这条链路。
程曼祺
可以讲讲你们具体发生了什么变化吗?你自己怎么变的,团队怎么变的?从之前的状态到现在这个更端到端、产品和模型打通的状态。
曹越
这个变化最核心还是组织侧。
你要从组织侧搭建模型体系、产品研发体系、运营体系,然后把它们 remix 起来。
程曼祺
你们以前是什么样,现在是什么样?
曹越
最开始肯定是产品和运营侧的认知比较不足。
后续首先要把这部分团队搭建起来,同时让它和模型侧有更深度的交流。
你要在组织里告诉大家,这种交流非常有必要,也要让大家有更多交流。
比如最关键的人,可以让他们直接组织 one-on-one,让他们平时有更多沟通;也可以安排产品和模型同学一起交流。
另外,我自己也可以成为一个很重要的分发中心。
我本身是算法背景出身,但现在绝大多数时间可能都花在产品和运营上。
程曼祺
这是今年 4、5 月之后的情况吗?
曹越
今年基本都是这样,主要是产品和运营。
我花更多时间和大家对齐上下文。有点像是,至少这些人和我的上下文是高度对齐的。
组织里更多算法同学也可以和他们对齐,而他们也需要花时间和算法同学对齐,理解各种模型到底是怎么回事。
我觉得最核心的是,让大家的认知更容易对齐,把不同背景的人放在一起,让大家 remix。
程曼祺
这不涉及组织结构调整,对吗?你们本身人也比较少,几十人的规模。
曹越
对,组织结构层面还好。主要是大家都在北京办公,要创造一个密集交流、共同工作的氛围。
我理解的垂直整合,就是组织里越来越多的人能够互相理解:做模型的人理解产品和运营,做产品的人理解模型以及模型未来的发展趋势。
最关键的是大家对齐。
当大家交流非常密集时,如果它是两个组织,交流带宽其实非常小;但如果大家能自由交换信息,产品侧可能有 A、B、C、D、E 各种需求,这时就能判断哪些需求模型侧好做,哪些不好做,哪些需要下一代模型,哪些只要迭代就能实现。
这都依赖于组织里大家的 context 更容易对齐。
context 对齐效率更高,意味着大家虽然处在不同层级、不同职能,但合作被更紧密地整合在一起。
这就是我们在学习和迭代的组织能力。
程曼祺
在这个新思路下,你怎么看“模型级产品”?
我最早听到这个词时,理解是传统意义上的产品和运营不要雕花。它很容易被理解成产品运营不要做太多事情,甚至产品和运营要听模型的。这个理解对吗?
曹越
有一点这种感觉。
我自己的感觉是,确实有比例层面的影响。
特别早期时,产品可能就是为了展现模型能力。那你怎么样最大化展现模型能力,而不是在过程中加入很多产品侧先验。
我们就以 Sora 2 的 Cameo 为例,这是一个很好的垂直整合案例。
它首先能够生成 C 端可消费的内容,还可以把人植入进去。下一步就是,如何把这个能力做成一个 C 端 feature。
围绕 Cameo,产品侧可以做熟人关系,把熟人之间的 @ 功能做进去,门槛很低,还可以通过邀请码建立熟人关系。
邀请码分发给朋友,朋友通过邀请码进入 App,彼此之间天然就建立了关注关系。
所以它是围绕 Cameo 这个能力做了很多产品迭代。模型侧可以展示能力,产品侧也要最大化放大这种能力,它们之间是互相放大的关系。
程曼祺
但这已经不是最开始大家理解的“模型级产品”了,又往前走了一步。
曹越
对。这还是和阶段有关。
那个阶段大家可能最大化地做模型侧迭代,产品侧可能总想拉着模型走。但模型还处在基础迭代阶段时,产品过多参与不一定是好事。
但到了一定阶段,包括语言模型发展到现在这个阶段,产品到底好不好用,也有很多可以迭代的部分。
包括有没有新的交互方式,就像 Cameo 这种新的交互方式,能放大模型能力。
这就是垂直整合能够带来的特点。
产品侧想做一个 feature,这个 feature 和产品定位高度相关;模型侧到底能不能做到,应该通过什么方式做到?这不是“我提一个 proposal,你去实现”,而是大家多次碰撞,最后形成一个结果。
懂产品的人也大概明白模型怎么回事,懂模型的人也知道产品大概怎么回事,大家充分讨论和交流,最后拿出一个方案。
程曼祺
有了新的做事方法之后,在新模型和对应的新产品上,技术和产品分别有什么变化?
曹越
最主要还是组织侧。对外的变化,是组织变化在产品侧的体现。
比如模型侧和产品侧告诉你,当前最高优先级是什么 feature,模型侧就应该第一时间和产品侧对齐这个 feature 的重要性。
根源是组织变化。
程曼祺
我想问的是它的表象和体现。技术上,Magi-1 是自回归模型,现在的新模型还是这个方向吗?还是有一些变化?
曹越
新模型的核心,是解决生成对于人物说话和表演都非常逼真的视频内容。
这就是目标,不是“我要搞一个什么新的技术”。大家是被这个目标拽着走的。
当这个目标出现时,哪些 feature 特别重要?
比如很多场景都非常需要保持 ID 的能力。Veo 3 出现之后,大家最需要的是,怎么把人物的音色保持得更好。
假设要做一个短剧,主角在 60 集、100 集里出现,音色都要保持得非常好。人物样貌和声音的 ID 能力就非常重要。
这就是一种垂直整合的体现:大家能够对齐优先级。
更细一点,还有身形、身材。
程曼祺
我用 Sora 的一个体验是,上面有一些我的朋友。有时五官还是比较像,但身高和体型不太像。因为我认识这个人,就会觉得不像。
曹越
对。这会导致人物在不同场景里和真实人物不 align。
程曼祺
尤其是视频里同时出现两个我认识的人时,他们的身高和体型关系也和现实不一样。
曹越
对,这很 make sense。
当组织要对齐某个需求时,就要判断需求里什么重要、什么不重要,大家怎么更核心地对齐目标,并实现这个目标。
如果是一个纯产品公司,它只能调 API,无法实现这些能力。我觉得这就是垂直整合最关键的要素。
我们看 Claude,Claude Code 可能相较 Cursor 是一个更垂直整合的 model。模型在他们手里,产品也在他们手里,他们可以为产品迭代优化模型。
模型本身有自己的迭代方向,但他们也可以为产品做设计:在某个产品 feature 下,到底使用最好的模型,还是允许中间有一些能力衰减?这样成本就可以更低。
另外,它真的可能迭代出独特的用户体验,而这种体验在其他产品里感受不到。
程曼祺
具体到你们这次模型之后要发布的产品,刚才你讲到 C 端产品也在计划里。你们第一个会发布什么产品?
曹越
第一个会先发布一个 Web 端产品。
程曼祺
10 月就会发布?
曹越
对,大家可以体验。
程曼祺
主要给更专业的制作者,还是所有人都可以?
曹越
我觉得都可以用,因为它本来就是一个 C 端产品。
程曼祺
那 Web 端最优先的目标用户是谁?
曹越
最开始还是希望更多人进来使用。
很多产品一开始认为用户是 A,但真正上线后会发现用户可能是 A 和 B 之间的一些人群。
所以最开始的目标是让尽可能多的人体验,然后观察留存用户到底是哪类人,再往前迭代。
当然有一些明显可以落地的场景,比如 AI 短剧,以及 C 端玩梗,这些需求都是比较明确的场景。
程曼祺
除了公司内部的人试用,你们有没有让潜在客户或用户试用?有什么有意思的反馈?
曹越
我们刚开始内测。
内测之后,大家最直接的反馈是,人物说话和表演的真实度非常高。这一点目前比较明确。
如果说现在是 SOTA 模型,它的呈现至少和 Sora 差不多,有些能力可能更好。
音画同出的能力差不多,但 Sora 是一个能在 10 秒内完成叙事的 case,有分镜;我们这个阶段还没有这个能力。
程曼祺
我指的是人物的部分。
曹越
人物那部分,我觉得至少差不多,也有机会表现得更好。
程曼祺
最后想聊聊你自己的变化。刚才其实已经聊到了一部分。
你从研究员,到联创,再到自己做 CEO。你觉得在整个过程中,哪个阶段变化最大?
曹越
9. 成为专业 CEO
坦率说,过去两三年的变化都非常大,每个阶段都有自己的变化。
如果说变化最大的阶段,还是当你承担最大责任的时候。对我来说就是成为 CEO。
我成长最多的部分,首先是向很多人学习怎么做一个专业的 CEO。
我觉得 CEO 也是有很多专业能力要求的,只是很多人不一定感受到。我也是在这个过程中逐渐学习和迭代。
程曼祺
做到什么才叫专业的 CEO?哪些素质是专业 CEO 应该具备的?
曹越
我参考过理想汽车之前的一个 talk,大概是 2020 年左右,标题叫《如何做一个专业的 CEO》。
它没有说你应该具体做什么,而是讲在做理想的过程中,怎么思考问题、怎么做事情。
最开始,你要想清楚做的这家公司处于什么行业,这个行业有什么趋势,发展节奏是什么样。
比如 AI 视频行业,现在处于什么发展阶段?这个阶段行业最核心的痛点是什么?不同阶段的痛点可能不一样。你要用什么方案解决这个痛点?
这个方案可能是一个整体方案。你要用它去做,需要融多少钱?要做多久?什么时候解决什么问题?满足谁的什么需求?
再往下就是,有了这个方案之后,应该怎么实现。公司的战略是什么?
当你有了前面的 context,就要想用什么方法解决痛点,在这个阶段抓住什么机会。不同时间点应该抓住什么机会。
在这个语境下,专业 CEO 是指 CEO 这件事有方法、有章法,而不是凭直觉、热情,或者觉得自己能做到什么,就横冲直撞。
这对我来说是非常有启发的框架。它先定义清楚业务是什么、怎么实现业务。
程曼祺
创业中有很多无法预料的事情,包括行业和公司内部都有很多不能计划的事情。你怎么应对?
曹越
首先要识别它到底是不是噪音,尽量不要被噪音干扰。
但如果行业确实发生了事件,就要仔细思考,这个事件对公司带来了什么影响。
可能还要把它写下来,询问不同的人,听听他们觉得这件事对行业产生了什么影响。最后把事件对公司当前阶段的影响写下来,再基于这些上下文做下一步动作。
这也是我自己努力学习和迭代的方法。
大多数情况下,比如 Sora 2 突然出现,它是一个事件。这个事件到底对行业产生什么影响?
从 2024 年 2 月 Sora 出现,到底对世界产生什么影响?也是类似的问题。
程曼祺
除了和人聊,你还很喜欢和大语言模型聊,和 Gemini 聊得很多。
曹越
对。
我接触了很多人,发现很多人对现在世界范围内最强的模型到底达到什么水平,没有清晰的认知和概念。这也算是一种认知差。
我最近一次明确感受到语言模型的强大,大概是在今年 5、6 月。
当时我们内部在讨论一个 research 问题,是一个算法问题。讨论了很多之后,团队里有同学和 Gemini 2.5 Pro 进行了讨论。
它甚至能够沿着我们的讨论,补全一些我们自己没有关注到的东西,并且最终提出一个还算靠谱的方案。
那一刻的感受非常不一样。我们当时开玩笑不是大家都说 web coding,我们那个就是 web research。
它真的像一个 partner 一样,帮你补全视野里的局限和 context,并且提出一个还算靠谱的方案。它在一些数学问题上,本身就比大多数人强。
那一刻首先是一个 aha moment:你明确感觉到,世界范围内最强的模型已经非常强了。
这时候就变成,怎么样激发它这方面的能力。
我开始更多地和它讨论。我发现几点。
第一,人有时会进行很多联想式思考。你想到事件 A,再去类比事件 B。但类比总是危险的。它能帮助你理解一个东西,但两者之间总有相似和不相似的地方。
我发现语言模型非常擅长帮你梳理两个事件之间相关和不相关的部分,以及背后的原因。这方面它比我见过的大多数人都强。
你可能模糊地觉得,一件事好像和另一件事有关。它能帮你建立关系,而且说得很有道理。至于这个道理对不对另说,但它一定可以说得很有道理。
所以在这个过程中,它能很好地帮助你梳理问题。
比如我想思考一个问题,围绕这个问题有很多零散的点。我可以把这些点全部打下来,一股脑扔给语言模型,让它结构化地梳理:围绕这个问题,我能想到的这些散点分别是什么。
它真的可以梳理得非常好。
这个过程天然就像你的思考伙伴。我们天天开玩笑叫它“Gemini 老师”,它确实能给你很多关于问题的深度见解。
程曼祺
这样的话,你每天都需要和它做很多讨论?
曹越
我没有算过平均时间,可能一两个小时。
你思考任何问题,都可以和它进行相对深入的讨论。
程曼祺
你是不是比起信任人,更信任大模型?你测试过吗?同一个观点,如果是一个人讲,或者 Gemini 讲,你会更相信后者吗?
曹越
我觉得很多人讲的观点也很有道理。
但这里最麻烦的一点,是人与人之间对齐上下文。
当我说出一个观点时,实际上可能有非常多上下文和信息,但我把它压缩成几十个字。另一个接收信息的人只能收到这几十个字,其他上下文全都没有。
一种方案是让这个人给我讲半小时、一个小时,把事情的上下文补齐。但对他来说很辛苦,对我来说也有压力。
仅仅对齐上下文,就要花这么多时间。
但你会发现,语言模型在对齐上下文方面非常强。你可以告诉它,这个人是什么背景,他说了什么观点,然后让它帮你补齐:这个观点背后可能是什么原因。
它能很好地快速补齐上下文,让你快速 get 到这些信息。
所以这不是相信人还是不相信人的问题,而是它能够大幅降低人与人之间交流的摩擦,帮助两个人快速对齐。
程曼祺
如果两个人同时和大语言模型聊,同时补齐一些上下文,形成共同上下文之后再讨论,效率会高很多。
曹越
对。
程曼祺
你们就是这么实践的吗?你们组织里有一个应用,可以让两个人对着 Gemini 问同样的问题?
曹越
倒没有专门的应用。
但组织里会告诉大家,它在这方面非常强。工作环境里这种困扰很多。
如果大家背景相似,还好;但如果要做垂直整合,算法同学和产品同学怎么交流?
产品同学给你说一段话,里面可能有三四个概念都需要背景知识,但你不知道。产品同学可能要写很长一段帮你补齐,但你光看这段文字还不一定能理解。
最好的方式是把这段内容的截图发给一个语言模型,让它解释这个人到底是什么意思。
我觉得组织里很多人都用这种方法来 bridge 人与人之间交流的 gap,而且它在这方面真的非常出色。
程曼祺
在你们公司,这是很常见的习惯?
曹越
对,是我带头的。
大家有时会开玩笑,说某某说话大家看不明白,就把截图发给“Gemini 老师”,让它想想这个人到底是什么意思。
大多数人可能没有意识到,这个现象有多普遍。
任何人与人之间的交流,都存在很大的 context gap。只是大多数人没有意识到,实际上是因为你不知道对方的上下文。
程曼祺
我最近在看《不能承受的生命之轻》,里面有两章讲到类似的事情。
一个角色是瑞士人,另一个是捷克斯洛伐克人,因为他们成长的体制不同,所以对很多基础词语的理解完全不一样。但背后有非常长的上下文。
曹越
对。我觉得这是我现在观察到的一个非常底层的变化,但大多数人还没有意识到。
现在很多人的用法还是“我有一个问题,和它讨论”。但事实上,人与人之间的交流摩擦是巨大的,它可以大幅提升人与人之间的交流效率。
我还没有看到很多人意识到,这部分其实有巨大的影响。
程曼祺
那这个部分有产品化空间吗?
曹越
我认识一些朋友,已经比较直接地做了产品化。
现在有很多产品和这个 mindset 有关。比如很多 AI dating app,男生在 dating 场景里有一些诉求,可以把聊天截图发给它,问:“这个女生到底是什么意思?”女生也可以把截图发给语言模型,问这个男生是什么意思。
在这个场合下,大家有明确的对齐诉求。其实即使是这个子类,也有很多产品在做。
但放宽来看,它本质上是在 bridge 人与人之间的交流 gap。
这和几件事有关。
首先是两个人之前的上下文:他是算法背景、产品背景,还是运营背景;是男生还是女生;是在中国成长,还是在北美长大,都可能有差别。
第二是 topic 本身。两个人到底在讨论什么?
比如算法同学和产品同学讨论算法问题,产品同学听起来会很晦涩;讨论产品问题时,算法同学听起来也会很晦涩,都需要补全 context。
但如果他们在讨论一个全新的问题,双方可能都不知道对方的上下文是什么。
语言模型最强的地方,是它拥有世界上几乎所有的知识。当它足够聪明时,看到一句话,本质上可能比大多数人更理解这句话背后的意思,因为它拥有所有 context。
这是我平时工作中非常频繁使用的能力。
程曼祺
你最近和真人交流,有没有什么特别有收获、特别有启发的瞬间?
曹越
我觉得人与人交流的启发还是很大。
一般来说,首先是双方没有利益冲突,对方确实能在某些方面给你提供帮助。
有些反馈对你来说可能很直接,比如来自用户或潜在客户的反馈。
程曼祺
你想到的是潜在客户的需求?
曹越
对。我们做人物表演,就是来自做叙事片子的客户。
我想到一个和影视行业非常厉害的人交流的经历。他当时有一个观点,对我非常有帮助。
他认为,所有内容的终局都是叙事。
短视频最开始是“记录美好生活”,后来变成了:即使只有 15 秒,也要充分优化观看体验,做成一个内容;再到短剧,最终以叙事的形式呈现。
即使是做 UP 主,也可能有自己的叙事。
我觉得这是一个很通用的观点:叙事对于各种内容都有关键影响。
他是影视行业非常厉害的前辈,所以给了我很大启发。
程曼祺
这次你也提到,Sora 2 最让你惊艳的,就是端到端做出了叙事能力。
曹越
对。
程曼祺
有没有什么企业家或创始人是你学习的对象?
曹越
挺多的。
这里有另外一个 side,也不知道对不对。我发现向人学习,比从事情本身学习容易很多。
和人交流时,你能更明确地感受到他的强项和边界,他也会讲当时是怎么做事情的。
所以和人交流,更容易从他们身上学到东西。
换一个视角,以人为榜样时,目标锚点也更清晰。
程曼祺
你和王慧文沟通非常密集,创业时从他身上学到了什么?
曹越
从老王身上学到非常多。
包括创业过程中的很多细节,以及对各种认知的理解。
举个例子,我想做 AI 视频时,第一次去找他,和他说这个方向很令人兴奋,准备做这个方向。
他给了我一个 comment:“如果你要做这个方向,可以研究一下皮克斯这家公司。”
他说:“皮克斯的商业模式非常好,这是一个 sharp 的 insight。”
程曼祺
皮克斯的商业模式是什么?很多人可能会认为它是一个制片公司,卖电影,也卖一些周边。
曹越
可以类比一些行业。
皮克斯首先通过 graphics 技术做一部电影,最后获得票房。但电影发布之后,电影里的角色 IP 会留在皮克斯这家公司里。
所以它可以长期通过 IP 变现。
一方面,它有影视行业的特点;另一方面,它有 IP 行业的特点;同时,它又是一个最开始源于新技术的方向。
这个维度上有很多可以琢磨的东西。
程曼祺
什么叫皮克斯的商业模式很好?
曹越
类比真人影视行业,很多影视公司做一部电影,电影上映后做票房分账,但没有长期收入。
为什么它没有长期收入,而皮克斯有?因为真人影视里,电影火了之后,角色 IP 其实被演员拿走了,而不是留在制作这部电影的公司里。
这会让它们之间的商业价值产生很大差异。
皮克斯因为整个过程都是自己做的,所以如果角色真的广泛传播、立住了,这个角色就可以通过周边等方式带来长期收入。
这是我现在的理解。
但当时老王只是给了一个非常直接的 comment。你就需要花很多时间去研究:皮克斯到底是一家什么样的公司?为什么它的商业模式好?这个“好”是相对于谁?
这里面有非常多启发。
程曼祺
你现在有什么榜样吗?
曹越
我印象中有一段时间,微信签名是“想想伊利亚怎么想”。
那段时间我研究 OpenAI 比较多,花很多时间思考 OpenAI 这个组织到底是怎么做到现在这样的。
现在我会想很多人的做法:想想老王怎么想,想想张一鸣怎么想,想想李想怎么想,想想雷军怎么想,想想段永平怎么想。
一方面可以看他们之前的演讲,能学到很多。
比如雷军总结的七字诀:专注、极致、口碑、快。我觉得这些都是很深的道理,但这个时候你可能只能琢磨出其中一小部分含义。
然后你也可以做很多 practice,从他们抽象出的东西里去想:站在他们的视角,应该怎么看自己的事情。
前提是你有机会和他们交流。看传记也有类似的意思,比如想想乔布斯怎么想。
所以你的学习对象,也可以是自我投射的一部分。
程曼祺
伊利亚比较偏研究型,而你现在学习的对象更综合,是企业经营者、创始人的角色。
曹越
对。创业之后,我更多时间都花在怎么把公司做好这个维度上。
程曼祺
在这个转变过程中,哪些部分是你喜欢的,哪些部分是不喜欢但必须接受的?
曹越
倒不是喜欢不喜欢,更像是这个角色和我在一段时间内作为 researcher 的角色,确实存在夹角。
这部分需要花更多时间打磨和迭代,包括想清楚产品、商业、业务。
学习这些东西,和研究什么技术有更大影响力、什么 system 更有影响力,肯定不一样。
你要更多关注产品价值和商业价值。
程曼祺
创业有什么部分比较反你的本性?不一定是本性深层,也可能只是和你以前的倾向不一样。
有些人不喜欢接受采访、不喜欢和人说话,但创业之后,在某些阶段还是要更多表达。
曹越
我确实不太喜欢在公开场合演讲。单独和人交流完全没有问题,但我不太享受在公开场合给大家讲东西。
程曼祺
公开场合也包括全员会?
曹越
对,也包括。我觉得这对我来说还是有一点挑战。
但我也在反推,为什么自己不享受这件事。
有些人,比如马云,可能非常擅长在这种场合讲话。但作为公司 CEO,在很多场合确实需要充分表达自己的想法和观点,让大家理解公司的发展方向。这也是对齐上下文的一部分。
对我来说,一个很大的挑战是,我会非常关注和一个人交流时,对方是否充分理解我在说什么。
但面对一群人时,很难表达,因为这群人的上下文可能差异很大。
这个时候你的 system prompt 是什么?怎么样让这群人更充分地理解你在表达什么?
有时面向一群人表达,除了让对方理解,还有一些仪式性的作用。在组织里可能也是需要的。
但这至少不是我特别 enjoy 的部分。
程曼祺
你现在优先级最高的工作是什么?
曹越
优先级最高的是理解清楚,AI 视频方向未来一段时间内比较大的机会是什么;以及打造好 Sand.ai 这个组织,让它能够在未来一段时间抓住相对较大的机会。
也就是识别最大的机会,并在行动上抓住它。
程曼祺
你应该已经看到一些眉目了?
曹越
肯定是的。
可以从行业趋势简单讲一下。
未来一段时间的行业机会,其实就在刚才提到的专业 CEO 框架里。最开始要理解行业发展趋势。
AI 视频行业最开始源于语言模型、图像模型、视频模型、声音模型的迭代,这些模型展现出来的能力,会给一些行业带来生产力变革。
在相对短的时间里,它还更像是工具类型的机会,本质上是生产力提升带来的机会。可能偏创作者端,也可能偏 C 端。
你要判断,对这些人的需求到底是 for use 的长期需求、刚性需求,还是只是短期玩一下的需求。
随着模型能力越来越 robust、越来越靠谱、质量越来越高,可能会出现更多偏 C 端的机会。
我觉得这就是未来一段时间的变化。
如果有人仔细思考过这个行业,这些趋势应该比较共识。最不共识的是 timing,这部分没法讲太多。
本质上要判断清楚,什么时间点会出现什么样的机会,并提前为那个方向做准备。
Timing 最重要,也最难判断。
大概这个领域会怎么发展,是比较好判断的;但 timing 最难判断。
要抓住 timing,节奏感也要好,行动能力要快。
还包括组织能力。假如机会出现了,但组织没有能力抓住,就意味着节奏没有把握好。
节奏感体现在:什么时间点是什么样的机会;你在这个阶段打造什么样的组织;这个组织能不能帮助你在那个时间点抓住机会。
这就是我对这个方向的一些思考。
从公司层面看,我们从最开始更偏模型侧,转向更加垂直整合的组织。在这个大方向上,还是有很多不同类型的机会可以抓住。
程曼祺
最后一个问题,想让你说一个正在思考的问题,或者你认为重要的问题。因为我们这个系列叫 Next Question,下一个问题。
或者你想问其他人的问题也可以。
曹越
10. 超级智能带来未知变化
有一个比较有意思、也非常开放的问题。
我们有时在组织里也会讨论:ASI,也就是超级智能,到底什么时候出现?它会给世界带来什么影响?
程曼祺
你想象中的 ASI 是什么?
曹越
可以从某些维度简单讲。
如果只看智能这个维度,语言模型的智力水平随着时间推移逐年提高。
我们按照智商去 rank,从几十到 100、120、150。假设它 5 年之后的智商是 1,000,那到底意味着什么?
人可能在相当长一段时间里还处在现在的认知体系中,不会有什么本质变化。
智商 1,000 可能意味着,现有的智商评测体系根本测不出来 1,000。这是一个绝大多数人类都难以理解的数字,大家也不知道它意味着什么。
那它到底会产生什么影响?
人和猴子的差别,或者大人和小孩的差别。小孩大脑还没有完全发育时,智力水平可能只有几十,大人相对容易“糊弄”小孩。
如果一个智商 500 或 1,000 的智能体出现,它到底会给世界带来什么影响?
这是一些可以往前延展的方向。
硅谷很多公司认为,做 superintelligence 需要 scale。但到底是不是真的需要 scale,可能大家有不同观点。
我的感觉是,沿着这个方向继续往前想,还是挺有意思的。
程曼祺
今天非常感谢曹越做客我们的节目,分享你从顶尖研究员一路创业的经历,以及 Sand.ai 在这一年多里的变化。
从之前更侧重模型驱动,到现在更加垂直整合,包括组织上的变化。谢谢。
曹越
谢谢。