王冠
我应该是公司第一个离职的人,第一个离职创业的人。后来,公司出去创业的人还挺多的,公司的离职流程也是从我那个时候开始有的。所以我经常跟朋友讲,大家都应该给 Moonshot 磕一个,大家都是受到 Moonshot 庇佑的。
张小珺
今天的嘉宾是一位创业者,是 ONE2X 的联合创始人兼 CEO 王冠。他们现在的产品是 AI 视频生成器 Mydou。王冠是一名产品经理型创业者,我和他认识了很长时间,那是他刚从 Kimi 离职出来创业,此前他是 Kimi 的模型产品负责人。
上一个从 Kimi 离职创业、来到我们节目的产品经理是明超平。除了 AI 时代的应用型公司要怎么做产品、怎么搭组织之外,由于我也是一名内容创作者,所以我也很好奇地和他讨论了许多关于新时代的内容平台、生成系统,以及 AI 创作者与平台权力分配的话题。
王冠,先给听众朋友们打个招呼,并且做一个简单的自我介绍。
王冠
大家好,我是王冠,ONE2X 的联合创始人。之前一直在做 AI 产品经理的工作。
张小珺
我们这个播客也是约了很长时间,那先介绍一下 ONE2X。
王冠
1. 打造 AI 产品工作室
ONE2X,我们把它定位成一个 AI 时代的产品工作室。这里面有两层含义:一层含义是 AI 时代,因为我们相信,AI 技术的发展会带来和之前的软件、互联网完全不一样的产品体验和商业模式。也意味着,未来信息商品的生产、分配和供给可能会出现非常大的变化。
我们希望在这样的变化里面,能够以产品为核心、以工作室的方式,去探索一些好玩的产品。
张小珺
为什么你们叫工作室,不叫公司,叫 Studio?
王冠
工作室是一个很像实验室一样的概念。相比于公司,它的探索性会更强,并且在组织形式上,会更以兴趣、产品的质量和效果,而不是简单的商业目标作为导向。
所以它对于人的要求可能也会不一样。我们希望工作室里面的每一个人都能够独当一面,每个人都应该是我们今天所谓的“超级个体”,但在 ONE2X 内部,我们称之为“AI 全栈工程师”。
相当于每一个人在公司内部都有一个独一无二的位置,有自己加入这个组织的目标,并且能够把自己的兴趣和工作内容结合起来。这个是我们认为它可能和传统公司不太一样的地方,所以我们觉得它很像一个工作室。
张小珺
先聊聊你过去吧。你是怎么成为大模型产品经理,然后开始在 AI 的浪潮下创业的?
王冠
2. 穿越三轮 AI 浪潮
我其实是一个比较草根的创业者。草根的意思是,可能没有那么多很鲜明的标签。我是从大数据这个时代开始做 AI 产品经理的,那大概是 2010 年代。
国内的 AI,我会把它分为 3 个大的阶段。第一个阶段,是以大数据和传统机器学习为核心的时代。那个时候大家可能都听过一个经典的例子:沃尔玛超市里面,把啤酒和尿不湿放在一起,它们的销量就会变好,里面有一些数据分析的方法。
那其实是国内最早的一波 AI。再往后到了 CV 和深度学习,今天的预训练和大模型,我会把它看成是第 3 次周期。这 3 次周期,我恰好都在一些比较典型的公司里面工作过。
在大数据时代,我是在百度。那会儿我们做过很多偏底层的事情,包括通过机器学习的方式,在一个用户身上计算非常多维度的标签,其实就是今天的 user profile,它是推荐系统里面非常核心的一个模块。
我们当时也基于用户画像,对不同用户做差异化定价和补贴,这些事情在当时可能都比较领先。
再往后到了 CV 和深度学习时代,我先去做算法开放平台,就是把各种算法能力以 API 的方式对外提供,让外部的客户、用户和开发者能够低成本地使用到一些大厂才能拥有的模型能力。
后来又做了开源框架,类似 TensorFlow、PyTorch。百度也有自己的框架,是国内比较有名的开源项目,叫 PaddlePaddle,在国内叫飞桨。
再往后,我去了旷视,做和 AI 算法生产力工具相关的事情。那是 CV 的时代,主要思考的是怎么能够更快、更低成本地生产出一个算法。
也是在那个时候,我开始接触到我们今天叫大模型的东西,但那会儿还没有“大模型”的概念,叫预训练模型。我记得是 2020 年五六月份,GPT-3 出来了。从那个时候开始,我就关注预训练模型这个技术。
因为当时 GPT-3 对我的冲击非常大。我之前一直在做的一条工作主线,都是让用户更低门槛、更方便地获得某种算法能力。当看到 GPT-3 的时候,我突然意识到,这种技术似乎可以让任何一个用户用极低的门槛,比如一个 prompt、一个 few-shot,就得到某种算法的 API。
你可以把 GPT-3 变成翻译 API,变成 summary API,只要你有 few-shot 和 prompt 的能力。所以当时就觉得这个技术非常吸引我,从那个时候开始关注它。
后来,我从旷视加入了澜舟科技。它算是国内非常早的预训练 startup,是之前 MSRA 副院长周明老师出来创业的项目。
从澜舟科技开始,算是正式接触预训练模型。那会儿的预训练技术和今天不太一样,非常不收敛,所以社区里会出现很多模型,也会有不同算法架构的探索。
那时候也没有参数量这么大、训练量这么大的模型,会有很多技术方向可以选择。我们当时会从社区里观察,到底有哪些模型适合拿来商业化。
商业化的方式,一方面是先把来自社区的模型做中文复现,另一方面再对它做一些轻量化处理,让使用成本变得更低。在那个时间点,我们尝试了非常多的技术方向,包括文本生成、文图生成。在 Stable Diffusion 发展和 ChatGPT 出来之前,我们都做过相关探索,并且有过一些商业化的尝试。
ChatGPT 是一个很大的历史事件。今天回头看,它给整个行业,包括很多公司,都带来了一些冲击和影响。
也是在那个时间点,2023 年年初,我去了 Moonshot。在 Moonshot,我更接近你说的“模型产品经理”这样的一个角色。
主要工作也比较简单,就是把模型当成产品一样去设计它。设计什么呢?设计它的效果和能力,并且尽可能确保你设计的这些效果和能力是可以被训练出来的,最终用户是可感知的。
这大概就是我的经历,以及你刚才说到的模型产品经理这个岗位,我对它的理解。
张小珺
这个很有意思。我们之前聊过很多人,他们其实都是从技术的角度来聊 AI 1.0、2.0、3.0 的浪潮。作为一个产品经理,你觉得 AI 从 1.0 到 3.0 的变化,给你带来的改变是什么?有没有一些切身的体会?
王冠
我接触 AI 今年刚好是第 10 年,但我可能不会用 1.0、2.0 或者 3.0 来区分。我会以“是否能够拟合”来区分,也就是你拟合的数据到底是结构化的还是非结构化的。
传统机器学习时代,包括深度学习做 CV,比如人脸、物体检测、图像分类,那时候的数据是结构化的。比如做 CV 算法时,你需要打上非常多细粒度的标签。这些标签是确定性的,比如一个矩形的坐标,或者一个物体到底属于什么类型。
今天的大模型会非常不一样,因为它拟合的是非结构化数据。非结构化数据代表什么?代表数据对于整个世界的表达能力更加丰富,表达能力也更加连续。
我们的世界不是一个个离散的点,而是非常连续的。语言是一个非常连续的东西,一个视频、一张图像,本质上也是非常连续的东西。如果你只能以结构化的方式去拟合结构化数据,得到的模型就没有办法表达这样一个连续的世界。
所以我会以是否能够拟合非结构化数据,作为划分的节点。当然,今天看到的所有生成类技术,都是在拟合非结构化数据。
另外一个切身感受是,我们确实赶上了一个很好的时代。这个时代有很多新技术,也会带来和之前产品的方法论、思考方式很不一样的新东西。
因为 AI 这个行业是有起伏的,而且大部分时间,对于一个产品经理来讲,它是一个相当无趣的工作。历史上,大量 AI 产品经理做的都是中后台的事情,很难走到前台,做一个完全以 AI 为主体的产品。
更多时候,产品经理是在做中后台的数据支持、算法能力提供、数据标注和策略制定。但今天,我们有一个站到前台的机会,可以以 AI 的能力往前看:从技术和模型能力的角度,它能够解决什么问题,能够成为一个什么样的独立产品,甚至有可能成为一个非常厉害的产品,比如 Manus、ChatGPT。
所以这是一个很大的体感不同。大家赶上了一个好时代,或者说,终于等到了一个好时代。
张小珺
所以你觉得在 AI 时代,产品经理的能力是被放大了吗?还是被缩小了?从技术的角度会觉得,今天模型就能定义产品。你觉得产品经理的价值是变大了还是变小了?
王冠
3. 产品经理价值变大
我自己的观点当然是变大了。为什么呢?因为“模型即产品”这个概念,我在比较早的一篇文章里面也提过,可能算是国内比较早讨论这个问题的文章之一。
但我今天的观点,并不是说产品经理的能力被放大,就和“模型即产品”这个观念相悖。我们想一想,模型本质上是什么?如果对标到人的层面,它本质上是一个 System 1。
因为它把大量信息提前压缩进了这套系统,所以可以更快、更本能地对输入进行反应。这个时候,产品的角色变成了什么?它变成了两个很重要的角色。
第一个重要角色是:System 1 到底应该是什么样的。模型所有的能力来源都是数据,数据分布决定了模型具有什么样的效果,效果是否好、是否达标。
这意味着,System 1 本身是值得被定义、也可以被定义的。这其实是产品经理非常重要的工作内容:System 1 这一部分到底应该是什么样。
刚才提到,模型产品经理的工作内容是,第一,你要能够设计能力;第二,你设计的能力要能够被实现出来,让用户感知到。这其实就是对于 System 1 来说,我认为会越来越重要的一种能力,而不是前期那些更偏技术的工作。
比如 evaluation,也就是评测。这件事情我们应该聊过很多次。我们第一次聊的时候,我就跟你讲过我对评测的一些理解。那个时候,行业里可能还没有太多讨论,直到去年下半年到今年上半年,OpenAI、Anthropic 的产品负责人出来讲,产品应该去写 eval,应该去定义模型能力,这件事才慢慢变成共识。
所以第一部分是,产品经理本身就会对 System 1 的能力到底是什么样产生决定性影响。
第二部分和我们现在正在做的事情更相关:当你有了一个好的 System 1 之后,如何把它的价值释放出来?
我们知道,模型所谓的 next-token prediction,意味着它最终能够实现的效果、输出的内容,取决于前面有哪些 token。前面的 token 会决定后面的效果。
这些 token 有两种产生方式。一种是模型自己产生,也就是它在完成任务时产生更多有效 token。今天的 reasoning 模型,本质上就是把用户简单的需求,基于自己的理解变成一个 reasoning 过程,增加有效 token 的数量,最后达到更好的效果。
另一种 token 来自模型之外。今天大家做 workflow、做 agent 框架、建立各个领域的知识库,本质上都是在模型之外提供更多有效 token,或者说 context。
这一部分和模型的 System 1 能力构建不一样,它完全是一个产品问题。不管是 agent 框架、workflow,还是专业领域的知识库,都和技术没有太大关系。
从 prompt engineering 到今天的 context engineering,概念一直在变化,但其实在技术层面,它并不是很复杂,也不是一种具有巨大挑战性的系统。更多的是你对业务的理解、对行业 know-how 的理解,以及如何把它变成 System 2,让模型在生成内容时能够有效理解,并且在经济上更有优势地输入 context。
所以这两部分,我会认为今天产品经理的价值反而被放大了。不管是在 System 1 还是 System 2,它都有机会发挥巨大价值,并且可能要以产品为主导。
张小珺
你刚刚是不是讲到,你先去了澜舟科技,后来又去了 Moonshot?这段经历能不能也给大家讲讲?
王冠
4. 从澜舟走向月之暗面
澜舟科技算是国内最早几个以预训练技术为核心的 startup 之一。刚才讲过,在 ChatGPT 出来之前,澜舟科技就已经成立,并且做了很多有价值的尝试。
周明老师是一个非常有自己理念的人。他的理念是,模型应该被用起来,而不是变成一个越来越大、大家都没有办法使用和调试的庞然大物。
所以澜舟一直有一个理念,就是模型应该越做越小。ChatGPT 刚出来的时候,大家可能会认为模型之后应该越做越大,但今天我们也看到,越来越多的模型在落地时,朝着越来越小的方向走。
张小珺
但它是不是应该先做大再做小,而不是直接做小?
王冠
这是一个路径问题。我们刚才讲的,可能是模型最终被使用时的状态,是终点问题。路径可以是先做大再做小,也可以是先做小再做大。
比如小模型可以验证一些技术原型,验证技术想法之后,再去 scale 数据和参数量。大模型为了更好地商业化,在一些特定场景里面也必须做小。所以这里面没有谁对谁错,只是路径的问题。
从澜舟到 Moonshot,确实和 ChatGPT 有比较大的关系。ChatGPT 出来的时候,第一时间大家都认为 AGI 要来了,可能很快就会实现 AGI。没有人能够在那个时间点抵御住“有机会为 AGI 做些什么”的冲动。
我自己当时有两个选择。一个选择是在那个时间点就去创业,当然我也做了一些尝试。
在澜舟的时候,也就是 ChatGPT 出来之前,我们已经有 GPT-3 了,它的接口已经很成熟。海外有很多用 GPT-3 做出来的成功产品,比如 Jasper、Copy.ai 和 Replika。
所以当时我们也尝试用 GPT-3 的能力去做写作辅助。比如在 Notion 里写文字时,给你提供文字处理和补全能力。这是我当时尝试的第一个方向。
这个方向做了没多久,ChatGPT 就出现了。当时的风向就变成,Jasper、Copy.ai 这一类产品可能都做不下去了,因为在 ChatGPT 里面就可以完成之前各种文章写作。
我也在思考这件事,觉得可能这个方向不太行,需要调整思路。那去做什么呢?我们就想,文字已经能够生成得很好,那就去做它当时生成不了的东西。
比如和代码相关的事情,但和今天的 coding 还不太一样。我们当时想找一个比较简单的代码场景,比如帮你画一个很好的图表。
你输入一个 Excel,里面有很多数据,想画一张很漂亮的图,那怎么办?我们当时就想,用 Codex 的接口,你输入数据,再描述你想要什么样的图表,它自动帮你生成这样的图表。
当然,当时的技术还不成熟,需要做很多优化才能把好的图表画出来。这个项目的 demo 做了一段时间,我们刚刚看到它能够画出一张图表,GPT-4 就出来了。
GPT-4 也能写代码、写 SQL 了。这对我们来说又是一次踩到了 OpenAI 的迭代路径上。因为它已经能写 SQL,那它一定也能画图,只不过当时可能画得没有那么好,但以后一定会画得更好。
我就继续想,既然上层的生成能力未来可能什么都能生成出来,那就意味着我们不应该在这一层再做产品,而应该把产品形态往下沉一层。
我们很早就开始用 LangChain,大概在 2022 年年底开始尝试。后来发现,LangChain 可能把路走歪了:它把一件没那么复杂的事情,慢慢变成了像一门编程语言一样复杂的东西,走了一条和当年 TensorFlow 很像的路。
这里面就存在机会。我们当时想,有没有可能把今天叫 Agent 的东西——当时其实叫 workflow——做成一个中间层?也就是把模型能力和数据源变成一个个节点,再把这些节点串联起来。
所以我们做了一个偏中间层的东西。你可以定义 workflow 中的节点,给节点指定数据源,也可以给每个节点指定 prompt,再把这些节点连接起来。
这其实很像今天的 Coze、Dify 在做的事情。当时这个项目刚做完 demo,有机构也在推动融资流程,准备上会的时候,ChatGPT Plugin 就出了。
Plugin 本质上是一个非常简单的 workflow,但这代表 OpenAI 也在思考同样的问题。
再一再二,不再三。但我已经在所谓大模型公司的迭代路径上连续踩了 3 次,精准地踩到了它的迭代路径上。所以我就反思,这里面到底是什么问题?
虽然之前做了这么长时间的 AI,虽然可能在 ChatGPT 出来之前就在做预训练模型,但我对今天的模型能力到底是怎么出来的、未来会朝什么方向发展、我做的事情和模型能力之间的关系是什么,以及我和它的距离、方向是不是匹配,这些问题完全不得而知,也没有任何答案。
对于一个产品来说,这是非常危险的事情。相当于你是在一个非常虚无的地基上构建各种想法。
所以在那个时间点,我放弃了创业的想法,觉得还是应该去一个能够近距离观察模型能力的地方。
刚好那个时间点,之前旷视的朋友联系我,邀请我一起去 Moonshot。虽然当时 Moonshot 还没有那么有名,还没有“六小龙”的说法,可能有其他大模型公司的资源更充足、声量更大,但和 Moonshot 团队接触完之后,我觉得那里是能够更好实现刚才那个目标的地方。
张小珺
你刚才说的那些产品尝试,都在上家公司尝试的吗?还是你自己尝试的?
王冠
有一些是在公司内部尝试的,也有一些是在公司外面和朋友一起尝试的。我一直在折腾这些事情。
张小珺
所以你一直觉得自己会创业,是吗?
王冠
是的。
张小珺
然后你去了月之暗面。当时是几月份?
王冠
2023 年年初,应该是 3、4 月份。
张小珺
是跟 Tim,也就是周星宇,对吗?
王冠
对。因为我们是旷视的同事,之前在旷视时,也在一些业务上一起搭档过。当时是他来找我,说他们做了一家新的模型公司,问我要不要一起去做一些事情。
也是从他那里,我了解到了“压缩即智能”这个概念。当时我们俩一起吃饭,他给我讲了差不多 3 个多小时,压缩到底是怎么回事。
张小珺
在哪儿吃的?
王冠
在五道口的龙人居,一直吃到他们下班。我完全没有听懂,因为他讲的全都是公式。
张小珺
压缩即智能,是吗?
王冠
对,压缩即智能。他后来写了一篇很长的文章,里面全都是各种数学公式。他那天大概就是把那篇文章里的东西用语言的方式给我讲了一遍,所以我完全听不懂。
但是我大受震撼。虽然没有听懂,但是大受震撼。于是我开始研究这件事情,沿着“压缩”的概念继续往下想,找到了杰克·雷的视频。他当时在 OpenAI,有一个视频专门讲他们怎么理解压缩。
我发现里面有很多观点和 Tim 讲的非常契合。这算是我开始进入真正的大模型,或者说这一波 AI 的一扇门。
张小珺
就是你的一只脚迈进去了。
王冠
对。再往后就是沿着压缩这件事情,包括一些工作的时间,开始慢慢把各种各样的信息拼凑起来,最终形成了今天能够支撑我创业的一些底层思考。
张小珺
你今天能不能给大家讲一讲,什么叫压缩即智能?
王冠
5. 压缩产生智能
这个概念会比较抽象。压缩本质上是一种算法,把一个文件变得更小,本质上也是一种压缩。
那为什么压缩会产生智能?因为我们认为,压缩会带来数据之间的连续。压缩的对象是数据,而这些数据原本代表的是对某一种对象的数据化表达。
当这种表达经过压缩之后,原本在数据分布层面处于离散状态的一些点,可能会形成某种联系,也就是我们所说的连续。这种连续对外的展现,就会是某种智能,或者说涌现、泛化,也有人称之为幻觉。我会认为,这些都是压缩带来的。
一个比较直观的例子是,不同的单点任务。比如 NLP 里原本有很多单点任务:翻译、summary、补全,这些都是一个个零散的任务。原本这些任务都是单独训练的,有自己的训练数据和模型。
到了 GPT-2 的时候,它把非常多的单点任务的数据统一成了一种可以用自然语言输入和输出的格式,再拿来训练。大家会发现,不同任务之间出现了刚才讲的连续。
举一个不那么恰当的例子:我原本有一个中文到英文的翻译任务,还有一个中文总结任务,但没有训练一个“英文总结”的任务。
连续的意思是,当我训练了这两个看上去和英文总结没有什么关系的任务,或者说数据里并没有英文总结这样的数据时,模型却学会了英文总结。
张小珺
它好像面对一个之前没有见过的新场景,也能够做得很好,具备泛化能力。
王冠
是的。语言其实是一种非常好的压缩载体,因为它对于世界的表达能力足够丰富。大量事情都可以用语言来表述,而且语言的训练成本相对更低。
相比图片和视频,语言的训练成本更低,所以它就成为今天非常好的压缩载体。可能我现在一个崭新的观点是,它不叫“压缩即任务”,而是叫“语言即智能”。
张小珺
语言通过压缩产生智能。
王冠
是的。
张小珺
你去了月之暗面以后,和你想象的一致吗?你觉得这是一家什么样的公司?
王冠
我在 Moonshot 待了差不多 1 年,从 2023 年年初到 2024 年年初,所以没有经历它后来最辉煌的那段时间。
我应该是公司第一个离职的人,第一个离职创业的人。后来公司出去创业的人还挺多的,公司的离职流程也是从我那个时候开始有的。
首先,我会认为它可能是我之前工作经历里面体验最好的一个地方。第一,大家的目标比较纯粹和一致。那个时间点,大家的目标就是搞出 AGI。
你看过《横空出世》吗?就是讲造原子弹的过程,里面有句话叫“搞出原子弹,挺直腰杆子”。我觉得当时团队里有很多人也是抱着“搞出 AGI,挺直腰杆子”的想法。
所以大家的目标非常一致和纯粹。第二,和一群聪明人一起做事非常省力。很多时候不需要开很多会去讨论、对齐和拉通,更容易出现的情况是,大家对于同一个问题,从各自的理解出发主动做一些工作,最后发现这些事情在某个时间点被拼凑起来了。
你完全可以基于自己对这件工作的理解去做,最后会发现,这项工作和其他人的工作是能够连上的。这就变成了一种大家可以非常自主、自下而上地产生好创意,并且最终汇集成好成果的工作模式。
所以那段时间,我不会觉得工作很累,它其实是一种比较松弛的状态。你会觉得自己是在为某种目标工作,可以完全给自己足够的时间去思考问题,而且所有产出大概率都是有用的。
张小珺
那你为什么还离职?
王冠
这个其实前面也讲过,我一直是在为创业做准备。你看我的工作历程,公司的规模是逐渐变小的,或者说,我加入那个公司的时间距离它成立的时间越来越短。
张小珺
这是什么推演?第一次听到这种推演终点。
王冠
当然,这只是一个现象。从这个现象其实已经可以推演出这件事情,背后当然还有一些决策逻辑在支撑。
最重要的支撑来自于,我想明白了一个问题。前面提到,我想要了解模型底层能力要解决的那些问题:模型能力到底是怎么出来的,未来会怎么发展,我做的事情和模型能力之间的关系是什么。
我觉得自己想明白了这 3 个问题。有了答案之后,在那个时间点,我非常相信,用这套方法能够在整个大模型技术浪潮里面,真正做出一个好的产品,做出一个有商业价值的产品。
这件事情是能够实现的,是有理论基础的。所以想明白这个问题之后,还是没有办法按捺住自己的创业热情。
张小珺
你在 Moonshot 这一年之中,积累了哪些关于技术与产品的认知?我记得你之前跟我分享过很多,比如有效数据、范式转移,其实认知比较多。
王冠
6. 数据决定智能边界
这里有一些可能已经不适合在今天这个时间点再说,因为整个行业发展得特别快。我分享一下,到底是什么支持我最终愿意在那个时间点出来。
刚才讲过几个关键问题:模型能力来自何处,模型未来会怎么发展,以及你自己做的事情——不管是应用还是模型——和基座模型,或者说最底层、未来会越来越通用的那个模型之间,到底是什么关系。
我对这些问题的答案,最后都归结到了一个点。我把它称为这一波智能的第一性原理。
AI 行业有一句流传很久的自嘲,叫“人工智能,就是有多少人工,就有多少智能”。相信很多人都听过这句话。这个“人工”代表的是什么?代表的是数据。
如果做 AI 业务,大家应该都经历过这样的场景:一个问题无论如何都解决不了,算法通常会跟产品说一句话:“产品经理再去搞一些数据。”
业务怎么都达不到想要的指标,怎么调算法、怎么调训练方法都不行,最后的结论就是,再多搞一些数据。
为什么是产品经理搞数据,而不是技术搞数据?因为数据本身代表了对这个问题的一种理解。尤其当一个问题有比较强的业务属性或者行业 know-how 时,它就越来越偏向产品问题,而不是技术问题。
技术可以用技术的方式产生数据,比如用 RL 的方式训练模型,本质上是用算力换数据的方法。但这里有一个前提:比如代码或者数学,天然就是很好的封闭域,可以自动、客观地验证数据质量的好坏。
但大量场景是开放性问题,其中有一些技术不太容易触达的 know-how,这时就需要把它转换成数据。
所以,刚才讲的“有多少人工,就有多少智能”,依然是今天这一波 AI 最底层的逻辑。不管模型看上去多么智能、多么像人,它的底层依然由数据决定。
我把它称为智能的时空观。你可以把智能想象成一个空间,这个空间有一个边界。比如想象一个二维空间,一个圆,这个圆的边界代表的就是数据,数据决定了智能的边界。
这里面还有算法和算力。算力是什么?算力其实是你逼近数据所代表的智能边界的速度。算力越充分,算力利用率越高,达到那个边界的速度就越快,你会越早触达到那个边界。
算法是什么?我们可以把这个大圆里面想象成有另一个小圆。这个小圆在逼近大圆边界时,会有一些部分突出去。它不断朝大圆的边界靠近,最终能够突破这个边界,画出一个新的圆。
这个新的圆取决于小圆的大小。它会画出一个新的边界。突出去的那部分,也就是超出原有数据所代表的智能边界的部分,我认为就是涌现的部分。
所以算法决定了,用已有数据到底能够产生多少涌现。这里面我会认为,数据还是更本质、更第一性的。
从“数据是第一性”这个结论,可以推演出很多有意思的事情,比如这个行业未来发展的阶段。
在我的推演里面,这个行业会有 3 个阶段。每个阶段对数据的要求不同,也会更利好不同方式做产品、做业务的玩家。
第一个阶段,我们今天看应该已经过去了,是围绕所谓公域数据的阶段。公域数据就是互联网数据,你有我也有,是互联网和历史信息化进程沉淀下来的数据。
把这些数据清洗、整合,然后训练到模型里面,这其实就是第一阶段大家都在做的事情。
这个阶段的数据决定了模型能力的边界,而这个边界是固定的。大家的圆都这么大,比的是谁更早到达终点。
所以它更适合人才密度高、有充分算力、决策速度快的组织,也就是组织消耗比较少的团队。
张小珺
如果算力、算法差不多,大家又使用相同的数据,都能达到差不多的边界,有没有可能我能实现 AGI,而你实现不了?
王冠
没有代差,模型效果不会有代差。大家可能会因为模型架构的差异、数据分布的差异,在某些任务上你比我好一些,我在某些任务上比你好一些,但不会存在所谓的代差。
第一阶段就是这样。那这么说的话,中美其实会拉平吗?
张小珺
现在已经是平的吗?
王冠
其实现在已经是平的。今天基座模型的能力,已经不只是最底层数据或算法的差异了。国外模型有一些先发优势,一方面是算力更多,算力多就更快;另一方面是因为它们更早提供服务,在不同场景里面搜集了更多数据。
这些数据经过有效筛选之后,又重新回到模型里面。随着国内模型也有越来越多的人使用,这些场景的数据也会回流到模型里面,差距会慢慢被抹平。
张小珺
好,这是公域数据。
王冠
公域数据之后,大家会拼所谓“我有你没有的数据”,也就是 domain 数据。
Domain 数据很利好大厂,或者信息化做得比较好的传统行业。它们信息化做得比较好,未来会接受到技术外溢带来的人才红利,就可以把自己的 domain 数据用大模型的方式利用起来。
更不要提它们天然就有业务场景、产品渠道和用户,所以会进入一个大厂更擅长的领域,模型能力也会出现差异,越来越分化。
前两个阶段都不属于产品创业的机会。第一个阶段更适合基座模型,第二个阶段更利好大厂。
什么是适合做应用层创业的机会?它也跟数据有关,我们称为“第三份数据”。第三份数据是产品内生的数据,简单来讲,就是之前不存在的数据。
举一个不那么恰当的例子。没有 ChatGPT 这种产品形态之前,历史上没有一份数据是通过对话、通过自然语言对话的方式去解决各种奇奇怪怪的问题。
当然,之前有 InstructGPT,ChatGPT 也是从 InstructGPT 过来的。但在这种模型和 ChatGPT 形态出现之前,并没有这样的数据。
这份数据是因为有了 ChatGPT 这种形态,背后又有了一个能够响应对话输入和输出的模型,才慢慢转起来的。后来我们发现,越来越多的问题都可以通过对话解决。
如果追根溯源,用对话解决各种各样的问题,就是一份来自 ChatGPT 的内生数据。
所以我们会认为,ChatGPT 对所有做应用的公司来说,都是一个非常好的参考样本。它通过创造一份此前不存在的数据,建立起了自己的产品价值和壁垒。
只是因为它原本是做模型的,所以天然有自己的模型。它在做产品的第一天,就把模型这个工作环节补上了。
对于未来做应用的公司,大家也可以参考这样的路径:在做产品的过程中,从第一天开始就设计出一份此前不存在的数据。它是因为你设计了这样的产品形态才产生的,并且未来这份新数据能够被训练回你自己的模型。
这样,刚才那个问题就有了一种解法:你做的事情和最底层、越来越通用的模型之间,如何保持一个安全距离。
张小珺
ChatGPT 有数据飞轮吗?它把数据训练回去,对它的产品价值是什么?
王冠
有一段时间,模型能力变化非常快。从 ChatGPT 刚出来到 GPT-4 那段时间,模型能力的变化非常快。
但再往后你会发现,模型能力的进展没有那么快了,甚至有一段时间出现了下降,大家直观的感受就是“降智”。
降智可能来自成本优化,比如换了更小的模型,当然有这种可能。但也存在另外一种可能:如果你不经筛选地把所有用户数据都训练回模型,数据决定模型的智能,就意味着模型能力会趋同于所有用户使用所代表的平均智能水平。
所以回到你的问题,“数据飞轮”这个词可能不太准确。它往往代表这些数据都是有用的,但实际上并不是所有数据都有用。
模型产品经理有一个很重要的工作内容,就是如何决定 System 1 的能力。一种方法是,应该有某种机制从数据里面找到代表更高智慧的数据,而不是一股脑把所有数据都训练回去。
张小珺
对自动驾驶数据来说,应该取优质驾驶员的 3% 还是 5%,我忘了具体的数据,然后再做训练,不能拿所有驾驶员的数据。
王冠
是的。比如 FSD 今天能够用于训练的数据,可能已经不足千分之一了,但一开始肯定不是这样。它是不断提高对数据筛选的标准。
不同行业、不同产品形态,会有不同的筛选方法和逻辑。但大的原则都是:要从已有数据里面找到对智慧有增量的部分。
张小珺
所以有效数据需要是高质量数据,不能是所有数据,而是高于模型当前水平的数据。你得跟一个更聪明的人学才行。
王冠
是的。其实聊到这里,就回答了前面的那个问题:为什么我会出来创业?
因为我推演出了未来会有一个属于 AI 应用的阶段。这些 AI 应用不用像 ChatGPT 刚出来时那样担心:我做一个产品,第二天就会被基座模型吃掉。
你没有这个顾虑,因为你可以通过构造新的产品形态,产生一份内生数据,未来长期和基座模型保持共同存在的状态。
想明白这些之后,我就出来了。
张小珺
你说你在月之暗面之前经常做产品,发现自己总是坐在 OpenAI 的延长线上,最后会被模型公司碾压。你现在怎么避开它的延长线呢?
王冠
这其实是一个竞争问题。首先不会存在你能做、其他人做不了的事情。永远不存在,不要说 OpenAI,任何公司都不能说它做不了你做的事情。
我们会看几个维度。第一个维度是目标:你做这件事情到底是为什么?
每个公司即使产品形态非常像,目标也一定不同。目标会影响你在发展过程中走的路径,而这些路径也会反过来影响目标,导致你走出一条和别人不一样的路,到达一个不一样的终点。
第二点是位置问题,也就是你从什么样的出发点来做这件事情。
比如刚才讲,做一个应用层产品,第一步是想清楚你独有的数据是什么。继续往下延伸,这份数据之前不存在,所以需要你去设计。
如果你从第一天开始,就以设计一种新数据为起点,和我从解决某个特定的、有商业价值的问题出发,去设计软件功能形态为起点,这两个位置就是不一样的。
目标和位置还会影响未来发展的速度。速度本身也带有组织属性,团队越小、人才密度越高、越早期,速度大概率越快,行动自由度也可能更高。
回到你的问题,我们并不认为今天我们做的事情,或者任何一家公司做的事情,大厂不会做、OpenAI 不会做。如果他们根本不思考这个问题,那大概率说明你想的方向可能有问题,可能是错的、没有价值。
所以不存在这种可能性。唯一的差别在于,你做这件事情的出发点、前进速度,以及设定的目标不同,最终会导致你和其他人做同一件事情时,路径和终点一定不一样。
今天很多方向上,大家的产品形态会非常像。比如以前做 chat,大家都是 chatbot;后来做 coding,大家都是 Cursor 那种形态。
这些都是产品早期的方法收敛。做这件事情的方法是收敛的,产品形态也收敛了:软件就应该长这样,大家应该有一个 chat 框,应该有一个 IDE。
但底层做法和目标,会导致接下来大家的分化越来越大。
所以我们不会担心或焦虑其他人是不是在做同样的事情。我们要关心的是,自己从什么起点出发,目标是什么,然后不断找到通往目标的路径,怎么让速度最快。
张小珺
你说的 3 份数据,第一份是公域数据,第二份是领域数据,第三份是新产品带来的内生数据。前两份数据我们都很清楚。第三份数据,你觉得哪些产品实现了?在你看来,哪些产品满足能够在产品内部产生新数据这个条件?
王冠
今天来看,其实不那么多。因为这个阶段相对靠后。这个东西隐藏在产品背后,你看产品界面,可能没有办法猜测它背后到底有没有设计自己的数据。
所以我只能从我们自己的例子来讲。我们现在做的产品和视频生产相关。
我们做这个产品的第一步,并不是直接设计一个视频编辑器的形态,而是从设计一种如何表达视频和制作方法的语言体系开始。
一个视频为什么是这样,你如何用一种清晰、结构化的语言描述出来?一个视频为什么被做成这样,它的制作过程也应该能够用一种非常结构化、清晰明确的语言表达出来。
所以,我们工作的出发点是:一个视频长什么样,以及它的制作过程,应该可以用一种语言来描述。
这份语言,至少在我们的视野里面,之前并不存在。它是我们设计的一种 DSL,也就是特定领域语言。
第二步,才是从这样一门语言往下走:前面应该有一套什么样的技术架构,从数据存储开始,包括今天可能叫 agent 的框架、workflow,以及前面的软件界面。
我们会把软件界面称为 environment,也就是环境。你应该了解强化学习里面的概念:要搭建一个供智能体活动的环境。
为什么要这么做?因为只有完成从语言的设计,也就是数据的定义,到和这套语言匹配的整个工程实现,才是完整的。
从数据存储到前面的软件概念设计、概念建模,再到 environment 里面的各种功能、每一个按钮,以及用户的每一个指令,都能够用语言的方式连接起来。
这件事情才是一个足够智能化、未来可能具备智能化的系统。所谓智能化,可能就是整个系统运行过程中,人和智能体都在这个环境里面活动。
这些活动会产生数据,而这些数据未来可以用来训练模型,并且能够有足够的方法,从数据中筛选出所谓的有效数据。
这一切,其实都是从设计一份新数据、设计一种新语言作为出发点来做的。这只是我们自己的实践,我们也不知道其他产品用的是什么思路和路径,只是这套逻辑在我们的产品实践过程中能够匹配上。
张小珺
你们现在获得新的数据了吗?
王冠
当然。你可以把我们在做的产品想象成一个标注平台。
这个软件界面是一个 environment,里面有两种活动主体:一种是人,另一种是 AI,叫智能体也好,或者其他名字也好。
这两种活动主体在活动过程中都会产生数据。智能体能产生,人也能产生。
比如,一个视频应该怎么做出来?几个镜头的顺序为什么是 A 而不是 B?它们为什么要这样组合?
人在生产视频时,工作流会自动被记录下来,这对你们来说也是一种数据标注。
张小珺
也就是说,人在生产视频时,他的工作流会被你们记录下来。这对你们来说是一种数据标注。
王冠
对。为什么叫它环境?因为环境代表了主体,也就是人和 AI 能够行动的范围。
在这个环境里,必须有一个功能、一种能力,这个人或 AI 才能按照这种能力行动,进而产生相关数据。
再往下一步,这份数据还要能够被学习。软件会不断产生数据,所有 SaaS 产品因为都是在线的,所以都会产生数据。人一直使用它,就会一直产生数据。
但这份数据是不是可被学习,更关键。
什么叫标注?我们并不会把用户的使用直接作为未来系统迭代的参考。为什么?因为还是回到刚才那个点:你要找到所谓的有效数据。
所以很长一段时间里,这个标注是由我们自己的专家完成的。你可以把他们理解成知道怎么做出更好视频的人,他们来使用这个产品。
张小珺
就好比 DeepSeek 他们内部有那种学中文的标注人员。
王冠
对。OpenAI 做完 GPT-4 之后,也开始招各种 Stanford 的 PhD,甚至招一些大学老师来标注领域数据。
你可以把 ChatGPT 理解成一个环境,只不过这个环境既可以对外使用,也可以对内使用。对我们来说也是一样。
它实现的是什么?你其实不用在软件层面做任何迭代和优化,只要通过标注产生数据,然后重新把它内化到系统里面,就可以让前面的用户感觉到,昨天做的视频和今天做的视频质量不一样了。
张小珺
我很希望有一个 AI 能够记录我的工作流,然后以后帮我完成这些工作。因为我觉得它其实是一个固定的工作流,我很希望 AI 能够取代它。
王冠
这其实就是刚才讲的第三份数据的一个非常典型的表现。你的工作流和 know-how 其实没有被信息化。
为什么你们的文章可能比其他账号的文章写得更好?这里面一定代表了某种方法,但这个方法并没有被信息化。这其实就是一份我们刚才讲的、尚未形成的数据。
张小珺
那你当时为什么在众多第三份数据中选择现在这个方向?这个方向是怎么选择的?你是 2024 年底开始创业的,对吧?这个方向想了多久?
王冠
不是,我们是 2024 年年初出来开始创业的。只是公司成立的过程比较坎坷,到 2024 年年中才把公司成立起来。
张小珺
所以你是 2023 年年初加入 Moonshot,2023 年底离职,2024 年年初开始创业,2024 年第二季度才把公司建起来。
王冠
对。
张小珺
怎么坎坷了?
王冠
这其实是另外一个故事,我们先说前面的视频这个事情。
7. 视频成为 AI 起点
我们当时刚出来的时候,视频这个模态还不成熟,多模态也还不是主流。最成熟的是文字,图片也还不错,再往下可能是声音,比如音乐。视频当时还处于比较早期的状态。
为什么选择这个方向?有几点考虑。
第一点是商业层面的考虑。刚才讲了,我们是一个起于微末的团队,一开始很坎坷,也没有什么钱,所以我们第一个要想的问题一定是怎么赚到钱,先养活自己。
视频显然是一种价值更高的模态。研究视频赛道会发现,比如在美国市场,虽然 CapCut 的营收一骑绝尘,但可能有 20 到 30 家做视频处理、视频软件 SaaS 的产品,ARR 都能做到几千万美元。
这是一个非常典型的蚂蚁工具市场。它意味着什么?意味着你在任何一个单点能力上,如果能做到足够好用,就能够产生不错的收入,因为视频的价值更高。
第二点是技术层面的考虑。刚才讲了,我们未来要做的产品,是从设计一份数据、设计一门语言出发的。
设计一门语言的前提,是这件事情能够被设计成一个封闭域,就像围棋一样。围棋有规则,有固定的棋盘位置。
封闭域代表着,你的行动、下一步行动是可以被计算的。这一点非常重要。
视频处理这件事情,可以被设计成一个封闭域。因为视频处理过程可以看成一系列原子能力,比如某种视频特效就是一种原子能力,一个花字也是一种原子能力。
视频处理的原子能力数量是有限的。你可以用一个最小化的原子能力集合,做出某种视频。视频制作的过程,本质上就是这些原子能力按照时间关系进行排序或组合。
所以它可以被设计成一个封闭域,也符合我们从设计一种语言、设计一个封闭任务出发来做产品的技术特点。
张小珺
什么叫设计一门语言?
王冠
刚才讲的就是,一个视频是什么样的,以及它是如何被制作出来的,应该有一套清晰的语言体系来表达。你可以认为,它是一门高度凝练、能够被评判的学科。
你可以把它抽象成一系列对象,每个对象有对应的属性和值,这些对象和属性值能够依托某种语法,表达出这个视频是怎么被做出来的,以及它长什么样。
它并不是单独开了一门语言,而是一个可描述的状态,只是我们用一种语言来描述它。它是一种介于自然语言和代码之间的形式。人未必能够完全看懂,但它有特定的格式。
第三点,是对未来的考虑。这一点比较抽象,也未必是对的,只是我们自己会这么想。
我们认为,互联网时代不管是 PC 互联网还是移动互联网,模态都是从文字、图片,再到声音,最后到视频这样发展过来的。回顾 PC 互联网和移动互联网的发展历史,很多大的产品都是按照这样的模态顺序发展。
为什么?一方面是硬件和技术的约束,比如流量很贵;更主要的是,模态越高,对人来说生产难度越大。
写文字比做视频一定更简单。对你来说可能不这么认为,但我们不是说文字的好坏,而是说,能够写一篇文字、成为文字创作者,和能够做出一个视频、成为视频创作者,门槛一定不一样。
所以一定会有这样的发展顺序。门槛更低的模态,产量就越大,更多人能够加入生产。写文字的人天然会比做视频的人多。
这就是互联网的特点,因为互联网并不解决生产问题。互联网解决的是连接、分配和消费问题,解决的是如何消费内容。内容的生产仍然是在人这里。
今天有了各种生产能力,尤其是这些生产能力未来越来越成熟之后,不同模态的生产能力会被拉平。用 AI 写出一篇好文章,和用 AI 做出一个好视频,门槛可能不会差异很大。
这代表什么?代表价值更高的模态,会在市场上占据越来越统治的地位。大家一定更愿意看视频。对广大的人民群众来说,大家一定更愿意看视频。
张小珺
这可以从抖音、TikTok 里面看出来。
王冠
对。如果不同模态未来的生产门槛都被拉平,就意味着,今天价值最高的模态,其实是 AI 时代的起点。
未来只会出现比视频更高级、价值更高的东西。比如软件、游戏。今天大家还在讨论生成游戏,因为生成一个小游戏可能已经很简单了,但要生成一个有消费价值的游戏,可能还不容易。
但视频可能已经可以了。我们是在 2024 年年初思考这个问题,所以一定要站在一个新时代的起点来做这件事情。
我们认为,视频其实是 AI 时代内容的一个起点。
张小珺
前面语言都是预演,是吧?至少它的商业价值可能没有那么高。
王冠
对,所以是这 3 个维度。
张小珺
那你怎么看图片这个模态?图片、文字和声音,其实都是视频的组成部分,未来也会变成软件和游戏的组成部分。
王冠
之前为什么会出现这些更低维度的模态?这里的“低维度”不是贬义,只是相对更简单。
核心原因在于生产力问题,还是回到人在生产内容这个点。能画出一张好画的人,未必能写出好的文字;能写好文字的人,未必能做出好的音乐。
大家只能术业有专攻。音乐做得好,就去作曲;画画画得好,就去画漫画。也许我有很好的故事构建能力,但不会画画,也不会做音乐,那我可以去写网文。
如果以人为生产主体,就会出现不同模态的划分。但如果未来生产能力把这些模态的生产门槛拉平,模态之间的差异就可能不会那么泾渭分明。
为什么一部漫画里面不能有音乐?为什么一段好的文字不能以视频的形式存在?
所以结论就是,视频是内容生产的起点。我们认为,视频是 AI 时代内容的一个起点,未来只会出现比视频更高维度的模态。
张小珺
这很有意思。不同创作者之间的壁垒是什么?如果内容都是 AI 生成的,创作者还有价值吗?
王冠
当然有。创作者的身份,和我们刚才讲的产品经理的身份非常像。
产品经理控制的是什么?产品经理控制 System 1 和 System 2,控制方式是在生产端。创作者控制的是什么?创作者控制的是生产能力如何被使用。
你刚才说,未来大家的差异会变成什么。前阵子很时髦的说法叫 taste,我们内部会把它称为 recipe。
生产过程中会有一个菜谱。如果你是一个做饭的人,其实会有一套自己的工作方法,甚至可以把它写出来,变成一份菜谱。
但是我写的菜谱交给你,你严格执行,做出来的菜和我做出来的菜,味道其实还是会有差异。但宫保鸡丁还是宫保鸡丁,水煮肉还是水煮肉,你不会拿着水煮肉的菜谱做成宫保鸡丁。
我们认为,recipe 是有价值的,而且是不同创作者之间形成差异化的核心。
张小珺
你们是做视频的工具,还是生产方?
王冠
这就和商业模式有关了。今天大量产品都是从工具端开始出发的。
我们也想过,为什么要做一个工具?你可以从工具出发,也可以从社区、分配端出发,还可以从消费端出发,自己去做内容供应商。
为什么从工具出发?核心原因是,底层技术带来的是生产力革命。生成等于生产,生成技术最直接影响的是生产环节。
生产环节对应的最直接的产品形态,就是工具,也就是生产力工具。所以它是离技术革命最近的地方。
张小珺
如果你直接做的是生产结果,也就是创作视频本身,而不是创作者手中用来做视频的工具呢?
王冠
这是一个很好的问题,里面有一个很重要的点,是 timing。
生产端的技术还在快速变化,技术没有稳定下来。我们认为,技术稳定下来有两个维度。
一个维度是 System 1 的部分要稳定。对于文字形态来说,语言可能已经很稳定了;代码可能会越来越稳定,未来可能达到 99.99999% 的可执行成功率。
但多模态今天远远谈不上稳定。从 Will Smith 到 Sora 2,我们才第一次看到,视频领域里此前可能需要多个单点模型产生的能力和内容,被合到了一起,比如音画同步、分镜。
这是一个非常早期的阶段。我们认为,Sora 2 和 Veo 3 并不是多模态的 ChatGPT 时刻,而是 GPT-2 的那个时刻。
如果对标语言模型的发展历程,这两个模型前后间隔很短,所以我们认为它们处于同一个时间点。它第一次把视频的多个单点任务合到一个模型里面。
后面还有很长的路要走,包括数据量的 scale、模型参数量的 scale、成本下降、生产速度和推理速度提升,当然还有最重要的模型能力。
比如今天我们实现不了一件事情:输入一个视频,让模型参考这个视频,再做一条新视频。
有人会说,可以先用 Gemini 把这个视频拉片、理解它,变成一个脚本,再把脚本输入生成模型,让它输出一条新视频。但这并不是端到端。
张小珺
你之前应该也聊过多模态技术的发展。
王冠
对。如果参考语言模型能够实现的效果,未来端到端的多模态模型,从应用端来说,我们希望看到的是,大家不需要再调很多不同的工具。
我只需要知道,如何把一个模型的不同能力抽出来,再组成我的 System 2。
这意味着,端到端的多模态模型应该可以接受任何模态的输入,不需要经过中间语言转换,而是在模型内部理解不同模态。
它应该能够理解输入的音乐,基于这段音乐做出一个视频。
张小珺
现在语言还是一个转换器。
王冠
对,现在语言还是冗余的,需要一个介质。
我们也相信,未来端到端的多模态能力,一定会把语言模型走过的路重新走一遍。比如语言模型今天走到了推理模型阶段,未来端到端多模态模型也会有推理能力,只不过它可能以视频的形式推理,以音频的形式推理。
但你看,这个状态和我们今天所处的状态相比,可能很难想象到那个时候该做什么产品。你连怎么用这个模型都想不清楚,更不要说在上面做什么产品形态了。
生产端距离能力变化最近。无论能力怎么变化,生产工具一定是第一时间感知到这些变化,并且探索如何利用这种能力。
与此同时,生产工具也在构建 System 2,构建让 System 1 更好发挥效果的 context。
这件事情对于未来的分配端和消费端也同等重要。真正的生产能力成熟,是 System 1 和 System 2 同时达到相对稳定的状态,再加上成本快速下降,可能还包括新的硬件、新的算法架构。
到那个时候,生产之后的环节可能会出现一个更繁荣的产品世界。
张小珺
所以现在还是先好好做工具。
王冠
对。我们有一个观点,叫“不要在诺基亚时代去做 App”。
张小珺
现在是诺基亚时代吗?
王冠
也许吧。只是从我们自己的思考来看,现在这个时间点可能不太适合做 App。这里的 App 是打引号的。
生产端距离模型更近,能够感知模型能力变化,并且为未来那个时间点的成熟积累自己的数据。
所以现在整个状态,仍然是我们所说的诺基亚时代。诺基亚里面当然也有 App,有小游戏,也有计算器。
张小珺
你用过诺基亚吗?
王冠
当然用过。
诺基亚时代的 App 和 iPhone 时代的 App 差别很大,不是同一个东西。今天只有在生产端做好积累和沉淀,未来才有机会在 iPhone 出现的那个时间点,做出真正好的 App。
张小珺
iPhone 出现的时间点,一个标志有可能是什么样?它是硬件创新,还是其他什么创新?
王冠
刚才其实已经描述了一部分。对于视频来说,端到端的多模态模型应该具备刚才说的那些能力。
另外,它的推理速度可能要有几个数量级的提升,成本也要有几个数量级的下降。
张小珺
现在还像是大型机时代。
王冠
当然。
张小珺
刚才你讲到整个产业链,也就是 AI 对产业链结构的影响,非常有意思。你觉得它会怎么重塑产业链?
比如我们提到的这些移动互联网时代的 App,会对现在的格局带来很大的变化吗?
王冠
我们会从软件、互联网、AI 这 3 种不同的技术范式来考虑这个问题。
这里面很大的一个变化,在于最终消费物的权利转移。
软件时代很像我们国家早期的供销社:你只能买我生产出来的东西。软件做出来之后,你用就好了,好不好用可以说,但不好意思,我也不知道怎么迭代。
所以权利更多在生产端。
到了互联网时代,权利慢慢转移到了分配端,比如电商平台、推荐引擎和搜索引擎,权力转移到了平台,转移到了分配这个环节。
再往下,按照这个趋势推演,自然应该转移到消费端。我要消费的内容,我们称为信息商品,它应该是什么样,权利应该在消费商品的消费者本身。
张小珺
他告诉你想要什么,然后生成一段内容,那就没有创作者什么事了。
王冠
他不需要再告诉模型自己想要什么内容。就像你使用推荐引擎时,并不需要输入一个 query,就能够得到自己想看的东西,而且它会推得越来越准。
按照这个技术发展趋势,未来一定会出现这样一天:你看到的内容,根据你的 user profile、所处的环境,甚至根据你此时此刻的精神和生理状态生成出来。
它会是更极致、更智能的个性化。
张小珺
我不知道你看不看《火影忍者》。最后那个 Boss 要实现“无限月读”,每个人都生活在自己的想象世界里。
王冠
对,其实会比较像我们按照这个逻辑推演出的终局。但它应该还需要很久,因为你问的是整个产业链、整个经济环节的变化。
从逻辑上推演,它应该是这样。但在这个过程中,不管是做工具的人、创作者,还是其他参与到整个经济链条里面的人,大家都在自觉或不自觉、主动或被动地朝这个目标前进。
就像互联网时代,一开始大家并不会想到,自己是在为未来的大模型标注数据、生产数据。但有一天,这些数据会被训练进模型,变成很强大的 System 1。
张小珺
所以 20 年的互联网发展,是在为 AI 大模型训练做准备。
王冠
是的,大家是不自知地在做这件事情。
今天,像我们这样的应用公司去定义一份新的数据、标注一套新的方法,其实也是在为未来的模型做准备。参与产品构建和使用的人,不管今天的目的是什么,最终都在为那个目标努力,或者说推动这个进程。
张小珺
那个最终目标应该怎么描述?感觉很宏大。我们所有人一直在标数据,做的是什么?为的是什么?
王冠
可能这就是另外一种 AGI。
张小珺
AGI 可能不是通过某一个 lab 实现,而是一个拼图?
王冠
是的。这个概念我们之前好像也聊过。
我对 AGI 有两种定义。一种比较抽象,称为广义 AGI。它的标志是一个状态:当模型知道自己不知道什么的时候。
这个“不知道”是真正的不知道。我们人在进行信息交互时,知道自己知道什么,也知道自己不知道什么。你问我一个问题,我不知道,我可以假装知道来回答你,但我自己心里清楚我不知道。
今天的模型不具备这样的能力。它有时会说这个问题不能回答,但你并不知道,它是因为被训练成了某种 pattern,还是因为数据里真的不存在这份信息,甚至是因为模型通过涌现获得了泛化能力。
你不知道它到底有没有泛化出这个能力,它自己也不知道。
如果知道自己不知道什么,意味着它可以有目标地学习,去解决自己不知道的信息。今天的模型已经有非常强的信息获取和工具使用能力。
如果模型真正知道自己缺乏什么能力、不知道什么,它就可以被设计一个 reward function,让它逐渐把自己不知道的事情补全进来。
这完全可以是一个自动化过程。所以我说它是一个状态:当达到那个状态时,哪怕它还没有学会所有不知道的东西,我觉得也可以认为它是 AGI 了,因为它的学习速度会很快。
这是一个定义,但我觉得它没有太大价值,因为很难评判,在今天没有任何技术手段去判断它,太抽象了。
另一个定义可能更狭义一些。这个狭义是指,它可能是局部的、渐进式的过程。
这个渐进过程是说,在某个有价值的商业问题领域里面,模型可以自己赚到钱,或者赢得资源来优化自己。
比如这两天的炒股就是一个非常经典的例子。如果模型能够赚到钱,再用这些钱为自己采购数据、算力,用新的资源让自己赚到更多的钱,那么在炒股这件事情上,它就形成了一个闭环。
它的目标是赚到越来越多的钱,工具包括获得更多的卡、更多的数据,以及进行自我评估的环节。它可以自动把这条链路转起来,不断赚到更多的钱,让自己变得更强,再赚更多的钱买卡、训练自己。
今天这个过程里,人还在大量介入。刚才这个 loop 我们可以做,但里面有大量人参与的部分。
张小珺
所以在这个领域里面,它还不够 AGI。
王冠
对。未来都是畅想,但我们应该能够看到,在很多有价值的商业问题里面,会出现一个 AI 系统,它自己能够赚到钱,并且在人参与越来越少的情况下,自己优化和迭代。
所以我认为,这是一个更狭义的 AGI 概念,它会一点一点发生。
张小珺
语言的 AGI 发生了,coding 的 AGI 也在发生,好像是一点点被点亮。
王冠
是的。我们一定会看到,人在这样一套优化系统中参与的部分越来越少,人慢慢退出这个 loop。
张小珺
感觉今天聊的很多东西都很民科。视频的 AGI 什么时候会达到?
王冠
我觉得还比较远。对于端到端的多模态模型来说,底层技术还有很长一段路要走。
张小珺
所以你们其实是先在这个点上开始积累能力。
王冠
我们是抢跑,但也不能叫抢跑。我觉得更像是在为未来的模型能力,先做好一个能够适配它的架构。
刚才讲了,我们做的是 System 2。今天的 System 1 长成这样,但我们可以推测未来的 System 1 会长成什么样,什么时候能力可能相对稳定,什么时候开始优化成本和推理速度。
我们希望做的是,推演出未来模型能力稳定时的状态,然后今天就按照那个状态构建自己的 System 2。
举一个不恰当的例子,coding 在 Claude 3.5 出来之前,Cursor 也没有那么好用。但 Claude 3.5 的代码能力有了很大提升之后,Cursor 就变得非常强了。
张小珺
Reid 说,产品应用公司先做一个壳,等着模型能力提高。你认可“壳”的说法吗?
王冠
壳可大可小,可薄可厚。我们肯定认可这个说法,“壳”这个词一点都不是贬义词。
我们做的也是一个壳。System 2 本质上就是一个壳,只不过它可薄可厚。
刚才讲的所有 System 2,都是围绕 context 这个概念的:Context is everything, everything is context.
王冠
什么意思呢?“Context is everything”就是说,你要去做的这个产品、你要去实现的那个效果的好坏,就是由 context 决定的。因为基座模型是一样的,大家用的是同样的模型,所以你的产品好坏,就是由你在基座模型之外的这些 context 去决定的。
张小珺
这个 context 跟你之前说的那个“内生新数据”是什么关系啊?
王冠
它不是一个概念,但是肯定会有一些 overlap。就是那份我们叫“特定领域 DSL”的东西,比如视频的 DSL、视频表达的 DSL,它是组成这个 context 的非常基础的一层。你所有的 context,都是从这个 DSL 往上设计出来的。
张小珺
嗯嗯。
王冠
对,所以刚才讲“Context is everything”,本质就是说,我们再去做应用这一层,大家其实拼的东西只有一个:你的 context 质量更好,你的使用效率更高。相同的 token,你可以比别人实现更好的效果,那你就赢了。
张小珺
怎么做到这一点?
王冠
那就涉及刚才你说的 context engineering 的部分了。它有很多方法,比如 agent 框架。不同 agent 框架的设计理念,对于 token 的消耗就会不一样。
比如你用 ReAct 这种方式,就会产生海量 token 的消耗。但是如果对于一个更确定的问题,你把整个架构里面一些更确定的部分提前固定下来,那你需要新产生的 token 就会变少。比如 memory 的一些管理机制,都会降低 token 的消耗。
张小珺
所以这就是“Context is everything, everything is context”?
王冠
其实对于未来的终极模型来说,所有跟视频相关的子模态,都应该可以以 context 的形式去影响模型的输出。就像刚才说的,音乐对于视频创作一定是有影响的,所以音频应该是一种 context。
文字模态的东西,甚至视频模态的东西,都应该可以像今天的语言模型、代码这样,作为 context 去影响最终的结果。
张小珺
那要实现刚才说的——就是很绕的——“Context is everything, everything is context”,它一定需要一套 System 2 来适配它,也需要一套软件和产品架构来适配它。去做大模型做不到吗?
王冠
去做大模型当然也可以做啊,就像 Anthropic,它也可以去做 Claude Code。
张小珺
对呀。这就是下面我想问你的:你怎么看 Claude 和 Claude Code?
王冠
这其实是一个很必然的事情。到今天来讲,我们不应该再去区分所谓模型公司和应用公司。
模型公司已经都开始做产品了。曾经它们是不做产品的技术公司,我们可以这么去看,对吧?但是现在所有模型公司都有自己的产品。
今天的应用公司,我们也不应该只把它们看成所谓的壳,或者软件公司、App 公司,而是还没有开始去做自己模型的公司。就像 Cursor,它其实一直在做自己的模型,只是它的速度可能没有那么快,但是它的体量和资源已经足够支撑它去做一个自己的 coding 基座模型了。
而且只有当它把这个基座模型掌握在自己手里的时候,才能够真正地产生利润,因为它的成本就可控了,它的成本是在自己手里掌握的。
张小珺
这句话我没听懂。因为你可以去优化它,那用别人的模型不是我的成本更低吗?
王冠
但是你没有办法优化 Claude。
张小珺
你没有办法去优化 Claude。但是从成本的角度来讲,它确实更低。你说要优化 Claude,是从技术壁垒的角度讲?
王冠
不是,是从两个层面:一个层面是效果,另外一个层面是成本。
效果是什么呢?就是跟周围一些 founder 去聊,大家其实都是做某个特定领域的。很多人都会遇到这样的问题:在调用基座模型的时候,探索到它们的能力边界,这个问题它就做不好了。
但这个时候,我们的解决方案只能在 System 2 的层面去做。我们只能去调 prompt,要么我就放弃,我不要调了,就这样吧;它能做到什么样就这样。接受不了,我就不要这个能力了,不要这个效果了。
张小珺
你只能在它的模型能力基础上调。
王冠
是的。
张小珺
嗯。
王冠
是的,是的。所以大家未来一定会越来越多地遇到能力边界。为什么?因为我们是在探索一个特定的问题,而基座模型是 general 的。
模型的参数量,就跟人脑子里面有多少神经元一样,它是固定的,所以它的能力一定会分配到不同的任务上。当然不同的任务之间,有的是互相促进的,但是也有的是互斥的。一个能力好,另外一个能力 maybe 就差了。
一个以通用为目标的基座模型,和一个以具体场景为目标的应用,它们在能力上的需求一定是不同的。所以从效果上来讲,应用公司一定会越来越多地遇到模型能力边界的问题。
张小珺
那这个时候,为了自己的发展,你一定会需要去优化这个结果。比如你们可能会尝试去找国内的基座模型厂商,把你们的场景变成 evaluation,然后变成一些种子数据,让他们基于你们的场景去训模型。
王冠
那这个是怎么讲呢?我们把这些模型厂商看成是我们自己的模型部门。
张小珺
但是,他给你们训的模型,也可以给别人用,对不对?
王冠
当然,因为这个数据已经训进去了。但是对我们来说,它一定是天然更适配我的场景的。至少我应该是更知道怎么去用这个能力的人,对吧?
这其实是现在这个时间点我们不得不去做的一个取舍。因为我们没有钱和卡去训自己的模型,这个是效果上的必要性。
然后从成本上来说,你刚才说调用 Claude,其实现在算来是更划算的,是因为他们已经有了规模优势。它有足够好的 AI 算力基础设施,而且它的调用量越多,就越能够去做各种削峰填谷,整体成本就会降下来。
这件事情,其实是因为现在单个垂直场景的商业价值还没有发挥到那么大。比如 coding 这个领域,对于 Cursor 来讲,它已经有这么高的 ARR,已经证明了这件事情的商业价值;它也融到了足够多的钱,就一定会去训自己的模型。
它可以走当年基座模型走的那条路:我训一个更好的自己的模型,并且有自己的算力集群,也能够去做各种各样的成本优化。
所以从效果和成本上来说,如果一个应用公司的场景未来能够变成一个很大的生意,那么一方面,如果它是个很大的生意,你一定会遇到基座模型厂商来做同类型的事情,对吧?
张小珺
对。
王冠
那这就会让你必须去训自己的模型。
张小珺
对啊,因为原本你们从上下游变成竞争对手了。
王冠
对。另一方面,在发展的过程中,从效果上,以及为了更有效地优化自己的成本、真正获得利润,你也必须得去做自己的模型。
张小珺
模型公司会去做产品,产品公司会去做模型,这个我能理解。那你觉得,当他们共同面对一个非常有商业潜力的场景时,谁能赢呢?比如 Anthropic 和 Google 的?
如果你们的场景是一个非常有商业价值的场景,那肯定巨头会下场,模型公司会下场,对不对?都会争夺这个领域。但是你们也会同时做自己的模型,到时候肯定会更有资源、更有钱,也有算力,那谁能赢呢?
王冠
这个影响因素就会很多了。我们刚才讲了,有目标的差异、路径的差异、起点的差异,那最后可能还有很多影响因素。
比如说之前我们聊过的这种事情,对吧?指不定哪一天某一个公司的组织架构就崩了,它被收购了,或者 anyway,就是有很多影响因素。这就不是一个单纯的业务问题了。
因为当其他所有的因素都趋同的时候,大家目标都很明确了,都是做那件事情;大家的资源可能也很趋同,都是这些资源。那还能比拼什么呢?比拼人才密度,比拼决策速度。
或者比如说,张一鸣早年接受采访的时候说,最后拼的是什么?最后拼的是大家对某一件事情的认知差异。可能就是这些东西了。
张小珺
但是互联网时代不像今天这么需要算力、需要卡、需要钱,它的资源损耗量远远不如今天。所以你觉得,应用公司的优势会是什么?当有一天商业价值足够大,要去跟模型公司和大厂竞争的时候?
王冠
其实还是刚才提到的那些点。因为对应用公司来讲,现在这个阶段唯一的优势就是速度。
速度是说,你和对手的距离,随着时间的变化是在变大还是变小。至少在今天这个时间点,每一个应用公司在一张地图上面,如果有一个目标,它应该和大厂或者基座模型的位置至少是有一段距离差的,而且它应该是领先的才对。
不能说一个应用公司要实现那个目标,其实它的起点低于某一个基座模型厂商。
张小珺
你说的起点,是起步的时间还是什么?
王冠
包括起步时间,包括业务状态,也包括刚才提到的,你到底是以一个什么样的方式开始做这个产品。这些都会决定你的起点。
张小珺
嗯。
王冠
那它意味着什么呢?当你的位置有一个距离差的时候,剩下的事情就变成保持或者扩大这个距离差。所以就会转化成这个问题。
张小珺
今天的模型能力对你们来说足够吗?你觉得模型能力的 scaling law 有放缓吗?
王冠
你说多模态的模型吗?
张小珺
视频这个场景吧。
王冠
还是刚才说的那个点:我们认为今天的视频模型或者多模态模型,处于比较早期的一个状态。但是这不代表它没有商业价值。
张小珺
对,这个我认可。只是说,今天的商业价值其实是在这个技术非常早期的阶段,未来它应该释放出比今天大非常多的商业价值才对。
王冠
所以回到你的问题,今天的能力对我们来说是否足够?其实我们没有办法去说它够或者不够,因为我们只能在已有的技术范围之下去做产品,然后产生商业价值。
只能说,如果用户需要的、能够产生商业价值的那个效果是某一个水平,而模型能力还达不到,那我们就需要通过 System 2 的部分去补全这部分价值。
但我们补全这部分价值所产生的成本,和用户愿意为此支付的费用,到底是一个赚钱的状态还是亏钱的状态,关键问题其实是这个。
因为我们没得选。基座模型的能力今天就是在这里,它在变化,我们也看到它在变化,但是这件事情我们既不能控制,也着急不了。不要去做模型能力边界之外的事情,今天只能这样。
张小珺
2025 年大家都会说是 AI Agent 的元年,或者产品爆发的元年。但是已经到 11 月份了,好像进度不如我们年初时的预期。你觉得卡点在哪里?你有觉得时间线是在往后延迟吗?
王冠
我其实倒没有这么觉得。因为已经有不少产品证明了自己有赚钱的能力,对吧?包括 coding agent、Manus,还有 Lovable,它们在不同的模态、不同的工作场景上,都证明了是可以赚到钱的。
张小珺
所以我并不会觉得说低于预期。很多时候,是不是产品公司证明自己挣钱的能力比模型公司快?
王冠
倒也不是。我说已经被证明,是说 agent 这种方式进入某一个商业问题,它有价值,这件事情是可以被证明的。
不管是用所谓“壳”的方式、workflow 的方式,还是所谓 agent 的方式,它都能够产生价值,它是有效的。
张小珺
那问题其实在于,大家可能觉得不够多,没有出现“勃勃生机、万物竞发”的这么一个状态,对吧?
王冠
你觉得有没有?
张小珺
我感觉没有。
王冠
因为还有很多公司处在一种静水流深的状态。
张小珺
静水深流,还是静水流深?
王冠
静水流深,静水流深的状态。
因为不同的领域,对于模型能力的要求,包括对这个领域 know-how 的梳理、把它变成 System 2,进度是不一样的。比如语言,也就是所谓文字这件事情,很显然是模型能力最成熟的。
张小珺
所以不要去跟大模型公司卷了吧,但是其实也可以去做,也有一些更垂直的场景能够赚到钱,对吧?
比如 Harvey,比如 OpenEvidence,在法律和医疗这些场景里,它们也能够赚到钱。它们的生意也很大,法律跟医疗肯定是很大的赛道,模型厂商也不是不知道,对吧?
但是比如你看 OpenEvidence 为什么能做得好,是因为它有更好的 System 2 的 context,做了大量专库,数据质量更高。
王冠
所以还是回到刚才那个问题:每一个领域的条件都是不一样的。它对于模型能力的要求、今天模型能力的 ready 程度,包括这个领域要去梳理它的 know-how,比如建立所谓专库,再叠加上团队状态、资源,这些东西都不一样。
但是这条路是有效的。这条路是指,以模型为核心的 agent 也好、workflow 也好,去解决某一个商业问题,产生用户愿意买单的经济商品。这件事情是完全被验证的。
张小珺
刚才我们说了模型公司和产品公司的边界问题,其实边界是越来越模糊的,大家都会相互渗透。那通用 Agent 公司和垂类 Agent 公司的边界会在哪里?
王冠
我觉得其实很难去说今天有什么通用 Agent 公司。垂直的大家很好理解,但是通用 Agent 这种公司似乎也不是真正无所不能、通用的,对吧?
可能是有更多的垂直任务,或者说垂直领域的问题,它们能够去解决,但是这个问题领域也不是无限的。
我会认为,今天的通用和垂直,很像这么一个诗里描述的状态,叫“千江有水千江月,万里无云万里天”。
“千江有水千江月”,其实你可以说是我们这样的垂直——其实我特别不喜欢用“Agent”的这个词。
张小珺
为什么?
王冠
因为你不会去说一个产品是互联网产品,是一个移动互联网 App 产品。你会说这是百度、这是今日头条、这是抖音,你不会说它是一个移动互联网视频。
张小珺
那我可以说它是一个 App,对吧?Agent 不是一个类似于 App 的概念吗?
王冠
我觉得 Agent 是一个技术。它最终会被内化到所有的产品里面。到那个时候,大家不会去说你是一个什么什么 Agent,应该就是说它的场景,或者就是这个产品的名字。
就像今天我们不会说短视频 App,不会这么去描述抖音和 TikTok。
张小珺
那是因为它这个品类占据了这个名字,是吗?
王冠
是啊,但其实也有其他类似的产品。只是我会认为,Agent 是一种技术。
张小珺
嗯嗯,对对对。回到刚才那个问题。
王冠
对,回到刚才那个问题。像我们这样去解决特定领域问题的公司,其实里面有很多不同的 agent。麻雀虽小,但是五脏俱全,里面有很多解决不同问题的 agent,还有各种各样的 tools。
所以这就是所谓“千江有水千江月”:每一条河里面,其实都会有自己的智慧、自己的数据,以及自己的商业价值。
然后通用 Agent 的竞争就是“万里无云万里天”了,只能有一片天。你是一个通用 Agent,我也是一个通用 Agent,那么最后一定只有一个通用 Agent。
张小珺
嗯嗯。
王冠
但我觉得,这其实只是今天发展到特定时间段的一个很特殊的过渡状态。因为垂直的这些 agent,也会慢慢延伸自己的边界。
比如视频,视频很容易降维成为其他模态。什么意思?比如视频,如果你把每一个画面都想象成一张图片,把它变成图片,那么这个图片上面可以生成很好、很结构化、很漂亮的图和文字,甚至还可以有图层。
它其实就可以降维成为 PPT。只不过这个 PPT 不是 Office 里面那样的东西,它可能有更好的展示效果,但是你可能没有办法编辑里面具体的元素。
不过今天来看,编辑这件事情会变得越来越不那么重要,因为生产出来的东西质量会越来越好。
所以今天在解决某个垂直问题的这些应用、这些公司,它的能力边界也会慢慢拓展。对于通用的这些公司来讲,大家解决的问题一方面会扩大,另一方面也需要慢慢做深。
因为每一个问题,用户最终都是为效果买单的,是为效果和成本买单的。我付出了多少钱,一定希望拿到值得这个钱,甚至高于这个钱的回报才对。所以能够完成的任务、能够产生的东西,质量应该越来越好。
通用 AI 公司也需要把特定的、有价值的任务做得更深。原本范围窄的公司在扩大自己的范围,原本范围宽的公司要去做深自己的范围。所以最终,我觉得大家可能会殊途同归。
最终还是会回到最朴实的道理:你到底在生产什么?是在生产视频,还是在生产音乐,还是在生产 PPT?你生产的这些内容,用户需要花什么样的代价,来得到什么样的效果?
所以它就会变成“海上生明月,天涯共此时”。
张小珺
最爱念诗的王冠。你之前说过一句话,我印象很深:你说 AI 时代的公司最终都是生成系统公司。这个能不能解释一下?
王冠
8. 生成系统重构内容
生成系统,其实是我们内部很早就会讲的一个词。从公司成立的第一天开始,我们就会和所有入职的同事讲“生成系统”。
张小珺
生成系统。
王冠
对。这个其实跟姚顺雨那期访谈很有共鸣。看完之后会非常有共鸣。他可能是更多从算法的角度去思考,而我们可能更多是在应用端做实践。
那什么是生成系统呢?你可以类比推荐系统。推荐系统是一种方法,是一种技术方法。用这种技术方法,你可以去推荐各种东西。它是一种通过对信息、商品和用户偏好进行算法计算,来进行关联的技术方法。
那你到底推荐的是什么,这件事情会有很多种可能。你可以推荐文章,它就变成了今日头条;你可以推荐视频,它就变成了抖音;你推荐段子,它就变成了皮皮虾和内涵段子。
所以生成系统首先对我们来说,是一种工作方法。它可以生成各种各样的东西。
今天我们做的可能是视频,但我们不是所谓 generate 视频,而是包含 generate 的一个更广义的处理。未来也可以用生成系统去做其他事情。
那生成系统里面包含什么?我们认为它由 3 个模块构成。
第一个环节,就是刚才讲的:整个视频系统都是 System 2 的部分。我们在做的 System 2,就是一个生成系统。
它包含刚才提到的 DSL,也就是你的生成系统所要解决的那个问题。比如视频所对应的底层 DSL:视频到底该如何被准确地表达出来,视频的制作方法该如何被准确地表达出来。
从 DSL 出发,其实刚才都已经聊过了。你可以从 DSL 往上构建整个 context 的部分。Context 的范围会更广。
比如之前大家会有 Agent 和 Workflow 之争。Agent 会觉得 Workflow 比较 low,没有技术含量;Workflow 会说 Agent 不可控,成本太高。
其实在我们内部不会做这样的划分。因为刚才已经提过,不管是 Agent 的方式还是 Workflow 的方式,本质上都是产生更多有效的 context,产生更多有效的 token,让 System 1 的效果更好。
这里面也包括领域 know-how 的专库。这些本质上都是刚才讲的 context。
这些 context 解决什么问题呢?其实在 context 之上,我们还有一层抽象。我们会设想,为什么需要这么多 context,为什么需要有效的 context?本质上是在降低两种熵。
一种熵是用户意图的熵。比如我很简单地说一句指令:“我要一个什么什么样的报告。”这是一个很模糊的指令,它代表的信息范围非常大。
在没有推理模型之前,模型直接写出来的内容可能不好;或者模型会反复跟你确认:“你到底要写什么领域?需要什么样的结构?”有的模型可能会这么做。
推理模型其实就是自动补上了这些 context。它有一个非常长的推理过程,提供了有效的 context,结果就会变好。所以,用户的意图,其实是通过这些 context 来把熵降下来。
另外还有一种熵,叫行动的熵。你的系统或者智能体要去行动、用工具、做 planning,对吧?它也需要更明确的信息,来让它做得更准确。
张小珺
为什么要降低它们的熵?
王冠
因为它要做的事情,效果要足够可控、足够好。一定意味着它要做的事情更明确,要精确、能够控制。你的模糊指令,要能够转化成精确行动的指令,并且这两件事情要能够很好地映射起来。
张小珺
这也是你们做的事情,对吧?在 System 2 上面做。
王冠
对,都是在 context 这个范围之内。所有的 context,一方面是在降低用户意图的熵,另外一个作用,是降低智能体活动时行动的熵。
第三部分就是刚才也提到的 environment。
Environment 直观看上去,是前面用户活动的软件界面,但是它可能和之前的软件有很大不同。这个界面里面不光有人在活动,其实也有智能体在活动,甚至智能体活动的占比会越来越大。
刚才讲了一个很模糊的指令,它可能对应很多工作,但这些工作并不是人在活动,而是智能体在活动。
要实现这件事情,就意味着你的指令所转化成的那些行动,在软件里面要有对应的能力能够对上。
比如我要用 10 个 tool,这些 tool 所对应的操作,如果你要形成标注的能力,人也能够介入这件事情。它可能对应按钮,也可能对应各种各样的 GUI 操作。
这些 GUI 操作依然会存在,但是主要使用者可能不是人,而是智能体。人是通过这些 GUI 去进行校验,或者进行微调。
并且,既然叫 environment、不叫 software,就意味着它一定不是简单地记录这些活动产生的 log。第一,它产生的数据一定是可被学习的。
刚才讲了,environment 里面一定要能够和你整个工作方法映射上。这个可能还得多讲一点,因为它跟你刚才讲的事情关联上了。
比如你写的文章比别人写得好,你说你有一些工作理由、工作方法。这个工作方法,我们依然可以类比做菜。
今天的一些菜谱,尤其是中文菜谱,非常不精确,比如“盐少许”。这个东西拿给另外一个人,他做出来的味道一定不一样。
但是如果我把做菜的整个 environment 搭建得非常完善,完善到这个厨师在第几分钟开始、动作是什么、下油时手臂的角度是什么、油此时的温度是多少、锅的温度是多少,这些东西在 environment 里面都有明确的信息,并且可以被记录下来,也可以被另外一个系统理解和执行。
那就意味着,你可以把它的 recipe 非常无损地传递出去。
所以这是 environment 里面非常重要的一个环节:它必须有一个编辑器。这个编辑器可能会越来越复杂,但它更多不是给人使用的。
当然,还有更重要的一点:一个 environment 里面一定需要有一个 reward function。
刚才我们说,它要有筛选有效数据的能力。这件事情本质上就是一个 reward 的概念。比如对于用户来说,你不希望你的 recipe 被别人拿走,但是你希望自己用的时候它越来越好,那这里就意味着,模型第一要能够记录下来;第二要有理解和筛选的能力,把好的信息留下来,把你的好方法记录下来。
所以它需要评价,需要 reward。
这 3 个部分,就是 environment。整个生成系统从 DSL 出发,去构建所有跟 context 相关的事情,最终以一个 environment 呈现给用户和智能体。整套东西,我们称为生成系统。
张小珺
我们这里讨论的是怎么搭建一个特定领域的 AI 生成系统。那你怎么评价一个好的视频呢?
王冠
好问题。这其实是一个非常典型的开放域问题。一个视频好不好,其实可以从用户行为中抽象出来。
核心就是用户行为。你可以抽象出哪些视频是符合要求的。比如刚才讲了,很多活动是 agent 来做的。Agent 做完之后,对于一个用户来说,他没有做那么多修改,那意味着对于这个水平的用户来说,这次活动是有效的。
那这种方法对于这个用户来说,就应该被强化。
但是这里会区分人。评判的方法是一样的,但是最后得到的结果不一样。
对于我们来说,前面也讲过,更有效地提升整个系统效果的方式,是做更专业的标注。我自己去做,把这些 know-how、这些方法放到整个系统里面,让所有用户都能够被动地提升自己的能力。
所以标注环节会更多地发生在我们内部。
张小珺
就像 Midjourney,Midjourney 内部有所谓艺术家这样的角色。你们有吗?
王冠
当然有。
张小珺
叫什么?也叫艺术家吗?
王冠
我们还没有名字。
张小珺
哦。
王冠
我们就叫 PM。
张小珺
是 PM 来决定审美,对吧?
王冠
PM 和那些有视频审美、制作能力的人一起。
张小珺
你们的审美、制作能力是什么样的人?他认为就是那些很会剪视频的人。你们是招进来的吗?
王冠
有外部合作的,也会有内部的。
张小珺
比如说,你们要做的视频,是要为什么场景服务的?是为哪一类人?比如给 B 站 UP 主服务,还是 YouTube?这可能是一类。还是导演?它的人群是什么样的?
王冠
因为视频的内容会非常广,有长的、有短的,有娱乐的、有严肃的,我们其实不会这么分。
我们会把视频认为是人对于世界的一种信息化构建。比如物理世界,我用手机把它构建出来,它就变成摄像头拍到的视频。这是物理世界的视频。
我们面向的是另外一类视频。从大的类型上来说,我们面向的是理念世界的视频。
张小珺
梦里什么都有,对吧?
王冠
对。理念世界是一个比物理世界更广阔的世界,不是用手机、不是用摄像头能够拍出来的。
张小珺
因为不是大自然的视频,就叫物理世界吧。
王冠
对,不是物理世界的视频,或者说不是用摄像头能够解决的视频。
张小珺
为什么选这个角度?为什么从这里切入?
王冠
因为物理视频已经做得足够好了。物理世界的视频已经有那么多摄像头遍布在各种地方,尤其是有手机,每个人都可以把某一部分物理世界变成一个视频。
这个内容已经建设得足够好了。今天每个人有个手机就能做了。短视频生态就是以物理世界的视频为核心的。
而理念世界的视频,我们认为还处在非常早期的阶段。
理念世界的视频像什么呢?比如你要传递一个知识、传递某种思想,或者把你们的文章变成一个视频。
一种方式是你自己出来口播,这是一个方式。另一种方式是讲一个具体的知识点、一个具体的理论,它有对应的公式、文字动效和数字动效。
这和你真人出镜去说这件事是不一样的,它代表的是你的理念的视频化。
所以从大类上来说,我们是去做理念视频。原因在于,我们认为理念视频还有很大的空间。
我们内部会把它称为,要在视频世界中去构建图书馆、歌剧院和大教堂。这其实是我们内容品类的划分,代表知识类内容、艺术类内容,以及跟精神相关的内容。
张小珺
与之对应的是什么?比如现在的视频世界里面,可能更多的是我们称为夜店、跟多巴胺相关的内容,比如芒果卫视的娱乐内容。
王冠
对,娱乐内容,帅哥美女跳舞。
张小珺
还有什么?上一个时代证明这类内容是更有商业价值的。为什么要去做精神类的内容?它商业价值足够大吗?大家变得更爱学习了吗?
王冠
在 AI 时代,不是。那一定不是。
几个点吧。一个点是,刚才也提到,来自物理世界的视频已经足够丰裕了,它的供给足够充分。
它有夜店,有生活广场。你说的八卦,我们其实会把它放在所谓广场的范畴。然后可能还有超市,各种卖货的。
现在的视频里有很多这样的内容,它其实已经把物理世界可能覆盖的、有价值的范围,基本都覆盖掉了。
而理念世界,第一,它的阶段会更早,因为成本会更高。你拍自己跳舞、拍自己讲一段话,肯定比写一篇有深度的文章,再把它做成视频容易。后者的门槛更高,所以它现在处于更早期的阶段。
第二,理念世界会有更多想象空间。之前因为视频生产能力不够,或者没有今天这样的生成技术,很多东西不容易视频化,或者没有办法用视频的方式产生价值。
比如我们有一个客户,他们是给别人做视频的。他们有一个客户做潮玩。潮玩天然是非常适合视频的场景,因为你可以把那些潮玩变成视频化的故事,变成视频化的各种创意场景。
对于喜欢潮流的人来说,这是很有消费价值的东西。但是在没有很好的生产能力之前,这不会是一门好生意,因为做那样一个视频价格很高。
我们知道这件事,是因为这个客户在使用我们产品的过程中,把这一类潮玩在小红书上的内容包圆了。你去看小红书上跟这个潮玩相关的 AI 视频,全都是他们做的。
因为生产效率足够高,成本足够低,它就可以变成一种新的内容方式。
张小珺
因为买点是用你们的产品,对吧?
王冠
对。因为它把成本降下来、生产速度提上来之后,就会变成一种新的内容方式。内容的量也很好,因为确实有很多人喜欢这个潮玩的形象。
你想,在之前,如果这种视频需要以周为单位制作,可能是几千甚至上万的制作成本,那这件事情就不会发生。
比如苹果、耐克,它们做的那种非常高大上的品牌广告,之前只有它们这样的公司可能一年做几条,每一条几十万美金,甚至上百万美金。当然它们的质量一定更好,但有很多人也需要用这样的方式表达自己的产品。
在之前的生产力情况下,这件事情做不到。今天如果生产成本降下来,它就有可能变成一门新的生意。
这都属于理念世界的东西,因为它来自人们对这件事情的想象和理解,然后把它视频化。今天它就有可能变成一个新的品类,变成一种新的内容类型。
所以刚才讲的就是,理念世界随着生产力的发展,会有更多想象空间,会出现新的内容形式。
生产力决定生产关系。现在生产力发生了巨大变化,从生产关系,到最终和用户最直接相关的消费部分,一定都会连带发生变化。
张小珺
你们这个生产关系是什么样的?你的客户给你付钱,你们的商业模式是什么样的?
王冠
我们现在还没有产生新的生产关系。我们现在依然是以工具的方式,提供给要制作视频的人。
张小珺
版权属于谁?
王冠
版权属于制作的人。
张小珺
哦,那当然。
王冠
嗯嗯。
张小珺
现在试用的人多吗?
王冠
我们的正式版产品其实还没有上线。
之前 5 月份的时候,有一个做了一半的产品,我们把它静默上线了。那个静默上线的产品,其实已经有不少用户产生了比较大的商业价值。
我们前两天才知道,可能具体的账号我就不说了,是 B 站和视频号上非常大的一个 AI 内容博主。他的播放量很大,每一条视频可能都是几十万、上百万的播放。
张小珺
谁呀?
王冠
这个 AI 视频博主不多的。
张小珺
他做 AI 内容,AI 内容博主不多。
王冠
对。前两天我们才知道,他其实是我们的用户。他的生产环节会用到我们的产品。
因为我们现在的产品还不是真正能做到端到端、完全在产品里面闭环,可能还有一些其他东西需要处理。他们依然会用剪映、达芬奇去做。
而且我们现在只能用 Google 账号,需要海外付费方式。所以他们把周围能借的所有 Google 账号都借了一遍,最后把我们每一档的积分包都买完了。
因为我们没有所谓流量包的概念,想买多少积分就买多少积分。之前我们压根没有做这个功能。
他们把能用的账号全部用完,把所有账号都充到最满的状态之后,发现积分还是不够用,就联系到了我们。我们才知道原来他们一直在用。
张小珺
从你们上一个半成品到现在这个成品,你觉得中间的迭代是什么?就是 12 月份可能即将发布的产品。
王冠
就是刚才讲的,整个生成系统这套东西完整地构建起来。
张小珺
对。所以你们之前为什么发半成品呢?
王冠
因为那个时间点的产品,我们也会提前给一些客户和用户试用。每一版产品都会给用户和客户试用。
那个时候其实已经能够感觉到它有很大的商业价值了。发出来之后,也确实证明了这一点。
只不过原本在背后、我们刚才讲的这些 DSL,以及整个 context 系统,搭建得没有那么完善,有很多功能没有办法暴露给用户。
剩下的时间,我们其实是在完善这些东西。
张小珺
刚才我们讲到了信息商品。你觉得在整个信息商品的链条里,从生产端、平台端到消费者端,你刚才讲的一点是,权力重心会向消费者端渗透。那其他环节你觉得会带来什么变化?比如平台会变化吗?会有新的平台出现吗?你怎么看 System 2?
王冠
首先一定会有新的平台出现。
张小珺
那这个新的平台,是又有真人创作者,又有 AI 内容的平台,还是只有 AI 内容的平台?你有没有一些构想?
王冠
首先,消费端的事情我们现在没有考虑那么多。刚才讲到了这个原因,我们还早。
张小珺
对,现在这个产品对于你们来说可能太早。
王冠
对,大家会有不同判断,无所谓对错。只是我们认为现在消费端可能有点早,所以不太会去想很多消费端的形态会是什么样。
我们现在有一个能够推演到的终局。刚才讲到的无限阅读,可能就是那个终局。
但这个终局我相信很多团队都能看得到,自己内部肯定也在讲,也看到了这样的东西,也在为这个目标努力。
不过这里可能有一个大家遗漏掉的关键问题:传统的、平台依托双边关系构造的整个模式,会发生巨大变化。
为什么?刚才讲了,之前为什么需要双边关系,是因为生产端永远需要人。
而我们刚才所有的推演已经说明,生产端需要的人数会越来越少,需要人去做的操作或者努力会越来越少。甚至如果搭建好足够完善的 environment,人的生产方法也会被越来越精确地记录下来,未来甚至可以被 IL 出来。
那未来会变成什么?未来可能就是,所谓双边关系中的生产端,完全自动化掉,或者变成一个单一供给方。
张小珺
单一供给方指的是某个公司?
王冠
对,一个生产平台。这个生产平台并不是完全没有人,而是一个生产平台。
比如字节这个公司,它是一个生成系统,而不是一个推荐算法系统。你可以想象,目前所有的生产者都是这个公司的员工。
张小珺
以抖音这个系统为例,对吧?所有生产者其实都应该是这个生产平台的员工。
王冠
对。差别是什么呢?它不需要那么多人。
张小珺
那还需要人吗?我核心的问题还是,还需要创作者吗?
王冠
需要创作者,但是不需要那么多创作者。创作者会有新的身份。
会有两种创作者。一种创作者属于这个生产平台里面的员工或者合作方,他们其实是金字塔尖的那批人。他们永远会在这个平台能力之上,能够提供增量数据,提供额外的智慧。
张小珺
这一波还需要真人创作者。你可以想象成每个月向 OpenAI 付 200 美元的那波人。
王冠
对,或者之前 OpenAI 公布过他们的用量。就是确实有人可以把这个系统用到极致,能够把系统发挥出的价值,做到和其他人不一样。
这是生产端创作者的角色。你可以把他们称为艺术家群体。
张小珺
他们和数据标注员是一回事吗?
王冠
也可能不是。因为刚才讲了,所有人本质上都是在标注,只不过你标注的数据作用是什么。
有的数据质量低,但可能作为预训练数据;数据质量高,就可以作为 SFT 数据,也可以作为对齐数据。
所以大家本质上都是标注员。互联网时代,所有人都是标注员。
我们想强调的是,这一批人的特点是有足够强的主观能动性,所以他们永远可以在工具和系统之上做出更好的东西。
那系统对于他们来说是什么?是能力的放大器。整个系统其实是去 scale 最强的人,把最强的人复制一万份、十万份,让少数人产生海量内容。
这是一类创作者的角色。
还有另外一类创作者,直接发生在消费端。有一个概念叫 prosumer,也就是产销者。他生产的同时就是在消费。
生产本身是有价值的。“劳动最光荣”这件事情,它就是原本字面的意思。比如你写文章的过程,会进入心流状态,你会觉得这个过程对你来说也是有价值的,最后产生这篇文章对你来说也是有价值的。
它是你的作品,你就是在消费它。
写毛笔字也是这样。退休老干部在家买很贵的笔墨纸砚,然后去写毛笔字,生产的过程本身对他来说就有消费价值。
张小珺
今天创作者都是这样吗?
王冠
平台上的创作者,也有不是的。有些人纯粹是为了获得更高流量、获得更多用户注意力。
我相信你刷短视频比较少。我们因为工作原因,需要大量刷短视频,去看现在平台上是什么样的东西。
你会发现,因为有推荐算法、有这样一套分配机制,大家从商业目的出发,一定会去做一件事情,叫“撞库”:我去撞你的推荐机制。
张小珺
能举一个例子吗?
王冠
有一类视频,就是给你拍一个很有想象空间的镜头,比如远处的一座山、一个山的远景,然后突然把镜头拉近,但是其实什么都没有。
它会让你觉得,那里是不是有一个很奇怪的东西,只是我没有看清。它很短,可能只有几秒钟,总共两三秒。
你第一次没有看清,它就会循环播放,可能你不知不觉就看了很多遍。它的完播率就高。
张小珺
它不光是完播率,还有重复看。
王冠
对,所以它的量就会很大。
你看短视频有很多方法论,比如黄金 3 秒,怎么在中间设置各种 hook,增加能够播放到多少秒。它永远不会把最吸引你的那个问题的答案一开始就告诉你,前面会啰嗦一大堆废话。
本质上是为了撞整个推荐算法的库,撞到匹配机制。所以它并不是刚才你说的产销逻辑,并不是我在生产过程中满足了自己的消费。
它是为了在流量池子里、在所谓注意力经济里获得更多收益。
张小珺
That makes sense。
王冠
所以产销者的逻辑不是这样的。产销者的逻辑是,当我看到这个内容,比如我去做二创,或者基于某一个主题有自己的想法,把它变成一个内容。
这个内容对于别人来说有没有价值,可能不那么重要。它对我自己的价值已经足够了。
但这里有一个很关键的问题,就是 timing。对于产销者来说,他自产自销的价值和生产成本之间,一定要满足消费价值大于生产成本才可以。
今天这个生产成本对于视频来说非常高,但是在一些其他模态里面其实已经发生了,比如文字和图片。
比如大家在 chatbot 里面做一些思想实验,调研一个问题,它产生了一个很好的回答,做 Deep Research,出来一个很好的报告。你并不是为了拿出去赚钱,自己看完之后,它对你来说就已经有价值了,这就是一种产销过程。
图片也是这样。很多图片社区里,大家画图是给自己看的。
这之前是一门生意,因为有很多漫画很小众,没有那么多周边,也没有那么多图包。有人要画同人、画图包,原本会有人去买。
但今天这门生意已经消失了。因为你喜欢这个角色、喜欢这个漫画,就可以在图片社区里自己生成你想象中的那些图。不需要拿出去给别人消费,对自己来说就已经有消费价值了。
所以这些人也是创作者,只是创作目标不一样了。他创作的目标本身是为了自己消费,但对于整个系统和平台来说,他提供了新的内容。
张小珺
老干部在家里写了一幅字。你直接说吧,这个系统干掉了哪些现存的创作者?
王冠
它并没有干掉任何人。因为在产销者这一块,我们认为它的范围是扩大的,所有人都可以参与生产。
今天已经实现了 UGC,UGC 就是在讲这件事。UGC 解决不了生产能力的问题,但是它参与生产,进一步降低了制作门槛,进一步降低了生产门槛,让 UGC 更广大了。
张小珺
对,是的。那这一部分创作者算是生成系统公司的员工吗?就是这个系统,今天不是吗?今天就是平台和创作者的关系。
王冠
今天肯定不是。但是未来这个商业模式是什么,其实是我们没有想清楚,或者说现在还没有仔细去想的问题。
张小珺
那这个 AI 生成系统和现在这些 AI 推荐系统,你觉得本质区别是什么?
王冠
没有中间商赚差价。
张小珺
现在中间商是谁?
王冠
其实所有互联网平台都是中间商。推荐引擎也是中间商,搜索引擎也是中间商,淘宝这种电商当然也是中间商。
张小珺
对,互联网平台是中间商。这个你不是第一个跟我说的。
王冠
不光会在信息商品上发生,也会在实体商品上发生。
张小珺
所以你是觉得,新的生成系统会替代旧的互联网平台系统?
王冠
我们对它的描述是:原本互联网时代,我们称它为分销平台,它掌管分配和消费,但是通过在分配端和消费端产生的权利来控制生产。
这些平台其实都不是生产端,它们其实在剥削生产端。你做的视频发给平台,你投入成本、付出努力、做出一个内容,发到平台上,但它可能只是作为中间填充物。
张小珺
对,就是你没有得到应有的价值。而且这个分配可能是失效的。什么意思呢?同样一个内容,不同的人去发,流量一定不一样。
我们俩同样发一篇文章,你的流量一定比我发出来的量大。
王冠
你说在微信这个平台吗?
张小珺
各种平台。微信不行,因为它有原创保护,其他人不能重复。
王冠
微信有原创保护,但是视频平台好像是,比如你拍一个视频,我照着你的脚本重拍一遍,我不知道它们对于抄袭有没有保护。这个在视频平台可能比较常见。
张小珺
其实我自己做的视频就被盗过。那个原创保护没什么用,是吧?
王冠
一定有一些方式可以规避。我们现在可能更多是在做一个思想实验。
张小珺
假设我们俩是牛顿和莱布尼茨,大家各自想到了微积分,然后在同一时间发到平台上。牛顿的流量一定会更大,因为他的身份更高,在系统里的权重会更高。
甚至可以再假设,两个人的 user profile 完全一样,在同一时间、同一地点,所有东西都一样,发了同样的内容,流量也会不一样。
这说明什么?说明这套经济分配机制不那么有效。同样的商品,它的价格不一样。
王冠
那生成系统为什么可以做得更好呢?因为没有这个环节了,没有分配这个环节。它的核心价值在于产销。
张小珺
比如我要买东西,它推荐给我什么样的商品,也是一种分配权利,对吧?
王冠
当然,它还是有分配,只是这个分配内化在了新的生产系统里面。
张小珺
如果是生产系统,它没有分配这个环节,是把库存分配的逻辑变成直接下单的逻辑?
王冠
对。对于某一个内容的需求,直接交给生产端,生产端产生一个内容,再直接给到你。
面向的其实是刚才说的产销场景的价值:这个内容对于你自己来说,它的价值就已经兑现了。
张小珺
我打开一个新的平台、新的系统,我要看什么内容,我理解它是更精准的推荐、更智能的推荐。
王冠
没有推荐,只有 generate。
张小珺
哦。
王冠
你看过的内容,都是此时此刻为你 generate 出来的。
张小珺
以内容为例,那生产端的生产者去哪儿了?如果我作为消费者,看到的是生成的东西,只有生成的话,真人创作的内容去哪儿了?
王冠
他们不是去创作内容了,他们是去创作方法。我们讲 recipe。
张小珺
那这对创作者的冲击还是很大的。我认为只创作 recipe 的人是极少数,而且又有多少 recipe 呢?机器一旦学习了以后,就不再需要这个人了。你所谓的艺术家呢?
王冠
这件事情只能说,从逻辑推演来看,它会发生。
第一,这个过程可能会很漫长。第二,这个过程其实不可避免。
就像之前大家在互联网上展示各种各样的内容、写帖子,把自己认为有价值的东西共享出来,其实可能也没有想到,有一天会因为这些数据产生一个智能系统,来替代自己的工作。
最典型的就是代码。
张小珺
我想一想。那比如我要去买一个东西,它给我生成什么?它怎么给我生成一个商品呢?
王冠
它可以直接连接到产线。这件事情我相信应该已经有团队在做了。只不过它不是做非常 general 的商品生产,而是直接让整个产线和前面的需求对上。
张小珺
所以在生产关系上,首先干掉的是中间商?
王冠
当然。中间商任何时候都应该被干掉。
张小珺
移动互联网时代、互联网时代,成长最大的应该都是中间商了。
王冠
这是技术决定的。中间商当然有历史发展特定阶段的重要贡献和价值,但是今天技术又有了新的变化。
而且刚才讲了,权力的过渡一定是不可逆的,一定会越来越向消费端转移。
即使在互联网时代,也会出现拼多多这样的例子。因为它在消费端给了消费者更多权利,所以它能够做得更好。
张小珺
一个很俗的词,叫创作平权。
王冠
对,创作平权。我们其实把它进一步延伸,变得更具象,是什么呢?创作可以变成表达。
语言是每个人都可以使用的。我跟你说话这件事情门槛最低,只要我不是失语,就一定能够用语言表达。
再往下一步是文字。文字对于我们国家来说,基本消灭了文盲。但从全世界人口范围来看,能够读写的人应该只有 70% 左右,还有很多人没有办法写字,门槛就高了起来。
再往下一步,图片表达的人会更少。你要用图片、用图像表达自己。当然有相机之后,这件事情变得相对容易,但刚才讲了,那是物理世界。
你可以把物理世界变成图片来表达,但是理念世界依然很难。你想象中的画面,要用图像表达,今天可能还是比文字更难一些。
声音、音乐就更难。视频至少是现在能够看到的、可能最难的一种形态。你要用视频作为一种表达方式,它非常难。
为什么这件事情有意义?第一,它的发展趋势就应该是这样。因为这种表达方式的发展趋势已经很明显了:我能够传递的信息量越来越高。
视频的信息量会更高,所以一定会朝这个方向发展。
第二,当创作变成表达之后,一定会出现新的产品形态和商业模式。
比如文字。如果你要创作文字,只能通过创作才能产生文字,古代就需要笔墨纸砚,还得会写字,才能创造出文字信息。那个时候,书是非常珍贵的东西。
到今天,它变成一种表达方式,就会有微信。你可以随时随地、很低成本地用文字表达自己,所以就会有微信。
你很难想象,如果产生文字信息必须通过一种创作方式才能得到文字,就不会有微信这样的东西。
对于其他模态也是一样。所有模态的信息量、信息密度越高,成为表达的难度就越大;但是当它能够成为表达的时候,产生的价值也会更大。
张小珺
所以这其实是你们今天在工具端做产品的初心?
王冠
对。让视频有一天也能从一种创作,变成人们能够进行表达的方式。
比如情侣之间原本是写情书来表达爱意。我们经常在网上看到,一个很用心的新郎在婚礼上给新娘做了一个两个人历程的视频,从相识到结婚,中间所有历程都在里面。
大家会觉得好棒,这个新郎很用心,这就是这个模态的价值。
但现在它还是一种创作。未来它应该变成一种更低门槛、每个人随时随刻都能做的表达。
所以至少在当前这个阶段,让视频从创作变成表达,是我们可以做很长一段时间的目标。
在这个过程中,整个工具的能力会越来越好,也意味着至少在当前这套经济逻辑下,使用工具的人应该拥有比其他人更好的收益、更高的效率。
张小珺
新的 AI 产品应该怎么做,你觉得?
王冠
我觉得你这个词,是不是等同于“到底什么是 AI native”?
我们觉得现在的产品都挺 AI native,因为大家都是有了 AI 之后才开始做的产品。只是路径不同,形态不同。
比如现在能够看到的产品形态,能力聚合一定是一类。大模型厂商就不说了,它天然就是模型级产品:从模型能力直接增加一个产品外壳,就变成一个好产品。
我们还会看到能力聚合。在语言模型时代,就会有 Poe。它今天依然在 a16z 的 Top 50 产品榜单里。
其他模态也会有这样的产品,因为聚合天然就是有价值的。
再往下,会有比聚合更进一步的形态:我不光聚合能力,还拥有编辑能力。给用户提供的价值更多了,不光能用各种各样的服务,还可以把这些服务的内容进一步加工和处理。
再往下,就是刚才讲的 agent 也好、workflow 也好。它其实比简单的编辑处理又更进一步,把智能体,也就是 AI worker,引入到系统里面,进一步提效。
所以这些产品形态都是有价值的。今天我们能看到的每一种产品形态,都有 ARR 做得很好的产品,因为它们确实产生了价值。
我们只不过是用一种和大家平行的方式去思考产品形态。刚才说我们要从 DSL、从一套语言的设计出发,这就会做得比较笨重、比较慢一些。
但这可能只是因为它更适合我们团队的基因,以及我们对产品的理解。我觉得并不存在“应该怎么做产品”,只是我们是这么做产品的,同时也看到其他做产品的方式。
不同的做产品方式都有自己的价值,也都有做得非常好的产品。
张小珺
你觉得 AI native 产品的北极星指标应该是什么样?它应该衡量什么?
王冠
这个我只能从我们自己的角度出发。
张小珺
从 Mydio 的角度,对吧?
王冠
是的,或者从我们未来去做所有产品的指标出发。
首先,做产品有商业价值,这是毫无疑问的。做一个公司、做一个组织,哪怕是产品工作室,也一定要产生商业价值。这是最 basic 的一个标准。
但在这之上,我们会想用整个系统的智慧程度来衡量这件事情。
张小珺
这听上去有点奇怪。你们是一个做应用的公司,怎么会有智慧?
王冠
我们不这么认为。因为我们会有一个生成系统,会有一个 System 2,这就意味着这套系统有自动生产能力。
自动生产能力一定有评价标准:你能做出 60 分的内容,还是 70 分的内容。这个东西其实可以判断。
它不光是对内容质量的主观判断,也可以来自用户在平台上产生的行为,比如导出率,或者一个人愿意付很多钱。
至少会有一个阶段,判断生产端产品和之前的 SaaS 产品不一样的地方:你能够让特定的、少数的用户产生海量营收。
少量用户产生相同营收,比海量用户产生相同营收更好。
张小珺
比如用 3 个用户产生 100 万营收,和用 10 万用户产生 100 万营收,对于你们公司来说,你们会更看重前者。为什么?
王冠
因为刚才已经提到了,我们认为生成系统的价值是去 scale 最强的人。
张小珺
哦。
王冠
因为更强的人也会让系统变得更强。
张小珺
对。依然是一个很深刻的说法,而且我相信大部分人不会这么想。现在的工具产品都把价格抬高,我觉得原因是这样,不是因为 token 贵,是因为算力贵?
王冠
当然模型是更贵的。价格背后对应的一定是更好的模型、更完善的 System 2。
但是从刚才讲的、让整个系统变得更好的角度来说,一定是更强的人对你的价值更大。
这绝不代表我们不做 ARR,也不代表我们不会做收入。只要产品真正能够帮用户解决问题,定价合理,收入就是一件水到渠成的事情。
提高整个系统的智慧程度,也会天然影响未来能够产生收入的上限。
张小珺
你怎么衡量智慧程度?
王冠
就是刚才说的,你能够做出来的内容,它应该有一个质量评分。
今天能够做出 60 分的内容,明天能够做出 70 分的内容,这就是在提高。
另外还有一个分母。做到相同质量的内容,如果消耗的 token 越少,其实就越智能。
为什么?我们拿人来做类比。做一道很复杂的数学题,一个人看一遍题,直接给出正确答案;另一个人需要把整个过程演算出来,中间还做错了一遍,说“这个方法错了”,再回头重新算一遍,最后得到相同答案。
如果每次两个人都能用各自的方式把问题做对,我们一般会认为前面的人可能更聪明一些。
张小珺
对啊。
王冠
对,其实就是这个道理。
张小珺
关于 AI native 时代的组织,你有什么思考吗?
王冠
其实还是那个点。我觉得没有什么 native,大家都是有了 AI 之后才出来做的公司,肯定都是 native 的。
但在我们自己的工作过程中,确实有一些比较有意思的观点。
9. 组织放大个体智慧
前面提到了产品的智慧程度、系统的智慧程度。这个智慧程度其实有一个冷启动要素,这个冷启动要素就是组织自己。
什么意思呢?产品的智慧程度,或者说它的能力,等同于组织在这件事情上的智慧程度,再乘以一种转化率。
张小珺
为什么会有一个转化率?
王冠
因为这是一个组织问题。这个转化率肯定是越高越好。
怎么提高转化率?我们的想法和产品工作室这件事情是连接上的。它必须是一种主动、自驱的方式。
我们会把公司视为一种 environment,建立这个组织,其实就是搭建一个 environment。
张小珺
这跟上次直林跟你讲的、要用强化学习的方式管理组织很像。
王冠
很像。我那天看到之后也觉得蛮有意思的。
张小珺
周星宇跟他说的,我就能猜到。
王冠
对。我们其实也是在构建一套 environment。这个 environment 里的每一个员工,我们把他视为一个智能体,一个人就是一个智能体。
为什么说在这个组织里他是一个智能体?大家可能都听过一个词叫“异化”,这是马克思主义的一个基本概念:资本会把人异化。
异化的一种直观表现,就是意义的缺失,或者叫意义的虚无感。
很多人在大厂工作会苦恼,是因为这件事情并不是他想做的。当有一天你追问这件事情的意义,一层一层往回追问“我为什么要做这件事”,你会发现那个意义是缺失的、虚无的。
人在这样的状态下,被异化成为公司的营收、组织、老板的某一个 KPI,被异化成这样的工具人。
搭建 environment 的意思,就是让人回归到人本身,或者说回归到一个智能体。也就是说,这件事情的意义应该由自己决定。
每个人的 reward function,不是由公司制定的。大家进入组织时带着某一个目标,或者在组织工作过程中产生了某一个目标。
Environment 要做的事情,是找到这些 reward function 和组织目标能够契合起来的方式。
所以提高转化率的关键,就是每个人在组织里面都主动地、有自己认同的目标,来做这件事情。
比如做 Mydio 这个产品的同事,如果他对视频这件事情本身缺乏热爱,转化率就一定低。
张小珺
这个其实比较好理解。因为人是有主观能动性的,如果他自己对这件事情感兴趣,工作对他来说可能就不是负担。
依然是产销者的逻辑:生产的过程中他在消费。要回到“劳动最光荣”。
王冠
对。比如我们很多同事在十一期间没有完全休假,一直在做开发。
张小珺
但是公司给加班费吗?
王冠
公司并没有加班要求,也没有这个安排。而且我们是 remote 办公,其实你加不加班可能也没有人知道。
只是最后看到,十一期间大家都在提交代码,最后都被合进去了。
张小珺
有人提交,还有人在合,对吧?
王冠
对。所以这可能就是刚才说的,每个人都有自己的 reward function 的一种具象。
有的人的 reward function 非常简单:他不想公司死掉,所以要尽可能让公司活下去。
张小珺
为什么 AI 时代需要一个让个体感受更好的组织?
王冠
回到前面讲的生产系统逻辑,因为你需要 scale 最强的人。
组织也是一样,应该找到最适合的人。比如代码能力,未来代码一定会越来越多地由模型生成,准确率越来越高,数量也越来越多。
技术栈更全面的工程师,能够产生的代码数量一定比只会某一种语言、某一个研发方向的人更多,他能够带来的产能也会更大。
这类人天然主动性和自驱力很强,很难用传统方式管理。所以一定要用刚才那种方式,最好在招聘的时候就把管理问题解决掉。
张小珺
你们现在多少人了?
王冠
现在 30 个人。
张小珺
增长了。你们是全员都可以不来公司吗?
王冠
是的。
张小珺
那你们平时办公室有人吗?
王冠
我们每周会有一天大家在线下办公,但这个其实是大家主动要求的。
张小珺
你无所谓?
王冠
我无所谓。
张小珺
你平时来公司吗?
王冠
我会来公司。
张小珺
那你看没有人,不难受吗?
王冠
不难受。
张小珺
你觉得这样创造力强吗?
王冠
至少从结果上来说,到今天为止,组织的产能是超出我预期的。
张小珺
怎么看?
王冠
从大家工作的产出数量和质量来判断。
张小珺
那你在招聘阶段会注重这个人的什么?
王冠
自驱力。几个点吧。
一个点是,自驱力包括主动性,这件事情其实很具象,有能够判断的依据。
比如自驱力强、主动性强的人,一定会 building in public。他会写自己的开源项目,会分享自己的认知,也会做很多工作之外的项目,并且把它们发出来。
另外一件事情,是对某一件事情的热爱。这就回到刚才讲的,他必须有自己的 reward function。
张小珺
你的 reward function 不应该是不工作,对吧?
王冠
对,而是劳动最光荣。
每个人都能找到自己最感兴趣的事情。有的人最感兴趣的事情就是休息、躺着;有直播的人就是直播睡觉,这都没有问题。
只是我们要一起做一件事情,要做一个产品。你的热爱,能不能和我们想做的事情找到连接?
如果每个人是一个向量,他的投影要能够投到我们的这条线上。不能是反着投,也不能是垂直投,至少要在我们要做的事情上有一个比较好的投影。
主要就是这两点。
张小珺
为什么 AI 时代支持这种所谓高人才密度的小团队?
王冠
因为有各种生产能力。生产能力本质上就是劳动力,所以未来会有越来越多劳动力以 token 的形式存在。
张小珺
你们有什么独特的管理文化吗?
王冠
我们管理很轻。但是因为 remote,在一段时间内,或者未来长期,可能会面临一个问题:remote 会天然带来孤独感,以及信任问题。
为什么?因为大部分时间都是自己一个人在工作。
人与人之间不能很快、很及时地面对面沟通。面对面沟通时,语气、肢体动作都有 context,都能传递信息。
但如果是纯线上、异步的交互方式,比如文档或者留言,就会让人对其他人产生不信任:你是不是在敷衍我?你是不是根本没做?
张小珺
那你没有因为这个而停止 remote 吗?
王冠
没有。
张小珺
为什么?
王冠
因为这件事情是有解法的,就像线下办公也有线下办公的问题。
张小珺
如果大家都在北京,为什么不让大家来线下?
王冠
首先,我们的人并不都在北京,在哪里都有,有很多地方都有人。
并且 remote 这件事情,是从前面所说的工作室推演出来的。如果要做比较探索性、比较有创造性的事情,就一定需要刚才说的那种类型的人。
如果这些人有热情、有主动性和自驱力,就不需要一定让大家每天到某个地方待着,也不需要一定看到他的工作产出。
坐班制其实是从工业革命的工厂起源的。农业时代没有坐班制,我想什么时候去田里做农活都可以,虽然也要依据每天的时间,但有足够多的灵活性。
因为有产线,所以才需要坐班。人在现场时,要付出体力才能完成工作。
但今天大家更多是脑力劳动,信息传递,尤其疫情之后,也有非常多好的工具去解决。所以我们认为,应该用这种方式去适配刚才说的、找到的这些人。
至少可以节省每天在路上的时间。
另外,当用这种方式发现问题之后,其实也可以解决。传统企业坐班时有问题,有对应手段去解决;remote 也有方法解决。
刚才提到孤独和信任这两个问题,我们内部有一个计划,叫“温暖可信计划”,对应孤独和失去信任的问题。它可以有一系列工作方法来支撑。
张小珺
怎么温暖可信?比如说?
王冠
我们内部有一个内部朋友圈。飞书里每个人都可以建立自己的话题组,在话题组里发起一个话题。
它就是一个内部朋友圈。你想发什么都可以,可以跟工作相关,也可以跟工作不相关。
你会发现,大家并不怎么发微信朋友圈,但是很喜欢发公司的朋友圈,甚至在公司的朋友圈里写很长的小作文,讨论很多生活八卦。
张小珺
层级感肯定是不重的,对吧?
王冠
我们没有什么层级感,因为公司没有所谓的管理岗,没有 manager 这个角色。
每一个 founder 也有自己 hands-on 的工作方向。
张小珺
每一个 founder?你们有几个 founder?
王冠
我们有 3 个 co-founder。
张小珺
大家都是 hands-on 在工作?
王冠
对,没有太多需要管理的事情。
张小珺
你主要负责什么方向?
王冠
我就是模型产品经理。
张小珺
另外两个 co-founder 做什么方向?
王冠
他们负责复杂编辑器底层的架构,以及刚才讲的整个 System 2 的工程架构。
张小珺
你刚才也讲到,开始的时候很困难,在 2024 年初刚起步的时候。后来是怎么完成融资的?你是怎么凑齐现在这个团队的?
王冠
首先,我们的融资是一种怎么说呢?我们其实没有去做很正式、主动的融资。
两个点。一个是当时资本市场比较差,大模型刚刚投完,应用公司还没有形成共识。
张小珺
对。
王冠
这也是我后来才知道的。所以那个时间点,融资天然是很困难的事情。
我们做好了 bootstrap 的准备。
张小珺
哦,就是没有钱。
王冠
对。如果用 bootstrap 的方式,就不会像今天这样用这么重的方式、用生成系统的方式去做。我们可能会像海外很多工具产品一样,从一个很小的功能点切入,开始赚钱,再谋后路。
转机来自去年下半年。去年下半年开始回暖,然后 DeepSeek 和 Manus 把整个应用这件事的资本热情激发出来了。
王冠
所以我经常跟朋友讲,大家都应该给 Manus 磕一个,大家都受到 Manus 的庇佑。
张小珺
是 Manus,不是 DeepSeek,对吧?
王冠
DeepSeek 激发起了大家重新的热情,但是 Manus 对应用这件事来说更本质。
张小珺
DeepSeek 是说,有开源模型,效果也可以很好,就证明未来大家都可能有很好的基座能力,对吧?
王冠
对。但是对我们来说,Manus 肯定更重要。
资本市场变好了,我们可能也在不断、阶段性地 deliver 出一些东西。虽然正式产品发布相对晚一些,但中间阶段不断有 milestone。
比如产品没有发布之前,其实已经在赚钱了。我们的理念是,自己先用这个东西赚到钱。
张小珺
你们现在怎么赚钱?
王冠
比如我们现在还没有发布的那个产品,刚才讲的潮玩品类,就是客户用我们的测试版来支持的。
张小珺
那他怎么给你们付费呢?
王冠
还是按工具的 token 来算。
张小珺
你现在能赚多少钱?
王冠
包括我自己,也用产品赚到过钱。
张小珺
就是 Mydio 这个产品?
王冠
对。我自己用 Mydio 做视频,然后发到平台上。这是去年年初的事情,是比较早的那一版 Mydio。
我用它做视频,发到视频号上。我的账号差不多做了一个多月,总共有 200 多万播放量。
张小珺
哦,这么多。
王冠
我一开始不知道它能赚钱。突然有一天它提示我:“你有一笔到账。”我去看了一眼,发现视频号即使没有挂任何广告,也会给你分成。
张小珺
还有几百块钱。
王冠
对。所以从那个时间点,我意识到这个产品真的能赚到钱。
最近我们线上的产品也会发现,原来有那么头部的创作者每天在用,把周围人的账号全部借了一遍去充钱。
新版产品能够打穿一个品类,所以至少证明它是能赚钱的。
张小珺
那你们团队是怎么凑齐的?
王冠
我们是传销模式。
张小珺
拉人。
王冠
对。我们的同事基本上都是一度和二度人脉。
张小珺
从哪些公司来?
王冠
什么公司都有。但上一家公司在大厂的人不多。
很多人的经历比较典型:一开始在大厂或者比较好的创业公司,后来自己出来独立创业,或者加入一个非常早期的公司。
来我们这儿之前的工作画像,大部分是这样。创业者的比例会很高,可能有一半左右的人之前做过 founder 或 co-founder。
另外还有很大一部分人,是从公司成立开始,或者在公司成立时就是核心员工。
张小珺
哪些公司?什么类型的公司?
王冠
什么类型都有,工具公司、AI 公司,什么都有。
张小珺
我特别喜欢听你讲畅想,因为你特别喜欢推演。所以说,民科太民科了。真的,从互联网到 AI,到底还会发生什么?
王冠
10. 信任取代注意力
刚才我们讲了信息商品可能的演变。那在其他环节、其他生产环节呢?我们再民科一把。
张小珺
我觉得民科的部分我们聊得有点多了。这个,5 年后再来看看吧,10 年后。
王冠
是的。
几个点。一个点刚才提到过,从分配经济到生产经济,已经聊过了。从分销平台到产销平台,这会从产品形态到未来商业模式都发生巨大变化。
再具体一点,比如具体产品的生产。之前大家生产的都叫单点内容,每个人生产一份内容,这个内容在一个公域池子里接受算法匹配,内容之间缺乏连续性。
但在生成系统里,未来生产者生产的其实是 recipe。Recipe 本质上是一种方法,不代表任何一份具体内容,不代表视频 A 或视频 B,而是代表视频 A 和 B 的一种生产方式,是抽象出来的、具有通用性的部分。
所以它对应的不再是单点内容,而是可以称为 IP,也就是有一些共同属性的连续内容。
生产的东西变了,不再是一份一份的单点内容,而是具有共同属性的内容组合。我们没有想到更好的词,IP 可能也不那么准确,但现在只能用这个词代替。
第三点,因为这是一个经济体系,所以一定有它的货币。我们认为货币也会发生变化。
之前的货币其实是大家的注意力。刚才举的例子,为什么会出现两三秒钟、让你突然看一下又看不清的奇怪内容?本质上是因为它能够更好地获得你的注意力,注意力是这套经济系统里的货币。
张小珺
因为平台需要这个。
王冠
对。但这个货币会随着生产端内容的丰裕,性质发生变化。
内容太多了,注意力是有限的,人的注意力有限,时长也有限。当它不够分配的时候,价值就会转移。
它会转移到什么呢?我们把它称为信任。
比如你的内容不是最适合普通大众消费的那类内容,在流量池里天然权重低,但你的内容价值很高,因为受众人群的价值很高。
看你的账号,人的平均收入水平、平均学历一定很高。
那如何把这些人的价值提炼出来?这就不是简单的注意力了。每个人消费能力不同,注意力的价值肯定有差别,但是对于一个公域流量池来说,差别没有那么大。
但这些人对你的账号的价值,不简单是注意力的价值,不简单是花几十分钟读你文章的价值,而是会产生一份对你的信任,对这个频道的信任。
张小珺
以前玩游戏的还说“暴雪出品,必属精品”。虽然今天暴雪已经不行了,但是早年的时候,暴雪本身就是一种信任。只要它出的游戏,大家就一定认为非常好。
王冠
对。生产端拥有了一系列内容的生产能力,内容从单点变成系列、连续的内容,变成 IP。与 IP 对应的货币,就从注意力变成了信任。
比如 Substack、Medium,它不是流量分配的逻辑,而是我信任这个作者,所以订阅他的专栏。
这件事情今天已经在发生,但还没有那么普及。
张小珺
但它好像在互联网时代就发生了,不需要到 AI 时代吧?
王冠
它没有普及,没有成为主流。信任还不是主流货币。
张小珺
为什么 AI 时代会成为主流?这跟 AI 的关系是什么?
王冠
好问题。还是回到生产力,回到生产端。
之前内容的生产能力是匮乏的,稳定地生产好内容很难,必须有足够多的内容去填充这个大的池子。
但是今天通过 recipe 加上生产系统来供给内容,同一种质量、或者越来越高质量的供给,就不再稀缺了。
张小珺
那稀缺不会消失,稀缺只会转移。
王冠
对,它会从单个内容转移到 IP。IP 对应的载体,就是刚才说的信任。
张小珺
比如 OnlyFans。
王冠
对,最典型的就是 OnlyFans。你会去订阅,是因为信任这个账号的内容质量。
这件事情已经越来越普遍了。大家都会把公域平台变成一个招商引资的地方,创作者都会去经营自己的私域。
张小珺
公域指什么?
王冠
比如在抖音上直播,就是公域。
张小珺
然后大家一定会说加群。比如公众号作者会说,去小鹅通、知识星球买我的付费内容。
王冠
这就是一种信任。它的价值比注意力高。
有些作者流量不是很高,文章观看数不是很高,但是质量很好。喜欢他内容的人产生了信任,而且有足够的消费能力,这个价值就有另外一种兑现方式。
张小珺
信任的兑现方式是什么?
王冠
我愿意为信任付费,去加入知识星球,去私域购买一些东西。
张小珺
这在 AI 时代会怎么放大?内容数量提高了,能够规模化生产了,每个人都可以拥有某种稳定质量的内容生产,形成自己的 IP,而不需要在公域流量池里争抢注意力。
王冠
对。
张小珺
然后优雅一点。
王冠
或者说,还是那个词:没有中间商赚差价。
张小珺
那平台会怎么样?平台也会转型吗?你觉得推荐引擎系统直接变成生成系统,make sense 吗?
王冠
它们会直接升级成一种新的系统,而且对旧的系统一定是兼容的。
就像推荐产品里面依然有搜索,它们不冲突。
张小珺
你前面提到一个问题:大家看的都是给自己的内容。那其实依然存在其他人看到你生产的内容,只不过它可能不是价值的唯一兑现方式。
可能绝大多数价值是自产自销,但你自产的内容、你自销的内容,如果是好内容,依然可以对其他人产生价值。
这也是刚才你说创作者会消失,我说其实不是的原因。创作者群体会放大,他们的价值未必也会放大,因为大家的生产力都变得很好。
王冠
对,因为系统提供了一个 baseline,大家都能够生产出很好的内容。
但稀缺只会转移,不会消失。这个稀缺会变成你的品味、你的消费品味,一种生产资源。
张小珺
未来的内容会全部都是 AI 生成的吗?电影、电视、视频?
王冠
我觉得至少会有越来越高的比重来自生成。
我们去观察其他模态的发展历程就可以。做不成熟的模态有一个很好的点,就是完全可以参考成熟模态的发展历程。
文字内容里,一篇文章有多少内容、多少字是来自生成的?新的代码里有多少来自生成?这个比例在不断提高,未来其他模态也会这样。
张小珺
那内容消费平台里的内容会不会全部是 AI 生成的,创作者整体消失?你觉得不会?
王冠
不会。刚才说了,消费的时候就是在创作。
张小珺
从人性的角度来说,我还是很想看另外一个人类在做什么。出于这个目的,我还是会消费它,不会只想消费 AI 的内容。
但如果 AI 内容太强大,会不会吸引到我全部的注意力?
王冠
好问题。你把消费时产生的内容,不称为另外一个人生产出来的东西,但其实它就是这个人生产出来的。
张小珺
系统基于我的偏好,为我做了一份内容。
王冠
对,只是我没有亲自去写这个内容,没有亲自编辑这个视频,但是这份内容来自于我。
张小珺
那版权是你的,对吧?
王冠
当然。产销就是在消费中生产,生产就是自己的消费。
张小珺
但你也说,有生成平台、生成系统产生的内容,它也能凭空 generate 大量内容。这和一个个体通过某个工具 generate 内容不一样。
第二种是你的内容,第一种是平台自动生成的内容。那会不会它把我的注意力全部抓走,我就不想看你生产的内容了?
王冠
反正现在都是民科时间,都是瞎说、乱扯。
这里其实不存在你刚才说的界限。为什么?因为产销时产生的内容,是消费用户的意图输入到系统,再返回出来的内容。
并不是有一个巨大的平台在不停往外自动吐东西。你可以想象,ChatGPT 今天其实就是这个系统。
大家在解决自己的问题时产生了内容,这个内容对其他人也有消费价值。
比如前两天田渊栋说,他们的新论文是跟 GPT-5 聊出来的。那个过程其实就是在产销过程中产生了一个对其他人有很大价值的东西。
背后的系统,就是刚才讲的生成系统。GPT-5 就是一个生成系统。
每个人在使用 GPT-5 时产生的一份内容,对其他人来说也有消费价值。所以你在使用 GPT-5 时,即使在消费它产生的内容,同时也在做新的内容生产。
张小珺
最后几个快问快答。一个全球范围内你喜欢的食物。
王冠
首先我不喜欢旅游,所以没有什么全球的概念。
张小珺
为什么不喜欢旅游?
王冠
我比较喜欢米饭类的食物,甚至是白饭。
张小珺
为什么?
王冠
因为米饭的兼容性很强。任何一个食物和米饭搭配起来,你都会觉得它非常有滋味。
张小珺
也有人不吃碳水。
王冠
那是另外一个问题。
张小珺
好的。一个全球范围内你喜欢的地点。
王冠
因为不喜欢旅游,所以我觉得任何安全、安静的地方都会比较舒适。
张小珺
一个少有人知道但必须了解的知识点。
王冠
我不能确定这个事情是不是太多人知道,但是我第一次知道的时候觉得蛮反常的,叫“一代人”或者说“一世”。
张小珺
一世,一个世界。一世是个时间概念。
王冠
对。这个时间概念所代表的时间范围其实很短,大概是 25 年到 30 年。
张小珺
一世是 25 年到 30 年?
王冠
是。
张小珺
应该是 80 年、90 年了。
王冠
是的。所以我知道这个信息的时候还蛮震惊的。
这代表着,像我这样年龄的人,其实可能在做很多下一代人的产品,甚至是下一世人的产品。这是一件听上去很惊悚的事情。
它正在发生。比如一个 30 多岁的人做的产品,可能是一个 25 到 30 年后、比他小 25 岁或者 30 岁的人使用的东西。你其实在服务另外一代人,或者说另外一世的人。
张小珺
听上去很离谱。
王冠
对。
张小珺
据所有读过的书,推荐 2 本必读书。
王冠
没有什么必读书的概念。每个人喜欢的东西都不太一样,我只能说我常读的书。
一本是《道德经》,我会常读。另一本是我最近在读的《慢煮生活》,它是汪曾祺的散文集。
他描述的是,跟白饭一样,可以把很普通的生活描述得让你觉得津津有味、很有意思。
张小珺
你是一个道家的人吗?
王冠
我不是道家的人。只是比较喜欢传统文化,道家的文化或者说它的一些哲学理念,和我会更搭一些。
大家会说老庄,就是老子和庄子,但他们是非常不一样的。
庄子的思想会更像你说的那一点,就是脱离世俗。但是《道德经》里的思想完全是入世的,讲的是如何在世俗世界里活得更好,而不是教你跳脱出去。
我把它形容为,老子和庄子合并起来,其实是一套“大鱼与蝶”的比喻。
庄子很像大鱼。大鱼是鲲,它飞在天上,很大,然后背负苍天,所以它是从很超脱的视角看到很远的东西。
这当然是好的,但是老子的思想更像蝴蝶穿花。
我们想象蝴蝶在花丛中,它行走的路线一定不是什么直线,而是在各种各样的障碍里面,所以叫游刃有余。
张小珺
因为它会顺其自然。
王冠
对。
张小珺
你心目中影响 AI 进程的重要的几篇论文?
王冠
因为我不是技术出身,对算法的理解其实很浅,所以很难评价哪些论文对行业来讲重要。
我只能说,对我的工作或者认知影响比较大的几篇文章,它们也未必是论文。
一篇是《Let's Verify Step by Step》。大概是 2023 年 5 月份,应该也是伊利亚最后一篇署名的论文。
它提到的是过程监督。过程监督今天会有一些 concern,因为有了 RL 之后,人去标注过程未必是最高效的。
但这里面更重要的一个理念,我觉得可以抽象成:方法是一个更高维度的智慧。做事情的方法和知识是两个不一样的东西,就像单词和语法是两种东西一样。
这两者都代表智慧,而方法代表的智慧程度可能更高。它可以是人标注的过程监督数据,也可以是 IL 出来的中间过程数据。
所以这是对我影响比较大的一篇。
第二个也跟伊利亚相关。它应该不是论文,是一个分享,叫《An Observation on Generalization》。
我完全看不懂,里面有很多数学公式的计算。但是其中一个很重要的思想是,为什么无监督会有效。
如果是两份数据 X、Y,无监督其实是在从 X、Y 中学习,从 X 中学习 Y,从 Y 中学习 X。所以它能够把两份数据中的共性抽象出来。
这个当时对我的触动很大。
可能还有一篇,讲语言建模,叫《Language Modeling Is Compression》。
它也是从数学层面论证,为什么语言模型就是压缩。对应到我们之前聊到的,压缩能够带来智能,这件事情就是对的。
很多细节我看不懂,全是数学公式,但是里面的一些理念对我影响很大。
张小珺
基于你当下的认知,一个关键的重要 fact 是什么?
王冠
不管是 AI,还是所谓 AGI,它都是一个 long chain 的事情。
所以 I bet China.