曲凯
我们最近聊了很多跟模型算法相关的人,因为这块也非常热,所以今天很开心请到 Evolvent AI 的联创孟繁青。可以先给大家简单介绍一下。
孟繁青
非常感谢曲老师的邀请。我是孟繁青,NUS 博士生,同时也是 Evolvent AI 这边的联合创始人。我主要负责的是 RSI 这个 research 方向。
我之前在 Kimi 有过一段比较长时间的实习经历,当时主要做 Agent 和 I/O,偏 Infra 方向。在 Kimi 期间,我参与的工作包括 Kimi Linear 以及 Kimi K2.5 等重要模型的发布。
从 Kimi 离开之后,我和一些朋友合伙创业,成立了 Evolvent AI。这家公司目前的一个大方向,就是主要聚焦在 RSI 这条线上。
曲凯
我觉得你的背景其实是现在一批特别热门的创始人身上很典型的画像:非常年轻,PhD 还没有毕业就开始创业,而且做的事情跟你之前在 Kimi 做的也算是 post-training,对吧?
我觉得这一批人现在出来创业的非常多。所以你最近这一年——创业算半年,对,差不多小半年——实际感受怎么样?
孟繁青
1. Post Training Founders
我会觉得,在大厂和创业公司做事情,确实有比较大的不同。一个很典型的点是,我在 Kimi 其实主要是去训技术模型,但到了后期我会觉得,训练推理模型这件事在大厂内部其实已经是相对比较工程化的事情了。
所以我当时的主要工作,也会去做一些合成数据。因为整个训练流程,包括推理流程,在内部都已经比较稳定了。
那么来到创业公司以后,我们肯定就不训练基模了,而是需要找到一些与模型厂商更正交的切入点。同时,我们也需要从零搭建一些平台类的 Infra,方便内部使用。
这是一个比较大的不同:我们可能并不是 focus 在推进模型治理,而是说我们是去做跟模型治理正交的,但是可能是实际应用更有用的东西。
曲凯
我发现做 post-training 的人现在创业比较多,pre-training 的好像很少。
孟繁青
这其实很好理解。做 pre-training 的人每天主要打交道的,要么是数据本身,但现在 pre-training data 已经相对饱和了;要么就是模型架构、优化器之类的东西。
而搞这些东西相当消耗资源,所以出来创业以后,初创公司比较难覆盖这一块成本。因为他做的一切事情,都是建立在算力基础之上的。
曲凯
那 post-training 的人出来创业,你觉得他们比较擅长、也比较适合做什么?
孟繁青
从目前来看,整个 post-training 基本上跟两件事情相关。一个是合成数据,合成数据是 post-training 很重要的一块。相比于预训练,post-training 对合成数据的要求是更精细,但数据量不会像预训练那么大。
另外一块其实是做平台。平台听起来稍微比较抽象,用白话说就是做 benchmark。
2. Benchmarks Become Environments
Benchmark 发展到现在,已经不是我们在 2024、2025 年看到的那种出很多题,让模型直接回答。现在的 benchmark,可能像一些 agent benchmark 一样,需要模型在它提供的环境里进行很长时间的探索,去完成一个任务。
这相比于预训练那种偏研究的模式,会更加落地。因为一个足够优秀的 agent benchmark,通常意味着工程实现也会比较好,相对而言,转化成商业模式会更简单。
所以我觉得,这就是为什么 post-training 的人更喜欢做 Agent 和 benchmark。它们本身离落地更近,因此这类人的创业也会更多。
曲凯
我觉得你说 benchmark 的白话还不够白。今天的 benchmark,跟之前的区别到底是什么?
孟繁青
之前的 benchmark,可以理解成做数学题:我有一道很难的题,让模型直接回答。它相当于一个考生,但这个考生没有日常生活中的环境。
举个例子,白领在日常工作中要完成一件事情,不只是靠大脑,还需要动手操作飞书、Notion 等各种软件。以前的 benchmark 主要测模型的大脑,现在的 benchmark 则相当于把这一部分模拟出来。
比如针对白领,我们会搭建一个模拟办公软件的整体环境,然后让 Agent 在里面完成某些任务。这样一来,模型不仅需要有做数学题那样的推理能力,还需要有跟各种工具交互的动手能力,最后才能把这件事情完成。
曲凯
但你看,之前做题,包括 coding,它的可验证性其实更强,也更简单。最后对一下结果,对就是对,不对就是不对。
那如果我建了一个环境,最终怎么评判这个结果的好坏呢?
孟繁青
这相对于原来会复杂一些。原先我们出一道题,首先要保证这道题是正确的。现在也是类似的:当我们造了一个环境以后,需要确保我们造的环境跟真实环境之间是相符的。
一个比较简单的例子是,环境里我们造了一个 Notion,真实世界里也有一个真实的 Notion。那么在同一个输入下,这两个环境的输出是不是一样?如果一样,就可以证明我们造的环境是正确的。
另外一块是我们出的题,以及跟这道题配套的检查。现在的检查不会像数学题那样简单,不是只判断答案是否相等,而是会拆成很多维度。
现在很多 benchmark,像我们之前做的 CrawlMark,或者目前大家在测的 AutomationBench,检查都分成非常多的小得分点。这些得分点目前仍然比较依赖人的精细设计,最后还是需要人来做检查。也就是说,实际上是人和 Agent 一起完成 check。
曲凯
3. Data Quality Sets the Ceiling
我最近听到一个说法:post-training 的人其实每天主要就是在做数据。
孟繁青
确实。现在模型厂商对于整个 training 生态已经做得很完备了。
比如在模型厂商之外,如果一个人想训练一个 SFT 模型,可能要去 GitHub 上找一个仓库,再找 GPU、配环境、整理数据,然后训练模型。
但在模型厂商内部,如果一个研究员想 SFT 一个模型,根本不需要这么复杂。因为模型厂商已经把这一套生态做成了服务。形式上,我只需要提交一个请求,服务就会在远程处理 SFT,最后把结果交给我。
对我来说,即使我是一个什么都不会、根本不知道 SFT 是什么的人,我要做的也只是把数据做好,然后就可以直接走完这一套完整流程。
曲凯
所以有人会讲,post-training 是不是相对比较枯燥、无聊的工作,就是认真把数据做好?以及现在所谓的训练模型,门槛是不是没有大家想象得那么高?
孟繁青
后一个问题我是认可的。训练模型这件事的门槛,确实在很大程度上降低了。当然,这是对大部分算法工程师来说的。
比如做 inference,实际上相当于是在构建服务的人,这里面还是有比较多坑的。但如果是大部分普通算法工程师,门槛确实会降低。
至于它到底是不是枯燥乏味,我觉得不一定。所有东西按照发展来看,都会越来越简单、越来越直接,越来越面向结果。无论是模型架构为什么最终发展到 Transformer,还是 RL 为什么最终过渡到 DeepSeek 提出的、基于可验证奖励的 RL,本质上都是这个规律。
所以 post-training 也是一样。它会发展到我们可能不再关注具体算法设计中的那些 tricky 的地方,而是直接关注最本质的事情:给模型什么数据。
而且,造数据本身其实也很难。不同的人,能造出来的数据是不一样的。我们最近也做了一些工作,做了一个 RSI Bench,在这个 benchmark 里讨论 Agent 到底能不能直接完成造数据、迭代训练模型这件事。
目前可以看到,Agent 还是只能做一些比较机械化的事情。比如我训练了一批数据,导致模型回答的格式错了,之后 Agent 发现问题并修改格式,这件事它可以完成。但它还无法提出所谓的造数据 insight。
现在模型厂的研究员在造数据方面有很多自己的 know-how,这也是目前的核心能力之一。所以不能说这件事本身是枯燥乏味的。
曲凯
同样的人,做出来的数据结果有好有坏,大概体现在什么地方?有没有具体的例子?
孟繁青
目前来看,这件事还是比较量化的,大概分为两个维度。
因为造数据一般也是针对给定的 benchmark,所以最简单的量化标准就是:在这个 benchmark 上,到底能不能在没有作弊,也就是没有 hacking 的情况下,完成提分。
曲凯
也就是在这个 benchmark 上的效果能提高。
孟繁青
对,这是最直接的一点。
当然还会有其他考虑。比如我针对代码 benchmark 合成数据,然后用这些数据训练模型,它会不会导致模型在写作等偏文科的事情上性能下降。
曲凯
但你说的是结果上的评判。对我来说,我想知道的是什么造成了不同的结果。
孟繁青
主要是他们合成出来的数据质量不同。
当我们还没有训练模型的时候,要评判数据质量其实比较难。我们只能用一些量化指标去评判,比如数据的正确性。
一般来说,我们有一个问题,以及一条模型轨迹,轨迹里会有一个答案。一方面要看模型轨迹里有没有出现类似作弊的情况;另一方面要看合成数据的难度是不是适中。
如果太简单,数据肯定没有用;但如果太难,模型也学不到什么东西。
曲凯
能不能换个角度理解:现在数据质量仍然是一个比较难评判的事情。最后还是得训练,结果好就是好,不好就是不好,然后再改。
孟繁青
对。很多数据质量检测指标只能做初筛,真正要看它能不能 work,还是得训练。
曲凯
对于一个模型来说,如果只看 post-training 部分,inference 的好坏和数据的好坏,你觉得重要性大概怎么分配?
孟繁青
目前来看,数据的好坏更重要。因为 inference 已经发展到了一个相对稳定的程度。
曲凯
我们刚才讲了很多相对介绍性的内容。你正好也刚从 Kimi 出来不久,现在 Kimi、MiniMax、智谱之间的竞争都很激烈,大家最近也在陆续发布新模型。
从你的视角来看,今天尤其是国内这些模型大概发展到了什么阶段?大家在竞争什么?
孟繁青
4. China Closes the Model Gap
我觉得目前国内模型和国外模型的差距,处在一个不断缩小的过程中。
比如我们可以看到,Kimi K3 在国内可用算力可能只有国外十分之一的情况下,已经发展到了接近 frontier 模型的水平。当然具体跟国外差多长时间,其实很难估计,因为国外那些厂商也会有自己的存货,可能还没有发布。但从它们 release 出来的结果来看,已经比较接近了。
我觉得这主要来自 pre-training。就像我刚才说的,国内模型厂拥有的计算资源远远少于国外,这就导致它们需要用这些更少的资源完成一个比较好的后训练。
国内基本上可以分成两种路径。一种是像 Kimi 和 DeepSeek 一样,在底层架构上做创新。比如 Kimi Linear 使用线性注意力机制,DeepSeek 的 MLA,也就是 Multi-Layer Attention,同样是一种注意力机制。
说白了,相对于原始的 Attention,这些架构更省计算量。这样就可以用更少的训练资源达到更好的效果,同时不会太损失性能和推理速度。
这相当于国内模型厂在有限资源下,逼出了一些 pre-training level 的架构创新,从而至少拥有一个不会落后太多的预训练模型水平。
另一方面是在 post-training 上。国内的 post-training,我觉得可能比国外稍微弱一些。当然,这种弱并不是技术实力上的弱,而是国外像 Claude、OpenAI 这些厂商,在数据上的积淀天然比国内早,甚至可能早半年。
国内在数据上的积淀相对少,所以目前绝大部分数据可能会通过蒸馏来补足短板。
曲凯
你说的其实跟我原本的预想还挺不一样。按你的说法,现在是国内的 pre-training 更有特色,而 post-training 反而比海外弱,对吧?
我个人原来会觉得,pre-training 部分海外的人才密度可能更高,卡也肯定比国内多;post-training 反而更偏工程,理论上应该是国内更有优势的部分。
孟繁青
我觉得是这样。现在我们可以看到,不仅是国内,全球范围内比较好的架构,主要也是 Kimi 和 DeepSeek 做出来的。
国外比如 Mamba,实际上没有多少人真正使用。Kimi 和 DeepSeek 的架构,至少已经在它们自己的公司证明了具备 scaling 能力。但国外的一些架构,比如 Mamba,一直没有证明它具备这种 scaling 能力。
曲凯
你觉得这是 AI Lab 内部大家公认的观点,还是比较个人的看法?
孟繁青
是不是公认我不太清楚,但我和一些朋友聊过,我们还是比较认同这个观点的。
曲凯
明白,这个挺有意思。而且我个人觉得,从现在来看,post-training 确实比预训练更像是一件工程的事情。
工程上的时间差,可能会更难弥补一些。国外更早有数据积淀,确实会做得更好。数据积淀本身又比较依赖人力和组织架构,相比于依靠研究员的聪明才智,优化起来可能更难。
所以 pre-training 有点像资源倒逼创新:海外可能本来也没有动力去做这些事情。
孟繁青
我觉得这是有道理的。
曲凯
那你觉得今天比如 Kimi K3 出来以后,大家都能看到它的各种榜单评分,反馈也很好。在此之前,智谱肯定是一路领先的。
你觉得后面的模型厂商会怎么变化?大家会交替领先,还是会怎么样?
孟繁青
基本上肯定会是这样:某一家发布一个大的模型版本,这个版本至少在开源社区里是 Top 1 或 Top 2。几个月以后,另一家模型厂商发布一个大的模型版本,就可能把它超越。
曲凯
所以不太存在某一家因为某种独特原因就一路领先,对吧?
比如 Kimi 和 DeepSeek 有自己的 pre-training 架构创新,但智谱发布下一版以后,还是有可能超过它们?
孟繁青
对。但这可能只是看 benchmark 的结果。如果说真正的体感,那也不一定。
从真正的使用体感来说,GLM 确实是长期领先的。
曲凯
我们可以挨家讲一下。你刚才提到 DeepSeek 和 Kimi,我们可以理解为它们的人才密度比较高,也在架构上做了一些创新。
我想补充问一点:Kimi K3 讲的是一个非常大参数量的模型,你觉得这对它的实际贡献有多大?
孟繁青
我觉得贡献显然很大。从 scaling law 的角度来说,在目前的数据规模下,扩大模型参数确实能拿到收益。这不仅是国内这样,海外也是这样。
曲凯
但其他家看到以后,也能很快追上吗?还是因为 Infra 或者各种架构的原因,没有那么容易效仿?
孟繁青
能追上,但肯定会有时间上的 gap。
曲凯
说到智谱,之前我们也在很多场合讨论过。我好奇你的视角:你觉得智谱前一段时间 GLM 在 coding 方面一直领先,核心原因是什么?
孟繁青
我其实不是太了解智谱这家公司。但我跟朋友交流时,会觉得智谱在 coding 数据上做得比较好。
曲凯
更偏 pre-training 还是 post-training?
孟繁青
Post-training。
曲凯
字节其实一直在 coding 上至少到目前还没有追上。你觉得这是不是也只是一个时间问题?
孟繁青
如果说它要追上现在的 frontier model,那肯定是时间问题。但它跟现在 frontier model 的差距到底是不是在缩小,这件事其实不太好说。
曲凯
我们最近也聊了很多人。我现在有一个感觉:在人才密度上,只要大家肯花钱,其实都能找到人。最近混元进了很多非常优秀的人,它们挖人也很厉害,这个趋势非常明显。
数据上也是一样,只要肯花钱、肯下功夫,大家可能没有特别本质的区别。那最后是不是还是拼卡?长期来看,或者中长期来看,如果拼卡,那大厂是不是优势最大?
甚至今天的 Kimi、智谱、MiniMax 等公司,长期仍然会面临非常大的挑战?
孟繁青
我个人觉得,拼卡当然是一个很直接的原因,但还有一层原因是组织架构。
从混元这个例子就很容易看出来,可能在之前没有改架构的时候做得比较差,但现在却突飞猛进。这一块我觉得更多来自组织架构的设计,也就是划分到底是不是更合理。
举一个比较简单的例子:多模态这个部门到底应不应该单独划出来?事实上现在大家并不会把它完全单独划出来,而是会跟 pre-training 进行合并。
曲凯
所以今天各个模型厂商到底在竞争什么?是架构创新、数据、Infra,还是其他东西?
孟繁青
从技术上来说,这几块肯定都有。
架构相当于你能不能在现有的有限资源里榨出更多东西;数据相当于你能不能在这些 benchmark 上达到更好的效果;Infra 则是保证内部迭代速度。
技术上的东西大家肯定都会竞争。更底层的,可能就是公司内部的组织架构。
曲凯
你觉得目前世界上有没有一个共识,认为下一个阶段最核心的点是什么?
孟繁青
5. Auto Research Takes Center Stage
我觉得有。现在的共识是做 Auto Design,或者把它叫作 SI。
曲凯
我们听到过非常多次,比如 self-evolving、自进化,还有 AI for AI,对吧?以及你刚才说的 RSI。这些其实都是一件事,也正好是你们现在在做的事情。
能不能先给大家解释一下,这几个词到底是什么?
孟繁青
不管是 self-evolving、SI,还是 Auto Research,形式化地说,都是给模型一个工作的环境和一个目标,看它能不能在里面持续操作,拿到结果反馈以后修改之前的操作,最终突破原来的上限。
曲凯
我理解这件事其实有几层可以做。
从最终产品输出的结果来看,之前就已经有人在做了。比如我先输出一个结果,但不给用户,而是先让模型换一个模型或者用其他方式再测一遍,最后再输出。这是最上层、最表层的部分。
中间的 harness 部分其实大家也一直在做,就是怎样让 harness 自己运转起来,自己去做很多事情。
还有我记得 Anthropic 等公司都在讨论,什么时候最终真的能够让模型层面的 AI 自己去训练 AI。你理解这几个都算 ASI 吗?
孟繁青
我个人理解都算。当然,从目前大众的理解来看,大家会把 RSI 更偏向于模型自己迭代自己,得到一个更强的模型。
而 Auto Research 可能是指:现在已经有一个很强大的模型,它能不能写出一个好的 GPU kernel。它在写 GPU kernel 的时候,会进行持续迭代。
但这两件事其实殊途同归,都可以形式化成:给模型一个环境和一个目标,然后让它在里面持续进化。
曲凯
听起来,让模型自己训练自己应该是最难的,对吧?这算是 pre-training 的部分吗?
孟繁青
它可以做成一整套。不管是 pre-training 还是 post-training,都可以包含在里面。
我之前听过一个观点:AGI 的一个概念,是看这个模型到底能不能从零复刻出一个自己。这其实就是一个很清晰的 SI 过程,只不过最终复刻出来的模型没有超越自己。
如果它能够复刻出一个超越自己的模型,在自己的基础上得到一个更强的模型,那就实现了 SI。
曲凯
我想再捋一下刚才说的几层。
最表层的迭代,我觉得是一个挺简单的事情,甚至一些基础工作、一些 prompt 就能完成。然后 harness 这一层,我想进一步理解一下。
现在也有很多人在说,模型可能会把 harness 一起训练进去。未来几年,是不是就没有 harness 这一层了,全部都变成模型自己的事情?
孟繁青
6. Harnesses Still Matter
我觉得未来不会没有 harness。现在可以看到,模型厂商基本都有自己的 harness。比如 Kimi 有 Kimi Code,DeepSeek 内部也有自己的 harness,只是还没有 release。
它们一般会把自己的模型和自己的 harness 一起发布。因为在 post-training 的时候,模型的输出是经过 harness 的;而在后训练过程中,通过反向传播,模型会越来越适配这个 harness。
所以这两个东西会配套出现,而不是 harness 消失。当然,我相信 harness 会越来越简单,这一点是肯定的。
曲凯
那你觉得未来几年,第三方 harness 还存在空间吗?
如果我是一个做应用的创业者,未来几年还需要做自己的 harness 吗?还是这部分责任会交给模型厂商?
孟繁青
可能会分两种情况。
一种是 general 领域,比如 coding,这一块确实没有第三方 harness 存在的必要。
但在一些垂直领域,情况可能不同。一方面,垂直场景根本没有必要使用模型厂商那么强大的模型;另一方面,也没有必要使用它们配套的 harness。
我可以用一个相对弱一点的开源模型,配上一个比较简单的 workflow,完成自己的需求。这样消费更少、速度更快。这种情况下,我觉得确实有必要拥有自己的 harness。
曲凯
但这里一直有一个疑问。你也在做 SI,肯定是相信这件事的。
如果真的相信 SI、相信 AGI,相信几年内能到达的话,既然模型都能训练自己,还有什么不能写的?我让它写一个垂直领域的 harness 不就好了?
孟繁青
对,是可以写。写完之后就使用这个垂直领域的 harness,不需要使用它自己的 harness。
曲凯
所以如果真的到了那一天,仍然会是模型吃掉一切的逻辑吗?还是垂直领域仍然会有价值和壁垒?
孟繁青
用一个强大的模型写 harness 当然没有问题。但问题在于,在垂直领域里,harness 背后的模型到底需不需要使用这个强大的模型,这件事未必。
随着现在 Claude 一次又一次发布新版本,普通用户其实已经很难体感到模型强度上的差别了。我们可能只能看 benchmark,而这些 benchmark 已经有点脱离日常使用了。
对于垂直领域来说更是如此。它可能根本不需要非常强大的模型,而是需要用强大的模型去指导一个比较小的开源模型,在自己的场景上进行迭代。
这其实也是一个 self-evolving 的过程:让小模型得到一个好的垂直领域模型,之后就只使用这个模型,不需要一直调用 Claude 这种大的模型。
曲凯
但这样的话,我还是在想,最终模型厂商的价值会怎么变化?
现在一些基础模型已经足够使用了,未来肯定会不断降价。不管是因为开源、Kimi、DeepSeek,还是其他原因。GPT 最近好像也刚降价了 80%,后面应该还会持续降,直到有一天,大家发现足够自己使用的模型已经接近免费。
孟繁青
这件事一方面是这样的:模型厂商降价,并不一定是因为成本真的降了很多,而是有商业模式上的考虑。
开源社区确实很强,又有竞争对手,所以它不得不降价。如果未来真的出现一两家垄断,价格也未必会一直下降。
另外,很多垂直领域有数据隐私的需求,所以它们不一定有很强的意愿去使用 Claude、GPT 这样的模型。
曲凯
但我觉得一两家独大,目前看起来不太会发生。
孟繁青
不好说。
曲凯
还有一个我没想明白、而且对你们尤其是做 RSI 的公司来说,可能比较 challenging 的问题。
现在市面上有很多所谓的 New Lab、RSI,或者 CFEVV[?] 在做这件事。那如果真的能够让模型自己研发自己,为什么不是直接瞄准做更好的基模?比如做一个比 OpenAI 更好的模型。既然模型能够自己研发、自己进化,那就让它自己迭代就好了。
这是第一个问题。第二个问题是,为什么不是模型厂商自己做出来?这应该也是现在所有大模型都很看重的一块,而且在它们的主路径上。
孟繁青
我觉得它的逻辑是这样的。
7. RSI Needs No Special Model
首先,RSI 基模这件事,跟模型厂商到底是正交的,还是跟模型厂商重合,我最近也在思考。最后我的判断是,RSI 基模其实就是模型厂商自己在训练的基模,只是原因可能比较复杂。
目前这些创业公司在做的事情,以我们为例,并不是要训练一个 RSI 基模,也不是要做一套 RSI 专用的 harness。这两件事我觉得都没有意义。
我们想做的是一些介于模型厂商和应用层之间的、建立 RSI 通道的东西。
曲凯
那 RSI 这件事的实现,最核心的点是什么?
我能理解的是,只要基模的 AI coding 能力越来越强,它慢慢就能做到这件事。
孟繁青
是这样的。不过我现在对 RSI 的思考可能会比较抽象。
现在有很多人在做 self-evolving,或者在 harness 上做方法。形式上来看,它可以被看作一个更聪明版本的 DFS。DFS 是一种算法,相当于它一直往里面探索。比如走迷宫,走到死路时,就回溯到上一个点。
为什么说目前这些人做的 RSI 方法,是一个更聪明版本的 DFS?因为模型现在可以写 GPU kernel。它写完一个 kernel 后,交给评分程序评分,得到一个分数。根据这个分数,它就拿到了反馈。
这类似于我们走迷宫时,有时候会走到一条死路;如果反馈不好,模型就会根据反馈回溯到某一个节点。在 RSI 或者 Auto Research 里,这个回溯是由 LLM 判断的,而不是像 DFS 那样通过代码判断的。
所以我觉得,现在做 RSI 的这些方法,本质上都是在做一个更聪明版本的 DFS,并且在 DFS 里加入了一些剪枝。这样就不会探索那些一开始看起来没有用的路径,而是把更多精力放到更有可能成功的路径上,从而提高 RSI 的效率。
这件事本质上要求我们剪枝,也就是预判某些操作会带来怎样的未来状态,以及这个未来状态会带来什么收益。从技术上来说,就是 world model 加 value model。
而这两件事情,在大模型预训练的时候其实已经被内化了。所以我个人觉得,并不存在 RSI 基础模型这件事。模型厂商在预训练模型的时候,已经把 RSI 所需要的能力内化进去了。
之后 RSI 会变强,本质上取决于我们有没有把模型知识内化得更好。还有一个因素是模型的 context window。现在模型的 context window 最高可能到 1M,如果它变得更长,就能记住更多东西,也可以回溯到更远的地方。
所以我觉得 RSI 可能主要来自这两块。
曲凯
按你的说法,你其实更看好现有模型自己去做 RSI,而不是 New Lab 去做这件事。对于 New Lab 来说,机会可能没有那么多。
孟繁青
对,没有 RSI 基础模型这个说法。
曲凯
我们假设——也不叫假设,现在大家肯定都在往 RSI 走。无论看海外模型还是国内模型,其实都在往这条路走。
如果有一天真的走到那一步,算法能够自我迭代、自我进化,而算力又在那里,那数据会不会反而变成瓶颈?还是到那个时候,数据也能够自己运转起来?
孟繁青
我个人觉得数据是可以自己运转起来的。
我们最近做的 RSI benchmark,其实就聚焦在数据层面的自进化上。我们确实可以发现,目前 Agent 已经在数据层面具备了一定的自进化能力,能够自己合成更好的数据。
曲凯
我们今天讲的很多东西,如果按照逻辑推理,最后可能会得到一些非常有意思的结果。
比如按照刚才的逻辑,最后模型公司可能只需要 10 个人、20 个人就够了。
孟繁青
从结果上看可能是这样,但实际还要考虑很多方面,也不一定会这么极端。
曲凯
8. The Synthetic Data Economy
最近很多人都知道,合成数据在国内也比较热。你们也在卖一些合成数据,对吧?
按照我们刚才的讨论,它是 RSI 的一个结果产出,还是 RSI 过程中的一个中间产物?这两件事是什么关系?
孟繁青
最终意义上的 RSI,是模型通过训练得到一个更好的自己。在这个过程中,它可能会改进数据、算法、架构等多个方面。
所以数据可能是 RSI 过程中的一个中间产物。
曲凯
我们经历过几波数据趋势。
第一波是 Scale AI 那一波,普通人标注数据就可以。那时候数据量本来就很小。后来以专家标注数据作为第二代。合成数据现在可以理解为当下第三个大的趋势。
孟繁青
我觉得是这样。当然,合成数据可能已经处在这个趋势的中后期。
曲凯
这三种数据现在是并行的,还是会有替代关系?
我知道现在大家其实也挺缺真人数据,会有人去采购真人数据。那真人数据跟合成数据之间又是什么关系?
孟繁青
ChatGPT 那一代数据,现在来说可能更多是用于预训练,属于 raw data,noise 比较多,所以这块的需求确实没有那么大了。
专家数据现在仍然有需求,但不会像 2025 年初那么多。因为当时 o1 出来以后,模型的推理能力发生了一次跃迁,大家非常希望有数学、物理专家提供他们自己的数据。
但现在这块确实在变少。主要原因是模型变得太强,对专家的要求也变高了。原来可能只要求专家做题,现在还要让专家出题,而且出的题不能跟市面上所有题重合,这就太难了。
现在比较重要的是 Agent 数据。模型从最初的聊天机器人,发展到 o1 这种推理能力很强的做题模型,再到 Claude Code 出现以后,模型开始真正成为你的同事,成为一个 Agent。
这就意味着我们需要 Agent 数据。Agent 数据主要分成两种:一种是合成数据,另一种是真人数据。
合成数据就是搭建很多环境,在环境里让一个模型接受目标、进行探索、完成任务,然后把整条轨迹保存下来。
真人数据则是让真人在自己的工作环境里产生交互轨迹。这些都是 for Agent 的数据。
曲凯
那现在合成数据和真人数据之间的价值关系是怎样的?
孟繁青
真人数据的 noise 也比较多,需要做清洗等工作。合成数据则相当于可以直接拿来训练。
曲凯
能不能给大家讲一下,现在一条普通标注数据、一条专家数据、一条合成数据,以及一条真人数据,大概分别是多少钱?
孟繁青
合成数据里,贵的可以卖到几千元,比如做题类的专家数据,可能也是一两千元这个量级。
至于真正的真人操控轨迹,有时候需要走量,所以没有单条价格的说法。
曲凯
你说合成数据好几千,单位是什么?他们花几千元买的到底是什么东西?
孟繁青
就是非常长程的任务,一条数据对应一个任务。
曲凯
合成数据听起来其实是模型厂商自己也应该能做的。它们为什么不自己做,而是还要向外采购?
我知道它们肯定自己也做,但为什么在自己做之外,还要到外面采购?所以合成数据的订单以后也肯定会越来越少,对吧?
孟繁青
对。数据这块现在还是多多益善。
我自己造了一批数据,里面可能有我自己的 bias。我肯定希望数据分布里的 bias 越少越好,所以可能还会从外面收一批质量比较高的数据,来补足分布。
曲凯
那为什么后面又会变少?
孟繁青
一方面,是现在 benchmark 越来越少了。以前 benchmark 非常多样,一个模型要测很多 benchmark,而且每个 benchmark 都要刷,需求自然就很多。
但现在模型越来越强,做一个好的 benchmark 难度也很高,benchmark 可能会收敛到只测几个做得最好的。所以模型厂商就有更多精力,专门去造这些 benchmark 的数据。
相对来说,对其他 benchmark 的需求就会减少。
曲凯
所以它其实是一波一波的。那你觉得下一波会是什么?
孟繁青
短期来看,可能是所谓的 RSI 数据。
举一个比较简单的例子,我们也在做:我有一个模型,用它去后训练另外一个小模型,把这个小模型的效果提升上来,形成一条轨迹。
这条轨迹已经超出了目前大部分数据的范畴,因为它在产生的时候,可能需要运行十几个小时,甚至一天。这种轨迹就是非常宝贵的数据,必须是有模型训练背景的人才能做。
曲凯
也就是说,这个数据行业的背景要求也在提高。
如果很多用户平时都在使用 AI,可能会产生很多数据。这些数据首先存在于他使用的中转站和模型里。如果他自己想卖,你觉得合理吗?能卖出去吗?
孟繁青
卖不出去。
曲凯
卖不出去,是因为你刚才说的太脏之类的问题吗?
孟繁青
对,而且也有合规问题。
曲凯
所以我的理解是,过去半年,包括你们以及其他一些公司,卖数据赚了很多钱,收入一下子涨得很快。但你觉得这一波在你看来已经快进入尾声了?
孟繁青
普通 Agent 的数据,比如 SWE-bench 那种 Agent 数据,确实已经接近尾声了。
所以数据行业变化非常快,也会对这些数据厂商进行筛选。之前大部分依靠重人力、做专家标注的公司,可能就很难活下来。反而是数据公司里有一些一线、hands-on 的 researcher,可能更能跟上数据变化的潮流。
曲凯
你们现在也在往 RSI 数据走。你们出的 RSI benchmark,主要就是为了这个?
孟繁青
数据是一方面,我们也不会只做数据。
数据一方面能带来现金流,另一方面也会反哺我们的一些认知,让我们获得更多 know-how,去做 RSI 这件事。
曲凯
但要做好 RSI,就回到刚才说的,你必须自己真的去训练模型。
孟繁青
对。但事实上,现在训练模型基本可以约等于造数据。
而且我们在造数据的时候,也会跟模型厂商合作。
曲凯
我记得最近有一个很流行的说法:算法就是数据,数据就是 Infra,Infra 就是算法。
我不知道你怎么看这个说法。它听起来像是戏谑,但好像又带着一点真相。
孟繁青
其实没什么毛病。
算法就是数据,是因为算法会收敛到最简单的形式。比如 RL 会收敛到 PPO。如果大家都用 PPO,那就要看谁的数据更好。
数据就是 Infra,也比较好理解,相当于你怎么把数据训练得更快。
比如现在有一批 RL 数据,训练慢的主要原因是推理时会有很多长尾。现在一般是先把一批数据推理完,再整理格式,然后导入训练。
但推理这批数据时,可能 100 条数据里,前 99 条一分钟内就推理完了,最后一条却要推理 100 分钟。这个过程中,其他卡的资源相当于闲置了,所有人都在等最后一条,所以就需要在 Infra 上改进,让这批数据训练得更快。
Infra 就是算法,也很好理解。以 SFT 为例,如果现在要训练大尺寸模型,就需要在 GPU 层面或者模型并行层面做大量并行,才能训练这么长的轨迹。
从现在的观点看,算法已经比较稳定,Inference 在基本层面上也比较稳定。当然,这是一个跟着需求走的过程。如果未来推理一条数据需要一天甚至几天,Infra 和算法层面都会发生修改。
所以数据是驱动因素。更难的数据会带来算法上的创新,也会要求 Infra 做出更 efficient 的设计。我个人觉得是这样的。
曲凯
未来大家还会继续追求更高的数据量吗?大家肯定希望数据更多,但是不是也没有那么多数据了?
合成数据会不会慢慢变成一种类似无限数据的东西?
孟繁青
无限数据倒不太可能。
数据的量目前确实在提高,但不会毫无节制地提高。高质量数据会一直存在,也会持续增加。目前还不至于说数据完全枯竭,因为 Agent 合成数据是一个新的来源。
而且当 Agent 的使用者越来越多以后,我刚才说的熵源也在提高,它会反哺我们合成更多、更好的数据,再反过来推动模型训练。
所以我个人觉得,数据量一定会增加,因为模型尺寸在增加;同时数据质量也会逐步提高。
曲凯
9. Distillation Is a Shortcut
聊到合成数据,就很难避免蒸馏的问题。很多人会把合成数据和蒸馏绑定在一起看。你怎么理解现在这种情况?
孟繁青
合成数据里,我们需要一个环境和一个问题,然后让 Agent 在里面探索。这个探索 Agent 有时候可以是外部模型,比如 Claude,当然也可以是内部模型。
如果使用外部模型,可能就是大家现在说的蒸馏。这里又要区分是硬蒸馏,还是有技巧的蒸馏。
硬蒸馏说白了就是环境太简单。比如做非常普通的数学题,直接把答案拿过来,类似于把老师布置的作业拿过来抄。
但如果环境足够复杂,对应的问题和评分方式都是正确的,而且足够高质量,那么仅仅搭建这一套环境、题目和评分机制,本身就是一件很有难度的事情。
有了这一套以后,当然可以得到更好的合成数据,或者说蒸馏数据。这就是有技巧的蒸馏。
曲凯
能不能理解为,合成数据如果用得好,对于相对落后的模型来说,价值远高于领先模型,因为它的学习 margin 更大?
孟繁青
这是肯定的,因为它的学习 margin 会更多。但对领先模型也是有用的。
曲凯
如果我已经是最领先的模型,我造了一个环境,然后用今天的模型自己去做,结果不是跟现在一样吗?
孟繁青
这就是 RSI。因为当你造出一套足够复杂的环境,以及对应的问题和评分方式以后,即使模型用自己在里面探索,拿到正确轨迹,再用这些轨迹训练自己,也是可以提点的。
曲凯
这件事是已经被证明了吗?它有什么明确原因,还是仍然是一个比较黑箱的状态?
孟繁青
说白了,这就是 RL 做的事情,是一个不断强化的过程。
曲凯
你觉得现在整体的模型状态、AI Lab 的状态处在什么阶段?
之前大家经历过一个时期,觉得 scaling law 是不是撞墙了。现在对做 AI 的人,尤其是 AI Lab 的人来说,是觉得空间还很大,沿着目前的路线继续做就能持续提升;还是觉得现有路线快要穷尽了,需要新的架构和技术路线?
孟繁青
10. AI Labs Move Beyond Coding
我觉得一方面,coding 这一块从年初到现在一直都是最重要的发力方向。
Coding 是智力的基础,相当于要持续提高模型智力的上限。这一块的增长虽然仍然很快,但整体 pipeline 可能已经相对稳定了。
所以 AI Lab 也会探索其他技术路线,比如 Auto Research。像 Claude、OpenAI 都会在 Auto Research 上投入,它们可能会用 Auto Research 去服务 AI for Science。
这其实就是一些新的技术路线。
曲凯
AI for Science 你们有在接触吗?最近这个方向也很火。字节最近推出了 100 位科学家的计划,Anthropic 也在做。
但理论上,AI for Science 好像跟模型本身并不处在完全重合的一层。你怎么看?为什么大家开始在这上面发力?
孟繁青
现在大家也开始提 Auto Research 了。你可以看到,千问、Kimi 发布的报告里,都会有一个很长、不断改进任务的过程。
它们可能大部分是在写 GPU kernel。AI for Science 也是类似的,比如让大模型去设计分子结构、蛋白质等东西。
一方面,这体现了模型的智力;另一方面,这也是比较直接的应用。
曲凯
我看 GPT 最近在 P2 上发布的新模型,流出来的信息是,它做数学题、解决数学猜想,已经到了一个新的层面。
因为仅从 coding 这个层面,已经无法充分体现模型的智力了。Science、STEM 这些领域,本身就是衡量模型智力的一个直接方式。
也就是说,已经从奥赛转向诺贝尔奖了。
孟繁青
对,这些都是在讨论模型智力。模型厂商需要找到这些场景,去展示模型的能力。
曲凯
所以你整体上觉得,目前 AI Lab 的状态仍然是未来有非常大的空间,大家继续做就好了?
不像 2024 年大家需要 o1 一样,现在不太需要这种东西了?
孟繁青
模型厂商的模型增速一直都在。
但这个模型增速背后,到底需不需要这么多 research engineer,或者 research engineer 现在的高薪能不能一直维持,这个可能不一定。
曲凯
听起来,很多东西已经确定了,在既有路线上继续做就好了。
孟繁青
一定程度上确实是这样,coding 就是如此。
曲凯
长期来看,如果把字节、腾讯、阿里这种资源和卡都很多的大厂分为一类,其他新的 AI Lab 分为一类,你怎么看这两类公司的发展?
孟繁青
我个人可能还是更 prefer 初创公司这一边。
技术一直在公司之间流通,大家技术水平上的差异可能不会特别大。背后真正的差异,可能在人。
曲凯
但按我们刚才讲的,技术路径虽然会不断迭代、出现新的东西,但短时间内大家就会统一,形成共识。最终是不是还是拼卡?
孟繁青
我觉得也未必。我反而觉得最后可能会归结到组织形态上。
当大家都懂技术以后,怎样设计组织,让公司作为一个整体跑得更快,我以前可能没有感觉到,但现在觉得这还是一门很有学问的事情。
曲凯
就是你刚才提到的,比如多模态要不要单独划出来。
现在也有人说,智谱做得好,是因为没有分很多精力去做多模态。也有人说,多模态,甚至世界模型,都不在智力主线上,做这些事情并不会提升模型智力,只有 coding、数学这些事情才能提升模型智力。
你怎么看?
孟繁青
这个观点可能有点绝对。我并不觉得多模态不重要,而且我也觉得它应该放到主线上。
只不过基于目前的资源考虑,不能一开始就进行全模态优化。多模态的发展相比文本慢很多,因为文本信息经过了高度压缩,本身学习起来也会比较快。
多模态信息里的噪声会更多。但我觉得,动态信息之后也会变得越来越重要。因为当 AI 想进入物理世界,它就不仅仅需要视觉,还会涉及听觉、触觉等各种信息。
曲凯
最后问一个可能比较敏感的问题:你觉得蒸馏对于国内模型追赶的意义,到底占比有多高?
孟繁青
我不说具体占比,但我觉得蒸馏不是国内模型变强的决定性因素。
就像我刚才说的,国内模型变强,一方面来自底层架构创新。现在大家比较共识的观点是,预训练负责学习知识,后训练则是在预训练分布上做分布 shift。
也就是说,模型本来可能已经会了,后训练只是让它答对的概率更高。从这个角度来看,模型智力的基础来自预训练。
我个人觉得,国内在预训练上做得比较好,比如 Kimi 的 Muon 优化器,以及各种各样的创新。我认为这是国内模型追赶最主要的因素。
后训练方面,蒸馏是国内公司的一个加速手段。不是说没有 Claude 的 API,国内公司就做不出这件事。
一方面,国内自己的模型也很强,可以用自己的模型做合成数据。另一方面,国内人也很多,如果真的下决心做数据积淀,也不见得做不出来。
曲凯
也就是说,能蒸馏最好,不蒸馏也可以。
孟繁青
对。蒸馏只是因为现在国内公司竞争非常激烈,所以作为一个加速手段,但它不是绝对必要的。
曲凯
比如 SuperCLUE 经常讲国内模型蒸馏的问题。按照你的说法,即使有一天所有蒸馏的渠道都被封掉,也不影响国内模型继续追赶,只是会更费劲一点。
孟繁青
对,我个人是这么觉得的。
曲凯
那如果这样,为什么字节一直不愿意蒸馏,或者一直对外说自己不蒸馏?蒸馏的坏处是什么?
孟繁青
蒸馏相当于抄近道。你可能会因此偏离自己的主路径,遗漏在主路上本来会发现的一些 insight。我觉得他们可能有这方面的考虑。
曲凯
所以仍然可以理解为,蒸馏是一个工具,关键在于怎么用好。它本身其实没有什么问题。
那我们今天聊得差不多了,最后再讲一下你们现在正在做的事情。
我们今天聊了很多新的模型、数据,以及比较敏感的蒸馏问题,也把现在 AI Lab 面临的各种情况和问题讲得比较清楚了。你可以最后介绍一下你们正在做的事情,以及未来的一些规划。
孟繁青
11. Evolvent AI Strategy
我们是一家初创公司,名字叫 Evolvent AI,基本上运行了半年左右。目前团队主要以 00 后 researcher 为主。
现在主要聚焦两块,但这两块并不割裂。
一块是合成数据,包括合成数据合作和商业订单。我们在做合成数据的同时,也会做一些 benchmark,这相当于在学术界进行一些探索。
另一块是长期来看做 RSI。
我们做 RSI,跟其他做 RSI 的公司有一些不同。我们不会聚焦于做 RSI 专用的技术模型,也不会专门做一套 RSI 方法。
具体原因刚才已经讨论过了。我们最终想做的,是一个连接模型厂商与应用公司的中间层。
我们最近发布了一个 benchmark,叫 RSI Bench Data。它是在这个平台内,针对 data 这件事进行 RSI 的初步探索。大家如果有问题,也可以跟我们交流。
曲凯
你们现在有招人的需求吗?
孟繁青
招人一直都是开放的。如果有兴趣,直接给我发邮件就可以。
曲凯
同样是 researcher,你觉得什么样的画像最值钱,是你们特别喜欢的?
孟繁青
对于 researcher,我们可能不会看很多量化指标,比如发了多少论文、引用多少次。
我们比较关心的是他的工程能力怎么样。我现在个人会觉得,一个工程能力比较好的人,比一个学术能力很强的人更好。
曲凯
好,谢谢,谢谢。感谢谢谢。本期节目到这里。