[BidClub_]
42章经 · · 59 min

从蒸馏到合成数据到 RSI,模型竞争的下一个焦点是什么?|对谈 Evolvent AI 联创孟繁青

曲凯孟繁青

Podcast
TL;DR
  • SI/RSI 与 Auto Research 被孟繁青视为模型竞争的下一阶段焦点,但他不认为会诞生独立的“RSI 基础模型”。self-evolving、Auto Search 与 RSI 都可形式化为“环境+目标+反馈+持续迭代”;真正影响 RSI 能力的,仍是现有基模内化的 world model、value model,以及更长的 context。创业公司的机会更可能是桥接模型厂和应用,而非再造基模。
  • 国内追赶的决定性因素不是蒸馏。孟繁青认为,Kimi K3 在国内可用算力可能只有国外十分之一,反而逼出了 Kimi Linear、DeepSeek“Multi-Layer Attention”等可 scale 的底层创新;蒸馏只是竞争激烈时的“加速手段”,即便通道被封,追赶会更费劲,但不会因此中止。
  • Post-training 已越来越接近造数据:模型厂内部把 SFT 等流程封装成服务后,普通算法研究员主要提交数据即可。真正稀缺的是数据正确性、难度、轨迹与分布上的 know-how;数据质量只能初筛,“正儿八经看它到底能不能 work,还得去训练”。
  • Benchmark 正从试卷变成工作环境。过去只测“模型大脑”,现在要模拟 Notion、飞书等软件,让 Agent 在长程任务中同时展示推理和操作能力,再按多个得分点验证结果;这使 benchmark 更接近产品和商业化的平台。
  • 普通 Agent 合成数据的高价窗口接近尾声。长程合成任务单条可卖到好几千,专家做题数据约一两千量级,但模型厂自制能力增强、优质 benchmark 收敛,外采需求会减少;下一波可能是 RSI 数据——例如让一个模型后训练小模型并完整记录轨迹,单条生成就要十几小时甚至一天。
  • 通用 Harness 的独立空间有限,垂域仍有经济账可算。coding 等通用领域更可能由模型与模型厂自有 Harness 配套提供;垂域则可让强模型指导较小的开源模型自进化,再以更低成本、更快速度和更强隐私性运行。“写 Harness”可以交给最强模型,但不等于运行时必须持续购买最强模型。
  • 长期壁垒可能从卡和人才转向组织吞吐量。模型发布大概率继续交替领先,技术会在公司间流通;当技术路径快速收敛,谁能合理组织 pre-training、多模态与 Infra,决定整个公司能否跑得更快。模型智力的展示则正从 coding 延伸到 Auto Research 和 AI for Science——曲凯概括为“从奥赛转到诺贝尔”。
Digest · the substance, structured for research

1. Post-training 创业者的机会在模型厂之外,而不是复制模型厂

  • 孟繁青是 NUS 博士生,曾在 Kimi 从事 Agent 与相关 Infra,参与 Kimi Linear、K2.5 等模型发版;创办 Evolvent AI 约半年后,他把方向收敛到 RSI 与合成数据,团队以“00 后 researcher”为主。

  • 从 Kimi 到创业公司的最大变化,是训练基模在大厂内已高度工程化,研究员更多是在稳定流程上生产数据;创业后则必须从零搭建平台,并寻找与模型厂商主线 更正交的切入口,做实际应用更需要的东西。

  • Pre-training 人员创业较少,并非能力问题,而是其日常工作围绕模型架构、优化器与大规模计算展开,离开算力很难复现研究条件;Post-training 更贴近合成数据、Agent 和 benchmark,也就 离落地与收入更近。

2. Benchmark 已从“让模型做题”升级为模拟真实工作的环境

  • 孟繁青把旧 benchmark 比作考试:给模型一道数学题,看最终答案是否正确,本质上只测“模型大脑”。新一代 Agent benchmark 则要搭建完整工作环境,让模型像白领一样操作飞书、Notion 等工具,既动脑也动手。

  • 这种环境首先要证明自己足够真实:例如模拟的 Notion 与真实 Notion 在相同输入下是否产生相同输出。只有环境行为对齐,Agent 在其中得到的成功、失败和训练轨迹才有意义,环境本身就是测量的一部分。

  • 新任务也不能再用一个答案做二元判定。孟繁青提到,当前许多 benchmark 会拆成多个细小得分点,评分器、题目和环境都需要精细设计,现实中仍是 人和 Agent 一起 check。

  • 这也解释了 benchmark 的商业价值:一个足够好的 Agent bench 不只是论文题库,它已经包含可运行的软件环境、任务系统和验证机制,工程实现更接近实际产品,因而更容易转化成 平台型商业模式。

3. 训练流水线正在商品化,数据判断力才是 Post-training 的核心资产

  • 在模型厂内部,SFT 已被封装成服务:研究员提交数据请求,远程系统完成训练,最后返回结果,不必亲自找 GPU、拉 GitHub 仓库或配置环境。孟繁青因此承认,普通算法研究员的 训模型门槛显著下降;真正构建服务的 Infra 人员仍面对大量难题。

  • 他不认同“Post-training 因此只是枯燥的数据劳动”。从 Transformer 到基于可验证奖励的 RL,技术演进本就在趋向更简单、直接、面向结果的形式;算法技巧收敛后,研究的本质自然暴露为:到底给模型什么数据。

  • 数据通常围绕目标 benchmark 设计,最直接的判断是能否在不作弊、不 hacking 的情况下提分,同时不能牺牲写作等其他能力。训练前只能检查正确性、轨迹是否作弊、难度是否适中;太简单没收益,太难又学不会,最终仍是“训了才知道”。

  • Evolvent AI 的 RSI Bench 显示,Agent 已能修复机械问题,例如发现一批训练数据使输出格式出错后自动调整;但它暂时不能提出研究员式的造数 insight。孟繁青的判断是,数据 know-how 仍在人手里,不同研究员造出的数据确实会得到不同模型结果。

4. 国内的资源约束反而逼出了 Pre-training 架构创新

  • 孟繁青观察到,国内模型与海外的差距正在缩小:例如 Kimi K3 在国内可用算力“可能只有国外十分之一”的情况下,发布结果已接近 frontier;但海外实验室可能仍有未发布的储备,因此真实时间差很难精确估计。

  • 他把国内追赶拆成两条路。第一条是 Kimi、DeepSeek 在 Pre-training 层做底层创新,例如 Kimi Linear 和 DeepSeek 的“Multi-Layer Attention”,目标都是用更少计算取得更好效果,同时不过度损失性能和推理速度,属于 资源倒逼创新。

  • 他甚至认为,全球真正得到公司内部规模化验证的新架构并不多;Kimi、DeepSeek 至少证明了自己的方案具有 scale 能力,而 Mamba 等海外架构尚未得到同等程度的采用。这个判断并非他声称的行业共识,而是 他与部分朋友交流后的看法。

  • 相较之下,国内 Post-training 可能反而更弱,弱点不在算法人才,而在数据积淀:Claude、OpenAI 等海外厂商起步可能早了半年。数据积累依赖持续人力与组织流程,时间差比单点算法差更难补,蒸馏因此成为快速补数据的工具。

5. 模型会交替登顶,真正体感与榜单排名并不是一回事

  • 孟繁青预计,国内开源模型将长期呈现 轮流 Top one 或 Top two:一家发布大版本后暂时领先,几个月后另一家的新版本再超过它。单一架构创新会制造时间差,却很难保证某家公司一路领先。

  • K3 的大参数规模被他视为重要贡献,因为在当前数据规模下,继续 scale 参数仍能获得收益;其他厂商能够追赶,但需要时间和相应 Infra。规模路线并非不可复制,却也 不是看见参数表就能立即复刻。

  • 榜单之外,孟繁青说从实际使用体感来看,GLM 确实长期领先;他虽不了解智谱内部细节,但从同行交流判断,其 coding 优势主要来自 Post-training 数据做得更好。对于字节,他认为追上当下 frontier 是时间问题,能否持续缩小与最新 frontier 的差距则不好说。

  • 人才可被高薪吸引、数据也能靠投入积累,卡仍重要,但孟繁青最终把长期差异落在 组织架构:混元调整组织后进步明显;多模态是否单独设部门、是否与 Pre-training 合并,都会改变公司整体的迭代速度。

6. Self-evolving、Auto Search 与 RSI 本质上是同一个闭环

  • 孟繁青给出的统一定义是:向模型提供一个工作环境和目标,让它持续操作,根据结果反馈修改之前的行为,再尝试突破原有上限。无论叫 self-evolving、Auto Search 还是 RSI,形式上都是 环境—行动—反馈—再行动。

  • 这个闭环可以发生在不同层次:最表层是结果交付前让模型自检或换模型复核;中间层是 Harness 自动组织多步工作;更深层则是模型自己生成数据、修改训练过程,最后训练出更强的自己。孟繁青个人理解这些都可以算作 ASI,但大众通常把 RSI 更专指模型自迭代。

  • Auto Search 可能表现为反复优化 GPU kernel,RSI 则可能覆盖 Pre-training 与 Post-training。孟繁青引用一种 AGI 判据:模型能否“从零复刻出一个自己”;若复制出的模型进一步超过原模型,才构成真正意义上的递归式自我改进。

  • 合成数据不是 RSI 的终点,而是其中间产物:完整自我改进还可能同时修改数据、算法和架构。Evolvent AI 的实验已看到 Agent 在数据层拥有有限自进化能力,但从“会修格式”走到“会提出训练 insight”,仍有明显距离。

7. Harness 不会消失,但通用市场与垂域市场将走向不同结构

  • 模型厂正在把模型与自己的 Harness 配套发布,例如 Kimi Code,以及孟繁青所说 DeepSeek 内部尚未 release 的 Harness。因为 Post-training 时模型输出会经过这套系统,反向传播会让模型越来越适配它,形成 模型与 Harness 的共同适配。

  • Harness 因而会变简单,却不会凭空消失。对 coding 等通用领域,孟繁青认为第三方 Harness 没有太大存在必要;模型厂更可能把模型与自有 Harness 一起提供。

  • 垂域的经济账不同:很多任务不需要 Claude 级别的最强模型,可以让强模型指导较小的开源模型和简单 workflow,在特定场景中完成自进化,随后只部署小模型,以换取 更低成本、更快速度与数据隐私。

  • 曲凯的追问是:若模型已能训练自己,当然也能编写垂域 Harness,是否终究仍是“模型吃到一切”?孟繁青区分了编写者与运行者——强模型可以写 Harness,却不代表运行时必须用它。曲凯还提到 GPT 好像刚降价 80%;孟繁青提醒,降价也受开源与竞争驱动,若未来出现垄断,价格未必一直下降。

8. RSI 不需要一套专用基模,它更像由现有模型执行的聪明搜索

  • 面对“既然能自我研发,为何创业公司不直接做出比 OpenAI 更好的基模”的质疑,孟繁青给出的判断是:所谓 RSI 基模其实就是模型厂正在训练的基模。另做一套 RSI 专用基模或专用 Harness,在他看来都没有意义。

  • 他把当前 RSI 方法概括为“更聪明版本的 DFS”:模型尝试一个方案、取得评分、遇到坏反馈后回溯,再选择另一条路径。与代码写死的深度优先搜索不同,LLM 会判断回溯到哪里,并提前剪掉明显无效的分支。

  • 剪枝要求模型预判一次操作会带来什么未来状态,以及该状态的潜在收益,技术上对应 world model+value model。孟繁青认为两种能力已在基模预训练中被内化;RSI 变强主要依靠知识内化得更好,以及 context window 继续变长。当前最高长度他说可能到 1M,更长的 context 能让模型记住更多探索并回溯得更远。

  • 因此 Evolvent AI 想做的是模型厂与应用公司之间的 RSI 通道,而非与模型厂正面训练基模。曲凯推演未来模型公司或许只需十到二十人,孟繁青只接受“结果上可能如此”,并强调现实中的组织与多方面约束未必允许规模极端收缩。

9. 数据产业已从普通标注、专家标注走到 Agent 轨迹

  • 第一阶段是以 Scale AI 为代表的普通人标注,数据量较小、任务相对简单;第二阶段转向专家数据。o1 出现后,模型推理能力跃迁,2025 年初模型厂一度大量寻找数学、物理专家。

  • 专家门槛随后被模型能力推高:过去只需解题,现在还要出题,而且题目不能与市场上已有问题重合。孟繁青说这已经“太难了”,所以专家数据仍有需求,却不会恢复到此前的规模,普通高噪声 raw data 则更多服务于 Pre-training,新增需求也已下降。

  • Claude Code 之后,模型从聊天机器人、超级做题者进一步变成同事,数据形态也转向 Agent 长程轨迹。合成路线是搭环境、设目标、让模型探索并保存完整轨迹;真人路线则记录人在真实工作软件中的交互过程。

  • 真人数据来自真实工作环境,但噪声高、需要清洗,还涉及合规;合成轨迹若环境、题目和评分器都设计正确,可以直接用于训练。个人用户想出售日常 AI 使用记录,孟繁青的回答很直接:“卖不出去”,原因正是数据太脏且存在合规障碍。

10. 当前合成数据订单趋近尾声,下一波是能训练模型的 RSI 轨迹

  • 节目给出的价格感知是:复杂、长程的合成任务,单任务能卖到好几千;做题类专家数据约一两千量级;真人操控轨迹通常按规模采购,没有稳定的单条价格。

  • 模型厂自己当然也造合成数据,但自造数据可能带有自身 bias,因此仍会从外部采购高质量样本以补充分布。随着优质 benchmark 数量收敛,厂商可以集中内部资源覆盖少数核心榜单,外部订单自然 从多多益善转向精选补充。

  • 孟繁青判断,普通 Agent 数据这一波已经接近尾声,重人力的专家标注公司会受到筛选。数据公司若想追上需求变化,必须拥有一线 hands-on researcher,能理解模型训练和新 benchmark,而不是只靠 扩大标注人力。

  • 下一波可能是 RSI 数据:例如让一个模型完整后训练另一个小模型,并把效果提升过程保存成轨迹;单条生成就可能运行十几小时乃至一天。Evolvent AI 现阶段用合成数据业务提供现金流,也借此积累 know-how,反哺 RSI Bench Data 与长期平台能力。

11. “算法就是数据,数据就是 Infra”不是玩笑,而是同一训练瓶颈的三面

  • 孟繁青认可“算法就是数据,数据就是 Infra,Infra 就是算法”的说法:当 RL 等算法逐渐收敛到较简单、统一的形式,团队之间的差别便更多体现为喂了什么数据,以及能否高效处理这些数据。

  • 他用一个长尾例子解释 Infra:一批 100 条数据中,前 99 条一分钟内推完,最后一条却要 100 分钟;同步整理和训练意味着其他 GPU 都在等待最后一条。如何在 Infra 上处理这种长尾,直接决定 训练速度与算力利用率。

  • 当轨迹越来越长,大尺寸模型的 SFT 又要求更多 GPU 和模型并行策略;若未来一条推理要一天甚至数天,数据需求反过来会迫使算法和 Infra 重构。因此并非三者界限消失,而是 更难的数据持续驱动另两层创新。

  • 合成数据也不会真正无限:数据量会增加,但不会毫无节制。Agent 用户越多,使用产生的“熵源”越丰富,能反哺更好的合成任务;孟繁青预计数据量会随模型尺寸增加,质量也会逐步提高。

12. 蒸馏是追赶工具,不是国内模型变强的决定性来源

  • 合成数据需要一个 Agent 在环境中探索;若 Agent 使用 Claude 等外部模型,就构成通常所说的蒸馏。孟繁青把简单数学题式蒸馏称为“把老师作业拿过来抄”,环境太简单时,教师答案几乎就是全部价值。

  • 真正“有技巧的蒸馏”先要造出复杂环境、足够好的题目和正确评分器,再让外部模型探索。此时数据生产者贡献的不只是调用 API,而是一整套任务与验证系统;落后模型因可学习的 margin 更大,获得的收益 更大。

  • 领先模型也能在自建环境中探索出正确轨迹,再用这些轨迹训练自己并提点。孟繁青把原因归结为 RL 的持续强化过程:教师和学生可以是同一个模型,所以 合成数据并不必然依赖更强外部教师。

  • 他认为国内模型的智力基础主要来自 Pre-training 的架构、优化器和知识学习,Post-training 只是对原分布做 shift;蒸馏是加速手段,“能争最好,不争也行”。若所有通道被封,追赶会更费劲但仍能继续;他推测字节谨慎蒸馏,可能是担心走“抄近道”而错过主路上的 insight。

13. 模型智力正从 Coding 延伸到 Auto Research,组织能力将决定谁跑得更快

  • Coding 从年初以来一直是模型厂提升智力上限的主线,增长仍快,但训练 pipeline 已相对稳定;Claude、OpenAI、千问、Kimi 等开始探索 Auto Research,让模型在长任务中不断修改方案,寻找 新的能力展示与训练路径。

  • AI for Science 同样符合这一结构:让模型设计分子、蛋白质等,既是相对直接的应用,也是新的智力标尺。曲凯把变化概括为“从奥赛转到诺贝尔”;孟繁青也指出,当 coding 已难充分区分模型时,科学任务承担了 benchmark 和 PR 的双重角色。

  • 孟繁青反对“多模态不在智力主线”的绝对判断。文本经过高度压缩,学习更快;多模态信息里的噪声更多、发展较慢,却是 AI 进入物理世界不可缺少的输入。资源有限时不应无差别全模态优化,但多模态应 放到主线上,而非完全割裂。

  • 模型能力仍会增长,却不代表模型厂永远需要同样多的高薪 researcher。孟繁青更偏好初创公司:技术会在公司间快速流通,最后比的是组织如何让整体跑得更快。Evolvent AI 因而选择合成数据与 RSI 桥接层;招聘时也不以论文、引用量为首要指标,而更看重 工程能力。

曲凯

我们最近聊了很多跟模型算法相关的人,因为这块也非常热,所以今天很开心请到 Evolvent AI 的联创孟繁青。可以先给大家简单介绍一下。

孟繁青

非常感谢曲老师的邀请。我是孟繁青,NUS 博士生,同时也是 Evolvent AI 这边的联合创始人。我主要负责的是 RSI 这个 research 方向。

我之前在 Kimi 有过一段比较长时间的实习经历,当时主要做 Agent 和 I/O,偏 Infra 方向。在 Kimi 期间,我参与的工作包括 Kimi Linear 以及 Kimi K2.5 等重要模型的发布。

从 Kimi 离开之后,我和一些朋友合伙创业,成立了 Evolvent AI。这家公司目前的一个大方向,就是主要聚焦在 RSI 这条线上。

曲凯

我觉得你的背景其实是现在一批特别热门的创始人身上很典型的画像:非常年轻,PhD 还没有毕业就开始创业,而且做的事情跟你之前在 Kimi 做的也算是 post-training,对吧?

我觉得这一批人现在出来创业的非常多。所以你最近这一年——创业算半年,对,差不多小半年——实际感受怎么样?

孟繁青

1. Post Training Founders

我会觉得,在大厂和创业公司做事情,确实有比较大的不同。一个很典型的点是,我在 Kimi 其实主要是去训技术模型,但到了后期我会觉得,训练推理模型这件事在大厂内部其实已经是相对比较工程化的事情了。

所以我当时的主要工作,也会去做一些合成数据。因为整个训练流程,包括推理流程,在内部都已经比较稳定了。

那么来到创业公司以后,我们肯定就不训练基模了,而是需要找到一些与模型厂商更正交的切入点。同时,我们也需要从零搭建一些平台类的 Infra,方便内部使用。

这是一个比较大的不同:我们可能并不是 focus 在推进模型治理,而是说我们是去做跟模型治理正交的,但是可能是实际应用更有用的东西。

曲凯

我发现做 post-training 的人现在创业比较多,pre-training 的好像很少。

孟繁青

这其实很好理解。做 pre-training 的人每天主要打交道的,要么是数据本身,但现在 pre-training data 已经相对饱和了;要么就是模型架构、优化器之类的东西。

而搞这些东西相当消耗资源,所以出来创业以后,初创公司比较难覆盖这一块成本。因为他做的一切事情,都是建立在算力基础之上的。

曲凯

那 post-training 的人出来创业,你觉得他们比较擅长、也比较适合做什么?

孟繁青

从目前来看,整个 post-training 基本上跟两件事情相关。一个是合成数据,合成数据是 post-training 很重要的一块。相比于预训练,post-training 对合成数据的要求是更精细,但数据量不会像预训练那么大。

另外一块其实是做平台。平台听起来稍微比较抽象,用白话说就是做 benchmark。

2. Benchmarks Become Environments

Benchmark 发展到现在,已经不是我们在 2024、2025 年看到的那种出很多题,让模型直接回答。现在的 benchmark,可能像一些 agent benchmark 一样,需要模型在它提供的环境里进行很长时间的探索,去完成一个任务。

这相比于预训练那种偏研究的模式,会更加落地。因为一个足够优秀的 agent benchmark,通常意味着工程实现也会比较好,相对而言,转化成商业模式会更简单。

所以我觉得,这就是为什么 post-training 的人更喜欢做 Agent 和 benchmark。它们本身离落地更近,因此这类人的创业也会更多。

曲凯

我觉得你说 benchmark 的白话还不够白。今天的 benchmark,跟之前的区别到底是什么?

孟繁青

之前的 benchmark,可以理解成做数学题:我有一道很难的题,让模型直接回答。它相当于一个考生,但这个考生没有日常生活中的环境。

举个例子,白领在日常工作中要完成一件事情,不只是靠大脑,还需要动手操作飞书、Notion 等各种软件。以前的 benchmark 主要测模型的大脑,现在的 benchmark 则相当于把这一部分模拟出来。

比如针对白领,我们会搭建一个模拟办公软件的整体环境,然后让 Agent 在里面完成某些任务。这样一来,模型不仅需要有做数学题那样的推理能力,还需要有跟各种工具交互的动手能力,最后才能把这件事情完成。

曲凯

但你看,之前做题,包括 coding,它的可验证性其实更强,也更简单。最后对一下结果,对就是对,不对就是不对。

那如果我建了一个环境,最终怎么评判这个结果的好坏呢?

孟繁青

这相对于原来会复杂一些。原先我们出一道题,首先要保证这道题是正确的。现在也是类似的:当我们造了一个环境以后,需要确保我们造的环境跟真实环境之间是相符的。

一个比较简单的例子是,环境里我们造了一个 Notion,真实世界里也有一个真实的 Notion。那么在同一个输入下,这两个环境的输出是不是一样?如果一样,就可以证明我们造的环境是正确的。

另外一块是我们出的题,以及跟这道题配套的检查。现在的检查不会像数学题那样简单,不是只判断答案是否相等,而是会拆成很多维度。

现在很多 benchmark,像我们之前做的 CrawlMark,或者目前大家在测的 AutomationBench,检查都分成非常多的小得分点。这些得分点目前仍然比较依赖人的精细设计,最后还是需要人来做检查。也就是说,实际上是人和 Agent 一起完成 check。

曲凯

3. Data Quality Sets the Ceiling

我最近听到一个说法:post-training 的人其实每天主要就是在做数据。

孟繁青

确实。现在模型厂商对于整个 training 生态已经做得很完备了。

比如在模型厂商之外,如果一个人想训练一个 SFT 模型,可能要去 GitHub 上找一个仓库,再找 GPU、配环境、整理数据,然后训练模型。

但在模型厂商内部,如果一个研究员想 SFT 一个模型,根本不需要这么复杂。因为模型厂商已经把这一套生态做成了服务。形式上,我只需要提交一个请求,服务就会在远程处理 SFT,最后把结果交给我。

对我来说,即使我是一个什么都不会、根本不知道 SFT 是什么的人,我要做的也只是把数据做好,然后就可以直接走完这一套完整流程。

曲凯

所以有人会讲,post-training 是不是相对比较枯燥、无聊的工作,就是认真把数据做好?以及现在所谓的训练模型,门槛是不是没有大家想象得那么高?

孟繁青

后一个问题我是认可的。训练模型这件事的门槛,确实在很大程度上降低了。当然,这是对大部分算法工程师来说的。

比如做 inference,实际上相当于是在构建服务的人,这里面还是有比较多坑的。但如果是大部分普通算法工程师,门槛确实会降低。

至于它到底是不是枯燥乏味,我觉得不一定。所有东西按照发展来看,都会越来越简单、越来越直接,越来越面向结果。无论是模型架构为什么最终发展到 Transformer,还是 RL 为什么最终过渡到 DeepSeek 提出的、基于可验证奖励的 RL,本质上都是这个规律。

所以 post-training 也是一样。它会发展到我们可能不再关注具体算法设计中的那些 tricky 的地方,而是直接关注最本质的事情:给模型什么数据。

而且,造数据本身其实也很难。不同的人,能造出来的数据是不一样的。我们最近也做了一些工作,做了一个 RSI Bench,在这个 benchmark 里讨论 Agent 到底能不能直接完成造数据、迭代训练模型这件事。

目前可以看到,Agent 还是只能做一些比较机械化的事情。比如我训练了一批数据,导致模型回答的格式错了,之后 Agent 发现问题并修改格式,这件事它可以完成。但它还无法提出所谓的造数据 insight。

现在模型厂的研究员在造数据方面有很多自己的 know-how,这也是目前的核心能力之一。所以不能说这件事本身是枯燥乏味的。

曲凯

同样的人,做出来的数据结果有好有坏,大概体现在什么地方?有没有具体的例子?

孟繁青

目前来看,这件事还是比较量化的,大概分为两个维度。

因为造数据一般也是针对给定的 benchmark,所以最简单的量化标准就是:在这个 benchmark 上,到底能不能在没有作弊,也就是没有 hacking 的情况下,完成提分。

曲凯

也就是在这个 benchmark 上的效果能提高。

孟繁青

对,这是最直接的一点。

当然还会有其他考虑。比如我针对代码 benchmark 合成数据,然后用这些数据训练模型,它会不会导致模型在写作等偏文科的事情上性能下降。

曲凯

但你说的是结果上的评判。对我来说,我想知道的是什么造成了不同的结果。

孟繁青

主要是他们合成出来的数据质量不同。

当我们还没有训练模型的时候,要评判数据质量其实比较难。我们只能用一些量化指标去评判,比如数据的正确性。

一般来说,我们有一个问题,以及一条模型轨迹,轨迹里会有一个答案。一方面要看模型轨迹里有没有出现类似作弊的情况;另一方面要看合成数据的难度是不是适中。

如果太简单,数据肯定没有用;但如果太难,模型也学不到什么东西。

曲凯

能不能换个角度理解:现在数据质量仍然是一个比较难评判的事情。最后还是得训练,结果好就是好,不好就是不好,然后再改。

孟繁青

对。很多数据质量检测指标只能做初筛,真正要看它能不能 work,还是得训练。

曲凯

对于一个模型来说,如果只看 post-training 部分,inference 的好坏和数据的好坏,你觉得重要性大概怎么分配?

孟繁青

目前来看,数据的好坏更重要。因为 inference 已经发展到了一个相对稳定的程度。

曲凯

我们刚才讲了很多相对介绍性的内容。你正好也刚从 Kimi 出来不久,现在 Kimi、MiniMax、智谱之间的竞争都很激烈,大家最近也在陆续发布新模型。

从你的视角来看,今天尤其是国内这些模型大概发展到了什么阶段?大家在竞争什么?

孟繁青

4. China Closes the Model Gap

我觉得目前国内模型和国外模型的差距,处在一个不断缩小的过程中。

比如我们可以看到,Kimi K3 在国内可用算力可能只有国外十分之一的情况下,已经发展到了接近 frontier 模型的水平。当然具体跟国外差多长时间,其实很难估计,因为国外那些厂商也会有自己的存货,可能还没有发布。但从它们 release 出来的结果来看,已经比较接近了。

我觉得这主要来自 pre-training。就像我刚才说的,国内模型厂拥有的计算资源远远少于国外,这就导致它们需要用这些更少的资源完成一个比较好的后训练。

国内基本上可以分成两种路径。一种是像 Kimi 和 DeepSeek 一样,在底层架构上做创新。比如 Kimi Linear 使用线性注意力机制,DeepSeek 的 MLA,也就是 Multi-Layer Attention,同样是一种注意力机制。

说白了,相对于原始的 Attention,这些架构更省计算量。这样就可以用更少的训练资源达到更好的效果,同时不会太损失性能和推理速度。

这相当于国内模型厂在有限资源下,逼出了一些 pre-training level 的架构创新,从而至少拥有一个不会落后太多的预训练模型水平。

另一方面是在 post-training 上。国内的 post-training,我觉得可能比国外稍微弱一些。当然,这种弱并不是技术实力上的弱,而是国外像 Claude、OpenAI 这些厂商,在数据上的积淀天然比国内早,甚至可能早半年。

国内在数据上的积淀相对少,所以目前绝大部分数据可能会通过蒸馏来补足短板。

曲凯

你说的其实跟我原本的预想还挺不一样。按你的说法,现在是国内的 pre-training 更有特色,而 post-training 反而比海外弱,对吧?

我个人原来会觉得,pre-training 部分海外的人才密度可能更高,卡也肯定比国内多;post-training 反而更偏工程,理论上应该是国内更有优势的部分。

孟繁青

我觉得是这样。现在我们可以看到,不仅是国内,全球范围内比较好的架构,主要也是 Kimi 和 DeepSeek 做出来的。

国外比如 Mamba,实际上没有多少人真正使用。Kimi 和 DeepSeek 的架构,至少已经在它们自己的公司证明了具备 scaling 能力。但国外的一些架构,比如 Mamba,一直没有证明它具备这种 scaling 能力。

曲凯

你觉得这是 AI Lab 内部大家公认的观点,还是比较个人的看法?

孟繁青

是不是公认我不太清楚,但我和一些朋友聊过,我们还是比较认同这个观点的。

曲凯

明白,这个挺有意思。而且我个人觉得,从现在来看,post-training 确实比预训练更像是一件工程的事情。

工程上的时间差,可能会更难弥补一些。国外更早有数据积淀,确实会做得更好。数据积淀本身又比较依赖人力和组织架构,相比于依靠研究员的聪明才智,优化起来可能更难。

所以 pre-training 有点像资源倒逼创新:海外可能本来也没有动力去做这些事情。

孟繁青

我觉得这是有道理的。

曲凯

那你觉得今天比如 Kimi K3 出来以后,大家都能看到它的各种榜单评分,反馈也很好。在此之前,智谱肯定是一路领先的。

你觉得后面的模型厂商会怎么变化?大家会交替领先,还是会怎么样?

孟繁青

基本上肯定会是这样:某一家发布一个大的模型版本,这个版本至少在开源社区里是 Top 1 或 Top 2。几个月以后,另一家模型厂商发布一个大的模型版本,就可能把它超越。

曲凯

所以不太存在某一家因为某种独特原因就一路领先,对吧?

比如 Kimi 和 DeepSeek 有自己的 pre-training 架构创新,但智谱发布下一版以后,还是有可能超过它们?

孟繁青

对。但这可能只是看 benchmark 的结果。如果说真正的体感,那也不一定。

从真正的使用体感来说,GLM 确实是长期领先的。

曲凯

我们可以挨家讲一下。你刚才提到 DeepSeek 和 Kimi,我们可以理解为它们的人才密度比较高,也在架构上做了一些创新。

我想补充问一点:Kimi K3 讲的是一个非常大参数量的模型,你觉得这对它的实际贡献有多大?

孟繁青

我觉得贡献显然很大。从 scaling law 的角度来说,在目前的数据规模下,扩大模型参数确实能拿到收益。这不仅是国内这样,海外也是这样。

曲凯

但其他家看到以后,也能很快追上吗?还是因为 Infra 或者各种架构的原因,没有那么容易效仿?

孟繁青

能追上,但肯定会有时间上的 gap。

曲凯

说到智谱,之前我们也在很多场合讨论过。我好奇你的视角:你觉得智谱前一段时间 GLM 在 coding 方面一直领先,核心原因是什么?

孟繁青

我其实不是太了解智谱这家公司。但我跟朋友交流时,会觉得智谱在 coding 数据上做得比较好。

曲凯

更偏 pre-training 还是 post-training?

孟繁青

Post-training。

曲凯

字节其实一直在 coding 上至少到目前还没有追上。你觉得这是不是也只是一个时间问题?

孟繁青

如果说它要追上现在的 frontier model,那肯定是时间问题。但它跟现在 frontier model 的差距到底是不是在缩小,这件事其实不太好说。

曲凯

我们最近也聊了很多人。我现在有一个感觉:在人才密度上,只要大家肯花钱,其实都能找到人。最近混元进了很多非常优秀的人,它们挖人也很厉害,这个趋势非常明显。

数据上也是一样,只要肯花钱、肯下功夫,大家可能没有特别本质的区别。那最后是不是还是拼卡?长期来看,或者中长期来看,如果拼卡,那大厂是不是优势最大?

甚至今天的 Kimi、智谱、MiniMax 等公司,长期仍然会面临非常大的挑战?

孟繁青

我个人觉得,拼卡当然是一个很直接的原因,但还有一层原因是组织架构。

从混元这个例子就很容易看出来,可能在之前没有改架构的时候做得比较差,但现在却突飞猛进。这一块我觉得更多来自组织架构的设计,也就是划分到底是不是更合理。

举一个比较简单的例子:多模态这个部门到底应不应该单独划出来?事实上现在大家并不会把它完全单独划出来,而是会跟 pre-training 进行合并。

曲凯

所以今天各个模型厂商到底在竞争什么?是架构创新、数据、Infra,还是其他东西?

孟繁青

从技术上来说,这几块肯定都有。

架构相当于你能不能在现有的有限资源里榨出更多东西;数据相当于你能不能在这些 benchmark 上达到更好的效果;Infra 则是保证内部迭代速度。

技术上的东西大家肯定都会竞争。更底层的,可能就是公司内部的组织架构。

曲凯

你觉得目前世界上有没有一个共识,认为下一个阶段最核心的点是什么?

孟繁青

5. Auto Research Takes Center Stage

我觉得有。现在的共识是做 Auto Design,或者把它叫作 SI。

曲凯

我们听到过非常多次,比如 self-evolving、自进化,还有 AI for AI,对吧?以及你刚才说的 RSI。这些其实都是一件事,也正好是你们现在在做的事情。

能不能先给大家解释一下,这几个词到底是什么?

孟繁青

不管是 self-evolving、SI,还是 Auto Research,形式化地说,都是给模型一个工作的环境和一个目标,看它能不能在里面持续操作,拿到结果反馈以后修改之前的操作,最终突破原来的上限。

曲凯

我理解这件事其实有几层可以做。

从最终产品输出的结果来看,之前就已经有人在做了。比如我先输出一个结果,但不给用户,而是先让模型换一个模型或者用其他方式再测一遍,最后再输出。这是最上层、最表层的部分。

中间的 harness 部分其实大家也一直在做,就是怎样让 harness 自己运转起来,自己去做很多事情。

还有我记得 Anthropic 等公司都在讨论,什么时候最终真的能够让模型层面的 AI 自己去训练 AI。你理解这几个都算 ASI 吗?

孟繁青

我个人理解都算。当然,从目前大众的理解来看,大家会把 RSI 更偏向于模型自己迭代自己,得到一个更强的模型。

而 Auto Research 可能是指:现在已经有一个很强大的模型,它能不能写出一个好的 GPU kernel。它在写 GPU kernel 的时候,会进行持续迭代。

但这两件事其实殊途同归,都可以形式化成:给模型一个环境和一个目标,然后让它在里面持续进化。

曲凯

听起来,让模型自己训练自己应该是最难的,对吧?这算是 pre-training 的部分吗?

孟繁青

它可以做成一整套。不管是 pre-training 还是 post-training,都可以包含在里面。

我之前听过一个观点:AGI 的一个概念,是看这个模型到底能不能从零复刻出一个自己。这其实就是一个很清晰的 SI 过程,只不过最终复刻出来的模型没有超越自己。

如果它能够复刻出一个超越自己的模型,在自己的基础上得到一个更强的模型,那就实现了 SI。

曲凯

我想再捋一下刚才说的几层。

最表层的迭代,我觉得是一个挺简单的事情,甚至一些基础工作、一些 prompt 就能完成。然后 harness 这一层,我想进一步理解一下。

现在也有很多人在说,模型可能会把 harness 一起训练进去。未来几年,是不是就没有 harness 这一层了,全部都变成模型自己的事情?

孟繁青

6. Harnesses Still Matter

我觉得未来不会没有 harness。现在可以看到,模型厂商基本都有自己的 harness。比如 Kimi 有 Kimi Code,DeepSeek 内部也有自己的 harness,只是还没有 release。

它们一般会把自己的模型和自己的 harness 一起发布。因为在 post-training 的时候,模型的输出是经过 harness 的;而在后训练过程中,通过反向传播,模型会越来越适配这个 harness。

所以这两个东西会配套出现,而不是 harness 消失。当然,我相信 harness 会越来越简单,这一点是肯定的。

曲凯

那你觉得未来几年,第三方 harness 还存在空间吗?

如果我是一个做应用的创业者,未来几年还需要做自己的 harness 吗?还是这部分责任会交给模型厂商?

孟繁青

可能会分两种情况。

一种是 general 领域,比如 coding,这一块确实没有第三方 harness 存在的必要。

但在一些垂直领域,情况可能不同。一方面,垂直场景根本没有必要使用模型厂商那么强大的模型;另一方面,也没有必要使用它们配套的 harness。

我可以用一个相对弱一点的开源模型,配上一个比较简单的 workflow,完成自己的需求。这样消费更少、速度更快。这种情况下,我觉得确实有必要拥有自己的 harness。

曲凯

但这里一直有一个疑问。你也在做 SI,肯定是相信这件事的。

如果真的相信 SI、相信 AGI,相信几年内能到达的话,既然模型都能训练自己,还有什么不能写的?我让它写一个垂直领域的 harness 不就好了?

孟繁青

对,是可以写。写完之后就使用这个垂直领域的 harness,不需要使用它自己的 harness。

曲凯

所以如果真的到了那一天,仍然会是模型吃掉一切的逻辑吗?还是垂直领域仍然会有价值和壁垒?

孟繁青

用一个强大的模型写 harness 当然没有问题。但问题在于,在垂直领域里,harness 背后的模型到底需不需要使用这个强大的模型,这件事未必。

随着现在 Claude 一次又一次发布新版本,普通用户其实已经很难体感到模型强度上的差别了。我们可能只能看 benchmark,而这些 benchmark 已经有点脱离日常使用了。

对于垂直领域来说更是如此。它可能根本不需要非常强大的模型,而是需要用强大的模型去指导一个比较小的开源模型,在自己的场景上进行迭代。

这其实也是一个 self-evolving 的过程:让小模型得到一个好的垂直领域模型,之后就只使用这个模型,不需要一直调用 Claude 这种大的模型。

曲凯

但这样的话,我还是在想,最终模型厂商的价值会怎么变化?

现在一些基础模型已经足够使用了,未来肯定会不断降价。不管是因为开源、Kimi、DeepSeek,还是其他原因。GPT 最近好像也刚降价了 80%,后面应该还会持续降,直到有一天,大家发现足够自己使用的模型已经接近免费。

孟繁青

这件事一方面是这样的:模型厂商降价,并不一定是因为成本真的降了很多,而是有商业模式上的考虑。

开源社区确实很强,又有竞争对手,所以它不得不降价。如果未来真的出现一两家垄断,价格也未必会一直下降。

另外,很多垂直领域有数据隐私的需求,所以它们不一定有很强的意愿去使用 Claude、GPT 这样的模型。

曲凯

但我觉得一两家独大,目前看起来不太会发生。

孟繁青

不好说。

曲凯

还有一个我没想明白、而且对你们尤其是做 RSI 的公司来说,可能比较 challenging 的问题。

现在市面上有很多所谓的 New Lab、RSI,或者 CFEVV[?] 在做这件事。那如果真的能够让模型自己研发自己,为什么不是直接瞄准做更好的基模?比如做一个比 OpenAI 更好的模型。既然模型能够自己研发、自己进化,那就让它自己迭代就好了。

这是第一个问题。第二个问题是,为什么不是模型厂商自己做出来?这应该也是现在所有大模型都很看重的一块,而且在它们的主路径上。

孟繁青

我觉得它的逻辑是这样的。

7. RSI Needs No Special Model

首先,RSI 基模这件事,跟模型厂商到底是正交的,还是跟模型厂商重合,我最近也在思考。最后我的判断是,RSI 基模其实就是模型厂商自己在训练的基模,只是原因可能比较复杂。

目前这些创业公司在做的事情,以我们为例,并不是要训练一个 RSI 基模,也不是要做一套 RSI 专用的 harness。这两件事我觉得都没有意义。

我们想做的是一些介于模型厂商和应用层之间的、建立 RSI 通道的东西。

曲凯

那 RSI 这件事的实现,最核心的点是什么?

我能理解的是,只要基模的 AI coding 能力越来越强,它慢慢就能做到这件事。

孟繁青

是这样的。不过我现在对 RSI 的思考可能会比较抽象。

现在有很多人在做 self-evolving,或者在 harness 上做方法。形式上来看,它可以被看作一个更聪明版本的 DFS。DFS 是一种算法,相当于它一直往里面探索。比如走迷宫,走到死路时,就回溯到上一个点。

为什么说目前这些人做的 RSI 方法,是一个更聪明版本的 DFS?因为模型现在可以写 GPU kernel。它写完一个 kernel 后,交给评分程序评分,得到一个分数。根据这个分数,它就拿到了反馈。

这类似于我们走迷宫时,有时候会走到一条死路;如果反馈不好,模型就会根据反馈回溯到某一个节点。在 RSI 或者 Auto Research 里,这个回溯是由 LLM 判断的,而不是像 DFS 那样通过代码判断的。

所以我觉得,现在做 RSI 的这些方法,本质上都是在做一个更聪明版本的 DFS,并且在 DFS 里加入了一些剪枝。这样就不会探索那些一开始看起来没有用的路径,而是把更多精力放到更有可能成功的路径上,从而提高 RSI 的效率。

这件事本质上要求我们剪枝,也就是预判某些操作会带来怎样的未来状态,以及这个未来状态会带来什么收益。从技术上来说,就是 world model 加 value model。

而这两件事情,在大模型预训练的时候其实已经被内化了。所以我个人觉得,并不存在 RSI 基础模型这件事。模型厂商在预训练模型的时候,已经把 RSI 所需要的能力内化进去了。

之后 RSI 会变强,本质上取决于我们有没有把模型知识内化得更好。还有一个因素是模型的 context window。现在模型的 context window 最高可能到 1M,如果它变得更长,就能记住更多东西,也可以回溯到更远的地方。

所以我觉得 RSI 可能主要来自这两块。

曲凯

按你的说法,你其实更看好现有模型自己去做 RSI,而不是 New Lab 去做这件事。对于 New Lab 来说,机会可能没有那么多。

孟繁青

对,没有 RSI 基础模型这个说法。

曲凯

我们假设——也不叫假设,现在大家肯定都在往 RSI 走。无论看海外模型还是国内模型,其实都在往这条路走。

如果有一天真的走到那一步,算法能够自我迭代、自我进化,而算力又在那里,那数据会不会反而变成瓶颈?还是到那个时候,数据也能够自己运转起来?

孟繁青

我个人觉得数据是可以自己运转起来的。

我们最近做的 RSI benchmark,其实就聚焦在数据层面的自进化上。我们确实可以发现,目前 Agent 已经在数据层面具备了一定的自进化能力,能够自己合成更好的数据。

曲凯

我们今天讲的很多东西,如果按照逻辑推理,最后可能会得到一些非常有意思的结果。

比如按照刚才的逻辑,最后模型公司可能只需要 10 个人、20 个人就够了。

孟繁青

从结果上看可能是这样,但实际还要考虑很多方面,也不一定会这么极端。

曲凯

8. The Synthetic Data Economy

最近很多人都知道,合成数据在国内也比较热。你们也在卖一些合成数据,对吧?

按照我们刚才的讨论,它是 RSI 的一个结果产出,还是 RSI 过程中的一个中间产物?这两件事是什么关系?

孟繁青

最终意义上的 RSI,是模型通过训练得到一个更好的自己。在这个过程中,它可能会改进数据、算法、架构等多个方面。

所以数据可能是 RSI 过程中的一个中间产物。

曲凯

我们经历过几波数据趋势。

第一波是 Scale AI 那一波,普通人标注数据就可以。那时候数据量本来就很小。后来以专家标注数据作为第二代。合成数据现在可以理解为当下第三个大的趋势。

孟繁青

我觉得是这样。当然,合成数据可能已经处在这个趋势的中后期。

曲凯

这三种数据现在是并行的,还是会有替代关系?

我知道现在大家其实也挺缺真人数据,会有人去采购真人数据。那真人数据跟合成数据之间又是什么关系?

孟繁青

ChatGPT 那一代数据,现在来说可能更多是用于预训练,属于 raw data,noise 比较多,所以这块的需求确实没有那么大了。

专家数据现在仍然有需求,但不会像 2025 年初那么多。因为当时 o1 出来以后,模型的推理能力发生了一次跃迁,大家非常希望有数学、物理专家提供他们自己的数据。

但现在这块确实在变少。主要原因是模型变得太强,对专家的要求也变高了。原来可能只要求专家做题,现在还要让专家出题,而且出的题不能跟市面上所有题重合,这就太难了。

现在比较重要的是 Agent 数据。模型从最初的聊天机器人,发展到 o1 这种推理能力很强的做题模型,再到 Claude Code 出现以后,模型开始真正成为你的同事,成为一个 Agent。

这就意味着我们需要 Agent 数据。Agent 数据主要分成两种:一种是合成数据,另一种是真人数据。

合成数据就是搭建很多环境,在环境里让一个模型接受目标、进行探索、完成任务,然后把整条轨迹保存下来。

真人数据则是让真人在自己的工作环境里产生交互轨迹。这些都是 for Agent 的数据。

曲凯

那现在合成数据和真人数据之间的价值关系是怎样的?

孟繁青

真人数据的 noise 也比较多,需要做清洗等工作。合成数据则相当于可以直接拿来训练。

曲凯

能不能给大家讲一下,现在一条普通标注数据、一条专家数据、一条合成数据,以及一条真人数据,大概分别是多少钱?

孟繁青

合成数据里,贵的可以卖到几千元,比如做题类的专家数据,可能也是一两千元这个量级。

至于真正的真人操控轨迹,有时候需要走量,所以没有单条价格的说法。

曲凯

你说合成数据好几千,单位是什么?他们花几千元买的到底是什么东西?

孟繁青

就是非常长程的任务,一条数据对应一个任务。

曲凯

合成数据听起来其实是模型厂商自己也应该能做的。它们为什么不自己做,而是还要向外采购?

我知道它们肯定自己也做,但为什么在自己做之外,还要到外面采购?所以合成数据的订单以后也肯定会越来越少,对吧?

孟繁青

对。数据这块现在还是多多益善。

我自己造了一批数据,里面可能有我自己的 bias。我肯定希望数据分布里的 bias 越少越好,所以可能还会从外面收一批质量比较高的数据,来补足分布。

曲凯

那为什么后面又会变少?

孟繁青

一方面,是现在 benchmark 越来越少了。以前 benchmark 非常多样,一个模型要测很多 benchmark,而且每个 benchmark 都要刷,需求自然就很多。

但现在模型越来越强,做一个好的 benchmark 难度也很高,benchmark 可能会收敛到只测几个做得最好的。所以模型厂商就有更多精力,专门去造这些 benchmark 的数据。

相对来说,对其他 benchmark 的需求就会减少。

曲凯

所以它其实是一波一波的。那你觉得下一波会是什么?

孟繁青

短期来看,可能是所谓的 RSI 数据。

举一个比较简单的例子,我们也在做:我有一个模型,用它去后训练另外一个小模型,把这个小模型的效果提升上来,形成一条轨迹。

这条轨迹已经超出了目前大部分数据的范畴,因为它在产生的时候,可能需要运行十几个小时,甚至一天。这种轨迹就是非常宝贵的数据,必须是有模型训练背景的人才能做。

曲凯

也就是说,这个数据行业的背景要求也在提高。

如果很多用户平时都在使用 AI,可能会产生很多数据。这些数据首先存在于他使用的中转站和模型里。如果他自己想卖,你觉得合理吗?能卖出去吗?

孟繁青

卖不出去。

曲凯

卖不出去,是因为你刚才说的太脏之类的问题吗?

孟繁青

对,而且也有合规问题。

曲凯

所以我的理解是,过去半年,包括你们以及其他一些公司,卖数据赚了很多钱,收入一下子涨得很快。但你觉得这一波在你看来已经快进入尾声了?

孟繁青

普通 Agent 的数据,比如 SWE-bench 那种 Agent 数据,确实已经接近尾声了。

所以数据行业变化非常快,也会对这些数据厂商进行筛选。之前大部分依靠重人力、做专家标注的公司,可能就很难活下来。反而是数据公司里有一些一线、hands-on 的 researcher,可能更能跟上数据变化的潮流。

曲凯

你们现在也在往 RSI 数据走。你们出的 RSI benchmark,主要就是为了这个?

孟繁青

数据是一方面,我们也不会只做数据。

数据一方面能带来现金流,另一方面也会反哺我们的一些认知,让我们获得更多 know-how,去做 RSI 这件事。

曲凯

但要做好 RSI,就回到刚才说的,你必须自己真的去训练模型。

孟繁青

对。但事实上,现在训练模型基本可以约等于造数据。

而且我们在造数据的时候,也会跟模型厂商合作。

曲凯

我记得最近有一个很流行的说法:算法就是数据,数据就是 Infra,Infra 就是算法。

我不知道你怎么看这个说法。它听起来像是戏谑,但好像又带着一点真相。

孟繁青

其实没什么毛病。

算法就是数据,是因为算法会收敛到最简单的形式。比如 RL 会收敛到 PPO。如果大家都用 PPO,那就要看谁的数据更好。

数据就是 Infra,也比较好理解,相当于你怎么把数据训练得更快。

比如现在有一批 RL 数据,训练慢的主要原因是推理时会有很多长尾。现在一般是先把一批数据推理完,再整理格式,然后导入训练。

但推理这批数据时,可能 100 条数据里,前 99 条一分钟内就推理完了,最后一条却要推理 100 分钟。这个过程中,其他卡的资源相当于闲置了,所有人都在等最后一条,所以就需要在 Infra 上改进,让这批数据训练得更快。

Infra 就是算法,也很好理解。以 SFT 为例,如果现在要训练大尺寸模型,就需要在 GPU 层面或者模型并行层面做大量并行,才能训练这么长的轨迹。

从现在的观点看,算法已经比较稳定,Inference 在基本层面上也比较稳定。当然,这是一个跟着需求走的过程。如果未来推理一条数据需要一天甚至几天,Infra 和算法层面都会发生修改。

所以数据是驱动因素。更难的数据会带来算法上的创新,也会要求 Infra 做出更 efficient 的设计。我个人觉得是这样的。

曲凯

未来大家还会继续追求更高的数据量吗?大家肯定希望数据更多,但是不是也没有那么多数据了?

合成数据会不会慢慢变成一种类似无限数据的东西?

孟繁青

无限数据倒不太可能。

数据的量目前确实在提高,但不会毫无节制地提高。高质量数据会一直存在,也会持续增加。目前还不至于说数据完全枯竭,因为 Agent 合成数据是一个新的来源。

而且当 Agent 的使用者越来越多以后,我刚才说的熵源也在提高,它会反哺我们合成更多、更好的数据,再反过来推动模型训练。

所以我个人觉得,数据量一定会增加,因为模型尺寸在增加;同时数据质量也会逐步提高。

曲凯

9. Distillation Is a Shortcut

聊到合成数据,就很难避免蒸馏的问题。很多人会把合成数据和蒸馏绑定在一起看。你怎么理解现在这种情况?

孟繁青

合成数据里,我们需要一个环境和一个问题,然后让 Agent 在里面探索。这个探索 Agent 有时候可以是外部模型,比如 Claude,当然也可以是内部模型。

如果使用外部模型,可能就是大家现在说的蒸馏。这里又要区分是硬蒸馏,还是有技巧的蒸馏。

硬蒸馏说白了就是环境太简单。比如做非常普通的数学题,直接把答案拿过来,类似于把老师布置的作业拿过来抄。

但如果环境足够复杂,对应的问题和评分方式都是正确的,而且足够高质量,那么仅仅搭建这一套环境、题目和评分机制,本身就是一件很有难度的事情。

有了这一套以后,当然可以得到更好的合成数据,或者说蒸馏数据。这就是有技巧的蒸馏。

曲凯

能不能理解为,合成数据如果用得好,对于相对落后的模型来说,价值远高于领先模型,因为它的学习 margin 更大?

孟繁青

这是肯定的,因为它的学习 margin 会更多。但对领先模型也是有用的。

曲凯

如果我已经是最领先的模型,我造了一个环境,然后用今天的模型自己去做,结果不是跟现在一样吗?

孟繁青

这就是 RSI。因为当你造出一套足够复杂的环境,以及对应的问题和评分方式以后,即使模型用自己在里面探索,拿到正确轨迹,再用这些轨迹训练自己,也是可以提点的。

曲凯

这件事是已经被证明了吗?它有什么明确原因,还是仍然是一个比较黑箱的状态?

孟繁青

说白了,这就是 RL 做的事情,是一个不断强化的过程。

曲凯

你觉得现在整体的模型状态、AI Lab 的状态处在什么阶段?

之前大家经历过一个时期,觉得 scaling law 是不是撞墙了。现在对做 AI 的人,尤其是 AI Lab 的人来说,是觉得空间还很大,沿着目前的路线继续做就能持续提升;还是觉得现有路线快要穷尽了,需要新的架构和技术路线?

孟繁青

10. AI Labs Move Beyond Coding

我觉得一方面,coding 这一块从年初到现在一直都是最重要的发力方向。

Coding 是智力的基础,相当于要持续提高模型智力的上限。这一块的增长虽然仍然很快,但整体 pipeline 可能已经相对稳定了。

所以 AI Lab 也会探索其他技术路线,比如 Auto Research。像 Claude、OpenAI 都会在 Auto Research 上投入,它们可能会用 Auto Research 去服务 AI for Science。

这其实就是一些新的技术路线。

曲凯

AI for Science 你们有在接触吗?最近这个方向也很火。字节最近推出了 100 位科学家的计划,Anthropic 也在做。

但理论上,AI for Science 好像跟模型本身并不处在完全重合的一层。你怎么看?为什么大家开始在这上面发力?

孟繁青

现在大家也开始提 Auto Research 了。你可以看到,千问、Kimi 发布的报告里,都会有一个很长、不断改进任务的过程。

它们可能大部分是在写 GPU kernel。AI for Science 也是类似的,比如让大模型去设计分子结构、蛋白质等东西。

一方面,这体现了模型的智力;另一方面,这也是比较直接的应用。

曲凯

我看 GPT 最近在 P2 上发布的新模型,流出来的信息是,它做数学题、解决数学猜想,已经到了一个新的层面。

因为仅从 coding 这个层面,已经无法充分体现模型的智力了。Science、STEM 这些领域,本身就是衡量模型智力的一个直接方式。

也就是说,已经从奥赛转向诺贝尔奖了。

孟繁青

对,这些都是在讨论模型智力。模型厂商需要找到这些场景,去展示模型的能力。

曲凯

所以你整体上觉得,目前 AI Lab 的状态仍然是未来有非常大的空间,大家继续做就好了?

不像 2024 年大家需要 o1 一样,现在不太需要这种东西了?

孟繁青

模型厂商的模型增速一直都在。

但这个模型增速背后,到底需不需要这么多 research engineer,或者 research engineer 现在的高薪能不能一直维持,这个可能不一定。

曲凯

听起来,很多东西已经确定了,在既有路线上继续做就好了。

孟繁青

一定程度上确实是这样,coding 就是如此。

曲凯

长期来看,如果把字节、腾讯、阿里这种资源和卡都很多的大厂分为一类,其他新的 AI Lab 分为一类,你怎么看这两类公司的发展?

孟繁青

我个人可能还是更 prefer 初创公司这一边。

技术一直在公司之间流通,大家技术水平上的差异可能不会特别大。背后真正的差异,可能在人。

曲凯

但按我们刚才讲的,技术路径虽然会不断迭代、出现新的东西,但短时间内大家就会统一,形成共识。最终是不是还是拼卡?

孟繁青

我觉得也未必。我反而觉得最后可能会归结到组织形态上。

当大家都懂技术以后,怎样设计组织,让公司作为一个整体跑得更快,我以前可能没有感觉到,但现在觉得这还是一门很有学问的事情。

曲凯

就是你刚才提到的,比如多模态要不要单独划出来。

现在也有人说,智谱做得好,是因为没有分很多精力去做多模态。也有人说,多模态,甚至世界模型,都不在智力主线上,做这些事情并不会提升模型智力,只有 coding、数学这些事情才能提升模型智力。

你怎么看?

孟繁青

这个观点可能有点绝对。我并不觉得多模态不重要,而且我也觉得它应该放到主线上。

只不过基于目前的资源考虑,不能一开始就进行全模态优化。多模态的发展相比文本慢很多,因为文本信息经过了高度压缩,本身学习起来也会比较快。

多模态信息里的噪声会更多。但我觉得,动态信息之后也会变得越来越重要。因为当 AI 想进入物理世界,它就不仅仅需要视觉,还会涉及听觉、触觉等各种信息。

曲凯

最后问一个可能比较敏感的问题:你觉得蒸馏对于国内模型追赶的意义,到底占比有多高?

孟繁青

我不说具体占比,但我觉得蒸馏不是国内模型变强的决定性因素。

就像我刚才说的,国内模型变强,一方面来自底层架构创新。现在大家比较共识的观点是,预训练负责学习知识,后训练则是在预训练分布上做分布 shift。

也就是说,模型本来可能已经会了,后训练只是让它答对的概率更高。从这个角度来看,模型智力的基础来自预训练。

我个人觉得,国内在预训练上做得比较好,比如 Kimi 的 Muon 优化器,以及各种各样的创新。我认为这是国内模型追赶最主要的因素。

后训练方面,蒸馏是国内公司的一个加速手段。不是说没有 Claude 的 API,国内公司就做不出这件事。

一方面,国内自己的模型也很强,可以用自己的模型做合成数据。另一方面,国内人也很多,如果真的下决心做数据积淀,也不见得做不出来。

曲凯

也就是说,能蒸馏最好,不蒸馏也可以。

孟繁青

对。蒸馏只是因为现在国内公司竞争非常激烈,所以作为一个加速手段,但它不是绝对必要的。

曲凯

比如 SuperCLUE 经常讲国内模型蒸馏的问题。按照你的说法,即使有一天所有蒸馏的渠道都被封掉,也不影响国内模型继续追赶,只是会更费劲一点。

孟繁青

对,我个人是这么觉得的。

曲凯

那如果这样,为什么字节一直不愿意蒸馏,或者一直对外说自己不蒸馏?蒸馏的坏处是什么?

孟繁青

蒸馏相当于抄近道。你可能会因此偏离自己的主路径,遗漏在主路上本来会发现的一些 insight。我觉得他们可能有这方面的考虑。

曲凯

所以仍然可以理解为,蒸馏是一个工具,关键在于怎么用好。它本身其实没有什么问题。

那我们今天聊得差不多了,最后再讲一下你们现在正在做的事情。

我们今天聊了很多新的模型、数据,以及比较敏感的蒸馏问题,也把现在 AI Lab 面临的各种情况和问题讲得比较清楚了。你可以最后介绍一下你们正在做的事情,以及未来的一些规划。

孟繁青

11. Evolvent AI Strategy

我们是一家初创公司,名字叫 Evolvent AI,基本上运行了半年左右。目前团队主要以 00 后 researcher 为主。

现在主要聚焦两块,但这两块并不割裂。

一块是合成数据,包括合成数据合作和商业订单。我们在做合成数据的同时,也会做一些 benchmark,这相当于在学术界进行一些探索。

另一块是长期来看做 RSI。

我们做 RSI,跟其他做 RSI 的公司有一些不同。我们不会聚焦于做 RSI 专用的技术模型,也不会专门做一套 RSI 方法。

具体原因刚才已经讨论过了。我们最终想做的,是一个连接模型厂商与应用公司的中间层。

我们最近发布了一个 benchmark,叫 RSI Bench Data。它是在这个平台内,针对 data 这件事进行 RSI 的初步探索。大家如果有问题,也可以跟我们交流。

曲凯

你们现在有招人的需求吗?

孟繁青

招人一直都是开放的。如果有兴趣,直接给我发邮件就可以。

曲凯

同样是 researcher,你觉得什么样的画像最值钱,是你们特别喜欢的?

孟繁青

对于 researcher,我们可能不会看很多量化指标,比如发了多少论文、引用多少次。

我们比较关心的是他的工程能力怎么样。我现在个人会觉得,一个工程能力比较好的人,比一个学术能力很强的人更好。

曲凯

好,谢谢,谢谢。感谢谢谢。本期节目到这里。

从蒸馏到合成数据到 RSI,模型竞争的下一个焦点是什么?|对谈 Evolvent AI 联创孟繁青 | BidClub