杨植麟
就有点像我最近可能看的一本书,就是《The Beginning of Infinity》。对我来说,我其实看了好几遍。他说有两句话要刻在石头上:一句话叫“问题是不可避免的”,但是第二句话是说“问题是可以解决的”。
也许我知道,有可能这座雪山没有尽头。我不知道,但我希望它一直没有尽头,因为这样的话,所谓 “The Beginning of Infinity” 就是这个意思:它可能是一座无限的山。
杨植麟
这个是 team 天天跟我讲的。他觉得要用 RL 的方式去管理,而不是用 SFT。
张小珺
过去一年也是波峰波谷来回震荡,你在这个过程中是什么样的心态?你需要平衡自己的心态吗?
张小珺
Hello,植麟,先给观众朋友们打个招呼。
杨植麟
Hello,大家好。
张小珺
在你创业第一年结束的时候,也就是 2024 年,我们访谈报道的标题是“向绵延而未知的雪山前进”。现在又过了一年,站在此刻——2025 年 7 月份——你最新的感受是什么样的?
杨植麟
1. The Snow Mountain Continues
你刚刚提到这个词,我感觉好像已经过了很久,已经一年多了。AI 一天,人间一年嘛,所以可能 AI 的一年,我不知道在人间是多少天。
感觉确实发生了很多变化,但是我觉得你刚才说的那种雪山的感觉,好像倒是差不太多。可能往山顶的这个过程,我们又走了一段距离。
张小珺
现在行进到哪里了?
杨植麟
现在模型的进步确实挺大的。比如两年前,模型可能连一篇文章都写不太明白;现在它不光可以写很好的文章,还能够连续工作几个小时,帮你完成一个可能很复杂的代码任务。我觉得这个东西在两年前是很难想象的。
所以我觉得,我们可能还在一个爬雪山的过程中,然后又解锁了一些新的场景。你大概知道中间这条路是什么样的,但同时在往上走的过程中,还是会观察到差不多的景象。接下来往上的过程,仍然会有很多未知的技术问题需要解决。
张小珺
你是更清晰了,还是更迷茫了?
杨植麟
我觉得肯定会有很多东西变得更清楚。比如两年之前,各种强化学习的范式,要怎么让模型有更强的推理能力,或者有更强的 agentic 能力,当时可能没有那么清楚。
当时更多是在说,模型的预训练怎么能做得更好,或者 RLHF 这样的技术,怎么让模型在对话体验里面做得更好。但是现在,我觉得有一些新的问题可能得到了答案,同时这些新的问题又展开了,产生了一些新的问题。
比如说,虽然你可以做强化学习,但是强化学习最终可能还是依赖于一个很好的评估,或者很好的验证。你让它去做一个数学题,或者一些有 test case 的编程任务,那可能可以做得比较好。但是如果让它去做一个更加复杂的端到端任务,有时候并不容易找到评估或者衡量的方式。
所以我觉得,现在这个系统可能会产生一些新的问题。
就有点像我最近可能看的一本书,就是《The Beginning of Infinity》。对我来说,我其实看了好几遍。它里面讲的最重要的一件事,就是有两句话要刻在石头上:一句话叫“问题是不可避免的”,但是第二句话是“问题是可以解决的”。
基本上,在启蒙运动之前,社会是一个静态的社会,大家并不追求创新。人们可能会用很多神奇的方式去解释观察到的现象,但这些解释并不是好的解释。比如看到天上打雷,会觉得是有雷公;看到冬天下雪,会觉得可能是某个神的心情不好,所以才下雪了。
社会里会有很多这样的、不好的解释去阐述这些东西,所以整个社会是静态的。只有非常少数的人,真正做所谓的科学研究,或者进行知识创造。
但是在启蒙运动之后,社会变成了动态的。很多新的知识被创造出来,而创造的过程就是:你产生了一个知识,它解决了一个问题;但解决这个问题的时候,又会产生新的问题。问题源源不断,是因为知识边界在拓展,所以你会遇到很多新的问题。
研发 AI 的过程中,我觉得恰好就是这样一个过程。你解决了强化学习的很多问题,但又发现面临着新的问题,比如刚才讲的评估、衡量和验证的问题。这些问题可能需要一些新的答案。
但这也是非常有意思的一点,因为你一直会有新的问题可以解决。每解决一个问题,技术就可能往上再攀登几百米。也许我知道,有可能这座雪山没有尽头。我不知道,但我希望它一直没有尽头,因为这样的话,所谓 “The Beginning of Infinity” 就是这个意思:它可能是一座无限的山。
你一直往上爬,而且甚至有可能爬到一段时间之后,不一定是你自己在爬,有可能是你用 AI 来爬。比如现在,我们也会用 Kimi K2 这个模型去做很多模型训练或者数据处理相关的工作。
这些事情以前可能都要人工写代码,或者有些同学不一定会写代码,以前就做不了。但现在很多数据处理、模型分析,甚至包括模型训练,慢慢都可以用模型来做。你可以把它作为一个放大器,更好地攀登这座山。
所以我觉得会有这样的感觉:问题会持续产生,你就持续去解决,然后又发现新的问题。
张小珺
如果雪山是无尽的,你追求的是什么?
杨植麟
追求的是攀登的过程,或者说你能一直越爬越高。你原来可能是在山底下,爬了一段之后又往上提升了一点,能看到的景色会不一样。
它是一个动态、进化的过程。我们可能想追求的,就是越爬越高。
张小珺
以前我们会固化地认为终点就是 AGI,今天的终点已经不是 AGI 了,是吗?那 AGI 是什么?
杨植麟
2. AGI Has No Finish Line
AGI 可能是一个方向,它可能不是某一级台阶。不是说你爬到了这一级台阶,就突然在一夜之间达到了 AGI,而是说它可能是一个方向。
今天在很多领域,其实你也可以认为它是 AGI,因为它可能做得比 99% 的人类更好。现在很多数学题、编程竞赛题,我觉得按照现在的提升速度,可以预想它会很快充分解决很多问题。
但我很难说,在某一个时间点突然喊一个口号,说我们在此时此刻实现了 AGI。虽然我们用登月来命名公司的名字,但它跟登月有一个区别:登月是你站上月球的那一刻,终点就到了;但 AGI 可能是你不断去做的过程。
这里面我觉得有两个层面。一方面,技术一直在提升;另一方面,除了技术之外,这个技术对于人类社会的影响,可能是一个更长周期的事情。
你也可以认为,这其实是 AGI 的一部分。比如产生蒸汽机之后,整个社会的变化,需要几十年、几百年的时间去消化。有一些工作可能不再必要,但会产生新的工作,也会有新的方式。人可能会用 AI 做更多事情,每个人都会成为“超人”,可以完成更多事情。
社会的工作方式和运行效率,可能都会发生很大的变化。
张小珺
我们先来回望一下过去一年。过去一年,全球大模型在你脑海中最重要的几件事情是什么?有哪些人工智能范式级的变化?
杨植麟
我觉得可能有几个重要的变化。
3. Reasoning Meets The World
一个是强思考的推理模型,以及基于强思考的强化学习。o1 作为第一个代表,本质上是让模型在这个过程中做很多尝试和反思。
我觉得反思是这里面的重点。反思本质上是两种能力:一种能力是提出一个新的猜想。你可以认为,模型在解决问题的过程中会不断提出新的猜想。
这个猜想还需要得到自我验证。它提出猜想之后,需要判断这个猜想到底是对的还是错的,也就是需要具备一定的验证能力。虽然你不是显式地训练一个验证模型,但它在推理过程中,可能隐式地做了验证。
你可以理解成,它把这个问题做了很多次:猜想、验证,猜想、验证,最后可能得到一个答案。
这个东西会很大程度提升模型的能力,因为模型本来只能做一次,直接给出一个答案,这个答案可能对,也可能错,并没有中间的过程。但现在它可以不断提出猜想去验证,相当于尝试了好几次。
所以你可以把 pass@k 变成 pass@1,本质上是这样的道理。这其实也很像人做科研或者解题的过程:不断提出新的猜想,然后去验证它,是一个自由探索的过程,不是线性的过程。
张小珺
它有效的工作方式实际上还是很多时候比较线性的。如果不考虑并行采样,假设做串行采样,它其实是线性的,对吗?
杨植麟
对。它的线性体现在:每次提出新的猜想,这个猜想可能基于之前的猜想,或者基于已经被否定的猜想,然后再提出一个新的猜想,所以它接近一个线性的过程。
但现在也可以把这个线性过程搭配一些并行策略。比如同时采样很多个,这样就结合了并行和串行两种不同的方式。
最近也有一些 paper 讲,串行的上限可能会更高,这可能跟我们的实验结论有些相关。我觉得这是一种范式。
但它还是一个“缸中之脑”。它并不需要跟外界交互。
张小珺
缸中之脑?
杨植麟
对。你想象一个鱼缸,把一个脑子放在里面,它跟外界没有联系,只是在这个环境里面,自己在大脑里不断思考。它不需要跟外界产生任何交互,就可以解一道题。
但还有一个很重要的范式,就是基于多轮 agent 的强化学习,或者说通过强化学习训练出来的 agentic 模型。它的特点是会跟外界做很多交互:一边思考,一边做操作,做很多轮操作。
它可能一会儿调用搜索,一会儿使用浏览器,一会儿写几行代码,然后通过多轮操作解决一个问题。它就不再是“缸中之脑”,而是跟外界有交互。
下一步行为,是根据交互得到的外界反馈,和外界给出的新状态更新决定的。它有一个交互过程。
这两个东西都指向同一个方向,就是所谓的 test-time scaling。你可以在测试或者推理的时候进行更好的规模化。
以前做聊天或者对话,更多是单轮输出一个结果。比如让模型写一篇文章,它就写一篇文章;再让它润色一下,又输出几百个 token,token 数量是很少的。
但不管是基于强思考的强化学习,还是 agent 的强化学习,本质上都是在预测时对 token 进行规模化。你可以增加轮数,也可以增加每一轮里的思考 token,都是对 token 进行规模化,使它能够完成更复杂的任务。
这也意味着完成时间会更长。现在它可能花几个小时,去做一件很复杂的事情,而且过程中不需要人工参与。比如把一个代码仓库克隆下来,翻译成另外一种语言,调试、测试,再把所有 bug 修好,让它正常运行。这样的工作可能已经可以端到端地直接完成。
这得益于我觉得是 test-time scaling。这两种都是 test-time scaling 的表现方式。
还有一个很有意思的趋势,就是现在会有更多模型公司去做一方产品,也就是一方的 agent 产品。
一开始,更多产品是基于基础模型,在上面做一些脚手架,或者设计工具,让模型更好地使用,然后搭建一个产品。
张小珺
享受模型溢出的能力。
杨植麟
对。它本质上做的一件事情,我认为是逆向工程,逆向工程模型的训练过程。
模型训练过程可能是通过各种环境和工具完成的。比如你可以认为,Anthropic 有一套 in-house 的环境和工具,它的脚手架可能训练出了这样的模型,但它并没有直接开放给你。
所以你其实是在逆向拟合它的分布:用什么工具效果会好,用什么 system prompt 效果会好,用什么 context engineering 效果会好。这是一个逆向的过程。
但如果模型公司去做一方产品,逻辑就完全不一样了。你不再需要逆向,而是采用正向的做法:先把工具设计好,把 context engineering 的方法设计好,然后就在这个环境里面训练模型。
这样,模型天然就在你的环境里表现得更好。你可以更好地整合工具和模型。如果模型有些地方解决不好,你可以调整工具的设计,把工具设计得更好,同时端到端地进行训练。
所以我觉得,这可能是开发方式上的一个比较大的变量。
张小珺
你刚才说的第一种脚手架,就像 Minus 这种方式;第二种就是你们这样的,端到端去训练模型。
杨植麟
当然,我们现在在一方产品上的投入还不算特别多,主要还是以模型作为主线。
但你可以看到,像 Clock Code 或者 ChatGPT Agent,其实就是一方产品。我觉得这应该也会是一个很大的趋势。后面可能要看这两种东西怎么配合,或者它们在生态里分别占什么位置,边界在哪里。
张小珺
说到主线,ChatGPT 设置了 L1 到 L5。我一直很好奇这里面的逻辑:L1 是 Chatbot,L2 是 Reasoner,L3 是 Agent。为什么有了 Chatbot 和 Reasoner 之后才有 Agent?为什么后面又是 Innovator 和 Organization?它们的逻辑是什么?在模型逻辑上,变化是什么?
杨植麟
它是能力一步一步的依赖。
4. The Ladder Is Not Linear
我觉得实际看起来,Agent 的上限取决于你有没有很强的 reasoning 能力,但好像并不是说必须按照这个顺序来。假设技术发展换一个顺序,先做出 agent 能力,再去做现在狭义上的 reasoning,也就是 long CoT reasoning,我觉得实际上也是成立的。
张小珺
也就是说,cloud 的路线可能就是在这一点上更领先。它在 reasoning 上做得没有那么多,但在 agent 上做得非常好。
杨植麟
对。它背后对应的是两种不同的 test-time scaling 范式。
一种是通过多轮方式进行 scaling,因为需要跟外界交互、使用很多次工具,所以可以 scale 轮次。另一种就像刚刚说的,可能没有什么交互,只是一直在那里思考,纯粹地思考。
这是两种不同的 scaling 维度。你看 Claude 的很多模型,它的 reasoning performance 并不是非常高,但 agent performance 很高。我觉得这两个东西不一定是依赖关系。
但如果想让它解决最复杂的任务,最终可能还是需要 reasoning 能力也很强。所以在研发上,它不是必然的顺序;但如果想把一个东西做到最好,就需要把另外一部分也做好。要达到最好的 agent,就需要把 reasoning 也做到最好。
张小珺
当你有了 Agent 之后,为什么接下来对应的是 Innovation?
杨植麟
我觉得最关键的一点,是模型到底什么时候能参与到模型的开发中。
比如我们希望 Kimi K2 能够参与到 Kimi K3 的开发。如果没有 agentic 能力,其实很难做到这件事。但当有了 agentic 能力之后,它就可以提出新的想法,做对应的实验,分析实验结果、得到结论,再迭代下一版的想法,或者优化某个 infra 的性能。
这些事情需要很强的 agentic 能力才能完成。所以我觉得,Innovation 最重要的一个点,就是看模型什么时候能参与到模型本身的研发和迭代中。
但这跟 Organization 也不一定是完全线性的关系,有些东西其实是并行的。
现在已经能看到很多这样的趋势:当你有一个 agent 之后,就可以把它拓展成一个 multi-agent 系统。你可以从一个 agent fork 出很多不同的 agent,让它们去做不同的事情。
它们可以串行,也可以并行,再合并起来,然后分成几个不同的 task。有的去写测试,有的去写文档,有的去设计整个软件框架,形成不同的分工。
所以它们不一定是线性关系,可能两个会一起发生。但我觉得 reasoning 和 agent,可能是 Innovation 和 Organization 的一个前提。
张小珺
我理解,Reasoning 是 Agent 的前提,是因为它能让语言通过推理在 Agent 中泛化。
杨植麟
对。如果想解决最复杂的 agent 问题,不会推理肯定很难。
但假设没有推理这种范式,还是可以在一定程度上做一些 agent 任务,完成不需要推理,或者不需要那么强推理能力的任务。你不需要在思考过程中输出几千个 token 去推理当前到底应该怎么做,也可以通过多轮交互,从环境里得到反馈。
比如写一些测试,然后运行测试,也能解决相对复杂的任务。所以这就是为什么 cloud 模型在一些场景里会做得更好,因为背后对应的是不同的技术路线。
但最终绕不开的是,如果要继续往山顶爬几步,两个能力都需要。它只是一个时间问题。
Organization 和 Innovation 也是一样。不同技术路线可能让短期路径略有区别,而这些短期路径的区别可能会产生影响,因为面对的是一个动态市场。
张小珺
Innovation 的标志是模型的自我迭代,那 Organization 呢?
杨植麟
Organization 可能相对简单,就是一个 multi-agent 系统。现在已经有很多雏形。
当然,multi-agent 系统怎么进行很好的端到端训练,怎么避免过拟合某几种 agent 类型,让它有更好的泛化性,我觉得还是有挑战的。
张小珺
所以 Organization 是雪山的峰顶吗?
杨植麟
我觉得也不是,可能真的没有顶。这几个能力都会随着时间持续变得更好,包括推理能力。推理能力的上限到底在哪里,我觉得今天也不好说。
虽然看起来它是 L2,但真正做到非常强的推理,今天仍然有很大的空间。
张小珺
你怎么看 L1 到 L5 的分级?你把它当作什么样的刻度?
杨植麟
我觉得它是几个重要的技术 milestone,但不一定完全是串行关系。
我们刚才说过,我们会预期一个东西被解决之后,再去解决下面的问题,但实际上可能会同时提升。比如 reasoning,如果要真正解决一些开放问题,或者做很好的创新、提出新的模型架构,对推理能力可能又会有更高要求。
所以我觉得,这几个能力都需要持续提升。
张小珺
我们来复盘一下。2023 到 2024 年,你们的关键决策是:2024 年 2 月决定创业,然后开始融资、组建团队;到了下半年,Kimi 上线,突破了长文本。那 2024 到 2025 年这一年,你的几个重要决策是什么?
杨植麟
5. K2 Rewrites The Training Playbook
我觉得很重要的一个技术决策,就是从以预训练和 SFT 为重点的研发范式,转变成以预训练和强化学习为重点的方式。
这需要做很多人才储备,也需要改变研发方式。另一个重要变化,是从对话到 Agent。我觉得这是一个重要的范式改变,也会影响实际的工作方式。
这两个是方向上比较重要的变化。
张小珺
过去半年,你们推出了 Kimi K1.5 和 Kimi K2,它们分别对于 Kimi 意味着什么?
杨植麟
我觉得 K1.5 更多是强化学习技术的验证。我们可能比较早地在这条技术路线上投入,并得到了一些结果,去理解背后的技术到底怎么做。
当时我们发现,可能不太需要太多 process reward 或者 value function,甚至这些东西在训练过程中还有一些副作用。你可能直接用端到端的 reward,就可以把训练做得非常好。
我觉得在早期,这一点并不是非常明确。但在这个过程中,我们积累了一些强化学习的基础设施,以及算法上的 know-how。
K2 的主要目标有几个。
第一个,我们希望它是一个非常好的基础模型,也就是一个非常好的 base model。如果想要更好的 base model,就要看整个领域的预训练瓶颈在哪里。
我们发现,高质量数据的增长确实非常缓慢。多模态数据又没有办法很好地提升文本本身的“智商”。你可以认为,高质量数据有点接近一个常数。
所以我们希望把每一份数据都最大化地使用,也就是所谓的 token efficiency:同样吃下这么多数据,能得到更多智能。
这跟之前的一些思路不太一样。假设你在训练系统里做很多性能优化,让它训练得更快,这当然也有价值,但训练得更快本身并不能提升智能上限。token 还是这么多,只是用更短的时间完成训练,模型效果不一定变得更好。
这是训练效率或者 compute efficiency 上的优化。我们现在更多希望提升 token efficiency,把一份数据当成好几份来用。
比如我们很关注 Muon 优化器。Muon 很有意思,它对 token efficiency 的提升比较大。Adam 这样的优化器可能已经用了十年,大部分模型都会用 Adam 训练,但它的效率并不够好。
它没有把一个矩阵参数中各元素之间的依赖关系充分考虑进去,而是更多地独立处理。通过考虑这些 dependency,可以获得更好的学习效率:学习同样一份数据,得到更多智能。
在我们早期的实验里,如果是在 compute-optimal 的情况下,基本上会有 2 倍的提升。也就是说,别人用 Adam 学 2 份数据,可能相当于你用 Muon 学 1 份数据。
假设有 30T 高质量 token,就相当于有了 60T 高质量 token。
张小珺
但它还是那么多数据啊。
杨植麟
对,但模型吸收之后,脑子会长得更快。
张小珺
为什么?
杨植麟
因为学习效率更高,优化器更好。同样喂这么多数据,它吸收得更好,所以压缩率会增长得更快,loss 也会降得更快。
张小珺
这个优化器是你们原创的吗?
杨植麟
不是。Muon 是 Keller 提出来的一个东西。我们在上面做了很多优化,让它能够适配并训练大规模语言模型。
比如我们之前有一个 Moonlight 的工作,让它第一次能够在有一定规模的语言模型上进行训练。后来进一步规模化的过程中,我们发现了很多新的坑。
比如 max logit 可能会出现爆炸,这在小规模实验上很难发现,但在大规模实验上可能会遇到。我们提出了一些新的 clipping 方法去解决这个问题,让它在非常大规模的情况下仍然能够很好地训练。
这很重要,因为 token 数量有限,所以希望每一份 token 都能产生更大的价值。
我们也会对数据做很多 refresh 操作。比如有 30T token,但其中真正高质量的数据可能更少,可能只有几十 B 或几百 B。我们希望这些数据能够被更好地使用,所以会对数据做一些改写,让它更好地被模型吸收,并且有更好的泛化。
张小珺
我读了你们的技术报告。你们尝试用已有模型改写现有数据,生成新的语料。具体的改写过程是什么样的?策略是什么样的?
杨植麟
如果同一份数据学很多次,泛化可能不一定好,可能会出现过拟合问题。所以我们希望通过改写,让它获得一定程度的泛化。
具体改写方式可能有很多种。我们找到了一种在实验中效果比较好的方法,但这个空间还很大,我觉得有非常多研究机会。
张小珺
怎么看待一种观点:改写和扩充其实没用,能够写出来知识,说明知识本身就在里面,没有新知识;除非改写时用到了其他方法。
杨植麟
这是一个很好的问题。确实可能跟改写方式有关。理论上,要看有没有新的熵输入。
张小珺
新的熵输入?
杨植麟
对,所以我觉得这对改写方式有一些要求。但我们今天也不一定已经找到了最好的改写方式,这里面还有很多可以探索的空间。
张小珺
回到刚才讲的点。K2 一方面是希望成为一个好的 base model,所以你们会很希望提升 token efficiency。这些是对应的设计,包括通过更大的稀疏度加入更多参数。参数更多之后,虽然学一样多的数据,但可能吸收得更好。
杨植麟
对。通过实验可以验证,它确实有更好的 token efficiency。
6. Agents Need Generalization
第二,我们希望它有好的 agentic 能力,包括强化学习,以及对工具和环境的模拟,让它有比较好的泛化性。
对于 agentic 模型来说,我觉得现在最大的挑战其实是模型泛化。现在的 RL 技术的局限在于,不管是训练任务还是评价指标,很多时候都是单点的。
比如训练 three bench,它就要提升 three bench。这是一个很确定的目标。但指标提升上去,并不意味着模型泛化会变得更好。
所以我们也在尝试解决一部分泛化问题,不希望它过拟合某些工具、某些环境,或者某些具体任务。这些任务可能是很好的观测,但我们不希望模型过拟合它们。
而且这个问题在 agent 训练里可能更加严重。相比之前的对话模型,agent 的泛化是更大的挑战。
张小珺
为什么不在 pre-training 里面去选?
杨植麟
这也是接下来我们想探索的东西。可能有一些 agentic 能力可以在预训练阶段获得,这也许能提高泛化性。
但这取决于具体做法,取决于数据分布是不是足够广泛,以及有没有很好的评估方法。现在整体评估仍然是一个瓶颈,也是阻碍 agent 模型变得更加泛化的一个重要瓶颈。
现在 agent 能用的 benchmark 不是非常多。而且在那些 benchmark 上观察到一个分数,很多时候也并不能完整反映这种能力,比较片面。这是大家需要想办法解决的问题。
其中可能有一个潜在思路,就是用更 AI-native 的方式训练 AI,让模型参与更多训练过程。
比如,如果 AI 能够做很好的 alignment research,做很好的对齐研究,理论上可能会有更好的泛化,因为它不只是优化一些单点任务。我觉得这是 agent 下一步非常重要的一点。
它今天可能还不像对话模型一样有这么好的泛化性,这可能会是接下来雪山上的几百个台阶。
张小珺
听起来,K1.5 是在跟着 OpenAI 跑,K2 是在抢跑,是吗?
杨植麟
整体来说,我们肯定借鉴了很多技术方向,但也希望有一些自己的创新。
至少在公开可查的资料里,我们可能是第一个使用非 Adam、基于矩阵正交化的方式来做新优化器,并在这么大规模的模型上进行训练。我觉得这是一个创新点。
包括一些 agent 数据的做法,至少在公开资料里,也算是比较早去做的。
这个空间会越来越大。越往上爬,空间越大。首先 token 在变多,完成同一个任务所需要的 token 变多,问题复杂度也会变复杂。
就像刚刚讲的,问题不可避免,但问题总可以被解决。不可避免的问题看起来会比之前更多,所以研究空间也会更大。这是我现在比较直观的感受。
张小珺
K2 是怎么立项的?筹备了多长时间?
杨植麟
筹备了比较长时间。这里面涉及很多技术,可能从去年就开始研究。
比如 Meme Clip 这样的技术,需要经过比较长的周期。一开始可能做一些非常早期的实验,发现这个想法有潜力,再通过小实验验证潜力到底有多大。
有了想法之后,到最后把它放进一个万亿模型里训练,要经过很长周期。要通过不同的 scaling 实验验证有效性。
像我说的,有些问题只有 scale 到一定规模之后才会发现,所以整个研发周期比较长。
如果只看模型本身,从按下训练按钮到训练结束,时间倒没有那么长。但整体研发需要前置做很多事情,才能保证最后的训练比较顺利。
张小珺
整体 LLM 的 pre-training 是什么时候开始的?
杨植麟
也需要很多积累。不同时间点的做法可能不太一样。一开始不一定会端到端地做,但会先积累环境和数据,之后才能更端到端地做强化学习。
中间需要很多基础设施和数据积累,这肯定不是一两个月就能做得非常好,需要时间积累。
整体上,大模型和相关技术挺需要时间积累的。还是要做时间的朋友,不断积累这些东西。技术曲线也比较陡峭,并不是今天想做就能做出来。
张小珺
所以什么时候立项?
杨植麟
首先我们可能从一年前就开始积累各种技术。至于 K2 这个具体模型,是最近几个月决定要训练这样一个模型,并把哪些技术用上,大概是这样的决策。
不是今天想训练这个模型,然后从零开始搞很多东西。那可能不是两三个月能解决的问题。
张小珺
为什么立这个项目?
杨植麟
我觉得很正常,因为我们一直在训练下一代模型。无非是决定下一代模型加入哪些技术,以及期待它成为一个什么样的模型。
就像现在,我们也会考虑 K2 之后下一代模型是什么样。这是一个持续需要思考的决策。
每次你都会发现,工具箱里又多了很多新东西,然后要决定拿哪些东西出来用,是这样一个过程。
张小珺
你们做研究和做训练的团队是分开的吗?一年前就已经开始研究这些技术了,到正式训练时,是同一个团队在做这件事情吗?
杨植麟
对,其实是一个团队在做。
这个东西很难分开。比如实际训练过程中会遇到问题,如果之前完全不了解,就没有办法解决。所以研究和训练实际上不会分开。
张小珺
训练过程中遇到什么挑战吗?
杨植麟
我们遇到的主要问题就是 Muon 训练时会“炸”。我们在 paper 里画了一些图,max logit 会长得非常高。我们认为这会影响训练稳定性。
如果训练久了,很多所谓的内部指标不正常,对模型上线是有害的。所以我们回过头重新看这个问题,去修复它。
这个问题在小规模实验上没有办法预测,因为小规模实验无法复现。小规模时不会出现爆炸问题。
其他方面基本还好。因为我们在小规模上做了很多实验,大部分都可以迁移。唯一的问题是这个在小规模上验证不了,需要在 scale 的过程中临时解决。
张小珺
K2 训练过程中最重要的几个 know-how 是什么?
杨植麟
主要的 know-how 我都写在 paper 里了,我们希望跟更多社区分享。
张小珺
你会怎么定义 Agent?怎么对 Agent 进行分类?
杨植麟
这其实就是我刚才说的:从一个缸中之脑,变成可以跟世界交互的系统。
所谓 Agent,最重要的特征就是可以多轮使用工具。我觉得有两个关键词:一个是多轮,一个是工具。
多轮意味着可以做很多次,是一种 test-time scaling 的方式。工具则是连接大脑和外部世界的方式。
比如使用搜索引擎,就可以把模型跟整个互联网连接起来;如果可以写代码,就可以把这个脑跟数字世界连接起来。数字世界里基本所有自动化都可以用代码描述,所以它就拥有自动化能力。
我想象中的 Agent,可能就是这两个特征。
接下来会有越来越多的工具,而且工具会呈现长尾分布。如果模型泛化得好,它不只是使用常见工具,也可以使用非常个性化的工具。
比如让模型访问公司内部数据库、个人文档,甚至访问定制 API,完成退票、下订单之类的业务操作。它应该能够泛化到没有见过的工具。
所以我一直在想,Agent 现在可能最缺的是泛化能力。如果泛化更好,之前大家讨论的各种垂直 Agent,可能就不一定那么需要。
当通用 Agent 能泛化到长尾工具上,很多领域专有问题都可以直接用工具解决。每次只需要增加不同的工具,比如定制数据库、定制 API、定制文档接口,就可以完成一个非常垂直的 Agent。它的普适性会强很多。
多轮主要是为了做 test-time scaling,可以完成复杂任务,而不是只做一次。人每天的工作,其实也可以认为是多轮使用工具的序列。
本质上,你希望把人的这个序列拟合进去,但又收集不到这样的数字化数据,所以可以用强化学习构造。
张小珺
它本质上是在模拟人的行为。
杨植麟
这样说可能不太准确。它其实是通用的。
张小珺
什么叫它是通用的?所以不是模拟人?人也很通用啊。
杨植麟
对,人也是通用的。人是所谓的 universal constructor。
它的主要目的不是模拟人,而是通用,也就是说这个形式化定义本身是通用的,可以完成几乎所有任务。它跟人的做法类似,可能只是一个刚好出现的结果,并不是设计这个系统的目的。
设计飞机是为了把它当作交通工具,并不是为了像鸟一样飞。Agent 系统更多是 general-purpose 的智能,刚好跟人相似。
张小珺
怎么提高通用性?你们探索到什么方法了吗?
杨植麟
这是一个很难的问题。今天 Agent 泛化有一个风险,就是陷入某些 benchmark 的过拟合,但现在可能又缺少很好的 benchmark。
这会是接下来的挑战。我觉得可能有一些解法,比如用更多 AI 去训练 AI,能够在一定程度上缓解这个问题。
张小珺
什么时候能做到用 AI 训练 AI?现在的瓶颈是什么?
杨植麟
现在其实已经有一部分可以这样做,但我们希望它能做得更多。
现在很多时候还是要依靠人的设计。
张小珺
到 Innovator 那个阶段了,所以这很有意思。它其实有可能不是线性的:你要用 Innovation 的方式去解决 Agent 的问题。
杨植麟
对。今天 Agent 泛化不够,所以要用 Innovation 的方式解决它,也就是用 L4 的技术去解决 L3。
所以我觉得 L1 到 L5 这个定义,真的可能不是线性的。没有很好的 Innovation,没有用 AI 训练 AI 或者 AI 对齐 AI 的方式,Agent 就很难做到特别好的泛化。
今天人工定义了一些 task,然后 fit 那些 task,但在其他看不见的 task 上,模型可能表现没有那么好。如果只 fit 那些 task,只刷那几个 task 的分数,很多时候用户在更 OOD 的场景里,体感还是没有那么好。
我觉得现在这个领域面临的阶段,就是 benchmark 不够用或者 benchmark 失效,同时 Agent 泛化有问题。
张小珺
为什么数学、代码是相对容易泛化的领域?
杨植麟
其实也没有那么容易。如果做强化学习,我觉得这些任务也会有一样的问题。
当然,强化学习本身的泛化性可能比 SFT 好,因为过程中有更多 on-policy sample,是从模型本身 sample 出来的,而且有负梯度。这两个东西会导致,从目前证据来看,它的泛化会更好。
但它的泛化仍然是有限度的。比如今天在某一种数学竞赛上做到 99 分,其他数学问题可能会提升 5 分,但很难直接也做到 99 分。
如果不把对应的 IO 任务放进去,就很难直接获得这样的泛化性。我觉得做数学题仍然有一样的问题:它受分布制约,所谓种瓜得瓜、种豆得豆。
但我们希望通过更多 AI 参与 RL 或 post-training,让它摆脱种瓜得瓜的情况。
张小珺
会不会摆脱不了?会不会提高不了泛化性?
杨植麟
还是回到刚才说的:问题是不可避免的,但问题是可以解决的。每次往前推进,泛化就会变得更好。它不一定有尽头,只会有更好的泛化。
张小珺
对于 Agent 来说,任务和环境非常重要。怎么定义好的任务,怎么定义好的环境?你在探索过程中有什么思考?
杨植麟
还是回到刚才讲的。一种方式是给定一个模型,然后设计环境,反向去拟合这个模型。
当然,也可以正向设计。假设你是一方产品,就正向设计工具和环境,让模型在这个环境里提升。
重要的是让设计具有更好的通用性,能完成很多任务,而不是为了某些任务专门设计工具和环境。当设计足够通用时,再让模型在这个过程中学习,而不是反过来拟合模型。我觉得这可能是更好的做法。
张小珺
我注意到一点。一般大家觉得,任务设计要足够有挑战,这样任务可能会促使模型产生本质上新的方法。但 K2 用的是一些中等难度的任务。这有什么思考?会带来通用性吗?
杨植麟
会。它也是一个爬山的过程。
你不能一上来就让它证明一个还没有人证明过的数学问题,那样 sample efficiency 会非常低。现在感觉比较好的方式是,强化学习搭配好的 sample 策略,本质上是一个隐式的课程学习机制,也就是 curriculum learning。
希望它从合适的难度开始学习,学完之后逐渐提升难度,而不是一上来就学非常难的东西。否则采样效率很低,基本学不到什么,算力也会被浪费。
但今天很多任务,还是来自人类已有的数据,或者人设计的任务,AI-native 的部分还比较少,所以可能会带来刚才说的泛化性问题。
张小珺
窄域 AGI 和通用 AGI 是什么关系?
杨植麟
窄域 AGI 可能是一个比较垂直的能力,或者说是一个子集。只要把两个工具用得足够好,就能做大部分事情。
最终还是希望不只是做 coding。现在训练这个模型,也不是让它只能做 coding,因为它还是会有局限。
Coding 相当于一个环境,是人类的手;它是任务的一个子集,但可能是很重要的一个子集。
张小珺
Coding 对 Agent 来说,是相对容易的任务吗?
杨植麟
它比较好验证,所以比较好学习。但它仍然会面临刚才讲的泛化问题。即便是 coding agent,也会面临同样的挑战。
Coding 之所以是很重要的子集,是因为它代表了数字世界的自动化。
假设今天想创建一个新的工具,本质上是写一段或者一大段代码来实现。或者想做更好的上下文管理,也就是 context engineering,背后对应的可能也是一个用代码实现的工具。
代码在这里面有独特的位置和作用,但并不是做了 coding agent 就足够了。现在很多不是程序员的人,也会用 cloud code 完成任务。律师、产品经理、设计师,也会用 cloud code 做事情,因为模型一定程度上具备泛化能力,不只是会写代码。
张小珺
所以你们是要做通用 Agent 模型,并不是做一个 coding 模型,对吧?
杨植麟
我们还是希望做通用模型。
张小珺
从写代码到操控整个数字世界,你觉得 Agent 还缺乏什么能力?
杨植麟
首先,现在这些高频工具的使用还不够好,能力上还有很大空间。这一方面也因为缺少更好的 benchmark 来观测。
比如 SWE-bench 可能很快会饱和。很多 benchmark 不够好,不能真实反映实际用户体验。
所以高频工具本身还有提升空间。长尾工具则是:面对没有见过、完全 OOD 的工具,怎么获得更好的泛化。我觉得这也是非常重要、需要解决的问题。
张小珺
你自己最看重能够提升 Agent 能力的关键能力有哪些?
杨植麟
长期来看,我希望用 Innovation 这一层的技术,去设计 Agent 这一层的能力。我觉得这可能是非常重要的方向。
张小珺
Long context、long-term memory 重要吗?
杨植麟
Long context 也很重要。现在很多任务,128K、256K 的 context 完全解决不了,可能需要百万级,甚至更多。
但在这个长度下,模型的脑子还要非常好用,不能只是长,智商还得很高。对模型训练来说,挑战非常大。
你希望压缩率足够高,所以模型可能要足够大,同时又希望它足够强。这两个东西天然存在冲突,需要更好的架构。
有些架构在更长 context 下效果会提升,但短 context 下可能不一定提升,甚至可能下降,所以会有很多架构上的平衡问题。
这些问题可能会逐渐被解决,我觉得是有解法的。Long context 可能是架构上的一个重要支持。
另外,RL 训练方式肯定也有很大提升空间。比如训练一个很复杂的 multi-agent 系统,只用端到端 reward 可能不够。中间的 reward 怎么产生,能不能摆脱一些人工设计,我觉得也会是很有意思的挑战。
张小珺
我回看我们去年对话,有一个问题非常想问你。你去年说,开源会落后于闭源,因为开源方式跟以前不一样。以前所有人都可以贡献到开源,因为开源本身是中心化的;现在开源贡献很多没有经过算力验证,而闭源会有人才聚集和资本密集,是一个对市场的整合,所以领先者不会开源,只有落后者才会这么做。
但今天你看起来走远了。
杨植麟
因为我们还没有做到绝对领先,完全领先。
有些判断基本上还是这样。模型出来之后,社区可以贡献一些东西,比如在推理侧做很多事情,让模型有更多人免费给你 serve,让更多人使用。
但要贡献到模型本身,把模型本身变得更好,好像还是只能由原厂自己来做。
当然,如果看 base model,确实是这样。但如果基于开源模型做很多 post-training,特别是 agentic post-training,可能会产生一些新的机会。
比如你想做一个法律相关的 Agent,是一家创业公司,完全可以基于 K2,在定制的工具集合下面,训练出一个 specialized agent,让它在你关注的场景中表现得非常好。
我觉得这种机会是存在的。但它更多是赋能下游应用,很难把这些东西重新变成主模型、base model 的提升,这目前还是比较难的。
张小珺
这个问题可能可以动态观察。你们会长期选择开源吗?
杨植麟
这是我们希望长期去做的事情,但不一定只做开源。我们希望跟社区分享技术 know-how。
这可以加速技术继续提升。大家不完全只是竞争,也可以有合作,甚至所有开源公司形成一个生态,把技术更好地往前推进,让这座雪山爬得更好,reach the top。
当然也不一定所有东西都开源。比如跟某些公司合作时,不一定所有东西都要公开。但我们希望持续开放一些好的技术。
张小珺
所以这是技术体系的信仰,还是市场博弈的策略?
杨植麟
客观地说,两者都有,而且可能都有好处。但最终,我们希望通过这个东西,让技术更安全、更快地达到更好的水平。
张小珺
开源和闭源的生态会怎么演进?你觉得最终开源和闭源,全球会剩下几家?
杨植麟
我觉得不会很多,但几家肯定还是会有。
7. Open Source Finds Its Role
如果看过去两年,趋势还是比较明确的:市场会逐渐集中、收敛和聚焦。一开始可能有几百个,后来到几十个,再到几个。我觉得最终几个可能是比较稳定的数量,这现在看起来是大概率事件。
张小珺
你们属于开源那一边,还是闭源这一边?
杨植麟
像刚才说的,我们会持续开放,但不是所有东西一定完全开放。选择性开放是一个动态决策,需要持续观察。
但我们肯定希望长期分享更多技术。
张小珺
为什么中国公司都开源了?
杨植麟
也不是都开源。客观来说,还是有市场博弈的因素。
对社区来说,这是好事。开源的公司可以互相借鉴,加速技术进步。我觉得这是一个很好的方式。
张小珺
去年你经常提到一个词,叫“有概率的非共识”。你今天的“有概率的非共识”是什么?
杨植麟
我觉得就是刚才讲的几个接下来比较重要的技术问题。
比如怎么提升 Agent 的泛化,我仍然觉得这是非常重要的问题。这里面可能会有一些技术上的新东西。
包括我们做优化器。在做出来之前,至少在我们做出来之前,应该没有很多人在做这个事情,所以它也算是一个非共识。之前所有人都会使用 Adam,而它对 token efficiency 的提升确实很大。
这让我们现在可以有一个比较好的 base model,后面就可以通过更多 post-training,把模型的上限和性能压榨出来。
张小珺
你怎么看 AI 时代的产品?你做 Kimi 做了很长时间,做 AI 时代的产品,跟做移动互联网产品会不一样吗?
杨植麟
我只能说 AI 产品,因为移动互联网产品没有做过。
以前大家喜欢说“模型级产品”。
张小珺
对。
杨植麟
我觉得现在这个判断还是没有变化。
8. Products Are Built In Training
假设做一个 Agent 产品,过程中需要把模型、工具和 context 结合起来。但训练模型时,基本上已经要把这一套全部搭好,才有办法训练。
所以模型训练完之后,产品其实已经做完了。上面再做一些交互层面的东西,肯定也有很大价值,但可能是最后锦上添花的一步。
模型性能已经在训练过程中打磨好了,也已经跟工具和环境有非常好的适配。所以产品是在训练中完成的,训练好之后,产品基本上就做得差不多了。
张小珺
你去年说,现在的开源方式演变成要做一个巨大的系统,就像 21 世纪初 Google 做的信息检索系统。
对于 AI 时代这个巨大的系统,你有没有更多想象?
杨植麟
现在系统的复杂性,在于你想让模型变得通用。通用会带来很多复杂性。
一方面可以认为它变简单了:只要把所有东西放在同一个模型里,就不需要维护那么多模型,也不需要一堆 routing 策略。从概念上,或者从一些工程实现上,它变简单了。
但另一方面,它也会变复杂。如果希望它很通用,就要希望模型在各种场景下都能工作。
比如做 Agent 模型,不希望它只在自己的工具集下工作,而希望别人使用时,在别的工具集,甚至没有见过的工具,或者不同定义、不同实现方式的工具下,也能工作。
这对模型要求很高。Agent 里可能有不同类型的任务:coding agent、search agent,以及其他 agent。把它们放在同一个通用模型里,可能会有相互冲突的问题。
工具定义可能不一样,数据 pattern 也可能不一样。把它做成通用模型,会有很多技术挑战。
但如果不做通用模型,泛化性又没有那么好,只能做一件事情。特别是 Agent 需要很多步才能完成任务,即便程序员也不仅只是写代码,写代码也不仅只是做 three bench。
所以你要做真正可用的东西,随着步数变多,对通用性的要求会更高。
我觉得系统复杂性,主要体现在训练模型的过程中,要让它足够通用,而不是拟合某些单点能力。拟合单点能力,benchmark 分数可能很好,但实际通用性可能不够。
还有一个例子:如果想往模型里加入多模态能力,就要让多模态能力不要损伤它的脑子。
张小珺
而且你希望多模态模式下不只是“不损伤”,对吗?
杨植麟
对。能不损伤已经很好了,但还希望多模态模式下的能力,和文本模式下共用一个脑子。
也就是说,多模态模式下也要能把文本的智商激发出来,而不是进入另一部分参数,完全丢掉原来在文本中学习的东西。
做通用模型就会面临这样的挑战:各种模态、各种任务类型,以及 Agent、reasoning、chat,全部要合到一起。
而且现在不只是 SFT,还要做 RL。到了 RL 阶段,这个挑战会进一步加重。
相比之下,只做通用 pre-training 相对容易,只要把各种文本放在一起,基本不会有太多问题。但越到 post-training 后期,越到 RL,这个问题会更加严重。这就是它的系统复杂性。
张小珺
搜索引擎系统构建在 PC 互联网之上,推荐引擎系统构建在手机,也就是移动互联网上。你觉得 AI 时代新的节点在哪里?超级节点在哪里?
杨植麟
新的系统肯定会运行在很多数据中心里,也就是 Jason 经常说的 AI factory。但肯定还会有很多终端。
终端可能有一些可以复用现在的形态,也可能诞生新的交互方式。Chat 是一种交互方式。两年前看,Chat 是一种新的交互方式,因为之前没有人与机器之间的这种对话。
现在 Agent 可能会带来很多新的交互方式。比如让它异步执行一个任务,然后查看中间结果,这本身也是一种交互方式。
接下来可能还会有更多交互方式。比如有了 multi-agent system 之后,交互方式会是什么样,可能会随着能力边界变化。
Coding 也是一个例子。最开始有 Copilot,之后有 Cursor,再之后有 cloud code,每一代交互都会发生变化。
交互会随着模型变化而变化。新一代模型能力提升很多之后,交互就可以改变。不再需要一个人逐个点击、决定是否接受修改,而是可以多步执行一个 agent coding 任务。
当然,今天 cloud code 的交互也不是终极形态。模型还会继续提升,交互也会持续变化。
张小珺
今天 scaling law 还没有放缓吗?
杨植麟
数据墙肯定是一个客观事实。要突破数据墙,就要提高 token efficiency。
这也是为什么我们会做 token efficiency,因为数据墙确实存在。同时还要把更多 compute scale 到 RL 的各种任务上。
但现在观察到,模型变好的速度并没有减慢,我觉得甚至是在加速。
张小珺
为什么 AI 产品都还没有形成数据飞轮?
杨植麟
因为基于算力的 scaling 太强大了。
比如先 scale pre-training,再 scale RL。RL 的效率比 pre-training 高很多,因为是 on-policy、带负梯度的训练。它的 scaling 效果和效率更高。
当 scaling 效率很高时,直接 scale compute、scale FLOPs 带来的提升非常大,所以其他方式带来的提升就显得很小。
另一方面,所谓数据飞轮,很依赖外界环境的 feedback。我们不希望 feedback 有太多噪声,但现在可能还没有把这个问题做得非常好。
大模型学习对噪声比较敏感,跟传统推荐系统不太一样。现在看起来,基于 FLOPs 的 scaling 更有效。
但平衡什么时候会变化,也有可能通过新的交互减少收集信号的噪声。
张小珺
需要创造一种新的交互。
杨植麟
对。但交互要适配模型能力的发展,不能超越模型能力。应该在模型能力范围内设计一个好的交互。
我觉得这是值得尝试的,只是今天看来,scale FLOPs 或者提升学习效率,确定性更高,也更有效。
张小珺
如果像严静说的,用户数据无法提供模型智能,那今天是不是就没有必要做 To C 产品了?一门心思提升智能就好了?
杨植麟
要看怎么看。可能还是要有一定量的用户。
不能直接把用户反馈拿去训练,但有一定用户量的好处,是可以知道整体需求分布,知道哪些地方用户用得好,哪些地方用户用得不好,再把这些抽象成 evaluation,去优化模型。
如果模型完全没有人用,可能都不知道该往哪里优化。
另外也要看用户的商业价值。现在又到了一个新的分水岭:用户有可能产生商业价值。
比如 OpenAI 的 PC 端用户,产生的商业价值很大,可能占它营收的比较大比例。特别是现在很多 Agent 产品可以端到端地产生价值,用户可能本身就是一个很好的生产力价值来源。
如果只是普通闲聊、问天气,可能不一定有很大商业价值;但如果是使用专业 Agent 的用户,就不完全一样了。
张小珺
你的产品有什么新的想法吗?
杨植麟
更多还是想模型怎么做。模型训练好之后,产品基本上已经做得差不多了。
张小珺
模型即产品。
杨植麟
我觉得今天仍然成立。我们还是会沿着这个方式一直做。
张小珺
有人会说,Kimi 是要做中国的 OpenAI。你不一定认可,但有人会这么看。你们是要从做中国的 OpenAI,变成想做中国的 Anthropic 吗?有这样的转换吗?
杨植麟
很难这样定义。中美不太一样,今天我们更多还是要站在全球视角思考这个问题。
做中国的什么,本身不一定成立。简单一点说,我们希望继续爬山,做时间的朋友,跟 community 一起加速技术推进。我觉得这是我们想做的事情。
张小珺
聊聊商业模式。你怎么思考?API 是好生意吗?
杨植麟
9. The Model Needs A Business
现在比较明确的商业模式,一个是 API,一个是一方产品。这两个我们都会做一些尝试。
当然,今天最主要的优先级,还是继续把模型做得更好,这是首要目标。
但在把模型做好的过程中,如果某些方面领先了,确实会有商业化空间。现在整体市场规模增长很快,头部公司有几十亿、上百亿美元的 ARR,而且还在快速增长,可能每一两个季度就翻两三倍。
我们会动态观察,做一些尝试。但最主要还是把效果做得更好。如果模型真的能做到 OpenAI 的水平,甚至做得更好,商业空间肯定更大。
张小珺
有用户说他们很喜欢 Kimi,但很担心 Kimi 赚不到钱。怎么办?你们能赚到钱吗?
杨植麟
还是要先投资。我觉得能不能赚到钱,取决于模型效果最后怎么样。
现在市场已经在一定程度上被验证,也在快速增长。所以还是专注把技术做得更好,剩下的事情确定性反而更高。
张小珺
Kimi 火了之后,你心情有什么变化吗?
杨植麟
没有,还是还好。这仍然是一个漫长的旅程,要持续做下一代模型。
还是回到刚才刻在石头上的两句话:会产生新的问题,然后去解决它。这可能是最有意思的部分。
张小珺
这个创业旅程里,有什么是完全意料之外的吗?
杨植麟
基本上所有困难都预料到了,只是具体会是什么困难,不知道。
最有意思的点是,你永远不知道会产生什么新的技术问题,也不知道这些新问题会怎么样被解决。这是最有意思的部分,也是很难预测的。
如果能预测,它就不是那么创新了。你会永远遇到新的问题。
张小珺
你现在的生活是什么样的?
杨植麟
生活节奏可能是睡得比较晚,每天也不太一样。但还好,花很多时间去看怎么把模型训练得更好。
张小珺
所以你的时间主要投入在模型训练上?
杨植麟
我觉得是。但模型训练是一个很抽象的概念。
其中很重要的一部分,是技术战略。我觉得这是公司战略里最重要的部分之一:下一步到底哪些要做,哪些不要做。
技术空间很大,总要选择一些东西重点去做。
张小珺
去年选择的是什么?
杨植麟
我觉得我们在很多事情上的 bet 是有效的,而且比较早。
比如做 long CoT,我们反应比较快;做 Muon 优化器;做更大规模的 pre-training;以及做一个可能是第一个开放的 Agent 模型。
这些都是技术 bet 或者技术决策。它们至少会决定五六成公司的走向。
但做出好的决策,还是需要很多证据支撑。我们需要做很多实验,了解具体实验结果,判断这件事是什么样,以及接下来会怎么发展。不能拍脑袋,还是要知道更多信息。
张小珺
这些决策里,你们最纠结的是哪个?花时间最长思考的是哪个?
杨植麟
最重要的是接下来做什么、不做什么。
张小珺
刚才说的那些决策里,哪一个花时间最长?
杨植麟
也还好。关键是一个收集数据的过程:做实验,看实验是不是扎实,再结合对技术的理解去判断。
很多时候,只要数据足够充分,判断也会比较显然。
张小珺
接下来呢?
杨植麟
接下来我们也在想,也在做实验,还是有很多东西可以做。
至少现在 K2 的性能潜力还没有被完全压榨出来。之前发布的版本更接近一个 base model。接下来可以增加更多 post-training FLOPs,我觉得它的上限应该比现在高很多。
当然还会做下一代模型,下一代模型应该还会有更多提升。具体怎么做,现在也会通过实验决策。
张小珺
也会加入多模态吗?
杨植麟
多模态肯定是比较确定的。
张小珺
你刚才一直说,多模态只要不干扰智能就已经很好了,是吗?
杨植麟
对。但多模态能力本身要做好,也并不容易,里面有很多工作。
关键是怎么让它借鉴文本的脑子,而不是单独开一个脑子。比如在 MoE 里,假设有 20 个 expert 专门做多模态,你可能不希望出现这种情况。否则学出来的多模态可能是“傻的多模态”。
我们希望它是聪明的多模态。
张小珺
下面有什么重要的技术里程碑?
杨植麟
泛化性可能是一个。
我觉得 Agent 泛化性可能是最重要的。它是今天还没有完全被解决的问题。
张小珺
你们解决了一部分了吗?
杨植麟
解决了一些。具体怎么做好,我们写在 paper 里了。
你可以尽可能构造更多样的数据,但不只是数据问题。还要尽量避免通过强化学习只拟合几个任务。
因为 benchmark 现在比较局限,优化 benchmark 会导致 I/O 任务坍缩到几个单点上。但我们不希望这样。模型在没有观测的任务上,可能会掉得非常多。
我们现在也在想更多办法解决这个问题。我觉得这会很重要。
另外,long context 的支持也会继续研究。在智商很高的情况下,支持更长 context,是一个很重要的问题。
现在很多 long-context 架构还是会影响智商。
张小珺
为什么 long-context 架构会影响智商?
杨植麟
比如纯粹的 linear attention,可能会影响智商,因为这个架构有一些 bias,在某些场景下效果没有那么好。
但这在一定程度上也可以被解决。
张小珺
模型公司和做 Agent 产品的公司,长期来看关系和边界在哪里?
杨植麟
我也没有明确答案。
今天看,一方产品的好处是可以做垂直整合。模型可以直接在工具环境里训练,模型和工具融为一体,不是分开做完之后再逆向工程。
但 Agent 的空间非常多,一方产品不一定做得过来。如果某个工具的实现需要很多领域 know-how,或者 evaluation 是一方产品根本不会考虑、考虑不过来的东西,我觉得就有机会。
像 K2 这样的开源模型,可以让大家在上面微调,更容易产生 specialized agent。垂直 Agent 的可能性,一定程度上还是会存在。
张小珺
那要看通用模型能通用到什么程度了。
杨植麟
对。但不管多通用,总还是有一些工具需要做。
你不一定要做模型,也可以把工具做得非常好。但如果工具太通用,可能就会和一方产品产生比较大的交集。
所以做垂直整合,可能优势更大。但如果工具专门针对一个东西,甚至是别人做不了的,比如掌握了一些线下服务入口,那么下订单或成交的工具就是别人做不出来的,也有可能产生独特价值。
当然还有另一种可能:当一方产品或者通用 Agent 的流量、商业模式足够成熟之后,很多原本垄断的专有工具,也会愿意接入,因为整体商业化效率更高。
但商业化效率的提升需要时间。在这个时间窗口内,专有 Agent 也会有空间。
最终,通用之所以能工作,是因为整体商业化效率更高。甚至很多内容平台,最终把内容接入通用 Agent,商业化效率可能会比今天更高,只是可能需要很长时间。
张小珺
像 Midas 这样的公司,会是你的客户,还是竞争对手?
杨植麟
现在还很早期,很难判断。产品本身也会演进。
短期内,更多可能是合作关系,大于竞争关系。但未来它确实会演进。
有点像 Claude 和 Cursor 的关系。Cursor 也需要动态调整产品策略:一方面,它能不能拥有一些模型能力;另一方面,能不能拥有别人做不到的工具或环境。
这些现在都没办法直接回答。但今天看,一方整合的优势应该是存在的。
张小珺
你形容 K2 是哪一座峰,哪一座山峰?
杨植麟
K2 本来就是世界上最难攀登的山峰之一,刚好这个名字有重合。
张小珺
这是你故意选的名字吗?
杨植麟
对,刚好也是 K2。
但我们也希望它不是终点,因为它不是最高的山峰。它可能是最难的,因为现在有很多范式转变:从对话到 Agent,base model 的 scale 也进一步变大,本身肯定存在难度。
所以刚好跟这个有点关联。
张小珺
结果超出你的预期吗?
杨植麟
差不多。模型训练得怎么样,在过程中基本已经知道了,不会有特别大的惊喜或惊讶。
张小珺
没有你的 aha moment 吗?
杨植麟
还好。很多东西是可以预测的。
训练一次模型,一是需要周期,二是需要成本,所以希望在早期尽可能预测到所有能预测的东西。唯一没有预测到的,就是 max logit 的问题,但那个确实没办法,因为小规模时预测不了。
其他问题,我们都希望尽可能预测好,在验证清楚之后再 scale。这样 scale 的成功率就比较高。
张小珺
你怎么看张祥宇说的 next-token prediction 的本质缺陷?你知道这个观点吗?
他的意思是,随着模型规模扩大,对话能力、知识量和情商都在变强,但是推理能力,尤其是数学的表现,可能是先上升、再趋于平缓,继续扩大反而下降。
所以他觉得,用更大的模型做数学问题时,模型倾向于跳步、不老实,这是 next-token prediction 的本质缺陷。
杨植麟
可以搭配强化学习 scaling。
如果今天不做强化学习,模型很难说特别聪明。数学题也不一定能做得非常好。
但更大的 base model,在强化学习上的上限还是更高,因为它的知识更多。本质上,是通过强化学习激活一个推理范式,把知识解锁出来,让它的上限更高。
所以要搭配 RL 去激活它。
张小珺
世界模型怎么看?有一种说法是,做世界模型是“造世界”,做 Agent 是“造人”。
杨植麟
这跟刚才说的用 AI 训练 AI 有点像。
如果有一个很好的世界模型,就可以模拟这些东西。它可以通过 AI 训练 AI 的方式,让泛化变得更好。
我觉得这可能是通往更好泛化的一种可能性。
张小珺
你的一个投资人说,第一次见你的时候,你就开始讲 GPT-10 可能长什么样。他之所以对你影响很深,是因为你第一次见他时,讲的不是 GPT-4、GPT-5,而是 GPT-10。你现在觉得 GPT-10 会长什么样?
杨植麟
还会有 GPT-10 吗?我当时说了什么?我不知道。
张小珺
建 evaluation 方面,你们有什么新的认知吗?
杨植麟
我们也在探索。刚才说的世界模型,可以认为是其中一部分。
但怎么实现,现在还需要更多实验。
张小珺
过去一年,对组织有新的想法和思考吗?
杨植麟
10. Leading Through Uncertainty
我最近一直在想一件事:有几个东西好像联系在一起。
如果看科研,或者创造新知识的过程,它很像一个强化学习过程。有一种理论叫经验主义,认为人得到新的知识来自经验。
但后来有很多观点认为并不是这样。人类在地球上存在了非常多年,但可能直到三四百年前,才有人提出地球是球形的。
人一直处在经验里,却并不知道事实是什么样。所以经验不能直接给你知识,而是你提出猜想。你观察到一些东西,提出猜想:我认为地球可能是圆的,然后想各种办法去验证它。
包括训练神经网络。你可能观察到几十万个内部指标,其中有一些不太对。直接观测不会给你新的知识,你需要提出猜想:为什么会这样?然后设计实验去验证。
这是现在可能比较好的方式。也许所有好的科研方式都是这样。
这几个东西好像是相通的:做科研、训练模型,以及管理一个团队。
张小珺
也就是说,管理一个团队也要用 RL 的方式,而不是 SFT。这个是 Tim 天天跟你讲的。
杨植麟
对。当然现在发现,做 RL 时也希望加入一部分 SFT,因为 SFT 是很好的先验,也就是所谓的 PTX loss。你不希望模型飞得太远。
但要管住自己的手,不能 SFT 太多。SFT 太多,同学就会失去主观能动性,没办法创新。
这个点我也在实践,看起来有一些效果。核心是掌握 SFT 和 RL 的平衡。
SFT 是直接告诉他,这个事情应该这样做;RL 则是从上而下,给他一个奖励:如果做到这样,可能就是好的。它更多时候反映在目标上。
我觉得这两个东西需要平衡。可能以 RL 为主,通过一部分 SFT 防止它飞得太远,但还是要有一些先验,控制它,或者防止它遗忘掉一些东西。
这些事情某种程度上都连接在一起。RL 好像是一个很本质的东西,组织在做创新,本质上也是 RL。
但在 RL 过程中,定义奖励或者指标并不简单。比如如果只是要求把所有 benchmark 做高,可能出现很多 overfitting。所有人都会不择手段把分数弄上去,但最后模型可能并没有变好。
所以奖励的定义很重要,也需要非常了解具体细节是怎么运作的,否则就会出现 reward hacking。
张小珺
怎么定义 reward?有什么想法吗?
杨植麟
这是一个很重要的课题。还是要建立更多观测指标,尽可能不要过拟合。
这样才能有更好的泛化,不会被 hack。
用 RL 管理团队,最大的问题就是容易被 hack:大家 hack 那个 reward,看起来结果都很好,但实际上没有达到最终想要的目标。
用 SFT 管理团队的风险,则是大家失去创造力。
所以最后一定程度上要平衡这些东西。我现在也在学习,肯定还没有做到非常完美,但在逐渐学习和理解这件事。
张小珺
你过去有很低落的时刻吗?
杨植麟
我觉得还好。更多是有些东西 work,有些东西不 work,解决一些问题,又产生新的问题。
只要觉得这件事有意思,就会一直想继续做下去。
张小珺
你对 CEO 这个身份有没有新的理解?
杨植麟
我现在最新的理解,就是怎么把握 RL、SFT 和 reward hacking 之间的平衡。我觉得这可能很重要。
张小珺
过去一年,舆论也是波峰波谷来回震荡。你在其中的心态是什么样的?需要平衡自己的心态吗?
杨植麟
心态不会像刚才说的那么简单。我觉得人会有高点和低点。
但很重要的是,你喜欢做这件事,想把它做好。所以不用想别的,就想怎么把它做好。这样好像也比较简单,没有什么特别复杂的。
很多复杂性都是人为强行加上去的,实际上并没有那么复杂。
张小珺
那你对人性有更多理解了吗?
杨植麟
这个东西还是需要时间打磨。我不敢说自己理解得很深入。
只能说在自己的故事里,不断感受自己到底是什么样的人,为什么要做这件事。我觉得需要不断思考这些问题。
张小珺
你是一个什么样的人?你为什么要做这样的事情?
杨植麟
因为觉得有意思。
张小珺
什么有意思?做实验有意思,做科研有意思,还是做 AI 有意思?
杨植麟
寻找真相的过程有意思,不断发现新的问题、解决问题的过程有意思。
张小珺
你也可以解决别的问题,为什么要解决这个问题?
杨植麟
因为这个问题重要。
张小珺
哪个问题重要?
杨植麟
我觉得 AI 很重要。这个问题我也问过 Kimi,它跟我说,AI 是人类文明的放大器。我觉得很有道理。
还是回到《The Beginning of Infinity》。从启蒙运动到现在,人类一直在找到新的方法,突破知识边界。下一个突破边界的,可能确实要靠 AI,因为它是一个巨大的杠杆。
比如今天在任何一个前沿学科,都要花二三十年才能学到最前沿的知识,但 AI 可能一夜之间就能学会。然后人类就可以继续往下做新的突破。
AI 会成为一门 meta-science。我觉得这也是人类文明非常重要的放大器。
张小珺
它有可能摧毁人类文明吗?
杨植麟
这个风险肯定不能说不存在,但我们可以做很多事情,比如更安全的对齐,以及更好的社会机制。
当 AI 可以做一些事情时,也很可能创造新的工作。我们需要一些方法去完成这个过渡。
我其实问过 Kimi 这个问题。它说,虽然有这样的风险,但不能放弃这件事,因为放弃它,就等于放弃人类文明的上限,不知道它的上限能做到什么程度。
有一点因噎废食的感觉。
但我承认,我们需要做很多事情。今天看到很多 AI 能力,确实有点震惊,因为半年前根本想不到现在能做到这样的程度。
同时我认为,人的独特价值在这个过程中仍然会持续存在。人的体验、人的情感,没有办法被 AI 替代。所以人可能会有不同的活法,但希望是能活得更好。
张小珺
什么样的不同活法?
杨植麟
我以前觉得人的一生可能有几个不同的意义,比如创造、体验和爱。当然每个人不一样,这是对我来说的理解。
创造里面很大一部分也许有一天可以由 AI 完成。我仍然很享受创造的过程,但不得不承认,有一天可能会有很多创造性工作由 AI 完成。
后两条可能仍然会以人为中心。但如果 AI 把创造拿走了,它其实也把生产力拿走了。人可以享受生产的结果,如果有一个好的机制,社会机制也需要改变。
但这是一个缓慢的过程,不会一两年完成,可能要一二十年逐渐调整。
张小珺
你会频繁跟 Kimi 聊天吗?
杨植麟
当然,我要测试模型。
张小珺
会跟它聊一些深刻的话题吗?
杨植麟
有时候会,也会聊一些很自我的话题。还有一些是工作本身的问题。
张小珺
你觉得今天 Kimi 的成功概率增大了,还是失败概率增大了?
杨植麟
相比于什么时候?
张小珺
相比于一年前。
杨植麟
我觉得成功概率增大了。
只要每往上爬一步,成功概率都会变大,因为会有一些人不再继续爬了。
张小珺
但你恐惧掉下去吗?
杨植麟
肯定会有恐惧。但恐惧很多时候还是要关注当前这一步,关注现在能做什么。想这个问题可能更重要。
张小珺
过去你有没有走弯路?
杨植麟
肯定有。
在这个过程中会有很多决策,有技术决策,也有业务决策。很重要的是,一个公司要逐渐调整。
知识创造也是这样,不可能创造出来的所有知识都是对的。有些东西在一段时间内可能是对的,之后可能又是错的。
比如牛顿做的很多东西,在当时是最好的理论,但并不是完美的理论。在一些场景下,它是完全错误的。万有引力需要其他解释,需要相对论通过时空扭曲去解释。
组织进化或者公司发展也是一样,是一个动态过程。任何一个中间状态,在某些时间是对的,在另一些时间可能是错的。
Kimi 也告诉过我,任何中间状态都会成为被批评的对象,类似是这个意思。总会有时代的局限性。
更重要的是,在这个过程中,一方面要投入一些不变的东西,比如人才和技术积累;另一方面,要不断适应和调整,针对反馈信号和环境状态的变化做出决策。
这两件事都很重要。
张小珺
到底做 AI 时代的产品,是不是跟互联网产品完全不一样?
互联网产品会通过投流扩大 DAU、扩大市场规模。但 AI 产品不太一样:模型能力提高之后,可能自然就能获客,但获客之后又不知道用来做什么。这个怎么平衡?
杨植麟
有时候也不一定那么自然,取决于两个变量哪个更大。
如果处在技术快速发展的阶段,很难通过投流去赢得战争。我觉得是很难的。
但投流可能更多是辅助手段。辅助方式和主要手段之间是什么配比,需要动态调整。
也取决于商业化进展,或者 PMF 有多强。不同时间点可能有不同策略,甚至一两年后,原本的策略又会变成好策略。
我们会用更开放的心态看这件事。但在每个时间点,最重要的是看哪个变量最大。
张小珺
今天最大的变量依然是智能。
杨植麟
对,还是爬山。
张小珺
我一直问你各种情绪,你都说“还好、还好、还好”。你最近一次,或者最近两次,颅内自嗨是什么情境?
杨植麟
为什么是颅内自嗨?
张小珺
为什么?
杨植麟
我觉得要“不以物喜,不以己悲”。
张小珺
但很难做到。
杨植麟
对。但这是为了避免情绪化决策。
张小珺
所以你会情绪化吗?
杨植麟
作为一个人,多少肯定会。但我说的是,尽量避免情绪化决策,最终在决策和执行上还是要更理性一点。
张小珺
你最大的成长是什么?过去一年。
杨植麟
认识到一个点:问题是不可避免的,它会一直存在。持续解决新问题,这是最重要、也可能是最有意思的事情。
我觉得这是一个心态上的变化,当然也可能改变很多做事的方式。
张小珺
这是一种正念的方式?
杨植麟
我不知道怎么理解,但可能差不多。
张小珺
你今天比一年前更兴奋吗?
杨植麟
有两个因素。
一方面,更适应这种状态,所以兴奋值会减少;另一方面,AI 进展很快,能力又提升了,所以兴奋值会增加。
基本上可能维持在一个比较稳定的水平。
张小珺
最后几个快问快答。一个全球范围内你喜欢的食物?
杨植麟
拉面。
张小珺
为什么?
杨植麟
好吃。
张小珺
一个少有人知道、但必须知道的知识点?
杨植麟
我好像不太擅长回答这种问题。
张小珺
基于所有读过的书,推荐两本必读书。
杨植麟
有一本我刚才一直在讲,就是《The Beginning of Infinity》。推荐这一本。
张小珺
心目中影响 AI 进程的几篇最重要的论文是什么?
杨植麟
最重要的几篇论文,可能是 Backpropagation,然后 Transformer 也可以算。还有 GPT,GPT-3。
当然有一些 building block 也很重要。比如 ResNet,我觉得也很重要,它可能是泛化的基础;还有 Adam,现在可能还有 Muon。
张小珺
基于当下的认知,一个最关键的 bet 是什么?
杨植麟
Agent 的泛化。
张小珺
用什么方式?
杨植麟
用 Innovation,用 L4 做 L3。
张小珺
最近的动物是什么?
杨植麟
不知道。我感觉脑子已经糊了,已经把一年的话都讲完了。
碳基生物的局限性。