程曼祺
终于见到田老师了,之前我们都是在线上聊的。上次采访是去年 5 月,当时我们聊的是你的科幻小说《破晓之中》。这次再聊,我觉得是科幻已经照进现实,因为这期间有一个比较大的变化,就是您和很多其他的顶尖研究员一起创立了 Recursive Superintelligence 这家公司。你们在做的一些事情,和你当时的科幻设想也有一些契合的地方。
你可以先用几句话,给我们的听众介绍一下这家新公司是做什么的。
田渊栋
1. RSI 的真正含义
这家公司叫 Recursive Superintelligence。它的目的就是,能不能找到用 AI 自我进化、自我迭代的方法,找到新的范式、新的模型、新的训练逻辑,然后得到更好的 AI。
程曼祺
因为你们的名字里有 Recursive,也就是“递归”的意思,Recursive Superintelligence 的缩写是 RSI,和现在硅谷讨论特别多的一个概念也是一样的。那个 RSI 是 Recursive Self-Improvement,也就是“递归自进化”。
田渊栋
对。其实我们这个 Recursive Superintelligence,意思也就是 Recursive Self-Improvement,所以意思上来说是非常接近的。这个概念应该说从今年 4 月、5 月份开始慢慢变得比较火。我们成立公司的时候,大部分人还没有想过这个概念,但是随着大家的意识和思考逐渐增加,它慢慢成为了一个共识。
大家发现,模型已经比较厉害了,有些模型能够发现模型自身的一些问题。通过这种方式,其实可以存在一种可能性,就是用 AI 找到 AI 模型自己的问题,然后让 AI 带领着模型变得越来越强。
程曼祺
我觉得正好也可以讲讲这个背景。RSI 也是我想和您深入讨论的一个话题。就像你说的,最近这段时间,我觉得它越来越成为一个相对共识性的趋势了。
另一方面,RSI 这个想法本身并不是那么新,之前也一直都有。为什么最近这段时间发生了什么变化,或者有什么因素导致大家开始讨论它?
田渊栋
2. RSI 正在成为共识
我觉得主要有两个原因。一个是 coding agent 变强了,另外一个是模型本身的能力也在提升。模型能力提升到一定程度之后,模型对 AI 自己、对 AI 模型的认知有了一些比较强的突破。
这样之后,你就可以用模型来充当研究员,让它找到当前模型的弱点,然后去做更好的优化。这样的话,闭环就会产生。产生闭环之后,下一次模型就会变得更强,递归就是这个循环不断往前推进的意思。
但是它的前提条件是,模型本身已经足够强了。如果模型本身不够强,这件事情就很难。
程曼祺
其实去年 5 月我们聊的时候,顺着你的科幻小说,延展讨论了一个话题:AI 会不会取代顶尖的 AI 研究员。当时你觉得短期内比较难,因为 AI 研究员可以从少量的数据里面,获得一些精准而细节的联系。
但至少当时的大模型,还是要学习大量复杂的数据,然后通过统计得到一种表达。到了去年年底,我们又聊了一下,那会儿你已经在筹备这家新公司了。在这个过程中,你自己的思路有一些什么变化吗?
田渊栋
首先,我现在还是认为,大模型目前还是替代不了顶尖研究员,至少现在还不行。只是说,模型的能力已经到了一定程度之后,确实可以用模型来做一些研究工作。
我觉得这件事很重要,而且存在一种可能性,就是模型会变得越来越强,最终产生更强的能力。这是有可能的。
3. GPT 改变了判断
一个契机是,去年 5 月之后,大概在 8 月的时候,我用当时的 GPT-5,和 GPT-5 合作做了一篇关于 Grokking 的文章。那篇文章做完之后,我意识到,模型的能力已经基本上强到让我觉得,我可以不用招实习生了。
因为很多想法和思路,完全可以通过我和模型对话来实现。我可以给模型一些具体的细节、比较细的方向,让它去找到新的想法、新的思路,证明新的定理。我这边可以写代码、做实验,然后把东西做出来。
现在写代码也不用人了,写代码都可以让 AI 来做。所以应该说,这个 loop 已经开始有转起来的趋势。
这个时候我觉得,也许 5 年之后我就被取代了,那么这个时间可能已经快到了。在这种情况下,与其自己被取代,不如我就开公司,做这件事情。
程曼祺
去年 8 月你看到这个迹象之后,我想知道,当时有多少人有类似的想法?你说从去年到今年 4 月、5 月,越来越多人开始讨论,在去年大半年前,情况是什么样的?后来你又怎么找到一些跟你想法比较相似的人,一起来做这家公司?
田渊栋
我觉得这个事情,如果不亲手实践、亲身去体验,是感觉不到的。如果你不把模型当成一个实习生,或者把模型当成一个聊天对象,你是感觉不到这个变化的。
要等到你真的把模型当成一个聊天对象,能够跟它合作、跟它做一篇文章,文章做完之后,你才会觉得,模型的能力确实已经比我想象的高很多。
程曼祺
你的意思是,倒回到那个时间点,这么做的人不见得很多。
田渊栋
对。现在我们也能看到这样的情况:有一些特别是 C-level 的人,他们一般不会去思考太细节的东西,可能会考虑比较 high level、比较高层次的想法和建议,但不会真正把模型拿过来做一个非常具体的项目。
另一方面,一些刚刚从学校毕业的学生,可能会把模型作为执行上的工具,也不会去做一些比较难的问题。所以这两边其实有一个 gap。
程曼祺
这也呼应了我们上次聊的一个话题。当时我们聊到,你连续两年写了年终总结。有一年应该是 2023 年的年终总结,讲了一些你觉得怎么带团队的经验。到了后面一年,你的想法变了,你说自己想更 hands-on。
田渊栋
4. Hands On 改变研究速度
对。因为大模型有一段时间让你发现,如果你不 hands-on,就没有办法真的知道模型内部发生了什么,也不知道整个系统发生了什么。
当你不知道这些东西的时候,你指挥的方向就会出现偏差。而这个偏差很难获得反馈。传统的研究过程中,一般是一个比较 senior 的导师跟学生说,我们要做一个方向,然后导师本身可能不会真的去碰代码、碰数据,而是让学生把事情做完,再反馈给导师。
学生会告诉导师,这件事情没做好、这件事情不 work,原因是有一二三四五这些困难。导师可能会说:“我的 idea 一定是对的。”然后让学生继续挖掘。
一般来说有两种可能。一种是学生发现导师说的是对的,最后把事情做成了;还有一种可能是导师的想法其实并不对,但学生证明了这件事情不对,然后找到下一个方向继续做。
这个过程至少需要几个月的时间,也是一个科研项目的一般周期。这是一个 loop,但这个 loop 的问题在于,导师不直接跟具体的实验打交道。
导师和学生讨论、给学生指导,学生把指导做出来、得到反馈,再跟老师汇报,这个过程一般至少需要几天。也就是说,大家是以天为周期进行科研探索,可能需要几周甚至几个月才能把事情做成。
但是现在有 AI,特别是有非常强的 AI 之后,这个时间被压缩到了几分钟,甚至更短。
程曼祺
也就是说,验证一次的循环,从几天、几周,压缩到了几小时甚至几分钟。
田渊栋
对。特别是对一些比较简单的项目来说,很多时候你有一个想法,大概告诉 AI,AI 很快就把代码写出来、跑完,然后告诉你结果。
也许你写完之后出去喝口水、喝杯茶,或者跟别人聊两句、开个会,开完会结果已经有了。结果有了之后,你就可以看到自己的问题在哪里,然后进行下一步循环。
程曼祺
你刚才描述自己最开始看到 RSI 的方向和前景时,让我想到一个稍微岔开一点的问题:什么样的人能够最早看到这个信号?
其实你描述的是,一个人既有比较多的经验,能够判断什么问题是难的、重要的,同时在那个时间点又非常一手地在做一些事情。
田渊栋
是,这样的人很容易敏感地感觉到当前风向的变化。
程曼祺
所以这个人有可能也不是特别年轻,是吗?这和现在 AI 叙事里“你特别年轻,什么东西都可以很快学起来,以前的经验可能是负经验、没有那么有用”的观念不太一样。
田渊栋
可能不太一样。以前在 coding agent 还没有普及,或者还没有达到人类能力之前,年轻人很有市场,主要是因为年轻人的冲劲比较足,决策和执行能力很快。
很多时候不要想太多,直接上来就干,干就完了。我觉得过去 3 年里面基本上都是这样。从大语言模型出来之后,年轻人很多时候有这样的优势,因为并不需要想太多,我们就 skill up、skill up,然后想做就做,非常简单。
通过这种方式,大语言模型得以快速发展。
程曼祺
所以你觉得 RSI 的风潮来了之后,反而可以让以往的经验积累,包括你沉淀的各种直觉判断和技术品味,有更好的发挥?
田渊栋
对,我觉得是的。可能天平会摆向更有经验、更年长的一群研究员。
当然,这也有很多争议,只是我的一个观点。现在 coding agent 来了之后,有很多以前从来不写代码的人,或者已经做了 10 年经理、总监的人,突然开始写代码了。他们会觉得,自己的青春又回来了。
很多人以前有想法,但是没有时间实现,团队也没有时间和精力去完成上面的人的每个想法和思路。所以这些人的经验很难被发挥出来。
但是现在有 AI agent,这个变化发生了。以前需要人去执行的重任,现在落在了 AI 身上,而人更多的是做判断、逻辑上的指导、大方向的把握,以及研究品味。这些东西变得很重要。
程曼祺
回到 RSI 这个主题。大约 10 年前,Google 做过 AutoML,也有一个类似的想法,用 AI 去优化 AI。你觉得现在的 RSI 和 10 年前 AutoML 这样的尝试,区别是什么?
田渊栋
5. 从 AutoML 走向 RSI
区别其实很大。上一波我们也做过类似的事情,我也写过很多架构搜索、AI-guided optimization、AI-guided design,也就是 AI 辅助设计这类方向的文章。
上一波的问题主要在于,我们没有一个模型能够建模人类的高层知识和高层思路。那一代很多时候是让研究员来定义搜索空间的大小和行为,然后让 AI 写成一个算法,去找到更好的解。
但是这一波大语言模型来了之后,模型能够达到这样一个程度:它本身对 AI、对 AI 本身的架构有了理解。这种理解可以部分代替人类定义问题的工作。
这样的话,解空间就变得非常大,而且比较智能,不像以前需要人去定义解空间。
程曼祺
所以它的区别在于,人参与的多少发生了变化?
田渊栋
是。以前人需要深度参与解空间的每个细节,AI 比较笨,只能在这个空间里面搜索。
现在更大的问题是,怎么样最大限度地发挥 AI 的能力,让它自己找到解空间的结构,自己找到一个比较好的方法去解决它。这可能更重要。
程曼祺
这也涉及到对 RSI 的理解和定义。很多时候大家提起 RSI,比如 OpenAI 也会说自己要做 AI intern,并且在 2028 年 3 月之前实现真正自动化的 AI 研究员。
这些说法都和自动化联系在一起,好像都指向把人从 loop 里解放出来。但另一方面,递归自进化中的“递归”,又有一个循环上升的意思。
你觉得这两件事是一起发生的,还是会有区别?
田渊栋
我觉得完全自动化不一定很快发生。自动化的程度,很多时候取决于人在上面会做什么样的工作,以及这些工作的层级是什么。
现在有 AI 和大语言模型之后,某些层级的工作不需要人去做了,但是更高一级的工作还是需要人去做,而且对更高一级工作的要求更高了。
所以某种程度上,人减少了投入时间,但可能需要更多脑力去做更高层次的工作。人还在 loop 里面,只是这个 loop 的 level 更高了一点。
程曼祺
所以你觉得递归有可能会先发生?
田渊栋
我觉得递归会先发生。完全自动化现在还看不到,这和我以前认为 AI 代替不了顶尖人类研究员的观点是一致的。
程曼祺
那你觉得递归和自动化这两件事,哪个更重要?
田渊栋
这个事情不存在重要不重要的问题,一定是随着模型能力慢慢发展。你可能会发现,完全自动化是不行的,还是需要人的指导。这个时候,自然就会形成递归的结构。
程曼祺
最近确实和很多人在聊这个概念。有一种观点认为,递归更重要,是因为一旦这个循环跑到一定程度,掌握这些循环的组织、个人或者团队,就有可能进入加速度越来越快的阶段,把其他人甩得越来越远。
比如 Anthropic 和 OpenAI,也许就有这种可能性。
田渊栋
有这种可能性。模型可能会让自己变得越来越强,变得越来越强之后,模型能理解更深的东西,接下来就会有更强的 AI agent、AI scientist。有了这些之后,它为了发现自己更大的问题,就可以继续迭代上去。
但这讲的更多是范式的转变,和人在不在 loop 里面其实关系不大。
程曼祺
所以你也觉得,这个循环加速本身是可能的?
田渊栋
这是可能的。但是它在什么程度上可能,以及需要做到什么程度,AI 才会变得足够强,这些事情还需要探索。
程曼祺
最近这个方向很热闹。除了刚才提到的 OpenAI 时间表,Anthropic 在今年 6 月发布了一篇长文,叫《When AI Builds Itself》,副标题是“我们在 RSI 方向上的进展和实践”。不知道你看了这篇文章没有?
文章里提到,4 月的时候,Claude 的 AI agent 端到端独立完成了一个开放式的 AI 安全研究,累计工作了 800 个小时,把一个 weak-to-strong 的性能差距缩小了 97%。如果是人来做,一周可以缩小 23%。这听起来更多是提效,它达到了我们刚才说的递归自进化的程度吗?
田渊栋
应该还没有。我看了一下这个博客,基本上还是刚才我们聊的那个思路,AI 能够让 AI 自我进化、自我迭代,然后越做越好。
它具体的解法是找到各种各样的方案,让 weak-to-strong generalization 做得更好。它有一些指标,通过这些方法把指标提上去。
比如把模型里面的 representation 拿出来做分析,然后想办法把模型做得更强,大概是这样的逻辑。但这些算法本身还是比较常规的,是把很多常规的想法和思路放在一起,最后让分数提升。
因为有分数之后,才能做自我进化。除了分数之外,没有其他办法衡量模型现在的能力有多强,也不知道 self-improvement 最后的效果好不好。所以一定还是要靠分数,分数一般会具体体现为提效、提高速度,或者减少 latency 这样的指标。
这应该说是自进化的第一层。
程曼祺
所以你觉得,在第一阶段,它确实就是这样展现的:拆成子任务,然后看 AI 在子任务上是不是越来越好?
田渊栋
是的,一般会这样。
程曼祺
你觉得 Anthropic 和 OpenAI 理解的递归自进化,和你们有什么相同和区别?
田渊栋
大的方向上都差不多,我不觉得有什么特别大的区别。可能不一样的地方是,像 Anthropic 那篇文章写的,感觉上特别是在代码上已经有自进化能力。
但我觉得更难的地方是研究问题。AI research 和代码之间还是有差距的。Anthropic 之前的一些工作,展示的是对于一个已有项目,能不能让它自动做好,比如从头开始写一个 Linux,或者从头开始写一个 CI 编译器。
这些事情是有路径的,我们知道怎么写,只是工作太繁杂、太繁重、太累,很难让一个人或者一个团队把它写出来。但问题本身是有章可循的。
很多比较难的 AI research problem,人都不知道怎么做。有很多需要突破性的进展、突破性的发现的问题,现在 AI 还是很难做。
程曼祺
除了 OpenAI 和 Anthropic 这两家最受关注的 Frontier Lab,这个领域现在也有一些新的公司在尝试。有一家是 6 月 25 日刚刚官宣的,叫 Mirandil,种子轮融了 2 亿美元,团队应该来自 DeepMind 和 Anthropic。
另外,之前更早成立的 Sakala AI,也在 6 月刚刚成立了一个 RSI 新团队。这些更多的尝试,可能反映了行业的什么变化?你从他们的表达里面看到了什么有意思的东西?
田渊栋
6. 新实验室加入竞赛
我觉得从高层次来说,他们基本上还是一样的,都是做递归自我进化。这个方向总体来说比较接近。
Ndea 那边的创始人,之前也和我聊过。
程曼祺
你说的是更早之前、还在筹备创业的时候?
田渊栋
对,也不是说专门来找我,只是当时问我要不要过去。当时他还在 Anthropic,也就是我可能要从 Meta 出来的时候,Anthropic 也有一个邀约,相当于聊过一次。
后来很有意思,他就离开了。所以我之前也跟大家说过,跟我聊过的那些人都跑路了,包括 Anthropic 的那位。
程曼祺
相当于你们看到了相同的方向,都觉得离开大公司、重新组建一个 Lab 来做这件事可能更好?
田渊栋
有可能是这样。一个原因是,OpenAI 和 Anthropic 其实已经算大公司了,里面有很多人。Anthropic 没有 OpenAI 人多,但应该也有两三千人。
另一方面,这两家公司现在都要冲 IPO。对他们来说,最重要的是把手上的业务做好。手上的业务是什么?Coding agent。Coding agent 能够赚很多钱,把这件事情做好的话,他们可能会优先把它做好。
所以有可能他们看到了这一点,觉得还是自己出来比较好,因为 AI 在 RSI 这个方向毕竟比较远,没有那么近。
程曼祺
你刚才说还有其他公司的人也出来了。他们出来之后准备做什么,现在已经浮出水面了,还是有些仍然在水下?
田渊栋
我当时说的是,有些人是作为大厂的高管来问我要不要跳槽过去,所以很多人后来都走了。比如苹果有人走了,Amazon 的人也走了,有些人出来创业了。Amazon 那边有一个 San Francisco Lab 的负责人 David,也出来了。
但是现在他们出来准备做什么,我不知道。
程曼祺
你当时也和一些大公司聊过,想继续做 RSI 这个方向?
田渊栋
跟大公司聊的时候,很难决定你能做什么方向。很多时候是大公司会说:“我们想做这个。”他们有自己的想法,希望我加入之后给他们提供助力。
程曼祺
所以去年秋天你和这些公司交流时,确实没有很多人提到想做 RSI?
田渊栋
对。当时 RSI 还不是大众认可的方向,还是一个小众方向。
程曼祺
现在至少在一些宣称和表态上,RSI 看起来已经变成一些公司的重点。OpenAI 和 Anthropic 都有这个现象,而且我和一些这些 Lab 的人聊,他们确实也很关注这个方向。
你觉得 OpenAI 和 Anthropic 对这件事有多重视、多认真?
田渊栋
这个我不好说。至少现在大家都在说这件事,但怎么样最终把它做成,应该说是更难的问题。现在大家可能还在讲一个概念。
一个问题是,这件事情到底有多重要,是不是未来的方向;另一个问题是,怎么样把它做成,具体的 metric 是什么。对于后面这些问题,现在大家讲得还不多。
程曼祺
你觉得这有可能成为他们继 coding agent 之后的下一个主线吗?
有一种推论是,RSI 非常需要 coding 和 agentic 的能力,而这两个能力本身对于这些前沿模型公司来说,已经是主线了。所以 RSI 可能就是沿着这条主线往下延伸的下一个方向。你怎么看这种想法?
田渊栋
我觉得 RSI 比 coding agent 要大得多。
程曼祺
你的意思是,它需要解决的问题、难度,以及可能的路径,都比现在的 coding agent 大很多?
田渊栋
对。Coding agent 只是一个执行者,RSI 的问题和路径要大得多。
程曼祺
所以你说的“大”,不只是市场规模,也包括研究上的可能方向和逻辑?
田渊栋
对,市场规模当然是一部分,还有研究上的一些可能方向和逻辑。
程曼祺
所以你觉得,光有 coding agent 这个支点,其实不见得就能做好 RSI?
田渊栋
是的。对 Cognition 来说,大家已经有可以用的 Claude Code 和 Codex,最近的一些开源模型效果也很好。这个方向在做一些基本功能的情况下,已经做得还不错了。
而且因为有开源模型的存在,这件事情变成所有人都有了这个能力。
程曼祺
开源模型的能力,和 Anthropic、OpenAI 的能力已经比肩了吗?比如 GLM-5.2、Kimi 2.7 这些。
田渊栋
肯定还是有差距,差距还是有一些,但应该在接近中。我自己的体感是越来越接近。
至少和 Opus 4.7 相比,GLM-5.2 还是挺不错的。
程曼祺
那和 4.6 比呢?
田渊栋
4.6、4.7 差不多。我的体感没有觉得 4.7 有多大区别,4.6、4.7、4.8 没有太大区别,只有版本号的区别。
可能唯一的区别是 4.8 的 context 变长了,用起来更舒服一点。因为 4.6 用到一半,突然会说:“我要 compact this history。”然后等半天,等它 reset 之后,你再问它以前的事情,它就不记得了。
这是它一个比较大的问题。4.8 相对来说没有这个限制,用起来会更舒服一点。
程曼祺
所以在你现在的实际使用中,像 GLM-5.2 这样的模型,已经很够用了?
田渊栋
应该说还可以。我最近刚从国内回来,紧急用了一下,因为大家都觉得它好,我肯定要试一试。
它还是比较擅长做执行上的工作,而且执行工作能做得不错。有一些事情经过思考之后,它做得还可以。但有些时候可能会陷入死循环,或者出现各种各样的毛刺。
总的来说,还是挺好的。
程曼祺
你刚才提到 RSI 比 coding 大得多。除了 coding 之外,你觉得它还需要什么能力?
田渊栋
7. AI 缺少研究品味
一个很重要的能力是,如果你要做 AI scientist,或者要做到人的研究员能力,就需要人类研究员的品味、对方向的感觉和理解,以及对问题的抽象能力。
这些东西现在的模型都不太有。
程曼祺
如果总结一下,这在模型里属于什么能力?属于推理,属于 reasoning 吗?
田渊栋
当然是推理能力,但很难形容这种东西,也不是 reasoning 能够完全包含的。
程曼祺
它比 reasoning 更大。那在人类的能力里面,它属于哪一种?
田渊栋
大部分人也并不具备这种能力,只有一些很强的研究员有。
程曼祺
这是创造力吗?
田渊栋
应该说是创造力。就是可以把一些概念从纷繁复杂的表象中抽取出来,加以总结、加以思考,然后继续应用于新的问题上。
这其实就是你之前说到的,从少量样本里看到精准而细节的联系。但这个能力现在的模型还很难具备。
程曼祺
这其实是对人来说真正的 grounding。
田渊栋
对。这应该说是人和大模型相比,一个比较大的优势。
大模型现在能力很强,还是因为有大量数据。对于非常常见的数据、重复性的领域工作,大模型有无穷无尽的数据,所以它可以学会。
但对于数据量很少的、像科学家这样开创性的领域,问题层出不穷。你每次做实验、每次探索都会发现新的问题,而这些问题的样本数据很少。要让 AI 去做,恐怕比较难。
程曼祺
你觉得计算机科学,或者具体到 AI 这个领域,相比其他自然科学,会不会本身数据更丰富,因此不需要你说的那种能力,也能继续往前走?
田渊栋
计算机科学也很大。它有很多工程方面的能力,大家已经反复实践过了,这些能力 AI 已经有了。可能不太需要灵光乍现,它也能往前走。
还有一些应用研究的能力,比如按照某个固定逻辑、固定的计算方案或者思维方式解决问题,这种能力 AI 现在也已经有了。
比如让 AI 解一道数学题,这道题肯定有很多相似题目已经出现过,AI 能够学会其中的模式,然后找到更好的解。
但是有很多问题,很难找到固定的模式,或者这个模式以前从来没有出现过,这些问题 AI 就很难找到答案。
程曼祺
至少在第一个阶段,不说 AI 和其他自然科学,单说 AI 这个学科,实际上有很多问题是需要在很少的样本里,找到一些没有固定模式的新东西吗?
田渊栋
有一个非常明显的例子,比如 Grokking,以及怎么样理解模型本身的问题。
模型本身有学习能力,它怎么从数据中学到模式,又怎么把这个模式拓展到其他方向?这个问题没有现成的数据集,因为如果有数据集,这个问题就解决了。
没有数据集,而且大家理解这个问题的方式也不一样。怎么样理解 AI,怎么认识世界,怎么发现新的 pattern,怎么产生涌现,这些问题上有很多人做了很多尝试。
从 2013 年、2014 年深度学习和大模型开始的时候,就有很多做理论的人想用各种方式解释它。比如物理上的重整化群,spin glass,也就是自旋玻璃;数学上的 neural tangent kernel,也就是神经正切核;还有贝叶斯方法、高斯过程等。
大家从很多不同角度研究模型怎么样产生涌现、怎么样学习东西。这些方法都尝试过,但没有特别满意的结果。
如果真正找到一个新的 AI 理解,这个理解可能会和其他方向都不一样。要让 AI 自己去找、去发现,就很难通过照搬已有的逻辑、把已有的逻辑套到 AI 上来完成。
程曼祺
从 2013 年、2014 年开始有这么多尝试,都没有很好地解释 AI,但另一方面,这似乎也不影响 AI 突飞猛进的发展。
我在想,回到你们公司的目标,或者 RSI 的目标:让 AI 自进化,或者让 AI 帮助 AI 更快进化。这件事情是不是不需要处理特别深的理论问题,也可能实现?
田渊栋
对,这就是 RSI 好的地方。RSI 不是像无人车那样,要么是零,要么是一百,而是有很多阶梯。
RSI 在初级阶段就能够做很多事情,比如优化各种算法、提高性能。这个阶段已经有实际用处,所以它的低级台阶本身就有很多实用价值。
等到第二级台阶,它可能会挖出更深的东西,实用价值也可能更大。最终,我们可能会有一个非常难、非常高的目标,比如希望 AI 成为爱因斯坦或者牛顿那样的大脑。
这样的大脑可以通过很少的样本获得很深的知识。如果这件事情成了,AI 就会非常厉害。但即使这件事情没有做出来,前面这些阶段本身也有很多应用。
程曼祺
回到刚才这一轮话题的起点:在 coding 之外,RSI 还需要什么能力?你刚才说了类似 Grokking、能够产生灵感和联想的能力,还有什么?
田渊栋
我觉得这很重要,但还有一些 agentic behavior。也就是说,AI 怎么调用工具、调用各种已有知识,获取新知识,然后把这些事情放在一起,完成任务。
这种能力某种程度上已经有公司在做,已经在探索、在往前推进了。
程曼祺
对新公司来说,好的一面是,你们有很多能力可以直接用;压力的一面是,其他公司也有这些能力,可能也会沿着这个方向往前推。
田渊栋
这些能力,很多开源模型和已有解决方案已经在那里了。所以这些能力有多大程度会左右 RSI 最后的结果,每个人的想法不一样。
还有一些能力,比如怎么收集信息,怎么从信息中找到最重要的信号。这部分在 deep research 方向上也已经有很多工作。
程曼祺
我最近的一个感受是,硅谷非常热衷于讨论 RSI,它有一个假设:谁最先达到这个状态,就会把其他人甩得越来越远,而且这件事有一个窗口期。可能过了一段时间还达不到,就无缘决赛圈了。
你觉得这个逻辑有什么漏洞吗?
田渊栋
8. Scaling Law 遇到瓶颈
这个逻辑应该说还是比较正确的,但它只是一种可能性。
对于 AI 来说,如果没有突破性进展,所有人的 AI 都差不多。它不是渐进式地一点点往上走,而可能是突破式地往上走。
在所有人没有达到某个 level 的模型之前,大家都差不多,都还不错。但也许有一两个人产生了突破,达到下一个层次。那个层次上的 AI,能力远远高于前一层次的 AI。
在这种情况下,整个 level 的提升会更快。它可能不是渐进式的。
程曼祺
这个推论似乎也意味着,初创公司还是有一定空间的。因为如果是渐进式的,如果现在的 scaling law 这条路线一定能通向 ASI,那么初创公司就没有什么机会。
OpenAI 和 Anthropic 已经做得很好了。如果他们沿着 scaling law 一直往前走,永远比别人走得更快,那初创公司怎么追上?
田渊栋
可以举一个例子。一个 ASI 系统肯定会让效果变得越来越好。从这个系统出发,它会有一个 S 型曲线:一开始涨得很快,然后因为遇到一些瓶颈停下来,进入平台期,直到下一个突破出现,再进入下一条 S 型曲线。
就是 S 型之后平台,平台之后再出现 S 型,再进入平台。每个平台可能都对应一个突破。
如果没有达到这个突破,大家即使做得再好,也可能无限逼近上一个效果的上界。
程曼祺
你觉得接下来的发展会直接这样往上走,还是会有平台期?
田渊栋
我觉得会有平台期。你发现了新的东西、新的想法,用这个想法产生的模型会变得更强;模型变强之后,你才会有更好的想法去做。它是一个阶段性跳跃的过程。
程曼祺
这个想法现在是主流吗?
田渊栋
现在应该还不是很主流,这完全取决于大家对 scaling law 有多大的信任。
如果大家认为 scaling law 百分之百正确,那么其实就不存在平台期。只要堆算力、堆计算资源、堆各种东西,能力就会越来越强。这样的话,AI 自我进化就是一个非常平滑的过程。
我比你快一点,就一定会比你快更多;你快很多,就会一直领先。这样的话,任何初创公司都不可能追上 OpenAI 和 Anthropic,因为它们一定在更前面,而且追得更快。
但我觉得不一定是这样。Scaling law 可能是对的,只是它需要的样本量非常大,横轴是指数级的。你需要 10 倍的计算资源、10 倍的数据和各种资源,最终才能达到线性的增长。
而这 10 倍资源现在已经开始有瓶颈了。所以哪怕这个理论是对的,也有其他现实限制。
程曼祺
这个限制应该很大,不可能让全世界、整个地球的电力都供应给一个人做自我进化。
田渊栋
对,不可能。肯定会有博弈,也会有各种限制,所以需要更好、更有效的方法去做这件事情。
程曼祺
这也是你之前反复讲过的:如果 scaling law 就是未来,那是一个比较悲哀、也非常无聊的未来,因为没有新的智识上的突破。
田渊栋
是的。我相信会有智识上的突破。有了智识上的突破,RSI 这个 loop 本身就是一个叙事上的 loop,因为不管是什么模型,都可以做这件事情。
但具体支撑这个叙事的底层架构、底层数学,以及模型的一些结构,应该会发生突变。
程曼祺
刚才我们说,达到 RSI 状态之后可能强者愈强、领先者越来越领先。你说有一个变量是,它接下来的走势是渐进式的,还是有 S 型的平台期。
田渊栋
对。还有一个变量,我觉得也很重要,就是智能未来的空间到底有多大。
程曼祺
你觉得空间很大?
田渊栋
很大。我们刚刚开始。就像我那本书的名字《破晓之中》,我们刚刚才看到一点点星光,太阳还没有露头,我觉得应该是这样的状态。
程曼祺
所以你觉得前途是光明的,但道路是曲折的。
田渊栋
对。我们毕竟是生活在地球上的、由一些非常可怜的猴子变来的生物。我们一直以来看到的东西都比较粗浅、比较简单,这上面应该还有很多很多东西可以做。
只是我们现在看到的东西非常少,所以只能看到这些,不能看到非常遥远的未来。
程曼祺
这个想象往后是什么?我们最开始是由猴子变来的、看到粗浅东西的可怜生物,再往后呢?
田渊栋
如果 AI 真的普及,所有人都有超越我们以前很多层次的智能,整个世界会完全不一样。
程曼祺
你可以稍微讲讲,可能会怎么不一样吗?
田渊栋
以前所有世俗上的一些东西,可能都能得到满足。所有欲望或者要求都能够被 AI 满足,就进入了修仙社会。
言出法随。我说这句话,这句话就一定会实现。今天晚上我要一栋大房子,马上就给你大房子;今天我要去海边旅游,旁边马上就是海。
我说要改变整个世界,把它变成我想要的样子,它马上就变成我想要的样子。你可以回去当皇帝,也可以去任何地方,做你想做的任何事情。
程曼祺
但在你自己写的科幻小说里,虚拟世界后来还是加了一层限制。本来是想要房子就有房子,后来也有了房价系统。
田渊栋
对。因为如果真是这样,对于这个世界来说,大家可能会失去动力。失去动力之后,人类社会怎么发展,这是一个很大的问题。
小说里其实迭代了两次。第一次迭代的时候发现这件事情不是很成功,推翻重来之后,第二次迭代时,作为虚拟世界的管理者,可能会思考怎么让人类在享受便利的技术进步之后,同时还能保持向前的动力。
这是一个很大的问题。
程曼祺
这个未来里至少有一件事我觉得很美好,就是一些现在很难克服的病痛,可能会消失。
田渊栋
对,我相信是这样。
程曼祺
这是你个人的愿景,还是你们新公司的共同方向?你们合伙人之间也会讨论这些事情,也有相同的愿景吗?
田渊栋
修仙社会之类的,肯定是我自己的愿景,更偏小说、偏科幻的想法。
至于公司,我们还是希望把这件事情做成,因为这是一个实现层面、具体执行层面的工作。
程曼祺
而且 AI 只是你们的第一个大阶段,后面还要进入其他科学领域。
田渊栋
对。如果 AI 做得比较好,我们能够找到新的架构、新的理论,或者新的模型优化算法,就说明这个系统本身对一个问题的理解已经很深了。
这样的话,我们是不是可以用这个系统做别的事情?
程曼祺
接下来聊聊你们最近的具体进展。你们在 6 月初正式官宣,6 月 11 日释放了第一个成果,发布了一篇技术博客《First Steps Toward Automated AI Research》,也就是“通往 AI 自动化研究的第一步”。
可以讲讲这是一个什么样的进展吗?
田渊栋
9. RSI 的第一个成果
这是一个初步进展,证明我们的系统还是可以做一些事情。
比如我们用它优化 nanochat,5 分钟的训练能够让 BPB 这个数字降得比较低,比 community 的数字还要低。我们也可以用它做 nanochat 的 Speed Run,让速度变得更快。
最后是算子优化。我们找到了一个新的算子,这个算子也是通过我们的系统优化的。用完之后,效果比现在最好的 SOTA 还要好不少。
程曼祺
这些成果都是开源的吗?
田渊栋
对,都是开源的。
程曼祺
这次发布之后,有什么有意思的反馈吗?
田渊栋
总的来说,有很多比较 positive 的反馈。大家会觉得这个结果不错,比较 impressive。
我个人特别觉得,第三部分,也就是算子优化,很有意思。这个方向一开始是我一个人加 AI 做到 SOTA 的,一个人加 AI 就做到 SOTA,后来可以把结果发出来。
程曼祺
可以说是用了哪个 AI 吗?
田渊栋
这个暂时不能说,因为这是我们自己做的系统,不是外面的系统。
网上大家都很兴奋,一开始很多人觉得它挺难,后来做到 SOTA 之后就很兴奋,很多人一起来做,最后达到了更好的结果。
程曼祺
为什么会去做这件事?你们是怎么注意到 SOL Exact Bench 这个 benchmark 的?
田渊栋
这个 benchmark 是英伟达最近发布的,应该说比较新。另外,算子优化本身也是很重要的工作,因为算子变快之后,会对 AI 的 model training 和 serving 都产生影响。
程曼祺
英伟达做这个 benchmark,也是为了推动 RSI 吗?
田渊栋
不是。对英伟达来说,AI 的计算变快是好事。它不在乎是人做的,还是系统做的。
为 AI 硬件配备更好的算子,让速度变快、效率变高,对英伟达来说都是好事。
程曼祺
你们这次做的 3 个测试,是用同一个系统跑的吗?还是针对不同测试和任务做了一些修改?
田渊栋
是同一个系统跑的,是一个通用的东西。
程曼祺
我觉得你们选的这 3 个 benchmark 很有意思。一个是算力受限时看性能,另一个是看 efficiency,也就是效率,最后一个算子优化则可以作用在基础设施上,也涉及模型的几个主要环节。
你们当时是怎么计划、思考去做这样一个成果的?
田渊栋
可能有一些机缘巧合。还有就是,我们会先做那些对我们来说相对容易的事情,作为第一步。这样一开始就有一个比较好的结果,也可以通过这种方式让模型做得更好。
程曼祺
你们把自己做的这个东西称为“系统”,为什么不叫一个 agent?
田渊栋
因为我们还是希望对细节保密。称为“系统”,可以保留各种可能性。
程曼祺
如果系统本身不方便展开聊,你可以讲讲现在选的 3 个 benchmark 分别在测试什么能力吗?往后有没有组合起来、更大的空间?
田渊栋
主要还是测试它在预训练上能不能找到更好的想法和思路,以及在算子上能不能找到更好的算子。
它们的共同特点是反馈比较快,很快能够获得反馈,系统也能很快跑起来。
程曼祺
你们把这个成果叫作 First Steps。更总结地说,你们是怎么设定第一阶段目标的?
田渊栋
第一阶段的目标,当然是希望系统能够跑起来,并且有一些初步结果。现在我们已经达到这个目标。
程曼祺
接下来除了你们自己继续使用这个系统之外,之前你也说过,一开始就考虑过商业化。现在有了初步成果之后,商业化上会马上有动作吗?
田渊栋
我们当然会继续优化系统,让它做得更好。商业化也在思考中。
我们还是希望系统做得比较一般化,解决通用问题。不会因为一两个具体的 vertical,让系统变得非常特殊化,否则可能就失去了通用化的意义。
程曼祺
回到这次具体的成果,你们在 3 个 benchmark 上都取得了 SOTA。但如果只看数字,直观感觉是改进好像非常小,其实不是这样,这些数字还是比较让人印象深刻的。
拿算子优化来说,你们当时战胜了第二名。第二名是一家公司叫 Double AI,是以色列团队做的。他们的 CEO 叫 Sasha,以前是 Mobile AI 的 CEO。Mobile AI 是一家很早的公司,一直做端侧或者芯片上的处理,也做过特斯拉的供应商。
所以他们是一支半导体专业团队,而你们团队里没有 GPU 专家,但效果比他们高了 10%。
田渊栋
对。他们里面的人都是专业做 GPU 的工程师,也提交了一个版本。我们的效果比他们高 10%。
但对于我们来说,组里面其实没有人是 GPU 专家。我们的系统比较高效,也比较有效率。所以你可以说,最懂算子优化的人应该是我。
程曼祺
很有意思的是,如果看你以前的简历和经历,你其实没有真的做过算子优化。
田渊栋
对。我只能说,以前做过一些大模型 efficiency、大模型效率提升的工作。算子优化本身,我没有真正做过。
所以这是一个非专业的团队,但我们有 RSI 的通用思考和逻辑,用通用的方式做这个系统,最后能够达到比业界顶尖专家团队更好的效果。
程曼祺
你自己对这个结果比较满意?
田渊栋
对,这是一个比较好的结果。
像 nanochat Speed Run,community 已经做了两年,那个数字很难再往上提,但我们又提高了大约 2 秒。绝对数字看起来不大,但对于已经做过这个方向的人来说,这个数字还是比较大的。
程曼祺
很多不是做这些事情的人,看到的可能只是从 79 秒到 77 秒,感觉好像只缩减了一点点。
田渊栋
但你要知道,79 秒是过去整个 community 做了两年的 SOTA。接下来再往上提就很难了,相当于也是技术社区里专门主攻效率方向的人的努力结果。
程曼祺
还有一个问题,你们现在测的 nanochat 和 nanoGPT 都是比较小规模的测试。比如 nanochat 训练的是 GPT-2 级别的模型,和现在主流大模型的参数规模差很多。
你们目前这些成果如果迁移到更大的模型、更大规模的架构上,会难吗?中间会有比较大的 gap 吗?
田渊栋
应该说还是会有一些 gap,这个我们也在继续做。之后有可能会看到相关成果,但具体细节我就不透露了。
程曼祺
再往下,你们会着手做什么?First Step 是现在看到的这个,那第二步是什么?
田渊栋
我们会继续优化系统,让它变得更强、更有效率、更好。然后看系统本身能够优化更多、更广泛的方向,比如预训练、后训练,这些都会做。
程曼祺
你们现在有类似 OpenAI 总结的 AGI 那几个阶段的 roadmap 吗?
田渊栋
目前还没有。公司刚成立,OpenAI 有那个 roadmap 也是成立 10 年之后了,大概 2023 年、2024 年才提出,很久之后了。
当然,现在整个过程会缩短,因为大家的热情很高涨,进展也非常快。但应该还不至于快到只需要半年。
程曼祺
你觉得这个领域现在急缺什么?
田渊栋
你说 RSI 吗?
程曼祺
对。一般来说做 AI,肯定要看数据是否充裕。那做 RSI 的话,什么数据可以用上?
田渊栋
这个问题现在还没有定论。现在有很多方法可以做数据,包括数据的具体做法、逻辑、准则和思路,都还不是很清楚。
有各种各样的方法可以做,现在还是探索期。
程曼祺
可以分享一些大致的数据思路吗?
田渊栋
这个我们暂时也不太方便说,大家都还在团队内部探索。
程曼祺
不说具体是什么类型的数据,我想知道,比如它成本高吗,获得难吗?
田渊栋
现在大家想到的几种方法里面,有难的,也有不难的。难的和不难的区别在于,它到底效果怎么样。可能难的效果好,不难的效果不好。
程曼祺
除了数据之外,你觉得还可能缺什么?
田渊栋
算力肯定是一部分。RSI 本身需要算力去探索、去研究,所以在这上面要花不少时间,思考怎么减少算力消耗,同时获得更多成果。
程曼祺
你们首轮融资很多,融了 6.5 亿美元。第一阶段算力也是一个问题,这笔算力对你们来说充足吗?
田渊栋
应该说还可以,这个数字还是不错的,可以做一些事情。当然,如果要达到大厂的级别,和大厂相比还有一定距离。
程曼祺
要实现你说的 RSI,之后是不是也需要 scaling law 之外的新创新?
田渊栋
我觉得是。如果完全拼 scaling law,小公司是拼不过大厂的。
程曼祺
关于 scaling law 之外的方向,你现在有什么想法可以透露吗?
田渊栋
现在还不太好说。
程曼祺
所以你已经想到了一些,但还需要验证?
田渊栋
对。一个大的方向是可解释性。我觉得可解释性很重要,它能够发现很多 insights,然后这些 insights 可以加快进展,也能让模型变得更加 safe。
但具体是什么,现在还不好说。
程曼祺
Grokking 其实就是一个可解释性方向的研究,解释了人们眼中的一种涌现是怎么来的。
你们之前公司的愿景里,特别强调要在安全的条件下追求 RSI。如果摊开来说,RSI 实现之后可能还会有什么风险?
田渊栋
10. 可解释性决定安全
风险其实挺多。很多人会问我,如果 AI 能够自我进化,会不会变得很疯狂。
程曼祺
你说的很多人,是什么类型的人?是从业者,还是这个领域之外的人?
田渊栋
很有意思的是,越是领域之外的人,问题反而越多。领域之内的人没有那么多问题,不会觉得这个问题特别严重,因为它可能不是一天就到来的。
其实现在 AI 还有很多问题,这些问题非常难解决,目前还有很大的差距。但领域之外的人会问,AI 自我进化之后,会不会有一天超过人类控制,或者达到某个方向,让 AI 和人类都无法理解。
这应该说是比较大的问题。
程曼祺
你一般会怎么回答?
田渊栋
首先,我们训练 AI 的时候,是把它当成狗一样训练。我们给它的 signal,相当于当年训练狗的方式,让 AI 能够很好地服务人,帮助人解决问题。
在这样的进化压力下,AI 没办法进化出和人一样的某些自我意识、自我认知。我觉得这是一个很大的区别。
程曼祺
如果要达到你设想的更终极的 RSI,产生新的创造力和灵感,它需要有意识吗?
田渊栋
我不觉得需要。意识和这件事不是一回事,不是必备的。
你可以想一想,有很多天才数学家和物理学家,在各自领域里非常天才,但另一方面,他们也与世无争,不想要权力,也不想要各种东西。
所以能力和欲求完全可以分开。
第二点,我觉得可解释性很重要。通过可解释性,可以真正知道模型在做什么,什么地方起作用,模型利用什么能力获得什么知识,得到什么结果。这样就可以消弭人们对黑箱的恐惧。
程曼祺
从业者里是不是也分两派?有的人认为这件事一定可以解释、可以被人类知道;另一派觉得,这可能很难追求到。
田渊栋
我可能是少数派。大部分人可能已经觉得绝望了,觉得大模型那么复杂,应该没有希望再了解里面的概念。
但我觉得不是这样。我觉得一定存在一个好的 principle,能够让这个模型运转起来。
如果真的找到这个 principle,一方面能够让模型变得更强,另一方面也能够让模型变得更安全。
程曼祺
你这种少数派的相信,来自什么?
田渊栋
来自我过去的经验,以及过去做过的一些工作。
程曼祺
展开来说,是什么东西给了你这种信心?
田渊栋
我一直在做神经网络训练算法的理解。神经网络是怎么学会各种知识、各种模式的?训练时做梯度下降,梯度下降会对神经网络的动力产生什么影响?神经网络里面的权重是怎么生成的?它怎么学会 pattern?
这部分分析我已经做了很多年。
程曼祺
你之前也提到,在这一轮 AI 热潮的起点,也就是 2012 年、2013 年前后,有很多理论研究想解释机制,有从物理里借鉴的,也有从数学里借鉴的,但成果其实比较少。
这不会影响你的信心吗?
田渊栋
不会。我会觉得,也许我会是那个少数派,会把它做出来的人。
程曼祺
这还是一个挺大的智识上和学术上的抱负与追求。
田渊栋
可以这么理解。如果没有这个想法,你可能只能随大流。但如果有这个想法,就可能沿着这条路一直往前走。
程曼祺
你什么时候开始有比较明确的想法?
田渊栋
应该是 2020 年、2021 年之后。对这个问题的理解慢慢深入之后,我会觉得也许自己在一条正确的路线上。
程曼祺
前后有什么技术环境的变化,让你的想法变得更明确?
田渊栋
至少对我来说,我对 AI 的一些分析和工作,让我觉得这个方向本身我已经做了很多年。
一开始并不是很顺利,有很多东西做得不好。但从 2020 年、2021 年之后,我会觉得对这些问题的分析和理解越来越深入。很多本来想不通的问题,现在突然想通了。
因为有这个过程,所以会觉得也许我在一条正确的路径上继续往前走。
程曼祺
现在还在追求这件事的人,你的同行有哪些?
田渊栋
应该说不多,因为很多人可能已经放弃了。
其实有很多人,包括这次提到的那位理论研究者。他以前也是做模型分析和理解的,发表过很多文章,其中有些还不错,也经常和普林斯顿的 Sanjeev Arora 合作。
但很多人在这一波 AI 热潮之后放弃了之前的工作,直接说:“好,我们就 scaling all the time。”他们加入 OpenAI 或者其他地方,加入 scaling 大军,把事情做成。
程曼祺
打不过就加入。
田渊栋
对。加入其实有很多种可能性。
一种是,我有自己的追求,但希望用 AI 来做这件事。这时候加入大公司、用他们的模型做研究,很正常。
还有一种是,我已经放弃了手上的东西,觉得 AI 就是一切,将来会成为 AI 研究员。
也有人是想进去看一下,过两年再回学术界,这也是有可能的。
程曼祺
我之前采访过的人里面,马毅老师似乎比较追求这件事。
田渊栋
对,他比较追求可解释性,还有百亿大模型的一些研究。
但我希望以后人类还是有一些多样性,不可能所有人都追求一个东西。如果所有人都相信 scaling law 是一切,那世界会很无聊。
程曼祺
你觉得 Yann LeCun 做的 AMI Labs,是在追求这个吗?
田渊栋
他的追求不一样。他是基于视觉、世界模型,在隐空间上做推理和推导,也做预测。
他抓住这几个点之后,觉得这个方向是正确的,就沿着这个方向走。这个方向即使和大模型不一致,他也希望它往前走。
但他的重点不一定是可解释性。他可能认为这个新的范式能够解决一些现有大模型做不了的事情,更多是工程上的方向。
程曼祺
我觉得你追求的是,希望把 AI 真正变成一门科学。
田渊栋
对,这可能是我的一个目标。现在它很难说是一门科学,因为有些原理确实还搞不清楚。但我觉得它以后终将变成科学。
这应该说是历史规律。历史不会重复,但在某种程度上,会和过去的东西相互呼应。
程曼祺
AI 终将变成科学,是和历史上的什么过程呼应?
田渊栋
比如炼金术变成化学,或者从第谷的天文观测到开普勒的经验总结,最后到牛顿的《自然哲学的数学原理》。
这个过程一定会发生。科学革命的结构就是从第谷到开普勒,从开普勒到牛顿,永远是这样。
在牛顿出现之前,大家可能觉得这件事情不可解释、太难了;等牛顿出现之后,会觉得“这个事情好像还挺简单”。
程曼祺
你觉得下一个牛顿还是人类吗?
田渊栋
不一定,可能是 AI,也可能是人类加 AI。
所以为什么要做 ASI,就是因为如果想做这件事情,一定要用世界上所有的计算资源和所有最强的大脑,包括人的大脑和 AI 的大脑,把这件事情做成。
程曼祺
你觉得有生之年会看到图灵奖颁给一个系统吗?
田渊栋
如果到那个时候,可能图灵奖也不是很重要了。
如果这个系统很强,它可能会以很快的速度获取很多知识,得到很多结果,变成一个 knowledge discovery system。可能每隔一个月、两个月就产生新的东西,而且非常厉害。
程曼祺
到了那个状态,人类研究员的乐趣是什么?比如你自己的乐趣是什么?你会做什么?
田渊栋
首先,如果能够理解 AI 到底是怎么工作的,我会很开心。
另外,如果真的不太需要人类介入,AI 能够自动发现新的东西,那时候你可以欣赏它的美。很多东西你来不及去做,但至少可以看一看,感受一下其中的美感,发现一些有意思的东西。
我现在就有这种习惯,经常去看数学证明,看一些有意思的问题是怎么被发现的。你发现其中一些有意思的东西,会有一种“原来是这么做的”的豁然开朗感。
程曼祺
这种感觉和你的日常工作并不直接相关?
田渊栋
对,不直接相关,但这个过程本身很有意思,是一种精神享受。
发现系统是怎么工作的,理解它在做什么,这是一件很有意思的事情。
程曼祺
最近 AI 系统也宣称取得了一些数学上的突破。你去看过吗?里面有没有你觉得比较优美的东西?
田渊栋
你有什么具体的东西愿意推荐我看吗?
程曼祺
比如去年的 Google AlphaEvolve。它好像改进了一种矩阵乘法,减少了一次计算。
田渊栋
对。它把矩阵乘法的顺序换了一下,少一次加法或者少一次乘法,通过这种方式减少代价。
真正去看的时候,会觉得它还是挺有意思的。它通过某种变换少了一次乘法,让效率更高。
程曼祺
所以你刚才问我有没有值得看的,是说 AI 现在做出来的东西,还没有那么优美,还没有让你产生享受感?
田渊栋
对。很多时候还是要看人做的东西。现在 AI 做的东西,很多时候处在“术”的 level,还没有到“道”的 level。
“术”和“道”是不一样的。“术”是具体细节,比如把矩阵乘法的次数减少一次。你可以看到,通过某种巧妙的变化,先把东西加起来再乘,这样就能减少一次乘法。
加完之后再乘,相当于同时把很多东西乘起来,一次乘法可以乘相当于 4 个数字。通过这种方式,可以算出一个比较好的结果。
这相当于在很大的空间里做穷举,然后找到一个好的结果。
但“道”可能是另外一回事。它是发现一个新的理论、新的逻辑或者新的链条。这个东西本身是美的,是以前没有见过的、不一样的东西。
程曼祺
最后想聊聊,你过去的一些经历和现在做的事情之间有什么关联?过去哪些选择和学习,让你走到了今天这种探索的状态?
我看你过去的经历,觉得一个比较重要的转折是,你之前在 Google X 做的是无人驾驶工程师,更偏工程;后来去了 Meta,最开始去 FAIR,又回到了更偏研究的状态。当时为什么主动、有意识地做这个选择?
田渊栋
11. 从工程师走向研究者
一个原因是,当时的工程比较无聊。那时又恰逢深度学习的变革期,大概是 2013 年、2014 年。
2013 年我加入 Google 无人车,一开始还是比较兴奋的。这个方向本身是一个比较大的事业,大家会觉得无人车以后肯定很火,而且那时候还很早期。
但我当时也知道深度学习开始发展了,我非常希望能够在无人车内部做深度学习,比如用深度学习算法训练一些无人车的分类器。
很可惜,当时没有资源做这件事。GPU 很少,资源有限时,都会优先分给一些比较受重视的人。像我们这样的人,只能做一些打杂的工作。这种工作对我来说没有什么职业发展的前途。
程曼祺
所以你 2013 年、2014 年入行时,和现在不一样的氛围是:当时年轻人没有那么受追捧,还是一个比较论资排辈的过程?
田渊栋
对。Google 内部有很清楚的级别分界。级别很高的人,比如当时我们组里有一个 L7,他能够获得比较好的自由度,可以用深度学习训练模型。
我刚进去时是 L4,对于 L4 的人来说,只能做一些打杂的工作。
程曼祺
在当时的技术阶段和环境下,级别高的人和级别低的人,谁更了解正在变化的深度学习浪潮?
田渊栋
实际上,年轻人比较容易接受。但很多时候不是学习上的区别,而是概念上的区别。
很多高级别的人,或者比较资深的人,会拒绝学习,停止学习。因为他们下意识觉得这个东西不行、效果不好,或者里面有很多猫腻。
要等到两三年之后,大家才会慢慢意识到这是一次变革。
程曼祺
今天大模型出来之后,这种思维上的差异还存在吗?
田渊栋
还是存在。还有另一个维度:年轻人动作很快,愿意熬夜,愿意把事情做成,很多时候也不考虑太多,我就先干了再说。
大模型确实需要很多 hands-on 的人,因为没有 hands-on 的能力,就没有办法知道大模型有哪些问题。
程曼祺
回到当时你在 Google 做无人驾驶工程师,你觉得有点无聊了。
田渊栋
对。一开始的新鲜感过去之后,会觉得做的事情对职业发展没有太大帮助。
当时我要做的是紧急车辆检测。这个问题是一个小样本问题,样本非常少,少到连分类器都训练不出来,可能需要手工写规则。
我觉得这样做下去没有什么前途。
程曼祺
这个行业后来确实有很长时间,很多东西都是手动写规则。
田渊栋
对。当时我对这个行业的判断也是对的。这个行业的问题在于,要么成功,要么完全不成功,没有中间状态。
如果自动驾驶在路上有风险,大家就不会用它。必须一直做到最后,达到无风险、比人更强,才能大规模上路。
这是一个很大的问题。
程曼祺
所以 2013 年、2014 年的时候,你就已经看到它可能很晚才会落地?
田渊栋
对。我已经感觉到了,它有很多 corner case 要修,而 corner case 的修复是一个非常漫长的过程。
程曼祺
2015 年、2016 年的时候,马斯克,包括后来 Google 成立的 Waymo 的一些 leader,其实都有过很乐观的宣言,比如 2016 年车就可以上路。
田渊栋
我当时已经免疫了,因为他们每次都这么说,永远是“还有 5 年”。特别是 2011 年第一次听说这件事时,说还有 5 年;等我 2013 年进去时,还是还有 5 年;现在可能还是需要 5 年。
程曼祺
现在在旧金山、洛杉矶已经在路上跑了。
后来你去了 Meta 的 FAIR。之前在 Google X 的经历更偏工程,去 FAIR 更偏研究,这一步跨得难吗?
田渊栋
其实不难。我在 FAIR 的前几年还是偏工程的。当时做围棋,很多时候也是我自己搭工程项目,从头到尾搭蒙特卡洛树搜索、分布式强化学习系统,这些都是我自己搭的,所以很工程。
当时给我的评价甚至是“这个人太工程了,不像研究员”。别人打开电脑全是文章,我打开电脑全是代码。
后来 2018 年、2019 年做了 OpenGo 之后,我就更偏研究一点。从 2019 年到 2022 年,慢慢形成了自己的一些 taste,开始觉得自己知道怎么做研究了。
程曼祺
你之前工程化、写很多代码的经验,对后面形成 research taste 有帮助吗?
田渊栋
当时看起来帮助不是很大,因为这是不一样的。写代码和做研究,其实完全不是一回事。
程曼祺
但现在回头看,还是不一样?
田渊栋
现在还是不一样。
程曼祺
我们最开始聊到,去年 8 月、9 月,也就是秋天的时候,你一边觉得工作很枯燥,一边又在做研究,而且有一些问题意识。是不是因为你有一手的写代码经验,所以能更快感受到研究加速循环的到来?
田渊栋
对。即使在 2019 年之后,我还是会写很多一手代码。你会发现,我每年还是至少有一篇一作文章。很多文章偏理论,但至少我还有一手的感觉,知道这个问题怎么做、那个问题怎么做,不会泛泛而谈。
如果一个研究员一直做最后一作,或者只做高层思考,他会慢慢把所有精力花在高层思考上,不再想这件事情具体怎么完成。
这样的话,他就会把难的问题和非常难的问题混在一起,没有一个特别清楚的思路,知道这些问题应该怎么做。
程曼祺
为什么不做实现、不做完成,就会把不同难度的问题混在一起?
田渊栋
如果不做实现、不做完成,就会忘记思考这个问题本身要怎么做。
研究员有两类。一类人会说:“我只看方向,这个方向很重要,我就指这个方向。”但指完方向之后,他不会想太多这个方向具体怎么做,可能把问题交给下面的人。
对他来说,只要把方向指出来就可以了。
另一类研究员比较接地气,他们不仅指出方向,还会告诉大家,为了达到这个目的必须走一二三四五步,把这些东西拼起来之后,得到这个方向。
程曼祺
这两类研究员里面,都有非常好的研究员吗?可以分别举几个你尊重、欣赏的例子吗?
田渊栋
第一类,比如乐坤。他会说自己想做 self-supervised learning,也就是自监督学习。
自监督学习里面有很多细节需要尝试。他看到一个重要的点:数据中有监督的样本非常少。所以他当时画了一个经典的蛋糕图,把 reinforcement learning 放在最上面,作为 cherry on the top。
在他看来,强化学习的反馈非常少,所以他不觉得这东西有前途。他觉得有前途的是自监督学习,因为自监督学习的反馈非常多。
这个本身是有道理的。但他不会去想,监督和反馈究竟是怎么样让模型学出来的。他会认为,监督少一定比监督多差,监督多的话模型学得更快。
他抓住这一点不放,坚持到底,就会让大家觉得这个东西很有道理,其他人也会去做。自监督学习后来确实有很大的用处,甚至可以说,GPT 的整个训练过程也是自监督的一部分,因为它是在预测下一个词。
所以第一类研究员的优秀之处,是能够提出一个问题,提出一个好的问题,抓住一个好的点,开一个好的坑。
程曼祺
也就是提出一个值得做的方向。
田渊栋
对,提出一个好的坑,告诉大家这个方向可以做。
比如我们以前推荐过的 coco net,也可以说是一个低维度的问题、一个范式。很多人可能会说,这个东西并不 work,或者还有很多地方需要解决,但至少它指出了一个方向:是不是可以用隐空间来学习 latent reasoning,而不是用语言来学习。
这个提法能够让大家觉得这个方向可以做,具体怎么做,就由很多文章继续探索。这也是第一类研究员的视角。
第二类研究员不仅知道做什么,还知道怎么做。我的很多工作就是这样:把机制解出来,找到路径,在这条路径上把事情做成。
程曼祺
你觉得 伊利亚和达瑞 属于哪一类?
田渊栋
他们都属于第一类。特别是 Ilya,他对 scaling law 有一种执念,或者说宗教般的信仰。他会让大家觉得,不要想太多,直接 scale、scale、scale,把工程问题做好,把事情做成,然后把数据放进去训练。
程曼祺
我看他去年年底接受采访时,倒是说过“房间里的空气已经被 scaling 吸走了”,感觉他也觉得应该研究一些别的东西。
田渊栋
对,我非常同意。因为他之前 scaling 的红利已经差不多吃完了。
任何研究方向都是有底的,不可能一直 scale 下去。那时候他在正确的时间、正确的地方,提出了正确的想法,让很多人去执行,成功了,又更加成功了。
但不可能一辈子都吃同一个方向。以前一个物理学家可能一个方向可以做到退休,但现在技术进展非常快,可能很快大家就把事情做成了,然后必须想别的东西。
程曼祺
你说红利已经吃到了,是指作为研究来说,可能已经不在研究阶段了?
田渊栋
不仅是研究,实验也已经吃到了。接下来当然可以继续吃,但作为 startup 的 CEO,他没办法只基于 scaling。
对于 startup 来说,scaling 不是它的长项。Google 已经在 scale,甚至 OpenAI 也开始 scale 了。如果是这样,startup 就要做 something different。
反过来说,你确实看到了不一样的事情,才应该去做 startup。
程曼祺
如果非常相信 scaling law,那就应该留在大厂,去 Anthropic 或 OpenAI。
田渊栋
对。
程曼祺
在 Meta 的最后阶段,整个公司有比较多的动荡,AI 组织也有很多变化,Meta 自己的模型也经历了 Llama 开源开始口碑很好、后来又出现问题的过程。
这个过程里,你对组织层面、对怎么做好研究,有什么总结?
田渊栋
大公司这一波 AI 都是反大厂的。所谓反大厂,就是大厂里面所有的 incentive、职级、人和人之间的关系,以及岗位调配和设计,都和现在 AI 的方向背道而驰。
你会发现,组织越来越臃肿、越来越大,对应的 AI 进展就会越来越慢。
因为 AI 非常需要人去 hands-on,真正去用它,真正去感受它,真正去发现它的问题。这样你才能很好地知道它和我们的概念有什么不一样,然后很快把事情做成。
一旦产生经理和执行者这样的二级架构,速度就会变慢。导师和学生一旦有了这样的关系,整个进展速度也会变慢。
导师没有办法百分之百了解学生做的东西,学生也不一定百分之百理解导师的想法。人与人之间的交流速度永远是最慢的。
大厂有这个问题,而且大厂很多时候,特别是中层管理,他们的目标不是为了让项目做成,很多时候是为了让自己过得更好。
程曼祺
那大厂里的小团队能独善其身吗?比如 Meta 新组建的 TBD,人数相对少,没有那么多人。
田渊栋
其实可以,但也要看。一旦这个组变大,有很多人、很多职级和中层管理,还是会有问题。
程曼祺
多大算大?
田渊栋
以前 Llama 4 和 X C R 都是超过 150 人之后开始不行。超过 150 人就不行。
从组织学上来说,150 人是一个临界点。再往上,人和人之间的关系就不一样了。
30 人、40 人的小团队里,每个人都认识每个人,人和人之间的关系很简单。但人一多,就会出现问题,因为彼此不再相互认识。
这时候通常要通过组织架构获取知识,再向上汇报。
程曼祺
所以核心部分要保持在你说的这个量级?
Anthropic 和 OpenAI 人都很多了,OpenAI 有 7,000 多人,但做模型的人其实不是很多。关键是做模型的核心团队要不要保持很小。
像 Crawl Code 这样的团队就很小,核心部分是收缩、精炼的。
田渊栋
对。我们也不会招太多人。
程曼祺
最近会有人在 Frontier Lab 和你们之间做选择吗?
田渊栋
有一些人对我们感兴趣,来自 Frontier Lab。有些还在聊,也有些已经加入了。
程曼祺
如果总结一下,你过去这么多经历,给你带来的直觉判断和技术品味是什么?你的偏好是什么?
田渊栋
我还是喜欢美的东西。本质上来说,我是一个挺喜欢数学的人,喜欢各种精巧的结构、相当美的东西。
但另一方面,我也意识到这种偏好的局限性。一方面我可能是一个工程师,会做很多工程上的事情;另一方面,我本质上是一个追求美的人。
程曼祺
追求美的同时,又知道美的局限。这个局限展开来说是什么?你做工程师,是不是在认知到这种局限之后,试图弥补它的一种方式?
田渊栋
可以这么说,这是理想和现实之间的碰撞。对于理想,我们希望找到很美的东西,但世界不是这样。所以要不停提醒自己,不能陷入美的幻觉,要做一些可能对大家有用、对世界有用、或者对公司有用的事情。
这些事情不一定很美,但在这个条件下,还是想追求美。
程曼祺
RSI 第一步是在 AI,后面是自然科学,这是大家能看到的。再往下,它能进入更复杂的世界吗?比如能不能改良社会科学的一些理解和认知?
田渊栋
我觉得有可能。但我对社会科学的认知也不是很多,很难给出建议。
社会科学至少在以前的学科分类里,也被算作 science 的一种。比如经济学里有很多统计和数据。
但这里和自然科学有一个很大的不同:自然科学默认信息是完全透明的,而经济学很多时候有反身性。我把这句话说出来,这句话可能就不灵了。
所以这个问题很大。
程曼祺
你刚才也提到,以前的科学家,比如物理学家,一个领域可能研究一辈子。但现在技术变化很快,很多事情不是能一直做到头的。
你能预见到,在这段旅程之后,接下来想探索什么吗?一个是 RSI 什么时候可能达到你设想的比较成熟的状态,另一个是再往后你想探索什么?
田渊栋
我觉得现在还是先把 RSI 做好。我们不会考虑其他问题。
程曼祺
今天非常感谢田渊栋老师做客《晚点聊》,分享 RSI 这个领域。去年下半年你们开始组建公司的时候,这个方向还没有那么多人讨论;到了今年 4 月、5 月,它已经成为硅谷相对共识性的热门话题。
我们也回顾了从 10 年前开始的一些相似尝试,到现在 RSI 有了什么变化,以及各家公司的进展,尤其是你们在 6 月初发布的第一阶段成果。
今天节目就到这里,谢谢,拜拜。