张小珺
Hello,大家好,我是小珺。AI 业界有两个姚顺宇:一个从 OpenAI 跳槽到了腾讯,一个从 Anthropic 跳槽到了 Google DeepMind。前一位姚顺宇去年来过我们节目,那今年我们邀请了另外一位。
这位姚舜宇毕业于清华大学和斯坦福大学,曾经的研究方向包括非厄米系统、量子物理和高能物理。毕业后,他从物理转战 AI,2024 年加入 Anthropic,2025 年跳槽到了 Google DeepMind,出任研究科学家,参与了 Claude 3.7、Claude 4.5、Gemini 3 等模型的开发过程。
除了这些重点模型的开发之外,他还有一些很有趣的观点,比如说 AI 的本质是简单的,预训练也是一种强化学习;不要迷信“老登”;AI 个人英雄主义的时代已经过去了;AI 从业者最重要的特质是靠谱,等等。
我们的节目录制于 2026 年 3 月。距离我们这次节目录制结束,世界又发生了许多意想不到的变化,比如 Meta 对 Manus 的收购被撤销,Cursor 可能被 SpaceX 收购,xAI 将终止独立运营并入 SpaceX,并更名为 SpaceX AI,等等。
如果我们的谈话内容有一定的滞后性,还请大家多多包涵,因为 AI 的世界实在是变化太快,也太出乎意料了。还要特别说明的一点是,技术细节会涉及一些企业机密,有一些内容嘉宾不方便分享,也请大家能够多多包容。我们会在最大的可能范围内,和大家一起来学习 AI。接下来就是我对舜宇的访谈,期待 2026 年我们和 AI 共同进步。
作为一个公司来说,它能够实行这种比较 top-down 的机制,是一件很独特的事儿。这对于其他模型公司来说很难吗?
姚舜宇
很难。比如说 OpenAI 就干不了,Gemini 也比较难。大公司和 startup 的打法本来就不一样,因为 startup 重要的是 make a bet,就是我得赌一件事儿。我觉得大家现在每个人都是冲浪的人,本质上是那个浪,而不是你这个冲浪的人,因为 AI 这个事儿本来也不太需要脑子。
张小珺
啊,需要脑子,真的不太需要脑子。需要什么?
姚舜宇
我觉得这个行业最重要的特质就是靠谱,就是做事儿细,然后对自己做的事儿负责任,这是最重要的特质。
张小珺
硅谷不是有两个姚顺宇吗?你要不要先给大家介绍一下你自己,然后给大家科普一下两个姚顺宇的区别?
姚舜宇
1. Two Yao Shunyu
可以。我叫姚舜宇,显然也有一个跟我几乎同名的朋友。我们俩的主要履历也有一些 overlap,所以看起来可能非常难以区分。
我以前是做物理的。本科的时候在清华,做凝聚态理论;后来去斯坦福做理论高能物理,以及量子信息、黑洞相关的一些方向。离开斯坦福之后,我去伯克利短暂地待了两个星期做 postdoc,然后就离职去了 Anthropic,在 Anthropic 待了一年。去年 9 月底、10 月初的时候,我加入了 Gemini。
如果大家非要区分的话,我觉得最大的区别就是,舜宇一开始一直都是做 CS,也就是计算机相关的;而我从某种意义上来说是半道出家。我之前是做理论物理为主的。
张小珺
你们是不是好朋友?你们好像大学就认识,而且是一届的,对吧?他是个什么样的人?你是一个什么样的人?评价一下他,你也评价一下自己。
姚舜宇
我们本科就认识,因为我们本科是一届的,在清华。他一开始就是学计算机的,在姚班,也就是计算机科学实验班;我是学物理,所以我在物理班。后来他去了普林斯顿,我去斯坦福。
这可能也是另一个有点令人费解的点:普世世界里好像觉得斯坦福应该是学计算机的人该去的地方,普林斯顿是学物理的人该去的地方,但我俩反过来了,所以也可能产生了一些费解的事情。
我俩其实也真的挺不一样。我觉得他是一个比我有趣得多的人。我过去也一直能从他身上学到一些和我很不一样的东西。比如说,他可能花了很多时间思考 AI 方面人与 AI 的交互,以及产品上的事情。对我来说,他是一个很不一样的朋友,我也从他那里学到了很多东西。
张小珺
你们之前在硅谷的时候多久见一次面?你们现在是不是还频繁打电话?多频繁?
姚舜宇
我们在硅谷的时候见面确实挺频繁的,可能每几个星期见一次。但是见面主要是为了凑在一起玩。
张小珺
玩什么?
姚舜宇
真的就是纯玩。可能出去散散步,扯扯有的没的,有时候吃个饭、打个牌之类的。
他回去之后,我们也还是经常会打电话。
张小珺
最近一次电话聊什么了?
姚舜宇
好像就是前一两个星期。可能过几个月,我们就会开一次长谈,聊聊大家最近的近况。
张小珺
他是不是多次想把你拉过去?
姚舜宇
可能有这个意思吧,但是我觉得不关键。
张小珺
你为什么不去?
姚舜宇
我觉得对我自己来说,我没想清楚。我觉得多半是我自己的原因。我也没有去任何中国的地方,主要原因是去年 8 月、9 月这个时候,我离开 Anthropic,决定要去哪儿时,最大的动机是我想学一些不一样的东西。
对我来说,我可能没有去考虑,也没有更着重地考虑能不能去领导一个项目,或者领导一个 project。更多的是优先去学习一些东西,所以那个时候选择去了 Gemini。
张小珺
我发现你们两个老被放在一起比较和讨论。对你来说,是困扰更多,还是享受更多?
姚舜宇
我没什么感觉,因为我这个人也不太关注社交媒体,所以其实真的没什么感觉。
张小珺
2. The AI Race Has Changed
因为舜宇去年说 AI 进入了 the second half,进入下半场,这成为了一个非常有名的观点。你觉得今天的 AI 处在一个什么样的时期?你能给它一个定义吗?
姚舜宇
对我来说,我可能没看得那么清楚什么叫上半场、什么叫下半场,或者说,这个定义一直以来对我都不是特别清楚。
现在 AI 确实进入到了一个阶段:大家已经开始不那么担心 AI 是不是能够做到一件事儿,而是担心这件事儿是不是被良好定义。我觉得这是一个很大的区别。
比如一年之前,可能是去年年初的时候,我在 Anthropic。那时候大家担心的事情还是:OpenAI 的 reasoning 做得这么强,我们有没有机会追上?有多大的机会能够超越它?大家还很担心这件事儿。
我觉得现在,至少在 Gemini、OpenAI 和 Anthropic 这三家当中,没有哪一家会真的担心自己追不上。现在大家更难的事情,是想明白要去做什么。这是一个 bet,是一个赌,但也是一个很需要人的 insight 的事情。
张小珺
那这也意味着模型的能力被拉平了,对不对?它变得同质化、商品化,所以模型之间没有很大的区别,在好坏上没有很大的区别,但是它需要分化。
姚舜宇
我觉得从用户的实际体验来说,这三家的模型还是能够感受到区别的。但难的一点是,过去这个区别在纸面上也能看出来。
纸面上是指,公开的 benchmark、测量规范。以前大家能够去看 SWE-bench,数学方面可能会比简单一点的 AIME,难一点的 IMO。那时候感觉从纸面上就能看出来:这个模型 reasoning 强一点,那个模型 coding 强一点,另一个模型在其他方面强一点。
现在纸面上大家其实都比较相近。当然你去看纸面上的数字,比如 SWE-bench,会发现好的模型可能比不好的模型高一个百分点或两个百分点,但其实大家都在 80% 附近。那个数字高一点、低一点,主要是 noise,是噪声,而不是信号。
但另一方面,大家在使用上确实还是能体现出区别。就我个人了解到的信息而言,Claude 目前仍然是比较通用的、工具使用类 agent 表现最好的。纯粹 coding 方面,最近 Codex 稍微追上了一点,把中间的 gap 缩小了一点。
Gemini 可能在纯 reasoning,以及一些比较日常的使用环境下,目前还是比较好的;在 coding 和 agent 上,还处于接近的状态。
张小珺
这些能力是他们有意选择优先发展哪个方向,还是说它就是好和坏的区别?这是能力问题,还是意愿问题?
姚舜宇
我觉得其实有意愿的成分在,尤其是在过去。当大家能从纸面上看出区别时,意愿肯定占大多数。比如 Claude 就一直更看重工具使用的能力,包括 coding。OpenAI 有一段时间非常看重 reasoning,当然现在也开始看重 coding 了。
那个时候意愿会占大多数,因为你更有意愿,就意味着你可能会花更多精力去构建合适的基础设施、合适的 infra,构建合适的数据。尤其数据从某种意义上来说是很花时间、很花精力的事情,所以那个时候肯定是意愿占主导。
但到现在,我觉得两方面其实都有。因为纸面上看起来都差不多,甚至做一些更内部的测试,数字的差别也没有那么大。这时候更难的事情就是,你该怎么定义问题,定义你想要的行为。
在这个事情没有定义得那么清楚的时候,模型的很多差异其实来自于一些你想象不到的事。当然现在你问我,我很难给你一个特别清楚的答案,可能过一段时间之后回过头来看,我才能给出一个清楚的答案。但我可以举一个想象不到的例子。
回到一两年,甚至三年前,那时候如果你去网上取预训练数据,训练一个模型就会发现,模型写代码写得很好。那时候当然没有 agent,它就是写一段代码。大家可能不知道为什么,但其中一个意外的原因可能是:如果你从网上随便取数据,不做任何筛选,code data 的质量很自然就会比别的数据高一点。
因为你去看网页会发现,GitHub 的质量显著比普通网页高。
张小珺
3. OpenClaw Reveals Long Horizons
在进入我们今天的主题之前,我想先聊聊最近模型的一系列新闻。最近大家都在讨论 OpenClaw,你作为一线研究员,对这个新的产品形态怎么看?你周围有哪些讨论?
姚舜宇
有趣的是,我感觉这件事在业外的讨论好像比业内的讨论更激烈。
张小珺
业内没有人讨论?
姚舜宇
业内有人讨论,但对业内的人来说,它并不是一件特别令人惊讶的事。可能在公司内部已经有人做了类似的实验或者 demo,只是没有作为一个产品去认真宣发、打磨,然后发出去。
当然,事实情况是,你去看 OpenClaw 最早版本 GitHub 上的代码,从某种意义上说写得也不是特别干净。但我觉得它很重要的事情,是给大家展示了这种可能性。
展示这种可能性之后,未来这些模型实验室,或者一些大一点的创业公司,可能会很快跟上,把这个东西打磨成一个真正可用的产品。OpenClaw 的作者自己也加入了 OpenAI,所以这些模型实验室或者大一点的创业公司,可能会很快跟上。
张小珺
所以我理解,在 OpenClaw 发布之前,Google 就已经有人在做这件事情了,只是还没有发布,因为大公司的流程比较长。
姚舜宇
至少我个人得到的印象、看到的情况是这样的。
张小珺
所以这种类似 OpenClaw 的产品形态背后,它本身说明了什么?
姚舜宇
在今年初这个时间点上,我觉得从技术上来说其实并不能说明什么。OpenClaw 这个产品当然依赖模型能做很多事情,但那些事情的能力并不是到今年年初才准备充足的。
去年,比如 OpenAI 发布 GPT-4.5 的时候,当然那时候 Claude 在 tool use 能力上比 OpenAI 和 Gemini 3 都要强一些。所以在那个时间点,其实就已经可以把这件事展示出来了。
而且它一开始发布也没有立即火起来,是发布过一段时间之后才火起来的。所以对我来说,技术上它并不是那么令人惊讶的事,它是模型能力的自然溢出。
但我觉得它带给大家的惊喜是,以前大家可能没有意识到这件事可以做。它让大家意识到,你可以控制很多不一样的模型,让它们做很多不一样的事情,然后把这些事情汇总起来,做一个很长、很长、很长的 long-horizon 工作。
以前大家并没有广泛地对这件事产生共识,而 OpenClaw 给大家展示了这样一种可能性。
张小珺
去年年初火的是 Manus,今年年初火的是 OpenClaw。从 Manus 到 OpenClaw,变化是什么?是模型能力的变化,还是产品的变化?
姚舜宇
这也是我一直没理解的事儿。Manus 和 OpenClaw 之间的质的区别是什么,是我自己没有太看明白的事情。
换句话说,OpenClaw 火了,但如果你回头问我,为什么 Manus 做不了这个事儿,我不明白 Manus 为什么做不了。可能只是它没做对。
张小珺
4. AI Startups Get Acquired
不管是 Manus 还是 OpenClaw,他们都选择了出售:Manus 卖给了 Meta,OpenClaw 卖给了 OpenAI。这个现象说明什么?为什么他们都卖了?
姚舜宇
我自己的感受是,一个东西如果要长久地生存,还是需要考虑一些壁垒。至少目前来说,很多壁垒都在模型侧。但未来会不会产生产品侧的壁垒,我觉得说不定。
市场上有一个老生常谈的话题,很多人会谈数据飞轮之类的事情。目前来说,我觉得没有哪一个场景真正形成了数据飞轮。甚至 AI 纯粹原生的应用场景,除了 agentic coding,也就是写代码之外,我觉得目前没有哪个场景是真正原生于 AI、并且变得非常成功的。
从某种意义上来说,chatbot 其实是搜索的一个延伸。
张小珺
Chatbot 是搜索的延伸,那它为什么不是独立于搜索的?
姚舜宇
因为大家和 chatbot 最多的交互是:我有一个问题,问这个 chatbot。这个其实是搜索本来做的事情。
当然,它带来了比搜索强得多的东西,就是它变得非常 interactive,有交互性。你可以追问,它甚至可以帮你总结通过它获取到的信息,把信息压缩、浓缩成回答你问题的内容。这是以前的搜索给不了你的。
但它当然不是完全一样的需求,只是从大的需求上来说,比较类似于搜索之前解决的需求。
张小珺
Manus 和 OpenClaw 我觉得都是现在最有名的“壳”,但壳最后都卖给了模型。那是不是说明,壳还是难以逃脱模型的掌心?它的逃逸速度不够快,是不是?
姚舜宇
我觉得壳在目前这个情况下,活下来大概有两种方式。
一种就是像你刚才说的,逃得足够快。我的增长速度足够快,以至于在模型公司反应过来的时候,我已经占领了大量的用户心智。然后在模型公司追赶我的产品形态时,我又自己研发出了自己的模型。我觉得 Cursor 就试图走这条路。
Cursor 在这种 AI 原生场景下,几乎是我能想到的创业公司里增长最快的。即使是这样的公司,它现在也很有危机感。
张小珺
它有多有危机感?
姚舜宇
我的感觉是,对 Cursor 来说,现在它和 Anthropic 已经进入了一个非常微妙的关系。
曾经他们是亲密无间的合作伙伴:Anthropic 提供模型,Cursor 提供产品。后来 Anthropic 自己有了 Claude Code,Claude Code 现在变得非常成功;Cursor 现在又自己试图做模型,所以 Cursor 在努力训练自己的 Composer。
不用说未来,其实现在他们已经处于一种比较竞争的关系了。如果在竞争中输掉,我觉得会比较麻烦。因为 coding 本质上是一种服务于专业用户的专业需求,是一种效率工具。效率工具很容易出现赢家通吃的场景。
我觉得这不管是对 Cursor,还是对任何一家做 coding 的公司来说,可能都是他们比较担心的事。
张小珺
刚才说的第一条路,就是要快。长得足够快,在别人还没想吃你的时候疯狂增长,等他想吃你的时候,你已经足够大了。
姚舜宇
另一种方式就是市场足够小,小到模型公司根本懒得去管。我觉得 Midjourney 就是一个例子。
虽然你说我们再努力一把,能不能做 Midjourney 那件事,可能花一些精力、花一些钱、花一些数据是能做到的,但是市场足够小,以至于我们可能不会在上面花时间,看不上它。这可能也是一种活下去的方式。
张小珺
所以哪怕 Cursor 今天也没有逃逸出模型的手掌心,有谁成功逃逸了吗?
姚舜宇
大的我目前还没看到。小的可能有,只是我还没看到。
张小珺
Lovable 算吗?
姚舜宇
我觉得他们有机会,他们有机会。
反正我觉得不能做那种通用的场景。这是 founder 要自己决定的一件事:你要不要抱着万分之一的生存几率,去赌一票大的;还是抱着百分之一的生存几率,先吃定一个小的事情?
张小珺
如果是你,你会怎么选?
姚舜宇
如果是我,我内心肯定是想吃一票大的。但我真诚地想,第一步是不能一步登天的。所以如果是我,我会选择先吃一个小的,但我会选择一个有想象空间的小的。
张小珺
OpenAI 为什么要收 OpenClaw?Meta 为什么要收 Manus?Google 为什么谁也不收?
姚舜宇
Google 也收了,Google 买了 Windsurf 的人。
张小珺
Windsurf?
姚舜宇
对。
张小珺
你刚才说你不理解。说说实话,你不理解什么?
姚舜宇
我不理解。我觉得 Meta 买 Manus 这件事,如果抛开花了多少钱不说,对他们来说最大的用处,是获得了一批很好的亚洲产品团队。
张小珺
在亚洲说明什么?
姚舜宇
一方面,显然大家都知道,中国的 AI 人才储备还是很丰富的。虽然目前从纯技术上来说,中国的 AI 还没有真正追上美国,但显然中国有很多好的人才,不管是纯技术上还是产品上。
我觉得可能中国本质上的人才是比美国更好的。对 Meta 来说,我觉得 Manus 成为了它在新加坡的一个锚点,可以从那里吸引一些来自中国、新加坡或者东亚的人才。
但我没有特别看明白这个产品本身对 Meta 来说有多重要。换句话说,为什么 Meta 不能自己做这个产品?
张小珺
不管是 Manus 还是 OpenClaw,它们事实上都诞生于外部团队。为什么不是硅谷的这帮研究员做出来的?你有没有反思过这个问题?
姚舜宇
我觉得一个公司一旦变大,它的负担也变大。
我作为一个研究员,可以做一些看起来很有趣、很有特点的产品。但一旦把这个产品公开给公众,要负责的事情就非常多。
第一,这个产品不可能上线之后告诉所有用户:“你得再去买一台电脑干这个事儿,否则它就有可能获得你电脑上的所有权限,把系统搞崩。”作为一个大公司,Google 不可能提供这样的产品出去。
所以产品要花很多时间打磨,要确认法律上没有风险,也不能损坏自己的品牌。你把它送出去之后,可能还要给它比较固定的资源,去 serve 这个模型或者这条产品线。这对大公司来说有很多负担。
但对于个人来说无所谓。我反正是一个开源项目,代码垃圾又如何?你帮我一起写吧。
我觉得不管是 Manus 还是 OpenClaw,它们其实指了一个方向,可能这也是 2026 年的一种趋势。
张小珺
5. Infinite Context Is Coming
你对 2026 年有什么思考和预期?
姚舜宇
我觉得可能性太多了。从模型能力上来说,我有时候特别爱说一个口号:train with finite context, use as infinite context。换句话说,就是用有限的 context length 去训练它,但在使用的时候,可以用非常非常长、甚至接近于无限的 context length。
我觉得这件事今年有机会实现。实现之后,我觉得会解锁很多新的应用。
举一个最简单的例子:你有可能让模型和你持续交互,持续获得你的信息。在运行过程中,它会根据当前场景和你的对话,持续地把它认为不重要的信息扔掉,最后就成了大家梦想中的个人助手。
从技术上来说,我觉得这件事今年无论如何都会实现。当然现在大家没有达成共识的是,技术上要怎么实现它。显然有很多技术路线,现在更多的是在尝试哪条路线能够跑通。
可能有好几条路线都能跑通,那到时候就要在实验上测,在广大用户常用的使用场景下,哪条路线的效率最高。现在更多处于这个阶段,而不是大家没有想法。大家有想法,但要确定哪个想法是最后的想法。
张小珺
站在 2026 年第一季度,作为一线研究员,你觉得模型的进步速度在放缓吗?
姚舜宇
我觉得完全没有,完全没有。
张小珺
它的速度曲线对比 2025 年、2024 年,变化是什么?
姚舜宇
这很难量化,因为你得给我一个标准,我才能量化地告诉你。
如果标准是看某一个 benchmark,每个月涨多少个点,那这件事肯定会变慢。因为根据定义,benchmark 最高只能到 100%,越接近上限肯定跑得越慢。
但这可能并不代表用户体验到的模型能力增长变慢了。从 50% 到 60%,用户可能会觉得好了一点;但从 70% 到 75%,他可能会发现好的地方比从 50% 到 60% 更多。80% 到 90%、90% 到 100%,用户感受可能会更显著。
当然也不一定。可能到了 80% 到 90%,用户发现没有任何区别,甚至变差了。
张小珺
你说完全没有变慢,是基于什么标准?
姚舜宇
基于我个人作为研究员的感觉。我个人得到的感受是,模型学东西的能力越来越强了。
以前可能让模型学会一件事情需要动很多脑筋,但现在可能不需要动那么多脑筋。最重要的事情是把问题定义清楚,然后想清楚怎么构建合适的数据。
现在数据的含义也更宽泛,包括环境之类的东西。剩下的事情,很多时候好像是顺其自然了。
张小珺
学习能力变强是为什么?
姚舜宇
原因可能有很多方面,但我觉得一方面是预训练在过去几个月里越来越强了。
这可能是一个比较有争议的事情。几个月以前,很多人已经在讨论预训练的 scaling law 是不是到头了。但我的体验是没有,而且我的感觉是在未来的 4 个月也没有看到到头的迹象。
张小珺
你觉得“到头”是为什么呢?
姚舜宇
我显然不知道大家觉得它到头的原因是什么,因为我自己没觉得它到头。但我的猜测是,一个人觉得一个规律到头了,无非有几种情况。
一种情况是,他觉得这个规律的适用范围到头了。可能从根本意义上讲,scaling law 没有办法无穷延展下去,这个猜测有可能是对的。也就是说,他可能觉得这个规律的适用范围到头了。
另一种可能,是他觉得这个规律中的某个条件不能满足了。比如他觉得数据已经撞上墙了,完全没有办法继续延展,这是另一种可能性。
还有第三种可能:他的工作里有一个 bug,但自己没有发现,所以觉得到头了。
从我的观感来说,绝大多数撞到墙的人,可能是因为第三种情况,是有 bug。
张小珺
是哪种 bug?
姚舜宇
bug 有很多种可能性。一种可能是你做 scaling law 的时候,科学假设没有做对。比如你选择什么样的 token horizon,每个规模的模型选择什么样的预期训练数据量;这个数据量怎么定,数据从哪里选。这些比较科学的选择没有选清楚,是一种可能性。
还有一种可能性,就是纯粹有一个 bug。这在业界并不惊奇,很多时候修好一个 bug 带来的进展,远大于一些很神奇的技巧。
我刚才讲的两种情况,是我见到比较多的。
张小珺
那你们的 bug 怎么办?你们怎么解决 bug 问题?
姚舜宇
我感觉这更像是一个信念问题。当你遇到一个 bug,觉得它不能解决,就会说这个到头了;当你遇到一个 bug,觉得它肯定可以解决,就会觉得这还没有到头。因为每个人都会遇到 bug。
我觉得这可能像你说的,是一些比较信念性的东西。但对我来说更重要的是做事系统:当一件事情和你的预测不一样时,你能不能系统地排除各种可能性。这是一个很重要的事情。
我觉得我们和海涛做得比较好,尤其是在预训练上。当某个尺度上的行为可能和你想象中不一样时,大家能够设计合理的 ablation 实验,通过合理的实验,测出你想象中的某些因素是不是真正的因素。
我觉得这种做问题的系统性才是关键。
张小珺
你觉得模型能力还能提高,那它的驱动力是数据、算力还是算法?你觉得主要来源于哪个?
姚舜宇
我觉得其实都有。但从某种意义上来说,数据和算力是强关联的一件事儿。
算力上去了,自然就会吸收更多的数据;数据上去了,自然就需要更多的算力。
算法的作用往往有一个相变。算法有一个阶段,是你完全没有搞清楚该怎么做。在那个阶段,算法会非常关键,因为你完全不知道怎么做,就没有办法 scale up,可能就卡在那里了。
但在某个点上,你可能发现了算法中最重要的事情,它可能一下就让你从完全不能做变成能做。之后算法的提升更多是一种比较平滑的提升,可能从某种程度上提高计算效率,或者提高使用数据的效率。
举例来说,从语言模型预训练的角度看,算法上发生跳跃的过程,可能就是发展出 Transformer。Transformer 发现之后,更多是慢慢让它的效率、使用数据的效率和使用算力的效率越来越高。
所以在现在比较清晰的框架里,主要驱动力是算力和数据。
张小珺
清晰框架是指预训练和后训练?不管是基于强化学习的后训练,还是基于 supervised learning,也就是监督学习的后训练?
姚舜宇
对。在这两个比较清晰的 paradigm 下,确实算力和数据是主要驱动力。
但不可否认,可能还有别的方向,驱动力是算法。
举一个简单的例子,多模态生成。我觉得它在算法上还没有完全想清楚,所以这还是一个科学问题,还没有解决。
自然语言生成,我觉得在目前这条技术方案撞到头之前,科学上已经比较清楚了,但工程上还有很多事情要做。
张小珺
你觉得预训练还能提高多少?通过预训练提升模型能力,还有多长的路可以走,可以预期到吗?
姚舜宇
人就是这样:当你没有撞到头的时候,其实不知道这条路有多长。我能看到的是现在还没撞到头,但我也不知道哪天会撞到头。
如果真的让我估计时间线,接下来 4 个月还是会继续有进展。但 AI 这个方向,没有人能预测 4 个月之后的事情。
张小珺
所以过去几个月你在看预训练和模型能力的时候,还是很兴奋的。这是你周围普遍的心态和状态吗?
姚舜宇
我觉得是的。
张小珺
这是在 Google 的一个小环境里,还是整个硅谷的环境里?
姚舜宇
我觉得很难说整个硅谷,因为硅谷太大了。
做产品的人可能对产品很兴奋。对他们来说,最兴奋的可能是 OpenClaw;但对做模型的人来说,我们会对模型进展更兴奋一些。
张小珺
对于做模型的人来说,兴奋是一个共识吗?至少在过去 4 个月?
姚舜宇
我个人认为是的。在至少我能接触到的范围内,我觉得在 Anthropic 和 Google,大家想得更多的是:AI 会不断进展下去,很快我们就要被替代掉;被替代掉之后我们该干什么?而不是模型撞到头了该怎么办。
张小珺
为什么在过去几个月,coding 的发展速度是最快的?为什么是这个场景?
姚舜宇
首先,coding 不只是在过去几个月发展最快。我觉得 coding 从 Claude 3.5 New 开始,或者外界有人称为 Claude 3.6,从那个时候之后就一直处于高速发展的状态。
那是前年 10 月,可能是 10 月或者 11 月,但差不多就是那时候。从那之后,我觉得它一直处于高速发展的状态。
我觉得 coding 这个场景有两个最大的优势。
第一个优势是它的 reward signal,也就是回馈信号,非常容易定义。比如 software engineer 的 task,经常是写一段代码实现一个 feature,这个 feature 要求某些输入得到某些输出。这是很容易测试的事情:输入和输出对应上,就说明你的实现成功了;对应不上,就说明不成功。
这只是一个例子。和写 code 相关的事情里,有很多这样定义良好的回馈信号。
另一个比较大的优势,是 coding 的数据有一个非常天然的基础,这个基础就是 GitHub。GitHub 汇聚了过去几十年很多优秀程序员写下的代码。从这些代码出发,可以构建出非常多的环境。
我觉得这两件事,从模型角度来说,是 coding 可以做得很好的原因。
当然,从产品上来说还有另外一方面:coding 这个产品的使用需求,从某种意义上来说比较单一。它不像社交软件或者游戏,每个人都有不一样的品味,很难满足每个人的需求,可能需要推荐算法。
coding 的好处是,优秀程序员写代码的风格比较类似。
张小珺
什么风格?
姚舜宇
简洁、干净。好的代码是不脏的,有一些共同标准:代码简洁、结构清楚、适合未来开发,有合理的抽象。当然还有很多其他标准,但好的程序员往往对这些标准有共识。
所以从产品上来说,coding 这个产品变得更简单了。
张小珺
你现在的工作有多少会用 Claude Code 写?它能帮你提高工作效率多少倍?
姚舜宇
你问了一个我差点会被开除的问题。我在 Google 不能用 Claude Code。
张小珺
好的。
姚舜宇
对我来说,一个保守的估计可能是 90% 的 code 是模型产生的。但我需要花很多时间去看这些 code 是不是写得合适、合理,是不是真的想让它这样写。
有了 AI 辅助工具之后,写 code 最重要的地方变成了:你怎么设计 code 的逻辑,它需要和哪一个文件关联,需要做哪些事情;你还需要给模型一些合理的 context,比如让它参考某一段 code。
真正输出 code,我觉得模型比人的能力强太多了。对我来说,如果要数有多少行 code 是自己手写的、多少行是模型写的,保守估计模型写的超过 90%;不保守的话,可能是 99% 或者 100%。
张小珺
剩下的 10% 是它不能写,还是为什么你没有让它写?
姚舜宇
保守估计 90%,是给我自己留点面子。我觉得它不能写、而我能写的部分,已经越来越少了。
张小珺
过去是什么样的?哪些是它不能写的?
姚舜宇
很早的时候,可能一年半以前,市面上说白了只有 Claude 一家能够真正写这种软件工程的 code。
那个时候模型的缺陷还是很多。比如它有时只关注一个文件,不会关注多个文件之间的关联。如果一个 class 的定义藏在很多层以后,或者没有直接被包含在当前的目录里,模型可能就找不着。
现在这个问题已经越来越少了,真的越来越少了。
张小珺
作为一个 researcher,你写程序的工作效率能够是过去的多少倍?
姚舜宇
从写 code 的角度来说,这件事比较难量化。但如果说做实验、实现一些 idea 的效率,我觉得比起一年甚至一年半以前,可能有 20 倍到 50 倍的加速。
现在模型真的变得很离谱。你可以同时开好几个,试好几个 idea;有些时候模型还可以帮你监控实验、监控结果。这是真正很大的效率提升。
但如果从个人工作时间来说,它好像反而让我工作时间变长了。
张小珺
这是为什么?
姚舜宇
因为开发速度变快之后,就越试越想试,有越来越多的想法要去试。
以前你可能有一个东西没见过,自己也不是很明白,可能要花时间去找那个人;约到那个人,可能已经是几个小时之后了。
现在不是这样。你看到一个不懂的文件,拿去问一下 Claude 或者 Gemini,可能 5 秒钟就告诉你结果,你就接着干了。
所以从工作时间上来说,我觉得工作时间反而变长了,而且工作的密度也变高了。
张小珺
Google 已经不是那个 Google 了,是吗?不是那个可以养老、work-life balance 的 Google 了?
姚舜宇
我感觉在 AI 这个领域,没有谁可以养老。
张小珺
所以你现在早起还是晚起?
姚舜宇
我一般早上 9 点钟起来,先看一下邮件,再看一看前一天晚上的消息,然后到公司一般是 10 点左右。晚上如果我一个人在美国,可能会待到 10 点、11 点。
当然,如果我老婆在,我可能会早一点回家,但在家反正也是干。我觉得在 AI 这个领域没有谁是在躺着的,除非你已经完全对技术没有兴趣,也没有对自己有追求。
张小珺
你躺着其实也没有人管你。
姚舜宇
对,但我觉得大家还是比较 self-driven,还是自己想干。
张小珺
6. Humans Keep the Hard Problems
你觉得其他领域会出现更多这样的 Claude Code 时刻吗?继 coding 之后,会在哪里爆发?
姚舜宇
你问了一个好问题。我要是看清楚了,可能已经出去创业了。
但确实,除了 coding 之外,我们已经能看到它对很多其他方向产生了很大影响。只是那些方向可能不是一个好的市场方向。
比如现在很多做基础科学研究的人,做数学、做理论物理,其实已经大量使用 AI 工具。过去我们做 AI 研究很像:你可能想到一个想法,想跑一个数值;学物理的人又不一定很会写 code,光搞明白怎么打开编译器、把 code 跑起来,半天已经过去了。
现在没有这个烦恼了。你现在想试,5 分钟之后 code 就写完了,可以开始试了。
甚至 Gemini Deep Research 发布之后,很多基础科学研究人员会把数学推导、数学证明,甚至阅读不同的文章、归纳这些事情,全都交给模型。所以我觉得它已经对 coding 之外的方向产生了影响。
当然,那些基础研究很难变成万众瞩目的事情,除非你真的发现一个以前没人发现、非常精妙的理论。比如 AI 产生了爱因斯坦理论级别的东西,那可能会变得万众瞩目。但那个时刻可能还没到来,影响已经在产生了。
张小珺
AI 好神奇,它为什么首先做的都是人类觉得最难的那部分工作?
姚舜宇
我觉得这是一个特别好的问题。在我人生所处的阶段里,大家往往会觉得最有智力挑战的工作,反而是那些比较理性、比较客观的事情,比如数学、写代码、做 AI 研究和科学研究。
越是这些事情,AI 越容易做好。因为一旦想清楚这件事怎么评价,就知道怎么训练。
张小珺
人为什么比较难?你看,人都是智力分配最高的那部分人去做这些工作。
姚舜宇
但未来可能不是这样。未来会发生一个改变:有很多事情 AI 没那么容易做,反而是人做得比较好,比如做产品经理。
说实话,做好一个产品经理,是我现在想不明白该怎么训练 AI 去做的事。
张小珺
这是为什么?
姚舜宇
没有标准,没有刻度。什么叫一个好的产品?我其实想不太明白。没有一个很客观的标准,你一定是做出来、给人用了之后,才知道它好,大家才会说它好。
这是一个回馈信号很不明确的事情,我不知道该怎么训练 AI 去做。
张小珺
程序员什么时候会被彻底取代?会有这一天吗?
姚舜宇
我觉得这一天会来,但不会一瞬间到来。不会是程序员都还在,过了一个晚上,第二天程序员全被开除了。它一定是一个渐变的过程。
但大家现在已经看到这个渐变过程了,因为有些公司已经开始裁员。
AI 从某种意义上来说当然是一个很好的东西,但从另一个意义上来说,它可能也是一件很不幸的事。AI 是一种 very centralized technology,它会让少部分人变得更强,但会让大部分人失去他们的独特价值。
所以对传统软件工程来说,最后可能会变成:千分之一的人干了过去所有人的工作,拿着现在 100 倍的工资。
张小珺
那你对程序员有什么建议?
姚舜宇
我觉得可能是接受新事物。未来程序员很重要的一件事,是怎么和 AI 有效协作。
有很多事情 AI 可能做得不是那么好,比如怎么合理地设计一件事情的实现方案,怎么样设计才能让它和公司未来的发展比较契合。这些东西很难告诉模型,让它理解。这件事可能还需要人去做。
但具体到过去很多程序员做的工作,比如经理告诉你:“实现这个方案,下周五之前给我。”这样的工作未来可能就不会再存在了。
张小珺
那千分之一的程序员会是什么样的程序员?他们的特质是什么?
姚舜宇
首先,千分之一是个虚数,可能是千分之一、万分之一还是十万分之一?也可能是百分之一,你不要那么悲观。
我是一个著名的悲观主义者,所以也不要太乐观。
我觉得未来好的程序员,首先从技术上来说一定会非常强。如果技术上弱,没有什么道理 AI 不能取代你。
但技术强可能不会是唯一的,也不一定是必要条件,可能是充分条件。
另一个重要的事情是,你得能够理解自己的这部分工作,在一个大的组织或者公司里该怎么适配进去。这也是一个重要能力。
当然还有很多别的事情,比如这个人的规划能力是不是足够强。如果规划能力强,他可以同时把一个很大的、很复杂的事情拆解成很多相对较小的事情,然后交给不同的 AI 去做。
但现在看,这三种能力是重要的,可能 AI 还不能完全做到,不代表 6 个月之后不能。可能 6 个月之后你再来问我,我会发现最后一个能力 AI 已经能做了,只剩下两个。再过 6 个月,可能剩下两个也能做了,那我的回答就会变得更悲观。
没有人能预计 6 个月之后发生什么。我只能说,从现在的观点来看是这样。
张小珺
7. China's AI Frontier
刚过去的春节,很多人关注另外一件事情,是 Seedance。Seedance 会让 Google 焦虑吗?
姚舜宇
有可能,但焦虑的情绪目前还没有传导到我这里。
可能负责多模态生成的团队会有一些压力,但如果你问我的话,我不觉得他们有什么可焦虑的。它并没有体现出范式上的改变,更多是我觉得它在产品效果、数据和细节上做得非常好。
Google DeepMind 过去在多模态生成上一直有比较强的优势,但至少我个人没有体会到它是一个范式上的变化。不足以说让大家非常焦虑,但肯定是有压力。
张小珺
Seedance 的产品能力,来自模型能力还是产品能力?
姚舜宇
我自己没有做过,所以不知道具体细节。但你要让我猜,我觉得可能模型还是占大头。
张小珺
模型能力的好来自于什么?来自数据吗?因为算法可能没有本质创新。
姚舜宇
首先,多模态生成还属于科学问题。多模态理解比生成肯定更系统、更有系统性的理解,但比起 text token 来说,范式还没有那么固定。
生成上,因为它还是一个范式没有固定的事情,可能每家使用的技术都会有大的或小的区别。现在更多只是能看到,效果上字节和 Google 做得比较好,所以可能也是来自细节做得更好。
如果要让我猜,我会猜数据。但我没有在字节工作过,所以也是我硬猜的。
张小珺
你怎么看从 Google 去字节的吴永辉?
姚舜宇
我何德何能评价永辉?
我过去没有和吴永辉一起工作过,所以不是很能给出很好的、很客观的评价。但我去了 Google DeepMind 之后,看到的更多是永辉好的一面。
通过看他以前写过的代码,以及他带过的项目,我感觉他是我见到的少数层级非常高、非常 senior,同时又有很强技术能力的人。这非常非常少见。
我觉得我可能还没到能够评价永辉的水平,但如果你问我的话,我觉得永辉非常非常强。
张小珺
站在 2026 年第一季度,拍一张快照,你觉得中美的模型能力差距是在放大还是缩小?差多远?
姚舜宇
如果现在放一张快照,看过去一年或者一年半的发展趋势,显然中美之间的 gap 越来越小了。
但最后这个 gap 会不会完全弥合,甚至中国超过美国,我觉得是一个不清楚的问题。对中国的 AI 研究员和研究机构来说,这也是一个机会。
一个很真实的事情是,中国在实际算力资源上占很大劣势,但这个很大的劣势可能反而逼出了一些有趣的事情。比如中国的模型公司其实很擅长 distillation,也就是蒸馏别人。
张小珺
最近 Dario 不是点名了 3 家公司蒸馏它吗?
姚舜宇
我觉得蒸馏这件事存在,是一个心照不宣的事实。但蒸馏也有不同的方式,有硬蒸馏和聪明的蒸馏两种不一样的选择。
硬蒸馏最简单的例子就是:从 Claude 里取出一堆它生成的 token,然后强行在上面做训练。
如果这样做,我觉得首先在商业上不太道德,在治理上也比较愚蠢。因为这样做的公司本质上体现出一件事:它不知道自己想干什么,唯一能做的事情就是抄别人,让自己的模型在数据上看起来好看一点。
这本质上说明它自己都不知道该干什么。
但蒸馏也有一些很有趣的科学问题。比如有没有可能,在我自己生成数据的链条中,用到了别的模型作为辅助;或者我自己模型生成的答案,用别的模型作为评价者。
这在商业上可能是一个比较灰色的地带,但从技术上来说很有意思。因为从某种意义上来说,中国的实验室可能成为了做 multi-agent 训练的先驱。
如果从不同家的模型里,用比较聪明的方案把它们融汇到一个训练系统里,每家模型的分布可能都很不一样,语言分布也很不一样。这是真正的 multi-agent,技术上可能比用了好几个 LLM 一起做更有趣。
所以对我来说,聪明的蒸馏在商业上最后会不会变成一个明确错误或明确正确的事情,我不知道,但技术上其实很有意思。
张小珺
你说的这两种蒸馏分别指谁?能不能后期把名字剪掉?
姚舜宇
我首先没有在中国的 lab 工作过,所以不知道确切事实。但我的感觉是,应该印证了。可能曾经硬蒸馏过,但后来慢慢也在努力向软蒸馏的方向转化。
我觉得比较明显、可能蒸馏得比较少的是 DeepSeek。DeepSeek 也是,我感觉这个模型还是比较有特点的。
张小珺
特点体现在哪里?比如说这个模型,你说它有多聪明呢?
姚舜宇
我觉得豆包肯定没有 Gemini 和 Claude 聪明,但豆包的语音生成非常非常强。
张小珺
这个很难吗?
姚舜宇
在技术上,豆包确实是做得最好的。
张小珺
我发现我生活上的问题只想问豆包,因为它很快。但其他模型为什么不优化这个产品功能呢?
姚舜宇
我觉得还是和它的用户群体有关系。在美国,大家的想法更专注于怎么提高工作效率。
张小珺
你生活中没有一些困惑吗?
姚舜宇
我生活中有。但我个人确实是一个生活上比较无聊的人,所以没有很多有趣的困惑可以去问豆包。我的困惑更多是技术上的,问 Gemini 这种聪明的模型是最好的。
我没有半夜去和豆包聊情感电台的需求。
张小珺
不只是情感。比如你做饭,可能会遇到一个问题,及时需要有人告诉你,但又找不到这样的人。
姚舜宇
这种需求我觉得更多是数据上的问题。可能美国公司现在主要的优先级,是智能或者工作效率。
张小珺
未来有一天,会不会变成这些日常的事情?
姚舜宇
我觉得有可能。
事实情况是,如果你去问这种日常话题,会发现 Gemini 一代又一代做得越来越好。我身边很多朋友,包括我自己以前也是这样:我以前在 Anthropic 的时候,写 code 会问 Claude,但日常查个什么东西,就会问 Gemini。
张小珺
你用过豆包吗?
姚舜宇
我其实只用过一两次。
张小珺
我发现你们都不怎么用,是不是有鄙视链?有智力上的鄙视链?
姚舜宇
没有,不至于。
首先,就跟在中国的人试图用美国的模型会有一些复杂的事情一样,我在美国用中国的模型其实也挺复杂的。第二,确实也没有这个动机。
尤其我觉得,我可能工作的时候就是工作,休闲的时候也还是找不一样的工作。所以对我来说,最好的伙伴就是 Claude 和 Gemini。
但对别人来说可能并不是这样,也只是我个人的问题。
张小珺
你自己用豆包的那一两次,是因为有人给你展示豆包手机。
姚舜宇
对。
张小珺
你怎么看豆包手机?
姚舜宇
我觉得这是一个很好的想法,效果上来说做得也不错。
当然我不知道技术上它的优化做得有多好。它实现一些任务,从效果上来说没有什么问题,但我不知道它会有多大消耗。
如果消耗非常大,那可能是技术上需要解决的问题。你并不希望模型帮你订了一张高铁票,结果花的钱比高铁票还贵,这肯定是不可接受的。
所以技术上来说,我不清楚它有多成熟。产品上来说,对大家还是一件挺让人兴奋的事。
苹果以前可能也想做这样的事情,只是苹果自己的模型一直不太行。苹果好像不是很在意它的 AI 战略。
张小珺
现在我觉得苹果一定是在意 AI 战略的。曾经 Siri 手机助手是苹果发布会里非常重要的闪光点,但自己的模型没赶上趟,现在可能要通过和别人合作来试图做这样的事情。
至于现在它是不是重视,我也不知道。你要让我猜,我肯定觉得它是重视的。但如果从外界看显得很重视,却又做不成,那就显得很蠢了。
姚舜宇
对。
张小珺
我们再说一下豆包的模型。你刚才说豆包模型比较有特色,具体一点。一个是它语音做得很好,这是第一点。
姚舜宇
我觉得语音做得好,是我能感觉到最有特色的事情。客气地说,可能是全世界最好的之一;不客气地说,我觉得就是全世界最好。
张小珺
这很难吗?
姚舜宇
我自己没有做到那个地步过,所以不知道难不难。但我觉得可能是一个很费功夫的事情,不管从数据还是各种优化来说。
张小珺
它是产品的事,还是模型的事?
姚舜宇
一定是模型的事,也可能包含一些产品部分,但一定是模型的事。
另一方面,我自己的感受不多,因为使用机会没那么多。更多可能来自亲朋好友的反馈:豆包这个模型 fun to talk,聊起来很有趣。但这更多是一些主观反馈。
我觉得另一个重要特点是它生成得很快。很多模型都在给你展示思维链,但生活上的琐事,我不想看它的思维链。
张小珺
这个事情技术上并不难,只是可能大家目前还没有花更多时间在上面。
姚舜宇
对。事实情况是,如果你去尝试 Gemini 3.1 和 Gemini 3,会发现 Gemini 3.1 在完成同样一个问题时已经比以前快很多,废话也少很多。
所以这在我看来不是技术难点,更多只是看什么时候重视、什么时候去做。现在美国这几家还都处于努力把智能上限不断往前推进的阶段。
豆包当然也在推进上限,但我觉得它可能在用户优化上也做得很不错。
张小珺
8. Robots Still Lack Generality
最近还有一个话题是中国的机器人很火,在春晚上也有很多表演。我不知道你对此有没有观察。
姚舜宇
我看过一些表演,也在亚马逊上搜过一些价格,确实很惊讶它居然这么便宜。
张小珺
买了吗?
姚舜宇
没买,买了也没什么用。
以前我脑海里觉得,人形机器人主要是硬件层面。要把硬件做到这么成熟,可能怎么也得几百万美元。但我去看了一下,价格比这便宜很多。
我觉得这体现出中国在硬件产业链上还是很有优势的。
但我并不知道它作为一个机器人硬件来说,我觉得确实是非常非常强。从软件上来说,没太看明白。我觉得机器人的模型也是目前非共识比较大的事情。
张小珺
怎么说?
姚舜宇
我觉得机器人的模型可能更多处于 feature engineering 的时代。给定一个环境、给定一个场景,然后去优化这个场景,大家知道怎么做。
做 RL,也就是强化学习,构建合适的虚拟环境、虚拟数据,然后进行训练,是可以提高的。但它没有很强的泛化性。
有没有泛化性,是很多 AI 方向的分水岭。一个确定的、单一的场景能不能做好,不是最近几年才解决的,十几年前就能做。
语言也是这样。在 Transformer 这种架构之前,并不是完全做不了语言任务。那时候也可以训练一个很强的模型做翻译,也可以训练一个很强的模型做语义分析。但做不到的是,水平地提高所有能力。
我觉得这是一个分水岭。语言模型在 Transformer 和 GPT 之后跨过了这样一个阶段:可以水平地提高所有能力。在一个点上的训练,会把这种能力抽象、泛化到所有相关的事情上。
但机器人还没有到那个阶段,更多还是在那个阶段之前:有一个单一场景、单一事情,然后为这件事做优化。
张小珺
你怎么看硅谷的这些机器人团队?包括 Google DeepMind 内部也有很多做机器人的人。你会怎么看这个方向?这是你们的子方向、平行方向,还是其他关系?
姚舜宇
过去是一个比较平行的方向,但现在机器人也在尝试能不能利用语言模型作为基座模型,然后在上面训练类似 VLA 这样的多模态模型。
所以现在它和语言模型这条线变得比较相关。我个人感觉它们未来会变得很重要,但目前还没有找到自己的路。
不过它们做的事情真的很有意思。我非常推荐大家去看看机器人实验室,比看做语言模型的实验室有趣得多。
做语言模型的实验室感觉就是正常办公室,但机器人实验室真的会有人去操控机器人、采集各种数据,然后看机器人如何在货架里取不同的货品。这是很有意思的一件事。
张小珺
你去的是哪家?
姚舜宇
我去过 Google DeepMind 自己的机器人实验室。还有 Dyna Robotics,我也去看过。他们是一个叠衣服的机器人,场景可能更单一一点,就是叠衣服;也可能做一些别的事情,比如倒水。
张小珺
你的直观感觉,机器人进展相当于大语言模型的哪一年?还没有到 GPT-1 的时刻,对不对?
姚舜宇
一定没到。我觉得一定没到。
对我来说,不管机器人还是多模态生成,都还没到那个点。大家还没有想明白怎么 scale up。
张小珺
9. From Physics Into AI
接下来进入今天的主题。我们还是对你非常感兴趣,聊一聊你是怎么从一个学物理的人进入 AI 世界的。
你从小在哪里长大?是怎么长大的?
姚舜宇
我出生在宁夏,一个很小很小的城市,叫大武口。
张小珺
你看,你这个困惑的表情已经说明了这个城市有多小。
姚舜宇
这个城市过去的存在是因为一个煤矿。因为石嘴山有一个煤矿,然后有了这样一个城市。
我在那里出生,但小学的时候跟父母一起去了上海,所以小学的后半段、初中和高中是在上海。上本科之后去了北京,博士在美国。
张小珺
你从小成绩很好,是吗?你是物理竞赛保送,然后在清华和斯坦福读的是理论物理。
姚舜宇
我不是物理竞赛保送的。我觉得我小时候挺菜的。
首先,我读的初中和小学都是无名之辈。我当时读的初中,好像竞赛并不是一个你该考虑的事情,就是处于这样一个初中里,叫上南中学东校,又是一个大家听了会很困惑、一头雾水的学校。
张小珺
既然都说到这儿,那小学是哪个小学?叫什么来着?
姚舜宇
我的 context management 能力太强了,我已经不记得叫什么了。
张小珺
可以。
姚舜宇
那个初中,一个班里面的小环境还是有一些想要好好做事的同学的,但总体来说,那个初中我觉得是比较躺平的状态。
我觉得自己学习还可以。那时候上海高中有所谓的“四校”,就是上海中学、华东师范大学第二附属中学、上海交通大学附属中学和复旦大学附属中学。
当时我的状态是能上这四个学校,但上不了这四个学校里最好的班。但我当时特别想搞竞赛,因为以前都没搞过竞赛。
张小珺
你初中开始搞竞赛?
姚舜宇
我初中没搞过竞赛。
张小珺
你没搞过竞赛,为什么想搞竞赛?
姚舜宇
因为没搞过,所以想搞。
张小珺
怎么植入了这个概念?
姚舜宇
我这个人的个性就是,总是爱干一些自己不太会的事。
当时没搞过竞赛,但是知道有这么回事儿,所以觉得义务教育之后、上大学之前得干一把。
但我的成绩也没好到那个份儿上,所以去四校也进不了搞竞赛的班。我当时发现有一个稍微差一点的学校,就是格致中学,稍微差一点,但那个学校有竞赛班。
我感觉这个竞赛班,用现在的话说就是 underdog;用当时的话说,我觉得是光脚的不怕穿鞋的。我觉得可以一搞。
那时候上海还有所谓的推优生制度,可以在中考之前和某一个学校签约,提前预定那个学校的名额,然后直接去他们那里。我就这样去了格致中学的竞赛班。
张小珺
所以你其实是在上海四校的普通班和格致中学的竞赛班之间,义无反顾地选择了格致中学的竞赛班。
姚舜宇
当然,我不能说做选择的时候,上四个最好的高中是板上钉钉的事儿。虽然后来分数确实够了,但那时候还没有中考。
当时就觉得,就算能上,我也应该去一个 underdog 的地方赌一把。
张小珺
为什么?
姚舜宇
因为想干这个事儿。
张小珺
你想干竞赛的目的是什么?
姚舜宇
最主要是想体验。我觉得没干过,一定要找机会干一下。
张小珺
为什么一定要干一下?
姚舜宇
第一,觉得它确实难,有一种对难的兴奋感。
至少当时没搞的时候,大家给我的印象是,这件事比不搞竞赛学的那些东西有挑战性得多。感觉干这个事儿的人确实强,不干的话,你也就只是平庸石头里最光滑的那一块。
所以我当时觉得要干。当然,干了之后也带来了一些好处。后来回想起来,如果当时没去搞竞赛,可能就进不了清华了。
张小珺
你是有加分还是什么?
姚舜宇
当时竞赛保送生制度已经大幅收紧了,只有进国家集训队才能保送。我当时没进国家集训队,所以不能算保送。
但在高三竞赛之前,我阴差阳错地去清华参加了一个夏令营。夏令营最后一天,我听说他们在搞自主招生,主要面向北京的学生,于是我疯狂给招生办老师发短信,说我要跟他们一起考。
张小珺
他答应了?
姚舜宇
他答应了。准确地说,是答应我和一起去夏令营的几个上海高中同学去考。
张小珺
你有什么理由说服他?你给他发短信说了什么?
姚舜宇
我已经忘了具体怎么说,大概意思就是:你们给北京的同学考,为什么不给上海的考?大家都在一条线上竞争。
张小珺
你当时觉得他们是在开后门吗?
姚舜宇
我也不是觉得他们开后门,就是觉得人家有这个机会,凭什么不给我们?
张小珺
你们当时是同学?
姚舜宇
对。后来他们就真的让我们去考了。
张小珺
几个人?
姚舜宇
记不太清了,可能上海去那个考场的有七八个人。
张小珺
是你发的那个短信?
姚舜宇
可能别的高中也有同学发,但我们高中是我发的。
张小珺
都是上海去北京参加那个夏令营的同学?
姚舜宇
对,参加夏令营的同学。后来他们就让我们考,然后签了。
我从那件事得到的人生中最重要的道理就是,胆子要大。你不争取,永远得不到;争取了也有可能得不到,但不争取就绝对得不到。
张小珺
你当时发那个短信的时候忐忑吗?你当时还是高中生。
姚舜宇
我已经不记得了。当时觉得自己这是个很大胆的事情吗?没有,还好。
我当时满脑子想的都是现在就得争取,再不争取明天就争取不到了。听说这件事的当天,我就赶紧疯狂发短信。
张小珺
发给谁?
姚舜宇
发给清华招生办的老师。
张小珺
发给一个人还是多个人?
姚舜宇
不记得了,应该是一个老师。
张小珺
他很快回复了吗?
姚舜宇
我觉得清华就是 yes 了。我不知道他们内部有没有讨论,但最后反正是同意了,然后一起考试。
所以我一直对清华挺有感情的。我感觉这个学校是愿意给大家提供机会、给大家平等机会的。
张小珺
你那个考试考得怎么样?
姚舜宇
我出来的时候觉得考得挺崩的,因为有半道题没做出来。但后来发现别人没做出来的更多,果然就招了。
张小珺
你们那一波上海同学进了几个?
姚舜宇
好像两个。
张小珺
自主招生是减分,还是降到一本线?
姚舜宇
降到一本线。
张小珺
后来你高考考得好吗?
姚舜宇
后来高考果然没考到清华的分,但除了清北之外的学校都能上。
张小珺
所以为什么网上都写你是保送的?
姚舜宇
我觉得没在那几年上过学的人,很难理解清楚那几年到底发生了什么。
在我前两届,拿了省一等奖就能保送。我们那时候是拿了省一等奖、进省队,再代表省队去参加国家比赛,进国家集训队才能保送。
我是进了省队去考国家比赛,但没进国家集训队。所以我那一届没有保送生名额。
张小珺
你搞竞赛搞得好吗?
姚舜宇
我觉得挺菜的。难道不是没有做到最好就是很菜吗?我显然没有做到最好,所以就是很菜。
张小珺
你家里人对你搞竞赛这件事是什么态度?
姚舜宇
我觉得我爸妈最好的一点,就是他们不太管我。他们可能曾经也试图管过我,后来发现管不住。
张小珺
怎么管不住?
姚舜宇
我也不听他们的。
我觉得大多数中国家庭,孩子和父母商量已经算是很好的了。我一般都是通知。
张小珺
你通知了什么?
姚舜宇
比如通知他们:我去参加自主招生了。
包括中高考填志愿也是。我爸妈甚至可能都没见过我的志愿单。
张小珺
他们比较佛系,是吗?
姚舜宇
我觉得他们是:当你没有办法理解别人在干什么的时候,别指手画脚就是最好的。我爸妈把这个道理理解得很好。
张小珺
那你是比较叛逆吗?
姚舜宇
我觉得是比较叛逆。
因为我很 care 我想做的事情。如果这件事是我自己想明白了要做,你就别拦我,我也一定会尽最大努力做到最好。但如果这件事我不想干,逼我干也没用,我也不会干。
张小珺
你的胜负欲强吗?
姚舜宇
挺强的。但我更多是在和自己较劲,不太愿意和别人较劲。
当然,如果这件事正好是我觉得很重要、你也觉得很重要,那我肯定要干得比你好。
张小珺
你到了清华就更神了,去学了量子物理,为什么?
姚舜宇
我当时做的是凝聚态理论。为什么选这个专业?阴差阳错。
现在回过头来,当然可以编造出一些听起来很合理的理由,但摸着良心回到当初,我觉得就是阴差阳错。
当时我们在基础科学班,基础科学班有一个很好的传统:虽然它在物理系,但不限制学生做什么,实际上三分之二的学生都不会做物理。
张小珺
那你为什么会进这个班?
姚舜宇
当时清华物理系全都是基础科学班,现在可能不是了,但当时是。
它另一个好的传统,是鼓励学生在实践中学习,鼓励学生尽早进入科研实验室,和科研工作者一起,在科研中学习。
我当时很想做理论。
张小珺
是觉得难吗?感觉你对难有一种着迷,可能也是一种病。
张小珺
这可能是一个病,之后可以再讲讲这个病带来的不良后果。
姚舜宇
当时基础科学班,或者我们叫学堂班,有一个更小的班。老师推荐说,高等研究院是一个很好的地方。清华高等研究院是杨振宁先生创立的研究院。
我就去那里找老师。正好有一个那时候还很年轻的老师,叫王忠,是我本科的老师。他那时候也没几个学生。我们俩聊了聊,我当然什么都不懂,但他还挺耐心,也给了我一些 paper 让我读。
读完之后我和他讨论,后来发现凝聚态理论,尤其是当时做的拓扑绝缘体等方向,其实很适合本科生上手。它需要的背景知识不多,只需要最基本的量子力学、统计力学和固体物理。
这些是非常容易学的基础知识,但它很考验你对这些知识理解的深度。对本科生来说,这是一个特别好的方向:你能够很快上手,做一些实际项目。
我们一起做了一些工作,其中有一项关于开放量子体系的工作,现在看来还是一个挺重要的工作。
回头来看,做那段时间的科研,其实和现在做 AI 特别像。更多的是你有一个想法、一个理解,然后做数值实验验证这个想法和理解是不是对的。
AI 其实也是这样。你有一个想法、一个理解,然后设计实验验证理解是不是对的,再设计模型训练 pipeline,把你的想法实施出来。所以这两个事情其实很像。
张小珺
你能不能讲讲你这个非厄米系统的研究?
姚舜宇
可以。我尽量说人话,但也有可能实际上说了鬼话,不想听的人可以划一下进度条。
非厄米系统是这样:量子力学一个最基本的假设是,一个孤立系统的演化由幺正演化描述。
幺正演化的意思是,它是一个线性的过程。这个线性过程可以由一个算子,也就是哈密顿量来描述。哈密顿量从某种意义上来说有点像体系的能量,当然不完全是,它决定了体系随时间的演化。
如果是一个孤立系统,哈密顿量会是一个厄米矩阵。厄米矩阵就是转置之后再做共轭,和原来一样。
但真实系统绝大多数都不是孤立系统。比如你我作为人,肯定要和外界进行信息和物质上的交互;材料也是一样,除非处在特别特别真空,否则总要和外界环境有交换。
所以真实体系绝大多数时候都不是孤立系统,也就不会被一个幺正过程描述,对应的哈密顿量也不会是厄米的。这就是“非厄米”这个词的来源,本质上是为了研究开放量子系统,也就是和外界有交换的量子系统的行为。
当时我们遇到一个很困惑的事情:一开始试图研究开放量子系统里的拓扑现象,结果手算出来的理论结果和数值怎么都对不上。
更确切地说,手算时假设体系是周期性边界条件,比如它在一个环上,或者在一个轮胎的表面上;而数值计算会采用更接近实际的开放边界,比如一个方块材料上的行为。结果这两个结果怎么都对不上。
后来我们发现,过去用来描述厄米系统的一个基本范式,也就是所谓的布洛赫波,假设物体的本征态都是一些波的线性组合,比如正弦、余弦波的线性组合,这个假设在非厄米系统里面会失效。
事实情况是,在非厄米系统里,能量本征态有可能会聚集到体系的一边。
于是我们系统地建立了这套描述方法,描述开放边界的非厄米系统,其本征态应该怎么描述,进而描述它的随时间演化和动力学。
这就是当时那份工作的内容。后来因为它是一个范式上的更新,所以有很多 follow-up 的工作。但后来我换方向了,没有继续在这个方向做下去。
张小珺
你为什么不继续做?很难抓住一次范式的变化,对吗?
姚舜宇
是的,这就是人性的弱点。我总爱挑战一些自己不会的事情。
当时我的感觉是,那个工作可能再过几年回头来看,会成为这个方向最重要的工作。之后再做一些工作,可能会让你更有名、获得更多引用、发表更多好的期刊文章、找到一个好的教职。
但作为科学生涯来说,就没那么令人激动了。所以我当时就想换一个自己不太会的东西做。
于是读博士的时候,我换了一个方向,去做高能理论。
张小珺
高能理论物理?
姚舜宇
对,高能理论物理。
张小珺
所以你本科和博士也是不一样的,不是从物理跳到 AI?
姚舜宇
其实本科和博士看起来都是物理,但方向已经发生了很大变化,是两个几乎没有任何联系的方向。
张小珺
你很神奇。包括你选竞赛、去格致中学也很神奇。这是你的什么人性?
姚舜宇
说难听了就是爱折磨自己,说好听的是挑战自己。
张小珺
被折磨开心吗?
姚舜宇
如果为了被折磨而被折磨,那这个人就是有心理疾病。但如果一个人是为了学习更多东西、丰富自己的能力而被折磨,我觉得是值得的。
张小珺
你本科那个老师王忠老师也是一个 underdog,是吧?
姚舜宇
算吗?不算,人家做得挺好的,怎么可以这样说?
张小珺
你刚才说他那时候很年轻。
姚舜宇
他很年轻,但我对他的印象一直是,他是一个很 sharp、很能看问题、试图把问题理解清楚的人。
他可能不像很多老师那样在社会上很有名气,或者很光彩夺目,至少那个时候不是。现在他已经很有名气了,那时候还没有那么有名。
但从能力上来说,我觉得他很强。他一开始读博士后是跟张首晟老师学习的,能被张首晟老师挑中的人,基本都不会太差。
张小珺
他对于你博士换方向说过什么吗?
姚舜宇
没说过什么。我觉得他是一个不爱干涉别人的人。我不知道他内心怎么想,但我觉得他不爱干涉别人。
张小珺
量子物理整个是一个什么样的世界观?它跟经典物理有什么区别?
姚舜宇
我觉得最大的区别是,它们是对应的概念。经典物理和量子物理,是在不同能量、时间或空间尺度下的理论。
本质上我们这个世界都是量子的。当然,我们现在也不知道在更小的尺度上会是什么。更小尺度上有很多不同的想法,比如弦论、量子引力等,但那些都没有办法验证。
能够被实验验证的、在最小尺度上的有效理论就是量子物理,包括量子力学和量子场论。
经典物理是当你看的空间尺度比较大时,量子物理慢慢退化成经典物理。所以它更多是在不同尺度下有不同的有效理论。
这在物理上是一个很深刻的想法,也就是所谓的重整化群:描述一个体系的理论,在不同能量尺度下可能看起来完全不一样。
哪怕它们从根源上是一个大一统理论,在不同尺度上看起来也可能完全不同。所以经典物理和量子物理,更多是两个不同尺度下的描述。
张小珺
讲到量子物理,有几个相关的词,比如蝴蝶效应、量子纠缠。能不能讲讲这些?我也不懂物理,大家不要骂我。
姚舜宇
量子纠缠确实是大家比较耳熟能详的、量子物理比较独特的事情。
很简单地说,我有两个粒子,它们处于一个纠缠态。它们实际上可以相隔很远,但我对其中一个做一些测量或微扰,也会影响到另外一个的状态。
张小珺
这是真实存在的吗?
姚舜宇
真实存在。
张小珺
什么样的物体会有量子纠缠?
姚舜宇
实际情况是,当你看得足够细、足够微观时,绝大多数例子可能都处于纠缠态。
你可以制造一个自旋和另外一个自旋,先把它们靠在一起,然后把它们坍缩到一个纠缠态,再把其中一个拉得很远,它们就成了一个距离很远的纠缠态。
我记得几年前还有人专门做过,把一个细菌和其他东西制备在一个量子纠缠态里。
张小珺
什么叫制备在一个量子纠缠态里?
姚舜宇
这是可以人为操作的事情。
张小珺
为什么?怎么操作?
姚舜宇
一般来说,通过一些测量和演化算符的作用,可以把它制备到这个状态上。
但难点在于实验上怎么实现这个过程。你可以想象,做一些量子测量和量子门操作是比较难的。
因为每个体系都不是孤立的。你可能觉得,两个自旋制备一下不就到纠缠态了吗?再把它们拉开不就行了?但实际问题是,这两个粒子生活在我们的世界里,会不断受到其他粒子的影响,或者被外面的热量扰动一下,状态就没有了。
所以最难的是怎么在实验上具体实施这个过程。
另一个更耳熟能详的例子,是薛定谔的猫。它的状态叠加了两种情况:一个放射源发出粒子,猫死了;另一个是放射源没有发出粒子,猫活着。
如果你去测量放射源,发现它发出了粒子,就知道猫死了,不管猫和放射源相隔多远。这就是纠缠。
但蝴蝶效应是另外一件事。大家熟悉的蝴蝶效应,反而是经典物理。著名的例子是,南美洲一只蝴蝶扇动翅膀,半个月之后可能导致北美洲刮起台风。
从数学表述来说,它是指在时间起始时做一个很小的扰动,然后测量这个扰动在未来产生的影响有多大。你会发现这个扰动的变化是指数级变大的。
这就是经典蝴蝶效应的数学描述。
但之前大家比较困惑的一件事是,这个事情在量子体系里怎么可能存在。孤立量子体系是幺正演化,是一个很线性的过程。如果一个状态是一个矢量,和另外一个矢量一开始夹角不大,经过演化之后夹角应该不会变化。
那怎么会存在初始状态差别很小、未来却指数级变大的情况?在量子力学上看,这似乎不太可能。
但我们刚才又说,微观世界是量子,宏观世界变成经典。它们是一脉相承的,怎么可能一个有、一个没有?这也是大家试图理解的事情。
后来大家有了更好的理解:讨论量子体系里的宏观效应时,不应该讨论两个态之间的变化,而是应该讨论所谓的 local observable,也就是局域观测量的变化。它对应的是经典物理里我们看到的那些变化。
张小珺
你读了 4 年量子物理之后,当时在想什么?你觉得物理对你的帮助是什么?大四毕业的时候,你有什么总结?
姚舜宇
本科期间读物理最大的帮助,第一是想问题要想清楚。读书不在于读得多,而在于读得深。
读得多不代表能够发现新的东西。如果你对一件事有和别人不一样的见解,那才是对社会更有价值的事情。
另外一件事是,别太相信理论,别太相信纯理论得出的结论。因为当时那个事情被发现,主要是因为能做数值:一开始是数值和理论对不上,才仔细研究那个问题,发现了这个现象。
张小珺
那你博士为什么去读高能物理?也是理论?
姚舜宇
这就回到了刚才的话题,总爱挑战很难的事儿。有时候这也会带来一些不好的结果。
张小珺
什么不好的结果?
姚舜宇
我觉得我的博士阶段对我自己来说学到很多东西、成长很大,但对这个世界来说没有产生什么贡献。
高能理论这个方向足够难,非常非常难。但不好的地方在于,它不太容易验证,没有什么客观的评价标准。
高能理论已经发展到了实验完全追不上的阶段。实验追不上理论讨论的能量尺度和微观尺度。所以它是怎么进步的?
一个进步来源是数学上的自洽性。比如你提出一个框架描述这些事情,它要和现有已经验证过的低能标理论自洽。
比如研究弦论,大家会问:弦论能不能在低能情况下回到量子场论,接回经典物理?这种自洽性是一个判断方法。我觉得这是合理、科学的一件事。
当然也有不科学的因素。当一个领域完全没有实验、没有客观标准时,肯定不会只有一个框架,也不会只有一个自洽的框架。
这时候谁做得好、谁做得不好,就依赖于领域内一些“老登”的主观判断。
张小珺
你是被谁伤害了吗?
姚舜宇
我也没有被谁伤害。我只是在那个领域待的时间越长,就越觉得这件事蠢。
人的一辈子也没多长,为什么要把自己的时间浪费在伺候“老登”身上?
所以我感觉自己花了 5 年,学了很多知识,但买了一个大教训。
张小珺
这个大教训是什么?
姚舜宇
要做实验,要做有比较客观评价标准的事。或者从另一个角度来说,要做对这个世界能够产生影响的事。
张小珺
所以你本科还是比较顺利的,对吧?在量子物理研究领域,很快就有了非常好的学术成果,而且是范式级的变化。但你很快觉得没有吸引力了,所以想在博士阶段挑战一个更难的事情。
姚舜宇
对。博士期间其实比较落寞,至少从结果来说是这样。外界看不出来,外界看到的都是非常光鲜的履历:博士在 Stanford。
从实际科研产出来说,我觉得没有人会说我博士期间的文章不好。但摸着良心说,对这个世界有多大影响?我觉得几乎没有,影响接近于零。
对我自己来说,我很不满意。但也没有不满意到担心别人说我在混日子,因为确实没有混日子,还是能达到所有外界标准的。
张小珺
这是怎么做到的?
姚舜宇
很多事情冷暖自知。
达到外界标准,或者达到一个小圈子的评价标准,就像训练模型一样。一旦有了这样一个小圈子,你知道他们的评价标准之后,做好是很容易的。
哪怕你不认可这个标准,也可以达到它。但你还是知道自己不认可。有时候哪怕不认可、但达到了,我也可以蒙蔽自己,继续往前走。
但后来我发现,我蒙蔽不了自己,骗不了自己。
张小珺
是哪一年发现的?
姚舜宇
可能是博士最后两年,就有这样的感觉。但那时候确实也没有想好、想清楚,如果不做这个该去做什么。
所以我花了一些时间了解不一样的方向。一开始更多是了解量子计算或者量子信息。拿到 postdoc offer 之后,感觉这件事更紧急了。
离开学校之前,你还可以用学生的心态;离开学校之后,就是自己的 career,你得给自己找一条路。
当时我觉得,量子计算和 AI 是两条给年轻人、给小团队机会比较多的路。
张小珺
所以你博士后的方向是什么?
姚舜宇
博后没有方向。博后其实就是理论物理这个方向。博后是一个很独立的职位,自己想干什么就干什么。
从某种意义上说,它有点像搞慈善。有些在意科研的国家组织或个人组织,可以给学校捐一笔钱,或者拨一笔钱,学校用这笔钱在一个系里招一些博士后,让他们做研究,同时把研究广泛地告诉系里其他人。
它更多是一种社会氛围性质的工作,没有什么限制。你想干什么就干什么。
但我也没做多长时间的博后。我实际可能在伯克利待了两三个月,但官方来说只待了两个星期。
张小珺
官方来说是什么意思?
姚舜宇
我其实在入职之前已经去那里了,因为我人就在湾区。入职之前我就去了,但入职之后只待了两个星期就辞职了。
张小珺
这两个星期发生了什么?
姚舜宇
什么也没发生。
我本来都不准备入职,但伯克利的人太好了。他们觉得,事情还没完全定下来,那还是先把现在的工作拿着,能来多久就来多久。
张小珺
你告诉他们其实在和 Anthropic 谈吗?
姚舜宇
我告诉他们,我可能会去做 AI,要不就别入职了。
但伯克利,或者不止伯克利,我觉得湾区这两个学校的老师都人很好,很照顾你。他觉得你还没有完全谈定,那就先把现在的工作拿着。
张小珺
你觉得物理对你后来做 AI 有什么帮助吗?
姚舜宇
硬实力上其实没什么帮助。纯工具性的技能上,从物理到 AI 的转化非常少。
如果非要说,我觉得主要可能不是能力,而是性格。做物理的人可能更想刨根问底,更想理解一件事情,也更想做事系统。
我们习惯系统性地做事情,不管是做实验还是做理论。所以这可能是一个比较好的地方。
但我不觉得这是做物理的人独有的。为什么计算机专业的人没有这个特性?我认识很多做计算机的人也有,很多做化学、生物的人也有,所以我不觉得它是物理独特的。
张小珺
但事实上比较有趣的是,这个领域里确实有很多物理出身的人,尤其是做大规模语言模型这种 AI,而且做得很成功。比如 Anthropic 这家公司。
很多人在描述这一代 AI 时都会说它是黑盒。你能用科学的角度理解一下这个黑盒吗?人工智能的运作原理是什么?
姚舜宇
我觉得这个世界上所有东西都是黑盒。
哪怕物理这种大家觉得很理解的东西,也不是真的有一个从微观行为一路演化到宏观体现的理解。
不管是量子力学还是量子场论,其实都是描述某个能标下的行为。本质上这个系统还是一个黑盒,你还是不知道它最微观的动力学是什么样。
AI 也是一样。黑盒不黑盒,其实都是相对的。
我们确实没有把语言模型理解到神经科学手术刀级别。不是说我理解一个行为,能够理解到这个行为是由哪一个人工神经元、哪一个激活产生的。没有到这个层面。
除非是在一些很稀疏、很小的网络里,像 Anthropic 有这个所谓的 interpretability(可解释性)团队,他们可能会做类似工作。但在实际能够使用的语言模型里,还没有达到这样的理解。
但这不代表我完全没有理解。比如 scaling law,就是描述在那个尺度下,模型随着模型大小和数据增加,perplexity 这个指标如何变得越来越好。
张小珺
所以你说是完全没有理解吗?如果 scaling law 不算理解的一小部分,那是不是我们也可以说,我们其实对这个世界完全不理解?这个世界也是一个完全黑盒?
姚顺宇
Scaling law 是一种科学规律。
张小珺
它是一种经验规律。
姚顺宇
对。但经验规律和科学规律之间的界限很模糊。
比如回头看热力学的各种定律,第一定律、第二定律、克拉珀龙方程,以及各种各样的东西,在当年被发现时也都是经验规律。
只是后来随着时间发展,我们慢慢知道了它们的微观机制,它们可能就变成了科学规律。
像 scaling law 这样的东西,现在肯定还是经验规律。但未来当技术变得比较固定,大家开始越来越多地理解它的微观过程,会不会变成科学规律?如果这个定义存在的话,我觉得有可能。
张小珺
能不能用科学的表达解释所谓的智能涌现?
姚顺宇
首先,“智能涌现”这个说法本身就不太科学,所以自然没办法用科学语言表达一个不科学的事情。
张小珺
智能涌现吗?
姚顺宇
我觉得智能涌现对我来说更多是一种主观感觉,而不是客观现象。
当很多人说智能涌现时,脑子里想的可能是:以前的语言模型只能做某一个方向的事情,只能翻译、分析或者做某种任务;但现在模型好像可以做所有事情。
对我来说,它更多是技术上的涌现,而不是行为上的涌现。
主要是我们通过研究发现了怎么做大规模训练,从而能够水平地提升所有能力。我觉得这是更本质的事情。
至于智能涌现,每个人心里的定义可能都不一样。
张小珺
你的定义是什么?
姚顺宇
对我来说就是没定义。
对我来说,唯一质的区别是,有没有发生一个技术上的改变,使得我们可以 scale up,可以水平地提升所有能力。这对我来说是一个良好定义的事情。
张小珺
你最后是在量子计算和 AI 之间选择了 AI。这个变化是怎么发生的?
姚顺宇
我花了一些时间去了解两个方向的瓶颈在哪里。我觉得它们的好处都是给年轻人机会比较多。
张小珺
但量子计算对你来说好像离你的主线更近一些,对不对?
姚顺宇
这就是为什么要去了解细节。了解细节之后发现不是,反过来了。
量子计算目前的主要瓶颈其实在实验上,并不是怎么设计算法或者算子,而是怎么在实验上实现它。这个事情反而是我不擅长的,和我过去很多感兴趣的事情都不太相关。
和我更相关的是 AI。刚才说过,AI 更多是你有一个想法,然后用数值去验证。这个数值在 AI 里面可能就是训练一个模型。
这反而和做物理很像。它甚至像 18 世纪的物理学,尤其是热力学:那个时代理论和实验不分家,没有理论物理学家、实验物理学家,你就是搞物理的,既可以做实验,也可以做理论推测。
我觉得 AI 有点像那个时代。
张小珺
所以从理论物理跨到实验物理的距离,比直接跨到 AI 还远?
姚顺宇
要远,而且从兴趣上来说也更远。
张小珺
你不喜欢实验物理。
姚顺宇
我觉得做实验确实不是我的兴趣所在。虽然我自己不愿意做,但我很有兴趣知道别人实验做得怎么样。
张小珺
AI 不用做实验吗?
姚顺宇
用,但更多是数值实验。
它不太像在实验室里搭一个光学平台。我觉得实验真的是一件很玄妙的事情。可能因为我不懂、没有达到那个境界,所以有些事在我看来很神奇。
比如大家都知道光学平台怎么搭,有的人就能搭出来,有的人耗了 6 年也没搭出来。这是动手能力,我一直没搞明白。有时候觉得这件事很玄妙。
对我来说,做数值实验、训练模型、研究各种技巧、看某些细节,反而是我能想明白为什么要这么干的事情。
但搭台子这件事,我就是一头雾水。
张小珺
你做过实验吧?
姚舜宇
当然做过。读物理的人基本都做过实验培训。但更多时候,我是去看做实验的朋友,看他们的实验室,或者和他们聊怎么设计实验。
我就感觉很多事情其实不太能理解,但他们确实有人做得好,有人做得不好。
张小珺
所以你说现在从事 AI 研究像 18 世纪研究热力学,虽然大家没有办法从科学上清晰地解释和理解它,但并不会阻止它发展。
姚舜宇
对。它更像那个时代的热力学。那时候大家不理解热的微观理论,不知道热是什么东西;就像现在大家不能理解语言模型里哪一个矩阵元在做什么。
但这不妨碍你有一些好的经验定律,比如热力学的各种定律,以及现在的各种 scaling law。
所以从研究方向来说,在这个层面上它们是类似的;从研究人员的角度来说,就是刚才说的另一个问题:理论和实验其实不太分家。
张小珺
10. Anthropic Moves With Conviction
那你是怎么面试 Anthropic 的?你进入 Anthropic 的历程是怎么展开的?
姚顺宇
主要还是因为有前同事在 Anthropic。
张小珺
前同事?
姚顺宇
对。Anthropic 其实有很多物理出身的人,尤其是理论物理出身的人。
张小珺
为什么?他们从人的选择上,为什么会选择这一批人?
姚顺宇
很多人可能会找一些原因,比如做物理的人擅长这个、擅长那个。但从我个人的视角看,主要原因还是 connection,也就是联系。
Anthropic 的创始团队里,当时有三四个比较技术的人,其中有两个现在还在技术一线领导。他们俩都是物理出身的,后来招的一些人也是物理出身,所以一直延续下来。
但到了我之后,其实几乎没怎么再招完全没有 AI 背景的人了。我觉得这也是一个时代的产物。
当时我决定做 AI,所以就试图联系一些地方。
张小珺
你只找了 Anthropic 吗?
姚顺宇
没有。我还找了 OpenAI 和 Google DeepMind。
但 Google DeepMind 那时候速度太慢了,所以最后没有出现在考虑范围内。
张小珺
速度太慢,是指面试速度慢?
姚顺宇
对。不过后来显然 Google DeepMind 的速度有了长足提升,后来动作就非常快了。
OpenAI 也联系了,但可能没有找到特别合适的事情和人。
Anthropic 是因为我当时联系了我的第一任 manager。他以前也是做理论物理的。他当时说,我们在尝试做强化学习,尝试做大规模强化学习,有很多科学问题要理解。
那是 2024 年 9 月、8 月的时候,强化学习还没有像现在这么成熟。大多数人其实不太知道怎么做,因为 o1 还没发布,只是快发布了。
大家知道有这个东西,但还没看到结果。Anthropic 当时大体上知道怎么做,但很多细节需要仔细研究。
他就跟我说:“有这么一件事,你要不要来面试一下?”我觉得可能是一个好的机会,于是就去了。
张小珺
你当时怎么认知强化学习?
姚顺宇
没认知。
张小珺
你大概知道 pre-train、post-train?
姚顺宇
对,大概知道这个流程,但我其实不知道工业级别的语言模型具体怎么训练,只知道学术界怎么训练。
所以现在回头谈那时候的认知,在我看来就是没有认知。更多的是,我当时觉得这件事是不确定的,是一个好的机会,所以就去干了。
当然也做了一些面试准备。面试题不太难,但我当时也不知道怎么准备。我就把能找到的课程自己学了一遍,把能做的作业做了一遍。
然后自己手搓了一套 Andrej Karpathy 的著名项目。好像叫 nanoGPT,反正就是一个可以在 Google Colab Notebook 里训练很小的 GPT 模型。我自己手搓了一下,然后就去面试了。
很快拿到了 offer。
当时有两个组的 manager 来和我聊,一个是做 evaluation,也就是模型评测;另一个是做强化学习。我选择了强化学习。
张小珺
你选择强化学习,是因为它更加不明朗?
姚顺宇
对。
那时候 Anthropic 也不像现在是一个大公司,公司其实很小。我去的时候,我们那个大 team 只有 10 个人左右,可能是 10 个人或者 11 个人。
张小珺
大 team 叫什么?
姚顺宇
叫 Horizon。
张小珺
这个大 team 的平行 team 有什么?
姚顺宇
那个大组后来几乎涵盖了强化学习的方方面面。但创业公司很难说一个组的目标是什么,因为它可能曾经有过很多不同目标,只是那个阶段主要目标是做强化学习。
底下有做数据的组,做环境和 infra、基础设施的组,也有做 research 和算法的组。我去的是比较偏 research 和算法的组。
张小珺
Anthropic 那时候多少人?
姚舜宇
那时候可能七八百人,总共。
张小珺
你一进去对这家公司印象是什么?
姚舜宇
我觉得我对 Anthropic 的印象一直挺 consistent 的。
进去之后,我觉得这家公司执行力非常强。它其实是一个比较 top-down 的公司,所以很多事情一旦决定,就会全力去做。
公司员工之间的氛围也很好,大家不会藏着掖着。尤其刚去的时候公司还比较小,大家互相都认识,所以氛围很好。
如果只是做语言模型相关的事情,现在回头来看,那是一个非常非常好的学习机会。你能够接触模型训练的方方面面,也都能找到对应的人去问。
张小珺
那个时候的 Anthropic,已经有了现在我们都知道的那个非常坚定的 bet 吗?
姚舜宇
有的。
张小珺
这个 bet 来自哪里?为什么会有这个 bet?
姚舜宇
我不知道它完全的来源是什么。我能看到的一个显然来源是,前一代模型 Claude 3 发布之后,Twitter 上有很多人在讨论:Claude 3 好像写 code 比 GPT-4 强。
那个年代 GPT-4 还是和大家有很大 gap 的模型,所以能有一件重要的事情比 GPT-4 强,就很厉害了。
张小珺
所以是试出来的?
姚舜宇
我觉得至少是其中一个原因,就是很快地对市场做了反馈。
这也是我觉得这家公司很强的一点:它的 execution,也就是执行力非常强。一旦得到一个信号,觉得这是一个很 reasonable、公司应该做的事情,就会扑上去。
它没有大组织那种冗余。
张小珺
为什么它的 coding 会比 GPT-4 好?
姚舜宇
不能说没有原因,是有原因的。但这是一个随机的原因,不是“我选择了这个方向,所以有了这个结果”的原因,而是纯技术原因。
确实有某一个团队做了某个事情。我不能确定一开始是随机试出来的,还是故意选择的。你要让我猜,我肯定会觉得是随机试出来的,纯技术原因。
张小珺
是自上而下的,还是自下而上的?
姚舜宇
最开始可能是自下而上的,但后来就变成了一个自上而下的事情。
也就是要快速捕捉内部和市场的信号,然后赶快扑上去。我觉得这是它非常强的一点:非常 reactive,反应非常快。
张小珺
它的执行力来自哪里?来自 Dario 这个人?
姚舜宇
来自于 Dario 的某种特质。
张小珺
作为一个公司来说,它能够实行这种比较 top-down 的机制,是一个很独特的事情。为什么?
姚舜宇
因为实行 top-down 有一个很难的点:做技术决策的人,必须也是公司的决策人。
首先,技术上得能服众,下面的研究员才会信服你,愿意去做这件事情。另一方面,你得是公司的决策人,得能为公司负责任。
Anthropic 有这个条件,就是它技术上的领导人其实也是公司的高层。
张小珺
你指的是谁?
姚舜宇
Jared Kaplan 和 Sam McCandlish。他们是公司技术方面的领导,也参与公司层面的决策,他们自己做这个决定。那是他们的公司,所以有权利做 top-down 的事情。
张小珺
那 Dario 作为 CEO,他会 say yes 和 no 吗?
姚舜宇
我不知道他们决策层讨论里的具体情况。
张小珺
大家又起到了什么样的作用?
姚舜宇
我只能说,技术 leader 是有决定权的。对我当时的工作来说,我接触最多的就是这帮人。
张小珺
可是这对于其他模型公司来说很难吗?
姚舜宇
很难。比如 OpenAI 就干不了。
张小珺
Ilya 在的时候难道不行吗?
姚舜宇
Ilya 在的时候有可能可以。但后来一方面我也不知道因为什么原因,他好像失去了做决策的能力,然后离开了。
张小珺
其他公司呢?
姚舜宇
其他公司我觉得都比较难,Google DeepMind 也比较难。但我觉得 Google DeepMind 是另外一套打法,不太一样。
大公司和 startup 的打法本来就不一样,因为 startup 重要的是 make a bet,就是我得赌一件事。