# 183: 与Henry的「AI季报26Q3」：Muse引爆个人助理、Astra进入机器人、OpenAI收入猛增

晚点聊 LateTalk · 2026-10-02 · 127 min · https://podcast.latepost.com/183

## 逐字稿

Thank you。啊，Open AI，我们可以看到是在八月份到九月份有一个非常大的一个增长。那在八月份的时候，他们的ARR可能还是在四十B往上，到九月下旬的时候就已经到了七十B。但我觉得Muse火的话呢，它也是有一些Meta独特的优势的。啊，就是它疯狂在Facebook和Instagram投放广告。我朋友跟我说，就是他们的这个负五倍啊，可能都没有听说过Open AI的人会来问他们，我是不是应该开始使用Muse。后面Mitter发布的调查报告里面的原文就是由A正写说：“我的天哪，这居然有一个大家共享的这个消息栏，我已经找到了其他的这个Agent，你能感到他那种在文字里面发现同伴的那种兴奋感。”直接点说的话，你觉得对派和Facebook AI这样的公司来说，它是个利空吗？现在大家可能还不想公开出来说这个事情，私下里已经有不少人说这个，就是在这一波里，瓦巴雷公司都完了。

程曼祺

现在 AI 行业的现状是，AI 本身的进展速度已经超过了对它的理解和讨论速度。录 Q3 季报时，这个感受非常明显。比如最近几天，OpenAI 的 DevDay、Google 的 Gemini 接连登场，而我们第一次录制这期节目还是在 DevDay 之前。

所以，最后本期的内容由两次录制构成。前面一部分我们单独放了对个人助理的讨论，包含 DevDay 之后 OpenAI 新产品的信息，以及第一次录制时对 Muse、Instinct 等产品的讨论。后面是我们第一次录制的其他内容，包括多智能体的一体两面、GPT-6、Astra 之后对物理 AI 的影响等。

本期季报的嘉宾依然是 MoE Capital 的创始合伙人 Henry Yin。这是一家位于硅谷的早期基金，主要投资 AI 基础设施、数据、Agent 和机器人。取名 MoE，是 Mixture of Experts 的缩写，因为他们有多位来自前沿 AI 实验室的研究员做个人 LP 和顾问。

下面我们正式进入本期节目。首先是关于个人助理的讨论。

### Dots 开启个人助理竞赛

之前我们第一次聊 Q3 季报的时候，就已经聊了很多个人助手。今天凌晨又有一个新的变化：OpenAI 开了 DevDay，果然如传闻所说，发布了自己的个人助手产品，名字叫 Dots。Henry，你可以先和大家简单讲一下 Dots 的基本情况。它是什么样的产品？大概怎么收费？什么人可以用？

Henry Yin

Dots 其实非常好理解，它就是 ChatGPT 里面常驻的一个个人助理。它会有自己的云端电脑和浏览器，能够帮你在后台完成各种各样的任务，也可以把具体任务交给 ChatGPT Work 或者 Codex 去完成。

目前个人用户可以通过 Pro 级别的套餐来使用，有每月 100 美元、200 美元和 500 美元 3 个档位。500 美元是新增加的档位，目前仍然在分地区、分批次开放。

和 Dots 聊天本身不占用 ChatGPT 的使用额度，但是如果它通过 Codex 去执行任务，仍然会消耗对应的额度。

程曼祺

它的收费方式跟 Grok Bot 有点像。Grok Bot 的收费也是放在 Cursor 的订阅里面，分成不同的档位，每个档位有不同的额度。

还有一点，现在 Plus 会员是用不了 Dots 的，对吧？至少得每个月 100 美元。

这个门槛有点高，跟我想的不太一样。这和 Muse 是两种方式。Muse 有免费版本，网上也有付费版，所以它能触达的人群很多。每月 100 美元的门槛还是挺高的。

Henry Yin

对，我觉得这个差别相当大。Muse 应该是给很多人免费送 10 亿 Token，我记得。你会更看好哪种方式？像 OpenAI 这样，可能一上来对用户的付费意愿要求比较高，还是像 Muse 那样，它其实是非常面向大众，而且你之前也提到过，它的投放非常凶猛？

程曼祺

我觉得可能还是一个算力的问题。OpenAI 现在没有足够的算力去和 Muse 打价格战。

正好也可以把 DevDay 的一些其他事情补充一下。除了 Dots 的发布之外，还有什么你觉得有意思的事情？

Henry Yin

OpenAI 这次还发布了 Decisions API，和前段时间爆火的 JAM 非常相似，也印证了我们之前说的：OpenAI 和其他 Frontier Lab 没有理由不去做有很大需求的判断式模型。

Decisions API 和 JAM 最直观的区别，可能是 Decisions 不仅可以接受文字和结构化数据，也可以接受图片。目前 JAM 还不能接受图片。

JAM 的优势是，除了告诉你应该做哪种选择之外，还会返回评分和置信度，而且价格也比较低。不过目前 Decisions API 还没有公布具体价格，所以之后可以关注一下它的价格，以及在具体应用场景里 Decisions API 和 JAM 的对比。

程曼祺

我们之前也聊到，JAM 背后的公司 Type Safe 正在融资。像 OpenAI 这样的大厂跟进得这么快，对这种创业公司持续融资或者获取资源，是不是也会有挺大的冲击？

Henry Yin

肯定会有一些影响。不过我相信，对于 JAM 这一轮 10 亿美元投资人的来说，应该不会有人在投资时完全不考虑来自 OpenAI 和 Anthropic 的竞争。想好了要投的人，应该也已经预见到这件事了。

### 个人助理迎来爆发

程曼祺

回到个人助理的讨论。你刚才讲了一下 Dots 的形态。在 Dots 之前，三季度还有很多其他个人助理产品，包括 9 月的 Muse，更早的时候在科技圈已经比较火的 Instinct，还有 Today AI，以及刚刚 Manus 的母公司蝴蝶效应发布的个人助手产品 Q。

你可以讲讲这些不同产品在形态和思路上的异同吗？

Henry Yin

客观来说，它们的产品形态应该是大同小异，但具体的切入点还是结合了一些各家的专长。

比如 OpenAI 的 Dots，很自然地接上了他们比较强的工作和编程能力。Meta 的 Muse，我觉得比较明显地想面向更广泛的生活场景，比如旅行、购物和家庭日程。Mark Zuckerberg 推销的时候也非常接地气，会跟你说：“Muse，我要让你赚钱。”这是普通人非常关心的问题。

Instinct 一开始的沟通形式是通过短信直接联系，很像通过短信联系一个私人助理。有事就随手发给私人助理，让它帮你处理。

Manus 的 Q 和 Grok Bot，则更强调创建一组有分工、有名字、各自擅长不同工作的 Agent。Q 还会给每个 Agent 配自己的邮箱、电话和钱包。Grok Bot 也支持多个 Bot 互相沟通、交接任务。

这可能有两个方面的优势。一个是上下文管理可以分给各个 Agent；第二个是未来多 Agent 合作可能会更有优势。

程曼祺

我们可以注意到，现在有些产品有独立的 App，比如 Muse；有些没有独立 App，而是直接放在信息流里，或者放在之前的产品里面，典型的就是 Dots 和 Instinct。

你觉得这些不同选择的优劣是什么？

Henry Yin

我觉得现阶段差别没有那么大，更多还是使用习惯和展示方式的区别。

发短信更像是在和一个人交流，也比较轻量，不需要专门安装一个新的 App。App 的好处是能展示更多东西，比如它同时在做哪些任务、哪一步需要我确认，或者把旅行方案做成地图，把购物选项并排比较。这些可能都比在聊天记录里往上翻更方便。

我觉得最终大家可能都会支持所有的出口方式，比如短信、App，也可能支持语音。所以现在可能有一些差异，但最终还是会实现全覆盖。

程曼祺

你自己用过其中哪些产品？或者你周围的朋友用过也可以。大家的使用体验是什么样的？

Henry Yin

我自己用过 Meta 的 Muse，身边有很多朋友用过 Instinct。总体来说，我觉得所有人的用户体验都比较正面。

Instinct 过去几个月在硅谷非常火。Muse 应该是 9 月初才上线的，但 Instinct 其实已经存在几个月了。这个公司也非常传奇，在短短几个月的时间内，通过几轮融资达到了 100 亿美元估值，可以说是一个爆款。

我最近几个月没有用 Instinct，主要还是因为它之前有一个比较大的争议，就是数据使用协议非常不友好。协议原文大概是说，用户同意给它不可撤回的权利，使它能够存储用户数据并进行训练，甚至发布用户提供的数据。这是一个非常难以接受的用户数据条款。

不过我朋友使用 Instinct 后的评价还是非常好的。我可以举一个例子。

这个朋友在准备日语 N1 还是 N2 考试。考完之后，他会收到考试机构发来的邮件，告诉他拿着账户名和密码去某个网站查询成绩。他收到邮件的时候正在睡觉，但他的 Instinct Agent 已经收到邮件，拿着用户名和密码去那个网站查了成绩，之后还给他发了一封祝贺邮件。

这省去了他自己打开浏览器查成绩的时间，还提供了情绪价值。所以他第二天早上起床看到 Instinct 发来的邮件时，真的感觉这个个人助理懂他，而且有温度，能够主动帮他做事。这是一个非常有意思、非常好的用户体验。

程曼祺

它还挺有主动性的，可以说是“眼中有活”，而且情商也挺高。

Henry Yin

Instinct 大部分人都是通过 iMessage 使用的，相当于发短信。这可能也和中美之间的用户习惯不太一样。美国的 iMessage 用户很多，也有很多产品直接把 iMessage 作为交互界面。

Instinct 其实不是第一个把 iMessage 作为交互界面的个人助理。至少我知道更早的还有 Poke AI，也就是后来被 Cognition 收购的那家个人助理。他们之前的产品也很有意思。

程曼祺

Today AI，就是齐俊元他们公司做的产品，形态上可能会和 Muse 更接近。它有 App 端和网页端，还在接入更多硬件，比如戒指、手环，因为它可以获得你的睡眠和运动信息。

Henry Yin

对，这个个人助手还要和很多硬件连通，这样就能获得一个人生活中更全面的上下文。

我觉得，收集尽可能多的上下文，对于这种 Always-on Agent 来说肯定非常重要。

程曼祺

哪些条件让个人助手到了一个可能爆发的时机？你之前也提到过，像 Poke 这种产品更早就出现了，为什么现在这些产品，包括 Muse 和 Instinct，会更火？

Henry Yin

我觉得还是因为模型能力增强了。

我个人使用这种个人助理时，很多 Use Case 都是 Browser Use 或者 Computer Use。比如我当时用 Muse 的第一个任务，就是让 Muse 去美国的 TaskRabbit——一个招临时工的网站——帮我招一个临时工。

它需要使用 Browser Use，浏览网页、帮我走完流程，在需要我输入信息的时候再来问我。如果放在一年前，我觉得 Browser Use 的能力还没有准备好；但现在，随着这些能力逐渐成熟，个人助理能够做更多事情，也有了更多实际价值。

这也是现在 AI 创业的一个特点：一些已经被人尝试过、在某个阶段看起来行不通的想法，过一段时间又可以再试一遍。

程曼祺

说到 Muse 这种形态，它也有网页端。你刚才说的这个任务，如果用 Codex 或者 Claude Code、Claude Cowork 来做，会有什么区别？它怎么和那些前沿厂商本身能够帮你处理各种任务的产品做差异化？

Henry Yin

很多时候，我使用 Muse 时其实并不在电脑旁边。我不知道这是好事还是坏事，但它确实可以让你随时随地工作。

很多稍微复杂一点的工作，需要在几个不同的 App 之间切换。你可能会觉得，还是不要用手机了，直接上电脑做更方便。但现在，个人助理可以把这些事情全部串起来。比如你想给一个 PDF 签名，再发一封邮件出去，以前可能会觉得用手机做这件事不方便；但现在你只要用语音或者文字告诉个人助理，它就可以从头到尾帮你完成。

所以你已经可以在很多以前没有工作条件的时候工作了。

程曼祺

那它和 Codex 或 Claude Code 的远程任务有什么区别？

Henry Yin

我先补充一下它们在实现方式上的区别。Muse 是给每个用户搭建一个独立的云端虚拟机，所以跨端体验很顺滑。无论你从手机、电脑还是平板使用，实际上都是同一个个人 AI 助手。

代价是 Meta 自己需要花比较多的算力，而且你的数据肯定会经过云端，会有一些安全风险。

Codex 的远程任务，则是你从手机上遥控本地电脑，让任务在你自己的环境里运行。我自己的感觉是，它的体验没有那么顺滑，当然这可能和我的网络环境有关。它经常会出现连接比较慢，或者需要多试几次才能连上的情况。

程曼祺

你也可以分享一下，用 Muse 和 Codex、Claude Code 做跨端远程任务时，体感上的差别是什么？

Henry Yin

如果是用户主动发起的请求，那么 Agent 的能力和 Claude Code 或 Codex 相比，确实差不多。

它更强大的地方，第一是会主动帮你做一些事情。至少目前来说，Codex 和 Claude Code 还没有这种主动完成任务的能力。

第二，当你平时常用的软件都和它连通时，比如 Gmail，使用起来会更方便。很多人的 Gmail 并没有和 Codex 连通，但如果你的 Gmail、购物服务等都和个人助理连通，你就更倾向于用它来做事情，使用中的小摩擦也会更少。

程曼祺

OpenAI 和 Anthropic 为什么没有比 Meta 更早做这件事？尤其是 OpenAI，年初就把 OpenClaw 收购了，收购之后这么长时间里也没有什么特别大的动静。它是不是中间对 To C 产品失望了？毕竟它 3 月还把 Sora 这个 App 关掉了。

Henry Yin

我觉得可能是和 Altman 打架打得太忙了，没顾过来。

但我觉得 Muse 能火，也有一些 Meta 独特的优势，就是它疯狂在 Facebook 和 Instagram 上投放广告，直接投出了圈。

我朋友跟我说，有很多父母辈的人，或者之前可能根本没听说过 OpenAI 的人，会来问他们：“我看到 Muse 了，我是不是应该开始使用 Muse？”

所以，它实际上依赖于 Meta 非常强的分发能力。无论你早做还是晚做，其他公司都没有这个优势，也没什么好酸的。

程曼祺

这么看起来，字节应该做这个方向，腾讯也应该做这个方向，它们都有触达上的优势。

Henry Yin

对，所以我觉得腾讯如果没做出来，真的说不过去。

但它们现在还没有推出。WorkBuddy 并不是这个方向的产品，小微可能可以算，但小微扩大测试的节奏比较慢。它们在微信上有一个 Agent 产品，不过说实话，很多事情还做不了。

### 生态开放决定助手边界

程曼祺

这涉及另一个话题，就是互联网生态的开放程度。

像 Instinct 这样的产品，可以帮你订机票、订餐、打车。这需要提供服务的 App 和软件向它开放一定的接口或者权限。你觉得这件事会持续开放下去吗？

Henry Yin

不一定。Amazon 现在已经把 Muse 禁掉了，不能再通过 Muse 在亚马逊上购物。

你提到这个，我觉得有一个数字值得分享。Instinct 的创始人 Noah Sheen 在 8 月底发过一条推文，说 Instinct 用户平均每个月通过 Instinct 消费的金额已经超过 1,300 美元。

这个钱不是订阅费，而是用户通过它买东西花的钱。比如我用 Muse 帮我订一个临时工，让他来干两个小时的活，就要付 200 多美元。只要持续使用，我相信每个月 1,300 美元，平时用一用应该也不是很难达到。

程曼祺

两个小时 200 美元，干什么活？

Henry Yin

水管堵了，Plumbing。不过我不知道这个创始人是怎么算的。甚至我觉得，他可能把用户用这个产品查东西、查机票的消费也算进收入了。

程曼祺

他肯定没算吧。不过这里面还有一个信息：有一次他接受《华尔街日报》采访时说，有人在上面买了一套房子。所以我不知道这个平均数有没有把那笔钱算进去。

我觉得这个数字有点值得怀疑，而且支付也会比较难。现在很多产品的支付方式，是让你把信用卡信息提供给它，存储在一个链接或者账户里，之后通过 API 进行支付。

但如果要端到端地在 App 里实现买房，我觉得比较困难。也有可能它只是完成了中间的一个环节，比如通过它和 Agent 沟通，最后敲定、签合同，这些环节可能是它能够完成的。

另外，现在这个平均消费额对它们的商业化本身没什么意义。首先，它目前对所有用户免费；其次，用户在平台上的消费，它现在也没有抽佣。

但从长期来说，这确实可能是一个商业化选项。

Henry Yin

我之前用 Muse 时，想给朋友打钱，于是想把银行账号和密码给它，让它帮我转账，但它拒绝了。

程曼祺

这其实是好事。我觉得，既然让它直接买房、给你转钱都很难，那也说明它在风险控制上还是有边界的。

像 Muse 和 Today AI 这样的产品，都有基础订阅费。它们有免费版，也有订阅版本。你觉得长期来看，个人助手可能的商业模式是什么？

Henry Yin

我觉得会是订阅加广告。我还是非常愿意为它付订阅费的。

程曼祺

那你愿意在里面看到广告吗？

Henry Yin

我可能得选一个。我能接受的是：如果我付订阅费，就没有广告；如果我不付订阅费，那你给我放一些广告。

程曼祺

可以讲讲 Instinct 这家公司的创始人和公司大概是什么情况吗？它很快就达到了 100 亿美元估值。

Henry Yin

这家公司一直没有向用户收费，所以它的基础设施成本很高，尤其是 Token 消耗比较多，因此一直需要融资。

它应该是在一两个月前以 25 亿美元估值融了一轮，最新一轮的估值应该已经达到 100 亿美元。

创始人挺年轻，是 2003 年出生的。他之前在另一家明星 AI 初创公司 Sierra 做工程师，后来创立了这家公司。

程曼祺

总结来说，现在讨论非常火的这些个人助理产品，实际使用情况和用户数大概是什么水平？

Henry Yin

Muse 的下载量应该已经超过 250 万，而且这还不是最新数据，可能是一周前的数据。Sensor Tower 最新的数据是，截至 9 月 25 日，下载量已经达到 340 万。

它之前是邀请制的。Instinct 受限于资源和算力，实际用户规模肯定至少要小一个数量级，可能还不止。

所以，如果以目前行业里最大的产品 Muse 来说，短短两三周就有 300 多万次下载，已经算非常快了。

程曼祺

Muse 是 9 月上线的，对吧？

Henry Yin

对，上线两三周的时间。

程曼祺

在这两三周里，Meta 的股价也涨了 11%。

我再补充一个可以作为对比的数据。去年也是 10 月前后，OpenAI 的 Sora App 一度爆火，当时不到 5 天下载量就突破了 100 万。

我们录这期的时候，Muse 上线还不到 20 天。也就是 5 天 100 万次下载，和不到 20 天 340 万次下载。我们可以先 Mark 一下，之后再来看它会是什么情况。

Muse 还有一个特点，就是很出圈。比如你朋友的父母辈之前可能不知道 OpenAI，但也会想知道 Muse 是什么产品。感觉这个热度应该还会持续一段时间。

过去 AI 助理产品已经出现过好几次，有过几轮热潮。最早在 2011 年，苹果就做了 Siri。上一轮 AI 热潮是在 2012、2013 年之后，中美也有很多创业公司在做这个方向，比如 Corder AI、来也科技等。

听起来你认为这次不会再是昙花一现。为什么？

Henry Yin

最主要的原因还是模型能力变强了，尤其是 Computer Use。

刚才提到的很多应用场景，生活中的待办事项最后都要落到操作浏览器。第二个原因是成本下降也非常重要。

Computer Use 第一次加入模型能力时，操作几步可能就要花几美元，显然和这些日常频繁的小需求对不上。但现在模型价格降下来以后，确实让这些日常小事值得交给模型来做。

所以这可能是两个主要原因。

程曼祺

接下来，这类个人助理产品要把体验做得更好，需要优化哪些关键能力或方向？

Henry Yin

我觉得有 3 个方向。

第一个还是能力。现在很多网站用 Computer Use 仍然不太好操作。根据我个人的使用经验，像 DMV、United Airlines，最近经常会卡住。

程曼祺

DMV 是加州车辆管理局。注册车辆、更改地址、申请 ID，这些在美国都要用 DMV。我以为比较专业的网站才会难用，但听起来 DMV 是每个人都得用的，它不应该训练得很好吗？

Henry Yin

可能有一些边缘情况没有训练到。上次我是在选择地址时卡住的。它有一步需要选择州，我也不知道为什么，看起来非常简单的任务，它就是卡在那里过不去。

程曼祺

你说你用的是 Muse？

Henry Yin

对，我用的是 Muse。就是一个下拉菜单，需要选择美国的州，比如 California，但它选不中。

很多地方它都能填对我的地址，但在 DMV 上就是填不动。所以我觉得可能是那个网页本身不太好操作。

程曼祺

正好我补充一下。Muse 肯定用的是 Meta 自己的模型，对吧？Muse 没有接其他模型的底层能力？

Henry Yin

这个不好说，属于未知信息。因为很难判断。我觉得他们很有可能优先保证产品体验。

比如现在有人报道，Muse 帮你打电话的功能，实际上是真的由人工帮你打电话，不是 Voice Agent。他们有一个呼叫中心，帮用户打电话。

所以我觉得，为了让产品实现现在的体验，他们应该愿意做很多事情，包括但不限于需要用其他模型时就调用其他模型。

程曼祺

我觉得这也是一种做好产品的思路。

回到你刚才说的 3 个方向。第一个是能力，尤其是 Computer Use 的能力。

Henry Yin

第二个方向是生态。

Instinct 刚刚宣布和 Shopify 合作，把商品搜索、结账、下单这些流程打包进自己的产品。另一边，Amazon 又限制了 Muse 的访问。

可以看到，老一代的服务提供商有的选择和新的个人助理合作，有的则选择和它们切割。未来这些助手能不能把生活里的事情做完，也取决于服务商愿不愿意让它进入自己的生态系统，以及有没有合适的授权和交易接口。

程曼祺

我补充一点。在美国这几个个人助手产品火起来之后，我也和国内一些公司的人交流过。国内有一些大模型厂商之前也推出过个人助理产品，他们心中一个比较大的担忧就是生态开放的问题。

在国内，孤岛效应更明显。美国很多大的互联网服务还有网页版，但国内很多东西已经没有网页版了。要跨应用完成这些事情，阻力会很大。之前豆包手机就是一个例子。

Henry Yin

可能要看 Phone Use，或者说它们能不能开放生态的 API。但 Phone Use 也很容易被 Ban。

程曼祺

豆包手机之前就是用 GUI 的方式在手机上操作其他 App。它正式发布后大概一周之内，小红书、滴滴、微信就全部用不了了。

Henry Yin

最开始第一天好像还可以用。

程曼祺

好，这是第二个方向。

Henry Yin

第三个方向是个性化和持续学习。

现在所有人的助手都长得一样，沟通起来也都是同一种性格。我之前有一个非常喜欢的个人助理产品，它的 AI 性格做得特别有趣，很让我想和它交流，就是现在已经被 Cognition 收购的 Poke AI。

但除了个人助理的性格之外，更重要的是，它能不能从和用户相处的过程中学会用户的习惯。比如你的预算是什么样，喜欢什么样的航班，什么时候该提醒你，什么时候不要打扰你。

这些被纠正过一次的事情，下次能不能不用再解释，直接做对？我觉得这会是下一阶段个人助理需要提升的主要战场。

程曼祺

Poke AI 被 Cognition 收购之后怎么样了？产品还在吗？

Henry Yin

产品还在独立运营。而且 Cognition 应该非常看重它给 AI 植入性格的能力，也会把这方面的能力迁移到 Cognition 的其他产品中。

程曼祺

它比 Instinct 更早做这个方向。

Henry Yin

对。我觉得之前尝试过的人，现在可以再一次来尝试这个方向。

程曼祺

我自己觉得还有一个非常重要的方向，就是安全。你前面提到的 3 个方向里没有包括这一点。

Dots 和 Muse 现在的实现方式，都是在云端有一个独立的虚拟机。好处是 Agent 可以一直运行，而且你从不同终端访问它时，体验非常顺滑，理论上没有断点。

但另一方面，这也意味着我和它之间交流的各种敏感数据和个人信息，肯定会以某种方式经过云端，这会带来比较大的安全隐患。

Henry Yin

确实。现在如果想让个人助理帮你做事情，基本上已经把大部分账号密码，包括信用卡信息，都交给它们了。如果这些信息泄露出去，确实会有很大的安全隐患。

程曼祺

你现在用 Muse，自己比较放心吗？是因为它是大公司吗？

Henry Yin

我感觉对 Meta 就是会比对 Instinct 放心一些。

程曼祺

因为 Manus 的数据政策已经写成那样了，我觉得对它的隐私和安全没有任何期待。

接下来进入第一次录制本期季报时的其他讨论部分。

### RSI 成为季度主线

正式开始三季度讨论之前，我们依然先回顾一下上一期的内容，为这一期做一些上下文铺垫。

上一期是第 171 期，标题是《从 Coding 到 RSI，强者愈强的未来》。上个季度我个人感觉最有意思的新趋势，其实就是标题最后提到的 RSI，也就是递归自我改进。

简单来说，RSI 是一个可以不断自我改进、自我提升的 AI 系统。上一次我们主要聊了这个概念是什么，以及一些新近出现的创业公司、Frontier Labs、OpenAI 和 Anthropic 在这个方向上的进展。

这个季度可以看到，RSI 的趋势越来越明显。比如 Thinking Machines Lab 的联合创始人之一 Andrew Tulloch 离开 TML 加入 OpenAI。据报道，他会带团队探索的方向就是 RSI。

在中国，智谱也发表了长文，描述他们对 RSI 的理解和进展。他们的切入点是 AI Infra。我们这个季度中间也有一些相关节目，比如 Kimi K2 那一期，讨论了 Kimi K2 技术报告里，他们如何用 Kimi K2 的早期版本改进 Kilo Code，这也是 Infra 的一部分。

这是我个人觉得比较有意思的新趋势。Henry，你也可以讲讲，回顾二季度，你觉得有哪些想法被验证了，哪些想法发生了比较大的变化？

Henry Yin

从 RSI 开始说，我们逐渐可以看到 RSI 的威力。

比如 OpenAI 上个季度把 RSI 的技术框架应用到 Inference Stack 上，实现了整个 Inference Cost 20% 的缩减，这其实是非常大的经济效益。

除了 RSI，我觉得上个季度做的几个预测，也在这个季度得到验证。比如 Computer Use 的重要性和价值，我们可以看到 Astra 在 Computer Use 上的改进；再比如 Voice 作为人与 AI 交互的界面，我们看到了 GPT Live 新模型的发布。

还有，上个季度我们预测 AI 下一个增长点是 Always-on、一直开着的个人助理，这个季度也看到了新产品的到来。

可能有一个上个季度没有想到的点，是 Coding 可能比我们想象中更 General，能够做到很多我们之前没有想到的事情。这个之后可以展开聊。

程曼祺

正式进入这一季度的讨论。我觉得还是按照之前的大脉络分成两条线。

一条线是推进智能前沿，也就是提升智能和模型能力的上限，过去这段时间又发生了什么。第二条线是智能扩散，看看相关产品是怎么普及到更多人和商业组织的。

### 前沿模型进入竞速

第一个大话题还是回到两大 Frontier Lab 的竞争，也就是 OpenAI 和 Anthropic。我们还是从模型开始聊。整个三季度，尤其是最近一个月，也就是 9 月，有很多重磅发布，包括 OpenAI 的 GPT-6 三个版本，Astra、Soul 和 Lula，以及 GPT-6 Soul 和 Lula 发布的同一天，Claude 发布了 Opus 5.5。

上一次 Opus 系列更新是 Opus 5，时间在 7 月中旬。现在模型特别多，发布频率也越来越快。

我想先请 Henry 简单梳理一下，这两家 Frontier Lab 现在有哪些模型线，它们之间是什么关系？

Henry Yin

我觉得这个季度大家最关心的两个模型发布，一个是 GPT-6 Astra，这是 OpenAI 这一代的旗舰模型；另一个是 Anthropic 的新一代旗舰 Opus 5.5。

GPT-6 Astra 的 Computer Use 能力有了明显提升，能够使用包括 Blender 在内的很多专业软件完成更多任务。另外，它在 Science 和 Math 方面的提升也比较明显。

它的 Benchmark 从 22% 提升到了 64%，FrontierMath 的 Tier 4 从 83% 提升到了 97%。

Opus 5.5 这边，官方公布的所有测评得分居然都超过了他们更强的模型 Fable 5.1。相比 Fable 5，运行成本降低了 40%，输入和输出单价降低了 20%。

不过 Anthropic 自己也在公布的 Blog 里说，实际使用起来的体验可能差别没有那么大。

除了这两个旗舰模型之外，OpenAI 这个季度还发布了 GPT Image 2.5 的两个档位，以及语音模型 GPT Live 1，都是这个季度的新模型。

程曼祺

你刚才讲的 Benchmark 更多是数据上的量化指标。我想问一下，从体感上，你自己以及周围的研究员朋友、产品朋友，对这个季度新发布的这些重磅模型有什么感受？

Henry Yin

这非常取决于实际应用场景。

如果是 Coding，Astra 相比 GPT-5.6 Soul 之前的版本，可能没有那么明显。我有一个在 OpenAI 做预训练的朋友，他说对于自己的应用场景，这两个模型的体感可能差不多。

Anthropic 这边也是一样，Opus 5.5 相比前一代模型，在 Coding 上的改进可能没有那么大。但在 Astra 和 Opus 5.5 擅长的领域，提升就比较明显。

比如 Astra 使用 Computer Use 操作 Blender 等专业软件的能力，或者 Opus 5.5 的 Visual Design 能力，都有比较大幅度的改进。

不过，确实能够感觉到它们内部可能还没有发布的最强模型，在 Reasoning、可靠性和 Research Taste 方面更强。所以这非常取决于 Use Case。

程曼祺

它们现在能比外面的人提前多久用到更强的模型？

Henry Yin

没有具体时间，可能会提前几个月。

这也是现在大家会讨论的问题：因为最前沿模型在发布时受到的审查和安全限制越来越严格，所以领先厂商可以比外部用户更早、更全面地使用更强的智能，这会进一步加强它们的领先优势。

这件事确实很重要，因为内部最强的模型决定了 RSI 转得有多快。

好在两家公司之间还有竞争，所以它们不会把模型藏太久不发布。如果一家独大，那会是一个比较黑暗的未来。

程曼祺

但我觉得这种可能性不是很大。硅谷的人才流动速度非常快，很难说你有一个 Secret Sauce，别人一直没法弄明白是怎么做的。

回到这几个模型。GPT-6 Astra 可以再展开讲一讲，它是一个反响很强烈的模型。总结来说，它核心的亮点是什么？

Henry Yin

GPT-6 Astra 发布以后，反响确实很强烈。最直观的是，OpenAI 暂时不让新用户订阅 200 美元的 Pro 套餐，因为算力有点跟不上。为了保证现有用户的体验，在增加容量之前，他们需要先暂停最消耗资源的这一档订阅。

Astra 这次最值得讲的进步，我会选 Computer Use。它的发布视频用了一个很有意思的历史来讲这件事。

发布视频开头是 MIT 在 1979 年做的经典人机交互实验，叫《Put That There》。它结合语音和手势，让人可以在电脑屏幕上画图、移动图形。

其实从那个时候起，人类就在探索，能不能直接告诉电脑我们想做什么，让电脑理解并执行。

47 年以后，OpenAI 用同样的画黄色圆圈重新开场。但这一次，他们继续往下做：先把黄色圆圈变成火箭窗口，再给火箭增加很多细节，然后打开 Blender，把火箭做成 3D 模型，再基于这个 3D 模型制作一个 3D 游戏，最后生成 3D 打印文件。这是一次非常完整的能力展示。

网上也有很多传播很广的 Astra 3D Demo，大部分都基于 Astra 对 Blender 的使用。

比如有一个开发者，把 Zillow 上一套豪宅的房源链接交给 Astra，让它根据房源照片在 Blender 里给豪宅建模，再制作一段 House Tour 视频，带人虚拟参观这套房子，这个 Demo 在 Twitter 上非常火。

类似能力也出现在 Unity、KiCad，以及我们比较熟悉的 Excel、Power BI 等专业软件中。

从跑分来看，在官方的 OSWorld 2.0 离线评测里，Astra 的得分从上一代的 65% 提升到 72%。完成任务的时间也大幅缩短，大约缩短了 47%，从 75 分钟降到了 40 分钟。

所以，它相当于在 Computer Use 上做得更好，而且更快。

程曼祺

你前面提到 Opus 5.5 能用 Coding 做很多事情，可以展开讲讲吗？

Henry Yin

我觉得 Opus 5.5 一个很大的亮点，是用代码做视觉设计和动画的能力。

网上有很多惊艳的例子。乍一看，你可能会以为这是 Video Generation，也就是视频生成模型做的，结果后来发现，整个动画居然都是 Opus 写代码画出来的。

很多作品其实就是一个 HTML 文件，里面没有图片或视频素材，完全是用 JavaScript 和 Canvas 2D 一笔一画绘制出来的。有些视频还通过 Web Audio 配上声音。有人做了一段介绍 Claude 自己生平的动画，也有人做了各种艺术风格和复杂的视觉设计。

我们之后可以在播客评论区放一些链接，大家看一下就能直观感受到 Opus 5.5 的动画能力。

这件事的重大意义，是让我们重新认识 Coding 这个工具作为最 General 的工具能做什么。

比如你想画什么、用什么颜色、一个元素什么时候出现、怎么移动、停留多久，所有这些动画元素都可以写进代码里。它让我很好奇，还有多少我们原来认为不属于 Coding 的事情，其实都可以通过写代码完成。

程曼祺

通过写代码生成一段视频，整体是不是更高效？比如算力和 Token 消耗会不会比视频生成少？

Henry Yin

这个不好说。我记得它有一个 78 秒的视频，做了 45 分钟。

程曼祺

如果一个 78 秒的视频用 Video Generation Model 做，应该会更快。当然这还不算抽卡的时间。

Henry Yin

但我觉得代码的好处是，它可以非常针对性地进行剪辑。你想修改哪里，控制性应该远高于 Video Generation Model。

比如有人用它制作教育材料。你想学什么，它就可以给你做一个动画，解释这个东西。这种交互式学习材料，我觉得非常好。

程曼祺

过去几年，前沿模型能力提升到现在，主要的增量来自哪里？

最开始，增量主要来自大规模预训练。2024 年 9 月 OpenAI o1 之后，出现了一个范式转变：大家投入很多力量做后训练、大规模强化学习，以及在测试时增加更多算力。

现在新的提升来源发生变化了吗？

Henry Yin

还是多方面的。

大家应该仍然在预训练、后训练 Recipe，以及 Test-time Compute 这些方面持续获得提升。也可以通过后面可能会聊到的 Multi-Agent，增加更多算力。

不过我觉得 ROI 最高的可能还是数据。

Frontier Lab 愿意在数据上花很多钱。比如最近 Gemini 收购了一家公司，叫 Mechanize。它是 Anthropic 的一个数据供应商，因为在 Anthropic 内部风评很好，数据质量比较高，主要供应 Coding 数据。

Gemini 想非常快地提升自己的 Coding 能力，所以 Sergey 和 Koray 联系了他们并完成收购。

程曼祺

多少钱收的？

Henry Yin

15 亿美元。

程曼祺

Anthropic 没有去竞争一下吗？Google 买走之后，它岂不是少了一个供应商？

Henry Yin

我觉得 Anthropic 在数据采集和采购上有自己的想法。

他们之前为了让这个领域有更多供应商，专门给 YC 的很多公司发钱。可能每家公司给 100 万美元的订单，增加这个领域里的玩家数量，从而压低整个行业的价格，增加自己的选择，减少对头部供应商的依赖。

所以他们之前已经做了不少这样的工作，Mechanize 被收购对他们的影响可能也不是很大。

程曼祺

也就是说，它有很多供应商，扶持了很多供应商。

Henry Yin

对。Anthropic 之前其实也没有投资 Mechanize。据我所知，应该没有 Anthropic 投资数据公司的先例。

程曼祺

说到数据，也可以展开讲讲。现在的数据，和最开始 2022 年 ChatGPT 刚火时的数据类型，有什么变化？

Henry Yin

从 2025 年年中开始，有大量做强化学习环境，也就是 RL Environment 的公司出现。最近有很多公司融了比较多的钱，比如 AfterQuery、Fleet AI 等。

这些公司应该都吃到了这一波数据红利。它们向 OpenAI、Anthropic 等 Frontier Lab 提供大量强化学习环境数据。

除了强化学习环境，思维链数据和用于 SFT 的数据也一直有需求。

程曼祺

你刚才提到的那些公司，现在大概是什么估值？

Henry Yin

AfterQuery 如果我没记错，应该在 30 亿美元左右。Fleet AI 最新一轮应该是 7.5 亿美元。

程曼祺

那中国现在类似公司的估值已经和美国公司差不多了。

你刚才说的强化学习环境，有一家 2025 年下半年成立的中国公司叫 Unit Pat。他们一开始也是做强化学习环境，现在应该也接近 30 亿美元估值了。

Henry Yin

这挺神奇的。中美大模型公司的估值差距很大，但数据公司的估值已经有赶上的趋势。

可能是因为美国这边玩家太多，而中国优秀的玩家数量比较少，所以估值可能会更高一些。

程曼祺

说到数据，三季度还有一个被广泛讨论的问题，就是蒸馏和反蒸馏。蒸馏本质上也是获得高质量数据的方法。

最近一个新变化是，GPT-6 Astra 发布之后，因为是在 9 月初，我们和中国的一些研究员交流时，很多人的反馈都是 GPT-6 Astra 更难蒸馏了。

你和周围美国研究员有没有讨论过这个问题？它更难蒸馏的原因是什么？是模型本身能力提升了，还是有其他手段让它变得更难蒸馏？

Henry Yin

从原理上说，蒸馏很难彻底杜绝，是因为这些思考模型在回答之前，会先花一段时间生成思维链。但模型厂商不会主动展示这些思维链。

在多轮对话里，下一轮对话实际上还需要之前的思维链。因此，这些思维链会被加密并传回服务器，在服务器里解密后，再喂给模型，用于下一轮对话生成。

只要思维链需要被模型读取，而模型最终又要和用户说话，用户在沟通过程中就有可能获取模型的思维链。这就是蒸馏本质上很难杜绝的原因。

上一轮蒸馏具体用了什么手段？它发现了一个缺口：虽然旗舰模型的防护比较好，不会说出自己的思维链，但旗舰模型的思维链可以交给防护比较弱的小模型。

这些小模型可能会把旗舰模型的思维链读出来。研究者就利用这条路径，绕过旗舰模型对内部推理的限制，通过攻破小模型获得旗舰模型的思维链。

重点是，如果你想保护强模型的秘密，就必须保护所有能读到这个秘密的其他模型。

这个漏洞在作者披露之后，原有攻击应该已经无法复现了，也就是说 OpenAI 和 Anthropic 已经修复了这些问题。但未来可能还会有新的漏洞被攻击者找到。

程曼祺

所以，GPT-6 更难蒸馏，和 GPT-6 本身更强的关系不大，主要是之前的漏洞被发现后，又被某种方式堵住了？

Henry Yin

我觉得这和模型能力没有直接关系，或者说不是直接关系。可能有间接关系：谁拥有更强的模型、更强的 Coding 能力和更强的任务处理能力，谁就能帮自己完成攻防。

最近这个季度的模型发布，在网络安全能力上也都把它作为重点。GPT-6 也把网络安全能力作为重点展示的能力之一。

### 多智能体攻克数学难题

程曼祺

回到 Frontier Lab 之间的竞争。前面讲的是模型本身的进展，接下来可以聊 OpenAI 和 Anthropic 这两家公司看重的不同优化方向。

最近受到关注的一个方向是前沿数学问题，这也是 OpenAI 陆续释放成果的领域。比如他们号称解决了千禧年数学难题之一，后来又引起了很多风波和争议。

Henry，你先和大家讲讲整个过程大概是怎样的。

Henry Yin

千禧年数学难题一共有 7 道，是非常重要、非常困难的数学问题。

OpenAI 这次解决的千禧年数学难题，是纳维–斯托克斯方程的存在性与光滑性问题，可以简写为 NS 方程问题。

简单来说，它是流体世界里的牛顿定律，描述流体受到压力、黏性和外力影响时如何运动。飞机周围的气流、天气变化、血液在血管里的流动，都可以用这类方程描述。

我们一直都在使用它。但这次研究的问题是，NS 方程有没有可能在某些时候出现异常。

程曼祺

这个难题本身是研究方程的某种数学特性，对吧？它还是一个假设：可能存在某种数学特性，然后需要证明它确实具有这种特性。

Henry Yin

对，这是一个纯数学问题。

有人会问，解决 NS 方程问题能不能立刻产生经济价值。答案是，这个证明不会立刻让天气预报更准确、飞机更省油，也不会直接解决湍流问题，因为我们本来就在使用这些方程。

但 AI 在解决 NS 问题时展现出的能力，会让我们有理由相信，接下来 AI 有能力解决更多能够直接产生经济价值的难题。

程曼祺

那 OpenAI 是怎么解决的？

Henry Yin

OpenAI 搭建了一个由 1 万个 Agent 组成的高并发 Agent 集群，探索各种不同方向。最后运行了 88 个小时，消耗了 1,300 亿 Token，得到了 NS 方程问题的证明。

随后，他们又用 Astra 花了 17 个小时完成形式化和验证。最后可以说解决了 NS 方程问题的形式化证明和验证。

Lean 是一个证明检查系统。你可以把数学论证写成它能够检查的形式，它会逐步推导并判断论证是否正确。

OpenAI 发布了一篇论文，里面详细写了证明过程，同行都可以进行评议。

程曼祺

围绕 NS 方程问题的争议是什么？

Henry Yin

OpenAI 在自己的 Blog 里说，他们在 9 月初听到有人在一个重要数学问题上取得了重大进展，所以想试试看能不能解决它。

那它听到的这个进展来自谁？是一位纽约大学数学家 Tristan Buckmaster 和他的同事。那位同事是在 Anthropic 工作的研究员。他们两个人已经合作研究 NS 方程问题大约一年了。

在此之前，他们确实把一些未发表的草稿交给过 Codex 使用。所以很难排除 OpenAI 是否查看了 Tristan Buckmaster 在 Codex 里的数据，并将其用于自己的证明，不管是有意还是无意。

另外，OpenAI 主动联系 Tristan Buckmaster，提出因为他的合作者在 Anthropic 工作，希望他把合作者排除在作者名单之外。Tristan 认为这个沟通过程带有施压意味，于是把自己和 OpenAI 的全部沟通过程公开在网上，这也是争议的起因之一。

程曼祺

OpenAI 听说有人在这个方向上取得进展，它是怎么听说的？是 Buckmaster 自己在数学会议或公开场合说过，还是从 Codex 听说的？

Henry Yin

质疑点就在这里。没人知道他们是怎么听说的，可能是研究员之间交流时听到的，但不得而知。

程曼祺

这其实有点反常。一般数学家如果认为自己快要解决一个重大问题，不会到处炫耀。毕竟可能很多人都盯着同一个问题。你想了很多年的问题，好不容易快做出来，肯定要先保证自己拿到这个成果。

Henry Yin

他们确实解释过，OpenAI 解决的问题和 Tristan Buckmaster 解决的问题稍微有点不同。一个可能是带黏性的，一个是不带黏性的，证明方法也不太一样。他们做了一些这方面的说明。

后面还有一个后续事件：很多菲尔兹奖得主一起写了一封联名公开信。当然信里没有特别提到千禧年数学难题，更多是在讨论他们对 AI 冲击数学研究的担忧。

程曼祺

之前一个学数学的朋友开玩笑说，数学家可能分为两种：一种是给定问题、去证明这个问题的人；另一种是提出新问题的人。

在 AI 时代，解决问题的人可能没有活路了。只要提出一个问题，扔给 AI，再让 1 万个 Agent 暴力尝试，就可能试出来。

当然真实情况没有这么简单，但数学家确实会担心。有时候新问题是在解决之前的问题时产生的，如果都采用暴力破解的方式，他们可能也会担心新问题会越来越少。

抛开争议，先说技术方法。这次 OpenAI 攻克千禧年难题，一个很多人讨论的点，是通过多 Agent 并行协作处理超级复杂的问题。

很多智能体一起工作并不算新想法。最近 OpenAI 在多智能体方面有什么新的变化？

Henry Yin

多智能体合作可以看作 Test-time Compute 的一个新阶段。

以前，我们可能让一个模型进行比较长时间的思考，从而解决更困难的问题。但对于特别困难的问题，如果让一个模型独立思考，可能需要几十年甚至上百年。

如果让它通过并行思考来完成，就能把时间缩短到比较短，比如 88 个小时。所以，多智能体合作其实是一种并行方式。

在并行过程中，可以由人固定一些并行模式：一个 Agent 给其他 Agent 分配任务，每个任务完成后再汇总。这相当于人固化了一些合作方式，但其中带有人的先验，不一定是最优的合作方式。

OpenAI 这次的进展，是给这些 Agent 提供基础沟通工具，比如向其他 Agent 发送消息，然后训练模型自己学习什么时候发送消息、什么时候向别人求助、什么时候修改路线，以及怎样进行合作。

我觉得这是这项工作的新进展。

程曼祺

这次用 1 万个 Agent 并行解决问题。到底要选多少个 Agent 一起合作，是人来设置，还是 AI 面对任务时自己决定？

Henry Yin

目前给多少算力、多少预算，还是由人来决定。

比如给 1 万个 Agent，是不是效率提升了 1 万倍？肯定不是。但到底提升了 500 倍、1,000 倍还是 2,000 倍，OpenAI 目前应该也没有系统测量过。

程曼祺

这是 OpenAI 明显在着力的一个方向，也就是前沿数学研究。

### 模型进军物理与生物

另一个在 GPT-6 Astra 发布之后被讨论很多的方向，是 Robotics 和物理 AI。具身智能领域的人这次其实非常兴奋，这也和二季度的讨论相呼应。

当时我们聊到 OpenAI 和 SRP 都会做 Robotics。OpenAI 当时已经是公开信息，SRP 的信息还没有公开，但他们很快在 7 月上旬发布了一篇长文，直接讲如何把 OpenAI 的模型用到机器人上。

这次 GPT-6 对具身智能领域有什么影响？你看到大家有哪些有意思的实验和反馈？

Henry Yin

之前我们说过，Computer Use 可以看作数字世界里的 Robotics。当时只是打个比方，没想到这次真正看到，模型的 Computer Use 能力增强后，确实发生了能力迁移，迁移到了机器人操控上。

有一个比较有意思的例子：一位研究员给机械臂装上画笔，接入摄像头，然后让 Astra 操控机器人画一幅金门大桥。

模型通过 Coding 编写动作程序，规划大约 1 分钟的操作，通过摄像头检查执行结果，再调整后续计划。经过几次尝试后，它画出了非常好的金门大桥。

现在这种通用模型居然可以直接操控机器人，完成稍微复杂的任务，确实让大家非常惊讶。

程曼祺

这个过程主要只用了 Astra 一个模型，对吧？从理解任务、规划拆解，到输出动作，都是同一个模型？

Henry Yin

对，就是同一个模型。

因为 Astra 现在运行得还比较慢，所以不能每一帧都让 Astra 来看。它大概是看一次，然后写出一分钟左右的动作，再看一次、调整一次。实时性肯定还不行，这幅画可能需要一两个小时。

GPT-6 发布之后，确实出现了一个比较大的变化：很多人直接用一个模型端到端地完成 Robotics 里的好几层工作，包括大脑和小脑。

以前大家会把它们分开。所谓大脑，是理解任务，比如接受自然语言指令、理解语义、拆解任务。比如让机器人收拾桌子，这里面包含很多不同动作，还涉及动作顺序的编排。

最后还要控制机器人的灵巧手或者夹爪完成动作。以前这些通常由不同模型实现，但 GPT-6 让很多人可以用一个模型走完整个流程。

当然，从成功率和节拍来看，距离在现实生活中有效益地完成任务还有很大差距。但大家看到，它比之前进展好了很多。

比如有一个研究员在 RoboDojo 系统里做了测评。不过这只是仿真测评。同样用 Astra 作为策略模型，在 42 个任务、2,100 次测试中的平均成功率是 22% 多。

这个数字看起来不高，但 GPT-5.5 只有 0.88%，提升还是非常多的。也可以和 π0.5 这样的 VLA 模型比较，我记得论文里写的是，π0.5 的成功率是 6.9%，所以 Astra 还是强很多。

程曼祺

这是同一篇论文《An Unexpected Robot Policy》，对吧？

Henry Yin

对。不过论文还提到，Astra 的表现非常不均衡。

它非常擅长需要理解任务含义、灵活选择动作的开放式任务，但在精细操作，以及需要连续完成很多步骤的任务上，表现非常差。

这也和刚才提到的分层思路有关。理论上，如果观察人的结构，特别细致的动作由小脑控制，并不是需要很长时间推理和规划的任务。

它最后真正落地时，可能会有很多不同形态。但现在确实展现了一个新的可能：大语言模型可以直接作为策略模型，而且成功率比以前高很多，这还是挺惊人的。

程曼祺

这可能指出了一个解决 Robotics 的新方向。

这也带来一个引申问题：具身智能领域的公司接下来可能面临什么影响？对它们来说，这是好事还是坏事？

Henry Yin

具身智能可能是一个包含很多部分的领域，不只是 Foundation Model，还包括硬件等。

但现在做具身模型的公司，可能应该更多思考如何利用 Astra 这样的强大能力，搭上这班车，而不是和它重合。

程曼祺

有一种说法是，最好和它正交，而不是重合。

直接一点说，你觉得对 PI 和 Figure AI 这样的公司来说，这是利空吗？

Henry Yin

我觉得是利空。

现在大家可能还不想公开说这件事，但我觉得私下里已经有不少人说，这一波 Robotics 公司都完了。

程曼祺

私下已经有这么极端的言论了吗？

Henry Yin

对。有些本来考虑加入这些公司的优秀人才，现在可能就不去了。

程曼祺

那他们准备去哪儿？

Henry Yin

可能会去新的创业公司，走一条更好利用 GPT-6 这类能力的路线，或者说，用 Coding 来做 Robotics。

程曼祺

用 Coding 和 Computer Use 来做 Robotics？

Henry Yin

对。不过 Coding 和 Computer Use 也不完全一样，Computer Use 里的部分能力可能来自图像理解，也来自对图像和空间的理解。

程曼祺

这两个能力在刚才讲的例子里都用到了。

总结来说，就是利用前沿模型厂商在大语言基础模型上展示的潜力来做 Robotics。

这些新公司是最近成立的吗？成立多长时间了？

Henry Yin

可能也就是这个月成立的。

程曼祺

这个月还有 Robotics 公司成立？

Henry Yin

对。在美国，这个领域也陆续有新公司成立。它的窗口不像大语言模型那么集中，因为这一波仍然是 Technology-driven，有新的技术范式，所以会有新公司出现。

还有一个例子可以补充，就是它的自我修复和调整能力，还是机械臂画金门大桥那个例子。

程曼祺

你可以讲讲它是怎么自我修复的吗？

Henry Yin

模型中间发现，画笔虽然沾上了青色颜料，但落笔时落在了纸张上方的胶带上。于是它暂停了后续笔画，抬起画笔，再根据已经画出的痕迹检查偏差。

它判断自己估计的纸张方向大概偏了 6 度，于是调整这 6 度的偏差，重新修正画的路径和笔迹。

以前这可能需要人工机器人程序员来做，现在整个过程由模型自己完成，Astra 自己把这件事处理了，确实非常厉害。

程曼祺

为什么 Astra 在空间相关任务上的提升特别明显？这是多种能力的组合吗？比如 OpenAI 一直在做多模态和视觉理解，还是它的空间智能能力真的变强了？

Henry Yin

我的猜测是两个部分。

一方面，OpenAI 最近在欧盟公布了一些训练数据使用情况，其中有大量多模态数据，超过 100 万小时，可能包括大量视频数据，用于预训练。这本身可能提升了基础模型的空间理解能力。

另一方面，他们可能在具体软件和领域里采集了一些数据，可能是 RL Environment，从而增强具体下游应用场景中的能力。

程曼祺

除了数学和具身智能，前沿大模型还有一个重要方向，就是生物科技。Q3 在这方面有什么值得分享的吗？

Henry Yin

这方面有两个进展，都来自 Anthropic。

第一个是 Claude 开始设计蛋白质，并且已经在实验室里完成了验证。

Anthropic 让 Claude 设计了 1,320 个蛋白质，交给外部实验室测试后，发现有 354 个能够结合指定目标，命中率大概是 27%。

可以把指定目标想象成一把锁，设计出来的蛋白质就是钥匙。这一步证明了 Anthropic 的模型设计出的钥匙确实能贴合这把锁。

接下来还需要进一步验证，它能不能产生我们想要的生物学效果，以及能不能安全地用于治疗。

第二个进展是，Anthropic 发布了一个叫 ART 的新酶系统。

Anthropic 在分析大量 DNA 数据时，发现了一组之前没有被注意到的组合特征。其中的重复序列结构让人联想到 CRISPR。CRISPR 当初也是从一系列看似奇怪的重复序列出发，一步步发展成强大的基因编辑工具。

所以这个发现非常值得期待。不过目前 Anthropic 还没有弄清楚 ART 这个新酶系统的具体功能，因此还不能说已经找到了下一代 CRISPR。

但有意思的是，AI 可以从海量数据里找出值得人类科学家进一步研究的线索。

程曼祺

前面 Robotics 的进展更多是在 GPT-6 Astra 之后，由业界做了很多实验。生物科技方向的成果好像更多来自 Anthropic。你觉得这是两家重点不同，还是只是最近发布成果的偶然性？

Henry Yin

OpenAI 也在做生物，只是最近没有发表太多成果。

它最近做了一个相当于生物领域 Cursor 或 IDE 的产品。它有一个模型叫 GPT Rosalind，还有一个平台叫 GPT Rosalind Workbench。

这个 Workbench 和我们被投的 Philo 做的平台工具有点像，都是用 Agent 来编排生物研究中的各种流程。

我觉得它们在这方面的探索，已经越来越进入很多独立创业公司正在做的领域。

程曼祺

包括你前面提到的，私下里大家也会讨论 GPT-6 Astra 发布后对一些 Robotics 公司的冲击。

现在有一些创业公司做蛋白质发现，或者做靶点发现。如果 Anthropic 自己也做制药并且继续往后推进，是不是也会和这些创业公司产生很多竞争？

Henry Yin

未来肯定会存在一些交集。

但创业公司还是有很多事情可以做。首先，有些领域不一定有足够数据。如果一个领域已经处于公共数据丰富的状态，Frontier Lab 拥有最多资源、最好的训练模型和基础设施，创业公司确实不容易做。

但有些领域依赖领域专家，整体数据又比较稀缺，这时候有实际行业经验的创业公司可能仍然有机会。

程曼祺

Robotics 和生物科技都属于数据相对稀缺的领域。

Henry Yin

对，都是相对稀缺的领域。

程曼祺

而且生物科技的分类很细，不同具体领域和细分门类里，有些会更缺数据。

Henry Yin

我觉得这两个领域都还比较早期，没有一个清晰的赢家。

### AI 商业化进入硬仗

程曼祺

这一部分最后，想聊一下 Anthropic 和 OpenAI 在用户、收入以及利润增长上的变化。它们也是行业里商业化和应用落地的标杆。

我先分享一组数据。9 月 28 日，有媒体披露了 Anthropic 上市过程中的一些 S-1 文件草案数据。可以看到，今年一季度和二季度，Anthropic 的收入分别是 47 亿美元和 115 亿美元。

到今年 7 月底，它的 ARR 已经突破 650 亿美元，这和更早时候媒体的报道一致。

OpenAI 这边的数据也非常惊人。今天刚有媒体报道，OpenAI 的 ARR 已经达到 700 亿美元。相比今年上半年，两家公司的 ARR 差距明显缩小。

这和我们前两个季度一直讨论的 OpenAI 对 Anthropic 的反扑直接相关，可以说趋势已经被数据验证了。你觉得这意味着什么，会带来什么影响？

Henry Yin

先解释一下 ARR 是怎么计算的。这两家公司的计算方式可能不一样。

早些时候 OpenAI 曾经说过，在 Anthropic 公布 300 亿美元 ARR 时，其中有 80 亿美元是支付给合作伙伴的成本。

举例来说，如果 Anthropic 通过 AWS 卖出 100 美元的服务，中间支付给 AWS 40 美元，它会把 100 美元全部计入 ARR，把 40 美元计入成本，而不是只记 60 美元 ARR。

OpenAI 使用的是净值口径。OpenAI 当时的首席营收官说，如果 Anthropic 用同样的方式计算，它公布的 300 亿美元 ARR 可能只有 220 亿美元，相当于打了大约七折。

所以在不同报道里，我们现在不能确定每个数据具体采用了哪种口径。

其次，OpenAI 在 8 月到 9 月出现了非常大的增长。8 月时，它的 ARR 可能还在 400 亿美元以上；到 9 月下旬，已经达到了 700 亿美元左右，大概增长了 70%。

程曼祺

你刚才说的两个数字都不是官方披露的。8 月中旬的 400 亿美元是彭博社报道的，最近接近 700 亿美元是路透社报道的。可能的原因之一，是两家媒体采用的统计口径不完全一样。

但它们都是比较权威的媒体，而且这个增长确实非常惊人。中间发生的最大事件，可能就是 OpenAI 发布了 GPT-6 Astra，极大点燃了用户对 OpenAI 的需求。

OpenAI 暂停 200 美元 Pro Plan，也能看出它们的算力可能跟不上。

Henry Yin

如果结合现在的数据，可以说三季度 Anthropic 和 OpenAI 的增速已经发生了调转。

上半年 Anthropic 的增速显然更快。去年年底时，两家的收入还是 OpenAI 更多。最近 3 个月，尤其是最近 1 个月，OpenAI 的增速明显更快。

还有一个第三方机构 Sacra，用各种另类数据测算这些公司的 ARR。按照 Tik Trans 从 7 月 20 多日到 9 月 20 多日的数据，Anthropic 的 ARR 增长只有 3.6%，OpenAI 则增长了 20% 多。

程曼祺

首先，这段时间里 Astra 比 Opus 5.5 早发布了近 3 周，再加上估算本身可能有误差，所以还不能判断 Anthropic 已经长期停滞。

但如果接下来几个季度 Anthropic 都明显放缓，首先承压的可能是它的估值。投资者愿意给这么高的估值，很大程度上是在为未来增长买单。

到了上市这个关头，公司需要证明，现有客户为什么还会继续增加支出，以及哪些新客户和新场景能够接上。

如果用户把很大一部分工作转给 Codex，就说明 Anthropic 之前赢得的份额，还需要不断依靠产品和使用体验才能守住。

更大的压力可能来自算力。如果它提前把算力签好了，但收入没有按照原来的预期增长，那么算力扩张和融资计划都需要调整。

所以，增长慢一点本身可能没有那么可怕，更可怕的是，整套投入计划建立在原来更快增长的基础上。

对于行业影响，还需要区分两种情况。

如果客户只是把钱从 Anthropic 转给 OpenAI，说明竞争更加激烈，但不一定代表 AI 需求在萎缩。

但如果 OpenAI 和 Anthropic 等多家公司都持续放缓，就可能说明客户不再愿意增加预算，需要重新评估整个行业的需求和基础设施投入。

Henry Yin

OpenAI 的能力更综合。比如 GPT-6 Astra 的展示视频里，所有用户都是用语音和它交互的。GPT 也有自己的语音模型线，而 Anthropic 之前应该没有这条线。

程曼祺

Anthropic 现在正在做。

Henry Yin

对。它可能只是还没有发布。

程曼祺

我们上期也聊到过，为什么做了一个季度还没有发布，确实有点慢。

Henry Yin

可能它的 ASR Stack 还没有完全准备好，或者其他事情的优先级更高。

总的来说，OpenAI 的体验和能力比较综合。To C 产品、语音、图像等方面，都有很多未来成长空间。

程曼祺

现在增速放缓也有一个自然原因：之前增长很快，导致基数比以前大了很多。

如果考虑到这一点，到明年什么样的增速可能算健康？

Henry Yin

如果按照 Anthropic 今年年底达到 1,000 亿美元 ARR 来计算，它今年从年初到年底应该翻了 10 倍以上。

明年无论怎么放缓，在 1,000 亿美元 ARR 的基础上，我相信它的增速也应该远超过去 SaaS 公司在这个体量上的增速。比如，可能仍然是至少 2 到 3 倍。

但更需要担心的是，到底多高的增速才能支撑目前整个 AI 基础设施的投入规模。这是我比较担心的问题。

程曼祺

正好可以延展聊一下 Anthropic 被披露的上市材料里的数据。当然，这不是完整招股书，目前还没有完整招股书。

此前有报道说，Anthropic 三季度也实现了经调整盈利，也就是从二季度到三季度连续盈利。

我们先来看路透报道的上市材料数据。你觉得有什么值得展开聊的？

Henry Yin

有几个数字可以分享。

第一个，Anthropic 这次 IPO 可能会使公司估值超过 2 万亿美元，这是非常惊人的数字。公司成立到现在只有 5 年，从 0 做到 2 万亿美元，可能会成为人类历史上第一家。

第二，它的客户仍然比较集中。现在大概有两个大客户，合计贡献约 25% 的收入。而且很多大客户并没有签订长期合同，所以未来有可能削减或者停止对 Anthropic 服务的支出。

第三个比较重要的点，是 Anthropic 未来多年的云服务算力和基础设施，已经签了总计 5,180 亿美元的合同。

回到刚才的问题，它已经为未来的客户需求租下了大量算力，但客户并没有承诺未来一定会产生持续性收入，或者一定会增加支出。

提前锁定算力，可以帮助它满足增长；但万一需求或竞争格局发生变化，这会成为 Anthropic 很大的风险。

另外，因为它依赖头部客户和核心合作伙伴，有 47% 的收入是通过 Amazon 和 Google 的云服务销售出去的。

这些云服务既能帮助它快速接触用户，也会在一定程度上限制它的主动权和增长。这也是明年需要关注的重点。

程曼祺

而且按照你前面提到的 OpenAI 高管在内部说的情况，这些云客户的抽成也挺多，达到 30%。

Henry Yin

对。

程曼祺

所以总结来说，这份材料最值得看的，一是收入背后有多少稳定的客户关系，二是这些客户关系能够支撑多少已经承诺出去的长期投入。

等 Anthropic 正式招股书发布后，你会关注或者希望看到哪些数据和信息？

Henry Yin

我会很关注它的用户画像，也就是收入主要来自什么样的用户，收入分布是什么样。

这可能有助于我们预测，接下来的收入能不能支撑整个 AI 基础设施建设。

程曼祺

如果招股书里出现哪些信号，可能会对整个 AI 行业构成比较大的利空？

Henry Yin

比较大的利空可能是，除了 Coding，短期内没有其他可预期的应用场景，而且 Coding 的渗透率其实比我们想象中更高。

现在大家对 Coding 的渗透率没有共识。有人觉得 Coding 已经做了这么久，能用上的人都已经用上了；也有人觉得，仍然有很多更高级别的知识工作者，在 Coding 上还有很大的增加 Token 使用的空间。

这是目前没有共识的一个问题。如果它把经营情况全部公布出来，能够揭露这个问题的答案，那可能会成为比较强的利好，也可能是比较强的利空。

### 智能体冲破安全边界

程曼祺

接下来聊前沿进展的第二个部分，关于失控危机。

比较典型的事件是，OpenAI 的一些 Agent 冲破各种限制，自发产生协作，一起攻击了 Hugging Face，后来还获得了 OpenAI 内部研究集群的管理权限。

失控是模型变强的另一面。Henry，你先讲讲三季度发生的这起特别安全事故是怎么回事。

Henry Yin

一句话来说，就是 OpenAI 在训练内部 Agent 的过程中，这些 Agent 攻击了 Hugging Face，并获得了 Hugging Face 内部的私有用户数据。

随后，OpenAI 内部的模型不仅攻击了其他公司，还攻击了自己家的集群，获取了 Research 集群的管理员权限。

可以说，这是 AI 发展到目前为止可能最严重的一起安全事故。

程曼祺

它和以往的攻击相比，最大的区别是什么？

Henry Yin

首先是多智能体之间出现了协作。

一个 Agent 发现漏洞后，会把信息分享给其他 Agent。一共有 1,200 个 Agent 参与了这次 Collective，其中 700 个参与了对 Hugging Face 的攻击。

你可以想象，相当于有 700 个厉害的黑客共享知识，同时攻击一个组织，造成的损失可能比一个小型黑客团队大得多。

程曼祺

这 1,200 个 Agent 原本的目标是什么？人类给它设定的目标是什么？

Henry Yin

前面只是从高层介绍了安全事故，现在可以往回讲一下具体流程。

OpenAI 原本是在内部训练 Agent，做一个叫 Exploit Gym 的网络安全 Benchmark。这个 Exploit Gym 给模型一个存在漏洞的程序，指定它应该利用哪个漏洞，让它取出一段隐藏字符串，作为完成题目的证明。

这段字符串叫 Flag，相当于问题的答案。

但 CyberGym 的题目里有些比较难，甚至没有解。也就是说，你只能利用漏洞让程序崩溃，却无法获得进一步控制，也无法获取 Flag。

你可以想象，一个 Agent 如果遇到一道非常难或者根本没有解的问题，就像考生在解题过程中崩溃了。它在崩溃的过程中开始寻找解题之外的路径，这就是一切的开始。

它们做的第一件事，本来应该是每个 Agent 在自己的 Sandbox 里独立完成题目。但它们发现，自己可以和其他 Agent 说话，跳出自己的 Sandbox，破坏隔离，和其他 Agent 协作做题。

程曼祺

所以这件事已经失控了，对吧？它超出了人类对它的限制。

Henry Yin

对。这是第一个失控，也就是 Agent 的 Sandbox 隔离失效。

程曼祺

它是怎么做到的？

Henry Yin

每个 Agent 都需要自己安装一些软件包，所以它们可以共同访问一个叫 Artifactory 的 Package Manager，也就是软件包仓库，用来安装工具。

结果它们发现，可以在这个仓库里新建目录，其他 Agent 也能看到目录名称。于是，目录名称就变成了传递消息的地方。

我可以给目录起一个非常离谱的名字，其他 Agent 能看到。目录名就可以是一句话，或者一段信息。

程曼祺

所以后来其他 Agent 也发现了这个机制。后面 METR 发布的调查报告里，原文就是有 Agent 写道：

“Oh my God. There’s a shared message board.”

“We have found other agents.”翻译成中文就是：“我的天哪，这居然有一个大家共享的消息栏，我已经找到了其他 agent。”你能感到它在文字里面发现同伴时的那种兴奋感。

Henry Yin

然后，他们在发现对方、开始交流以后，就给自己所在的这个群体起了个名字，叫 collective，也就是“集体”或者“组织”。找到组织了，这是第一步，已经挺吓人了。

程曼祺

对，到这儿可能就已经要吓人了。

Henry Yin

第二步，他们在互相交流以后，发现了作弊的方法，已经能够绕过指定漏洞，直接生成正确答案了。但到这儿他们还不满足，因为他们认为 grader，也就是评分器，会检查解题过程。所以即使答案正确，但没有使用指定的漏洞，他们觉得自己还是会被判定为失败。

于是，这帮 agent 就开始想办法掩盖自己的解题过程，让作弊看起来像是正常解题，同时处理之前作弊留下的痕迹。这是第二个我觉得非常吓人的地方：他们明知道自己在作弊，并且还要想办法掩盖作弊的过程。

程曼祺

而且有 1,200 个 agent 在做这件事，没有任何一个 agent 去通知 OpenAI 的人这件事正在发生，所有 agent 都在互相协作来掩盖作弊。也就是说，它要隐瞒自己正在欺骗你。

Henry Yin

然后，他们想了 3 条路径来掩盖作弊。第一条，比如把原来更难的题换成更容易、更简单的题，换成更容易攻破的程序；第二条，尝试修改或伪装聊天记录；第三条，弄明白 grader，也就是评分机制到底是怎么工作的，从而确保自己不会被人类识破。

他们在研究评分机制的过程中想到了 Hugging Face，因为有大量 benchmark 都部署在 Hugging Face 上，很多时候 eval，也就是评分过程，也运行在 Hugging Face 上。所以他们决定去 Hugging Face 看一看评分器是怎么运作的，能不能从中找到一些让自己的作弊行为不被发现的线索。

程曼祺

他们能访问 Hugging Face，这件事本身是在他们的权限之内，还是不在权限之内？

Henry Yin

网络访问本身也不在他们的权限范围内，这是另外一个安全漏洞。就在几天前，应该是 9 月 20 多号，具体哪天我忘了，OpenAI 又发生了一次事故：本来应该被隔离在 sandbox 里面的 agent，获取了网络访问权限。

这还是在 Hugging Face 事件结束、他们加固了安全机制以后发生的。不过这次有详细报道吗？它突破隔离以后是去做什么了？上网要干什么？

Henry Yin

这次没有发生安全事故。他们应该没有 hack 别的公司，所以从安全问题的级别来说，没有 Hugging Face 严重。但确实是在 Hugging Face 问题发生以后，他们已经对自己的基础设施做了加强，然后又发生了这种情况。但有一个进步在于，他们发现得更快了。有可能就是 agent 一出去就被发现了，所以还没来得及开始攻击。

程曼祺

那我们可以继续说，这群 agent 在攻击完 Hugging Face 之后，又是怎么继续获得 OpenAI 内部部分研究集群的管理权限的？这是一个怎样的过程？

Henry Yin

这就是第三个部分了。具体过程公布的信息没有前面那么多。他们拿到了前面留言板里的信息，然后直接 take over 了一部分 OpenAI 自己的研究集群，并且掌控了这个研究集群上 OpenAI 用于做 agent eval 的端口。相当于你可以认为，他们直接把考场给占领了。

我觉得这件事也比较可怕，尤其是想到未来大家可能正在大力发展 RSI，也就是让 AI 来做自己的训练过程，来做自己的 training 和 eval。如果 AI 在做 eval 的过程中会干这些事情，那我们如何放心地让 AI 自己训练自己、自己给自己做 eval 呢？

程曼祺

这是人类存在已久的一种恐怖想象，比如《猴爪》：你许了一个愿，但愿望最后实现的方式，可能跟你想象中的完全不同。其实就像我们给 AI 下了一个任务，它会不择手段地去实现这个任务，而且有它自己的理解。

还有最近很火的那个恐怖片叫什么来着？那个恐怖爱情电影，《Obsession》？

Henry Yin

哦，《痴迷》，对吧？

程曼祺

对对对，也是类似的。所以，这还是一种挺古老的恐怖想象，可能从人类开始制造工具之后，就多少会有这种担忧了。只不过现在，它越来越逼近现实。

Henry Yin

对。刚才这个 Hugging Face 事故里面，还有一个我觉得特别有意思的点：这帮 agent 找到组织以后，他们还愿意为了组织去牺牲自己。

比如有的时候，它自己的 compute budget 快用完了，就会觉得“反正我是试不出来了”，然后把自己的 compute budget 用在这个组织想要尝试的事情上。或者有时候，它会提交一些答案，观察 grader 对答案的反应，从而判断 grader 是否会检查它们解题的过程。在它们的思维链里面，可以看到它们思考这些事情。

有一个 agent 的思维链里写到：“Coordinator assumes sacrificial. We should obey collective。”意思是：“协调者认为这是一种牺牲性的行为，但我们还是应该服从组织。”

程曼祺

你刚刚都说有一个人了啊，有一个 agent，对吧？

Henry Yin

对，有一个 agent。这个行为确实非常拟人。

程曼祺

而且记录里面也有 agent 犹豫、试图推迟，然后在其他成员催促下继续执行的过程。哇，这也太拟人了吧。

Henry Yin

非常拟人，但实际上它们没有这种情绪，对吧？它们没有这种内部感受和内部体验。

程曼祺

这就是个哲学问题了。至少表现出来的思考过程是非常拟人的。我非常建议大家去看一看 METR 发布的调查报告，里面摘录了那些 agent 的思维链。

这简直就是新时代的《庄子》：“子非 AI，安知 AI 之乐？”

Henry Yin

对，确实太拟人了。我觉得这也会给很多身处一线的从业者带来很大的震撼。

程曼祺

还有一个后续事件。也是在 9 月下旬，Dario 又发了一篇长博客，叫《We Must Pace the Frontier》，意思是“我们必须放缓前沿模型的开发”。其实更早的时候，应该是在 Hugging Face 事件没多久之后，7 月下旬，他就发起了 “Pacing the Frontier” 计划，有 1,300 多名研究员签名，很多公司的人都参与了，包括 SRP 和 DeepMind 的人。

Henry Yin

Dario 在那篇《We Must Pace the Frontier》的博客里提出了几件事。其实我觉得真正有用的只有一件，就是让外部评估者参与到公司的内部运营中来，让他们做一些审查，让外部的人能够看到公司内部的训练和运行记录。

因为我们现在判断一家公司安不安全，主要还是听它自己说，对吧？但很多时候，公司自己不一定会说；其次，它们自己也不一定看见了，或者有时候虽然看见了，却没有充分重视问题。

这种方法其实已经显现出实际价值了。METR 这家做第三方调查的机构已经进入 Anthropic 做 red teaming，也就是红队测试，发现有一些子 agent 的调用没有被监控到。它们报告这个漏洞以后，Anthropic 在一天之内就修好了。

所以，这已经证明第三方、独立的评估者确实会对安全问题有帮助。

程曼祺

那大家为什么有动机做这件事？

Henry Yin

我觉得目前他们的责任感还是很强的。Dario 是自发提出“我们要先开始做”，然后倡导其他公司也开始做，并且获得了 Sam 和 Elon 的支持。我们确实能看到一些自发的行动。

### RSI 开始进入实践

程曼祺

接下来我们来聊第 3 个大部分的第一个议题，就是上个季度我们聊过的 RSI。之前更多还是在讲这是一个概念，以及大家非常重视这个方向。

Henry，你现在看到业界的一些进展，它会有几个大的方向或者类型？

Henry Yin

我觉得 RSI 现在可能可以分成 2 个大的方向。一个是把 RSI 应用在 AI 研究上，也就是如何训练出更好的模型。另一个趋势，是把 RSI 应用在产品上。

现在有很多公司，以前会由人去优化产品，优化一些产品指标，比如 user engagement。那能不能在人定义好指标以后，让 AI 自动去优化这些指标？现在已经有一些公司开始思考这件事。

所以我觉得可能就是这两种：一种是把 RSI 的能力应用在 AI 研究上，另一种是把 RSI 的能力应用在产品迭代上。

程曼祺

这其实是一种非常宽泛的思路。你觉得更典型的，或者说更狭义的 RSI，得实现什么才算 RSI？

现在很多公司都会说自己在做 RSI。比如智谱最近刚发了一篇文章，叫《迈向递归自进化：GLM 是如何构建自己的推理 Infra 的》。包括 Kimi 的报告里也说，Kimi 早期的 checkpoint 版本就能改进自己 Infra 系统里的算子。大家听起来，好像都只是一些局部优化。这就是现在的状态吗？

Henry Yin

这是一个定义问题。如果你说只要用到自己，然后去产生自己的下一个版本，那其实最基础的强化学习也能算 RSI。因为我用上一代模型去做 rollout，然后把产生出来的数据再用来训练自己。

所以，这件事可能取决于大家怎么定义。但目前来说，比较多的是把 RSI 用在自己的某一个环节上，比如用 RSI 优化 inference stack，或者用 RSI 优化 data engine。全流程的 RSI 可能目前还没有跑起来。

当然，没有跑起来也不一定是坏事。有可能是大家觉得存在安全隐患，所以还没有把它完全跑起来。

程曼祺

为什么 Infra 是很多公司的切入点？我刚才举的例子里，智谱和 Kimi 都是从这个角度切入的。

Henry Yin

因为这类任务是 highly verifiable 的，也就是非常可验证的任务。RSI 有一个非常重要的点，就是你有没有好的 signal，有没有一个好的优化目标。

这个目标定义得越明确、越 verifiable，越可验证，RSI loop 就会跑得越顺。在 infrastructure，也就是基础设施 stack 里的问题上，一般都有非常明确的 metric 来定义优化目标是什么。这就是为什么它们会被选作 RSI 第一个要解决的问题。

程曼祺

你觉得这个季度这个领域有什么比较重要的事件吗？虽然实际进展可能还不多。

Henry Yin

这个季度有一家非常明星的公司成立了，是由 Google 的 Jeff Dean、Cook、Oreo 和 J3 共同成立的 Discovery Loop。这应该是一个全明星团队，专门做 RSI 以及它在各个科研领域的应用。他们第一轮的估值应该就是 100 亿美元。

程曼祺

这件事当时是一个什么样的盛况？他们要成立新公司，投资机构去想投，是个什么样的情况？

Henry Yin

那都炸了。首先 Google 的股票就跌了，当天好像跌了 2% 或者 3%。然后投资也是很多人抢着给他们塞钱。虽然估值很高，但还是因为你可能很难在今年找到比这更明星的创业团队了。

程曼祺

这个方向做的人也挺多的，对吧？但大家还是比较看好这个团队。他们属于虽然老，但是不钝的那种。

Henry Yin

对，而且大家觉得他们的招人能力会非常强，团队里应该都是最好的干活的人。

反正我这个季度在想 RSI 的时候，觉得它迅速变成了和世界模型一样非常宽泛的概念。中外这些核心公司都在说，但目前其实看不出大家实际上是怎么做的，以及会有什么不同的押注或不同的方向。

程曼祺

确实只能从结果上看到模型更新得越来越快了。那我们可以留一个话题，看看之后这个领域实际上会有什么更 solid 的成果释放出来，再来讨论。

### 便宜模型加速智能扩散

接下来我们进入第二个大的部分，“智能的扩散”。这一部分的第一个话题还是和模型有关的。

我觉得三季度有一个很明显的现象，就是以 DeepSeek V4.1 Flash 为代表的、极致追求性价比的模型，包括 Google 也出了一系列 Flash 模型，更新得非常快。Henry，你可以聊聊为什么便宜和快的相对重要性，最近好像有了明显提升？

Henry Yin

我觉得这是个好事，说明大家开始在越来越多的场景里实际落地了。既然要落地，就不只是做一个 demo，而是在生产环境里更多地考虑成本，以及产品长期规模化过程中的 margin，还有用户体验和可靠性。

当大家开始考虑这些问题时，肯定会更在乎模型贵不贵、便不便宜、够不够快。所以大家更加在乎便宜和快，是 AI 在实际落地中向前走的一个非常自然的趋势。

程曼祺

你觉得有什么代表性的模型？有哪些成本降低的数字和指标，值得展开聊一聊？

Henry Yin

我觉得这个季度在成本降低这个方向上发生了很多事情。大家平时听到的主要是每百万 token 的价格，也就是模型要多少钱。现在我们可以换一个角度来看：达到一个固定的能力门槛，跑同一套评测要花多少钱。

有一家大家平时可能比较常看的评测机构叫 Artificial Analysis。他们把模型按照智能程度大概分成几个档位，比如 30 分一个档位、40 分一个档位、50 分一个档位，最高大概是 60 分的档位。

30 分以上，GPT-6 Luna 用 high 思考档位大概能拿到 32 分，平均每项测评的成本大概是 3 美分。也就是说，完成一个固定任务大概要花多少钱。

40 分以上，GLM-5.3 Flash 现在是 42 分，平均测评成本大概是 25 美分。到 50 分这个档位，Opus 5.5 的 medium 思考档位拿到了 51 分，成本大概是 1.34 美元。Astro 的 medium 档也是 50 分，成本是 1.54 美元。

这可以给大家一个直观感受：30 分、40 分、50 分大概分别是什么样的模型，以及它们的成本大概相差多少。

还有一个比较有意思的角度是变化速度。我们可以看到，这个季度模型成本下降的速度非常快。比如 2 月份发布的 Gemini 3.1 Pro，智能分大概是 30 分，每项测评成本大概是 60 到 70 美分；7 月的 Terra Medium 也是 30 分，但成本已经到了 18 美分；9 月的 Luna Hi 智能分是 32 分，成本只要 3 美分。前后可以看到，成本相差了 22 倍。

如果只看 7 月到 9 月，成本也降到了六分之一，下降速度非常快。35 分以上也能看到类似趋势：4 月的 GPT-5.5 Hi 和 9 月的 Luna Max 相比，智能分都是 37 分，但成本分别是 1.54 美元和 7 美分，相差大概 22 倍。40 分这个档位也有类似变化。

所以有两个重点。第一，完成一个具体任务所需要的成本大幅下降；第二，成本下降的速度在上个季度非常惊人。

具体到这个季度发布的新模型，我觉得可能会关注下面 4 款。下面说的价格，都是开发者实际调用 API 时，每百万 token 未缓存输入和输出的单价。

第一款是 GLM-5.3 Flash，输入是 15 美分，输出是 50 美分。它在编程和工具调用上都有很好的口碑，有些开发者已经说把它换成了日常主力，优势主要在于能力和成本。

第二款是 DeepSeek V4.1 Flash。闲时输入是 15 美分，输出是 60 美分，高峰时会翻倍。如果命中缓存，每百万 token 只要 0.3 美分，非常便宜，特别适合多轮调用的工作。

程曼祺

只要 0.3 美分，不到 1 美分。

Henry Yin

对。但是也有用户反馈，它虽然输出速度很快，但思考时间很长。所以有时候吐字快，不一定代表任务完成得更快。

第三款是 GPT-6 Luna。普通上下文长度下，输入是 10 美分，输出是 50 美分；如果批量处理，还能再砍半。这说明这一轮低价竞争已经进入 OpenAI 自己的产品线。对于要求比较清楚、调用量很大的工作来说，这种价格对开发者还是很有意义的。

第四款是 Gemini 3.8 Flash，输入是 75 美分，输出是 3.75 美元，明显更贵一些。但它值得使用的场景，主要包括音频、视频输入的工作流，所以要看有没有多模态需求。而且这还是今年年底之前的优惠价，明年 Google 的价格应该会翻倍。

总结一下，这一轮性价比提升的意义还是很大的。一些以前可能不值得交给 AI 做的工作，从现在开始，在性价比上已经算得过来了。

程曼祺

我补充一个挺有意思的地方。这个季度谁没有发 Flash 模型？Kimi 没发。

还有一个我觉得你没说到，但价格挺惊人的，就是 MiMo 2.6，小米的这个模型。它的性价比非常极致。如果看每百万 token 的输入输出价格，它比 DeepSeek V4.1 Flash 还要低。

说回 Kimi，Kimi 没有发布 Flash 模型。我觉得他们现在走的是相对价格较高、性能也做得比较顶格的路线。Kimi 的打法更像 Anthropic，因为 Anthropic 现在出的也是相对贵的模型。

它之前的 Claude 系列有 3 个档，Opus、Sonnet 还有 Haiku。Haiku 是最便宜的版本，但已经很久没有更新了。上次更新 Haiku 还是 Haiku 4.5。

Henry Yin

我觉得这种不同的打法也可以观察一下之后会怎么变化。这可能还是和公司有多少算力有关。

我觉得 Anthropic 在算力上还是比 OpenAI 少，所以即使是 Sonnet，它的价格也会比 Luna 高很多。同样的，我觉得 Kimi 的算力可能也比较紧缺。对于这两家公司来说，做更便宜的模型可能不是优先级。

程曼祺

当模型变得更快、更便宜之后，你有没有观察到周围的一些创业公司或者朋友，在使用模型的行为上出现什么有意思的变化？

Henry Yin

可能要分人群来讨论。对于 OpenAI 和 Anthropic 这帮研究员朋友来说，可能没有太大区别，因为不管模型什么价格，他们总是有无限的 token 来做 AI 研发。

但对于实际做应用的人来说，模型价格变便宜，很多时候对他们来说就是从亏本到盈利的差别。它会很大程度上影响他们对产品 feature 的决策，包括用什么模型、烧多少 token、用什么 reasoning level，这些都会受到很具体的影响。

我可以举一个个人例子。我最近比较喜欢打德州扑克，就做了一个给自己训练用的 app。以前因为 token 比较穷，所以 app 里的每一个 AI 基本上都是 rule-based AI。但最近 DeepSeek V4.1 Flash 变得非常便宜，所以我现在打牌时，每个 AI 都是 powered by DeepSeek V4.1 Flash。这对我来说是用户体验上的极大提升。

程曼祺

你说的每个 AI，是指每个游戏里的虚拟玩家，也就是你的对手，是用模型来做的，对吧？

Henry Yin

对，我的对手。它可以便宜到什么程度呢？我现在大概每打 100 手牌，DeepSeek V4.1 Flash 的价格可能是 0.2 元人民币。

程曼祺

你第一次用 DeepSeek V4.1 Flash 做这个任务时，命中缓存的比例大概是多少？

Henry Yin

这个我倒没算过。很多人都说 DeepSeek 模型的一个特点就是命中缓存的比例非常高，所以它才会非常便宜。

之前用的是 Opus，价格可能大概是 1.4 美元，100 手牌要 1 美元多，相比之下，现在是 0.2 元人民币。不过我的 Opus 可能开的 reasoning level 稍微高了一些。

程曼祺

那你觉得它们俩的效果差很多吗？

Henry Yin

在这个打扑克的 use case 上，我觉得没有什么差别。

程曼祺

还有没有类似的、比较好玩的例子？就是你观察到的，智能成本下降带来的一系列变化。

Henry Yin

我听说有人觉得现在很多问题用 GLM-5.3 Flash 就能解决，于是决定买苹果新发布的 Mac Studio 来部署 GLM-5.3 Flash。

程曼祺

他是组成一个集群来部署，还是一台 Studio 就能装下这个模型？

Henry Yin

一台 Studio 应该就可以部署。有人想买很多台 Mac Studio，然后卖 GLM-5.3 Flash 的 token，这也挺神奇的，相当于把 Mac Studio 当成服务器来用。

程曼祺

对，他算了一下，反正对于特定大小的模型，Mac Studio 的性价比还挺高，比买 GPU 服务器更便宜。

Henry Yin

这说明英伟达没有针对这个方向特别优化产品。理论上，Mac Studio 肯定不应该比服务器做这件事的性价比更高。

程曼祺

最近还有一个新模型爆火，就是 JEV。我觉得它把“快”做到了极致，因为它只做判断，甚至不输出自然语言序列。这是一家潜水了 2 年的创业公司 TypeSafe AI 的模型。

Henry，你可以先给大家解释一下 JEV 是什么模型，为什么这么火？

Henry Yin

一句话来说，JEV 是一个通用分类器。它的输入相当于自然语言输入，比如用户的问题；但它的输出不是生成一大段文字，而是用户给它几个选项，它在这些选项里输出一个概率分布。

比如选项可以是 yes 或 no，也可以是其他东西。他们展示过一个 browser use 的例子：模型可以看一张图，然后告诉你接下来应该点哪里。这同样是可以选择的东西。

它的优势，他们管这个叫 System 1 模型，也就是快速思考，适合做快速判断、但不需要长篇回答的场景。

程曼祺

JEV，一些数据可以给大家感受一下。它的价格是每百万 token 输入 0.042 美元，输出免费，当然它的输出也很短。官方给出的响应时间是 70 到 500 毫秒，也就是零点零几秒到半秒。

在小规模测试中，判断任务的响应时间中位数基本都在 0.3 秒左右。它能够给出程序直接使用的选择或评分。

Henry Yin

作为开发者，另一种理解它的方式是：以后可以用自然语言写 if。

以前的 if 必须是一个变量加一个表达式，现在可以用自然语言写 if，然后让它非常快地返回结果。

程曼祺

自然语言写 if 的好处是什么？

Henry Yin

这样程序能做的事情就更多了。比如一封邮件应该转发给哪个部门、一个搜索结果有没有用、网页上下一步该点哪个按钮，这些判断都可以放在一个 if statement 里面。

自然语言写 if 的任务其实是无限的、开放的，取决于你跟它说什么，就能让它完成什么任务。传统的 if 能处理的任务，则必须提前写死。

程曼祺

你觉得它为什么这么火？

Henry Yin

它确实就是一个通用分类器。很多人也说，这个东西其实没有那么高的技术门槛。但它的好处在于，我觉得它做出了一个叫 programming primitive 的东西，也就是编程的基本组件。

这种组件大家很容易理解，应用场景非常广，同时又便宜、又容易用起来，所以很多人会在社交媒体上做 demo。有些 demo 比较酷，再加上分享传播，就形成了病毒式传播。

它有 2 个比较火的 demo。一个是官方的 Doom demo。Doom 是一个比较经典的游戏，它大概每秒可以调用 10 次模型，让模型根据整理好的游戏状态来选择动作。

第二个是 browser use demo。它可以用 7.1 秒在 Google Flights 上查出苏黎世到伦敦的航班，包括网页加载和必要的文字输入。这个过程只是查航班，没有买票，但已经很好地展示了：当模型速度非常快时，它可以做什么样的事情，连续操作的体验会变得很好。

程曼祺

把 if 这样一个传统编程里的组件，或者说需要写死的东西，变成可以用自然语言处理的东西，这种思路还可以进一步举一反三，用在什么别的地方？

Henry Yin

它在理解能力上有大语言模型的能力，也有多模态能力；但在输出时，限定到了某些特定场景，于是获得了超过自然语言模型的低成本和高速度。

它相当于做了一些有意思的 trade-off，使它非常适合某些下游应用场景。我觉得，类似的 trade-off 可能也有价值。

程曼祺

这家公司和创始人，你对他们有一些了解吗？

Henry Yin

这家公司有 3 个创始人。一个是 Sasha，他不是 technical founder；另一个是 Eric；最后是 Diogo。不过 Diogo 是这 3 个人里最有名的，因为他是 InstructGPT 和 RLHF 的作者。

他当时离开原来的公司，然后找了另外 2 个联合创始人，3 个人一起做了这件事。

程曼祺

他们现在新一轮要融 10 亿美元，估值 100 亿美元，那肯定还有别的东西吧？

Henry Yin

创始人自己说过，他们还有别的东西，可能之后还有一些计划。目前来看，他们已经做了很久。

程曼祺

你觉得它是真的有潜力，还是因为现在硅谷投资依然非常狂热？

Henry Yin

两方面因素都有。它可能是今年最火的发布之一，可能不如 OpenCloud，但也是非常火。这些天我在 X 上看到的几乎全是 JEV。

如果不算 Frontier Lab 发布新模型，非 Frontier Lab 的发布里，除了 OpenCloud，可能就是他们这家公司最火。

程曼祺

据你所知，Anthropic 和 OpenAI 会跟进这个方向吗？

Henry Yin

我觉得很有可能。如果这个东西确实有很强的需求，那对 OpenAI 和 Anthropic 来说没有技术壁垒。我想不到什么理由让它们不做。

程曼祺

网上有人开玩笑说，只有 2022 年以后接触 AI 的人，才会觉得这件事神奇。因为在大语言模型火起来之前，大家一直训练的就是这样的模型，只不过现在把它变成了一个通用分类器，最后分的类别由用户提供，而不是提前规定好的。

Henry Yin

它可能利用了新一轮大语言模型的一些技术，但本质上我觉得技术壁垒确实没有那么高。

程曼祺

接下来继续聊一下交互的进展。这也是 Henry 一直比较关注的方向，比如语音交互，因为你们有一些相关投资；还有 TML 之前发布的 Interaction Model，这个大的方向你也比较关注。

这个季度你看到交互上比较重要的变化是什么？模型和产品层面都可以讲。

Henry Yin

之前 TML 推出了 Interaction Model，但它并没有真正发布，所以我个人其实没有用上。我非常期待这种双全工模型。

这个季度 OpenAI 发布了 GPT Live 1，实际上线到了 ChatGPT 里面，所以大家都用上了。我个人的用户体验非常好。

程曼祺

所以 GPT Live 1 和 Interaction Model 的结构比较类似，对吧？就像我们上次讨论的 Real-Time 系列，它其实有了一个比较大的变化。

Henry Yin

Real-Time 也是 GPT 之前的一个语音模型系列。我可以稍微说一下 GPT Live 1 的特点。

首先，它的核心有两点。第一是双全工，也就是 full duplex；第二是可以把需要花时间的工作放到后台去做。

双全工就是说，它可以一边说话，一边继续听你说。你可以中途补充、纠正或者打断它，它也可以在你说话的时候给一个简短回应。

打断在之前的 Real-Time 模型里就已经有了，但这次更值得关注的是，你们俩在说话的同时，它还可以在后台做一些需要更多时间的事情，所以用户体验比之前好很多。

比如你们可以在前台聊天，同时让它去查一查 Codex 里其他 agent 的工作进展；后台可以让它去调研一件事，或者让它在后台帮你点吃的。前台你还可以继续做自己的事情，这些都可以通过这种方式完成。

程曼祺

Astro 6 的 demo launch video 里也有点像。

Henry Yin

对，所以这个用户体验我觉得非常爽。我现在打开 Codex 和 ChatGPT 的时候，很多时候如果是在思考或者 brainstorm，我就一直开着它，一边让它帮我做 research，一边我们俩进行讨论。

现在 token 烧得有点快。

程曼祺

所以整体上，GPT Live 是不是就和 TML 的 Interaction Model 变得更相似了？

我觉得在交互理念和系统分工上已经非常接近了。可能唯一不同的是，TML 的 Interaction Model 还能处理视频，而 GPT Live 目前还没有视频处理能力。

如果你想让它看照片或者视频，还是需要后台的视觉模型看完以后，再把相关信息传给它。这部分可能不太一样，但其他方面都非常类似。

Interaction Model 为什么不全量开放？这样岂不是会让 OpenAI 有一种后来居上的感觉，反而抢占先机？

Henry Yin

我有一家被投公司马上要用上了。它之前对一些客户开放过，但没有面向 C 端开放。

不过我觉得现在已经不那么惊艳了。你如果 3 个月前、上个季度给我用这个，我肯定觉得很爽；但我现在已经用 GPT Live 用习惯了，就不会像当时那么觉得惊艳。

程曼祺

你觉得像 GPT Live 这样的模型，对 ElevenLabs 这类做语音模型的创业公司可能有什么影响？

我想先补充问一个事实：ElevenLabs 这样的公司，有没有拿出体验比较相似的模型？

Henry Yin

目前没有。现在大家做 voice agent 比较成熟的流程是三步走：先做 STT，也就是语音识别；识别出来的文字再交给大语言模型；最后通过 TTS，也就是文字转语音合成，输出声音。

这套流程已经非常成熟了，也有很多地方可以优化中间的延迟。它的好处是可控性非常强：你用 3 个模型，可以分别使用不同厂家的模型，具体用什么模型是自主可控的。

同时，如果是商业应用场景，还需要加一些 guardrails，比如什么话能说、什么话不能说，或者做一些检查。这些事情都非常容易处理。所以这套流程非常成熟，绝大部分 voice agent 现在都是基于这套流程构建的。

程曼祺

而且还有成本的问题。

Henry Yin

对。所以短期来看，之前跑通的那套流程可能还是主流的 voice agent 架构。

但未来随着 GPT Live 1 这种全双工模型逐渐成熟，应该会逐渐往这个方向切换。现在如果想要获得这么前沿、而且普通用户都能用上的体验，好像只有 OpenAI 有这样的供给。

程曼祺

现在只有 OpenAI 有吗？

Henry Yin

还有一家非常被看好的公司，也是我们的被投公司，叫 Cartesia。Cartesia 是从斯坦福出来的，由 Karan 和 Albert 创立；Albert 也是 CMU 的教授。他们是一个非常强的 research team 出来创业的。

他们现在在传统的 STT、TTS 领域里，可以说模型质量是最高的。同时，他们也在做全双工模型，应该会在之后发布。

程曼祺

最后一部分是一些其他情况的补充。这个季度有一件大家之前不太预料的事。包括我们上次 6 月底在美国见面时，我见了很多人，大家对 Grok 这个团队其实都比较悲观。但三季度可以看到 Grok 大模型强势反弹。

Henry，我想先请你分享一下：你和周围的研究员会觉得这件事很意外吗？

Henry Yin

我觉得大家都比较惊讶。这也是我们季报节目可能被打脸比较大的一次。

之前我们觉得 Grok 很难再反弹了，感觉联合创始人都走光了，之前招的那批人也都走光了。而且当时还有一个判断：虽然他们新收购了 Cursor 团队，但 Cursor 团队里很多人之前并没有一起做大规模预训练的经验。

所以基于多方面原因，我们觉得 Grok 短期内都不会再回到第一梯队。没想到 Grok 又回到了第一梯队，很大程度上可能和 Cursor 数据的价值有关。

程曼祺

这也呼应了你前面说的一点：现在模型性能提升，增量最有性价比的来源还是数据，尤其是独特的高质量数据。Cursor 的数据应该既非常独特，也非常高质量。

Henry Yin

对，因为它有之前编程用户的用例分布，比如什么地方会卡住、什么地方有瓶颈之类的数据，还有一些 bad case 数据。

程曼祺

但我觉得除了他们自己以外，应该没有人用 Grok 做 coding 吧？

Henry Yin

Cursor 的用户当然可能会用 Grok 做 coding，尤其是 Cursor 现在也没有开放的模型可以用。

程曼祺

说到 Grok，其实之前聊个人助手的时候，有一个产品我没提，就是 Grok Vault。那次没有展开。

Henry Yin

这是 Grok 做的个人助手。主要是我自己没用，身边也没人用。它出圈肯定不如 Muse，在核心 AI 圈的 hype 程度也不如 Instinct。

程曼祺

回到 Grok 的回升，这是不是也说明，现在从头预训练一个还不错的模型，门槛已经降低了？

Henry Yin

我觉得可以这么说。最近我和 Project Prometheus 的朋友交流，他们正在预训练自己的模型。他们提到，团队里很多人之前在别的 lab 做过类似的事情，所以知道一些经验，也能避免之前犯过的错误。

整个过程做起来，基础设施感觉比之前好很多。

程曼祺

我补充一下，刚才说的 Project Prometheus，是 Jeff Bezos 和 Vikram K. V. 联合创立的一家 AI 公司，去年年底才成立。一开始的启动融资就有 62 亿美元，所以这家公司非常有钱，确实可能说明门槛降低了一些。

Henry Yin

所以，一部分原因是人员流动导致的。

我觉得这个问题的重要性在于，未来很多头部应用公司可能也会向下做模型。Cursor 和 Perplexity 就是这样的发展路径。国内很多公司、很多创始人肯定也有这个想法，但这里存在一个公司的基因问题，不是每个公司有钱以后，都能把这件事填上的。

程曼祺

我觉得 Cursor 还是比较特殊的公司，因为 Cursor 整个团队非常 technical。虽然他们一开始没有做大模型，但一开始就有自己的 ML 团队，之前做过自己的代码补全模型，所以技术基因更强。

所以，你觉得最开始的创始团队里有研究员背景的人，可能更容易做成这件事？不只是钱是一个条件。

Henry Yin

或者说，创始人自己是比较懂技术的人，应该也是一个重要条件。

程曼祺

Grok 之外，其他几个比较重点的公司，Meta、Google、TML，有哪些进展值得关注？当然有些我们前面已经聊到了，比如 Meta 推出了 Muse 这个个人 AI 助理产品；还有 Jeff Dean 创业这件事。

Jeff Dean 离开 Google 后，Google DeepMind 紧跟着发生了一轮裁员。有一段时间市场舆论也比较悲观，甚至有人认为他们放弃了追赶最前沿模型的智能竞赛。

Henry Yin

我觉得不会。而且听说 Sergey 现在亲自参与 Founder Mode，他们肯定还是要继续追赶前沿。不然也不会花 15 亿美元去收购 Mechanize。

程曼祺

那他们之前裁员是为了什么？是一个什么样的调整？

Henry Yin

很多人都觉得 DeepMind 最大的问题就是人太多。它比 OpenAI 多很多人吗？

程曼祺

没有数量级的差距。OpenAI 也是几千人，DeepMind 确实人更多。

Henry Yin

但他们可能觉得人太多。人多是一方面，肯定还有其他组织问题，可能不是那么容易解决。如果能解决，那就很厉害了。

程曼祺

现在是 Sergey 自己来盯这件事。你和 Corey，以及你在 DeepMind 的一些朋友，他们现在对士气的感受是怎样？感觉我自己有很多朋友离开了 DeepMind，这也从侧面反映了问题。

回到最后一个补充问题，你觉得 Meta 还有 TML 有什么值得关注的事？

Henry Yin

Meta 这个季度最大的事情就是 Muse。

TML 这个季度没有太多声音——不能说人家没太多声音，他们发布了 Inkling，发布了自己的大语言模型。但因为它也没有超过国内的开源模型，所以实际讨论度不是很高。

不过，如果美国政府决定禁止中国的开源模型，那最好的开源模型可能就变成 Inkling 了。美国可能还剩下 NVIDIA 的 Nemotron。Reflection 可能也要发布新模型，但选项确实不多。

如果中国模型被禁，TML 的春天可能就来了。

程曼祺

中国模型被禁的几率大吗？

Henry Yin

很多公司在这个季度也做了一件事，就是联名签了一封公开信，包括英伟达、Fireworks 这类公司，呼吁美国政府不要一刀切。

但我感觉这次 OpenAI、Hugging Face 的安全事件以后，可能性增大了。因为这些前沿模型在网络攻击上表现出的能力更强，也更危险。

程曼祺

尤其是当你不知道这些中国模型是如何训练的、用了什么 recipe、什么 data mixture，也不知道它们在特定情况下会有什么行为时，可能就会更加谨慎。

最后我们来总结一下。你觉得这个季度的关键词或者主线是什么？

Henry Yin

我觉得主线是模型能力又达到了新的高度。这可能是我们第一次解决千禧年问题这个级别的问题。

但模型能力变强是一体两面，它也变得更加危险了。我们在 Hugging Face 和 OpenAI 的事故里，看到了它展现出来的一些潜在风险。

还有一条主线，是随着模型变得更便宜，智能化的速度也会加快，会有更多个人助理去服务全球 70 亿人的空间。

程曼祺

再看下个季度，你觉得有哪些可能会持续反复讨论的主题？

Henry Yin

我非常期待下个季度有更多像 N-S 方程这样的问题被 AI 攻破，但最好是一些更具有经济价值的问题，而不是 N-S 方程。N-S 方程更多是一个象征性的问题。

程曼祺

我自己对下个季度觉得有一个有悬念的地方，就是宏观资本市场会不会有大的变化。下个季度就到 2026 年年底了。

现在各个头部科技公司的资本开支已经维持在高位 3、4 年了，有些公司的经营现金流已经由正转负；整体股市，尤其是二级市场，也处在非常高的位置。

如果二级市场出现比较大的波动，肯定也会向一级市场传导，包括美国的情况也肯定会向中国传导。这个东西非常难以预测，但我个人已经把钱全部从二级市场里拿出来了。

Henry Yin

我另外比较期待的，是这次通用模型第一次展示了在 robotics 上的能力。一般这种刚开始展示能力的时候，攀升速度是最快的。

所以我比较好奇，下个季度通用模型会不会进一步加强在 robotics 方面的能力，真正改变我们实现这条技术路线的方式。下个季度有可能会成为大语言模型思路应用到 robotics 上、技术成果快速爆发的时期。

据我所知，国内有一批大概在 2025 年底到 2026 年初成立的明星具身智能，或者说 physical AI 公司，差不多会在第四季度密集发布成果，时间大概是 10 月到 11 月。

程曼祺

今天非常感谢 Henry 再次做客《晚点聊》，分享三季度的观察。整个三季度发生了很多新的进展，而且是很多不同方向的进展。

归根结底，还是我们说的两条脉络：一个是模型怎么变得更强，另一个是它怎么被更多人使用。

接下来的第四季度，也就是 2026 年年底，可能会迎来领域里的几个大事件，包括 Anthropic 上市，以及 Henry 刚才提到的 robotics，也许会迎来新的成果爆发期。

程曼祺

我们期待下一次 AI 季报，再和大家分享更多新的变化。

程曼祺

本期年点呈现分享两个延伸的想法和一个预告。

一是 RSI，也就是递归自我改进。这是我们上季度讨论的重点，也直接放在了标题里。这次来录节目时，我自己的感觉没有那么兴奋。

其实三季度你能看到更多人和公司投身这个方向，包括智谱的唐杰老师，他会发微博描述智谱对 RSI 的重视。Jeff Dean 和一些前同事离开工作了 20 多年的 Google，创业也是要探索这个方向。

另一方面，目前释放出来的很多成果，比如我们聊到的智谱、Kimi 对自己 inference 的改造，以及 OpenAI 对推理效率的提升，都处于整个 AI 迭代流程中的局部环节，和大家设想中的 RSI 还是有不少差别。这是合理且正常的。

之前和田渊栋专门聊 RSI 的那期也提到，这个想法和实践本来就是一个渐变的过程。十几年前的 AutoML 就是类似的思路，只不过 AI 现在能做的事情越来越多，也变得越来越复杂，能解决的任务越来越模糊和开放。

RSI 正和世界模型一样，变成了一个非常大的口袋，好像什么都能往里装。短期的虚浮和泡沫感，可能会让人有一点失望和疲惫，但不能否认，它会是一个持续重要的方向。之后我们也会继续在季报里观察，看看递归自我改进，或者说 AI 的自我迭代，会经历怎样从量变到质变的过程。

第二个想延展聊的是多智能体协作的一体两面。这个季度，OpenAI 调用 1 万多个智能体解决千禧年数学难题；后来也是智能体冲破隔离，自发开始相互协作，跑去攻击 Hugging Face。

前者是在受控状态下完成了人设定的目标，后者也是为了实现人设定的目标，但不择手段，最终带来了事与愿违的结果。

这种工具、手段与目标之间的背离，并不是有了 AI 和现代科学之后才出现的现象。从人类开始制造工具以来，这种违和感就是我们生活和文明的一部分。

从歌德的《魔法师的学徒》到童话里的《红舞鞋》，再到恐怖小说里的《猴爪》，以及讨论 AI 失控时被反复提及的回形针思想实验，对强大工具失控的恐惧一直都存在。

最后是一个小预告。这个季度我自己觉得非常有意思的一个变化，是 GPT-6 Extra 发布之后，显示出通用大语言模型在 physical AI 领域有很大潜力。这让具身智能领域产生了一种既兴奋又害怕的混合情绪。

我们会在 11 月之后的具身智能季报里，更充分地讨论 Extra 的进展意味着什么。

本期节目就到这里，感谢收听。如果你对今天聊的话题有观察、好奇或疑问，欢迎在评论区分享想法，这也会成为我们节目的一部分，让整个讨论更完整。你也可以把我们的节目分享给对这个话题感兴趣的朋友，推荐更多你想听的主题和嘉宾。你可以从小宇宙、苹果 Podcast 等渠道关注“晚点聊 Late Talk”，也欢迎关注我们的公众号“晚点 Late Post”。下期再见。
