[BidClub_]
屠龙之术 · · 55 min

智能的下一幕,让人兴奋---73页PPT solo

庄明浩

AI & SoftwareTechnicalCompany Building
Podcast
TL;DR
  • 模型发布已进入“制造业”节奏,观察者集体麻木。 OpenRouter数据显示,2026年4月和7月分别上新80个和70个模型(日均约2个),版本号被迫先加 Flash/Pro/Max 层级再加日期(DeepSeek V4 Flash 0731→V4 Pro 0813→千问3.8 Max 0902);明浩引用张一鸣的判断:“这些模型厂之间没有本质区别,水平都差不多,无非是谁的新版本抢发几天的差异”——科学家带不好现阶段团队,“需要的就是包工头带大伙一起007”。
  • Benchmark集体失效后,模型传播靠“奇观”。 飞布5.1、腾讯混元4 Preview、GPT-6发布后,大面积评测视频都在让模型做3D;智谱GLM 5.3 Flash匿名登榜引发传播,公布身份后官方自画能力/价格“斩杀线”;MiniMax H3经fal.ai后训练在推特开24小时直播,“模型生成的速度超过了观看的速度”,造出可以无限滚动的“无限流”——发布策略的本质回到“Attention Is All You Need”。
  • 开源追平闭源的周期从33个月压缩到9个月,“最强模型≠最好用的智能”。 GPT-3时代本地小模型追上SOTA要33个月,如今千问3.8的27B在GPT-4.5发布9个月后达到其能力;OpenRouter上其他模型实验室已贡献2/3的Token量但只拿走1/3的花费,闭源Token价格被急速下拉。
  • 企业“永远用最新最贵模型”的前提出现松动,SOTA保质期急剧变短。 Claude 5发布后企业付费占比涨到十几%即停滞,多数客户仍用GPT-4.8;Ramp口径下最重度企业的人均月AI支出在7月见顶8000美元(约美国软件工程师工资一半)后8月回落,最前沿、最贵模型使用占比一个月内从53%跌到45%——“哪怕最激进的厂商都意识到,这个成本需要调一调”。
  • “Own Your Intelligence”成为新叙事:模型训练全流程被商品化,卖水人进入黄金期。 Stripe以70亿美元收购OpenRouter(8/19)、英伟达以129亿美元收购Hugging Face(9/3)标志中间层被基础设施收编;Harvey的打法是“Build a Benchmark→后训练→搭建RL环境并与训练基础设施厂商合作”,LangChain则把Agent定义为Model、Context加Harness,并主张通过评估和强化学习形成Loop;Brex最快增长软件Top25中14家是帮别人造模型的公司,YC W25的数据公司AfterQuery五个月估值从3亿涨到32亿美元。
  • RSI与Loop是前沿Labs最集中的Bet,但“Loop是一种结构,不是魔法”。 统计的119家New Lab融资934亿美元、仅16家披露过收入,英伟达投了其中34家,近半赌广义Loop/RSI;智谱唐杰称GLM-6.0定位“全自训练技术路线,海外对应的就是RSI”;但Hugging Face的“能否验证×是否容易迭代”四象限里,目前只有代码和3D所在的第一象限被证明较好,物理世界是AI最后尚未完全接管的模块——这也解释了上半年世界模型的热度。
  • 界面重构已经开始:App Store收入十年首降,办公Agent战役可能是弯路。 Codex达2500万周活,GPT-5.6之后ChatGPT调整成Codex,且国产办公Agent界面与它“几乎没有任何区别”;国内月活数据的意义受到质疑,百度环比增长1063.79%之类的数据被明浩以“懂的都懂”带过;侧边栏堆满技能、连接器、插件——“这种复杂度不应该产品自己消化吗?向来如此便对吗?”Meta的Muse、Grok Bot代表的Personal Agent叙事已启动,“办公AI Agent回头看是不是一段弯路呢?”
Digest · the substance, structured for research

1. 命题设定:给一家“全员Web Coding”的金融机构往高了讲

  • 这期PPT源自一次内训邀约:对方“内部Agent化程度很高,还有自己的基础模型,全员Web Coding,你只要往高了讲就可以”,且因是金融机构,明确要求不讲一二级市场叙事——于是无法展开惯常的CapEx、并购、上市融资等内容,全部集中在技术与产品,明浩自称“可能是我接的所有类似项目里最难的一次”。
  • 开场关键词六个:RSI(“到底是一种目标,还是把模型往前推进的手段,亦或两者都是”)、Auto Research、Loop(“一切皆可Loop,真的如此吗”)、New Lab(“这个定义和范围是不是太大了”)、Router(中间态还是入口)、Benchmark——连Benchmark本身也成了瓶颈,以至于演讲当天“阿里和腾讯投资了一家在中国做Benchmark的公司”。

2. 模型狂奔:日均两个新模型,大模型成“残酷的制造业”

  • OpenRouter数据:2024年月均十几到二十个新模型(峰值8月28个);2025年有六个月分别达45、50、35、42、42、35个;2026年前七个月只有1月(17个)和2月(26个)日均不足1个,4月80个、7月70个日均达2个,8月前11天已发22个。Hugging Face覆盖的多模态、语音、RL等模型总量曲线进入2026年后又被拉出新的斜率,接近笔直增长。
  • 版本号通胀是同一现象的切面:DeepSeek V4 Flash 0731→V4 Pro 0813→千问3.8 Max 0902,先分Flash、Pro、Max等层级,再加日期区隔——“那再往后是不是还需要加别的?”
  • 张一鸣《大模型是残酷的制造业》被整段引用:“这些模型厂之间没有本质区别,水平都差不多,无非是谁的新版本抢发几天”;“判断一个行业是不是制造业有一个硬指标,就是马斯克能不能玩明白”——Grok确实不错;“科学家带不好现阶段的大模型团队……现阶段干大模型需要的就是包工头带大伙一起007,主要工作就是做题、解题”。明浩的评价:“说得没有任何错。”

3. Benchmark失效,传播靠“奇观”

  • 各种榜单与Pareto最优图“似乎都很难界定一个模型到底好不好”,于是引兰希老师的观察,传播需要“奇观”:飞布5.1、腾讯混元4 Preview、GPT-6发布后,大面积评测视频都在让模型做3D。这又呼应梁文锋的判断:“当前最重要的是把AI训练做好,并不需要世界模型,甚至不用多模态”——“梁文锋诚不欺我”。
  • 两个“Attention Is All You Need”案例:智谱GLM 5.3 Flash先以匿名身份登榜并引发推特传播,公布身份后官方自画能力/价格“斩杀线”;MiniMax H3被美国后训练公司fal.ai拿去在推特开24小时直播间,“模型生成的速度超过了观看的速度”,直播变成“无限流”、可以无限滚下去——大家惊呼视频模型到了一个节点,也让人想起上半年几家号称做世界模型、主张就是无限流的公司。

4. 开源vs闭源、本地vs云端:追赶周期从33个月到9个月

  • 中美头部模型差距“有些观点认为已缩小到三到六个月,有些认为在六到九个月之间,反正不是特别大”;美国前三家OpenAI、Anthropic和Google延续闭源,开源生态“更多是由中国厂商贡献的:Kimi、智谱、千问”。
  • 关键曲线:SOTA出现后多久有可本地部署的小模型追平。GPT-3时代要33个月;如今千问3.8的27B在GPT-4.5发布9个月后就达到其能力——“似乎不需要等太久,就可能有一个30B左右的小模型达到GPT-6的能力,甚至可能都不需要等”。
  • OpenRouter的Token份额交叉发生在去年8月:如今其他模型实验室(绝大部分是开源实验室)占2/3的Token量、头部三家只占1/3;但花费角度反过来,2/3的钱仍归三巨头——“非常合理,Token消耗更大了,但单价更低”。第三方Token ETF显示闭源价格被开源急速下拉。

5. 智能分化:两笔并购与“最强≠最好用”

  • 8月19日Stripe以70亿美元收购OpenRouter,9月3日英伟达以129亿美元收购Hugging Face——这轮AI最核心的两家中间层公司在相近时点被广义基础设施高价收编,“大的并购往往代表着行业重要节点的出现”。
  • Ramp口径的Claude系列企业付费结构:Claude 5发布后占比涨到十几%就不再增长,大部分客户仍用GPT-4.8。过去几年“所有人都要用最新最强模型”是默认前提,如今松动——“Claude 5出来的时候强得可怕,技术领先,但没有给Anthropic带来超额利润,SOTA模型的保质期急剧变短”。
  • 支出端同步降温:Ramp的8月《AI Index》里,花费最多企业的人均月AI支出7月见顶8000美元后8月回落(Top 10与中位数企业仍在涨);最前沿、也就是最贵模型的使用占比从8月2日的53%跌至9月6日的45%,Light版16%→14%,多数回流Standard。明浩承认可能有季节性或单月异常,但主观结论是“哪怕那些最激进的厂商都意识到,这个成本需要调一调,那个前提松动了”。价格是核心:GPT-5.6大幅调价后,Luna级模型访问量暴涨。开源侧的历史铺垫也清楚:2023年Llama 2幻觉多,大家退回GPT-4;2024年Llama 3可以试;2025年DeepSeek R1引发一系列变化;2026年“我不需要去解释”。

6. Own Your Intelligence:企业自建智能,训练流程全面商品化

  • 企业开始认真构想拥有自己的智能,“成本只是因素之一”——租用还是本地部署,最核心的区别在数据的掌控,还有速度、能力天花板和组织问题(自上而下还是自下而上、全员还是集团军,“没有标准答案”)。红杉美国给出的执行路径是:战略→设定评估标准→Harness与路由→提示词→数据准备→后训练→Online Learning;“没有评估就没有真正的进步”。目标是通过开源模型、后训练、自有数据等组合,达到比单纯调用闭源API更好的能力。
  • Harvey这家AI法律公司最近融资15.5亿美元,在红杉美国会议上的标题叫“Building a Research Lab”。逻辑三步:Build a Benchmark→用Benchmark后训练模型→与能够提供模型训练基础设施的厂商合作;随后围绕RL环境、长链路和评估不断Loop,形成飞轮。
  • 供给侧随之分工:LangChain把Agent定义为Model、Context加Harness,各环节都有专门厂商服务;Mercor讲当下RL环境搭建已经从众包数据走向生成式数据,需要构建World、Apps,以及可评估、可Loop的Task。LangChain的主张“听起来非常简单”:建一个V1版Agent跑起来,收集执行过程、跟踪数据、基于Benchmark做实验、评估、强化学习,形成Loop。

7. 卖水人的黄金期:Frontier Labs的预算就是另一批人的收入

  • 光锥智能的海多老师那篇文章的标题被点名“写得更明显”——《无法蒸馏的美国市场:谁在分食Frontier Labs百亿美金的数据预算?》:头部Labs融的钱要搭自己的训练流程, “他们的预算就是另一批人的收入”。
  • 榜单交叉验证:Brex 2026年夏季最快增长软件Top 25中有14家是帮别人构建AI模型的公司,Ramp八月榜约一半同类;YC 2026年夏季批次200多家公司里有8家把Scale AI作为假想敌,单项最多。
  • 最极端的样本是YC W25的数据公司AfterQuery:9月1日估值32亿美元,五个月前只有3亿,从YC孵化到当时不过十几个月。“而且看起来一切才刚刚开始。”

8. 循环自生:AI改进AI,只剩物理世界没被完全接管

  • 第三章从Claude今年上半年发布的《When AI Builds Itself》讲起:示意图里模型越来越深地参与训练,“到最后人类不见了,AI for AI”。对照Sam Altman当年的L1-L5,L4“研究者”就是能做OpenAI内部研究员的事——而新闻显示其内部最先进模型“似乎就在做他们研究员自己在做的事情”。
  • 国内同步:8月31日智谱财报电话会上唐杰说GLM-6.0的定位是“全自训练技术路线,海外对应的就是RSI”;GPT-6相关论文在讲Loop,字节Seed模型最新论文标题里也出现了Looped。
  • 一张被盛赞的图把训练拆成奖励信号、训练数据、教师模型、数据集、人类行为归纳、研究者、环境搭建、物理世界等模块。从2022年到今天,越来越多模块被AI接管,“完全没有办法百分之百接管的,只剩最后的物理世界了”——这也是上半年世界模型热度上升的原因。

9. New Lab的934亿美元豪赌,与Loop的边界

  • 美国机构统计119家New Lab共融资934亿美元,但只有16家公开过“有一点点收入”;英伟达投了其中34家、将近三分之一。按赛道分,除物理AI/机器人、世界模型、AI for Science外,新架构、推理与真正定义RSI的公司占了另外三块——“将近一半的公司是在赌广义的Loop跟RSI”。
  • 由此产生估值难题:SaaS有产品、收入、增长阶段,生物医药有临床几期,“那这些New Lab怎么办呢?拉一批人、组建一个团队、公布一个榜单,都能算吗?”
  • Hugging Face给出的“能否验证×是否容易迭代”四象限泼了冷水:目前似乎只有第一象限——既强、可以被验证,又容易迭代的代码和3D——被证明较好;物理AI所在象限最难,内容板块则验证稍难但容易迭代。“Loop其实是一种结构,但不是魔法。”而人类的价值变成定义新高峰:Human Insight在前,Agent Loop在后,达峰后再寻找下一个。明浩还把Loop外推:报价体系、商业公司的运转都是Loop,“它其实就是一套思维和运行方式”。

10. 界面重构:App Store十年首降与办公Agent的“弯路之问”

  • 苹果最新财报里App Store收入十年来第一次下降——“无论iPhone卖得多还是少,App Store的收入从来没有降过”。因AI和Web Coding崛起,“我们真的可以为每一个人做一个满足其单独需求的、甚至是一次性的软件”,科幻片里的个人助理“似乎一点都不科幻”。Agent板块阶段性共识收敛为Coding+Personal Agent:Codex最新公布2500万周活,GPT-5.6之后ChatGPT调整成Codex,用户持续爆发式增长——而“今天你打开任何一个国产办公Agent,跟打开Codex界面上几乎没有任何区别”。
  • 国产办公Agent战役的数据意义受到质疑:夸克发布的7月数据里,WorkBuddy有658万月活,明浩认为这个数字基本可信;QClaw为225万、Trae为190万、CodeBuddy为23万、AutoGLM为14万。易观的WPS 2000万周活、办公软件“过去30天用户数突破3000万”、百度“环比增长1063.79%”等数据则被他以“数据这个东西吧,懂的都懂”带过。这场仗“打到年底?春节再打一波?打到明年?”护城河也存疑:产品两三天一更、豆包与飞书合并后“恨不得一天更新两个版本”,但更重要的变化是字节、腾讯、阿里、百度的组织架构调整,“都是组织”。
  • 界面批判是全章最锋利的一段:侧边栏堆满专家套件、技能、连接器、定时任务、API和插件,“对一个普通用户而言,这复杂度是不是过高了?向来如此便对吗?这种复杂度不应该产品自己消化吗?”WorkBuddy还与《和平精英》合作推出桌面宠物和主题界面。Grok Bot和Meta的Muse(比Manus的虚拟机“做得更极致”)代表把复杂内化的新尝试。收尾连发三问:“办公AI Agent回头看是不是一段弯路呢?”“张小龙怎么看现在这波办公Agent战役?”考虑到微信这几天的灰度测试——“想不清楚啊”。四章最终点在一起:Own Your Intelligence。
Full transcript
庄明浩

哈喽,大家好,我是明浩,欢迎收听我的播客《屠龙之术》。这是一期我的单口,带PPT,针对过去一个季度左右AI行业的一次梳理。关注我播客的朋友应该知道,我本来没有打算做这一季度的整理,因为大概率 10 月底的狂喜,我应该会再做一次整理,中间间隔的时间不是太长。但最近因为一个朋友找我去他们公司做了一次演讲,就有了这次整理,所以索性又做了一次 PPT。

在今天的节目开始之前,先跟大家聊一件我最近挺在意的事儿,掉头发,对。熟悉我的朋友应该知道我最近在打提尔伯泰,这段时间也出现了掉头发的困扰。现在除了关注体重,我还得关注一下头发,所以最近我真的开始认真研究掉头发这件事情。到了自己在意这件事的时候,就会很想弄明白一瓶强发洗发水里面的成分到底在做什么。也正好这期图们之树的赞助商就是欧倍青DMG洗发水。这个合作算是碰上了我最近正在研究的一个生活课题。品牌给它的定位是新一代头皮兴奋剂,欧倍青旗下最强配方。这里面我想重点跟大家讲的是它的主打成分 D M G。D M G 中文叫二甲基甘氨酸,它在这套配方里的作用是帮助促进头皮微循环。这个词听起来有点专业,其实说白了就是头皮的血液循环。头发从毛囊里长出来,毛囊需要的氧气和养分都靠血液送过去。如果头皮微循环不畅,毛囊就相当于在饿肚子,营养送不到,发根自然就弱,长出来的头发也容易细软脱落。欧倍青DMG关注的就是这个环节,帮助改善微循环,让发根获得更好的营养支持。跟它搭配的是欧倍青大家比较熟悉的咖啡因,帮助激活发根。咖啡因和DMG组成专利协同配方。一边支持发根活力,一边改善供氧条件,这也是这次产品升级最值得了解的地方。当然,掉头发还得结合个人情况看原因。对我来说,研究洗发水是认真做日常头皮护理的一部分。这瓶洗发水的用法也很明确,按产品说明,洗发时让它接触头皮,停留两分钟再冲洗干净。把头皮护理放进原本就要做的洗头这件事里,对我来说是比较容易坚持的。我现在的想法也很简单,既然已经开始在意这件事,就把每天能做的护理认真做起来。如果你最近也开始关心掉头发,可以了解一下欧倍青 D M G 洗发水。选的时候记得看清 D M G 三个字母,它的核心就是咖啡因,帮助激活发根,D M G 帮助促进头皮微循环,两者形成专利协同配方。感谢欧倍青支持本期节目。好,接下来进入今天的正题。我用了一个之前红杉美国最近一次研讨会的标题,叫作 “Own Your Intelligence”。我又配了一个中文小标题:从模型竞争到智能生产。看到这个标题,你大概就会知道我们今天会讲到什么。

在讲述开始前,先介绍一下这次准备内容的不同之处。刚才讲到,我这次的 PPT 内容是去一个朋友的公司做类似培训。他的公司是一家很有意思的公司。他找我的时候给我发了这样一段话:“我们内部 Agent 化程度很高,还有自己的基础模型,全员 Web Coding,所以你只要往高了讲就可以。”

我听到这个诉求之后就觉得,这可能是我接过的所有类似项目里面最难的一次。更麻烦的是,他们是一家金融机构。他特意强调了这一点,因为我之前给他看过一些我过去做的内容,他的建议是,最好不要去讲一级市场和二级市场的叙事。

熟悉我的 PPT 的朋友应该知道,我大部分这种超长的季度总结,通常会分成四章:技术、产品、资本,以及一个叙事,而那个叙事往往也跟资本相关。根据他的要求,过去我讲过很多的 CapEx、M&A、上市融资,这类叙事今天都没有办法展开了。

所以今天这期内容更多集中在技术和产品,可能是最难的一次,但我觉得也是好事。按照之前的习惯,如果大家了解的话,我一般会做季度更新、行业梳理,再加一次叙事;这次可能更多的就是季度更新,加一点点展开。

我们今天会涉及哪些关键词?我在做这次 PPT 之前列了大概十几个关键词,最后挑了五六个,留在了 PPT 比较靠前的位置。

第一个关键词是 RSI。我觉得在过去三四个月,甚至再往前推到过去大半年、一年左右的时间里,最前沿的模型公司大部分谈的应该就是 RSI。

第二个关键词是 Auto Research。它可能跟 RSI 有一定的概念重合,但更聚焦在 Research 任务上,议题变成了多大程度上的自动化。对于前面的 RSI,我会有一个疑问:它到底是一种目标,还是今天大家把模型往前推进的手段,亦或是两者都是?

第三个关键词是 Loop。这个关键词在我前两期的 PPT 节目里面,应该已经出现过无数次了。看起来所有人都在做 Loop,一切皆可 Loop,那真的如此吗?

下一个关键词是 New Lab。这可能也是过去一年左右,整个业界在认知和投资角度上最宽泛的一个定义。所有人似乎都成为了 New Lab,那问题就变成了,这个定义和范围是不是太大了?

下一个关键词是 Router,也就是路由。路由到底是一个中间态,还是会成为所谓 AI 行业的一个入口?围绕这件事的讨论,在过去很长一段时间里也有很多观点和主张。

最后一个关键词是 Benchmark。我的疑问变成了,今天连 Benchmark 似乎也成为了一种瓶颈,所以造成的结果是,今天出现了一堆只做 Benchmark 就可以成为独立公司的公司。就在我演讲这个 PPT 的当天,阿里和腾讯投资了一家在中国做 Benchmark 的公司。

涉及的关键词大概就是这些。今天的正式内容一共分四个章节,分别是模型狂奔、智能分化、循环自生、界面重构。模型、智能、循环和界面,四章,我们一章一章来。

第一章,模型狂奔。

1. 模型发布全面提速

我这次 PPT 的制作时间,大概是 9 月初到 9 月 10 日左右,也就是 9 月上旬。我截取了 8 月到 9 月头部模型厂商的发布情况。无论是中国厂商还是美国厂商,都可以截出超过 20 个模型。

也就是说,在过去一个多月时间里面,中美可能发布了超过 40 到 50 个模型,而且这还只是头部厂商,我还没有去统计那些非头部厂商。所以面对这种密集、甚至有些过于密集的模型发布,我觉得无论是我们这样的观察者、个人用户,还是从业者,大家已经有点麻木了。

再看具体的数据统计。这里有两张图,第一张图来自 OpenRouter。这张图我在《AI by Numbers》里面用过,是 OpenRouter 的数据分析师给出的数据。

2024 年,在 OpenRouter 上线的模型平均每个月一般是十几个到 20 个,最多的时候是 2024 年 8 月,达到了 28 个。也就是说,平均每天大概是 0.5 到 1 个,但不到 1 个,所以他用了白色柱状表示 2024 年的使用情况。

到了 2025 年,你会发现大概有 6 个月的模型发布量也不到平均每天 1 个,大概平均在 25、26、27 个左右。但是另外 6 个月的模型发布量分别到了 45 个、50 个、35 个、42 个、42 个和 35 个。平均算下来,那 6 个月每天发布的新模型超过了 1 个,但还没有到 1.5 个,所以他用紫色柱子表示。

到了 2026 年,你会发现,这张图制作的时间是截至 2026 年 8 月 11 日,也就是说有 7 个完整月。7 个月当中,只有 2 个月平均没有达到每天 1 个,分别是 1 月和 2 月,发布了 17 个和 26 个模型。

超过 1 个的是 3 月、5 月和 6 月,平均每天超过 1 个。更疯狂的是 4 月和 7 月,分别发布了 80 个和 70 个模型,也就是平均每天达到了 2 个。他用了绿色柱状表示。

这张图截至 8 月 11 日,8 月前 11 天已经发布了 22 个模型,所以如果按整个月计算,应该也会超过每天 2 个。从频率和发布量来看,模型厂商确实在疯狂发布。

另外一张图来自 Hugging Face。很有意思,一张来自 OpenRouter,一张来自 Hugging Face,而且这两家公司都被收购了,后面会展开。

Hugging Face 统计的是它所覆盖的所有 AI 模型,不只是语言模型,还包括多模态、语音、RL,以及各种各样模态和环境的模型。你可以明显感知到,从这条曲线的斜率来看,进入 2025 年下半年之后,曲线瞬间变成了一个快速向上拉升的状态。

进入 2026 年之后,这条曲线又硬生生被拉出了一个新的斜率,基本上快要笔直地向上增长。所以肉眼可见,从模型发布的角度来讲,总量和频率都在增加。

再看版本号的变化。我列了三个版本号,可能是最近国内比较有名的几个版本号。比如 DeepSeek V4 Flash,第一次发布叫 DeepSeek V4 Flash 0731;没过多久,DeepSeek V4 又发布了 Pro,叫 DeepSeek V4 Pro 0813;再过没多久,千问发布了 Qwen 3.8 Max 0902。

我们单纯只看版本号本身,第一层可以看到,除了定义版本号之外,还出现了 Flash、Pro、Max 这样的分布。GPT 也有类似的划分,Claude 模型也分成不同参数量的大小,这是一层。

但这一层分布还不够,还要加日期。为什么要加日期?因为模型版本发布得太密集,可能仅仅过了一段时间,甚至没有多久,前面的 V 几或者版本号没有太大变化,Flash 和 Pro 也没有变化,但模型其实已经进化了。那我们只能用日期来做区隔。

先有版本号,然后有模型大小对应的编号,之后又有日期。再往后,是不是还需要加别的版本号?

所以模型变成了什么?像张一鸣讲的,模型或者大模型的生产和训练,变成了纯粹的制造业。之前张一鸣有一篇文章叫《大模型是残酷的制造业》,里面有几段话我觉得讲得非常好,我截取了几段。

“经过了这两个月模型厂的狂轰滥炸、疯狂更新之后,相信大伙都逐渐认清了一个事实:这些模型厂之间没有本质区别,水平都差不多,无非是谁的新版本抢发几天、谁晚发几天的差异。”

你回想过去这几个月的时间,似乎确实如此。

下一条:“判断一个行业是不是制造业,有一个硬指标,那就是马斯克能不能玩明白。”

你看最近这个 xAI 的模型 Grok,也还不错,对吧?马斯克跨界进去玩不明白的,那铁定不是制造业。

第三段话:“事实证明,科学家带不好现阶段的大模型团队,因为科学家不爱带人打标,不爱做工程任务,而现阶段干大模型需要的就是包工头带大伙一起 007。主要工作就是做题、解题。”

说得没有任何错,所以大模型变成了残酷的制造业。

2. Benchmark失去效力

至此出现了一个新的问题,也就是我前面提到的最后一个关键词:Benchmark。

面对这么密集的模型发布,用户、厂商、To B 公司和观察者,如何去评判模型的能力?我们看到了各种各样的打分,甚至有最有名的让模型画“鹈鹕骑车”这样的案例,也看到了各种各样所谓 Pareto 最优的衡量方式,也就是除了衡量模型能力之外,还衡量价格。

你可以在所有模型发布的官方推送上看到各种各样的榜单,可是似乎所有这些榜单和 Benchmark,都很难界定一个模型到底好不好、强不强。

就像兰希老师说的,似乎我们需要另外一种方式去衡量模型的价值。最近一些新的模型,比如之前的飞布 5.1、腾讯的混元 4 Preview 版本发布时,包括这次 GPT-6 发布之后,你会发现,大面积的评测视频都在用模型做 3D 效果,来衡量模型的价值。

这就出现了一个问题:为什么大家开始和 3D 过不去了?

也是兰希老师说的,当所有 Benchmark 失效之后,我们这些观察者、用户甚至厂商,对于模型的传播和模型能力的界定,需要的是奇观。3D 也好,游戏也好,似乎就是最直观的奇观。

这又让我想起前一段时间 DeepSeek 的梁文锋说过的一句话。他说,当前最重要的是把 AI 训练做好。把 AI 训练做好,并不需要世界模型,甚至不用多模态。梁文锋诚不欺我。

对于当前的模型厂商而言,当模型的制造和训练变成所谓制造业之后,如何获取 Benchmark 之外的奇观和关注?这又对应了这一轮 Transformer 最重要的核心论文的标题:“Attention Is All You Need”。

举两个例子,分别来自两家中国上市的大模型公司。

先是智谱最近发布的 GLM 5.3 Flash,就是那个很厉害的模型。它先是在推特上引起了巨大的传播,匿名登榜,然后得到非常多的关注。能力非常强,价格也非常便宜,于是得到了更多传播和用户关注。

在公布自己就是 GLM 5.3 Flash 之后,他们在正式公布的推文里,官方自己画了那个非常有名的斩杀线,也就是模型能力和价格之间的斩杀线。用这样的方式,让 5.3 Flash 得到了更多关注。

Attention Is All You Need。

下一个案例是 MiniMax。MiniMax 的 H3 发布之后,美国一家做后训练的公司 fal.ai 做了一件事。具体来说,他们通过自己的后训练,基于 H3 在推特上开了一个直播间。

这个直播间 24 小时不间断。更重要的是,因为 H3 的能力加上后训练,也就是他们对模型的调教,造成的结果是,当用户在直播间的弹幕里发出对视频模型的修改要求之后,模型生成的速度超过了观看速度。

我再说一遍,模型生成的速度超过了观看速度。也就是说,它生成一段 1 分钟的视频,不需要 1 分钟。这造成了什么结果?那个直播间就变成了所谓的无限流,视频可以无限滚下去。

当传说中的无限流出现之后,大家会惊呼,视频模型似乎到了一个节点。因为这样的传播,MiniMax H3 得到了巨大的关注。

Attention Is All You Need。

这个事情再延展一下。提到无限流,如果关注行业的话,你应该会想到,今年上半年有几家做所谓视频模型的公司,号称自己在做世界模型。他们的主张就是无限流,对吧?

3. 开源改写竞争格局

这个问题再延展,就是老生常谈的中国和美国的模型对抗。似乎我们的头部模型厂商和美国最头部的模型厂商之间,差距不是特别大。有些观点认为已经缩小到 3 到 6 个月,有些观点可能认为还在 6 到 9 个月之间。反正这个距离不是特别大,而且因为我们的模型性价比提升,又引发了后面所有的问题。

所以这个问题自然而然引入了另一个对比角度,就是开源和闭源的竞争。

美国最头部的三家模型厂商,OpenAI、Anthropic 和 Google,依然延续着闭源策略。美国当然也出现了一些做开源模型的厂商,但开源生态似乎更多是由中国厂商贡献的,比如 Kimi、智谱和千问。

开源和闭源的竞争,是一个问题。

再下一张图,也是我之前《AI by Numbers》提到的那张非常重要的图,就是云端模型和本地模型的对比。这张图比较的是,当一个最新的 SOTA 模型出现之后,需要多久才能出现一个可以在本地部署、参数量比较小的模型,并且它的能力达到当前头部 SOTA 模型的能力。

在 GPT-3 的年代,这件事情需要 33 个月,接近 3 年。到了最近,千问 3.8 的 27B 模型已经非常强,而且可以本地部署,它的能力已经达到了 GPT-4.5 的能力。也就是说,GPT-4.5 发布之后 9 个月,就有一个可以部署在本地的小模型达到了 GPT-4.5 的能力。

大家会想,今天世界上最优秀、最强的模型是 GPT-6。那似乎不需要等太久,就可能有一个 30B 左右、可以本地部署的小参数量模型,达到 GPT-6 的能力。

这个事情可延展的空间似乎会被无限放大。甚至可能我们都不需要等到 GPT-6,现在千问 3.8 的 27B 模型就已经可以做很多事情了。

所有这些议题,到这里自然而然引发了几个问题:中国和美国的对抗、开源模型和闭源模型的竞争、本地模型和云端模型的竞争。你会发现,纯大模型这件事情出现了分化。

所以我们进入第二章,智能分化。

前面提到了两家公司。8 月 19 日,Stripe 以 70 亿美元收购 OpenRouter;9 月 3 日,英伟达以 129 亿美元收购 Hugging Face。

Hugging Face 和 OpenRouter 被定义为这一轮 AI 爆发过程中最核心的所谓中间层代表公司,在差不多的时间点,都以非常高的价格,被 AI 行业的基础设施公司,或者广义上的基础设施公司收购。

我觉得,大的并购往往代表着行业重要节点的出现。

再看一张图,是 Ramp 统计的,金融时报重新绘制的一张图。我在上一次《AI by Numbers》里也用过,就是 Claude 系列所有模型在企业端的付费占比。

你会发现,之前 Claude 5 发布之后,并没有得到所有人的认可。它的占比增长到可能百分之十几之后就不再增长,大部分人依然在继续使用 GPT-4.8。

在过去几年,似乎在应用和 To B 场景里,大家有一个默认前提:所有最新、最强的模型出来之后,我就要用那个最新、最强、甚至最贵的模型。

但今天,这个前提本身出现了松动。也就是说,不是所有人都要用最新、最强的模型。

造成的结果是,Claude 5 出来的时候,强得可怕,技术领先,但没有给 Anthropic 带来超额利润。也就是说,所谓 SOTA 模型的保质期急剧缩短了。

更麻烦的是,同样来自 Ramp 的统计。它在刚刚发布的 8 月《AI Index》里,统计了它所覆盖的美国几万家公司在 AI 上的花费。

Top 1,也就是花费最多的公司,平均每个员工在 AI 上的花费,这个月度额度达到了 8000 美元。我讲过,这个数字大概是美国软件工程师工资的一半。

这个数字在 7 月达到顶点,是 8000 美元。可是到了 8 月,这个数字往下掉了一点点。

为什么呢?虽然 Top 10 和平均数、中位数企业的 AI 支出还在上涨,但是最核心的,也就是原来使用 AI Token 最狠的那些企业,在 8 月平均支出往下掉了。

当然,这里面可能有季节性因素,或者单月异常数据的变化。但似乎我们可以得出一个比较主观的结论:哪怕是那些最激进的厂商,也意识到这个成本需要调一调。那个前提松动了。

这里面最核心的原因当然是价格。过去这么多年,我们已经看到过无数次,SOTA 模型的单价会在一段时间之后不断下降,可能降一个数量级,而且这个保鲜期在急剧缩短。

如果有印象,大家上一次最大的调价应该就是 GPT-5.6 的调价,Luna 级直接调了特别多,所以在悟空的时候,Luna 的 5.6 模型访问量暴涨。价格,价格还是价格。

同样来自 Ramp 的统计,也印证了这个趋势。他统计了三家最头部的模型厂商,也就是 OpenAI、Anthropic 和 Google,按照最大模型、标准模型和 Light 模型来区分。这个尺寸本身当然也代表价格。

你会发现,在 8 月 2 日的统计里,使用最前沿、也就是最贵模型的比例还有 53%;但到了 9 月 6 日,这个数字已经跌到了 45%。而 Light 版本,也就是轻量版本的比例没有太大变化,大概从 16% 降到了 14%。大部分模型回到了所谓 Standard,也就是标准版。

从价格曲线上来看,这条曲线就在往下拉。

我们回想过去这段时间发生了什么?换一个角度来看,如果今天有一个模型能力达到头部模型 80% 甚至 90% 的开源模型,但成本只有对方的十几分之一,甚至几十​​分之一,那我为什么不去用那个开源模型?

所以我们看过去三年半开源模型领域发生了什么。

2023 年,最有代表性的开源模型是 Llama 2。那简直像上古时代的模型了,还不太行,有非常多的幻觉。大家也做过很多后训练和调试,发现不太 OK,所以在 2023 年,很多公司又选择回到了 GPT-4。

2024 年出现了 Llama 3,还可以,有些公司开始做尝试。真正意义上,Llama 3 可以说是大家认为开源模型可以和闭源模型试一试,那是 2024 年的事情。

2025 年,DeepSeek R1 出现,引发了后面无数的事情。真正意义上,开源模型可以和闭源模型竞争,大家可以开始尝试做更多部署,因为低成本,经济性特别明显。

到了 2026 年,我们不需要列任何一个开源模型的能力。今天开源模型和闭源模型的能力,你知道,我也不需要再解释。

自然造成的结果,就是大面积的商业铺开成为现实。过去三年半经历的事情,趋势已经非常明显。

同样是 OpenRouter 的统计,在 Token Share,也就是 Token 占比的曲线上,如果我们把 Anthropic、Google、OpenAI 定义成一条曲线,把其他实验室——其实绝大部分都是开源实验室——定义成另外一条曲线,那么它们在 OpenRouter 上 Token 量的交集,发生在去年 8 月。

到了今天,从 Token 量角度来看,OpenRouter 上有三分之二的 Token 是由其他模型贡献的,最头部的三家模型只占三分之一。

但从 Spend,也就是花费角度来看,情况是反过来的:三分之二的花费由那三家占据,三分之一被开源模型拿走。

我觉得这非常合理。确实,Token 消耗变得更大了,但因为单价更低、成本更低,所以从花费角度来讲,大头还是在那三家。

同样是一张我之前《AI by Numbers》用过的图,是第三方机构做的 Token ETF。你可以明显感知到,闭源模型的价格在过去一两周被快速往下拉,原因就是开源模型的崛起。

甚至开源模型的价格其实还在往上提,但因为之前开源模型的价格足够低,所以它会把闭源模型的价格往下拉得非常强烈,造成整体平均价格的曲线也在往下。

4. 企业开始拥有智能

那么问题就出现了:如果最强的模型今天似乎已经不再等于最好用的智能,会出现什么样的状态?

这也是我今天标题的来源——红杉美国那次研讨会的标题,“Own Your Intelligence”。企业开始想,能不能拥有自己的智能。成本需要优先考虑,速度也要考虑,什么才算是好的智能也要考虑,当然更重要的是对数据的把控。

这几方面因素造成的结果是,在过去大概两个季度的时间里,无数企业开始认真构想建立自己的智能。

但在建立的过程中,需要直面一些问题。比如,到底是选择租用,还是在本地建立?这个边界和权重怎么分?如果要建立,团队怎么构建?建立了自己的能力之后,如何说服客户接受这种能力?具体的执行过程应该是什么样?

这些问题都会迎面而来,自然而然也会有很多厂商去解决它们。

在所有问题里面,我觉得成本只是第一个因素,或者只是因素之一。租用云端服务还是本地部署,在成本上肯定有区别,在速度上也会有区别,但最核心的区别在于数据的掌控。当然,可能还有能力天花板的问题,所以成本只是因素之一。

然后是刚才说的组织问题。到底是自上而下,还是自下而上?是全员参与,还是一个小规模集团军?是以点带面,还是全部铺开?没有标准答案,要看每家公司自己的情况。

具体的执行路径,红杉美国的定义是,你可能首先需要一个战略。所谓战略,就是你要做出这个决定,然后评估、设定评估标准,接着做 Harness 和路由,做提示词,做数据准备,做后训练,做链路,做 Online Learning,做所有这些事情。

还是这个观点:既然你要做这么多事情,就一定会有厂商提供各种能力,帮助你把这些环节做起来。

5. 模型训练全面商品化

所以无论是开源领域还是闭源领域,今天你会发现,出现了一堆把刚才说的这些事情——做战略、做评估、做 Harness、做 Routing、做数据、搭建 RL 环境、做后训练,甚至做预训练——商品化并提供给其他人的厂商。

也就是说,模型训练的各个流程成为了商品。

最后,没有评估就没有真正的进步。你希望达到的效果,一种方式是用闭源云端 API 达到一个效果;但你今天希望通过开源模型、后训练、提示词、自己的数据、Online Learning,以及各种各样的事情,达到比单纯使用 API 更好的能力,这才是最终目标。

我们看一些具体实施。典型的比如 Harvey,这家最有代表性的 AI 法律公司,最近刚刚融资 15.5 亿美元。他们在红杉美国那次会议上的标题叫 “Building a Research Lab”。

逻辑特别简单,三步:Build a Benchmark,然后用这个 Benchmark 去后训练模型。谁来帮助你,或者说你选择跟谁合作?就选择那些能够为模型训练提供基础设施的厂商。

他列了非常多的厂商。从模型厂商开始,包括 OpenAI、Anthropic、DeepMind、xAI 和 Meta;开源模型厂商又包括 Kimi、智谱、DeepSeek 和千问。还有做数据的公司、做 Training 的公司、做评估和榜单的公司,甚至各种各样的 New Lab,大家合作一起做起来。

具体的做事方式是,先建立一个法律领域的 Benchmark,然后基于这个 Benchmark 搭建一套 RL 环境,和合作方一起做长链路,再和各种各样提供服务的 New Lab 合作,建立一个 Loop,或者说一个飞轮。

环境搭建、后训练、Benchmark 评估,不断反馈,不断 Loop,不断地循环,这就是 Harvey 的执行策略。

在这个过程中,我们看到一个很重要的提供商,比如 LangChain。它把概念扩大到了 Agent 角度,认为 Agent 就是 Model,也就是模型加上下文,再加上外围的 Harness。

针对这几个事情,你会针对模型做训练,针对数据做记忆,针对 Harness 做 Harness Engineering。所有这些事情都有专门的厂商提供服务。

我们同样看到了我之前 PPT 里无数次提及的 RL 环境搭建。在红杉的会议上,Mercor 讲了如何在现在这个时间点搭建 RL 环境。

他说,以前这类数据都是众包的,后来变成了生成式数据。然后你要构建 World,也就是广义的环境;要构建 Apps,让它能够运行;还要构建 Task,让它完成具体任务。这个任务必须是可以评估的,也必须能够实现 Loop。

在这个过程中,我们也无数次看到 Agent 和 Harness。同样是 LangChain 的主张:今天的 Agent 需要运行在一个可以行动的环境里,连接你的数据,管理长程任务,并行执行各种任务,同时允许 Human in the Loop,也就是把人的行为加进去,然后持续改进。

这就是整个 Agent 和 Harness 框架要做的事情。

LangChain 的主张其实特别简单:建立一个 V1 版本的 Agent,让它先跑起来;收集它执行的所有过程,跟踪这些数据;然后基于你的 Benchmark,让它不断做实验;我们去评估实验结果的好坏,进行强化学习,再形成 Loop。

这听起来是一种非常简单的主张。

所以,智能本身,或者说模型训练,加上 Agent、Harness 的整套服务,出现了产业分工。于是出现了一堆做广义 Infra 的公司。

它们不单纯是做云、芯片、基础设施和数据中心,也做广义的软件层 Infra,帮助你做数据训练、RL 环境搭建、预训练,甚至做 Harness、做榜单、做评估、做构建。

所有这些事情,都出现了一堆公司来帮助你做协议、支付、身份认证和权限搭建。

在美国过去两个季度,一个比较热门的方向,就是做 AI Training Data 和 RL 环境搭建的公司。

我同样用了上一次《AI by Number》的一张图表。前段时间,光锥智能的海多老师发过一篇文章,我觉得它的标题写得更明显:《无法蒸馏的美国市场:谁在分食 Frontier Labs 百亿美金的数据预算?》

特别简单,对吧?这些最头部的模型厂商和 New Lab 融了那么多钱,要搭建自己的模型训练流程、架构和平台。他们的预算,就是另一批人的收入。这一批人自然而然要给他们提供服务。

同样,另外一家和 Ramp 类似、做企业支付的公司 Brex,发布了 2026 年 Summer 的 Top 25 最快增长软件供应商榜单;Ramp 刚刚发布的 8 月 Top Software Vendors 榜单,也出现了一模一样的趋势。

超过一半的厂商都在做刚才所说的这些服务。比如 Brex 的 Top 25 里面,有 14 家公司是在帮助其他厂商构建 AI 模型的公司,无论是做数据、做训练,还是做平台,都是这样。

Ramp 的 8 月榜单里,也大概有一半公司在做相关事情。很多榜单都展现了同样的趋势。

我在今天上午看了 YC 这一届 2026 年夏季所有项目的统计,也是一模一样的趋势。其中有一个统计很有意思:统计了这些公司对外宣讲时瞄准的是谁,也就是它们的假想敌是谁。

在 200 多家公司里面,有 8 家公司把 Scale AI 作为目标,这是最多的,8 家。看起来,一切才刚刚开始。

同样是 YC 的公司,AfterQuery,你听这个名字,AfterQuery。它是一家做数据的公司,9 月 1 日估值达到了 32 亿美元。

这家公司是 YC W25 的公司,也就是 YC 2025 年冬季的公司。我再次说一下,YC 2025 年冬季的公司,到今天不过十几个月的时间,不到两年。这家公司从 YC 孵化出来,到今天已经成长为一家估值 32 亿美元的公司。5 个月之前,这家公司只有 3 亿美元。

我刚才说过,这一届还有 8 家瞄准 Scale AI。单纯只是做数据这件事情,才刚刚开始。

到这里,似乎出现了一个新的可能性。还是刚才 LangChain 那张图的主张:建立一个 V1 版本的 Agent,收集数据、跟踪过程,然后评估、打分、改进。

那么,这套流程能够自动化吗?

6. AI开始改进AI

好,刚才我们聊到,围绕模型已经长出了一整套产业分工。接下来还会再往前走一步:能不能让 AI 参与改进 AI,也就是所谓的自动化处理?

如果连改进 AI 这件事都能让 AI 参与进来,那么会发生什么呢?

自然而然,我们进入今天的第三章,循环自生。

还是今年上半年,我认为 Claude 发布的最重要的一篇文章,就是《When AI Builds Itself》。它画了一个非常直观的示意图:人类和计算机训练出第一代模型,模型加入训练过程,不断加入、不断增加,模型越来越多地参与整个模型训练,最后人类不见了,变成 AI for AI。

我们到底走到哪儿了?

回头去想,当年 Sam Altman 定义的 L1 到 L5:L1 是 Chatbot,L2 是推理,L3 是 Agent,L4 是研究者,L5 是组织者。

当时所谓的研究者或者创新者,就是能够做 OpenAI 内部研究员正在做的事情。那似乎我们从一些新闻里可以看出来,OpenAI 内部最先进的模型,似乎就在做他们研究员自己在做的事情。

同样,8 月 31 日,智谱发布新的财报。在财报发布之后的分析师电话会议上,智谱创始人唐杰老师说,未来要发布的 GLM-6.0,定位是全自训练技术路线,海外对应的就是 RSI。

同样,最近刚刚发布的 GPT-6,也有一些论文在讲述它们如何使用 Loop 的方式。字节的 Seed 模型,最新论文的标题里也出现了 Looped 公式,关键词还是 Loop。

再放一张图,我觉得这张图画得非常好。

我们把模型训练分成奖励信号、训练数据、教师模型、数据集、人类行为的归纳、研究者、环境搭建,以及物理世界等一个个模块。你会发现,从 2022 年到 2023 年、2024 年,再到今天,这些模块越来越多的部分被 AI 自己接管了。

似乎到今天,完全没有办法百分之百接管的,只剩下最后的物理世界。所以为什么今年上半年世界模型那么热,也是这个原因。其他这些事情,看起来似乎都已经被模型自己接管了。

这就造成了一个结果:从 2025 年下半年开始,一堆所谓的 New Lab 疯狂融资。这些 New Lab 当中,很多公司到今天依然没有公布任何营收数据。

美国一家机构做过统计,它统计了 119 家 New Lab,在过去一段时间里融了 934 亿美元。但在这将近 120 家公司里面,只有 16 家公开过有一点点收入。

所有孵化器、VC、巨头和大佬,都在疯狂押注这些 New Lab。还有一个统计:英伟达在这 119 家里面投了 34 家,接近三分之一。

那么,这些 New Lab 到底在押注什么?

我们把这 119 家 New Lab 按类别分类。物理 AI 和机器人、世界模型、AI for Science,这几块看起来可能和 RSI 的关系没有那么大。但剩下的三块——新的架构、推理,以及真正意义上定义 RSI 的公司——占了另外三个板块。也就是说,将近一半的公司是在押注广义的 Loop 和 RSI。

同样,我们看一些比较有名的大佬,比如刚刚离开 Google 的 Jeff Dean、原 OpenAI 的 Ilya Sutskever、OpenAI 的 Mira Murati,以及 Meta 的田渊栋老师。

我们看 Jeff Dean 那家公司的 Logo,就是一个倒着的 8,也就是无限大的 Logo。这个东西代表的不就是循环吗?

田渊栋老师的公司的缩写就叫 RSI。比如 Jeff Dean 刚刚离职时那张介绍业务的 BP,讲的就是 Loop。他说,在其他很多科研领域,实验、改进、再促进实验的循环已经形成了,那 AI 领域他就想做这件事情:Loop。

最近英伟达在推一个新的主张 TTT,也就是 Test-Time Training。Mira 他们最近发布的新模型,主张的是 Human in the Loop。田渊栋老师他们发布的第一篇论文,标题里也有 Automatic。

大家看到的共识是一样的。

再往后,人类呢?人类的目的,或者说人类的价值,变成了什么?

如果一切都 Loop 了,人类相当于在定义新的高峰。我用了 Hugging Face 最近的一张 PPT:人类和 AI 并行研发的过程,变成人类先寻找一个高峰、一个目标,然后通过 AI 和 Loop 的方式达到目标;达到之后,人类再去寻找下一个目标,不断地往上垫。

第一步是 Human Insight,第二步是 Agent Loop。

如果一切都 Loop 了,从投融资的角度来讲,怎么给这些公司定义里程碑,来给出新的估值?

比如传统 SaaS 公司,可以从产品阶段、产生收入阶段和增长阶段来定义。生物医药公司,可以从实验室、临床试验一期、二期、三期,到正式上线、通过审批来定义。

那这些 New Lab 要怎么办?拉一批人,组建一个团队,公布一个榜单,都能算作里程碑吗?

还有一个问题:所有事情都能 Loop 吗?

Hugging Face 给了一个划分方式,画出四个象限。横纵坐标分别是:能不能验证,以及好不好迭代。

这样四个象限里,似乎只有第一象限现在已经被证明比较好,也就是既强、可以被验证,又容易迭代。典型的就是代码,以及我们前面提到的 3D。

为什么大家用 Blender 去做器官?因为你会发现,如果是第四象限,也就是那些物理 AI,似乎就比较难。

内容板块基本都属于强、稍微不好验证但容易迭代。所以并不是所有事情,听起来都可以通过强化学习和 Loop 的方式非常完美地解决。

Loop 其实是一种结构,但不是魔法。

7. Loop扩展到商业运行

这个问题再扩大一下。我们刚才聊的很多 Loop,都定义在模型训练和 Agent 训练上。但你细想,今天代码的 Loop 已经形成了。

一家公司的报价体系,其实也是一个 Loop。你根据用户反馈不断调整价格结构,用户接受,然后你就确定这个架构;用户不接受,就继续调整、继续扩展。一家商业公司的运转,不也是 Loop 吗?

所以 Loop 的 Loop,其实不只是技术和产品,它更是一套思维和运行方式。

自然而然,我们进入第四章,界面重构。

8. 个人软件正在到来

刚刚公布的这一季财报里,苹果在过去 10 年历史上第一次出现了 App Store 收入下降。

过去 10 年,无论这个世界发生任何事情,无论 iPhone 成不成功、卖得多还是卖得少,无论 iPad 成不成功、卖得多还是卖得少,App Store 的收入从来没有下降过,最多只是增长变慢。但过去这个季度,App Store 的收入第一次下降。

我们似乎真的进入了一个新的软件时代。

传统的软件到今天,随着 AI 和 Web Code 的崛起,我们真的可以为每个人做一个满足其单独需求的、甚至是一次性的软件。

那些科幻电影里演过的个人助理,一个知道我所有事情的 AI,可以帮我把生活、娱乐、工作、投资和健康都处理好。原来电影里演的东西,今天听起来好像马上就可以实现了,对吗?

科幻吗?似乎一点都不。

所以阶段性的共识出现了。在 Agent 这个板块,Coding 和 Personal Agent 成为了共识。Coding 已经不用讲了,对吧?Personal Agent 一会儿后面可以稍微展开一点。

Code Agent 最大的共识是 Codex。Claude Code 可能是 2025 年第三季度开始的,Codex 今年接棒。

截至我做这次 PPT 的时候,Codex 最新一次公布的数据已经达到了 2500 万周活。GPT-5.6 之后,ChatGPT 调整成 Codex,Codex 的活跃用户一直在爆发式增长。

这个共识有多么强?今天你打开任何一个国产的所谓办公 Agent,或者原来的 Chatbot 产品转成的 Agent,和你打开 Codex,界面上几乎没有任何区别。

回头再想,过去几个月由这些中国大厂兴起的办公 Agent 战役,已经打了一个多季度,满打满算两个季度。大家觉得这场仗能够持续多久?年底?春节再打一波?打到明年?

阶段性的数据,比如夸克发布的 7 月数据,WorkBuddy 有 658 万月活。我觉得这个数字基本可信。QClaw 有 225 万,Trae 有 190 万,CodeBuddy 有 23 万,AutoGLM 有 14 万月活。

反过来想,这些阶段性数据,尤其是月活数据,是否有意义?

一提到数据,就不得不再一次吐槽上次说过的那些数据,比如易观统计的 WPS 2000 万周活,以及办公软件最近公布的过去 30 天用户数突破 3000 万。

前一段时间,百度的相关产品还公布了环比增长 1063.79%;Kimi AI 还没有超过 2500 万用户。数据这个东西,不展开了,懂的都懂。

又回到那个老生常谈的问题:这些产品的护城河到底是什么?

我截了一下 WorkBuddy 过去一个多月的版本更新,基本上每两三天更新一次。豆包自从和飞书合并之后,甚至恨不得一天更新两个版本。

这些执行功能和快速迭代,能够构成护城河吗?

这背后其实更重要的是组织架构的调整。我们已经看到了字节的调整、腾讯的调整、阿里的调整,甚至百度的调整。其实都是组织,都是组织。

还有一点,从界面角度来看,你在今天所有这类产品上都能看到:侧边栏里有专家套件、技能、连接器、伙伴、定时任务、API 和插件。

当然,你可以说这些产品向来如此。但我反问一句:对于普通用户而言,这是不是复杂度过高了?向来如此就代表它是对的吗?这种复杂度不应该由产品自己消化,而不应该交给用户,不是吗?

再提到界面这件事。比如最近我们看到了 WorkBuddy 和《和平精英》合作。你可以领取一个《和平精英》的桌面宠物,然后 WorkBuddy 的界面会放上《和平精英》的样子;你甚至可以做张靓颖主题的界面,也可以做传统 QQ 的界面。

界面这件事,我们的创新性还是很强的。

同样,我们看到了一些界面上的变化。比如马斯克的 Grok Bot,最近讨论很多。我觉得它符合前面说的逻辑:那些复杂的东西应该内化到产品本身,而不应该交给用户。

同样,我们看到了 Meta 的 Muse,我觉得依然符合这个逻辑。之前 Manus 定义的是给用户一台虚拟机,Meta 的 Muse 做得更极致。

但这就一定对吗?我们也不知道。至少在刚才提到的 Personal Agent 这个板块上,一些厂商开始做新的尝试,中国也有一些创业团队在尝试类似的事情。

问题来了,那几家打得非常热烈的办公 Agent,要不要尝试这个方向?不知道。

新的界面叙事、更加个人化的叙事,似乎已经开始了。

我之前发过一条帖子,说模型之外,产品端的叙事在过去一年左右,已经经历了从 Code,到 OpenClaw,到 Work,再到 ClawTag、ClawBot。最新的趋势,像 Meta 的 Muse,就是个人 AI Assistant。

那么国内要跟吗?或者说会跟吗?办公 AI Agent 回头看是不是一段弯路?

我又想起前几天那个问题:你说微信的张小龙,龙哥,会怎么看现在正在打的这一波所谓办公 AI Agent 战役?如果再考虑到这几天小微灰度测试的功能,就更想不清楚了。

回头来看,今天的四个关键词——模型、智能、循环、界面——似乎点在了一起。

最后,Own Your Intelligence。

感谢收听。老规矩,我的 PPT 会放在 Show Notes 里。