广密
智能提升是唯一的主线,智能本身就是最大的应用,所以我们还是要围绕智能本身去投入和思考。我觉得今天还是要喊一下,大家还是要重视 pre-training,我觉得这个才最本质。
张小珺
所以进入 2025 年,你首先重新又坚信 pre-training 了?
广密
对。
张小珺
广密,你对我们这个系列节目有什么想说的吗?
广密
持续为 AGI 布道吧,我觉得这个很有意义。希望输出更多对 AGI 的思考和非共识认知,多讨论一些硅谷的创新洞察,启发大家有一些全球化的视野。
张小珺
进入 2025 年,好像比去年更卷了。我感觉时间明显穿梭得更快了,AI 竞争的格局也是飞速转化,格局没有一天稳定过。今年 Q1 刚刚开始,不管是 DeepSeek、Manus、Grok、GPT-4o 还是 Claude 3.7,似乎都在不断改写全球 AI 格局。今天这期节目有什么是我们可以期待的?
广密
我觉得最重要的,还是希望给听众理清楚 AGI 的主线和主峰,哪些是真正重要、值得重视的,传递一个从 AGI 原教旨主义出发的思考路径。
张小珺
你是 AGI 原教旨主义者,对吧?
广密
我觉得是相信吧。
张小珺
开始我想先问你一个问题。今年大家都在喊 AI 的应用,觉得这是应用爆发、AI 爆发的元年。你花了很多时间研究 model training 本身,你觉得基座模型的竞争结束了吗?我们还应该花多少精力关注基座模型的进展?
我也听到过另外一种观点,就是说现阶段放这么大精力关注模型其实没有必要,还是应该把时间投入到真正能用的应用上。你怎么看?
1. Pre Training Is Not Over
广密
今天最大的共识就是 pre-training 结束了,其实今天最大的非共识也是 pre-training 空间还非常大,甚至可以说才刚刚开始,还会迎来新的能力涌现。我有很强的信心说,pre-train base model 这个赛道远远没有结束。
下一代的 SOTA 模型,还是能够显著超过今天的 SOTA。不管是今天的 GPT-4.5、Grok 3、Sonnet 3.7,还是 Gemini,我觉得之前“pre-training 结束了”的共识,很大原因可能是 OpenAI 的 pre-training 进程变慢了。其实 Anthropic 也好,xAI 也好,我觉得他们还挺快的。
张小珺
因为 OpenAI 之前是领先者,对吧?领先者的表现容易被认为是正确的共识,但当领先者不再领先,这个共识就不一定成立了。
广密
我觉得要强调的一点就是,只有 pre-training 才能涌现出新的能力。其实 post-training 和 RL 并不会涌现新的能力,它只是把能力激发出来或者加强。
基本上,pre-training 决定了模型内在的上限。后面你再怎么做 post-training,做相关的 RL,我觉得也只能做到 pre-training 这个内在上限。所以只有在 pre-training 阶段把 base model 的能力往上提,才是最本质的。
不然你在一个很差的 base model 上做强化学习,其实就像小学生刷题,很容易饱和、见顶。我觉得只有 pre-training 才能把小学生本质上变成初中生。o 系列其实就是刷题。
我们在半年前那篇博客里就喊过 RL 的范式。当时说 pre-training 有 50% 的概率结束了,但今天所有人都在聚焦做 reasoning model,我觉得今天还是要喊一下,大家还是要重视 pre-training,这个才最本质。
张小珺
所以进入 2025 年,你首先重新又坚信 pre-training 了。
广密
对。
张小珺
从外界看,OpenAI 好像没有那么重视 pre-training 了,你觉得是这样吗?原因是什么?
2. OpenAI Loses Focus
广密
我觉得也可能不是不重视。其实从外部观察,一个可能是战略选择,另外一个可能是组织问题。
从战略上来看,o 系列在 benchmark 上走得非常快,o 系列可能两个月刷分的收益,就比 pre-training 一两年的收益来得快。另外,ChatGPT 的增速也非常快,而且还在加速。我觉得 ChatGPT 肯定也占了管理层很大的精力。
第二,从组织上来看,外部观察到的情况是,OpenAI 的 pre-training 核心团队一直挺动荡的。最早 Anthropic 的 Dario 带走了一批人,Ilya 离开了,CTO Mira Murati 又带走了核心 post-training 的人,包括早期比较核心的 inference 团队成员。原来的 pre-training 人员就得不断调到 post-training,我觉得团队动荡还是比较大的。
所以他们可能不是 top-down 地不重视 pre-training 了,而是因为组织调整的原因,显得不那么重视 pre-training 了。OpenAI 是一个自下而上的公司,做 pre-training 的好的人都走了。
张小珺
我觉得 Anthropic 和 xAI 的 pre-training 团队,可能比今天 OpenAI 的更强。
广密
我觉得是的。所以 o 系列虽然做得很快,但它不一定能打开智能的天花板。我觉得它更多是加强。现在能不能打开,我觉得没有标准答案。
张小珺
既然 o 系列做得很快,为什么 pre-training 还要继续?之前不是说数据已经不够用了吗?
广密
你看,2023 年我们就在提合成数据,对吧?但其实今天很少有人提合成数据了。恰好今天是 RL 产生更多合成数据,尤其是高价值的 CoT 数据,而且可以加到 pre-training 环节里。或者说,从 pre-training 阶段就做 RL,这就解决了 data bottleneck 的问题。
但这其实挺难,因为这里涉及训练框架和 inference 的问题。Training 和 RL 的 inference,我觉得要融合,这是一个很难的问题。要求 GPU 同时运行 RL inference 的 sampling 和 training。之前 training 是一套框架,inference 是一套框架,今天要把它们融合,对 inference 的要求很高。我觉得大家突破这个问题还是花了挺长时间的。
张小珺
外界认为 pre-training 的收益在放缓,投入产出的 ROI 也不那么明显。继续投入 pre-training,还能带来巨大的突破或者新的能力涌现吗?
3. Tool Use Creates Magic Moments
广密
我是很期待新的能力涌现的。举个例子,比如今天的 tool use。模型今天用电脑、用电脑上的工具,水平其实还只是我们爸妈用电脑的水平。我觉得后面很快可能就会到熟练程序员用电脑的水平。
Agent 可以在电脑和手机这种数字环境下,完成人类操作电脑的绝大部分行为。甚至很多你都不知道怎么操作的事情,Agent 也能完成。绝大多数人使用 Excel 公式的能力其实是不如 Agent 的,包括整个 Windows、Office 里面可能有上百万个功能点,Agent 都可以调用得非常好。
比如 Manus 就非常依赖 tool use 这个能力。我觉得可以说,Manus 就是 Anthropic tool use 能力的 ChatGPT moment。Anthropic 的 Claude 模型非常重视 tool use,他们专门做了可能几百个 tool use 相关的训练。因为他们只 focus 模型能力的提升,也不太着急做产品。
Manus 对 Claude 模型的理解非常棒,执行力也非常强,这让外界第一次感受到了 tool use 的 magic moment。我觉得这就好像 OpenAI 当年做 ChatGPT 一样。很多这种 magic moment,可能还是要靠模型内化的能力才能推动,pre-training 阶段是最关键的。
我觉得大家还要有一个 sense,就是智能没有上限,智能一定会持续变得更聪明。我们每年回看过去一年,都会发现智能技术的变化非常大。
张小珺
你觉得 Anthropic 的 tool use 能力的 ChatGPT moment,为什么不是 Anthropic 做的,而是 Manus 做的?为什么不是模型公司做的,而是一个外部的产品公司做的?
广密
当然,Manus 先把产品的壳做好,在外面等着模型能力变强。我觉得 OpenAI 和创业公司都没有预期到今天 Agent 来得这么快,其实他们还没有完全做好准备。模型公司和云厂商都还没做好准备。
张小珺
你觉得站在今天看,实现 AGI 是变得更清晰了,还是变得模糊了?
4. AGI Arrives Within Two Years
广密
我对两年内实现 AGI 有前所未有的信心。在我看来,概率是 100%。
张小珺
为什么这么快?为什么是在两年之内?这好像比之前的预期更快。你前所未有的信心,来源是什么?
广密
我觉得离 AGI 越近,AGI 就没那么神秘了。最重要的是想明白一件事:coding 可能是实现 AGI 最好的环境。
Coding 的意义不在于编程本身,而在于这个环境。现实世界绝大部分的任务,可能都可以通过 code 来表达。我觉得 coding 可能就是数字经济 GDP 活动最重要的一个环境,构建这个环境非常重要。
AlphaGo 当年的棋盘就是它的环境。百度构建的是通用搜索,index 是整个网页。淘宝构建了一个商品搜索的环境,携程构建了一个旅游产品搜索环境,BOSS 直聘构建了一个工作搜索的环境。
Coding 是一个非常通用的环境。我比较好奇一个问题:大家会觉得数字经济 GDP 和实体经济 GDP 未来的占比会怎么样?在没有互联网之前,可能 100% 都是实体经济。我觉得未来会非常极端。如果只看增量,增量的绝大部分可能都是数字经济 GDP,可能是实体经济 GDP 的成千上万倍。
未来人类的经济活动,大部分都是数字化的表达,最后都可以用 code 来表达。而且 Agent 可以调度物理世界的人和实体,去完成很多事情。我觉得 coding 可能就是模型的一只手。
你看 Manus 也给 Agent 搭了一个虚拟的电脑环境,让 Agent 操作电脑。两年以内,Agent 操作电脑和手机这种数字环境的能力,绝对会超过 99% 的人,能够完成正常人类 99% 的操作,而且操作得比人更好。
我觉得这是不是就是 AGI?两年内一定会实现,几乎没有什么障碍。
张小珺
你的表达很有意思:coding 是环境,coding 是模型的一只手。这两句话应该怎么更好地理解?特别是在 Anthropic 上,是怎么体现的?
广密
我觉得 coding 是环境。一个好的环境有两个重要特点:一个是动态,另一个是可操作。环境不仅包含数据和一些硬规则,还要让模型能够执行自己的想法,并且得到实时反馈。
符合这种环境要求的,主要还是 coding、gaming 和 science 相关的环境。Coding 是最通用的赛博世界环境。
模型的一只手,就像人类通过手去操作物体、改变环境。模型则通过生成和执行代码,实现对外部环境的采集、处理和反馈,这就是它像一只手的原因。
Anthropic 的模型设计了很多 tool use 的脚手架放到这个环境里,帮助模型更好地理解和操作环境。比如 OSWorld,包括 Computer Use,以及把环境中的 RL synthetic data 喂回 pre-training,我觉得都很重要。
张小珺
现在这么多大模型厂商,哪家的 coding 做得最好?
广密
我觉得现在每个模型公司都越来越重视 coding,但我对 Anthropic 的信心也是前所未有地强。我觉得 Anthropic 还能在 pre-train base model 上取得显著进步,做出下一代 SOTA,然后继续保持或者加强 coding 领域的领先优势。
Coding 也是 SOTA。你看,Cursor 现在是最火的独立编程工具 IDE,他们的 agent 已经超过 150 个命令了,我觉得年底可能会到 400 到 500 个命令。Claude Sonnet 已经变成 coding 的默认模型了。
Cursor 一个月可能要给 Claude Sonnet 支付 1,000 多万美元的 token 费用,这可能是第二名 OpenAI 的 4 到 5 倍。我觉得这就是开发者投票了。
张小珺
你觉得 OpenAI 为什么没有做好 coding?这反而给 Anthropic 留了机会。
广密
我觉得这可能不是技术问题。以 OpenAI 的能力和认知,他们肯定也很重视 coding,但过去一年左右还没做好,我倾向于是战略选择和组织问题。
做好 coding,要么是在 pre-training 阶段,在 code 数据集上花大量时间和精力,把实战型数据做得更细,比如各种标注。可能有人两年前就做了几百个门类的细分,但今天有的人也只做到几十个门类的细分。
要么就是有全新的方法,比如 RL。但我感觉这还是需要 leadership top-down 的战略决定和组织能力。当然也有可能 OpenAI 今天的 coding 能力还没有体现出来,未来某个时候发个大招也有可能。
Coding 是一个 trillion-dollar 级别的机会。只要 Anthropic 能在 coding 上持续领先,我觉得 Anthropic 有机会成为一家 3,000 亿到 5,000 亿美元的公司。Cursor 这样的公司,也有机会到 1,000 亿美元。
Coding 一定会出现抖音、拼多多、微信级别的机会。
张小珺
所以你觉得它们怎么变成 1 万亿美元,甚至 10 万亿美元这么大的规模?
广密
如果到 1 万亿美元或者 10 万亿美元,我觉得要在 AI for Science 上实现突破。
你看,一种减肥药每年都能卖出 1,000 亿美元的营收。未来如果攻克癌症、治疗所有疾病,我觉得就是十个这样的市场。全人类在健康上的消费,比今天在手机上的消费可能要大 10 到 100 倍。
张小珺
听起来,coding 更像是一种技术手段。但最终 coding 会成为最好的产品表达吗?它的产品形态会是 coding,还是 coding 只是一个路径?
广密
之前我们播客里提到过,coding 比搜索引擎和推荐引擎更重要。推荐引擎的表达就是信息流产品。Coding 本身是高门槛、高动机用户才能用好的产品形式。
如果做消费级产品,可能要淡化 coding 这种编程元素,因为用户门槛太高。产品表达是一种内容或者交互形式。抖音也不会说自己是推荐引擎产品,它说自己是短视频产品。
所以把 coding 当作一个技术引擎比较好,最后的表达可能是信息流产品。只是今天还没有定义好。我最近看到 Notion 的首席设计师加入 Cursor,其实挺期待 Cursor 在新的交互表达上做出新东西,包括 Claude Code。
张小珺
所以 coding 可以对标搜索引擎或者推荐引擎,但产品可能是百度或者抖音。只是今天的百度和抖音还没有找着。
广密
我觉得是的。
张小珺
现在看这些领先的模型公司,大家在实现 AGI 的路线上有差异吗?OpenAI 和 Anthropic 同宗同源,最开始路线都是一样的,但走着走着,核心战略的 bet 或路线已经发生了很大变化。
广密
你看 OpenAI 现在核心的 bet,我觉得有两个。一个是 OpenAI 希望通过 o 系列或者 reasoning model 实现 AGI;第二个是希望把 ChatGPT 做成一个 10 亿以上活跃用户的 Killer App,去掀翻 Google。
Anthropic 的核心 bet,第一个是专注做 pre-training,继续 bet on pre-training,做一个很强的 base model;第二个是继续 bet on coding,bet on agentic。
我觉得大家 leadership care 的事情不一样。OpenAI 更 care reasoning model、o 系列,Anthropic 更 care base model 和 coding。大家都有自己的 focus 和路线。
OpenAI 更重视 C 端市场,Anthropic 更重视 B 端市场。OpenAI 还是一个自下而上的创新组织,Anthropic 是一个自上而下的创新组织。
张小珺
OpenAI 和 Anthropic 为什么会出现这样的分化?从同宗同源,慢慢走向两条路径?
广密
可能是因为 Anthropic 的 Dario 他们就是做 pre-training 出身的,所以对 pre-training 非常有信心。大家可能都有自己的路径依赖。
OpenAI 最早的 Frontier team 做出了 o 系列。o 系列非常亮眼,对吧?Frontier team 的负责人 Mark Chen,现在已经成为仅次于 Sam 和 Greg 的第三号人物,所以肯定要给 o 系列更多资源。
加上 OpenAI 的 pre-training、post-training 团队变动比较大,o 系列的优先级肯定比原来的 pre-training 更受重视。战略选择本质上是不同组织能力的表达,也是不同人的表达。
公司内部可能有 pre-training 和 o 系列两股力量。pre-training 的人被削弱了,o 系列的人就被放大了,所以它既是组织能力的表达,也是人的表达。
张小珺
你觉得 o 系列能走到哪里?从 o1 开始,到 o3、o4、o5 继续走下去,它的天花板能有多高?
广密
o 系列刷 benchmark 刷得特别快,但我不确定这是不是足够本质。说实话,我也不知道 reasoning model 的落地场景到底是什么,因为它的主要表现还是 math 和 code。
数学好像没什么落地场景,也没什么市场。它主要还是 coding,但 reasoning model 提升的 coding,好像也不是实战型 coding,而是偏竞赛型 coding。
Anthropic 做的还是实战型 coding 更多一些,这要回到数据上。
张小珺
你平时在硅谷,觉得硅谷对于现在这些不同技术路线的认知,有什么分歧吗?
广密
我觉得分歧很大。这个问题背后的本质是:流量重要,还是智能重要?
OpenAI 有非常大的流量,Anthropic、Claude 几乎没有多少 C 端流量。我觉得这一点在硅谷的分歧很大。
硅谷很多 VC,比如 Sequoia 美国的 Roelof、Khosla Ventures 的 Vinod,这一派认为 OpenAI 今天应该变成一个大型消费互联网平台公司。他们觉得模型训练的资本效率很低。
他们最近也专门发了一篇文章讨论这个问题。我觉得他们是错的。这帮老牌投资人的 taste,喜欢经典的商业模式。但今天 AI 的商业模式都很差,还讨论不清楚。我觉得今天还不是讨论商业模式的时候,太早了。
我有点担心 OpenAI 过早走向一家消费互联网公司。今天产品和流量其实没那么重要,即便重要,也应该排在模型训练之后。大家的认知分歧确实很大,每个人都有自己的信仰和 bias。
我更相信 AGI 原教旨主义,智能最重要。构建一个 Google,除了赚钱,好像意义也没有那么大。今天是人类少有的窗口,可以去铺设智能,这个杠杆效应非常强。
在 AGI 的范式下,这是一个研究驱动的范式。很多判断产品和商业模式的惯性,可能都是错的。
张小珺
你说有点失望,是因为 Sam 把 10 亿用户作为首要目标,而不是 AGI first、research first、model training first,去推动智能边界。为什么?
广密
今天智能还处于非常早期的阶段,不能停下来。现在 OpenAI 的杠杆效应很大,几千个人可以改变几十亿人。我觉得不应该把构建一个新的互联网平台作为首要目标,普世智能才是最高的目标。
今天还有太多问题没有解决。攻克癌症,让世界上没有疾病,我觉得 OpenAI 有机会对人类产生非常大的帮助。不应该降低对科学的 vision,过早追求商业,可能会错过 AGI 科学的文艺复兴。
张小珺
Anthropic 和 OpenAI 这样不同的 bets,最后谁会是 winner?
广密
谁是最终的 winner,可能取决于智能水平走到哪里,各家模型能不能拉开显著差异。核心就是 base model 能不能显著领先其他人。如果智能往前走得很强,形成显著领先,我觉得就会有流量迁移。
那个时候流量是没有忠诚度的,这是非常关键的问题:base model 能不能显著领先。
你看 Google 在模型上无法显著反超 OpenAI。每次 Gemini 发点东西,Sam 都会狙击。Gemini 后面的模型做得其实很好,但流量一直上不去。过去一两年,整个 chatbot 的流量大部分还是去了 ChatGPT。
本质上,ChatGPT 的 base model 过去有相对领先优势,它把技术领先优势转化成了流量。
我也觉得 Anthropic 的 roadmap 很好,长期有可能 Anthropic 比 OpenAI 更有价值。我有一定 bias,因为我比较相信 AGI 原教旨主义。我更关心谁重视 pre-training,谁能先大幅 beat 对方的 base model。
Pre-training 一旦放松或者降低优先级,后面其实很难追。RL 和 reasoning model 是容易追的。一旦 Anthropic 做出更强的 base model,OpenAI 再从 o 系列切回来,我觉得会比较难。
从外部视角看,OpenAI 对 pre-training 的重视度可能不够,过多精力放在 reasoning model、ChatGPT 的 C 端各种 features 上,我觉得不够本质。
但我也觉得大家路线的差异其实无关对错。两家都在攀登珠穆朗玛峰。今天 AGI 的科学探索每天都在突破边界,每个团队都要敢于 bet,把自己的 bet push 到极致。
回头看 OpenAI,我觉得它对行业的贡献也非常大。虽然没有开源,但路线是 open 的,给大家指明了方向。所以我们还是一定要尊重和认可 OpenAI 对整个行业的贡献。这个领域竞争太激烈了,他们差异化的表面是战略选择,但本质还是组织能力的表达。
张小珺
国内有 DeepSeek 这样在 push boundary、而且开源的公司。你觉得其他公司还有必要继续训练自己的闭源模型吗?还需要那么多人一起去 push the boundary 吗?
广密
需要有很强的 training 能力。如果没有很强的 training 能力,你看不到很多风景,很多东西自己做才知道。
还有一条路线,就是可以先从 post-training 做题,甚至做 mid-training,最后再做 pre-training。但最后还是要有比较强的 training team,否则你没法向下改模型。
张小珺
应用公司需要做这些事情吗?
广密
我觉得想做大的应用公司,几乎一定要做。
张小珺
你刚才说智能还处于非常早期,但另外一些人觉得现在已经很聪明、已经够用了,模型的上限可能也就到这里,但已经足够做应用了。这两种认知的本质差异是什么?
广密
我觉得是想象力的局限。人类在没有汽车之前,最多的想象力就是一辆更舒服、更快的马车。人类一直围绕马车做了很多工作,但今天福特 T 型生产线已经滚滚而来。
我觉得今天可能就是福特 T 型生产线大规模生产智能的前夜。后来人类又发现还可以做飞机,还可以更快,这就是想象力。
张小珺
你有没有观察到,在这一波 AGI 浪潮下,越年轻的人越愿意相信智能边界无限?想象力可能跟年龄有关,年龄越大,想象力反而会递减。你有这种感觉吗?
广密
我也有。
张小珺
刚才你一直在提 AGI 的路线图。AGI 的路线图是怎么样的?特别是在 AGI 原教旨主义者眼中,它是什么样的?
5. The AGI Climbing Route
广密
AGI roadmap 是我最想表达的东西。AGI 探索就像爬一座科学的高山,最后谁能到达珠穆朗玛峰?大家要思考 AGI 登山的主线是什么,哪里是珠穆朗玛峰。
我最近脑子里反复想的一句话就是:智能提升是唯一的主线,智能本身就是最大的应用。所以我们还是要围绕智能本身去投入和思考。
你看,ChatGPT 走到 3.5,有了通用泛化性,解锁了 chatbot 对话能力。Claude 走到 3.5 Sonnet,解锁了 coding 能力,跑出了 Cursor。今天大家在解锁 Agent、agentic,未来可能还有 science、robotics。
大家脑子里可以有一张图:AGI 探索就是攀登科学界最高的那座山。今天回头看,ChatGPT 只是这座高山山脚的第一站,后面还有很多山头:coding、coding agent、general agent、AI for Science、robotics。这几个关键词都在登山主线上。
多模态、online learning、multi-agent,大概率也在主线上。这样就可以画出一条登山路线图,每个 milestone 都有代表性的名字:GPT-3.5、GPT-4、ChatGPT,Claude 3.5 Sonnet,OpenAI 的 o 系列、Deep Research,Cursor、Devin、今天的 Manus。
今天回头看,ChatGPT、chatbot 既是必然,也是偶然。但我觉得 ChatGPT 只是前菜,接下来的 Agent 才是正餐。
AI for Science、科学探索,才是那座珠穆朗玛峰。真的攻克癌症、治疗人类几乎所有疾病,会创造全新的经济增长和消费增长驱动力。你看,我们的父母和长辈未来为什么付钱?手机上已经付不了多少钱了,他们未来会愿意为健康和身体付钱,这会是消费最大的来源。
其实在这个路线图里,我们没有把 video generation 放进去。我觉得视频生成可能还不是今天的主线,文生图可能也不是主线。有可能这是 OpenAI 的烟雾弹。多模态理解是主线,但研究上还需要突破,突破的时间点不确定,但我感觉不会太久。
张小珺
你觉得多模态理解是主线,但文生图不是主线,因为它不产生智能?
广密
它也代表智能,但我觉得它不是实现 AGI 原教旨主义意义上智能的主线。还是基于语言本身产生智能。
另外,站在用户视角看,智能涌现或者登山,就是一个个 magic moment。每爬升几百米,用户就看到不同风景。用户可感知的差异,会带来巨大的流量迁移和应用爆发机会。
ChatGPT 是这一波技术革命最开始的 magic moment。Claude 3.5 Sonnet 是,Manus 是,Sora 也是,AlphaGo 最早也是。随着 model skill 带来更多智能涌现,用户会持续感知差异。一旦感知差异非常大,用户就会迁移。
张小珺
所以我就在想,OpenAI 的 ChatGPT 真的有壁垒吗?之前我们提到过,ChatGPT 的心智和品牌是很强的护城河,但本质上这个护城河可能很低。
广密
今天做 AGI 的模型公司也好,产品公司也好,其实都没有绝对壁垒,因为技术进步太快。这个护城河还在沙滩上,没法构建。
如果技术突然好 10 倍,比如出现一个多模态版本的 ChatGPT,或者 Agent 范式下的 ChatGPT,或者 Manus 这种可以大规模开放使用的产品,很多地方都能大幅 beat ChatGPT 的用户体验。
我对未来两年出现好 10 倍的技术,有前所未有的信心。所以今天最重要的事情,还是围绕智能主线,把智能能力本身往上推。
做应用,是要构建一个环境或者容器,承接研究溢出的智能红利。过去是 mobile 手机渗透的红利,现在最大的红利就是承接研究溢出的智能红利。
DeepSeek 就看出来了这一点。去年下半年我们以为国内前两名已经基本定下来了,但 DeepSeek 一出来,在那个时间点智能水平最好,就带来了产品爆发。
张小珺
但这会是终局吗?
广密
这也不是终局,还是动态的。DeepSeek 的 chatbot 在那段时间流量增长非常恐怖。如果它继续做下去,有可能今天已经有上亿 DAU,可以跟 ChatGPT 掰手腕。但 DeepSeek 选择了放弃,为什么?
一方面,DeepSeek 的组织文化决定了战略表达。它如果继续做产品,就需要一个产品团队,可能更适合它自己,也更适合 Meta。另一方面,Chatbot 今天的商业模式、变现效率和产品形态,可能都不是最本质的。
智能本身还是最本质的。今天智能的收益更可观,应该继续铺设智能。现在看,放弃可能是对的。除非未来 Chatbot 产品发生了质变,否则放弃是对的。
张小珺
你在之前的路线图上把 robotics 放在 science 后面,为什么?现在机器人非常火,为什么你把它放那么后?
6. Science Beats Robotics
广密
我对 robotics 的态度也有一些变化。从第一性原理看,今天做 robotics foundation model 或者 robotics research lab,方法上还不够本质。
第一是数据。OpenAI 或 GPT 语言模型能够有 scaling law,是因为有 Common Crawl 这样的数据集,持续抓取互联网上的数据。今天机器人的数据采集效率太低了。人操作几十台设备,每小时成本可能几十到上百美元。如果采集 1 亿个小时的有效数据,可能要几亿美元。Scaling law 的验证成本很高。
我期待 robotics 领域能不能出现一个通用或者垂直的 Common Crawl 数据集。
第二是算法结构。今天大家还没有达成一致,底层算法到底是哪一个,没有共识,还没有找到具有通用泛化性的架构。
从第一性原理出发,未来语言模型的 foundation model 多模态能力变强以后,先在数字世界实现 AGI,Agent 可以看电脑屏幕,执行各种二维操作。未来从二维世界走向三维世界,是比较自然的过程。那时对各种硬件的依赖也会降低。电脑也是一种硬件载体,应该让 AI 去适配各种硬件。
我对 AI for Science 的预期更高。说实话,上一波 AI for Science、BioTech,我觉得没有找出什么好药。现在有可能大幅推动这件事。比如在湿实验之前,可以先搭出一个干实验环境,用 Agent 构建一个虚拟实验室,变成 platform-based,也更容易 scalable。
AI for Science 现在已经出现了一些明显趋势。旧金山有不少创业公司,我也聊了一些,感受比较深。比如 self-driving lab 正在出现,也就是自动化实验室,这个趋势很明显。
各个垂直领域的 foundation model for biology 也在出现,包括蛋白质结构模型,已经到了类似 GPT-3 moment。甚至基因组级别的虚拟细胞 foundation model,也开始表现出一些智能。
如果构建一个 AI for Science 的虚拟实验室,这个实验室本身可以驱动很多工作。第一个是 workflow,各个环节都能提效。每个生物化学 PhD 都有很多重复性工作,Agent 可以 cover 很多重复工作和 workflow,让 PhD 的带宽、capacity 大幅放大,相当于把 lab 的 batch size 加大。
湿实验今天还是很难替代,但如果能让湿实验之前的 sampling size 和探索空间变大,也非常有意义。
第二个趋势是非垂直领域的 foundation model 也出来了,比如蛋白质、RNA。过去这些场景都要靠专家大量 trial and error,靠对序列的理解。这个领域很容易出现 superhuman,我觉得在 science 领域很值得思考。
我现在花了很多精力开始学 science。我觉得 2026、2027 年有可能是 AI for Science 爆发的时间点。
张小珺
最近我看到艾伦、朱啸虎有个新闻,说他们正在全面退出人形机器人公司。你怎么看这个判断?现在观点分歧很大,有人投了很多机器人公司,也有人彻底不投、不看。
广密
我们之前两期播客都提过机器人。我觉得 robotics 的技术成熟周期,可能和自动驾驶比较像。2015、2016 年就在提自动驾驶,到现在 10 年了,还没有大规模落地。
Robotics 肯定也会有技术的波峰波谷,需要一个成熟过程。第二,从第一性原理角度讲,它确实还不成熟,需要很多研究工作,才能看到所谓的 magic moment。
比如泛化性,今天机器人还没有看到泛化性,语言已经有泛化性了。最终真的需要物理机器人吗?如果虚拟 Agent 已经可以完成非常多事情,真的还需要物理机器人吗?
张小珺
你怎么看现在这些软硬一体的应用,包括眼镜?
广密
我更看好手机持续变得更强。
张小珺
你不看好智能眼镜替换手机,对吧?
广密
我觉得绝对不可能替换手机,最多是加强。眼镜今天更像一个 GoPro,一个可以记录一些东西的摄像头。
让我比较难受的是,如果既有眼镜、智能手表、指环,又有手机,一条垃圾短信会在各个渠道推送给我,很烦。
AGI 时代手机只会更强,不会被削弱。
张小珺
为什么?
广密
苹果很稳。我们的 context 输入输出,手机还是更稳定,因为最后云和端还是要结合,肯定需要一个端。手机已经变成人的器官了。
张小珺
说了这么多,智能本身是最大的应用。那智能的本质是什么?
7. Intelligence Expands Exploration
广密
这是一个极好的问题。每个人都可以想一想,也可以问 ChatGPT、Claude 或豆包,智能的本质是什么。每个人的理解肯定不一样,有想法可以打到评论区,我其实挺好奇每个人对智能的理解。
狭义上讲,智能可能就是归纳、总结、推理。抽象和宏大一点,智能可能就是人类的进化。
人类进化可能有三个关键词:生存、探索、自动化。生存是所有事情的基础。人类持续探索,形成经验、知识、群体组织,甚至形成国家、公司和制度。
自动化就是软件或者机械,因为自动化其实是对探索之后最佳实践的传递和标准化,持续帮助人类提高生产力。
人类社会还有一个 reward model,就是金钱,用来激励好的探索。人类有了金钱以后,经济总量增加得非常快,说明生态系统需要 reward 奖励系统。
AI 的智能为什么重要?我觉得 AI 能增加人类的探索空间。比如我是 ChatGPT、Deep Research 的日活用户,每天至少问三五个问题,它经常给我很多思路上的启发,是我自己完全没有想到的。
以前我可能一上午调研一个 topic,要搜索几百个网页,自己阅读几百个网页。今天可以把这件事交给它,一上午并行做三五个问题,甚至更多,让我做投资研究的 capacity 提升了很多。这相当于 scale 了我做投研的生产力。
未来,无数 Agent 可以虚拟出一个地球、一个虚拟实验室。数据和算力可以帮助人类做非常多探索。我比较认同 Anthropic 的 Dario 说的那句话:未来一个世纪的探索,可以压缩到 5 到 10 年。
为什么刚才要提 coding?我觉得 coding 就是未来 AI 自动化探索的结果。人类绝大多数任务都可以通过 code 来表达。
每个人理解的智能都不一样,没有标准答案。我很期待大家说说各自理解的智能本质是什么。
张小珺
你觉得智能进步的衡量标志是什么?
广密
有很多。一个可能是解锁 AGI 应用的速度,一个个 magic moment 不断出现。我觉得这个进程明显在加速,未来 AGI 应用会越来越多。
如果要量化,token 消耗量可能是一个指标。一个 chatbot 一次对话可能几千个 token,AI 搜索比如 Perplexity 一次可能几万个 token,但今天的 Manus 平均一个任务可能消耗 70 万到 80 万个 token。这个 token 消耗量,也是把智能榨干的一种表现。
还会有很多标志。AI 可能会做出很多超过人类认知的行为。比如模型开始写出人看不懂的代码,但代码非常 work,我们不需要知道它为什么 work,这种事情会越来越多。
张小珺
为什么 Manus 要消耗这么多 token?
广密
Manus 做的工作可能是几十步、几百步,甚至上千步。它要帮我阅读几十、几百个网页,还要调用很多次工具。每做下一步,前一步也非常重要,可能还要再放回 context window 里,所以 token 消耗量会反复增加。
这里对 long context 的要求非常高。
张小珺
它真的很快,速度上比人操作快很多。为什么到今天为止,我们的直观感觉还是 AGI 应用爆发的数量比较少?Agent 喊了这么久,虽然已经出现 Manus,但还没有出现真正大规模通用的 Agent。
广密
很大程度上,Agent 产品还处于供给受限状态。Agent 今天过度依赖模型能力。Agent 是一个新物种,模型公司和云厂商其实还没有做好 inference 方面的准备。
今天能说得上 Agent 的可能有几种。第一种是 Deep Research,处理文本类任务,未来可能和 Operator 集成。第二种是 coding 类任务,比如 Devin,未来 Cursor、OpenAI 也可能做 coding agent。第三种是偏通用的,比如 Manus,或者 Computer Use、ChatGPT Operator。
我上次和另外一个 AGI 原教旨主义的朋友聊我画的那张 AGI 登山路线图,他有一个很好的描述:智能水平离 AGI 越近,可能越像宇宙大爆炸。今天还可以画出单点的一条线,后面可能就没有这个单点了。宇宙大爆炸之后,可能就是百花齐放、全面展开。
我非常同意。AGI 的渗透今天很慢,但一旦到达某个临界点,爆发性会非常强。
张小珺
所以应用的多少和密集程度,取决于智能水平。
广密
是的。
张小珺
黄仁勋这次在 GTC 上重点提到 agentic 的新范式。关于 Agent 和 agentic 的关键能力,你有什么想说的?
广密
我觉得有 3 个 agentic 能力非常重要。
第一个是 long-context reasoning,因为 Agent 要操作很多东西。第二个是 tool use,也就是工具调用能力。第三个是 instruction following,指令遵循能力。任务很长,模型要理解完整指令,并且很好地 follow。
这 3 个能力,其实对应 3 种不同的 inference 能力。你要给 Agent 一个环境,这个环境可能是一台电脑、一个虚拟机、一个操作系统或者一个浏览器,环境非常重要。还要给 Agent 工具,以及 context 和 memory。
外界也经常提到 planning。Reasoning 很重要,action 也很重要。模型内在的 planning 能力非常重要,因为模型做多步骤任务时,要知道哪一步能实现,哪一步实现不了。
Reasoning 也很重要。Coding 本质上是每一步 action 的执行,执行会用到 tools。Instruction following 也是非常重要的能力。
这方面 Claude 是断档式领先,我觉得这和它 coding 强有很强的相关性。
我们上一期播客提到过 context 非常重要。我觉得 context 现在前所未有地重要。未来要完成任务自动化,需要调用各种背景数据。这些数据都存在我们的软件里:个人社交软件、旅游软件、电商软件。现在这些数据就像你的钱存在银行,但银行还没有网银。
需要有标准接口,把这些数据打通。我觉得 context 里存在支付宝级别的机会,long context 非常重要。
张小珺
我们应该怎么更好地理解 long context 的重要性?Agent 未来都是 long-horizon reasoning,有非常多步骤。假如要做 1,000 步才能解决一个复杂问题,后面每一步都要看前面很多步的结果。Tool use 最后返回的东西也非常大,很容易达到 100 万 token,这需要非常长的 context window。
广密
对。你要做一个复杂任务,可能要调用很多工具,返回内容很大,还要把前面的过程放进 context。Long context 还需要支持 self-reflection,也就是自我反思。
我觉得 long context 有效的做法,今天可能还没有真正实现,大家怎么解决还没有共识。包括 Google 的 100 万 token,本质上还是大海捞针,不是真正意义上的解决。
难点有几个。第一是数据,历史上很难找到 100 万 token 同时推理的数据。要做 long context,前提还是要有很多 long-horizon 数据集,但这个数据集不是现成的。
第二是成本,成本会平方级增加。第三是架构,今天的 Transformer 架构可能还是要改变。
接下来 AGI 的 milestone 可能是 long-term memory,它可能会取代 long context。因为当前 context 中,一个任务结束,内容可能就没了。Long-term memory 可能是一个解决方案,这也是很有意思的研究话题,但不知道什么时候能实现。
最简单地理解,long context 就是你有了电、有了智能以后,电线需要铺得很长,而且能耗很低,要把电送到很远的地方。MCP 就是插座,是标准插座;每个应用可能就是家电。
我觉得 long context 在终局时非常重要。所有 long-context 技术,本质上都是把很长的序列信息压缩。Linear attention 的主要问题是压缩不够动态,它压缩成固定大小,再尝试从固定尺寸里找到有用的信息。
压缩方式有很多种。比较 sparse 的压缩可以找到统计上的点,cluster 压缩可以找到相似信息。Linear attention 有点像傅里叶展开。
从根本上讲,最理想的压缩可能是把信息直接存到模型的 weights 里。也有人尝试 linear attention,但压缩比可能还不够,因为它本质上还是线性压缩。
张小珺
你说的 weights,是什么意思?
广密
就是参数、权重。包括 inference-time scaling,也是成本问题,本质上是平方级还是线性级的问题,因为更贵。
Long context 今天还不是一个有标准答案的问题,大家都在探索。
张小珺
这个问题今年能解决吗?还是更长期的问题?
广密
希望吧。
张小珺
你说两年内实现 AGI,这个确定性比较高,是沿着现有路径往下走吗?不需要新的路径?
广密
对,不需要新的路径。我觉得是 2026 年底到 2027 年初。
张小珺
到今天为止,AGI 的定义有没有发生变化?之前第一期播客可能提过,AGI 的定义是“3 个 90%”:在 90% 的行业达到 90% 专家的水平,能做 90% 有经济价值的工作。
广密
我觉得这个定义没有变。今天可以再加一个环境,环境变了,是在电脑和数字环境、计算环境下。有了这个环境,定义就更清晰了。
张小珺
如果现有路径不足以实现 AGI,还有可能有哪些新的路径?
广密
如果未来还有范式级路线,我觉得 online learning 可能算一个。Online learning 的核心不是 online real-time,核心可能还是让模型自主在线探索和学习。
这很像人类的生存方式:在生存和激励的基础上,保持充分好奇心,不断探索,把好的 workflow 抽象出来,做自动化,形成自己的 workflow。
在目前范式下,我能想到的 online learning,是让模型通过和用户交互,实时更新一些更小的参数。但什么情况下更新记忆、更新权重,今天还没有很好的 reward,也没有很好的目标定义。这对未来的 Agent 是一个挑战。
Online learning 也可以用模型微调实现,包括个性化 LoRA,甚至 multi-agent 系统。你可以定义一个 memory agent,来实现模型的记忆能力。
当然,我觉得刚才提到的这些方法可能都不能真正解决问题,也可能还会有很多完全没想到的新方法。
人也挺难的。每个人听到同一个内容,总结、提炼和记忆都不一样,这很依赖智力、经验和品味。智力是模型需要提高的能力,经验和品味也很重要。
Chatbot 这种对话产品,信号其实非常稀疏,在 Chatbot 产品下做 online learning,难度很大。
张小珺
你说得再直白一点,人类本身的 reward model 到底是什么?如果一定要找一个量化标准,可能是金钱。但金钱又不客观,有钱人不一定是好人,穷人也不一定是坏人。
广密
人类也缺少好的 reward model。历史上很多有钱人没有被铭记,反而是做出探索和科学突破的科学家、创新者被铭记。
Online learning 是一个特别值得研究的 topic。
张小珺
现在有没有谁在这方面研究得比较好?
广密
Ilya 可能在研究 memory 和 multi-agent。但这可能还不算范式级变化。
如果回到播客开头讲的,把 pre-training 的 scaling 和 RL 的 scaling 融合,在 pre-training 阶段就做 RL,我觉得这算半个范式级创新,因为领先模型可能都在做。
还有一个是全模态统一架构,多模态输入、多模态输出。统一架构的想象力很大,但研究上还需要做很多工作。
张小珺
这次 GPT-4o 能通过文本生成图片,它有创新吗?
广密
还是有的。这是全模态的第一步,或者前几步,算是创新。但非常耗卡。
张小珺
怎么理解每条路线的差异?
广密
可以画一个坐标轴。横轴是资源和精力的投入,纵轴是智能产出的 performance。然后画几条曲线:pre-training 是一条,RL 是一条,数据也是一条。
最后看坐标轴里每条曲线收益的走向,以及每条线的天花板。我觉得画出来之后,数据那条曲线可能收益非常高,所以大家要重视数据。
张小珺
基于刚才说的这些,对 GPU 或者英伟达的叙事有影响吗?
广密
未来可能有两个叙事,对英伟达算力的刺激比较大。一个是 pre-training 的叙事重新回来,第二是 Agentic 的 inference。它对算力的消耗,可能是 chatbot 的 1,000 倍量级。
后面做复杂任务都是 multi-agent 或者持续 inference,所以我对算力需求一直非常乐观。
张小珺
怎么看最近贾扬清的公司要被英伟达收购?英伟达在下一盘什么大棋?
广密
最大的棋,可能是英伟达应该变成云厂商,变成 AWS 和 Azure。但黄仁勋又要照顾和云厂商的关系,放不开手脚去做。所以之前支持了很多 GPU cloud,CoreWeave 这两天也上市了。
但这些 GPU cloud 的软件技术都非常拉胯,和 AWS、Azure 差得很远。如果让国内的火山引擎、火山云去帮黄仁勋做,可能都有得一拼。
我觉得贾扬清老师的 Lepton 全栈思路,比较符合 NVIDIA 要自己做云的战略。只能说贾老师卖掉 Lepton 卖得非常聪明,读懂了英伟达的需求。
张小珺
说到这里,你能不能总结一下上面我们所说的全部?
广密
第一,对实现 AGI 有了前所未有的信心。第二,对 pre-training base model 持续提升有前所未有的信心。第三,理清楚了 AGI 的主线和主峰。第四,对 Anthropic 也非常有信心,有可能它会成为比 OpenAI 更有价值的公司。
后面是得 coding、得 agentic 才能得天下。
张小珺
对于刚才提到的那部分人,他们选择在当下不再关注模型能力提升,而转向关注应用,看市场上有没有更多应用机会。你觉得这个判断对吗?这个选择对吗?
8. Research Must Drive Applications
广密
我觉得应该去做研究驱动的应用,而不是产品驱动的应用。
张小珺
AI 市场目前有没有泡沫?
广密
泡沫肯定有,但 Agent 的泡沫还没开始。过去半年到一年,已经有一波 pre-training 的 hype,RL 也有一波 hype。我觉得第三波 Agent hype 才刚开始。
后面有机会看到很多套壳公司 IPO,这很正常。
张小珺
现在 AI 技术在快速进步,但 AI 的产品和商业模式好像没有进步,普遍定价大概是每月 20 美元。我也很好奇,为什么今天定价都是 20 美元?是 copy 了 SaaS 的定价吗?
广密
SaaS 背后不会消耗大量 token,但今天的 AI 产品都消耗大量 token。相当于每家每户每个月的电费都是 20 美元,大家还都在狠用。
长期来看,这个定价偏低很多。比如招一个投资研究员,年薪 100 万元。如果 Deep Research 做得很好,我们是不是每年可以花 30 万元给它?这比较 make sense。你可以让一个研究员的 capacity 变成 3 到 5 个研究员的 capacity。
张小珺
会有绝对通用的 Agent 出现吗?
广密
能不能通用,取决于 pre-training 和 RL 这两个范式能走多远。另外还要看我们刚才提到的关键能力:planning、reasoning、coding、action、tools、instruction following 和 context。
这些能力本身也都是通用能力。如果这些通用能力都很强,可能就接近通用 Agent。
但今天怎么做 Agent,也是很大的非共识,大家还在不同路径上探索。
张小珺
Reward model 有答案了吗?
广密
我觉得泛化性非常关键,但今天的泛化性都非常微弱。
张小珺
接下来聊聊模型的壁垒和商业模式,以及模型和产品的关系。你觉得模型的壁垒和商业模式会怎么样?
广密
模型公司的 secret 其实没有保鲜期。湾区人员流动很快,大家带着不同信息在不同公司之间流动。
裸模型发布的时代可能会结束。未来模型如果要构建壁垒,可能有两个方向。
第一,成为云厂商。比如 OpenAI 自己变成微软之外的云服务商。第二,形成 OS,养出一个生态。后面大家可能都开始打造 operating system。
张小珺
OS 需要软硬一体吗?
广密
今天的硬件都在云端,就是 GPU。它想做端,除了手机,今天还没有看到特别好的端。
我也在想,OpenAI 的商业模式到底是好还是差。也有可能是好的。只要定价能持续往上提升,to C 的生意坦白说可能比 to B 卖 API 更好,因为毛利更高。
OpenAI 还是占据了比 Anthropic 更好的位置。Anthropic 真的在 bet on model capability,几乎不重视或者放弃 C 端流量。我也不知道这件事长期看对不对。
张小珺
投资人现在应该怎么投 AI 应用?这些应用公司怎么构建壁垒和护城河?
广密
投资人之间的分歧也很大。如果投应用,我倾向于投研究推动、research 溢出形成的产品和应用。如果是产品推动研究,我觉得不值得投。
今天应该花很多时间理解基础模型 research 的重大突破,去承接智能研究溢出的红利。应用创业者应该是盗火者,盗出智能溢出的红利。今天最大的红利,就是承接模型 research 结果的红利。
大家今天没有护城河,也想不清楚。比如用户积累的数据能不能用起来?Cursor、Perplexity 积累了那么多数据,怎么用起来?
第二是怎么构建独立环境。长期来看,想做大的 Agent 公司,都要具备向下调整模型或者做 research 的能力。不然容易被模型公司,或者能向下调模型的公司干掉。
张小珺
对于用户数据能不能用起来,现在有结论吗?
广密
结论非常微弱,应该没有大的用处,不能形成闭环。所谓数据飞轮,今天 ChatGPT 收集的很多是偏好数据,偏好数据更多是帮助 push MAU,但不能提升模型能力。
提升模型能力的是能力数据。但能力数据不在用户那里,因为模型今天已经比绝大多数人聪明。闲聊不产生智能。
张小珺
常见来看,模型公司会把产品吃掉吗?我们先做一个应用、做一个产品,在前面等着模型公司能力变强,模型公司长期会反过来吃掉这个产品吗?
广密
这个问题本质上是 feature system 和 learning system 哪个更快。
模型本质上是进步速度非常快的 learning system,越来越多能力和 features 都会内化到模型上。模型上面的脚手架,几乎每一次都要持续重置。
套壳的价值越来越小,但会持续产生新的套壳价值。套壳阶段性的价值都存在。所以做应用、做套壳,执行力要特别快,退出也要快,退出之后赶紧做下一个事情。
过去两年的 record 来看,聚焦产品驱动的公司绝大多数失败了,聚焦模型本身的公司都成功了。但 focus 模型本身,不代表一定要自己 pre-train 模型,也可以做模型的盗火者。
Perplexity、Cursor、Manus,都是模型的盗火者。
张小珺
为什么 Perplexity 作为模型盗火者,没有被模型公司现在吃掉?至少目前还没有。
广密
还是刚才聊到的 OpenAI 的战略选择和组织能力。Anthropic 的战略选择是做企业级,它不需要联网搜索,直到最近才加联网搜索。
今天最大的应用还是 ChatGPT。ChatGPT 过去两年的增长非常快,已经接近 7 亿月活,4 亿多周活跃用户。ChatGPT 在 chatbot 里的市场占有率持续提升。
这代表核心价值还是被基础模型公司拿走了。如果今天我是 Cursor 的 CEO、Perplexity 的 CEO,我的危机感会很强。我还是会担心模型公司明天升级这个、升级那个。
Perplexity 的 Deep Research,不如 OpenAI 自己的,也不如 Grok 原生的。Cursor 也是因为 Sonnet 3.7 出来,基本上修了 3、4 周。之前 Cursor 有一套自己的外部脚手架,但 Sonnet 3.7 在 model training 时已经内置了一套脚手架,所以两者发生了冲突。
Cursor 也把 Midjourney 做 training 的人招了过去,我感觉它也要做端到端训练,包括自己的定向模型。每一款想做好、做大的超级应用,长期都需要端到端训练,以及 post-training、RL 相关能力。
但这里还存在一个问题,比如 Perplexity,取决于模型公司能不能自己做好产品,这考验战略选择和组织能力。Anthropic 的优先级不是做产品,它继续做模型,做得风生水起。它认为模型是更重要的事情,DeepSeek 也不着急做产品。
今天智能 research 的收益可能还是更重要的。但 Cursor 和 Claude、Sonnet 的关系说明,未来模型和产品的边界会越来越模糊。应用公司会做自己的模型,模型公司也会向上做产品。
张小珺
Agent 对 SaaS 公司会有什么影响?如果一个 Agent 到了真正本科生的水平,还需要 SaaS 吗?
假如 Agent 有无限 memory、online learning,Agent 自己还会做 research。相当于你的 iPhone、微信,全部权限给了我,我花 1 万个小时研究你的微信,我是不是比你还懂你自己?
广密
那有了 Agent 之后,SaaS 公司的存在价值是什么,我确实不知道。
张小珺
现在是不是很多之前做 To B 的人,去做 Agent 是一个很好的选择?
广密
我觉得是。
张小珺
GPU computing 的投入很大,capital efficiency 也不够高。模型训练的经济性怎么理解?
广密
你看 OpenAI 几百亿美元的投入,其实是给全人类提供了一个巨大的技术杠杆。几千个人杠杆了几亿人的生产力,我觉得这是很伟大的事情,也给今天通胀的世界提供了巨大的通缩力量。
传统软件开发,需要把一个个功能点开发出来。现在的应用开发,70% 到 80% 的东西都不用开发,已经包在模型里,直接调用模型能力就好。
相当于 model training 把人类未来 10 年的 R&D 成本提前投入了。这是人类面向未来的巨大投入,我觉得其实还好。
张小珺
很多人讨论模型和应用的关系,以及两者未来价值链的划分。你怎么看?
广密
今天价值链、利润池的划分非常不合理。你看从 NVIDIA 到 AWS,到 Anthropic,再到 Cursor,NVIDIA 几乎拿走了 80% 以上的利润,AWS 拿走 30%,Anthropic 是亏损的,Cursor 也是负毛利。
长期利润会往后移,AWS 的利润会起来,模型和应用的利润也会起来。我对模型公司的长期价值信心越来越强。
张小珺
你预计 2025 年 AI 领域会出现哪些黑天鹅?
广密
DeepSeek 已经出现了,后面持续出现的概率会越来越大。而且黑天鹅可能会把很多模型公司的下限打得非常低。
张小珺
什么叫下限打得很低?
广密
就是价值毁灭。我们第一期播客就提到,模型训练是一个价值毁灭的事情,但它对长期价值又很重要。
比如 DeepSeek R2 追到 o3 的水平,对生态是好事,但还算不上黑天鹅量级。能算黑天鹅的,比如 Ilya 再做出一个全新架构,学习效率非常高,只需要很少数据和一定算力就能变得很聪明。全新架构算一个。
又比如 Mira Murati 的新公司,如果做出一个多模态 ChatGPT,能不能 beat 今天的 chatbot 形态?或者谁定义出新的 Agent 产品形态?我觉得还会有很多黑天鹅,但不确定会从哪里爆发。
张小珺
接下来更新一下全球大模型公司的竞争格局,这是季报的传统。OpenAI、Anthropic 刚才已经聊了不少路径分化,能不能说一下你理解的现在其他基础模型公司的竞争格局?
9. Model Companies Consolidate Power
广密
刚才我们提到,OpenAI 现在核心 bet 有两个:通过 o 系列 reasoning model 实现 AGI;把 ChatGPT 做成 10 亿以上活跃用户的产品。
Anthropic 的核心 bet 是专注 backbone pre-training,做一个很强的 base model;再做 coding backbone 和 agentic 生态。
OpenAI 更重视 C 端,Anthropic 更重视 B 端,这是外部感受。
虽然刚才有一些对 OpenAI 的吐槽,但从实际格局看,OpenAI 过去两年的领先优势其实在加强。它让整个模型训练格局收敛得非常快,小模型和垂直模型公司可能长期都不存在。
我们第一期播客也聊到过,可能基础大模型公司会 take 一切。ChatGPT 流量集中度在大幅提升,其他 C 端产品几乎没有真正长大。Perplexity 的量今天也没那么大,最后流量都回到 ChatGPT。
从 AI-native revenue 的角度,我觉得 OpenAI 的 Sora 几乎拿走了整个市场 80% 的 revenue,其他人好像没有拿走什么。Cursor 其实也在给 Anthropic 打工。
拿 Google 和 OpenAI 对比,Google 过去一两年几乎没有从 OpenAI 这里抢走什么。OpenAI 的增量用户持续变强。最近 OpenAI 又发布了文生图产品,ChatGPT 过去两年越来越丰富。
ChatGPT 在显著进步,但 Google Search 没有显著进步,甚至市场份额开始下降。一旦 Google Search 的份额显著下降,会非常可怕。
OpenAI 盯着 Google 打,可能想成为下一个 Google。但说一句难听的,OpenAI 其实 kill 了很多创业公司的机会。OpenAI 生态里没有长出什么大公司。Open S D 都是跟 Anthropic 合作,Chris 也是跟 Anthropic 合作。OpenAI 想做苹果,Anthropic 想做安卓,但理论上 OpenAI 既可以做苹果,也可以做安卓。
之所以 Anthropic 还能活着,xAI 还能活着,背后还是阿莫总跟马斯克撑着。如果不是这两个大腿撑着,我觉得可能早就掉队了。
但 Anthropic 团队还是很强,超预期。Anthropic 的生态越来越好,出现了 Cursor、Manus。DeepSeek 完全是意料之外,但 OpenAI 和 Anthropic 似乎受到的影响都很小,这也很神奇。
DeepSeek 和马斯克的 xAI、Grok,我倾向于认为还是在 follow OpenAI 现有路线,先把 OpenAI 今天实现的东西追平、逼近,没有实现反超。需要在追平基础上再有新的 bet。
Google 的特点是多模态能力很强,最近的新模型也很好。Google 还是 follow 为主。之前开玩笑说,Google 是被 OpenAI 领导的公司,经常在 OpenAI 发布新东西两三个月后追平,甚至反超,但每次又受到 Sam 的狙击。
Gemini 今天的流量还是很小。
张小珺
GPT-4.5 算领先吗?
广密
把 model size scale 到很大,意义还是重要的。不 scale 上去,就相当于登山没有登到很高的位置,看不到那个 view。
我相信 GPT-4.5 可能还是会比较强,只是很多能力今天还没有被激活和挖掘出来。GPT-4.5 的意义可能比 o3 还大,就看谁能把 model size scale 到足够大的程度。
张小珺
GPT-5 还会一直跳票下去吗?
广密
可以换一个角度想。如果 OpenAI 和 AWS 合作,而不是微软,是不是 GPT-5 可能更早出来?微软的 infra 能力是不是比较拉胯?
如果有一半时间都在 debug,那就相当于 GPT-5、AGI 的时间延长了一倍。
张小珺
你觉得 GPT-5 会长什么样?
广密
Sam 在 Twitter 上说 GPT-5 也会是 hybrid model。我猜肯定会是 GPT 系列作为 base model,再融合 o 系列。
但今天 GPT-4.5 这个模型那么大,做 RL 可能跑不动,成本太高。估计还需要一个比 4.5 小、但能力也非常强的模型。之前可能都是基于 GPT-4o 的 base model,我觉得 GPT-4o 可能很快退出历史舞台,需要新的旗舰模型支撑。
张小珺
什么时候能看到?今年夏天吗?
广密
我估计今年夏天应该还是会有 GPT-3.5 到 GPT-4 量级的提升。今天 benchmark 上可能看不出来,因为人的 benchmark 不一定能发现模型背后的暗物质。
张小珺
最近我看到 OpenAI 支持 Anthropic 的 MCP 协议。你怎么看这个事情?他们两家公司现在是什么关系?
广密
基本确定,这就是 AI Agent 的 TCP/IP 协议。
第二,OpenAI 似乎也挺尊重 Anthropic 这个团队。一帮老大哥专注做 research,不 hype,比较踏实。Sam 好像也挺大方、挺大气。
虽然有竞争,但大家的路径在分化:一个做 to C,一个做 to B,关系还可以。
张小珺
OpenAI 和微软为什么会有裂痕?这个裂痕会破裂吗?
广密
我们想一下,7 万亿美元和 5,000 亿美元本质上是什么。如果 Sam 有了 5,000 亿美元现金,OpenAI 是不是就变成新的 Azure 云服务商?那它会不会和 Azure 发生根本冲突?
5,000 亿美元可能就是它能圈到的市场上几乎能圈到的所有钱,那 OpenAI 就不需要微软了。
张小珺
这个分家对微软影响更大,还是对 OpenAI 影响更大?
广密
肯定是微软。
微软的 Azure 起了个大早,我觉得有可能成为 AGI 的 loser,但也不至于到 loser 这么显著,因为 OpenAI 很多 inference 还跑在上面。
微软手上有一堆好牌,但没有打好。开发者产品都被 Cursor 和其他公司做出去了。今天的 foundation model 就是下一个 Windows 操作系统。如果微软没有这些操作系统和开发者生态,会比较困难。
所以我现在更看好 AWS。
张小珺
OpenAI 当然还是一面旗帜,但我们也看到它有各种问题。OpenAI 有没有失败的风险?风险有多大?
广密
整体还好。刚融了 400 亿美元,未来两三年至少比较安全。它的 C 端领先还是一骑绝尘,也比较稳。
今天投 OpenAI,可能是投消费互联网公司的逻辑,看它能不能成为下一个 Google。OpenAI 很快可能接近 3,000 人,确实有点走向 Google。
但组织一旦变大,就比较难专注。它是否还足够聚焦 AGI research,是否足够清晰?他们可能要做的事情太多了。
我更关注 OpenAI 接下来会砍掉什么业务,比如干脆放弃 API,专注做好 C 端 ChatGPT,做好更多产品,做好 coding agent,去掀翻 Google,这也是一个大的 bet。
历史上同时把 C 端和 B 端做好的公司很少。微软做好了 B 端,C 端其实没有做得很好。
OpenAI 最大的风险是 base model 不够领先。别的模型公司先做出更强的 base model,又有很多开发者在这个 base model 上做出 super app,就会抢走 ChatGPT 的流量。
现在还是快速技术进步周期,不能停下来。
张小珺
xAI 的 Grok 今天的突出能力是什么?
广密
Writing,写作能力比较突出。但 writing 市场其实很小。
xAI 和 Twitter 合并,我觉得也在情理之中。Grok 没有一个基本盘,因为 OpenAI 有 ChatGPT,并且持续加强;Anthropic 占据 coding 和开发者 Agent。
Grok 只能先拿 Twitter。反正也是同一个老板。
我对 xAI 的印象是执行力超强,可能没有哪家公司比 xAI 执行力更强。Infra 能力非常强,production 团队也很强,很多朋友的工作常态是凌晨三四点、四五点下班,强度非常大。
Grok 3 很不错。说它是 base model 里的 SOTA,至少绝对是第一梯队。他们也会持续训练更大的模型。
张小珺
你觉得他们为什么合并?
广密
xAI 的 Grok 缺一个产品形态,但 Twitter 也不一定是最正确的新产品,毕竟它是老产品。它是在老产品里加一个 prompt,也有一个新的入口。
我觉得主要是为了流量。ChatGPT 可能已经有六七亿 MAU,Twitter 现在有 5 亿多 MAU,算是一个量级,但 ChatGPT 其实更大。
张小珺
Ilya 想做的 ASI 和 AGI,本质差异是什么?实现 ASI 还需要什么?
广密
AGI 更像普通本科毕业生操作电脑,ASI 更像爱因斯坦。实现大学毕业生和实现爱因斯坦,差别非常大。
实现 AGI 的确定性已经很清楚,但实现 ASI,可能还需要一些突破。很有可能 Ilya 是赢在两年以后,不和今天的 OpenAI、Sora 竞争。
AGI 强调的是通用的人类水平。ASI 强调的是领域超级专家的水平,在一个领域内发现新的知识,批量实现最强专家,并自动化一些 SOP。
也有可能 Ilya 想做的是通用超级专家,但超级专家能不能通用,是否真的会有 1,000 万名通用的诺奖级爱因斯坦,还有待验证。
人类历史上很久没有真正的通才了。我觉得 ASI 可能会带来专业知识领域的垄断。一个领域内的顶尖专家,能够交流的对象很少。
Deep Research 已经成为很多领域顶尖专家的 thinking partner。定价 200 美元,很多科学家都愿意付,因为很少有人能陪我 brainstorm 很多事情。
但今天的 Deep Research 还是信息收集能力。我觉得 ASI 有可能基于这些信息产生新的知识、新的定律和总结。对一个学科、一个领域来说,价值非常大,甚至可能点亮一些科技树。
今天最接近 ASI 的领域,可能就是 AI coding,进步速度非常快。
张小珺
你怎么看 Mira Murati 的新公司?
广密
团队非常好,甚至远强于 OpenAI 早期团队班底。OpenAI 最核心的 post-training team,包括 Lee 的 Barrett 以及另外几个核心成员,还有最早 infra team 的核心,都被 Mira 拉过去了。
他们的 infra 和 post-training 都很强。能够吸引这么强的班底,说明很厉害。而且 Mira 很大方,听说很多人拿到了很多股票。
模型复现的时间越来越短。Anthropic 的 Claude 追到 GPT-4,大概花了两年;Mira 的团队可能一年甚至更短。但他们追 base model 肯定不是目标,应该还是产品思路。
张小珺
他们想做什么?
广密
可能是做一个能 beat ChatGPT 的产品。Mira 之前在 OpenAI,对发布 ChatGPT 有很大影响,可以理解为这个团队是做 ChatGPT 的几乎核心团队。
OpenAI 剩下的团队,是 push AGI、推动智能的团队,但后来又分裂出一个做 o 系列的团队。
Mira 现在不一定已经把产品形态想得很清楚,但肯定是奔着做产品的方向,不管是多模态 ChatGPT,还是 Agent 范式下的 ChatGPT。
另外,Mira 可能代表另一种意识形态。Mira 比较欣赏梁文锋。她可能认为 Anthropic、OpenAI 代表的是一种美国精英思路:闭源,领导层有道德约束,所以 AGI 不至于做坏事。
但 Mira 可能更信奉开放的 AGI,认为这个 power 应该交给社区。我听说他们可能在 DeepSeek V3 的基础上做 post-training,因为他们的 post-training 特别强,未来再做 mid-training 和 pre-training。
我觉得他们应该还是走应用优先的策略,可能也会开源一些研究。这也是组织能力下的 bet 和战略选择。
张小珺
所以他们第一步不是自己先做 pre-training,因为没有必要,DeepSeek V3 还挺好的。
广密
对。不同战略选择背后,也是不同价值观和不同组织能力。
张小珺
之前我们有一期播客专门聊 Perplexity。能不能对比一下今年火的 Manus 和 Perplexity?
广密
我觉得他们都是执行力非常强的人,都被叫作各个地区的 to C 之王。
他们都是打开潘多拉魔盒的人,Manus 更明显。Manus 是一个 token 容器,能比较极致地榨干模型智能。模型越好,对 Manus 越好。Manus 非常吃模型能力,更强的模型它都能吃得下。
模型越好,对 Perplexity 的体验增加就没有那么突出。Perplexity 是抓住了两年快速成长的窗口期。那两年 ChatGPT、Claude、Google 都没有做好,给了 Perplexity 成长到一定规模的机会。
但 Manus 今天面对的竞争环境更激烈,没有那两年猥琐发育的时间。所以肖弘和张涛怎么打好这张牌,要求很高。
Manus 在主线上是智能的主线,这也让人兴奋:它登上了全球最高水平的赛场,去打 NBA。
张小珺
很多人说他们发布产品时其实还没有准备好。你有什么建议?
广密
火爆肯定是超预期的。建议就是重视 research,未来肯定要做 post-training、RL 相关的工作。
张小珺
你觉得 Deep Research 会做 Manus 吗?Deep Research 的未来是什么?
广密
Deep Research 是 OpenAI Agent 的雏形,后续肯定会集成很多东西,比如 Operator、各种工具、coding。
未来 Deep Research 可能是一个 general agent,但有两个方向还不确定。一个是走向 Google,变成更高级的 Deep Search;另一个是走向专业化,变成 co-scientist、co-analyst、co-worker。
张小珺
你对 Devin 和 Kimi 这两个产品的状况,有没有一些更新的认知?
广密
Devin 抓住了一个时间窗口,是一个提前等待模型、比较激进的想法。但它解决的问题容易被模型公司覆盖。
它 target 的任务类型,要么模型能力不 work 的时候它也不 work;模型能力变强、任务 work 了,Devin 可能又没有价值。
Cursor 今天 interface 的交互价值比较大。但如果智能很强了,未来还需不需要交互,我不知道。可能几句 prompt 就能解决很多问题,Cursor 今天的形态可能只是阶段性的。
所以 Cursor 招了 Notion 的首席设计师,也招了 Midjourney 做 training 的人,肯定会探索新的交互形态和自己的 model training。
张小珺
那 DeepSeek 呢?虽然它也是模型公司,但也是一个非常成功的产品。
广密
DeepSeek 的创新,建立在幻方量化很强的 infra 积累上。这个 infra stack 非常 solid。
坦白说,DeepSeek 今天真正科学探索上的范式级创新还相对少。我挺期待 DeepSeek 出现范式级创新,未来有可能吧。
张小珺
全球范围内,你觉得对 AGI 推动贡献最高的人是谁?有没有你心中的排名?
广密
贡献和水平可能要分开。Ilya 和 Noam 这两个人的贡献最大。
Ilya 像一个神,几乎指明了今天整个行业正在走的核心路线。现在行业可能还会沿着 Ilya 指出的路线走很长时间。
2020 年所有人还在关注 BERT 时,还没有出现 LLM 这些范式,Ilya 当时就提出 pre-training 和 RL 的路线。他非常 visionary。
Noam 的贡献主要在架构上,是架构之神。他们两个人的贡献和水平都非常高。
其次可能是 Dario 和 Alec。Alec 刚离开 OpenAI,他的成就是 GPT-1。Dario 的成就是知道行业和技术走到哪一步,taste 非常好。
如果不是 Dario 继续坚持 scaling,从 GPT-3 开始继续扩大规模,OpenAI 可能就停在 GPT-1 了。
之后可能是 Sam Altman、Mira。Mira 的新团队非常强。
张小珺
你都没有提 Sam。他呢?
广密
Sam 对业界贡献很大,主要是把 hype 弄起来了。他想象力非常大,帮助很多人打开想象空间,裹挟大量资源进入 AGI 行业。
从业者做 research 获得了更多 GPU 资源,个人待遇也提高了很多。我觉得这是 Sam 非常大的贡献。
Sam 的综合能力还是很强,但我感觉他一些外部行为具有迷惑性,可能有各种烟雾弹。有时候他发布的东西不一定是主线,最近的事情可能就是烟雾弹。
张小珺
刚才我们说了很多 AI 认知。回到你的工作。如果给你 1 亿美元或者 10 亿美元,让你今天构建一个 AGI portfolio,在全球范围内投资,按照最新估值,假设都能投进去,不考虑抢不抢得到 deal,你会投哪些公司?站在财务回报角度。
广密
我会投 25% 给 Anthropic,25% 给 Baidu自己,10% 投 OpenAI,10% 投 Mira 的公司,5% 投 Ilya,5% 投 Manus。这是 85%,剩下 15% 还没想好。
如果 DeepSeek 融资,我也愿意放基金的 25%。我觉得这个团队很强。
有意思的是,我认识的 researcher 朋友,几乎 99% 都觉得自己的 upside、股票 upside 比 OpenAI 好,甚至很多 researcher 个人都想去买字节的股票,这很神奇。
张小珺
为什么?
广密
字节比较低调,也被低估了,而且 revenue 很大、利润很好。比如 2030 年,OpenAI 的营收和利润可能还远远不如字节今天的营收和利润,但它们今天估值一样,都是 3,000 亿美元。
张小珺
同样是 3,000 亿美元,你去投字节还是投 OpenAI?
广密
字节今天的 AI 产品还不一定能增进原有老产品,也不一定能让旧产品扩大 10 倍。
但 AGI 的未来,今天的 revenue 和利润都是走向未来的养料。OpenAI 还需要外部融资,字节可以内生赚钱,赚 1,000 亿美元去投 AGI。OpenAI 未来能不能融到 1,000 亿美元,我不知道。
张小珺
为什么不是字节做出 DeepSeek?
广密
我觉得是大组织和小组织的区别。字节未来可能也是更灵活的组织。组织很关键,组织能力非常关键。
张小珺
为什么小组织更容易成功?
广密
因为今天的 AGI 是科学界的探险。小组织更灵活,敢于 bet。做 AGI,赌性非常重要。
张小珺
你为什么在这个 portfolio 里放给 Anthropic 的钱比 OpenAI 多?
广密
我对 Anthropic 团队更有信心,对 prediction base model、backbone、coding agent 更有信心。我比较 enjoy 他们的 roadmap、战略重点和组织能力。
张小珺
Anthropic 目前估值多少?
广密
最近是 615 亿美元。
张小珺
OpenAI 最新估值是 3,000 亿美元。Mira 的公司最新估值是多少?
广密
100 亿美元。Ilya 的公司是 300 亿美元。
张小珺
为什么放给 Mira 的公司比 Ilya 的公司多?
广密
我觉得 Ilya 公司的失败风险非常高,Mira 公司的成功概率比较高,更依赖科学探索。
张小珺
Mira 的公司大概率会被收购?
广密
对。我觉得不管是 Apple 还是 Meta,大厂都需要一个 Mira team,需要一个非常强的团队、非常好的文化和组织。
张小珺
所以 Mira 的确定性更高。
广密
对。
张小珺
Manus 和 Cursor 放的钱一样多,为什么?
广密
这是两种模型能力的表达。一个是 coding、coding agent,一个是 tool use,代表两个应用方向。
张小珺
整体来说,你还是会在基础模型公司上放更多钱,相对应用公司来说。
广密
今天仍然是仅有的一点点时间窗口,可以投 AGI 基础模型。
张小珺
如果 DeepSeek 开放融资,你放的钱跟字节和 Anthropic 一样多?
广密
是的。因为基金上限是 25%。
张小珺
作为投资人,未来 3 到 5 年你在投资上会做的最大 bet 是什么?
广密
最大的 bet 是 AGI 带来科学的文艺复兴。
具体来讲,我觉得 2030 年之前会有多家超过 10 万亿美元市值的公司。具体表现可能是下一个 Google、下一个 Windows、下一个 Office、下一个 Meta,以及下一个辉瑞、礼来。
Next Google 已经有雏形,可能就是 OpenAI。Next Windows 可能是 Claude,Claude 可能是新的 Windows 或者安卓。Next Office 可能是接下来要争夺的 coding agent 或 general agent。
Next Meta 今天还看不到。AI for Science 里可能会有下一个辉瑞、礼来。当然辉瑞和礼来未来也可能变得非常强,自己成为几万亿美元的公司。
张小珺
刚才讲了很多,其实都关联到组织文化。在 AGI 时代,组织文化作为关键竞争力被低估了吗?
10. Organization Is The Core Edge
广密
组织和文化的竞争力,仅次于算力,是核心竞争力。
DeepSeek 给了很多启发:灵活的小团队,敢于 bet。做 AGI 需要赌性,有限资源就要猛做一个大的 bet。
OpenAI 早期的赌性也很强,但组织变大后,下注阻力也变大,没办法快速下注。我感觉 OpenAI 的赌性逐渐变弱了,因为它想要的东西比较多。
核心是看一个组织敢于放弃什么。AGI roadmap 和战略选择可以变,但都处于组织能力之下。
人才密度比人才数量重要非常多。AGI 很像探险,每一刻都在突破边界,所以每个位置上的人都非常关键。
张小珺
怎么判断一个组织是不是 AGI-native?什么是好的组织、好的文化?
广密
有几个特点:能不能做到 AGI first、research first、researcher first;有没有 AI 一号位;有没有领军人物;优秀 researcher 愿不愿意加入;有没有自己的 bet;有没有人才 promotion 机制;到底什么样的人被重视、被奖励。
团队成员应该年轻、聪明、有想象力、有执行力。经验完全不重要,资历也不重要。想象力、年轻和执行力特别重要。
AGI 和模型训练没有那么神秘,就是做研究、做实验、做工程。但组织特别关键。
大概率 2025、2026 年,仅仅这两年,就会看到很多个 GPT-3 到 GPT-4 级别的智能跨越。
很多科技公司管理层跟不上技术突破节奏。面对 research 的巨大突破,怎么投入、怎么判断、怎么选 AI 一号位?你想豪赌,有时候都不知道该怎么赌。
我上次和老王聊天很有意思,他提到不应该再持有不 all-in AGI 的科技公司。我觉得这是对的。
如果想在 AGI 时代做一个有想象力的事情,就不要恋战今天的产品形态、商业模式和旧组织。这个时代的秩序变化非常剧烈。
我们这个播客讲的就是,把智能技术提升当作唯一主线,把智能本身当作最大的应用,也把 90 后甚至 95 后研究员放到核心管理层,选好 AI 一号位。
张小珺
纵观全球这么多公司,你觉得哪些公司现在看起来可能最先实现 AGI?
广密
大概率还是 OpenAI 和 Anthropic 最先,其次是 Google 和 xAI。中国至少有三四家也能实现 AGI,字节和 DeepSeek 可能最确定,另外肯定还会有一两家。
张小珺
开源和闭源的比例会怎么占?
广密
DeepSeek 等于开源,字节也有可能开源。中国走开源未尝不是一个很好的路径,自己也可以开源。我觉得应该开源一些。
张小珺
硅谷对中国 AI 进展的态度,在 DeepSeek 之后发生了巨大变化吗?你怎么看中美 AI 走势?
广密
只要是在现有路径下,美国实现 AGI,中国复现就是必然。过去两年中美差距毫无疑问在快速缩小,很多地方每 3 到 6 个月就在追平。
中国人才非常强。美国头部有很多世界级顶尖科学家,但中国再往下一些,可能几百、几千个中坚一线人才,来自庞大的教育体系,积累了非常多优秀人才。
除了 DeepSeek,我最看好字节,因为后面 skill-based model 需要非常强的 infra 能力,字节也花了很多力气做 infra,价值会随着时间慢慢出来。
如果 infra 比较差,不仅是成本问题,可能根本没办法爬到某个高度。跑大的实验会很困难。比如 large-scale RL,过去 pre-training 训练框架和 RL inference 框架是分开的,今天要融合,GPU 要边推理边训练,一边 sampling 一边 training,bug 很多,挑战很大。
DeepSeek 之前做得好,也因为幻方在英特尔上的积累很强。只有把 infra 做好,才能高效率地做事。不然整个 foundation 和组织都会很差。
很多 research 时间都浪费在 debug 上,这会把 AGI 的时间拖长。
张小珺
为什么你觉得开源可能更适合中国?
广密
开源无国界,可以突破地缘封锁。
张小珺
中国公司里你最喜欢谁?
广密
我对字节的预期最高。但不是说字节一定能追到全球模型第一梯队,而是大公司应该做大公司应该做的事情。
中国很缺一个像 Google DeepMind 或 Google Brain 一样,具备长期 vision、比较纯粹的 AI lab,能够培养人才。我期待有公司拥有这种文化、vision 和魄力,拿出很大的营收和利润支持基础科研,做好 full-stack infra,探索真正的智能上限。
如果只是再做一个抖音,我可能已经不够兴奋了。探索智能边界和上限,这个 vision 更有意义。
之前大公司确实都有组织问题,但只要组织理顺,后劲还是很强。字节的人才密度非常高。可能因为地缘问题,之前比较低调。我期待后面能有突破智能上限的东西。
创新的基础是什么?要有充裕资本、冒险精神、基础设施和好的文化。这些都是创新的基础。
张小珺
今年是不是对中国复现或者实现 AGI 更有信心了?
广密
取决于两个条件。
第一,现有的 pre-training 和 RL 两条路线不需要其他 fundamental breakthrough,就能实现 AGI。第二,不需要几十万张甚至百万张 GPU,可能几万张、3 万到 5 万张,或者 5 万到 10 万张就够。
如果这两个条件成立,实现 AGI 的确定性就非常高。美国模型公司之所以烧那么多钱,很多 GPU 用在探索上。探索非常耗卡,OpenAI 还要做大量 serving。如果不做 serving,也不需要那么多。
如果只是纯复现,可能 3 万到 5 万张、5 万到 10 万张 GPU 就够。探索花费的时间和资源,可能是复现的 5 到 10 倍。
还有一个感受,中国团队的加速度比美国团队强。国内中年和年轻的优秀人才,可能比美国更好。
你看 Devin 团队的执行力,就没有 Manus 团队强。
张小珺
你觉得硅谷和中国的创新特点有什么不同?
广密
硅谷有很多 0 到 1 的创新,不屑于 follow 和 copy。背后的原因是硅谷资本特别充裕,可能有 500 到 1,000 家 VC 投资机构,大家都很有钱。
资本充裕是非常重要的创新土壤。另一个是冒险精神,冒险精神集中在硅谷湾区。
中国有很多 1 到 100 的创新,把硅谷 0 到 1 的东西发扬光大。
张小珺
AI 时代,中国还会主要是 1 到 100 的创新吗?会有更多 0 到 1 的创新吗?创新模式和技术会发生变化吗?
广密
会。之所以我有预期,是因为大公司要做大公司应该做的事情:资本充裕、文化好、infra 好,还有冒险精神。
说句不好听的,DeepSeek 是一个富人做出来的。如果没有充裕资本是不行的。资本充裕是创新的前提,另外就是冒险精神。
张小珺
这次 DeepSeek 是梁文锋做出来的,对字节冲击大吗?
广密
冲击还是有的,但这是好事,把大家拉回智能主线,而不是过度聚焦豆包这个产品。之前大家有些偏离,都在做投流和增长。
今天增长长期可能有意义,但可能占用了组织太多精力,没有花在模型上,没有花在突破智能边界上。
智能是主线,智能是最大应用。如果量已经很大,未来出现一个好 10 倍的技术,这些壁垒也守不住。所以今天产品增长不是最本质的。
张小珺
投流今天都应该停止吗?应该花多少精力?
广密
不应该停止,这也是人类的一种探索行为。豆包应该还在继续增长。
张小珺
今天大家都在说全球化,但中国公司或者中国投资走出去,仍然会遇到很多问题。我看到你前几天发朋友圈写:假设 iPhone 是中国团队做出来的,而且能控制,美国用户非常喜欢,美国本土又造不出来,这个时候地缘问题会怎么解决?这个问题的本质是什么?
广密
我今天最大的期待和兴趣,是在 AGI 叠加复杂地缘的乱纪元下,怎么做一个 AGI-native 且全球化的跨国公司。这件事特别有意思,我们自己也在探索,身边很多伙伴也在探索。
假设 Apple 是一个中国公司,能不能跨越地缘问题,销售到全球市场?我觉得答案是可以。但今天的中国公司还没有一家能超越 Apple 在产品和技术上的极致,所以我们在技术和产品上还有很大距离。
最后核心就一个:只要把产品和技术 push 到极致,取得断层领先,把竞争对手打服。
DeepSeek 这一波,很大程度上挑战了美国科技霸主的地位。我期待更多 DeepSeek moment 出来。
作为年轻创业者,不用太顾虑地缘问题,push 产品和技术到极致,地缘问题最终都能解决。
张小珺
Red 上次说一定要全球化,要更激进地全球化。好的技术、好的产品是没有国界的。
广密
对。上一代、上上一代互联网公司,真正做好全球化的并不多。
美国过去强大,有几个表现:美元、美国跨国公司,以及美式意识形态。美国人觉得自己制定了近百年的全球秩序,有一层优越感。
我期待越来越多中国创业者做出中国原生的全球跨国公司。这是新一代创业者的使命。
张小珺
华人在硅谷做投资,天花板在哪里?有多高?
广密
科技投资不是混出来的。很多 VC investor 喜欢混圈子,但混圈子没有意义,天花板很低。
还是要靠创造,真正深入一个行业,朴实到极致。到处混、建立很多 connection 并不难,但跨越种族和文化建立信任很难。
很多人去混硅谷科技圈,很难进入核心圈,很难和 Sam、Dario、Arvind 建立信任。还是要自身足够强,有足够厉害的东西,硅谷才会 value 你的价值。
所以要多想创造,而不是想混,不然天花板很低。
投资的天花板相对低,创业做企业家的天花板更高。湾区的 Zoom 创始人袁征,还有 Fortinet 的谢青,Fortinet 市值我记得有七八百亿美元。
包括今天半导体行业的 CEO,我觉得都应该更多想去创造。我们很快就会面临,或者说已经进入 AGI 科学文艺复兴的时代,后面的机会是宇宙大爆发式的。
张小珺
你把自己叫作 AGI 原教旨主义者。你觉得它的对立面是谁,是什么主义?
广密
我觉得是相信科学本身和不相信科学本身的区别。
上一代投资人不相信科学本身,相信产品和商业模式,很多人是在算账。
张小珺
你为什么会相信科学本身?
广密
今天算账算不过来,算产品也没有意义。今天的驱动和核心变化,只有科学进步,只有这一件事。
张小珺
所以在新的 AGI 框架下,所有叙事都会发生变化?
广密
今天过早讨论太多用户需求,意义不大,因为这是一个供给驱动型市场。手机上的需求已经被穷举过很多次,今天的变化不在需求端。
需求可以被刺激出非常多,核心变量在供给端。比如癌症、糖尿病、肥胖症,核心是供给,不在需求。
张小珺
推演未来一年,你觉得还会有哪些大的变量?
广密
会非常多,不知道从哪里出来。今天线性外推只是参考。
比如我比较期待 Claude 4 显著 beat 今天的 GPT-4.5,base model 还能持续提升,大家重新回来卷 pre-training base model。
Google Search 的份额和营收会不会发生根本性动摇?Agent 对 search 和广告的影响会比较大。
还有一个可见趋势是,ChatGPT 的流量可能持续加强。在下一个强大 base model 拉开差距之前,我觉得每月 1,000 美元、2,000 美元甚至更贵的定价,会被更多人接受,因为它的 value 正在被体现。
张小珺
Red 说他听你的播客,你听过他的吗?
广密
听了两遍。
张小珺
你对他的观点有什么赞同或者不赞同?
广密
我觉得 Red 是智能的盗火者,sense 非常好。在微信那波红利到来之前,他抓得很好;在 AI 这一波起势时,他又抓得很好。我觉得这就是创业者的本质。
什么是创业者?我觉得创业者精神内核就三个字:抓机遇。Red 能持续抓住机遇。\n\n张小珺\n\n你们之前也认识吗?就是播客里有增量吗?\n\n广密\n\n增量还是很多的。Tryna turn me off, I want it on。\n\n张小珺\n\n好啦,这期节目就是这样。如果你喜欢我的节目,欢迎前往小宇宙、苹果 Podcast、腾讯新闻、喜马拉雅、QQ 音乐订阅《张小俊商业访谈录》。如果你有其他想邀请的嘉宾、想听的内容,或者你有任何想探讨的话题,都欢迎各位听众朋友们在评论区里留言。那我们下期再见,拜拜。