[BidClub_]
屠龙之术 · · 18 min

Vol.71 简单聊聊GPT5和美国电力---with 刘一鸣/101 Weekly

刘一鸣庄明浩

Podcast
TL;DR
  • GPT-5并未证明数据“撞墙”消失,而是显示强化学习把 scaling law 延伸到了新路径。 庄明浩认为,Ilya 在2024年9月指出的原始数据瓶颈“没有说错”;变化在于合成数据、预训练再利用与后训练形成了“左脚踩右脚就飞上去”的梯云纵,数学、编程、医疗正是能够明确通过强化学习提升效果的领域。
  • 算力需求仍会从训练延伸至推理,而且单位成本下降不会压低总需求。 庄明浩给出的量级是:token 单位成本差不多每12个月下降一个数量级,但 token 消耗和所需算力也差不多每12个月以指数级上升,“它就配上了”。推理 token 与算力并非简单线性关系,还要同时考虑时间和单次消耗成本,不能用单一方程处理。
  • GPT-5发布不及预期,但产品工程仍在为 To C 主线补短板。 减少幻觉、路由、去掉谄媚,以及更细的工程实现,都在改善产品体验;工具应用、任务长度和成功率的提升,则指向更可靠的 agent。庄明浩的判断是,“主线还是 To C 的这个战场”。
  • OpenAI必须加码 To B,因为消费订阅很难独自覆盖不断扩大的 CapEx。 ChatGPT 周活从年初约3亿—4亿升至7亿,但即便继续增长,周活乘转化率、再乘每月20或200美元的 ARPU,收入仍是可估算的;企业实施和政府订单提供更大的边际增量,同时也要正面应对 Anthropic 和云厂商的竞争。
  • 广义 scaling law 仍有效,但能力增长已经从“喂更多数据”转向预训练、后训练与强化学习的组合。 庄明浩认为,这条研发路线至少到2024年Q3仍然奏效,GPT-5强化工具应用、任务长度与成功率,符合 L3 agent 阶段;至于下一节点及 L4 如何实现,“对于我们这些外人来讲可能没有办法知道”。
  • 美国电力资产的重估,来自数据中心 CapEx 触及电力系统临界点,而非 GPT-5 单次发布。 几家头部公司当前单季度投入约1000亿美元;庄明浩转述摩根士丹利报告称,到2029年还是哪一年,年投入可能达到3万亿美元,并据此推演:“美国整个电力生态都可能被重新写一遍。”
  • 电力扩容机会不止发电设备,而是生产、输送、配电及辅助设施的全链条。 刘一鸣关注 GEV 的蒸汽燃机、蒸汽轮机、SMR 与水电等布局,并提到订单排到2029年;但两人明确保留判断边界——他们是在按 AI 需求和 CapEx 推演,尚不知道数据是否已到临界点、具体需要怎样改变。
Digest · the substance, structured for research

1. 强化学习绕过了原始数据瓶颈,却没有否定“撞墙”

  • 刘一鸣先追问 Ilya 在2024年9月提出的数据瓶颈是否仍成立。庄明浩的回答很明确:“伊利亚没有说错”,公开世界里的原始数据,以及再加工、再标注的边际效率,确实已经非常差。

  • 过去一年真正超预期的是强化学习权重的提升:它不再只是后训练提效工具,也开始通过已训练模型生成合成数据,再反哺预训练,形成能够自我抬升的循环。

  • 庄明浩用“梯云纵”形容这种机制:“左脚踩右脚就飞上去。”一旦预训练、合成数据与强化学习能够互相促进,能力进步就不再完全受限于新增互联网语料。

  • GPT-5重点展示数学、编程、医疗,并非偶然;庄明浩认为,这几个板块都明确能够通过强化学习提升模型效果。DeepSeek、千问、Llama、Anthropic及 OpenAI 过去一年的头部模型发布及其高分能力,大体符合这条路线,Google 则“可能不太一样”。

2. 推理需求吃掉降本红利,GPT-5继续向 agent 演进

  • 从 base model 到推理模型,再叠加模型尺寸、复杂数据和合成数据,最终都推高训练、推理及应用端的 token 消耗;因此算力重心向推理迁移的趋势仍会延续。

  • 庄明浩借“安迪—比尔定律”的逻辑解释为何降本不等于总消耗下降:token 单位成本差不多每12个月下降一个数量级,消耗与算力需求也差不多每12个月以指数级增长,“它就配上了”。

  • 刘一鸣追问 token 增长10倍是否意味着算力也增长10倍。庄明浩没有强行给答案:“这个可能不仅仅算力,还包括时间”,算力、时间和单次消耗成本令它“不是一个单一方程能够解出来的数据”。

3. GPT-5没有惊喜,但 OpenAI 的商业压力更加具体

  • 刘一鸣认为 GPT-5 整体发布“不太给力”;庄明浩则指出,产品改进并没有因此消失:减少幻觉、路由、去掉谄媚,以及更细的工程实现,都在改善产品体验。

  • 庄明浩判断,对于 OpenAI 或 Sam 来讲,主线依然是 To C;问题在于 ChatGPT 周活已从年初约3亿—4亿增长到7亿,再向上时,很难继续要求指数级增长。

  • 消费收入可以近似拆成用户数、转化率和每月20或200美元的 ARPU。即便实现此前谈到的10亿日活,这个数字相对算力、CapEx 与其他成本仍可能“不够”,OpenAI 只能从 To B 寻找更快增量。

  • 企业实施团队、政府大单都是这条路线的体现,但竞争也更硬:刘一鸣认为 Anthropic 在企业服务和编程上“把 OpenAI 打得很痛”,云厂商又在 To B 战场占据重要位置,倒逼 OpenAI 投入更多。

4. 广义 scaling law 仍在走,未知的是 agent 之后

  • 庄明浩把今天的 scaling law 定义得更宽:它已不只是预训练数据投喂,还包括后训练、强化学习等。至少到2024年Q3,他认为头部厂商仍有较清楚的阶段目标、里程碑和实施路径。

  • 庄明浩回顾,OpenAI 此前将路线描述为从 chatbot 到推理,再到 agent;agent 后面可能是把各种能力组织起来的“组织者”,最后是创新,但他也表示“没记错的话”。GPT-5强化工具应用、任务完成长度和成功率,符合 L3 agent 阶段的要求。

  • 对后续如何从 agent 走向更高阶段,庄明浩保留不确定性:头部公司内部“可能”正在尝试,但外界并不知道它们具体在试什么、努力方向是什么,也无法判断 L4 如何实现。

5. 数据中心 CapEx 把美国电力系统推到了临界点

  • 刘一鸣观察到,GEV等电力股一度涨得甚至比英伟达更高。庄明浩则回溯,2024年Q3截至时,标普500细分类别中基础设施、能源类“应该是排第一的”,甚至比 IT 和科技更靠前;Q4回落,1月和2月又因 DeepSeek 事件延续了讨论。

  • 转折来自Q2几家头部公司的财报:应用、用户拓展、收入利润和云收入增长都较好,市场预期从悲观迅速翻正。结合持续两三年的数据中心 CapEx,庄明浩推测它可能已到临界点,开始影响电力系统的稳定性和容量,甚至影响民用端;美国电力市场化且与价格相关,也使市场进入新的状态。

  • 现在几家头部公司一个季度大概是1000亿美元的体量;庄明浩转述摩根士丹利报告称,到2029年还是哪一年,每年可能要投入3万亿美元。若这个投入趋势再翻几番,“美国整个电力生态都可能被重新写一遍”。

  • 数据中心建设曲线快速上升、办公楼建设曲线几乎跌完,两者已经接近交叉,甚至可能继续发展到前者超过后者。若趋势再持续三年,核电厂及其他电力设施可能让一些已经淡出公众讨论的“锈带”城市重新被拉回视野。

6. 不止发电,而是整条电网设备链

  • 刘一鸣强调,美国电力扩张近似一轮“大基建”:新建电厂只解决发电,输电、配电、变压器及其他辅助设施同样存在瓶颈,对应另一批上市公司。

  • 美国各州经济和电网条件差异很大,部分地区甚至需要重新设计。庄明浩给出的逆向框架是:“你底子薄,那你可能改善的空间变得更大了嘛。”

  • 刘一鸣介绍,GEV覆盖蒸汽燃机、蒸汽轮机、天然气发电,并投资 SMR,也有水力发电,基本占据电力相关的多种概念;但两人没有把逻辑推演包装成精确预测:“我们不是能源专家”,是否已到具体临界点、需要怎样改变仍需专业数据验证。

  • 节目结尾,刘一鸣认为 GPT-5 对算力及其他领域的影响不大,次日英伟达等标的也没有太多变化;部分算力租赁公司上涨,似乎与某几家公司的财报有关,与 GPT-5 本身关系不大。

刘一鸣

谢谢。您觉得,之前伊利亚在 2024 年 9 月发过一个东西,说遇到了一些“撞墙”,可能是数据上的问题,训练数据不够了。这次您觉得整体发布的效果怎么样?“撞墙”这个逻辑是否依然存在?

1. 强化学习缓解数据瓶颈

庄明浩

伊利亚发布这件事其实已经是一年之前了。过去一年,强化学习的发展比很多人想象得要快,或者说,强化学习在模型的预训练和后训练过程中的权重提升,比很多人想象得要大得多。

强化学习最开始可能会被认为只能在后训练的结果里提升效率,但现在发现,在预训练里,包括基于已经训练好的模型生成合成数据,再一次用于模型预训练,这些事情对于模型的提升,也出现了一些探讨和可见的效果。所以它变成了一个类似金庸小说里讲的“梯云纵”的过程:但凡一件事情能够形成类似梯云纵的运动,左脚踩右脚就飞上去,很多事情的发展就会很快。

包括这一次 GPT-5 发布的时候,你会发现,虽然它没有公开技术实施的细节、训练过程和参数,但从它现在反复强调的几个重点方向——数学、编程,包括医疗——其实这几个板块都是明确能够通过强化学习提升模型效果的板块。它为什么会强势?就是因为这些东西在这些事情上见到了效果,所以这条路径在某种意义上缓解了伊利亚之前说的最开始的那个问题。

但是,纯粹从今天这个时间点来看,公开网络世界也好、现实世界也好,能够拿到的原始数据,包括数据的再加工和再标注,边际效率可能确实已经非常差了。可是我今天上午看到,Scale AI 还是哪一家数据标注公司的 CEO 发了一篇文章,说为什么在这个时间点,大家都认为早期的数据标注和数据采集已经不重要了,但这几家做数据标注的公司依然发展得非常快。

大家会发现,刚才我们讲到,在强化学习这个板块里面,数据的采集、清理和标注变得更加复杂、更难,甚至需要重新创造一些世界上可能没有的数据,去让模型在某些特定场景提升能力。这件事情的挑战,比最开始做预训练时直接把现成数据拿过来,要难得多。

所以你说伊利亚说错了,我觉得伊利亚没有说错。只不过在过去这一年时间里,我们找到了另外一条路径,把这件事情的效果和可能达到的里程碑列出来了。回顾这一年几乎所有头部模型的发布,以及它们拿分比较高的板块,基本都符合刚才我们讲的这个逻辑:DeepSeek 也好,千问也好,Llama 也好,Google 的模型也好——Google 可能不太一样——Anthropic 也好,包括 OpenAI 这次的 GPT-5,我觉得都符合这个逻辑。

刘一鸣

最近整体上,AI 训练的算力是在往推理方向转嘛。那这次 GPT-5 是不是仍然符合这个趋势?未来会延续推理主导的模式吗?

2. Token 消耗持续指数增长

庄明浩

我觉得会。从最早的纯 base model,也就是基础模型,到推理模型这一步,再加上模型本身尺寸的变大,可能再加上数据变复杂,包括合成数据等,这几个因素本身最后都推导出了你刚才那个问题:训练、推理和应用上的 token 规模会变大,而且是一种乘级、级数式,甚至指数级的变化。

原来的 IT 行业不是有摩尔定律吗?硬件大概每 18 个月提升一倍。但是同样也有安迪—比尔定律,就是软件的消耗会把硬件的能力消耗掉。今天你会发现,大模型的训练和推理也符合这个逻辑:token 的单位成本确实差不多每 12 个月下降一个量级,可是 token 的消耗量,以及所需要的算力,也差不多是每 12 个月以指数级的方式提升,所以它就匹配上了。

刘一鸣

推理 token 的增长和算力需求是线性的吗?比如推理 token 增长 10 倍,对算力的需求也是 10 倍,还是会高于 10 倍?

庄明浩

这个具体我没有特别强的感觉,但我觉得这可能不仅仅涉及算力,还包括时间。这里面衡量的坐标轴变复杂了:算力也好,时间也好,单次消耗的成本也好,它变成了一个可能不是单一方程能够解出来的数据,没办法再用线性的方式来做。

刘一鸣

明白。其实这一次 GPT-5 的整体发布有点不及预期。我感觉 OpenAI 非常强调企业级应用,是不是因为 To C 用户的付费不够、利润不够高,支撑不了他们现在这么大规模的 AI CapEx,所以需要更多地往企业级方向强调?

3. 企业收入成为新战场

庄明浩

我没记错的话,应该是 Q2 的时候,OpenAI 或者《The Information》发过一篇关于 OpenAI 未来收入预期增长的报道,预计到 2028 年左右。确实,如果我们按照 To B 和 To C 来算,增量效应比较多的,肯定还是 To B。

To C 基本上可以衡量出用户的增长曲线。虽然这个用户增长曲线还很快,比如年初可能周活是 3 亿还是 4 亿,我没记住,前两天 OpenAI 的 Sam 说已经到了 7 亿。GPT-5 发售之后,这个数字还会涨,但毕竟这个数字要乘以转化率,再乘以每个月 20 美元还是 200 美元的 ARPU,已经很难再要求它指数级增长了。

周活已经 7 亿了,你说周活还能跑到 10 亿?大家之前不是还问过 Sam,到底是要 10 亿日活,还是要 AGI。他说都要,但是更倾向于要 10 亿日活。哪怕到了 10 亿日活,乘以转化率,再乘以单位 ARPU,这个数字也是算得出来的,但这个数字跟我们上一期聊到的,无论是 CapEx 投入、算力投入,还是其他成本投入相比,确实是不够的。

所以它只能从 To B 这个战场寻找可能的增量和边际效应,也就是增长更快的趋势。从这个角度来说,它确实需要这样做。包括它去年还是今年年初成立了一个专门做 To B 实施、企业内部实施,类似咨询的 team;包括最近跟政府签了很大的单子。当然,头部几家模型公司都跟美国政府签了很大的单子,做这些事情确实如此。

但我还是会觉得,这一届 GPT-5 在产品功能和体验层面还是做了一些事情的。减少幻觉也好,路由也好,去掉谄媚也好,包括一些更细化的工程实现,它还是在持续推进。我觉得对于 OpenAI 或者 Sam 来讲,主线还是 To C 这个战场,但为了把收入拉起来,在其他战场上也需要付出更多努力。

刘一鸣

而且 To B 战场里的竞争对手太强了,或者说打得太激烈了。Anthropic 在 To B,尤其是企业服务和编程这个板块,可以把 OpenAI 打得很痛。云厂商本来就在这个战场里,在 To B 战场占据着很重要的位置,所以也倒逼着 OpenAI 在这个战场上付出更多努力,才可能拿到一个不错的效果。

目前来看,GPT-5 的 scaling law 还能继续延续吗?

4. Scaling Law 继续有效

庄明浩

我觉得今天的 scaling law 也变成了宽泛意义上的 scaling law,不再单纯只是最早的预训练数据投喂的 scaling law,包括后训练、强化学习,很多事情都包含在里面。

我觉得这条路径至少截至 2024 年 Q3 这个时间点,依然还是奏效的。或者说,头部几家模型厂商在肉眼可见的中短期研发路径、各阶段性里程碑、想达到的效果,以及实现这个效果的路径,都是比较清楚的,还是沿着这条路在走。只不过下一个节点会是什么,就不知道了。

然后我们再回头看,当年 OpenAI 提出从 chatbot 到推理,再到 agent。agent 再往后一步是组织者吧?我没记错的话,就是要把各种各样的能力组织起来,变成一种组织的方式,最后一步是创新。

如果这个行业还是延续 OpenAI 之前定义的方式往前走,那似乎我们在这个节点上,还是在保证 agent 能力的提升。所以你看,这次 GPT-5 的发布,从底层角度来讲,GPT-5 越来越强调工具的应用、满足任务的能力,包括任务能够完成多长、任务的成功率,它都在做这些努力。

这确实符合我们讲的 L3 这个阶段的要求。至于再往后怎么走到 L4,我们现在也不知道。可能最顶头的公司内部在试,但试的是什么、努力的方向是什么,对于我们这些外人来讲,可能没有办法知道。

刘一鸣

明白。然后我们聊聊电力的需求。最近 GE Vernova,也就是 GEV,还有好多电力股,我感觉涨幅甚至比英伟达还要高。它背后的逻辑是,GE Vernova 的强项就是蒸汽燃机,而这个产品的需求量好像很大,订单已经排到 2029 年了;并且它的利润也比较容易算出来,因为美国电价是浮动的、市场化的。

您怎么看这一波对电力的需求?因为 4 月份的时候,很多相关股票其实大跌了一次,我感觉当时还没有形成共识,但后面很快共识就建立起来了,股价也立刻暴涨。我们可以先复盘一下,今年整体电力需求的状态是怎么样的?

5. AI 需求重塑美国电力

庄明浩

我觉得跟那个微电的那个走势有点像,包括这一波科技股在 3、4 月,或者 4、5 月的时候,大家对整个市场都非常悲观。那一波跌得非常厉害,电力股其实也跌了。

但反过来讲,我没记错的话,2024 年 Q3 截止时,我们看整个标普 500 所有细分品类的股票增长,基础设施、能源类应该是排第一的,甚至比 IT 和科技还要靠前。到了 Q4 又跌下去了,1 月和 2 月又因为 DeepSeek 事件,这个事情持续有一些探讨和争论。

拐点可能出现在大家认为,强化学习也好,整个业界也好,包括 Q2 几家头部公司的财报表现都非常好,尤其是在应用层、用户拓展层、收入利润层,以及云收入增长这些角度都非常好。它直接把市场从不是特别好、甚至悲观的状态,瞬间扭转到了一个正向状态,所以就拉回来了。

我觉得可能到了某种程度上的临界点。当然我们不是专业研究能源的,也不了解美国电力系统、供电稳定程度、电力容量,以及各种类型电力供应的占比。但结合今天这个时间点,可能已经延续了两到三年的数据中心 CapEx 投入,开始到了临界点,变成它真的开始影响整个电力系统的稳定性和容量,甚至影响民用。

又因为美国电力是市场化的,和价格相关。所有这些因素到了一个临界点之后,就被拉成了一个新的状态。原来大家讨论了很多年的锈带,也就是那些已经衰落的传统工业城市,因为建设核电厂和各种电力设施,又重新被拉回到视野当中。

当然,你说这件事情对当地居民来讲是好事还是坏事,没有人知道。但纯粹从行业分析的角度来讲,为什么那些已经从公众讨论中消失的城市又被拉起来?就是因为到了一个临界点之后,需要新增更多设施,来维持这么重大的 CapEx 投入。

因为数据中心 CapEx 的预期已经可能真的会拉到 2029 年甚至 2030 年。现在几家头部公司一个季度大概是 1000 亿美元的体量,我那天看摩根士丹利的报告,讲到 2029 年还是哪一年,每年要投入 3 万亿美元。也就是说,一个季度可能要大几千万美金,距离今天还要再翻几番。

今天这个时间点,已经到了逼着电力系统做出改变的程度。如果这个事情再翻几番,那甚至美国整个电力生态都可能被重新写一遍。如果是这样一个趋势,这几家头部公司的价值当然就要重新计算了,所以我觉得逻辑上应该是这样。

当然,我们不是能源专家,只是在纯粹地盘逻辑。我们并不知道具体数据是否真的到了临界点,也不知道到了百分之多少需要做什么样的改变。但是我们知道数据中心 CapEx 这件事情,也知道前两天有一张图被转了很多:在 Q2 GDP 发布之后,美国数据中心建设的曲线,对应美国办公室建设的曲线,差异非常明显。一条跌得差不多,另一条疯狂拉升,两条曲线已经差不多交叉了,甚至再过一段时间就会超过去。

也就是说,建设数据中心已经超过了建设办公室。如果这个趋势再延续三年,很多事情真的就很可怕了。

刘一鸣

6. 美国电网进入大基建周期

特别是特朗普。我感觉现在美国电力整体上有点像美国版的大基建。因为它不只是数据中心,不是建个电厂就结束了,对于整个电网的能力,包括变压器和各种辅助设施,现在好像都有很大的瓶颈。

所以,生产电、输电、配电都会发生非常大的变化。建电厂只是生产电这个环节,另外还有输电和配电;而输电、配电涉及的很多上市公司,就变成刚才您说的那些公司了。

对,没错。

刘一鸣

反正我觉得这一轮,我昨天还跟几个基金经理聊,他们在中国也在看相关的电力股。只不过中国电力可能没有美国那么有弹性,所以涨幅肯定是有限的,但现在大家确实都在关注电力。

从美国的角度来说,电力还有一个很大的影响:美国原来的电网是不是比较弱,整体比较脆弱?因为有些地方应该是很脆弱的。

庄明浩

美国各个州之间的经济,以及相对应的电网状态是不太一样的,所以有些州可能重新需要设计电网。反过来讲,原来比较弱,没准今天就变成一个好处:底子薄,改善的空间可能就更大了。

刘一鸣

对。您觉得电力这一块还有没有什么补充可以聊?我看了 GEV 的一些首次覆盖报告,可能会介绍一下这家公司,也对它的业务做一些介绍。

它真的什么都做,有蒸汽燃机、蒸汽轮机,还有天然气发电;它也投资做 SMR,也就是小型模块化反应堆。基本上,电力相关的概念它全部都占了,也有水力发电,基本上所有发电形式它都有。

庄明浩

我可能没有什么补充,还是因为咱们不是能源方面的专家。咱们今天只是从逻辑,以及已知的 AI 需求角度,往前推。

刘一鸣

好,那我们今天先聊这么多。下回再有什么新选题,我再找明浩老师。今天主要是 GPT-5 这个结果不太给力,不太值得单独聊。

他们可能也会做一个对 GPT-5 的整体复盘,陈倩可能会聊一些相关内容。但感觉 GPT-5 对算力或者其他领域没有那么大的影响,昨天英伟达这些也没有出现太多变化。反而有些算力租赁公司倒是暴涨了一下,但好像是跟某几家公司的财报有关,和 GPT-5 本身关系不大。

谢谢明浩老师。

Vol.71 简单聊聊GPT5和美国电力---with 刘一鸣/101 Weekly | BidClub