泓君
Hello,大家好,欢迎收听硅谷101,我是泓君。
最近我看到哈佛大学经济学家 Jason Furman(杰森·弗曼)的一项研究,数据很有意思。他说,在2025年上半年,整个美国 GDP 的增长几乎全部来自人工智能基础设施建设。如果把信息技术和软件这一部分拿掉,美国 GDP 的增长仅仅只有0.1%。
最近还有一个大新闻,大家可能都看到了:OpenAI 发公告说,已经完成了公司架构的重组,而这次重组的目的,是为潜在的 IPO 铺路。核心也是说,它未来会承诺投入1.4万亿美元,建设整个 AI 基础设施。
还有一个消息大家可能没有注意到:就在完成架构调整的前一天,OpenAI 发了一封公开信,致信白宫。在这封公开信里面,OpenAI 提到,中国在2024年新增的电力容量是429吉瓦,而美国仅仅增加了51吉瓦,所以它希望美国政府能够优先审批 AI 基础设施建设项目。
为什么这些公司都那么激进?最根本的一点,是大部分公司现在都意识到,Underinvestment is riskier than overinvestment,也就是投资不够给你带来的风险,要远远大于过度投资带来的风险。因为没有人想当诺基亚。
之前我听到 OpenAI 这个5000亿美元的 Stargate 项目,就已经觉得非常夸张了,但现在这个饼已经画到了1.4万亿美元。美国也需要基础设施建设,这是一个比想象中更加疯狂的大基建时代。
美国极少数的科技公司联合金融巨头,正在不成比例地对美国经济产生决定性的影响。我们先抛开钱从哪里来的问题,这一集就来看一看,这一轮 AI 大基建带火了哪些行业,以及为何美国的电力建设如此困难。
下面就请收听我们今天的节目。今天我们来聊一聊 AI 军备竞赛背后,数据中心与能源之争。
今天跟我们在一起的嘉宾,一位是 Ethan徐。Ethan 现在在字节跳动,负责数据中心与能源项目。大家好。Ethan 在去字节之前,曾经在微软负责数据中心和能源项目,再之前是在 Bill Gates 旗下的突破能源基金,也做了很长时间的能源相关项目。两年前 AI 大爆发之后,他算是加入到了数据中心和能源结合的赛道。
还有一位是王辰晟。王辰晟之前是特斯拉的供应链总监,马上也要加入 xAI。
Ethan徐
大家好。
王辰晟
大家好。
泓君
如果让大家总结一下,现在我们看到所有的 AI 巨头都在做数据中心。你们觉得哪几家做得最猛?
新闻报道上,第一是 OpenAI 和微软的5000亿美元 Stargate 项目,第二个是最近 OpenAI 和甲骨文合作的3000亿美元数据中心项目。当然,这两个项目中间是有重合的。
但我知道,其实马斯克的 xAI 在布局数据中心和抢货方面也非常猛,扎克伯格也是在全力投入。所以从你们的角度来看,哪些公司最激进,他们的策略是什么?
Ethan徐
OpenAI 的野心非常非常大。现在它公布出来的数据,是要做10吉瓦的 Stargate 项目。我觉得这可能只是刚刚开始,它的野心可能是这个的10倍,甚至更多。
在未来5到10年,他们想实现的一个目标,是10倍、5万亿美元的一个产业。我觉得这个数量级基本上没有问题。
泓君
美国现在的 GDP 是多少?二十几万亿美元,是吧?
Ethan徐
差不多。
泓君
它这个就要占 GDP 的——
Ethan徐
当然也不是一年。
泓君
对,整体上算下来,要占美国 GDP 的25%,我觉得是很高的。我们可以拭目以待,看一看今年美国 GDP 的增长当中,有多少是数据中心基础建设贡献的。我觉得这个比例有可能会到70%。
我也不会很吃惊的。
泓君
你有可能低估了,甚至有可能低估。
Ethan徐
对,我也看过一些黄仁勋或者咨询公司的观点,他们也认为,在未来5年,整个数据中心基础设施建设的投资规模应该会达到5万亿到7万亿美元这个级别。
钱从哪来,确实是一个很有意思的问题。我记得你们之前做过一期节目,讲的是钱在彼此之间循环的 AI 资本论。未来这也会是一种比较创新的融资方式。辰晟怎么看?哪一家最激进?
王辰晟
OpenAI 肯定是相对比较激进的。你看它现在公布的很多公告,未来几年跟英伟达有一个10吉瓦的意向,跟 AMD 有一个6吉瓦的意向,同时最近还有博通,也有一个10吉瓦的意向。
加起来就已经是26吉瓦了。按照每吉瓦500亿美元计算,就已经是1.5万亿美元的概念了,还是未来5年的投入。
同时,它在一些供应链上也非常激进地做了其他布局。最近它跟三星和 SK海力士包下了每月90万片晶圆的产能,基本上占了整个 DRAM 市场的大约1/3,HBM 市场的60%都在它一家手里。
泓君
如果你是马斯克,或者你是小扎,看到这个情况会怎么应对?因为你也不希望被他们卡脖子。所以每一家公司现在从供应链角度来看,可能做法都不一样。
王辰晟
马斯克的 xAI 横扫了所有小型燃气轮机发电机。Meta 过去几年来其实已经做得非常激进,去买各种能源,以及成本相对比较低的土地来建设数据中心。
最近它是在爱达荷州还是俄亥俄州,又有一个5吉瓦的数据中心要上线。它的规模基本上能占大半个曼哈顿。
谷歌也会做一些供应链上的布局。比如说,无论是互联设备还是光缆,他们都会非常激进地买断供应链上的产能。
所以其实每个巨头都在发力,都不想在这个竞争当中输人一头。
泓君
微软我们好像还没有提到。
Ethan徐
微软其实也蛮有意思的。去年它跟 OpenAI 的合作关系非常融洽,但是在年初的时候,大家也看到一些新闻,提到 OpenAI 和微软的关系已经有了一些变化,包括 OpenAI 开始去找 Oracle 或者其他公司合作建设数据中心,所以微软已经不是它唯一的数据中心提供商了。
同时,微软可能也在某些数据中心开始暂停施工,或者退租了一些数据中心。我们看最近这几个月的发展,能够感觉到微软在数据中心投资这方面,和其他公司比起来是相对稳健一些的。
OpenAI 就完全是另外一种风格,几乎每一两个星期就会有一个非常大的公告,说要建设5吉瓦、7吉瓦的数据中心,和普通公司合作,和整个产业链合作。所以能看出,这两个公司可能在 AI 数据中心,或者整个数据中心行业的投资和策略方面,已经有一些不同了。
泓君
所以就是说,微软中间稍微缓慢了一点,最近又在加速?
Ethan徐
对。现在能看到,微软最近刚刚宣布了一个全球最大的 AI 数据中心之一,已经落成了。所以今天看到的微软,可能跟年初看到的微软又有一些不一样。
我觉得这个行业的变化确实还是蛮快的。年初的时候,我记得微软的 CEO 也在公开采访中提到过,他觉得这个行业存在一定程度的过度建设,也有一些泡沫,他想用更稳健的方式去建设数据中心。
但我们现在看到的是,微软的速度也蛮快,可能并没有像年初说的那样很快慢下来。所以我猜想,也许各个公司的高层在这一年过程中,策略和想法上都有一些波动。但是此时此刻,能感觉到所有人基本上都在全速前进。
泓君
我觉得几个巨头,包括 Google、亚马逊和微软,他们的态度可能是因为过去在云上已经有很多数据中心投入了。像 Google、微软,它们现在已经有的数据中心可能已经超过10吉瓦。
对于 OpenAI 这种从零开始发展的公司来说,大家需要的增长速度是不一样的,因为基数不同,反馈出来的激进程度可能也会有不同。
这个点很关键。这也是为什么我们现在经常听到的名字是 Meta、xAI 和 OpenAI,而不是云厂商巨头 Google、亚马逊和微软。
我们刚刚其实提到了,OpenAI 在做 Stargate 项目、抢土地、跟芯片厂商达成合作;马斯克其实也在抢发电机,Meta 也在抢土地。我在想,你的芯片供应其实也就这么多,大家在某种程度上是不是都有短缺?
Ethan徐
从纯产业链的产能来看,芯片现在并没有像能源这么紧缺。如果每一片芯片都能把它用到刀刃上,台积电的产能也在积极布局,所以相对来说是比较充足的。
包括台积电,两年之前可能还在说 CoWoS,也就是先进封装的产能会有些落后,但是它最近也在说,要在亚利桑那州建设两个晶圆厂。其实这些产能在过去两年经历这个周期的时候,已经有投资了。
我只能相信老黄,他的直接声明是对的:GPU 芯片的供应肯定不缺。但是在一些其他配套产业上,可能会有额外缺口,包括刚刚提到的存储器、线束,甚至一些数据机柜。不过这个缺口相比能源来说,并没有那么大。
王辰晟
我觉得这点可以补充一下。我能看到的几个比较重要的策略观点,一个就是我们刚才一直在聊的所谓“电力优先”,也就是 Power First 策略。
大家已经明显看到,可能最缺的就是电。谁能拿到电,就意味着谁能买更多 GPU,就更有可能训练出更好的模型,获得更多用户和更好的用户体验,从而占据更大的市场份额。
这样的市场份额可能会给你带来更多营收和利润,然后又可以把这些营收和利润投入到购买更多的电和土地上,继续让模型变得更好。所以 Power First 这个策略,在很多大型公司里都是非常重要的策略。
还有另外一个大家都考虑到的策略:为什么这些公司都那么激进?最根本的一点,是大部分公司现在都意识到,Underinvestment is riskier than overinvestment,也就是投资不够给你带来的风险,要远远大于过度投资带来的风险。
泓君
为什么会这样呢?
王辰晟
像 AI 这个行业,大家目前可能有一个大致的共识,就是很有可能谁最先获得最好的 AI 模型,或者所谓的 AGI,这家公司就会占据比较大的市场份额,其他公司的生存空间就会很快缩小。
所以,投资不够的风险非常大。我们再看一下,过度投资会有什么风险?你无非就是买了更多的土地、更多的电、更多的房子来建设数据中心。最后你发现可能买多了,无非就是可以把它用作公司内部的一些效率提升,或者把它租给其他人,也可以把这些土地和电卖给其他公司。
总体来说,过度投资的风险实际上是有上限的,因为它们都是固定资产。这些固定资产转卖也比较容易。比如 GPU 买多了,卖给其他公司也没有什么问题。所以过度投资的风险相对来说比较小。
而对于某些大型科技公司来说,如果投资不够,导致它没有在这场竞争中胜出,面对的有可能是生死存亡的境地。所以这也是为什么绝大部分公司宁愿多投资,哪怕华尔街现在已经有一些质疑:是不是过度投资了?你们能不能收回利润?营收能不能覆盖投资?甚至股价上也开始反映出来了。
但是这些公司,我觉得现在没有一家在眨眼睛,都是继续加大投资。所有公司今天说的都是:年初的时候,我们公布今年会投资这么大的规模,已经很震惊市场了;但是现在看起来,我们投资的还没有应该投资的那么多。
所以这也是“投资不足比投资过度风险更大”的策略。
泓君
对,因为没有人想当诺基亚。你跟股东说,我4万亿美元的市值会变成3万亿美元的市值好呢,还是说我的4万亿美元市值会变成0?
更多时候,大家听到的是这样一个梦想:我现在投资,如果经历过这一场退潮,然后我活下来、其他人死掉了,我就可以从4万亿美元变成10万亿美元。这是大家更喜欢听到的故事,但不代表它一定会发生。
还有一点,在硅谷有一句话,叫“比尔总会吃掉安迪”。Andy 代表 Andy Grove,英特尔的一任 CEO;Bill 是比尔·盖茨。意思就是说,只要你有基础设施、只要你有硬件,软件总有办法把这些资源运用起来。
这周早些时候,OCP 大会上 Meta 的人就在里面说,他们目前的 GPU 光是用来做内部 AI,比如 Instagram 或者 Facebook 的内容审核,就已经需要很多算力了。就算有多余的闲置算力,也可以用来做内部降本,也就是 cost reduction,完全可以用掉。
所以我觉得,现在主流的这些公司都不会担心过度投资之后没办法用掉。更多的是,它们会思考怎么把已有的资源做更好的配置,扩大利润和收入。
王辰晟
我可以稍微补充一下 Ethan 刚刚讲的一点。为什么大家要建设这么大的数据中心?这里面有两笔账,一笔是经济账。
Google 自己也发布过数据,说如果在爱荷华州建设一个1吉瓦的 AI 数据中心,相比同样分布式的数据中心,一年可以节省5亿美元的运营成本,因为它在输电、冷却和运营方面都更加高效。这是 Google 一个1吉瓦数据中心一年可以节省的成本。
同时,从 AI 算力训练的角度来讲,比如 GPT-4,按照以前一张 H100 的卡,需要大约1.6万张卡、90天的时间,去训练这样一个1.7万亿的数据量的模型。到了 GPT-4.5,可能是10^26,它需要的卡可能是两三倍;甚至一个 GB200 集群,2.5万张卡,也需要90到120天计算。
在这样的 AI 军备竞赛前提下,你肯定不希望花一个季度甚至更长、3到4个月才能训练出一个模型。你更希望每一周或者每两周就能有一个模型,不停进步、不停迭代。
所以它会造成指数级的需求增长:从1万卡集群变成10万卡集群,甚至到百万卡集群,而且可能需要训练更大规模的数据模型。这样就会把整个 AI 数据中心的算力,从以前一个30兆瓦的 AI 数据中心,推到一个可能1吉瓦、甚至5吉瓦的数据中心规模,因为大家都不想输。
泓君
那我再问一个更底层的问题。大家为什么需要建设这么大的数据中心?我知道大数据中心和小数据中心是一个问题,还有一个更底层的问题:你们觉得这些数据中心未来更多是用于模型训练,还是用于应用?
也就是说,我们还需要这么大规模的预训练算力吗?还是说大家开始用 AI 代替日常搜索、代替日常应用,整个产业规模会变得很大?这个数据中心到底是支持谁的?
Ethan徐
两年之前,大家主要可能有60%到70%的算力用于预训练。当然,预训练也有自己的瓶颈,包括现在有很多不同的工程优化,无论是专家模型,还是训练后进行强化学习,这些都是厂商在考虑如何提高模型效率。
现在正在从预训练转换到后训练的过程。同时,因为要算经济账,大家要确保自己有收入。训练不能直接给你带来收入,一定要从应用或者订阅费用中获得收入。
所以现在所有大厂都在转型,把更多资源用到推理上。今年早些时候,推理和训练的比例已经发生变化,推理占比更高,可能是六成,训练是四成。
我的理解是,之后推理的比例会大幅增加,甚至占到80%以上。所以我理解,现在的数据中心主要是给这些 AI 厂商做推理使用的。
王辰晟
我基本同意这个观点。未来一定是推理和应用方面的数据中心利用率,或者能源利用率越来越高,而且会占大头。
当然,AI 训练还需要不断迭代,会有更好的模型出现,所以训练一定也会占有一定比例。但是很高兴看到推理占比越来越高,因为这意味着 AI 越来越多地在应用层面创造价值。
就像微软 CEO 之前说的,AI 只有在真正创造 GDP 的时候,才是有价值的时候。那也是真正关键的时刻。
泓君
根据你刚刚的观点,现在大公司如果激进建设数据中心,可能留下的是一堆固定资产。如果往回撤,未来要发展这些 AI 应用的时候,后面的算力又跟不上。整体大逻辑是这样的吗?
王辰晟
对,是这个逻辑。
泓君
那我们一定需要这么大的数据中心吗?小的数据中心行不行?比如说,我们零散地把一些居民用电中的闲置电力集中起来,再做储能,分配给各个应用或者大厂,这种方式有可能吗?
Ethan徐
如果是做训练,这种规模可能不太允许做这样的调整,因为它需要所有卡同时进行计算,也需要机柜和机柜之间互联,所以需要一个大的集群。
但如果做推理,就可以根据用户需求进行合理配置,使用现在闲置的算力或者电力。这个有点像以前的 PPTV,或者类似的一些产品。
现在也确实有一些公司在用闲置算力,比如 Novita。它更多是利用闲置算力,提供比其他供应商成本更低的算力。
可是作为一个大厂,更多还是要算一笔经济账。用户有需求的时候,是否始终有可用性,能否一直调用这些算力资源?如果资源是分散的,它在管理、物流等方面其实都没有效率。
包括我刚刚提到的,如果有一个大规模集群,它可以用来做训练;等到不需要训练的时候,再把这些算力用来做推理,这笔经济账更容易算。因为它可以更好地分配电力,安排备用电源,甚至降低冷却运营成本。
王辰晟
没错,我也非常赞同。具体要看应用是什么,它可能会决定对数据中心的要求。
举一个例子,现在大家也有一个初步共识:对于 AI 训练来说,也许数据中心并不需要离大城市太近,可靠性也不需要太高。因为可靠性不高的后果,无非是影响公司内部研究人员的进度。
但如果 AI 云厂商要向第三方客户提供服务,可靠性可能需要达到所谓的“五个9”,也就是99.999%的可靠性。对于 AI 训练来说,也许不需要达到那么高,三个9,也就是99.9%,可能就可以了。
这些 AI 数据中心又需要很多能源,所以也许可以建在离能源更近的地方。比如 OpenAI 的策略,我觉得就非常好:它把 Stargate 很大一部分项目放到了德州西部。那里既有风能和光能,也有一定的电网接入能力,而且还有大量土地,非常适合做 AI 训练。
所以,并不是所有数据中心都需要离客户那么近。在资源非常紧缺的情况下,可以根据应用的不同,决定数据中心要建在哪里、实现什么目标。
泓君
数据中心首先需要有电,其次还需要有发电机,以及各种各样我们可能想不到的小型设备,比如变压器,另外还需要芯片。这三个问题怎么解决?
我们今天可以一个一个来分析。首先,数据中心现在的电从哪里来?Ethan,我记得你之前在我们节目上讲过,整个美国的电力处在一个比较稳定的增长状态,但从今年的数据来看,还是这个样子吗?
我记得上周黄仁勋在 CNBC 的采访中也提到,他可以生产出整个市场所需要的 GPU,这没有问题,但现在最大的问题是没有电。有了 GPU,没有电,也没办法运行数据中心。
Ethan徐
在过去20年,美国整个电力系统的发展非常缓慢,几乎是以每年低于1%的增速,慢慢扩张自己的电力系统。这和中国每年大约5%到7%的增速完全没有办法比。
美国过去20年的 GDP 或者经济发展,和电力系统的发展几乎是脱钩的。这也导致一个问题:哪怕现在开始把增长速度提高一倍,也只是2%,所以这个增长速度远远跟不上数据中心的高速增长。
在美国新增电力负载当中,我们估计数据中心可能占到40%左右。剩下的60%可能来自电动车增长、制造业回流到美国等因素,但这也要看经济发展的状态。
还有一个数据可以分享。有些机构预估,美国每年需要增加大概80吉瓦的发电量,才能大致满足数据中心、电动车和制造业回流美国的增长需求。
但目前美国每年的发电量增长,可能只有50多到60吉瓦。也就是说,美国每年可能面临大约20吉瓦发电容量的巨大缺口。如果保持这样的缺口,未来5年左右,美国很可能会面临大约100吉瓦的发电量缺口。
美国现在的总发电量大概是1300吉瓦,所以这个缺口占的比重也是非常大的。
泓君
20吉瓦是什么概念?比如一整个纽约市,或者旧金山的发电量,会有20吉瓦吗?
这是个很好的问题。纽约的平均用电量大概是6吉瓦,每年的峰值可能是11到12吉瓦左右。
所以如果差20吉瓦,那这个缺口可能相当于2到3个纽约的发电量。现在居民用电和工业用电都要保证,AI 数据中心也要建设,因为用户数一直在增长。那么现在缺的这部分电从哪里来?
回到现在这个时间点,对于 AI 来说,大家缺多少电?我们预估,今年数据中心可能会新增大概8吉瓦的用电负荷。
美国过去几十年的电网建设中有一些余量。还有像 GE 这样的公司,也在大量制造和出售天然气发电站。另外还有清洁能源,也有一些研究机构预测,新增发电量可能有60%需要依靠天然气发电站,40%左右需要依靠光伏、风能和储能来弥补。
当然,我们希望未来核能能够尽快成为新的主力。现在美国发电量中大概20%来自核能,但这些基本都属于过去几十年一直存在的存量核能。
新增核能可能还要等到2028年左右,才能看到有新的核电上线。像小型模块化核反应堆,也就是 SMR 这样的技术,我个人估计可能还要等到2030年左右,才会真正成为主力。
泓君
我看最近 Sam Altman 投了一家公司,它们是做小型核裂变反应堆的,股价也涨得很厉害。这家公司叫 Oklo。
Ethan徐
Oklo 的股价确实涨得非常疯狂。我也没有想到,它在短短几个月之内就能上涨那么快。
我觉得这更多不是在反映基本面,而是在反映市场对它的期待和情绪,并不是它的技术基本面,或者施工和运营能力在突飞猛进。
泓君
所以这家公司现在已经实际用于发电了吗?
Ethan徐
现在还没有。我记得有一次参加能源和 AI 相关的会议时,Oklo 的一位高管告诉我们,最理想的情况可能是2027年开始实现商业运营。
但是据我过去对核能行业的理解,核能是一个难度非常大的行业,跟软件和 IT 行业不可同日而语。所以我觉得这个日期可能比较乐观。
考虑到美国过去几十年核能行业基本没有怎么发展,很多人才也转行去了其他行业,很多地方可以说是出现了断档。如果要很快让核能开始规模化商业运营,我觉得这个时间可能没有那么乐观。
王辰晟
我补充一点。美国一年增加50多吉瓦的发电量,但如果按照火力发电来看,其中的组成其实不到5吉瓦。更多的是大概45吉瓦太阳能,另外5吉瓦可能是风能。
这些发电方式都是不可持续的,会根据日照和天气变化。所以实际有效的发电量,可能一年不足20到25吉瓦。我觉得这会进一步扩大缺口。
我们也可以算一笔账。按照数据中心投资,老黄有一个数据:每500亿美元对应1吉瓦。这样算下来,如果真的有60吉瓦,就是3万亿美元的资本投入。
但是目前所有大公司预计明年的投入量,基本上不到1万亿美元。所以从整个发电量来看,只看这个数字,我觉得还没有达到那么紧缺的状态。如果把美国 GDP 的增长全部归功于 AI 数据中心增长,可能是因为电网里还有一些余量可以使用。
泓君
你说得很对。如果是太阳能的1吉瓦和天然气的1吉瓦,其实不是同一个概念。
太阳能只有在有阳光的时候才能发电,所以还有一个概念叫容量系数,也就是平均发电量大概是峰值的多少。
太阳能的容量系数可能只有25%左右。也就是说,1吉瓦太阳能容量最终发出来的电,平均下来可能只有峰值的25%。
但核电完全不一样。核电几乎全年都能一直按照峰值发电,只有偶尔需要维修保养时,才会暂时停机。所以它的容量系数可能达到93%左右。
天然气的容量系数也很高,根据长期运行的历史数据,可能达到85%左右。不同发电技术虽然都是同样的吉瓦,但实际发电量并不一样。
泓君
所以你刚刚说的每年80吉瓦的需求,是一个混合数据吗?也就是说,如果有一部分天然气发电站、一部分光伏和风能发电站,所有这些吉瓦加起来,可能需要80吉瓦左右?
我又听说美国的电网相对比较脆弱。Ethan,你能不能多介绍一下美国的电力系统?
美国的电力系统确实有很大的问题。我们一直关注发电这一点,但这稍微有些片面,因为数据中心需要的电,是通过整个电力系统获得的,而不只是通过一台发电机或一个电厂获得。
所以我们要看的是,从发电到输电再到配电,整个产业链都要形成一个有效系统,才能给居民、工业或者数据中心提供足够的电。
这里面最重要的一块确实是发电。发电大概占整个电力系统投资的50%左右,输电大概占10%到20%,配电大概占20%到30%。
输电网的发展在过去也是非常缓慢的。理想情况下,如果这些电站都能接入美国电网,那么数据中心供电是没有问题的。
但问题在于,电网本身连吸纳这些新的发电站都能力不足;要并入新的数据中心时,也会遇到很大问题。
泓君
刚刚辰晟有一个数据,你是说60吉瓦背后差不多是3万亿美元的资金支持。反推 OpenAI 的 Stargate,如果是5000亿美元的项目,它可能就能建成10吉瓦的电。
这10吉瓦现在是在 Stargate 的规划中吗?如果我们不管用什么方式,把这10吉瓦的发电容量建成了,按照 Ethan 你刚刚的说法,它输入到电网中,是不是也会有阻力和难度?
没错。现在我们了解到的 Stargate,目标是建设10吉瓦。目前可能已经签约和宣布的,大概有7吉瓦左右,但这些都还只是签约和意向。
真正要进入电网,应该还会有一些阻力。比如说,它需要在很多地方找到现存容量。对于这么大的体量,OpenAI 或者它的合作伙伴 Oracle,显然需要想办法在电网上创造新的容量。
现在很多科技公司得自己建设发电机、发电站、变电站和配网设施,甚至建设一些较短的电力传输线,来满足自己的需求,因为电力公司已经完全跟不上它们的需求了。
泓君
我们刚刚提到,输电是一块问题,建电网和发电可能是更大的问题。
我注意到,不管是 OpenAI 的 Stargate 项目,还是马斯克的 xAI 项目,现在大家基本上还是用燃气轮机的方式来发电。辰晟可能比较了解,燃气轮机现在的供应链是什么情况?它是不是也是一种比较短缺的产品?
王辰晟
它的产能完全不足。你可以看 GE Vernova 的财报,它过去10年的增长其实非常平缓。到峰值的时候,可能是2019年或2020年,大概一年有70多台,每台大概是30到50兆瓦。
我们做一个对比:燃气轮机其实和飞机发动机非常像。飞机发动机一年大概有将近4000台下线,而燃气轮机市场占比最大的 GE Vernova,一年只有不到100台,这是一个数量级的差别。
一方面,之前需求没有这么旺盛;另一方面,过去政府对于可持续能源、零碳排放有很多标准,大家对于会增加碳排放的行业也没有那么多投入,因为它相当于是一个夕阳产业。
直到最近,因为 AI 数据中心需求确定,大家才找到了这样一个短期止损的方案。但并不是所有数据中心都愿意长期使用燃气轮机,更多是因为如果并入电网,需要两年的许可审批时间,而数据中心可能6个月就要上线。
以马斯克为例,他一年半的时间差,只能使用一些短期方案,比如燃气轮机。不同公司也不一样。根据公开信息,xAI 横扫了美国将近70%的燃气轮机库存,已经用来给孟菲斯的两个大型数据中心供电。
泓君
70%?按照你刚刚说的一年产量,差不多就是50多台?
王辰晟
不是,是存量。
根据 SemiAnalysis 一位博主的分析,如果我没有记错,光是 Colossus 2 这一个数据中心,基本上就有160台燃气轮机在那里给 xAI 提供发电。
泓君
我想问一个问题,是不是燃气轮机其实也分几种类型?像 GE 的燃气轮机,是几百兆瓦的大规模设备。现在是不是 GE 的燃气轮机已经要到2028年以后才可能接新的订单?
所以大家现在开始买一些隐形的发电机,也就是小型发电机,是不是这一部分也开始被扫货了?
王辰晟
对。一种是通过飞机发动机改造的,叫航空衍生燃气轮机。它通过蒸汽循环,把发热转换和蒸汽结合起来,做 combined cycle,以提高燃料效率。
也可以做小型燃气轮机,比如 Caterpillar,但它的产能也需要很长时间才能建立起来。当然,造10台燃气轮机,也只抵得上一台300兆瓦的发电机,所以对供应链的挑战还是很大。
大型燃气轮机的发电效果更好,比如刚刚提到的 GE;小型燃气轮机也可以发电,只是功率没有那么强,效率比大型燃气轮机稍微差一点。
GE 也做小型设备,但大型设备更多,主要供应原来的发电站。
就像我刚才说的,美国之前每年火力发电只有不到5吉瓦,但现在需要20吉瓦,短期内供应链需要很长的交付周期。正如你说的,它现在的订单已经排到2028年了。
泓君
中国可以做吗?
王辰晟
据我所知,中国火力发电或者天然气发电并不是非常主流的选项。包括燃气轮机里面的叶片,也需要一些专业合金,这些都属于军工级别的安全要求。
中国目前的产业还没有像美国或者韩国的一些工业体系那么发达。所以我的理解是,制造燃气轮机是一个高技术产业,并不是靠供应链和制造优势就可以解决的问题。
如果给一定时间,肯定能够解决,但大家现在是在一场抢占能源的战争当中,并没有留给供应链这么多时间。
泓君
这只是燃气轮机的一部分。发电还会涉及很多零部件。我记得之前马斯克有一句话,说的是“Transformer,transformer”。第一个 Transformer 说的是算法,第二个 transformer 指的是变压器。
我知道变压器在整个市场上也是供货周期很长的产品,可能要18到24个月,而且它又是电厂发电中必须存在的一个环节。
王辰晟
先分享一个小故事吧。大概一年半到两年之前,特斯拉还在做 Dojo,也就是我们内部 AI 训练项目的时候,我们想在 Palo Alto、硅谷中心建设一个非常小型的训练集群,只有十几台训练设备。
当时 Palo Alto 市政府告诉我们,你们没有电。如果需要,现在变压器交期已经从3个月涨到18个月。
当然,马斯克的公司最后是怎么做的?我们自己买了两台变压器,给 Palo Alto 市政府安装好,然后说我们把它交付给你们,你们让我使用。
那时候只有3兆瓦,现在动辄谈的是3吉瓦,差了1000倍。
变压器的原理,是把高压转换成低压供使用,或者在传输时进行电压转换。里面需要很多特殊钢材,比如硅钢或者取向硅钢,因为它会带有磁力方向,可以提高效率。
这种钢材美国只有一家公司能够生产,每年产能是25万吨;全世界大概有500万吨产能,中国宝钢一家就有将近200万吨年产量。
所以美国在这个产业链上非常落后。据我所知,2016年、2020年,包括2024年,美国政府都出台过一些政策,针对这些钢材采取反倾销措施,或者通过 OBBBA 法案等各种法案,禁止美国公司从中国进口相关材料。
这是为了发展制造业回流,但短期来说,美国制造业并没有能力承接这么大规模的需求,也造成过去两年变压器交期一直没有有效缩短。
泓君
我理解,宝钢这些公司说的都是原材料层面,而不是真正把材料做成变压器的层面。
但今天聊建电厂的时候,变压器可能只是其中一个环节。英伟达其实在今年的 GTC 上讲了一种新的直流输电方式,也就是高压直流。
它还提到了800伏高压直流输电。大家可不可以讲一下,现在整个数据中心和电厂,到底是在用这种新方式,还是传统方式?它们的区别和效率是怎样的?
王辰晟
英伟达这次在 OCP 展会上讲的800伏直流,更多是用于数据中心内部、整个 AI 数据机柜的输电,用来替代之前的54伏机柜。
我们先退一步来看,整个电是怎么产生的。高压电线如果跨距离传输,是350千伏的体量;到本地变电站,大概是3.8到35千伏的中压电。
进入数据中心之后,可能通过一个不间断电源,也就是 UPS,传到数据中心内部。目前一般是480伏或者415伏交流电,再通过交流转直流,转换成54伏,给所有芯片或服务器供电。
为什么要把54伏提高到800伏?以英伟达几代产品为例,之前的 Hopper,也就是 H100,一个机柜可能是30千瓦左右。最近一代 GB200,一个机柜就到了100千瓦;之后的 Vera Rubin,以及后续产品,都要往400千瓦、甚至1兆瓦一个机柜发展。
我们简单算一下,功率等于电压乘以电流。英伟达自己有一个数据,如果仍然使用54伏做柜内传输,一个1兆瓦机柜需要大约200公斤铜来传输电力。
电流如果是纯电阻,就是电压除以电阻,所以功率和电压的平方成正比。提高电压,可以大大减少传输效率损失。
如果一个1兆瓦机柜继续使用54伏直流,光是传输电力就可能损失22%的效率。现在我们缺电,当然不能承担这样的损失。
如果提高到800伏,铜材上的损失可以降到0.6%,这是好几个数量级的进步。
泓君
现在数据中心已经具备800伏直流的能力了吗?
王辰晟
目前还没有,现在主要还是以415伏交流为主。
泓君
为什么还没有?是因为进不了电网吗?
王辰晟
不是,是因为现在还没有按照这个标准建设。
有一点很重要:英伟达虽然能自己造出所有芯片,但没有电来给芯片供电。所以老黄现在制定这样一个标准,是希望整个生态链共同进步。
如果继续使用415伏交流、54伏直流,一个1吉瓦的数据中心需要差不多50万吨铜,这是没有人能够提供的。下一步可能就会变成缺铜。
所以它不得不推动整个产业链和生态链,转向更高压的直流数据机柜输电。
泓君
那卡点在哪里?
王辰晟
更多是大家如何理解它这一周刚发布的规范,以及如何把供应链拉起来,完成规范理解、设计和生产。
泓君
是不是可以这样理解:这个规范是看到了今天缺电非常严重的现实情况,所以要重新定义行业里的各项标准?
现在刚刚发布新的标准,还需要一点时间,让生态链各个环节的企业重新设计各种电器产品,使其能够适应、进入新的标准。
下一代数据中心就有可能根据这个标准建设起来,这样整个数据中心的效率都会提高很多。
王辰晟
是的。虽然现在大家还没有建设800伏高压直流,但相比之前的54伏直流电,已经有人开始尝试200伏、400伏,大家都在往这个方向靠,只是还没有一下子把标准拉到那么高。
在英伟达的白皮书里,也提到了几个阶段:从415伏交流转换成54伏直流,也可以从415伏交流直接转换成415伏或者400伏直流,给机柜供电。
之后是把整个配套基础设施提高到800伏,在数据中心内部直接做直流传输。甚至最后的 ultimate stage,是在数据中心的输电入口就通过固态变压器直接做到800伏直流。
这样可以去除一些 UPS,并提高整体效率,把92%到98%的效率,进一步提升到98.5%,甚至99%的端到端效率。
泓君
Ethan,我们做数据中心高压直流电,跟居民用电的方式是完全不一样的,对吗?这种方式不能提供给居民用电,限定了它只能用于数据中心?
Ethan徐
我的理解大概确实是这样。我们现在整个电力系统,都是建立在所谓的交流电力系统基础上的。
刚才说的高压直流,其实在电网侧也有很多应用,尤其是中国。比如电网传输电力时,如果是长距离传输,电流越大,损耗就越多。怎么让电流变小?就把电压升高。
这也是为什么输电时需要很多变压器。一方面,变压器要在发电机那一侧把电压提高,在传输过程中损耗就会比较小;另一方面,在用电时再通过变压器把电压降低,这样居民、商业和工业使用时,电压才比较安全。
所以在中国,其实建设了很多高压直流,但那是输电线的高压直流,可能是500千伏、750千伏,比800伏高1000倍左右。
现在整个社会基本上还是以交流电作为主要用电方式。但我觉得现在确实到了一个时机,数据中心内部应该使用高压直流来提高效率。
2025年,美国数据中心的用电量加起来,很有可能占到美国总用电量的5%左右。整个加利福尼亚州今年的用电量,大概占美国所有用电量的6%多一点。
也就是说,今年数据中心的用电量会稍微低于整个加利福尼亚州的用电量。而这个数字到2030年可能会翻倍,也就是说到2030年,整个数据中心行业的用电量,很可能是加州今天用电量的两倍左右。
这是非常大的用电量。所以我也觉得,到2030年数据中心用电量大概会占到10%的时候,这已经是一个很大的用电行业,完全值得为它设计一套专用的用电标准。
比如英伟达的800伏标准,如果能够让这个占美国用电量10%的行业效率提高20%左右,会带来非常大的经济收益。
泓君
我觉得我们可能看到的,比如上周公布的那份报告,就是这一切的开始。大概给听众一个印象:我们用 ChatGPT 搜索一次,会消耗多少电?
它差不多是用谷歌搜索一次的10倍。
我另外看到一个数据,中国今年整个电力建设是495吉瓦,美国今年整个电力建设是50吉瓦。为什么中国可以建设得这么快,而美国在这么缺电的情况下,建设速度还是这么慢?
Ethan徐
总体来说有几个主要原因。一个是中国的电网很多时候有集中规划的概念,这和政治制度、经济制度息息相关。
美国很多电网是小区域、局部规划,很少有跨区域的大规模集中规划。当然,美国也意识到这个问题,开始做出改进,也出台了一些鼓励政策,但这方面才刚刚开始。
这和中国一直以来通过高压直流,把西部的电送到东部、把南方的电送到北方,通过整个中国的大规模电网建设来实现电力大规模传输,完全不能同日而语。
另一方面,在建设电网的过程中需要很多审批。在中国,它有相对集中的管理方式;而在美国,很可能一条高压输电线需要经过一个农场主,而这个农场主说不允许你在这里建设,你可能就要绕道几百英里。
在这个过程中,可能会遇到几百个这样的农场主。一个一个谈下来,时间会非常漫长。
泓君
这就是为什么美国高铁建不成。
对,是同样的道理。
还有一个数字可以给大家参考:在美国建设一条新的长距离输电线,大概需要7到12年,这是非常漫长的过程。
所以过去几年,美国几乎没有大规模输电线建设。但这只是整个电力系统建设中的一角。其实无论输电还是配电,整个建设都会遇到很多类似的问题。
泓君
长距离输电线的建设主体是谁?是政府吗?
我现在的角度是,如果做这件事的不是政府,而是科技公司,因为它们有实打实的利润和业务需求作为考量,那么它们在做同样的事情时,推进速度是不是会更快?
Ethan徐
我觉得在整个电力系统建设的某些环节,科技公司确实有优势。但在输电线这个环节,可能遇到的问题跟电力公司是一样的,还是要跟无数人谈判,这依然非常困难。
所以现在科技公司采取的策略是,不参与很多大规模输电线建设,而是走另外一条路。比如自己建设发电站,把发电站建在自己的数据中心附近。
很多事情在它们经济资源和政治资源的影响范围内,可以做得更快、更好。
泓君
数据中心的建设需要大量的水吗?
Ethan徐
建设过程中用水并不多。在运行过程中,要看采用什么样的制冷方式,这可能决定用水量。
液冷的用水量会非常大,但也要看具体技术,因为有些液冷系统是闭循环,用水量并不多。
数据中心运行过程中,用水量和用电量往往存在此消彼长的关系。当你想降低用水量时,往往意味着要用更多电去制冷;如果想降低用电量,可能就要依靠当地的水资源帮助制冷。
这也是一个矛盾点。所以在数据中心建设或者选址过程中,每家公司都会看:这个地区是电更多,还是水更多?要根据当地资源禀赋决定策略。
泓君
我看现在科技巨头建设数据中心时,也遭到很多当地居民抵制。不管是污染、缺水,还是各种各样的问题,可能都会有。
所以再回到刚才的问题,为什么中国建设得这么快?Ethan,你的观点是行政效率的问题。
Ethan徐
对。我觉得可能还有一个原因,就是成本,包括设备成本和人力成本。
中国过去大约10年,在政府和政策推动下,整个清洁能源行业发展得非常快。一个简单的数字就可以让大家留下深刻印象:中国一年的太阳能装机容量,相当于世界上所有其他国家加在一起的总和,有时候甚至更多。
这意味着整个行业已经把清洁能源发电成本压得非常低。比如我们看到的大规模储能,美国的设备价格可能是中国的两倍左右。
所以成本差异也是一个比较大的原因。
泓君
现在整个电力建设带火了哪些能源股?
Ethan徐
刚才聊到的天然气轮机,GE 可能是最受益的公司。过去很多年,我们一直在做清洁能源转型、降低碳排放,天然气发电业务其实一直都不是很好。
但现在 AI 爆发,需要大量发电,而天然气能够比较快上线。所以 GE 这样的公司已经涨得非常高了,因为大家明确看到它的订单在疯狂增长,溢价能力也非常高,需求还远远没有得到满足。
除此之外还有核能。但我个人认为,核能不是一项短期能够实现的技术,可能是未来5年左右可以实现的技术,所以这也应该是比较受益的板块。
还有很多供应链上规模稍微小一点的企业,比如生产各种电气设备的公司,以及生产各种原材料的公司。铜就是一个非常关键的原材料,这些企业和公司应该都会受益。
泓君
辰晟,之前有一家公司是做化学燃料电池的,可以在买不到天然气轮机时,短期解决这个问题。最近它的股票也涨得非常好。
王辰晟
但从资本角度来说,这笔经济账其实算不过来。
同样是100兆瓦时,一个燃气轮机可能需要大约2亿美元投入;一些其他替代方案的资本支出,可能要翻3到3.5倍,也就是大约7亿美元。
同样是100兆瓦时,它的能源效率虽然提高了,但燃料和每年的运营费用可能还要额外花费2000万到5000万美元。这样算下来,5年可能要多花6亿到10亿美元,去解决100兆瓦的能源问题。
可是现在大家在竞争,我要比你更快实现通用人工智能,我要比你更快实现商业化,所以这促使大家疯狂购买这些产能。
当然,从股票或者供应链来看,AI 现在缺的东西很多,大到变压器这样的基础设施,小到芯片的各种环节都缺。
过去两年我们一直在谈缺芯,包括芯片本身的晶圆产能,以及台积电全球独有的 CoWoS 特殊封装产能,其实还处于相对紧缺的状态。
比如因为 Sora 或者 Veo 这样的 OpenAI 和谷歌视频模型,存储器的需求会指数级增长。有一份研报说,如果不考虑新模型对存储器的需求,明年年底缺口还有5%到8%;如果考虑进去,缺口可能会更大。
这是因为过去好多年产能没有得到有效投资,又受到经济波动影响,所以其实各个方面都缺。
我再举一个有意思的例子。现在一个10万张卡的 AI 数据中心,如果参考之前训练 Meta Llama 的情况,使用大约2.5万张卡,或者1.6万张卡,训练54天,平均每3个小时就会断一次,其中58%的问题是 GPU 产生的。
OpenAI 训练 GPT-4,或者 Meta 训练 Llama 4 时,如果使用10万张卡的规模,平均32分钟就要宕机一次,需要大约15分钟恢复。
退下来的芯片当然要退回英伟达。光是10万张卡,假设每周有1%的故障率,就可能有大约1000张卡需要运回去。这是什么样的体量?可能需要100吨货物,连 FedEx 都要额外购买货车,把这100吨卡运回去。
所以整条供应链上有太多卡点,现在还不能支持这么大的体量。
泓君
我可不可以简单总结一下现在 AI 面临的问题?
前两年我们理解的是缺芯片,这两年的核心问题是缺电、缺能源,以及数据中心建设过程中的各种供应链环节和各种小卡点。
Ethan徐
是的。
王辰晟
是的。
泓君
好的,非常精彩。我们之前的节目还在聊10亿美元的独角兽,已经觉得很大了。后来聊大模型,可能是几百亿、几千亿美元的估值。
今天我们是在聊1万亿美元的市场,感觉我们的野心也在慢慢变大了。
王辰晟
没错,这个投资规模实在太大了。
泓君
我觉得这也可以说是载入人类史册的一个投资时期。非常精彩,谢谢两位。
这就是我们看到的现在整个美国经济冰火两重天的现状:一端是科技巨头热火朝天的大基建,另一端是传统行业只有0.1%的增长。
在这样的资金传导链条中,任何一个环节出现信任危机,不管是有公司造假,还是整个 AI 的落地不及预期,会不会成为这副多米诺骨牌倒塌的第一步?
感兴趣的听众,可以给我们写下你的评论,我们一起来讨论一下。那这就是我们今天的节目。如果大家喜欢我们的节目,记得在小宇宙、苹果播客、Spotify上收听、订阅我们。同样大家也可以在YouTube或者bilibili上搜索硅谷101播客,来关注订阅我们。我是泓君,感谢大家的收听。