周楠
Sam Altman 其实是 Cerebras 最早的投资人。Sam Altman 在百度投资之前,百度是 2017 年投的;在 2016 年的时候,Sam Altman 就已经投了这家公司。那个时候 Andrew Ng 的号召力非常强,而且百度应该是为数不多的 AI lab,给了充足的预算让研究员去买 GPU、训练 AI 模型。
Dario 当时能够进百度,其实是他职业生涯中非常重要的一个环节。Dario 是 Greg Diamos 招进去的。Greg 当时认识 Dario 之后,觉得这个人是个人才,对 AI 的一些构想非常深。
其实 Dario 没有 AI 的 background。他当时是数学、物理和生物背景,不是 computer science 或 AI 科班出身的研究员。
程曼祺
欢迎收听晚点聊,我是曼琪。今天的嘉宾是目前任职于高通创投 Qualcomm Ventures 的投资人周楠。他是 5 月中旬 IPO 的 Cerebras Systems 的早期投资人之一。这是一家提供新架构 AI 算力的芯片与系统公司,被外界视作英伟达的补充,甚至是挑战者。
9 年前完成这笔投资时,周楠刚从投行加入百度的硅谷人工智能实验室。当时吴恩达是负责人,Anthropic 的创始人 Dario Amodei 也曾在那里实习。
今天这期节目,我们从 Cerebras 的 IPO 切入,聊了 AI 算力的趋势,为什么 OpenAI 会和它签下百亿美元的大订单,也通过回顾这段投资过程,回到了 10 年前 Scaling Law 在硅谷萌芽的阶段,以及当时百度美研的状态。那是一段在现在的地缘环境下鲜少被人提及的故事,但它值得在 AI 历史中有一席之地。我们正式进入本期节目吧。
今天非常高兴邀请到在美国的一位投资人周楠做客《晚点聊》,来分享最近刚刚上市的公司 Cerebras 的情况,同时我们也延展聊一聊算力层的一些变化。楠楠可以和我们的听友简单打个招呼,做个自我介绍。
周楠
大家好,我是周楠。首先谢谢曼琪的邀请,也谢谢《晚点》的邀请。
我主要这 10 年都在美国硅谷做人工智能投资。我的人工智能投资职业生涯非常巧地始于 10 年前的百度美国研究院。我当时在百度美国研究院,经历了整个 AI 1.0 时代的起飞,也和当时百度的 Chief Science Officer 吴恩达一起工作。吴恩达当时是百度美国研究院的负责人,我们和他一起做了很多关于 AI 的调研,不管是算力层面、数据层面,还是应用层面。
在百度工作了 3 年之后,我又加入了高通创投。在高通的 6 年里,我主要集中在 AI 端侧的投资,也包括一些 AI 在端侧芯片上的应用和延展。
加起来,我在 AI 投资领域差不多有 10 年时间,确实目睹了 AI 从 1.0 到 2.0、再到 3.0 时代的变迁,也目睹了当时 Scaling Law 在百度美国研究院诞生、我们对它的一些推测,以及后来 ChatGPT 的爆发,所以这 10 年我还是挺有感触的。
程曼祺
今天正好我们聊的切入口就是 Cerebras 这家刚刚上市的芯片公司。它也是你 10 年前开始投资时做的第一个项目,和你刚才说的整个过程都很相关,我们正好可以来回顾一下。
我觉得可以先简单跟大家介绍一下,Cerebras 是一家什么样的公司。它是 5 月中旬上市的,目前大概接近 500 亿美元市值。
周楠
1. Cerebras 重做 AI 算力
Cerebras 当时真的非常巧,是我刚刚开始投资生涯的时候,10 年前在百度美国研究院自己 source、做尽调、建立投资 conviction,最后完成投资的第一个项目。它应该算是百度当时 co-lead 的 Series C,也就是 C 轮项目。
10 年前投这家公司的时候,它完全是在共识形成之前的一笔投资。简单来说,它是一家为 AI 的训练和推理重新设计架构的公司。公司创立之初,就是想建造一个专门为深度学习训练打造的计算系统,颠覆当时市场上大家熟悉的架构,也和英伟达的架构非常不一样。
它的核心创新就是 wafer-scale architecture。你可能在招股书上也看到了,它把一整片晶圆做成一个巨大的 AI 计算引擎,让晶圆上的大量计算核心无缝互联。传统 GPU 是一个个芯片放在晶圆上,而它是尽量让整个晶圆上的计算核心无缝互联。
它不只是一个芯片公司,也是做完整系统的公司,包括芯片、服务器、散热、电源,以及配套的编译器和软件栈。它的路线非常激进,就是要把一整片晶圆变成一个超级大的计算引擎。
它要解决的问题,是让大量计算单元和内存在同一个硅片上靠得更近,从而降低通信和数据搬运成本。这就是它和传统 GPU 最根本的不同。
从今天的市场来看,Cerebras 也不只是一个硬件或芯片公司,而是英伟达之外一个非常具有颠覆性的架构系统。
程曼祺
我刚才的描述可能不太准确。简单来说,它是个芯片公司,但更准确地说,它应该算是一家在寻找新的 AI 算力方法的公司。
周楠
是的,它是在构建一个软硬结合的系统。
程曼祺
现在它上市之后一度冲得非常高,市值接近 1,000 亿美元。市场上也出现了一种叙事,把它定义成英伟达的挑战者。你作为它的投资人,怎么看这种定位?
周楠
2. 英伟达之外的 Option B
这个定位非常有意思。我们刚刚决定要投这家公司的时候,正是我刚加入百度美国研究院的时候。
那个时候有很多 AI researcher 在训练模型。有几个 researcher 第一天就跟我说,未来模型的 size 会越来越大,需要的芯片和数据也会越来越多。要让模型迭代得很快,就需要非常强大的芯片。
当时的共识是,AI researchers 都在用英伟达。他们给我的第一个 lecture 就是,不能只依赖英伟达这颗芯片。因为未来会出现非常大的模型,这个未来是多少年,当时并不知道,但如果这个时候不去找新的芯片,5 年、10 年以后就会形成英伟达独大的局面。
而且英伟达在 10 年前并不是对深度学习最友好的芯片。它 96% 的 die area 不是专门为深度学习优化的,因为它更多是为游戏和图形显卡设计的。所以当时如果涉及其他非图形的模型,它并不是最优解。
那个时候我种下了一个种子,就是我要找一个不同架构的芯片,但不是要和英伟达抗衡,而是找一个更适合训练深度学习的芯片。起始点就是找一个可能比英伟达更好用、或者未来能够避免英伟达垄断的替代品,至少是一个 Option B。
回到现在,英伟达当然已经是一个 5 万亿美元的公司,是大语言模型时代的王者。如果今天再问,Cerebras 虽然已经成功上市了,它是不是英伟达的挑战者,离这一步还有多远,我觉得今天来看,Cerebras 应该是英伟达在一些特定 workload 上的挑战者,尤其是 inference,也就是推理上的挑战者。
但它不能说是英伟达全栈生态的全面替代者。英伟达的护城河不只是芯片,还包括 CUDA、开发者生态、网络、系统、软件、客户信任和供应链等一整套生态,这才是它最强的护城河。
所以对于 Cerebras 来说,它的机会在于,当某些 AI workload,尤其是推理 workload,受限于内存带宽、通信延迟以及推理响应速度时,它是一个非常优秀的架构选择。
程曼祺
它的 inferencing 速度确实比现在的一些解决方案快很多,招股书里也能看到这一点。
你刚才说到 10 年前大家的想法,我也想到那个阶段。全球范围内其实都有类似的创业思路,比如寒武纪也是前后成立的。那会儿有一个创业潮,是做 ASIC,也就是面向特定任务的集成电路,大家认为它可以针对深度学习做更好的优化。
但后面这 10 年的发展过程中,ASIC 并没有撼动通用 GPU 的地位。通用 GPU 的发展也超出了大家的预期,因为 10 年前英伟达显然还不是现在这样一个受关注的巨头。我们后面展开聊你当时在百度美研的情况时,也可以回顾这个过程。
回到 Cerebras 的近况,大概两三年前它的估值也只有数十亿美元,最近上市到了数百亿美元,甚至逼近 1,000 亿美元。你觉得这是市场情绪变了,还是这个公司的业务和技术真的发生了很大变化?
周楠
我觉得是市场对于这个产品的需求变了,也包括市场到了一个更成熟的阶段。这个变化点可能有几个阶段。
两三年前,GPT moment 刚刚到来的时候,ChatGPT 让 AI compute 变成了全球非常稀缺的战略资源。但那个时候大家要解决的问题是模型训练,模型的能力和智力水平需要不断迭代,所以当时英伟达还是叙事的主体。
两年前,AI 推理,也就是 inference,还没有现在这么大的需求。现在你会看到,一半以上的 GPU 需求都用在推理上。今年 AI agent 的爆发,也进一步激发了对推理芯片的需求。
当推理需求从去年开始到今年出现大规模爆发之后,Cerebras 的 value proposition 里低延迟、low latency,以及高吞吐、high throughput 的解决方案,就变得更有价值,也更稀缺。
所以在这个节点上,Cerebras 出现了爆发。作为目前非常优秀的一种解决方案,它的估值有这样大的提升,我觉得也是水到渠成的事情。
程曼祺
2026 年 1 月有一个比较明显的利好,就是 OpenAI 和它签了一个很大的订单,至少是 200 亿美元的合同,他们也做了一些定制化设计,建立了深度绑定的合作关系。你可以展开讲一讲,为什么 OpenAI 会对 Cerebras 的方案感兴趣,以及他们大概是怎么合作的?如果能分享一些内部细节,比如他们接触了多久,也可以讲讲。
周楠
3. OpenAI 寻找第二条算力路线
如果你看到一些公开市场的信息,会发现 Sam Altman 其实是 Cerebras 最早的投资人。Sam Altman 在百度投资之前,百度是 2017 年投的;在 2016 年的时候,Sam Altman 就已经投了这家公司。
这说明当时 Sam Altman 在成立 OpenAI 的时候,也预测到了同样的事情:未来 AI 模型做得很大、应用场景很多时,不能只依赖英伟达一家芯片。这个可以解释为什么 Sam Altman 在那个时候就去投资 Cerebras。
程曼祺
这个时间点确实卡得很紧。2015 年 12 月左右,也就是 2015 年底,OpenAI 成立;2016 年 Sam Altman 就投资了 Cerebras,相当于 OpenAI 成立没多久之后,他已经对算力市场有相当的 vision 了。
周楠
回到 OpenAI 当下的情况,它已经是 AI 领域的霸主。它对 Cerebras 感兴趣非常合理。
一方面,OpenAI 不是说需要一个便宜一点的 GPU,而是目前 AI compute,也就是 AI 算力,已经成为模型继续 scale 的瓶颈。算力稀缺是第一位的核心瓶颈。
第二,OpenAI 的逻辑很清晰。不管是 OpenAI、Anthropic,还是其他 frontier lab,都不能依赖单一路线。即使英伟达很强,现在训练模型和做推理都在用英伟达,任何一家模型公司也都需要让 supply 多元化,不能只依赖一个芯片提供商。
这涉及供应链考虑,也涉及战略自主性。所以它去找一个可替代方案,是必然会发生的事情。不只是 OpenAI,我可以预见,Anthropic 也在寻找其他算力替代方案。每一个 frontier lab 都在做这件事情。
同时,推理越来越重要。推理决定了用户的产品体验,也决定了 developer 使用这些模型时的商业毛利。推理要做到低延迟、高吞吐,cost per token 也要不断优化。
Cerebras 确实能在这些方面提供非常明显的优势,所以对 frontier lab 有很强的吸引力。模型公司不只是要买算力,还要找到一个英伟达之外的 Option B。
程曼祺
Cerebras 是 Sam Altman 个人投资的,还是 OpenAI 投资的?在美国这算关联交易吗?
周楠
这是他个人投资的,是 Sam Altman 当年个人投的。
程曼祺
所以不算关联交易。
周楠
不算关联交易。Sam Altman 个人投资了很多公司,也投过一些硬件公司,其中一家硬件公司最后还被 OpenAI 收购了。
程曼祺
你说的是 OpenAI 收购那家硬件公司的事情吧?我知道。当时也有一些人吐槽,说 Sam Altman 有很多资本运作,因为他也不是一个特别大的股东。
周楠
对,他不是一个特别大的股东。
程曼祺
你刚才说到 Cerebras 和一些前沿 AI lab 合作。最近 6 月初,它们也宣布和 Amazon AWS,也就是云厂商有更多合作。
另一方面,Cerebras 自己也有云业务。这是一种什么样的布局和思路?
周楠
4. 云平台降低采用摩擦
Cerebras 现在也开始做自己的云平台。这让我回想起 10 年前我们投资的时候。当时 Cerebras 的客户,是那些有能力训练深度学习模型的平台,包括 Salesforce、Google、Microsoft 和 Amazon。只有这样的大平台才有 data center,才能训练大模型,当然也包括百度。
现在它去搭建自己的云平台,原因很明显:它的客户越来越多了,不只是大型 frontier lab,也有很多应用场景和做应用的客户。
对于硬件公司来讲,纵观整个生态,我在高通工作这么多年,发现硬件公司一个很大的挑战就是 adoption friction。什么叫 adoption friction?就是你让客户购买一套全新的硬件,把新的计算方案部署到自己的数据中心;因为买了新的硬件系统,还要修改软件栈,这个周期会很长。
Cerebras Cloud 通过做自己的 cloud,可以把整个复杂的底层系统封装起来。客户直接使用 API,就能立刻把 Cerebras 的产品接入自己的模型训练、应用或者 API 应用中。
所以从 Cerebras 客户采用产品的速度来看,它做云也有相当的战略意义。
程曼祺
我当时看到它有云业务的时候,有一个比较阴暗的揣测,或者说我觉得这对公司来说同时有一种风险和诱惑。
包了一层云之后,底层究竟使用什么算力,有时候对客户和市场来说可能就没有那么重要了。因为底层使用别的算力,它也可以从云平台获得收入。
但最近我看到它的创始人 Andrew Feldman 在 Bloomberg 的 Tech Summit 上非常强势地表态:我们会和所有人合作,除了英伟达。
至少从公开表态来看,他说自己不会使用英伟达的芯片,也不会和英伟达合作,这一点挺有意思。我不知道你有没有观察到,英伟达当然有很强的生态和云厂商渠道。它自己也孵化了 CoreWeave,和 Nebius 这样的 neocloud 紧密合作。
周楠
这些 neocloud 也有很强的痛点:它们的算力不够。为了服务客户,GPU 已经成为一个很大的 constraint。
对于 Cerebras 来说,在算力成为 constraint 的情况下,做云也是业务的延展,会让业务拥有更强的护城河。
如果它有云业务,也会给客户提供一整套解决方案。比如我是一个做模型的公司,如果我去找英伟达以及周边的 cloud company,仍然解决不了算力问题。
但如果有 Cerebras 的方案再加上云,就有了一个 one-stop solution,可以直接使用 Cerebras 的云来做推理、运行推理 workload。这其实是一件非常省事的事情。
当然,我只是从商业和产品逻辑角度这样讲。
程曼祺
总结来说,你现在能看到 Cerebras 这个公司的上限和下限是什么?比如你觉得它保底能做到什么,如果发展得更好,能到什么状态?
周楠
它的上限其实很高。现在 AI compute 的需求非常大,所以我觉得它在推理上的上限可能真的是无止境的。如果它之后到 5,000 亿美元,我不会吃惊。
它的下限在于,wafer-scale 这样的解决方案是不是能够持续 scale。它目前的客户比较集中,招股书里的风险披露也提到,它现在有几个大客户,包括 G42,客户不像其他芯片厂商那样多元化。
所以它需要在客户层面,让使用范围迅速扩大。它的解决方案能不能在大规模情况下迅速 scale,是需要关注的方向。
它现在也有 data center,wafer-scale 的解决方案目前已经不是问题。但能不能持续在稳定环境下交付、运营,并且让客户真正用起来,我觉得这是他们需要注意的。
程曼祺
这里正好可以补充讲讲它使用的 wafer-scale 新方案。一整片晶圆做得特别大,它在规模化交付上的阻碍或者难点是什么?
周楠
5. Wafer Scale 面临硬件考验
我们可以讲讲 wafer-scale engine 的好处和代价,也可以讲讲 wafer-scale 和传统芯片制造有什么不同。我尝试用比较容易理解的方式解释一下,因为它确实非常 technical。
传统芯片制造是在一片晶圆上做很多小芯片,然后把它们切开、封装,再把很多 GPU 通过 PCIe、NVLink 这样的方式连接起来。
但 Cerebras 是反过来的。它尽量不把晶圆切开,而是在一整片晶圆上做一个非常大的 AI 计算引擎,让大量计算核心在里面无缝互联。
这样做的好处是,计算单元、内存和通信网络都在同一个硅片上。数据不用频繁从一个芯片搬到另一个芯片上,也不用把外部的 HBM,也就是高带宽内存,频繁搬到计算单元上,所以可以大幅加速计算。
打个比方,传统 GPU 像是很多个强大的人类脑袋,但需要依靠高速网络协作;Cerebras 则像一个非常巨大的大脑,尽量让计算和记忆都发生在同一个硅片上。
如果说 GPU 的优势是生态成熟、通用性强,那么 Cerebras 的优势就是让推理,尤其是和推理相关的 AI workload,减少分布式通信和内存搬运。这是我对两者差异的理解。
它的挑战涉及当时投资决策中的风险问题。
程曼祺
你们在投资决策时担心的风险?
周楠
对。现在大多数风险应该已经解决了。当时的风险包括这种颠覆性架构里的很多风险点,我们可以重点拆解,比如封装、散热、良率等,风险非常多。
如果回到现在,它已经上市了,你问它的潜在下限是什么,一个是客户集中度,另一个是英伟达也不会坐等市场被 Cerebras 拿走。
但我觉得这个市场还是非常大的。英伟达可能也会推出推理性能非常强的芯片。
程曼祺
英伟达其实也收购了 Groq,收购的是 Groq 的 LPU。
周楠
对,你这个点非常好。当时 Groq 在融资的时候,大概是 2019 年或者 2020 年,我也看过 Groq,就觉得它和 Cerebras 的思路很像。
回到 Cerebras 的架构风险,我觉得还要看这种架构能不能迅速在客户中扩大规模。这可能仍然是它需要注意的一点。
程曼祺
它的生产制造会导致规模化比较难吗?我看到很多评论认为,这种晶圆做得特别大,良率会是一个问题。
周楠
良率确实是个问题。这个我们之后可以在风险部分拆解当时的状态。
程曼祺
我们接下来可以回顾一下你最开始投资 Cerebras 的过程。那是差不多 9 到 10 年前,当时你刚加入百度美研。你前面也提到,这是你自己找到的项目,可以讲讲为什么当时要看这个方向,以及你怎么接触到这家公司的吗?
周楠
6. 百度开启 AI 投资生涯
2016 年我刚加入百度的时候,刚开始自己的 VC 投资生涯。
在那之前,我在投行工作。当时我在 Barclays Capital,就是华尔街的 bulge bracket。后来我被调到香港,在投行的 3 年里做了很多移动互联网公司的上市,正好赶上中国移动互联网公司上市的大潮,比如阿里、京东等。
所以我当时已经对科技领域的公司打下了一些基础,也做过一家芯片公司的上市。2016 年,百度在全球海选 AI 投资人,寻找加入硅谷人工智能研究院、和吴恩达一起工作的人,我就是在这个背景下加入百度的。
这相当于从二级市场转到一级市场和早期投资,从投行卖方转到了买方投资。比较幸运的一点是,我和传统 financial VC 里的投资人不太一样,我一开始就进入了一个纯 AI 环境。当时大家还没有在投 AI,而我是在这样的环境下开始投资生涯的。
程曼祺
为什么 2016 年想从移动互联网转向 AI?投行主要是做 IPO,当时移动互联网还在上升期或者收获期,AI 则非常早期。
周楠
因为我在投行时做过一家搜索公司的上市。那家公司没有成功,我就不说名字了。但它在上市招股书里讲了一个 AI 的故事,那是我第一次接触 AI。
我当时就觉得,这是 future。后来我知道,百度在 2014 年请吴恩达加入百度美国人工智能研究院。我也去过几次硅谷,听过几次吴恩达的讲座,就对百度产生了很深的崇拜。
2015 年底,百度在全球海选 AI 投资人时,我递交了简历,后来非常幸运地加入了百度。
程曼祺
虽然那个 IPO 没有成功,但你从招股书和团队交流里看到了新的机会,也为你加入百度铺了一条路。
可以继续回到你刚加入百度时的情况。为什么当时要找算力这个方向?
周楠
刚加入的时候每天都非常激动。那时百度美国人工智能研究院应该是硅谷最强大的 AI research lab。
Andrew Ng 当时的号召力非常强,百度也是为数不多的 AI lab,给了充足预算让研究员买 GPU、训练 AI 模型。Andrew 也是第一个公开说明 GPU 可以很好地用于训练 AI 模型的人。
我觉得 Andrew 和英伟达之间也有一个非常重要的连接。如果没有 Andrew 当时为英伟达背书,大家不会形成这样的认知:原来 GPU 可以被大规模用于 AI 模型训练。
我当时就在百度人工智能研究院,和世界上最顶尖的 researchers 一起工作。这些人包括很多你可能也知道的人,Anthropic 的 founder Dario Amodei 当时也在百度,不过我和他没有 overlap,先声明一下。
当时有相当一部分研究员后来成为 OpenAI 早期的 researchers,基本上那部分研究员是 2022 年 GPT moment 开始以后,最早一批 frontier lab 的 co-founder。所以那个时候的人才密度非常震撼。
我觉得那是 AI 1.0 时代。百度美国 AI lab 里的研究员在做不同的事情:有人做 speech model,有人做 vision model,有人用 deep learning 为各个行业寻找解决方案,比如 retail、fintech,还有 healthcare 和 autonomous driving。
但当时有一个很强的共识。百度发布 Deep Speech 2 那篇论文之后,我们已经看到,AI 的进步依赖三件事情:更大的模型、更多的数据和更强的算力。
所以我们形成了一个很朴素的判断:如果想让 AI 持续进步,底层算力基础就非常重要。GPU 虽然是当时最好的工具,但不是从零开始为深度学习设计的,所以我们需要找到更强大的算力系统。
我大概经历了半年的学习,把 AI 从训练、架构、数据到算力等一系列知识从头到尾弄明白。2017 年开始,我就满大街去找和 GPU 不同的新算力系统。
程曼祺
你刚才提到的 Deep Speech 2 论文,可以展开说一下。这篇文章 Dario 是一作,他在文章里发现了 Scaling Law 的雏形。
你加入百度美研时,这篇论文是 2015 年底发布的。在你加入的那个阶段,整个组织会觉得这是很重要的事情吗?
周楠
我加入时,Deep Speech 2 的论文已经发表了。我也和当时的 researchers 聊过这个发现。
Deep Speech 2 对百度来说非常重要。但在那个年代,百度美国研究院还没有把 Scaling Law 作为一个非常有数学规律的结论,系统化地表达出来。
不过基于 Deep Speech 2 的发表,当时已经非常清楚地感受到一件事:当模型更大、数据更多、训练更久、计算系统更强时,模型表现就会持续提升。
我更愿意把它称为一种经验性的直觉。后来到了语言模型时代,它被更系统地验证和理论化,也就是今天大家所知道的 Scaling Law。
但如果回溯的话,Scaling Law 诞生的萌芽,就是当年 Deep Speech 2 的那篇 paper。
程曼祺
所以当时百度美研的人认为这件事很重要,也认为应该沿着这个方向去找研究和投资机会?
周楠
可以这么说。当时的结论很清楚:想让 AI 能力继续提升,就需要让模型更大、数据更多、训练时间更长,也需要更强的计算能力。
那时候还没有 pre-training、post-training 的概念。由于训练需要更长时间,所以必须找到计算能力更强的芯片。这就是当时对我来说的投资启发。
百度内部有很多团队在做不同的事情,也有团队在做语言模型。当时百度训练出来的语言模型,已经接近 3 亿个 parameters。你想,3 亿参数在 10 年前是非常大的量级。
我很清楚地记得,他们跟我说,当时用 GPU 训练这样一个模型,至少需要 3 个多月。我当时听傻了,说要 3 个多月才能训练出一个模型?他们说是。
我又问,如果需要调参、观察模型效果,或者进行迭代怎么办?他们说,那就是好几个月的时间。
基于这个时间上的紧迫性,如果想让模型能力持续提升,确实需要找到更强大的芯片。当时我们使用的英伟达芯片,需要 3 个多月才能完成训练。
7. Cerebras 赢下架构之争
后来我在一堆芯片公司中找到 Cerebras。Cerebras 当时说,他们有一种架构,可以让深度学习训练提效 1,000 倍。比如原本需要 3 个多月训练的模型,使用当时的 wafer-scale 架构,可能几天或者几个星期就能训练出来。
我觉得这样的发现非常有吸引力。
程曼祺
你当时还看到了哪些公司?
周楠
看到了很多,包括 Graphcore、Wave Computing,还有一些做 ASIC 的公司。
对 ASIC,我当时最早的判断是,它更多应该算推理芯片。但基于 Deep Speech 2,我认为当时要解决的最大问题还是训练。要让 AI 能力不断提升,首先要解决 AI 训练的问题。
所以我没有把寻找 ASIC 推理芯片作为 priority,而是寻找能够提升深度学习训练效率的芯片。在这种情况下,我感兴趣并展开尽调的公司,主要集中在 Graphcore、Wave Computing 和 Cerebras 这 3 家。
程曼祺
Graphcore 在 2024 年被软银以 5 亿美元收购。
周楠
对。我现在已经不太记得当时 Graphcore 和 Cerebras 的具体对比了,但当时的结论是,Graphcore 可以提速、提效,但效果不如 Cerebras,架构也没有 Cerebras 这么颠覆性。
作为投资人,我当时的直觉是,如果要投,就投一个具有颠覆性架构、真正能够让深度学习训练提速百倍、千倍的公司。
程曼祺
你刚才说的第三家公司是什么?
周楠
是 Wave Computing。这家公司的架构和理念与 Cerebras 还挺像,但它的团队有问题,所以第一个被我淘汰了。
程曼祺
这家公司现在还存在吗?
周楠
不存在了,应该很早以前就不行了。
程曼祺
所以你当时三选一,选到了从现在的结果来看最好的选择。
周楠
我觉得三选一的时候,Cerebras 的信号非常明显。
Cerebras 的团队非常强。它的创始人 Andrew Feldman 之前创办的 SeaMicro 被 AMD 收购了。他几乎是带着 SeaMicro 的原班人马,以及对全新架构的愿景,创办了 Cerebras。
当时最吸引我的一点是,我那时还不太懂技术,但他们的团队大概有 80 多个人,其中将近 70 个人是 PhD。他们的工作经验加起来有几百年,可以看出这个团队多么有经验、多么强大,也是我见过 PhD 密度最高的公司。
我当时就想,这个 leader 这么有号召力,能让原班人马和这么多 PhD 为他工作,而公司才成立一年多,这很不一般。它一下调起了我所有的好奇心和兴趣,我就开始对它展开尽调。
程曼祺
创始人 Andrew Feldman 本人并不是芯片工程和技术出身,这会是你当时投资的一个疑虑吗?
周楠
这是个很好的问题。对正常的芯片公司来说,创始人基本都是工程师出身。
但对于 Cerebras 这种系统级公司,我觉得 Andrew 的强项在于产品定义、组织团队、理解客户,以及坚持长期愿景的能力。
当时我更多是凭着赤诚之心和直觉去投他的。但现在回溯,我觉得他身边有几个很强的信号。如果用我现在的知识回头看,我还是会选择他。
程曼祺
那几个信号是什么?
周楠
首先,他身边已经有非常强的技术 co-founder,而且这些技术 co-founder 都跟了他很多年。这不是减分项,反而是很好的组合,因为他已经有两三个很强的技术 co-founder 和他一起创业。
另外,我觉得 Andrew 是一个非常有经验的创业者,可以说是 serial entrepreneur。他在这个行业里很多年,有非常深厚的 ecosystem 关系网。
他的优势是非常清楚客户的痛点,也能讲清楚这个系统为什么必须存在。
还有一点让我印象很深,就是他的 conviction。他对自己做的事情有很强的 conviction,不是空洞地讲一个 vision。
我在 deep tech 投资这么多年,见过一些 founder 给你讲很大的 vision,说要解决一个很大的问题,但具体技术路线和风险怎么解决,很多 founder 讲不清楚。
Andrew 恰恰相反。面对 Cerebras 这样颠覆性、复杂的技术路线,他扛住了我对所有风险的尽调。
当时我带了好几个百度 AI 的 researchers 去做非常深度的尽调,把风险全部拆开来讲。比如良率怎么办、散热怎么办、电源怎么办、compiler 怎么办、客户为什么要买。
Andrew 完全不回避这些问题。他一个一个拆开,非常耐心地跟我讲。我当时是一个芯片小白,他可以不厌其烦地每天跟我讲 2 个小时,持续 4 个星期。
所以我认为他是一个非常 decisive 的创业者。他不仅能把 vision 讲清楚,也能把风险点从第一性原理出发,一个一个讲清楚。
对于投资人来说,投 deep tech 不是只投一个宏大的愿景和 vision,而是要知道投的风险到底是什么,能不能把风险清清楚楚地拆解出来,并且看到抵消这些风险的 mitigation strategy。
综合整个投资过程来看,我觉得 Andrew Feldman 是一位非常卓越的创业者。
程曼祺
你们当时尽调的过程具体是怎样的?你找百度美研的研究员来支持,在组织上是怎么协调的?是吴恩达直接帮你调人吗?因为有些研究员可能不喜欢做这一类事情。
周楠
我觉得当时这个时间点非常有意思。
当时 Greg Diamos 亲自训练语言模型,还有其他 researchers 在训练 3 亿参数的语言模型。他们有非常实打实的痛点:用英伟达芯片需要 3 个月,他们非常想找一个更快的芯片来解决训练时间问题。
所以当我把 Cerebras 这样的架构带到他们面前时,他们眼前一亮,觉得这可能是期待已久的解决方案,非常想知道它到底能不能行、靠不靠谱。
Greg Diamos 本人还是 NVIDIA CUDA 的 key developer。百度当时能挖来这么厉害的人,确实非常强。Greg 在读 PhD 期间就参与构建英伟达 CUDA 的生态系统。毫不夸张地说,他是当时帮助英伟达构建 CUDA 的核心人物之一,而且是特别重要的人。
他也是 Deep Speech 2 那篇论文的作者之一。
所以当时 Greg 看到这个架构也很兴奋。我们那几个 researchers 都非常积极地跟着我一起做尽调。
我自己也非常激动,觉得发现了这样一个架构,还可以在实战中和这些 researchers 一起讨论、实践。那段经历非常宝贵。
程曼祺
后来 Greg 也和吴恩达一起创业了一段时间,对吧?
周楠
对,他们后来一起创办了 Landing AI。
而且当时 Cerebras 只有一个 simulator。它当时的 wafer-scale architecture 还没有在实物上实现,芯片也还没有流片,所以所有构想都在 simulator 上。
能够验证这个 simulator 的公司,当时只有百度一家。因为只有百度拥有当时世界上最大的语言模型。
那个时候 Transformer 还没有出现,百度的语言模型基于百度自己研发的架构,叫 PaddlePaddle,也就是飞桨。我们把语言模型跑在 Cerebras 的 simulator 上。
当时因为是一个 signal letter,只能通过一些数据推测结果性的东西。比如假设芯片良率可以顺利通过、compiler 没有问题、散热和封装也没有问题,在这些情况下结果确实非常好。我不能透露太多具体结果,但当时确实只有百度能够在它的架构上运行这样一个模型,并给出尽调结果。
我觉得这个结果对 Cerebras 也非常重要,因为在某种程度上,它验证了公司的想法和技术理念。
那段时间,一些研究员包括 Greg,不只是帮助我做投资尽调,也和 Cerebras 有相当紧密的合作。有些研究员后来甚至加入了 Cerebras。
程曼祺
像 Greg 这样的研究员,我理解他们能验证的是这套方案对模型训练提效是否有用。但其他风险点,比如良率、散热、封装,你们要找什么样的专家来判断?
周楠
我找了一些斯坦福的教授和芯片专家。
硬件层面的风险,理论上是可以拆解出来的。比如当时良率不好,如果第一次流片失败,失败到什么程度,需要多长时间重新流片,大概增加多少成本,我们都把最坏情况演算了一遍。
当时的判断是,可能要多花 6 个月时间,增加 500 万到 1,000 万美元成本。公司的现金流能不能支持重新跑一遍流片?我们觉得风险是可控的。
这是硬件层面的良率风险。散热风险,包括水冷和系统设计,当时也已经有了方案。
我记得在他们办公室里,Andrew 给我看过液冷系统。芯片大概这么大,整个液冷系统是一个更大的盒子,所以可以推断,当时的液冷已经有比较好的解决方案。
另外,很多计算核心在一个 wafer 上,万一出现短路怎么办?电源风险怎么办?他们也有软件层面的方案,可以识别哪颗芯片短路,然后把任务重新运行到其他 redundant 核心上。
所以从物理和硬件风险来看,他们已经做到了当时能够做到的、相对可控的解决方案。
回到 Greg 和百度美研研究员的工作,他们更多负责 compiler 和系统层面的测算。比如模型怎么映射到这个架构上,怎么和 TensorFlow、Caffe、PyTorch 等框架对接,怎么和客户的数据中心对接,API 怎么对接。
这部分百度美研花了很多精力做尽调。当时我们觉得 compiler 也是可以解决的。系统级和代码级的尽调非常重要。
如果没有百度美研的研究员,我没有办法预测这部分风险。当时百度美研虽然纯硬件背景的人比较少,但自动驾驶团队里有很多硬件专家,我把他们都问了一遍。
散热、电源、良率风险,我全部和这些硬件专家讨论过。当时那批硬件专家中,有相当一部分人现在也在做 CPU 创业,所以他们给了我很多宝贵的尽调意见。
我觉得,如果看 Cerebras 早期投资人,百度做的尽调可能是技术角度最深入的,给出的尽调和风险报告也最全面。
我当时把尽调的初步结果,也就是大概的结果,和早期投资人 Benchmark、Coatue 的投资人分享过。他们比百度更早投资,听完以后也觉得心里的石头虽然没有完全落下,但至少落下了一小半。
程曼祺
你刚才说百度美研出去很多人创业,我觉得挺有意思。百度不光在中国互联网是黄埔军校,看起来百度美研在硅谷也是黄埔军校,输送了很多业界人才。
周楠
我觉得它是相当厉害的黄埔军校。
里面有一些 researchers 是 Inflection 的 co-founder、Adept 的 co-founder,也有一部分人后来成为 Meta FAIR 实验室的 founding members。当然也包括 OpenAI 和 Anthropic 的人。
程曼祺
这个问题我们后面也可以展开。先把 Cerebras 的投资过程聊完。你们后来上投决会是怎样的过程?当时哪些人一起决定投不投?
周楠
当时投决会上有我的老板、百度 CFO Jennifer Li,还有陆奇和 Robin Li。
作为投资人,我觉得自己非常幸运。我当时把 investment memo 写了大概十几页,有中文一稿和英文一稿。4 个星期后发给投决会,不到 2 天他们就拍板通过了这笔投资。
这件事当时我觉得理所当然,但后来在高通这样的 CVC 工作,也了解了其他 VC 的投决会之后,我才知道,当时有这样一个有眼光的投决会是多么幸运。
首先,他们对于非共识投资是有共识的:要投一个非常具有颠覆性的算力系统。百度从上到下都非常支持投资 Cerebras,所以当时的投决会可以说是无痛秒过。
程曼祺
你还记得李彦宏和陆奇有什么具体评价或反馈吗?
周楠
具体的评价和反馈我不太记得,当然也不太方便透露。总体来讲,当时投决会的高层非常支持。
吴恩达不在投决会上,也不参与投资决策。
程曼祺
当时投资时,吴恩达已经离开百度了?
周楠
对。吴恩达是 2017 年 4 月离开百度的,我的投资是在 2017 年 8 月完成的,大概是 8 月或者 9 月。所以投决会当时就是 CFO、陆奇和 Robin Li。
程曼祺
你从接触到这个项目,到最后投资,中间有几个月时间。
周楠
2017 年初我还不认识这家公司,是到 2017 年上半年后期才接触到的。
当时也很巧。我把 Coatue 的 founding partner Thomas Laffont 拉到百度来 catch up。Thomas 现在已经是投资界的大佬了。他当时正好见了 Jennifer,Jennifer 也在美国出差。
在 meeting 过程中,我提到了我们对算力的构想。Thomas Laffont 本人曾经是半导体研究员,非常有意思。他是 Coatue 的 founding partner,同时也花过很长时间研究半导体。
他听到我讲这个 topic 后非常激动,跟我说他投了一家非常颠覆性的公司,叫 Cerebras,然后给我介绍了这家公司。
我们当时眼前一亮,立刻开始看 Cerebras。那时候我们已经看过 Graphcore、Wave Computing 等公司,但都处在一个 lingering 的状态,没有觉得值得投资。直到 Cerebras 出现,我们才真正眼前一亮。
程曼祺
当时百度管理层,比如李彦宏,有提过要等流片之后再投吗?因为你们是在流片之前投资的。
周楠
没有。百度高管没有干涉这件事情。
你想,百度能够那么早成立百度美国研究院,Robin Li 当时那么早就参与到 Geoffrey Hinton 的实验室,这是一群很有 vision 的 leadership。现在回头看,他们支持这样一笔颠覆性投资,我觉得是理所当然的。
程曼祺
你还记得当时投进去时估值是多少吗?和你看的其他公司相比,估值并不便宜。
周楠
当时估值差不多是 7 亿多美元。我现在回头看当时的 memo,觉得很有意思。7 亿多美元在 2016、2017 年的背景下并不便宜,已经快接近 unicorn 了。
所以这家公司当时很贵。我当时测算它的收入,认为到 2025 年,AI 训练芯片市场大概是 220 亿美元。
现在回头看,我当时错得有多离谱。2025 年的 AI 训练市场比 220 亿美元大了不知道多少个量级。
在我当时预测 2025 年训练市场大概 220 亿美元的情况下,我对 Cerebras 投资回报率的预测是 3 到 5 倍。可见我当时真的低估了整个 AI 腾飞的速度。
程曼祺
但你当时测算它的市占率应该比较高。
周楠
我测算的市占率大概是 20%。
现在它的绝对收入体量和签的订单都非常大,但市占率很小,因为整个盘子变得特别大。
8. Cerebras 熬过硬件低谷
2017 年到 2019 年,Cerebras 经历了一段非常艰难的时期。它确实有过很多推迟,因为架构本身的原因,刚才讲的几个风险基本都发生了。
它的流片有延迟,大概延迟了 1 到 2 年。我们当时风险测算的下限基本都发生了,所以团队的韧性和坚持非常重要。
虽然它现在的市占率还不高,但它的架构成功了。现在成功之后,就是要在推理市场上铺开。
我不认为它在训练市场没有机会,只是现在 frontier lab 既然训练已经使用英伟达 GPU,就已经形成了完整体系,让它换训练芯片的风险很大。
Cerebras 的解决方案刚好特别适合推理场景,所以它现在的大多数客户都是推理场景的客户。
程曼祺
OpenAI 的 200 亿美元订单还没有交付,在这个阶段能说它已经在推理市场成功了吗?
它的推理也需要和英伟达配合。Cerebras 的算力结构很特别,是不是意味着英伟达需要做比较多的改动,生态上能跟得上吗?
周楠
我觉得需要一些定制化。公司已经到了这个体量,我认为他们为了 OpenAI 的订单定制化 infra 是完全必要的。
接下来就看它能够多快交付这个解决方案。
程曼祺
他们自己的团队能搞定吗?
周楠
我认为可以。
公司刚成立时,早期 80 多名员工中有很多 PhD,其中相当多的人做 infra。它的人才结构非常全面。
程曼祺
他们现在会和一些第三方 infra 公司合作吗?比如 SGLang 这样的生态里,也成立了一些新的公司。
周楠
我认为有一些合作,但我不能确定。
我最近也想给它介绍一些生态系统里的公司,比如做 AI agent infra 的公司。因为 AI agent 的推理市场也非常符合 Cerebras 的 value proposition。AI agent 的 infra 如果能和它合作,整个 workload 跑起来会更顺畅。
程曼祺
你说 2017 年到 2019 年是这个公司比较低谷、非常艰难的阶段。
周楠
对,那段时间很艰难。
我两周前去纽约参加了它的 IPO 庆祝会。当时几个早期投资人纷纷发言,我非常感动的一点是,他们每个人都提到,2017 年到 2019 年,公司遇到了很大挑战。
当时芯片没有流片成功,各种风险层出不穷:一会儿 compiler 搞不定,一会儿 wafer 流片出现问题,各种事情都在 delay。
但董事会对 Andrew 的支持非常大。我觉得公司能成功,和早期投资人以及 3 位董事会成员对他的耐心等待有很大关系。
你想让一个计算芯片取得成功,真的没有 10 年时间很难实现。
程曼祺
它现在 4 个董事会成员分别是 Benchmark、Coatue,还有哪家机构?
周楠
是 Benchmark、Foundation Capital 和 Eclipse。
程曼祺
它在成长过程中,算是一个对主流基金来说比较抢手的项目吗?
周楠
我觉得不算。
包括最后两年前那轮融资,我记得估值是比较高的。高通那轮是 20 多亿美元,后面还有 40 多亿美元、80 多亿美元的投资。80 多亿美元那一轮,应该有一些比较大的基金进来了。
但在两三年前,主流一线 VC 是不敢投的。他们不知道这个市场到底有多大,对 wafer-scale architecture 也没有特别深的 insight。
再加上 ChatGPT moment 出现后,训练芯片几乎一边倒地使用英伟达。那段时间 Cerebras 的芯片已经流片出来了,但在训练场景里大家都在用英伟达。
由于迁移成本比较高,那段时间也是比较难熬的。它当时还有一个客户 G42,既是投资人又是客户,所以有单一客户风险。
程曼祺
如果它当时流片更快,是不是现在的算力结构可能会很不一样?
周楠
我觉得这个问题很好。如果它当时流片成功了,或许会很不一样。
比如 OpenAI 当时训练模型时,是黄仁勋拿着 GPU 送过去的。如果那个时候已经有 Cerebras,可能就是 Andrew Feldman 拿着 Cerebras 的方案送过去。
所以如果它流片更快一些,历史或许会被更多改写。但必须非常快,因为 2017 年 Transformer 发布之后,OpenAI 就已经开始探索这个方向。
程曼祺
而且现在 frontier lab 训练模型的 GPU 都是一个 cluster。数据中心和基础设施已经投资、建设完成了,要在这个时候换到其他芯片,其实是非常大的系统风险。
我觉得这可能也和半导体行业的周期有关。硬件迭代周期比较长,大家使用产品时,也会考虑稳定性以及良率能不能支持规模交付。英伟达 GPU 毕竟是积累了很多年的产品,软硬件都积累了很多年。
周楠
其实我刚才那个假设,回头看也很难成立。
Cerebras 本来就提出了一个比较新的方案,而且到 2017 年 Transformer 出现时,它成立的时间还不长。这个新方案还要经过物理制造验证。
在半导体历史上,很少有这么快的成功。你总是会遇到各种问题。
即使假设它流片成功,也还要能够规模化生产和交付,compiler 以及软硬件也都要跟上。所以确实很难在这么短时间内达到理想状态。
如果不到理想状态,frontier lab 就不会用你。我觉得这也是它和大模型或者软件公司不太一样的地方:它是一家厚积薄发的硬件公司。
周楠
对,现在反而是个好机会。
你看它和 OpenAI 的合作,包括 Anthropic 也在寻找定制化芯片。现在算力使用一部分是训练,但相当大一部分是推理。当推理需求变得非常大时,Cerebras 的优势就都凸显出来了。
所以与其继续争夺训练市场,不如把全部精力放在推理 workload 上。我觉得从战略决策来说,去吃推理市场是比较正确的决定。
程曼祺
说到周期问题,这家公司还有一个特点,就是创始人年纪都比较大。当时你投资时,这会是一个问题吗?
周楠
半导体公司的创始人年纪都不小,因为半导体周期很长。
Andrew Feldman 是连续创业者,前一个公司 SeaMicro 被 AMD 收购。你要经历这样一个周期,至少就已经需要十几年,更不要说之前的工作和学习经验。
很多半导体创业者本来就是 PhD,所以团队年龄不可能很小。Andrew 当时应该已经 40 多岁了,但这是优势。
因为你在这个行业里积累很多,能够解决每一个节点上的风险。你需要行业关系、人脉,以及对整个生态系统非常深的知识。
所以对于半导体创业来说,经验和年龄是加分项。
程曼祺
我印象比较深的是,他们开始创业时,另一位联合创始人、技术负责人 Lauterbach 当时已经 60 岁了。不过他现在已经退休了,他们有新的 CTO。
周楠
对,现在有新的 CTO。新的 CTO 当时也是 founding member 之一,应该是 founding members 里比较年轻的一个,现在也已经很有经验了。
程曼祺
想再回来聊一聊百度的情况。除了在百度投资 Cerebras 之外,你当时在百度美研做 AI 投资时,还看过哪些公司?当时百度的整体投资主线是怎么布局的?
周楠
9. 百度错失前沿 AI 机会
当时百度非常坚定地要投 AI。除了 AI,还有自动驾驶这个方向。
我花了很多时间看自动驾驶。当时对自动驾驶硬件,包括激光雷达和算力,也做了一些布局。像百度出来创业的地平线创始人余凯博士,以及一些做自动驾驶 Level 2、Level 3 芯片的公司,我们也都看过,做了一些布局和投资。
当时有一件事很可惜。百度真的很有前瞻性,那时候我们想做一个基金。百度当时有 Baidu Capital 和 Baidu Ventures,我还参与过一个百度 Growth Fund 的募资,想布局更前沿的 AI 全栈系统,并且把基金独立出来。
那时候已经出现了一些地缘政治风险。我当时还有一个 thesis,就是投资 data 和 data engine,所以很早就 source 了 Databricks。
OpenAI 当时也在我们的 deal list 上。那时候 Sam Altman 和百度关系不错,陆奇也算是他的 mentor,所以 OpenAI 当时愿意接受百度投资,也在我们的 deal list 上。
程曼祺
你说 OpenAI 愿意接受百度投资,是哪一年?2017 年吗?
周楠
大概是 2017、2018 年,应该是 2018 年。那时 OpenAI 还比较艰难,我们看得非常早。
当时我参与那个基金的融资,花了很长时间。非常可惜,因为地缘政治的原因,很多原本想参与的 LP 最后都打了退堂鼓,基金最终没有做起来。
如果这个基金做起来,百度可能会成为全世界最牛的 shareholder,成为这些 frontier lab 的 shareholder。这确实是比较可惜、让我有些意难平的事情。
程曼祺
所以在筹备新基金的过程中,对 OpenAI、Databricks 这些已经在 list 上的公司,你们的想法是募到钱之后一定会投?
周楠
那是一定会投,因为它们已经在我的 investment thesis 里了。
Databricks 是 data warehouse、data engine 相关的公司。当时连 Scale AI 也在我的备投名单上。Alexander Wang 2016 年就出来创业了,我当时认为 data annotation 也是一个 investment thesis。
程曼祺
后来百度复盘过这件事吗?因为看起来错过了很多投资机会。
周楠
我后来也离开了。我觉得这不是百度错过,而是当时地缘政治的原因让基金没有办法做起来。
这不是哪一家公司的问题,而是当时处在中美这样的状态下,这件事很难做起来。
基金没有办法继续之后,我顺着这个 investment thesis,和很多美国一线 VC 聊过。我聊过 Insight Partners、Sequoia、Benchmark,也聊过很多其他机构。
我还去找了 Benchmark 的 Eric。我想,你们投了 Cerebras,是不是能够 buy in 我的 investment thesis?但他们没有一个人 buy in,都说要投 SaaS,不再投这么高风险的 AI。
那时候大概已经是 2018、2019 年。我当时想着,基金做不起来,但拿着这个 thesis,总能碰到认可它的人。可惜当时聊了这么多 VC,没有一个人赞同。
在那样比较遗憾的情况下,我加入了高通创投。
程曼祺
那硅谷这件事情开始转向是什么时候?大家什么时候从 SaaS 转向 AI?
周楠
我觉得是在 ChatGPT 爆发以后,可能 2022 年底的时候大家还没有完全意识到。
2022 年底有一件很有意思的事情。Sequoia 最早写了一篇文章,谈到“Generative AI is here”。如果你去看那篇文章对 Gen AI 的描述,其实是 Sequoia 一个很年轻的 partner 宋亚航写的。
但那篇文章可能也没有引起很大重视。因为如果你看 Sequoia,它也错过了这一波,没有押注任何 frontier lab。
我不是要批判 Sequoia。我是觉得,Sequoia 也没有踩上这一波。包括这些顶级 VC,我觉得都是到 2023 年后期、2024 年才开始意识到,要全线押注 AI。
这其实比中国 VC 也没有早很多。在硅谷,大家真正把大模型看作一个巨大投资机会,也是 ChatGPT 爆发之后。
OpenAI 是 2015 年创办的,Anthropic 是 2020 年创办的。但这两个 frontier lab 在创办时,融资都不是一帆风顺的。对美国 VC 来说,也是 ChatGPT 爆发之后才意识到这件事真的可以做成。
程曼祺
Anthropic 最早的投资人其实都不是 VC。一位是 Eric Schmidt,Google 的前 CEO,另外还有哈萨比斯。
周楠
对。我还可以讲一个小故事。
10. GPT 3 连接百度与 Anthropic
2020 年夏天,OpenAI 的一些百度前同事给我打电话。他们很多人是我的老同事,因为当时在百度共事过。他们也是最早跟我讲 Deep Speech 2 和早期 Scaling Law 雏形的那些人。
他们打电话说:“跟你讲一个激动人心的事情,GPT-3 快要训练出来了。”
那时候我已经在高通了。他们还给我发了一篇很长的文章,讲 GPT-3 是怎么回事,说我当年在百度想做的事情快要做成了,而且是在 OpenAI 做成了,模型也训练出来了。
我问,这个模型聪明到什么程度?因为当时百度的测算是,如果想训练出一个达到 Wikipedia 水平的模型,可能需要接近 10 年,也需要消耗很多算力和上亿美元。
我问他们,已经到这个阶段了吗?当时那位朋友很诚实地说:“还没有,还会胡说八道。”
那是 2020 年,距离 GPT-3 发布还有两年,但 GPT-3 当时已经在做 post-training。他们很兴奋地跟我讲这个阶段性的成果。
后来他又跟我说,他们都想出来创业,因为不再信任 Sam Altman,觉得他对安全问题不够重视,跟我吐槽了很多。
他们想出来创办一家新公司,问我有什么意见,能不能做 advisor。那时候正是疫情期间,还没有疫苗。我说,我能给你们什么 advice?和当年一样,还是要融很多很多钱去买算力。你们觉得自己能融到吗?
他们说好像比较难,也不知道能不能融到。我说,那这就是一个大挑战。你们要找到愿意给钱买算力的人,而主流 VC 不会投这样的钱。
我当时很诚实地告诉他们,即使在高通内部,也很难推动这样的投资。那个电话最后就以这样的结论结束了。
其实我当时很想和他们见面,可惜那时疫情最严重,还没有疫苗,所以我没有勇气去现场找他们。
后来,Jaan Tallinn 去和他们见了一面又一面,给他们出主意怎么融资。很多时候这都是命运,之后才出现了 Anthropic。
当时他们想出来创业时,我确实知道 Jaan Tallinn 是他们的早期天使投资人。他不是以 VC 机构身份,而是个人支持他们。那时候主流 VC 没有这样的 conviction,因为 GPT-3 还在 post-training 阶段,hallucination 也非常严重。
距离 GPT 真正发布还有两年多,没有人想到两年后它就能问世。我觉得其中的 generalization,也就是泛化效应,以及 aha moment 的出现,应该是在 2022 年。
程曼祺
你在百度的这几年,除了投资部分,也观察过其他团队是怎么运转的吗?当时百度美研全是 AI researchers 和自动驾驶团队,规模有多大?
周楠
顶峰时期应该至少有 250 多个人。
研究员确实都是全世界非常顶尖的人,在一起共事。
程曼祺
你加入的时候已经搬到 Sunnyvale 了,对吧?
周楠
对,我加入时就在 Sunnyvale 总部。
程曼祺
我记得那个时候大家每天中午一起吃饭,研究员们讨论不同的研究话题和 topic。那个阶段确实非常难得。
周楠
我上个星期还和 Greg catch up。他也很感慨,说那时候是一堆神仙打架的年代。那个人才密度,我觉得甚至是 Google DeepMind 都没有过的。
相当一部分人可能真的是冲着 Andrew Ng 来的。还有就是,百度的创始人 Robin Li 他们很早发起了这个研究院,让 researchers 能够实现当时对 AI 的理想和构想,并且给了非常充足的 budget 去买 GPU。
我觉得当时全世界可能很难找到第二家这样的研究院。
为了挖人才,百度在吴恩达加入之后,带来了很多 DeepMind 的人才,那些人也愿意跟着 Andrew 一起过来做一番事情。
程曼祺
你后来和其中的人聊过,包括吴恩达为什么离开、Dario 为什么离开的原因吗?
周楠
没有细问过。我觉得这可能也不方便跟我讲。
程曼祺
当时百度美研研究员典型的工作状态和氛围是怎样的?
周楠
我觉得正好可以澄清一下。大家一直有一个段子,说 Dario 在百度受到了一些不好的对待,导致他对中国很不满,但这都是开玩笑。
Dario 当时能够进百度,其实是他职业生涯中非常重要的一个环节。
当时 Dario 是 Greg Diamos 招进去的。Greg 认识 Dario 之后,觉得这个人是个人才,对 AI 的构想非常深,训练模型的能力也很强。
即使 Dario 没有 AI background,他当时是数学、物理和生物背景,不是 computer science 或 AI 科班出身的研究员。把他招进来的时候,内部可能还有一些质疑,但 Greg 发现了这个人才,把他拉了进来。
这个故事是百度美研的一些同事告诉我的。当然,Dario 本人是不是这样认可,我不确定。这只是我听说的一个故事。
当时研究员可以根据自己的研究构想发表 paper,做 AI 研究。我觉得那种氛围非常自由,也非常鼓励他们做各种发现。
程曼祺
Dario 的背景和我们刚才说到的早期投资也有相关性。a16z 投资他的合伙人也是学生物学的,具有生物科学背景,可能他们以前认识,或者有共同话题。
周楠
我觉得非常有可能。
程曼祺
大家都说百度在 AI 上有一种起了大早、赶了晚集的状态。百度 2011 年就成立了百度美研,2015 年 Deep Speech 2 论文已经看到了,扩大数据和算力可以训练出更智能的模型,但最后这件事并不是百度自己做成的。
周楠
这点确实会让人觉得有些可惜。
我感觉还是和当时的地缘政治有关。2018 年、2019 年之后,因为地缘政治,研究员也会离开百度。
在中美 AI 竞争的情况下,研究员可能会基于这种压力选择离开。所以我觉得地缘政治是一个很重要的原因。
程曼祺
对比来看,即使在中国公司训练的中国模型里面,百度现在也不是最靠前的。
周楠
我对中国的情况不太了解,因为我在百度工作期间一直都在百度美国。
但我觉得,最早期那批人工智能 researchers 确实在美国,比如从 Hinton 实验室出来的研究员,以及吴恩达这样最有 vision、最有远见的人,确实是在美国和硅谷。
百度美研起步很早,2011 年就成立了。起步很早以后,美国这边慢慢出现了创新信号和 AI 信号,中国才开始布局。
我作为一个在美国的投资人来看,美国在颠覆性创新上更有优势,中国在应用和追赶上更有优势。
中国是一个非常大的 AI 应用场景,有很多摄像头部署在街上。当时 computer vision model 中国非常强,市场也非常大。
语言模型则是硅谷先开始创新,再扩散到中国。所以我觉得,中国一直有工程能力强、可以迅速追赶、在落地场景上加快应用的优势;美国更多是在颠覆性架构和原有认知上的创新。
程曼祺
你刚才讲到 2011 年在美国,我本来想到一个反例,就是微软亚洲研究院也有很多 AI 人才。但你后面说的说服了我。
微软亚洲研究院当时可能更强的是计算机视觉。再往前追溯,可能是 2008 年前后发现 CNN 非常有效,到 2012 年 ImageNet、AlexNet,那确实也是从美国开始的。
语言模型,也就是 NLP,同样是从美国开始的。
周楠
至少过去十几年里,这个模式是成立的。美国很多 AI 创新更像是一个起点,然后扩散到全球。
程曼祺
百度倒是有两个留下来的 AI 成果,一个是自动驾驶,另一个也和你投资 Cerebras 有关,就是昆仑芯。
周楠
昆仑芯。百度在自动驾驶上的研究布局非常早,最后也坚持做了下来,这一点确实要给百度点赞。
昆仑芯当时的负责人,我在投资 Cerebras 时也和他交流过。我觉得他当时已经有了创办昆仑芯的雏形。
所以百度能够把昆仑芯做出来,也很了不起。
程曼祺
你们百度前同事在一起,有没有复盘和讨论过过去百度美研这 15 年的得失?你觉得错过了什么大的机会?
周楠
大家心里还是比较唏嘘,觉得有一些可惜的地方,但好像这可能是历史的必然。
作为一家中国公司,在美国做 AI 模型研发,本身就会遇到很多阻碍。
后来我回想,2018 年时,我和前老板想做一个 AI 基金,可能那时候已经预见到地缘政治的阻碍。我们想成立一个独立的 AI 基金,把这些厉害的人都投进去。
当时已经看到很多趋势:从百度离开的研究员纷纷创业,而且都非常厉害,应该把他们都投下来。这是我们当时募集基金的初衷。
但很可惜,基金也因为地缘政治原因没有募起来。
如果当时我更成熟、更勇敢一点,破釜沉舟,也许可以把它做成。但那时我太年轻,没有管理一个独立 VC 的能力。
程曼祺
如果把百度每年出去的人都投一遍,包括 Pony(小马),还有 Anthropic 和 Dario,那可能确实会是非常好的组合。
周楠
对。如果当时把这些人都投了,应该会非常成功。
所以我经常想,如果当年我再有一些经验就好了。如果那时我已经做了 5、6 年投资,很多事情可能会不一样。
可惜我当时才是第二年、第三年做投资,太年轻了,没有办法支撑起这样一个基金的架构。
程曼祺
你后来想从百度离开,是什么契机?
周楠
也是因为当时基金没有办法继续运作。百度在美国也没有投资团队了。
我带着这些 investment theses 去找美国一线 VC,也没有人认可。那时候距离共识到来还太久,特别反共识。
正好高通抛来了橄榄枝。高通愿意去寻找端侧 AI 的应用场景,所以我就很自然地加入了高通。
程曼祺
最后这一部分,我们聊一聊你在百度和高通整个 10 年的科技投资过程中,看中的方向,尤其是和算力、infra、半导体相关的领域,看到了哪些机会。
周楠
11. 下一轮 AI 投资地图
我的投资 thesis 一直比较清晰。
在百度那几年,我确定的是算力投资方向,后来过渡到 data engine。我觉得应该投资和 data warehouse、data engine 相关的公司。当时的大背景是以云为基础,训练大规模视觉模型和语言模型。
当然还有自动驾驶,以及自动驾驶的硬件和软硬结合方案。这些是我早期形成的投资理念。
到了高通以后,因为高通非常强调端侧 AI,有大概 3 年时间,我看了很多 IoT 和端侧布局。
当时我有一个 lesson learned:端侧 AI 在美国,尤其是硬件和 IoT,不太容易腾飞。端侧和硬件相关的投资,在美国本土土壤不是特别好。
真正的 IoT 可能在中国更容易跑通。基于全球视角,高通也是一家全球性公司,我们发现 IoT 投资在中国明显比美国更容易成功,因为中国的应用场景更多。
程曼祺
你说的 IoT、端侧投资,举例来说是什么?比如智能设备?
周楠
比如智能家居。就是智能设备、端侧设备,以及早期一些机器人的投资。
那时的机器人投资还早于现在所谓的 world model、physical AI。我们发现,这些场景在中国有更多落地机会。
到了 GPT moment 出现的 2022 年,我有一个觉醒期。那时我发现,大模型的到来比我们在百度测算的时间早了好几年。
我突然意识到,要赶快把投资抓回到 cloud-based infra 上来。于是 2023 年开始,我就在思考后面应该怎样布局。
从 2023 年开始,我觉得可能是 AI 2.0 到 3.0 的过渡期。模型进步和 enterprise adoption 都开始加速。
我在 2023 年、2024 年还在高通内部做过分享,认为 enterprise AI 的到来会比我预想中更快。当时我给了一些数据和场景,也提出了 coding AI 的概念。
那时 coding AI 已经在微软 Copilot 上有了一些尝试,还没有到 Cursor moment。我当时就觉得,这是一个会爆发的场景。
这也和我在百度的基础有关。你在那个时间点往后看,会很清楚地看到,大模型、enterprise AI 的 adoption、持续增加的算力,以及 AI infra 都会有投资机会。
大语言模型时代的 infra 还是一片空白。从 2023 年到 2025 年,很多 AI infra 都有机会下注,包括 RAG、inference optimization,以及怎样部署模型等。
程曼祺
现在你看到算力层和云层面有什么新的机会?整个大的 infrastructure 层面,你会重点看什么?
周楠
今年开始,推理占据了算力中很大的部分,所以推理成本优化会成为 AI 产业很大的战场。
这包括帮助模型在应用层做 deployment 和 inference,也包括多模态推理优化。推理成本最后会反映到 profit margin 上。
不管是模型应用方,还是终端消费者,如果能够降低推理成本和 token cost,gross profit 就会有很大提升。
所以这已经到了 AI 商业模式优化的下半场,对推理成本的优化非常重要。
有一家叫 AIG 的公司,今年 3 月被 Nebius 收购,就是非常典型的推理优化创业公司。
这家公司是我去年 8 月、它刚成立时发现的。它是通过 MIT 教授韩松的一位朋友介绍的,创始人是韩松的学生。
因为高通对端侧推理比较敏感,我对推理优化这件事也非常敏感。我觉得端侧爆发以后,推理优化会非常重要,会对 AI 的 business model 带来质的提升。
程曼祺
韩松以前也自己创业做过芯片公司,叫深鉴,是联创之一。
周楠
对。
程曼祺
所以这是一类机会。它是第三方 infra 优化公司,偏软件系统层。
周楠
对,它偏系统层。
通过 inference optimization 或 token optimization,你也可以延展到 cloud 相关的 business。这一层和 cloud 结合得最自然,因为它可以直接帮助部署在 cloud 上的客户优化 inference,让模型部署得更好。
程曼祺
之前黄仁勋划分 AI 产业时,把云和 infra 放在同一层,是五层蛋糕中间的第三层,最下面一层是能源,再上面是芯片集群,第三层就是云和 infra。这是你会重点看的一层。
周楠
我觉得这已经在发生了,而且是一个很重要的事情。对模型厂商和应用场景来说,这都是非常重要的环节。
程曼祺
除了你刚才说到的、已经被收购并成功退出的公司,这个领域还有没有你觉得特别有意思、但没有投上的公司?
周楠
有。这家公司我其实看得很早,也很想投,但它卖得太快了,所以也要恭喜创始人。
程曼祺
它后面就没有再融资,很快完成了交易?
周楠
对,没有再融资。你可以看到这个事情的重要性。
程曼祺
这个领域还有哪些比较有意思、值得关注的公司?
周楠
当然还有,但我暂时不提公司名字了。
程曼祺
你还要投,对吧?
周楠
对。这个领域现在可能处在共识形成的初期,还是有两三家公司在做。
程曼祺
之前 Cerebras 上市时,你写过一条社交媒体分享,说伟大的投资发生在没有形成共识之前。现在有没有什么你很相信、但还没有形成共识,是很好的投资机会的方向?
周楠
这个问题很难回答。
我觉得这两年的早期投资其实非常难,因为 AI 已经成为共识。成为共识之后,所有投资人和产业链上的人都会想办法去挖,还有没有非共识机会。
所以窗口越来越短。我们当时投资 Cerebras,到它上市,经历了 10 年。如果是在 2023 年投资 Anthropic 或 OpenAI,它们可能也处在共识刚刚形成、但还没有完全形成的窗口期,至少还留有一点时间做投资布局。
但现在越来越难。
我去年还写过一封给身边投资人朋友的信,没有公开。大概是在 2025 年 2 月,我列举了一些投资方向,包括 general-purpose AI agent,当时提到了 Manus 和 Genspark;还有 video model、multimodal model,以及 multimodal infra;也包括 Figure AI 这样的公司、physical AI 和 vertical AI。
这些公司给投资人的窗口期可能只有 1 到 2 个月。看中以后要立刻下注。
这个时间窗口越来越短。想做好早期投资很不容易,必须有敏锐的嗅觉、很强的 picking 能力,能够找到正确的公司,并在共识形成之前下注。
所以现在对早期 VC 的考验非常难。
今年相对容易的投资是后期投资。像 coding agent、frontier lab,以及一些已经跑出来的 infra,都已经有比较大的 winner。
越来越多 VC 在投中后期,并且在募比较大的基金去投中后期。比如 Benchmark 最近宣布要募一个 20 亿美元的基金,募资窗口在 24 小时内就关闭了,一天之内就把 20 亿美元募完。
这些头部 VC 都在募偏后期的基金,用大钱去砸已经出圈的 category winner。
所以我觉得今年的投资主题,就是砸 winner,用大钱去砸已经跑出来的公司。
程曼祺
那这还是 venture capital 吗?
周楠
这是 venture capital 的变种。
VC 原本需要在没有形成共识之前下注,但现在从非共识到共识的窗口太短了,短到你可能还没有反应过来,它就已经形成共识,变成需要花大价钱下注的局面。
所以现在的 VC 演变成了先募一个大基金,去投已经跑出来的公司。
程曼祺
当然,砸 winner 也不是十拿九稳。如果它出了岔子,可能就是很大的问题。
周楠
对。我是这么认为的:如果把 AI 的时间拉长,我们可能还处在这一轮技术变革的早期,可能是第四次或第五次技术变革的早期。
虽然现在已经有很明显的 winner,大家也觉得 AGI moment 到来了,但 adoption 还处在早期。
在这样的早期阶段,已经出现的 winner 会越长越大,形成飞轮效应。比如为什么现在大家都像疯了一样要投 Anthropic?Anthropic 现在可能刚刚到 1 万亿美元左右的量级,那它未来会到多少?
我觉得它变成 5 万亿美元并不是奇怪的事情。
如果你是一个明智的一级市场投资人,现在要投什么?我觉得投 Anthropic 是 no-brainer。
还有一些已经跑出来的 infra 公司,比如 Fireworks、fal.ai、Baseten,它们也形成了早期飞轮效应,后面的雪球可能会滚得很大。
所以直接 bet 这些 winner,也是一种共识。
程曼祺
接下来你比较期待发生什么?
周楠
我觉得 physical AI,也就是 robotics,可能会有很多人说它像 10 年前的自动驾驶。
但根据我在语言模型上学到的经验,我认为 physical AI 的 aha moment 可能比自动驾驶、也比我们想象中更早到来。
它现在还有很多问题,包括数据瓶颈、软硬件结合的瓶颈,但我认为 aha moment 会比我们想象得更早。所以现在可能是下注硬件的好时候。
程曼祺
为什么?理论上 physical AI 不是比自动驾驶更难吗?
周楠
它的很多场景比自动驾驶更加 diverse,但对正确性的要求没有自动驾驶那么高。
自动驾驶必须做到 99.9% 的正确性,否则会出人命。但 physical AI 对任务完成度和准确度的要求可能会比自动驾驶稍微宽容一些。
程曼祺
为什么大语言模型的经验会让你觉得 physical AI 的 aha moment 更早到来?
周楠
如果回到 10 年前,当时我们在百度测算,觉得出现一个达到 Wikipedia 水平的模型可能需要 10 年。但模型有一种 generalization,也就是泛化能力。
模型泛化能力的速度会比想象中更快。当模型越来越大时,它的进步程度会呈现一种陡峭曲线。我觉得这可能是一个物理规律。
程曼祺
可不可以说,百度美研 10 年前低估了语言模型的进化速度,但高估了自动驾驶进化和落地的速度?
周楠
自动驾驶对准确性的要求非常高,所以我不觉得我们低估了它的速度,我是说高估了它的速度。
语言模型则有一定的泛化能力,这一点可能是当时没有预料到的。
程曼祺
我印象里,2017、2018 年,甚至更早的 2016 年,从美国到中国都认为全无人驾驶会比较快普及。
周楠
对。当时 Waymo 和马斯克都有很多相关言论。
而且当时也有路线之争:到底基于视觉模型就可以,做到 Level 3 就够了,还是需要激光雷达才能做到 Level 4。这也是当时的一个重要争论。
程曼祺
所以 physical AI 也是你接下来可能会花精力看的方向。
周楠
对。我可能会花一些精力看这个方向,因为它还没有形成共识。
我觉得投资人一定要在没有形成共识的事情上,形成自己的投资理念和逻辑。
程曼祺
你觉得 physical AI 会产生新的芯片、算力和 infra 需求吗?现在有没有看到这一类苗头?
周楠
这个还不好说。
芯片层应该会有一些机会。如果 physical AI 落地时,机器人身上都挂着一个 GPU,我觉得会非常耗电。所以需要 low latency、power efficient 的解决方案。
我觉得算力解决方案上会有创新空间。
另外,除了芯片层,我还认为可能会出现一种新的 CPU 架构,作为推理芯片。
现在推理芯片上,Cerebras 是一家刚刚出圈的公司,未来可能还会出现其他基于 CPU 解决方案的公司。我知道已经有一些创业公司在做,已经开始行动了。
这也是一个值得关注的方向。
OK,那今天非常感谢周楠做客晚点聊,分享了过去十年的投资故事,尤其是刚刚上市的 Cerebras 这家公司的投资故事。从最开始他怎么发现了这家公司,和百度美研当时的研究员一起怎么做了详尽的尽调,然后在这家公司的方案还是一个非共识的时候,很快地做了投资决策。我们也延展地聊了现在整个 AI 领域,尤其是算力和 infra 层有什么正在萌芽的新的投资机会。那今天非常感谢大家收听晚点聊,节目就到这里,拜拜。
在第 156 期与 Henry In 的 2026 年 Q1 AI 季报中,以及那之后不久我和 SpaceX 的早期投资人、Fusion Fund 的创始合伙人张璐聊马斯克的 Terra Five AI 基建设想的节目中,我们都讨论了 2026 年以来 AI 算力的最新趋势。大家都看到的转折是从训练走向推理,也就是算力消耗的重点会从制造大模型的阶段走向使用大模型的阶段。这本来没有什么新鲜的,前两年也一直有人在说。不同的是,2025 年下半年至今,coding 以及 agent 应用的爆发让这一条预言真的成了事实。大家看到了 agent 这类更复杂的任务和应用,带来了推理算力和 token 消耗量的爆发式增长。
更深入地看这个趋势,又可以看到两个明显的变化。一是 AI 推理有了更多异构芯片的机会,主要就是指不同于英伟达通用 GPU 结构的芯片。Cerebras 上市后的强势上涨表现,就是因为一些人押注 Cerebras 设计的 Wafer Scale Engine 这种独特架构在推理阶段有优势,这包括低延迟、高吞吐、高稳定性等等。其实英伟达自己也做了相关动作,就是我们这期聊到的,他们在去年 12 月非常快速地以 200 亿美元收购了 Groq 这家创业公司,并且在今年 3 月 GTC 的新方案上把 Groq 整合到了英伟达的整个算力平台上。Groq 主打的就是在推理阶段提供 AI 算力。
二是 CPU 崛起。比如这期我们就聊到了 CPU 正在出现一些新的创业机会,这是因为在 Agent 的工作流程中存在一些调度类型的任务,它们并不适合 GPU 所擅长的并行计算。周楠也提到,他知道有些团队已经开始在这个方向发力和创业了,这也是他接下来可能会投资的方向。其实这种变化也反映在了二级市场上,我们看到英特尔和 AMD 近年来都有不小的涨幅。
回到九年前周楠在百度美研想投资 Cerebras 的起点,就是研究员们认为未来的大模型不应该在算力层只依赖英伟达这一家公司。而现在的情况是,如果不考虑 Google 的 TPU 这种大厂自己训练模型时主要自己使用的自研芯片,在公开市场、公共云上,英伟达确实形成了事实上的 AI 算力垄断。十年前部分研究员想避免的这种对单一公司过多的依赖,依然发生了。这种状态会持续吗?未来的变局可能会从哪条裂缝开始?这会是我们之后反复讨论的话题。
本期节目就到这里,感谢收听。如果你对今天聊的话题有观察、好奇或疑问,欢迎在评论区分享想法,这也会成为我们节目的一部分,让整个讨论更完整。你也可以把我们的节目分享给对这个话题感兴趣的朋友,推荐更多你想听的主题和嘉宾。你可以从小宇宙、苹果 Podcast 等渠道关注“晚点聊 Late Talk”,也欢迎关注我们的公众号“晚点 Late Post”。下期再见。