灵初其实是在这一波的具身大潮中创立的。我们定位于是解决具身中皇冠级的那个问题,就是人的双手的操作问题。你们是一家大脑公司,我们现在做的不是一个纯粹的 R research 的团队,我们在做的是 research and development。Chat GPT 在二零二三年的年初就引进了 Peter Deng 这样的产品,所有的产品最后都要完成一个从技术到产品到市场。中国的具身市场现在是非常传奇的,你在业内肯定也感受到,今天的具身公司进来的人才密度、资金体量、棋手都不敌上一波的顶点的这些公司,会是现在这波公司的低点。什么样的数据可以被视为能够规模化去做预训练的优质数据?这是一个非常好的问题,只有基模公司和头部的基层公司能够分辨是不是 garbage,这很重要。我们认为一百万个小时只是一个起点,中国有机会在大脑层面做的更好吗?数据成本在这么低成本的量。起的很快的情况下,有可能在模型上是能够追的。一家公司到底是真正的在训大脑,还是水货公司?一个最直接的标准就是它每年花多少算力。数据进来之后,我的管线能把它吞下来。数据我们是有很多的这种底层的洞察。上一个时代做自动化机器人,这一波巨深的创新派最后谁会胜出?我觉得您很有立场来回答这个问题。一系列公司倒下去,它不是在旧世界站出来,它是来自于一个完全的新世界的物种,一个新世界降维打击了个旧世界。
卫诗婕
哈喽,大家好,欢迎来到漫谈来的Star,我是诗杰。二零二六的上半年,中国的资本市场围绕具身大脑进行了大规模的布局,将具身大脑这个赛道推向了前所未有的热度。今天的嘉宾灵兔智能刚刚登顶了Morgan Stanley最新发布的全球人形机器人研报,它被视作中国具身大脑阵营的核心代表之一。从灵巧操作出发,这条大脑路线直指智能的上限。创始人王启斌是七零后产品背景,乔治华盛顿大学博士,完整经历了从智能设备、移动机器人到具身智能的三次范式更迭。我们的访谈不仅涉及到大量具身行业的真实进展,也描绘了在具身这个早期行业中,从研发到工程到产品,所谓RDP的全流程。二零二四年,七零后的王启斌和八零后自动驾驶算法老兵柴晓杰、九零后北大学者杨耀东、零零后天才少年陈元培组成了一支“巨声七八九零”战队,成为这个行业背景最豪华的团队之一。接下来是我和王启斌的访谈。
欢迎 Victor 跟大家打个招呼吧。
王启斌
大家好,我是灵初智能的创始人 Victor。
卫诗婕
先恭喜你们,最新登顶了 Morgan Stanley 的全球人形机器人研报,你们稳坐具身大脑的第一梯队。
王启斌
对。我们最近在 4 月中发布了整个 Policy 模型 R2,也发布了 Action-Conditional World Model。之后,我们在美国 Mobile ALOHA 的榜单上排名第一。昨天我们在 Hugging Face 上上传的 1,000 个小时数据集,下载量也是第一。
卫诗婕
我看你身上这件 T 恤上有你们的标志,是吗?
王启斌
对。
卫诗婕
这是什么标志?
王启斌
这是我们公司的 logo。大家看到它类似于一个小人手的三指 logo,其实它是希腊字母的第 23 个字母,叫 psi。Psi 本身有很多种解释,我们当时选这个名字,也看中了它可以用英文表示一种 proprioceptive intelligence,也就是本体感知智能。
我们公司从创立的时候,强化学习就是一个在环境中交互、像一个孩子一样逐渐长大的过程。
卫诗婕
大家其实不是特别了解灵初,这是一家什么样的公司?
1. 灵初专注通用灵巧操作
王启斌
灵初其实是在这一波具身大潮中创立的。我们定位于解决具身智能中皇冠级的一个问题,就是人的双手的操作问题。
实际上,我们从成立的第 1 天开始,就定位于解决通用灵巧操作这个问题。我们由算法驱动来搜集数据,用数据来提供整体的解决方案。
卫诗婕
通用灵巧操作,简单来说就是让机器人的手和脚可以更灵活吗?
王启斌
通用灵巧操作远远比这个复杂。我们人在做任何任务时,其实都有一个很强的能力。举个例子,任何人尝试把这张桌子收拾干净,都会潜意识地知道先做什么:先收拾这个话筒,再收拾这些线。
我们能够非常精确地完成每个任务,手眼协同也做得非常到位。更重要的是,如果我在作业中出现了一些失误,我自己能够很快纠错。人类形成这样的能力,经过了接近一年的演进。
规划其实是大脑做的,手眼协同其实是小脑做的。
卫诗婕
如果从人类的视角来看,的确是这样。但实际上在机器人上,我认为目前机器人小脑的能力并没有这么发达。在具身系统里,到底哪一部分是小脑、哪一部分是大脑,或者怎么把它们有机地融合在一起,还不能严格对应。
王启斌
我们越做具身,就越会去想人类的进化历史。人类的语言模态形成得最晚,整个机器学习,包括语言范式,都是人类最晚形成的能力。
这种用语言对世界进行压缩和表述的能力,机器现在基于文本和各种信息,基本上已经学会了。视觉能力是在寒武纪时期形成的,是动物最早形成的模态之一。人类最早从灵长类动物开始,其实还不是智人的时候,就已经有行动能力了,而且这是经过最长时间演进的能力。
今天我们要实现通用灵巧操作,就要把这 3 种能力都在一个系统中做出来,所以它其实是一个非常复杂的系统:行动能力、视觉能力和语言能力。
卫诗婕
通用灵巧操作涵盖了所谓的大脑和小脑,但对于机器人来说,它并不一定像人类一样,大脑和小脑是完全分开的,对吗?
王启斌
对。目前机器人这个领域还没有找到一个完美的、用大脑和小脑的结构来拟合,或者生成最类似人类能力的方案。
卫诗婕
最早的时候,我以为灵初是一家做灵巧手的公司,但其实你们是一家大脑公司。
王启斌
对,其实我们是一家大脑公司。灵初是中国第一家从 Day One 开始,就明确说我们做通用灵巧操作、不做任何夹爪产品,也不做移动底盘的公司。实际上,这远远超前于大家当时的认知。
在中国,大家今天看到的做大脑的公司,从 Day One 开始,大多是在做以夹爪为主的操作。
卫诗婕
所谓夹爪和通用灵巧操作,本质区别是你们更多以手部形态、手部作业为主吗?
王启斌
对。
卫诗婕
可以快速聊一下整个具身行业的进展吗?
王启斌
这一波具身大潮,本质上在解决两类问题。
一类类似于人的行走问题。大家看到了一些头部公司,不管是四足机器人还是双足人形机器人,它们都能够在更大的范围内移动,包括崎岖路面和各种复杂路况。这是一种能力。
另一种能力类似于人的上半身。大家之前看到很多工业界的设备,用两个夹爪把东西夹起来。但实际上,夹爪很难解决复杂的类人操作。举个例子,我怎么把这瓶水拧开?通常所有人类的自然操作,都会用 3 个手指形成力闭合的扭矩,把瓶盖拧开。这就是一种类人的操作。
灵初从 Day One 开始成立,就是在做通用灵巧操作。“通用”意味着我能够做很多任务;“灵巧”意味着对于电子元件这样的物体,也能够完成类人的精细操作。
当然,还有一个更底层的问题,就是我们刚才聊到的:人脑是如此复杂的系统,经过了接近一年的进化。今天来做具身系统,什么样的范式能够更接近地训练出这样的系统?
大家越来越意识到数据很重要。我们从那时候就知道,人的数据应该是一个非常大的、蕴藏在地下但我们看不到的东西。
卫诗婕
你们认为人的操作数据是一座富矿。从这座富矿的数据层面展开,可以最快抵达更高水平的智能,所以这条路线是最佳路线吗?
王启斌
是这样的。人类的操作数据无时无刻不在每天的各种环境中发生,从工厂到服务行业,包括我们的家庭,它一定是一个富矿。
但是非常遗憾,人类数据在过去这么多年都没有一个工具把它记录下来。大家知道,语言模态从文字开始,大语言模型是基于这些文本数据训练出来的。
但我们在打开一瓶水的时候,到底用了几个手指、多少扭矩、触觉是什么感觉?这种模态从来没有被记录过。这是今天一个非常大的缺陷。
这么重要的知识模态没有被记录下来,传承其实靠的是人类已经内化在基因层面的东西,我们再把它探索出来。那在猩猩、鸡犬这样的动物身上,这些知识我们如何真正挖掘出来,变成具身智能可用的数据?这是一个非常大的问题。
2. 具身行业进入七年赛跑
卫诗婕
做大脑的公司普遍比做本体的公司估值高。你们是做大脑的,但是第 1,你们的估值并没有显著更高;第 2,似乎你们做大脑的标签也不显著地强,为什么会这样?
王启斌
第 1 个问题,大家觉得大脑更有价值,是因为从去年世界机器人大会之后,有大约半年的时间我们没有怎么做 PR,因为我们开始布局真正的数据采集设备,以及数据采集的整套管线。
今年 4 月我们发布模型,这中间基本上经历了 8 到 9 个月非常漫长的过程,然后才有这些成果展示。当然,整个融资圈在过去 9 个月里日新月异,故事层出不穷。我们的更多精力还是专注于把产品和产业的东西做得更好,有更拿得出来的东西给大家看。
所以为什么上个月发布的模型效果很好,数据集也得到大家称赞?因为过去我们花了很多时间在做这件事。
我个人觉得,语言传播的力量可能是最微弱的。科技公司最好的方式,当然是展示自己的模型效果和数据集,这些才是最有说服力的。所以那段时间,我们并没有花很多时间向大家讲这些事情。
卫诗婕
你们登上 Morgan Stanley 的研报、跻身具身大脑第一梯队这件事,你自己客观评估一下。
王启斌
目前我们也得到了海外权威机构的认可。同时,海外正在发生一个趋势:最近有一家叫 Genesis 的公司也发布了模型,越来越多很强的大脑公司开始发布通用灵巧操作模型。这也印证了我们从成立之初就要做的事情。
卫诗婕
中国的具身市场现在非常传奇,你在业内肯定也感受到了。你怎么看?
王启斌
我不知道你说的“传奇”是指什么。如果是指今年的融资规模非常大,大家动辄融 10 亿元,整个行业热到发烫,那它就像冲浪一样,是一波新的浪来了。
我自己身在其中创业,很坦诚地说,它超出了我对资本市场热度的预期。我们过去经历过的几波范式变化,不会持续这么长时间。但我觉得,底层必然还是有一些道理的。
卫诗婕
你觉得为什么?
王启斌
第 1 个原因,具身要解决的问题,是真正回到物理世界的问题。这个问题有多大?
智能驾驶其实是具身智能最早成熟的应用。它是在一个平面上、在已有的交通系统中做水平移动,而它的市场已经大到今天这个体量了。那具身是不是有机会在未来成长出 10 倍、几十倍甚至上百倍的市场?我个人觉得一定会,这个波浪一定会来。
但很坦诚地说,因为具身的应用场景如此之多,到底每个细分场景需要多长时间完成一个周期,会有很多非共识。
卫诗婕
你觉得多长时间能跑完?
王启斌
这是一个很难回答的问题。如果取一个中值,我个人会认为是 7 年左右。
从两个维度来看。第 1 个,比照之前的汽车行业,汽车真正智能化是从 2018、2019 年开始,到去年大概 6 年左右。它是一个比具身更低维的东西。今天具身是在三维空间里,是进一步升维了。
但它有一个平衡点:今天具身公司进来的人才密度、资金体量、玩家质量都不低,反而非常高。我认为在这个不断循环的过程中,会有一些场景在 5 到 10 年里真正做出来,远远高于上一波行业顶点的公司,可能会成为现在这一波公司的低点。
卫诗婕
现在估值上,你们属于准第一梯队,对吗?
王启斌
可能是这样。
卫诗婕
你觉得实力上呢?
王启斌
很坦诚地说,我们自己非常有信心。在中国做通用灵巧操作,我们毫无疑问是第一,因为我们的积累不是一天形成的,我个人对此非常有信心。
至于其他方面,我不认为估值是一个能够完全评价公司的指标。估值可能是投资人喜欢的故事,也是媒体和听众喜欢的内容,但具身是不是可以用估值一个指标说清楚?我觉得不一定。
第 1,整个生态链和生态系统会更广、更分散。第 2,我认为这一波公司从 2023 年开始,至今也就两年多。像我刚才说的,这是一个以 7 年为周期的赛跑,中间会有几轮淘汰赛。
卫诗婕
你觉得从去年开始,具身行业的融资军备竞赛已经开始了吗?
王启斌
我觉得已经开始了。当然已经开始了。全球融资正在逐渐形成马太效应,越是头部的公司,拿到的钱越多、越快。
卫诗婕
我们还是先从你个人的故事聊起。能不能讲一讲你早年的求学和工作经历?
3. 产品经理走进机器人时代
王启斌
我的整个背景还是比较简单的。我是 70 后,2001 年去海外求学,2008 年在美国乔治·华盛顿大学读完博士,然后回国了。
2008 年到 2018 年,我在外企做产品经理,经历了做手机的年代。
卫诗婕
你在黑莓是从哪一年到哪一年?
王启斌
在黑莓是从 2008 年一直到 2012 年。
卫诗婕
之后呢?
王启斌
之后我还做了智能音箱。Sonos 是全球最早做 Wi-Fi 音箱的品牌之一。
2018 年是我的一个很大分水岭。2018 年之后,我开始想怎么样做一件更有意思的事情,所以加入了云迹,那是国内最早做酒店机器人的公司,也是绝对的头部。
在云迹开始做产品副总裁,后来去了京东,在创业前的 3 年半都在京东 X,做配送机器人以及整个无人车业务。
卫诗婕
你 2008 年到 2012 年在黑莓。2008 年应该是黑莓最后的巅峰时刻,差不多 2008 年之后就开始下行。虽然当时黑莓还有增速,但苹果的增速更快,等它反应过来的时候已经来不及了。
你是在这个战局结束之前离开黑莓的。这段经历对你有什么影响?
王启斌
影响非常大。今天作为一个中年创业者,我可能有很多东西是非常有教训的。
黑莓在我任职期间,是全球唯一一家净利率能做到 25% 以上的公司,第 2 个做到这一点的是苹果。
我学到的最重要的东西是:什么叫智能设备?智能设备是从苹果开始的吗?To B 和 To C 是不是有绝对的分割?
苹果是一个典型的把体验做到极致之后,从 To C 做起,逐步蚕食 To B 市场的公司。
我们当时经历了一个很大的技术范式变化,就是 iPhone 的兴起。从 2007 年到 2010 年,3GS 这样一个搭载复杂传感器、非常 smart 的智能设备出现,才有了一个生态,才击穿了以前的手机系统。
这意味着,在一个好的硬件平台上,在智能传感器的平台上,开始出现各种软件生态和 App 生态。
那为什么我 2018 年去做机器人?因为我觉得智能在那个时间点又发生了一次变化,那就是行动。它不是一个静止的、static 的东西。2018 年,我们认为机器人移动的能力,又是智能的一次更大突破。
今天来说,我们做的是更智能的产品。什么是智能?什么是好的产品?智能当然随着技术的演进不断放大。
在那个年代,大家讲的智能,是设备里有很多传感器,能够感知自己,包括地理信息、摄像头输入、气压计等,从而做出很多新的应用。这推动了移动互联网的兴起,包括打车应用和社交应用。
智能的底层逻辑,是技术演进在不断变化。从 2018 年到现在已经 7 年了,我们这一波从 2023 年开始做具身智能,本质上还是因为模型算法偷偷推翻了以前的智能概念,出现了一种新的智能。
这种新的智能包括类人的模型思考能力、推理能力,以及硬件平台上的交互能力,也就是 embodied 的能力。
卫诗婕
黑莓是智能手机的开创者,但现在大家都会认为 iPhone 才是。你觉得智能手机的权力更迭,最本质的原因是什么?
如果重新回到那个时代,你能够做黑莓的 CEO,有什么方式可以改变它的命运吗?
王启斌
我觉得很难改变。但是实际上,黑莓有一点可以做得特别好。
黑莓是商业手机,黑莓上有两点东西非常吸引人。第 1 个叫 BBM,是最早、也是全球最好的实时通讯工具之一;第 2 个是邮件。
当时中国移动正在做移动智能手机,曾经希望黑莓把 BBM 这套软件授权给第三方平台。我觉得这背后的逻辑特别像微软 Office 365 的历史,也像苹果当年做 iTunes。
iTunes 一开始只在 Mac 上使用,后来授权到 Windows。最后那场战役,其实就是从封闭走向开放。
同样的事情也发生在黑莓身上。黑莓在硬件底层没有那么强的创新能力,但在上层的一些应用上,其实可以有更好的选择。
卫诗婕
所以你觉得胜负手在于苹果构建了一个相对开放的生态?
王启斌
我觉得胜负手并不在于它构建了一个生态。我的一个很大爱好,是研究全球公司的形成历史。
2008 年我回国前,在美国已经有第 1 代 iPhone 了。我真正看到它做得很好,首先是从硬件层面,它很早就发现了日本的一套存储技术。整个 iOS 软件生态从哪里来?App Store 更早之前已经有 iTunes。
iTunes 是一个历史性、颠覆性的产品。它让大家存储和下载音乐更方便,更重要的是,它带来了商业模式的变革。以前大家买唱片,是一张一张光盘买,垃圾歌曲和好歌曲都在一起;iTunes 把它拆解成按单曲付费。
大家看到的 iPhone,是所有这些东西交织在一起,经过多年形成的结果。没有哪一家全球公司能够说,那个时候自己就可以做出来。
黑莓当然是一个失败案例,但它不是唯一的。我们看到 Nokia 失败,看到 Motorola 失败,也看到一系列公司倒下。
而且这个物种不是在旧世界里成长出来的,它来自一个全新的世界。一个新世界对旧世界形成了降维打击。站在旧世界的人不用抱怨,这就是宿命。每一次新的技术范式中,都会看到很多相似的事情发生。
卫诗婕
2008 年苹果正在崛起,你当时在黑莓,为什么决定回国?
王启斌
我当时在美国东海岸读书,其实不太喜欢东海岸。我在华盛顿特区读书,大家知道,那里还是以联邦政府为主,地铁里的人都穿着西服,大部分人都是联邦政府的职员。
我的家人已经回来了,我夫人也已经回来了,所以我的选择就是这样。现在想想,如果当时有机会去西海岸,肯定也是一个好的选择。但回来之后,我从来没有后悔过。我从手机做到音箱,还是非常喜欢科技型的东西。
卫诗婕
如果重构你的人生,你会重新设计自己的轨迹吗?
王启斌
我非常喜欢读历史。我觉得历史中其实没有“if”这个词,每个人无法重构过去的事情,这里面有一部分宿命感。
我觉得我能够回来,一定有某种内在的东西在驱使我。我在美国读书时,床头一直放着钱穆的《国史大纲》,也会读像顾颉刚这样的汉学家。我觉得可能有一种宿命感或者召唤感。
那个时候我也很想念国内。我是武汉人,早上非常喜欢吃小吃,武汉人叫“过早”。这些东西可能也是一种宿命。
卫诗婕
你回来的节点,刚好是国内硬件开始崛起的时候。回来之后,面对国内硬件,是一个什么样的江湖?
4. 中国硬件开始快速崛起
王启斌
其实非常有意思。那个年代我看到了两种东西。
第 1,中国硬件快速迭代和崛起。我回来的时候,中国硬件很坦诚地说是比较 ugly 的。我经历过两家公司:黑莓是 B 端公司,Sonos 则是一个小众品牌,工业设计非常好。苹果发布 iPod 时,拿来做 benchmark 的产品就是 Sonos。
但国内生态的快速迭代速度是无可比拟的。这个意识是在智能手机兴起时形成的。当时国内一些头部创业公司,比如小米,来找我们这样的产品经理,我们都不愿意去。但实际上,中国国内的迭代速度非常快。
这发生在 2010 年之后。随着小米生态链和 IoT 的发展,我特别明显地感受到,在消费电子的工业设计上,中国正在快速追赶,开始有了审美。
当然,底层支持它的是整个工业体系:从整机设计、核心零部件的掌控,到整个流程跑通和快速迭代。这让我当时非常吃惊。
所以到了 2018 年,我觉得自己其实已经晚了。很坦诚地说,我很后悔离开 Sonos。我本来应该更早、更深入地进入中国生态,做一些有意思的事情。
卫诗婕
你觉得中西方硬件产品的审美,最底层有什么不一样?
王启斌
审美还是要有一定的物质基础。第 2,审美要有传统。
苹果的 Jony Ive,他的设计传统在英国;小米设计团队的领导者,设计背景其实在德国。包括我之前接触的很多消费电子,审美传统也都来自欧洲。欧洲国家有很强的审美传统。
美之所以为美,我认为是一个非常复杂的问题。
举个例子,我们做产品时发现,美也在不断迭代。我经历了从手机到 IoT 音箱的年代,大家第 1 个做的是如何把产品做得更好看。
我当时做音箱,有各种理念。比如有一个品牌叫 B&O,它会把产品做得特别绚丽,在屋子里非常吸引眼球。Sonos 的理念则是家庭生活和家居,我们认为做的是声音产品,要更好地融入家庭,而不是特别抓眼球。
所以我们的音箱是黑色和白色。我们讲 product guideline、design,这些东西其实都很有意思。
我从 2018 年开始做具身。很坦诚地说,从消费电子的角度看,具身大部分还处于比较原始的阶段,产品都长得很丑,缺乏审美,大家还在做功能型的、解决问题的产品,美感还很缺乏。
当然,我相信随着生态迭代、更多优秀的人进入这个行业,这些都会改变。包括刚才说的颜值、技术审美,我认为中国现在完全有机会做好。
卫诗婕
大家传统上可能会说,美国的大脑领先于中国,中国的硬件领先于美国。你怎么看?
王启斌
我个人觉得,这只看到了轨迹的起点,其实不是这么回事。
美国在模型迭代上确实有一些领先,但中国有中国的特色。第 1,中国在数据获取和应用场景上更加丰富。
还有一个很神奇的现象,过去几轮从互联网、移动互联网到汽车的迭代中,中国具备非常强的产品经理能力。因为应用场景丰富,每个应用的产品经理都有自己的一套东西。
比如 TikTok 这样全球性的产品。TikTok 和抖音让大家不断刷视频,本质上是间接卖广告或者销售商品。很多应用,中国在全球都是领先的。包括我刚才说的一些 IoT 产品,中国也是全球领先的。
中国在用户的细微洞察、产品定义上,有很多领先的地方。它不是一个简单的组合,而是一个深度耦合、具有很强 synergy 的复杂系统:从硬件,到大数据,再到模型和应用软件,一起解决人类在无处不在的环境中遇到的问题。
这里面会有很多有意思的地方,不是简单地判断谁胜谁负。
卫诗婕
你刚刚其实提到了一个问题,但好像没有正面回答。到底是做 To B 产品还是 To C 产品?
具身行业目前优先出货肯定是给 B 端的,最终是瞄向 B 端产品还是 C 端产品?
5. 通用能力最终走向家庭
王启斌
很坦诚地说,从中期愿景来说,我们一定是瞄向 To C 产品的。
我们做的是通用灵巧操作。什么叫通用?最通用的地方在哪里?家庭。To C 产品最通用的场景就是家庭。
但家庭目前是最难的,它涉及的不只是技能泛化,还有环境的高度非结构化。所以我们现在选择 To B 的切入点,是因为当前整体能力还在可实行阶段,需要先让飞轮转起来。
物流和服务业的泛化性居中,比绝对工业化的组装线更需要泛化,节拍又低一些,所以这是我们的切入点。
实际上我们还是走通用路线,最后一定会走到 To C 的那一天。
卫诗婕
我也考古了一下黑莓和苹果的那段历史。这是不是和那段历史给你的启示有关?
黑莓最早在 B 端非常强劲,苹果则从 C 端把用户体验做到极致,在 C 端大量渗透,再反过来包抄 B 端,最终实现领先。
王启斌
这里有一个非常底层的问题,一直没有人深入讨论。我觉得 To B、To C、To B 不能这么简单地聊。
黑莓和苹果发生的那段历史,给我最大的启示是:什么类型的 To C 产品能够击穿 To B,渗透进去?
苹果完成了这件事。后来很多人携带自己的设备,用它来做 App,企业也开始进行应用管理。也就是说,To B 不是一个简单的 To B,里面有一些平台型产品。
移动设备集成到 To B 里,本身有部分标准品和平台性质,之上还可以有二次开发。
今天我们谈机器人、谈具身智能,要谈的是我们做的是什么样的机器人。我们这种机器人本身是一个类平台的东西,它是不是具有从 To B 穿透到 To C 的特性?反过来,现在做 To C 的公司,会不会逆向穿透到 To B?我觉得都有可能。
我们做的东西基于这个逻辑,仍然是更通用的。比如今天我们做轮式机器人的基础模型,能够抓取很多物体、扫码、放置,包括打开塑料袋。这些能力都可以用在 To C 场景。
卫诗婕
什么样的 To C 产品有机会把 To B 打穿?
王启斌
如果 To C 产品中的通用能力,能够更好、更便捷地集成到 To B 系统里,它就具有这种特性,可以逆向打穿 To B。本质上还是一种通用能力。
卫诗婕
对,就是你说的通用灵巧操作。
我最近听到一个非常有启发的想法。我在聊另外一家具身产业里非常杰出的硬件公司的创始人,他提出了一个很大的反共识:未来在 B 端领域,所有公司都是机器人公司,世界上不会有两台长得一模一样的 B 端机器人。
因为每家企业都会定义自己的需求,追求最高的 ROI,然后定义一台差异化的机器人。也就是说,市面上所有 To B 机器人公司都无法完全满足一个 B 端企业的需求,所以最好的技术是开放的、能够给对方使用的技术,而不是卖产品。
你怎么看?
王启斌
说实话,我没有完全想透。我既有认同的地方,也有不认同的地方,我从两个角度谈一下。
第 1,我觉得这条路径会从通用走向专用。今天做具身,底下有几层规律。
从技术到研发,有几大块东西。第 1 块是硬件。硬件最大的规律其实是规模效应。从手机到电动车,再到今天,最后一定是规模为王,产业格局会形成多头垄断。
这意味着,如果 B 端大客户自己能够形成规模效应,它就能定义中腰部客户。中腰部客户能不能定制自己的硬件?这是第 1 个问题。
我需要仔细观察。我认为硬件本身一定会出现多种形态,但我不认为短期内一定是每家公司都有自己的形态。
再往上,我们说一定要有大脑和数据。大脑和数据本身涉及的是,这套大脑能够覆盖多少应用场景;当它覆盖新的应用场景时,用已有的大脑来覆盖,边际成本有多高。
所以我个人认为,这一局在大脑上有更多不确定性,也更符合强者越强的规律。数据进入得越多,飞轮效应越快。
回答你的问题,我认同的是,大脑可能会形成多方面的通用能力;硬件上,头部公司可能会定义自己的硬件,但腰部和长尾公司很难独自拥有自己的硬件。
卫诗婕
你一直是产品经理。你觉得 AI 时代你想做的产品到底是什么样的?
王启斌
我觉得是一套深度耦合、能够驱动解决真实问题的产品,从物流一直到未来的家庭场景。
卫诗婕
所以它会是软件、硬件,还是一套系统?
王启斌
一定是一套系统。在可预期的几年里,它一定是深度软硬件耦合的产品。
大家仔细看,前几天 Dyna Robotics 的创始人 Yoky Yang 也在讲这件事。包括你刚才问的问题:美国头部公司只做模型,模型非常强。我个人非常坚持地认为,这个命题在 5 年之内都是伪命题,因为目前具身还处于非常强的软硬件耦合阶段。
举个例子,我们今天做操作,如果不做到硬件底层的控制层面,包括手臂控制、手指控制,我根本无法达到系统最优。
人的动作有很好的节拍,比如我做这样的动作。这样的高动态动作进入系统之后,怎么在系统中实现?包括数据采集,也要把从视觉到最终系统的整个过程采集下来。它目前一定是硬件嵌入软件的深度耦合。
只有迭代到一定阶段,才会出现生态上的最终解耦。
卫诗婕
你们似乎现在也没有公布硬件产品。
王启斌
是的。但实际上,我们正在和合作伙伴深度定制硬件产品。我们在硬件里深度编写了所有控制软件,从手部的位置控制、速度控制,到电流环的力控,都是自己写的。
硬件由我们自己设计,找合作伙伴定制,主要完成两个任务:第 1,让系统软件做到最优;第 2,让成本做到最优。
卫诗婕
硬件应该不会是通用的吧?
王启斌
现阶段,未来 5 年之内,其实会从通用走向 specialist,从 generalist 走向 general specialist。
目前大家能看到的形态主要有两种。比如具身机器人是人形的,尺寸有大小;像我们这样的轮式双臂双手类人形,也是在类似的形态上做系统耦合和迭代。
可能迭代到一定程度之后,才会追求规模阶段的极致性价比。极致追求性价比,反而会开始对硬件降配。
这和算力平台很类似。算力平台从 GPU 时代开始,大家逐渐提出要做更个性化、更高效率、更低成本的芯片。但进入这种规模化阶段,应该会比我说的更晚。
卫诗婕
在大脑技术层面,你们瞄准的是现阶段的终局,也就是灵巧操作。但是在硬件层面,你并没有跳一步说“我现在只做手、只做单臂”,而是选择了轮式本体,是这样吗?
王启斌
是的。
卫诗婕
为什么?
王启斌
我补充一下。对于工厂和客户来说,有一点非常不合理:如果我用双臂就可以把操作做得很好,为什么要一整台机器人?
卫诗婕
对,为什么一定要有轮式,为什么一定要有身体,为什么不能只是手?
王启斌
我们设想的落地场景有两个版本。一个是固定在那里的上半身,另一个是可以移动的、加上半身的形态。确实有两种形态。
这本质上还是来源于我们对大脑训练数据飞轮的理解:最后数据怎么流转。
我们现在有数据采集设备,能够启动这套飞轮。具身最底层的逻辑和汽车不一样。汽车即使没有智能驾驶系统,也有人自己开。因为有了底层存量市场,大家完成了一个重大的范式转移,开始有了智能驾驶和电动车,智驾数据也回流了。
这是一个非常好的模式:用户花钱买了车,还免费给车厂提供数据。
非常遗憾的是,具身处于一个完全不同的启动模式。去年大家也知道,头部公司的硬件出货量也就在 5,000 台左右。今年即使达到几万台,这个量也不够我们的飞轮收集数据。
所以我们现在的定位,是先用人类数据来收集。最后在真实场景中做推理时,数据怎么回来?在那个环节,我们需要自己的硬件,把硬件部署到一些场景中,在真实环境里把新的数据带回来。
卫诗婕
我还是没有听懂,为什么非得要有轮式?为什么一定要有身体?为什么不能只是手?
王启斌
正式的应用场景有几种。
第 1,如果仅仅是桌面操作,其实双臂双手或者单臂就够了。
第 2,有些场景是在纵向平面上,或者环形空间里操作,这个时候就一定要有腰部能力。
还有很多典型场景,比如在 4 到 5 平方米的商超范围内做补货、拣货,这种场景需要小范围移动。移动就需要快速、稳定的底盘。
所以这些因素决定了产品形态。
卫诗婕
大方向上,你们选择了两种构型:一种是只有手,另一种是加上腰部、甚至具备行动能力的类人形,对吗?
王启斌
对。
卫诗婕
这两类数据最终会回传去训练一个模型,还是分成两个池子去训练?
王启斌
现在是训练一个模型。
卫诗婕
我理解,你过去在云迹以及京东做的,主要是下半身能力,也就是上一个时代自动化机器人的叙事,把运动能力做到可商用的状态。这一波通用具身智能其实是在攻克上半身能力。当然下半身的运动控制也在做,但最大的创新仍然体现在上半身。是这样吗?
王启斌
是的。
卫诗婕
现在资本市场上有很多务实派投资人内心在打鼓。上一个时代做自动化机器人、工业机器人的公司并没有退出历史舞台,它们也在做具身转型。它们转型融入这个时代,会有胜算;这一波具身创新派也会有胜算。但最后谁会胜出,你思考过这个问题吗?
王启斌
我觉得你很有立场来回答这个问题。
王启斌
我当然思考过。
6. 创新公司挑战旧机器人
王启斌
我觉得大概率的结论是,上一个时代的集成公司在这一波里很难赢。
这是一个非常大的顶层问题:这一波的集成公司到底要解决什么问题,需要用什么样的技术路线来回答?
第 3 个问题是,需要什么样的人才来回答这个问题?
我们之前做移动机器人时,更多是因为 SLAM 技术兴起。2015 年前后,中国出现了室内移动公司和仓储移动公司,很多都是基于规则的。
这一波要解决的问题更具挑战,是更复杂的操作问题。大家都在用 learning-based、基于学习的范式来学。学习范式背后的人才,和上一波完全不一样。
这一波的算法人才,都是在新的算法范式里训练基座模型的人才。这是非常大的挑战。
上一波集成公司更多拥有自己的场景。比如我们之前解决酒店、餐厅或者仓储的问题,但场景循环可能恰恰是它们的负担。
上一代机器人公司更多使用基于规则的技术,解决一个细分场景的问题。这次完全是新的变化:我要用通用的、基于学习范式的技术,让飞轮转起来,逐步击破一个又一个场景,未来解决 10 个、20 个甚至更多场景的问题。
它和深耕一个场景、做局部最优是不一样的。整个技术路线和人才布局都非常不同,这是最大的挑战。
卫诗婕
你讲的是从 rule-based 到 learning-based。现在所有做大脑的公司,其实它们的估值,我认为资本市场都是在为未来的前景和可能性买单。但大家现在都还没有完全 deliver 泛化性和通用性。
所谓 learning-based,需要很多数据训练出来。能不能这样理解:当有一天这种智能真的萌芽,上一代做自动化机器人的公司,只要最先应用这个通用技术,把客户的整体系统翻新一遍,用上最新技术,理论上它的数据回传可能比做具身的公司更快。
因为具身公司可能要重新攻克一个又一个市场。上一代公司是不是能快速接上?
王启斌
我觉得有可能。它有自己的场景和客户。
但另一方面可能会发生变化:如果有一天一个通用大脑解决了很多场景,其中一个场景被解决之后,最值钱的东西到底在谁手上?所以我觉得这可能不是一个简单、静态的问题。
卫诗婕
假如你今天仍然是一家上个时代自动化机器人翘楚公司的 CEO,面对这个时代,你会怎么做?
王启斌
这就是我在上家公司给高层提供的最大建议,但没有被采纳。
我觉得非常简单,就是完全开辟新的部门,做独立的创新和投资。这就是成功者的诅咒,也就是创新者的诅咒:之前的成功范式,很难在组织内部孕育出新物种,极大可能是不可能的。
卫诗婕
所以你是因为当时建议没有被采纳,才决定出来创业的吗?
王启斌
是这样的。其实在去京东之前,我有一个选择:要么在一家创新公司负责一块完全创新的业务,要么去京东。
我当时认为,做配送体系应该是谁有场景谁就能赢。但实际上,我最后很坦诚地验证了“创新者的窘境”:原来真的是“纸上得来终觉浅”。
并不是谁有场景谁就能赢。上一波自动化、仓储物流领域,最终赢的全是创新公司,比如海柔、极智嘉,包括我们后来做无人配送,今天处于头部的公司也全是创新公司,比如新石器、九识。
几个大厂,阿里、美团和京东,都落后于创业公司。为什么?
底层还是因为,在一个拥有成熟业务的大公司里,成熟的商业模式会不断强化自己的流程和决策体系。这些东西对于创新周期相对长的游戏来说,会非常艰难。
本质上,这家公司的精力和人才永远会聚焦于上一个模式,很难抽身出来做一件足够创新的事情。
卫诗婕
你说得太对了,它是无法分身的。一个组织就像一个有机体,有机体真的很难做到,上一刻还在做 A 面,下一刻就完全分裂成一个相对立、互斥的 B 面。
我看你在京东留到了 2023 年。
王启斌
对。我是 2024 年年初出来的。
卫诗婕
但 ChatGPT 是 2022 年年底发布的,为什么你晚了一年?
王启斌
很坦诚地说,我当时在找首席科学家。2023 年年底开始找,花了基本半年的时间组建团队。
卫诗婕
从 2022 年年底 ChatGPT 出现,到你 2024 年中决定创业,这中间你经历了什么?
王启斌
ChatGPT 的出现,对机器人和我们这样的圈子是有震动的,在意识层面产生了一些影响,但并没有达到真正震动的阶段。
大家会觉得语言模型很有意思,会讨论 learning-based 会不会出现。预判是一定会出现的。
我在 2023 年年底基本下定决心出来,然后找人找了半年。灵初直到 2024 年 9 月才成立。
卫诗婕
我认识的一位投资人说过一个观点:有信仰的公司在 2023 年就出现了,2024 年再出现的都是跟风追热点。你怎么看?
王启斌
我个人肯定不认可这个观点。只有自己创立过公司的人,才知道创立一家公司需要做很多准备。
灵初真正拿到融资是在 2024 年 5 月,我们拿到了头部两家风投的投资,就是高瓴和蓝驰。
当时很神奇。我从上海见完投资机构回来,坐在火车上。我也很无知,就开始在百度上搜索“灵初智能”。结果发现这个名字在北京被一个机构抢注了。
按照北京的规定,抢注一个公司名称,如果 3 个月之后没有成立,才会被释放出来。所以大家看到的是,我们 9 月才真正注册公司,但实际上 6 月就已经开始干活了,只是公司名称被人抢注了。
从 2023 年开始,我就想创立这家公司。我有自己的 mission,要找到和我情投意合的联合创始人。
我和杨耀东老师、陈元培聊了很久,和杨老师大概聊了小半年。2023 年 9 月、10 月就开始聊了。大家要了解彼此的个人兴趣,我还要读他的所有论文;他也要知道我能做什么,互相判断实力是不是匹配。
最后才是你刚才问到的,我们都决定一起干了,然后确定路线:到底要不要长期做手?要不要碰夹爪?初始团队应该怎么搭建?这是一系列问题。
卫诗婕
为什么叫灵初智能?
王启斌
我们是先有了这个手的 logo,也就是 PSI,再去想公司的名字。
我们觉得强化学习很像一个孩子的成长,需要逐步和环境交互,应该具有各种灵性。所以我们当时有各种各样的名字,原来的联合创始人还提议叫“零元”,被我否了。我说,难道是“零元购”吗?
我们有“零初”,还有“零企”等各种名字。“元”是元年的元,在中国文化里有很深的含义,比如混沌元年,或者围棋里的天元。元其实是一个很重要的概念。
“零元”这个名字,我只是觉得不好听,谐音也不好听。
PSI 这个字母本身在希腊字母里有心理学的应用,也有物理学的系数,非常有灵性。强化学习一个好的系统应该是这样的。我们只是在寻找另一个汉字,最后把“灵”和“初”合在了一起,所以我们很高兴。
“初”这个词也能代表这个行业现在的本质。我们认为,灵巧操作处在一个初始状态上,然后通过灵初不断成长和发展。
卫诗婕
具身领域有一种非常标准的配置,你们完美契合了这个配置:一个做过硬件和量产的老将,也就是你;一个杰出的科学家,也就是杨耀东老师,他是国内强化学习专家;一个年轻的科学家面孔,也就是你的联合创始人陈元培;再加上一个算法很厉害的人,也就是柴晓杰博士。
为什么会是这样一个行业标准配置?这是巧合吗?
王启斌
倒不是巧合,取决于我们对这个行业的认知。
在新的浪潮中创立一家公司,要走几条路:从技术到产品,再从产品到市场。这一波最难、和以前不一样的地方在于,从技术到产品可能会走很长一段路。
所以这里面一定要有各种角色。我的背景是产品经理,对产品以及如何走向市场,已经经历过很多轮。这一次处在更强的技术范式里,就需要很深的科学家。
小杰承担的是智驾以及 L4 无人配送车的底层算法工程化工作。所以当时组建团队时,我们就是从这几个层次来看,需要什么样的人来组成这样一个团队。
卫诗婕
我最近接触了很多自动驾驶出身的具身公司,它们是一位自动驾驶出身的人来做一号位。你不是,你是产品经理出身的一号位。
你觉得这两种一号位、两种公司会有什么区别?
王启斌
每个创始人最大的区别,可能在于他对世界的认知、对组织的认知,以及能够携带多少资源进来。
在这样一个复杂的、长赛道的系统创新里,能够聚合多少资源,可能更重要。所以从本质上,我不认为行业标签本身会带来根本区别。
卫诗婕
我知道从 2023 年开始,国内学者在具身领域被疯抢。你先帮我验证或者证伪一下,这是真实情况吗?
王启斌
是真实情况。
当时我既找了美国的科学家,也找了中国的科学家。在国内,能够做灵巧操作的人非常有限,我觉得不超过 10 个。
从上海交大、清华、北大到武汉大学,我基本上访谈了其中七八位。的确从 2023 年开始,具身领域有一两家公司出现,有些公司背后也有产业大佬,所以当时确实是疯抢的程度。
我觉得我和耀东的团队能够走到一起,在那个时间点非常弥足珍贵。大家聊过之后,能够一起携手出来创业。
卫诗婕
你去美国找到哪些 researcher 和科学家?
王启斌
当时聊了很多人。Sunday Robotics 的陈驰,我跟他聊过;斯坦福的王晨,我聊过;DeepMind 的谭杰,我也聊过。
美国至少有 6 到 7 个人我都谈过。后来我又开始和国内的科学家聊。
卫诗婕
美国的科学家没能争取到,是因为你们是一家中国公司吗?
王启斌
倒没有这么强的标签化。他们的诉求是,如果在美国、离他们更近的地方创业,大家有机会合作。
卫诗婕
你为什么最终选择把公司设在中国,而不是像很多创业者一样直接设在美国?你曾经在海外留学和生活过。
现在的现象是,确实有人出去创业,比如 James Park 景鲲,我也认识;也有人回来了,比如 Hillbot 的苏浩。
为什么 2018 年你下定决心从 Sonos 离开?Sonos 后来上市了。
王启斌
那件事对我伤害非常大。
在 Sonos 的时候,我曾经把 Sonos 全球 CEO 带到中国,去见陆奇。我们当时做智能音箱,要做 Voice 合作。Sonos 在美国和 Amazon、Google 合作,在中国要选择唯一的合作伙伴。
当时陆奇在美国的家里全是 Sonos 音箱,他非常喜欢 Sonos。我们全球 Sonos 软件部门的一位 VP 以前是微软的,所以陆奇就坐在那里对我们说:“你们想在中国做什么事情,我立刻让我的团队和你们对接,很快就能做出来。”
陆奇的决策力非常强。我们从那栋楼里出来后,我就问我们的老板:“我们什么时候开始动手做?”
老板说:“9 个月之后。”
我问:“为什么是 9 个月?”
他说:“我们现在先把 Amazon 做完,Google 还在 pipeline 里。百度排第 3。”
那时候我就觉得,在一个全球化的盘子里想做一件事,非常 frustrating。所以我其实开始想到,应该在中国生态里做一些对我来说特别有意思的事情。
我不知道这是不是在潜意识里影响了我,但我从来没有想过一定要在海外创立公司。
卫诗婕
中美两边具身领域的科学家,风格上有什么差异吗?
王启斌
还是有部分差异的。当然个人所见略有不同。
我接触的,尤其是做 research 的科学家,可能会想更宏大的事情,更少关注短期内的落地。
中国不只是做模型,还要考虑商业化应用,所以中国的 researchers 也在中国的生态中被强化学习过,更务实。
卫诗婕
北大的杨耀东老师,应该是国内最早涉及灵巧手的科学家之一,对吗?
王启斌
是的。他从 UCL 回到北大,在强化学习上有两个具体方向。
他的组里包括通用灵巧操作。他们在国内最早做了双手操作的模拟环境和数据,后来开始发表灵巧操作数据应用方面的论文。
另一个方向是大模型后训练和对齐,所以他在这方面也是最早的一批。
在 2022 年年底、2023 年,他承接了国家级的指定落地研发项目,做的就是通用灵巧操作。
卫诗婕
作为一个非技术人士,去寻找科学家的时候,怎么判断哪个科学家适合创业,尤其是适合和你一起创业?
王启斌
这是一个非常好的问题。
首先要有技术判断力。先看这个老师做的东西,回到基本面:到底只是发表论文,还是有 demo?有 demo 意味着这个东西往前走了一步。然后再看他的学术成果。
当然也要做背调。peer review 这个圈子很小,大家会去了解这些老师做的研究,最专长的地方在哪里。
另一方面很重要的是,创业是非常有挑战、并且要持续很长时间的事情。所以我要关心,这些老师对创业是不是有真正的承诺。
最后当然要谈核心利益,要做到既有效,又可持续。
卫诗婕
中美科学家在研究风格和研究侧重上有什么不同?
王启斌
美国那边更加多样化,有纯做研究的,也有人在考虑是不是要出来创业。比如陈驰当时应该已经下定决心出来创业了,他也和我说过。
国内我在选择时有几个标准。第 1,要选技术天花板非常高的人。第 2,要能够帮我组建最好的研发团队,工程性的东西由小杰来组建。
筛选完这两个标准后,最重要的是这个老师是不是非常 committed,愿意做这家公司。包括大家能不能搭在一起。最后我和耀东之间有非常深的互信,所以才组建了这家公司。
卫诗婕
你觉得他为什么选择你?
王启斌
这个你得问耀东。你没问过他吗?
卫诗婕
没有,因为你们现在熟到不会问这些事情了。
王启斌
我很清楚自己为什么选择耀东。他跟我说过几句话,非常打动我,也和我的共识一样。
第 1,他看到一个很重要的趋势:全球范围内,现在能够做出最大创新的地方,已经从学校转移到一些优秀的创业公司。底层原因是,做新的创新需要资源。
第 2,他说自己论文已经发了很多,也获得了成就感,想在产业界做一些新的、非常有成就感的事情。
这是我们在北大食堂吃饭时他和我聊的。
卫诗婕
他介绍了他的学生陈元培加入这家公司,也是你们的联合创始人。
王启斌
是的。
卫诗婕
陈元培发表过一篇非常重要的论文,我理解主要讨论的是如何把人类数据真正用在通用灵巧操作上,然后做数据迁移。是这样吗?
王启斌
是这样。这是元培在斯坦福最后发表的那篇论文。
他是在李飞飞和 Kerri Liu 的实验室做研究,离开之前发表了这篇论文,研究如何使用人类数据,在仿真环境中训练 sim-to-real 的操作能力。
我们现在发布的模型里,也用了大模型加强化学习的方式。这些重要的东西,当时已经在他的研究里体现出来了。
卫诗婕
我问一个特别好奇的问题。这个行业有太多具身公司,一号位是非技术人士。非技术人士怎么判断科学家做出的研究成果是不是真的扎实?
一个非技术的一号位,怎么评判内部技术是否真正足够领先、足够可用?
王启斌
这是一个非常有意思的问题。
刚才我们讲从技术到产品。我们的技术到底有没有竞争力?首先要符合技术底层逻辑。
我们这里有杨耀东、元培,还有上海交大的温老师。大家有一定程度的 peer review 机制,会互相判断,再看真正呈现出来的效果。
从这一点上,可以看出模型真实的研发状态和效果。
卫诗婕
我之前聊过一个做量产的一号位,我们也聊到了技术管理。他说,对于一个没有做过量产的科学家,研究时长和 deadline 可以被推迟,甚至无限推迟;但如果要做量产交付和商业化,最后一定有明确的 deadline 要管理。
在灵初内部,你们更偏向哪种模式?
王启斌
算法模型的研究不能完全用这套方法管理。
我们从成立到现在已经接近两年了,其中经历了几个版本。在不同版本阶段,管理方式也不同。
最早的探索期,强时间管理并不是一个好的方式。到了最近这一版模型,我们已经有了更接近靠谱的时间线。
这是因为模型训练、infra 管线等都已经搭起来了,有了一个比较好的平台,所以能够更好地呈现结果。
我觉得要针对不同的事情,看它的底层规律,采用不同的管理方式。当然,“管理”这个词,我们也可以之后再讨论。
还有一个很重要的事情:我们现在不是一个纯粹的 R,也就是 research 团队,而是在做 research and development,也就是要做工程。
算法人员和工程人员,怎么放在一个组里协作?我们现在有一个大组,上面有算法人员,下面有很强的数据平台、训练平台和工程架构师。整个团队在快速迭代。
这和硬件量产又有不同。硬件量产有严格的 milestone,但在具身和大 AI 领域,最有意思的是,你没有办法确定探索期的窗口到底有多长。
卫诗婕
硅谷最前沿的公司,比如 Physical Intelligence,可能不着急商业化,瞄向通用终局;但 Figure、特斯拉这样的公司,会两条腿同时走:先做量产和商业化,把机器人本体送到工厂里采集数据,迅速回传,然后进行软硬件一体化布局,迭代大脑。
国内也有不同路径,比如智元机器人铺量产铺得很猛,也有大脑更重的公司,声称不走这条路线。
王启斌
你说的点特别有意思。
刚才我们讲过,从硬件很强的公司往上走,一条思路是把硬件发货量做大,做到稳定、便宜、规模化,然后开始迭代。
我们其实更多是从模型和数据出发,用更好、更优质、更批量化的数据开始训练模型,再往下走。
大家的路径不一样,研发流程也会有差异。
卫诗婕
有一类公司认为,一定要卖本体、做本体,因为只有具备数据采集能力的本体,才是做大脑非常强的一环,是制胜要素。比如星海图就说过类似的话,你怎么看?
王启斌
我觉得这是两条路。现在大家怎么走,差异很大。
如果做本体,现在可能有一条路是把本体做到极致便宜,进入现场,从遥操作切入,形成数据闭环。这是非常典型的特斯拉思路。
但我个人认为,具身走这条路的难度比特斯拉更高,因为它有硬件本体耦合的挑战,也有算法模型耦合的挑战。
还有一个大前提:它同时是一个规模和机器的问题。如果算法不够好,硬件进去之后转得慢,也未必能够快速跑起来。
我们的思路是从模型出发,用人类数据启动它,让模型训练起来,然后放到我们设计、与合作伙伴定制的本体上开始运行。
我觉得这是一种不同的走法。我们的资源大部分聚焦在上面这一部分,也就是大脑。
现在说哪条路一定更优,还为时过早。在美国同样有两批公司,国内也有不同路径。
卫诗婕
我观察到,后者相对于前者来说资产更轻一些。但你可能会说,它在 researcher 和人才层面的支出也会更大,对吗?
王启斌
是的。
卫诗婕
刚才聊到科学家的问题。具身领域的技术战线很长,需要很多领域的人才,这对管理造成了很大挑战。怎么让不同领域的人才融合在一起?这方面你有经验吗?
王启斌
这是一个非常大的问题,也是这一次和我之前在上家公司组建团队时很不一样的地方。
我最近也在想,是不是“管理”这个词都不准确,应该叫“治理”。
在从技术到产品的研发阶段,我个人认为,一开始的 research 阶段,也就是探索型研究阶段,可能更多采用 bottom-up 的方式会更好。
比如我们和北大有联合实验室,在跟进最新技术和全球路线时,很多研究是自下而上的。
但一旦我们真正看到了某条路线的重要性,开始做 development,就需要从上到下决策,投入更多资源。
我们也有联合实验室做很多方向探索,但大家今天看到的数据,以及从采集设备到模型训练的整套体系,其实从去年下半年开始就已经成为公司的重心。
这个重心意味着,我们要不断投入资源,把最好的人招进来。
第 2 个问题是如何组织资源。刚才说算法人员和工程人员都在里面,怎么让它运转起来?
目前我们还是以项目牵引制为主。大型、超大型项目,一个数据项目可能有七八十人投入,各个部门共同参与,以项目牵引的方式快速迭代。
卫诗婕
你怎么看现在具身领域有一波联合创始人出走、自己创业的现象?
王启斌
我理解,可能是道不同,不相为谋。
举个例子,在具身发展的理念上,到底是做技术模型,还是更多做硬件应用,大家会有差异。差异导致各自开山立派、各自去做,这在目前的情况下也可以理解。
卫诗婕
你的公司在 Day One 怎么对齐“我们到底道同不同谋”?
王启斌
这就是为什么组建公司时,我和杨老师、袁培以及小杰聊了很久。
当时我们有一些争论,也希望达成“慢就是快”的共识。目前看来,大家对公司的定位有充分共识,当然也会有一些争执,这很正常,但目前还好。
卫诗婕
你们会为了什么事情争执?
王启斌
很多决策性的事情都会讨论。
比如一个研究项目,到底是不是应该进入 development 阶段;进入之后要投入多少,是不是要有预算,还是应该完全无预算地投入。
这些事情内部也会讨论,但我觉得都属于战术层面,很快就能解决。
7. 算力验证大脑真伪
卫诗婕
市场上号称做具身大脑的公司非常多,本质上大家都在描述一个故事、讲一个前景。
判断一家公司到底是真正在训练大脑,还是一家水货公司,最直接的标准就是它每年花多少资源、多少钱、多少算力。这是一个试金石。
灵初在这方面的算力消耗可以透露吗?
王启斌
保守估计,今年会是几千万元人民币,可能还覆盖不了我们全部的算力需求。
卫诗婕
几千万元人民币?
王启斌
对,几千万元,还是保守估计。因为后面的 data scaling 会起得非常快。
卫诗婕
到年底,100 万小时的真机数据要吃到那个程度,算力要增加到多少?
王启斌
我们现在还在看。
卫诗婕
几千万元对于一家如此早期的创业公司来说,是相对比较高的投入,对吗?
王启斌
实话实说,并不算太高。大家也知道,我们的融资能力是能够撑住这件事的。
从算力上来说,在具身公司里肯定不低,但对我个人来说并不算特别高。现在国内大厂也在训练具身大脑,包括阿里、字节、小米。这些公司的财力,以及每年能够投入算力的资源,都比创业公司大得多。
更不用说它们可能还有语言模型、多模态视频方面的优势。
卫诗婕
硅谷也是这样。谷歌手上有最强大的语言模型。你们这些创业公司怎么面对这些对手?
王启斌
我们对模型训练的数据,有很多底层洞察。
比如我们 4 月发布的模型,我们坚持认为,手部 3D 位姿的精确度远远比数据量、比 2D 照片更重要。
这意味着我们的采集设备捕捉了人的关节角。它和很多公司仅仅使用纯视频、ego 第一人称视角的视频来训练模型,是不一样的。
人的关节角轨迹能够被采集下来,和仅仅带一个摄像头采集 ego 数据相比,我们的数据更精确、更丰富。
这决定了我们在训练模型时可以反复迭代。数据量从 10 万个小时,到今年年中四五十万个小时,再爬升到年底的 100 万个小时,我们的模型能力肯定会越来越强。
我觉得我们还是有独特理解和复利效应的。
卫诗婕
你说今年数据的 data scaling 会快速上升,为什么?
王启斌
因为我们 4 月发布的模型,实际上是在 10 万小时以上的多模态数据上训练出来的。
这些多模态数据包括视觉、关节角和触觉。我们已经在这个量级的数据上知道,数据进入管线之后,效果会怎样,模型效果会怎样。
我们已经发现了其中的规律,接下来就是扩展数据。
今年我们要把这样的手套至少扩展到 1,000 套以上,以此为基础扩大采集规模。数据进来之后,管线能不能吞下来、模型能不能训练出来,这些都是我们今年可以预见的事情。
说白了,投资人只要投入资源,就能够把效果放大到这个规模。
卫诗婕
你向大家解释一下,你们做的手套是什么样的?你所谓的数据管线又指什么?
王启斌
我们的数据手套是一个全模态数据手套。上面有类似于人的关节角度传感器,也有触觉传感器。采集时,人还会戴一个头环,所以人的多模态数据都可以进入系统。
我们上个月发布的模型,使用的 10 万小时数据就是这样的多模态数据。多模态数据能够支撑模型取得很好的效果。
卫诗婕
就是把手伸进去?
王启斌
对,把手伸进去采集数据。人可以戴着这样的手套去工作,把数据快速采集出来。
而且这个手套后续可以迭代到真实环境中,人在干活的同时采集数据。
卫诗婕
所以所谓数据管线,就是你们把手套交给合作伙伴,让他们采集数据,再把数据回传给你们训练模型?
王启斌
这是数据管线中的一部分。管线是指我的数据处理平台,能够在平台上进行数据审核、标注和处理,完成之后再进入训练框架训练模型。
卫诗婕
你的合作伙伴都是谁?
王启斌
在数据生态里,我们投资了数据运营方,也有一些合作伙伴。
卫诗婕
这 10 万小时数据是在多久的周期内形成的?
王启斌
从去年 10 月底一直到今年 3 月,大概 5 个月。
我们在 3 个数据采集厂里,用几百套手套采集出了这些数据。在手部数据这一块,这是目前全行业最大的数据集。
大家也可以看看,我们前两年在 Hugging Face 上下载排名第一的那个数据集,那是 1,000 个小时的多模态数据。
卫诗婕
现在数据厂有一些乱象。我听说各地合作的数据厂已经出现了很多空置现象。
王启斌
那一定会有。到底采什么数据、如何采、如何低成本采集,并不是每个数据厂都知道。
我知道全国大概建了 50 多个数据厂,真正高效运行、能够把数据拿出来交易的,可能不到 10 个。所以现在一定会有各种各样的乱象。
卫诗婕
刚才讲到无本体数据,我理解你们的数据更多是以人为中心的,对吗?
王启斌
对,我们是 human-centric 的。
刚才说的人类的几个模态,包括类似人眼看到的头部摄像头、手套上采集的人体关节角,以及人的触觉数据,我们都有。
卫诗婕
什么样的数据可以被视为能够规模化进行预训练的优质数据?
王启斌
这是一个非常好的问题。
什么样的预训练数据能够训练出什么样的预训练模型?就像我刚才一直反复讲的,人类的操作有 3 个特性。
第 1,它能够对任务进行长程分解,这是语义层面的能力;第 2,它能够做好手眼协同;第 3,它能够进行纠错。
数据本身要满足这些要求。还要有手眼配合的多模态数据。
所以我们反复强调,数据手套除了视觉之外,还能采集触觉和关节角等多模态数据。同时,采集时任务的多样性也非常重要。
只有这样的组合,才能保证规模化数据产生之后,能够高质量地训练模型。
卫诗婕
我是否可以这样理解:只有真正具备大脑能力、正在训练模型的公司,才有资格定义到底需要什么样的数据?
王启斌
Exactly,非常对。
数据本身还是要有需求方。真实场景中,现在有两类公司在使用数据:第 1 类是基模公司,中国的或者美国的;第 2 类是头部集成公司。
我们自己在使用数据,所以知道什么样的数据重要。如果没有模型需求方来牵引数据,一定会出现无序、低效的乱象,或者垃圾场级别的数据采集。
必须有很强的公司在前面牵引,对数据进行定义,包括格式、模态等,最后才能有效地生产数据。
这个行业有一句话叫 garbage in, garbage out。数据不行,训练出来的模型也不行。最重要的是,只有基模公司和头部的具身公司能够分辨什么是 garbage,这很重要。
大部分人现在可能确实在生产 garbage。
卫诗婕
我上一次来你们实验室考察时,有一个非常有意思的发现:你们公司内部正在加班加点做数据工作。这是不是意味着你们跑得非常快?
王启斌
是的。
大家今天看到的 10 万小时,是我们经过很多尝试之后的结果。比如我们是不是需要深度数据?深度数据要用什么样的摄像头?很多东西都要尝试。
卫诗婕
什么叫深度数据?
王启斌
平面上看到的只是 RGB,也就是红、绿、蓝 3 个颜色。深度数据则能看到纵向的维度,也就是物体的厚度和距离,可以用深度摄像头、结构光等方式采集。
卫诗婕
很多公司都在做通用大脑,我理解通用大脑也涵盖灵巧操作。你们有什么信心说自己会比那些做通用大脑的公司做得好?
王启斌
“通用”现在也是一个被滥用的词。
通用的意思是,人类数据输入之后,训练出来的模型更接近人的数据,因此具备更多泛化能力,能够完成长程操作。
但通用灵巧操作复杂的地方在于,要做人的高自由度手部操作和手眼协同。
我们是从模型到数据一路走过来的,所以今天能够做到这样的能力。一个仅仅使用非人类数据、比如夹爪数据的模型,后面数据来源如何持续多样化、如何保证充足,会遇到瓶颈。夹爪模型显示出来的效果也会有局限性,这就是很大的差异。
卫诗婕
你刚才提到了,美国的具身大脑公司确实比中国的大脑公司领先一个身位。你觉得中国有机会在大脑层面做得更好吗?中美在具身大脑训练上,会有不同的叙事吗?
王启斌
其实是有这样的机会的。
在大语言模型上,我们看到 DeepSeek 在 R1 推理模型上快速赶超美国,而且是在算力资源受限的情况下完成的。
中国具身模型的大脑现在还处于非常早期的阶段,大家都会快速迭代。中美之间后面会发生什么样的叙事逻辑,是动态的。
尤其是在中国,如果数据成本足够低,能够快速实现高质量数据的规模化,那么我们有可能在模型上追赶。
卫诗婕
中美具身在数据成本层面的差异,能不能具象化体现一下?
王启斌
举个例子,半年前我们在美国采集一条同样的抓取数据,成本按美元计算。我们可能做到 2 到 3 元人民币,对方可能是 2 到 3 美元。
这个数据量就决定了整体规模的起量。
现在大家看到印度人带着头环采数据,不仅成本低,数据也有多样性。国内我们接触的是泛服务行业、物流流通行业以及 To C 场景,大家都开始做。
如果做得好,和模型形成耦合迭代,我觉得有机会在某个时间点追赶甚至持平。
卫诗婕
蜜蜂说要做数据交易平台。我一直有一个疑惑:如果对于我自己训练模型来说,含金量特别高的数据,我是绝对不会拿出去卖的。
王启斌
Good point。这里还有两个点没有说透。
第 1,我觉得具身模型需要的数据量远远超出我们的预期。我们认为 100 万个小时只是一个起点,真正可能要达到它的 100 倍,也就是 1 亿个小时。
这意味着数据需求是一片汪洋大海。每家公司拥有的数据,可能只是其中一个小湖泊。
你说湖泊里的资源数据是不是稀缺?当然稀缺。但有没有可能把这些数据加在一起,产生更大的综合效应?
所以我个人预测,在一定阶段,数据会发生交换。就是我手上有价值的数据,和你的数据进行交换。
我不认为在可预见的 3 年内,谁能真正说自己垄断了数据。因为数据采集成本以及具身应用场景太大了。
举个例子,我在物流或者商超场景做两年数据,对物流和商超的东西非常熟;另一个人可能做的是工业上的高精度、高节拍场景,对那部分非常熟。不同数据对模型的价值是不一样的。
但未来有没有一天大家进行数据交换?我觉得有可能。
在这片汪洋大海里,目前看不到谁能垄断数据。大家可能都会获取更多数据资源,输入模型,让模型能力增强。
卫诗婕
谈到具身数据,大家会用 recipe 这个词,也就是配方,数据配方是模型大脑能力的体现。
如果数据可以在市场上交换流通,数据就不绝对地构成壁垒。真正懂得如何训练模型的公司,如果能够拿到更多数据,哪怕不是自己生产的,也能够获得一定程度的领先,而且这种领先可能很稀缺。
我的理解对吗?
王启斌
完全是的。
作为一家大脑公司,我们认为一定是这样。对我们来说,杠杆很高,并不一定非要资金体量最大。
大家可以看到,GPT-3 还是 GPT-3.5 之后,就不再公布技术细节和数据配方了。具身领域更复杂。现在大家展示的模型效果,具体使用了什么数据配方,其实只有自己知道。
卫诗婕
我问一个非常实操的问题。资深投资人都跃跃欲试,想看项目。对于创业者来说,你会把公司训练模型的 recipe 公布给投资人吗?
王启斌
当然不会。
卫诗婕
因为这是含金量最高的东西,对不对?
王启斌
对。大家会交流一个大致情况,比如用了什么样的数据、用了人类数据、用了多少小时真机数据做 fine-tuning。
但真正的数据配方和具体小时数,我们肯定不会公布。
卫诗婕
对于投资人来说,投之前岂不是盲选?因为看不到你的底牌,可能要交钱进去之后才能看底牌。
王启斌
投资人最后看的是这道菜到底怎么样。
卫诗婕
机器人脑公司到底应该怎么做?这些全球领先的大脑公司给过你们什么启示?你们研究过吗?
王启斌
我们一直在关注。去年世界机器人大会之后,我们开始专心思考数据。
去年有几个节点。第 1,Generalist 发布了 27 万小时的数据和 π0 模型,这和我们的判断不谋而合:真实数据非常重要。但它使用的是夹爪数据,我们觉得用同样的范式做手部数据,也一定能够做出来。
后来还有几类公司,比如陈驰的公司。从去年年底开始,全球头部模型公司和我们的判断越来越接近:真实数据里的东西非常重要,配方以及处理数据的管线也非常重要,配方做好之后会体现出很大的模型效果。
所以我们去年做了一件别人没有做的事情:把人类数据如何采集进来这一步自己闭环完成。我们开发了数据采集工具,开始搭建管线,规模化采样、训练模型,然后持续运行到现在。
卫诗婕
你们定义的真实数据是什么?
王启斌
真实数据就是通过这套数据采集设备采集下来的数据,而不是纯粹来自仿真的数据。
卫诗婕
市场上也有仿真派,你怎么看?
王启斌
我们还是坚持认为,真实数据做好之后,在成本和多样性上都更有优势。
卫诗婕
真实数据的成本还有下降空间吗?
王启斌
一定有。
整个数据成本分 3 大块。第 1 是采集设备成本,这符合规模化硬件迭代的逻辑。第 2 是数据采集运营成本,涉及人的成本,国内有很大的运营体系,特别擅长把这件事做好。第 3 是存储和算力成本。
这 3 部分结合在一起,我们有办法持续迭代、不断降低成本。
卫诗婕
现在在中国采集一条真实数据的成本是多少?
王启斌
不一样,取决于任务的难易程度。从几十元一小时,到 100 元左右一小时,都有可能。
卫诗婕
这个数字已经比半年前下降很多了。
王启斌
对。半年前很多还是以遥操作为主体。遥操作整套机器人的固定投入分摊,成本很高。现在大家转向人类数据采集设备,成本就会低很多。
卫诗婕
所以刚才你回答机器人脑公司应该怎么做,答案是更重视并采集真实数据。
王启斌
这只是第 1 步,是其中一步。
一定要有数据基础,有能力知道采什么数据,然后批量化地把数据采回来、处理完。后面还有配方,按照配方训练模型。完成之后,还要建立 evaluation,也就是模型评估体系。
比如,怎么在评估环境中评估模型,怎样从数据到模型形成完整管线。全球做大脑的公司,都要解决这些问题。
卫诗婕
全球做大脑的公司中,有一家所有人都会关注的独角兽,就是 Physical Intelligence,也就是 PI。你们对标的是 PI 吗?
王启斌
我们一直在研究 PI,但和 PI 并不是完全对标。
PI 使用的是夹爪数据,我们采集的是高维手部数据。这一点和最近的 Dream 系列,也就是 Dream Zero 和 Dream Dog,有部分相似,都是聚焦于手部。
卫诗婕
你怎么看 PI 的夹爪式物理数据,对整个行业的影响?
王启斌
PI 还有很多真实机器操作数据。它通过数据告诉大家,用真实数据运行模型,可以取得很好的效果。
π0.7 也告诉大家,在夹爪上已经能够实现泛化,同时能够理解语言,把 compositional language 直接拆解成机器人任务。这是一个非常重要的突破。
卫诗婕
所以你认为 PI 对你们最大的验证和启示,是证明真实数据的泛化效应,以及真实数据对模型智能涌现有很大作用,坚定了你们走这条路?
王启斌
部分是,部分是。
卫诗婕
其余呢?
王启斌
其余你可以再和袁培聊聊。
这些大脑公司开源了模型、公布了夹爪数据,但不代表它只在做夹爪。可能它们也在做手部,只是开源和公布出来的内容,未必是最领先的阶段,可能是前一代或者前两代。没有必要把所有底牌都亮出来。
卫诗婕
据我们所知,应该已经有两三家公司在做手。你们预期自己能够做到全球什么样的状态?什么程度会让你个人很满意?
王启斌
我个人觉得,投资人疯狂问大家是不是已经走到 GPT-3.5、类似 ChatGPT 的时代,好像还远未到。
今天大家可能还处在一个相对平的阶段,真正的基点或者突变点还没有发生。在那之前,没有人能够洋洋自得地认为自己已经取得了多大成就。
所以我们还在不断扩展认可的数据量级和模型训练迭代速度,目前仍处在这个阶段。
卫诗婕
我上一次采访的嘉宾、智源研究院的杨宝清院长认为,现在具身智能还没到 GPT-1.0 时代,所以谈通用有点好笑。
王启斌
我觉得,因为这个赛道比较长,大家切入的路径不一样。
我们从一开始就定位在做通用。从去年开始发布的模型,也在证明我们确实可以在不同任务上实现泛化。4 月大家看到的 demo,都是在同一个基础模型上做出来的,只是通用程度不同。
我个人为什么不碰 To C 家庭?因为我认为,多种任务、多种物体、完全非结构化环境下的通用能力,还需要很长时间。
但在一个 domain 内,专注于这个 domain 的通用性,完成多种任务,我认为是可以做出来的。
卫诗婕
其实你们俩有一点共识:在现在的具身大脑层面,没有绝对意义上的头部,因为大家都没有完成自己立下的目标。
王启斌
这点我认可。
现在大家说谁是头部,可能只是从自己的理解出发,用简单粗暴的估值来判断。但在这一场颠覆性的范式变化中,在这么大的一波浪潮里,现在说谁是头部还太早。
游戏才刚刚开始,第一轮淘汰赛都还没有开始。
接下来会有一轮轮淘汰赛。比如做大脑的公司找到了一定的小配方,能不能把数据量级高效扩展起来?能不能在模型里形成迭代?模型迭代的效果能不能落到真机上,产生好的效果,再回流数据?
所以我认为,现在仍然处在非常早期的阶段。
卫诗婕
从你刚才说到苹果开始,苹果手机做得很好,有一个非常 smart 的地方,就是把多传感器融合得很好,并在用户体验中交付出来。
具身领域的机器人需要非常多模态的数据,也需要很多传感器。但现在大脑层面大家并没有共识架构:到底怎样的模型架构,才能很好地融合多种传感维度的数据,涌现出适合机器人的智能?
我的理解是,大家首先没有共识,其次也没有探索出绝对成熟的状态。这个理解对吗?
王启斌
部分是这样。
现在有主流架构,但主流架构在目前阶段是不是绝对垄断性的架构,还值得探讨。底层架构的有效性是不是足够强,本身需要数据验证。
Transformer 能够不断发展,是因为 GPT-3.5 之后,尤其到推理模型,再加入强化学习的范式,吃掉了非常大的数据量,得到了验证。
我们现在在做两件事。第 1,如何在复杂空间里做操作。现在大家认为,基于数据的 World Action Model 可能是一个好的探索方向。
第 2,人类说出一句话之后,如何像人一样把它拆解并执行。到底什么样的架构能做到这一点?以前大家觉得语言模态很重要,但我觉得还是需要一定的数据量来支撑和验证架构。
卫诗婕
你们是一个双模型架构,对不对?解释一下这个双模型。
8. 双模型构成闭环
王启斌
双模型架构里,第 1 个模型是类人的动作生成模型。它的输入包括图像、语言和历史状态,输出机器人要执行的动作。
它是一个 Action Model,也就是策略模型。这个策略需要一个评估体系:策略生成动作之后,最终是否达到了预期?
所以我们还有一个真正的世界模型来评估它。世界模型会看动作执行之后,系统状态变成什么样。如果状态不对,就在里面进行优化,其中包含强化学习,也会加入很多失误数据,大概 30% 的纠错数据。
所以这里有两个模型,它们串在一起形成闭环,对策略模型生成的动作进行评估和优化,最后整个数据再回流,形成新的数据集。
卫诗婕
我理解这有点像快脑和慢脑架构,但也有差异。
以前快慢脑的架构,更多是想办法接近第 1 个模型,也就是 R2 模型,输入视频、历史状态和语言,生成动作。
你们的 W0 更像一个基于真实世界的仿真器,用来评估这套东西。它回答的是,怎么对策略进行评估和优化。
王启斌
对,最后都是希望 Action Model 生成的动作更有效,弥补机器人和人之间的巨大差异。
卫诗婕
R 是 reasoning,也就是生成策略、进行推理吗?
王启斌
最早用 R 系列,是因为它是我们的 Action Model,R 强调的是 reinforcement learning,也就是强化学习。
卫诗婕
所以它形成了闭环:一个模型产生结果,然后在同一个架构里自己验证自己。
王启斌
对。
卫诗婕
这套双系统架构在业内是独创的吗?
王启斌
我们目前是最早把这两个模型串在一起进行闭环的人,最早提出了这套架构。
卫诗婕
有哪些变量决定着模型的差异?刚才我们提到了数据、模型架构和 recipe 配方,还有别的吗?
王启斌
当然还有模型架构里的模块设计和调整。
我理解它本质上构成了一套训练方式,而训练方式背后又是人。大家真正的竞争点,我觉得是怎么样吸引到真正优秀的研究人员,并且激发他们做出有效探索。
在这一点上,创业公司相比大厂有不同的优势。
卫诗婕
确实,回到底层,我们要找到足够多的算法人员。招聘顶尖人才是一个很大挑战。
在模型训练上,你们和头部大厂之间也有过竞争。大家都想找训练过大模型、做过超大规模模型后训练的人。所以这里面还是非常直接的抢人。
你能抢得过大厂吗?
王启斌
本质上,我能抢得过想来创业公司的人,但有时候也抢不过。
吸引人才有几个层次。大家初步看到的可能是薪酬,但对 00 年左右出生的 AI 原生代人才来说,package 只是其中一部分,还有更内核的东西。
第 1,我们做的事情一定是他真正想做的事情,这非常重要。我们做的是具身领域皇冠级、极具挑战的事情。
第 2,我们在逐步建立口碑。最近我听到很多猎头给 HR 的反馈,业内会认为灵初是一家非常简单、透明的公司。
我们几个联合创始人倡导做一个非常透明的公司,沟通成本低,技术策略清晰。这些都是我们正在建立的软影响力。
卫诗婕
你接触过很多去大厂的候选人吗?
王启斌
基本上所有候选人我都会面。
卫诗婕
你面多久?
王启斌
每个人不一样,基本上是 30 分钟到 1 个小时。即使是最 junior 的候选人,我也会面 30 分钟。
卫诗婕
你问什么?
王启斌
不一样。
我面试有两个目的。第 1,我也在和人交流,学习他做的东西,以及他在研究机构里的工作,放到具身操作公司的体系中,到底哪些是轻、哪些是重。
第 2,我很重要的是看这个人 fit 不 fit 这家公司,能不能和身边的人搭在一起。
我更喜欢招非常简单、真正喜欢做这件事的人。我们肯定会给他 fairly enough 的 pay,把这样的人招进来。
卫诗婕
你怎么判断他和身边的人搭不搭?是一种直觉吗?
王启斌
这是两步。
第 1,我们会看他做过的工作。我会反复问:你在组织中承担的工作是怎样协同的?遇到最难的事情时,是怎么解决的?
我不太在意他最后是否解决了,我更在意他用什么方式解决问题,是不是 right 的方式,以及他是不是真的 persistently、用尽一切力气去解决问题。
我不太喜欢那种简历非常光鲜,但讲出来的事情一帆风顺、没有经历过挑战的人。因为这不符合做难事的底层规律。
如果我们做的真的是一件很难的事情,包括发表论文、做研究或者做超大型项目,一定会有非常难的部分。可能是技术上的,也可能是工程上的。
没有失败过的成功是不可信的。
卫诗婕
换个角度,没有失败过的经历,是否算 real 的成功,也很难定义。
现在大家抢人都很激烈。我理解,在前沿技术探索中,愿景非常重要。
你刚才反复提到,你们做的是皇冠上的事情,但好像没有使用“皇冠上的明珠”这个词,因为这个词比较俗。灵初在 vision 这一部分,你好像一直没有把 narrative 描述好。
王启斌
我本人对描述一件事很挑剔,但不是因为高傲。
“皇冠上的明珠”这句话太俗了,我不想用“明珠”这个词。它很有年代感,不像 AI 时代应该用的词。
有人说在爬山,但我觉得我们真的不是在爬山,我们在冲浪。技术是一浪又一浪,浪的形状不断变化,我们要有能力真正 serve 这股浪。
所以“皇冠上的明珠”是一个很糟糕的描述,我自己很难 convince 自己。我还在想应该怎么描述这件事。
本质上,我们想做的是真正有操作能力、有应用场景,同时又很艺术的东西:做出一种机器人形态,或者说一个新的物种。准确地说,它是一个真正带有智力、能够完成复杂操作的超级形态。
我们要解决的是这样一件非常有挑战的事情。到底怎么描述它,我还在想。
卫诗婕
我说“皇冠上的问题”,是想问你:通用灵巧操作在整个具身变革中,会是一个核心价值的锚定点吗?
王启斌
一定是。
卫诗婕
为什么?
王启斌
就像我刚才从头讲的,从人类进化的角度看,从语言到视觉,再到基于小脑和肌肉完成操作,最难的就是这一部分。
这也一定是在验证算法和模型的难度。它一定是这一波具身浪潮中最核心、最重要的价值锚点。
卫诗婕
袁培之前跟我说过一句话。他按照自己的想法,觉得灵初应该定位成一家 AGI 公司,因为你们做的是通用智能技术,未来甚至可能不做机器人、不做灵巧手,而是把这项技术变成一种基本能力,像基础设施一样流通在各个市场上。
听起来好像很有道理。他确实跟你提议过,但你最后没有这样定位公司。
王启斌
我相信康德那句话:既要仰望头顶璀璨的星空,又要脚踏大地。
我知道这句话的上半句,但作为一个成熟、理智、经历了这么多年的成年人,我要先知道自己的脚站在哪里,才会说出这句话。
我不想把它变成一句简单的流行话,叫 AGI。但我知道,大家心里都有一个向往,希望最终把它做成那个样子。
对我来说,同时要想清楚我站在哪里、路径是什么。
卫诗婕
市场上很多公司都说自己要做通用大脑。你们本质上也要做这件事,但你不这么说,会不会很吃亏?
王启斌
可能是想得更好、更通透之后再说出来,才能更 convincing。这可能是我的个人风格。
卫诗婕
所以你们 Day One 就做 manipulation?
王启斌
是的。
卫诗婕
袁培是 00 后,这也是你们创始团队非常有意思的地方,叫“七八九零战队”。你是 70 后,袁培是 00 后,柴晓杰和杨耀东老师分别是 80 后和 90 后。
这个组合把各个年龄段都配齐了。你们平时怎么工作?大家风格上有差异吗?
王启斌
当然有风格差异。
还是回到我们这个组织要完成的任务:从 R 走到 D,从 research 走到工程,再走到产品。
这里需要 AI 原生代的人,像袁培这样的 00 后,有很强的 AI 能力和很好的创意。
同时还需要工程化能力,包括怎么把管线搭起来。小杰做过工程化,做过接近 1,000 台车的数据平台。
大家更多是互补的能力。再往后走,要做场景级应用,这需要大家互相结合、配合。
卫诗婕
我认为今天中国资本市场还是比较青睐年轻人,甚至说得严重一点,有点年龄歧视。
你从一开始就向大家强调自己是 70 后。面对这种年龄偏见,你有什么想说的?
王启斌
很坦诚地说,在创业初期,确实会被投资人 challenge,之后也会自我反思。
但我觉得今天这已经不是一个问题了。既然我能够创业,肯定有自己的价值。
举个例子,即使是 OpenAI,ChatGPT 在 2022 年年底发布之后,2023 年年初就引进了 Peter Thoma 这样的产品负责人。
我觉得所有产品最后都要完成从技术到产品、再到市场的路径。到了某个阶段,像我这样的背景会有很强的优势。
所以这件事我已经完全不纠结了。
当然,从治理公司的角度看,在这个阶段应该建立什么样的组织、什么样的文化,才能让 AI 原生代的人在创业公司的算法体系里发挥更大优势?早期要帮助他们运转起来,中间又怎样通过 top-down、透明的方式把项目管理起来?这些问题更重要。
卫诗婕
你今天和我上次见你时不太一样,是去染头发了吗?
王启斌
有一点。
卫诗婕
是为了上镜更好看吗?
王启斌
我老婆觉得这样更好上镜,所以让我做一下管理,让她老公看起来更好一点。
卫诗婕
但我看没有全部染,两边还留了一些白发,为什么?
王启斌
没有,那是上次染了之后,自然变成这样的。
卫诗婕
我以为有什么特殊寓意。
王启斌
没有。
卫诗婕
你整个状态非常年轻,是因为跑步吗?
王启斌
我比较喜欢运动。现在基本上每个月还会跑步。
卫诗婕
所以你是一个户外运动的人?
王启斌
现在还算不上完全的户外人。以前每周还能打打网球,现在网球搭子也没了,只剩下跑步,偶尔做一些无氧运动。
卫诗婕
袁培是 00 后,你和 00 后怎么交流、怎么合作?
王启斌
我觉得不需要刻意交流。
我最大的价值,是作为一个比较成熟的人。很重要的一点是,除了可见的产品,公司本身也是我最大的产品。
我反复强调,我们要做一家非常透明、把技术和工程做到极致的公司。像袁培这样的 00 后,在他擅长的领域,就应该让他有最大的发言权。
他需要什么资源,我们就给他足够资源,让他牵引手上的事情,这就足够了。
所以从技术和原生模型角度看,这不是传统意义上的管理。
我也觉得现在“管理”这个词有点 old school。目前我还在思考一个很大的问题:在 AI 应用方面,我自己也在使用 AI 工具,把自己的工作流 stream 起来。怎么让公司内部的运作更加 AI 化,这也是很重要的话题。
卫诗婕
我去年在硅谷听到一个说法,叫 research as a product。现在做 AI 的 researcher,也有机会定义产品。不像原来,研究和产品之间有一条界限分明的线。
你觉得 AI 时代的产品经理是什么样的?研究人员可不可以做产品?
王启斌
单纯的研究员做不了。
真实情况是,OpenAI 在 2023 年年初就有了产品团队。我听说 Anthropic 也让 post-training 团队承担了部分产品职责,去看哪些应用更好。
我觉得本质上产品经理这个角色还在,但产品经理的能力边界扩得更宽了。
不管是 researcher 能不能做产品,还是产品经理是不是要更懂技术,底层逻辑是一样的。
做产品的人有 3 个圈。第 1,他要懂技术。在这个时代,不懂技术怎么做产品?第 2,他要懂 UX,也就是用户交互。第 3,他一定要有商业思维,知道这个模式怎样形成商业闭环。
今天的 researcher,如果技术驱动能力很强,同时对后两个方面也有 sense,当然可以做产品。
产品经理也是一样。如果不懂技术底层,就做不了今天的产品,尤其是模型驱动的产品。
这是互相牵动的。这两年大家也可以看到,我们公司有产品经理自己使用 AI 工具画出所有原型图,直接开发一些简单功能,验证模型效果。
卫诗婕
所以你仍然会接受,甚至乐于选择来自前几个时代的产品经理?
王启斌
不是。
我还是更看重 BAT 中比较年轻的 AI 原生代人才。他们有很好的技术或算法 sense,同时又有客户和用户 sense,并且开始具备商业 sense。我觉得这才是面向未来的产品经理。
卫诗婕
如果我们节目的听众和观众里,有来自上一个时代的产品人,你有什么建议给他们?
王启斌
我现在面试人,会问他是不是关注最新的 AI 信息,自己是不是真的动手使用 AI,包括是否把 AI 用进自己的工作流。
如果是这样,我觉得他可能更容易随着这一波浪潮融入进来。
卫诗婕
一家瞄向通用智能的公司需要很长的战线,怎么确保资金充足?你们在融资和商业路线图上怎么思考?
9. 模型能力走向商业化
王启斌
融资上,我们会更强化大脑公司的定位,定期发布模型,同时也会做商业化。
目前商业化有两个模式。
整个大浪潮我判断有 3 波。第 1 波是硬件已经出来了;第 2 波是数据,我们会把数据采集设备和数据做一些变现;第 3 波是场景,我们会在模型覆盖的场景里做解决方案销售。
这两条线今年都会推进。
卫诗婕
所以你设定了在 2026 年年底实现数亿元销售额的目标,对吗?
王启斌
对。就是通过两条具体的线:第 1,数据采集系统和数据;第 2,行业解决方案。
卫诗婕
我观察到,2025 年行业开始卷量产,2026 年开始卷交付。很多机器人瞄准进入工厂。
但我一直很好奇,如果准确率达不到 100%,出了生产事故谁负责?
王启斌
毫无疑问,集成公司和供应商之间会有协议,肯定要负责。
但在某些情况下,能不能由人工接管?这要看具体生产场景。
我个人判断,在流水线这种高节拍场景上很难,但在流水线下面的供料等场景,基本应该可以跑通。
卫诗婕
准确率和事故问题,和你们现在的模式没什么关系,是吗?
王启斌
有关系。因为我们在做场景级解决方案时,物流客户也会有整体评估。
卫诗婕
现在要达到什么样的准确率,才算可商业化、可落地?
王启斌
物流上大家还是会做到至少 3 个 9,也就是 99.9% 以上的成功率。
节拍也很重要,至少要达到中国工人作业节拍的下限,才能商业化。再加上人工接管系统,就可以逐步推进商业化。
卫诗婕
但我最近半年发现,物流等场景非常红海,几乎所有机器人公司都在做。
王启斌
这就是从高度非共识走向共识的一条路径。切入口很重要,大家可能都认为,一定的泛化性加上适中的节拍,是可以切入的方向。
当然,底层还要看场景是否足够大。综合这几个维度,可能就是一个可以做的场景。
卫诗婕
你们现在和未来的客户都有谁?
王启斌
刚才说的两个模式,一个是设备和数据,客户包括一些数采厂,也包括国内的技术模型公司。
在物流上,我们已经和国内头部物流公司开始做 POC。工业客户则包括汽车零部件供应商,还有 3C 客户。
卫诗婕
我和投资人聊出来的一个判断是,他们觉得现在的具身行业挺脱离基本面,非常看各家的拿单能力。
王启斌
这是一个反常识的观点,我不太认同。
我觉得根本不是拿单。现在所有具身公司,包括我们在内,周围的行业头部公司,目前还是产研驱动。
如果我们真的能把一个场景交付出去,根本不愁客户。
卫诗婕
为什么会有客户簇拥着你们?
王启斌
这一波大潮里,所有客户都知道早晚要下场,所以大家通过各种方式下场。
有的客户是要解决成本问题,认为具身未来会成为一种解决方案;有些制造业客户则认为,具身机器人是他们未来要做的产品,是可以赚钱的产品,所以也会下场。
真实情况是,大家都期待我们解决他们的场景问题。但选择太多也会构成诱惑,让人挑花眼。
卫诗婕
你怎么选?
王启斌
一定是万花丛中过,然后选取自己最重要的场景。
今年是我们非常收敛的一年。我们已经从看行业细化到看场景,包括具体场景怎么做,都有很清晰的规划。
卫诗婕
你怎么定义最好的场景?
王启斌
有几个逻辑。
第 1,一定要有真正的商业价值和痛点,也就是说,它应该是行业中的共性场景,应用面很广。
第 2,场景要符合我对数据泛化性的需求。比如物流里有 10 万种商品,从 1,000 种增长到 1 万种,再增长到 10 万种,这种量级增长本身就能提升模型能力。
它不能只是在一个工序上持续操作 5 种或 10 种东西。那样过了一定阶段之后,就接近非标自动化设备了。
这里面还要把数据成本隐含地放进去,这就是我们挑选场景的逻辑。
第 3,是技术可实现性。
卫诗婕
所以一个是商业收入的功能,一个是模型提升的功能。
王启斌
对,这两个都非常重要。
卫诗婕
哪个更重要?
王启斌
必须同时满足。两个条件都满足,才会选择这个场景。
卫诗婕
如果做大脑的公司无法在模型和算法上保持明显领先,我是不是可以认为它会掉下牌桌?
王启斌
一定会。这也是所有做大脑公司的挑战。
卫诗婕
本体公司也越来越有自研大脑的趋势。你认为这是它们必须做的事情吗?
王启斌
这是 3 个圈的问题。
这是它们一定想做的事情,但这是不是它们一定能做的事情,以及市场是不是给它们机会做,我不知道。
卫诗婕
你怎么判断一家具身企业是不是在画饼?
王启斌
我不太在意别人画不画饼,我只关注自己是不是在画饼,或者是不是在做真正重要的事情。
卫诗婕
刚才听起来你好像抗拒画饼。
王启斌
从公司的本质风格来说,我们肯定要在基本面上充分 convince 自己,然后持续做那些事情。
“画饼”本身是一个中性词。作为一家公司,还是要给投资人,包括潜在求职者,一个强烈的愿景和信心。
但这个东西一定要从公司内部出发,以创始人为核心,先自己相信这件事,持续把事情做好,再把故事讲好。
卫诗婕
你怎么定义最头部的具身大脑公司?
王启斌
当然还是看模型展示出来的能力,还有几个维度:研究人才的能力、是否消耗了一定算力、数据管线能不能做好。
这些可能是判断大脑公司的一些方法。
卫诗婕
不止一个业内人士跟我说过,demo 并不能和模型能力画等号。
王启斌
如果是真实、可信的 demo,还是能够部分展示模型能力的。
卫诗婕
你怎么判断一家公司的 demo 是不是真实可信?
王启斌
专业人员能够看出一些东西。比如里面是不是有操作延迟,是否是遥操作,还是完全由 policy 控制,这些还是能够看出来的。
有时候,如果存在部分抖动和延迟,反而可能更真实。
卫诗婕
2026 年上半年,具身行业的水温和动向有什么变化?
王启斌
第 1 个共识是,大脑公司非常重要。第 2 个共识是,数据也非常重要,这一点已经开始显现。
但行业里仍然参差不齐。什么样的数据更重要,什么样的公司能够验证自己是好的大脑公司,大家的判断仍有差异。
卫诗婕
差异在哪里?
王启斌
要看大脑公司发布的模型效果好不好,也要看它获取数据的飞轮能不能持续。
卫诗婕
我之前和一位技术管理者聊,他说国内的大脑公司都在等美国最领先的大脑公司开源。你怎么看这两个判断?
王启斌
大家太乐观了。
目前开源的,包括 PI,并没有完全开源模型,更不用说完整权重。大家只会部分开源数据集之类的东西。
第 2,最近听到消息,27 万小时的数据里可能有烟雾弹。所以我觉得,国内大脑公司要招募顶尖人才,在技术路线上形成自己的判断力。
卫诗婕
很坦诚地说,为什么今年年初你们依然给头部具身公司供应数据?
王启斌
作为数据供应商,我也在观察生态中的迭代和演进。
卫诗婕
你说的头部建模公司,是头部具身建模公司,还是头部大语言模型公司?
王启斌
头部具身建模公司。
卫诗婕
也就是说,你们的竞争对手,你们也在给他们供应数据。
我听说一种很夸张的说法:有些声称做大脑的公司融了很多钱,但其实并没有真正训练模型。
王启斌
我觉得有可能。
卫诗婕
不确定,但有可能?
王启斌
对。
卫诗婕
你觉得上半年灵初在行业中的身位有变化吗?
王启斌
一直没有变化。
因为大脑在行业应用中越来越重要,灵巧操作也越来越重要,所以大家逐渐意识到了灵初在这个行业中的位置。
灵初成立时是一个很小众的公司。我们是中国第一个在成立时就向所有人讲灵巧操作和灵巧手的公司。最早向大家讲灵巧手的强化学习,也没有人能听懂。
现在可以说,这也是一种信用和判断力。大家越来越验证,我们做的事情重要而且有价值,所以灵初相对越来越显眼。
卫诗婕
你觉得具身行业现在进入拐点时刻了吗?我认为拐点会是一段相当长的周期,现在到这个周期的开始了吗?
王启斌
我觉得曲线已经开始跑了,但还没有真正进入拐点时刻。
我们会认为,今年年底可能是模型的第 1 个阶段。到了一定数据量之后,模型的泛化性会更强,今年会有第 1 个阶段的验证。
卫诗婕
你们做了很多实验和探索。具身机器人有没有可能以一种更快的方式学习?
它到底是一种可以和人类相比的学习方式,还是完全不同于人的学习方式?
王启斌
我个人觉得,从学习范式上,希望达到人的效果,但学习方式和人完全不一样。
卫诗婕
所以你觉得 2026 年是具身领域数据军备竞赛的开始吗?
王启斌
基于数据量增强的模型迭代军备竞赛已经开始了。
卫诗婕
你觉得这个军备竞赛会持续多久?
王启斌
我没有看得那么透。我觉得至少是 3 年以上的周期。
最重要的还是回到那句话:大家对大脑未来要解决的问题,期待是非常广的。
卫诗婕
有几家公司都声称今年内会达到百万小时的数据量级。当然我理解,大家的数据不是同一种数据,有做手的,有做夹爪的,也有本体数据。
你觉得到时候大家会汇合,还是会完全岔开?
王启斌
百万小时这个目标,是我们在国内最早于去年提出的。但现在所有人都在说,我反而很慌,感觉变成了随波逐流。
大家真的都有足够的 insights 来判断这个目标吗?
我们当时提出百万小时,是基于几个预判。第 1,我们从汽车数据倒推,认为最后可能需要 10 亿条 clips。第 2,当时我们已经有大概 6 万小时真实数据,算下来觉得有可能做到。
但现在大家都这么说,我反而觉得要重新从 factual 层面推演。它依然只是一个 hypothesis。
卫诗婕
那最终是不是有可能比 100 万个小时更重要的是,质量更高?
有什么话想对同行说?
王启斌
没有特别的话。我觉得大家都在各自冲浪,尽情发挥、各自表演,能够冲得开心,给大家一些价值。
卫诗婕
现在做大脑其实没得抄,是吧?因为真正做得好的公司不会开源。
王启斌
对。大家看到很多人都在发布模型,但实际上没有人真正开源底层权重,也没有完全开源。看到的东西,还是需要很强的预判能力。
卫诗婕
做到什么程度,你会觉得这次创业是一个酣畅淋漓的创业?
10. 创业没有终点
王启斌
我现在最大的经验教训是,曾经以为有一天能够走到一个阶段,彻底释放自己。可能这是一个误解。
可能过程中才是最重要的事情。
卫诗婕
地瓜机器人的秦玉森也说过,他们做机器人基础设施,就像西西弗斯推石头。今天觉得基建工作做到 61%,第二天可能又掉到 59%。
王启斌
一定是这样。这非常符合螺旋式上升的规律。我们永远会创造新的需求,也会解决更大的问题。
更重要的是享受这个过程。
卫诗婕
你的风格非常务实。你有没有想讲一讲你们创业中浪漫的部分?
王启斌
永远浪漫的人,浪漫是在心里。
作为一个 70 后,有机会参与这样一个史诗级的征程,本身就很有意义。我们“七八九零”的组合也很有意思,大家相处得很和谐,里面有很多感人的事情。
有一天早上我到公司,特别有意思。以前你身后的墙上有一个 logo,后来墙改了。大概四五个月前的一天早上,我习惯来得比较早,看到太阳从斜面照进来,很多具身设备的部件在那个地方。
我突然觉得,自己的努力有一天能够让我们参与这样一件激动人心的事情,非常高兴。
还有一天,我和一个头部客户开会,对方非常认可我们的能力和价值,我也觉得特别有意思。
真正感动自己、感动团队的,永远不是大家觉得宏大的叙事,而是公司在这一切中,每一点都一点一点进步。这就是一种复利效应。
包括我们能够招到最聪明的人才,也是一种变相的认可。我对沿着这条路持续走下去,还是非常有信心的。
卫诗婕
最后聊几个轻松的问题。你有最害怕的事情吗?
王启斌
我觉得创业的人应该都有害怕的事情。
很坦诚地说,我有过中年危机。大概 40 岁的时候,我害怕未来发生的事情可能和我无关。这是当时最害怕的一件事。
现在加入这股洪流,带领一家公司创业,本身就是一件很有意思的事情。所以害怕和激动永远是两面。
卫诗婕
能不能分享一本你最喜欢的书?
王启斌
前段时间让我最高兴的,还是读《Same as Ever》,就是摩根·豪泽尔的那本书。他之前写过《金钱心理学》,这本书也非常好,讲的是人类底层的一些东西。
最近我也读了很多关于模型公司的书,比如《Empire of AI》,讲几家美国模型公司的故事,也挺有意思。
卫诗婕
有什么 take 可以和大家分享吗?
王启斌
OpenAI 和 DeepMind 的故事很有意思。为什么我刚才反复讲,AI 领域会有很多生态和不同路径?因为创始人的基因,真的会决定公司的路径。
OpenAI 和 DeepMind 的不同在于,DeepMind 的 Demis Hassabis 很有意思。他当时说,公司会拿很多诺贝尔奖,但 nobody believed in him。
实际上,他在 AlphaGo 上持续投入资源,做出了非常惊艳的世界级产品。但换个角度,他也 miss 掉了大语言模型。
OpenAI 成立时的基因,是希望做一件和安全相关的事情,最初是非营利组织。但后来有一部分人离开,创立了 Anthropic。
大家会看到,每家公司从 vision 到 mission,再到产品,路径都非常不同。
在人类伟大的 AI 史诗中,有各种各样的活法。创始人自己的信念和经历,会让他们在面对挑战和压力时做出不同选择,最后呈现出不同路径和不同结果。
卫诗婕
你说的是 Demis Hassabis 的传记,也就是《谷歌 AI 之脑》?
王启斌
对。
卫诗婕
上个月我也采访了这本书的作者。我的关注点可能和你们有一点不同。
在这两家公司发展的故事中,我看到了很多所谓天才身上凡人的部分,包括愤怒、嫉妒心等。
王启斌
我强烈推荐你读《金钱心理学》和《Same as Ever》。这两本书是我过去两三年里最喜欢的书。
我也读了很多心理学书籍,你会看到里面对人的底层人性有非常有意思的描述。
卫诗婕
你有看到天才身上普通人的一面吗?我们说人性的那一面。
王启斌
第 1,我不是天才,很坦诚地说。
但我有一定的学习能力,持续学习了至少 10 年。我觉得自己有一些智慧,对技术也有足够的理解能力。
但作为一个创始人,我更多的是把自己看成一个六边形战士。我有自己的短板,所以要建立团队,把事情做成。
卫诗婕
你很喜欢看心理学书。在一个如此火热、金钱如此密集的行业,人性的变化处处会发生。如果你发现了这些,你怎么应对、处理并和它共生?
王启斌
作为一个创始人,首先要自信。
我在外企待了这么多年,特别不喜欢作为公司一号位之后,有人开始服侍我,甚至帮我买饭。我觉得这件事很可怕。
我反复和大家强调,公司是透明的。每个人都要思考,自己能不能为公司做出贡献。
卫诗婕
现在灵初有多少人?
王启斌
现在已经超过 160 人,其中北大联合实验室有 40 人。这个规模在行业里算是中等公司。
我知道现在有些公司基本上有三四百人,但人数从来不是我关注的第 1 要素。
我们反复要回答的问题是,在这样一个从硬件、数据到模型异步开发的复杂系统中,什么样的组织能够最好地完成从 development 到 productize。
卫诗婕
我知道你非常认真地研究过 OpenAI 的成长发展史,也读了 Demis Hassabis 的传记。
如果现在有一个能力,让你的组织形态完全和某一个阶段的 OpenAI 或 DeepMind 对齐,你会选择哪一年、什么时候的哪一家公司?
王启斌
这两家公司都没有回答复杂硬件耦合的问题。
复杂硬件耦合做得最好的是特斯拉,更早之前是苹果。
如果纯粹从模型角度看,我个人还是希望 OpenAI 在 2020 年到 2022 年上半年那段时间的状态。大家在 2022 年 10 月看到 ChatGPT,但更早之前,从 GPT-2 到 GPT-3.5 之间的这段路非常关键。
那是浮在水下、最关键的一段时期,是智能涌现的前夜。
卫诗婕
最后一个问题。你刚才聊到,你在华盛顿读的是钱穆先生的书。为什么喜欢读历史?当时有什么收获吗?
王启斌
那纯粹是一种个人喜爱。
我对历史有偏好,尤其喜欢钱穆、吕思勉这样的学者。到海外之后,我也对海外汉学家写的书很感兴趣,包括《叫魂》。
过去很长时间,我会反复阅读自己最喜欢的公司的历史。
钱穆先生和我们今天聊到的陆奇一样,我认为史学家的文笔也很重要。过去这些年重读历史,很多人大名鼎鼎,但我最喜欢的还是谭伯牛的《战天京》。野史派的写法确实让人读得酣畅淋漓,很有特色。
我在那一代人身上,读到了历史视野和优美文笔,更底层的,是那一代知识分子身上深深的民族自豪感。
很有意思的是,钱穆先生身处五四运动这样一个西化过程。大家在喊民主、喊科学时,他依然在讲,我们要仔细审视自己的历史。我觉得这很有价值。
当然,在那个历史交汇口,最主要的历史旋律就是民主和科学。钱穆先生依然用温润如玉的方式,写出了很多很好的东西。
我个人坚信,这一波 AI 浪潮会是未来大概 50 年里最重要的一次范式变化。
只是促成这次范式变化的暗流涌动,很多因素是我们非常不熟悉的。我们会感到陌生和不适应,但我觉得在这股浪潮中,像冲浪一样去参与,可能是一种很好的方式。