陈哲
NVIDIA Cosmos 3 是这一季度世界模型的一个标杆,因为它算是市场上第一个提出全开源 Omni Model 的产品。更底层的问题是,我们到底有什么理由说明,很多年以后,所谓具身智能的模型不是由 Anthropic、OpenAI 或 Google 这样的通用模型大厂来提供的?
如果 Omni Model 这条路线最终被证明是有效和有用的,那么机器人的空间理解和动作预测,是不是可以被融合到一个更大的通用模型里去?
程曼祺
这期是《晚点聊》季报系列的第二期,我继续邀请 Alpha East 的创始合伙人陈哲 Peter,和我们分享最新的具身智能动态与行业趋势总结。
最近有意思的一件事,是关于这个领域的称呼正在悄然变化。更多人开始使用“物理 AI”这个词,世界模型也继续风头强劲,这正是我们第一季度讨论的 Top 5 主题之一。本期季报依然按照第二季度 Top 5 的进展和事件展开,包括人形机器人马拉松、Figure 的物流分拣直播、灵巧手和灵巧操作的进展、NVIDIA 的世界模型 Cosmos 3,以及世界模型创投热。最后一点,是全球领先的具身模型进展,包括 Generalist 的 G1 和 Physical Intelligence 的 π0.7。
今天这一期依然邀请 Alpha East 的创始合伙人陈哲 Peter 来做客。上一季度的季报之后,评论区有很多留言,希望 Peter 能常驻和返场,之后我们也会继续这个系列。Peter,你可以和听友简单打个招呼。
陈哲
大家好,很高兴回来。
程曼祺
1. Five Breakthroughs Define The Quarter
那我们还是总结一下这一季度最重要的 Top 5 进展,里面既有一些行业事件,也有一些技术成果。Peter,你觉得第二季度具身智能领域,或者说现在大家也喜欢用的“物理 AI”领域,最重要的 5 件事是什么?
陈哲
我觉得 Q2 比较明显的是世界模型和灵巧手取得了一些显著突破,同时人形机器人第一次大规模走进了普通人的视野。
总结 Q2 具身智能 Top 5 的进展,我个人会这么排序。第一件事情,是北京亦庄人形机器人马拉松比赛,有 100 多个人形机器人参加了全程比赛。最终取得马拉松冠军的是手机厂商荣耀的机器人事业部。这件事情传达出,大厂可以把人形机器人做好,并且在未来一段时间内可能会成为整个市场非常重要的一股力量。
第二件事情,是 Figure 连续几天直播人形机器人做包裹分拣的展示。这算是人形机器人在工业场景的价值第一次向全球大众进行普及和教育的过程。
第三件事情,是灵巧手和灵巧操作取得了爆发式的进展。尤其是在今年的 ICRA 上,以五G为代表的公司发布了新一代高自由度灵巧手,多家具身智能创业公司也用高自由度灵巧手做出了精细操作的基础模型,让灵巧手成为下一个竞争战场。
第四件事情,是 6 月 1 日 NVIDIA 发布了最新的 Cosmos 3 世界模型。这让世界模型从一个概念真正变成了一个产品和范式的标杆,也成为这个季度创业最火的风口。
最后一件给我留下深刻印象的事情,是 VLA 这条路线的进一步迭代。包括 Physical Intelligence 推出的 π0.7、Generalist 推出的 G1,都是让 VLA 的能力和叙事得到进一步延展,也开始出现与世界模型融合的迹象。
程曼祺
在展开聊这 5 个进展之前,正好可以先回顾一下上个季度的结尾。我们当时讨论了对未来的一些展望,你列了这个季度或者更长期可能出现的一些现象。
第一点,你当时提到要看世界模型能否拿出超出 VLA 的进展。首先可以快速回答一下:你觉得这一季度算实现了吗?
陈哲
上个季度当我们提到世界模型的时候,它还是一个在研究和概念上非常有创新的思路,或者说,我们见到了一些实验室级的早期样品。当时我们展开聊的,其实是世界动作模型这样一个世界模型大范畴里的分类。
比如说,当时提到的 NVIDIA DreamDojo,实际上是 NVIDIA GEAR Lab 内部一个规模比较小的实验室作品,当时使用的视频模型还是开源的 Wan。但到了 6 月,NVIDIA 发布的 Cosmos 3,实际上是一个更加产品级、也是更加大规模预训练的模型。
我认为,它实际上把世界模型这个概念从实验室拉到了工业级,也就是可以被调用、可以被部署的状态。
程曼祺
其实从它发布也能看出来,它一次发布了 3 个版本,有 Super、Nano,还有 Edge,针对不同的部署环境。这个我们后面可以展开。
回到刚才的问题,你觉得世界模型拿出了超出 VLA 的进展吗?
陈哲
我觉得经典 VLA 模型架构的优势和劣势其实已经比较明显了。世界模型的长处是对环境进行预测和建模。实际上,以 Cosmos 3 为代表,我们看到了统一架构的世界模型可能给 VLA 能力带来的潜在提升,也看到了领先的 VLA 模型正在用不同的方法,把世界模型的能力连接或者缝合进自己的体系里。
所以,与其说世界模型颠覆了 VLA,或者超越了 VLA,不如说世界模型给现有的 SOTA 模型带来了一种新的能力和思路。
程曼祺
你当时还期待另外两件事,也觉得它们大概率会发生:灵巧手、灵巧操作的更多成果,以及第二届马拉松比赛会让大家的观感,从之前的噱头和搞笑走向更加严肃的竞争。
2. Big Tech Wins The Marathon
回到 Top 5,第一件事就是我们上一次季报录制不久之后,4 月 9 日在北京举行的人形机器人马拉松。前面你也提到,这一次前三名都是荣耀机器人事业部的闪电机器人,冠军、亚军、季军都是同一个型号。
首先想问一下,这件事会让你或者其他从业者感到有点意外吗?
陈哲
亦庄马拉松比赛当天我也去了现场。这场比赛开始之前,其实夺冠的三大热门就是宇树、北京人形机器人创新中心和荣耀,所以市场对荣耀机器人的实力是有所预见的。
为什么在比赛开始之前,业界就认为宇树、北人和荣耀是热门?因为去年北人的天工机器人就是上一届冠军。作为卫冕冠军,他们为了这一年的比赛也做了很多准备。
宇树去年没有官方参赛,今年是第一次正式参加比赛。作为目前人形机器人运动控制的全球标杆,大家对于宇树的性能和表现都有非常高的期待。宇树赛前也发布过一些测试视频,展现了很强的实力,在测试场中跑出了 10 公里每小时的成绩。
荣耀机器人事业部大概在两年前开始成立,团队接近 100 到 200 人,并且从行业里招揽了一批在人形机器人领域很有经验的工程师和行业专家。所以,他们为了这场比赛投入的研发成本相当高,可能从量级上看显著高于另外两家公司。
程曼祺
这笔钱用来做了什么?能够让它定制比赛需要的电机,并且设计一套非常精密的液冷机构吗?
陈哲
对。比赛现场遇到一个非常明显的情况,我们在直播视频里也可以看到,其他公司的机身在长时间高速跑动时会出现电机过热,不得不休息。
荣耀设计了一套更好的液冷机制,让整个比赛过程中电机温度都能控制在比较低的水平。这是让它的闪电机器人能够在整场马拉松里保持较高速度和一致性的一个重要原因。
程曼祺
荣耀夺冠,其实有一个我觉得和未来行业走向相关的问题。有人认为,今年对于那些长于本体的公司来说,比较重要的一道坎,就是能不能 IPO,上市到一个资源相对安全和充裕的状态。
如果做不到,接下来一年,比如 2027 年,像荣耀这种资源比较多的大型终端厂商,包括手机和汽车终端厂商,它们的机器人本体可能就会进入市场。而且这些公司在大规模制造、可靠性和一致性方面都更有经验。你怎么看这个想法?
陈哲
我觉得这次马拉松比赛证明了,一个拥有高端制造经验和很强组织能力的团队,在足够的资源和人才密度下,可以快速拿出非常有竞争力的人形机器人产品。
程曼祺
这比较侧重硬件产品,对吧?
陈哲
对。但从运动控制、导航等其他能力和算法来讲,大厂的水位也不差。至少对于单纯追求性能的马拉松比赛而言,荣耀的能力是不差的。
我觉得这件事隐含的含义是,拥有荣耀这样组织能力、人才能力和资金能力的大厂,在中国还有很多。像小米、小鹏、理想等电动车厂商、手机厂商,也已经开始严肃投入人形机器人这场游戏。
所以我认为,人形机器人作为一个高端制造业,加上复杂算法和复杂软件系统的系统工程,正在从单一技术创业公司的视角,演变成系统性工程、系统性作战能力的竞争。
荣耀这次在马拉松比赛里的成功,其实是在预示未来这个市场可能会形成怎样的竞争格局。
程曼祺
我还有一个赛制方面的小问题。因为冠军、亚军、季军都是荣耀的机器人,所以今年是不是一个机器人厂商可以派很多机器人参赛?
陈哲
是的。这也是我说的,荣耀相比另外两个竞争对手,在参赛资源上非常宽裕。北人和宇树都只派了 1 个,如果我没有记错,其他公司应该派了两三个队伍,但荣耀有 10 支队伍参赛。
程曼祺
这没有上限吗?不约束一下吗?
陈哲
比赛首先分为遥控和自主导航两个类别,在两个赛制里又各有几支队伍参加。按照当时的赛事规则,因为荣耀有足够多的资源,也带了足够多的机型参加两项比赛,所以在两项比赛里都取得了冠军。
程曼祺
也可以讲讲具体成绩的变化。2025 年那次冠军是天工,也就是北人的团队。当时半马用了 2 小时 40 分钟跑完,第二名松延动力已经差了很多,用了 3 小时 37 分钟,差了将近 1 个小时。
这一次在自主导航类别里,冠军、亚军、季军,荣耀的 3 个机器人,成绩都在 50 分钟左右,而且咬得很紧。上一次都是遥控,这一次是自主导航。你怎么评价这个进步速度?
陈哲
首先,我认为这个进步速度非常快。在 1 年左右的时间里,成绩提高了 3 倍多。在这么长的距离、多个机器人同时参赛的前提下,还能实现相当高程度的可靠性和一致性。
相比去年很多机型还非常磕磕绊绊,今年已经能够比较顺利地完成全程比赛。我们看到,机器人的硬件、控制和自主导航层面都有非常快的进步。
另外一点是,如果大家严肃地去优化这个问题,投入相应资源,很多问题在今天的技术架构下是可以解决的。之前可能没有人对人形机器人的 locomotion 性能极限提出要求,所以我们不会为了马拉松这种长达一个多小时、比拼最高速度的环境,去进行完整的硬件和系统优化。
程曼祺
但马拉松这种形式确实创造了一个需求,只是这个需求不是市场化需求。这也是大家对这类比赛、或者表演性质展示的长期疑问:它有什么用?
我把它优化得特别厉害,然后呢?我认为马拉松作为一种极限运动性能测试,本质上是人形机器人技术的练兵场,是一个 benchmark,可以这么说吗?
陈哲
是的,就像 F1 赛车从来不是为了卖车,而是不同汽车公司展示它们最新技术,以及在突破技术边界时可以实现的能力和尝试。很多技术会逐渐引入量产车或者量产产品。
一个人形机器人想顺利完成 20 多公里的半马比赛,需要有很好的全身运动控制能力,能够处理应急场景和各种地面不规则障碍物,同时还需要长时间无故障运行,并解决供电、散热以及一系列系统层面的问题。
实际上,马拉松创造了一种极端测试环境。当我们能够熟练了解人形机器人各种能力的边界时,在量产过程中就有大量系统设计经验可以利用。
程曼祺
3. Logistics Proves The Humanoid Case
接下来我们讨论你说的第二个进展,Figure AI 的直播展示。它也是一个展示,但和马拉松不一样,它是在真实物流产线上。
具体可以先介绍一下这个直播吗?
陈哲
这场直播从 5 月 13 日开始,有 3 台 Figure AI 机器人连续直播了 100 多个小时。
它们做的分拣任务,具体来说就是站在流水线旁边,包裹每来一个,就把它翻一个面,把标签翻到正面。大家可以看我 show notes 里贴的图片和视频链接。
这 100 多个小时一共分拣了 13 万个包裹,差不多 3 秒钟一个。中间也有和真人的对比,真人也在做类似的工作,有一些节拍和成功率上的比较。
程曼祺
你把它列进 Top 5,原因是什么?
陈哲
Figure 这次做的包裹拣选工作,无论从观赏效果还是实际工业价值上,都算是一次从 0 到 1 的突破。
很长时间以来,我们都在讨论人形机器人到底可以做什么工作、在什么场景下可以有效替代人。我觉得物流包裹分拣本身就是非常合适的场景,需要一定的泛化性和通用操作能力。而且这项工作是连续、长时间的,非常不适合人类长时间工作。
Figure 是全世界第一家公司把这样的场景通过直播方式展示给全球大众,我觉得示范意义非常明显。
程曼祺
我看的直播片段里,机器人其实没有移动,都是站在相对固定的位置。但它使用的是完整人形,带双足和双臂。你觉得这是一种冗余吗?它其实只需要操作能力。
陈哲
我们可以展开讲一下这个场景。在快递包裹分拣过程中,包裹会通过传送带快速投递过来。的确,在绝大部分情况下,我们只需要用双手完成拿起或者翻面这样的动作,这也是 Figure 把机器人固定在那里的原因。
但现实中会有很多意外情况。比如传送带速度过快,物体过轻,或者物体是球形、容易滑动,它可能掉出来。一旦包裹滑出来或者掉到地上,机器人就需要处理。
我们在直播中也看到过一两个片段,物体从台面滑落到地面。当各种意外情况出现时,真人知道应该怎么处理这些 corner case。
程曼祺
但在这次直播里,机器人还没有做到,对吧?
陈哲
目前还没有做到。但我想说明的是,为什么这个场景需要一个人形机器人,或者说最好由人形机器人来做。因为当这种意外真正出现时,只有人形机器人加上我们今天的具身模型,才有可能解决这些无法穷尽的长尾问题。
程曼祺
这也回到另一个问题。有些朋友可能会关注,是不是四五年前就有机器视觉加工业机械臂的公司,试图解决同样的问题?
陈哲
中国邮政四五年前就在陆续和很多中国机器人公司合作,采用的就是你说的这种方案。但这个具体问题之前一直没有解决,所以以前也更多是 demo,没有真正工业落地。
传统机械臂的方案,是运动控制加深度学习图像识别,再加上工业机械臂。用这种方法,其实很难把问题解决好。
我们要解决的问题是:当一个快递包裹被快速运过来时,希望把有二维码或者条形码的一面快速翻出来并扫描。快递包裹往往是软体的,贴在上面的二维码很容易被遮挡,也会产生各种形变。
如果是人在操作,他会用双手进行灵巧操作,把二维码翻面、展平。这两个动作,在四五年前的技术栈下基本是无解的。
程曼祺
那它对末端夹具的灵巧程度要求也挺高。
陈哲
对。这就是为什么我们看到,无论是 Figure 还是星动纪元的展示,都用到了灵巧手。
传统方案基本上还在用吸盘,甚至都没有用夹爪,因为在当时的技术条件下,吸盘是更通用的解决方案。但你基本没有见过吸盘方案进行双手操作,它只能做简单的 pick and place。
程曼祺
那是不是也存在场景难度的区别?比如有些物流场景里的包裹标准化程度更高,柔性包裹比较少,都是刚性的纸盒。
陈哲
当然。包括我之前投资的海柔,以及已经上市的极智嘉,这些仓储物流自动化领域的机器人公司,实际上都在解决标准化物流场景。
但为什么到今天物流仍然是人形机器人非常大、非常有价值的场景?因为在标准化包裹、标准化纸箱之外,还有大量非标包裹和拣选需求没有得到解决。
比如电商仓就是比较典型的场景。有些电商仓商品类型非常多样,柔性很强,既有拣货和打包需求,也有快递分拣需求。
Figure 和星动纪元选择这个场景非常聪明,因为这是一个传统技术,以及非人形、非双臂加灵巧手的方案,很难流畅解决的问题。
就像我们之前看过 π0 和 Dyna 做叠衣服的 demo,deformable material,也就是可形变材料的操作,非常适合今天的具身模型解决。比如纺织物、塑料袋等,因为你没法用一个简单的固体模型去建模它的空间几何和操作点,必须要有一定泛化能力、理解能力和适应能力的模型,才能做这种灵巧操作。
程曼祺
回到 Figure AI 这次直播,还有一个争议。直播中出现了一些片段,人形机器人有扶头的动作,有人就说:“这是不是遥操作?”
Figure AI 官方说,这次直播使用的是 Helix 02 模型自主完成的。
陈哲
我觉得遥操作根本不是这个问题的争议点。所有人形机器人在真正进入部署场景之前,都会经过长时间的遥操作,用来收集数据和纠正动作。
哪怕其中有相当一部分时间需要人类介入和干预,我觉得也不能削弱这件事情本身的意义。
程曼祺
你说到这个,我想到一件事。未来如果它真的进入工业长期部署状态,可能会有点类似自动驾驶:后台有一个真人,同时管理数台机器人,因为中间可能会出现需要人接管的情况。
陈哲
远程接管对于 robotaxi 系统来说,已经是市场上的 norm。我们看 Waymo 和国内其他 robotaxi 公司时,都会衡量它们的接管效率,也就是一个人可以盯多少台车。
我认为,对于一个全自主运行的人形机器人来说,也一定会是这样。
程曼祺
但这又涉及另一个问题。在工业、物流和生产场景里,可以有一个人在后台盯着。如果真的进入家庭场景,就会有隐私问题。那是不是对机器人的全自主能力要求更高?
陈哲
可以这么说。这也是为什么人形机器人真正进入家庭场景的难度,从隐私和数据分布角度看,都会比单纯的工业场景更大。
这也是为什么我认为 Figure 找到的物流分拣场景非常好。回看历史上真正成功的 B2B 机器人,基本都部署在有大规模需求、足够高吞吐率,以及作业环境和作业需求相对一致的场景。
之前提到的极智嘉、海柔、TVS Robotics 等成功的 B2B 机器人公司,其实都在仓储自动化领域。
我们也看到一些人形机器人公司,想在工业场景里做落地和示范。但仔细看会发现,有些工业场景里的人形机器人,实际上在做专用机器人、专用机械臂已经可以做的事情,本质上是精准上下料和工具定位操作。
而 Figure 展示的这个场景,在机器视觉加工业机械臂的时代并没有得到很好的解决。
程曼祺
去年和今年,宇树以及其他机器人公司两次登上春晚,让中国大众对人形机器人有了更多认知,也掀起了热潮。你觉得 Figure AI 这次直播在海外出圈了吗?它有向大众普及的作用吗?
陈哲
我觉得在 Twitter 上的反响还是很高的。
同期发生的一件事也很有意思。几天前,美国达人秀上出现了一个表演,来自四川成都的舞者吴雨霏和 8 台宇树 G1 人形机器人进行现场舞蹈表演,获得评委和观众热烈响应,并全票晋级。
这个视频发布后,也掀起了全网热烈讨论。实际上,它和 Figure 的展示一样,都是让美国普通观众通过非常直观的方式,看到人形机器人开始进入工业和商业场景。
之前很多人在 YouTube、Twitter 上看过中国春晚的机器人表演,但也有人怀疑那是不是 AI 生成的,或者是不是录制了很多遍,而不是现场直播。
程曼祺
回到国内,刚才也提到星动纪元在物流上宣布了新的合作,和中国邮政。其实他们去年 11 月就发布过邮政包裹分拣 demo。
你觉得国内这样的进展,离真正落地还有多远?
陈哲
从技术成熟度来讲,已经到了相当成熟的阶段。
我获得的信息是,星动纪元在快递分拣场景里,不仅在中国邮政,也在顺丰做了长时间的测试和训练。他们已经能够实现人形机器人的全自主分包、翻面、扫描等一系列工序。
这也是中国公司在人形机器人物流、工业场景落地方面,实际进展并不亚于美国公司的一个很好体现。
程曼祺
这种场景一旦被释放出来,场景方有需求,是不是会有很多公司去尝试?除了星动纪元已经宣布的合作,你知道还有哪些公司在物流上投入比较多吗?
陈哲
具体有哪些公司会选择这个场景,我不确定。但我知道,这一定是一个好的 PMF,是一个适合双臂人形机器人、适合具备一定泛化和智能能力的具身模型的场景,也需要灵巧手配合。
拥有这些综合能力的团队一定不少。
程曼祺
你以前投过的海柔,以及海 X Y Z 等更早成立的公司,在物流场景深耕了很久。你觉得它们可以往这个方向拓展吗?
陈哲
当然可以。这其实也回到了 To B 科技公司的一个底层问题:很少有技术本身具有垄断性,更关键的是,你的产品或系统要嵌入一个更大的运营体系。
在这个案例里,就是快递或者仓库的物流自动化。你对行业有哪些认知和经验,以及和客户系统的耦合程度,都会变成 To B 技术公司非常重要的门槛和壁垒。
所以我认为,在上一个范式里已经取得一定成功的 To B 机器人公司,都有机会把人形机器人和具身智能大脑的能力,应用到一些尚未被解决的场景里。
程曼祺
上一批公司现在有一个劣势,是不是融资上会差一些?因为它们好像没有那么强的新噱头去融资,但其实已经有一定体量的收入。
陈哲
上一波 To B 机器人公司基本已经进入 IPO 或 Pre-IPO 阶段。虽然它们在一级市场讲“具身”的概念时,大家可能觉得它是家老公司,但真正 IPO 之后,它能获得的资源和能力,有可能远远大于今天一级市场的公司。
比如之前做送餐机器人的普渡,现在已经是商业机器人领域非常头部的一家公司。还有擎朗、海柔,它们在仓储自动化里,已经通过移动机器人解决了很多可以被自动化的场景。
但仓库里仍然有大量员工,物业里也仍然有大量清洁工和物业人员。对于那些简单自动化还没有覆盖的场景,这些 To B 机器人公司都有很好的延展机会。
程曼祺
4. Whole Body Control Rewrites Data
关于整个人形机器人的进展,我们上次还聊到一个细分趋势,就是把 locomotion,也就是运动控制能力,和 manipulation,也就是精细操作结合起来,做全身运动控制。
前面也讲到了,包裹分拣在一些 corner case 下需要全身控制。我自己观察到一个变化:有新的公司专门做这个方向,比如李宏洋老师做的原力灵机。
陈哲
过去两三年,具身智能市场主要关注操作智能。之前说到机器人的 locomotion 能力,也就是运动能力时,我们可能会自然认为它是“小脑”的能力,和大脑的认知决策、操作能力没有直接关系。
但随着 whole-body manipulation 技术逐渐成熟,我们现在发现,有机会用一个更统一的架构,同时训练移动和操作能力。
在这个前提下,真正拥有很强运动控制能力的团队,其价值会被放大。
这个季度我们不仅看到了很多新创业公司出现,也看到了数据采集方面的明显趋势:越来越多公司开始收集全身运动控制数据。
程曼祺
全身运动控制数据,和之前大家采集的数据有什么区别?
陈哲
我可以讲一下数据范式的演进。我们知道,具身智能整体的瓶颈其实就是数据。每个周期模型范式的迭代,本质上都是数据范式的变化。通过看数据公司在做什么,也可以提前预判这个行业未来会往哪里走。
回到两年前,当时最火的方向是 ALOHA,本质上是一种真机遥操作的数据采集方式。
程曼祺
ALOHA 是一种轻型机械臂,对吗?
陈哲
对。经典的 ALOHA 方案是用真机和轻型双臂做采集,实际上涉及 4 个机械臂:人操作其中 2 个机械臂,直接控制另外 2 个机械臂。
因为人直接操作的机械臂和被控制的机械臂构型完全一样,所以它们是同构的。遥控手臂上的所有动作,都可以被另一个手臂克隆复制。这是大约两年前数据采集的主要方案。
程曼祺
这个方案是当时斯坦福的 Mobile ALOHA,另一个联合创始人 Tony Zhao 提出来的吗?
陈哲
对,Tony Zhao 和子鹏在 2023 年发表了相关工作。
到了去年左右,出现了 UMI 的方案,也就是用人手持一个两指夹爪,进行无本体数据采集。它的好处是成本更低,不需要真机。数据采集人员拿着两个假夹爪,就可以在很多真实场景里进行采集。
去年年底,大家也开始引入 egocentric,也就是第一视角视频。通常会佩戴头环或者头戴式摄像头,收集大量第一视角的操作视频。
这个方案最大的好处是多样性暴涨,可以应用到非常广泛的场景里,而且人操作任务时受到的干扰尽量少。
程曼祺
Egocentric 视频需要配合手套吗?
陈哲
不一定。它的核心特点是第一视角视频。在这个基础上,可以是 egocentric 视频加两个 UMI 夹爪,也可以是 egocentric 视频加数据采集用的灵巧手手套,也可以完全空手。
所以,它的数量和多样性都会多很多。
到了去年年底,随着 NVIDIA 的 SOMA 全身动捕工作出现,我们看到越来越多团队可以通过动捕的方式,为人形机器人做大范围数据采集,也可以把人的各种动作、舞蹈更快迁移到人形机身上。
这也是为什么今年出现了更多想做全身动捕,以及基于全身动捕开展 whole-body manipulation 的尝试。
程曼祺
NVIDIA 做的全身动捕方案 Sonic,和以前电影、纪录片里展示的特效动捕有什么区别?那种通常会在人身上打很多点。
陈哲
本质上,你会有一些骨骼点,可能还有外部摄像头,然后把这些骨骼点映射到一个人形机身上。关键是如何做 retarget。
SOMA 是一个开源技术栈,因为它做得特别好、也很简单,所以大家可以很快迁移上去。
这里面很大的原因,也是因为宇树的硬件做得好。宇树不只是硬件做得好,在开源市场里也有很多人围绕宇树的机器人做相应参数优化。
所以,当我们捕捉到一个人的运动骨骼信息时,这个人的运动信息可以很快迁移到宇树人形机器人上。
程曼祺
所以算法上和 NVIDIA 开源的 Sonic 成果相关,硬件上则是宇树的本体更加成熟了。今年大家才更多地进行全身运动控制探索。
陈哲
对。从研究员角度看,他们一定想做更新、更有探索性、更终极的方案。
所以我们不仅看到很多以 whole-body manipulation 为目的的全身数据、全身动捕方案,也看到很多公司开始想办法采集灵巧手数据,无论通过手套、外骨骼还是其他方法。
本质上,我们今天开始采集的数据,可能会转换成 3 个月、6 个月以后模型方面的突破。
程曼祺
5. Dexterous Hands Become The Battleground
正好进入第三个主题:灵巧手和灵巧操作。你刚刚去维也纳参加了 ICRA,国际机器人与自动化大会。这次 ICRA 上也有很多展示。你可以讲讲第二季度灵巧手有哪些变化,包括在 ICRA 上得到的最新反馈和讨论吗?
陈哲
我觉得这次 ICRA 有非常多中国厂商参展,尤其是在灵巧手领域。
以五G为代表的公司发布了新一代直驱灵巧手,也有其他公司,比如 Sino、临界点,发布了新一代高自由度灵巧手产品,获得了很多关注。
程曼祺
零星巧手和沙帕也去了吗?
陈哲
沙帕没有发布新的灵巧手产品,零星巧手去了。
程曼祺
星尘智能有在 ICRA 上发布灵巧手吗?
陈哲
有。星尘智能也发布了高自由度灵巧手。
程曼祺
在这种本体和智能都做的公司里,它们会自己做灵巧手。它们和中国邮政的合作用的也是自己的灵巧手,叫 X-Hand,对吧?应该是一个中自由度的手,但在 ICRA 上发布的是 21 自由度的旗舰高自由度手。
陈哲
对。实际上,在 ICRA 发布灵巧手的公司很多。但我认为在所有公司里,五G发布的二代手获得了显著更多的关注和认可。
今年 ICRA 的情况和 2025 年很像。2025 年给大家留下最大印象的,是 Shadow 发布高自由度灵巧手;这届 ICRA 给大家留下最深印象的,可能就是 Wuji 的二代手。
程曼祺
可以讲讲 Wuji 二代手的基本情况吗?上次节目我们聊到,沙帕的手是 22 个自由度,售价大概 5 万美元,当时很多全球前沿的具身研究室在使用或者等待它的手。
陈哲
五G的二代手也是20个自由度。
程曼祺
有些灵巧手可能标称的自由度比较高,但有些自由度并没有动力,是靠其他关节带动的吗?
陈哲
一般来说,灵巧手的自由度分为主动自由度和被动自由度。有些可能属于被动自由度,虽然标称自由度更高,但那个自由度不能主动控制,只是在被其他关节牵动时跟着运动。
对于高自由度灵巧手来说,在 20 个自由度左右,基本可以实现人类掌内需要的各种操作。这也是一个工程上的 trade-off。
全自由度灵巧手取决于技术方案是直驱还是腱驱,两种方案的工程实现难度不同。对于全自由度直驱灵巧手而言,基本上每个自由度都对应一个电机。
程曼祺
这次 ICRA 上 Wuji 的手受到关注,是因为展示了什么能力?
陈哲
五G和沙帕可能是全球市场上做直驱高自由度灵巧手最领先的两家公司。它们去年发布的一代手在市场上也获得了很好的反响,但有不少工程问题没有解决,比如严重的散热问题。
它们一代手的结构没有反驱能力,也就是说,关节不能自由地反向掰动。这样在强冲击环境下容易损坏,关节对力的响应和控制也不够灵敏。
这次发布的二代手,在没有增加重量的基础上实现了更好的反驱性能,也大幅改善了散热问题。所以现场有很多观众主动上手尝试,感受这只手的灵巧性和反驱性。
对很多研究人员来说,这一点非常有吸引力。
程曼祺
如果把五G的手和沙帕的手并排比较,会发现 五G的手大概只有沙帕一半的体积。从模拟真人手掌大小的角度看,Wuji 的优势很明显。
高自由度灵巧手除了五G、希诺,以及一些腱驱和直驱的混合方案之外,体积都比成年人的手大,可能大 1.5 倍到 2 倍。
这会带来很多问题。很多在人手上能完成的操作,如果通过人类数据学习策略,可能没办法在体积更大的手上实现。
这次它们展示了什么比较炫技的功能吗?研究人员怎么看出它是不是自己需要的东西?
陈哲
主要看手的体积、灵活度、反驱性和机械性能。
这就像我们看宇树机器人的特点一样。大家需要一个好的硬件载体,才能在这个硬件载体上完成大量控制工作。
这也和两家公司的定位差异有关。我们上次讨论过,李帆重新做沙帕,长期可能想做通用具身智能,从灵巧手切入,所以他们在软件和算法方面投入较多,也提出了三层模型架构,会展示组装风车、双手削苹果等动作。
五G则更像你上次提到的,灵巧手领域里的“宇树”或者“英伟达”:成为大量前沿研究的基础设施。
程曼祺
为什么这次 ICRA 上 五G的手获得了比较积极的反响?
陈哲
因为 ICRA 主要是学术会议。过去一两年,我和很多海外研究人员交流后有一个认知:大家完成了以夹爪为核心的 VLA 研究之后,发现硬件限制导致很多更复杂的任务无法完成。
灵巧手不是一个新领域,全球已经发展了三四十年,但直到今天,还没有特别成熟、特别便宜的硬件方案,让全球研究人员可以在这个技术上快速研究和试错。
我觉得 五G今天的定位比较像宇树:专注于把低成本、高可靠、稳定的硬件设备做到足够可靠耐用,让大家可以基于它做大量研究和实验。
这也是为什么过去一两个月,我们看到很多美国和中国的创业公司,都发布了基于五G灵巧手的灵巧操作模型或工作进展。
程曼祺
现在高自由度灵巧手全球市场规模怎么样?
陈哲
首先解释一下灵巧手的市场格局。它分为低自由度手和高自由度手。
低自由度手,无论是第三方公司生产的,比如灵心巧手,还是强脑科技、智源等公司自产的,目前市场规模大概是一年几万只,和人形机器人的数量基本成正比。
程曼祺
你知道目前卖得最多的是谁吗?
陈哲
我觉得零星巧手应该是比较大的,但之前还有英石。因时机器人是做连杆的,出货量也比较大,因为它很早就服务残疾人市场。
低自由度灵巧手市场已经有不少具备出货量的公司,包括英石、零星巧手、强脑、奥翼等中国公司,也包括智源拆分出来的临界点。
低自由度灵巧手目前最大的场景,实际上是配合人形机器人销售,无论是表演场景,还是简单抓取、pick and place 场景。
高自由度灵巧手则以虾爬和五G为代表,主要面向全球灵巧手操作科研市场。这个市场目前出货量还比较小,因为在去年虾爬真正量产之前,市场上几乎没有可以买到的量产高自由度灵巧手。
虽然高自由度灵巧手出货量还比较小,头部公司只有几千只的水平,但因为技术含量高,对算法和数据都有影响力,所以也是大家竞争的焦点。
程曼祺
刚才说的是灵巧手本体的进展。在灵巧操作模型上,也就是偏软件和系统的部分,有什么进展?
陈哲
今年 5 月,Genesis AI 发布了用定制五G灵巧手完成灵巧操作的模型。
程曼祺
可以稍微介绍一下这家公司吗?之前我们没有聊过 Genesis。
陈哲
Genesis AI 成立于 2024 年,最开始做机器人仿真环境,一年多以前开始专注灵巧操作和机器人全栈系统开发。
我认为,他们 5 月发布的工作代表了目前市场上使用高自由度灵巧手进行操作的 SOTA 表现。
他们公开说采集了大约 20 万小时数据。我相信其中相当一部分是异构传感器数据,也有一些可能通过遥操作或数据采集手套获得的灵巧手真机数据。
从 demo 里可以看到,他们用五G灵巧手实现了一些很灵巧的操作,比如旋转魔方、处理食物、烹饪、弹钢琴等。
程曼祺
他们展示的做菜能力,整个步骤还挺长的,有 20 个步骤,从备菜到烹饪完成。你觉得这是什么思路?
陈哲
我觉得灵巧手操作模型今天还处于行业早期阶段。现在很多灵巧手操作,比较像两年前用 ALOHA 进行真机遥操作。
什么意思呢?如果我们有高质量的人类完成某个任务的数据,无论通过动捕手套、外骨骼还是其他方式,只要采集了足够数据,就有较高置信度和可靠性重现这个动作,这就是 behavior cloning,也就是行为克隆。
此前市场上完全没有高自由度灵巧手供给,所以今天很多模型研究公司还处于比较初级的真机数据获取阶段。
之后,随着 egocentric video 技术提升,或者出现更轻便的类似 UMI 的方法,让用户更快捷地采集高保真的手部操作数据,我们有可能训练出更加泛化和通用的灵巧手操作模型。
今天我看到 Genesis 以及很多其他做灵巧手操作的公司,它们的技术范式还比较像两年前用 ALOHA 做行为克隆。
程曼祺
所以它可能换一个任务,甚至环境稍微复杂一点,成功率就会有明显变化。
陈哲
有可能。
如果拿 Generalist 这种在夹爪操作上已经做到比较通用、比较泛化的公司来对比,我认为 Generalist 已经找到了通过 UMI 方法采集几十万小时无本体数据的方法。
但在高自由度灵巧手操作上,目前市场还没有特别清晰的方法获得足够高保真的数据,来驱动灵巧手操作模型。
到底纯 egocentric video 能不能解决?还是像宇树跳舞一样,用很好的 Isaac 仿真解决?或者使用手套、机电手环、外骨骼等动捕设备?我觉得还没有形成特别清晰的共识。
但我们知道,只有数据问题得到充分解决和释放,才有可能训练出非常泛化和通用的灵巧手操作模型。行业趋势正在快速朝这个方向发展。
程曼祺
6. Data Defines The Dexterous Hand Winners
接下来沿着你刚才说的点,聊灵巧手数据的收集问题。数据是 AI 进展的三要素之一。作为这么重要的资产,你觉得最后数据会在哪里?会在第三方公司吗?
很多做灵巧手的公司是第三方公司,相对于直接做完整人形机器人本体的公司,可能会有不同的位置。
这个问题也可以等价于:灵巧操作能力最后会由什么样的公司更快、更好地做出来?是直接做灵巧手硬件的公司,可以软硬一体快速迭代,还是做整个具身大脑,或者大脑和小脑融合统一模型的公司?
陈哲
你的第一个问题是数据由谁提供,第二个问题是智能由谁提供。
因为数据和智能是相关的。对于有些公司来说,如果智能是必争之地,那数据肯定也要自己掌握。
我们观察到,在真机遥操作的 ALOHA 时代和 UMI 的无本体数据采集时代,已经诞生了不少数据采集公司,开始服务各种具身智能大厂或创业公司。
比如简驰就是一家独立公司。
以 UMI 为例,它对执行器硬件的依赖和限制比较低,因为本质上是一个简单的平行夹爪。但对于高自由度灵巧手数据来说,如果你不控制手本身的结构和设计,作为第三方公司采集数据时,可能会受到具体本体形态和结构的限制。
很多自由度和关节特征,并不容易 transfer,也不容易 retarget。
程曼祺
如果我作为第三方数据采集公司,服务 A、B、C 3 个客户,可能不能用一套方案、一套数据服务这 3 家,而是要分别定制。主要是因为今天灵巧手的硬件结构还没有完全收敛。
你要采集灵巧手数据,最简单的问题就是:按照哪一只手的构型、哪一种自由度去采集?
陈哲
对。有些公司是 22 个自由度,有些是 20 个,有些是 21 个,意味着它们在每根手指上的自由度设计和结构都不一样。
程曼祺
所以我刚才说数据在哪里,想的是两种可能:要么灵巧手公司自己做数据采集;要么本体厂商把灵巧手硬件也自研,同时自己采集数据。
你刚才说的是第三种可能:专门做数据采集的公司,手本身不一定自己制造,可能来自客户、数据需求方,或者自己采购设备。
陈哲
这种数据服务商的生态位是存在的。在 LLM 时代,也有独立的数据服务公司。
但大量灵巧手操作数据未来是否仍然由独立数据公司提供,或者这些公司是否需要和灵巧手厂商建立深入耦合和绑定,现在很难一概而论。
程曼祺
我说的两种可能,你更倾向哪一种?是本体厂商有动力自研灵巧手,同时获得数据,还是灵巧手公司从手切入,逐渐做更多数据和软件?
陈哲
逻辑是这样的:灵巧手相关数据高度依赖灵巧手自身的结构和构型、电机选型、传感器选型。
所以,如果你是灵巧手厂商,自己设计一套数据采集设备和标准,是很 make sense 的。第三方公司很难直接把这件事情做好。
程曼祺
那长期来看,灵巧手公司和人形本体公司的关系会是什么样?或者就叫人形公司,因为它们可能也会做大脑,属于大脑和本体一起做的公司。
陈哲
目前看来,人形公司大概率最终会是全栈公司。
程曼祺
如果是全栈公司,大概率硬件本体、大脑和灵巧手都想自己做。核心挑战是,是否还会有广泛、足够大的第三方灵巧手厂商的位置?
陈哲
这是更关键的问题。如果这个位置存在,大量数据很可能由独立灵巧手公司提供;如果这个位置不存在,数据就应该由人形本体厂商提供。
如果看激光雷达,很多厂商的算法并不依赖某一个具体型号或配置,不同激光雷达采集的点云数据,都可以通过一条管线训练进更大的模型,所以激光雷达公司在数据上没有很高话语权。
但灵巧手不一样。它的数据维度和格式,和硬件设计、方案设计有很大关系。今天市场上也没有特别成熟的统一方案,而灵巧手工程复杂度非常高。
马斯克一直说,灵巧手可能占特斯拉整个公司 50% 的工程投入。结果就是,很多公司其实没有能力真正做出 SOTA 灵巧手并集成到自己的本体上。
如果这个情况持续,第三方公司确实可能有更好的位置采集更多数据,服务更多本体厂商。
如果类比自动驾驶,除了蔚小理、特斯拉这类头部公司有全栈能力,仍然有大量公司会采购 NVIDIA 或地平线的方案。NVIDIA 和地平线也会提供完整的自动驾驶方案,包括数据清洗、采集、标注和训练。
所以长期来看,灵巧手和人形本体之间,可能会是一个长期博弈、长期共存的关系。
程曼祺
7. Drive Architectures Split The Market
关于灵巧手,还有一个上次就讨论过、以后也会持续出现的话题,就是腱驱和直驱两种方案的选择。
你提到 ICRA 上还有一家中国公司西诺未来,它们做的是混合方案。Optimus 在 Q2 也有进展,第三代 Gen 3 陆续披露了一些技术细节,包括手部是 22 自由度灵巧手,但依然采用腱驱方案。
陈哲
这次 ICRA 另外一个重要发布,就是西诺未来的 Flex 2 混合方案灵巧手。
西诺未来是一家拥有自研电机和机器人关节核心零部件能力的公司。在这个基础上,它们做出了两代灵巧手方案。
今年 ICRA 发布的是一款比较创新的混合驱动高自由度灵巧手。它的混合方案体现在:大量需要重载的能力,通过前臂里的电机以腱驱方式实现。
程曼祺
重载是什么意思?是握力、抓握力比较大?
陈哲
对。因为电机可以放在前臂,空间更大,能够提供更大的抓握力。掌心内也有微型电机,提供指节上的精细操作能力。
程曼祺
所以指节上是直驱的。
陈哲
对。它称之为混合方案,也就是腱驱加直驱。
其他厂商展示的是从腕部开始的产品,而它的产品从小臂开始。所以从原理上讲,它可能同时拥有腱驱和直驱的优势。
程曼祺
原理上也拥有两种方案的劣势吗?
陈哲
这涉及腱驱的一个更大问题:为什么到今天,我们还没有看到大量高自由度灵巧手采用腱驱方案真正出货?
我觉得西诺的混合方案是在尝试解决纯腱驱方案的一些问题。纯腱驱为了实现高自由度,可能需要很多腱绳穿过狭小的腕部空间,才能实现充分自由度,组装和维修都非常麻烦。
通过混合方案,可以把部分腱绳换成前臂内的电机,只需要更少的腱绳穿过腕部空间,另一些自由度由掌心内的电机实现。
它的双重优势是,抓握力量更大,同时结构没有纯腱驱那么复杂。因为电机可以放在前臂,更大的电机不再受到手掌体积和散热限制。
如果思考人手的真实结构,会发现手的抓握力大量由前臂肌肉实现,但掌心也有小肌肉控制细微动作。
程曼祺
说到这里,我还想到一家叫 Aratio Flow 的公司,就是做肌电的。他们的数据采集是一个闭环手环,套在手上,通过肌电信号采集手部操作数据。
陈哲
用肌电控制灵巧手,或者用肌电捕捉人手数据,并不是新想法。十几年前,加拿大滑铁卢就有一家公司推出过 (音)mile手环,专门做肌电控制。
杭州的强脑科技也有通过肌电控制低自由度灵巧手的尝试。
之所以最近大家更加关注这个问题,是因为随着算法进步,我们在采集大量数据并进行训练、fitting 方面的能力显著提升。
所以大家会好奇,通过新的肌电方法,能不能更高精度地还原手上每个关节的位置、操作以及对外界的反应。
程曼祺
如果混合方案整个带一个前臂,它和下游的全栈人形机器人公司,合作方式会是什么样?
陈哲
对于绝大部分涉及前臂腱驱的方案,最大的问题是需要和本体厂商深度耦合和集成,不能像标准手掌产品那样快速切换。
比如宇树、智源的人形机器人都不带手掌,所以可以快速切换到其他灵巧手产品。但对于需要集成前臂的灵巧手公司来说,商业上更需要和本体厂商做深入集成和定制。
这也是为什么我们看到西诺未来过去一段时间拿到了国内很多大厂的战略投资。
基本上,所有大厂做人形机器人研究时,灵巧手都采用了类似特斯拉的腱驱方案。
程曼祺
我看到理想和京东都投资过它。
陈哲
我和国内很多大厂研究人员聊过。对中国所有大厂来说,选择 follow 特斯拉的腱驱路线,是比较直接的选择。
因为它们本身会控制本体,同时特斯拉还在做这个方向。让大家选择不同方向,对很多工程师来说是巨大风险,他们不愿意承担。
程曼祺
因为他们是大公司,有向上汇报的压力,所以负责人不想承担风险?
陈哲
对。万一特斯拉是对的,你选择了新方向,谁来承担错误责任?这确实是一个很现实的问题。
程曼祺
上次聊的时候,你自己更看好直驱方向。但从大公司的动作和投资来看,很多大厂仍然在做腱驱。
陈哲
对于独立灵巧手公司来说,我觉得做全直驱、且不依赖前臂,可能是唯一或者更好的路线。
如果是需要深度定制前臂的方案,大概率会变成大厂的定制公司,很难独立做成一家标准化产品公司。
程曼祺
如果这家公司在美国生态里,先不考虑美国制造业是否可行,它和大厂深度合作,其实也有一个退出路径:可能被大公司收购。
我不知道在国内是否容易发生。之前智驾行业确实有一些公司被大公司收购,但收购价格都不是很好。
陈哲
关键是它是不是一个价格合适的退出。你到底是因为经营不下去被收购,还是因为发展得非常好被收购,差别很大。
程曼祺
所以这个季度看完灵巧手的进展之后,你对腱驱和直驱的偏好没有变化,还是觉得直驱目前潜力更大?
陈哲
这个判断应该是有所加强。现在灵巧手研究中的最新进展和突破,仍然由全直驱灵巧手实现,无论是 五G还是沙帕。
本质上,谁能够更快提供可靠、稳定、廉价的灵巧手供给,谁就能更快成为行业事实标准,也就是更多算法和软件会围绕你的硬件架构设计。
程曼祺
这两类灵巧手目前看起来下游是分开的。直驱的新公司更多面向研究市场,做前沿灵巧操作模型;腱驱方案,尤其 Optimus 的方案,更像是面向产业方,只是产业方什么时候上量,可能还很久。
陈哲
最底层的原因,还是 Optimus 没有公开放弃腱驱方案。
马斯克是非常相信第一性原理的人。他认为腱驱方向更接近人类生物结构,因此是更好的方向,也给工程团队提出了很高要求,希望实现腱驱灵巧手量产。
但事实是,我们看到它的 Gen 3 手一直在迭代,什么时候可以规模化生产还未知。我们也听到不同声音,说 Optimus 也在尝试替代方案,可能是直驱,也可能是混合方案。
工程方案探索需要时间,大方案调整也需要很长过程。
对于国内绝大部分大厂一线工程师来说,选择 follow 策略,不只是在灵巧手上,在很多其他技术路线、本体算法和构型上,跟随海外大厂也是更保险、更稳妥的方案。
今天灵巧手研究还处于非常早期,我们很难说产业界现在选择的腱驱方案,一定是真正能够量产和规模化的方向。
程曼祺
8. Cosmos 3 Builds The Omni Model
接下来进入世界模型。世界模型和 VLA 都直接涉及智能能力,也就是大家讨论的更偏具身智能模型的部分。
上期我们聊过世界模型之后,可以更明显地看到,世界模型已经成为非常火热的创业风口。国内出现了很多新公司,主要服务具身机器人或者物理 AI 创业公司。有些今年才成立的公司,已经很快成长为估值 10 亿美元的独角兽,创始人也都非常年轻。
你觉得这个方向最重要的进展是 NVIDIA Cosmos 3。可以简单介绍一下它是什么样的成果吗?
陈哲
我认为 Cosmos 3 是这一季度世界模型的标杆,因为它算是市场上第一个提出全开源 Omni Model 的产品。
Omni 指大一统、混合、全能。这个模型可以原生处理不同的输入模态,包括文本、图像、视频、声音和动作,也可以输出这些不同模态。可能这是行业第一次这样实现。
按照 NVIDIA 自己的定义,Cosmos 3 是一个全能 World Model,可以用于不同的预测和生成任务,也可以像普通的 VLM、VAM,或者像 VLA 一样,输出文字、图片,或者机器人的操作。
它在技术上有一个重要突破,叫 MoT,也就是 Mixture of Transformers。它包含两个 Transformer 结构:一个是自回归 Transformer,用来做 reasoning;另一个是 diffusion Transformer,用来做生成。
程曼祺
你和研究人员交流下来,觉得这个新架构的反响怎么样?有没有什么负面或者担忧的声音?
陈哲
从概念上讲,这是一个非常理想的概念。
很长时间以来,语言模型研究和图像、视频生成研究使用的是两套不同架构。后者更多使用扩散模型。
本质上,一个模型更擅长处理离散信号,比如文字 token;另一个模型更擅长处理连续信号,扩散模型更适合处理图像、视频这样的连续序列。
过去很长时间,这两类模型是孤立的。Cosmos 3 使用了很巧妙的分工和统一架构:自回归模型是独立 Transformer,扩散模型也是独立 Transformer,但两者共享 attention 机制,让它们的状态可以相互影响。
这相当于把两种很不一样的模态模型缝合到一起,同时统一理解和生成。
程曼祺
这其实是大家一直想探索和实现的方向。它能实现,是有什么特别之处吗?还是说现在虽然结构上实现了,但效果还没有那么好?
陈哲
刚才说到,它的架构原理是 Mixture of Transformers。相当于不同模态会被两条管线动态调节和处理,这也是为什么模型本身规模比较庞大。
从架构原理上讲,这是非常创新的。
程曼祺
是在 Cosmos 3 上才实现了这种全能统一吗?它和之前的版本有什么区别?
陈哲
其实没有一个独立的 Cosmos 2 这个品牌。Cosmos 最早应该是在 2025 年 CES 发布的,去年和今年初做过迭代,把几个模块更新到了 2.0 版本。
Cosmos 3 是这次新出现的品牌。之前其实是几个独立模型,包括 Predict、Transfer 和 Reason。这次相当于把几个模型缝合进了统一架构。
程曼祺
我以前对 Cosmos 的理解是视频生成模型。
陈哲
对,但 Cosmos 3 不能简单地说是视频生成模型。它包含视频生成模型,也可以直接生成动作。
程曼祺
直接生成动作,理论上就能给机器人用,因为机器人要生成动作轨迹。
陈哲
对。Cosmos 3 之前其实有一个 Cosmos Policy 子模型,是在之前 Cosmos 模型上加一个 action head,让它可以直接输出机器人的操作。
这次则是把它们统一起来。
在 NVIDIA 的 scope 里,它是一个更大的 picture:Cosmos 3 实际上是为 NVIDIA 的芯片和算力平台优化的,同时 NVIDIA 也想推广自己的机器人开发套件。
程曼祺
它也可以用在自动驾驶,对吧?
陈哲
对。因为它是通用世界模型,可以输出不同模态。它之所以是 Omni Model,是因为可以输入所有模态,也可以输出所有模态。
在不同组合下,两个 Transformer 被激活的程度不同。有些模态可能只需要激活自回归 Transformer。比如图片到文本的任务,可能只需要它就够了。
但如果是文本、图片到动作和视频的任务,就需要激活 diffusion model。
从这个思路讲,它开拓了一个很好的 Omni Model 路线。我相信其他大公司,包括中国大厂,之后也会开发类似思路并跟进。
程曼祺
9. World Models Ignite Venture Fervor
从原理上讲,它是一个比较优美、理想的架构。正好也可以从 Cosmos 3 进一步聊近期非常火热的世界模型创业投资风口。
我们把范围缩小到和 robotics 相关的世界模型。即使收缩到这个领域,也有很多东西被叫作世界模型,但可能并不一样。你会怎么分类?
陈哲
世界模型的定义非常多。我参考 NVIDIA 6 月写的一篇世界模型官方综述,其中分成 3 种。
最底层的叫 video world model,代表可能是 Google 的 Veo、阿里的 Wan。它们的底座本质上是视频生成模型:根据条件或者描述生成视频,也就是预测未来状态。
NVIDIA 自己也把 Cosmos 3 放在这个分类里,因为 Cosmos 3 是一个全能模型。
第二类叫 action-conditioned world model。Action-conditioned 指的是,它基于动作,或者说给定动作,在动作条件下预测世界状态。
程曼祺
也就是给定一个动作,预测世界的下一个状态。
陈哲
对。这里的动作具体指物理世界里的动作。
我之前和 DreamDojo 的一位 GEAR Lab 研究员高深远聊过。他描述 DreamDojo 时,我理解它是一个世界模拟器,但这个世界模拟器的输入是动作:你想做什么,以及这个动作会带来什么变化。
世界模型训练过程中,会基于 ground truth,也就是训练原材料里包含的真实物理变化,记录动作对环境产生的影响。
他当时说,action 的类型也可以很多。比如一段文字指令,也可以被视为一种 action,因为它会对环境产生影响。
程曼祺
但在具身领域,更多还是机器人的动作作为 action,对吧?
陈哲
对。一般说 action,是指机器人的动作。但文字也可能是对环境的影响。
从这个角度讲,纯粹以生成视频为目标的 video world model,和 action-conditioned world model 的相似之处,都是有某种 input。区别在于,这个 input 是文本描述,还是物理动作。
比如我向前走、向后走、去拿一个东西,或者改变某个环境。假设把 Genie 也当作 action-conditioned world model,那么人在空间里移动的指令,就是这个 world model 生成内容的 condition。
NVIDIA 分类的第三类是 world action model,也就是 WAM。
程曼祺
这就是现在特别火的方向。
陈哲
核心是通过模型生成机器人的动作,同时它可能也会生成未来的图像或视频。也就是说,它既生成未来世界状态,也生成机器人动作。
所以它更像一个 policy。像 DreamZero、蚂蚁的 LingBot VLA,都属于这样的定义。
在具身领域,我们更关注机器人如何响应和操作,所以 WAM 是目前最受关注的方向,因为它直接用在机器人上,作为一个策略。
程曼祺
但也可以想象,为什么 Cosmos 3 的概念很有意思。你和一些北美实验室做 LLM 的研究人员聊过,他们其实不理解为什么我们会发明 VLA 和 World Model 这两个对立概念。他们认为这是一个东西,最好的模型应该就是 Omni Model,也就是 Cosmos 3 这个方向。
陈哲
对。所以我认为 Cosmos 3 在一定程度上代表了大家对模型终极形态的思考:作为一种智能模型,它应该接收不同模态,也能输出不同模态。
从今天 Cosmos 的对外展示来看,它就是一个模型。只是内部有一套 mixture 机制,共享一些状态和不同 pipeline。但从输入端和输出端看,它就是一个整体模型。
程曼祺
这也回到前面说的,比如 G1 和 π0.7,它们可能都融合了一些 VLA 和世界模型。你觉得它们的叙事也不是谁替代谁的关系?
陈哲
对。回到本质,今天的 VLA 更擅长生成指令和动作;而 World Model 本质上是一个以视频为 backbone 的模型,更擅长预测状态。
如果有巧妙的方式把这两种能力结合起来,从终极性能上肯定更好。
程曼祺
你怎么看现在世界模型的创业和投融资热潮?我感觉转化特别快。DreamDojo 这类成果好像是去年年底出现的,然后很快就有新公司成立,估值和融资额也成长得很快。
我们可以先盘一下,你知道目前有哪些大的世界模型公司吗?不一定要具体到 WAM 这样的方向,就说投资市场上那些自称在做世界模型的公司。
陈哲
最近比较火的,刚才提到的有 Genesis AI、Liberty AI、Manifold、Inverse Matrix、模式星空等。还有一家成立较久的 Figure AI,应该是目前估值最高的公司之一。
我之前和其他投资人聊,4 月初的时候,已经有人整理出 49 家世界模型公司。刚才提到的那些基本都是 2025 年或 2026 年成立的中国公司。
海外公司上季度聊到过,在 GDC 期间宣布融资 4.5 亿美元的 Ronda AI。它之前处于隐身状态。我们聊完没多久,我知道 NVIDIA GEAR Lab DreamDojo 团队的负责人周章也出来创业了。他是韩国人,名字我不一定写对。他在美国成立了一家新公司。
所以海外也有新的公司出来,只是最近几个月的事情。
程曼祺
还有什么补充吗?
陈哲
具体公司很难列全,因为 World Model 是很大的概念,太多公司都可以贴上这个标签。我很难判断每家公司到底是不是在做纯粹的 World Model,或者和 World Model 的相关性有多大。
但我可以说,World Model 为什么是这么大的变化和冲击,本质上还是因为 VLA,也就是 vision-language-action、视觉语言模型加动作序列这条路径,在迭代中遇到了一定性能瓶颈。
通过视频生成路线做机器人 policy,其实早在 2023 年就有工作尝试。比如字节做的 GR-1 和 GR-2,就是 Video Action Model 比较早期的尝试。
但当时 VLA 可以更快给出一个 60 分的答案,典型代表就是 π0 的发布。它本身是开源的,也代表了当时市场的缩短路径,所以很多团队快速跟进。
π0 是 2024 年 10 月发布的。VLA 这条路线抽象来看,本质上是一种行为克隆:把文字和图片描述,与机器人运动信号建立某种联系。
如果人反复示教一个动作,我们一定能建立某种联系,让 VLA 输出类似的机器人关节信号。但这条路线的泛化局限很明显。
视频生成路线可以使用更大量、更海量的数据和 know-how,其中包含大量物理知识。所以这条路线从原理上很有吸引力。
但 2023 年最早尝试时,没有很好的视频生成模型,也没有像 Wan 这样预训练好的开源模型,没有 diffusion policy 去生成连续关节序列,也没有 flow matching 这样的生成方法。
World Action Model 的很多基础 recipe 3 年前就有了,但它的能力要到 2025 年底、2026 年初才逐渐释放。
从我自己来看,为什么会觉得这件事很兴奋?因为今天的 SOTA 视频生成模型,比如可灵、Seedance、Veo 3,已经达到很高水平。它们对物理和常识的理解已经很好,用它们来做机器人预测和策略,理论上可以取得很好的效果。
这一系列要素的出现,是让世界模型在 2026 年突然爆火的原因。
程曼祺
如果说技术进展让你兴奋,是偏开心的心情;但看到这么多公司融这么多钱,作为投资人你是什么心情?
陈哲
本质上,大家在大模型里赚了一些钱。赚到钱的人会把更多钱投进去,没赚到钱的人也会在这一波补票。
程曼祺
赚了钱的人继续投,没赚钱的人补票。
陈哲
对。具身是一个很大的方向,出现新的技术刺激,就会有人投资。
底层有这样的因素,所以估值能在非常短时间内上涨这么多。
但从更长角度看,第一,具身领域无论硬件还是模型,中国公司都有很好的资源和能力,这也是一个长期战略方向。国家在这方面有很多支持和战略投入。对于立志成为世界级公司的创业者来说,这是很好的发展机会。
投资人也看到了这个机会。它到底会不会像当年电动车浪潮一样,出现 100 多家公司分别成立去做电动车,我不知道。但一波大浪肯定会带来大量人才和资金涌入,也反映了这次变化有多剧烈。
程曼祺
10. VLA Models Absorb World Models
最后一个 Top 5 进展,是在当前火热的世界模型趋势下,显得有点过时的 VLA。你提到两个具体进展,都是 4 月初到 4 月中旬出现的:Physical Intelligence 发布 π0.7,Generalist 发布 G1。
陈哲
我觉得给它们贴 VLA 标签可能不是最重要的。提到它们,是因为它们是现有模型公司在这个季度里取得的很有启发性和创新性的突破。
程曼祺
可以分开讲。比如 π0.7,你看到什么启发?
陈哲
首先,Physical Intelligence 是一家非常创新、稳步迭代的公司。从 π0.5、π0.6 到 π0.7,每一版迭代都非常明显。
如果用一句话总结 π0.7 和之前版本最大的区别,我会说,它是在传统 VLA 基础上接了一个轻量级世界模型。这个轻量级世界模型可以预测未来任务的图像,再用预测结果影响生成模型去生成相应动作。
程曼祺
比如我现在手指移动到这个位置,假如我要拿杯子,手指移动到这里时,它可以预测未来几步会是什么样子,生成物体和我之间的位置关系,或者物体的形变?
陈哲
对。它会预测未来一段时间的结果图像,再用那个图像指导动作生成。相当于把一个轻量、带有预测性的未来子目标,反馈给 VLA 的动作生成过程。
程曼祺
这很符合人的直觉。人做很多事情时,大概能想象会发生什么,只是执行得不够精确。
有一类动作尤其明显:比如把纸团扔进有一定距离的垃圾桶,你会先脑补一下轨迹。
陈哲
对。所谓脑补,就是我们判断使用什么样的力量、什么样的角度,可能导致什么结果,然后根据脑补调整角度和力量。
回到 π0.7,我觉得 Physical Intelligence 一直在引领 VLA 研究前沿。上次季报提到,π0.6 提出了一些新的能力,包括类似长时间 agent 规划的能力。
它使用文本记录方法,持续存储当前状态,然后根据之前观测到的状态,规划具体动作。
这些小改进,在每个版本里都非常创新,也非常引领行业。
程曼祺
然后是 Generalist G1。我的体感是,国内从业者对 G1 的讨论度更高,相比其他模型,它引发了更多关注。
陈哲
我觉得它有几点取得了显著突破。
第一,它显著提高了大家觉得比较慢的 VLA 模型执行速度,不再慢悠悠地执行一个任务。
第二,在一些复杂长程任务里,他们宣称实现了非常高的准确率。有几个任务从 60% 多的平均成功率提升到 99%。这个数字的提升反映了模型任务能力的显著跨越。
还有一点大家非常关注:他们自己采集了 50 万小时真实世界交互数据,是一种 UMI type 的无本体数据采集方法,非常高效。
同时,他们用这 50 万小时数据,在没有预训练模型的基础上,自己训练了一个端到端模型。这体现了团队对自己技术路线的高度自信,也说明模型可能有较强的 scaling 能力,可以使用这么多数据。
他们在报告里清晰展示了,在 1 万小时、几万小时到 50 万小时等不同数据规模下,模型泛化性和能力都显著提升。
程曼祺
这其实是在展示 scaling law 在这个领域是否有效。
陈哲
对。按照 Generalist 自己的说法,他们一直宣称找到了 scaling 的钥匙。
程曼祺
你刚才说它没有在 VLM 上微调,展现了团队的自信。这个做法很罕见吗?
陈哲
我觉得在研究界,大家容易出现路径依赖,尤其是某些方法证明有效之后。
典型来说,国内很多模型团队因为 π0 是开源的,会在 π0 基础上做大量后训练和微调,并把它作为 benchmark,证明自己的性能比 π0.5 提高了多少。
这说明 π0 在制定和引领行业标准方面有很大影响力。但另一方面,独立开创新技术方案,投入这么大数据量采集和训练,需要相当大的勇气和决心。
程曼祺
所以,对同为美国公司的 Generalist 和 Physical Intelligence 来说,Generalist 肯定不屑于跟随别人,相互之间也不会 follow 对方。
陈哲
这是我对美国创投生态的一个整体观察。美国的创投和创业环境整体非常奖励创新,很难见到两三个团队讲一模一样的故事。
很多团队都会想方设法在技术和路线上寻找差异化,投资人也会奖励第一个做这件事的人。
美国巨头公司非常多,也非常活跃。巨头本身有大量创新业务和前沿实验室,很多好工作本来就是 Google、Meta、Amazon 等公司做出来的。讨论汽车时,也经常会提到 NVIDIA。
所以在美国做硬科技创业公司,市场惯性和投资人认知都要求你做出非常有差异性、创新性的事情。否则很难获得市场认可、投资认可,也很难被大企业收购。被收购本来就是美国很多硬科技创业公司的正常 exit。
程曼祺
所以我会发现,美国有些公司可能是为了创新而创新。这不只限于具身领域,在很多领域都一样。因为美国大企业自身创新非常有效,也很有竞争力。如果你只是做更便宜或一样的东西,很难在美国市场获得客户认可和产品溢价。
回到 G1 的具体进展。π0.7 是接入轻量级世界模型,Generalist 从目前公开信息看,能看出它对世界模型是什么思路吗?
陈哲
从公开信息看,Generalist 比较排斥把自己定义成 World Model 或 VLA。
Peter Florence 专门写过一篇文章,大意是,他们的做法既不是把动作粘贴到 VOM 上变成 VOA,也不是一个 World Model,而是完全按照物理交互原生数据训练的模型。
这也是为什么他们采集的几十万小时数据,可以直接训练一个 Transformer network,不需要依赖 VLM 或视频生成模型作为 backbone。
这是它自己的方法。因为 Generalist 从未开源,所以外界并不知道具体细节。
但类似思路,其实在 Google 最早的开创性工作 RT-1 里就展示过。RT-2 是 VLA 风潮的起点,但在 RT-2 之前,RT-1 训练的是一个中等规模 Transformer,输入是文字描述、图片和一些动作、关节序列,输出则是根据文字描述生成关节动作。
当时那个模型的 backbone,就是一个独立训练的 Transformer。
程曼祺
正好聊到了 RT-1、RT-2。这个季度 Gemini Robotics 也发布了新的模型,4 月发布的 ER 1.6。但你没有把它排进最重要的 Top 5,你怎么看 Google 或 Gemini Robotics 的成果和影响力?
陈哲
Google 的 General Robotics 是一个很大的部门,推进的研究很多。
最近公开的 ER 1.6,全称是 Embodied Reasoning 1.6。你可以把它理解成一个通用模型,但它不能直接输出机器人的控制或 policy。
程曼祺
所以它不是策略模型,不是直接用在机器人上的。
陈哲
对。它相当于在 VWM 上提供更多空间理解、任务理解和 reasoning 能力,可以通过图片、视频视觉,更好地描述和推理物理环境与条件。
它背后体现的是 Google 做整个具身生态的思路:想做这个领域的 Android。
ER 1.6 发布时也介绍了一些合作方,包括波士顿动力的四足机器人 Spot、Apptronik,以及思灵的人形机器人 AgiOne。看起来 Google 是想做 robotics 的 Android。
程曼祺
你觉得这个思路现在有市场吗?
陈哲
Google 肯定想占据偏大脑、偏 API、偏软件的位置。
我觉得 ER 1.6 的工作说明,它希望发挥语言模型方面的优势,增加高层空间推理和理解,再封装成一种可以被调用、被大家使用的产品。
实际上,如果看 ER 1.6 的报告,它的对比对象是 Gemini Flash 3.0。
程曼祺
它是和通用模型做对比的。
陈哲
对。它就是一个通用模型,只是训练了更多物理环境理解。
你刚才提到的波士顿动力合作,是一个非常典型的工业场景。波士顿动力的 Spot 机器狗,目前出货量应该有几千只,真正用到工业巡检,主要是一些复杂的油气田场景。
机器狗需要上下楼梯,进入复杂地形,在油气设备里主要检查传统阀门和面板仪表盘上的数字,也会检查是否存在异常值。
所以 ER 1.6 实际上是一个通用模型,但增加了空间理解能力。这代表了大厂对这个问题的思路和态度:如果可以用通用模型解决,那么最终可能只需要训练一个 Omni Model,解决所有事情。
程曼祺
那对小公司意味着什么?现在看起来 Google 和很多中小创业公司有不少合作。它合作的几家公司相对来说还是机器人本体和硬件公司,所以双方有天然契合度。
陈哲
更底层的问题是:我们到底有什么理由说明,很多年以后,所谓 embodied AI 的 model 不是由 Anthropic、OpenAI 或 Google 这样的通用模型大厂来提供?
如果 Omni Model 这条路线最终被证明有效和有用,那么机器人的空间理解和动作预测,是不是可以融合进一个更大的通用模型?
程曼祺
这个问题经常被讨论。一个马上想到的反方观点是,这种模型形成过程中需要大量硬件参与,需要硬件收集数据,而很多通用模型公司不做这件事,或者不擅长。
陈哲
今天它们可能确实不擅长,因为还没有针对这个事情进行优化。
但我们也知道,大模型公司花了几十亿、上百亿美元做各种语料和数据标注,只是主要是文本和图片数据。
程曼祺
OpenAI 确实在 5 月底更加正式地官宣了 robotics team。当时 Sam Altman 发了一条 Twitter,提到几个关键词。
一个是寻找顶尖全栈人才,后面列了一堆方向,包括硬件、系统、机器学习等。他们要做对社会有用的机器人。
第二个是场景,短期场景是制造给他们自己使用的 infrastructure,应该指 AI 算力基础设施。长期愿景则很普遍:做一个每个人都可能使用的机器人。
他还提到团队负责人是 Arditia Ramesh,过去一年一直在领导这个团队,团队也逐渐演变成 OpenAI Robotics。这个人的背景我看了一下,他是 DALL·E 的作者,本科毕业就进了 OpenAI,没有读博士,毕业于纽约大学。
陈哲
我知道的情况是,OpenAI Robotics 团队是基于此前做 DALL·E 和 Sora 的团队建立的,或者说,那是它的技术基础。
OpenAI 内部对 Sora 的定位,一直认为它就是一个世界模型。最开始发布时就是这样说的。
程曼祺
而且这个负责人之前带领的团队,在内部名字写的是 World Simulation Research,也就是世界仿真研究。
陈哲
对。所以我觉得 OpenAI Robotics 在这个时间点高调成立,实际上是看到了这一系列技术的拐点和突破。
程曼祺
你觉得它接下来会投入多少?前段时间 Anthropic 的 Claude Code、Claude Cowork 增长很强势,我觉得这给 OpenAI 带来比较大压力。
有一段时间看起来它关闭了 Sora 2,有一种收缩和重新聚焦的趋势。但第二季度又宣布 Robotics 团队正式扩招。它真的会把这件事当作重点吗?
陈哲
我想分享一个观察。今天哪怕是最大的具身智能研究团队,真正涉及的算力和模型规模,相比旗舰视频生成模型,更不用说旗舰语言模型,都是非常小的量级。
比如 Generalist 说自己使用了 50 万小时数据,但关键不是数据量,而是实际使用的算力。
以 Cosmos 3 为例,我认为 Cosmos 3 代表了今天具身智能训练模型投入的最高算力预算,大概是万卡级别。这已经是今天整个具身研究算力的天花板。
但以这个标准看,对于 OpenAI 或 Anthropic 这样的头部 LLM 公司来说,都不算特别大的算力预算。
程曼祺
你的意思是,它不需要把这件事作为特别大的重点,投入就已经比大部分具身团队多了。
陈哲
对。类似的比较是蚂蚁的 LingBot 团队,LingBot VLA 应该也是万卡级别。
程曼祺
我还有一个问题。它现在想做全栈,但机器人研究不能离开硬件。说白了,今天的研究还很早期,脱离硬件,研究成果很难验证,所以一定要和硬件走得近,研究才会高效。
我知道 OpenAI 会在灵巧手上有很大的投入和研究方向。它既然要进入市场,不可能再去做夹爪。你觉得 OpenAI 这个动作接下来会带来什么连锁反应?
陈哲
OpenAI 能够在这个时间点高调重启机器人业务,说明它看到了技术成熟度,以及这些技术和自身核心模型能力的相关性。
我们知道,4 月 OpenAI 其实关闭了 Sora 的消费级产品接口。但 Robotics 的核心成员,有很多就是从 Sora 团队过去的,因为 Sora 一开始的目标就是做世界模型,或者说具备世界模拟能力。
所以我认为 OpenAI 在这个领域的投入,会和我们关注的世界模型路线高度相关。
考虑到它拥有相当大的算力,也能吸引顶级研究员,我很期待它未来一段时间在这个领域拿出行业 SOTA 进展。
程曼祺
11. Capital Markets Test The Industry
最后,我们聊一下前面 Top 5 没有涉及的变化和重要事件,包括资本市场和商业落地。
一个很重要的事情显然是宇树 IPO。上次我们已经讨论过它的招股书、发展历程,以及它在行业里的特殊位置。
第二季度,宇树正式在科创板 IPO 过会,接下来我们很快会看到它登陆科创板。头部公司这一批上市之后,你觉得后面的公司会怎么样?
陈哲
我觉得宇树上市对于具身行业的发展和投资,都是标志性事件。
本质上,它给今天所有头部具身公司制定了估值锚点,其他具身公司都会把它作为估值基准。
通用型机器人一定会有非常大的公司,因为人形机器人本来就是非常通用、非常 general 的产品,所以这里面长出特别大公司的可能性更高。
但人形机器人今天在物理层面仍然有很多限制,比如功率密度、电机密度、电池密度、重量、体积等。
即使人形机器人长期普及之后,也可能分化出服务不同场景的不同人形机器人。可能有小型机器人,服务娱乐、表演甚至科研;也可能有大型机器人,服务重载、搬运或者大 payload、低速 payload 场景。
所以不一定是 winner takes all。
但大脑有可能是这样的。如果模型路线成立,一个超级模型能力显著高于其他模型,这件事在 Anthropic 身上已经看到很强的端倪。它可能不是 winner takes all,但至少会寡头化。
更底层的问题是,大脑作为智能产品,智能可能一定会两极化:要么追求最好的智能,要么追求一个够用的智能。
如果模型又是边际成本很低、可以开源共享的产品,那么长期来看,智能模型大概率会分成高水平开源模型和顶级水平闭源模型。
如果语言模型终局是这样,我认为具身模型很可能也是这样:高水平开源模型、顶级水平闭源模型,中间没有其他模型生存空间。
如果一个闭源模型能力超不过 SOTA 开源模型,它就没有存在价值。
程曼祺
那谁会提供高水平开源模型?是想做生态的 Google、NVIDIA 这样的公司?
陈哲
很可能是。
程曼祺
语言模型现在不就是 Qwen、DeepSeek 这样的公司在提供吗?
陈哲
我们和一些模型公司创业者讨论时,有一个终极问题很难回答。
程曼祺
你说的是大语言模型创业公司的创始人,还是具身模型创业公司的创始人?
陈哲
具身模型,但我觉得是同一个问题。
如果你做一家模型创业公司,怎么回答两个竞争问题?
第一个,如何和最好的开源模型竞争?它大概率由 NVIDIA 这样的公司提供,因为 NVIDIA 的商业模式不依赖模型变现,而是依赖算力变现,所以可以把模型开源。
第二个,如何和寡头化的头部私有模型竞争?这个供给大概率来自 Google、阿里、字节、Anthropic。
程曼祺
你听到过创始人给出比较有说服力的答案吗?
陈哲
这个问题在 Anthropic 创业时也被投资人反复问过,但 Anthropic 最终成为了 Anthropic。
程曼祺
你的意思是,Anthropic 刚起步时也未必能回答这个问题。
陈哲
是的。所以一开始能不能回答,不是最关键的。
OpenAI 可能一开始也很难回答,但它们成立时,并不像具身智能模型一样,面临一群已经成熟的大语言模型公司。
客观说,今天具身智能创业和投资热潮,和上一波语言模型创业公司的成功与热潮有关。我们已经有几家大语言模型创业公司成功上市,还有更多公司在 pipeline 上,给投资人创造了丰厚收益。
所以,推断具身模型里可能有类似创业和投资机会,是合理的。
但挑战在于,如果所有人都这么想,市场一定会出现过度竞争和过度投资。最终赢家仍然稀缺,投资回报和创业成功预期都会被大幅压缩。
程曼祺
宇树作为中国第一家即将上市的具身智能公司,已经盈利很多年。但大部分其他公司还处于前期探索阶段。
行业反复讨论的问题,是接下来商业化和落地节奏会怎样。前面 Top 5 里也有相关内容,比如星动纪元和邮政的合作。
更广泛地说,你关于落地节奏,在这个季度有什么新的想法?
陈哲
我觉得落地节奏要从两个维度看:一个是中美差异,一个是硬件公司和模型公司的差异。
以美国领先公司为例,无论 OpenAI 还是 Physical Intelligence,都符合典型的美国前沿领域创新公司 pattern:一群非常聪明、有想法、有愿景的人才或科学家,针对一个潜力巨大、长期不确定的方向持续投入。
美国创投环境也提供了早期孵化阶段。OpenAI 可能从 2015 年成立,到 2022 年底 ChatGPT 出现之前,一直没有明显商业化或产品化进展,但这不妨碍它吸收大量人才和资源。
今天 Physical Intelligence 也在做类似的事情,不断发布甚至开源领先模型,引领行业进展。但从落地来看,so far 还没有看到特别清晰的商业化时间表。
程曼祺
你说美国这些公司基本都有这个问题,除了 Figure AI 好像更强调落地。Figure AI 现在也没有任何一单已经被真正验证的收入,但至少它会对外展示“我要落地”的姿态。
陈哲
对,但姿态和事实还是不一样的。
程曼祺
那你觉得国内公司已经是事实了吗?大家不只是姿态了?
陈哲
中国本质上是对长期不确定性探索的容忍度比较低,所以一定更需要做出落地姿态,最好还要是事实。
在中国,如果我跳出来创办一家公司,明确告诉投资人 10 年内绝不商业化、绝不落地,问题是你怎么获得足够资源和人才,怎么在资本市场获得反响,甚至怎么面对未来对接二级市场的阻力?
程曼祺
我想到一个方法:你是梁文峰。
陈哲
对,所以你很有钱。
我一直觉得 DeepSeek 是一家非常稀缺、非常不一样的公司。当你足够成功、对事情有足够信仰时,才有可能这样做。
客观来说,OpenAI,包括 DeepMind,本来就是一群 billionaire 的尝试和投资。OpenAI 最开始本来就是非营利公司,至少很长时间里,商业化和盈利性并不是目标。
所以今天更大的分歧在于,我们认为具身智能研究和行业发展到底到了什么阶段。
如果我能开天眼,告诉大家这件事像自动驾驶一样,至少需要 10 年甚至 15 年才能规模化商业化,甚至盈利——Waymo 已经实现商业化,但还没有盈利——如果告诉大家需要 15 年才能盈利,还有没有人愿意在这个领域创业和投资?
如果判断它 5 年内就能商业化和盈利,可能就会有更多人愿意投资和创业。
所以底层问题是,大家对周期的判断可能不同。
程曼祺
你目前判断,这个周期是在缩短、变长,还是没有太明显的变化?
陈哲
相比去年,我觉得这个周期肯定在缩短。
本质上,这是一个足够重要的问题,在整个社会和市场上聚集了大量资源、资金和人才。世界模型等技术快速发展,是因为相关基础要素在快速成熟。
而且语言模型领域的进展,也让大量能力、算力和数据可以迁移到具身领域。事实加速了具身领域的发展。
这也是为什么我们这次把 Figure 和星尘智能在人形机器人快递分拣上的进展单独列出来。至少我们看到,在这样一个场景里,通用型人形机器人用新的算法技术栈,可以更好地解决问题,具备实际落地的可能性。
程曼祺
最后展望一下下个季度,或者接下来一段时间行业会有哪些变化。
我们开头回顾了上次聊到的 3 件展望,基本都在第二季度持续发生。再往后看,你会看到什么新的东西?
陈哲
有一件事我最近反复思考,我认为会变得更加主流,就是人机结合成为一种形态和载体。
未来一两个季度,可能会有更多人形机器人产品在具体场景得到落地和商业化,也会有更多公司宣布进入市场,公布人形机器人产品计划或路线。
程曼祺
你说的更多公司不一定是创业公司,也包括中外大公司?
陈哲
对。当然,从宣布计划到发布产品,我认为至少需要 1 年到 1 年半。
这个时间判断可能会有分歧。我和一些具身创业者聊过,他们会把时间表判断得更紧迫,认为大厂会更快下场。
比如理想在 2026 年初前后宣布相关计划,但内部应该已经做了一段时间。荣耀也是这样,实际上已经做了两年。
我认为未来 1 到 2 个季度,或者未来 6 个月,是大厂进入这场游戏的最后窗口。
如果 2026 年不启动、不进入这个市场,等到 2027 年、2028 年人形机器人真正广泛落地时,可能就没有身位了。
程曼祺
特别大的终端厂商,手机和汽车公司,国内至少很多主流公司都多少布局了一点。
但还有一类大公司,除了字节、腾讯、阿里这样的互联网公司,我指的是人形机器人全栈方向,它们可能会有什么动作?
陈哲
对大厂来说,更好的对标可能是 Physical Intelligence 和 Anthropic 的模式,还是偏智能能力基础设施。
因为它们太擅长做模型,模型的商业模式和能力与自身高度相关。这也是为什么今天国内大语言模型里,字节、阿里都非常领先。
我觉得在中国做具身智能创业有一个悖论,或者说尴尬:除了很难做一家 10 年没有商业化、没有收入的公司,投资人和资本市场也更难容忍一家公司不是全栈公司,或者大量能力依附于客户和合作伙伴。
这导致现在出现了一个现象:所有具身大脑公司都在宣布自己做机器人本体。
程曼祺
前段时间我采访许华哲,他就是很非主流的想法。他认为不应该所有事情都在公司内部完成,有些事情应该交给生态。
陈哲
我认为这个想法可能是对的,也可能是非常美国式的想法。
他肯定是觉得智能能力更优先,相比商业化,如果你能在任何一件事上做到行业最好,才有意义。
如果不做全栈,或者做全栈的时机太晚,没有特别好的身位去做,那就在细分领域做到行业最好,也仍然有价值。
最终大赢家大概率还是有全栈公司的机会。苹果、小米、华为这样的公司,在具身时代也会存在。
但有意思的是,今天市值最大的几家公司其实不是全栈公司。NVIDIA 不是全栈公司,Anthropic 或 OpenAI 最终上市,也可能不能叫全栈公司。
所以到底全栈是终局,还是垂直一体化是终局,长期可能都会反复,是一种博弈和竞争关系。
但在中国市场,创业公司比较难的一点是,你很难说自己 10 年没有收入;也很难说只做大脑公司,或者只做本体公司。
很多投资人也会挑战宇树:宇树只是一家硬件公司,没有 AI,没有模型。
程曼祺
我其实不太认可这个 challenge,但市场确实会拿这个去攻击宇树。相当于宇树在某一个环节做到强如宇树,仍然会受到“你不是全栈”的挑战。
陈哲
如果宇树未来一直是一家硬件公司,我认为它也可以是一家很赚钱的硬件公司。它能不能形成垄断,是另一个问题。
但我不觉得有什么理由说明,它不能长出软件或 AI。只要公司在战略和方向上真的想做,就有机会。
程曼祺
今天非常感谢 Peter 再次做客《晚点聊》,分享 2026 年第二季度他观察到的具身领域新变化。
这次节目最后,我们也展望了接下来可能发生的事情。第三季度、第四季度的节目里,我们可以再回来聊聊,这些进展是否得到了印证。