Speaker 1
还有东西吗?你看一下那个箱子里还有没有?
哦,我们没有箱子的。这个电脑就是当时用的。
卫诗婕
这是除夕夜晚上11点,宇树机器人训练场位于北京大兴。这一天,宇树刚刚完成了马年春晚的表演节目《武BOT》。这是他们第三次登上中国春晚,从牛年的机器牛,到2025年蛇年的机器人扭秧歌,再到2026年,25台宇树机器人组成一个集群,和中国最顶尖的武术学校塔沟武校的人类小演员们一起,完成了一场震撼的表演。
王兴兴
我们甚至罗列了全世界所有的功夫动作,然后让机器人去复刻、学习了一遍。我们筛选了其中比较好的几十个动作,呈现到节目里面。
卫诗婕
《武BOT》被外媒称为展现了人形机器人运控的巅峰。这场表演不仅展现了全球最强的运控能力,也超越了宇树自己。从2025年蛇年春晚爆红以后,宇树站在行业之巅,承受了不小的压力。这次访谈,我们不仅聊到了春晚舞台背后的技术进步,还有宇树和王兴兴本人这一年的成长和思考。
这里是漫谈 Light the Star,我是诗杰,我们一起记录时代的每一寸跃进。
1. 春晚挑战再次升级
谢谢兴兴。现在已经是正月初一凌晨12点半,你们刚从春晚舞台上下来。我看到你的桌子上摆了很多药。
王兴兴
对,我最近感冒了一个多月了。
卫诗婕
这是第三次登上春晚,和前两次有什么不同的感觉吗?
王兴兴
我觉得每次都是非常非常大的挑战。这一次,因为过去两次,尤其是去年,效果比较好,所以我们肯定要拿出更好的作品出来。其实心里的压力还是非常非常大的,因为我们一直知道,我们最大的对手是我们自己。
卫诗婕
我昨天正好在采访松延动力的创始人,他也跟你们一起登上了春晚,只是在不同的节目。来自同行的评价是,他们在彩排时看了宇树的表演,觉得宇树是全球运控最棒的团队。
王兴兴
谢谢。
卫诗婕
今天看这个节目的时候我特别感动。这次你们机器人选的搭档是武术学校的孩子,两个团队我觉得有共通之处:技术和练武的过程都是漫长、艰辛的,要吃很多苦,也要坐很多冷板凳。这是让我觉得很感动的地方。
王兴兴
工作量还是非常非常大的。某种意义上,你要把一件事情做好,无论是技术也好,功夫也好,做到极致,工作量都是非常大的。
为了呈现好一个节目效果,它并不单单只是打功夫。单单打功夫,可能和整个节奏、画面对不太齐,中间可能差了0.1秒,我们就要微调一下,或者把这个工作重新推倒、重新来一遍,所以这都是非常花时间的一件事情。
卫诗婕
我看到有一个很特别的桥段设计。这次的节目融入了人和AI、机器人之间的关系:先是一个小演员想要挑衅机器人,然后机器人做了一个非常俏皮的动作,好像不太在意人;紧接着,小演员开始打醉拳,倒在了地上。翻身起来的时候,周围的人对他竖起大拇指,一直到最后,人机牵手一起走向观众。
感觉这像是在讲述技术和人的关系不断演进的过程。
2. 人机正在共同成长
王兴兴
对,这也是导演组特别设计的。导演组也相信,机器人最终是为人服务的,人机共融的社会,或者人和机器人互相学习、互相成长的过程,是非常重要的一部分。
我觉得这一点也是未来机器人真正走进生活必须要面临的问题。因为现在10岁左右的小朋友,和人形机器人本身是在共同成长、共同长大的。他们和我们这些成年人的感觉可能差别还非常大。
某种意义上,对他们来说,机器人的时代已经到来了。对我们来说,机器人目前可能还不够智能,能做的事情比较少;但对10岁左右的小朋友来说,人形机器人的时代可能已经来临了。
卫诗婕
我觉得还有一个隐喻。现在机器人发展的技术阶段,是不是就像一个10岁的孩子,甚至更小?
王兴兴
对,还是非常接近的。目前大家可以看到,它每年都有持续的技术进步,但真正距离大规模应用、进入家里和工厂干活,确实还需要一些时间。
但这个时间如果快的话,可能是3到5年;慢的话,应该绝对不会超过10年。所以对于现在10岁左右的小朋友来说,等他成年、等他20岁的时候,整个机器人的技术相对于现在,可能已经发生翻天覆地的变化了。
卫诗婕
问一个比较有趣的问题。我看到去年你们登上热搜的其中一个话题是“宇树机器人不穿裤子”,就是扭秧歌的时候。今年我发现,G1还是没有穿裤子,但是H1,最后那个像齐天大圣一样、两米高的全尺寸机器人,穿上了一整套非常威武的服装。这个是特别设计的吗?
王兴兴
对,还是根据节目效果,以及导演组大家共同的决定。服装这块我们参与得比较少,我们参与得比较少。
卫诗婕
我以为穿裤子会影响运动,是这样吗?
王兴兴
运动也可以,但是某种意义上,毕竟是机器人,穿了以后有时候看上去不太好看,有时候穿了会比较好看,还是要看整个呈现效果。
卫诗婕
发现你们这一届已经自动冲上微博热搜了吗?
王兴兴
这个可能还没来得及关注,最近还没来得及关注这个事。
卫诗婕
再给你一个很好的消息。我们看完这场节目之后,我的一些投资人朋友都不约而同地盛赞宇树的表现,觉得宇树定义了技术的高度。
王兴兴
谢谢。
3. 稳定性支撑全球领先
卫诗婕
您自己觉得,宇树现在的运控水平,和全球海外最先进的公司比起来,是什么样的状态?
王兴兴
在这部分,我们最近几年一直处于头部水平。很多方面、大部分方面,我们基本上是最好的。当然,也有可能个别公司有一部分比我们好,这还是有可能的。
总体层面上,我们其实取得了很好的成绩,包括运动的灵活性、稳定性。举个最直接的例子,因为我们台上有20几台机器人,大家可能想象不到,我这里分享一个细节:我们上春晚每次彩排的时候,都没有提前测试过这些机器人。
为什么呢?因为春晚整个节目现场没有那么多场地给我们做测试。我们做测试的场地实际上在大兴,那边的场地更大,可以做测试。但测试时,我们不可能每次彩排、每次表演,都把机器人从测试好的大兴运到舞台现场,这不是可行的技术方案。
所以我们在春晚现场放了几十台机器人,在大兴的彩排、测试现场也放了几十台机器人。但我们基本可以保证,在大兴测试好的机器人算法,到了舞台表演时,只要做一个升级,就可以上台表演,而且基本不会出现太大的差别。这保证了算法的稳定性。
当然,对硬件的稳定性也有要求,但主要是算法的稳定性,以及它对不同机器人的适应性要更强。因为我们去年出货了5500台机器人,你不是写一个程序给一台机器人用,而是写一套算法,基本上要给5000多台、甚至1万台机器使用。
所以对算法稳定性的要求,比单纯做一个Demo高非常非常多。这也是其中一点:我们目前算法的稳定性,可能确实比绝大部分其他厂家要好一些。
卫诗婕
我也和投资人聊过,或者说这是行业里给出的反馈:宇树的机器人真的可以做到开箱即用,稳定性极强,而且兼容性也很强。我想问,这种稳定性背后是什么?
王兴兴
这更多还是要投入时间和精力。比如说,要把硬件做得更可靠、更通用,这样各种算法跑上去以后,稳定性会更好。
在算法层面,也要做适应。我们的目标一直是:哪怕硬件比较差,甚至硬件已经更换了,算法跑进去以后,也要保持机器稳定。这两方面的要求都非常重要。
4. 持续迭代才是护城河
卫诗婕
我之前请教行业里的专家,他们说做运控这件事情的护城河,某种程度上就是时间:做的时间越久,遇到的Bug越多,解决的Bug也越多,就越有经验。其实是这样吗?
王兴兴
这只是其中一部分,更重要的还是要保证技术本身持续进步。像我们去年年初的时候,算法的适应性比较差:这台机器人跑起来效果不错,稍微换一台机器人,效果可能就变得非常差。这说明软件的适应能力还不够。
但从去年中下旬开始,我们算法的稳定性提高了很多。各种奇奇怪怪的机器人装上我们的算法以后,稳定性都提高了很多。这样才能实现大规模集群的机器人表演。
不然的话,你可能一台机器人跳舞、打个滚没问题,但上10台,就有好几台可能不行。所以今年最重要的,还是要保持持续的技术进步,不进步是不行的。
大家可以关注到,现在开源算法非常多。举个例子,为什么去年中下旬以后,中国很多机器人公司都可以跳舞、打功夫?原因非常简单,因为有人把算法开源了。
卫诗婕
对。
王兴兴
很多人喜欢把AI做出来以后开源,所以整个行业会持续进步。我们想做到比整个行业平均水平更高,其实要花的工作量和时间,比大家可能想象的多很多。
卫诗婕
我分享一个我知道的八卦,您可以验证一下。我知道,2024年初的时候,上海那边想搞一个机器人列队方阵。当时所有行业里据说只有两家公司的机器人能走得明白,当然其中一家是你们。
但仅仅半年过去,你就看到大家都可以跑、能跑、能跳了,其实背后就是AI本身的进步。
王兴兴
对,AI本身在进步,而且很多人愿意把AI共享出来。共享出来以后,整个行业的基础水平会持续往上,水位在不断升高。
卫诗婕
所以像宇树或者其他公司,如果好几个月,尤其是半年、一年没有进步,就会变成一家平庸的公司。
王兴兴
是。举个最简单的例子,如果过去一年我们公司没有产品和技术上的进步,到现在为止,就是一家非常平庸、甚至落后的公司了。
卫诗婕
这就是我想问的。Coding Agent其实可以极大地加速算法迭代。我的理解是,这件事情既可以帮助你们放大优势,但同时也有可能让你们更快被别人赶超。这是不可避免的一件事情吗?
王兴兴
对,因为在新的技术浪潮面前,唯一不变的就是要保持进步、保持迭代。这样基本上可以持续保持领先,或者至少保持基本领先。
能不能保持第一不好说,还有一些运气成分在里面,但至少要尽可能保持同步水平。如果你一旦懈怠,这个社会是非常现实的,可能几个月、半年,你就处于落后水平了。
卫诗婕
去年蛇年春晚之后,你们是真正爆火,而且还带动了全行业爆火,带动整个行业涌入了非常多新的玩家。中国有句话叫“高处不胜寒”。你们毫无疑问是第一名,当第一名的滋味如何?
王兴兴
这一年压力肯定还是非常非常大的。各种资源和资金进来,对整个行业肯定是好事。当然,对我们来说压力确实也比较大。
但我过去这么多年总结下来,最大的对手永远还是我们自己。我们自己要保持产品和技术迭代,基本上别人是追不上的;但如果我们自己松懈了,那就不好说了。
所以包括这次春晚,包括未来几个月、今年,最大的事情还是要构想新的产品和技术,努力把它们做出来、做好。这样我们就可以持续保持领先。但如果我们自己未来几个月懈怠了,那肯定就不太行了。
5. 具身大脑驱动技术跃升
卫诗婕
以我的有限了解,机器人行业过去是按照两分法来分的:做本体的,被称为Locomotion Control;做大脑的,做的是Manipulation。宇树被视为做本体的代表,但过去一年我们可以看到,做大脑的公司估值非常高,行业好像也更看好做大脑的公司。大家又把宇树归为做本体的一类,您有什么想说的吗?
王兴兴
我们本体和大脑都在做,只是因为我们的本体卖得比较多,大家可能喜欢把我们当成一家做本体的公司。这是非常正常的现象。
苹果也是一样。苹果自己做操作系统、做软件,也卖手机,但大家的印象中苹果就是一家做硬件的公司。实际上,它里面也做了很多软件和系统。
对我们公司来说,最大的事情是,当下具身智能AI的不确定性因素还非常多,所以我们要持续把自己的技术、硬件和软件都做得更好。两边做得更好以后,产品才会更有竞争力。
但未来最重要的,虽然本体一直非常重要,我们也卖本体,但我一直承认,最重要的是具身智能大模型,也就是具身大脑。这肯定是行业内、全世界最重要的一部分。
不过,做大脑的风险也比较高,因为没人能保证谁做得最好、谁做得最快。在纯AI领域,大家也知道,隔三差五可能今天这家公司的功能做得好,明天那家公司的功能做得好,变化非常快。
但做硬件的公司,大家会发现它的变化可能不会那么大。今年这家公司做得好,过几年基本上可能还是这家公司。
所以我的理解是,宇树要守好自己的硬件,硬件肯定是基本盘,但我们一直也希望把软件做得更好。
卫诗婕
我最近留意到一股趋势。以前我们说做Locomotion Control的做Locomotion Control,做Manipulation的做Manipulation,现在好像有一个新的趋势,叫Locomotion Manipulation。你有留意到吗?
王兴兴
这个倒没有特别注意。因为我们其实一直在做这些事情。我们做灵巧手的硬件和软件已经很多年了,也开源了好几个模型。
比如基于视频生成的具身模型,这个方向我们在全球做得非常早。2024年的时候,我们就做出了一个版本,还把它开源了。像大家比较常用的VLA模型,或者VLA加RL模型,我们也一直在推动。
在具身模型这块,我们一直比较开放。我们会探索各种新的方向,发现哪个效果比较不错,就多花一些时间去做;或者发现国内外哪一家第三方公司做得不错,我们也会开放合作。
当然,合作并不意味着我们自己的东西就不做了。可能某个方向确实有价值,我们就合作一下。像国内几家大的具身模型公司、互联网大厂,我们也都有一些合作上的推动。
我觉得具身模型是目前全世界共同的门槛和天花板。所以只要谁能做出来,对整个行业都是贡献。只要全世界有一个人做出来,不是我们公司,也不是中国公司,甚至不是美国公司,对整个行业都是巨大的推动作用,大家都应该感谢他。
卫诗婕
所以其实你们是希望成为帮助大家推动整个行业发展的人。
王兴兴
我觉得最大的事情,是让机器人行业、人形机器人行业整体进步,这对所有公司都好,对我们公司也好。包括我们公司过去几年,我觉得最大的成就感,就是帮助全世界共同开源、共同推动了行业进步。
这件事单单比自己卖了多少台机器人、或者公司有多少估值,更令人有成就感和高兴。
卫诗婕
刚才您提到,大家都觉得苹果是一家硬件公司,但它其实也做系统、做软件。苹果作为行业领先者,选择的是闭源;但您刚才也讲到,你们会开源一些模型,而且致力于开源。
王兴兴
这个比较简单。我们自己觉得比较重要的部分,很多情况下可能不会开源;但我们觉得有些东西值得开源,也拿出了很多开源方案给大家使用。
所以我们也不能直接和苹果完全对比。我们可能有一半的东西不开源,有一半的东西开源。
卫诗婕
我理解,算法、算力、数据都很重要。这次我们有了这么大的飞跃,其实算法、算力、数据这三方面都有突破。背后的原因是什么?
王兴兴
肯定都有。比如大家看到机器人可以做更多动作,我们其实采集了各种人的动作,然后喂给模型。这样模型对各种动作的适应能力就更强了。
对于具身智能模型,最根本的还是要把模型做得更好,把数据也做得更好,两部分相辅相成。不能单纯说“我有足够的数据,就一定会变得更好”。
每一个细节都非常重要,包括数据本身也要做清洗。和语言模型一样,语言模型想做得更好,数据也要清洗和筛选。机器人的运动模型也是一样,想要效果更好,不能随便采集一个动作,肯定要采集一些比较优秀、具有代表性的动作让它学习,这样效果会更好一些。
卫诗婕
是否可以这么理解:过去一年,单说AI技术,它本身也在飞速发展,而这个飞速发展带动了具身智能底层技术的发展?
王兴兴
肯定的。全世界目前最大的驱动引擎就是AI,是它驱动了各行各业的发展。机器人行业肯定是离AI最近的行业之一,所以它本身也有一些独有的技术,但很多技术也和AI行业共生,是一种共生关系。
卫诗婕
AI加速了具身智能。
王兴兴
肯定的。
6. 集群表演暴露真正难点
卫诗婕
但我很好奇,大家都能享受到同样的优势,可从效果上来看,宇树今天的提升幅度应该更大。这里面的代差是什么?
王兴兴
我们确实做了不少工作。大家可能看上去都是机器人在打功夫,或者找一个别的厂家,也能让机器人打功夫;但真正要让几十台机器人快速变换队形,同时保持队形稳定,全世界这次基本上是第一次。
大家可能看到过其他机器人打功夫,或者有队形地打功夫,但可以关注一下,它们通常没有走位:先把机器人放在那里,开始打功夫,然后就结束了。
但我们这次表演,先有一个队形,然后变换队形、打功夫,打完功夫以后还要再次变换队形,而且是快速变换队形。变换队形的过程是跑过去,而不是单纯地调整位置。我们整个动作的剧烈程度也比较高。
所以在细节层面上,提升其实比较多。有些技术目前可能其他厂商还做不了,有些技术他们也能做,但我们可能做得更好一些。
卫诗婕
变换队形这件事,靠的是一种AI融合算法,对不对?
王兴兴
对。为了快速变换队形,我们单独开发了一个算法。
卫诗婕
外行人看,会觉得它不就是跑了一个队形吗?实际上它的难点是在于定位会漂移,还是其他问题?
王兴兴
跑队形的时候,它的轨迹都是任意的,并不是说“这台机器人往前跑就行了”。很多情况下,它可能要快速转弯跑到一个位置;或者这台机器人刚刚打完功夫,已经歪掉了,它也要实现这样的效果:在任意情况下,都能跑到指定位置。
所以它有很大的泛化性要求。它不是固定走几步,也不是从这个位置跑到那个位置,而是要实现无论在东西南北哪个位置,都能跑到一个固定位置,需要一定的泛化能力。
另外一个挑战是定位的稳定性。我们使用了激光雷达,但它和一般汽车使用的激光雷达定位不太一样:机器人在空翻、在各种剧烈运动的情况下,定位都不能丢;即使定位丢了,也要马上快速找回来,在剧烈动作中保持稳定。
大家可能想象不到,这次我们在硬件上遇到的一个很大挑战是什么:雷达坏了非常多。因为机器人在空翻等剧烈动作时,直接把雷达震坏了。
卫诗婕
非常夸张。是因为这种激光雷达本身不是为剧烈动作设计的?
王兴兴
对。我们空翻一下,地面和很多铝合金部件都被震断了。因为机器人高度很高,落下来以后,铝合金腿部直接断掉的情况都有。
卫诗婕
它跳起来能到几米?
王兴兴
目前借助弹射器,大概可以到3米多高。
卫诗婕
这个高度非常夸张。
王兴兴
硬件的要求很高。早期激光雷达直接震坏了很多,所以后面我们加了很多减震结构,减少激光雷达的损坏。
但哪怕这样,激光雷达在剧烈动作时的寿命依然非常低。可能今天这台激光雷达还是好的,第二天这台机器人到舞台上表演时突然就坏了。
怎么办?就要靠算法去修正,或者通过各种办法想办法解决。一般人可能没想到会有这种问题。
7. 春晚成为技术大考
卫诗婕
我发现,你们上春晚其实是一种很幸福的经历,因为在春晚舞台上,总能遇到很多原来在实验室里想象不到、也没有碰到过的事情。
王兴兴
对,这也是对我们的一个大考。我一直觉得这是一个很好的机会,让我们集中一段时间去攻破更尖端的技术。这些技术可能非常重要,但我们以前可能没有时间去关注。
卫诗婕
我问一个很人文的问题。我曾经主持过机器人的发布会,发现那是我第一次意识到,机器人的背后是无数个程序员,基本上都是男生。刚才我也看到你们团队都在那里收拾东西、吃泡面。你和团队之间,那些程序员是怎么沟通的?
王兴兴
说实在的,大家都是搞技术的,沟通都比较简单。
卫诗婕
没有什么感性表达,是吗?
王兴兴
没有太多感性的表达。
卫诗婕
但你能感受到,比如每一次在春晚上大获成功之后,大家的精神气不一样了。
王兴兴
我觉得这是属于所有参与者的荣耀。
我觉得能够创业做10年,是真的热爱机器人这件事,也一定会找到同好。我们还是希望大家的目标是明确的,大家觉得为了这件事情值得拼搏,而不是单纯地把它当作一份工作。
对我自己,或者对公司每一位同事来说,我都希望大家喜欢技术、喜欢机器人,愿意为这个事业奋斗一生。这样的话,大家做任何事情都会有成就感和开心,而不是勉强来做机器人或技术,那对大家都不太好。
卫诗婕
这次整个训练过程有多久?
王兴兴
这次大部分时间花在细节微调上,并不是说“我有10台机器人,编一个功夫动作”。说实在的,如果只是这样,我一两天就可以做好。
但为了这个节目,我们准备了几十天。大部分时间都在调整各种细节。
卫诗婕
整个过程中,你自己有没有最快乐的那一刹那?
王兴兴
还是中间有几次技术突破的时候,非常高兴。不然的话,我觉得呈现效果会比现在差很多。
卫诗婕
哪几次技术突破最开心?
王兴兴
第一次就是刚才说的任意跑位,而且跑得很快。这样一来,整个跑位问题就解决了。
过去或者一开始准备节目的时候,机器人真的只能走路。打完功夫以后,要跑到下一个位置,它只能慢吞吞地走过去。这和去年有点像,非常不好看,也不实用。所以我们对这项技术进行了特殊攻坚。
第二次,是刚才提到的更高的弹射器空翻。一开始做弹射器的时候,空翻高度不理想。最初做出来时,可能只比平地空翻高零点几米,连1米都不到,不震撼,没感觉。
但后来有一次真的飞到接近天花板那么高,感觉就完全不一样了。尤其是站在旁边看,特别震撼。
卫诗婕
也和观众分享一下:这种集群式的功夫表演,现场看的震撼程度远超电视。因为动作剧烈的时候,整个地面都会震,气场非常强大。
那我们以后可以去哪里看到这样的表演?
王兴兴
这种大型表演确实比较花时间,可能在其他地方还比较难看到;几台机器人的表演可能会比较常见。但集群表演到目前为止确实很难,因为部署一次、协调一次,工作量还是比较大的。
卫诗婕
我已经开始期待机器人舞台剧了。
王兴兴
这个肯定还是会有的,未来会有。
卫诗婕
还有第三次最开心的时候吗?
王兴兴
基本上就是这样。
8. 强化学习重构训练方式
卫诗婕
明白。那我接着问技术问题。我可能说得不对,您可以指正。我看你们好像围绕强化学习重新做了一个框架,是吗?
王兴兴
对。因为这次动作数量非常多,我们设计的训练动作超过100种。100多种动作要先筛选,然后快速训练、筛选,再把这些动作拼接起来,所以对整个训练的要求更高。
过去很多训练算法,可能只能单独训练一个动作,或者训练好以后动作没办法拼接,这样整体效率非常低。
卫诗婕
爆发力对硬件和算法也有要求。大规模爆发时,甚至会把机器人的腿杆、铝合金或钢制部件都损坏,因为力量实在太大,尤其是高空落地时,对电机甚至电池都有要求。
王兴兴
这里也分享一个细节:高处落地时,电机会吸收能量,反充到电池。简单来说,机器人里的电流会突然变得非常大,可能把电池等部件都损坏。
卫诗婕
有点像一个人突然血压升高很多,然后整个人休克。机器人也会出现类似的“高血压”。
遇到这种情况,是让它像人一样缓一会儿,还是在软件和硬件上做了改进?
王兴兴
我们做了改进。我们加装了特别的结构,把这种能量稍微吸收或者释放掉一些,避免突然出现的大电流把整个硬件损坏。
卫诗婕
之前如果它“高血压”,就直接倒下、不能用了。
王兴兴
对。一般人可能想不到,功夫动作特别剧烈时,对电池和整个供电系统的要求也非常高。不然可能突然电池供电电流不够,或者电流太大把电池充坏,都会遇到类似的问题。
卫诗婕
你刚才讲到,电机、电池都面临很大的考验。据我所知,你们是自研电机的,这件事情应该也会利好你们自己的技术。
王兴兴
对,我们肯定做了一些升级。
卫诗婕
反过来说,如果不是自研电机的玩家,可能就很难做。
王兴兴
对,没办法。因为我们可以直接修改电机程序,这也算是一个护城河。
卫诗婕
还有一个技术问题。这次做的是武术,武术动作非常大开大合。据我了解,它对关节自由度的要求也极高,是吗?
王兴兴
对。这次上场的G1是我们的顶配版本,腰部有3个自由度,每条手臂有7个自由度,也有手腕,所以灵活性比较高。
其中有几台还装了灵巧手,为了更好地抓棍子。
卫诗婕
我发现这次一共抓了四样东西:双节棍、棍子、葫芦,还有一个什么,我有点忘了。其实这体现了灵巧手的能力。
我记得你之前说过一句话:目前机器人的硬件是完全够用的,我们缺的是模型,对吗?
王兴兴
对。目前灵巧手做到自由抓取,一般性的抓取还是可以的,但不能抓太细的东西,那可能挑战比较大。
灵巧手目前其实某种意义上要用也够用,当然不够好,可靠性等问题还挺多的,包括触觉感知,但某种意义上还是够用的。
最根本的问题还是AI模型。我的观念一直是,只要AI模型足够好,用一堆非常差的硬件也照样可以干活。
举个最简单的例子,有些残疾人没有手,但他们照样可以把活干得非常好,甚至可以做雕塑。有些一只手指都没有的残疾人,也能把雕塑做得非常好。
所以某种意义上,只要AI能力够强,硬件差一些也能用。
卫诗婕
你觉得现在产业供应链的生态里,需求最强的环节是哪些?
王兴兴
这个很难评价。我觉得最重要的肯定是AI模型。硬件也肯定要做得更好、更可靠、成本更低、更规模化,这同样是挑战。
因为哪怕硬件没有根本上的技术问题,但要量产几万台、几十万台,甚至几百万台并完成集成,工程量和工作量还是非常吓人的。
卫诗婕
你们有没有特别的强化学习方法?
王兴兴
我们肯定有自己的模型结构。
卫诗婕
我留意到一个小细节:在和人一起舞棍子的时候,那个棍子好像有一点弹性,软软的,是不是为了让人和机器人能够更好地配合?
王兴兴
对,这主要是为了保护小朋友。不然棍子如果打到或者捅到小朋友,都不太好,所以棍子尽可能要稍微软一些。
卫诗婕
明白了。您觉得从去年到今年,机器人进化得这么快,底层最关键的要素有哪些?能列一列吗?
王兴兴
我觉得软件和硬件都很重要。硬件的可靠性得提升,不然做一个剧烈动作,机器人可能就直接报废了。
另外,软件的运动能力得提升,硬件的兼容能力也要强。所以我觉得都是细节问题,而细节问题非常多。
哪怕春晚这个节目几个月前就让我们做,我们也要花好几个月的时间把细节完善,所以挑战还是非常大的。
卫诗婕
软件的挑战能够被攻克,除了你们在细节和时间上的积累之外,还有没有更底层的技术,比如AI升级?
王兴兴
肯定有。我们模型结构的优化也有很多。大家知道,模型结构本身就是通过很多细节优化出来的:模型结构怎么搭建、怎么优化,这个工作量也很大。
9. 世界模型正在挑战VLA
卫诗婕
2026年刚刚过去两个月,Agent,尤其是Coding Agent的讨论度非常高。Coding Agent现在对机器人非常有用,我平时编程时,基本上大部分代码都是让AI来写的,所以它会加速这个行业,对吗?
王兴兴
肯定会加速,对整个行业都会有加速作用。
卫诗婕
2月份热议的话题还有Seedance 2.0的发布。我采访的一些多模态领域的专家认为,Seedance 2.0可以生成非常符合物理规律的视频。想听听您的看法:这种符合物理规律的视频生成,能够帮助具身智能训练吗?
王兴兴
肯定的。2024年,我们也开源过一个基于视频生成的具身智能模型。
大家的想法其实很简单:既然我可以生成一个机器人干活的视频,那为什么不能用这个模型去控制一个真实机器人?原理上不是一样的吗?只要把视频生成里机器人动作的逻辑映射到一台实物机器人上,它就可以干活。
我觉得这个想法非常自然,也非常符合第一性原理,所以我们一直很重视这个方向,后续也会继续做。我个人还是比较看好这个方向的。
卫诗婕
有人质疑,像Seedance 2.0这样的模型,只是生成了一个仿佛符合物理规律、看上去符合物理规律的视频,实际上和真实世界的精度差很多。他们觉得,理论上可以用来训练,但实际还不行。
王兴兴
如果只要做到足够精细,我觉得甚至有可能突破。为什么?比如我抓一个东西时,如果视频连这个物体的弹性都能仿真出来,那说明它本身的接触仿真已经做得不错了。
某种意义上,我觉得如果沿着这条路线做,而且数据足够多,用数据把具身智能模型“砸”出来的概率还是很大的。
只是当下没有人有机会获得大规模的真实机器人数据。我们自己也在做视频生成的具身模型,最大的挑战是什么呢?视频生成模型的动作和真实机器人没办法很好地匹配。
因为两部分数据本身不同。视频模型是用海量数据训练的,但它没有足够的真实机器人数据,所以两者的匹配和对齐效果不太理想。可能视频生成时已经抓住了物体,但实物机器人还差一点。
这个问题如果有海量数据,没准就可以把差距直接对齐掉。
卫诗婕
海量数据从哪里来?
王兴兴
只能通过真实采集或者仿真。
所以从这个角度看,如果靠堆数据就能把问题解决,那只是大家现在还没有这么海量的数据。我们现在也在想办法:能不能在没有海量数据的情况下完成对齐,或者做出一种新模型,在没有海量数据的情况下实现闭环。
卫诗婕
现在大家很强调出货,因为会觉得如果能够部署到真实场景里,机器人在使用过程中就可以不断产生数据。这条路可行吗?
王兴兴
这条路是可行的,但目前也知道,机器人自己产生的数据很多情况下还没办法直接使用,需要人去采集,或者人在仿真环境里采集。
而且数据量可能也不够。大家也知道,现在视频生成模型效果这么好,它们使用的数据量非常惊人。
目前人类能掌握的AI核心原则只有一条:用海量数据训练出来的效果是好的。这一点目前毋庸置疑。你只要有海量数据,什么模型都能训练出来。
但在机器人领域,即使有1万台机器人每天采集数据,我觉得数据够不够还不好说,因为最主要的问题是,采集到的数据质量并不是很好。
卫诗婕
所以这就是你今天提醒大家要有耐心的原因?
王兴兴
对。可能会很快突破,如果有海量数据的话,但具体什么时候不好说。视频生成模型相比过去一两年,效果已经非常好了,但机器人领域总会比这个慢一些。
而且视频生成模型对我们这种机器人公司有一个很不好的地方:它对算力的要求太高。多模态模型消耗的算力非常夸张,我觉得全世界一般的纯机器人公司可能都训不动。
卫诗婕
训不动怎么办?
王兴兴
想办法。我也不知道。
我们还是希望能做出对数据需求更小的模型。如果能做出来,可能会更好一些。
卫诗婕
你去年其实有一小部分争议。你是比较少见的、站出来说VLA可能会面临瓶颈和问题的人,也听到过很多质疑的声音,对吗?
王兴兴
我知道。但没准现在去问问别人,赞成我观点的人可能会更多一些。
卫诗婕
我关注到2026年的一个趋势:才过去两个月,大家讨论世界模型多了,讨论VLA少了。
我最近还得到一个很有趣的信息,和你分享一下:我采访了一位多模态领域的学者,他认为像Seedance 2.0这样的模型,其实已经是世界模型的一部分,甚至本身就是世界模型。
王兴兴
对。视频模型把很多语言本身也加在了一起,是多模态模型,里面还包括很多音频和声音。
在这种模型的基础上,某种意义上只要把真实机器人的轨迹、杆件等信息加在一起训练,这个模型就可能变成一个万能模型:既可以生成视频,也可以让机器人干活。
我觉得这个趋势肯定会有大公司去做,而且这个方向非常符合第一性原理,也是非常正确的方向。
卫诗婕
所以相比VLA和世界模型,你是更偏向世界模型这一派?
王兴兴
对。目前我觉得世界模型的效果肯定更好一点。
当然,VLA模型我们自己还在做,也会继续优化。并不是说它现在有缺点,这条路线就一定死掉了,绝对不存在这种情况。大家也在改进VLA模型,比如把强化学习加进去。
有时候大家也会想,VLA有没有必要?要不要把它变成一个VLA模型,让整个推理流程更加简单、直接?大家会有各种各样的想法。
卫诗婕
我理解,不同的技术路线最后可能带来不同的方案,但在做一件事情的时候,所有方案都可能用得到。
王兴兴
对。目前AI领域没有唯一的路线,没有人敢说“唯一的路线就是正确的路线”。可能今天这个方向比较好,后天发现另一个方向比较好。AI领域的变数非常多。
很多时候,大家发现以前做的AI模型已经成功了,但实际上里面还有更好的路线。
卫诗婕
这就是第一名很大的压力。像你说的,AI创新现在有一些随机性。我也听出来了,你们其实很多方向都在尝试,但一定有你比较相信的方向,对吗?
王兴兴
这个说不好,我经常改主意。今天我相信这个方向,我们做一些测试实验,发现不行,明天就换下一个方向。
对于我们公司来说,我觉得还是一定要保持相对开放。我并不是说今天觉得这个好,明天就说这个一定不好。我非常欢迎明天发现VLA非常好,然后我就变成VLA的拥护者。
这个说不好,任何技术随时都可能改变。保持学习,保持灵活,比较重要。
10. 宇树必须持续进化
卫诗婕
过去一年你的时间是怎么分配的?
王兴兴
公司上的各种杂事比较多,所以说实在的,真正用在产品和技术上的时间相对少一点,晚上可能时间还会更多。
但我觉得一定要保持对整个产品、对新技术的了解和认知,要跟上全世界的节奏。
卫诗婕
你怎么跟上?
王兴兴
每天多看看最新的论文、最新的成果,肯定要多关注。
卫诗婕
现在海外的公司,你最关注哪几家?
王兴兴
所有做得好的公司都关注,包括国内的公司。
卫诗婕
刚才应该有想起几家。
王兴兴
想想还是不告诉大家。
没有,我们关注的范围一直很广,非常广。哪怕是一个个人做出一点好的东西,也值得关注。
因为在AI目前的技术里,很多时候还是有一些技术随机性。举个最简单的例子,大家也知道,Transformer这个结构目前大家都在用。它最早是2017年谷歌做出来的,但真正大规模使用时,已经是2022年OpenAI开始大规模使用了。
中间有很多技术,包括现在的很多技术,未来可能会成为真正的“大脑”,或者非常好的模型,只是大家还没有发现。它们可能就藏在沙子下面。
所以大家可以多关注各种新技术。有些技术现在看上去不太有用,或者没人关注,但未来变成主流技术,都是非常有可能的。
卫诗婕
您讲的这一点很关键。Transformer源自谷歌,但谷歌却没有拿它打赢第一场胜仗。当然现在谷歌又重回王座了。公司变大的时候,就有可能让机会悄悄溜走。
王兴兴
这件事不可避免。在一些新技术里,真的没人能保证一项技术非常有价值。有些技术埋在下面几十年,都有可能。
卫诗婕
那宇树现在在变大吗?
王兴兴
对,我们公司人也多了。很多时候管理跟不上,效率反而更低了,或者没有更好地发挥每个人的价值,每个人的聪明才智没有得到足够发挥。这在某种意义上是不可避免的。
卫诗婕
那怎么办?
王兴兴
尽可能改进公司的管理和流程,没有最优解,只能尽可能完善。
卫诗婕
但我发现你是一个很有节奏感的人。你会很客观地去讲所有事情,也承认变化的发生,但自己始终有一个非常坚定的目标。
王兴兴
我觉得最大的事情,还是要尽可能看清整个技术发展路线。不能错过最重要的技术发展,不然别人已经做出来,而我们公司没做,那会付出非常惨重的代价。
卫诗婕
所以现在宇树这一年相比过去那些年,速度更快了吗?
王兴兴
因为人也多了,所以整个迭代速度肯定比过去快一些。
卫诗婕
如果给2026年许一个小心愿,会是什么?
王兴兴
对我自己、对公司来说,我们定的目标都非常简单:每一天、每个月、每半年、每一年,都要有持续的产品和技术进步。这是最重要的事情。
卫诗婕
每一天的技术进步怎么看出来?
王兴兴
也很简单。你要关注前沿领域,自己去做测试、尝试、迭代,总是可以获得进步。
卫诗婕
2026年你最期待的行业突破是什么?
王兴兴
一直最期待的,肯定还是全球具身智能模型有更多突破。只要有人做出来,对整个行业都是好事。当然,如果是我们公司自己做出来,那肯定是最好的一件事情。
卫诗婕
你的这个位置有一个特别得天独厚的地方:只要你保证自己不退步,只要有更好的模型做出来,你就还是能够保持领先。
王兴兴
对。保持头部水平相对容易,但要一直保持全球第一,肯定更难。
卫诗婕
你的梦想和第一天相比,有产生变化吗?
王兴兴
我觉得没有。我从小就非常喜欢科技,希望做出非常好的科技产品,推动整个社会进步。这是我最大的理念,也是我的梦想。
当然,我觉得当下我们做的这个行业非常好,非常值得做。它真的能够让人类文明迈上一个新的台阶。
卫诗婕
你之前讲过,你觉得机器人的强化学习还没有做得特别好。
王兴兴
对。目前我觉得全世界的RL还没有真正把它的价值发挥出来。
大家也知道,目前视频生成模型、语言模型使用RL相对比较少。但RL这项技术,我觉得还可以发挥更大的价值,包括它的Scaling Law,整个规模也还没有真正上来。
卫诗婕
你觉得机器人的Scaling Law怎么样才能出现?
王兴兴
现在没人知道,但我们期待它能够出现。
我给它定了一个指标:如果未来有一天,一台机器人到了一个陌生环境——比如80%左右都是陌生的环境——你给它发一个语音或者其他指令,它能够完成80%左右的任务,我觉得就差不多达到了具身智能或者机器人的ChatGPT时刻。
这非常重要。现在的AI模型都是提前预训练的:在某个场景上,如果用很多数据训练一个场景,成功率基本可以做到100%;但稍微换一点东西、换一个场景,成功率就会暴跌,甚至完全无法成功。
所以目前机器人的泛化能力还不够。我觉得真正的具身智能,如果泛化能力能达到刚才说的两个“80%”,那就是整个机器人行业黎明的时刻。
卫诗婕
今天这个跑位,其实机器人对于要跑到什么位置、怎么跑,已经实现了一定的泛化性,但还不够。它没有真正实现让机器人在80%左右的陌生场景中干活。
王兴兴
而且我们的跑位也要提前建图。建图以后可以实现高成功率,但并不是随便拎一台机器人到任何场景,它都能达到这种效果。
卫诗婕
现在行业非常火热。有一个判断是,到2026年机器人可能会供过于求,因为生产出来的机器人非常多,但市场不一定有那么大。
王兴兴
这确实有可能,也可能出现恶性竞争的问题。
卫诗婕
在这个过程中,大家可能都需要跑马圈地。据我所知,宇树一直在To Lab方面非常强,同时在表演、To C层面也很强。在To B和工业领域,你们是怎么想的?
王兴兴
我觉得最核心的还是保持持续的技术和产品进步,别的都是虚的。
无论你在其他领域卖了多少台机器人,某种意义上都不顶用。最大的问题是要保持持续的技术和产品进步。只要这个做得好,哪怕一台机器人都不卖,你永远也是全球最厉害的机器人和AI公司。
但如果技术和产品落后了,那些市场、占据的市场,包括我们自己占据的市场,某种意义上都是浮云。因为真正的具身智能AI模型突破那一天,你过往的东西和它比起来都没有价值。
卫诗婕
所以在宇树的优先级里面,技术永远优先于订单。
王兴兴
肯定的,这是最重要的东西。技术足够好,AI模型足够好,哪怕一台机器都没卖出去,也没关系。
卫诗婕
我知道时间有限。今天其实非常值得纪念,因为我们从除夕跨到了大年初一。谢谢,辛苦你了。
我知道你是宁波人,宁波人春节应该有吃年糕的习俗,所以我们现场准备了一个小年糕,可以一起分享一下,作为一个花絮。
王兴兴
好,谢谢。
卫诗婕
年糕的寓意应该是一年更比一年高吧?
王兴兴
这个我倒不知道有这个意义。
卫诗婕
对,所以寓意宇树一年比一年高。
王兴兴
好,谢谢。
11. 行业热潮需要更多耐心
卫诗婕
以上是除夕夜和王兴兴的独家访谈。由于访谈时间只有1个小时,有许多未尽的重要信息没有条件充分展开,所以我截取了一些王兴兴在群访中的发言,想和大家分享他的思考,以及我个人的思考。
首先,王兴兴在群访中聊到了2025年一整年中国具身智能赛道的狂热。
王兴兴
大家也知道,目前有更多资源和资金进入这个行业以后,同质化竞争非常严重。所以我倡议所有机器人公司,还是要合理、克制地竞争,不要进行恶意的、无效的竞争。这样其实不太好,对整个行业都不太好。
如果大家都开始亏本卖机器人,就可能把这个行业做砸,我觉得这是非常不好的事情。
卫诗婕
关于具身智能行业去年的火热,我在《漫谈》第62期年终复盘节目中,专门有一章分析了中国具身智能产业的发展和投资热。欢迎前往收听。
卫诗婕
这场访谈中,王兴兴也提到,宇树在赛道下的压力以及面对变化的唯一解。
王兴兴
我们公司最大的竞争对手,永远还是我们自己。
我反复提到耐心,希望大家给机器人行业多一点耐心。当前这一轮人形机器人的浪潮,某种意义上大概只发展了3年左右。随着技术越来越成熟、越来越有价值,整个市场规模也会慢慢打开。
我们一直非常重视让机器人真正走进生活、真正去干活。但现阶段对整个行业来说,全世界都还处于早期和探索阶段。
所以我们目前尽可能提高整个机器人的运动能力,因为我们相信,真正能干活的机器人,运动能力肯定要非常强。人也是一样,为什么大家平时要体育锻炼、要跑步?因为只有身强力壮,才能真正去干活。不然稍微搬点东西,自己都站不稳,那肯定不能干活。
所以我觉得,运动能力是所有机器人或者具身智能的先决条件。只有运动能力足够好,才能去干活。
卫诗婕
这段话结合整个具身智能行业的发展来听,其实很有深意。最后,我也想分享一下我个人对于春晚《武Bot》这场演出的一些看法。
这场表演中,机器人的搭档是来自塔沟武术学校、精心挑选出的少年演员。这组搭档本身就有寓意:在当下阶段,机器人就如同一个孩童,它也正在从孩童成长为少年。
所以我觉得,这场表演既体现了新兴技术的成长,也蕴含了一种希望。阿婆围着火塘添新柴,炊烟绕成云尾巴。
这里想特别夸夸人类小演员们的表演,很有生命力和感染力。就像我在采访开头所说的,武术和技术都需要漫长的苦功。我们要给新生力量更多耐心和喝彩。
我还观察到节目中对于人机关系的一些有趣体现。我贴图分享在了小红书账号上,欢迎大家去搜索关注。最后,我想再夸一夸具身智能行业的工程师们。
我曾经在《漫谈》的节目里不止一次说过,机器人背后其实更多是年轻工程师们的努力。因为工作关系,我在工厂、训练场等地不止一次看到过一批批年轻的95后、00后工程师。为了实现机器人的一些能力,他们要在这些地方长时间地坐冷板凳。
这期节目发布之前,我看到蔡明老师接受央视访谈时说,松延动力在昌平的训练场里没有暖气。数九寒天,工程师们手上都是冻疮,平均凌晨4点睡觉。
宇树的训练场条件稍微好一些,但在录制当天,我也看到了从舞台现场回来的宇树工程师们。他们迫不及待地泡上泡面,飞速收拾现场器材。旁边有人问他们为什么这么着急,他们说是因为赶着回家过年。
感谢所有科技创新企业,以及背后一个个具体的人。也希望大家能给予科技更多耐心,一起欣赏科技之美。
再次祝大家新年快乐。2026年,让我们一起描绘、定义、推动一个更美好的世界。好了,这期节目就是这样。欢迎前往微博等地观看这期访谈的视频版。如果可以,请在评论区分享你对宇树表演的观后感,或者这期节目的听后感,或者任何你想分享的新年祝愿,这将是对我们最大的支持。这里是漫谈 Light the Star,我们下期再见。阿婆围着火塘唱新柴,炊烟绕着云尾把。