# 90.人形机器人为什么执着于运动会？｜与天工熊友军的访谈

卫诗婕｜漫谈 Light the Star · 2026-09-29 · 86 min · https://www.xiaoyuzhoufm.com/episode/6aba6ee6195d838e2aeb3367?utm_source=rss

## 逐字稿

摇头晃脑，但是速度奇快。Hello，大家好，我是施杰。世界人形机器人大会获得了空前的瞩目，我们看到人形机器人刷新了人类短跑记录，他们无脸害羞的跑姿也深得网友的喜爱，获得了大量的讨论。今天的嘉宾是打造这款无脸跑的机器人天宫Omni背后的公司，北京人形机器人创新中心的CEO熊友军。创新中心在行业内被视作国家队，熊友军本人也曾是人形机器人第一股优必选这家公司的CTO。围绕这场参赛规模庞大的世界人形机器人运动大会，熊老师贡献了他独特的行业视角，也分享了很多幕后细节。我觉得这个运动会呢，本质上它是个极限测试的环境，在这个极限测试的环境里面呢，去扩展机器人本体的可靠性、稳定性，还有一些呃像运动能力的天花板吧。机器人通过它自己的学习，通过它自己的迭代，哎，它达到了，在我看来就是一个涌现。Scaling law在具身智能里面什么时候会体现？完全靠数据去堆积的话。这可能不一定是一个正确的一个方式。今天的具身智能产品虽然有这么多的公司在，但是大家本质上是没有竞争的。选择一个方向，需要把精力和资源投到你坚持的方向里面去，然后做时间的朋友。

卫诗婕

欢迎熊老师。先祝贺你们在今年的世界人形机器人运动会上获得了非常好的成绩，你们的天工 Omni 那个“无脸跑”的小机器人也爆火全网。现在是什么心情？

熊友军

谢谢，谢谢。基本上是在预料之中吧。平常心，胜不喜，败不忧，反正就是一如既往地坚持自己的产品和技术追求就好了。

卫诗婕

您说的“意料之中”，是指夺冠意料之中，还是被这么多网友关注也在意料之中？

熊友军

我说的是测试成绩在意料之中。至于被网友关注，那真是我们没有想到的。

卫诗婕

以防还有人没有看过那段视频，您给大家解释一下，为什么会出现“无脸跑”这个动作？

### 机器人学会了无脸跑

熊友军

我们那个跑姿，是机器人通过强化学习自己学出来的结果。我们当时给它做强化学习的时候，设置了一些惩罚函数和奖励函数，故意对它肩关节的转动角度做了一些限制。

机器人为了跑得快，需要自己保持平衡，于是训练出了那个跑姿。这确确实实是自我学习、自我进化的结果。

卫诗婕

之前我看过这个技术解读。以我们人体为例，跑步时挥动上肢，其实是为了保持下肢平衡。机器人最终舍弃了挥动上肢，因为挥动上肢的功耗在硬件方面不太允许，所以最后是靠腰部扭动来平衡下肢。

熊友军

是的，是的。

卫诗婕

你们在训练的时候，有没有觉得这个姿势很有意思？

熊友军

说实话，我们当时训练出这个跑姿之后，觉得它不是那么漂亮，甚至还想再训练一套更漂亮的跑姿。但是这个跑姿是最快的结果，所以我们也就让它去参加比赛了。

卫诗婕

所以我们现在看到一个趋势：机器已经可以自己学习，并发现最适合自己的优化方式，就像人类一样。

熊友军

是的。

卫诗婕

这算是具身智能的涌现时刻吗？

熊友军

我觉得算是一个方面吧。在具身智能领域里面，涌现可能还是很难在我们平常的生产生活过程中达到。但是机器人通过自己的学习和迭代，达到了这个结果。在我看来，这就是一种涌现。

卫诗婕

这次赛后“无脸跑”火爆全网之后，有没有感受到当年宇树上春晚之后的那种热度？

熊友军

这次我们的“无脸跑”好像上了好几次热搜。网上有各种各样的视频和解读，非常感谢大家的关注。这应该是对我们前期运动控制工作的肯定。

卫诗婕

其实这个行业整体受到大范围关注，最早是从宇树上春晚、转手帕开始的。

熊友军

对。第二年他们上春晚表演了武术。

卫诗婕

那两次节点，您当时在做什么？是什么样的心情？

熊友军

我们都很开心。这是行业的一个盛世，把人形机器人带到了普通老百姓面前，让大家真正感受到中国人形机器人产业的进步和发展。我觉得这对整个行业都是非常好的事情。

卫诗婕

您从事机器人行业已经有20多年了。遇到这样一个节点性时刻，有没有一秒钟想过，为什么没有发生在我的团队？

熊友军

没有。其实我做的机器人上春晚已经上过好几次了。优必选在2016年的时候就上过一次春晚，那时候是541台机器人上春晚：1台机器人和主持人一起做节目，另外540台机器人组成3个方阵，表演了集体舞。

后来 Walker 机器人也上过几次春节联欢晚会，只是那时候没有像今天这样引起大家的关注。

卫诗婕

您怎么看这次运动会上宇树的成绩，好像没有大家期待的那么好？

熊友军

可能宇树在关注其他方面的事情吧。其他几家公司也在全力往前奔跑，大家的投入方向不一样，确实可能会有不一样的结果。

我希望大家都参与比赛，不断推进机器人技术的进步，就可以了。

卫诗婕

我观察到一个很有趣的现象。大家赛前都会做准备，彩排的时候好像是9秒44，初赛之后又快了一些。后来发现对手也很厉害，于是继续迭代算法，不停突破极限，最后达到了8秒64的成绩。

所以，是不是当比赛把大家的创新汇聚到一起，达到一定密度的时候，就会刺激每一家的创新程度？

### 比赛推动具身智能进化

熊友军

对。比赛中大家都希望不断突破、不断尝试，我们也在不断测试机器人硬件的上限，摸它的天花板在哪里。当然，还有很多算法策略，大家都会做分析。

卫诗婕

AI本质上是一门实验科学。

熊友军

是。到底是借鉴人类的训练方式，还是把各种方法都试一遍，最后自己挑更好的？我们会有几种方案，都会去做测试，最终看比赛测试的结果。

在比赛之前，我们也在仿真环境里做了很多策略，所以这是一个综合考虑的因素。

卫诗婕

在仿真环境里训练，还是要给它很多数据吧？到底需要什么样的数据，最后才能让它自主探索出一个好的结果？

熊友军

我们会采集很多人类跑步的数据，包括跑步的姿态、怎样保持平衡、怎样摆臂，甚至包括脚关节、踝关节、膝关节在不同阶段、不同速度下的状态。

我们会用动作捕捉设备测试人的跑步姿态，再把这些数据输入模型，做一些基础的模仿。当然，这只是最基本的部分。还有奖励机制、惩罚机制和优化函数，这些才是最主要的。

另外还有各种约束条件，比如每个关节的最大扭矩、最大速度。它肯定会受到物理环境的约束。

刚才说到肩关节，其实我们就对它设置了约束，包括转动频率、范围、速度、角度和力量输出。我们限制它不让它输出那么大的力，因为总的优化目标是以最快速度跑完400米、1500米。

为了达到这个总目标，它还是要找到最优解，所以就让腰关节旋转起来。

卫诗婕

要跑通这么一套百米冲刺算法，现在用到的模型参数量是多少？

熊友军

我们确实已经训练出了一个通用运动控制器。这个通用控制器用了几百个小时的人类数据，行业里这方面的数据量应该都差不多。

我记得英伟达也有一个通用控制器，叫 Sonic，他们用了700多个小时的人类数据。我们也是差不多几百个小时的数据。

实际上，在我们第一次跑完马拉松并拿到冠军之后，就已经把运动控制相关代码全部开源了，包括训练范式。

机器人现在之所以能做很多复杂动作，比如托马斯回旋、空翻等等，其实都可以基于这一套 pipeline 完成。

卫诗婕

它大概是一个多大的模型？

熊友军

这个没有那么大，是比较小的一个模型。通用控制器本质上是垂直领域的模型。

即使现在已经有了一些比较好的性能，它跟我们人类期望的效果仍然有很大距离。我们还需要在运动控制和通用控制器方面做很多工作，包括把操作层面的控制纳入进来，甚至把灵巧手控制也纳入进来。

目前这个通用控制器主要是全身控制，但更多还是下半身。更复杂的操作需要更多数据，我们还没有达到那个阶段。

至于运动控制的 scaling law 需要多少数据，现在还真不知道。我们距离天花板还很远，甚至还没有摸到那个天花板，所以仍然需要更大的数据量。

卫诗婕

今年很多人都在提一个问题：scaling law 在具身智能里面什么时候会体现？我常常听到的答案是，先有1亿小时的数据再说，10亿小时可能会迎来 scaling law。您认同吗？

熊友军

这些判断基本上都是类比大语言模型得出的。具身智能的数据量毫无疑问会非常大。

至于需要多少亿小时，我没有准确判断，但我觉得千万小时的量级肯定是需要的。现在我们的数据距离这个量级还有几个数量级的差距。

我们现在训练一个运动控制器，也就用几百小时的数据；做世界模型和大模型，数据量其实也就是几十万小时、几万小时。

卫诗婕

您跟我看到或接触到的创始人非常不一样。通常他们还是会给我一个具体数字，您是第一个跟我说“我也不知道”的人。

熊友军

是真的。我们现在都还不知道。包括当前大模型，也就是具身智能世界模型的发展范式、机器大脑的发展范式，现在都还不清楚。

我们一直觉得，完全靠数据堆积，可能不一定是正确的方式。

卫诗婕

为什么？现在行业都在堆数据。

熊友军

这是当前不得不采取的解法。

卫诗婕

为什么是“不得不”？

熊友军

因为大语言模型在互联网上有大量数据可以使用，所以可以用“大力出奇迹”的方式做出来。

但到了具身智能时代，是否还是这种方式，还是要像人类、像小孩一样学习，遵循更好的学习机理，依靠探索和经验，这些都还需要研究。

人类只需要很少的数据，就可以实现举一反三的泛化能力。为什么机器人一定要那么大的数据量？这个范式还需要继续探索。

如果出现新的范式，可能真的能够做到 zero-shot，也就是零样本学习，或者少样本学习。所以我不一定认为一定需要几亿小时的数据，这只是当前阶段的判断。

卫诗婕

如果出现新的学习方式，比如自主探索，我们可能用少量数据就能做到。我自己是这么理解这个问题的：首先，新范式还没有收敛；当我们确定一种新范式之后，这个新范式到底需要什么样的数据，以及这些数据和现在大家采集的数据是否完全一致，也都是未知数。

熊友军

对，这确实是值得探索的事情。

当前的范式，比如 VLA 模式、4D 模型、大一统模型，甚至多模态模型加 VLA，本质上都还没有收敛。但当前确实有一些方式可以落地。

比如 VLA 模式，适合在相对结构化的环境中做一些具体工作，比如工厂里的特定任务。它适合定义好的场景，环境相对结构化、可控。

但如果希望看得更远，就可能需要新的东西。一旦涉及人机交互，涉及突发的环境变化，就可能需要多模态大模型。世界模型可能需要对长程任务做更多预演，随着复杂程度增加，对模型的要求也会不一样。

卫诗婕

这次世界人形机器人运动会和 WRC 世界机器人大会，是两个独立的大会，但刚好有两天重合。我有一个观察：今年行业整体都进入了具体场景干活的状态。

相比往年，大家更多是在展示运动控制和表演。但今年头部厂商都在卷工业场景和具体工作场景，已经可以干活了。这个时候大家再去比运动控制，意义是什么？为什么要搞一个运动会？

### 运动会检验机器人大脑

熊友军

我觉得这个运动会本质上是一个极限测试环境。在这个极限测试环境里，去拓展机器人本体的可靠性、稳定性，以及运动能力的天花板。

这应该是在为机器人未来真正大规模进入工厂、商场或者家庭环境打基础。

今天你在 WRC 上看到的一些展示场景，距离真正商业化、生产化的真实环境，还是有一定差别的。工厂里面要求7×24小时运行，流水线上甚至需要99%的成功率和可靠性，这些我们都还需要努力。

今天 WRC 展示的内容是一个很好的趋势：大家从原来的表演式、实验室里的技术展示，开始走向工业和国民经济的主战场。这是行业里非常好的现象和趋势。

但这些都还需要很多底层技术支撑。

卫诗婕

哪些底层技术？

熊友军

硬件的可靠性和稳定性、能源，以及运动控制算法等。

本质上，运动会是给大家设置标尺和训练场，让大家在同一个训练场里锤炼机器人、锤炼算法，一起去摸高。

运动会也是观察本体、供应链和能源极限的窗口。每年就像一场汇报大赛，大家带着自己的极限来到这里，你大概就能知道行业现在的极限在哪里。

卫诗婕

因为本体跟大脑是紧密关联的。一个再好的大脑，如果脱离一个好的本体，也可能发挥不了作用，就像脑和手之间的关系。

熊友军

没错。

卫诗婕

今年相比去年，在硬件方面最大的突破是什么？

熊友军

今年最大的感受是，自主运行的机器人越来越多了。

去年大家基本上还是拿着遥控器。去年全场200多台机器人，只有我们的天工是完全自主参赛的。今年田径赛事除了障碍赛偶尔需要遥控以外，其他项目都是全自主的。我觉得这是非常大的进步。

卫诗婕

为什么去年只有你们一家能做到自主，其他机器人还需要拿着遥控器跟着它跑？

熊友军

可能是大家平时对大脑的重视和投入还不足。

实际上，我们第一次参加马拉松比赛之后，创新中心就开始把大量资源和精力投入到机器人大脑的开发上。

我们在2024年推出天工机器人硬件本体通用平台之后，后面又推出了“慧思开悟”机器人大脑。这个大脑主要负责感知、决策、认知和学习。

之后我们陆续推出了 VLA 模型、UniPerceiver 统一世界模型、多模态大模型等。这些工作都是我们在大脑方面所做的努力。

我们充分意识到，大脑对于机器人的作用是不可替代的。

卫诗婕

不可替代的作用是什么？

熊友军

机器人的终极目标，是融入未来人机共融的社会。它需要像人一样感知环境、自主学习、自主决策和自主规划。

只有一个好的身体和一定的运动能力，远远不能适应人类社会。不可能在复杂、危险的场景里辅助人类完成各种工作。

卫诗婕

您说今年大家都摆脱了遥控器，可以自主运行，究竟是什么技术带来的？还是说这只是花时间就能做到的事情？

熊友军

首先是整个行业都在进步，大家都把更多资源投入到机器人大脑上。资源投入带来了人才投入。

本质上，这次运动会是机器人大脑进步的一次展示，但运动赛展示的大脑能力其实很小，只包括感知跑道线、识别弯道、判断什么时候压弯，以及根据环境变化调整跑姿和奔跑策略。

实际上，现在多模态大模型和世界模型方面的进步远远超过这些内容。一个运动会还不足以呈现它们的成果。

卫诗婕

今年的运动会还设置了场景赛，有几十种场景，但仍然不足以体现现在世界模型的成果。

熊友军

对。尤其是长程任务规划、错误反思，以及环境变化等能力，目前都还没有充分表现出来。

我猜这应该是比赛未来的发展趋势：更多体现机器人大脑进化的能力。

卫诗婕

我采访过的嘉宾中，不止一位提到，虽然具身智能行业吸纳了非常多资金，也有很多创业公司声称自己在做大脑，但判断一家公司是否真的在做大脑，有一条标准线：它能不能拥有千卡有效算力，去训练一个真正的大脑模型。

但现实是，在这个行业里，真正不依托政府和大厂、能够拥有千卡有效算力去训练大脑模型的独立创业公司，不超过5家。您认同吗？

熊友军

具体有多少家我还真不知道，没有做过统计。但这个判断标准我觉得是对的，因为要做大脑，前期训练的算力要求非常高。

所以我们很早就让百度成为投资人。百度有大量云端算力，我们也使用了他们非常多的算力。

当然，只有算力还不够，还需要数据。我们自己建设了具身智能数据采集中心。今天我们的数据采集量已经非常大，年采集量接近20万小时，而且都是高质量数据。

我们也要承担国家创新中心的职责，所以把这些数据全部开源了。目前下载量已经超过2000万次。

此前我们也和高校、科研机构做过几次活动，不断释放我们在具身智能大脑方面的进展。

最初我们自己建设了算力中心，就在自己的大楼里。刚开始还能应付，但随着技术进步、数据量增加和模型迭代，发现这些算力远远不够了。后来我们开始寻找第三方算力。

今天除了百度的算力以外，其他几家云端算力我们也都在使用。

卫诗婕

这说的是训练阶段。以后部署之后，可能还需要推理算力，推理又是一个更大的需求。

熊友军

对。推理算力会更大。当然，随着客户使用，推理成本也可以被分摊。

卫诗婕

所以自建算力只能在一定阶段内有效，超过一定程度之后，就不是一家独立创业公司能够承担的事情了。

熊友军

是的。

卫诗婕

20万小时量级的数据，在中国是什么水平？在全球又是什么水平？

熊友军

至少在公开数据里，我们算是体量非常大的一个数据集。这些数据都是我们自己训练过，并且被证明是高质量的数据。

卫诗婕

您怎么判断数据质量高不高？

### 高质量数据走向长程

熊友军

我们在采集数据时，非常关注几个方向。

第一个是多任务，第二个是多本体，关注任务和本体的丰富性。第三个是多场景。

我们还会关注更长程的任务，以及需要逻辑思考的任务。现在很多数据都是基于 Ego，也就是第一视角，主要是桌面上的抓取和放置，这类数据已经很多了。

但真正的具身智能需要长程任务推理，甚至需要触觉反馈，也需要错误案例和反面案例。这样的数据实际上是稀缺的。

卫诗婕

具身智能领域的数据，感觉一直有一个主流。今年年初的时候，UMI 很火，现在可能大家都在做 Ego。这个过程经历了怎样的变化？

熊友军

没有对错。大家训练时首先觉得数据缺，所以当 UMI 出现时，发现它对训练模型有效，大家可能都会做 UMI，于是它就形成了阶段性的行业共识。

但到了某个阶段，这类数据可能已经不缺了，就要去探索其他方式。

Ego 相对来说成本低、容易获取、采集量也比较大。它本质上就是在头上绑一个摄像头，用视觉方式捕捉人类操作信息，让机器人从视频中学习。

卫诗婕

第一视角的方式。

熊友军

对。在 Ego 之前，实际上是全身遥操作：现场有一台真实机器人，人穿着动作捕捉服，或者拿着遥控器，去遥控整台机器人。

这种方式需要布置很多场景，还需要投入真实机器人，成本很高。

Ego 只需要一个工人在工作时戴上设备，把数据采集下来就可以了，成本大幅下降，采集速度大幅提升，而且场景非常丰富。这就带来了 Ego 数据的大量繁荣。

卫诗婕

平均多久之后，大家会发现某一种数据采集方式的天花板或局限？

熊友军

这取决于模型进步、训练方式变化，以及迭代速度和周期。大家多久会发现 UMI 有局限、Ego 也有局限，我还真没有统计，估计半年左右吧。

卫诗婕

Ego 的下一个主流，您觉得会是什么？

熊友军

我还没有判断。至少从我们的角度来说，我们现在更关注长程任务，包括完成这些任务的逻辑是什么。

我为什么第一步做这个事情，第二步做那个事情，第三步做另一个事情，中间的逻辑是什么？这有利于机器人进行推理。

可能还需要增加多模态。除了语音和视觉视频以外，有时还要加入力觉和触觉。这些可能是当前采集模式需要补充的部分。

卫诗婕

我觉得具身智能要回答一个非常重要的第一性问题：我们现在甚至无法用一句话说清楚，人做一件事情到底依靠什么，人究竟是如何完成一件事情的。有哪些向量、哪些维度，可能有助于机器人理解物理世界？

一旦探究到本源，有时候就会上升到哲学层面。

### 机器人需要自主探索

熊友军

现在具身智能的学习范式里有很多不同的声音。我们目前这种基于数据驱动的方式，一直都有不同的意见。

就像你刚才说的，人为什么要做一件事，我觉得更多可能涉及价值驱动理论。国际上也有学者提出，能不能让机器人拥有价值观。

比如，机器人为什么要去捡垃圾？我们现在的做法是告诉它什么是垃圾，再告诉它垃圾桶在哪里，然后让它把垃圾放进垃圾桶。

但机器人为什么知道要捡这个垃圾？垃圾放在这里不好吗？

在人类社会里，我们认为环境应该保持整洁，这背后有一个更高层次的世界观。有了这个世界观，机器人看到垃圾之后，才会自然而然地主动去做这件事。

所以，机器人学习的方式可能还需要发生很多变化。

前段时间，图灵奖得主 Richard Sutton 也来创新中心交流。他跟我们讲了很多机器学习领域国际上最前沿的技术。

实际上，他强调的也是强化学习模式：不是给机器人大量数据，而是设置规则，让机器人自主在环境里探索，边探索、边反馈、边纠正、边学习、边提升，形成一个类似 PDCA 的循环，螺旋式上升。

这种方式不需要太多数据，而是需要给它一个好的环境，设置迭代方向，让它自己在里面探索、失败、纠正、改进和提升。通过多轮迭代，它就能自主向前发展，甚至可能超越人类。

很多类似的学术理论和范式正在交织。最终哪一种能够走出来，还需要一段时间探索。

但我依然坚信，当前阶段能够落地的，确实包括 VLA、多模态大模型和世界模型。它们是有效的，其中有确定性可循。

能够产业化的先产业化，能够用起来的先用起来，我觉得这都没有错。本质上，我们需要一部分接地气，同时也需要仰望天空，看看这个行业真正能够发展到什么地方。

卫诗婕

您提到 Richard Sutton，他的《苦涩的教训》应该是行业里大家都会读的一篇论文。您和机器人打交道20多年，在实践过程中，有没有对这个原理产生特别强的共鸣？

熊友军

这样的时刻挺多的。

早期我们做机器人时，比如运动控制，都是基于数学模型的运动控制方式。我们规划好机器人每一步要做什么，通过数学模型求解，再把结果复制给机器人，让它按照要求一步一步执行。

每一步都可以预测，也可以判断。但这种方式反而限制了机器人的发展，因为机器人基本上就是一个傀儡，环境稍微变化，它就完全不能工作，也体现不出智能。

当时大家都很困惑：机器人的未来方向在哪里？是不是这条路已经走到尽头了？

2010年以前，基本上都是这种范式。要让机器人完成一个很简单的工作，我们都要写上万行、几千行代码。

卫诗婕

那您对机器人的热爱，最早可以追溯到什么时候？

### 本田机器人点燃梦想

熊友军

可能是读书的时候，应该是那时最狂热。从博士开始读博士时，我有几位导师，其中有几位院士给我们上课。

他们给我们播放了当时日本本田 P2 机器人的视频。P2 是 ASIMO 的前身，前身还包括 P1。

卫诗婕

那时还没有发展到 ASIMO 那么好的程度。本田机器人是那个时代机器人技术的巅峰象征吗？

熊友军

那绝对是王者，是我们所有搞机器人、学习机器人技术的人仰望的对象。

当时我们看过一个视频，是熊有伦院士给我们播放的。视频里，P2 接待我国总理参观本田工厂。

卫诗婕

那是哪一年？

熊友军

我看到的视频应该是2002年。

卫诗婕

那时波士顿动力还没有出现吧？

熊友军

还没有。

我们当时读博士，做的都是焊接机器人。我们的博士课题，都是研究工业机械臂如何解决焊接问题，如何让机器人的焊缝更加均匀、美观，更好地适应焊缝变化。我们为这些问题焦头烂额。

但人家的机器人已经可以在生产线上带着人参观了。本田的流水线也非常震撼，全部是各种各样的机械手臂。

我们当时觉得，差距真的不是一点点。

卫诗婕

所以那个画面点燃了您对机器人的热爱？您觉得自己热爱的是什麽？

熊友军

我应该是被那个场景、那个画面感染了，觉得这就是未来。

后来随着研究不断深入，我越来越真实地感觉到，未来应该是人机共融的社会。以后具身智能会深入方方面面：家庭、商业、工厂，各种极限环境，以及未来更远的星辰大海探索，可能都可以应用。

卫诗婕

您提到 ASIMO 的前身 P2。ASIMO 后来停产，好像从来没有真正量产，也没有进入真实生产场景。对那个时代的本田来说，它可能更像一个技术宣言，而不是产品路线图。

后来我们看到 ASIMO 退出舞台，本田也很快失去了机器人领域的全球领导地位。您觉得这是为什么？

熊友军

我觉得这和技术进步、范式迭代有关。

在人形机器人发展的历史长河中，经历了好几轮迭代。本田应该从1986年开始投入人形机器人的研发。它借助日本通产省几次产业倡议，利用日本在汽车领域精细的零部件制造、可靠性和稳定性，以及精密加工方面的优势，把技术钻研到了极致。

所以他们当时做出的机型非常领先。但这种领先，是基于传统数学模型求解范式的领先。

当时自然语言处理很差，视觉处理能力也很差，算力也非常不足。机器人背后都背着一个很大的背包，实际上那就是一台工业计算机。

但毫无疑问，他们通过探索给我们描绘了非常美好的人形机器人未来。今天我们做的很多事情，其实还没有超出他们当时描绘的那幅美好图景。

卫诗婕

资本市场花了多久才认为本田提出的 ASIMO 畅想不切实际，把它放到一边？还是说另一个巨星崛起之后，一个时代就过去了？

熊友军

我更偏向你后面这种说法。

后来深度学习技术出现，大模型发展，人工智能技术不断迭代，把原来基于数学模型的整套范式逐步抛弃了。

人机交互和视觉技术不断提升，现在很多能力都归结到大模型里。技术迭代让机器人拥有了更广泛的适应能力。

但我觉得本田当时没有理解这个行业巨大趋势的变化，就像诺基亚错过智能手机时代一样。

卫诗婕

从深度学习一直到大模型伴随出现的机器人化时代，代表性产品分别是谁？ASIMO 之后是谁？

熊友军

ASIMO 之后，当然还有阿特拉斯。后来法国的阿尔德巴兰公司做了 NAO，还有 Pepper，Pepper 后来被日本软银收购了。

卫诗婕

NAO 和 Pepper 这样的产品，给行业带来的启示是什么？

熊友军

它们让大家看到，商业服务和家庭服务可能有非常大的市场前景。

其实这个需求一直都在。之所以没有做起来，并不是市场不认可，而是技术还不行。

今天的具身智能产品，虽然有这么多公司在做，但大家本质上并没有真正竞争，因为这是一个巨大的蓝海。

每家公司只要把自己的产品做好，解决某个垂直领域的问题，市场就足够大。这也是投资人还在持续下注的原因，因为赛道足够大、足够长。

卫诗婕

一个行业要出现 killer 级的产品，还要多久才能等到那样一款产品？

熊友军

这个问题确实很难回答。一般做时间预测，基本上都会犯错误，甚至会因此失败。

我觉得这个行业充满了不确定性。

卫诗婕

从20多年前您读博开始，肯定也有过这样的梦想。您人生中有没有某一刻认为，多少年之内它会出现？

熊友军

博士刚毕业的时候，我也充满激情，觉得这个梦想很快就能实现。

卫诗婕

十年之内？五年之内？

熊友军

还真有。当时觉得这一天很快就会到来。

卫诗婕

所以这个想法指引着您博士毕业之后进入机器人行业吗？您是直接加入优必选的吗？

熊友军

不是。那时候在上海，我也在一些机器人小公司、创业公司工作过。

但你也知道，2000年代那时候，大家的关注点不在这里。那时可能是互联网、移动互联网，后来是房地产。我们当时想拿到投资都很难。

所以机遇和 timing 都很重要。

卫诗婕

我查到您本科读的是汽车相关专业，后来又读了机械设计。其实您有很多次机会，只要转身就可以加入曾经吸纳大量资本的新能源汽车行业。为什么始终没有做这个选择，始终留在机器人行业？

熊友军

就是喜欢，没有别的。

当你喜欢一个人的时候，就会爱屋及乌，喜欢他所有的东西，连他的缺点也会喜欢。失败了，也会觉得这是一次考验、一次磨炼、一次成长。

这些东西是刻在骨子里的。

卫诗婕

为什么加入优必选？因为它当时只是一家普通的创业公司，而且是非常早期的创业公司。

熊友军

那时候我们去的时候就几个人，只有几张办公桌。

卫诗婕

您毕业之后一直做机器人，也做出了一些行业认可的影响力，为什么会选择这样一家公司？

### 优必选靠坚持成长

熊友军

早期我们在上海做机器人，主要偏工业和教育领域。但在优必选，我们的梦想是走入家庭，做家用家庭服务。这是我梦想版图里最终的那一部分，非常符合我的想法和理念。

当有一家公司告诉你，它就是要做这件事时，就像找到了知音，所以我义无反顾地加入了。

哪怕遇到很多困难，从2012年3月注册，到后来上市，优必选经历了很多起伏，但我们都坚持下来了。

卫诗婕

优必选创始人周剑老师，被媒体塑造成一个“机器人疯魔”的形象。他为了做机器人付出了很多，也投入了大量时间和资金，经历过很多至暗时刻。

您当时认识他的时候，在您眼中他是什么样的人？

熊友军

他是一个狂热的追求者，也认可机器人未来巨大的市场前景，和我的想法不谋而合，有一种找到知音的感觉。

卫诗婕

你们俩谁更狂热？

熊友军

我可能在技术领域更狂热，他可能在市场和应用层面了解得更多。

卫诗婕

是他说服您加入的吗？

熊友军

对，确实是这样。当时我在上海，他已经在深圳了。

卫诗婕

他用什么话打动了您？有没有一个具体画面？

熊友军

应该说是他的激情、愿景，以及我们共同的一些想法。

当时团队还没有成型。

卫诗婕

听说你们之前会彻夜长聊？

熊友军

说实话，更多是相互打气、相互取暖。

有时候员工都下班了，我们两个人还在办公室里讨论公司的未来怎么做、发展方向是什么，甚至未来的蓝图是什么样。那时候是真的在做梦。

梦做好之后，还要把这些梦告诉员工、告诉团队，甚至告诉投资人。

卫诗婕

如果对方不相信怎么办？

熊友军

那就去找同路人。这个世界这么大，不可能所有人都相信你，总会有人相信你。

卫诗婕

有没有梦破裂的时候？

熊友军

那可多了去了。

优必选在人形机器人领域做了很多开创性的工作。我觉得，它在这个领域的地位不亚于日本的 ASIMO 和美国的波士顿动力。

卫诗婕

为什么？

熊友军

因为在技术探索方面，优必选是最早开始做的。

当时我们推出第一代 Walker 原型时，很多行业人士说我们是抄 ASIMO 的，说我们把 ASIMO 买回来之后换了一个壳。网上有很多这样的说法。

卫诗婕

但这完全不可能，对吗？

熊友军

对。当时 ASIMO 的技术完全封闭，绝对不开放。Atlas 当时还有美国国防部和 DARPA 支持，也同样是封闭的。

所以所有技术都要我们从底层开始做。

我们最早做的是两条腿：两条腿怎么走起来，怎么上下楼梯，怎么走斜坡，这些都是最早探索的技术。

卫诗婕

那时候只做两条腿，是因为只能做两条腿吗？

熊友军

对。因为太复杂了，再做上半身会更复杂，控制不了，只能一步一步来。

所以很多技术都是原创的。

包括关节。当时我们想过不做关节，直接购买德国或韩国的产品，但那时候他们的关节质量很差，很容易坏。后来没办法，只能自己做关节。

卫诗婕

你们自己做关节、自己造两条腿机器人，应该远早于王兴兴在实验室里做机器人吧？

熊友军

是的，是的。

卫诗婕

那个时候中国可能还没有人形机器人的供应链。

熊友军

没有现成的人形机器人供应链。

不仅没有供应链，2012年、2013年的时候，大家都在关注手机。那时候做手机很赚钱。

我们设计出图纸之后，想找工厂加工，还要去求别人。没有人看得上这种小生意。我们的技术要求高又复杂，公司当时也比较穷，还要抠成本。

人家问你要多少，你说做10台、20台，人家拿手机订单给你看，都是 K 级、百万级的订单，当然看不上我们这种小单。

所以那时候要把零部件加工出来，还要利用别人机床的空隙，请工厂厂长吃饭，和机床操作师傅喝酒，人家才愿意认真帮你做。

很多事情都非常麻烦，真的可以写成一本书。以后退休了，我可能会写一本回忆录。

卫诗婕

好像有一部电影叫《青春之城》，拍了你们当时创业的艰难时刻。

熊友军

对，也拍到了一些优必选创业的艰难时刻。

卫诗婕

回忆优必选的艰难时刻，您脑海里立刻浮现的画面是哪几刻？

熊友军

没有。现在回忆起来，更多是比较开心的时刻和高光时刻。

在我的印象中，整个过程都很享受。刚才说到的春晚，2016年我们第一次上春晚，我觉得是一个很高光的时刻。后来上市也是一个高光时刻。

卫诗婕

您在优必选拉起的是一个什么样的团队？以您的个人风格，应该会组建一个研发气质很强、具有技术理想主义的团队。

熊友军

我觉得不是一类人，很难走到一起。

首先，底层核心价值观肯定要相通。创新中心的核心价值观是：正直、自驱、合作、极致。

正直是第一原则。首先人品要好，我觉得要做好事，先要做人。这是我招募团队的第一原则。

第二是自驱。具身智能时代，一定要有比较高的理想，志存高远。不管我在不在，你都要努力工作，为梦想去打拼。

第三是合作。机器人是一个集大成者，涉及方方面面，肯定需要团队协作。

第四是极致。工作不能做到95分就觉得够了。很多人觉得做到90分已经很了不起，但我说，做不到120%都不达标。

机器人产业链非常长，如果每个环节都只做到90%，最后累积起来就会差之毫厘、谬以千里。这是我对产品的要求。

卫诗婕

后三点比较容易观察，正直怎么判断？

熊友军

其实就是一种感觉。

行业发展到一定程度之后，大家甚至比拼的是体力、人品和底层三观。你是否认同这个梦想？你怎么看未来的具身智能和人形机器人产业？这些决定了你能不能走远。

这么多年，人形机器人产业有高潮也有低谷。很多人是在高潮时进来的，到了低谷就离开了。

现在看起来行业又处于高潮，大量资金进来，希望蹭一波热度。等行业遇到低谷时，这些公司还会不会坚持？不一定。

我们在2010年代的时候，也经历过一次人形机器人行业的高潮。当时很多公司和今天一样繁荣，但真正走到最后，发现很多公司都不在了。

遇到低潮时，很多公司坚持不下去，或者不想坚持。他们觉得有更好的赚钱方式，比如房地产、移动互联网、智能手机，这些当时都比机器人更赚钱，于是大家都去做能赚钱的事情了。

没有梦想，就走不远。我需要找到同路人，所以整个团队基本上都和我有相同的气质。

卫诗婕

您刚才提到第一项是正直。这让我想到这一届人形机器人运动会，有团队被主办方退赛，是因为违反了规则。

大家都声称是自主参赛，但赛方查出有团队是假扮自主，实际上使用了遥操作。

我很好奇，既然这个行业已经可以实现自主泛化，应该说这是行业的平均水平了，为什么这一届人形机器人运动会仍然保留遥操作？既然大家都可以自主了，为什么还需要遥操作？

熊友军

在有些情况下，遥操作也是一个很好的补充。

卫诗婕

比如什么应用场景必须要遥操作？

熊友军

在一些比较特殊、危险的场景里，单机本体可能不适合完全自主操作。

比如操作道闸、电力设备、配电箱和配电柜。如果操作错误，可能会造成比较大的影响。有时候为了确认，最后需要人工介入判断，这时就可能需要遥操作。

简单来说，在当前人工智能和机器人大脑还不够发达的时候，要把人的智能和机器的智能结合起来，完成一些超出当前机器人能力的工作，就需要人的介入。

但遥操作也不是普通老百姓想象的那种遥操作。普通人理解的遥操作，可能像遥控玩具、遥控车一样，按一下遥控器，机器人前进、后退、左转、右转。

其实今天具身智能里的遥操作是行为级别的，也有任务级别的，是分层次的。

最低层级的遥操作，是每一个微小动作都需要人发出指令，完全是一步一趋。行为级遥操作可能是给机器人一个指令，比如“把这个杯子拿起来”，让它完成一个小的行为。

还有一种是任务级遥操作。今天人工智能已经发展到一定阶段之后，真正把人的智能和机器智能结合起来。比如在变电站里，机器人看到一个开关亮红灯，需要判断是不是要把开关扳动，让它变成绿灯。

这时机器人判断需要人介入，人给它一个决策：把这个开关扳下来。之后机器人自己走过去，可能还要绕过障碍、打开一扇门，完成一系列复杂操作。

人给的是任务决策，机器人负责具体执行。这是一种更高级的任务级遥操作。

这种遥操作也有很高的技术含量。人给出更高层级的决策，机器人负责具体执行，不再是过去那种傀儡式操作。

卫诗婕

明白了。所以您刚才说，这次比赛中关于遥操作的争议，和你们的价值观是冲突的，需要裁判根据规则进行约束。

熊友军

对。

卫诗婕

这次大赛我们还看到很多非纯机器人公司加入进来，比如汽车领域的公司、手机领域的公司。

今年4月的马拉松，荣耀最终夺冠，是所有人眼中的黑马。您怎么看荣耀这样的厂商也来做机器人？

熊友军

这说明产业在繁荣，大家也看好未来市场。大家一起把这个行业推向更高的高度，我觉得这是好事。

卫诗婕

汽车领域有小鹏为代表，手机领域有荣耀为代表，大家都跑来做机器人。您觉得他们为什么来做机器人？他们都是商业化公司。

熊友军

最底层的原因可以说都是为利而来。大家应该相信这是一个万亿级的蓝海市场。

今天投入1个亿，明天可能赚10个亿、20个亿，甚至100个亿。大家应该看到了这是一个值得进入的市场。

卫诗婕

今年运动会上最后的决战，简直就是“红白大战”：你们的机器人是白色的，荣耀的机器人是红色的。一个代表原生机器人公司，一个代表硬件厂商。

手机和汽车公司对供应链的管理能力，以及对极致制造的追求，应该是它们的优势。两派公司各自有不同的优势和风格，放在一起竞争，您觉得能看出什么？

熊友军

我看出来的还是技术取胜。

首先，荣耀跑得非常好，我也很认可荣耀的技术和投入。

我觉得，只要大家朝着一个目标前进，真正去做工作，就都能取得比较好的成绩。

卫诗婕

作为一个行业专家，当您看到硬件厂商展现出不俗的硬件和技术实力时，会不会产生一些意想不到的后续判断，需要更加留意这类玩家？

熊友军

第一年马拉松，荣耀作为黑马拿到第一名之后，大家可能会觉得，机器人领域里的硬件和运动控制是不是已经没有太多门槛了？

好像任何公司只要往里面砸钱，就能取得好成绩。于是有人会认为，原来做机器人的公司已经落后了，未来是资本的天下。

荣耀今天砸多少钱就拿第一名，明天一家互联网公司随便砸5个亿、10个亿，是不是也可以超过所有机器人公司？那是不是机器人公司都可以出局，不用干了？

当时很多人，包括资本，都提出过这样的看法。但这可能还是有些片面。

机器人赛道绝不是一家或两家公司，或者一次性投入就能做好的。这是一个需要长期积累的赛道。

你可以采取简单粗暴的方式，在某个单点上取得短期成绩，但如果真的想为行业做贡献，达到很高的高度，把机器人推向千家万户，就需要长期积累和持续挑战，做很多底层工作。

所谓“板凳要坐十年冷”，就是这个道理。

我一直反对行业一火起来，大家就往里面砸钱。互联网公司、造车公司、手机公司都进来了，好像这是一块唐僧肉，大家都想吃一口。

但产业长期繁荣需要长期积累，需要真正进行大量底层创新，也需要耐心资本。

卫诗婕

您会怎么判断一家机器人公司是不是一家好公司？

熊友军

好的公司首先要有好的核心价值观，使命和愿景也很重要：这个公司为什么而生？

卫诗婕

那么多机器人公司，愿景应该都类似，都是让机器人进入千家万户、进入人类社会生活。

熊友军

这个愿景当然都很好。但有了愿景之后，下面每一步行为是不是围绕愿景展开，具体打法可能会不一样。

要看清楚自己在行业中的定位，也要看团队擅长什么、拥有怎样的禀赋和资源，并把这些结合起来。

有的人对市场了解很深，对生产制造和机器人在工业中的应用有经验，可能就会做这方面的工作。

有人可能更了解医药、养老和健康领域，就可能去做外骨骼等产品。

我觉得这些都很好，关键是要有自己的独立判断和独立思考。跟风的话，最终可能会被淹没在具身智能的浪潮里。

卫诗婕

您刚才说“板凳要坐十年冷”。您在优必选的十多年，其实已经经历过冷板凳阶段。这段经历给您最深刻的影响和认知是什么？

熊友军

我觉得就两个字：坚持。

坚持真的很重要。选择一个方向，就要把精力和资源投入到坚持的方向里，做时间的朋友。

确实有很多非常艰难的时刻，很多时候都可以放弃。放弃是一件非常容易的事情，反而坚持下来没有那么容易。

当年和我们一起创业的很多公司，后来走着走着就不在了。

卫诗婕

很多人把这一轮智能革命比喻成另一种工业革命。

工业革命之前，人类社会的生产系统围绕人力设计；蒸汽机的动力被验证之后，整个社会生产系统转而围绕动力设计。

如果以工业革命作为一面镜子，也许当智能能力发展到一定阶段之后，整个社会的生产设施也会转型，从以人为中心，变成以人、机器人和 AI 为中心。

整个设施架构和体系都会变化，所以人形并不一定是终极答案。

### 人形机器人连接未来

熊友军

我同意你的看法。那我们为什么还要拼命做人形？为什么不能绕过人形？

这又回到我们个人最底层的逻辑，也就是你的三观是什么。

我做人形机器人的底层判断是：未来社会会是一个人和机器共融的社会。机器人会成为我的朋友、伙伴，甚至家人。

卫诗婕

那为什么一定要做人形？什么样的机器人会成为您的朋友和家人？它会是轮式机器人，还是爬行机器人？

熊友军

我觉得不会。

成为我朋友的机器人，一定是我能接受的，能够自然地和我交流、理解我的机器人。

如果让我和一个看起来奇奇怪怪、动作和行为我都无法理解、从来没有见过的形态交流，那绝对不是我希望的形态。

人形机器人能够适应我们的工作，无缝连接到生活和生产环境中。它可以操作我们已经习惯使用的各种工具，不需要改造环境、设备和工作流程，拿过来就可以用。

它不像手机，我还要解锁、输入密码、打开 App。机器人来到我身边，我一个手势、一个眼神，它就明白我的意思，马上帮我办好事情。

它也不像电脑和手机，还需要键盘、鼠标和各种 GUI 转换。它可能成为第三代人机交互中心。

大家今天诟病人形机器人，无非是因为技术复杂、成本高。但如果这些问题都解决了呢？

一个很聪明的机器人可以完成所有工作，你会选择买手机还是买机器人？那时候我根本不会考虑手机，电脑也不需要了。

如果一个很聪明的人形机器人和一条机器狗放在你身边，你会选择什么？我们做过很多测试、调研和对比。

当大家忘掉成本，忘掉背后的技术复杂度，只做直接选择时，毫无疑问，大家会选择人形。我需要这样一个人，给我提供情绪价值。

未来社会可能是一个“三体”社会：一个肉体的熊友军，一个机器人的熊友军，还有一个数字人的熊友军。

我的肉体总有一天会死去，但通过脑机接口，我可以把大脑中的知识储备和过往经历输入数字人，也可以输入机器人的熊友军。说不定这样就能实现某种意义上的永生。

我觉得这可能是未来人机共融社会的一个直观画面。

卫诗婕

我个人不是这一派，但没关系。我们更多是呈现每个人所相信的世界。

您在优必选期间应该深度参与了 Walker 系列。Walker 一开始定位家用，但最后还是先选择在工业场景落地，就像今天大部分具身智能公司选择的商业化路线。

为什么最终会有这样的转折？这是一种妥协，还是另一种坚持？

熊友军

我觉得这是现阶段技术局限和公司需要获得商业回报共同作用的结果。

Walker 走入家庭是长期愿景，但以当前情况来看，进入家庭确实还有难度，涉及安全、标准等问题，很难在短期内取得重大突破。

所以基于当前技术状态，让它进入工厂，在结构化、可变现的场景中完成工作，我觉得是一个正确选择。

同时，在人形机器人大量进入工厂一线的阶段，也可以采集大量数据，加快 Walker 系列的迭代。

卫诗婕

几乎所有头部公司都不会放过工业场景。但我确实发现，有几家公司做物流分拣时，节拍明显快于其他公司，或者稳定性更高。

目前展示出来的工业场景中，表现更好的机器人究竟强在哪里？是算法、硬件可靠性，还是其他维度？

熊友军

现在我觉得，大家在工业场景中的表现还处在同一个 level，没有看出非常明显的代差。

卫诗婕

您说的是 WRC 展出的状态，还是实际落地的状态？

熊友军

我说的是 WRC 展出的状态。

卫诗婕

新松的高继阳说过，假设人完成一个任务是100%，机器人现在的速度大概能达到六七成，也就是70%左右。您认同吗？

熊友军

要看不同场景。

卫诗婕

比如分拣台分拣？

熊友军

以人的最快速度来看，我们在京东流水线上看到过，一小时基本可以达到2000多件。

卫诗婕

今天比较快的，FANUC 可能能达到1500多件。国内也有1200多件、1000件、1300到1400件的水平。

到底是什么决定这种差异？是算法、硬件，还是什么？

熊友军

这是综合能力的体现。

算法当然很重要，还包括针对场景进行深度定制，以及模型和大脑的能力。

包裹的变化非常多，尤其是真实流水线上，有十几种不同的包装：硬包装、软包装，还有塑料袋。需要采集各种各样的数据进行训练。

在这个场景里训练出一定的泛化性，比如识别不同颜色、不同包装，判断不同大小和形状，都是可以做到的。

卫诗婕

靠 VLA 技术可以实现，对吗？

熊友军

对。这相对来说是一种泛化性，场景变化不是特别多。

卫诗婕

您应该是在2023年11月成立北京人形机器人创新中心。这个公司和其他具身智能创业团队非常不一样，大家把你们称为“国家队”。

你们名称后面还有“国家地方共建”几个字，所以简称“国创”。我们应该怎么理解“国家队”这个定位？您为什么会从优必选，从深圳来到北京做这件事？

### 国家队建设开放底座

熊友军

在优必选，因为它是一家商业化公司，我的定位是 CTO，主要负责技术探索和产品研发，目标是实现最大的商业化。

但在这里不一样。我需要站在国家和产业的角度分析行业：如何让行业健康发展？如何让中国的具身智能机器人产业，在未来全球竞争格局中取胜，占领行业制高点？

这是我现在需要思考的问题。

我会站在整个产业和国家的层面，分析行业的痛点、难点和堵点在哪里，然后针对这些问题进行布局和研发。

同时，我们会尽量把研发成果开源开放，让更多商业化公司避免底层重复建设和无序建设，减少社会资源浪费。

卫诗婕

所以你们更像行业的基础设施建设者和协调者。

熊友军

对，我们更多是基础设施的搭建者。

你看，我们早期天工的一些硬件设计全部开源。跑完马拉松之后，第一届比赛涉及的所有算法和 pipeline 也全部开源。

后来我们训练大模型的数据，包括几百万条高质量数据，也全部开源。模型架构同样开源。

这些都是我们一直坚持的初心。

卫诗婕

创新中心有一些大股东，比如优必选、小米，还有亦庄方面的政府机构。为什么最终会是这些资本成为创新中心的底座，成为第一批早期股东？

熊友军

你说的这些原始创始股东，都认可创新中心的愿景和价值观。

当时我们在做融资工作时，和很多机构都沟通过。有些机构没有投资，主要是因为他们觉得这是一个国家平台，商业价值和公司自身追求未必匹配。如果不符合，他们可能就不会投资。

优必选、小米、亦庄国投，还有京城机电当时投资，并不是单纯追求商业利益。

卫诗婕

那他们追求什么？

熊友军

追求技术创新，追求为行业带来更多贡献。

我们开源开放的内容，对优必选、小米、京城机电以及所有股东都是开放的，本质上也是在赋能他们。

他们投入资金和各种资源，也是把一部分创新资源放在企业体外，让它有可能发生。

卫诗婕

创新中心有国家队的定位，但背后也有行业巨头和政府的身影。只要有大资本存在，市场就会把它理解成某种“战队”。

如果其他有商业化诉求的公司来使用和合作，可能会产生“分你我”的顾虑。怎么解决这个问题？

熊友军

目前我们还没有看到所谓战队的问题。

我们坚持开源开放，而且是一视同仁的全球开放。在美国可以使用我们的开源内容，在欧洲、日本、韩国也都可以下载。

我觉得不存在这个问题。

卫诗婕

原来您在优必选担任 CTO，更多从公司的商业化角度思考；现在要考虑整个国家的产业如何在全球占据更好位置、实现更高水平创新。这两个角色之间，认知有什么变化？

熊友军

变化很大。

原来在优必选，是从商业化和公司角度出发，是“小我”。今天考虑的是国家和行业，可能是“大我”。

今天做的研究和布局，比优必选更底层，更偏向基础设施建设。优必选更多是做应用技术，偏向上层，比如运动、视觉、感知和决策。

思考范围发生了很大变化。

卫诗婕

中国产业和供应链的深度，在具身智能这件事上，有机会把中国推到全球什么位置？

熊友军

这是个很好的问题。今天可以毫不避讳地说，具身智能的竞争就是中美之间的竞争。

国家给出的定位是，人形机器人竞争是中美科技竞争的必争之地。

从社会期待和行业发展来看，大家至少站在同一起跑线上，各有各的优势。

中国有非常明显的优势，包括供应链和迭代能力。在本体和产业链方面，我们有很好的基础，也有大量应用场景，为人形机器人的快速迭代提供了支撑。

美国则在大脑和人工智能领域做了很多原创性创新，国内相对来说还处于跟随状态。

卫诗婕

美国现在实践出了哪些中国还没有的创新？

熊友军

比如世界模型、空间智能，李飞飞团队正在做的工作，这些领域我们很多还处于跟随状态。

另外，机器人对算力有很大需求，算力芯片大部分来自美国。这些都是国内需要突破的方向，而且很紧迫。

卫诗婕

中国的算力多久能够突破这道关卡？

熊友军

国内已经有几家公司上市了，但它们更多是在无人驾驶和整个 AI 层面的算力方面发展。在具身智能领域，大家还在做适配。

现在不是没有替代方案，只是这个替代方案在当前追求技术进步的情况下，是不是应该马上拿出来，它是不是最经济的方案，不一定。

国产算力拿来并不是直接就能用，还需要做很多适配，需要在底层架构上投入大量工作，开发投入和成本都会更高。

所以现在除非万不得已，比如美国真的限制出口，不再向我们出售，我们才会全面启用这些方案。

但并不是没有解决方案，解决方案是有的。

卫诗婕

从帮助一家公司赢——也就是您在优必选时的目标——到现在帮助一个区域、甚至一个国家的产业链赢，重点关注的指标有什么不同？

熊友军

现在关注的指标，更多是底层技术的突破。

包括我们刚才说的两个平台：一个是天工，另一个是慧思开物；另外还有生态建设。

我们做了很多开源开放工作，培养了很多二次开发者。这次比赛有很多科研院所、高校和二次开发者使用我们的平台开发并参赛，整个赛场上应该是最多的一家。

卫诗婕

美国仍然以闭源为主，中国靠开源走出了一条自己的路。现在开源生态逐渐形成燎原趋势，也对闭源技术的领先性形成了一定压力。具身智能也是这样吗？

熊友军

是。我们开发并开源自己的数据集之后，在行业里的下载量应该是最大的一家。

卫诗婕

您说的行业，是中国还是全球？

熊友军

现在能够统计到的主要是国内数据。全球数据我找不到，但应该中国是第一，全球也可能是第一。

国外具身智能数据集开源得不多。

卫诗婕

为什么中国会选择开源？

熊友军

我觉得中国整体上比较开放，这可能是思维模式的转变。

通过开源开放，我们能够聚集更多同路人，形成更好的生态，扩大技术迭代。从开源过程中，我们看到了很多好处，所以会选择开源。

卫诗婕

开源自己的数据集和算法之后，带来的最大好处是什么？

熊友军

第一个好处是培养更多使用者。今天他们是我们的开源用户，未来可能就会成为真正的用户。

开源有一整套协议。用户使用我们的内容并进行开发，也需要上传和反馈，把更多案例反馈给开源社区。

开源过程中，很多人会提出建议和改进意见，甚至发现 Bug，我们就可以快速迭代。这对促进技术进步也有很大帮助。

所以本质上，开源是把更多人聚集在一起，形成一个团队和生态，众人拾柴火焰高。

另外，因为我们是国家平台，也希望为中国培养更多具身智能人才。通过开源，可以帮助国内很多开发者提升具身智能开发能力。

卫诗婕

您一开始说自己是乐观派。在具身智能领域，您觉得中国有机会赢吗？

熊友军

对此我坚定不移，非常坚信。

卫诗婕

我们要怎么补上大脑这一课？什么时候大脑方面的原创创新能够出现在中国？它需要满足什么条件？

熊友军

大脑确实需要大量投入，而且是长期投入。

现在已经有很多创业公司开始做这件事，这是一个很好的变化。未来说不定会出现类似 OpenAI 的公司，只要坚持长期主义。

大家沿着不同方向探索，至少可以证明哪些方向走得通，哪些方向能走得更远，哪些方向是死胡同。

中国有一点比较好，就是很多方向都有人探索。最后很快就能知道哪一方成功了，大家就不会继续向不成立的方向投入资源。我觉得这也是一件好事。

卫诗婕

不知道您有没有留意到，这届 WRC 开幕式上，王兴兴讲了一个具身智能目前无法解决的卡点。

他说，语言模型的输入输出是纯数字编码，严格限制在固定向量空间里，基本没有损耗。但机器人的每一次输入输出都会引入偏差和损耗，尤其是触觉层面的细微误差几乎无法修正，成功率也会随之暴跌。

他认为，这限制了机器人智能的最后1公里。您怎么看这个问题？

熊友军

我认同他的意见。不同模态信号和信息的表征，会带来一定损耗。

所以我们现在也在追求对多模态信息进行统一表征：语言、视觉、触觉等信号使用同一种表征方式，输入大模型后，用统一的向量进行推理和决策。

这就是我们接下来追求的大一统模型。

卫诗婕

之前并不是在统一向量空间里做表征。您觉得大一统是一个趋势吗？

熊友军

现在还没有完全形成行业共识，但有几家领先公司已经在探索，包括我们。

我们推出了自己的 RoboBrain Unify 统一大模型。从当前效果来看，我们觉得还不错。

后来这个模型登顶了 World Arena 权威榜单的榜首。之后我们在语音和视觉榜单中也做了一些测评，发现效果同样不错。

至少在当前阶段，我们认为这是一个值得探索的方向。

大一统模型可以把 VLA、多模态大模型和世界模型的优点结合起来。

VLA 可能更擅长操作和执行，世界模型可能更擅长推理和预测。它们各有优势，也各有不足，但通过统一表征，可以把各自优势结合起来。

卫诗婕

大一统意味着需要消耗更大资源，数据、训练方式和整体范式都要更大规模，也是一种全新的范式。这个事情不是所有人都能做，有一定门槛。

熊友军

对。大一统模型的参数量，和多模态大模型、之前的 VLA，可能不是一个量级。

部署到本地端、部署到机器人上，确实有难度。当前算力和机器人端侧芯片都不支持，所以很多大一统模型还在云端运行。

未来随着芯片技术和架构发展，我们可以采用不同架构来规避这个问题。

现在参数量确实比较大。等它成熟到一定程度之后，可以采用蒸馏、裁剪等方式，把模型缩小，再部署到机器人端侧。

随着技术迭代，我觉得这些问题有办法解决。

卫诗婕

在这个赛道里，有技术深度和底蕴的公司，后劲会更足吗？

熊友军

我觉得现在无论是具身智能，还是人形机器人领域，技术树上还有很多节点没有点亮。

机器人真正进入生活，需要克服并点亮这些技术节点。所以这类公司的目标可能更远，路也可能更长，但要真正达到梦想的彼岸，这些问题绕不过去。

卫诗婕

现在行业里有一批公司，拿到了资本市场最多的钱，但并没有真正下场训练模型、抢占大脑技术。

可能它们认为现在还不是时机，等有人做出统一范式，或者某种范式被验证之后，再下场砸资源、收割市场。您怎么看这种思路？

熊友军

这可能更多是商业模式的操作，也确实有成功案例，或者说阶段性成功。

但在我的认知里，这样的公司走不远。你可以一时成功，某一次或某几次成功，但不可能次次成功。

卫诗婕

您相信最终走得好的长寿公司，一定是下苦功的公司？

熊友军

一定是有自己坚持和梦想的公司。

卫诗婕

机器人是一个非常复杂的体系。有些人的梦想在大脑，有些人的梦想在供应链，有些人的梦想在本体硬件。现在基本上头部公司都声称自己做全栈，对吗？

熊友军

对，确实有很多公司说自己做全栈。

卫诗婕

您定义的“全栈”是什么？

熊友军

“全栈”应该要打引号，每个人对全栈都有不同解释。

在具身智能和人形机器人领域，真正的全栈公司，我觉得不可能存在，因为范围太广。

我们所说的全栈，是公司自己的两个平台：天工，也就是本体的开源开放平台；第二个是慧思开悟，也就是大小脑平台。这两个平台涉及一些关键的核心共性技术，这就是我们所说的全栈。

卫诗婕

为什么说不可能有真正做全栈的公司？

熊友军

因为太广了。

真正的全栈还包括很多内容：核心技术、关键元器件、运动控制，比如 MPC、WBC 等控制器，范围太多。

大脑方面还涉及更多范式，甚至还有更底层的操作系统、工具链，以及刚才说的数据。

数据内部又有很多细分的底层数据。整个具身机器人技术的 map，细分起来非常复杂。

产业发展需要很多公司一起努力。所以我们要开源、开放，让大家各自专注于擅长领域，为行业添砖加瓦。

卫诗婕

回到这次运动会。运动会分成两类主题，一类是竞技赛，一类是场景赛。

竞技赛是跑、跳等类似人类运动会的项目；场景赛则定义机器人的工作场景，让机器人完成任务。

我所知道的是，这个行业里基本上大家都偏科。你们应该是唯一一家在竞技赛和场景赛两类赛事中都取得头部名次的公司：竞技赛金牌数第一，场景赛金牌数第二，对吗？

熊友军

偏科不是坏事，术业有专攻。专注于自己擅长的领域并做到头部，我觉得就有机会。

本质上，无论创业还是做事情，都应该坚持这个逻辑。那些偏科的公司，如果真的在自己的领域做到头部，我都应该为他们鼓掌。

创新中心因为是一个国家平台，需要站在全行业角度，扫描行业短板和共性关键核心技术是什么，分析我们和海外竞争时落后在哪些方向，再列出需要努力和发力的点。

基于当时掌握的资源，我们一步一步展开工作。

创新中心也不是一开始就做今天所谓的全栈。一开始我们先做天工本体，先把运动控制和运动能力做到极致。

第一次参加马拉松并获得冠军之后，我们开始布局大脑和大模型。最初做的是 VLA，之后是多模态大模型加 VLA，再之后加入世界模型，现在又开始做大一统模型。

这是基于现有资源和对行业的认知逐步展开的。未来不排除还有其他布局，也会基于行业发展、社会需要和科技竞争来决定。

卫诗婕

既然你们从一开始就要扫描整个行业，那现在我们有没有绝对优势和绝对劣势？

熊友军

现在确实有优势。

中国在一些核心元器件方面有优势。比如关节领域，行星减速器、谐波减速器、滚珠丝杠等，国内有很多公司在探索，而且走在前面。

技术的稳定性和可靠性，国内也做得很好。甚至海外大家熟知的几家公司，关键硬件供应链也在中国。

这些优势我们要牢牢抓住，并不断强化。

传感器方面，国内做得也比较好。比如电子皮肤、压力传感器，过去不够好，但这两年的进步非常快。

还有能源和电池。到今天为止，电池仍然是短板，但现在看，电池正在快速进步。

过去机器人电池又大又笨，容量看起来很大，实际也就10安时。现在小型电池的容量已经比过去大很多，放电倍率等参数也提升了很大一截。

说不定下一次马拉松比赛，就能看到一块电池跑完全程。

核心元器件技术都在快速迭代，这方面中国确实有不可比拟的优势。国家也已经意识到这一点，并在有意识地加强这些优势。

卫诗婕

问一个伦理问题。每次看到马拉松或跑步比赛中机器人跑得非常快，我都会担心：机器人跑得特别快，如果出现意外怎么办？

这次还有一个全民关注的热点：有机器人跑着跑着撞到挡板，腰断了；还有机器人跑着跑着上半身飞出去。我忘了具体是哪一家。

怎么看机器人越来越强大之后带来的安全和伦理问题？

熊友军

伦理和安全问题就是底线。

现在大家都在考虑人工智能安全，国际上已经成立了很多安全能力委员会，这是一个很大的话题，也是底线问题。

国家层面和学术领域都在制定相关安全标准，包括几个层面。

第一个是本体安全，确保机器人不会对人和环境造成伤害。第二个是数据安全。第三个是信息安全，以及个人隐私泄露等问题。

这是一整块很大的拼图。行业正在制定标准，我们也牵头参与安全标准的制定和规划，在工信部指导下开展相关工作。

今年年底会发布很多标准。未来机器人厂商必须强制执行这些标准，机器人达不到安全标准，就不允许销售。

否则可能对社会、人员和用户造成不必要的意外。这是一个底线，而且是很高级别的底线。

卫诗婕

我们现在看到最成熟的应用之一是无人机，但实际上在北京无人机禁飞。

未来机器人会不会出现类似无人机的情况，在某些地方受到限制？国家会不会从安全系数、生命风险等综合因素出发，制定一套规范这类行为的体系？

熊友军

一定会。

从系统安全层面来说，如果机器人被黑客攻击，被有不良意图的人控制，变成一个杀手怎么办？它确实可能造成意想不到的危害。

所以机器人未来大规模上市时，必须满足国家强制性的安全法规要求。

卫诗婕

从技术上能否实现机器人不被黑客攻击，保证它是安全的？

熊友军

当然可以。

在系统软件层面，可以采用很多安全防护方式和加密措施。无论是网络、通信，还是整个系统，都有现成的解决方案。

只是现在还没有统一的法律法规，所以很多创业公司可能还没有特别关注这件事。

卫诗婕

我们现在已经在路上，未来会碰到越来越多机器人，所以担心还是有道理的。

熊友军

但正规的机器人上市之后，你就不用有这个担心了。

卫诗婕

这一天应该也会很快到来，是吗？

熊友军

是。

卫诗婕

我们的节目希望做最有生命力的科技商业访谈。最后想请您分享一下，您和机器人相处20多年，最有生命力的时刻有哪几个？

### 机器人也需要情绪价值

熊友军

最有生命力的画面，还是在家庭场景里。

我以前做过一个比较小的桌面机器人。有一次我正在专心处理工作，它突然像苏醒一样站起来，对我说：“熊总，外面有位客人到了，需要您去和他开会。”

当时我正在专注地做自己的事情，它突然这样提醒我，就感觉像我的秘书，像一个真正的人一样。它说话的声音、语调和动作都比较自然，我很容易接受。

还有一次是在疫情期间。我们当时用机器人给隔离区的人送生活必需品。很多人处在无助状态时，有一个机器人来帮助你，那种雪中送炭的感觉非常温馨。

还有一次是在养老院。老人需要护理人员，隔一段时间要做操。那次是我们的机器人带着老人一起做操。

老人们觉得很新奇，问了很多问题，机器人就带着他们完成活动。我第一次真实地感觉到，机器人真正发挥了价值，也给社会带来了温暖。

这是一种很利他的价值观，也是一种很温馨的感觉。这就是我想到的3个最有生命力的画面。

卫诗婕

今年看运动会，我有一个特别大的感受。以前我会觉得，机器人不需要提供情绪价值。

但看了运动会之后，我觉得机器人太需要提供情绪价值了。已经很久没有出现过这样的场景：我和朋友们坐在电视前看一场比赛，大家全都在笑。

我们看机器人打拳、跑步，确实会因为技术还不够成熟而显得笨拙。但恰恰是这种笨拙，让人觉得非常有趣，像是在观察某种生物成长，像人类看宠物一样看它们。

这就是机器人带来的情绪价值。当然，每当它突破、刷新纪录时，又会让我们对硅基生命产生一种敬畏。

您知道我是这样看的吗？

熊友军

其实我看它们，就像看自己的孩子蹒跚学步，一步一步成长。

我会用充满期待的眼神看它们，也会带着爱。有时候它摔倒了，我会用怜爱的眼神看它，就像看自己的儿子摔倒一样。

卫诗婕

它摔倒了，您会心疼吗？

熊友军

当然会心疼。

你看，我们的机器人身上还会带泡沫。我们的 Omni、Archo 刚开始测试时，身上有很多泡沫。

因为测试时它经常摔倒，摔倒之后，胳膊有时会摔歪，胸前的外壳也可能摔变形。这些都需要后续维修。

为了保护它们，我们专门做了一套泡沫衣服，把关键部位保护起来。这些都是我提出来的。

所以我和你们看它们时，可能是完全不一样的眼神，也是不一样的心情。
