90.人形机器人为什么执着于运动会?|与天工熊友军的访谈
熊友军把人形机器人运动会定义为极限测试场:比赛不是替代工业落地,而是在统一标尺下摸出本体、能源、运控与可靠性的天花板。 天工 Omni 从彩排的 9 秒 44 迭代到 8 秒 64,背后是竞争密度对软硬件极限的持续挤压;真正的商业门槛则更苛刻——工厂要求 7×24 小时运行和甚至 99% 的成功率,“板凳要坐十年冷”。
爆火的“无脸跑”不是预编程表演,而是机器人在肩关节受限、功耗受约束的条件下,为追求最快速度自行找到的解。 团队一度嫌姿势“不那么漂亮”,甚至想重训,但最终保留了最快版本:机器人舍弃摆臂、改用腰部扭动平衡下肢。熊友军将其视作一种具身智能“涌现”——“它确确实实是自我学习、自我进化的一个结果”。
运动会最重要的年度变化不是速度,而是自主化:去年 200 多台机器人中只有天工全自主参赛,今年除部分障碍项目外,田径机器人基本摆脱了遥控器。 熊友军认为这只是“大脑进步的一个展示”,因为识别跑道、压弯和调整跑姿仍是较浅能力;长程规划、错误反思和环境突变处理,比赛尚未充分呈现。
具身智能的数据需求很可能达到千万小时量级,但熊友军拒绝把“大力出奇迹”当成确定终局。 当前通用运动控制器只用数百小时人类数据,世界模型训练约几万至几十万小时,与千万小时仍差数个数量级;他承认“我们现在都还不知道”scaling law 的天花板,并判断纯靠堆数据“可能不一定是一个正确的方式”,自主探索、强化学习和少样本学习仍可能改写所需数据规模。
真正训练“机器人大脑”的门槛同时来自算力、数据和范式,而不是发布一个模型名称。 熊友军认同“千卡有效算力”是一条有意义的判断标准;创新中心借助百度及多家云平台训练,年采集量接近 20 万小时,开源下载超过 2,000 万次,并把重点从重复的抓取放置转向长程任务、逻辑链、力觉触觉、失败与反例。“数据驱动”仍能落地,但 VLA、世界模型、多模态与大一统模型都尚未收敛。
近期商业化仍将首先发生在结构化工业场景,但这更像通往家庭机器人的桥,而不是终点。 包裹分拣中,人类最快约 2,000 多件/小时,FANUC 被提及约 1,500 多件,国内机器人约 1,000 至 1,400 件;差异来自本体、算法、模型、数据与场景定制的综合能力,至少在 WRC 展示中尚未出现明显代差。熊友军坚持人形最终会成为“朋友、伙伴,甚至家人”,主持人则保留异议:生产设施也可能围绕“人+机器人+AI”重新设计,人形未必是唯一终局。
投资判断的核心不是谁在热潮中融资最多,而是谁有长期技术复利、清晰禀赋和穿越低谷的意愿。 熊友军认为行业目前“本质上是没有竞争的”,因为蓝海足够大,但资本可以买来单点成绩,买不来长期底层积累;创新中心以天工本体、慧思开物“大脑”和全球开源生态补公共基础设施。“选择一个方向……然后做时间的朋友”是他贯穿二十余年的答案。
1. “无脸跑”是约束条件逼出来的最优解
卫诗婕追问天工 Omni 为何摇头晃脑、几乎不摆臂却速度奇快;熊友军解释,训练时团队刻意限制了肩关节的转动频率、范围、速度、角度与力量输出,让强化学习自己寻找平衡方案。
人类通常靠摆臂抵消下肢运动,但摆臂也消耗功率;Omni 为完成“以最快速度跑完 400 米、1,500 米”的总目标,把补偿转移到了腰关节,于是形成网友称作“无脸跑”的姿态。“它确确实实是自我学习、自我进化的一个结果。”
团队最初并不喜欢这个姿势,觉得“不那么漂亮”,还想训练一套更好看的动作;但它是所有方案里最快的,最终以成绩优先。熊友军因此把它视为具身智能的一次局部涌现:不是工程师直接写出动作,而是目标、奖惩和物理约束共同诱发了策略。
2. 从 9 秒 44 到 8 秒 64,竞争把天花板不断往上推
赛前彩排成绩约为 9 秒 44;看到对手表现后,团队继续迭代算法、试探硬件上限,最终跑到 8 秒 64。熊友军的判断是,比赛会迫使各队“不断去突破、不断去尝试”,把平时不会轻易触碰的余量压出来。
这种提升并非只靠单一算法:团队在仿真环境中准备多种策略,再用真实测试筛选。熊友军强调“AI 本质是一个实验科学”,既会借鉴人类训练方式,也会把不同方案跑一遍,用结果决定取舍。
对夺冠,他说“基本上是在预料之中”;对连续跑动视频多次上热搜,则完全没有预料到。他把传播热度看成公众对团队长期运控积累的确认,而不是技术路线本身突然改变。
3. 运动会的价值是极限测试,不是热闹地重复表演
面对“行业已经转向工业干活,为什么还要比跑跳”的质疑,熊友军给出的定义很直接:运动会是一个“极限测试的环境”,用来扩展本体可靠性、稳定性、运动能力和能源系统的边界。
WRC 展台上的工作演示代表行业从实验室表演走向“国民经济主战场”,但离真实生产仍有距离。工厂需要 7×24 小时运行,流水线甚至要求 99% 的成功率;运动会提供的是统一标尺和训练场,让各家共同“摸高”。
他的因果链是:竞技项目先暴露本体、关节、能源和控制算法的薄弱点,这些底层能力再支撑机器人进入工厂、商场与家庭。一个再好的“大脑”离开可靠本体也无法执行,正如“脑和手之间的关系”。
4. 真正的年度跃迁,是机器人放下了遥控器
熊友军回忆,上一届赛场有 200 多台机器人,只有天工依靠全自主方式参赛,其他队伍普遍需要人员拿着遥控设备跟跑;今年田径项目除部分障碍赛偶尔需要遥控介入,其他基本实现全自主。
全自主跑步需要感知跑道线、识别弯道、决定何时压弯,并随环境变化调整跑姿和速度策略。熊友军将其视为具身“大脑”投入增加后的集中展示,而非单纯把原有程序运行得更快。
但他也压低了这一进展的含金量边界:运动会呈现的大脑能力仍很小,长程任务规划、执行错误后的反思、复杂环境突然变化等能力,“都还没有表现出来”。未来赛事应逐步增加这些项目。
5. 通用运动控制器从人类数据起步,但奖惩与物理约束决定上限
团队用动捕设备记录人类不同速度下的跑姿、摆臂、平衡方式,以及脚踝、膝关节在不同阶段的变化,再把数百小时数据输入模型做基础模仿;熊友军提到 NVIDIA Sonic 使用了 700 多小时人类数据,行业量级大致相近。
模仿只是起点,“最主要的”仍是奖励函数、惩罚函数、优化目标和约束条件。关节最大扭矩、速度、角度和输出能力构成物理边界,控制策略必须在这些边界内求解总体最优。
这个通用控制器本身并不大,属于垂直领域模型;与人类期望的效果仍有很大距离。当前控制器主要覆盖全身运动、尤其是下半身,更复杂的操作和灵巧手控制仍缺数据。
团队在第一次马拉松夺冠后,开放了运动控制代码与训练 pipeline。熊友军称,托马斯回旋、空翻等复杂动作都能沿用这套范式训练。
6. Scaling law 可能存在,但没有人知道具身体量的答案
面对“1 亿小时还是 10 亿小时才会出现 scaling law”的问题,熊友军拒绝给一个看似精确的数字。他只愿判断“千万小时的量肯定是需要的”,而今天运动控制器只有数百小时,世界模型也大致是几万至几十万小时。
他坦承:“是真的,这个我们现在都还不知道。”未知的不只是数据量,也包括具身世界模型和机器人大脑最终采用什么范式;当前 VLA、4D 模型、多模态加 VLA、世界模型和大一统模型均未收敛。
卫诗婕将问题进一步拆开:即使未来范式收敛,新范式需要的数据也未必等同于今天大家采集的数据。熊友军认同,因此现阶段的数据资产不能简单按小时数线性估值,任务结构、模态和学习机制同样决定价值。
7. “大力出奇迹”是不得不用的解法,不必然是终局
熊友军把海量数据路线称作“当前不得不的一个解法”:大语言模型能利用互联网存量,而具身数据昂贵、稀缺且需要与物理世界互动,照搬语言模型的规模路径未必经济,也未必符合人类学习机制。
他的反问是:“我们人类其实几下子,或者少量的数据,就可以做一定的举一反三……机器为什么一定要那么大的数据?”如果自主探索或新的少样本范式取得突破,zero-shot 或小样本泛化可能降低数量要求。
这不是否认现有路线。熊友军认为,VLA 在相对结构化、环境可控、任务定义明确的工厂场景已经有效;复杂度上升到人机交互、突发变化和长程任务时,才需要多模态模型和世界模型承担更多预演与推理。
8. 数据竞赛正从 UMI、Ego 转向长程逻辑与多模态反馈
熊友军不把 UMI、Ego 或全身遥操作划分成绝对的对错:行业先发现某类数据能有效训练模型,就会形成约半年左右的阶段性共识;当供给不再稀缺,局限暴露,采集重点便转向下一种模式。
全身遥操作需要真实机器人、动作服或控制器和大量场景布置,成本高、速度慢;Ego 只需让工作者佩戴第一视角摄像设备,便能低成本覆盖丰富场景,因此迅速繁荣。但第一视角视频仍不能完整表达力量、触感、执行逻辑和失败原因。
创新中心下一阶段更关注长程任务及其逻辑链:“为什么第一步做这个,第二步做这个,第三步做这个。”数据还应加入语音、视觉、力觉、触觉、错误过程和反面案例,让模型不只复现动作,也能学习推理与纠错。
9. “为什么要捡垃圾”暴露了数据驱动学习缺少的价值层
熊友军用捡垃圾说明现有训练的缺口:模型可以被告知什么是垃圾、垃圾桶在哪里,再执行抓取和投放;但它不知道“这个垃圾放在这里为什么不好”,也不会自然形成维护环境整洁的主动性。
人类行动背后可能存在价值驱动和世界观层级,而不只是感知到指令后复刻动作。熊友军提到,国际上已有学者探索是否应让机器人拥有某种价值观;他没有断言答案,却认为这类问题会把具身学习推向哲学层面。
他的取向是“两条腿走路”:能落地的 VLA、多模态和世界模型先产业化,同时继续“仰望天空”,寻找更接近自主认知的学习机制。接地气与探索新范式在他看来并不矛盾。
10. Sutton 式自主探索,提供了另一条少数据路线
熊友军提到 Richard Sutton 曾到创新中心交流,其强化学习思路不是持续由人类喂入大量示范,而是设置环境、规则和迭代方向,让机器人“探索、反馈、纠正、学习、提升”。
他把过程类比为 PDCA 的螺旋:机器人失败后根据反馈修正,再进入下一轮探索;关键资源从大量示范数据,部分转移到高质量环境、奖励机制和可持续试错能力。
熊友军保留了不确定性:“具体最后哪个能跑出来,可能还需要一段时间的探索。”但他相信,这类自主迭代有机会超越单纯模仿,也解释了为何团队把 Omni 自己学出的奇怪跑姿视为重要信号。
11. 从可预测的数学模型到学习系统,是熊友军经历过的范式断裂
2010 年以前,团队主要依赖数学模型做运动控制:工程师规划每一步,求解后逐条下发,动作可预测、可判断,却把机器人变成了“一个傀儡”。环境稍有变化,系统就“完全不能工作”。
当时完成一个简单任务也可能需要几千乃至上万行代码。熊友军记得行业一度困惑:机器人是不是已经走到技术尽头?后来深度学习、大模型、视觉和自然语言技术改变了整个解法空间。
他把本田错过这次转向类比为“诺基亚错过智能手机”:ASIMO 时代的机械、加工和可靠性做到极致,但仍建立在传统数学模型、有限视觉与有限算力之上,未能抓住 AI 范式变化。
12. P2 点燃了理想,但也展示了技术宣言与产品路线的距离
熊友军读博时研究焊接机器人,整日处理焊缝均匀度、美观和变化适应;约在 2002 年,他看到本田 P2 接待来访者并带人参观流水线,感到双方差距“还不是一点点”,也第一次直观地觉得“这就是未来”。
熊友军说,本田应该从 1986 年开始投入人形机器人研发,利用汽车产业的精密零部件、加工、可靠性与稳定性优势,成为一代研究者仰望的对象;但当时机器人背着巨大的工业计算机,自然语言、视觉和算力都不足。
卫诗婕指出,ASIMO 更像技术宣言,始终未大规模进入真实生产。熊友军没有否定其价值:今天很多人形机器人愿景仍未超出本田描绘的图景,但市场需求存在不等于技术已经成熟;NAO、Pepper 等后续产品也重复证明了这一点。
13. 优必选的早期壁垒,来自没有供应链时自己造出来
熊友军加入优必选,是因为团队提出让机器人走进家庭,与他对“人机共融”的终局想象高度一致。他形容那是“找到知音的感觉”,早期办公室只有几个人、几张桌子,创业者常在员工下班后彻夜讨论未来,再把“梦”讲给团队和投资人。
第一代 Walker 原型从两条腿开始,因为上半身会令控制复杂度陡增;关节原想从德国、韩国采购,却因产品易坏而被迫自研。ASIMO 和 Atlas 当时都高度封闭,团队无法通过购买成熟技术抄近路。
2012、2013 年间,手机供应链接的是 K 级乃至百万级订单,人形机器人一次只做 10 台、20 台,技术要求高又压成本。团队要等机床空档,还得请厂长、操作师傅吃饭喝酒,才可能让“小单”被认真加工。
14. 高光不是偶然爆红,而是二十年行业记忆的累积
宇树凭春晚转手帕、武术获得大众关注时,熊友军把它视为“行业的一个盛世”,没有追问为什么热点不属于自己的团队。他提醒,优必选早在 2016 年就有 541 台机器人登上春晚:1 台与主持人互动,540 台组成三个方阵跳舞。
回忆优必选的艰难阶段,他首先想到的反而是春晚、上市等高光时刻,称自己一直“很享受这个过程”。优必选从 2012 年 3 月注册到后来上市几起几伏,真正留下的认知只有两个字:“坚持”。
早年资本追逐互联网、移动互联网和房地产,机器人融资困难;他本科接近汽车方向,也随时可以转向后来吸纳大量资本的新能源汽车,但答案始终是“就是喜欢”。“当你喜欢一个人的时候,就爱屋及乌”,失败也会被理解成考验和成长。
15. 团队的四个词,解释了为什么 90 分仍可能不合格
熊友军给团队设定的价值观是“正直、自驱、合作、极致”。正直是先做人再做事;自驱要求在无人监督时仍愿意为长期目标工作;合作来自机器人横跨机械、控制、算法、数据和应用的系统复杂性。
“极致”不是把单项做到 90 分或 95 分。他的原话是:“你不做到 120% 都不达标。”机器人产业链太长,如果每一环都只有 90%,误差层层相乘,最终会“差之毫厘,谬以千里”。
正直最难量化,他更多通过一个人如何看待梦想、低谷和长期投入来判断。上一轮人形机器人热潮中,大量公司在行业降温后转向更快赚钱的领域;高潮入场、低谷离开的人,很难成为他要找的“同路人”。
16. 遥操作不是落后技术,冒充自主才是越界
卫诗婕提到有团队因宣称自主、实际遥操而被取消资格。熊友军认为这违反比赛规则和团队价值观,必须由裁判约束;但他同时强调,遥操本身在高风险场景仍有正当价值。
例如配电柜或变电站出现红灯,错误操作可能造成严重后果,人类应决定是否扳动开关;一旦获准,机器人可以自主绕障、开门、走到设备前并完成动作。这已经不是玩具车式的前后左右控制,而是“人给高层决策,机器人负责具体执行”。
他把遥操区分为微动作级、行为级和任务级:前者近似傀儡,行为级可下达“拿起杯子”这样的局部指令,任务级则把人的判断与机器的自主执行结合。智能尚不足时,这种混合方式可能比追求形式上的全自主更安全。
17. 新玩家能买到单点成绩,买不到长期复利
对汽车、手机公司进入机器人行业,熊友军的第一反应是产业繁荣:商业公司“为利而来”,意味着它们相信这是万亿级蓝海,今天投入 1 亿元,未来可能追求 10 亿、20 亿乃至 100 亿元回报。
主持人以荣耀在 4 月马拉松中的夺冠和赛场“红白大战”为例,追问传统机器人公司是否会被资金雄厚的硬件厂商超越。熊友军认可荣耀的技术与投入,但认为结论只能是“真实做工作就能取得成绩”,不能推导为人形机器人的壁垒已经消失。
他的反驳针对资本市场的线性想象:砸 5 亿、10 亿元,确实可能在某个单点取得短期成果;但机器人不是一次性投入能完成的赛道。“板凳要坐十年冷”,底层技术、可靠性与系统整合需要长期累积,阶段性成功不等于可以次次成功。
18. 蓝海里没有真正的正面竞争,只有不同禀赋的兑现
熊友军判断,今天具身智能公司虽然很多,“大家本质上是没有竞争的”,因为尚未满足的市场足够大。只要能解决一个垂直领域的真实问题,就可能获得独立空间,这也是资本持续下注的原因。
判断一家公司,他先看“为什么而生”,再看后续资源配置是否真的围绕使命展开;然后看团队禀赋——懂工业和制造的可以深耕工厂,熟悉医疗、养老的可以做健康或外骨骼。愿景相似不重要,打法必须与能力匹配。
对跟风者,他的判断相当明确:没有独立定位,只在热度中复制别人,最终可能“淹没在具身智能的浪潮里”。坚持不是守着同一产品不变,而是把时间、精力和资源持续投入自己真正相信且擅长的方向。
19. 人形是不是终局,访谈保留了最重要的分歧
卫诗婕提出工业革命类比:过去设施围绕人力设计,蒸汽动力成熟后,整个生产系统转而围绕机器动力重构;同理,未来设施也可能围绕“人+机器人+AI”重新设计,因此今天的人形未必是最终形态。
熊友军同意环境会改变,却坚持自己的底层判断:未来是人机共融社会,机器人会成为朋友、伙伴甚至家人。要承担这种关系,它需要人类自然理解的外形、动作与交流方式,并能直接使用为人设计的工具和空间,而无需大规模改造环境。
他把人形称为潜在的“第三代人机交互中心”:不再像手机那样解锁、打开 App,也不依赖键盘、鼠标和 GUI,而是通过语言、手势甚至眼神理解意图。在他们做的测试、调研和对比中,暂时忘掉成本和技术复杂度后,大家会选择人形而不是机器狗。
卫诗婕明确说“我个人不是这一派”;熊友军则描绘“三体”画面:肉体的熊友军、机器人的熊友军和数字人熊友军并存,知识与经历或可借脑机接口迁移,甚至产生某种“永生”。两人的分歧没有被强行收束。
20. 工业落地是技术约束下的现实桥梁
Walker 最初锚定家庭,后来优先进入工厂。熊友军认为,这既是现阶段技术局限,也是商业回报要求下的综合选择:家庭涉及更高的安全、标准与开放环境难题,短期难以突破;结构化工业场景更可控、更容易变现。
工业部署也能反向创造数据:机器人进入真实一线后,可以采集大量数据,加快 Walker 系列的迭代。因此先工业、后家庭不是放弃长期愿景,而是为其建立商业回报、可靠性与数据基础。
对 WRC 展示的厂商,熊友军尚未看到明显“代差”。他举包裹分拣为例:人类最快约 2,000 多件/小时,FANUC 被提及约 1,500 多件,国内部分系统约 1,000 至 1,400 件;成绩取决于硬件、算法、大脑模型、数据和场景定制的综合能力。
软包、硬盒、塑料袋、不同颜色、尺寸和形状要求大量真实训练。VLA 已能在这种变化范围有限的场景形成一定泛化,但这仍不同于开放家庭环境中的任意物体、任意任务和人机互动。
21. 国家队的任务,是补基础设施而不是只赢一家公司
主持人提到北京人形机器人创新中心应于 2023 年 11 月成立;熊友军则说,从优必选 CTO 转向中心 CEO后,角色从商业公司的“小我”转向产业和国家的“大我”:不只追求单家公司商业化,而是扫描行业的痛点、难点和堵点。
创新中心把自己定位为基础设施搭建者:天工提供本体通用平台,慧思开物覆盖大小脑(访谈前文另称“慧思开悟”),并持续开放硬件设计、马拉松训练 pipeline、数百万条高质量数据和模型架构,以减少行业在底层重复建设上的浪费。
优必选、小米、亦庄方面及京城机电等早期股东的共同点,不只是期待财务回报,也认可平台的技术与产业价值。熊友军称开放原则“一视同仁”,美国、欧洲、日本、韩国的开发者同样可以下载,因此不认为平台已形成排他阵营。
相比优必选偏应用技术,创新中心需要投入更底层的共性卡点、工具与生态。比赛中大量高校、科研院所和二次开发者使用其平台参赛,熊友军把这种开发者密度视为平台价值,而非只看自有队伍奖牌。
22. 训练大脑的硬门槛,是千卡算力、数据质量与持续投入
卫诗婕转述行业判断:不依托政府或大厂、真正拥有千卡有效算力训练大脑的独立创业公司可能不超过 5 家。熊友军没有确认公司数量,但认同这条标准的方向——前期训练所需算力“非常非常高”。
创新中心早期自建算力中心,随着数据和模型增长很快不足;百度成为投资人后提供大量云端资源,团队也使用其他云服务。训练之外,未来大规模部署还会产生更大的推理需求,只是推理成本可随客户规模分摊。
年数据采集量已接近 20 万小时,熊友军称其在公开数据中属于很大体量,累计下载超过 2,000 万次。所谓高质量,不是把重复抓取堆成时长,而是覆盖多任务、多本体、多场景、长程逻辑、触觉反馈、失败过程和反例,并由团队训练、验证这些数据。
23. 大一统模型试图修复具身智能“最后一公里”的损耗
卫诗婕转述王兴兴的卡点:语言模型输入输出处于固定数字向量空间,信息损耗较小;机器人每次感知和动作都会引入偏差,触觉细微误差尤其难修正,任务越长,成功率越容易暴跌。熊友军明确认同。
创新中心探索的答案,是把语言、视觉、触觉等不同模态映射到统一表征空间,再由同一模型推理和决策。熊友军称团队已推出 RoboBrain Unify 统一大模型,并登顶 World Arena 权威榜单榜首;在语音和视觉榜单测评中也取得了不错结果。
这条路线试图结合 VLA 擅长操作和执行、世界模型擅长推理和预测等优势;代价是参数规模远高于单一模型,当前机器人端芯片难以承载,大多仍需云端运行。
熊友军设想,待模型成熟后可通过蒸馏、裁剪及架构变化缩小体量,再逐步部署到端侧。他把它定义为“值得探索的方向”,而非已经形成的行业共识。
24. 真正的“全栈”不可能由一家公司独占
面对大量公司自称全栈,熊友军认为必须给“全栈”加引号。机器人科技树包含关节、关键元器件、运动控制、MPC、WBC、更多大脑范式、操作系统、工具链和不同类型数据,没有公司能把全部层级做到最深。
创新中心所谓全栈,只指围绕天工本体平台和慧思开物大小脑平台,覆盖若干关键共性技术。赛事中同时取得竞技赛金牌数第一、场景赛金牌数第二,与国家平台需要扫描行业短板有关,并不意味着偏科公司没有价值。
熊友军反而为偏科辩护:“术业有专攻。”一家创业公司若在某个关键方向做到头部,就值得鼓掌;产业真正需要的是大量公司各自攻克擅长的技术,再通过开源和供应链组合,而非每家复制一套伪全栈。
25. 中美优势结构不同,中国要补的是原创“大脑”
熊友军把具身智能的全球竞争直接收敛到中美:双方至少处在同一起跑线,但优势结构不同。中国强在供应链、制造迭代和海量应用场景,美国强在 AI 原创、大脑模型、世界模型、空间智能与算力芯片。
中国在人形关节的行星减速、谐波减速、滚珠丝杠等方向已有大量探索,稳定性和可靠性持续提高,部分海外知名机器人公司的关键硬件供应链也在中国;电子皮肤、压力传感器和电池近两年进步尤其快。
电池仍是短板,但体积、容量和放电倍率已明显改善。熊友军甚至判断,“说不定下次马拉松比赛,你可以看到一块电池跑完全程”,以此说明供应链优化仍会直接改变产品边界。
国产算力已有替代方案,却需要重新适配底层架构和开发体系,当前未必是最经济选择;在海外芯片仍可获得时,企业未必主动承担转换成本。熊友军承认,国内在世界模型、空间智能等原创方向仍更多处于跟随状态,必须以长期投入补课。
26. 开源把公共投入变成开发者、反馈和人才复利
创新中心选择开源,并非只为宣传。第一层回报是培养使用者:今天下载代码和数据的人,未来可能成为客户或生态合作方;第二层回报是根据开源协议获得案例、修改、建议和 Bug 反馈,加快产品迭代。
熊友军称其数据集在国内下载量应该是最大的一家,并推测全球也可能处于第一,但对全球排名没有确证。他更看重“众人拾柴火焰高”:通过开放平台聚集开发者,减少共性技术重复投入,同时为中国培养具身智能人才。
相比美国常见的闭源路线,他认为中国开放文化可以形成另一种扩散优势。开源不是放弃商业化,而是把公共底座做大,让不同公司在应用、产品和服务层继续竞争。
27. 安全不是附属功能,而是机器人商业化的准入底线
机器人跑得越快、力量越大,摔倒、撞击、结构断裂的后果越严重。熊友军把安全拆成多个层面:本体不能伤害人和环境,数据和信息必须受保护,个人隐私不能泄露,系统还要防止黑客劫持。
他确认未来部分地区和场景一定会像无人机一样受到限制;机器人正式大规模销售前,也必须满足国家强制安全法规。创新中心正在工信部指导下参与标准制定,他称“今年年底”会有多项标准推出,未达标产品将不允许销售。
对“能否避免机器人被 hack 后变成杀手”,熊友军认为网络、通信和系统软件已有加密与防护方案,技术上并非无解;真正缺的是统一法律法规和行业强制执行,目前不少创业公司仍未充分投入。
28. 机器人最有生命力的时刻,不是夺冠而是被人需要
熊友军首先想到一个桌面机器人:他专注工作时,机器人突然站起来说,“熊总,外面有位客人到了,需要您去和他开个会。”自然的声音、语调和动作让他第一次感到,它像秘书,也像一个真正的人。
第二个画面发生在疫情隔离区,机器人为无助的人送去生活必需品;第三个画面来自养老院,机器人带老人做操,老人因新奇不断提问。熊友军称这些场景有一种“雪中送炭”的温暖,让技术真正产生社会价值。
卫诗婕从运动会感受到另一种情绪价值:机器人笨拙拳击、跑步、摔倒,让朋友们久违地围着电视大笑;当它们刷新纪录,又令人对“硅基生命”产生敬畏。笨拙与突破共同构成了观看乐趣。
熊友军的观看方式更像父亲看孩子学步:“充满期待的眼神和充满了爱。”测试中的 Omni、Archo 经常摔倒,胳膊有时会摔歪,胸前外壳也可能摔变形;他亲自提出给关键部位穿泡沫保护衣。别人看到的是笑点,他看到的是一个会摔倒、需要保护、也正在长大的孩子。
Full transcript
摇头晃脑,但是速度奇快。Hello,大家好,我是施杰。世界人形机器人大会获得了空前的瞩目,我们看到人形机器人刷新了人类短跑记录,他们无脸害羞的跑姿也深得网友的喜爱,获得了大量的讨论。今天的嘉宾是打造这款无脸跑的机器人天宫Omni背后的公司,北京人形机器人创新中心的CEO熊友军。创新中心在行业内被视作国家队,熊友军本人也曾是人形机器人第一股优必选这家公司的CTO。围绕这场参赛规模庞大的世界人形机器人运动大会,熊老师贡献了他独特的行业视角,也分享了很多幕后细节。我觉得这个运动会呢,本质上它是个极限测试的环境,在这个极限测试的环境里面呢,去扩展机器人本体的可靠性、稳定性,还有一些呃像运动能力的天花板吧。机器人通过它自己的学习,通过它自己的迭代,哎,它达到了,在我看来就是一个涌现。Scaling law在具身智能里面什么时候会体现?完全靠数据去堆积的话。这可能不一定是一个正确的一个方式。今天的具身智能产品虽然有这么多的公司在,但是大家本质上是没有竞争的。选择一个方向,需要把精力和资源投到你坚持的方向里面去,然后做时间的朋友。
欢迎熊老师。先祝贺你们在今年的世界人形机器人运动会上获得了非常好的成绩,你们的天工 Omni 那个“无脸跑”的小机器人也爆火全网。现在是什么心情?
谢谢,谢谢。基本上是在预料之中吧。平常心,胜不喜,败不忧,反正就是一如既往地坚持自己的产品和技术追求就好了。
您说的“意料之中”,是指夺冠意料之中,还是被这么多网友关注也在意料之中?
我说的是测试成绩在意料之中。至于被网友关注,那真是我们没有想到的。
以防还有人没有看过那段视频,您给大家解释一下,为什么会出现“无脸跑”这个动作?
1. 机器人学会了无脸跑
我们那个跑姿,是机器人通过强化学习自己学出来的结果。我们当时给它做强化学习的时候,设置了一些惩罚函数和奖励函数,故意对它肩关节的转动角度做了一些限制。
机器人为了跑得快,需要自己保持平衡,于是训练出了那个跑姿。这确确实实是自我学习、自我进化的结果。
之前我看过这个技术解读。以我们人体为例,跑步时挥动上肢,其实是为了保持下肢平衡。机器人最终舍弃了挥动上肢,因为挥动上肢的功耗在硬件方面不太允许,所以最后是靠腰部扭动来平衡下肢。
是的,是的。
你们在训练的时候,有没有觉得这个姿势很有意思?
说实话,我们当时训练出这个跑姿之后,觉得它不是那么漂亮,甚至还想再训练一套更漂亮的跑姿。但是这个跑姿是最快的结果,所以我们也就让它去参加比赛了。
所以我们现在看到一个趋势:机器已经可以自己学习,并发现最适合自己的优化方式,就像人类一样。
是的。
这算是具身智能的涌现时刻吗?
我觉得算是一个方面吧。在具身智能领域里面,涌现可能还是很难在我们平常的生产生活过程中达到。但是机器人通过自己的学习和迭代,达到了这个结果。在我看来,这就是一种涌现。
这次赛后“无脸跑”火爆全网之后,有没有感受到当年宇树上春晚之后的那种热度?
这次我们的“无脸跑”好像上了好几次热搜。网上有各种各样的视频和解读,非常感谢大家的关注。这应该是对我们前期运动控制工作的肯定。
其实这个行业整体受到大范围关注,最早是从宇树上春晚、转手帕开始的。
对。第二年他们上春晚表演了武术。
那两次节点,您当时在做什么?是什么样的心情?
我们都很开心。这是行业的一个盛世,把人形机器人带到了普通老百姓面前,让大家真正感受到中国人形机器人产业的进步和发展。我觉得这对整个行业都是非常好的事情。
您从事机器人行业已经有20多年了。遇到这样一个节点性时刻,有没有一秒钟想过,为什么没有发生在我的团队?
没有。其实我做的机器人上春晚已经上过好几次了。优必选在2016年的时候就上过一次春晚,那时候是541台机器人上春晚:1台机器人和主持人一起做节目,另外540台机器人组成3个方阵,表演了集体舞。
后来 Walker 机器人也上过几次春节联欢晚会,只是那时候没有像今天这样引起大家的关注。
您怎么看这次运动会上宇树的成绩,好像没有大家期待的那么好?
可能宇树在关注其他方面的事情吧。其他几家公司也在全力往前奔跑,大家的投入方向不一样,确实可能会有不一样的结果。
我希望大家都参与比赛,不断推进机器人技术的进步,就可以了。
我观察到一个很有趣的现象。大家赛前都会做准备,彩排的时候好像是9秒44,初赛之后又快了一些。后来发现对手也很厉害,于是继续迭代算法,不停突破极限,最后达到了8秒64的成绩。
所以,是不是当比赛把大家的创新汇聚到一起,达到一定密度的时候,就会刺激每一家的创新程度?
2. 比赛推动具身智能进化
对。比赛中大家都希望不断突破、不断尝试,我们也在不断测试机器人硬件的上限,摸它的天花板在哪里。当然,还有很多算法策略,大家都会做分析。
AI本质上是一门实验科学。
是。到底是借鉴人类的训练方式,还是把各种方法都试一遍,最后自己挑更好的?我们会有几种方案,都会去做测试,最终看比赛测试的结果。
在比赛之前,我们也在仿真环境里做了很多策略,所以这是一个综合考虑的因素。
在仿真环境里训练,还是要给它很多数据吧?到底需要什么样的数据,最后才能让它自主探索出一个好的结果?
我们会采集很多人类跑步的数据,包括跑步的姿态、怎样保持平衡、怎样摆臂,甚至包括脚关节、踝关节、膝关节在不同阶段、不同速度下的状态。
我们会用动作捕捉设备测试人的跑步姿态,再把这些数据输入模型,做一些基础的模仿。当然,这只是最基本的部分。还有奖励机制、惩罚机制和优化函数,这些才是最主要的。
另外还有各种约束条件,比如每个关节的最大扭矩、最大速度。它肯定会受到物理环境的约束。
刚才说到肩关节,其实我们就对它设置了约束,包括转动频率、范围、速度、角度和力量输出。我们限制它不让它输出那么大的力,因为总的优化目标是以最快速度跑完400米、1500米。
为了达到这个总目标,它还是要找到最优解,所以就让腰关节旋转起来。
要跑通这么一套百米冲刺算法,现在用到的模型参数量是多少?
我们确实已经训练出了一个通用运动控制器。这个通用控制器用了几百个小时的人类数据,行业里这方面的数据量应该都差不多。
我记得英伟达也有一个通用控制器,叫 Sonic,他们用了700多个小时的人类数据。我们也是差不多几百个小时的数据。
实际上,在我们第一次跑完马拉松并拿到冠军之后,就已经把运动控制相关代码全部开源了,包括训练范式。
机器人现在之所以能做很多复杂动作,比如托马斯回旋、空翻等等,其实都可以基于这一套 pipeline 完成。
它大概是一个多大的模型?
这个没有那么大,是比较小的一个模型。通用控制器本质上是垂直领域的模型。
即使现在已经有了一些比较好的性能,它跟我们人类期望的效果仍然有很大距离。我们还需要在运动控制和通用控制器方面做很多工作,包括把操作层面的控制纳入进来,甚至把灵巧手控制也纳入进来。
目前这个通用控制器主要是全身控制,但更多还是下半身。更复杂的操作需要更多数据,我们还没有达到那个阶段。
至于运动控制的 scaling law 需要多少数据,现在还真不知道。我们距离天花板还很远,甚至还没有摸到那个天花板,所以仍然需要更大的数据量。
今年很多人都在提一个问题:scaling law 在具身智能里面什么时候会体现?我常常听到的答案是,先有1亿小时的数据再说,10亿小时可能会迎来 scaling law。您认同吗?
这些判断基本上都是类比大语言模型得出的。具身智能的数据量毫无疑问会非常大。
至于需要多少亿小时,我没有准确判断,但我觉得千万小时的量级肯定是需要的。现在我们的数据距离这个量级还有几个数量级的差距。
我们现在训练一个运动控制器,也就用几百小时的数据;做世界模型和大模型,数据量其实也就是几十万小时、几万小时。
您跟我看到或接触到的创始人非常不一样。通常他们还是会给我一个具体数字,您是第一个跟我说“我也不知道”的人。
是真的。我们现在都还不知道。包括当前大模型,也就是具身智能世界模型的发展范式、机器大脑的发展范式,现在都还不清楚。
我们一直觉得,完全靠数据堆积,可能不一定是正确的方式。
为什么?现在行业都在堆数据。
这是当前不得不采取的解法。
为什么是“不得不”?
因为大语言模型在互联网上有大量数据可以使用,所以可以用“大力出奇迹”的方式做出来。
但到了具身智能时代,是否还是这种方式,还是要像人类、像小孩一样学习,遵循更好的学习机理,依靠探索和经验,这些都还需要研究。
人类只需要很少的数据,就可以实现举一反三的泛化能力。为什么机器人一定要那么大的数据量?这个范式还需要继续探索。
如果出现新的范式,可能真的能够做到 zero-shot,也就是零样本学习,或者少样本学习。所以我不一定认为一定需要几亿小时的数据,这只是当前阶段的判断。
如果出现新的学习方式,比如自主探索,我们可能用少量数据就能做到。我自己是这么理解这个问题的:首先,新范式还没有收敛;当我们确定一种新范式之后,这个新范式到底需要什么样的数据,以及这些数据和现在大家采集的数据是否完全一致,也都是未知数。
对,这确实是值得探索的事情。
当前的范式,比如 VLA 模式、4D 模型、大一统模型,甚至多模态模型加 VLA,本质上都还没有收敛。但当前确实有一些方式可以落地。
比如 VLA 模式,适合在相对结构化的环境中做一些具体工作,比如工厂里的特定任务。它适合定义好的场景,环境相对结构化、可控。
但如果希望看得更远,就可能需要新的东西。一旦涉及人机交互,涉及突发的环境变化,就可能需要多模态大模型。世界模型可能需要对长程任务做更多预演,随着复杂程度增加,对模型的要求也会不一样。
这次世界人形机器人运动会和 WRC 世界机器人大会,是两个独立的大会,但刚好有两天重合。我有一个观察:今年行业整体都进入了具体场景干活的状态。
相比往年,大家更多是在展示运动控制和表演。但今年头部厂商都在卷工业场景和具体工作场景,已经可以干活了。这个时候大家再去比运动控制,意义是什么?为什么要搞一个运动会?
3. 运动会检验机器人大脑
我觉得这个运动会本质上是一个极限测试环境。在这个极限测试环境里,去拓展机器人本体的可靠性、稳定性,以及运动能力的天花板。
这应该是在为机器人未来真正大规模进入工厂、商场或者家庭环境打基础。
今天你在 WRC 上看到的一些展示场景,距离真正商业化、生产化的真实环境,还是有一定差别的。工厂里面要求7×24小时运行,流水线上甚至需要99%的成功率和可靠性,这些我们都还需要努力。
今天 WRC 展示的内容是一个很好的趋势:大家从原来的表演式、实验室里的技术展示,开始走向工业和国民经济的主战场。这是行业里非常好的现象和趋势。
但这些都还需要很多底层技术支撑。
哪些底层技术?
硬件的可靠性和稳定性、能源,以及运动控制算法等。
本质上,运动会是给大家设置标尺和训练场,让大家在同一个训练场里锤炼机器人、锤炼算法,一起去摸高。
运动会也是观察本体、供应链和能源极限的窗口。每年就像一场汇报大赛,大家带着自己的极限来到这里,你大概就能知道行业现在的极限在哪里。
因为本体跟大脑是紧密关联的。一个再好的大脑,如果脱离一个好的本体,也可能发挥不了作用,就像脑和手之间的关系。
没错。
今年相比去年,在硬件方面最大的突破是什么?
今年最大的感受是,自主运行的机器人越来越多了。
去年大家基本上还是拿着遥控器。去年全场200多台机器人,只有我们的天工是完全自主参赛的。今年田径赛事除了障碍赛偶尔需要遥控以外,其他项目都是全自主的。我觉得这是非常大的进步。
为什么去年只有你们一家能做到自主,其他机器人还需要拿着遥控器跟着它跑?
可能是大家平时对大脑的重视和投入还不足。
实际上,我们第一次参加马拉松比赛之后,创新中心就开始把大量资源和精力投入到机器人大脑的开发上。
我们在2024年推出天工机器人硬件本体通用平台之后,后面又推出了“慧思开悟”机器人大脑。这个大脑主要负责感知、决策、认知和学习。
之后我们陆续推出了 VLA 模型、UniPerceiver 统一世界模型、多模态大模型等。这些工作都是我们在大脑方面所做的努力。
我们充分意识到,大脑对于机器人的作用是不可替代的。
不可替代的作用是什么?
机器人的终极目标,是融入未来人机共融的社会。它需要像人一样感知环境、自主学习、自主决策和自主规划。
只有一个好的身体和一定的运动能力,远远不能适应人类社会。不可能在复杂、危险的场景里辅助人类完成各种工作。
您说今年大家都摆脱了遥控器,可以自主运行,究竟是什么技术带来的?还是说这只是花时间就能做到的事情?
首先是整个行业都在进步,大家都把更多资源投入到机器人大脑上。资源投入带来了人才投入。
本质上,这次运动会是机器人大脑进步的一次展示,但运动赛展示的大脑能力其实很小,只包括感知跑道线、识别弯道、判断什么时候压弯,以及根据环境变化调整跑姿和奔跑策略。
实际上,现在多模态大模型和世界模型方面的进步远远超过这些内容。一个运动会还不足以呈现它们的成果。
今年的运动会还设置了场景赛,有几十种场景,但仍然不足以体现现在世界模型的成果。
对。尤其是长程任务规划、错误反思,以及环境变化等能力,目前都还没有充分表现出来。
我猜这应该是比赛未来的发展趋势:更多体现机器人大脑进化的能力。
我采访过的嘉宾中,不止一位提到,虽然具身智能行业吸纳了非常多资金,也有很多创业公司声称自己在做大脑,但判断一家公司是否真的在做大脑,有一条标准线:它能不能拥有千卡有效算力,去训练一个真正的大脑模型。
但现实是,在这个行业里,真正不依托政府和大厂、能够拥有千卡有效算力去训练大脑模型的独立创业公司,不超过5家。您认同吗?
具体有多少家我还真不知道,没有做过统计。但这个判断标准我觉得是对的,因为要做大脑,前期训练的算力要求非常高。
所以我们很早就让百度成为投资人。百度有大量云端算力,我们也使用了他们非常多的算力。
当然,只有算力还不够,还需要数据。我们自己建设了具身智能数据采集中心。今天我们的数据采集量已经非常大,年采集量接近20万小时,而且都是高质量数据。
我们也要承担国家创新中心的职责,所以把这些数据全部开源了。目前下载量已经超过2000万次。
此前我们也和高校、科研机构做过几次活动,不断释放我们在具身智能大脑方面的进展。
最初我们自己建设了算力中心,就在自己的大楼里。刚开始还能应付,但随着技术进步、数据量增加和模型迭代,发现这些算力远远不够了。后来我们开始寻找第三方算力。
今天除了百度的算力以外,其他几家云端算力我们也都在使用。
这说的是训练阶段。以后部署之后,可能还需要推理算力,推理又是一个更大的需求。
对。推理算力会更大。当然,随着客户使用,推理成本也可以被分摊。
所以自建算力只能在一定阶段内有效,超过一定程度之后,就不是一家独立创业公司能够承担的事情了。
是的。
20万小时量级的数据,在中国是什么水平?在全球又是什么水平?
至少在公开数据里,我们算是体量非常大的一个数据集。这些数据都是我们自己训练过,并且被证明是高质量的数据。
您怎么判断数据质量高不高?
4. 高质量数据走向长程
我们在采集数据时,非常关注几个方向。
第一个是多任务,第二个是多本体,关注任务和本体的丰富性。第三个是多场景。
我们还会关注更长程的任务,以及需要逻辑思考的任务。现在很多数据都是基于 Ego,也就是第一视角,主要是桌面上的抓取和放置,这类数据已经很多了。
但真正的具身智能需要长程任务推理,甚至需要触觉反馈,也需要错误案例和反面案例。这样的数据实际上是稀缺的。
具身智能领域的数据,感觉一直有一个主流。今年年初的时候,UMI 很火,现在可能大家都在做 Ego。这个过程经历了怎样的变化?
没有对错。大家训练时首先觉得数据缺,所以当 UMI 出现时,发现它对训练模型有效,大家可能都会做 UMI,于是它就形成了阶段性的行业共识。
但到了某个阶段,这类数据可能已经不缺了,就要去探索其他方式。
Ego 相对来说成本低、容易获取、采集量也比较大。它本质上就是在头上绑一个摄像头,用视觉方式捕捉人类操作信息,让机器人从视频中学习。
第一视角的方式。
对。在 Ego 之前,实际上是全身遥操作:现场有一台真实机器人,人穿着动作捕捉服,或者拿着遥控器,去遥控整台机器人。
这种方式需要布置很多场景,还需要投入真实机器人,成本很高。
Ego 只需要一个工人在工作时戴上设备,把数据采集下来就可以了,成本大幅下降,采集速度大幅提升,而且场景非常丰富。这就带来了 Ego 数据的大量繁荣。
平均多久之后,大家会发现某一种数据采集方式的天花板或局限?
这取决于模型进步、训练方式变化,以及迭代速度和周期。大家多久会发现 UMI 有局限、Ego 也有局限,我还真没有统计,估计半年左右吧。
Ego 的下一个主流,您觉得会是什么?
我还没有判断。至少从我们的角度来说,我们现在更关注长程任务,包括完成这些任务的逻辑是什么。
我为什么第一步做这个事情,第二步做那个事情,第三步做另一个事情,中间的逻辑是什么?这有利于机器人进行推理。
可能还需要增加多模态。除了语音和视觉视频以外,有时还要加入力觉和触觉。这些可能是当前采集模式需要补充的部分。
我觉得具身智能要回答一个非常重要的第一性问题:我们现在甚至无法用一句话说清楚,人做一件事情到底依靠什么,人究竟是如何完成一件事情的。有哪些向量、哪些维度,可能有助于机器人理解物理世界?
一旦探究到本源,有时候就会上升到哲学层面。
5. 机器人需要自主探索
现在具身智能的学习范式里有很多不同的声音。我们目前这种基于数据驱动的方式,一直都有不同的意见。
就像你刚才说的,人为什么要做一件事,我觉得更多可能涉及价值驱动理论。国际上也有学者提出,能不能让机器人拥有价值观。
比如,机器人为什么要去捡垃圾?我们现在的做法是告诉它什么是垃圾,再告诉它垃圾桶在哪里,然后让它把垃圾放进垃圾桶。
但机器人为什么知道要捡这个垃圾?垃圾放在这里不好吗?
在人类社会里,我们认为环境应该保持整洁,这背后有一个更高层次的世界观。有了这个世界观,机器人看到垃圾之后,才会自然而然地主动去做这件事。
所以,机器人学习的方式可能还需要发生很多变化。
前段时间,图灵奖得主 Richard Sutton 也来创新中心交流。他跟我们讲了很多机器学习领域国际上最前沿的技术。
实际上,他强调的也是强化学习模式:不是给机器人大量数据,而是设置规则,让机器人自主在环境里探索,边探索、边反馈、边纠正、边学习、边提升,形成一个类似 PDCA 的循环,螺旋式上升。
这种方式不需要太多数据,而是需要给它一个好的环境,设置迭代方向,让它自己在里面探索、失败、纠正、改进和提升。通过多轮迭代,它就能自主向前发展,甚至可能超越人类。
很多类似的学术理论和范式正在交织。最终哪一种能够走出来,还需要一段时间探索。
但我依然坚信,当前阶段能够落地的,确实包括 VLA、多模态大模型和世界模型。它们是有效的,其中有确定性可循。
能够产业化的先产业化,能够用起来的先用起来,我觉得这都没有错。本质上,我们需要一部分接地气,同时也需要仰望天空,看看这个行业真正能够发展到什么地方。
您提到 Richard Sutton,他的《苦涩的教训》应该是行业里大家都会读的一篇论文。您和机器人打交道20多年,在实践过程中,有没有对这个原理产生特别强的共鸣?
这样的时刻挺多的。
早期我们做机器人时,比如运动控制,都是基于数学模型的运动控制方式。我们规划好机器人每一步要做什么,通过数学模型求解,再把结果复制给机器人,让它按照要求一步一步执行。
每一步都可以预测,也可以判断。但这种方式反而限制了机器人的发展,因为机器人基本上就是一个傀儡,环境稍微变化,它就完全不能工作,也体现不出智能。
当时大家都很困惑:机器人的未来方向在哪里?是不是这条路已经走到尽头了?
2010年以前,基本上都是这种范式。要让机器人完成一个很简单的工作,我们都要写上万行、几千行代码。
那您对机器人的热爱,最早可以追溯到什么时候?
6. 本田机器人点燃梦想
可能是读书的时候,应该是那时最狂热。从博士开始读博士时,我有几位导师,其中有几位院士给我们上课。
他们给我们播放了当时日本本田 P2 机器人的视频。P2 是 ASIMO 的前身,前身还包括 P1。
那时还没有发展到 ASIMO 那么好的程度。本田机器人是那个时代机器人技术的巅峰象征吗?
那绝对是王者,是我们所有搞机器人、学习机器人技术的人仰望的对象。
当时我们看过一个视频,是熊有伦院士给我们播放的。视频里,P2 接待我国总理参观本田工厂。
那是哪一年?
我看到的视频应该是2002年。
那时波士顿动力还没有出现吧?
还没有。
我们当时读博士,做的都是焊接机器人。我们的博士课题,都是研究工业机械臂如何解决焊接问题,如何让机器人的焊缝更加均匀、美观,更好地适应焊缝变化。我们为这些问题焦头烂额。
但人家的机器人已经可以在生产线上带着人参观了。本田的流水线也非常震撼,全部是各种各样的机械手臂。
我们当时觉得,差距真的不是一点点。
所以那个画面点燃了您对机器人的热爱?您觉得自己热爱的是什麽?
我应该是被那个场景、那个画面感染了,觉得这就是未来。
后来随着研究不断深入,我越来越真实地感觉到,未来应该是人机共融的社会。以后具身智能会深入方方面面:家庭、商业、工厂,各种极限环境,以及未来更远的星辰大海探索,可能都可以应用。
您提到 ASIMO 的前身 P2。ASIMO 后来停产,好像从来没有真正量产,也没有进入真实生产场景。对那个时代的本田来说,它可能更像一个技术宣言,而不是产品路线图。
后来我们看到 ASIMO 退出舞台,本田也很快失去了机器人领域的全球领导地位。您觉得这是为什么?
我觉得这和技术进步、范式迭代有关。
在人形机器人发展的历史长河中,经历了好几轮迭代。本田应该从1986年开始投入人形机器人的研发。它借助日本通产省几次产业倡议,利用日本在汽车领域精细的零部件制造、可靠性和稳定性,以及精密加工方面的优势,把技术钻研到了极致。
所以他们当时做出的机型非常领先。但这种领先,是基于传统数学模型求解范式的领先。
当时自然语言处理很差,视觉处理能力也很差,算力也非常不足。机器人背后都背着一个很大的背包,实际上那就是一台工业计算机。
但毫无疑问,他们通过探索给我们描绘了非常美好的人形机器人未来。今天我们做的很多事情,其实还没有超出他们当时描绘的那幅美好图景。
资本市场花了多久才认为本田提出的 ASIMO 畅想不切实际,把它放到一边?还是说另一个巨星崛起之后,一个时代就过去了?
我更偏向你后面这种说法。
后来深度学习技术出现,大模型发展,人工智能技术不断迭代,把原来基于数学模型的整套范式逐步抛弃了。
人机交互和视觉技术不断提升,现在很多能力都归结到大模型里。技术迭代让机器人拥有了更广泛的适应能力。
但我觉得本田当时没有理解这个行业巨大趋势的变化,就像诺基亚错过智能手机时代一样。
从深度学习一直到大模型伴随出现的机器人化时代,代表性产品分别是谁?ASIMO 之后是谁?
ASIMO 之后,当然还有阿特拉斯。后来法国的阿尔德巴兰公司做了 NAO,还有 Pepper,Pepper 后来被日本软银收购了。
NAO 和 Pepper 这样的产品,给行业带来的启示是什么?
它们让大家看到,商业服务和家庭服务可能有非常大的市场前景。
其实这个需求一直都在。之所以没有做起来,并不是市场不认可,而是技术还不行。
今天的具身智能产品,虽然有这么多公司在做,但大家本质上并没有真正竞争,因为这是一个巨大的蓝海。
每家公司只要把自己的产品做好,解决某个垂直领域的问题,市场就足够大。这也是投资人还在持续下注的原因,因为赛道足够大、足够长。
一个行业要出现 killer 级的产品,还要多久才能等到那样一款产品?
这个问题确实很难回答。一般做时间预测,基本上都会犯错误,甚至会因此失败。
我觉得这个行业充满了不确定性。
从20多年前您读博开始,肯定也有过这样的梦想。您人生中有没有某一刻认为,多少年之内它会出现?
博士刚毕业的时候,我也充满激情,觉得这个梦想很快就能实现。
十年之内?五年之内?
还真有。当时觉得这一天很快就会到来。
所以这个想法指引着您博士毕业之后进入机器人行业吗?您是直接加入优必选的吗?
不是。那时候在上海,我也在一些机器人小公司、创业公司工作过。
但你也知道,2000年代那时候,大家的关注点不在这里。那时可能是互联网、移动互联网,后来是房地产。我们当时想拿到投资都很难。
所以机遇和 timing 都很重要。
我查到您本科读的是汽车相关专业,后来又读了机械设计。其实您有很多次机会,只要转身就可以加入曾经吸纳大量资本的新能源汽车行业。为什么始终没有做这个选择,始终留在机器人行业?
就是喜欢,没有别的。
当你喜欢一个人的时候,就会爱屋及乌,喜欢他所有的东西,连他的缺点也会喜欢。失败了,也会觉得这是一次考验、一次磨炼、一次成长。
这些东西是刻在骨子里的。
为什么加入优必选?因为它当时只是一家普通的创业公司,而且是非常早期的创业公司。
那时候我们去的时候就几个人,只有几张办公桌。
您毕业之后一直做机器人,也做出了一些行业认可的影响力,为什么会选择这样一家公司?
7. 优必选靠坚持成长
早期我们在上海做机器人,主要偏工业和教育领域。但在优必选,我们的梦想是走入家庭,做家用家庭服务。这是我梦想版图里最终的那一部分,非常符合我的想法和理念。
当有一家公司告诉你,它就是要做这件事时,就像找到了知音,所以我义无反顾地加入了。
哪怕遇到很多困难,从2012年3月注册,到后来上市,优必选经历了很多起伏,但我们都坚持下来了。
优必选创始人周剑老师,被媒体塑造成一个“机器人疯魔”的形象。他为了做机器人付出了很多,也投入了大量时间和资金,经历过很多至暗时刻。
您当时认识他的时候,在您眼中他是什么样的人?
他是一个狂热的追求者,也认可机器人未来巨大的市场前景,和我的想法不谋而合,有一种找到知音的感觉。
你们俩谁更狂热?
我可能在技术领域更狂热,他可能在市场和应用层面了解得更多。
是他说服您加入的吗?
对,确实是这样。当时我在上海,他已经在深圳了。
他用什么话打动了您?有没有一个具体画面?
应该说是他的激情、愿景,以及我们共同的一些想法。
当时团队还没有成型。
听说你们之前会彻夜长聊?
说实话,更多是相互打气、相互取暖。
有时候员工都下班了,我们两个人还在办公室里讨论公司的未来怎么做、发展方向是什么,甚至未来的蓝图是什么样。那时候是真的在做梦。
梦做好之后,还要把这些梦告诉员工、告诉团队,甚至告诉投资人。
如果对方不相信怎么办?
那就去找同路人。这个世界这么大,不可能所有人都相信你,总会有人相信你。
有没有梦破裂的时候?
那可多了去了。
优必选在人形机器人领域做了很多开创性的工作。我觉得,它在这个领域的地位不亚于日本的 ASIMO 和美国的波士顿动力。
为什么?
因为在技术探索方面,优必选是最早开始做的。
当时我们推出第一代 Walker 原型时,很多行业人士说我们是抄 ASIMO 的,说我们把 ASIMO 买回来之后换了一个壳。网上有很多这样的说法。
但这完全不可能,对吗?
对。当时 ASIMO 的技术完全封闭,绝对不开放。Atlas 当时还有美国国防部和 DARPA 支持,也同样是封闭的。
所以所有技术都要我们从底层开始做。
我们最早做的是两条腿:两条腿怎么走起来,怎么上下楼梯,怎么走斜坡,这些都是最早探索的技术。
那时候只做两条腿,是因为只能做两条腿吗?
对。因为太复杂了,再做上半身会更复杂,控制不了,只能一步一步来。
所以很多技术都是原创的。
包括关节。当时我们想过不做关节,直接购买德国或韩国的产品,但那时候他们的关节质量很差,很容易坏。后来没办法,只能自己做关节。
你们自己做关节、自己造两条腿机器人,应该远早于王兴兴在实验室里做机器人吧?
是的,是的。
那个时候中国可能还没有人形机器人的供应链。
没有现成的人形机器人供应链。
不仅没有供应链,2012年、2013年的时候,大家都在关注手机。那时候做手机很赚钱。
我们设计出图纸之后,想找工厂加工,还要去求别人。没有人看得上这种小生意。我们的技术要求高又复杂,公司当时也比较穷,还要抠成本。
人家问你要多少,你说做10台、20台,人家拿手机订单给你看,都是 K 级、百万级的订单,当然看不上我们这种小单。
所以那时候要把零部件加工出来,还要利用别人机床的空隙,请工厂厂长吃饭,和机床操作师傅喝酒,人家才愿意认真帮你做。
很多事情都非常麻烦,真的可以写成一本书。以后退休了,我可能会写一本回忆录。
好像有一部电影叫《青春之城》,拍了你们当时创业的艰难时刻。
对,也拍到了一些优必选创业的艰难时刻。
回忆优必选的艰难时刻,您脑海里立刻浮现的画面是哪几刻?
没有。现在回忆起来,更多是比较开心的时刻和高光时刻。
在我的印象中,整个过程都很享受。刚才说到的春晚,2016年我们第一次上春晚,我觉得是一个很高光的时刻。后来上市也是一个高光时刻。
您在优必选拉起的是一个什么样的团队?以您的个人风格,应该会组建一个研发气质很强、具有技术理想主义的团队。
我觉得不是一类人,很难走到一起。
首先,底层核心价值观肯定要相通。创新中心的核心价值观是:正直、自驱、合作、极致。
正直是第一原则。首先人品要好,我觉得要做好事,先要做人。这是我招募团队的第一原则。
第二是自驱。具身智能时代,一定要有比较高的理想,志存高远。不管我在不在,你都要努力工作,为梦想去打拼。
第三是合作。机器人是一个集大成者,涉及方方面面,肯定需要团队协作。
第四是极致。工作不能做到95分就觉得够了。很多人觉得做到90分已经很了不起,但我说,做不到120%都不达标。
机器人产业链非常长,如果每个环节都只做到90%,最后累积起来就会差之毫厘、谬以千里。这是我对产品的要求。
后三点比较容易观察,正直怎么判断?
其实就是一种感觉。
行业发展到一定程度之后,大家甚至比拼的是体力、人品和底层三观。你是否认同这个梦想?你怎么看未来的具身智能和人形机器人产业?这些决定了你能不能走远。
这么多年,人形机器人产业有高潮也有低谷。很多人是在高潮时进来的,到了低谷就离开了。
现在看起来行业又处于高潮,大量资金进来,希望蹭一波热度。等行业遇到低谷时,这些公司还会不会坚持?不一定。
我们在2010年代的时候,也经历过一次人形机器人行业的高潮。当时很多公司和今天一样繁荣,但真正走到最后,发现很多公司都不在了。
遇到低潮时,很多公司坚持不下去,或者不想坚持。他们觉得有更好的赚钱方式,比如房地产、移动互联网、智能手机,这些当时都比机器人更赚钱,于是大家都去做能赚钱的事情了。
没有梦想,就走不远。我需要找到同路人,所以整个团队基本上都和我有相同的气质。
您刚才提到第一项是正直。这让我想到这一届人形机器人运动会,有团队被主办方退赛,是因为违反了规则。
大家都声称是自主参赛,但赛方查出有团队是假扮自主,实际上使用了遥操作。
我很好奇,既然这个行业已经可以实现自主泛化,应该说这是行业的平均水平了,为什么这一届人形机器人运动会仍然保留遥操作?既然大家都可以自主了,为什么还需要遥操作?
在有些情况下,遥操作也是一个很好的补充。
比如什么应用场景必须要遥操作?
在一些比较特殊、危险的场景里,单机本体可能不适合完全自主操作。
比如操作道闸、电力设备、配电箱和配电柜。如果操作错误,可能会造成比较大的影响。有时候为了确认,最后需要人工介入判断,这时就可能需要遥操作。
简单来说,在当前人工智能和机器人大脑还不够发达的时候,要把人的智能和机器的智能结合起来,完成一些超出当前机器人能力的工作,就需要人的介入。
但遥操作也不是普通老百姓想象的那种遥操作。普通人理解的遥操作,可能像遥控玩具、遥控车一样,按一下遥控器,机器人前进、后退、左转、右转。
其实今天具身智能里的遥操作是行为级别的,也有任务级别的,是分层次的。
最低层级的遥操作,是每一个微小动作都需要人发出指令,完全是一步一趋。行为级遥操作可能是给机器人一个指令,比如“把这个杯子拿起来”,让它完成一个小的行为。
还有一种是任务级遥操作。今天人工智能已经发展到一定阶段之后,真正把人的智能和机器智能结合起来。比如在变电站里,机器人看到一个开关亮红灯,需要判断是不是要把开关扳动,让它变成绿灯。
这时机器人判断需要人介入,人给它一个决策:把这个开关扳下来。之后机器人自己走过去,可能还要绕过障碍、打开一扇门,完成一系列复杂操作。
人给的是任务决策,机器人负责具体执行。这是一种更高级的任务级遥操作。
这种遥操作也有很高的技术含量。人给出更高层级的决策,机器人负责具体执行,不再是过去那种傀儡式操作。
明白了。所以您刚才说,这次比赛中关于遥操作的争议,和你们的价值观是冲突的,需要裁判根据规则进行约束。
对。
这次大赛我们还看到很多非纯机器人公司加入进来,比如汽车领域的公司、手机领域的公司。
今年4月的马拉松,荣耀最终夺冠,是所有人眼中的黑马。您怎么看荣耀这样的厂商也来做机器人?
这说明产业在繁荣,大家也看好未来市场。大家一起把这个行业推向更高的高度,我觉得这是好事。
汽车领域有小鹏为代表,手机领域有荣耀为代表,大家都跑来做机器人。您觉得他们为什么来做机器人?他们都是商业化公司。
最底层的原因可以说都是为利而来。大家应该相信这是一个万亿级的蓝海市场。
今天投入1个亿,明天可能赚10个亿、20个亿,甚至100个亿。大家应该看到了这是一个值得进入的市场。
今年运动会上最后的决战,简直就是“红白大战”:你们的机器人是白色的,荣耀的机器人是红色的。一个代表原生机器人公司,一个代表硬件厂商。
手机和汽车公司对供应链的管理能力,以及对极致制造的追求,应该是它们的优势。两派公司各自有不同的优势和风格,放在一起竞争,您觉得能看出什么?
我看出来的还是技术取胜。
首先,荣耀跑得非常好,我也很认可荣耀的技术和投入。
我觉得,只要大家朝着一个目标前进,真正去做工作,就都能取得比较好的成绩。
作为一个行业专家,当您看到硬件厂商展现出不俗的硬件和技术实力时,会不会产生一些意想不到的后续判断,需要更加留意这类玩家?
第一年马拉松,荣耀作为黑马拿到第一名之后,大家可能会觉得,机器人领域里的硬件和运动控制是不是已经没有太多门槛了?
好像任何公司只要往里面砸钱,就能取得好成绩。于是有人会认为,原来做机器人的公司已经落后了,未来是资本的天下。
荣耀今天砸多少钱就拿第一名,明天一家互联网公司随便砸5个亿、10个亿,是不是也可以超过所有机器人公司?那是不是机器人公司都可以出局,不用干了?
当时很多人,包括资本,都提出过这样的看法。但这可能还是有些片面。
机器人赛道绝不是一家或两家公司,或者一次性投入就能做好的。这是一个需要长期积累的赛道。
你可以采取简单粗暴的方式,在某个单点上取得短期成绩,但如果真的想为行业做贡献,达到很高的高度,把机器人推向千家万户,就需要长期积累和持续挑战,做很多底层工作。
所谓“板凳要坐十年冷”,就是这个道理。
我一直反对行业一火起来,大家就往里面砸钱。互联网公司、造车公司、手机公司都进来了,好像这是一块唐僧肉,大家都想吃一口。
但产业长期繁荣需要长期积累,需要真正进行大量底层创新,也需要耐心资本。
您会怎么判断一家机器人公司是不是一家好公司?
好的公司首先要有好的核心价值观,使命和愿景也很重要:这个公司为什么而生?
那么多机器人公司,愿景应该都类似,都是让机器人进入千家万户、进入人类社会生活。
这个愿景当然都很好。但有了愿景之后,下面每一步行为是不是围绕愿景展开,具体打法可能会不一样。
要看清楚自己在行业中的定位,也要看团队擅长什么、拥有怎样的禀赋和资源,并把这些结合起来。
有的人对市场了解很深,对生产制造和机器人在工业中的应用有经验,可能就会做这方面的工作。
有人可能更了解医药、养老和健康领域,就可能去做外骨骼等产品。
我觉得这些都很好,关键是要有自己的独立判断和独立思考。跟风的话,最终可能会被淹没在具身智能的浪潮里。
您刚才说“板凳要坐十年冷”。您在优必选的十多年,其实已经经历过冷板凳阶段。这段经历给您最深刻的影响和认知是什么?
我觉得就两个字:坚持。
坚持真的很重要。选择一个方向,就要把精力和资源投入到坚持的方向里,做时间的朋友。
确实有很多非常艰难的时刻,很多时候都可以放弃。放弃是一件非常容易的事情,反而坚持下来没有那么容易。
当年和我们一起创业的很多公司,后来走着走着就不在了。
很多人把这一轮智能革命比喻成另一种工业革命。
工业革命之前,人类社会的生产系统围绕人力设计;蒸汽机的动力被验证之后,整个社会生产系统转而围绕动力设计。
如果以工业革命作为一面镜子,也许当智能能力发展到一定阶段之后,整个社会的生产设施也会转型,从以人为中心,变成以人、机器人和 AI 为中心。
整个设施架构和体系都会变化,所以人形并不一定是终极答案。
8. 人形机器人连接未来
我同意你的看法。那我们为什么还要拼命做人形?为什么不能绕过人形?
这又回到我们个人最底层的逻辑,也就是你的三观是什么。
我做人形机器人的底层判断是:未来社会会是一个人和机器共融的社会。机器人会成为我的朋友、伙伴,甚至家人。
那为什么一定要做人形?什么样的机器人会成为您的朋友和家人?它会是轮式机器人,还是爬行机器人?
我觉得不会。
成为我朋友的机器人,一定是我能接受的,能够自然地和我交流、理解我的机器人。
如果让我和一个看起来奇奇怪怪、动作和行为我都无法理解、从来没有见过的形态交流,那绝对不是我希望的形态。
人形机器人能够适应我们的工作,无缝连接到生活和生产环境中。它可以操作我们已经习惯使用的各种工具,不需要改造环境、设备和工作流程,拿过来就可以用。
它不像手机,我还要解锁、输入密码、打开 App。机器人来到我身边,我一个手势、一个眼神,它就明白我的意思,马上帮我办好事情。
它也不像电脑和手机,还需要键盘、鼠标和各种 GUI 转换。它可能成为第三代人机交互中心。
大家今天诟病人形机器人,无非是因为技术复杂、成本高。但如果这些问题都解决了呢?
一个很聪明的机器人可以完成所有工作,你会选择买手机还是买机器人?那时候我根本不会考虑手机,电脑也不需要了。
如果一个很聪明的人形机器人和一条机器狗放在你身边,你会选择什么?我们做过很多测试、调研和对比。
当大家忘掉成本,忘掉背后的技术复杂度,只做直接选择时,毫无疑问,大家会选择人形。我需要这样一个人,给我提供情绪价值。
未来社会可能是一个“三体”社会:一个肉体的熊友军,一个机器人的熊友军,还有一个数字人的熊友军。
我的肉体总有一天会死去,但通过脑机接口,我可以把大脑中的知识储备和过往经历输入数字人,也可以输入机器人的熊友军。说不定这样就能实现某种意义上的永生。
我觉得这可能是未来人机共融社会的一个直观画面。
我个人不是这一派,但没关系。我们更多是呈现每个人所相信的世界。
您在优必选期间应该深度参与了 Walker 系列。Walker 一开始定位家用,但最后还是先选择在工业场景落地,就像今天大部分具身智能公司选择的商业化路线。
为什么最终会有这样的转折?这是一种妥协,还是另一种坚持?
我觉得这是现阶段技术局限和公司需要获得商业回报共同作用的结果。
Walker 走入家庭是长期愿景,但以当前情况来看,进入家庭确实还有难度,涉及安全、标准等问题,很难在短期内取得重大突破。
所以基于当前技术状态,让它进入工厂,在结构化、可变现的场景中完成工作,我觉得是一个正确选择。
同时,在人形机器人大量进入工厂一线的阶段,也可以采集大量数据,加快 Walker 系列的迭代。
几乎所有头部公司都不会放过工业场景。但我确实发现,有几家公司做物流分拣时,节拍明显快于其他公司,或者稳定性更高。
目前展示出来的工业场景中,表现更好的机器人究竟强在哪里?是算法、硬件可靠性,还是其他维度?
现在我觉得,大家在工业场景中的表现还处在同一个 level,没有看出非常明显的代差。
您说的是 WRC 展出的状态,还是实际落地的状态?
我说的是 WRC 展出的状态。
新松的高继阳说过,假设人完成一个任务是100%,机器人现在的速度大概能达到六七成,也就是70%左右。您认同吗?
要看不同场景。
比如分拣台分拣?
以人的最快速度来看,我们在京东流水线上看到过,一小时基本可以达到2000多件。
今天比较快的,FANUC 可能能达到1500多件。国内也有1200多件、1000件、1300到1400件的水平。
到底是什么决定这种差异?是算法、硬件,还是什么?
这是综合能力的体现。
算法当然很重要,还包括针对场景进行深度定制,以及模型和大脑的能力。
包裹的变化非常多,尤其是真实流水线上,有十几种不同的包装:硬包装、软包装,还有塑料袋。需要采集各种各样的数据进行训练。
在这个场景里训练出一定的泛化性,比如识别不同颜色、不同包装,判断不同大小和形状,都是可以做到的。
靠 VLA 技术可以实现,对吗?
对。这相对来说是一种泛化性,场景变化不是特别多。
您应该是在2023年11月成立北京人形机器人创新中心。这个公司和其他具身智能创业团队非常不一样,大家把你们称为“国家队”。
你们名称后面还有“国家地方共建”几个字,所以简称“国创”。我们应该怎么理解“国家队”这个定位?您为什么会从优必选,从深圳来到北京做这件事?
9. 国家队建设开放底座
在优必选,因为它是一家商业化公司,我的定位是 CTO,主要负责技术探索和产品研发,目标是实现最大的商业化。
但在这里不一样。我需要站在国家和产业的角度分析行业:如何让行业健康发展?如何让中国的具身智能机器人产业,在未来全球竞争格局中取胜,占领行业制高点?
这是我现在需要思考的问题。
我会站在整个产业和国家的层面,分析行业的痛点、难点和堵点在哪里,然后针对这些问题进行布局和研发。
同时,我们会尽量把研发成果开源开放,让更多商业化公司避免底层重复建设和无序建设,减少社会资源浪费。
所以你们更像行业的基础设施建设者和协调者。
对,我们更多是基础设施的搭建者。
你看,我们早期天工的一些硬件设计全部开源。跑完马拉松之后,第一届比赛涉及的所有算法和 pipeline 也全部开源。
后来我们训练大模型的数据,包括几百万条高质量数据,也全部开源。模型架构同样开源。
这些都是我们一直坚持的初心。
创新中心有一些大股东,比如优必选、小米,还有亦庄方面的政府机构。为什么最终会是这些资本成为创新中心的底座,成为第一批早期股东?
你说的这些原始创始股东,都认可创新中心的愿景和价值观。
当时我们在做融资工作时,和很多机构都沟通过。有些机构没有投资,主要是因为他们觉得这是一个国家平台,商业价值和公司自身追求未必匹配。如果不符合,他们可能就不会投资。
优必选、小米、亦庄国投,还有京城机电当时投资,并不是单纯追求商业利益。
那他们追求什么?
追求技术创新,追求为行业带来更多贡献。
我们开源开放的内容,对优必选、小米、京城机电以及所有股东都是开放的,本质上也是在赋能他们。
他们投入资金和各种资源,也是把一部分创新资源放在企业体外,让它有可能发生。
创新中心有国家队的定位,但背后也有行业巨头和政府的身影。只要有大资本存在,市场就会把它理解成某种“战队”。
如果其他有商业化诉求的公司来使用和合作,可能会产生“分你我”的顾虑。怎么解决这个问题?
目前我们还没有看到所谓战队的问题。
我们坚持开源开放,而且是一视同仁的全球开放。在美国可以使用我们的开源内容,在欧洲、日本、韩国也都可以下载。
我觉得不存在这个问题。
原来您在优必选担任 CTO,更多从公司的商业化角度思考;现在要考虑整个国家的产业如何在全球占据更好位置、实现更高水平创新。这两个角色之间,认知有什么变化?
变化很大。
原来在优必选,是从商业化和公司角度出发,是“小我”。今天考虑的是国家和行业,可能是“大我”。
今天做的研究和布局,比优必选更底层,更偏向基础设施建设。优必选更多是做应用技术,偏向上层,比如运动、视觉、感知和决策。
思考范围发生了很大变化。
中国产业和供应链的深度,在具身智能这件事上,有机会把中国推到全球什么位置?
这是个很好的问题。今天可以毫不避讳地说,具身智能的竞争就是中美之间的竞争。
国家给出的定位是,人形机器人竞争是中美科技竞争的必争之地。
从社会期待和行业发展来看,大家至少站在同一起跑线上,各有各的优势。
中国有非常明显的优势,包括供应链和迭代能力。在本体和产业链方面,我们有很好的基础,也有大量应用场景,为人形机器人的快速迭代提供了支撑。
美国则在大脑和人工智能领域做了很多原创性创新,国内相对来说还处于跟随状态。
美国现在实践出了哪些中国还没有的创新?
比如世界模型、空间智能,李飞飞团队正在做的工作,这些领域我们很多还处于跟随状态。
另外,机器人对算力有很大需求,算力芯片大部分来自美国。这些都是国内需要突破的方向,而且很紧迫。
中国的算力多久能够突破这道关卡?
国内已经有几家公司上市了,但它们更多是在无人驾驶和整个 AI 层面的算力方面发展。在具身智能领域,大家还在做适配。
现在不是没有替代方案,只是这个替代方案在当前追求技术进步的情况下,是不是应该马上拿出来,它是不是最经济的方案,不一定。
国产算力拿来并不是直接就能用,还需要做很多适配,需要在底层架构上投入大量工作,开发投入和成本都会更高。
所以现在除非万不得已,比如美国真的限制出口,不再向我们出售,我们才会全面启用这些方案。
但并不是没有解决方案,解决方案是有的。
从帮助一家公司赢——也就是您在优必选时的目标——到现在帮助一个区域、甚至一个国家的产业链赢,重点关注的指标有什么不同?
现在关注的指标,更多是底层技术的突破。
包括我们刚才说的两个平台:一个是天工,另一个是慧思开物;另外还有生态建设。
我们做了很多开源开放工作,培养了很多二次开发者。这次比赛有很多科研院所、高校和二次开发者使用我们的平台开发并参赛,整个赛场上应该是最多的一家。
美国仍然以闭源为主,中国靠开源走出了一条自己的路。现在开源生态逐渐形成燎原趋势,也对闭源技术的领先性形成了一定压力。具身智能也是这样吗?
是。我们开发并开源自己的数据集之后,在行业里的下载量应该是最大的一家。
您说的行业,是中国还是全球?
现在能够统计到的主要是国内数据。全球数据我找不到,但应该中国是第一,全球也可能是第一。
国外具身智能数据集开源得不多。
为什么中国会选择开源?
我觉得中国整体上比较开放,这可能是思维模式的转变。
通过开源开放,我们能够聚集更多同路人,形成更好的生态,扩大技术迭代。从开源过程中,我们看到了很多好处,所以会选择开源。
开源自己的数据集和算法之后,带来的最大好处是什么?
第一个好处是培养更多使用者。今天他们是我们的开源用户,未来可能就会成为真正的用户。
开源有一整套协议。用户使用我们的内容并进行开发,也需要上传和反馈,把更多案例反馈给开源社区。
开源过程中,很多人会提出建议和改进意见,甚至发现 Bug,我们就可以快速迭代。这对促进技术进步也有很大帮助。
所以本质上,开源是把更多人聚集在一起,形成一个团队和生态,众人拾柴火焰高。
另外,因为我们是国家平台,也希望为中国培养更多具身智能人才。通过开源,可以帮助国内很多开发者提升具身智能开发能力。
您一开始说自己是乐观派。在具身智能领域,您觉得中国有机会赢吗?
对此我坚定不移,非常坚信。
我们要怎么补上大脑这一课?什么时候大脑方面的原创创新能够出现在中国?它需要满足什么条件?
大脑确实需要大量投入,而且是长期投入。
现在已经有很多创业公司开始做这件事,这是一个很好的变化。未来说不定会出现类似 OpenAI 的公司,只要坚持长期主义。
大家沿着不同方向探索,至少可以证明哪些方向走得通,哪些方向能走得更远,哪些方向是死胡同。
中国有一点比较好,就是很多方向都有人探索。最后很快就能知道哪一方成功了,大家就不会继续向不成立的方向投入资源。我觉得这也是一件好事。
不知道您有没有留意到,这届 WRC 开幕式上,王兴兴讲了一个具身智能目前无法解决的卡点。
他说,语言模型的输入输出是纯数字编码,严格限制在固定向量空间里,基本没有损耗。但机器人的每一次输入输出都会引入偏差和损耗,尤其是触觉层面的细微误差几乎无法修正,成功率也会随之暴跌。
他认为,这限制了机器人智能的最后1公里。您怎么看这个问题?
我认同他的意见。不同模态信号和信息的表征,会带来一定损耗。
所以我们现在也在追求对多模态信息进行统一表征:语言、视觉、触觉等信号使用同一种表征方式,输入大模型后,用统一的向量进行推理和决策。
这就是我们接下来追求的大一统模型。
之前并不是在统一向量空间里做表征。您觉得大一统是一个趋势吗?
现在还没有完全形成行业共识,但有几家领先公司已经在探索,包括我们。
我们推出了自己的 RoboBrain Unify 统一大模型。从当前效果来看,我们觉得还不错。
后来这个模型登顶了 World Arena 权威榜单的榜首。之后我们在语音和视觉榜单中也做了一些测评,发现效果同样不错。
至少在当前阶段,我们认为这是一个值得探索的方向。
大一统模型可以把 VLA、多模态大模型和世界模型的优点结合起来。
VLA 可能更擅长操作和执行,世界模型可能更擅长推理和预测。它们各有优势,也各有不足,但通过统一表征,可以把各自优势结合起来。
大一统意味着需要消耗更大资源,数据、训练方式和整体范式都要更大规模,也是一种全新的范式。这个事情不是所有人都能做,有一定门槛。
对。大一统模型的参数量,和多模态大模型、之前的 VLA,可能不是一个量级。
部署到本地端、部署到机器人上,确实有难度。当前算力和机器人端侧芯片都不支持,所以很多大一统模型还在云端运行。
未来随着芯片技术和架构发展,我们可以采用不同架构来规避这个问题。
现在参数量确实比较大。等它成熟到一定程度之后,可以采用蒸馏、裁剪等方式,把模型缩小,再部署到机器人端侧。
随着技术迭代,我觉得这些问题有办法解决。
在这个赛道里,有技术深度和底蕴的公司,后劲会更足吗?
我觉得现在无论是具身智能,还是人形机器人领域,技术树上还有很多节点没有点亮。
机器人真正进入生活,需要克服并点亮这些技术节点。所以这类公司的目标可能更远,路也可能更长,但要真正达到梦想的彼岸,这些问题绕不过去。
现在行业里有一批公司,拿到了资本市场最多的钱,但并没有真正下场训练模型、抢占大脑技术。
可能它们认为现在还不是时机,等有人做出统一范式,或者某种范式被验证之后,再下场砸资源、收割市场。您怎么看这种思路?
这可能更多是商业模式的操作,也确实有成功案例,或者说阶段性成功。
但在我的认知里,这样的公司走不远。你可以一时成功,某一次或某几次成功,但不可能次次成功。
您相信最终走得好的长寿公司,一定是下苦功的公司?
一定是有自己坚持和梦想的公司。
机器人是一个非常复杂的体系。有些人的梦想在大脑,有些人的梦想在供应链,有些人的梦想在本体硬件。现在基本上头部公司都声称自己做全栈,对吗?
对,确实有很多公司说自己做全栈。
您定义的“全栈”是什么?
“全栈”应该要打引号,每个人对全栈都有不同解释。
在具身智能和人形机器人领域,真正的全栈公司,我觉得不可能存在,因为范围太广。
我们所说的全栈,是公司自己的两个平台:天工,也就是本体的开源开放平台;第二个是慧思开悟,也就是大小脑平台。这两个平台涉及一些关键的核心共性技术,这就是我们所说的全栈。
为什么说不可能有真正做全栈的公司?
因为太广了。
真正的全栈还包括很多内容:核心技术、关键元器件、运动控制,比如 MPC、WBC 等控制器,范围太多。
大脑方面还涉及更多范式,甚至还有更底层的操作系统、工具链,以及刚才说的数据。
数据内部又有很多细分的底层数据。整个具身机器人技术的 map,细分起来非常复杂。
产业发展需要很多公司一起努力。所以我们要开源、开放,让大家各自专注于擅长领域,为行业添砖加瓦。
回到这次运动会。运动会分成两类主题,一类是竞技赛,一类是场景赛。
竞技赛是跑、跳等类似人类运动会的项目;场景赛则定义机器人的工作场景,让机器人完成任务。
我所知道的是,这个行业里基本上大家都偏科。你们应该是唯一一家在竞技赛和场景赛两类赛事中都取得头部名次的公司:竞技赛金牌数第一,场景赛金牌数第二,对吗?
偏科不是坏事,术业有专攻。专注于自己擅长的领域并做到头部,我觉得就有机会。
本质上,无论创业还是做事情,都应该坚持这个逻辑。那些偏科的公司,如果真的在自己的领域做到头部,我都应该为他们鼓掌。
创新中心因为是一个国家平台,需要站在全行业角度,扫描行业短板和共性关键核心技术是什么,分析我们和海外竞争时落后在哪些方向,再列出需要努力和发力的点。
基于当时掌握的资源,我们一步一步展开工作。
创新中心也不是一开始就做今天所谓的全栈。一开始我们先做天工本体,先把运动控制和运动能力做到极致。
第一次参加马拉松并获得冠军之后,我们开始布局大脑和大模型。最初做的是 VLA,之后是多模态大模型加 VLA,再之后加入世界模型,现在又开始做大一统模型。
这是基于现有资源和对行业的认知逐步展开的。未来不排除还有其他布局,也会基于行业发展、社会需要和科技竞争来决定。
既然你们从一开始就要扫描整个行业,那现在我们有没有绝对优势和绝对劣势?
现在确实有优势。
中国在一些核心元器件方面有优势。比如关节领域,行星减速器、谐波减速器、滚珠丝杠等,国内有很多公司在探索,而且走在前面。
技术的稳定性和可靠性,国内也做得很好。甚至海外大家熟知的几家公司,关键硬件供应链也在中国。
这些优势我们要牢牢抓住,并不断强化。
传感器方面,国内做得也比较好。比如电子皮肤、压力传感器,过去不够好,但这两年的进步非常快。
还有能源和电池。到今天为止,电池仍然是短板,但现在看,电池正在快速进步。
过去机器人电池又大又笨,容量看起来很大,实际也就10安时。现在小型电池的容量已经比过去大很多,放电倍率等参数也提升了很大一截。
说不定下一次马拉松比赛,就能看到一块电池跑完全程。
核心元器件技术都在快速迭代,这方面中国确实有不可比拟的优势。国家也已经意识到这一点,并在有意识地加强这些优势。
问一个伦理问题。每次看到马拉松或跑步比赛中机器人跑得非常快,我都会担心:机器人跑得特别快,如果出现意外怎么办?
这次还有一个全民关注的热点:有机器人跑着跑着撞到挡板,腰断了;还有机器人跑着跑着上半身飞出去。我忘了具体是哪一家。
怎么看机器人越来越强大之后带来的安全和伦理问题?
伦理和安全问题就是底线。
现在大家都在考虑人工智能安全,国际上已经成立了很多安全能力委员会,这是一个很大的话题,也是底线问题。
国家层面和学术领域都在制定相关安全标准,包括几个层面。
第一个是本体安全,确保机器人不会对人和环境造成伤害。第二个是数据安全。第三个是信息安全,以及个人隐私泄露等问题。
这是一整块很大的拼图。行业正在制定标准,我们也牵头参与安全标准的制定和规划,在工信部指导下开展相关工作。
今年年底会发布很多标准。未来机器人厂商必须强制执行这些标准,机器人达不到安全标准,就不允许销售。
否则可能对社会、人员和用户造成不必要的意外。这是一个底线,而且是很高级别的底线。
我们现在看到最成熟的应用之一是无人机,但实际上在北京无人机禁飞。
未来机器人会不会出现类似无人机的情况,在某些地方受到限制?国家会不会从安全系数、生命风险等综合因素出发,制定一套规范这类行为的体系?
一定会。
从系统安全层面来说,如果机器人被黑客攻击,被有不良意图的人控制,变成一个杀手怎么办?它确实可能造成意想不到的危害。
所以机器人未来大规模上市时,必须满足国家强制性的安全法规要求。
从技术上能否实现机器人不被黑客攻击,保证它是安全的?
当然可以。
在系统软件层面,可以采用很多安全防护方式和加密措施。无论是网络、通信,还是整个系统,都有现成的解决方案。
只是现在还没有统一的法律法规,所以很多创业公司可能还没有特别关注这件事。
我们现在已经在路上,未来会碰到越来越多机器人,所以担心还是有道理的。
但正规的机器人上市之后,你就不用有这个担心了。
这一天应该也会很快到来,是吗?
是。
我们的节目希望做最有生命力的科技商业访谈。最后想请您分享一下,您和机器人相处20多年,最有生命力的时刻有哪几个?
10. 机器人也需要情绪价值
最有生命力的画面,还是在家庭场景里。
我以前做过一个比较小的桌面机器人。有一次我正在专心处理工作,它突然像苏醒一样站起来,对我说:“熊总,外面有位客人到了,需要您去和他开会。”
当时我正在专注地做自己的事情,它突然这样提醒我,就感觉像我的秘书,像一个真正的人一样。它说话的声音、语调和动作都比较自然,我很容易接受。
还有一次是在疫情期间。我们当时用机器人给隔离区的人送生活必需品。很多人处在无助状态时,有一个机器人来帮助你,那种雪中送炭的感觉非常温馨。
还有一次是在养老院。老人需要护理人员,隔一段时间要做操。那次是我们的机器人带着老人一起做操。
老人们觉得很新奇,问了很多问题,机器人就带着他们完成活动。我第一次真实地感觉到,机器人真正发挥了价值,也给社会带来了温暖。
这是一种很利他的价值观,也是一种很温馨的感觉。这就是我想到的3个最有生命力的画面。
今年看运动会,我有一个特别大的感受。以前我会觉得,机器人不需要提供情绪价值。
但看了运动会之后,我觉得机器人太需要提供情绪价值了。已经很久没有出现过这样的场景:我和朋友们坐在电视前看一场比赛,大家全都在笑。
我们看机器人打拳、跑步,确实会因为技术还不够成熟而显得笨拙。但恰恰是这种笨拙,让人觉得非常有趣,像是在观察某种生物成长,像人类看宠物一样看它们。
这就是机器人带来的情绪价值。当然,每当它突破、刷新纪录时,又会让我们对硅基生命产生一种敬畏。
您知道我是这样看的吗?
其实我看它们,就像看自己的孩子蹒跚学步,一步一步成长。
我会用充满期待的眼神看它们,也会带着爱。有时候它摔倒了,我会用怜爱的眼神看它,就像看自己的儿子摔倒一样。
它摔倒了,您会心疼吗?
当然会心疼。
你看,我们的机器人身上还会带泡沫。我们的 Omni、Archo 刚开始测试时,身上有很多泡沫。
因为测试时它经常摔倒,摔倒之后,胳膊有时会摔歪,胸前的外壳也可能摔变形。这些都需要后续维修。
为了保护它们,我们专门做了一套泡沫衣服,把关键部位保护起来。这些都是我提出来的。
所以我和你们看它们时,可能是完全不一样的眼神,也是不一样的心情。