[BidClub_]
晚点聊 LateTalk · · 82 min

149: 具身模型哪家强?|与范浩强、高阳聊具身模型的测评、RoboChallenge,26 年具身展望

范浩强高阳程曼祺

Podcast
TL;DR
  • RoboChallenge 的首要价值,是把具身能力从精挑细选的 demo 变成可反复观察的代际曲线。 传统论文往往只展示三四个任务,定义还互不相同;新平台用标准化的 Table 30、集中场地的真机环境和数百次执行压低方差。范浩强的目标不是争论 99% 与 99.5%,而是先可靠地区分“它是零,我不是零”。

  • π0 到 π0.5 的进步证明,具身模型虽然很早期,却已出现足以肉眼感知的跃迁。 π0 在 30 个对人类近乎零失误的任务上平均成功率只有 20% 多,π0.5 升至约 42%,若干简单任务微调后可达 100%;范浩强站在机器旁的感受是“它比之前的模型更灵光一点”。主持人称其为短期飞跃,他则提醒两代模型其实“快一年”之隔,但翻倍仍是明确的 scaling 信号。

  • 最新榜单中,千寻智能 Spirit V1.5 超过 π0.5、位列第一,但最高档模型总体仍未越过 60 分。 这不是榜单失效,而是团队刻意把任务放在当前模型的“敏感区”:碎纸考验遮挡下的精密插入,插花涉及物体与物体接触,扫二维码则暴露单帧 VLA 没有记忆。对投资判断更关键的是代差和改善速度,而非一个看似精确却无法复现的小数点。

  • “Scaling data 可能是 2026 年最重要的一个主题”,而路线之争尚未收敛。 高阳把数据分成仿真、人类视频、可穿戴设备和遥操作四类,千寻目前押注除仿真外的全部真实世界来源;范浩强则认为“条条大路通罗马”,真正决定上限的是团队收集了多少物理世界知识。Generalist AI 声称已有 27 万小时、每周新增 1 万小时,另有可穿戴路线团队提出一年采 1,000 万小时,数字都需按嘉宾原有条件理解。

  • 具身领域还没有找到相当于 AI coding 的高价值、规模化应用楔子。 Coding 高度集中、单位价值高,机器人服务却分散在家政、取送、维修等大量垂类,而且传统工业机械臂已经抬高了商业基线。范浩强把“每天自动叠好我家的被子”视作个人验证任务,但被子也同时检验模型、负载、精度和整机稳定性,说明应用突破不会只由模型决定。

  • 两位嘉宾把当前能力类比为 GPT-2 或 CIFAR 阶段,而非公众从 demo 中想象的准消费产品阶段。 高阳预计让普通人真正感到 GPT-4 式“破圈”可能还需 3—4 年,从业者则会更早从不完美模型中看见信号;主持人补充说,如果 2027 年能出现奇迹当然最好。“破圈”最终必须发生在客户侧,只有客户相信,需求和部署才会正向流转。

  • 2026 年的两个核心悬念,是中国能否出现具身领域的 DeepSeek 时刻,以及基础模型能否逼近 GPT-3 乃至 GPT-3.5。 范浩强想验证国内团队能否从过去仰望海外模型走到追平,高阳则说“今天的我非常有自信”,同时保留几个月后信心可能升降的余地。RoboChallenge 上线约一两个月已积累逾 1 万次运行、九台左右机器一度排队一两天,既显示研发需求真实,也提醒评测基础设施本身仍处在供给不足的早期。

Digest · the substance, structured for research

1. 两条技术履历共同塑造了对具身进步的乐观

  • 范浩强从 2012 年、高三保送后便进入旷视,经历了从 SIFT、SVM 到 deep learning 的计算机视觉产业化。他记得人脸识别从 80% 多一路做到“一共十二个九”,由此形成一个强烈信念:“只要这个算法原理是对的”,持续投入聪明才智和劳动,技术最终会给出回报。

  • 高阳约从 2016 年在 UC Berkeley 读博期间,由计算机视觉转向与 Sergey Levine 等人合作机器人研究;2020 年回清华任教,ChatGPT 浪潮又让他相信人类已经掌握通往 AGI 的道路。2023 年前后创办千寻智能时,目标便是做具身领域最强模型,并把它装进能进入生活的机器人产品。

  • 两人的互补也解释了节目里的分工:范浩强更关心如何把难以复现的能力变成可运营、可迭代的工程系统;高阳则从机器人学习史、模型范式和数据结构解释为什么今天终于具备大规模测评的条件。

2. 精选 demo 长期掩盖了机器人模型的真实边界

  • 范浩强把过去的机器人 research 比作图形学论文:每篇都要有几个很酷的 demo video,但通常是“录了很久,最后有一条好的”,只能证明某件事至少可以发生,不能说明成功率、泛化性或稳定性。

  • 真机论文往往只测三四个任务,不同论文即便都叫 table bussing,实际环境、物体和动作定义也完全不同;仿真虽然易测、noise 可控,却不能直接回答现实部署表现。缺少共同榜单也反过来拖累研发,让团队无法判断一次模型改动究竟进步还是退步。

3. 大规模真机执行显出了清晰代差

  • RoboChallenge 的起点是一个朴素问题:能不能不再测三次、五次,而是让模型至少执行几百次,再用平均成功率压低偶然性?一旦决定 large-scale evaluation,任务格式、文字描述和测试 protocol 就必须标准化,并兼容单臂、双臂等不同机型。

  • 团队最初挑了 30 个对人类“绝对能够百分之百干好”的桌面任务,π0 的平均成功率却只有 20% 多,相当于四次只能成功一次。范浩强承认当时很慌:若把结果公布,外界会不会因此对整个行业失去信心?

  • π0.5 权重公开后,团队第一时间测试,平均成功率升到约 42%。冲击不只来自翻倍的分数;站在机器旁看,它“比之前的模型更灵光一点”,若干最简单任务经过 fine-tuning 已能稳定做到 100%。

  • 主持人把这描述为短时间内的迅速提升,范浩强保留了重要修正:“其实也不短了”,π0 与 π0.5 相隔接近一年。即便如此,两代模型在同一套真机任务上的差异,仍让他确信行业正在发生非常 concrete 的进展。

4. 物理世界的噪声决定了评测应先看趋势而非小数点

  • 高阳指出,具身模型必须与物理环境闭环交互;两只杯子的把手、物体摆位、光照乃至机械误差都可能不同。模型失败时,很难立刻判断是模型差、把手不同,还是环境某个细节越出了训练分布。

  • 主持人的反问值得保留:这难道不正说明模型泛化很差?高阳承认早期模型确实需要近乎一样的环境,今天的模型已好很多;但研究创新常常只带来 0.x%,很大的改进也可能仅约 5%,环境噪声足以把信号完全淹没。

  • RoboChallenge 因而不追求证明某个数字“百分之一都不差”,而是识别明显代差。当前最高成绩尚未到 60 分,正好位于能放大模型差异的“敏感区”;行业还在比较“它是零,我不是零”,远没到 99% 对 99.5% 的阶段。

5. 学术界早有远程真机设想,却缺少持续运营的资源

  • 高阳回溯,CMU 的 Abhinav Gupta 在他读博前便尝试过把固定实验室场景和机器人开放给外部远程连接,后来国内外也有类似项目。思想与 RoboChallenge 并不遥远:锁定机器和环境,让别人远程运行算法。

  • 问题在于高校实验室空间有限,往往只能维护一两台机器、两三个任务,还需要大量人员复位和照看;负责学生毕业后,整套 setup 很容易无人维护。学术界“有这个 idea”,却难以把它变成连续运行并被广泛接受的基础设施。

  • 技术能力也已变了:旧机器人算法只能缝手绢、剪特定物体或完成少数固定任务,换一个任务便根本不能运行;VLA 至少让“理论上什么任务都可以做”成为可能,成功率虽低,却首次创造了通用 benchmark 的真实需求。

6. 仿真能复现代码,却还不能代表现实世界

  • 仿真的优势非常明确:同一份 simulator 和代码,任何人下载后都应跑出相同结果。但很多仿真轨迹来自预先编写的程序——先移动到物体上方、下降、抓取——状态分布远窄于人类遥操作,也不能充分反映真实机器人会遇到的偏差。

  • 高阳说,机器人会议的审稿人通常不会轻易接受只有仿真结果的论文,因为算法在 simulator 中变好,不等于真机具有同样效果。李飞飞、MIT 的 Russ Tedrick 等人仍在推进相关方向;结论不是仿真无效,而是“它是一个很难的事情”。

  • 节目谈到 World Labs 的 Marble 时,高阳认为现阶段更像静态 3D 场景巡游;其背后的 3D 或 4D Gaussian 技术暂时难处理动态交互,因此可能先服务游戏或 3D 视觉,还不能直接充当具身训练世界。

7. RoboChallenge 与 RoboArena 测的是两个不同成熟度的问题

  • Physical Intelligence 发起的 RoboArena 采用分布式机制:全球不同实验室各贡献一点算力和真机时间,每次在同一实验室、同一台机器上跑两个模型,只比较谁更好。足够多的成对观察最终可汇总成相对排序,不要求所有实验室环境完全一致。

  • RoboArena 测的是 zero-shot:现场临时指定任务,模型不用该任务的数据便应理解文本并执行。高阳用语言模型作类比——GPT-3 阶段常需少量专家问答做微调,那是 few-shot;模型足够强、无需任何示例便能合理回答,才是 zero-shot。

  • RoboChallenge 当前选择 few-shot 或 fine-tuned setting:每个 Table 30 任务提供约 1,000 条人类示范,参与者用自己的基模和训练方法完成微调,再通过统一 API 控制现场机器人。数据本身定义了测试分布,中心化环境则提供可比较的绝对成功率。

  • 主持人的质疑是,RoboArena 对现在的模型是否太难。两位承认其多数任务成功率很低,有时只能说两个模型都没抓住,但其中一个动作“更 promising”;若所有成绩都接近零,区分能力也会下降,开放式 pairwise testing 更适合未来成熟的 zero-shot 模型。

8. Table 30 的区分度来自真实愿望,而非整齐的任务分类

  • Table 30 并非先由理论分类体系推导出来。团队组织全公司列出“接下来机器人一定能做成什么”,形成数千条愿望清单,再由数据采集团队逐项判断可执行性,最后一位研究员先勾出 30 项。

  • 任务选择最初相当 ad hoc,测试后才发现覆盖了柔性物体、毫米级定位、上下文记忆、执行器与物体接触,以及物体与物体接触等不同能力。它没有把拿杯子、拿皮球当作两个近似任务重复计分,而是让每项都拥有不同失效模式。

  • 范浩强事后的总结很鲜明:“人民群众的真实需求,其实就是最有代表性、最高质量的 benchmark。”来自生活愿望的任务未必形式漂亮,却比人为排列出的学术 taxonomy 更容易撞上模型真正的盲区。

  • 高阳则强调基础模型团队不会为每项任务分别设计技巧:千寻用同一个基模和标准化微调流程处理全部任务。基础模型的意义恰恰是“无论想做什么样的东西”,都能通过同一流程学会,而不是逐个手工攻关。

9. 最难任务把接触、遮挡和柔性物体问题同时暴露出来

  • 碎纸要求机器人把纸插进碎纸机窄缝;纸在插入过程中又会遮住手上相机,模型必须在视觉信息变差时保持精确动作。它不是普通 pick-and-place,而是遮挡、柔性材料和细缝定位的叠加。

  • 插花进一步把 interaction 从执行器—物体扩展到物体—物体:模型既要定位自己的手,也要理解拿起的花柄何时接触另一个物体。杯子放入孔洞等任务容差只有几毫米,同样令当前最好模型成功率偏低。

  • 餐巾纸擦桌子看似简单,真正困难的是擦完后,餐巾纸已经皱成训练数据难以覆盖的形态,机器人还要把它放回纸篓。范浩强认为柔性物体很难建模,demonstration data 也不可能枚举所有形变 case。

10. 扫二维码证明许多 VLA 仍活在没有过去的单帧世界

  • 扫码任务要求一只手拿物品,另一只手拿扫码枪,扫描后再放回;动作本身并不复杂,难点是扫描前后画面几乎完全一样。模型无法仅凭当前图像判断“刚才扫没扫”,于是有的上手便停住,有的重复扫描。

  • 高阳把问题归结为记忆:许多开源 VLA 仍是单帧式输入,看完若干相机画面便输出动作,没有机制把此前是否扫描放入上下文。范浩强的比喻是:“每过一帧就忘一次,每 0.7 秒它就忘了。”

  • 行业已有修补方案,例如输入更多历史帧,或通过 agent 记录发生过的事件;但两位区分得很清楚,这类记忆往往是工程系统外挂,并没有真正训练进基础模型。Table 30 因而意外测出了一项最初并未刻意设计的认知缺口。

11. Spirit V1.5 登顶之余,平台需求先超过了机器供给

  • 千寻测试的是统一基模,Spirit V1.5 的最新成绩高于 π0.5,并成为当时公开榜单第一。RoboChallenge 只要求记录绑定自然人,组织可以匿名;通常先出现成绩,之后公司再自行认领,避免榜单从一开始就变成商业 PR 对决。

  • 平台从 10 月宣布上线到访谈时约一两个月,已积累超过 1 万次 run。提交信号最远来自英国伦敦:代码跨越地球连接实验室,仍能让机器人完成动作,这让团队感到“挺 rewarding”。

  • 测试能力约为九台机器人,覆盖四种类型,包括一种双臂和三种单臂;提交者一度需要等待一两天。范浩强说热度“远超预期”,若早知道需求如此旺盛,最初一定会准备更多机器。

  • 榜单启动时没有外部成绩,团队先找志愿者复现约六个开源模型作为 baseline;后来越来越多公司认为由平台代调不够放心,开始自己 fine-tune、自己提交。这一变化本身也显示社区已从仰望 π0,走到掌握同档模型技术并挑战 π0.5。

12. 开放控制 API 扩大了创新空间,也把可信度交给了社区

  • 平台没有要求上传固定模型文件或 Docker,而只提供控制机器人的 API;参与者可使用任何计算架构、参数和控制逻辑。原因是 fine-tuning 有大量“手艺问题”,换显卡都可能影响结果,平台统一训练反而替参与者做掉关键创新。

  • 代价是平台无法直接确认参与者用了多少 episodes,甚至无法从接口判断背后究竟是模型还是人。当前方案主要依靠学术自律,并鼓励上榜者公开模型与 code,让第三方重新提交;结果不必完全重合,但大趋势必须可复现。

  • 最简单的 hack 是同一任务提交 100 次、只取最好成绩,规则因此采用最后一次结果,有限产能也阻止无限重试。由于参与者接触不到现场环境,常见的摆物体作弊较难实施;潜在最大攻击反而是用真人遥操作伪装模型。

13. RoboChallenge 正从单一榜单变成共享真机基础设施

  • 范浩强强调项目已不只是其公司独立运营,而是由 partnership 与 community 共同推进,已有十多家公司参与;Hugging Face 提供国际合作,本体厂商可以捐机器,拥有数据采集场或实验室的团队也能贡献自己的 benchmark。

  • Table 30 只是第一块内容。未来可能出现 Kitchen、Restaurant 等场景集,也可能围绕开源灵巧手设计新任务;高阳还提到,他记得名为 Tesollo 的公司希望参与设计相关任务。不同组织提供机器、场景与数据,模型才可能得到比单一桌面操作更完整的“体检”。

  • 对范浩强所在公司而言,对外服务只是内部大量模型评估成本的一小部分,因此当前仍可负担;但不断增加的任务、硬件和提交量,需要更多机构共同分担。平台最大的短期约束不是需求,而是 feature、机器与运营能力只能排队上线。

14. 数据规模被两位嘉宾视为 2026 年最明确的主线

  • 高阳判断,当前具身模型的主要瓶颈仍在数据;如果拥有像语言模型那样近乎无穷的数据,问题“大概率可以做出来”。他因此预计 2026 年及随后一年会看到非常大的模型进步,而不是线性的小修小补。

  • 他给出的路线是语言模型“三部曲”:先用大规模通用数据预训练,再以高质量专家数据做 supervised fine-tuning,最后用 RL 或类似 RLHF 的后训练提高任务成功率。具身的具体模型可以不同,但“预训练—精调—强化”的学习范式已相当清晰。

  • 范浩强开玩笑说,Table 30 至少做到 90%,才较有把握判断算法“不缺 major parts”。高阳认为沿着现有 scaling data 路线可能很快接近这一水平;真正要解的是让算法吞下多源大数据,以及用怎样的社会分工组织真实世界采集,而非不可跨越的理论障碍。

15. VLA 只是输入输出说明,不是唯一架构答案

  • 高阳提醒,VLA 只描述模型接收 vision、language 并输出 action,并不规定必须先有 LLM、再有 VLM、最后接动作头。模型也可以成为 VLTA,让 T 代表 tactile;视频生成模型是否是更好的基座,至今同样是开放问题。

  • 千寻目前从 VLM 底座出发,加入视频、人类遥操作和可穿戴设备数据,但并非以显式 world model 形式组织;最后可选择强化学习。目标是让不同数据在各自合适的阶段发挥作用,而非坚持单一来源。

  • 范浩强认为大的学习框架已相当收敛:先让 VLM 吸收互联网知识和不变性,再用大量 robot data 建立动作与感知之间的映射,发版前补上后训练工艺。真正分化团队的,是“拿什么积木、加什么数据、用什么比例”。

16. 四类数据各自交换规模、质量与多样性

  • 高阳把数据分成仿真、人类视频、可穿戴设备和遥操作四类。千寻当前押注后三类真实世界数据:量大但质量较低的数据适合预训练,规模小但质量高、与机器人动作对齐的数据更适合后训练。

  • 他暂不押注仿真的核心原因是 diversity 成本:每个场景仍需专业 artist 在仿真器里搭建,工具不够易用,生产速度慢,也难像遥操或可穿戴采集那样交给大量普通操作员完成。这是千寻的经验判断,并不意味着行业其他公司的仿真尝试一定错误。

  • 高阳保留了明确的改变态度条件:如果仿真工具进步到“随手一做就能出个《黑神话》”,仿真数据当然会“真香”。问题不在数据名义上是否 synthetic,而在能否便宜、快速地生成足够丰富又符合物理规律的交互。

  • Marble 等静态 3D demo 暂时没有解决动态交互,说明视觉逼真也不等于具身有效。机器人训练还需要物体被抓、推、遮挡和形变后的连续状态,而不是只能游览的三维背景。

17. 不同采集路线最终都要支付获取世界知识的成本

  • 范浩强对路线之争更淡然:“条条大路通罗马。”做仿真的团队要生产海量 3D assets、弥合 sim-to-real gap;做真机的团队要把操作员、设备、复位和质检工业化降本。走到后面,两条路可能都会卡在如何枚举日常商品与场景。

  • 他的团队因过去建立过大规模线下人脸数据采集体系,选择以真机为主;这不是宣称真机路线唯一正确,而是选择组织最擅长的生产方式。决定性要素不是 data representation 的名字,而是“花了多大精力去收集这个世界里的 knowledge”。

  • Generalist AI 的离体采集让人手持夹具完成动作,不必让机器人握夹具,因此更容易寄出设备、扩大采集。范浩强转述其公开口径:已有 27 万小时、每周新增 1 万小时;“如果他说的是对的”,到 2026 年底可能积累接近但不到 100 万小时。

  • 可穿戴路线的规模口径更加激进,他听到有公司提出一年采 1,000 万小时。两位并未为这些数字背书,但这些计划说明行业正把竞争焦点从模型命名转向知识量、采集效率和劳动组织。

18. 数据共享不会自动消除清洗与工程劳动

  • Open X Embodiment 是学术数据共享的重要 effort,把原本公开但分散的数据集整理起来;公司层面则尚未出现同等规模的共享。各家公司花钱采集的具身轨迹,短期内仍更可能作为私有资产使用。

  • 范浩强反驳“互联网数据对语言模型公司是免费的”这一简化叙事,称之为一种 “fairy tale”:网页虽可访问,仍要由大量优秀工程师清洗、去噪和组织,真正的人类劳动才“造就了现在这个模型的伟大”。

  • 具身也许能够先利用海量公开视频,但前提是算法能从视频抽取动作与物理知识。范浩强认为行业可能仍需解决 scaling data 之前的前置问题;Table 30 的低成功率,正说明模型尚未把已有数据稳健地转化成基础操作能力。

19. 具身行业仍在寻找自己的 AI coding

  • 高阳把能力与商业拆开:基础模型决定机器人能做什么,商业逻辑再决定其中什么值得做。落地并非不能开始,但当前基础模型仍不够强,因此能力提升比急于寻找一个统一应用更紧迫。

  • 主持人提到,据说语言模型约一半流量可能来自 AI 编程,其余重要用途包括搜索替代和问答;高阳的回应是变化仍在孕育,模型能力转化成手机助手、自动点外卖等产品需要时间,不能由当前流量判断最终边界。

  • 两人共同留下的核心问题是:“机器人时代里的那个 coding 是什么?”Coding 消耗高价值智力、单位价值高且形态集中;机器人能做的取快递、收房间、家政和维修却高度分散,没有一个同等清晰的大市场把模型、数据和产品迭代同时拉起来。

  • 高阳因此预期机器人产业会形成许多垂类公司:有的做家政,有的修屋顶。中国人力相对充沛,更难感受到某些服务的迫切成本;欧美人工昂贵,可能更早出现经济上必须由机器人承担的细分任务。

20. “叠好被子”同时检验模型、硬件和产品闭环

  • 范浩强创业时用一个私人任务说服自己:每天早晨起床不用管,被子能自动叠好,晚上回家便看到整齐床铺。扫地机和传统家电厂商未必认为这是自己的工作,而经典检测、分割算法又明显做不到,因此它能代表具身从不可做到可做的时刻。

  • 现阶段信号已经出现,但离这个目标仍远。范浩强提到 π0.6 能在工厂叠纸盒;主持人随后提到一些美国公司的展示,包括把袜子团起来、叠毛巾等柔性操作。不过“团起来”不等于还能抠开、翻面,后者对操作要求更高。

  • 被子很重,机器人既要有足够负载把它拎起,又不能因重心变化倒下;袜子与衣物也会暴露硬件本身的精细度和负载能力。很多看似算法的失败,实际可能首先需要本体、灵巧手和控制系统跨过门槛。

  • 家务之所以在学术界热门,是因为任务易布置、精度要求相对不高,又能明显展示智能;真正商业化仍可能非常细分。范浩强期待的是几个“震撼心灵的 demo”让客户相信更多任务也能完成——“破圈不光要破圈到公众投资人,更重要的是客户哪天信了”。

21. 公众不是高估就是否定,demo 工程放大了两极认知

  • 范浩强观察到两种相反误解:一端认定机器人公司都在做视频剪辑,另一端则认为机器人早已实现,过去的仿生机器人不也能跑跳。公众看到叠衣服,容易自然推导出团袜子、放进柜子都已解决,却不知道不同动作的技术边界并不按人类直觉排列。

  • 高阳列出了看 demo 要防的四种风险:cherry-pick、视频剪辑、遥操作和 AIGC。一项任务跑 100 次只展示成功的一次,或固定所有物体位置后录制,都能制造远超真实泛化性的观感;唯一强证据仍是让观察者站在现场并与系统交互。

  • 线上认证尚无完整答案。业内会在画面中放 iPad 时钟防加速剪辑,也有人要求每次领取唯一随机哈希值并把它放入现场,拍完立即提交,甚至设想与区块链结合;这些方法能提高造假成本,却还不能彻底证明模型自主完成。

22. 从业者可能比公众早三四年看见临界点

  • 高阳把当前具身基础模型类比为 GPT-2 左右;范浩强更喜欢视觉史类比,认为行业仍在 CIFAR 时期,ImageNet 尚未出现。CIFAR 只有 10 类、32×32 小图,一眼便知是 toy example;ImageNet 扩到 1,000 类和全分辨率图片后,人才开始相信模型“真能干活”。

  • 高阳预计面向普通人的 GPT-4 式破圈可能在 3—4 年左右。他认为 GPT-3.5 还不算真正破圈;从业者却会更早识别信号——即使模型不够听指令、后对齐很差,只要“做什么都很溜”,专家便知道补上后训练可能已接近可用。

  • 主持人补充说,如果 2027 年能出现奇迹当然最好;高阳没有给出更短的确定时间。两人都强调智能进步可能是非线性的,今天接近零的成功率不能直接外推未来三年的速度。

  • 范浩强用一句玩笑概括信息差:“搭上 LM 快车最好的方法,是 GPT-2 文章发出来之后重仓英伟达。”这不是节目给出的投资建议,而是强调从业者看到 CIFAR 式早期信号与公众看到可用产品之间,必然存在时间差。

23. 2026 年将同时验证追赶速度与基础模型上限

  • 范浩强最想验证的是具身领域能否出现中国的 “DeepSeek moment”:过去看到海外工作只剩羡慕,2026 年能否见证国内模型真正追上。他以计算机视觉为参照,从 Google 的“天外来物”到国内外共同做到 human performance,体感约三年;Codex、Cursor 等工具又提高了今天的实验生产力。

  • 高阳对中美叙事着墨较少,更期待基础模型能否从 GPT-2 走到 GPT-3,甚至 GPT-3.5。他的措辞既乐观又保留可证伪性:“今天的我非常有自信”,但再干几个月后,可能更有信心,也可能失去信心;目前趋势是疑惑越来越少、确定性越来越高。

  • 节目尾声把行业归纳为数据、模型、硬件三条轴:数据与模型直接决定智能,硬件还要同时解决寿命、耐久、可靠性、精度、负载和续航。大脑、小脑与本体理论上可解耦,但软硬垂直整合可能加快研发迭代和落地,中国团队也能借助本地供应链。

  • 团队来源同样多元:自动驾驶、长期 Robotics 学术研究、计算机视觉和传统机器人产业各带来不同能力。主持人的最后判断是,具身正因跨学科而混乱,也因此不太像一个巨头仅靠砸资源就能迅速收束的赛道;测评、数据生产、模型架构、硬件和应用都还留有大量变量。

范浩强

但是呢,我们测了很多模型,这个成功率非常低。低到多少?比如测 π0 的时候,我们只测出来了百分之二十多,也就是说,基本上看 4 次只能成功 1 次,这是 30 个任务的平均数。

程曼祺

你说的是哪个任务?

范浩强

不是某一个任务,是 30 个任务的平均数。

那时候我们自己心里其实很慌。如果把这个成绩最后公之于众了,大家是不是会对整个行业都没信心?

直到 π0.5 的权重公开,我们第一时间去测。测完之后非常震撼。这种震撼不光是看成功率,站在旁边看机器运行,你就会觉得它比之前的模型更灵光一点。这种感官体验对我们的冲击非常大,也给了我们很大信心:这个行业的确是在很 concrete 地往前进展。

范浩强

因为现在真的就是 scaling data 可能是 2026 年最重要的一个主题。

我们自己的尝试是,仿真数据的 diversity,也就是多样性,比较难提升到很高。

程曼祺

那你说现在机器人除了叠衣服之外还能干什么?机器人时代里的 coding 是什么?我觉得这可能是一个很核心的问题。

程曼祺

欢迎收听晚点聊,我是曼琪。

虚拟空间的大模型有大量 benchmark 测试,非常直观。而在如火如荼的具身领域,怎么衡量模型能力本身,还是一个需要探索的课题。

这期我们邀请了两位具身智能的从业者,Dexmo 原力灵机联合创始人范浩强和千寻智能联合创始人、首席科学家高阳,一起来聊具身模型哪家强,也就是具身模型的测评。

两位都是清华校友。范浩强从高三就开始在旷视工作,有丰富的计算机视觉开发与落地经验。高阳回国前在伯克利攻读博士,和 Physical Intelligence 联合创始人 Sergey Levine 有诸多学术合作。

去年 10 月,原力灵机和 Hugging Face 一起发起并上线了 RoboChallenge 开源测试平台。在前不久发布的最新测评结果中,千寻的 Spirit V1.5 模型登顶榜单,表现超过了 π0.5。

在 RoboChallenge 的测评中,机器人不再只活在精挑细选的 demo 视频里,而是要在多样化的 Table 30 任务中接受真实世界的检验,包括碎纸、插花、扫二维码等。

我们与小强和高阳一起聊了具身模型测评的难点,RoboChallenge、RoboArena 等目前的大规模测评尝试是怎样的思路,行业里心照不宣的 demo 工程,以及 2026 年我们可能从哪些路径逼近具身智能的 GPT-3 时刻。

小强和高阳说,组织与参与测评的过程本身,增强了他们对具身智能的信心。从 π0 在 Table 30 任务上只有百分之二十多的成功率,到 π0.5 的翻倍成功率和一些国产模型的超越,具身智能仍然非常早期,但进步速度也非常惊人。

程曼祺

下面我们正式进入节目吧。

这一次的节目,我们请到了具身智能领域的两位一线从业者,Dexmo 原力灵机的联合创始人范浩强、千寻智能的联合创始人高阳。两位可以和我们的听友、观众简单打个招呼,然后简单自我介绍一下你们之前在 Robotics 和具身领域的一些经历。

范浩强

大家好,我是范浩强,一般都叫我小强。原力灵机是 2025 年 3 月刚刚成立的一家具身智能创业公司。我们喊来了很多之前在旷视时的老同事,以及一些新加入的伙伴,一起做了这么一家企业。

原力灵机主要专注于具身智能机器人产品及相关应用,另外也会做其中 AI 相关的技术。

高阳

大家好,我是高阳。我现在是千寻智能的联合创始人,也是清华大学交叉信息研究院的助理教授。

我做具身已经好多年了。最开始是在 UC Berkeley 读博的时候做计算机视觉,但到博二左右就开始和 Sergey Levine 一起对机器人产生兴趣了。那个时间点大概是 2016 年。

博士后半段,我做了很多具身机器人视觉融合的研究。当时我们会讲模仿学习、强化学习,但今天把这些技术聚合到一起,就是所谓的具身智能。

我大概是 2020 年开始在清华任教。后来经历了 ChatGPT 浪潮,让我觉得我们似乎已经掌握了通往 AGI 的一条道路。于是到了 2023 年左右,我和韩孟涛、郑林英一起创立了千寻智能。

我们的目标是做具身领域最强的模型,并且希望能把这个模型以机器人硬件产品的形式带进大家的生活。

程曼祺

因为两位都是清华校友,你们是同一级吗?

范浩强

我和你差挺多。我是零字班的,2013 年上的本科。

过去的人生大部分时间都花在了旷视身上。我差不多从 2012 年开始加入旷视,旷视是 2011 年成立的。所以我的本科生涯,其实一直是在计算机视觉创业的过程中度过的。

程曼祺

我上次跟原力的创始人唐文斌聊,他说你高三就去旷视上班了。

范浩强

是的。2012 年刚好因为他保送了,信息学奥赛拿了金牌,保送之后,高三其实就有很多时间在旷视工作。

那时候文斌刚开始做,计算机视觉还很新,甚至还没有 deep learning。最早是拿 SIFT 之类的特征和 SVM 分类器去做。但做的时候我就觉得特别有意思,和真实的图片、数据打交道,是一件特别好玩的事情。

后来 deep learning、神经网络这些技术出现之后,你就非常笃定地觉得,这个技术不只是用来发 paper,一定能够实用化。我觉得这是过去一段时间里对我影响最大的一个过程。

最早做旷视的时候,人脸识别可能准确率只有百分之八十几。你识别 5 个人,可能就肯定会错 1 次。后来一路做,最后差不多做到了 12 个 9,也就是 99.999999999999% 的准确率。

所以在这个过程中我发现,只要算法原理是对的,然后投入大量的聪明才智、勤劳和汗水,技术一定会给你回报。这一点给我的冲击特别大。

程曼祺

我觉得两位的背景正好有相似的地方,也有不一样、互补的地方。

这次想请两位来聊,是因为我觉得大家非常关心一个主题:具身模型哪家强?翻译一下,就是我们现在到底怎么去测评一个具身模型。

背景是原力灵机和 Hugging Face 一起发起了一个新的测评平台 RoboChallenge。千寻,包括中国还有很多其他公司,以及海外的一些公司,模型其实都有参与进来。

你们可以讲讲 RoboChallenge 的背景是什么吗?在这之前,大家是怎么测具身模型的?你们现在新做的评测标准,和以前不一样的地方是什么?

范浩强

1. RoboChallenge 诞生始末

我大概讲讲当时做 RoboChallenge 的背景。

Robot research 很多时候很像做图形学。每篇文章可能都一定要有几个 demo video,做几个看起来很酷的任务。大家一般会把它们 cherry-pick 出来,可能录了很久,最后找到一条好的,就拿出来告诉大家,至少这件事是可做的。

另外,做 benchmarking 的时候,绝大多数还是依赖仿真测试,因为仿真相对容易测,noise 也相对可控。真机测试的话,甚至最好的 paper 也就放三四个任务,简单数一下。

而且不同 paper 放的那三四个任务还不一样。比如都叫 table bussing,但一个人测的和另外一个人测的,可能完全不是一回事。

我们自己做机器人研发的时候也一直被这个问题困扰。大家都是一点点去 improve 一个模型走过来的,现在突然发现没有这么一个榜可以做,迭代和实验就会非常费劲。

所以我们当时问了一个问题:能不能做 large-scale 的 robot evaluation?

最终你要想把方差控制住,还是得测很多很多次。不只是大家测 3 次、5 次就去评价这个模型,而是至少执行几百次,把成功率平均下来。也许这个指标才有一些意义。

一旦想到这一点,很多事情就顺了。既然要做 large-scale,这些任务本身的格式和描述就必须标准化,也就是 standardized。测试 protocol 也必须足够通用,能够兼容单臂、双臂等不同机型。

把所有这些东西放在一起之后,我们大概就有了 RoboChallenge 的雏形。

不过 RoboChallenge 做的过程中,有一段时间我们一直很困惑。我们选了 30 个对人来说非常 trivial 的任务。

程曼祺

这里的 trivial 是指琐碎和简单吗?

范浩强

就是简单,就是人一做不可能失误的问题。比如把一个东西从这里拿起来,放到那里;或者稍微复杂一点,拿张餐巾纸擦桌子。让一个人做,他绝对可以百分之百做好。

但是我们测了很多模型,包括开源的 π0。那时候成功率非常低,低到什么程度?比如测 π0 的时候,我们只测出来了百分之二十多,也就是说基本上 4 次只能成功 1 次。

程曼祺

那时候你们测 π0 是几月份?

范浩强

我们差不多从 7、8 月份开始想做这件事。那时候 π0.5 的权重还没有公布,所以我们心里其实很紧张。

如果一个 benchmark 把大家的分数都测得很低,它就不是一个好 benchmark。我们当时很担心,如果最后把这个成绩公之于众,大家是不是会对整个行业都没信心?

直到 π0.5 的权重公开,我们第一时间去测。测完之后非常震撼。它的成功率不光是比之前高,你站在旁边看机器运行,就会觉得它比之前的模型更灵光一点。

这种感官体验对我们冲击非常大,也给了我们很大信心:这个行业的确是在很 concrete 地往前进展。所以我们想把这件事情分享给大家。

我们也很想见证,为什么排名第一的模型总是国外发布的?国内这些模型之前都是在 PR 上说自己是第一,有没有一种方法,能让其他人也信服,能够见证一个好的国产模型诞生?

在这些想法叠加之下,我们最后决定做 RoboChallenge,并且把它做成一个 community-based 的 program。不只是原力灵机做多少事情,而是把各家公司都拉在一起,大家一起把它做到尽可能客观、公正,在技术上严谨。

本质上,我们希望让具身圈外的人也能承认,具身智能不只是大家发布了很多新闻,而是真的有非常 concrete 的技术进展。

程曼祺

所以从 π0 到 π0.5,你们自己的测试至少证明,在全世界范围里,有人能在比较短的时间里把具身模型的性能提升得很快。

范浩强

其实也不算很短,这两个模型之间也隔了挺长时间,快一年吧。但这种对比和冲击,会让你觉得这一定是下一代的东西。

程曼祺

那实际上,你们 30 个任务的平均成功率,从之前 π0 的百分之二十多提升到了多少?

范浩强

π0 我记得是二十几。π0.5 是 42% 左右,而且翻倍了。

它很多任务简单 fine-tuning 一下就能做到百分之百。比如最简单的叠瓦片那几个任务,它就做得很稳定。你会觉得它可能学了多少条数据之后,真的就学会了。

这个其实是非常强的信号,说明具身模型在不断 improve,正在逼近那个临界点,虽然可能现在还没有达到。

程曼祺

总结一下,你们最开始做这件事,有一个思路是想把以前在计算机视觉、NLP 这些更纯粹的虚拟空间里的模型测评方法,迁移到具身领域,对吧?

我想请高阳补充一下。你从 2016 年开始读博士,一直在做 robotics 相关的研究。在此之前,行业里有没有什么公认的方式,能够大范围评估不同模型的能力?

高阳

2. 真实世界难以复现

其实大家意识到这个问题已经很久了。但因为刚才讲到的那些原因,以前虽然也有很多公司,但没有这么多公司和资源来做这件事情,所以基本都是一个个高校实验室在尝试。

高校实验室其实也提出过类似的方案。比如我有一个机器人,有一个场景,这个场景在我的实验室里,可以保证复现;你可以远程连接到我的机器人上。

这个想法在学术界很早就出现了。我知道最早的尝试之一,是卡内基梅隆大学的 Abhinav Gupta。我忘了具体是哪一年,反正至少在我读博之前,他就已经做过类似的尝试。

后来还有很多类似的工作,包括 Priya,以及我记得上海交通大学卢策吾老师,也有过类似尝试。但这些尝试规模比较小,集中在一个实验室里。高校实验室往往随着一个学生毕业,这个 setup 就没有人管了。

而且它测的场景也比较有限,可能只能测一两个、两三个任务。实验室空间有限,机器人也有限,也没有那么多人看着机器人测试,帮忙给机器人复位等等,这里面需要很多人力投入。

所以学术界有这个 idea,但没有足够资源让它成为一个能够连续运行、并且被广泛接受的事情。

以前机器人模型的另一个痛点是,大多数模型让它做一件事,它根本做不了。以前的机器人模型还没有 VLA。现在是我能做,但成功率可能没有百分之百;至少理论上,我现在的模型什么事情都可以做。

以前的模型或者机器人算法只能做单一任务。比如我只能缝一个手绢,或者只能剪一个东西。你让我做其他任务,它根本做不了,对任务的限制很强。

所以我觉得,正是因为这两个点,一方面我们对 benchmark 的需求更加强烈,另一方面技术也到达了一个拐点,使得我们真的可以开始做任何任务。

程曼祺

对普通人来说,最直接的方式可能就是把这些机器人都弄到一个地方,让它们做一些任务。为什么这种最直观的测试方式,在这个领域其实不太行得通?

高阳

这个问题的本质原因是,具身智能模型在执行的时候,需要一个物理环境和模型进行交互。

听起来这并不是很难,但实际执行时,物理环境是不一样的。比如我家的杯子和你家的杯子就不一样,我这个杯子的把手,和现场这几个杯子的把手也不太一样。

那么如果我的模型成功率低,到底是因为把手不一样,还是因为我的模型真的差?有很多物理因素会影响结果。我们也很难在不同地点保证完全一样的场景。

所谓一模一样,包括物体一模一样、摆放位置一模一样、光照一模一样,以及其他所有东西都一模一样。这是困扰机器人很多年的评测问题。

程曼祺

这岂不是正说明你的模型泛化能力很差吗?难道一定要一模一样才能测吗?

高阳

以前的模型泛化性很差,所以确实需要一模一样才能比较。但现在的模型已经越来越好,可能不需要完全一样也能成功。

不过如果我们做实验,还是希望评测环境尽可能一样。因为很多时候,一个创新带来的提升可能只有百分之零点几。即使创新很大,提升也可能只有百分之五。

如果评测不够准确,就可能看不出来这是不是一个创新,也不能正确衡量它到底是进步了还是退步了。

计算机视觉时代,大家只需要一个数据集,所以可以把评测做得非常精准。因为机器人需要真的去执行一条轨迹,就很难达到同样的准确率。

范浩强

这一点我在计算机视觉时代感受很深。刚才说从百分之八十几到 12 个 9,其实拆开来看,每一步的小 improvement 都只是一点点,可能刚好比上一次的曲线高一点。

但就是靠无数这种小的改进和创新,一点点堆上去,整体才不断往上走。

高阳

对。我觉得以前做视觉时,它有一个 privilege,就是测试非常可重复,样本足够多时,信噪比也足够高。

但机器人没法这么做。Robotics is about noise。你很难永远控制住物理世界里的所有东西,还是会有很多噪音。

所以现在我们反而会想,我们追求的可能不是百分之百准确地测出一个数字,不是说百分之一都不能差,而是希望它能够反映模型发展的趋势。

当几个模型之间有比较明显的代差时,测试结果能够明显看出差异。如果它们本来就大差不差,最终分数也可以集中在一起。我觉得,能够把这种大的区别测出来,可能就是现在做 evaluation 的使命。

毕竟现在还很早期,还不是“你是 99%,我是 99.5%”的阶段。现在比的是“它是 0,我不是 0”。

从这个角度来说,现在榜单上的很多成绩,最高的甚至还没到 60 分,我觉得这反而是刻意为之的。我们把它卡在一个敏感区,让不同模型之间的区别可以被放大,这样才能更好地 measure 模型之间的差异,以及不同代际之间的进步。

程曼祺

3. 仿真无法替代真机

刚才你们也提到过,之前还有一种跑 benchmark 的方式,是在仿真环境里看模型表现。但仿真环境里的表现,对实际应用的意义是不是没有那么大?它和部署到真实机器上之间,gap 会比较大吗?

高阳

是的。学术界的另一条路线,是使用各种仿真器。只要把代码开源,每个人下载同一个仿真器,跑出来的结果理论上就应该一样。

但这里面也有很多难点。仿真器往往不够真实,而且仿真器里的轨迹,很多不是人类遥操作采集的,而是通过程序生成的。比如程序规定先移动到这里,再往下走,再抓取。

这种程序生成的轨迹,和真实世界中通过遥操作采集的轨迹非常不一样。它的状态数量比较少,在这种数据上学习,也不能充分反映机器人在现实世界里的表现。

学术界有很多基于仿真器的工作,可以反映一些算法进步。但机器人领域的会议往往不接受一篇只有仿真结果的论文,因为审稿人也知道,这种结果不一定能在真实世界取得同样的效果。

当然,现在仍然有很多学者在做仿真器,包括李飞飞和 MIT 的 Russ Tedrick。他们仍然在仿真器方面进行努力。不是说这件事完全不行,而是它很难。

程曼祺

刚才你讲到有两个变化:一个是技术本身的变化,机器人可以做更多任务了;另一个是出现了更多公司和创业者,大家也需要更大范围的评测。

除了你们在做的 RoboChallenge 之外,全球范围还有什么类似的事情吗?

高阳

4. RoboArena 走向零样本

RoboArena 也逐渐做起来了。RoboArena 的发起方是 Physical Intelligence,也就是 π。

他们的做法和原来的实验室比较像,但多了一层分布式机制。不再依赖某一个实验室,而是号召全球很多实验室,每个实验室参与一点。

在每个参与实验室的机器上,每次跑两个算法,比较谁好谁坏。假如有足够多的 sample 和观测,就能够对所有算法进行排序。

这个方法的难点在于,不同实验室的环境是否足够一致。

程曼祺

但这个方法其实没有这个问题吧?因为每次是在同一个实验室、同一台机器上跑两个算法,测的是零样本泛化模型,而不是微调模型。

可以解释一下 zero-shot 模型吗?

高阳

现在的具身模型还处在比较初级的阶段。大语言模型比如 GPT-4,你直接打开 OpenAI 的网站,跟它说什么,它就能直接回答你。

但在 GPT-3 的时候,模型回答问题还没有那么有道理。那时候大家会拿一些专家数据,比如你问“今天股市怎么投资”,有一个专家给你写一段回答,再用这些专家数据去微调模型。

用了专家数据进行微调,我们可以叫它 few-shot,也就是用少量数据进行微调。

如果模型已经非常强,不用任何数据,它就能直接给出合理解答,我们就叫它 zero-shot。

现在 π 的 RoboArena,就是 zero-shot 的设定。它假设模型足够强,可以做任何事情。原力灵机的 RoboChallenge,则是 few-shot 的 setting。

程曼祺

RoboChallenge 和 RoboArena 的区别是什么?现在 RoboChallenge 的测试流程是怎样的?

范浩强

首先,我们测的还是 fine-tuned model。也就是说有 30 个任务,每个任务都有清晰描述,并且我们会给这个任务提供大约 1,000 条示例数据。

这些数据是一个人采集这个任务应该怎么做。每个任务最多大概会有 1,000 条。

参加测试的人可以先有一个基础模型,也就是基模,然后拿这 1,000 条数据去 fine-tune,也就是进一步训练。得到精调后的模型之后,再让它指挥机器人完成这个任务。

这 1,000 条数据其实定义了测试分布。你可以把它叫作 few-shot learning,和经典模型动辄用几万条数据训练不一样。

RoboArena 则是由测试实验室现场指定任务。无论是什么任务,你都要根据文本理解之后自己去完成。它们测试的对象其实是不一样的。

高阳

而且 RoboArena 分布在不同实验室,RoboChallenge 则集中在一个场地,或者说同一个环境里的硬件上测试。

程曼祺

但如果是这种对比性测试,每次测的实验室、任务和道具可能都不一样,单次结果本身不能拿去平均。只能一次测两个或多个模型,比较谁更好,得到一个相对关系,再把一对一对的关系最后汇总成一个总值,对吗?

高阳

对。比如现在的 LMArena,是大语言模型领域最有影响力的榜单之一。它做的就是 zero-shot 或者开放性问题,再加上对比性测试。

也许具身智能哪天也走到了 zero-shot 阶段,这种测试就很有道理。但现在我们看到,任务要想做成,还是需要 fine-tune。所以 RoboChallenge 的第一个 benchmark,就专注于 fine-tune setting 下的测试。

程曼祺

RoboArena 直接做 zero-shot,岂不是很多模型在那儿根本完成不了任何任务?如果大家都接近于零,反而也比不出来。

高阳

你去看它的测试视频,的确大部分任务的成功率都比较低,所以这也有一定问题。

它是对比性测试,只能说虽然大家都没抓住,但这个看上去好像走得更 promising 一点,最终只能得出这种结论。它的方法对现在的模型来说太难了。

程曼祺

听完这个之后,我不知道你们跟投资人或者其他人讲这件事时,他们通常是什么感觉。

一般人可能会觉得,这个行业确实还很早期。距离我们想象中的机器人进入家庭,或者在商业服务场景里干活,似乎还有很远的距离。

高阳

我觉得智能的发展是非线性的,是指数级的。

3 年前,大语言模型刚刚出来,什么也干不了,只能跟你说一些话。技术极客可能会觉得有点意思,觉得它竟然会说人话了。

但到今天,已经有很多模型能把 IMO 的题目都做出来了。中国和美国每年各派 5 个人参加的比赛,现在这些大模型已经可以把题目完全解出来。

具身模型其实也是一样。刚开始你觉得它很菜,但它是一个指数级变化的趋势。

范浩强

这方面我也更乐观。之前做微震时,那么多模型加起来可能还打不过现在一个 Grounding DINO,但不妨碍我们真的把它卖到了祖国大江南北。

最终去做场景和产品,还有它自己的逻辑。所以我觉得,即使具身模型还没有 zero-shot、百分之百完成所有任务,也不阻碍大家先做一些落地尝试。

程曼祺

回到你们具体看到的进展。你们陆陆续续测了很多模型,前面说过 π0.5 相比 π0,成功率翻了一倍。其他测过的模型可以透露一下吗?千寻应该也参加了这个测试吧?

高阳

5. Spirit V1.5 登上榜首

我们千寻测试的模型,最新结果大概比 π0.5 高一些,暂时位列榜单第一。

范浩强

其他模型方面,我们在 9 月份发布的时候,把一些开源模型,比如 ACT 这类经典模型,也自己做了一遍复现,做了一个 baseline。

后来我们还邀请了一家公司。他们的模型叫 WALL-OSS-FLOW,公司也派了一些志愿者在我们平台上做 fine-tune,最后拿到了一个成绩。印象中,大概能比 π0 好一些。

程曼祺

现在有哪些公司参加可以透露吗?国内公司里面。

范浩强

目前能够绑定到公司名字上的,主要就是这两家。其他还有很多公司其实也已经在测试了,但一般都是测完之后才会说这是谁的结果。

程曼祺

在你们现在测的过程中,有没有谁甩开其他人一个身位,有明显更好的模型?

高阳

现在看,肯定是 Spirit V1.5 比较亮眼。

我可以补充一些背景。首先,RoboChallenge 参与的单位并不是以 organization 的形式参与。大家能看到的公开信息,都是一条条测试记录。测试记录里的模型名字,也是用户自己上传的。

我们唯一要求的是,用户要把自己的自然人姓名写上去,作为标识。所以这个平台本身并没有商业属性,不是公司和公司之间直接比较。

程曼祺

所以在这个平台里,对组织来说可以是匿名的。

高阳

Exactly。往往是先有了成绩,之后才有人认领,说这个其实是我的。

我们做 RoboChallenge 的初心,也是不想让这件事夹杂太多商业化的东西,而是想做一个干净的 benchmark。就像当年的 ImageNet,以及其他经典 benchmark,大家都可以有成绩,取成绩也不需要付出太多代价。

万一测得不好,也不会驳谁的面子。这就是我们做这件事的初衷。

程曼祺

目前由公司认领的、表现最好的,就是千寻的 Spirit V1.5,对吗?

高阳

对。RoboChallenge 运营到现在,我今天听 Liya 说,已经有 1 万多次不同的测试 run 了。

程曼祺

1 万多次来自多少个不同模型,你们统计过吗?

高阳

这很难统计。因为大家经常自己给模型起名字,有时候也不是特别规律。

但这个数字很震撼。不光是国内在测,我们最远还收到过来自英国伦敦的 IP。信号穿过整个地球,来到我们的 lab 去指挥机器人,那个任务竟然还能动起来。

说实话,这个过程还是挺 rewarding 的。

程曼祺

你们获得 1 万多条记录用了多长时间?

高阳

我记得是 10 月的时候 announce 了 RoboChallenge,后面其实也就运营了 1、2 个月。

程曼祺

这是超出预期,还是在预期之内?

高阳

远超预期。现在 RoboChallenge 最大的压力,是我们测不过来了。

机器一共就那么几台,大家提交之后,经常要等 1、2 天才能得到反馈。现在有很多团队,除了公司之外,还有很多想发 paper 的人,也想拿一个成绩。

提交的人已经很多了。这个 popularity 远超出我们的预期。早知如此,我们肯定会多准备一些机器,不会只用这么几台。

程曼祺

你们现在一共有多少台机器?

高阳

我记得当时大概是 9 台,差不多这个规模。9 台包括 4 种不同类型,有双臂的,也有协作机器人。

范浩强

有双臂的一种,剩下主要是单臂的,我们准备了 3 种。

程曼祺

这说明整个具身智能研发社区确实非常需要这个东西。

高阳

我觉得是。而且好处在于,更多人敢来测试了,说明大家的模型水平确实已经提上来了。

程曼祺

展开说一下,你们的 30 个任务是怎么挑选的?你们这个任务集叫 Table 30,比较直观地理解,肯定是和桌面操作相关的任务。如果再进一步分类,具体是怎样的?为什么挑选这些任务?

范浩强

6. Table 30 放大模型差异

这个任务集其实是内部孵化出来的。我们想做测试的时候,大家说先找一些任务测一测。当时有一位研究员画了 30 个勾,大家在测试过程中发现,这 30 个任务确实很有道理。

有些任务考验你操作柔性物体,有些考验定位精度,还有些考验上下文记忆。我们是事后分析了一下这些任务的考点、对应场景和机型分布,最后发现其实还蛮合理的。

程曼祺

你可以讲讲事后分析的逻辑吗?比如总结下来,它可能是哪几类?

范浩强

我觉得主要是考点丰富。30 个任务几乎每个都有一点自己的难点,而且彼此很不一样。

比如有个很难的任务叫碎纸,考验你能不能把纸插进碎纸机的缝里。插的过程中,纸会遮挡你手上的视觉,所以模型想把这个任务做出来,必须有办法克服这一点。

再比如插花,不光考验你对自己手的定位,还要看你拿起花柄后是不是触碰到了另外一个物体。它的考点不只是执行器和物体之间的 interaction,还扩展到了物体与物体之间的 interaction。

我觉得 Table 30 最有意思的地方,就是每个 task 几乎都能找出与众不同的难点,最终形成了一个非常 diverse 的分布。

程曼祺

这可能也是它能把模型区分度测出来的一个重要 factor。虽然这些任务当时是比较 ad hoc 地选择的,但它很丰富。

不像第一个任务测拿杯子,第二个任务测拿皮球,那样考点可能很单一。

这些任务的 source 是怎么来的?

范浩强

当时我们在公司里组织了一帮人,大家都去想:你觉得接下来机器人一定能做成什么?

我们列了一个特别长的清单,可能有几千条,有点像愿望清单。后来数据采集团队再一个个去看,哪些能采,哪些不能采。

所以任务集的基底就是从这里采样出来的。我们事后总结,人民群众的真实需求,其实就是最有代表性、最高质量的 benchmark。这是回头看它成因时,我觉得比较重要的一点。

程曼祺

千寻在测试过程中,觉得什么任务比较难?有什么印象比较深的?

高阳

我们测试的时候,是用一个基模统一做微调。我们并没有特别关注任务本身的特性,因为我们做的是一个基础模型。

基础模型的意义就在于,无论想做什么,都希望有一个标准化流程,通过这个流程就能做这些事情。

程曼祺

那在 30 个不同任务里,哪些成功率相对高,哪些相对低?

高阳

一些比较精细的任务,成功率的确比较低。比如把一个杯子放到某个洞里,容差可能只有几毫米,这种任务确实比较难。

还有擦桌子的任务。把桌子擦好并不难,但最后要把已经皱掉的餐巾纸放回纸篓里,需要的功夫就比较深。

这些任务目前可能对任何一个最好的模型来说,都仍然很有挑战性。

程曼祺

你们这边有很多测试记录。从大面的数据来看,什么任务成功率高,什么任务成功率低?

范浩强

我觉得它们击中了现在模型的一些盲区。

比如柔性物体很难建模,而且采集 demonstration data 的时候,也很难把所有 case 都涵盖住。

另外有个任务叫扫二维码。左边拿起一个东西,右边拿起扫码枪扫一下,再放下去。这个任务看起来动作很简单,但它难在哪里?

扫描之前和扫描之后,图像上的状态是一样的。模型分不清自己刚才到底扫没扫,所以很多模型测试时一上手就不动了。它不知道应该再扫一次,还是其实已经扫完了。

程曼祺

它不知道应该把扫码枪拿开,还是继续扫。

范浩强

对。因为扫完之后,那两个东西本身并没有变化,所以从图像上区分不出来。

程曼祺

你们这个任务很刁钻。

范浩强

是的。我们之前也从来没想过这个场景。这个任务其实是拍脑袋想出来的,真正做了之后才发现,原来它的难点在这里。

程曼祺

如果要让机器人知道自己是不是已经扫完了二维码,需要什么能力?

高阳

需要模型有记忆能力。模型不仅要看到当前场景、知道要做什么,还要记住自己之前做了什么。

程曼祺

那它怎么理解扫二维码这个任务?

高阳

扫描这个动作本身并不难。难点是,同样看到这个场景,我可能以为自己已经扫完了,那就应该停下来;也可能以为还没扫,于是开始继续扫描。

现在的模型大多是单帧输入,给它几张图片,它就开始动。它没有一个机制,把“我是不是已经扫过”这个上下文放进去。

你可以想象一下,如果你每 100 毫秒就失忆一次,会是什么感觉。大家常说金鱼 7 秒就忘记,但模型现在是每一帧就忘一次,每 0.7 秒就忘一次。

现在所有 VLA 基本都是这样的。

当然,也有一些 fix。比如有些工作会把记忆放进去,修复这个问题。但现在大多数开源 VLA 或基础模型,都是基于单帧的,没有记忆。

高阳

把记忆放进去,也不是直接放在模型里面。它不是训练在模型里的,而是通过一些工程化方式,让模型记住更多帧,知道之前发生了什么。

范浩强

对,也有一些方法用 agent 的方式,去记住之前发生过什么。

我觉得这个任务非常巧妙。Table 30 有意思的地方,就是每个任务都有独特的一面。这是整个过程中最好玩的地方。

程曼祺

在两个多月的测试过程中,你们有没有看到整个行业进步的趋势或者速度?

范浩强

我觉得还是挺快的。

刚发布 Table 30 的时候,我们最担心的是没人来玩。那时候很多人看 π0,觉得它像天外来物一样,觉得太厉害了,不知道应该怎么做。

但接触下来,我们感觉很多公司至少已经掌握了 π0 这一档模型的技术。毕竟大家现在已经在挑战 π0.5,甚至将来挑战 π0.6,趋势还是很明显的。

从动作上看,越来越多机构和个人愿意来榜单提交。大家教模型,都是为了教出一个好成绩,这说明大家的自信心增长得非常明显。

程曼祺

除了大家主动提交之外,你们会特意邀请一些比较好奇、或者觉得比较强的公司来测吗?比如我就很好奇,π0.6 如果来测会是什么表现。

范浩强

这个不一定请得来。

程曼祺

你们 1 万条记录里应该也有美国的 IP。个人或者纯学术参与还好,但一旦是公司对公司,尤其是比较敏感的行业,我觉得顾虑可能会多一些。

高阳

对。但最早放榜单的时候,我们没有跟别人说这件事,所以平台上一个别人贡献的结果都没有。

为了启动它,我们当时去找 volunteer。反正现在大家的模型都是开源的,我们总能找到人下载 code base,跑一跑,测出一个分数。

最早那一批结果,我记得大概有 6 个,都是这么来的。后来才有很多公司说,你们测我不放心,那由我来做 fine-tune,再去 evaluate 成绩。这是后面才发生的事情。

程曼祺

所以现在大家来测的时候,微调部分不是测试社区或平台统一做的,而是每个人自己做。

高阳

当然。这个就是设计的 purpose。

我们当时也考虑过,测试方到底应该提交一个模型文件、一个 Docker,还是其他东西。最后我们选择把这些都 leave out,只提供一个进行控制的 API。

理论上,参与者可以用任何计算架构、任何控制逻辑去跑程序。我们希望做一个尽可能通用的设计。

在这种情况下,假设由我们来做微调,微调其实有很多手艺问题。大家使用的参数不一样,甚至换一块显卡,结果可能都不一样,这里面有太多说不清楚的地方。

所以 RoboChallenge 从一开始的设计,就是平台只保留最核心的功能,大部分事情留给测试参与者,让他完全自己掌控整个过程。

程曼祺

但如果大家自己来微调,你们怎么知道他到底喂了多少 episodes?

高阳

7. 开放代码维护榜单可信度

所以我们现在号召所有上榜的人都做 open source。

哪怕你是通过遥操作做出来的,理论上也可以把这个测试结果提交上去。除了道德约束之外,我们觉得最好的方法是自证清白。

如果你有一个成绩,就把当时取得这个成绩的模型和 code 放出来。理论上其他人可以再提交一遍你的东西。

因为误差问题,结果不一定百分之百重合,但至少大的趋势应该是一致的。用这种方式,至少能够解决所谓可信度的问题。

程曼祺

所以现在更多是靠大家的自律?

高阳

是的。我们还是相信绝大多数参与者是为了学术目的,也希望把这件事做得技术严谨。

如果真的有人作弊,他也交不出将来可以开源的东西。我觉得随着时间演进,大家最终还是会理清楚哪些结果是真正可靠的。

程曼祺

你们这个测评平台接下来有什么新的计划吗?我看你之前在推特上发过,有人给你们捐了灵巧手。接下来可能也会上线和灵巧手硬件相关的测评?

高阳

当然。现在 RoboChallenge 已经远远不是原力灵机一家在做了,它其实是一个 partnership 和 community。现在大概已经有十多家公司加入进来。

程曼祺

主要是中国公司吗?

高阳

Hugging Face 是国际公司。还有一些做本体的厂商,想捐一台机器人进来;有些公司有自己的数据采集厂和实验室,也想捐一套 benchmark。

也就是说,你们可以提交到我这里来,测我那些任务。

我们希望所有人都能把自己的 contribution 放进来。这样整个 program 的内容就会越来越丰富,不只是现在的 Table 30,将来可能还有 Kitchen 多少、Restaurant 多少。

这样才能对各种模型有更好的评测。

程曼祺

厨房里的任务、餐厅里的任务。

高阳

对。有一家公司,我记得叫 Tesollo,他们的手也是开源的。他们说也想加入进来,设计一些相关任务,将来做成 benchmark。我们非常欢迎这个 idea。

当然,毕竟时间紧、任务重,这些 feature 只能排队逐个上线。

程曼祺

从测评延展开来聊一下现在模型的状态,以及你们看到的接下来具身智能在 2026 年怎么往前推进。

刚才你们讲的目前的测试现状,比如把一个杯子放到一个洞里,或者把餐巾纸放到纸篓里,对人,甚至对很小的小孩来说,都是很简单的任务。

如果具身模型要继续往下走,目前面临的瓶颈可能是什么?大家又是怎么解决的?

高阳

8. 数据成为最大瓶颈

我觉得现在具身模型面临的瓶颈,主要还是数据层面。

如果数据层面有像大语言模型那样无穷多的数据,具身模型要解决的问题,我觉得并不是很难。因为大语言模型已经给我们摸出了一条很清晰的道路,我们沿着这条道路去做,大概率可以做出非常好的模型。

所以我觉得在 2026 年和未来一年,我们会看到具身模型有非常大的进步。

程曼祺

你说大语言模型指出的这条路,具体是什么?

高阳

大语言模型这条路线其实有一个三部曲。

第一步,用互联网上所有的文本数据给模型做预训练。第二步,用高质量数据给模型做监督微调。最后用 RL,也就是强化学习,给模型做 RLHF,让它在最终任务上的成功率提升。

现在基本上所有大语言模型都沿着这套三部曲在做。我觉得对机器人来说也是一样的。

程曼祺

在你描述的方法里,模型架构不一定非得是现在大家说得最多的 VLA,也可能是其他模型。但核心是这样一个从预训练到后训练的流程。

高阳

VLA 只是在描述模型的输入和输出。它也可能是 VLTA,T 代表 tactile,也就是触觉。

它也可能是别的架构,但总之是一个能够做事情的模型。VLA 并不代表一定要先有一个大语言模型,再得到 VLM,最后得到 VLA。

现在也有人觉得,视频生成模型可能是更好的基座。具体问题至今仍然是开放的,具体做法是开放的。

程曼祺

那你们两家公司的路线是怎样的?

高阳

我们还是通过 VLM 开始,先以一个 VLM 作为底座。

后面会加入一些视频数据,但不是以 world model 的形式加入。我们还会加入遥操作、可穿戴设备等数据进行微调,最后可选地做强化学习。

我觉得这个学习原理其实已经比较收敛了:用 VLM 吸收尽可能多的互联网知识和不变性,再加入大量 robot data,让它建立起从动作到感知之间的映射,最后在发布之前做一些后训练的工艺。

这个框架已经比较固定了,只是过程中到底拿什么积木、加什么数据、按照什么比例,还是仁者见仁、智者见智。

范浩强

我也同意高老师讲的。大的范式或者原理一旦收敛,你就会对这件事特别有信心。

现在 scaling data 可能是 2026 年最重要的一个主题。数据多了之后,泛化性和鲁棒性才能一点点体现出来。

程曼祺

那你们都是怎么获得数据的?你们看到业界规模化获取数据,主要有哪些做法?什么做法可能比较合适?

高阳

数据大概有 4 种:仿真数据、人类视频数据、可穿戴设备数据和遥操作数据。

我们自己除了仿真之外,其他数据源都会做,包括人类视频、可穿戴和遥操作。每种数据源都有自己的特性:有的量很大,但质量比较低,适合做预训练;有的量很少,但质量很高,适合做后训练。

我们会把所有这些真实世界的数据拿过来,用合适的算法喂给模型。

程曼祺

为什么你们没有把仿真数据也放进去?

高阳

这只是我们自己的经验,不一定正确。行业里还有很多公司在尝试用仿真数据。

我们的尝试是,仿真数据的 diversity,也就是多样性,很难提升到很高。每一个仿真场景,都需要艺术家,也就是 artist,在仿真器里把场景搭出来。

搭建过程比较慢,仿真器也没有那么好用,而且这是一个专业化过程。不太可能让一个只做过体力劳动的人去搭建仿真器,但你可以让他帮忙采集遥操作数据、可穿戴设备数据和视频数据。

程曼祺

所以这里面有一个成本考量?

高阳

对。随着仿真器变得更好,仿真数据未来可能也会是我们考虑的方向。

范浩强

如果仿真器变得更好,随手一做就能做出《黑神话:悟空》那样的场景,那仿真数据当然很香。

程曼祺

你们关注李飞飞的 World Labs 以及他们发布的 Marble 模型吗?

高阳

这个 specific 模型我不知道自己有没有仔细看过,但确实看过他们的一些 demo。

他们的 demo 目前都是静态场景的 3D 巡游效果。背后的技术是 4D Gaussian,或者说 3D Gaussian。

但这种技术暂时还没有办法处理动态场景,所以暂时不能直接用在具身智能里。它可能会更早应用在游戏,或者和 3D 视觉更相关的场景。

程曼祺

你们在数据规模化获得这件事上的时间表是怎样的?

范浩强

我个人觉得路线可能没有那么重要,条条大路通罗马。

如果做仿真,就天天想怎么做 3D asset,怎么大规模扫描资产,再想办法弥补 sim-to-real gap。如果做真机,就不断研究怎么用一大批操作员,把数据采集工业化、降本。

我相信最终都能走到终点,而且最后的卡点和难点可能是一样的。比如 3D 资产看起来无穷无尽,但里面的知识还是来自对物理世界本身的获取。

所以无论做仿真还是做采集,最后可能都会变成同一个问题:怎么建立一个集合,枚举日常生活中大家能接触到的所有商品。

我相信最终的本质难点是一样的。

从我们公司角度讲,我们选择了自己最擅长的方向。当年做人脸数据采集时,我们建立了一套非常完善的线下大规模采集体系,所以现在数据还是以真机为主。

其他方向,比如 Generalist AI 做离体式采集,号称已经采集了 27 万小时数据,可能也挺 promising。

如果这些东西能成熟,对用户来说并不会改变数据采集的逻辑。最终还是要回答:那些场景从哪里来,那些人从哪里来?我觉得这是数据收集里最核心的难点。

程曼祺

你刚才说 Generalist AI 的离体式采集,是什么意思?

范浩强

Generalist AI 是一家美国公司。他们主打的是人拿着一个夹子采集,而不是机器人拿着夹子采集。

这样采集效率很高,也可以把设备寄出去做采集。他们当时说了一个很惊人的数字,已经采集了 27 万小时,而且每周能采集 1 万小时。

如果这个数字是准确的,那到 2026 年结束时,他们可能会积累不到 100 万小时的数据。

现在也有公司在做可穿戴采集,比如在头上绑一个相机去采集。我听说有公司甚至说今年要采集 1,000 万小时。

所以我才说条条大路通罗马。最终可能还是总的知识量到了。无论 data 的 representation 是什么,可能都能走通。

真正决定性的因素,反而是你花了多大精力去收集这个世界里的 knowledge。

程曼祺

不过具身领域和之前做大语言模型、视觉有一个不一样的地方。大语言模型和视觉模型的数据,每个人都可以 touch 到。

每个参与其中的创业公司,至少可以在网上找到大量公开信息,后面再去做一些比较特别的数据。现在具身领域是不是每家公司采的数据都还是自己使用?有什么机制能让这些数据更好地普惠整个行业吗?

高阳

Open X-Embodiment 就是业内的数据共享联盟。现在这种形式已经有不少了。

它是一个学术数据集,数据本来就是公开的。这个项目相当于把这些数据整理起来。

但公司层面,我暂时还没有看到特别大规模的数据共享。

范浩强

以前互联网数据对创业公司来说好像是免费的,但后来也出现了版权纠纷。

不过现在大家的具身数据确实是每家公司花钱采集的。认为互联网数据可以直接拿来用,其实是一个 fairy tale。

互联网数据也不是直接喂进模型的。实际上里面有大量优秀工程师做清洗,最后才训练出那么好的模型。这里面都是真实的人类劳动,恰恰是这些人类劳动造就了现在模型的伟大。

程曼祺

所以那些数据也不是直接使用,只是互联网数据省去了采集这一步。

范浩强

对。YouTube 上可能有非常大量的视频数据,大家也可以直接利用。

但具身智能可能还是要先解决一些数据规模化之前的前置问题,之后才能踏上快车往后走。

程曼祺

那 scaling data 的前置问题有哪些?

范浩强

开个玩笑,至少 Table 30 得做到百分之九十吧。做到这一步,才知道我们的算法没有 major parts 的缺失,对吧?

我觉得沿着现在 scale 数据的路线,Table 30 做到百分之九十可能很快就会实现。

我自己不觉得有什么特别大的瓶颈。可能只是需要开发算法,让它能够处理这么多数据;需要研究学习算法应该怎样调教、怎样改变;还包括真实世界的数据采集,应该以什么样的社会分工来实施。

这些问题需要解决,但并不是不可解。我觉得它们是可解的。即使一开始解决得没有那么好,也可以产生很大的效果。

程曼祺

接下来是行业里比较共识性的命题。除了怎么大规模获取数据之外,还有什么?

范浩强

落地应用方向。

基础模型能力决定了你能做什么,而你能做这些事情之后,还会有商业逻辑去决定要不要做。

但我觉得现在的主要瓶颈,还是基础模型能力没有特别强。落地应用当然可以做,但基础模型进步是更加紧要的事情。

程曼祺

我们可以想想 LM 都落地了什么场景。据说有人统计,一半流量是用来做 AI 编程,剩下的比如替代搜索引擎、做问答。

范浩强

但实际上,哪怕它已经表现得像 AGI,真正能够普惠的人群,以及替代生活中环节的数量,也没有大家想象得那么多。

高阳

9. 具身应用仍待爆发

我有一个不同观点。我觉得这是一个正在孕育变化的过程。

程曼祺

过程中?

高阳

对。它其实已经很厉害了,但大家需要一些时间,把这种能力真正转化成手机里的助手。

比如我不用打开外卖软件点餐,直接告诉它我想吃什么,它就能帮我完成。刚才说应用,是因为 coding 确实把整个 LM 社区往前推了一大截,Agentic 又把它往前推了一大截。

最终你会发现,能够推动技术往前走的,是对一种非常具象化的应用方式的想象和思考。

程曼祺

那你说现在机器人除了叠衣服之外还能干什么?机器人时代里的 coding 是什么?我觉得这可能是一个很核心的问题。

高阳

这个问题对 LM 来说很简单,是因为 LM 已经真的无所不能了。Coding 又是一个非常消耗人类智力、单位价值很高的事情。

但机器人不一样。如果机器人已经无所不能,那我可以让它把房间收拾一下,我会很开心;让它下楼拿快递、拿外卖,也有很多事情可以做。

但它现在还没有那么厉害。它的规模又非常大,同时很高价值的场景好像还比较难想到。

程曼祺

一旦出现了这种场景,原来那些工业六轴加上一套算法,其实已经在做了,它的 baseline 其实很高。

高阳

对。以前的传统机械臂,已经占据了一些这样的场景,比如汽车装配厂里的组装工作。

另一个原因是,我们在中国,人力比较充沛,所以可能很难想象一个“真的很贵”的场景,觉得一定要机器人来做。

但在更多海外市场,人力相对没有那么充裕,很多事情都需要大家付很多钱去做。欧美的服务也很贵,比如理发,或者找人收拾房间。

它确实比 coding 更难一点,因为每一个细分服务都比较分散。

但编程大概就是几大类,前端可能已经能覆盖很广的人群和场景。比如我可以让它做一个网页。

所以机器人相对于大模型,可能是更加分散的一种行业形态。最后行业里可能会出现很多垂类公司:有的机器人做家政,有的机器人帮你修屋顶,会有很多不同的 subcategory。

范浩强

我刚创业的时候,一直在说服自己,具身智能一定会有一个时刻到来。

当时我想的是,如果机器人能把我家的被子叠好,为什么这件事对我很重要?因为我想了半天,扫地机器人的厂家和家电厂商肯定不觉得这件事应该由他们来做。

同时这个任务有用,也没有那么 trivial。所以我当时想,如果算法和机器人本体的负载、智能,能够做到每天早上我起床之后不用管,被子自己就叠好了;晚上回来的时候,被子还是叠好的,那我心情会非常舒畅。

而且我坚信,原来那套检测、分割技术肯定做不出来这个事情。如果哪天这个产品诞生了,我会非常信服,觉得具身智能这件事肯定能成。

当然此时此刻还没见到。所以像家政,或者所谓通用的简单操作,可能是第一个大的方向。

程曼祺

现在很多公司也都在瞄准这些问题。虽然还没有到能在你家叠被子的状态,但有没有什么业界进展,让你看到这个事情的信号?

范浩强

至少 π0.6 能在工厂里把纸盒叠得挺好。

程曼祺

π0.6 可以叠纸盒,对吧?我看美国有些公司,比如 三德 Robotics 的展示里,可以把袜子团起来。dello 主攻的方向是叠毛巾、叠衣服这类柔软物体。

把袜子团起来看似简单,但你能再把它抠开吗?能不能把里面翻出来?

范浩强

这些事情考验的可能不只是算法,而是硬件本身的精细度和负载能力。

为什么说被子?因为被子很沉。机器人本体能不能把它拎起来而自己不倒?说实话,这对硬件可能都是很大的挑战。

程曼祺

你的这个私藏任务很有意思。什么时候你们的 RoboChallenge 里也能把叠被子加进去?

范浩强

我觉得这可能是一个比较具象化的想象方向。

当然,大家最终是不是都去做家务类任务,还不一定。现在家务类在学界确实最火,因为任务很好布置,精度要求也没那么高,还很考验智能,所以大家都喜欢讲这个。

但我相信最终商业化落地时,肯定还是会非常细分。

高阳

不过也许大家会有一个共识:从不可做变成可做的 moment 出现时,可能会有一个时刻,真的出现几个像 ChatGPT 一样震撼心灵的 demo。

它完成一个任务之后,虽然没有做其他任务,但你相信很多别的任务它也都能做。更重要的是,客户相信了。

需求和商业机会就能正向流转起来。我觉得这可能就是具身智能的破圈之日。

这个破圈不只是破圈到公众和投资人,更重要的是客户相信了。真正的应用爆发,可能就从那时开始。

程曼祺

你们觉得这个破圈之日什么时候可能出现?高老师,这个时间已经比较好预估了吗,还是仍然很不确定?

高阳

还有一定不确定性,但我自己比较乐观。

破圈是一个非常重大的事情。GPT-3.5 其实还不算真正破圈,GPT-4 才是真的破圈。大概从 3.5 到 4 这个阶段,我判断可能会在 3 到 4 年左右。

程曼祺

3 到 4 年左右?这个时间比我想的稍微长一点。如果 2027 年能出现奇迹,那当然最好。

高阳

我觉得 3 到 4 年,是让普通人看到这件事。但让从业者看到,应该会快很多。

有一些 early sign 对普通人来说没有那么 impressive,但从业者看到一个模型,可能会发现它虽然后对齐没有做好,不太遵守你的指令,但做什么都很流畅,只是有时候你告诉它做一件事,它不听你的。

从业者就会知道,这个东西马上要来了,只需要做一些后训练,就能把事情完成。

程曼祺

如果类比大语言模型的发展,它现在可能处于什么时间点?

高阳

我觉得大概是 GPT-2 左右。小强,你觉得呢?

范浩强

我觉得差不多。我最喜欢的类比是,现在处于视觉领域 CIFAR-10 的时期,ImageNet 还没有出现。

但从年份上看,其实已经不远了。历史是一波一波 echo,而且 echo 的频率越来越快,感觉正在进入加速进化的前夜。

程曼祺

CIFAR-10 和 ImageNet 的区别是什么?

范浩强

CIFAR-10 经典的就是 10 个类别,图片也很小,32×32。你很明显知道这是一个 toy example。

到了 ImageNet,类别非常多,有 1,000 类,而且图片都是全分辨率的。你会觉得这个模型真的能做,真的能干活了。

所以在识别任务上,ImageNet 比 CIFAR-10 更接近真实世界中大家要识别的东西。

高阳

我觉得现在也有点像阿波罗计划那个时期。很多公司都在做开源的东西,后来逐渐收敛到服务客户。

现在可能刚刚走出实验室,但距离走进客户还有一段距离。

程曼祺

具身智能这个行业比较特别的一点是,从业者和非从业者有时认知差别非常大。

大语言模型很多人可以直接接触,但具身智能对很多人来说没有直接接触的途径。同时大家又传播很多视频,在展会上也有大量现场演示,所以公众认知可能会领先或落后很久。

范浩强

我们有一个开玩笑的说法:搭上 LLM 快车的最好方法,是 GPT-2 的论文发出来之后重仓英伟达。

从业者中有很多人能看到最早期的信号,但这也会产生一个时刻:从业者需要向公众证明自己。

我们已经看到,具身智能这条路其实很清晰了。但观众除非看到机器人真的在那里到处叠被子,否则不会相信。

所以这里面必然存在一个时间差。

高阳

现在有些人认为这件事已经很强了,因为大家都拍了很多 demo。

这也和 demo 的展示方式有关。普通公众很难理解一个 demo 的边界在哪里。比如看到一个机器人叠衣服,肯定会觉得既然叠衣服都能叠了,那团个袜子、把衣服放进柜子应该更简单。

但实际并不是这样。

程曼祺

你们最近这一两年遇到的,比较常见的对你们所做事情的误解是什么?

范浩强

感觉是完全两极分化。

一些人觉得你们都是做视频剪辑的公司;另一些人觉得机器人不是早就实现了吗?当年日本做的那些仿生机器人,不也能蹦、能跳吗?

对于一个特定的 demo,大家还会觉得,既然你们能叠衣服,是不是马上就要进入家庭了。

大家看到的不只是技术展示,还会直接把它联想到应用落地。我们最初做这个东西,是想看看技术到底怎么样,推动技术发展,demo 只是阶段性成果。

但公众往往会把技术展示直接联想到应用落地,觉得马上就可以进家里叠衣服了。

这中间其实还有一定距离。大家的反应也很两极化:看到 demo,就觉得美好愿景马上实现;听到一点负面新闻,又觉得这都是假的、不能信。

我觉得只有从业者才能看到从 0 到 1 的中间态。

程曼祺

行业里有没有什么大家心照不宣、但不太会公开讨论的事情?

范浩强

10. Demo 工程暴露真实边界

Demo 工程肯定是一个公开的秘密。

程曼祺

Demo 工程是指什么?

范浩强

比如在微信公众号或者其他地方,放出一段机器人做得很厉害的视频。背后到底对应了多少实际上的实现方式,这件事算是一个公开的秘密。

很多视频里,一个机器人看起来很厉害,又爬到那里做了一个动作。但如果真的去看,就会发现每个东西的位置都不能变。

程曼祺

我最早看 Figure 的那些视频时,也觉得机器人已经实现了。

范浩强

我其实不太清楚它的泛化性到底怎么样。但不特指 Figure,很多 demo 都是这样。

就像高老师刚才讲的,你不停去找一个恰好成功的区域。比如杯子刚好摆在这里时,算法成功了,那录 demo 的时候,就把这一段录下来。

一件事做 100 遍,把其中成功的那一次拿出来给大家看。

程曼祺

有没有比较简单的方法,分辨什么视频或 demo 相对真实,什么可能做了比较多 demo 工程?

高阳

我还真思考过这个问题。现在主要有 4 种风险:第一是 cherry-pick,第二是视频剪辑,第三是遥操作,第四是 AIGC。

AIGC 我觉得应该能够分辨出来。最好的方法,还是带着大家站在机器人面前现场看,这是唯一的办法。

程曼祺

所以 RoboChallenge 社区里也在讨论,有没有线上的方法,能够尽可能接近现场观看的体验。

高阳

对。作为一个学术问题,这的确很难,现在可能还没有特别好的方案。

程曼祺

作为测评社区,你们可以在测试场地放摄像头,通过远程监控观看,这样是不是会更接近现场?如果能和 demo 交互,就更好了。

高阳

对。如果能和 demo 交互,会更好。

程曼祺

但怎么防止它是剪辑的呢?

高阳

这里面有很多 evaluation 本身的 open question 需要解决。

现在很多 demo 为了防止后期剪辑和加速,会放一个 iPad 时钟。最近学术界也有一些 program,要求 demo 每次都放一个随机的哈希值,证明视频是唯一的,不是 cherry-pick。

比如每个人只能申领一次哈希值,拍完之后必须把带有这个哈希值的视频传上去展示。

这些东西还可以和区块链结合。展开来说,这本身就是一个挺好玩的学术课题。

高阳

但它肯定还是一个没有被解决的问题。至少从技术上看,我觉得它很有意思。

很多东西都需要思考,怎么在物理上给它做一个标记。这和大语言模型的测评很不一样。

程曼祺

大语言模型也有 hack 数据集或 benchmark 的方式。具身领域据你们所知,有哪些 hack 的方法?

比如 Table 30 发布之后,我可以怎么针对性优化?你们又怎么反制?

范浩强

最简单的攻击方法,就是同一个模型、同一个任务交 100 次,取最好成绩。

首先规则上我们取最后一次,所以数学上已经把这种方式砍掉了。其次,我们也没有那么多产能供你反复提交。

所以这里也需要行业自律来约束。

高阳

除此之外,现在能防的其实很多。大部分所谓作弊手法,都要求你能够控制 environment。

但 RoboChallenge 是在线测评,你接触不到测试环境。你顶多是在背后不是用模型,而是让一个人去操作。

程曼祺

这可能是目前最大的潜在攻击方法。

高阳

对。一涉及真实世界就很有意思,可能想 hack 的话,只能做社会工程学了。

范浩强

来我们这里应聘测试员。

程曼祺

你说到这个,我想起以前去一些工厂或者制造业企业的大客户那里做 POC 验证。以前有创始人跟我说,一定要把测试体系里从上到下的人都打点好,不要让他们来害你。

因为 POC 可能同时在测很多家公司。现在可能更重要的是把那条机械臂照顾好,别测到一半卡住,也别测到一半挂掉。

你们毕竟是一家商业公司,做这件事肯定也会有人力投入,买设备、换设备也需要经费。你们长期是怎么考虑的?

范浩强

对外提供测评服务,相对于我们内部提供测评服务,其实只是一个 fraction。

因为我们内部本来就有大量评估模型的需求,所以这不是很大的额外成本。目前至少还在可负担范围内。

当然,有更多公司一起来做、一起分担,肯定是更好的。

程曼祺

最后想请两位分享一下,接下来一年,也就是 2026 年,你们最想验证的一个悬念是什么?

范浩强

11. 具身智能等待 DeepSeek 时刻

我特别想知道,具身智能的 DeepSeek moment 能不能到来。

程曼祺

你说的是中国超越美国?

范浩强

对。以前看很多国外的工作,心里只能剩下羡慕。我想看看,国内外追上的时间点,能不能在 2026 年最终被我们见证到。

当年做视觉的时候,看 Google 的工作也真的像天外来物。但做了几年之后慢慢发现,其实也能追上。

程曼祺

你们从看 Google 的东西觉得像天外来物,到后来追上,大概花了多久?

范浩强

其实没多久。比如 Google 最早做那种用几千台服务器生成一张猫脸的工作,后来人脸识别做到 human performance,是国内国外一起完成的。

我感觉也就 3 年。而且现在的节奏可能更快。

现在大家做实验的代码都是 Codex、Cursor 写的,生产力比当年高多了。

高阳

我对中美之间的叙事没有那么关注。2026 年我最期待的,还是具身基础模型到底能不能达到 GPT-3,甚至 GPT-3.5。

我对这件事非常期待。而且今天的我非常有信心。当然,可能再做几个月会更有信心,也可能就没有信心了。

程曼祺

从你开始做机器人,包括创业到现在,你的自信一直比较高,还是中间有过波动?如果有波动,当时发生了什么?

高阳

我觉得是越来越高。

程曼祺

越来越高?

高阳

对。因为很多东西看得越来越清楚了,最开始困扰我的一些疑惑变得越来越少,也越来越确定,所以我觉得是越来越自信了。

程曼祺

今天非常感谢两位做客《晚点聊》,分享了从 RoboChallenge 开始,行业之前是怎么测评的,以及为什么现在大家在 VLA 之后,非常希望有一个更大规模、能够比较更多模型能力的测评社区和平台。

我们也从这个话题延展到了现在具身模型是什么样的状态。它一方面没有视频里展现的那么厉害,但绝对也不是一些人说的那样,什么都做不出来、全部都是泡沫。

作为从业者,你们每天都能感受到这个领域的进步和进展。

今天的节目就到这里,感谢大家的观看。各位拜拜。

范浩强

拜拜。

本期零点呈现讲一讲做了多期具身智能访谈后的一些总结和观察,大家也可以去听几期晚点聊直接相关的节目,一是上一期访谈踏实创始人陈义伦,还有一百一十二期我们对高阳的专访,以及八十六期对清华叉院许华哲的专访。高阳和许华哲都曾在伯克利贝尔攻读博士。第一个总结是关于具身的大的框架,或者说可以从几个维度去观察,简单来说是数据、模型还有硬件,其中数据和模型是和智能能力直接相关的部分。行业的共识是数据是当前的最大议题,更准确的说是如何规模化且相对低成本的获取大量有效的数据,也就是小强在这期里说的 scaling data 是二零二六年的一个行业主题,以及陈义伦在上期提到的三道观察中的第一道就是数据,而怎么获取数据则是现在行业分歧所在,有些是从视频里来学,也有人侧重真机,真机数据又可以分为比较重的去做。遥操采集,它的质量是最高的,但是很贵,因为你需要造一个机器人或者至少是一个同构的结构才好做遥操。而现在很火的一个方向是 UMI,简单来说就是让工作中的人带着可穿戴设备来采集真实场景里的真实工作数据。Generalist 还有 Sand Robotics 和踏实都有这样的尝试。二六年我们肯定会看到更多团队有类似的工作。在模型架构上,VLA 或者说端到端是当前最主流的方向,但是怎么做 VLA,包括怎么理解 VLA,每个团队也都有不同的想法。比如高阳在这期提到也可以是 VLTA,T 这里是指触觉。小强也提到 VLA 不一定是要像现在最主流做法那样以 LLM 就是大语言模型为基座,它也可以是以视频为基座。硬件则是一个更跨学科的问题,它要实现的目标很多,包括寿命、耐久性、可靠性、精度、负载等等,还有续航,背后需要。能源材料的突破,理论上智能也就是大脑和小脑的部分和硬件的部分是可以解耦分开的,所以在海外也有一些只做大脑和小脑而不做本体的创业公司,但是从研发迭代的速度和落地应用的角度。来说,软硬垂直整合可能会有一些优势。我们看到大量中国公司都是大脑和本体一起做,这样也可以利用国内的供应链的优势。另一个观察视角就是巨声团队的来源,我们访谈过的对象刚好涵盖了几种主要的来源。第一是来自自动驾驶领域,比如陈一伦,他是华为前自动驾驶的首席科学家,类似的还有星海图的创始人高继阳曾在威某和Momenta工作,质检动力的两位创始人贾鹏和王凯都曾在理想工作。二是一直做Robotics学术研究的人,比如高阳、徐华哲。三是来自其他的AI领域,如CV计算机视觉,范浩强就有很强的CV背景。同一个公司里几个主要联创的背景也会有互补,比如在星海图,高继阳有更多的工业界经验,在清华任教的赵航则有更多研究背景。在千寻,高阳的创业合作伙伴,千寻的创始人韩风涛来自洛石,这是一家国产协作机器人公司,韩风涛有很强的工业界经验。这两个视角其实指向了巨声智能一个共通的特点。就是这是一个非常跨学科、跨领域的创业方向。这是聚星智能目前让人感觉比较混乱、难以看清和头大的地方,也是它很有意思的地方。可以想象,这不是一个巨头靠砸资源就能快速取得成效的领域,未来它还会有很多变数,我们可以一起观察,一起见证。本期节目就到这里,欢迎收听。如果你对今天聊的话题有观察、好奇或疑问,欢迎在评论区分享想法,这也会成为我们节目的一部分,让整个讨论更完整。你也可以把我们的节目分享给对这个话题感兴趣的朋友,欢迎推荐更多你想听的主题和嘉宾。你可以从小宇宙、苹果 Podcast 等渠道关注“晚点聊 Late Talk”,也欢迎关注我们的公众号“晚点 Late Post”,下期再见。

149: 具身模型哪家强?|与范浩强、高阳聊具身模型的测评、RoboChallenge,26 年具身展望 | BidClub