范浩强
但是呢,我们测了很多模型,这个成功率非常低。低到多少?比如测 π0 的时候,我们只测出来了百分之二十多,也就是说,基本上看 4 次只能成功 1 次,这是 30 个任务的平均数。
程曼祺
你说的是哪个任务?
范浩强
不是某一个任务,是 30 个任务的平均数。
那时候我们自己心里其实很慌。如果把这个成绩最后公之于众了,大家是不是会对整个行业都没信心?
直到 π0.5 的权重公开,我们第一时间去测。测完之后非常震撼。这种震撼不光是看成功率,站在旁边看机器运行,你就会觉得它比之前的模型更灵光一点。这种感官体验对我们的冲击非常大,也给了我们很大信心:这个行业的确是在很 concrete 地往前进展。
范浩强
因为现在真的就是 scaling data 可能是 2026 年最重要的一个主题。
我们自己的尝试是,仿真数据的 diversity,也就是多样性,比较难提升到很高。
程曼祺
那你说现在机器人除了叠衣服之外还能干什么?机器人时代里的 coding 是什么?我觉得这可能是一个很核心的问题。
程曼祺
欢迎收听晚点聊,我是曼琪。
虚拟空间的大模型有大量 benchmark 测试,非常直观。而在如火如荼的具身领域,怎么衡量模型能力本身,还是一个需要探索的课题。
这期我们邀请了两位具身智能的从业者,Dexmo 原力灵机联合创始人范浩强和千寻智能联合创始人、首席科学家高阳,一起来聊具身模型哪家强,也就是具身模型的测评。
两位都是清华校友。范浩强从高三就开始在旷视工作,有丰富的计算机视觉开发与落地经验。高阳回国前在伯克利攻读博士,和 Physical Intelligence 联合创始人 Sergey Levine 有诸多学术合作。
去年 10 月,原力灵机和 Hugging Face 一起发起并上线了 RoboChallenge 开源测试平台。在前不久发布的最新测评结果中,千寻的 Spirit V1.5 模型登顶榜单,表现超过了 π0.5。
在 RoboChallenge 的测评中,机器人不再只活在精挑细选的 demo 视频里,而是要在多样化的 Table 30 任务中接受真实世界的检验,包括碎纸、插花、扫二维码等。
我们与小强和高阳一起聊了具身模型测评的难点,RoboChallenge、RoboArena 等目前的大规模测评尝试是怎样的思路,行业里心照不宣的 demo 工程,以及 2026 年我们可能从哪些路径逼近具身智能的 GPT-3 时刻。
小强和高阳说,组织与参与测评的过程本身,增强了他们对具身智能的信心。从 π0 在 Table 30 任务上只有百分之二十多的成功率,到 π0.5 的翻倍成功率和一些国产模型的超越,具身智能仍然非常早期,但进步速度也非常惊人。
程曼祺
下面我们正式进入节目吧。
这一次的节目,我们请到了具身智能领域的两位一线从业者,Dexmo 原力灵机的联合创始人范浩强、千寻智能的联合创始人高阳。两位可以和我们的听友、观众简单打个招呼,然后简单自我介绍一下你们之前在 Robotics 和具身领域的一些经历。
范浩强
大家好,我是范浩强,一般都叫我小强。原力灵机是 2025 年 3 月刚刚成立的一家具身智能创业公司。我们喊来了很多之前在旷视时的老同事,以及一些新加入的伙伴,一起做了这么一家企业。
原力灵机主要专注于具身智能机器人产品及相关应用,另外也会做其中 AI 相关的技术。
高阳
大家好,我是高阳。我现在是千寻智能的联合创始人,也是清华大学交叉信息研究院的助理教授。
我做具身已经好多年了。最开始是在 UC Berkeley 读博的时候做计算机视觉,但到博二左右就开始和 Sergey Levine 一起对机器人产生兴趣了。那个时间点大概是 2016 年。
博士后半段,我做了很多具身机器人视觉融合的研究。当时我们会讲模仿学习、强化学习,但今天把这些技术聚合到一起,就是所谓的具身智能。
我大概是 2020 年开始在清华任教。后来经历了 ChatGPT 浪潮,让我觉得我们似乎已经掌握了通往 AGI 的一条道路。于是到了 2023 年左右,我和韩孟涛、郑林英一起创立了千寻智能。
我们的目标是做具身领域最强的模型,并且希望能把这个模型以机器人硬件产品的形式带进大家的生活。
程曼祺
因为两位都是清华校友,你们是同一级吗?
范浩强
我和你差挺多。我是零字班的,2013 年上的本科。
过去的人生大部分时间都花在了旷视身上。我差不多从 2012 年开始加入旷视,旷视是 2011 年成立的。所以我的本科生涯,其实一直是在计算机视觉创业的过程中度过的。
程曼祺
我上次跟原力的创始人唐文斌聊,他说你高三就去旷视上班了。
范浩强
是的。2012 年刚好因为他保送了,信息学奥赛拿了金牌,保送之后,高三其实就有很多时间在旷视工作。
那时候文斌刚开始做,计算机视觉还很新,甚至还没有 deep learning。最早是拿 SIFT 之类的特征和 SVM 分类器去做。但做的时候我就觉得特别有意思,和真实的图片、数据打交道,是一件特别好玩的事情。
后来 deep learning、神经网络这些技术出现之后,你就非常笃定地觉得,这个技术不只是用来发 paper,一定能够实用化。我觉得这是过去一段时间里对我影响最大的一个过程。
最早做旷视的时候,人脸识别可能准确率只有百分之八十几。你识别 5 个人,可能就肯定会错 1 次。后来一路做,最后差不多做到了 12 个 9,也就是 99.999999999999% 的准确率。
所以在这个过程中我发现,只要算法原理是对的,然后投入大量的聪明才智、勤劳和汗水,技术一定会给你回报。这一点给我的冲击特别大。
程曼祺
我觉得两位的背景正好有相似的地方,也有不一样、互补的地方。
这次想请两位来聊,是因为我觉得大家非常关心一个主题:具身模型哪家强?翻译一下,就是我们现在到底怎么去测评一个具身模型。
背景是原力灵机和 Hugging Face 一起发起了一个新的测评平台 RoboChallenge。千寻,包括中国还有很多其他公司,以及海外的一些公司,模型其实都有参与进来。
你们可以讲讲 RoboChallenge 的背景是什么吗?在这之前,大家是怎么测具身模型的?你们现在新做的评测标准,和以前不一样的地方是什么?
范浩强
1. RoboChallenge 诞生始末
我大概讲讲当时做 RoboChallenge 的背景。
Robot research 很多时候很像做图形学。每篇文章可能都一定要有几个 demo video,做几个看起来很酷的任务。大家一般会把它们 cherry-pick 出来,可能录了很久,最后找到一条好的,就拿出来告诉大家,至少这件事是可做的。
另外,做 benchmarking 的时候,绝大多数还是依赖仿真测试,因为仿真相对容易测,noise 也相对可控。真机测试的话,甚至最好的 paper 也就放三四个任务,简单数一下。
而且不同 paper 放的那三四个任务还不一样。比如都叫 table bussing,但一个人测的和另外一个人测的,可能完全不是一回事。
我们自己做机器人研发的时候也一直被这个问题困扰。大家都是一点点去 improve 一个模型走过来的,现在突然发现没有这么一个榜可以做,迭代和实验就会非常费劲。
所以我们当时问了一个问题:能不能做 large-scale 的 robot evaluation?
最终你要想把方差控制住,还是得测很多很多次。不只是大家测 3 次、5 次就去评价这个模型,而是至少执行几百次,把成功率平均下来。也许这个指标才有一些意义。
一旦想到这一点,很多事情就顺了。既然要做 large-scale,这些任务本身的格式和描述就必须标准化,也就是 standardized。测试 protocol 也必须足够通用,能够兼容单臂、双臂等不同机型。
把所有这些东西放在一起之后,我们大概就有了 RoboChallenge 的雏形。
不过 RoboChallenge 做的过程中,有一段时间我们一直很困惑。我们选了 30 个对人来说非常 trivial 的任务。
程曼祺
这里的 trivial 是指琐碎和简单吗?
范浩强
就是简单,就是人一做不可能失误的问题。比如把一个东西从这里拿起来,放到那里;或者稍微复杂一点,拿张餐巾纸擦桌子。让一个人做,他绝对可以百分之百做好。
但是我们测了很多模型,包括开源的 π0。那时候成功率非常低,低到什么程度?比如测 π0 的时候,我们只测出来了百分之二十多,也就是说基本上 4 次只能成功 1 次。
程曼祺
那时候你们测 π0 是几月份?
范浩强
我们差不多从 7、8 月份开始想做这件事。那时候 π0.5 的权重还没有公布,所以我们心里其实很紧张。
如果一个 benchmark 把大家的分数都测得很低,它就不是一个好 benchmark。我们当时很担心,如果最后把这个成绩公之于众,大家是不是会对整个行业都没信心?
直到 π0.5 的权重公开,我们第一时间去测。测完之后非常震撼。它的成功率不光是比之前高,你站在旁边看机器运行,就会觉得它比之前的模型更灵光一点。
这种感官体验对我们冲击非常大,也给了我们很大信心:这个行业的确是在很 concrete 地往前进展。所以我们想把这件事情分享给大家。
我们也很想见证,为什么排名第一的模型总是国外发布的?国内这些模型之前都是在 PR 上说自己是第一,有没有一种方法,能让其他人也信服,能够见证一个好的国产模型诞生?
在这些想法叠加之下,我们最后决定做 RoboChallenge,并且把它做成一个 community-based 的 program。不只是原力灵机做多少事情,而是把各家公司都拉在一起,大家一起把它做到尽可能客观、公正,在技术上严谨。
本质上,我们希望让具身圈外的人也能承认,具身智能不只是大家发布了很多新闻,而是真的有非常 concrete 的技术进展。
程曼祺
所以从 π0 到 π0.5,你们自己的测试至少证明,在全世界范围里,有人能在比较短的时间里把具身模型的性能提升得很快。
范浩强
其实也不算很短,这两个模型之间也隔了挺长时间,快一年吧。但这种对比和冲击,会让你觉得这一定是下一代的东西。
程曼祺
那实际上,你们 30 个任务的平均成功率,从之前 π0 的百分之二十多提升到了多少?
范浩强
π0 我记得是二十几。π0.5 是 42% 左右,而且翻倍了。
它很多任务简单 fine-tuning 一下就能做到百分之百。比如最简单的叠瓦片那几个任务,它就做得很稳定。你会觉得它可能学了多少条数据之后,真的就学会了。
这个其实是非常强的信号,说明具身模型在不断 improve,正在逼近那个临界点,虽然可能现在还没有达到。
程曼祺
总结一下,你们最开始做这件事,有一个思路是想把以前在计算机视觉、NLP 这些更纯粹的虚拟空间里的模型测评方法,迁移到具身领域,对吧?
我想请高阳补充一下。你从 2016 年开始读博士,一直在做 robotics 相关的研究。在此之前,行业里有没有什么公认的方式,能够大范围评估不同模型的能力?
高阳
2. 真实世界难以复现
其实大家意识到这个问题已经很久了。但因为刚才讲到的那些原因,以前虽然也有很多公司,但没有这么多公司和资源来做这件事情,所以基本都是一个个高校实验室在尝试。
高校实验室其实也提出过类似的方案。比如我有一个机器人,有一个场景,这个场景在我的实验室里,可以保证复现;你可以远程连接到我的机器人上。
这个想法在学术界很早就出现了。我知道最早的尝试之一,是卡内基梅隆大学的 Abhinav Gupta。我忘了具体是哪一年,反正至少在我读博之前,他就已经做过类似的尝试。
后来还有很多类似的工作,包括 Priya,以及我记得上海交通大学卢策吾老师,也有过类似尝试。但这些尝试规模比较小,集中在一个实验室里。高校实验室往往随着一个学生毕业,这个 setup 就没有人管了。
而且它测的场景也比较有限,可能只能测一两个、两三个任务。实验室空间有限,机器人也有限,也没有那么多人看着机器人测试,帮忙给机器人复位等等,这里面需要很多人力投入。
所以学术界有这个 idea,但没有足够资源让它成为一个能够连续运行、并且被广泛接受的事情。
以前机器人模型的另一个痛点是,大多数模型让它做一件事,它根本做不了。以前的机器人模型还没有 VLA。现在是我能做,但成功率可能没有百分之百;至少理论上,我现在的模型什么事情都可以做。
以前的模型或者机器人算法只能做单一任务。比如我只能缝一个手绢,或者只能剪一个东西。你让我做其他任务,它根本做不了,对任务的限制很强。
所以我觉得,正是因为这两个点,一方面我们对 benchmark 的需求更加强烈,另一方面技术也到达了一个拐点,使得我们真的可以开始做任何任务。
程曼祺
对普通人来说,最直接的方式可能就是把这些机器人都弄到一个地方,让它们做一些任务。为什么这种最直观的测试方式,在这个领域其实不太行得通?
高阳
这个问题的本质原因是,具身智能模型在执行的时候,需要一个物理环境和模型进行交互。
听起来这并不是很难,但实际执行时,物理环境是不一样的。比如我家的杯子和你家的杯子就不一样,我这个杯子的把手,和现场这几个杯子的把手也不太一样。
那么如果我的模型成功率低,到底是因为把手不一样,还是因为我的模型真的差?有很多物理因素会影响结果。我们也很难在不同地点保证完全一样的场景。
所谓一模一样,包括物体一模一样、摆放位置一模一样、光照一模一样,以及其他所有东西都一模一样。这是困扰机器人很多年的评测问题。
程曼祺
这岂不是正说明你的模型泛化能力很差吗?难道一定要一模一样才能测吗?
高阳
以前的模型泛化性很差,所以确实需要一模一样才能比较。但现在的模型已经越来越好,可能不需要完全一样也能成功。
不过如果我们做实验,还是希望评测环境尽可能一样。因为很多时候,一个创新带来的提升可能只有百分之零点几。即使创新很大,提升也可能只有百分之五。
如果评测不够准确,就可能看不出来这是不是一个创新,也不能正确衡量它到底是进步了还是退步了。
计算机视觉时代,大家只需要一个数据集,所以可以把评测做得非常精准。因为机器人需要真的去执行一条轨迹,就很难达到同样的准确率。
范浩强
这一点我在计算机视觉时代感受很深。刚才说从百分之八十几到 12 个 9,其实拆开来看,每一步的小 improvement 都只是一点点,可能刚好比上一次的曲线高一点。
但就是靠无数这种小的改进和创新,一点点堆上去,整体才不断往上走。
高阳
对。我觉得以前做视觉时,它有一个 privilege,就是测试非常可重复,样本足够多时,信噪比也足够高。
但机器人没法这么做。Robotics is about noise。你很难永远控制住物理世界里的所有东西,还是会有很多噪音。
所以现在我们反而会想,我们追求的可能不是百分之百准确地测出一个数字,不是说百分之一都不能差,而是希望它能够反映模型发展的趋势。
当几个模型之间有比较明显的代差时,测试结果能够明显看出差异。如果它们本来就大差不差,最终分数也可以集中在一起。我觉得,能够把这种大的区别测出来,可能就是现在做 evaluation 的使命。
毕竟现在还很早期,还不是“你是 99%,我是 99.5%”的阶段。现在比的是“它是 0,我不是 0”。
从这个角度来说,现在榜单上的很多成绩,最高的甚至还没到 60 分,我觉得这反而是刻意为之的。我们把它卡在一个敏感区,让不同模型之间的区别可以被放大,这样才能更好地 measure 模型之间的差异,以及不同代际之间的进步。
程曼祺
3. 仿真无法替代真机
刚才你们也提到过,之前还有一种跑 benchmark 的方式,是在仿真环境里看模型表现。但仿真环境里的表现,对实际应用的意义是不是没有那么大?它和部署到真实机器上之间,gap 会比较大吗?
高阳
是的。学术界的另一条路线,是使用各种仿真器。只要把代码开源,每个人下载同一个仿真器,跑出来的结果理论上就应该一样。
但这里面也有很多难点。仿真器往往不够真实,而且仿真器里的轨迹,很多不是人类遥操作采集的,而是通过程序生成的。比如程序规定先移动到这里,再往下走,再抓取。
这种程序生成的轨迹,和真实世界中通过遥操作采集的轨迹非常不一样。它的状态数量比较少,在这种数据上学习,也不能充分反映机器人在现实世界里的表现。
学术界有很多基于仿真器的工作,可以反映一些算法进步。但机器人领域的会议往往不接受一篇只有仿真结果的论文,因为审稿人也知道,这种结果不一定能在真实世界取得同样的效果。
当然,现在仍然有很多学者在做仿真器,包括李飞飞和 MIT 的 Russ Tedrick。他们仍然在仿真器方面进行努力。不是说这件事完全不行,而是它很难。
程曼祺
刚才你讲到有两个变化:一个是技术本身的变化,机器人可以做更多任务了;另一个是出现了更多公司和创业者,大家也需要更大范围的评测。
除了你们在做的 RoboChallenge 之外,全球范围还有什么类似的事情吗?
高阳
4. RoboArena 走向零样本
RoboArena 也逐渐做起来了。RoboArena 的发起方是 Physical Intelligence,也就是 π。
他们的做法和原来的实验室比较像,但多了一层分布式机制。不再依赖某一个实验室,而是号召全球很多实验室,每个实验室参与一点。
在每个参与实验室的机器上,每次跑两个算法,比较谁好谁坏。假如有足够多的 sample 和观测,就能够对所有算法进行排序。
这个方法的难点在于,不同实验室的环境是否足够一致。
程曼祺
但这个方法其实没有这个问题吧?因为每次是在同一个实验室、同一台机器上跑两个算法,测的是零样本泛化模型,而不是微调模型。
可以解释一下 zero-shot 模型吗?
高阳
现在的具身模型还处在比较初级的阶段。大语言模型比如 GPT-4,你直接打开 OpenAI 的网站,跟它说什么,它就能直接回答你。
但在 GPT-3 的时候,模型回答问题还没有那么有道理。那时候大家会拿一些专家数据,比如你问“今天股市怎么投资”,有一个专家给你写一段回答,再用这些专家数据去微调模型。
用了专家数据进行微调,我们可以叫它 few-shot,也就是用少量数据进行微调。
如果模型已经非常强,不用任何数据,它就能直接给出合理解答,我们就叫它 zero-shot。
现在 π 的 RoboArena,就是 zero-shot 的设定。它假设模型足够强,可以做任何事情。原力灵机的 RoboChallenge,则是 few-shot 的 setting。
程曼祺
RoboChallenge 和 RoboArena 的区别是什么?现在 RoboChallenge 的测试流程是怎样的?
范浩强
首先,我们测的还是 fine-tuned model。也就是说有 30 个任务,每个任务都有清晰描述,并且我们会给这个任务提供大约 1,000 条示例数据。
这些数据是一个人采集这个任务应该怎么做。每个任务最多大概会有 1,000 条。
参加测试的人可以先有一个基础模型,也就是基模,然后拿这 1,000 条数据去 fine-tune,也就是进一步训练。得到精调后的模型之后,再让它指挥机器人完成这个任务。
这 1,000 条数据其实定义了测试分布。你可以把它叫作 few-shot learning,和经典模型动辄用几万条数据训练不一样。
RoboArena 则是由测试实验室现场指定任务。无论是什么任务,你都要根据文本理解之后自己去完成。它们测试的对象其实是不一样的。
高阳
而且 RoboArena 分布在不同实验室,RoboChallenge 则集中在一个场地,或者说同一个环境里的硬件上测试。
程曼祺
但如果是这种对比性测试,每次测的实验室、任务和道具可能都不一样,单次结果本身不能拿去平均。只能一次测两个或多个模型,比较谁更好,得到一个相对关系,再把一对一对的关系最后汇总成一个总值,对吗?
高阳
对。比如现在的 LMArena,是大语言模型领域最有影响力的榜单之一。它做的就是 zero-shot 或者开放性问题,再加上对比性测试。
也许具身智能哪天也走到了 zero-shot 阶段,这种测试就很有道理。但现在我们看到,任务要想做成,还是需要 fine-tune。所以 RoboChallenge 的第一个 benchmark,就专注于 fine-tune setting 下的测试。
程曼祺
RoboArena 直接做 zero-shot,岂不是很多模型在那儿根本完成不了任何任务?如果大家都接近于零,反而也比不出来。
高阳
你去看它的测试视频,的确大部分任务的成功率都比较低,所以这也有一定问题。
它是对比性测试,只能说虽然大家都没抓住,但这个看上去好像走得更 promising 一点,最终只能得出这种结论。它的方法对现在的模型来说太难了。
程曼祺
听完这个之后,我不知道你们跟投资人或者其他人讲这件事时,他们通常是什么感觉。
一般人可能会觉得,这个行业确实还很早期。距离我们想象中的机器人进入家庭,或者在商业服务场景里干活,似乎还有很远的距离。
高阳
我觉得智能的发展是非线性的,是指数级的。
3 年前,大语言模型刚刚出来,什么也干不了,只能跟你说一些话。技术极客可能会觉得有点意思,觉得它竟然会说人话了。
但到今天,已经有很多模型能把 IMO 的题目都做出来了。中国和美国每年各派 5 个人参加的比赛,现在这些大模型已经可以把题目完全解出来。
具身模型其实也是一样。刚开始你觉得它很菜,但它是一个指数级变化的趋势。
范浩强
这方面我也更乐观。之前做微震时,那么多模型加起来可能还打不过现在一个 Grounding DINO,但不妨碍我们真的把它卖到了祖国大江南北。
最终去做场景和产品,还有它自己的逻辑。所以我觉得,即使具身模型还没有 zero-shot、百分之百完成所有任务,也不阻碍大家先做一些落地尝试。
程曼祺
回到你们具体看到的进展。你们陆陆续续测了很多模型,前面说过 π0.5 相比 π0,成功率翻了一倍。其他测过的模型可以透露一下吗?千寻应该也参加了这个测试吧?
高阳
5. Spirit V1.5 登上榜首
我们千寻测试的模型,最新结果大概比 π0.5 高一些,暂时位列榜单第一。
范浩强
其他模型方面,我们在 9 月份发布的时候,把一些开源模型,比如 ACT 这类经典模型,也自己做了一遍复现,做了一个 baseline。
后来我们还邀请了一家公司。他们的模型叫 WALL-OSS-FLOW,公司也派了一些志愿者在我们平台上做 fine-tune,最后拿到了一个成绩。印象中,大概能比 π0 好一些。
程曼祺
现在有哪些公司参加可以透露吗?国内公司里面。
范浩强
目前能够绑定到公司名字上的,主要就是这两家。其他还有很多公司其实也已经在测试了,但一般都是测完之后才会说这是谁的结果。
程曼祺
在你们现在测的过程中,有没有谁甩开其他人一个身位,有明显更好的模型?
高阳
现在看,肯定是 Spirit V1.5 比较亮眼。
我可以补充一些背景。首先,RoboChallenge 参与的单位并不是以 organization 的形式参与。大家能看到的公开信息,都是一条条测试记录。测试记录里的模型名字,也是用户自己上传的。
我们唯一要求的是,用户要把自己的自然人姓名写上去,作为标识。所以这个平台本身并没有商业属性,不是公司和公司之间直接比较。
程曼祺
所以在这个平台里,对组织来说可以是匿名的。
高阳
Exactly。往往是先有了成绩,之后才有人认领,说这个其实是我的。
我们做 RoboChallenge 的初心,也是不想让这件事夹杂太多商业化的东西,而是想做一个干净的 benchmark。就像当年的 ImageNet,以及其他经典 benchmark,大家都可以有成绩,取成绩也不需要付出太多代价。
万一测得不好,也不会驳谁的面子。这就是我们做这件事的初衷。
程曼祺
目前由公司认领的、表现最好的,就是千寻的 Spirit V1.5,对吗?
高阳
对。RoboChallenge 运营到现在,我今天听 Liya 说,已经有 1 万多次不同的测试 run 了。
程曼祺
1 万多次来自多少个不同模型,你们统计过吗?
高阳
这很难统计。因为大家经常自己给模型起名字,有时候也不是特别规律。
但这个数字很震撼。不光是国内在测,我们最远还收到过来自英国伦敦的 IP。信号穿过整个地球,来到我们的 lab 去指挥机器人,那个任务竟然还能动起来。
说实话,这个过程还是挺 rewarding 的。
程曼祺
你们获得 1 万多条记录用了多长时间?
高阳
我记得是 10 月的时候 announce 了 RoboChallenge,后面其实也就运营了 1、2 个月。
程曼祺
这是超出预期,还是在预期之内?
高阳
远超预期。现在 RoboChallenge 最大的压力,是我们测不过来了。
机器一共就那么几台,大家提交之后,经常要等 1、2 天才能得到反馈。现在有很多团队,除了公司之外,还有很多想发 paper 的人,也想拿一个成绩。
提交的人已经很多了。这个 popularity 远超出我们的预期。早知如此,我们肯定会多准备一些机器,不会只用这么几台。
程曼祺
你们现在一共有多少台机器?
高阳
我记得当时大概是 9 台,差不多这个规模。9 台包括 4 种不同类型,有双臂的,也有协作机器人。
范浩强
有双臂的一种,剩下主要是单臂的,我们准备了 3 种。
程曼祺
这说明整个具身智能研发社区确实非常需要这个东西。
高阳
我觉得是。而且好处在于,更多人敢来测试了,说明大家的模型水平确实已经提上来了。
程曼祺
展开说一下,你们的 30 个任务是怎么挑选的?你们这个任务集叫 Table 30,比较直观地理解,肯定是和桌面操作相关的任务。如果再进一步分类,具体是怎样的?为什么挑选这些任务?
范浩强
6. Table 30 放大模型差异
这个任务集其实是内部孵化出来的。我们想做测试的时候,大家说先找一些任务测一测。当时有一位研究员画了 30 个勾,大家在测试过程中发现,这 30 个任务确实很有道理。
有些任务考验你操作柔性物体,有些考验定位精度,还有些考验上下文记忆。我们是事后分析了一下这些任务的考点、对应场景和机型分布,最后发现其实还蛮合理的。
程曼祺
你可以讲讲事后分析的逻辑吗?比如总结下来,它可能是哪几类?
范浩强
我觉得主要是考点丰富。30 个任务几乎每个都有一点自己的难点,而且彼此很不一样。
比如有个很难的任务叫碎纸,考验你能不能把纸插进碎纸机的缝里。插的过程中,纸会遮挡你手上的视觉,所以模型想把这个任务做出来,必须有办法克服这一点。
再比如插花,不光考验你对自己手的定位,还要看你拿起花柄后是不是触碰到了另外一个物体。它的考点不只是执行器和物体之间的 interaction,还扩展到了物体与物体之间的 interaction。
我觉得 Table 30 最有意思的地方,就是每个 task 几乎都能找出与众不同的难点,最终形成了一个非常 diverse 的分布。
程曼祺
这可能也是它能把模型区分度测出来的一个重要 factor。虽然这些任务当时是比较 ad hoc 地选择的,但它很丰富。
不像第一个任务测拿杯子,第二个任务测拿皮球,那样考点可能很单一。
这些任务的 source 是怎么来的?
范浩强
当时我们在公司里组织了一帮人,大家都去想:你觉得接下来机器人一定能做成什么?
我们列了一个特别长的清单,可能有几千条,有点像愿望清单。后来数据采集团队再一个个去看,哪些能采,哪些不能采。
所以任务集的基底就是从这里采样出来的。我们事后总结,人民群众的真实需求,其实就是最有代表性、最高质量的 benchmark。这是回头看它成因时,我觉得比较重要的一点。
程曼祺
千寻在测试过程中,觉得什么任务比较难?有什么印象比较深的?
高阳
我们测试的时候,是用一个基模统一做微调。我们并没有特别关注任务本身的特性,因为我们做的是一个基础模型。
基础模型的意义就在于,无论想做什么,都希望有一个标准化流程,通过这个流程就能做这些事情。
程曼祺
那在 30 个不同任务里,哪些成功率相对高,哪些相对低?
高阳
一些比较精细的任务,成功率的确比较低。比如把一个杯子放到某个洞里,容差可能只有几毫米,这种任务确实比较难。
还有擦桌子的任务。把桌子擦好并不难,但最后要把已经皱掉的餐巾纸放回纸篓里,需要的功夫就比较深。
这些任务目前可能对任何一个最好的模型来说,都仍然很有挑战性。
程曼祺
你们这边有很多测试记录。从大面的数据来看,什么任务成功率高,什么任务成功率低?
范浩强
我觉得它们击中了现在模型的一些盲区。
比如柔性物体很难建模,而且采集 demonstration data 的时候,也很难把所有 case 都涵盖住。
另外有个任务叫扫二维码。左边拿起一个东西,右边拿起扫码枪扫一下,再放下去。这个任务看起来动作很简单,但它难在哪里?
扫描之前和扫描之后,图像上的状态是一样的。模型分不清自己刚才到底扫没扫,所以很多模型测试时一上手就不动了。它不知道应该再扫一次,还是其实已经扫完了。
程曼祺
它不知道应该把扫码枪拿开,还是继续扫。
范浩强
对。因为扫完之后,那两个东西本身并没有变化,所以从图像上区分不出来。
程曼祺
你们这个任务很刁钻。
范浩强
是的。我们之前也从来没想过这个场景。这个任务其实是拍脑袋想出来的,真正做了之后才发现,原来它的难点在这里。
程曼祺
如果要让机器人知道自己是不是已经扫完了二维码,需要什么能力?
高阳
需要模型有记忆能力。模型不仅要看到当前场景、知道要做什么,还要记住自己之前做了什么。
程曼祺
那它怎么理解扫二维码这个任务?
高阳
扫描这个动作本身并不难。难点是,同样看到这个场景,我可能以为自己已经扫完了,那就应该停下来;也可能以为还没扫,于是开始继续扫描。
现在的模型大多是单帧输入,给它几张图片,它就开始动。它没有一个机制,把“我是不是已经扫过”这个上下文放进去。
你可以想象一下,如果你每 100 毫秒就失忆一次,会是什么感觉。大家常说金鱼 7 秒就忘记,但模型现在是每一帧就忘一次,每 0.7 秒就忘一次。
现在所有 VLA 基本都是这样的。
当然,也有一些 fix。比如有些工作会把记忆放进去,修复这个问题。但现在大多数开源 VLA 或基础模型,都是基于单帧的,没有记忆。
高阳
把记忆放进去,也不是直接放在模型里面。它不是训练在模型里的,而是通过一些工程化方式,让模型记住更多帧,知道之前发生了什么。
范浩强
对,也有一些方法用 agent 的方式,去记住之前发生过什么。
我觉得这个任务非常巧妙。Table 30 有意思的地方,就是每个任务都有独特的一面。这是整个过程中最好玩的地方。
程曼祺
在两个多月的测试过程中,你们有没有看到整个行业进步的趋势或者速度?
范浩强
我觉得还是挺快的。
刚发布 Table 30 的时候,我们最担心的是没人来玩。那时候很多人看 π0,觉得它像天外来物一样,觉得太厉害了,不知道应该怎么做。
但接触下来,我们感觉很多公司至少已经掌握了 π0 这一档模型的技术。毕竟大家现在已经在挑战 π0.5,甚至将来挑战 π0.6,趋势还是很明显的。
从动作上看,越来越多机构和个人愿意来榜单提交。大家教模型,都是为了教出一个好成绩,这说明大家的自信心增长得非常明显。
程曼祺
除了大家主动提交之外,你们会特意邀请一些比较好奇、或者觉得比较强的公司来测吗?比如我就很好奇,π0.6 如果来测会是什么表现。
范浩强
这个不一定请得来。
程曼祺
你们 1 万条记录里应该也有美国的 IP。个人或者纯学术参与还好,但一旦是公司对公司,尤其是比较敏感的行业,我觉得顾虑可能会多一些。
高阳
对。但最早放榜单的时候,我们没有跟别人说这件事,所以平台上一个别人贡献的结果都没有。
为了启动它,我们当时去找 volunteer。反正现在大家的模型都是开源的,我们总能找到人下载 code base,跑一跑,测出一个分数。
最早那一批结果,我记得大概有 6 个,都是这么来的。后来才有很多公司说,你们测我不放心,那由我来做 fine-tune,再去 evaluate 成绩。这是后面才发生的事情。
程曼祺
所以现在大家来测的时候,微调部分不是测试社区或平台统一做的,而是每个人自己做。
高阳
当然。这个就是设计的 purpose。
我们当时也考虑过,测试方到底应该提交一个模型文件、一个 Docker,还是其他东西。最后我们选择把这些都 leave out,只提供一个进行控制的 API。
理论上,参与者可以用任何计算架构、任何控制逻辑去跑程序。我们希望做一个尽可能通用的设计。
在这种情况下,假设由我们来做微调,微调其实有很多手艺问题。大家使用的参数不一样,甚至换一块显卡,结果可能都不一样,这里面有太多说不清楚的地方。
所以 RoboChallenge 从一开始的设计,就是平台只保留最核心的功能,大部分事情留给测试参与者,让他完全自己掌控整个过程。
程曼祺
但如果大家自己来微调,你们怎么知道他到底喂了多少 episodes?
高阳
7. 开放代码维护榜单可信度
所以我们现在号召所有上榜的人都做 open source。
哪怕你是通过遥操作做出来的,理论上也可以把这个测试结果提交上去。除了道德约束之外,我们觉得最好的方法是自证清白。
如果你有一个成绩,就把当时取得这个成绩的模型和 code 放出来。理论上其他人可以再提交一遍你的东西。
因为误差问题,结果不一定百分之百重合,但至少大的趋势应该是一致的。用这种方式,至少能够解决所谓可信度的问题。
程曼祺
所以现在更多是靠大家的自律?
高阳
是的。我们还是相信绝大多数参与者是为了学术目的,也希望把这件事做得技术严谨。
如果真的有人作弊,他也交不出将来可以开源的东西。我觉得随着时间演进,大家最终还是会理清楚哪些结果是真正可靠的。
程曼祺
你们这个测评平台接下来有什么新的计划吗?我看你之前在推特上发过,有人给你们捐了灵巧手。接下来可能也会上线和灵巧手硬件相关的测评?
高阳
当然。现在 RoboChallenge 已经远远不是原力灵机一家在做了,它其实是一个 partnership 和 community。现在大概已经有十多家公司加入进来。
程曼祺
主要是中国公司吗?
高阳
Hugging Face 是国际公司。还有一些做本体的厂商,想捐一台机器人进来;有些公司有自己的数据采集厂和实验室,也想捐一套 benchmark。
也就是说,你们可以提交到我这里来,测我那些任务。
我们希望所有人都能把自己的 contribution 放进来。这样整个 program 的内容就会越来越丰富,不只是现在的 Table 30,将来可能还有 Kitchen 多少、Restaurant 多少。
这样才能对各种模型有更好的评测。
程曼祺
厨房里的任务、餐厅里的任务。
高阳
对。有一家公司,我记得叫 Tesollo,他们的手也是开源的。他们说也想加入进来,设计一些相关任务,将来做成 benchmark。我们非常欢迎这个 idea。
当然,毕竟时间紧、任务重,这些 feature 只能排队逐个上线。
程曼祺
从测评延展开来聊一下现在模型的状态,以及你们看到的接下来具身智能在 2026 年怎么往前推进。
刚才你们讲的目前的测试现状,比如把一个杯子放到一个洞里,或者把餐巾纸放到纸篓里,对人,甚至对很小的小孩来说,都是很简单的任务。
如果具身模型要继续往下走,目前面临的瓶颈可能是什么?大家又是怎么解决的?
高阳
8. 数据成为最大瓶颈
我觉得现在具身模型面临的瓶颈,主要还是数据层面。
如果数据层面有像大语言模型那样无穷多的数据,具身模型要解决的问题,我觉得并不是很难。因为大语言模型已经给我们摸出了一条很清晰的道路,我们沿着这条道路去做,大概率可以做出非常好的模型。
所以我觉得在 2026 年和未来一年,我们会看到具身模型有非常大的进步。
程曼祺
你说大语言模型指出的这条路,具体是什么?
高阳
大语言模型这条路线其实有一个三部曲。
第一步,用互联网上所有的文本数据给模型做预训练。第二步,用高质量数据给模型做监督微调。最后用 RL,也就是强化学习,给模型做 RLHF,让它在最终任务上的成功率提升。
现在基本上所有大语言模型都沿着这套三部曲在做。我觉得对机器人来说也是一样的。
程曼祺
在你描述的方法里,模型架构不一定非得是现在大家说得最多的 VLA,也可能是其他模型。但核心是这样一个从预训练到后训练的流程。
高阳
VLA 只是在描述模型的输入和输出。它也可能是 VLTA,T 代表 tactile,也就是触觉。
它也可能是别的架构,但总之是一个能够做事情的模型。VLA 并不代表一定要先有一个大语言模型,再得到 VLM,最后得到 VLA。
现在也有人觉得,视频生成模型可能是更好的基座。具体问题至今仍然是开放的,具体做法是开放的。
程曼祺
那你们两家公司的路线是怎样的?
高阳
我们还是通过 VLM 开始,先以一个 VLM 作为底座。
后面会加入一些视频数据,但不是以 world model 的形式加入。我们还会加入遥操作、可穿戴设备等数据进行微调,最后可选地做强化学习。
我觉得这个学习原理其实已经比较收敛了:用 VLM 吸收尽可能多的互联网知识和不变性,再加入大量 robot data,让它建立起从动作到感知之间的映射,最后在发布之前做一些后训练的工艺。
这个框架已经比较固定了,只是过程中到底拿什么积木、加什么数据、按照什么比例,还是仁者见仁、智者见智。
范浩强
我也同意高老师讲的。大的范式或者原理一旦收敛,你就会对这件事特别有信心。
现在 scaling data 可能是 2026 年最重要的一个主题。数据多了之后,泛化性和鲁棒性才能一点点体现出来。
程曼祺
那你们都是怎么获得数据的?你们看到业界规模化获取数据,主要有哪些做法?什么做法可能比较合适?
高阳
数据大概有 4 种:仿真数据、人类视频数据、可穿戴设备数据和遥操作数据。
我们自己除了仿真之外,其他数据源都会做,包括人类视频、可穿戴和遥操作。每种数据源都有自己的特性:有的量很大,但质量比较低,适合做预训练;有的量很少,但质量很高,适合做后训练。
我们会把所有这些真实世界的数据拿过来,用合适的算法喂给模型。
程曼祺
为什么你们没有把仿真数据也放进去?
高阳
这只是我们自己的经验,不一定正确。行业里还有很多公司在尝试用仿真数据。
我们的尝试是,仿真数据的 diversity,也就是多样性,很难提升到很高。每一个仿真场景,都需要艺术家,也就是 artist,在仿真器里把场景搭出来。
搭建过程比较慢,仿真器也没有那么好用,而且这是一个专业化过程。不太可能让一个只做过体力劳动的人去搭建仿真器,但你可以让他帮忙采集遥操作数据、可穿戴设备数据和视频数据。
程曼祺
所以这里面有一个成本考量?
高阳
对。随着仿真器变得更好,仿真数据未来可能也会是我们考虑的方向。
范浩强
如果仿真器变得更好,随手一做就能做出《黑神话:悟空》那样的场景,那仿真数据当然很香。
程曼祺
你们关注李飞飞的 World Labs 以及他们发布的 Marble 模型吗?
高阳
这个 specific 模型我不知道自己有没有仔细看过,但确实看过他们的一些 demo。
他们的 demo 目前都是静态场景的 3D 巡游效果。背后的技术是 4D Gaussian,或者说 3D Gaussian。
但这种技术暂时还没有办法处理动态场景,所以暂时不能直接用在具身智能里。它可能会更早应用在游戏,或者和 3D 视觉更相关的场景。
程曼祺
你们在数据规模化获得这件事上的时间表是怎样的?
范浩强
我个人觉得路线可能没有那么重要,条条大路通罗马。
如果做仿真,就天天想怎么做 3D asset,怎么大规模扫描资产,再想办法弥补 sim-to-real gap。如果做真机,就不断研究怎么用一大批操作员,把数据采集工业化、降本。
我相信最终都能走到终点,而且最后的卡点和难点可能是一样的。比如 3D 资产看起来无穷无尽,但里面的知识还是来自对物理世界本身的获取。
所以无论做仿真还是做采集,最后可能都会变成同一个问题:怎么建立一个集合,枚举日常生活中大家能接触到的所有商品。
我相信最终的本质难点是一样的。
从我们公司角度讲,我们选择了自己最擅长的方向。当年做人脸数据采集时,我们建立了一套非常完善的线下大规模采集体系,所以现在数据还是以真机为主。
其他方向,比如 Generalist AI 做离体式采集,号称已经采集了 27 万小时数据,可能也挺 promising。
如果这些东西能成熟,对用户来说并不会改变数据采集的逻辑。最终还是要回答:那些场景从哪里来,那些人从哪里来?我觉得这是数据收集里最核心的难点。
程曼祺
你刚才说 Generalist AI 的离体式采集,是什么意思?
范浩强
Generalist AI 是一家美国公司。他们主打的是人拿着一个夹子采集,而不是机器人拿着夹子采集。
这样采集效率很高,也可以把设备寄出去做采集。他们当时说了一个很惊人的数字,已经采集了 27 万小时,而且每周能采集 1 万小时。
如果这个数字是准确的,那到 2026 年结束时,他们可能会积累不到 100 万小时的数据。
现在也有公司在做可穿戴采集,比如在头上绑一个相机去采集。我听说有公司甚至说今年要采集 1,000 万小时。
所以我才说条条大路通罗马。最终可能还是总的知识量到了。无论 data 的 representation 是什么,可能都能走通。
真正决定性的因素,反而是你花了多大精力去收集这个世界里的 knowledge。
程曼祺
不过具身领域和之前做大语言模型、视觉有一个不一样的地方。大语言模型和视觉模型的数据,每个人都可以 touch 到。
每个参与其中的创业公司,至少可以在网上找到大量公开信息,后面再去做一些比较特别的数据。现在具身领域是不是每家公司采的数据都还是自己使用?有什么机制能让这些数据更好地普惠整个行业吗?
高阳
Open X-Embodiment 就是业内的数据共享联盟。现在这种形式已经有不少了。
它是一个学术数据集,数据本来就是公开的。这个项目相当于把这些数据整理起来。
但公司层面,我暂时还没有看到特别大规模的数据共享。
范浩强
以前互联网数据对创业公司来说好像是免费的,但后来也出现了版权纠纷。
不过现在大家的具身数据确实是每家公司花钱采集的。认为互联网数据可以直接拿来用,其实是一个 fairy tale。
互联网数据也不是直接喂进模型的。实际上里面有大量优秀工程师做清洗,最后才训练出那么好的模型。这里面都是真实的人类劳动,恰恰是这些人类劳动造就了现在模型的伟大。
程曼祺
所以那些数据也不是直接使用,只是互联网数据省去了采集这一步。
范浩强
对。YouTube 上可能有非常大量的视频数据,大家也可以直接利用。
但具身智能可能还是要先解决一些数据规模化之前的前置问题,之后才能踏上快车往后走。
程曼祺
那 scaling data 的前置问题有哪些?
范浩强
开个玩笑,至少 Table 30 得做到百分之九十吧。做到这一步,才知道我们的算法没有 major parts 的缺失,对吧?
我觉得沿着现在 scale 数据的路线,Table 30 做到百分之九十可能很快就会实现。
我自己不觉得有什么特别大的瓶颈。可能只是需要开发算法,让它能够处理这么多数据;需要研究学习算法应该怎样调教、怎样改变;还包括真实世界的数据采集,应该以什么样的社会分工来实施。
这些问题需要解决,但并不是不可解。我觉得它们是可解的。即使一开始解决得没有那么好,也可以产生很大的效果。
程曼祺
接下来是行业里比较共识性的命题。除了怎么大规模获取数据之外,还有什么?
范浩强
落地应用方向。
基础模型能力决定了你能做什么,而你能做这些事情之后,还会有商业逻辑去决定要不要做。
但我觉得现在的主要瓶颈,还是基础模型能力没有特别强。落地应用当然可以做,但基础模型进步是更加紧要的事情。
程曼祺
我们可以想想 LM 都落地了什么场景。据说有人统计,一半流量是用来做 AI 编程,剩下的比如替代搜索引擎、做问答。
范浩强
但实际上,哪怕它已经表现得像 AGI,真正能够普惠的人群,以及替代生活中环节的数量,也没有大家想象得那么多。
高阳
9. 具身应用仍待爆发
我有一个不同观点。我觉得这是一个正在孕育变化的过程。
程曼祺
过程中?
高阳
对。它其实已经很厉害了,但大家需要一些时间,把这种能力真正转化成手机里的助手。
比如我不用打开外卖软件点餐,直接告诉它我想吃什么,它就能帮我完成。刚才说应用,是因为 coding 确实把整个 LM 社区往前推了一大截,Agentic 又把它往前推了一大截。
最终你会发现,能够推动技术往前走的,是对一种非常具象化的应用方式的想象和思考。
程曼祺
那你说现在机器人除了叠衣服之外还能干什么?机器人时代里的 coding 是什么?我觉得这可能是一个很核心的问题。
高阳
这个问题对 LM 来说很简单,是因为 LM 已经真的无所不能了。Coding 又是一个非常消耗人类智力、单位价值很高的事情。
但机器人不一样。如果机器人已经无所不能,那我可以让它把房间收拾一下,我会很开心;让它下楼拿快递、拿外卖,也有很多事情可以做。
但它现在还没有那么厉害。它的规模又非常大,同时很高价值的场景好像还比较难想到。
程曼祺
一旦出现了这种场景,原来那些工业六轴加上一套算法,其实已经在做了,它的 baseline 其实很高。
高阳
对。以前的传统机械臂,已经占据了一些这样的场景,比如汽车装配厂里的组装工作。
另一个原因是,我们在中国,人力比较充沛,所以可能很难想象一个“真的很贵”的场景,觉得一定要机器人来做。
但在更多海外市场,人力相对没有那么充裕,很多事情都需要大家付很多钱去做。欧美的服务也很贵,比如理发,或者找人收拾房间。
它确实比 coding 更难一点,因为每一个细分服务都比较分散。
但编程大概就是几大类,前端可能已经能覆盖很广的人群和场景。比如我可以让它做一个网页。
所以机器人相对于大模型,可能是更加分散的一种行业形态。最后行业里可能会出现很多垂类公司:有的机器人做家政,有的机器人帮你修屋顶,会有很多不同的 subcategory。
范浩强
我刚创业的时候,一直在说服自己,具身智能一定会有一个时刻到来。
当时我想的是,如果机器人能把我家的被子叠好,为什么这件事对我很重要?因为我想了半天,扫地机器人的厂家和家电厂商肯定不觉得这件事应该由他们来做。
同时这个任务有用,也没有那么 trivial。所以我当时想,如果算法和机器人本体的负载、智能,能够做到每天早上我起床之后不用管,被子自己就叠好了;晚上回来的时候,被子还是叠好的,那我心情会非常舒畅。
而且我坚信,原来那套检测、分割技术肯定做不出来这个事情。如果哪天这个产品诞生了,我会非常信服,觉得具身智能这件事肯定能成。
当然此时此刻还没见到。所以像家政,或者所谓通用的简单操作,可能是第一个大的方向。
程曼祺
现在很多公司也都在瞄准这些问题。虽然还没有到能在你家叠被子的状态,但有没有什么业界进展,让你看到这个事情的信号?
范浩强
至少 π0.6 能在工厂里把纸盒叠得挺好。
程曼祺
π0.6 可以叠纸盒,对吧?我看美国有些公司,比如 三德 Robotics 的展示里,可以把袜子团起来。dello 主攻的方向是叠毛巾、叠衣服这类柔软物体。
把袜子团起来看似简单,但你能再把它抠开吗?能不能把里面翻出来?
范浩强
这些事情考验的可能不只是算法,而是硬件本身的精细度和负载能力。
为什么说被子?因为被子很沉。机器人本体能不能把它拎起来而自己不倒?说实话,这对硬件可能都是很大的挑战。
程曼祺
你的这个私藏任务很有意思。什么时候你们的 RoboChallenge 里也能把叠被子加进去?
范浩强
我觉得这可能是一个比较具象化的想象方向。
当然,大家最终是不是都去做家务类任务,还不一定。现在家务类在学界确实最火,因为任务很好布置,精度要求也没那么高,还很考验智能,所以大家都喜欢讲这个。
但我相信最终商业化落地时,肯定还是会非常细分。
高阳
不过也许大家会有一个共识:从不可做变成可做的 moment 出现时,可能会有一个时刻,真的出现几个像 ChatGPT 一样震撼心灵的 demo。
它完成一个任务之后,虽然没有做其他任务,但你相信很多别的任务它也都能做。更重要的是,客户相信了。
需求和商业机会就能正向流转起来。我觉得这可能就是具身智能的破圈之日。
这个破圈不只是破圈到公众和投资人,更重要的是客户相信了。真正的应用爆发,可能就从那时开始。
程曼祺
你们觉得这个破圈之日什么时候可能出现?高老师,这个时间已经比较好预估了吗,还是仍然很不确定?
高阳
还有一定不确定性,但我自己比较乐观。
破圈是一个非常重大的事情。GPT-3.5 其实还不算真正破圈,GPT-4 才是真的破圈。大概从 3.5 到 4 这个阶段,我判断可能会在 3 到 4 年左右。
程曼祺
3 到 4 年左右?这个时间比我想的稍微长一点。如果 2027 年能出现奇迹,那当然最好。
高阳
我觉得 3 到 4 年,是让普通人看到这件事。但让从业者看到,应该会快很多。
有一些 early sign 对普通人来说没有那么 impressive,但从业者看到一个模型,可能会发现它虽然后对齐没有做好,不太遵守你的指令,但做什么都很流畅,只是有时候你告诉它做一件事,它不听你的。
从业者就会知道,这个东西马上要来了,只需要做一些后训练,就能把事情完成。
程曼祺
如果类比大语言模型的发展,它现在可能处于什么时间点?
高阳
我觉得大概是 GPT-2 左右。小强,你觉得呢?
范浩强
我觉得差不多。我最喜欢的类比是,现在处于视觉领域 CIFAR-10 的时期,ImageNet 还没有出现。
但从年份上看,其实已经不远了。历史是一波一波 echo,而且 echo 的频率越来越快,感觉正在进入加速进化的前夜。
程曼祺
CIFAR-10 和 ImageNet 的区别是什么?
范浩强
CIFAR-10 经典的就是 10 个类别,图片也很小,32×32。你很明显知道这是一个 toy example。
到了 ImageNet,类别非常多,有 1,000 类,而且图片都是全分辨率的。你会觉得这个模型真的能做,真的能干活了。
所以在识别任务上,ImageNet 比 CIFAR-10 更接近真实世界中大家要识别的东西。
高阳
我觉得现在也有点像阿波罗计划那个时期。很多公司都在做开源的东西,后来逐渐收敛到服务客户。
现在可能刚刚走出实验室,但距离走进客户还有一段距离。
程曼祺
具身智能这个行业比较特别的一点是,从业者和非从业者有时认知差别非常大。
大语言模型很多人可以直接接触,但具身智能对很多人来说没有直接接触的途径。同时大家又传播很多视频,在展会上也有大量现场演示,所以公众认知可能会领先或落后很久。
范浩强
我们有一个开玩笑的说法:搭上 LLM 快车的最好方法,是 GPT-2 的论文发出来之后重仓英伟达。
从业者中有很多人能看到最早期的信号,但这也会产生一个时刻:从业者需要向公众证明自己。
我们已经看到,具身智能这条路其实很清晰了。但观众除非看到机器人真的在那里到处叠被子,否则不会相信。
所以这里面必然存在一个时间差。
高阳
现在有些人认为这件事已经很强了,因为大家都拍了很多 demo。
这也和 demo 的展示方式有关。普通公众很难理解一个 demo 的边界在哪里。比如看到一个机器人叠衣服,肯定会觉得既然叠衣服都能叠了,那团个袜子、把衣服放进柜子应该更简单。
但实际并不是这样。
程曼祺
你们最近这一两年遇到的,比较常见的对你们所做事情的误解是什么?
范浩强
感觉是完全两极分化。
一些人觉得你们都是做视频剪辑的公司;另一些人觉得机器人不是早就实现了吗?当年日本做的那些仿生机器人,不也能蹦、能跳吗?
对于一个特定的 demo,大家还会觉得,既然你们能叠衣服,是不是马上就要进入家庭了。
大家看到的不只是技术展示,还会直接把它联想到应用落地。我们最初做这个东西,是想看看技术到底怎么样,推动技术发展,demo 只是阶段性成果。
但公众往往会把技术展示直接联想到应用落地,觉得马上就可以进家里叠衣服了。
这中间其实还有一定距离。大家的反应也很两极化:看到 demo,就觉得美好愿景马上实现;听到一点负面新闻,又觉得这都是假的、不能信。
我觉得只有从业者才能看到从 0 到 1 的中间态。
程曼祺
行业里有没有什么大家心照不宣、但不太会公开讨论的事情?
范浩强
10. Demo 工程暴露真实边界
Demo 工程肯定是一个公开的秘密。
程曼祺
Demo 工程是指什么?
范浩强
比如在微信公众号或者其他地方,放出一段机器人做得很厉害的视频。背后到底对应了多少实际上的实现方式,这件事算是一个公开的秘密。
很多视频里,一个机器人看起来很厉害,又爬到那里做了一个动作。但如果真的去看,就会发现每个东西的位置都不能变。
程曼祺
我最早看 Figure 的那些视频时,也觉得机器人已经实现了。
范浩强
我其实不太清楚它的泛化性到底怎么样。但不特指 Figure,很多 demo 都是这样。
就像高老师刚才讲的,你不停去找一个恰好成功的区域。比如杯子刚好摆在这里时,算法成功了,那录 demo 的时候,就把这一段录下来。
一件事做 100 遍,把其中成功的那一次拿出来给大家看。
程曼祺
有没有比较简单的方法,分辨什么视频或 demo 相对真实,什么可能做了比较多 demo 工程?
高阳
我还真思考过这个问题。现在主要有 4 种风险:第一是 cherry-pick,第二是视频剪辑,第三是遥操作,第四是 AIGC。
AIGC 我觉得应该能够分辨出来。最好的方法,还是带着大家站在机器人面前现场看,这是唯一的办法。
程曼祺
所以 RoboChallenge 社区里也在讨论,有没有线上的方法,能够尽可能接近现场观看的体验。
高阳
对。作为一个学术问题,这的确很难,现在可能还没有特别好的方案。
程曼祺
作为测评社区,你们可以在测试场地放摄像头,通过远程监控观看,这样是不是会更接近现场?如果能和 demo 交互,就更好了。
高阳
对。如果能和 demo 交互,会更好。
程曼祺
但怎么防止它是剪辑的呢?
高阳
这里面有很多 evaluation 本身的 open question 需要解决。
现在很多 demo 为了防止后期剪辑和加速,会放一个 iPad 时钟。最近学术界也有一些 program,要求 demo 每次都放一个随机的哈希值,证明视频是唯一的,不是 cherry-pick。
比如每个人只能申领一次哈希值,拍完之后必须把带有这个哈希值的视频传上去展示。
这些东西还可以和区块链结合。展开来说,这本身就是一个挺好玩的学术课题。
高阳
但它肯定还是一个没有被解决的问题。至少从技术上看,我觉得它很有意思。
很多东西都需要思考,怎么在物理上给它做一个标记。这和大语言模型的测评很不一样。
程曼祺
大语言模型也有 hack 数据集或 benchmark 的方式。具身领域据你们所知,有哪些 hack 的方法?
比如 Table 30 发布之后,我可以怎么针对性优化?你们又怎么反制?
范浩强
最简单的攻击方法,就是同一个模型、同一个任务交 100 次,取最好成绩。
首先规则上我们取最后一次,所以数学上已经把这种方式砍掉了。其次,我们也没有那么多产能供你反复提交。
所以这里也需要行业自律来约束。
高阳
除此之外,现在能防的其实很多。大部分所谓作弊手法,都要求你能够控制 environment。
但 RoboChallenge 是在线测评,你接触不到测试环境。你顶多是在背后不是用模型,而是让一个人去操作。
程曼祺
这可能是目前最大的潜在攻击方法。
高阳
对。一涉及真实世界就很有意思,可能想 hack 的话,只能做社会工程学了。
范浩强
来我们这里应聘测试员。
程曼祺
你说到这个,我想起以前去一些工厂或者制造业企业的大客户那里做 POC 验证。以前有创始人跟我说,一定要把测试体系里从上到下的人都打点好,不要让他们来害你。
因为 POC 可能同时在测很多家公司。现在可能更重要的是把那条机械臂照顾好,别测到一半卡住,也别测到一半挂掉。
你们毕竟是一家商业公司,做这件事肯定也会有人力投入,买设备、换设备也需要经费。你们长期是怎么考虑的?
范浩强
对外提供测评服务,相对于我们内部提供测评服务,其实只是一个 fraction。
因为我们内部本来就有大量评估模型的需求,所以这不是很大的额外成本。目前至少还在可负担范围内。
当然,有更多公司一起来做、一起分担,肯定是更好的。
程曼祺
最后想请两位分享一下,接下来一年,也就是 2026 年,你们最想验证的一个悬念是什么?
范浩强
11. 具身智能等待 DeepSeek 时刻
我特别想知道,具身智能的 DeepSeek moment 能不能到来。
程曼祺
你说的是中国超越美国?
范浩强
对。以前看很多国外的工作,心里只能剩下羡慕。我想看看,国内外追上的时间点,能不能在 2026 年最终被我们见证到。
当年做视觉的时候,看 Google 的工作也真的像天外来物。但做了几年之后慢慢发现,其实也能追上。
程曼祺
你们从看 Google 的东西觉得像天外来物,到后来追上,大概花了多久?
范浩强
其实没多久。比如 Google 最早做那种用几千台服务器生成一张猫脸的工作,后来人脸识别做到 human performance,是国内国外一起完成的。
我感觉也就 3 年。而且现在的节奏可能更快。
现在大家做实验的代码都是 Codex、Cursor 写的,生产力比当年高多了。
高阳
我对中美之间的叙事没有那么关注。2026 年我最期待的,还是具身基础模型到底能不能达到 GPT-3,甚至 GPT-3.5。
我对这件事非常期待。而且今天的我非常有信心。当然,可能再做几个月会更有信心,也可能就没有信心了。
程曼祺
从你开始做机器人,包括创业到现在,你的自信一直比较高,还是中间有过波动?如果有波动,当时发生了什么?
高阳
我觉得是越来越高。
程曼祺
越来越高?
高阳
对。因为很多东西看得越来越清楚了,最开始困扰我的一些疑惑变得越来越少,也越来越确定,所以我觉得是越来越自信了。
程曼祺
今天非常感谢两位做客《晚点聊》,分享了从 RoboChallenge 开始,行业之前是怎么测评的,以及为什么现在大家在 VLA 之后,非常希望有一个更大规模、能够比较更多模型能力的测评社区和平台。
我们也从这个话题延展到了现在具身模型是什么样的状态。它一方面没有视频里展现的那么厉害,但绝对也不是一些人说的那样,什么都做不出来、全部都是泡沫。
作为从业者,你们每天都能感受到这个领域的进步和进展。
今天的节目就到这里,感谢大家的观看。各位拜拜。
范浩强
拜拜。
本期零点呈现讲一讲做了多期具身智能访谈后的一些总结和观察,大家也可以去听几期晚点聊直接相关的节目,一是上一期访谈踏实创始人陈义伦,还有一百一十二期我们对高阳的专访,以及八十六期对清华叉院许华哲的专访。高阳和许华哲都曾在伯克利贝尔攻读博士。第一个总结是关于具身的大的框架,或者说可以从几个维度去观察,简单来说是数据、模型还有硬件,其中数据和模型是和智能能力直接相关的部分。行业的共识是数据是当前的最大议题,更准确的说是如何规模化且相对低成本的获取大量有效的数据,也就是小强在这期里说的 scaling data 是二零二六年的一个行业主题,以及陈义伦在上期提到的三道观察中的第一道就是数据,而怎么获取数据则是现在行业分歧所在,有些是从视频里来学,也有人侧重真机,真机数据又可以分为比较重的去做。遥操采集,它的质量是最高的,但是很贵,因为你需要造一个机器人或者至少是一个同构的结构才好做遥操。而现在很火的一个方向是 UMI,简单来说就是让工作中的人带着可穿戴设备来采集真实场景里的真实工作数据。Generalist 还有 Sand Robotics 和踏实都有这样的尝试。二六年我们肯定会看到更多团队有类似的工作。在模型架构上,VLA 或者说端到端是当前最主流的方向,但是怎么做 VLA,包括怎么理解 VLA,每个团队也都有不同的想法。比如高阳在这期提到也可以是 VLTA,T 这里是指触觉。小强也提到 VLA 不一定是要像现在最主流做法那样以 LLM 就是大语言模型为基座,它也可以是以视频为基座。硬件则是一个更跨学科的问题,它要实现的目标很多,包括寿命、耐久性、可靠性、精度、负载等等,还有续航,背后需要。能源材料的突破,理论上智能也就是大脑和小脑的部分和硬件的部分是可以解耦分开的,所以在海外也有一些只做大脑和小脑而不做本体的创业公司,但是从研发迭代的速度和落地应用的角度。来说,软硬垂直整合可能会有一些优势。我们看到大量中国公司都是大脑和本体一起做,这样也可以利用国内的供应链的优势。另一个观察视角就是巨声团队的来源,我们访谈过的对象刚好涵盖了几种主要的来源。第一是来自自动驾驶领域,比如陈一伦,他是华为前自动驾驶的首席科学家,类似的还有星海图的创始人高继阳曾在威某和Momenta工作,质检动力的两位创始人贾鹏和王凯都曾在理想工作。二是一直做Robotics学术研究的人,比如高阳、徐华哲。三是来自其他的AI领域,如CV计算机视觉,范浩强就有很强的CV背景。同一个公司里几个主要联创的背景也会有互补,比如在星海图,高继阳有更多的工业界经验,在清华任教的赵航则有更多研究背景。在千寻,高阳的创业合作伙伴,千寻的创始人韩风涛来自洛石,这是一家国产协作机器人公司,韩风涛有很强的工业界经验。这两个视角其实指向了巨声智能一个共通的特点。就是这是一个非常跨学科、跨领域的创业方向。这是聚星智能目前让人感觉比较混乱、难以看清和头大的地方,也是它很有意思的地方。可以想象,这不是一个巨头靠砸资源就能快速取得成效的领域,未来它还会有很多变数,我们可以一起观察,一起见证。本期节目就到这里,欢迎收听。如果你对今天聊的话题有观察、好奇或疑问,欢迎在评论区分享想法,这也会成为我们节目的一部分,让整个讨论更完整。你也可以把我们的节目分享给对这个话题感兴趣的朋友,欢迎推荐更多你想听的主题和嘉宾。你可以从小宇宙、苹果 Podcast 等渠道关注“晚点聊 Late Talk”,也欢迎关注我们的公众号“晚点 Late Post”,下期再见。