“我看到了 Scaling Law 的信号” | 对谈清华叉院助理教授徐梦迪:具身智能、世界模型、真正的泛化
- 徐梦迪称已在具身领域看到 Scaling Law 的早期信号,但强调 loss 不等于成功率。他援引其他公司的结果:预训练数据从十万小时 scale 到一百万小时后,在未见过的测试集上有较好效果;但他用“拿杯子二十步、前十七步可能都没有接触到杯子”的例子说明时序不平衡让 loss 与 success rate 脱钩,他真正想见的是“数据逐渐增多、模型逐渐变大,你在没有见过任务上的 success rate 逐渐升高”。
- 他判断具身当前处于 GPT-1 阶段(预训练+针对 target domain 的 fine-tuning),押注的拐点是 GPT-3 式的 in-context learning 时刻。终局是终端用户用 prompt 和 demo 定义机器人行为——叠衣服可以叠方块、卷起来或只挂不叠;他判断未来三到五年可能通过 scaling 看到一个明确的范式转变或拐点,而这场马拉松目前只“跑到十公里”。
- 路线之争中他明确更相信世界模型,理由是任务难以通过穷举实现 scalable。“任务实在是太多了,你很难通过穷举的方式;但如果能通过世界模型学到这个世界变化的规律,它是更 fundamental 的一种能力。”关注名单:美国的 Physical Intelligence、Google、英伟达、Generalist、Roda(音);国内点名林波新发的 LingBot VLA 2,其 ICL 路线“非常有意义”。
- 对中国具身创业的整体判断:“有非常多实际的进步,但也会存在一些泡沫,两个其实不是互斥的。”材料、sensor、本体、数据、模型全链条都有国内公司攻关、资源持续投入,长远他“非常乐观”;但行业焦点从数据摆到世界模型再摆回数据,他类比控制系统的“超调”震荡——路线远未收敛。
- 具身落地最 risky 的点是数据闭环的鸡生蛋问题。base 模型要好到终端用户教半小时就能看到“显而易见的进展”,数据闭环才转得起来;而模型又需要先进场景被使用才能提升。目前他的团队正在真机双臂加灵巧手的桌面任务上尝试采集人类修正指示、改变机器人行为,目标是全身灵巧操作。
- 数据路线上他自称“融合派”,认为 human data 价值很高。遥操作数据最接近本体、适合 post-training;simulation 干净可控、适合 pre/mid-training;UMI 居中;human data 成本最低可铺满场景——“人确实是一个非常成熟的本体”,morphology 差异可由 transfer 解决,学的本是与形状无关的任务信息。
- 方法论金句贯穿全场。李飞飞先追问 benchmark 指标中“哪个是真正重要的”,徐梦迪的答案是最终 success rate;她又引用爱因斯坦“把事情变得简单不是更简单”。姚期智的建议是“真正重要的问题其实没有几个”;扣姐收尾:“悲观很容易正确,只有乐观才可能成功。”
1. 三十点五岁的助理教授:从车辆工程到具身智能
- 徐梦迪自报“三十点五岁”,INTJ、摩羯,现任清华叉院助理教授,核心方向一句话:“让机器人能够从现实的场景当中不断的持续提升自己。”泛化主线从 CMU 时期延续至今,源头是 Charles Finn(斯坦福教授、Physical Intelligence 创始人之一)的 MAML——“它能够让机器人学到它没有见过的任务”,他当时认定“这是真正机器人未来的一个方向”。
- 转行路径并不常规:清华车辆工程本科,大二跟机械系严少泽做 bio robotics,研究蜜蜂翅膀碰撞后的超弹性恢复;大三暑假进入 Hobby Cho Set(Howie)的组,设计爬管子的蛇形机器人,从机械设计逐步转向算法。
- 他对泛化的拆解贯穿全场:人类泛化强有两层——“人有很多的先验知识”加“人能学知识学的非常的快”,而“真正的泛化其实是希望能够让机器人有类似人的这种快速学习的能力”。
2. 衡水竞赛班:战友而非对手
- 童年细节:河北衡水人,小学靠放学路上捡小垃圾,其中的钢铁零件可以卖钱,用来攒四驱车。扣姐点评这是车辆工程的种子,他认同:一直觉得机械结构“非常的酷”,是“非常多代的工匠知识”凝结成的精密系统。
- 对争议中的衡水模式,他的样本是物理竞赛班:跑操与作息管理和高考班一样严格,但氛围是“更像是大家在一起抱团把这个问题解决”,竞争弱、战友情谊强——“身边的朋友都跟你有同样的愿景……不觉得苦”。竞赛近似创业的破釜沉舟:等到确认可能没有保送机会,才在高三下学期进入正常高考班。
3. CMU 最佳博论:预训练不是全部
- 博士论文《Building Adaptable Generalist Robots》拿下系里当年两人的最佳博士论文奖。核心命题带着精确的两面性:“预训练本身肯定是非常有用的,我也非常相信 scaling 这个事情,但预训练不是全部”——不能寄希望于机器人靠预训练就“百分之百成功”,部署后必须适应具体环境变化。
- 论据是“开放世界”:家里今天二十个物体、一周后三十个且种类不同,人的 preference 也在不断变化——任务本身在变,机器人必须“在这个变化的环境里面去提升它自己”。
4. 两条解题路线:ICL 与只改 0.5% 参数
- 路线一是 2021 年的 Prompt Decision Transformer,直接受 GPT-3 的 in-context learning 启发:“你就不需要在部署的环境当中重新做训练,它是一种更高效快捷的 adaptation 方式”——给模型一段 demonstration,让它 adapt 到不同的 locomotion 和 manipulation 任务。
- 路线二 Hyper Design Transformer 针对 test-time 改参数的“双刃剑”(改多了预训练知识会遗忘):先学一个 hyper network,再生成只占整个 Transformer 约 0.5% 参数的 adapter,只适配这一小块。
- 他的结论倒向前者:小规模预训练下 hyper network 更容易 work,但数据与预训练规模上来后,“真正的 future direction 其实还是 in context learning”——不改参数,或攒够 multi-task 任务后再做 batch 更新。
5. 模型参数应该等价于一个 RL 算法
- 他最推崇的续脉是 DeepMind 的 algorithm distillation:主流 VLA 用 expert demonstration 做模仿学习,等于把模型参数当任务记忆模块;AD 的 claim 是“你模型参数应该等价于一个 RL 的 algorithm”——把 suboptimal 轨迹放进 context window,让模型根据过去不好的动作和历史不断修正 future action,参数里蒸馏出的是自我提升能力本身。
- 局限他讲得直白:AD 在模拟器里做的多是走迷宫、locomotion,manipulation“现在还是相对来说比较难”。同脉工作还有 depark 他们组一篇叫 local former 的文章,把 ICL 式 adaptation 部署到四足机器人;以及英伟达最近发表的 Robot TTT——让机器人看人类长程操作视频、用 TTT 改变行为。
6. 为什么 adaptation 现在才成共识
- 扣姐的追问:这事听起来“自然应该重要”,为什么现在才被讨论?他的答案:此前主流是 scale 数据和模型把 prior 堆起来(对应人类泛化的第一层),大家近来发现机器人“确实无法只通过预训练、只通过 expert demonstration based imitation learning 来解决所有应用问题”,第二层的快速学习才被推上台面。
- 顺序其实合理:adaptation 对基模有硬要求——“我们不希望机器人到了实际场景自己学,但学的过程是非常可怕的,比如可能会把杯子打碎”,所以先做 prior 再做 adaptation,“大家从 foundation model 开始做我觉得也是合理的”。
7. 斯坦福博后三件套:BEHAVIOR、steerable 与创造性工具使用
- 在吴佳俊、李飞飞组做了三个工作。BEHAVIOR benchmark 回答“机器人到底应该解决什么样的任务”,含家庭、学校场景与大量开源 asset;他参与用一个叫 momentum 的方案,通过人工操作生成模拟环境中的数据。该 benchmark 至今持续有人维护、易用性在提高。
- 第二件是让机器人更 steerable——follow 更 diverse 的 language instruction、adapt 到不同人的 preference,与他的主线直接相关。
- 第三件最有画面感:creative tool use benchmark。人用工具靠 function/affordance 而非名字——“想切蛋糕但手边没有刀具,我可以用叉子或筷子”;扫桌子没笤帚可以用书本甚至小臂。团队采集大量一/三视角对齐的人类数据,评测三个维度:多模态大模型选工具与生成轨迹的能力、柔性物体(蛋糕、水等 deformable)的 3D/4D 重建、人的灵巧工具使用能否 transfer 给机器人。
8. 李飞飞的一课:只有 final success rate 真正重要
- 李飞飞 vision driven,逼他跳出单个项目思考“领域未来十年什么是真正重要的问题、你在其中扮演什么角色”。最具体的一次:团队把 benchmark 的 metric 定得很细(进度、成功率、耗时等),她反问哪个真正重要——徐梦迪认为“其实就只有一个,就是你 final success rate”,她又引用爱因斯坦:“把事情变得简单,不是更简单。”
- 他的消化:PhD 到 PI 的跃迁是从盯细节 metric 做 debug,到“让大家关注真正重要的那个点”——扣姐总结为“从解题人变出题人”。吴佳俊则更含蓄,会和他讨论具体设计,并推动他建立自己的 research brand。
- 他对 research brand 的理解反而朴素:“对一个问题研究到了超过三年五年,那本身就已经成了你的一个 research brand”——从兴趣出发才是本质,“跟别人不一样”不是。扣姐类比 Paul Graham《如何成就伟大事业》:知识的球远看平滑,走近全是坑洼黑洞,坑洼处即机会。
9. 回国抉择:自由度压倒算力
- 2023 年博五面临工业界/学术界的十字路口:Google 实习体验很好、“有资源做更大规模的事情”,但“同时也会有一个自由度的缺失”——“我希望我的时间能够被最大化的分配到我觉得重要的问题上面去”,学术界因此是他的 optimal choice。他引 ML 概念自况:“no free lunch——你选了一个决定,就要承担它相对弱的层面。”
- 叉院面试由吴毅牵线。选叉院两个理由:学生极强(“很多做 robotics、AI 的人在美国都会认识姚班毕业生”),且机器人是系统——“单纯只做大脑或者只做硬件,都会在我心里有点欠缺”,叉院能让他把机器人做成真正落地的系统。
10. 姚期智的建议与那个答砸的面试题
- 姚期智的建议让他博后期间持续受益:“真正重要的问题其实没有几个,一个人的时间又是非常有限的,把时间摊开到太多的事情上,结果可能并不太好”——一定要 focus。他自认好奇心多,需要反复提醒自己专注。
- 另一位老师的面试题他自认答砸了:“你为什么觉得五年之后一定能成为自己领域顶尖的 researcher?”当时的答案是纯自信的“我觉得我一定可以”;后来的修正版:“如果我找到了感兴趣的 topic——让机器人真的有一天进入千家万户、在实际环境不断提升自己——沿着这个正确的道路研究五年,我觉得我一定不会差的。”
11. 选环境像游戏通关:能力要能翻倍
- 他拒绝“一帆风顺”的标签,自选的词是“幸运”——每次转型“都不算完全顺利”,靠朋友、老师、mentor 支撑。但幸运有方法论:“一个人成长成什么样子,一部分是自己决定的,一部分是你选择了一个什么样的环境。”
- 选环境的标准出人意料地不是“选最好的”,而是看进去之后“你的能力是不是能够翻倍……就像游戏通关一样”。执行靠信息采集:先找朋友 connect,不行就发邮件,“researcher 里面很多人都是非常热心的”。
- 给 I 人的 cold email 技巧:自己先写初版再让 AI polish;他收到“纯 AI 写的邮件通常不会回复”——诚意的标准是“把你的兴趣点落实到实际的工作上面,这个链路是不是能够走通”,只有兴趣没有落实是常见的坑。
12. 中国具身现状:进步与泡沫不互斥,焦点摆动像“超调”
- 回国一年多的总体判断:“有非常多实际的进步,但是也会存在着一些泡沫,它两个其实不是互斥的东西。”好的一面是全链条——材料、sensor、本体、数据、模型——都有国内公司攻关、资源持续投入,“长远来讲的话,我还是非常乐观的”。
- 泡沫的根源是路线未收敛:焦点从数据摆到世界模型、最近又摆回数据。他借控制论打比方:“就像 PID 参数调的不好了,它就会震荡——超调。”但他强调这不是两条互斥路线,而是两个层面:数据决定模型“能够看到什么东西”,世界模型关乎“你的 representation 是什么,你对世界的理解是什么”。
13. 他的 belief:世界模型,因为任务难以穷举
- 站队讲得明确:“我自己本身也是比较相信世界模型的这个路线”——理由是任务本身难以 scalable:“任务这个事儿是一个非常容易不 scalable 的方式,因为任务实在是太多了,你很难通过穷举的方式。但如果你能够通过世界模型的方式让它学到这个世界变化的一个规律,它其实是更 fundamental 的一种能力。”
- 关注名单按 belief 筛选:美国是 Physical Intelligence、Google、英伟达,初创里点名 Generalist 和 Roda(音)——后者“最近也在做一些 in context learning 的尝试”;国内点赞林波新发的 LingBot VLA 2,“也是沿着 ICL 的路线在做,非常有意义的工作”。
14. Scaling Law 信号已现,但 loss 不等于成功率
- 对标题之问,他的原话有分寸:“我觉得还是看到了一些的,但是不是我们自己的”——其他公司的结果显示,预训练数据从十万小时 scale 到一百万小时后,在 hold out 的未见测试集上有较好效果。但大家现在测的多是 loss,而“机器人里面有一个很 tricky 的点是你的 loss 跟你的成功率不是直接挂钩的”。
- 他的例子值得完整保留:拿一个杯子共二十步,前十七步可能都没有与杯子接触,“即使你这前十七步 fit 的非常的好,如果第十八步真的跟这个杯子有接触的时候误差比较大,这个任务其实就很容易失败”——时序上的不平衡让 loss 与 success rate 大部分时候不直接相关。
- 他真正想见的 scaling law:“数据逐渐增多,模型逐渐变大,你在没有见过任务上面的 success rate 是逐渐升高的。”扣姐确认:目前有信号,但“没有那么的强”——他没有反驳。
15. 具身还在 GPT-1,他要的是 GPT-3 时刻
- 机器人会不会有 GPT moment?“我觉得会有,我还是非常相信 scaling 这个事情。”现状类比:主流具身模型是“预训练+针对 target domain 做 fine-tuning”,对应 GPT-1;他真正希望做到的是 GPT-3 时刻——通过 ICL 和 prompting 给模型任务信息而不需 fine-tuning,扣姐补一句“普通人也可以用起来”。
- 对英伟达金范“具身严格对应语言模型各阶段”的演讲,他“总体上是认可的”,但补两条差异:机器人的安全性要前置,部署前需要类似 stress test,“比 language model 更关键也更急迫”;且机器人有身体,context 更多样。扣姐补上实时性:语言模型等二十分钟“完全 OK”,机器人“一秒钟我都觉得它是不是死机了,我想去拍一拍它”。
- Benchmark 他认为具身比语言更需要:要预先告诉 developer 和用户“能力的边界是在哪里”,包括失败与 risky 情况。开源里推荐 BEHAVIOR——长程任务多、家庭环境丰富;drawback 是会被 criticize 有 sim2real gap,“但从模型能力来讲,eventually simulation 只是一种环境”。
16. 叠衣服的三种叠法:ICL 的终局是终端用户定义机器人
- 最近一两个月最重要的工作仍是 ICL 路线,他用叠衣服讲清楚它 enable 什么:现在很多机器人 demo 都叠成方块,隐含假设“每个人家里的衣服都是叠成方块的”——但他自己用胶囊衣橱要卷起来,有人按颜色摆放,有人只挂不叠。“in context learning 本身想要解决的,就是让这个模型有被终端用户定义的能力。”
- 更深一层是训练学习速度本身:机器人学做一道菜,最初 adapt 要半个小时,类似任务学过一千个之后可能只要十分钟甚至更少——“我们本身在训练的是这个模型快速学习新的任务的能力”,铺到更多家庭和服务场景后“它其实是会学的越来越快的”,这是他相信 ICL 能最终让模型 scale up 的原因。
- 扣姐追问最可能“输在哪里”,他的回答是数据闭环,且有鸡生蛋问题:“base 模型需要足够好,学习的速度才会足够快;但又需要先进入到场景里面去,让用户开始用。”用户教半小时必须看到“显而易见的一些进展”闭环才转得起来——“能不能跑通这个数据闭环,其实是最 risky 的一个点”。目前的初步闭环是在真机双臂加灵巧手的桌面任务中,机器人根据人的修正指示和示范改变 behavior,终局是全身灵巧操作。
17. 离线模仿只是内插泛化;数据定义由模型能力反推
- 与离线模仿的本质区别回到 algorithm distillation 那条线:imitation learning 把模型当任务记忆模块,泛化靠“内插性泛化(interpolation generalization)”——模型看过桌面上五个物体、十个位置,之后给它一个相关范围内的新位置能解,“但它其实是没有学习新的任务的这种能力的”。他要的是让模型看到 rich 的 offline 数据:suboptimal 轨迹、人的 body gesture、语言修正指示、human 和 robot demo,激发“远远超过只是 imitate expert demonstration 能够赋予的模型能力”。
- 数据为什么难,难在需求定义:“数据的定义其实不是凭空定出来的,是靠模型的能力定出来的。”要动作平滑就采平滑数据,要 failure recovery 就要采失败加修正的数据——问题是“大家现在对模型能力的定义还相对来说比较模糊”:要不要分割、tracking、depth 和 normal 重建这些 CV 能力?ICL 本身也是一种待定义的新能力。
18. 数据来源上的“融合派”:human data 的价值
- 他自称融合派,各类数据各归其位:遥操作数据最接近机器人本体,适合 fine-tuning/post-training 等后段;simulation 数据干净、可制造位置泛化和纹理泛化,也可以改变颜色等因素,适合 pre-training 甚至 mid-training 的前段;UMI 数据居中——像机器人数据但采集成本更低。
- 对 human data 他态度鲜明:“人确实是一个非常成熟的本体”,成本最低、可大规模铺到不同场景,是场景鲁棒性与场景理解的来源。针对 morphology 差异太大的质疑,他的回应:human 本身就是一种 morphology,有好的 morphology transfer 就有非常大的作用——从 human data 里学的本是“场景的变化、做任务时物体的变化,跟具体形状不那么相关的任务信息”。结论:“用什么数据就要把它用到对的地方,正确的构建数据和模型能力之间的链接。”
- 叉院同事(许华哲、高阳、陈建宇等)私下都忙但有沟通,大 vision 一致——让机器人通过 scale up 落地——细节路径不同:有人更关注视觉模型,有人希望做 VLA 加视觉的融合路线。“短期来讲我觉得这是一个很好的事情,因为确实还没有最终的收敛。”
19. 给学生的建议、AI 论文洪水与十公里处的马拉松
- 给想入行学生两条:一是多看——“书越读越厚,再越读越薄”,很多学生对 fancy 概念的兴趣一追问就模糊,本质是“知道的还不够多”;二是尽早上手,“真机部署是一个非常消耗经验的事情”。面试博士生时常问“你最感兴趣的一篇文章是什么”;听过最好的答案:一个学生引的不是 diffusion policy 而是 diffusion model 最原始的那篇——“能够 trace back,找到这个文章真正的发源地”的刨根问底能力。
- Robotics 论文正在翻倍增长,其中不少 AI 写作痕迹重:“看起来会详实,但是实际上它有很多的论证是有点漏洞百出的”,发现是 AI 写的“兴趣就会打点折扣”。他的过滤器:每天刷自己关注的研究者转发、宣传的工作——这些论文已经经过作者认为“值得自豪、值得推广”的一轮筛选。
- 终局判断:具身这场四十二公里的马拉松“跑到十公里”——强调泛化、强调通用能力的智能机器人“实际落地还是没有看到的”,但“未来的三到五年,其实我们能够通过 scaling 看到一个明确的范式的转变或者明确的一个拐点”。扣姐收尾的一句值得留下:“悲观很容易正确,只有乐观才可能成功。”
Full transcript
嗨,我是扣姐。那本周十字路口的嘉宾是徐梦迪。那梦迪呢是清华叉院的助理教授,在回国任教之前,他先后求学于清华、Johns Hopkins以及CMU,也在斯坦福的吴佳俊和李飞飞团队做博士后。那你好梦迪,欢迎来到十字路口。
嗨大家好,我是徐梦迪,非常感谢扣姐还有十字路口的邀请。
我们还是先从我们的传统快问快答开始啊,帮助大家了解你。然后请问梦迪你的年龄?
我今年30.5岁。
30.5岁,这么精确。求学经历刚才我已经介绍过了,我们直接进入下一个问题:MBTI和星座。
我的MBTI是INTJ,星座是摩羯座。
用一句话介绍一下,你当前花时间最多的研究方向是什么?
我现在最重要的研究方向,是让机器人能够从现实场景当中不断、持续地提升自己。
这个方向你做了多久?我记得你很早之前就在做泛化。
对,我从CMU开始,其实就在沿着泛化的方向做。当时我觉得,机器人不能只依赖预先学到的知识。
我们看人类为什么有这么强的泛化能力,其实有两个层面。一个层面是人有很多先验知识,另一个层面是人学习知识的速度非常快。
我觉得真正的泛化,是希望让机器人也具备类似于人的快速学习能力。
当时是什么契机让你开始进入这个研究方向?
我到CMU之后,就开始做当时叫作Robot Learning的方向,也就是把机器学习的一些技能和方法用到机器人上。当时还没有“具身智能”这个很时髦的名字。
我在CMU的时候非常喜欢一项叫MAML的工作,是Charles Finn——一位斯坦福教授、也是现在Physical Intelligence创始人之一——非常有名的工作。MAML有一个很厉害的地方,就是它能够让机器人学会没有见过的任务。
我当时觉得,这是真正属于机器人未来的一个方向。
那你当时是怎么了解到这项工作的?
当时这项工作确实非常有名。我们实验室有一些同学对机器学习的前沿方向都非常感兴趣,大家平时会互相交流、分享文章。我们看的文章也很杂,所以也是在这个过程中看到了这个方向。
我记得你清华本科读的是车辆工程系。
对。
从车辆工程系到具身智能,中间感觉隔着一个变形金刚。这个转型过程是怎样的?
我本科确实学的是汽车,我们专业叫车辆工程。现在回头看,当时选择汽车其实是一个非常正确的决定,因为汽车专业学得非常全面。
本科课程会涉及机械设计、汽车电子,这些内容和现在电子专业学生学的东西也有不少交叉,同时还会涉及一些算法。所以本科阶段,我从机械设计到算法都有所了解。
后来真正转向机器人,契机应该是我大二开始做科研的时候。那时我跟着机械系的严少泽老师做研究,方向是生物机器人。我们当时研究的是蜜蜂翅膀的超弹性恢复。
蜜蜂在采蜜的过程中,翅膀会频繁和周围环境发生碰撞,但翅膀不会因此受到损伤,因为它的结构具有超弹性。我们当时就是研究这个现象。
后来我也因此有机会进入CMU的Hobby Cho Set老师的组。他们组非常有名的方向就是生物机器人。大三暑假,我到Howie的组里设计了一个蛇形机器人,让它能够沿着管道爬行。
从那时开始,我逐渐从机械设计转向了机器人的算法设计。可以理解为,最开始做机械设计,后来慢慢开始做算法。
但这好像也不是车辆工程系学生最常见的路径。
对。不过后来我发现,我们系的学生有一个特点:如果自己想做一件事,就会非常努力地去寻找和兴趣相匹配的地方。
当时我有一些学长也去了严少泽老师的组,包括杨恒学长,他现在是哈佛的助理教授。我还有一些高中一起参加竞赛的同学,也在严老师的组里。所以我算是阴差阳错、也非常幸运地进入了严老师的组。
刚才提到你高中参加过竞赛,我也想听你讲讲中学甚至小学阶段的经历。你是一路都是学霸吗?
我现在特别不敢称自己为学霸。后来不断求学、出国,我看到了非常多厉害的人,觉得大家都有自己的想法。
所谓学不学霸,可能只是有些人把精力放到了学业上,另一些人把精力放到了自己更感兴趣的事情上。
我的小学生活其实过得挺轻松,没有上过什么补习班。课余时间要么参加学校活动,要么和朋友一起玩。
你是河北人,对吧?
我是河北人。
河北哪里?
衡水。
所以你上的是衡水中学?
对,我高中是衡中的。小学的时候,家里也给了我一个比较自由的环境,所以小学过得非常快乐。
当时我有一个很大的兴趣爱好,就是拼四驱车。那时候有一部很火的动漫叫《四驱兄弟》,里面有各种可以自己买零件、组装起来的四驱车。
当时我觉得这是一个很烧钱的兴趣爱好。
所以你还想过赚钱买四驱车?
对。我们院里当时有好几个小朋友都很喜欢四驱车,大家想赚钱买四驱车。
你们是用四驱车赚钱,还是通过别的方式赚钱?
通过别的方式赚钱,再买四驱车。
怎么赚钱?
我们放学路上会捡一些小垃圾,然后拿去卖掉。其实还挺赚钱的,很像一个城市寻宝游戏。
什么样的垃圾能卖到买四驱车的钱?
当时会有一些钢铁零件,有人会回收这些钢铁零件。
现在想起来,你小时候还挺有毅力的,也感觉很小的时候就埋下了车辆工程的种子。
对。后来想了想,这也是我选择车辆工程的原因之一,因为我一直觉得机械结构非常酷。
它能够把很多很小的零件整体组装到一起,其中凝结了很多代工匠的知识积累,最后形成一个非常精密的系统。
那你在衡水中学的体验是什么样的?
我自己的体验其实还挺好的。因为我高中学的是竞赛,是竞赛生,所以我们的主业就是学习竞赛,和高考班的管理要求不太一样。
某种程度上,竞赛需要激发学生自己更加主动、更加有动力,所以我们整体上学习高考课程的时间,和高考班会略有不同。
怎么才能成为竞赛生?
应该是在高一第一学期结束的时候,学校会做一次整体的意向调研,老师会来问大家对哪一科更感兴趣。
我当时在数学和物理之间选择,后来觉得物理是一门非常贴近现实世界的学科,所以选择了物理。
我听说衡水中学很多学生早上五六点就起床,日程安排细到每一分钟、每五分钟。我有一个朋友后来去了复旦,现在在做基金。他说他们当时甚至一个星期只有一次洗澡机会。
衡水中学不管是对高考班还是竞赛班,要求其实都比较一致。早上起来要跑操,上午也要跑操,有固定而且严格的作息时间。
学校还会把高一、高二、高三的时间错开,让大家错峰去食堂。这一层面的管理确实比较严格。
现在外界对“衡水模式”有很多讨论,大家也很感兴趣。你观察到的衡水模式,最后培养出来的学生会有怎样的发展?会比较多元,还是会更偏向应试教育?
我的观察主要基于自己的经历。因为我在竞赛班,竞赛班有一个很明显的特点,就是每个人都有非常强的想法。
大家为什么选择参加竞赛?因为竞赛需要非常强的时间投入。比如普通高考生有暑假和寒假,而我们往往会利用这些时间参加集训。
所以我的竞赛班同学里,有一部分人后来出国,成长为非常优秀的研究者;也有一部分人留在国内发展。
听起来,竞赛有点像一条不归路,会有这种感觉吗?
确实会。参加竞赛以后,你不能像普通高考生一样,系统学习很多常规科目的知识。
我们先参加竞赛考试,之后通过保送、自主招生等方式确定去向。等到最后确认可能没有保送机会,才会进入正常的高考班。那个时候时间已经很短了,通常都到了高三下学期。
这有点像创业,是破釜沉舟。
对。不过当时觉得这是非常有意思的经历。学习竞赛时会很有干劲,因为身边的朋友都有同样的愿景:小到把一道题解出来,大到冲击省一等奖、金牌等。
所以大家做这件事的动力很强,也不觉得苦。
竞赛中的竞争关系强吗?
不算强,可能是因为教练引导得比较好。
当然,清华每年在河北的竞赛保送名额是有限的。竞赛首先要考进省赛,拿到省一等奖之后,会从中挑选一部分人进入省队;进入省队后,还要参加国家集训队等选拔,一直到国家层面的考试,所以竞争肯定是存在的。
但我们当时更像是一种同伴关系,竞争关系相对较弱。
教练是怎么引导的,能够营造出这样的班级氛围?
我觉得主要是大家都从零开始成长,更像是一起抱团解决问题。
如果所有人都处在同一个阶段,然后一起慢慢成长,我觉得战友之间的情谊会比竞争关系更强。
你在CMU时也是机械工程系。博士毕业的时候,你的论文还拿到了系里的最佳博士论文奖。
对。
这个奖应该很难吧?一年大概一位,还是几位?
我们那一届一年有两个人。
你的博士论文主要研究什么?
我的thesis叫《Building Adaptable Generalist Robots》,读起来有点拗口。
还是和刚才的方向一样。
对。核心就是希望让机器人具备适应变化环境的能力。
预训练本身当然非常有用,我也非常相信scaling,但预训练不是全部。我们不能寄希望于机器人只通过预训练,就变成一个百分之百成功、非常强的个体。
机器人部署到真实环境之后,一定需要适应具体环境的变化。现实环境是一个开放世界,开放世界的特点是任务在不断变化。
比如我家里今天可能有20个物体,但一周之后可能会有30个物体,而且物体的种类也会发生变化。人的偏好也会在不同场景中不断变化,这些都是开放世界的体现。
对应到机器人,我们希望它能够适应环境带来的变化,并且在变化的环境中不断提升自己。
当时你主要采用了哪些解题思路?
当时主要探索了几个思路。第一个是机器人的in-context learning,第二个是通过test-time training,也就是在部署时改变模型的一小部分参数。
它们本质上都是为了同一个愿景:让机器人不再只受限于预训练,而是能够通过交互、通过上下文,在现实场景中不断学习。
第一个方向是in-context learning。这个方向从我的一项叫作《Prompt Decision Transformer》的工作开始。那是2021年的工作,现在看已经是5年前了。
当时的主要动机,是看到了GPT-3。GPT-3已经具备in-context learning能力,这让我觉得非常酷。传统机器学习的思路是,训练完成之后,如果遇到新任务,就进行fine-tuning。
但GPT-3可以通过上下文学习,也就是说,你可以通过prompting给它一个任务定义,或者规定一种输出格式,模型就能根据prompt改变自己的输出。
我觉得这非常厉害,因为在部署环境中不需要重新训练,这是一种更高效、更快捷的适应方式。于是我们就想,机器人是不是也能具备这样的上下文学习和快速适应能力。
《Prompt Decision Transformer》是从一个相对简单的设定出发:给模型一些机器人的demonstration,让它适应不同的locomotion任务,以及不同的manipulation任务。
第二个方向是《Hyper Design Transformer》,算是《Prompt Decision Transformer》的延续。它沿着test-time training的思路,在部署时改变模型中的一部分参数。
但改参数像一把双刃剑。它确实能让模型解决目标任务,但如果修改的参数过多,模型可能会遗忘之前预训练得到的知识。
所以我们当时采取了一个折中的方法:先让模型学习一个hypernetwork,把原有知识注入hypernetwork的参数中,然后再通过hypernetwork生成少量adapter。这个adapter只占整个Transformer参数的约0.5%,我们只需要适应这0.5%的参数。
效果怎么样?
在预训练数据量较少的前提下,Hypernetwork更容易奏效。但现在数据量不断积累,预训练规模也不断扩大,所以我个人认为,真正的未来方向还是in-context learning,也就是使用prompting的方式。
因为这样不需要修改模型参数,或者只需要在模型学习、收集更多多任务之后,再进行批量参数更新。
现在我们做的事情,和当时的工作有什么延续或者发展?
主要是发展。自从做完《Prompt Decision Transformer》之后,沿着in-context learning让模型具备快速适应能力的工作越来越多。
其中有一项我觉得很有意思的工作,叫Algorithm Distillation,是DeepMind研究人员做的。它提出了一个很有意思的问题:你的模型到底应该等价于什么样的智能?
现在大家使用VLA时,通常把模型参数看作包含了任务相关知识。因为我们使用专家demonstration,通过模仿学习把专家示范中的知识蒸馏到模型参数里,这是一种对应关系。
另一种对应关系,就是Algorithm Distillation提出的想法:模型参数应该等价于一个算法,更具体地说,应该等价于一个强化学习算法。
它的做法是,把一些次优轨迹放进上下文窗口,让模型根据过去执行中不好的动作和历史,不断改变未来的动作。这样,Transformer结构就具备了自我提升的能力,模型参数等价于一个强化学习算法。
这项工作最后是在模拟器里,还是在真实机器人上实现的?
它在模拟器里实现了效果,但当时的任务大多偏向导航或者运动控制,比如走迷宫和一些locomotion任务。在manipulation领域,目前还是相对困难的。
沿着这个方向,后面还有一些工作。比如depark他们组有一篇叫local former的文章,也是在用基于Transformer的in-context learning实现适应,并部署到四足机器人上,但同样更偏向locomotion。
后来还有Robot TTT,这是NVIDIA最近发表的一项工作。它可以让机器人观看人类长程manipulation视频,或者通过test-time learning改变模型的行为,让机器人学习人类示范中的动作。
听起来,大家的思路还比较发散。你现在感觉到有收敛的迹象吗?
我觉得大家最近越来越重视adaptation。因为大家逐渐发现,仅仅通过大规模数据和大规模模型的预训练,机器人确实无法解决所有应用问题;仅仅通过基于专家示范的模仿学习,也同样不够。
在这个基础上,adaptation就变得尤其重要。最近这个方向正在逐渐形成新的共识。
这个听起来好像不需要特别讨论,它本来就应该重要。那为什么直到现在它才变得重要?
因为我们在观察人为什么有很强的泛化能力时,会发现有两个原因。
第一个原因是人有大量积累。这种积累从生物进化的角度来看,包括我们本身具备非常强的小脑控制能力;在不断学习的过程中,人的先验知识也会通过记忆等方式保存下来。
第二个原因是,人学习新东西的速度很快。这两点共同构成了人很强的泛化能力。
过去大家主流的方式,是通过scale数据和scale模型,让模型的多任务能力、指令跟随能力变得更强。它有点像先通过数据采集,让模型拥有足够强的先验。
但这并不意味着adaptation不重要。可能正因为如此,大家最近才越来越意识到,机器人的模型确实需要很强的适应能力。这也是从机器人未来实际应用场景出发的考量。
当然,机器人要有较强的adaptation能力,对基础模型也有一定要求。我们不希望机器人到了真实场景里虽然能够自己学习,但学习过程非常可怕,比如把杯子打碎。
为了避免这种情况,模型必须具备比较强的基础能力。所以大家从foundation model开始做,我觉得也是合理的。
你博士后去了斯坦福,在吴佳俊和李飞飞的团队。当时主要做了什么工作?
我觉得当时做了3个自己比较满意、也很感兴趣的工作。
这是多长时间内做了3个工作?
我有非常强的合作者,所以非常幸运。
当时做的事情,主要是把博士期间的一些想法变得更落地、更实际。
第一个工作是BEHAVIOR benchmark。这是李飞飞团队投入了大量时间和精力做的一个benchmark,尝试回答一个问题:机器人到底应该解决什么样的任务?
BEHAVIOR包含很多模拟场景,包括家庭场景和学校场景,也有大量开放源代码的资产,研究者都可以使用。所以它回答的是:什么样的任务比较重要。
我在其中的角色,是帮助生成一些数据集。我们当时提出了momentum这样的方案,通过人工操作生成模拟环境中的数据。和我博士期间的工作相比,这项工作更加落地,因为之前没有太多涉及local manipulation,而很多长程操作任务其实非常困难。
第二个方向,是让机器人变得更加steerable,这和我的主线研究更相关。Steerable本质上是让机器人能够遵循更多样、更丰富的人类语言指令,并适应不同人的偏好。这个方向我们发表了两篇相关工作,我都很喜欢。
第三个是Creative Tool Use benchmark,希望机器人有一天能够具备类似人的创造性物理工具使用能力。
这个benchmark怎么做?它既要creative,又要benchmark。
我们当时是从人的数据开始采集的。这个benchmark想回答的问题是:人在现实中使用工具时,并不是根据工具的名字来使用,而是根据工具的功能,也就是机器人领域所说的affordance来使用。
比如今天想切蛋糕,但手边没有蛋糕刀,也可以用叉子或者筷子把蛋糕切开。人在使用工具时,依据的是工具的功能,而不是工具的名字。
再比如想清扫桌上的一些物品,有扫帚当然可以直接用;如果没有,也可以用书本,甚至可以用机器人的小臂,把桌面上的物体整体扫到一起。
人会创造性地使用身边的物体,我们希望机器人也具备类似能力。所以这个benchmark最开始采集了很多人创造性使用工具的数据,包含第一视角和第三视角对齐的数据。
这个benchmark如何评估?是把什么任务交给机器人?比如切蛋糕、擦桌子?
这也是一个很有意思的问题。我们当时确定了3个想要benchmark的维度。
第一个,是现在的多模态大模型选择工具、生成工具使用轨迹的能力。
第二个,是从视觉角度出发的场景重建能力。机器人使用工具时,经常要操控一些不常见的、非刚体的物体。比如蛋糕是柔性、可切分的物体,水也是可变形物体,所以这些物体的4D重建相对困难。
因此,第二个维度是评估不同方法进行3D和4D重建的能力。
第三个,是机器人能不能具备类似的工具使用能力,也就是现在的方法有没有一种现成的方式,把人的灵巧工具使用能力迁移到机器人的灵巧工具使用能力上。
所以总共有3个维度。
你在李飞飞团队时,李飞飞是什么样的风格?团队氛围怎么样?
我当时有两位导师,李飞飞和吴佳俊。能够有两位导师非常幸运,因为他们的风格很不一样,给我的收获也不同。
李飞飞会更加vision-driven。她经常问我一些问题,让我跳出单个项目、单个benchmark去思考:这个领域未来10年甚至更长时间,什么才是真正重要的问题?你在这个领域里应该扮演什么样的角色?
她不一定会直接这样问,但在讨论中经常提出能够引发思考的问题。总体来说,就是思考未来,以及自己能够做出的最重要的贡献是什么。
有具体的问题你还记得吗?
比如当时我们在确定benchmark的metric时,希望给参赛者更细致的指标,包括进度、成功率、时间等,所以会把metric定得非常细。
但李飞飞会问:这些指标里,哪个是真正重要的?
其实只有一个,就是最终成功率。其他指标从开发和调试的角度看很重要,但从最终愿景来看并不是真正重要,真正重要的只有success rate。
她当时引用了爱因斯坦的一句话叫“把事情变得简单不是更简单。”这句话的意思是,希望大家思考更本质的问题,让事情变得简单,而不是仅仅变得更简单。
从博士成长到博士后,再到PI,考虑的事情确实不一样。博士阶段考虑的是如何把事情做成,所以需要关注很多细节指标,指导自己如何调试方法。
但成为PI之后,要做的是让大家关注真正重要的那个点,要跳出来。不是只解决问题,而是定义问题,从解题人变成出题人。
吴佳俊相对来说更含蓄一些。我会和他讨论项目应该做什么,也会讨论具体的设计细节。如果我有迷茫,他也会推动我去做真正能够建立自己research brand的工作,给了我很多支持。
这还挺难得的。作为共同导师,他们是非常好的组合。
说到research brand,应该怎么理解?每个人都应该追求research brand吗?有没有什么心得可以分享?
我的想法是,research brand应该从自己的研究兴趣出发。真正能够让你持续花10年甚至更长时间研究的问题,本身就应该能够定义你的research brand。
有人会说,research brand需要和别人不一样,但这并不是本质。最重要的是,你觉得什么问题重要,然后愿意花时间去研究它。
如果你对一个问题研究了超过3年、5年,它本身就已经成为你的research brand。
这听起来还是和创业很像,要从自己的热情出发。
对,从自己真正相信的地方出发。
我最近也在看Paul Graham。他有一篇文章叫《如何成就伟大事业》,里面讲到,当你远远看一个知识体系时,它像一个球,表面平滑而且完美;但你只要走近,就会发现球体坑坑洼洼,里面还有大量漏洞和黑洞。
这些坑洼、漏洞和黑洞,就是创业机会,也是研究值得继续做下去的起点。
那你为什么决定回国?听起来,如果继续留在斯坦福发展,也是一条很自然的路。
我是在2023年的时候,回清华交叉信息研究院面试的。当时我已经进入博士第五年,开始考虑之后的发展方向。
对我来说,大的选择无非是工业界和学术界。当时我在Google实习了很长一段时间,体验非常好。我的mentor给了我很多帮助,包括帮助我建立自己的research taste。
工业界确实有资源做更大规模的事情,相对来说,学术界在资源方面会有一些限制,所以当时我也思考了很久,到底应该去工业界还是学术界。
去交叉信息研究院面试的契机,是我有幸认识了吴毅老师。他帮我搭了一个桥,拿到了交叉信息研究院的面试机会。面试时和院系老师、和姚先生交流,我的体验都很好。
交叉信息研究院有几个优势。第一个是人非常强,学生非常强。很多做机器人和人工智能的人,在美国也会认识一些姚班的人。姚班有很多毕业生,后来成为各个领域顶尖的研究者。
第二个是,我自己的研究方向是机器人。机器人本身是一个系统,单纯只做大脑,或者单纯只做硬件,我觉得都不完整。
我需要找一个最合适的地方,把机器人做成一个真正能够落地的系统。综合考虑之后,交叉信息研究院是对我来说最优的选择。
刚才你提到,在工业界和学术界之间想了很久。后来是怎么做决定的?现在应该有很多人也面临同样的十字路口。
在做决定之前,包括来交叉信息研究院面试之前,我找了很多朋友和师长寻求建议。后来发现,真正促使自己做决定的,还是要回到自己内心具体想要什么。
工业界可能有很多算力支持,你可以更容易地把一个小想法scale up;但同时,工业界也可能存在自由度的缺失。
对我来说,自由度非常重要。我希望自己的时间能够最大化地分配到我认为重要的问题上。因此,学术界对我来说是相对更优的选择。
当然,每个人的想法都会不同,但最后还是要回到自己心里真正觉得什么东西重要。
你刚才提到,回来面试时体验很好。之前我们聊天时,你说吴毅老师当时问了一个让你印象深刻、好感倍增的问题。
那个问题其实不是吴老师问的,是另外一位老师问的。
当时的问题,也是我后来一直在思考的问题:你为什么觉得自己5年之后一定能够成为自己领域顶尖的研究者?
我当时回答得并不好。我非常自信地说:“我觉得我一定可以。”大概就是这种风格,相信自己能做到。
但后来逐渐想,这个回答其实不太好。更准确的说法应该是,如果我找到了真正感兴趣的主题,比如让机器人有一天进入千家万户,并且能够在实际环境中不断提升自己,这是我非常感兴趣的问题。
如果我沿着正确的道路研究5年,我觉得自己一定不会差。还是要专注,并且真正深入地思考这个问题。
当时姚先生面试你的时候,问了些什么?
我们聊的内容很广,包括生活和研究。姚先生也问我为什么想回到交叉信息研究院。我当时的回答和现在差不多:我觉得这里是一个很好的平台,也有自由度去做自己想做的事情。
姚先生给我的一个建议,是我后来在博士后阶段也非常受益的:要把自己的注意力更加集中。
真正重要的问题可能没有几个,而一个人的时间非常有限。如果把时间摊在太多事情上,结果可能并不好。所以他建议我,一定要专注于自己真正感兴趣的事情。
我听起来觉得你好奇心也很强。
对,我对很多事情都很好奇,所以可能需要不断提醒自己专注、专注。
不过后来我发现,不同领域之间其实有很多互通的东西。机器人本身是一个很大的集成性学科,有人做硬件,有人做算法,也有人做学习算法,但如果最终目标是把机器人落地到真实应用,这些东西都需要有所了解。
机器人已经不存在“我只做硬件”这样的单一划分了。尤其在AI时代,它需要一个比较全面、整体性的知识体系。
你现在怎么平衡?一方面要专注于自适应和泛化,另一方面又要了解领域里发生的很多事情,而这个领域每天都有很多头条新闻。
我现在看头条新闻没有那么多,可能会更多地看论文和一手信息。最近国内机器人确实发展得非常快,国外的机器人研究也已经成为一个很好的研究主题。
但还是要花更多时间在自己真正研究的地方。如果一直看各种消息,很容易迷失。我和一些美国朋友交流时,大家的共识也是,真正重要的事情还是手头正在做的事情:那些你觉得未来1年、2年,甚至更长时间后,可能改变这个领域的东西。
所以还是需要沉下心来做研究。
你现在认为最重要的事情,就是机器人的自适应和泛化,对吗?
我现在认为,真正重要的是让机器人具备in-context learning能力,让它不再只被预训练时见过的数据定义。
模型应该能够根据从环境中收集到的信息不断学习,比如失败案例、人的示范、机器人的示范、人的身体姿态,以及人给出的纠正指令。最终,它应该成为一个能够自己运行、在场景中不断学习新任务的智能体。
在很多外人看来,你的人生非常一帆风顺。听到这个词时,你是什么感受?你会这样形容自己吗?
我其实也踩过很多坑,也经历过很多转折。
比如看我的发展经历,最开始做设计,后来逐渐转向learning、算法和模型。中间每次转型都不算完全顺利。
但如果总结我的成长经历,我觉得更多的是幸运。每个阶段都有非常好的朋友、老师和mentor支持我。所以我会用“幸运”这个词形容自己。
这种幸运是从天而降的,还是你觉得获得更多幸运也有一些方法和规律?
可能是因为我交到的朋友都非常好,大家能够互相支持、互相帮助。
某种程度上,一个人成长成什么样,一部分由自己决定,另一部分取决于选择了什么样的环境。环境也会反过来影响你。
那你是怎么选择环境的?
我选择环境时,更多看的是自己能不能在这个环境中发挥最大的作用,或者最大化自己的兴趣点和能力。
这很有意思。我原本以为你会说选择最好的环境,但其实不是。
因为好不好可能有一个普遍的标准,但对个人发展来说,还是要选择最适合自己的。
比如你选择一件事、进入一个环境之后,自己的能力能不能因此翻倍。不是简单的double,而是像游戏通关一样,不断通关,把它当成一个游戏来做。
在进入一个环境之前,无论是去交叉信息研究院、CMU还是斯坦福,你怎么尽可能多地了解这个环境是否适合自己,是否能够放大自己的能力?
这个时候信息采集非常重要。我会先找朋友,看能不能连接到相关的人;如果不行,就发邮件建立联系。
后来我发现,研究者中有很多人都非常热心。如果你能够正确表达自己的请求,大家通常愿意互相帮助。
对很多I型人格的人来说,这一步挺难突破。你有什么小技巧吗?
我自己也是I型人格。后来我觉得,在自己的专业领域里,需要尽可能使用适合自己的方法。
即使是I型人格,也可以遵循一些流程。比如,可以先自己写一版邮件,再让AI帮忙润色,让表达更礼貌、更合适。
现在工具很多,只要正确使用工具,我觉得已经没有什么事情是无法达成的。
现在应该也有很多学生、学弟学妹给你发邮件或者打电话。什么样的邮件和电话,会让你更愿意回复?
有些邮件明显是纯AI写的,这种我通常不会回复。给别人发邮件,最重要的是表现出诚意。
诚意体现在,第一,你确实了解这个领域;第二,你确实了解这个方向。也就是说,你能不能把自己的兴趣落实到实际工作上,这条链路是不是能够走通。
很多人只有兴趣,但没有落实,这是需要注意的地方。如果一个人能够清楚地分析自己的兴趣,同时说明自己愿意做什么,那通常说明他比较有想法。
这样的学生,我一般愿意把流程推进到下一步,再多聊一聊。
刚才你也提到自己经历过多次转型。你觉得过去最艰难的人生十字路口是什么?
最艰难的选择,确实是要不要回国。从某种程度上说,也是选择工业界还是学术界。
这对我来说是一个非常大的决定,我考虑了很长时间。我的科研生涯绝大部分时间都在美国,所以当时也会犹豫,自己回国之后能不能适应。肯定会有很多挑战。
我特别喜欢机器学习里的一个概念,叫“No Free Lunch”,也就是天下没有免费的午餐。你做出一个选择,就一定要承担这个选择在某些方面相对较弱的地方。
经过很多考虑,我发现自己最看重的还是自由度,也希望把机器人做成一个完整的系统,让它能够真正落地。因此综合考虑之后,回国做教职是我的最终选择。
回来一年多,你应该见到了很多具身领域的研究者和创业者。你现在对中国具身创业的整体感受是什么?
在回国之前我就了解了一些,觉得非常令人兴奋。大家都很有干劲,沿着机器人系统的不同层面做事情。
回来之后,包括结合之前的了解和现在的观察,我的整体感受是:确实有很多实际进步,但也存在一些泡沫。这两件事并不矛盾。
好的地方是,在整个机器人系统层面,从材料、传感器、本体,到数据和模型,都能看到相应的国内公司在沿着这个方向攻关。也有很多资源投入到这个方向。
所以从长远来看,我还是非常乐观的。我觉得机器人一定会取得实际进步,而且现在确实已经有实际进步正在发生。
但同时也会有泡沫。因为具身智能本身还没有收敛,大家沿着不同的路径、不同的信念向前走,焦点肯定会发生转移。
有时候大家关注数据,之后可能转向世界模型,后来又重新关注数据。这是一个焦点不断变化的过程。在这种多变的情况下,泡沫一定会存在,就像控制系统里可能会出现超调。
什么是超调?
比如PID参数没有调好,系统可能会发生振荡,这就是一种超调。
上次和你聊天时,感觉去年很多人都在说先做数据,上半年大家又都在做世界模型,最近似乎又开始讨论数据。你觉得这种转移是为什么发生的?
其实是大家看问题的角度发生了一些变化,但并不是完全转移。大家的关注点会逐步变化,可能从数据到模型,再从模型回到数据,之后又回到模型。
这说明大家在不断思考:这个行业里什么是真正重要的问题。但数据和模型其实都非常重要,并不是两条互斥的路线,而是在看两个不同层面的问题。
具身数据确实非常稀缺。数据决定模型能够看到什么,而模型,尤其是世界模型,相对于VLA来说,可能是一条新的路线。它更关注representation是什么,以及模型如何理解世界。
这和VLA更关注任务的路线确实不太一样。我自己也比较相信世界模型,因为任务本身是一种很难scale的方式。任务实在太多,不可能通过穷举解决。
如果能够通过世界模型,让模型学习世界变化的规律,这是一种更加基础、更具普适性的能力。
在中国和美国,你分别最关注哪些公司或实验室?
我关注的比较多,主要看哪些公司的研究和我的方向、我的信念比较相关。
美国方面,我肯定会关注Physical Intelligence,也会关注Google、NVIDIA等大公司,以及Generalist等初创公司。Roda的路线我也觉得很有意思,尤其是他们最近在尝试in-context learning。
国内也有一些公司的工作我很喜欢,比如林波他们最近发布的LingBot-VLA 2,也是沿着in-context learning的路线在做,我觉得这是非常有意义的工作。
最近你看到什么scaling law的信号了吗?
我看到了一些,但不是我们自己的结果,而是其他公司发布的一些结果。
比如从10万小时扩展到100万小时预训练数据之后,模型在一些hold-out,也就是没有见过的数据集和测试集上,能够取得更好的效果。
但现在大家测得更多的是loss。机器人领域有一个很tricky的地方,就是loss和成功率并不直接相关。可能loss很低,但最终成功率不一定高,甚至会出现很多振荡。
举个例子,假设机器人要拿起一个杯子,一共需要20步。前17步可能都没有接触到杯子,即使这17步拟合得非常好,只要第18步真正接触杯子时误差比较大,整个任务就很容易失败。
所以在时间序列上会存在不平衡,导致loss和成功率大部分时候并不直接相关。
如果未来能看到一种真正有意义的scaling law:数据量逐渐增加,模型逐渐变大,模型在没有见过的任务上的成功率逐渐升高,那才是我真正想看到的scaling law。
所以目前能看到一些信号,但还没有那么强。
大家很喜欢讨论一个问题:机器人到底有没有自己的GPT moment?你觉得会有吗?
我觉得会有。我还是非常相信scaling。
现在主流的具身模型,基本还是沿着这样的路线:先做一定程度的预训练,预训练之后,再根据目标领域进行fine-tuning。
这可以类比语言模型的GPT-1阶段。GPT-1本身也需要有针对性的后训练或fine-tuning,才能解决相应任务。
但我真正希望看到的是类似GPT-3的时刻:模型可以通过in-context learning、通过prompting,获得和任务相关的信息,但不需要fine-tuning,而是只通过context告诉模型具体要做什么。
这样,fine-tuning的比重会降低,模型也更容易通过ICL进入更多场景,完成更多任务。
普通人也可以用起来。
对。
在具身领域,当我们关注scaling law带来的GPT moment时,你觉得有哪些benchmark特别值得关注?有没有这样的榜单?还是说不需要这种benchmark,GPT moment一旦发生,所有人自然就能感受到,像魔法一样?
我觉得还是需要一些benchmark,尤其是具身领域。
语言模型发展过程中有很多benchmark,虽然大家也有不少争议,但在一定程度上,benchmark确实帮助了模型发展。
具身领域的evaluation或者benchmark会更加重要,因为机器人有一个physical body。评估时不能只看模型的成功率,还要关注失败情况和风险情况。
这些都需要通过预先设计的benchmark,告诉模型开发者和用户,它的能力边界在哪里。所以具身领域的benchmark会更加重要。
现在很多公司都有闭源的、内部使用的评测标准,外界很难知道。开源benchmark方面,你有什么推荐?
我还是想推荐BEHAVIOR。它包含更长程的任务,也有很多家庭环境和物体布置。
它可能的缺点是会受到sim-to-real gap的批评,但如果从模型能力角度来说,simulation最终只是一种环境。
BEHAVIOR从你们当时做出来到现在,一直有人维护和迭代吗?
对,一直有人维护,它的易用性也在逐渐提高。
今年上半年,英伟达的金范有一场在中国和美国都引起很多关注的演讲。他认为具身智能的发展会严格对应语言模型经历的几个阶段。你认可吗?
总体上我认可。
比如语言模型里大家已经知道的scaling、scaling law,以及foundation model的出现,还有in-context learning能力,这些在具身领域也会出现。
但不同的是,具身领域会有一些侧重点变化,也有机器人自身的独特性。
首先,机器人的安全性需要更早被考虑。在部署之前,需要有类似stress test的评估,才能真正把机器人部署到场景中。这些问题比语言模型领域更加关键,也更加紧迫。
另外,机器人的context更加多样,因为它有身体,所以灵活性更强。它可以观察周围环境,context中会有更多不同的含义。
总体来看,机器人模型一定会被scale up,但关注点可能会有先后顺序上的不同。
我在想,今天大家都愿意使用最先进的语言模型。我给它一个任务,它有时候20分钟才回复,但我觉得完全可以接受,反正等着就好,而且我可能同时运行很多任务。
但对机器人来说不可能。一秒钟没有反应,我都觉得它是不是死机了,甚至想过去拍一拍它。
实时性确实是非常重要的。具身模型不可能20分钟才给出一个反应,它需要实时和周围环境交互。
所以还有很多工作需要攻克,确实任重道远。
我们前面聊了很多行业观察,再回到你的工作。最近一两个月,你做的最重要的事情是什么?
最近最重要的事情,是沿着in-context learning这条路线不断向前推进。
我想先解释一下,in-context learning在具身领域具体意味着什么,以及它最终可能实现什么能力。
举一个简单的例子。大家看到很多机器人demo都是叠衣服,假设我们就拿叠衣服来说。现在的demo往往是把衣服叠成方块,但这里有一个假设:每个人家里的衣服都叠成方块。
可实际上并不是这样。比如我自己使用胶囊衣橱,衣服都是卷起来的。我希望机器人到了我家以后,我告诉它:“我的衣服是这样叠的,请把衣服好好卷起来。”
另一个人可能会告诉机器人:“我的衣服按照固定颜色摆放。”还有人可能根本不用叠衣服,直接把衣服挂起来就可以。
所以,in-context learning想解决的是,让模型具备由终端用户定义的能力。终端用户可以根据自己的偏好和需求,改变模型的具体能力以及行为。
这可能是我们最终希望机器人实现的事情。
再比如,机器人一开始不会做某道菜,但我想让它做这道菜,于是我给它示范一次。机器人可能学习了1000个类似任务。最开始它需要30分钟适应,慢慢可能只需要10分钟,甚至更短。
我们训练的其实是模型快速学习新任务的能力。如果这种模型能够部署到更多场景、更多家庭,甚至服务场景中,它就会在不断强化学习能力的过程中,学得越来越快。
所以我非常相信,in-context learning最终能够成为让模型scale up的一种方式。
但要实现这一点,似乎依赖很多外部突破,不管是机器人本体、世界模型,还是其他环节。我能想到很多问题。你觉得现在最可能做不到的点在哪里?最大的bug会出在哪里?
最难的点,是能不能让模型拥有一个稳定的数据闭环。
刚才提到,这种方式需要和具体场景结合。你要把机器人真正放进终端家庭或者服务场景,还需要有合适的mentor教机器人做事情。
同时,机器人需要在用户教了它半个小时之后,呈现出一些显而易见的进展。只有这样,终端用户才愿意继续使用,数据闭环才可能真正转起来。
这就有一个鸡生蛋、蛋生鸡的问题:基础模型需要足够好,学习能力和学习速度才会足够快;但模型又需要先进入真实场景,让用户开始使用,基础能力才能被激发出来。
能不能真正跑通这个数据闭环,是目前最有风险的一个点。
我们现在已经跑通了什么样的数据闭环?比较简单的闭环是什么样?
我们现在在做一些比较简单的桌面任务,采集人的纠正指示,让机器人根据人的纠正、示范来改变自己的行为。
目前还是先从桌面任务开始。
这些都是真机吗?
对,都是在一个by manual setup,就是双臂的一个场景,同时呢也会有一个灵巧手。我们最终希望实现的是全身灵巧操作。
你们做的事情,和离线模仿学习之间是什么关系?有哪些相同和不同?
离线模仿学习的一个相对公认的定义是:你有一些专家数据,通过监督学习,也就是模仿学习的方式,从这些专家数据中学习。
这本质上回到了刚才说的Transformer和Algorithm Distillation的区别。
模仿学习是把模型当成一个任务记忆模块。大规模训练之后,如果你想让它解决一些泛化场景,比如没有见过的任务,实际上寄希望于模型具备插值泛化,也就是interpolation generalization。
比如模型看过桌面上5个物体、10个位置,之后给它一个相关范围内的新位置,它可以把任务解决。但它其实没有学习新任务的能力,因为它本质上是在记忆数据中的动作知识。
我们想做的,是让模型有针对性地看到不同类型的数据:比如次优数据、人的身体姿态、语言纠正指令、人的示范、机器人示范等。
这些丰富的离线数据,能够激发模型不同的能力,远远超过单纯通过模仿专家示范所能赋予模型的能力。
说到交叉信息研究院,大家会想到一些名字,比如现在在创业领域非常活跃的助理教授许华哲、高阳、陈建宇等。你们最近有时间坐下来一起聊天吗?大家会一起开会吗?
大家私下里确实都挺忙,很难找到一个时间让所有人坐下来一起聊,但平时会有一些沟通。
大家做的事情,整体vision大致相同,都是希望通过scale up,把机器人落地到实际应用场景,让机器人真正有用。
但细节上的路径会不同。有些人更关注视觉模型,有些人希望做融合路线,比如VLA加视觉模型。
短期来看,这是一件好事,因为这个领域确实还没有最终收敛。
大家共同感兴趣的话题是什么?
共同感兴趣的话题,是如何让模型scale up。平时也会讨论数据,以及如何让模型进入真实人的场景。
我之前也和高老师聊过一些相关主题。
说到数据,我记得之前我们沟通时,你提到数据最难的地方在于需求定义。为什么难在这里?
数据会被喂给模型,但数据的定义不是凭空产生的,而是由模型能力决定的。
大家定义数据时,本质上是在思考模型需要什么能力,再反推数据应该如何采集。
比如如果希望模型的动作更平滑,就需要采集平滑类型的数据。如果希望模型具备failure recovery,也就是从失败中学习的能力,数据里就需要包含失败和纠正。
无论是VLA模型还是世界模型,都需要有失败和修正的数据。所以数据的定义,应该由模型的能力来决定。
现在大家对模型能力的定义还比较模糊,这也是很多研究者正在逐渐思考的问题。
比如,基础模型是否需要具备分割、tracking、深度重建、法向重建等更偏计算机视觉的能力?
又比如,in-context learning本身就是一种新的能力,它要求模型能够从更多样的模态中学习,包括人的手部指示、身体指示和语言指示。
不同的模型能力,确实会反过来定义数据需求。
听起来很复杂:要从模型出发,但模型能力本身也还没有收敛。
现在比较主流的数据采集方式,各自有什么优缺点?有没有你觉得肯定不行的方式?
我是融合派,因为不同数据中,模型学到的东西应该是不一样的。
比如teleoperation数据最接近机器人本体,所以非常适合用在训练后期。不管是fine-tuning还是post-training,在这个阶段都希望数据和目标领域直接相关,因此teleoperation数据在这一层面肯定最好。
Simulation数据比较容易制造位置泛化、纹理泛化,也可以改变颜色等因素,因此能够让模型对视觉变化更加鲁棒。这类数据在模型训练的前端,也就是pre-training甚至mid-training阶段会比较有用。
Simulation数据还能够提供比较好的对齐,因为相对干净,可以用来激发大规模视频预训练模型中的一些能力。
还有一种是UMI数据,它处于中间位置,更像机器人数据,但采集成本更低。
成本最低的是human data。我本人非常喜欢human data,因为人确实是一个非常成熟的本体。
人可以在日常生活中非常方便、快捷地帮助我们采集场景数据。由于human data成本低,可以大量铺到不同场景中。
这时,human data应该发挥的作用,是提升模型对场景的鲁棒性,以及对不同场景的理解。
有些人可能会觉得,human data和机器人在形态上差别太大。但我觉得,人本身就是一种形态。如果有比较好的morphology transfer方式,human data会发挥非常大的作用。
我们从human data中学习的,应该是场景变化,以及人在执行任务时物体发生的变化。这些内容和机器人具体的形态并不那么相关,而是和任务相关,因此可以从human data中学到。
本质上,关键不是某一种数据绝对最好,而是要把不同数据用在正确的地方,并正确构建数据和模型能力之间的联系。
现在具身智能非常热门,很多学生,尤其是学汽车或机械的学生,也想进入这个方向。你会给刚走上研究道路的年轻学生什么建议?
我的第一个建议是,一定要多看,一定要吸收足够多。
我和一些学生聊天时发现,他们可能会觉得自己对某些时髦概念感兴趣,但认真问他兴趣点究竟在哪里,往往还比较模糊。
一个本质原因是,他们知道的还不够多。可能要先把书读厚,再把书读薄。只有先知道足够多,才能从中抽取出来,逐渐了解自己真正感兴趣的地方。
所以第一点是一定要多看,也要多和人交流。
第二点是要实际上手做事。很多人都对具身方向感兴趣,我也是从小就对机器人感兴趣,我觉得这是人的天性,很多人都会对这个方向感兴趣。
但把实际兴趣转化为行动能力,要越早开始培养越好。要真正上手,才能了解这个领域真正困难的地方。
比如真机部署非常消耗经验。如果能在早期积累这方面的经验,会非常有帮助。
你现在也带博士生,对吧?
对。
你面试博士生时,有什么必问的问题?
我会问学生最感兴趣的一篇文章是什么,或者换一种方式问:他觉得哪篇文章做得最好。
这是一个和research taste相关的问题,也可以说是一个和个人判断相关的问题。
这个问题挺难回答。
确实挺难。它的前提是,学生已经对这个领域有了一定了解,也知道自己的兴趣点在哪里。
你听到过最好的答案是什么?
我有一位学生对diffusion非常感兴趣,但他引用的不是Diffusion Policy,而是最早的那篇diffusion model论文。
我会觉得这个学生看得非常广,并没有局限在控制和机器人应用层面,而是能够追溯到最初的源头,找到这项工作的起点。
我觉得这是一种比较好的能力,也就是刨根问底、找到源头的能力。
你现在会带本科生做研究吗?
也会。我们组里有一些本科生,在我刚来的时候就已经开始跟我做研究。现在能看到他们很大的成长:从一开始兴趣点还不明确,到逐渐了解更多、上手做更多事情,自己的判断力也越来越强。
那你会怎么选择本科生?
现在我们还是比较宽进,因为我希望给大家提供一个平台,让大家有机会了解前沿研究在做什么。
我们组会也会邀请很多本科生来听,形式基本是tutorial。前面大概30到45分钟,会介绍整个领域的发展,有时从科学史角度讲,有时把一个主题分成不同流派来讲;最后15到30分钟,由做报告的同学介绍自己的项目。
主要目的是让学生有一个学习的机会。我觉得这更像一个学习小组。
每周一次吗?
最开始计划是每周一次,后来实际执行下来,应该是biweekly。
tutorial由谁来做?
由学生来做。学生们其实都很厉害。
我会提前和他们确认具体主题,然后一起讨论。第一次通常会带他们过一遍,梳理一下主题的组织方式是否合理。之后学生慢慢就能自己做总结,学习效率都非常快。
一开始问了MBTI,我觉得你还是比较典型的INTJ。你有没有经历过一些偏F的时刻?
我是一个共情能力很强的人。
体现在哪里?
我觉得自己能非常敏锐地观察到别人的情绪变化。所以在一个集体里,我通常会更照顾别人的情绪。
这是好事还是坏事?
我觉得是好事。团队凝聚力需要一些关键人物把大家凝聚起来。
在非工作时刻,比较偏F能够拉近我和同学、合作者之间的距离。我并不希望自己的伙伴都只是工作上的伙伴。
我感觉你确实很有亲和力。
在工作讨论之外,大家和博士生、同事在一起时,还会聊些什么?
也会聊很多别的。我其实很感谢我的学生。
最开始和一批年轻人一起做博士,本身就是一个很有风险、很有挑战的选择。所以我在面试博士生时,会直接告诉他们:如果来我这里读博,可能需要承担一些实验室建设的角色,也可能做一些看起来比较琐碎的事情。
我会提前把这些讲清楚,但他们都愿意接受这个挑战。
这有点像从零开始创业。
确实。但我不太觉得这是一个人的startup,更像是我和博士生一起构建一件事情。
对你来说也是从零到一,尤其是这些博士生此前都不是你认识的班底。
但我们的信任磨合得还挺好。主要是大家有一个共同愿望,就是把事情做好。
有了共同愿望之后,每个人都在合适的位置贡献自己的能力和时间,凝聚力就比较容易构建起来。
你们会团建吗?团建通常做什么?
会团建。前两天我们还一起唱歌。
我自己组织过两次团建,学生们也会组织,有时还会叫上我。我觉得这很好,也是我比较想构建的实验室氛围。
我不希望大家只是工作或学术上的合作者,而是能够成为彼此长期信任的朋友。
最后聊点轻松的。你日常会用哪些AI产品?
我用ChatGPT比较多。最近有一个变化,我会在ChatGPT和Gemini之间轮换使用,因为它们在一些事情上给出的观点确实不太一样。
以前我使用AI更多是为了知识性任务,比如总结内容或者做调研。最近开始和它进行一些工作之外的对话。
你会和AI聊什么?
有时会聊对一些事件的看法,或者最近发生的有意思的事情,可能还是会和工作有一点关系。
比如我最近在给实验室起名字。我会把一些关键词给AI,让它帮我尝试构建名字。我自己先列了一些初步名单,再让它帮我润色或者提出新的方案。
当时觉得它提出的名字都还挺好。
已经定下来了吗?
还没有,还需要继续聊。
最近我遇到好几个人,都说自己所在的领域论文大爆发。你有这种感觉吗?
有。机器人论文最近确实在翻倍增长。
我还认识一位非常垂直的物理学博士后。他说以前他们领域一天可能只有4篇论文,大家每天早上都会刷;现在已经完全不可能了。
对,而且其中有很多是AI写的,质量也鱼龙混杂。
你现在怎么面对整个研究环境的变化?
我现在摄取论文的方式有不同种类。
比如我每天会浏览一些关注的研究者宣传的论文,因为作者列表本身已经完成了一轮筛选:作者认为哪些文章真正值得自豪、值得推广,就会转发和宣传。
尤其在embodied AI,也就是机器人领域,大家已经越来越习惯通过社交媒体宣传自己的工作。国内研究者也会在平台上介绍自己的论文。
我大概每天都会过一遍这些内容,也能明显看到有些文章的AI生成成分非常多。
目前来看,AI写的文章可能通过审稿,甚至可能发表在会议上,但整体质量还是不如人写的文章。AI写的文章第一眼看起来可能很详实,但很多论证其实漏洞百出。
它可能看起来内容很多,实际信息量并不大。所以如果我发现一篇文章是AI写的,我对它的兴趣会打一些折扣。
最后一个问题。大家很喜欢用一个比喻,说具身智能是一场马拉松。马拉松是42公里,你觉得我们现在跑到几公里了?
我觉得跑到10公里,差不多是四分之一的位置。
真正重要的,是把机器人放到实际场景中应用。强调泛化、强调通用能力的智能机器人,目前还没有真正落地,所以还有很长的路要走。
但总体上我还是比较乐观。我觉得未来3到5年,我们可能会通过scaling看到一个明确的范式转变,或者一个明确的拐点。
所以未来3到5年会是非常关键的阶段。
我觉得做创业、做研究、做具身智能、做AI都需要乐观。悲观很容易正确,只有乐观才可能成功。
对。
谢谢梦迪,今天聊得非常开心。
谢谢,谢谢,我再来做客,感谢考警。
好,拜拜,拜。