# “我看到了 Scaling Law 的信号” | 对谈清华叉院助理教授徐梦迪：具身智能、世界模型、真正的泛化

十字路口Crossing · 2026-09-20 · 81 min · https://www.xiaoyuzhoufm.com/episode/6ab0504f0916f6f8b4466ece?utm_source=rss

## 逐字稿

Koji

嗨，我是扣姐。那本周十字路口的嘉宾是徐梦迪。那梦迪呢是清华叉院的助理教授，在回国任教之前，他先后求学于清华、Johns Hopkins以及CMU，也在斯坦福的吴佳俊和李飞飞团队做博士后。那你好梦迪，欢迎来到十字路口。

徐梦迪

嗨大家好，我是徐梦迪，非常感谢扣姐还有十字路口的邀请。

Koji

我们还是先从我们的传统快问快答开始啊，帮助大家了解你。然后请问梦迪你的年龄？

徐梦迪

我今年30.5岁。

Koji

30.5岁，这么精确。求学经历刚才我已经介绍过了，我们直接进入下一个问题：MBTI和星座。

徐梦迪

我的MBTI是INTJ，星座是摩羯座。

Koji

用一句话介绍一下，你当前花时间最多的研究方向是什么？



徐梦迪

我现在最重要的研究方向，是让机器人能够从现实场景当中不断、持续地提升自己。

Koji

这个方向你做了多久？我记得你很早之前就在做泛化。

徐梦迪

对，我从CMU开始，其实就在沿着泛化的方向做。当时我觉得，机器人不能只依赖预先学到的知识。

我们看人类为什么有这么强的泛化能力，其实有两个层面。一个层面是人有很多先验知识，另一个层面是人学习知识的速度非常快。

我觉得真正的泛化，是希望让机器人也具备类似于人的快速学习能力。

Koji

当时是什么契机让你开始进入这个研究方向？

徐梦迪

我到CMU之后，就开始做当时叫作Robot Learning的方向，也就是把机器学习的一些技能和方法用到机器人上。当时还没有“具身智能”这个很时髦的名字。

我在CMU的时候非常喜欢一项叫MAML的工作，是Charles Finn——一位斯坦福教授、也是现在Physical Intelligence创始人之一——非常有名的工作。MAML有一个很厉害的地方，就是它能够让机器人学会没有见过的任务。

我当时觉得，这是真正属于机器人未来的一个方向。

Koji

那你当时是怎么了解到这项工作的？

徐梦迪

当时这项工作确实非常有名。我们实验室有一些同学对机器学习的前沿方向都非常感兴趣，大家平时会互相交流、分享文章。我们看的文章也很杂，所以也是在这个过程中看到了这个方向。

Koji

我记得你清华本科读的是车辆工程系。

徐梦迪

对。

Koji

从车辆工程系到具身智能，中间感觉隔着一个变形金刚。这个转型过程是怎样的？



徐梦迪

我本科确实学的是汽车，我们专业叫车辆工程。现在回头看，当时选择汽车其实是一个非常正确的决定，因为汽车专业学得非常全面。

本科课程会涉及机械设计、汽车电子，这些内容和现在电子专业学生学的东西也有不少交叉，同时还会涉及一些算法。所以本科阶段，我从机械设计到算法都有所了解。

后来真正转向机器人，契机应该是我大二开始做科研的时候。那时我跟着机械系的严少泽老师做研究，方向是生物机器人。我们当时研究的是蜜蜂翅膀的超弹性恢复。

蜜蜂在采蜜的过程中，翅膀会频繁和周围环境发生碰撞，但翅膀不会因此受到损伤，因为它的结构具有超弹性。我们当时就是研究这个现象。

后来我也因此有机会进入CMU的Hobby Cho Set老师的组。他们组非常有名的方向就是生物机器人。大三暑假，我到Howie的组里设计了一个蛇形机器人，让它能够沿着管道爬行。

从那时开始，我逐渐从机械设计转向了机器人的算法设计。可以理解为，最开始做机械设计，后来慢慢开始做算法。

Koji

但这好像也不是车辆工程系学生最常见的路径。

徐梦迪

对。不过后来我发现，我们系的学生有一个特点：如果自己想做一件事，就会非常努力地去寻找和兴趣相匹配的地方。

当时我有一些学长也去了严少泽老师的组，包括杨恒学长，他现在是哈佛的助理教授。我还有一些高中一起参加竞赛的同学，也在严老师的组里。所以我算是阴差阳错、也非常幸运地进入了严老师的组。

Koji

刚才提到你高中参加过竞赛，我也想听你讲讲中学甚至小学阶段的经历。你是一路都是学霸吗？



徐梦迪

我现在特别不敢称自己为学霸。后来不断求学、出国，我看到了非常多厉害的人，觉得大家都有自己的想法。

所谓学不学霸，可能只是有些人把精力放到了学业上，另一些人把精力放到了自己更感兴趣的事情上。

我的小学生活其实过得挺轻松，没有上过什么补习班。课余时间要么参加学校活动，要么和朋友一起玩。

Koji

你是河北人，对吧？

徐梦迪

我是河北人。

Koji

河北哪里？

徐梦迪

衡水。

Koji

所以你上的是衡水中学？

徐梦迪

对，我高中是衡中的。小学的时候，家里也给了我一个比较自由的环境，所以小学过得非常快乐。

当时我有一个很大的兴趣爱好，就是拼四驱车。那时候有一部很火的动漫叫《四驱兄弟》，里面有各种可以自己买零件、组装起来的四驱车。

当时我觉得这是一个很烧钱的兴趣爱好。

Koji

所以你还想过赚钱买四驱车？

徐梦迪

对。我们院里当时有好几个小朋友都很喜欢四驱车，大家想赚钱买四驱车。

Koji

你们是用四驱车赚钱，还是通过别的方式赚钱？

徐梦迪

通过别的方式赚钱，再买四驱车。

Koji

怎么赚钱？

徐梦迪

我们放学路上会捡一些小垃圾，然后拿去卖掉。其实还挺赚钱的，很像一个城市寻宝游戏。

Koji

什么样的垃圾能卖到买四驱车的钱？

徐梦迪

当时会有一些钢铁零件，有人会回收这些钢铁零件。

Koji

现在想起来，你小时候还挺有毅力的，也感觉很小的时候就埋下了车辆工程的种子。

徐梦迪

对。后来想了想，这也是我选择车辆工程的原因之一，因为我一直觉得机械结构非常酷。

它能够把很多很小的零件整体组装到一起，其中凝结了很多代工匠的知识积累，最后形成一个非常精密的系统。

Koji

那你在衡水中学的体验是什么样的？

徐梦迪

我自己的体验其实还挺好的。因为我高中学的是竞赛，是竞赛生，所以我们的主业就是学习竞赛，和高考班的管理要求不太一样。

某种程度上，竞赛需要激发学生自己更加主动、更加有动力，所以我们整体上学习高考课程的时间，和高考班会略有不同。

Koji

怎么才能成为竞赛生？

徐梦迪

应该是在高一第一学期结束的时候，学校会做一次整体的意向调研，老师会来问大家对哪一科更感兴趣。

我当时在数学和物理之间选择，后来觉得物理是一门非常贴近现实世界的学科，所以选择了物理。

Koji

我听说衡水中学很多学生早上五六点就起床，日程安排细到每一分钟、每五分钟。我有一个朋友后来去了复旦，现在在做基金。他说他们当时甚至一个星期只有一次洗澡机会。

徐梦迪

衡水中学不管是对高考班还是竞赛班，要求其实都比较一致。早上起来要跑操，上午也要跑操，有固定而且严格的作息时间。

学校还会把高一、高二、高三的时间错开，让大家错峰去食堂。这一层面的管理确实比较严格。

Koji

现在外界对“衡水模式”有很多讨论，大家也很感兴趣。你观察到的衡水模式，最后培养出来的学生会有怎样的发展？会比较多元，还是会更偏向应试教育？

徐梦迪

我的观察主要基于自己的经历。因为我在竞赛班，竞赛班有一个很明显的特点，就是每个人都有非常强的想法。

大家为什么选择参加竞赛？因为竞赛需要非常强的时间投入。比如普通高考生有暑假和寒假，而我们往往会利用这些时间参加集训。

所以我的竞赛班同学里，有一部分人后来出国，成长为非常优秀的研究者；也有一部分人留在国内发展。

Koji

听起来，竞赛有点像一条不归路，会有这种感觉吗？

徐梦迪

确实会。参加竞赛以后，你不能像普通高考生一样，系统学习很多常规科目的知识。

我们先参加竞赛考试，之后通过保送、自主招生等方式确定去向。等到最后确认可能没有保送机会，才会进入正常的高考班。那个时候时间已经很短了，通常都到了高三下学期。

Koji

这有点像创业，是破釜沉舟。

徐梦迪

对。不过当时觉得这是非常有意思的经历。学习竞赛时会很有干劲，因为身边的朋友都有同样的愿景：小到把一道题解出来，大到冲击省一等奖、金牌等。

所以大家做这件事的动力很强，也不觉得苦。

Koji

竞赛中的竞争关系强吗？

徐梦迪

不算强，可能是因为教练引导得比较好。

当然，清华每年在河北的竞赛保送名额是有限的。竞赛首先要考进省赛，拿到省一等奖之后，会从中挑选一部分人进入省队；进入省队后，还要参加国家集训队等选拔，一直到国家层面的考试，所以竞争肯定是存在的。

但我们当时更像是一种同伴关系，竞争关系相对较弱。

Koji

教练是怎么引导的，能够营造出这样的班级氛围？

徐梦迪

我觉得主要是大家都从零开始成长，更像是一起抱团解决问题。

如果所有人都处在同一个阶段，然后一起慢慢成长，我觉得战友之间的情谊会比竞争关系更强。

Koji

你在CMU时也是机械工程系。博士毕业的时候，你的论文还拿到了系里的最佳博士论文奖。

徐梦迪

对。

Koji

这个奖应该很难吧？一年大概一位，还是几位？

徐梦迪

我们那一届一年有两个人。

Koji

你的博士论文主要研究什么？



徐梦迪

我的thesis叫《Building Adaptable Generalist Robots》，读起来有点拗口。

Koji

还是和刚才的方向一样。

徐梦迪

对。核心就是希望让机器人具备适应变化环境的能力。

预训练本身当然非常有用，我也非常相信scaling，但预训练不是全部。我们不能寄希望于机器人只通过预训练，就变成一个百分之百成功、非常强的个体。

机器人部署到真实环境之后，一定需要适应具体环境的变化。现实环境是一个开放世界，开放世界的特点是任务在不断变化。

比如我家里今天可能有20个物体，但一周之后可能会有30个物体，而且物体的种类也会发生变化。人的偏好也会在不同场景中不断变化，这些都是开放世界的体现。

对应到机器人，我们希望它能够适应环境带来的变化，并且在变化的环境中不断提升自己。

Koji

当时你主要采用了哪些解题思路？

徐梦迪

当时主要探索了几个思路。第一个是机器人的in-context learning，第二个是通过test-time training，也就是在部署时改变模型的一小部分参数。

它们本质上都是为了同一个愿景：让机器人不再只受限于预训练，而是能够通过交互、通过上下文，在现实场景中不断学习。

第一个方向是in-context learning。这个方向从我的一项叫作《Prompt Decision Transformer》的工作开始。那是2021年的工作，现在看已经是5年前了。

当时的主要动机，是看到了GPT-3。GPT-3已经具备in-context learning能力，这让我觉得非常酷。传统机器学习的思路是，训练完成之后，如果遇到新任务，就进行fine-tuning。

但GPT-3可以通过上下文学习，也就是说，你可以通过prompting给它一个任务定义，或者规定一种输出格式，模型就能根据prompt改变自己的输出。

我觉得这非常厉害，因为在部署环境中不需要重新训练，这是一种更高效、更快捷的适应方式。于是我们就想，机器人是不是也能具备这样的上下文学习和快速适应能力。

《Prompt Decision Transformer》是从一个相对简单的设定出发：给模型一些机器人的demonstration，让它适应不同的locomotion任务，以及不同的manipulation任务。

第二个方向是《Hyper Design Transformer》，算是《Prompt Decision Transformer》的延续。它沿着test-time training的思路，在部署时改变模型中的一部分参数。

但改参数像一把双刃剑。它确实能让模型解决目标任务，但如果修改的参数过多，模型可能会遗忘之前预训练得到的知识。

所以我们当时采取了一个折中的方法：先让模型学习一个hypernetwork，把原有知识注入hypernetwork的参数中，然后再通过hypernetwork生成少量adapter。这个adapter只占整个Transformer参数的约0.5%，我们只需要适应这0.5%的参数。

Koji

效果怎么样？

徐梦迪

在预训练数据量较少的前提下，Hypernetwork更容易奏效。但现在数据量不断积累，预训练规模也不断扩大，所以我个人认为，真正的未来方向还是in-context learning，也就是使用prompting的方式。

因为这样不需要修改模型参数，或者只需要在模型学习、收集更多多任务之后，再进行批量参数更新。

Koji

现在我们做的事情，和当时的工作有什么延续或者发展？

徐梦迪

主要是发展。自从做完《Prompt Decision Transformer》之后，沿着in-context learning让模型具备快速适应能力的工作越来越多。

其中有一项我觉得很有意思的工作，叫Algorithm Distillation，是DeepMind研究人员做的。它提出了一个很有意思的问题：你的模型到底应该等价于什么样的智能？

现在大家使用VLA时，通常把模型参数看作包含了任务相关知识。因为我们使用专家demonstration，通过模仿学习把专家示范中的知识蒸馏到模型参数里，这是一种对应关系。

另一种对应关系，就是Algorithm Distillation提出的想法：模型参数应该等价于一个算法，更具体地说，应该等价于一个强化学习算法。

它的做法是，把一些次优轨迹放进上下文窗口，让模型根据过去执行中不好的动作和历史，不断改变未来的动作。这样，Transformer结构就具备了自我提升的能力，模型参数等价于一个强化学习算法。

Koji

这项工作最后是在模拟器里，还是在真实机器人上实现的？

徐梦迪

它在模拟器里实现了效果，但当时的任务大多偏向导航或者运动控制，比如走迷宫和一些locomotion任务。在manipulation领域，目前还是相对困难的。

沿着这个方向，后面还有一些工作。比如depark他们组有一篇叫local former的文章，也是在用基于Transformer的in-context learning实现适应，并部署到四足机器人上，但同样更偏向locomotion。

后来还有Robot TTT，这是NVIDIA最近发表的一项工作。它可以让机器人观看人类长程manipulation视频，或者通过test-time learning改变模型的行为，让机器人学习人类示范中的动作。

Koji

听起来，大家的思路还比较发散。你现在感觉到有收敛的迹象吗？

徐梦迪

我觉得大家最近越来越重视adaptation。因为大家逐渐发现，仅仅通过大规模数据和大规模模型的预训练，机器人确实无法解决所有应用问题；仅仅通过基于专家示范的模仿学习，也同样不够。

在这个基础上，adaptation就变得尤其重要。最近这个方向正在逐渐形成新的共识。

Koji

这个听起来好像不需要特别讨论，它本来就应该重要。那为什么直到现在它才变得重要？

徐梦迪

因为我们在观察人为什么有很强的泛化能力时，会发现有两个原因。

第一个原因是人有大量积累。这种积累从生物进化的角度来看，包括我们本身具备非常强的小脑控制能力；在不断学习的过程中，人的先验知识也会通过记忆等方式保存下来。

第二个原因是，人学习新东西的速度很快。这两点共同构成了人很强的泛化能力。

过去大家主流的方式，是通过scale数据和scale模型，让模型的多任务能力、指令跟随能力变得更强。它有点像先通过数据采集，让模型拥有足够强的先验。

但这并不意味着adaptation不重要。可能正因为如此，大家最近才越来越意识到，机器人的模型确实需要很强的适应能力。这也是从机器人未来实际应用场景出发的考量。

当然，机器人要有较强的adaptation能力，对基础模型也有一定要求。我们不希望机器人到了真实场景里虽然能够自己学习，但学习过程非常可怕，比如把杯子打碎。

为了避免这种情况，模型必须具备比较强的基础能力。所以大家从foundation model开始做，我觉得也是合理的。

Koji

你博士后去了斯坦福，在吴佳俊和李飞飞的团队。当时主要做了什么工作？



徐梦迪

我觉得当时做了3个自己比较满意、也很感兴趣的工作。

Koji

这是多长时间内做了3个工作？

徐梦迪

我有非常强的合作者，所以非常幸运。

当时做的事情，主要是把博士期间的一些想法变得更落地、更实际。

第一个工作是BEHAVIOR benchmark。这是李飞飞团队投入了大量时间和精力做的一个benchmark，尝试回答一个问题：机器人到底应该解决什么样的任务？

BEHAVIOR包含很多模拟场景，包括家庭场景和学校场景，也有大量开放源代码的资产，研究者都可以使用。所以它回答的是：什么样的任务比较重要。

我在其中的角色，是帮助生成一些数据集。我们当时提出了momentum这样的方案，通过人工操作生成模拟环境中的数据。和我博士期间的工作相比，这项工作更加落地，因为之前没有太多涉及local manipulation，而很多长程操作任务其实非常困难。

第二个方向，是让机器人变得更加steerable，这和我的主线研究更相关。Steerable本质上是让机器人能够遵循更多样、更丰富的人类语言指令，并适应不同人的偏好。这个方向我们发表了两篇相关工作，我都很喜欢。

第三个是Creative Tool Use benchmark，希望机器人有一天能够具备类似人的创造性物理工具使用能力。

Koji

这个benchmark怎么做？它既要creative，又要benchmark。

徐梦迪

我们当时是从人的数据开始采集的。这个benchmark想回答的问题是：人在现实中使用工具时，并不是根据工具的名字来使用，而是根据工具的功能，也就是机器人领域所说的affordance来使用。

比如今天想切蛋糕，但手边没有蛋糕刀，也可以用叉子或者筷子把蛋糕切开。人在使用工具时，依据的是工具的功能，而不是工具的名字。

再比如想清扫桌上的一些物品，有扫帚当然可以直接用；如果没有，也可以用书本，甚至可以用机器人的小臂，把桌面上的物体整体扫到一起。

人会创造性地使用身边的物体，我们希望机器人也具备类似能力。所以这个benchmark最开始采集了很多人创造性使用工具的数据，包含第一视角和第三视角对齐的数据。

Koji

这个benchmark如何评估？是把什么任务交给机器人？比如切蛋糕、擦桌子？

徐梦迪

这也是一个很有意思的问题。我们当时确定了3个想要benchmark的维度。

第一个，是现在的多模态大模型选择工具、生成工具使用轨迹的能力。

第二个，是从视觉角度出发的场景重建能力。机器人使用工具时，经常要操控一些不常见的、非刚体的物体。比如蛋糕是柔性、可切分的物体，水也是可变形物体，所以这些物体的4D重建相对困难。

因此，第二个维度是评估不同方法进行3D和4D重建的能力。

第三个，是机器人能不能具备类似的工具使用能力，也就是现在的方法有没有一种现成的方式，把人的灵巧工具使用能力迁移到机器人的灵巧工具使用能力上。

所以总共有3个维度。

Koji

你在李飞飞团队时，李飞飞是什么样的风格？团队氛围怎么样？

徐梦迪

我当时有两位导师，李飞飞和吴佳俊。能够有两位导师非常幸运，因为他们的风格很不一样，给我的收获也不同。

李飞飞会更加vision-driven。她经常问我一些问题，让我跳出单个项目、单个benchmark去思考：这个领域未来10年甚至更长时间，什么才是真正重要的问题？你在这个领域里应该扮演什么样的角色？

她不一定会直接这样问，但在讨论中经常提出能够引发思考的问题。总体来说，就是思考未来，以及自己能够做出的最重要的贡献是什么。

Koji

有具体的问题你还记得吗？

徐梦迪

比如当时我们在确定benchmark的metric时，希望给参赛者更细致的指标，包括进度、成功率、时间等，所以会把metric定得非常细。

但李飞飞会问：这些指标里，哪个是真正重要的？

其实只有一个，就是最终成功率。其他指标从开发和调试的角度看很重要，但从最终愿景来看并不是真正重要，真正重要的只有success rate。

她当时引用了爱因斯坦的一句话叫“把事情变得简单不是更简单。”这句话的意思是，希望大家思考更本质的问题，让事情变得简单，而不是仅仅变得更简单。

从博士成长到博士后，再到PI，考虑的事情确实不一样。博士阶段考虑的是如何把事情做成，所以需要关注很多细节指标，指导自己如何调试方法。

但成为PI之后，要做的是让大家关注真正重要的那个点，要跳出来。不是只解决问题，而是定义问题，从解题人变成出题人。

吴佳俊相对来说更含蓄一些。我会和他讨论项目应该做什么，也会讨论具体的设计细节。如果我有迷茫，他也会推动我去做真正能够建立自己research brand的工作，给了我很多支持。

Koji

这还挺难得的。作为共同导师，他们是非常好的组合。

说到research brand，应该怎么理解？每个人都应该追求research brand吗？有没有什么心得可以分享？

徐梦迪

我的想法是，research brand应该从自己的研究兴趣出发。真正能够让你持续花10年甚至更长时间研究的问题，本身就应该能够定义你的research brand。

有人会说，research brand需要和别人不一样，但这并不是本质。最重要的是，你觉得什么问题重要，然后愿意花时间去研究它。

如果你对一个问题研究了超过3年、5年，它本身就已经成为你的research brand。

Koji

这听起来还是和创业很像，要从自己的热情出发。

徐梦迪

对，从自己真正相信的地方出发。

Koji

我最近也在看Paul Graham。他有一篇文章叫《如何成就伟大事业》，里面讲到，当你远远看一个知识体系时，它像一个球，表面平滑而且完美；但你只要走近，就会发现球体坑坑洼洼，里面还有大量漏洞和黑洞。

这些坑洼、漏洞和黑洞，就是创业机会，也是研究值得继续做下去的起点。

那你为什么决定回国？听起来，如果继续留在斯坦福发展，也是一条很自然的路。



徐梦迪

我是在2023年的时候，回清华交叉信息研究院面试的。当时我已经进入博士第五年，开始考虑之后的发展方向。

对我来说，大的选择无非是工业界和学术界。当时我在Google实习了很长一段时间，体验非常好。我的mentor给了我很多帮助，包括帮助我建立自己的research taste。

工业界确实有资源做更大规模的事情，相对来说，学术界在资源方面会有一些限制，所以当时我也思考了很久，到底应该去工业界还是学术界。

去交叉信息研究院面试的契机，是我有幸认识了吴毅老师。他帮我搭了一个桥，拿到了交叉信息研究院的面试机会。面试时和院系老师、和姚先生交流，我的体验都很好。

交叉信息研究院有几个优势。第一个是人非常强，学生非常强。很多做机器人和人工智能的人，在美国也会认识一些姚班的人。姚班有很多毕业生，后来成为各个领域顶尖的研究者。

第二个是，我自己的研究方向是机器人。机器人本身是一个系统，单纯只做大脑，或者单纯只做硬件，我觉得都不完整。

我需要找一个最合适的地方，把机器人做成一个真正能够落地的系统。综合考虑之后，交叉信息研究院是对我来说最优的选择。

Koji

刚才你提到，在工业界和学术界之间想了很久。后来是怎么做决定的？现在应该有很多人也面临同样的十字路口。

徐梦迪

在做决定之前，包括来交叉信息研究院面试之前，我找了很多朋友和师长寻求建议。后来发现，真正促使自己做决定的，还是要回到自己内心具体想要什么。

工业界可能有很多算力支持，你可以更容易地把一个小想法scale up；但同时，工业界也可能存在自由度的缺失。

对我来说，自由度非常重要。我希望自己的时间能够最大化地分配到我认为重要的问题上。因此，学术界对我来说是相对更优的选择。

当然，每个人的想法都会不同，但最后还是要回到自己心里真正觉得什么东西重要。

Koji

你刚才提到，回来面试时体验很好。之前我们聊天时，你说吴毅老师当时问了一个让你印象深刻、好感倍增的问题。

徐梦迪

那个问题其实不是吴老师问的，是另外一位老师问的。

当时的问题，也是我后来一直在思考的问题：你为什么觉得自己5年之后一定能够成为自己领域顶尖的研究者？

我当时回答得并不好。我非常自信地说：“我觉得我一定可以。”大概就是这种风格，相信自己能做到。

但后来逐渐想，这个回答其实不太好。更准确的说法应该是，如果我找到了真正感兴趣的主题，比如让机器人有一天进入千家万户，并且能够在实际环境中不断提升自己，这是我非常感兴趣的问题。

如果我沿着正确的道路研究5年，我觉得自己一定不会差。还是要专注，并且真正深入地思考这个问题。

Koji

当时姚先生面试你的时候，问了些什么？

徐梦迪

我们聊的内容很广，包括生活和研究。姚先生也问我为什么想回到交叉信息研究院。我当时的回答和现在差不多：我觉得这里是一个很好的平台，也有自由度去做自己想做的事情。

姚先生给我的一个建议，是我后来在博士后阶段也非常受益的：要把自己的注意力更加集中。

真正重要的问题可能没有几个，而一个人的时间非常有限。如果把时间摊在太多事情上，结果可能并不好。所以他建议我，一定要专注于自己真正感兴趣的事情。

Koji

我听起来觉得你好奇心也很强。

徐梦迪

对，我对很多事情都很好奇，所以可能需要不断提醒自己专注、专注。

不过后来我发现，不同领域之间其实有很多互通的东西。机器人本身是一个很大的集成性学科，有人做硬件，有人做算法，也有人做学习算法，但如果最终目标是把机器人落地到真实应用，这些东西都需要有所了解。

机器人已经不存在“我只做硬件”这样的单一划分了。尤其在AI时代，它需要一个比较全面、整体性的知识体系。

Koji

你现在怎么平衡？一方面要专注于自适应和泛化，另一方面又要了解领域里发生的很多事情，而这个领域每天都有很多头条新闻。

徐梦迪

我现在看头条新闻没有那么多，可能会更多地看论文和一手信息。最近国内机器人确实发展得非常快，国外的机器人研究也已经成为一个很好的研究主题。

但还是要花更多时间在自己真正研究的地方。如果一直看各种消息，很容易迷失。我和一些美国朋友交流时，大家的共识也是，真正重要的事情还是手头正在做的事情：那些你觉得未来1年、2年，甚至更长时间后，可能改变这个领域的东西。

所以还是需要沉下心来做研究。

Koji

你现在认为最重要的事情，就是机器人的自适应和泛化，对吗？

徐梦迪

我现在认为，真正重要的是让机器人具备in-context learning能力，让它不再只被预训练时见过的数据定义。

模型应该能够根据从环境中收集到的信息不断学习，比如失败案例、人的示范、机器人的示范、人的身体姿态，以及人给出的纠正指令。最终，它应该成为一个能够自己运行、在场景中不断学习新任务的智能体。

Koji

在很多外人看来，你的人生非常一帆风顺。听到这个词时，你是什么感受？你会这样形容自己吗？

徐梦迪

我其实也踩过很多坑，也经历过很多转折。

比如看我的发展经历，最开始做设计，后来逐渐转向learning、算法和模型。中间每次转型都不算完全顺利。

但如果总结我的成长经历，我觉得更多的是幸运。每个阶段都有非常好的朋友、老师和mentor支持我。所以我会用“幸运”这个词形容自己。

Koji

这种幸运是从天而降的，还是你觉得获得更多幸运也有一些方法和规律？

徐梦迪

可能是因为我交到的朋友都非常好，大家能够互相支持、互相帮助。

某种程度上，一个人成长成什么样，一部分由自己决定，另一部分取决于选择了什么样的环境。环境也会反过来影响你。

Koji

那你是怎么选择环境的？

徐梦迪

我选择环境时，更多看的是自己能不能在这个环境中发挥最大的作用，或者最大化自己的兴趣点和能力。

Koji

这很有意思。我原本以为你会说选择最好的环境，但其实不是。

徐梦迪

因为好不好可能有一个普遍的标准，但对个人发展来说，还是要选择最适合自己的。

比如你选择一件事、进入一个环境之后，自己的能力能不能因此翻倍。不是简单的double，而是像游戏通关一样，不断通关，把它当成一个游戏来做。

Koji

在进入一个环境之前，无论是去交叉信息研究院、CMU还是斯坦福，你怎么尽可能多地了解这个环境是否适合自己，是否能够放大自己的能力？

徐梦迪

这个时候信息采集非常重要。我会先找朋友，看能不能连接到相关的人；如果不行，就发邮件建立联系。

后来我发现，研究者中有很多人都非常热心。如果你能够正确表达自己的请求，大家通常愿意互相帮助。

Koji

对很多I型人格的人来说，这一步挺难突破。你有什么小技巧吗？

徐梦迪

我自己也是I型人格。后来我觉得，在自己的专业领域里，需要尽可能使用适合自己的方法。

即使是I型人格，也可以遵循一些流程。比如，可以先自己写一版邮件，再让AI帮忙润色，让表达更礼貌、更合适。

现在工具很多，只要正确使用工具，我觉得已经没有什么事情是无法达成的。

Koji

现在应该也有很多学生、学弟学妹给你发邮件或者打电话。什么样的邮件和电话，会让你更愿意回复？

徐梦迪

有些邮件明显是纯AI写的，这种我通常不会回复。给别人发邮件，最重要的是表现出诚意。

诚意体现在，第一，你确实了解这个领域；第二，你确实了解这个方向。也就是说，你能不能把自己的兴趣落实到实际工作上，这条链路是不是能够走通。

很多人只有兴趣，但没有落实，这是需要注意的地方。如果一个人能够清楚地分析自己的兴趣，同时说明自己愿意做什么，那通常说明他比较有想法。

这样的学生，我一般愿意把流程推进到下一步，再多聊一聊。

Koji

刚才你也提到自己经历过多次转型。你觉得过去最艰难的人生十字路口是什么？

徐梦迪

最艰难的选择，确实是要不要回国。从某种程度上说，也是选择工业界还是学术界。

这对我来说是一个非常大的决定，我考虑了很长时间。我的科研生涯绝大部分时间都在美国，所以当时也会犹豫，自己回国之后能不能适应。肯定会有很多挑战。

我特别喜欢机器学习里的一个概念，叫“No Free Lunch”，也就是天下没有免费的午餐。你做出一个选择，就一定要承担这个选择在某些方面相对较弱的地方。

经过很多考虑，我发现自己最看重的还是自由度，也希望把机器人做成一个完整的系统，让它能够真正落地。因此综合考虑之后，回国做教职是我的最终选择。

Koji

回来一年多，你应该见到了很多具身领域的研究者和创业者。你现在对中国具身创业的整体感受是什么？



徐梦迪

在回国之前我就了解了一些，觉得非常令人兴奋。大家都很有干劲，沿着机器人系统的不同层面做事情。

回来之后，包括结合之前的了解和现在的观察，我的整体感受是：确实有很多实际进步，但也存在一些泡沫。这两件事并不矛盾。

好的地方是，在整个机器人系统层面，从材料、传感器、本体，到数据和模型，都能看到相应的国内公司在沿着这个方向攻关。也有很多资源投入到这个方向。

所以从长远来看，我还是非常乐观的。我觉得机器人一定会取得实际进步，而且现在确实已经有实际进步正在发生。

但同时也会有泡沫。因为具身智能本身还没有收敛，大家沿着不同的路径、不同的信念向前走，焦点肯定会发生转移。

有时候大家关注数据，之后可能转向世界模型，后来又重新关注数据。这是一个焦点不断变化的过程。在这种多变的情况下，泡沫一定会存在，就像控制系统里可能会出现超调。

Koji

什么是超调？

徐梦迪

比如PID参数没有调好，系统可能会发生振荡，这就是一种超调。

Koji

上次和你聊天时，感觉去年很多人都在说先做数据，上半年大家又都在做世界模型，最近似乎又开始讨论数据。你觉得这种转移是为什么发生的？

徐梦迪

其实是大家看问题的角度发生了一些变化，但并不是完全转移。大家的关注点会逐步变化，可能从数据到模型，再从模型回到数据，之后又回到模型。

这说明大家在不断思考：这个行业里什么是真正重要的问题。但数据和模型其实都非常重要，并不是两条互斥的路线，而是在看两个不同层面的问题。

具身数据确实非常稀缺。数据决定模型能够看到什么，而模型，尤其是世界模型，相对于VLA来说，可能是一条新的路线。它更关注representation是什么，以及模型如何理解世界。

这和VLA更关注任务的路线确实不太一样。我自己也比较相信世界模型，因为任务本身是一种很难scale的方式。任务实在太多，不可能通过穷举解决。

如果能够通过世界模型，让模型学习世界变化的规律，这是一种更加基础、更具普适性的能力。

Koji

在中国和美国，你分别最关注哪些公司或实验室？

徐梦迪

我关注的比较多，主要看哪些公司的研究和我的方向、我的信念比较相关。

美国方面，我肯定会关注Physical Intelligence，也会关注Google、NVIDIA等大公司，以及Generalist等初创公司。Roda的路线我也觉得很有意思，尤其是他们最近在尝试in-context learning。

国内也有一些公司的工作我很喜欢，比如林波他们最近发布的LingBot-VLA 2，也是沿着in-context learning的路线在做，我觉得这是非常有意义的工作。

Koji

最近你看到什么scaling law的信号了吗？

徐梦迪

我看到了一些，但不是我们自己的结果，而是其他公司发布的一些结果。

比如从10万小时扩展到100万小时预训练数据之后，模型在一些hold-out，也就是没有见过的数据集和测试集上，能够取得更好的效果。

但现在大家测得更多的是loss。机器人领域有一个很tricky的地方，就是loss和成功率并不直接相关。可能loss很低，但最终成功率不一定高，甚至会出现很多振荡。

举个例子，假设机器人要拿起一个杯子，一共需要20步。前17步可能都没有接触到杯子，即使这17步拟合得非常好，只要第18步真正接触杯子时误差比较大，整个任务就很容易失败。

所以在时间序列上会存在不平衡，导致loss和成功率大部分时候并不直接相关。

如果未来能看到一种真正有意义的scaling law：数据量逐渐增加，模型逐渐变大，模型在没有见过的任务上的成功率逐渐升高，那才是我真正想看到的scaling law。

Koji

所以目前能看到一些信号，但还没有那么强。

大家很喜欢讨论一个问题：机器人到底有没有自己的GPT moment？你觉得会有吗？

徐梦迪

我觉得会有。我还是非常相信scaling。

现在主流的具身模型，基本还是沿着这样的路线：先做一定程度的预训练，预训练之后，再根据目标领域进行fine-tuning。

这可以类比语言模型的GPT-1阶段。GPT-1本身也需要有针对性的后训练或fine-tuning，才能解决相应任务。

但我真正希望看到的是类似GPT-3的时刻：模型可以通过in-context learning、通过prompting，获得和任务相关的信息，但不需要fine-tuning，而是只通过context告诉模型具体要做什么。

这样，fine-tuning的比重会降低，模型也更容易通过ICL进入更多场景，完成更多任务。

Koji

普通人也可以用起来。

徐梦迪

对。

Koji

在具身领域，当我们关注scaling law带来的GPT moment时，你觉得有哪些benchmark特别值得关注？有没有这样的榜单？还是说不需要这种benchmark，GPT moment一旦发生，所有人自然就能感受到，像魔法一样？

徐梦迪

我觉得还是需要一些benchmark，尤其是具身领域。

语言模型发展过程中有很多benchmark，虽然大家也有不少争议，但在一定程度上，benchmark确实帮助了模型发展。

具身领域的evaluation或者benchmark会更加重要，因为机器人有一个physical body。评估时不能只看模型的成功率，还要关注失败情况和风险情况。

这些都需要通过预先设计的benchmark，告诉模型开发者和用户，它的能力边界在哪里。所以具身领域的benchmark会更加重要。

Koji

现在很多公司都有闭源的、内部使用的评测标准，外界很难知道。开源benchmark方面，你有什么推荐？

徐梦迪

我还是想推荐BEHAVIOR。它包含更长程的任务，也有很多家庭环境和物体布置。

它可能的缺点是会受到sim-to-real gap的批评，但如果从模型能力角度来说，simulation最终只是一种环境。

Koji

BEHAVIOR从你们当时做出来到现在，一直有人维护和迭代吗？

徐梦迪

对，一直有人维护，它的易用性也在逐渐提高。

Koji

今年上半年，英伟达的金范有一场在中国和美国都引起很多关注的演讲。他认为具身智能的发展会严格对应语言模型经历的几个阶段。你认可吗？

徐梦迪

总体上我认可。

比如语言模型里大家已经知道的scaling、scaling law，以及foundation model的出现，还有in-context learning能力，这些在具身领域也会出现。

但不同的是，具身领域会有一些侧重点变化，也有机器人自身的独特性。

首先，机器人的安全性需要更早被考虑。在部署之前，需要有类似stress test的评估，才能真正把机器人部署到场景中。这些问题比语言模型领域更加关键，也更加紧迫。

另外，机器人的context更加多样，因为它有身体，所以灵活性更强。它可以观察周围环境，context中会有更多不同的含义。

总体来看，机器人模型一定会被scale up，但关注点可能会有先后顺序上的不同。

Koji

我在想，今天大家都愿意使用最先进的语言模型。我给它一个任务，它有时候20分钟才回复，但我觉得完全可以接受，反正等着就好，而且我可能同时运行很多任务。

但对机器人来说不可能。一秒钟没有反应，我都觉得它是不是死机了，甚至想过去拍一拍它。

徐梦迪

实时性确实是非常重要的。具身模型不可能20分钟才给出一个反应，它需要实时和周围环境交互。

Koji

所以还有很多工作需要攻克，确实任重道远。

我们前面聊了很多行业观察，再回到你的工作。最近一两个月，你做的最重要的事情是什么？



徐梦迪

最近最重要的事情，是沿着in-context learning这条路线不断向前推进。

我想先解释一下，in-context learning在具身领域具体意味着什么，以及它最终可能实现什么能力。

举一个简单的例子。大家看到很多机器人demo都是叠衣服，假设我们就拿叠衣服来说。现在的demo往往是把衣服叠成方块，但这里有一个假设：每个人家里的衣服都叠成方块。

可实际上并不是这样。比如我自己使用胶囊衣橱，衣服都是卷起来的。我希望机器人到了我家以后，我告诉它：“我的衣服是这样叠的，请把衣服好好卷起来。”

另一个人可能会告诉机器人：“我的衣服按照固定颜色摆放。”还有人可能根本不用叠衣服，直接把衣服挂起来就可以。

所以，in-context learning想解决的是，让模型具备由终端用户定义的能力。终端用户可以根据自己的偏好和需求，改变模型的具体能力以及行为。

这可能是我们最终希望机器人实现的事情。

再比如，机器人一开始不会做某道菜，但我想让它做这道菜，于是我给它示范一次。机器人可能学习了1000个类似任务。最开始它需要30分钟适应，慢慢可能只需要10分钟，甚至更短。

我们训练的其实是模型快速学习新任务的能力。如果这种模型能够部署到更多场景、更多家庭，甚至服务场景中，它就会在不断强化学习能力的过程中，学得越来越快。

所以我非常相信，in-context learning最终能够成为让模型scale up的一种方式。

Koji

但要实现这一点，似乎依赖很多外部突破，不管是机器人本体、世界模型，还是其他环节。我能想到很多问题。你觉得现在最可能做不到的点在哪里？最大的bug会出在哪里？

徐梦迪

最难的点，是能不能让模型拥有一个稳定的数据闭环。

刚才提到，这种方式需要和具体场景结合。你要把机器人真正放进终端家庭或者服务场景，还需要有合适的mentor教机器人做事情。

同时，机器人需要在用户教了它半个小时之后，呈现出一些显而易见的进展。只有这样，终端用户才愿意继续使用，数据闭环才可能真正转起来。

这就有一个鸡生蛋、蛋生鸡的问题：基础模型需要足够好，学习能力和学习速度才会足够快；但模型又需要先进入真实场景，让用户开始使用，基础能力才能被激发出来。

能不能真正跑通这个数据闭环，是目前最有风险的一个点。

Koji

我们现在已经跑通了什么样的数据闭环？比较简单的闭环是什么样？

徐梦迪

我们现在在做一些比较简单的桌面任务，采集人的纠正指示，让机器人根据人的纠正、示范来改变自己的行为。

目前还是先从桌面任务开始。

Koji

这些都是真机吗？

徐梦迪

对，都是在一个by manual setup，就是双臂的一个场景，同时呢也会有一个灵巧手。我们最终希望实现的是全身灵巧操作。

Koji

你们做的事情，和离线模仿学习之间是什么关系？有哪些相同和不同？

徐梦迪

离线模仿学习的一个相对公认的定义是：你有一些专家数据，通过监督学习，也就是模仿学习的方式，从这些专家数据中学习。

这本质上回到了刚才说的Transformer和Algorithm Distillation的区别。

模仿学习是把模型当成一个任务记忆模块。大规模训练之后，如果你想让它解决一些泛化场景，比如没有见过的任务，实际上寄希望于模型具备插值泛化，也就是interpolation generalization。

比如模型看过桌面上5个物体、10个位置，之后给它一个相关范围内的新位置，它可以把任务解决。但它其实没有学习新任务的能力，因为它本质上是在记忆数据中的动作知识。

我们想做的，是让模型有针对性地看到不同类型的数据：比如次优数据、人的身体姿态、语言纠正指令、人的示范、机器人示范等。

这些丰富的离线数据，能够激发模型不同的能力，远远超过单纯通过模仿专家示范所能赋予模型的能力。

Koji

说到交叉信息研究院，大家会想到一些名字，比如现在在创业领域非常活跃的助理教授许华哲、高阳、陈建宇等。你们最近有时间坐下来一起聊天吗？大家会一起开会吗？

徐梦迪

大家私下里确实都挺忙，很难找到一个时间让所有人坐下来一起聊，但平时会有一些沟通。

大家做的事情，整体vision大致相同，都是希望通过scale up，把机器人落地到实际应用场景，让机器人真正有用。

但细节上的路径会不同。有些人更关注视觉模型，有些人希望做融合路线，比如VLA加视觉模型。

短期来看，这是一件好事，因为这个领域确实还没有最终收敛。

Koji

大家共同感兴趣的话题是什么？

徐梦迪

共同感兴趣的话题，是如何让模型scale up。平时也会讨论数据，以及如何让模型进入真实人的场景。

我之前也和高老师聊过一些相关主题。

Koji

说到数据，我记得之前我们沟通时，你提到数据最难的地方在于需求定义。为什么难在这里？

徐梦迪

数据会被喂给模型，但数据的定义不是凭空产生的，而是由模型能力决定的。

大家定义数据时，本质上是在思考模型需要什么能力，再反推数据应该如何采集。

比如如果希望模型的动作更平滑，就需要采集平滑类型的数据。如果希望模型具备failure recovery，也就是从失败中学习的能力，数据里就需要包含失败和纠正。

无论是VLA模型还是世界模型，都需要有失败和修正的数据。所以数据的定义，应该由模型的能力来决定。

现在大家对模型能力的定义还比较模糊，这也是很多研究者正在逐渐思考的问题。

比如，基础模型是否需要具备分割、tracking、深度重建、法向重建等更偏计算机视觉的能力？

又比如，in-context learning本身就是一种新的能力，它要求模型能够从更多样的模态中学习，包括人的手部指示、身体指示和语言指示。

不同的模型能力，确实会反过来定义数据需求。

Koji

听起来很复杂：要从模型出发，但模型能力本身也还没有收敛。

现在比较主流的数据采集方式，各自有什么优缺点？有没有你觉得肯定不行的方式？

徐梦迪

我是融合派，因为不同数据中，模型学到的东西应该是不一样的。

比如teleoperation数据最接近机器人本体，所以非常适合用在训练后期。不管是fine-tuning还是post-training，在这个阶段都希望数据和目标领域直接相关，因此teleoperation数据在这一层面肯定最好。

Simulation数据比较容易制造位置泛化、纹理泛化，也可以改变颜色等因素，因此能够让模型对视觉变化更加鲁棒。这类数据在模型训练的前端，也就是pre-training甚至mid-training阶段会比较有用。

Simulation数据还能够提供比较好的对齐，因为相对干净，可以用来激发大规模视频预训练模型中的一些能力。

还有一种是UMI数据，它处于中间位置，更像机器人数据，但采集成本更低。

成本最低的是human data。我本人非常喜欢human data，因为人确实是一个非常成熟的本体。

人可以在日常生活中非常方便、快捷地帮助我们采集场景数据。由于human data成本低，可以大量铺到不同场景中。

这时，human data应该发挥的作用，是提升模型对场景的鲁棒性，以及对不同场景的理解。

有些人可能会觉得，human data和机器人在形态上差别太大。但我觉得，人本身就是一种形态。如果有比较好的morphology transfer方式，human data会发挥非常大的作用。

我们从human data中学习的，应该是场景变化，以及人在执行任务时物体发生的变化。这些内容和机器人具体的形态并不那么相关，而是和任务相关，因此可以从human data中学到。

本质上，关键不是某一种数据绝对最好，而是要把不同数据用在正确的地方，并正确构建数据和模型能力之间的联系。

Koji

现在具身智能非常热门，很多学生，尤其是学汽车或机械的学生，也想进入这个方向。你会给刚走上研究道路的年轻学生什么建议？



徐梦迪

我的第一个建议是，一定要多看，一定要吸收足够多。

我和一些学生聊天时发现，他们可能会觉得自己对某些时髦概念感兴趣，但认真问他兴趣点究竟在哪里，往往还比较模糊。

一个本质原因是，他们知道的还不够多。可能要先把书读厚，再把书读薄。只有先知道足够多，才能从中抽取出来，逐渐了解自己真正感兴趣的地方。

所以第一点是一定要多看，也要多和人交流。

第二点是要实际上手做事。很多人都对具身方向感兴趣，我也是从小就对机器人感兴趣，我觉得这是人的天性，很多人都会对这个方向感兴趣。

但把实际兴趣转化为行动能力，要越早开始培养越好。要真正上手，才能了解这个领域真正困难的地方。

比如真机部署非常消耗经验。如果能在早期积累这方面的经验，会非常有帮助。

Koji

你现在也带博士生，对吧？

徐梦迪

对。

Koji

你面试博士生时，有什么必问的问题？

徐梦迪

我会问学生最感兴趣的一篇文章是什么，或者换一种方式问：他觉得哪篇文章做得最好。

这是一个和research taste相关的问题，也可以说是一个和个人判断相关的问题。

Koji

这个问题挺难回答。

徐梦迪

确实挺难。它的前提是，学生已经对这个领域有了一定了解，也知道自己的兴趣点在哪里。

Koji

你听到过最好的答案是什么？

徐梦迪

我有一位学生对diffusion非常感兴趣，但他引用的不是Diffusion Policy，而是最早的那篇diffusion model论文。

我会觉得这个学生看得非常广，并没有局限在控制和机器人应用层面，而是能够追溯到最初的源头，找到这项工作的起点。

我觉得这是一种比较好的能力，也就是刨根问底、找到源头的能力。

Koji

你现在会带本科生做研究吗？

徐梦迪

也会。我们组里有一些本科生，在我刚来的时候就已经开始跟我做研究。现在能看到他们很大的成长：从一开始兴趣点还不明确，到逐渐了解更多、上手做更多事情，自己的判断力也越来越强。

Koji

那你会怎么选择本科生？

徐梦迪

现在我们还是比较宽进，因为我希望给大家提供一个平台，让大家有机会了解前沿研究在做什么。

我们组会也会邀请很多本科生来听，形式基本是tutorial。前面大概30到45分钟，会介绍整个领域的发展，有时从科学史角度讲，有时把一个主题分成不同流派来讲；最后15到30分钟，由做报告的同学介绍自己的项目。

主要目的是让学生有一个学习的机会。我觉得这更像一个学习小组。

Koji

每周一次吗？

徐梦迪

最开始计划是每周一次，后来实际执行下来，应该是biweekly。

Koji

tutorial由谁来做？

徐梦迪

由学生来做。学生们其实都很厉害。

我会提前和他们确认具体主题，然后一起讨论。第一次通常会带他们过一遍，梳理一下主题的组织方式是否合理。之后学生慢慢就能自己做总结，学习效率都非常快。

Koji

一开始问了MBTI，我觉得你还是比较典型的INTJ。你有没有经历过一些偏F的时刻？

徐梦迪

我是一个共情能力很强的人。

Koji

体现在哪里？

徐梦迪

我觉得自己能非常敏锐地观察到别人的情绪变化。所以在一个集体里，我通常会更照顾别人的情绪。

Koji

这是好事还是坏事？

徐梦迪

我觉得是好事。团队凝聚力需要一些关键人物把大家凝聚起来。

在非工作时刻，比较偏F能够拉近我和同学、合作者之间的距离。我并不希望自己的伙伴都只是工作上的伙伴。

Koji

我感觉你确实很有亲和力。

在工作讨论之外，大家和博士生、同事在一起时，还会聊些什么？

徐梦迪

也会聊很多别的。我其实很感谢我的学生。

最开始和一批年轻人一起做博士，本身就是一个很有风险、很有挑战的选择。所以我在面试博士生时，会直接告诉他们：如果来我这里读博，可能需要承担一些实验室建设的角色，也可能做一些看起来比较琐碎的事情。

我会提前把这些讲清楚，但他们都愿意接受这个挑战。

Koji

这有点像从零开始创业。

徐梦迪

确实。但我不太觉得这是一个人的startup，更像是我和博士生一起构建一件事情。

Koji

对你来说也是从零到一，尤其是这些博士生此前都不是你认识的班底。

徐梦迪

但我们的信任磨合得还挺好。主要是大家有一个共同愿望，就是把事情做好。

有了共同愿望之后，每个人都在合适的位置贡献自己的能力和时间，凝聚力就比较容易构建起来。

Koji

你们会团建吗？团建通常做什么？

徐梦迪

会团建。前两天我们还一起唱歌。

我自己组织过两次团建，学生们也会组织，有时还会叫上我。我觉得这很好，也是我比较想构建的实验室氛围。

我不希望大家只是工作或学术上的合作者，而是能够成为彼此长期信任的朋友。

Koji

最后聊点轻松的。你日常会用哪些AI产品？



徐梦迪

我用ChatGPT比较多。最近有一个变化，我会在ChatGPT和Gemini之间轮换使用，因为它们在一些事情上给出的观点确实不太一样。

以前我使用AI更多是为了知识性任务，比如总结内容或者做调研。最近开始和它进行一些工作之外的对话。

Koji

你会和AI聊什么？

徐梦迪

有时会聊对一些事件的看法，或者最近发生的有意思的事情，可能还是会和工作有一点关系。

比如我最近在给实验室起名字。我会把一些关键词给AI，让它帮我尝试构建名字。我自己先列了一些初步名单，再让它帮我润色或者提出新的方案。

当时觉得它提出的名字都还挺好。

Koji

已经定下来了吗？

徐梦迪

还没有，还需要继续聊。

Koji

最近我遇到好几个人，都说自己所在的领域论文大爆发。你有这种感觉吗？

徐梦迪

有。机器人论文最近确实在翻倍增长。

Koji

我还认识一位非常垂直的物理学博士后。他说以前他们领域一天可能只有4篇论文，大家每天早上都会刷；现在已经完全不可能了。

徐梦迪

对，而且其中有很多是AI写的，质量也鱼龙混杂。

Koji

你现在怎么面对整个研究环境的变化？

徐梦迪

我现在摄取论文的方式有不同种类。

比如我每天会浏览一些关注的研究者宣传的论文，因为作者列表本身已经完成了一轮筛选：作者认为哪些文章真正值得自豪、值得推广，就会转发和宣传。

尤其在embodied AI，也就是机器人领域，大家已经越来越习惯通过社交媒体宣传自己的工作。国内研究者也会在平台上介绍自己的论文。

我大概每天都会过一遍这些内容，也能明显看到有些文章的AI生成成分非常多。

目前来看，AI写的文章可能通过审稿，甚至可能发表在会议上，但整体质量还是不如人写的文章。AI写的文章第一眼看起来可能很详实，但很多论证其实漏洞百出。

它可能看起来内容很多，实际信息量并不大。所以如果我发现一篇文章是AI写的，我对它的兴趣会打一些折扣。

Koji

最后一个问题。大家很喜欢用一个比喻，说具身智能是一场马拉松。马拉松是42公里，你觉得我们现在跑到几公里了？



徐梦迪

我觉得跑到10公里，差不多是四分之一的位置。

真正重要的，是把机器人放到实际场景中应用。强调泛化、强调通用能力的智能机器人，目前还没有真正落地，所以还有很长的路要走。

但总体上我还是比较乐观。我觉得未来3到5年，我们可能会通过scaling看到一个明确的范式转变，或者一个明确的拐点。

所以未来3到5年会是非常关键的阶段。

Koji

我觉得做创业、做研究、做具身智能、做AI都需要乐观。悲观很容易正确，只有乐观才可能成功。

徐梦迪

对。

Koji

谢谢梦迪，今天聊得非常开心。

徐梦迪

谢谢，谢谢，我再来做客，感谢考警。

Koji

好，拜拜，拜。
