卫诗婕
Hello,大家好,这里是漫谈 Light Star,我是诗杰。过去三年,人们的目光聚焦在语言模型,但当下物理 AI 正在被热议。这其中 VLA 和世界模型这两个技术方向极具潜力又充满争议。今天邀请到的嘉宾是小米的具身基座大模型负责人陈龙。陈龙博士是九零后,是全球最早将 VLA 和智能驾驶融合的顶尖科学家。加入小米后,他正试图将车和机器人打通,打造一种 AI 学习的新范式。这期内容我们聊到了小米的九零后 AI 当家们、MiMo 大模型,以及陈龙和罗福莉等年轻高管们的合作。其中既有大量硬核的信息量,也有技术的初心、烟火气和浪漫想象。
陈龙
这个就是我比较喜欢的一个雕塑,它是一个会飞的猪。因为雷总说过一句话,在风口上,猪都可以飞起来。
我小时候就看过一部美剧,叫《霹雳游侠》。主人公是有一辆汽车的,那就是理想系列当中这个汽车智能,
卫诗婕
这跟你小时候的梦想隔空击了个掌。
陈龙
是的。
卫诗婕
你把 VLA 带到辅助驾驶领域,是全球首创。为什么是你?
陈龙
我觉得可能有几个方面。第一,我之前的公司比较看重学术领域,创始人、早期员工很多都是 researcher,早期投资人也有很多是这个行业里做 AI 前沿方向的人。甚至 Ilya Sutskever、Yann LeCun、Peter Abbeel 都是我们的投资人,他们是国际上做神经网络、做 AI 很前沿的一批人,也对我们后来的发展提供了很多影响和建议。
第二,我们有一套很好的工程团队和实验方法,可以快速验证很多想法。我们的模型特别简单,从训练模型到部署都很方便,一个人就可以自动化地训练模型、部署到车辆上。模型训练好之后,第二天就可以上车体验自己训练出来的模型。
卫诗婕
那时候你想过有一天会进入小米吗?
陈龙
当时还没有想过。我只是特别喜欢小米这辆车,如果在英国能够买到一辆就太好了。因为我当时也在自动驾驶行业,就想如果我的车能有这样的自动驾驶功能,那就太好了。
卫诗婕
我们也看到了很多 90 后的面孔在小米,比如罗福莉、王乃岩。90 后在小米是一个什么样的状态?
陈龙
我跟王乃岩年龄差不多,他比我大几天,好像蛮巧的。罗福莉比我年轻,我们经常一起吃饭。
卫诗婕
你们俩之间会有什么交流吗?
陈龙
MiMo 模型主要是罗福莉团队做的一些预训练,MiMo-Embodied 使用了 MiMo 的模型。
卫诗婕
你比较需要它的基座模型吧?
陈龙
是的。它也很需要我,我相当于给它下游的 feedback。
卫诗婕
你们俩都是 90 后,交流有障碍吗?
陈龙
障碍还蛮少的。
卫诗婕
现在技术 leader 掌控全局的能力是非常重要的。
二零二五是一个特别的年份,大家普遍都在探索 what’s next:世界模型、VLA、强化学习。这一年还是有很多成就的。
从 VLA 到 XLA,一类人的终局目标是要把不仅是模态,还有本体都统一起来,最终形成一个很大的具身大脑,实现物理世界的一加一大于二。
陈龙
Richard Sutton 的 The Bitter Lesson,苦涩的教训。
卫诗婕
为什么是苦涩的教训呢?
陈龙
因为大家探索的时候,总是会想要加更多的东西。加了一些东西,性能可能会稍微涨一点,达到一个局部最优,但最终会发现,加入这些东西对最终目标的影响并不大。
最终肯定是最简洁的一些结构,越简单、越纯粹,越美妙。
卫诗婕
对。完全使用语言来进行推理的范式,可能还不是最终的范式。
陈龙
是的。
伦敦的创业文化跟硅谷还是有些区别的。英国可能更偏重理论研究一些。我之前硕士是在 UCL 读的,UCL 其实就诞生了 DeepMind,做 deep learning 很出名的这家公司。
我最近刚看完 DeepMind 创始人 Demis Hassabis 的传记。里面写到,谷歌不是把 DeepMind 收购了吗?收购之后,Hassabis 还一直坚持把基地设在伦敦,这件事还挺神奇的。
伦敦其实还是有很多做人工智能的人才,特别是 UCL,以及牛津、剑桥,还是有很多人工智能,包括一些比较尖端方向的人才。
卫诗婕
您喝什么?
陈龙
冰美式吧。
卫诗婕
好的。因为小米员工买咖啡有优惠价。
陈龙
没有的,但是这个定价本身已经很便宜了。
卫诗婕
冰美式是 11 块钱,确实很便宜。
陈龙
对。其实我对做咖啡还是有一些研究的。店里说他们的咖啡机是最顶尖的咖啡机,叫 La Marzocco,那台是意大利产的。
我其实真的挺喜欢做咖啡的。我家有一台手动咖啡机,在英国的时候经常每天早上做一杯咖啡。
我觉得做咖啡其实跟训练神经网络很类似,因为有很多参数要调整。比如磨咖啡豆时的粗细度、咖啡出多少克、手柄网孔的粗细,之后把手柄放在咖啡机上,水流的速度、水流的温度,包括出水的速度,其实都会对整个咖啡的风味产生影响。
这跟训练神经网络蛮像的。重点是每天只能做一两杯咖啡,每次可能只能调一两个参数,所以需要一段时间才能调到最佳参数。每一个细节,都会对最终结果产生很大的影响。
卫诗婕
欢迎陈龙跟大家打招呼吧。
陈龙
hello,大家好,我是陈龙,现在在小米负责 VLA 大模型。
卫诗婕
你是我采访过的第二位 MIT TR35,35 位 35 岁以下、对科技领域有杰出贡献的人物。
陈龙
我其实是最后一刻上车,因为我今年刚好 35 岁。
卫诗婕
我看了一下颁奖词,你在自动驾驶的可解释性方面做了很多突破性的工作,而且是全球首创把 VLA 应用在辅助驾驶领域,对吗?
陈龙
对,是的。
卫诗婕
入选 TR35,当时有什么样的感受?
陈龙
还是蛮荣幸的。很多我之前已经很了解的出名人物,比如夏斐、高飞老师、吴毅老师,他们当时在自动驾驶、机器人,包括大模型方向,都做过很多前沿探索。
当然还有很多人在脑机接口、核聚变、生物药物研发等领域。每一个行业其实都有那么一小批人,在使用最新的技术推动这个行业进步。
1. From Vision To Driving
卫诗婕
你是怎么来到自动驾驶这个领域的?好像刚开始毕业的时候,并不是直接进入这个行业的。
陈龙
对。其实我刚开始进入的是增强现实领域,这也可以追溯到我之前的一些经历。
我小时候特别喜欢计算机。小学的时候,我特别幸运,我父母给家里买了第一台计算机。我很喜欢新事物,就自己自学了很多编程知识。
所以在大学选专业的时候,我没有选择计算机这个学科,因为我想学习更多不同的东西。当时我选了一个比较偏生物医学工程的学院,做的是计算机视觉、医学图像处理等工作,一直在计算机视觉上深耕。
我觉得计算机视觉其实是计算机和真实世界之间的一个接口,因为它第一次让计算机能够看到这个世界,并且理解这个世界。
回到刚才的话题,我一直在计算机视觉上做了很多探索。博士毕业之后,我去的第一家公司也是做计算机视觉的,是一个增强现实平台,主要做 AR 互动。
当时也非常幸运,我刚加入这家初创公司不到 6 个月,它就被美国一家头部网约车公司收购了。对方使用我们的技术来做自动驾驶。
陈龙
然后当时也非常的兴奋,因为其实我非常喜欢比较尖端的行业。
我在那家网约车公司做的工作,主要是使用公司的数据优势。我们当时在每辆汽车上放了一个摄像头,采集人类驾驶的习惯,记录外部视角,记录车辆是怎么运动的,其实就是行车记录仪。
当时有很多这样的数据。我们使用计算机视觉技术,得到了人类驾驶的轨迹,包括在什么场景下应该怎么开。
我当时立了一个项目,使用这些数据训练一个神经网络,也验证了当时的一个 scaling law:从大量、可能算是比较低质量的数据当中,学习人类驾驶行为,之后把它用在自动驾驶汽车上。
卫诗婕
一个小的 scaling law。
陈龙
是的。
卫诗婕
那是哪一年?
陈龙
当时还比较早,大概是 2018 年、2019 年左右。2017 年 Transformer 架构刚刚被发明。
卫诗婕
这件事是不是一个基础,就是你们想要用神经网络让汽车去学习?
陈龙
对。我们当时也使用了 Transformer 最新的架构。
这个项目对我之后的影响还蛮大的,因为自动驾驶是一个研究了很长时间的行业,可能已经有几十年的历史。传统做法都是分模块的:检测车辆在哪里、行人在哪里,会有一些规则去定义,也会使用搜索算法找到一条最优路线,让车辆不撞人、比较舒适、安全地到达目的地。
我当时做的工作,其实是打破了这些传统,算是比较早去探索两段式自动驾驶。
2. How Autonomous Driving Evolved
卫诗婕
自动驾驶行业经常会说从两段式到一段式,包括后来所说的端到端,这是一个什么样的演进轨迹?
陈龙
自动驾驶大体上可以分为 3 个阶段。
前期的做法是使用刚才讲到的分段式网络架构,也是受限于当时的技术。当时还没有特别深的神经网络,它是一个流程式的三段结构,可以理解为 3 个小模型串联在一起,每个模型做不同的事情。
第一个模型负责感知:我周围的车在哪里,行人在哪里。第二个模型负责预测:周围的车会怎么开,周围的人会怎么走。第三个模型负责规划:有了前面两个信息之后,大体上进行搜索或者使用规则。如果前面的车要 cut in,我就减速;前面没有车,我就正常行驶。
因为当时没有很深的神经网络,大家会以比较工程化的方式去思考这 3 个模型的作用和功能。
卫诗婕
跟今天 VLA 对应的是差不多的,感知、判断和执行。
陈龙
对,可以这么讲。VLA 只不过把这个过程内化了,它不会显式地说我要输出这些东西。
这是自动驾驶的第一个阶段,我们也叫自动驾驶 1.0 阶段。
之后大家发现了这种做法的一些缺点。首先,在感知阶段需要人为定义很多标签,比如定义这是车、这是人、那是什么动物。但有一些更奇怪的东西,或者一些从来没见过的障碍物,你可能很难定义它是什么。
还有一点,分模块的自动驾驶中间存在很大的信息损失。第一个模块输出的是人的位置、车的位置,到第二个模块,甚至到第三个规划模块时,我只能看到这些位置,但已经缺失了很多图像信息。
比如前面那辆车里的人向你招手,这个信息在分段式过程中会完全丢失。人类看到这个招手的动作,可能会理解为“让我先过”之类的意思。但在采集数据时,它只采集车辆状态信息,并没有办法采集到人的动作,所以这个信息就被损耗掉了。
卫诗婕
算法的问题在于它是分段式的,每一段都会做自己的输出,所以损失掉了很多原始信息。本质上还是 rule-based:人要穷尽所有场景,但其实人没有办法穷尽物理世界里的所有场景。
陈龙
对。所以大家也发现,这些算法虽然可以开,但开得很不拟人。当有一些比较微小的互动时,很多信息都会丢失。
卫诗婕
说一下我的理解。三段式其实很像 3 个人接力传水:第一个人舀起一盆水传给第二个人时,就只剩半盆了。
陈龙
非常形象。
卫诗婕
那什么时候从三段式变成两段式呢?
陈龙
所谓两段式,就是从传统的模块化进化到自动驾驶 2.0,当然也受益于神经网络的发展,以及 Transformer 架构的提出。Transformer 让数据具备了更好的 scaling 特性。
我刚才讲到的经历,就是使用很多网约车数据训练一个神经网络,这也是两段式的。它还是有感知模块,但也受限于当时的算力和数据,很多公司没有坚持下来。
但我上一家公司非常遵循第一性原理。自动驾驶领域的第一性原理是什么?开车不是一个可以靠规则定义的行为,而是需要从人类驾驶经验中获得一种知觉。
3. The Bitter Lesson Changes Everything
当时还有一个概念叫 Richard Sutton 的 The Bitter Lesson,苦涩的教训。我们其实也特别崇尚这个想法:一定要去掉很多人类定义的行为。
传统上,在计算机视觉领域有很多人类注入的先验。比如开车,大家可能会以人类怎么开车为出发点,认为开车一定要知道周围的车在哪里,一定要预测它下一秒怎么开。
我们当时想转换到完全数据驱动的范式,不需要人类定义任何规则,也不需要使用计算机视觉去检测周围物体在哪里,而是完全使用一个神经网络来模拟人类驾驶行为,相当于学习一个人类的大脑,直接从视频输入输出 action。
当时这个做法算是非常激进的。
卫诗婕
那是哪一年的事情?
陈龙
我是 2021 年左右加入这家公司的,但他们从 2018 年就开始做这件事。2018 年对于整个深度学习领域来说,还是非常早期的阶段。
卫诗婕
你刚才讲到 Sutton 的 The Bitter Lesson。我从一个非专业技术人士的角度理解这篇论文,最大的意义是它讲述了 scaling law 的影响。
像你描述的,在前一个时代,更多是人教 AI 怎么学习。老师会在课堂上告诉你这个世界是什么样的,遇到什么情况应该做什么反应。但深度学习可能是直接把它推到社会上,让它去经历,在经历当中学习,也就是你讲的数据驱动。
Bitter Lesson 重点讲的是,机器的学习未必完全按照人类的学习方式进行。让机器自己探索,可能会获得更好的智能。不知道我总结得对不对?
陈龙
总结得比较精辟。
卫诗婕
你当时是怎么把这篇论文和你所做的自动驾驶结合起来的?
陈龙
为什么叫苦涩的教训?因为大家探索时总会想加更多东西。加一些东西,性能可能会稍微涨一点,达到一个局部最优,但最终会发现,加入这些东西对最终目标的影响并不大。
最终肯定是最简洁的一些结构,是用完全数据驱动的范式学习出一个强大的神经网络来做这件事。
卫诗婕
你刚才讲的话让我想到数学家许晨阳。他在采访中讲过一个最简单的 principle:越简单、越纯粹,越美妙。
陈龙
对,但这其实也受限于当时的时代和技术发展。
卫诗婕
所以你当时非常激进地探索,用神经网络训练自动驾驶时,你们的算力和数据够用吗?
陈龙
说实话,当时不太够用。一个初创企业做这么大的一件事情,资源没有那么多,而且当时很多人不相信这件事。
但我们内部一直坚信,虽然也有过一些动摇,因为经常遇到不 work 的情况,大家也不知道怎么改进。当然,我们做了大量实验。
随着 Transformer 的提出,以及数据和模型参数量的 scaling up,包括大语言模型、世界模型等方向的发展,我们也发现使用端到端是可以得到很好的自动驾驶效果的。
卫诗婕
如果用最简单的逻辑描述一下,你之前所在的那家公司为什么坚信,用神经网络端到端的方式,至少在自动驾驶领域能够带来更高的智能?
陈龙
上一家公司真的以 research 迭代为目标,来推动量产的发展。我们有一个非常好的学术环境,是一家通过学术研究来迭代的公司。
我们有一套很好的 baseline,也有一套很好的评价指标,会做大量实验,发现哪个参数最好。同时我们也会结合最新技术,包括大语言模型和世界模型,把它们融入自动驾驶,探索它们对自动驾驶的影响。
当时我们的模型结构非常简单,只有一个神经网络,直接把视频映射到自动驾驶行为上。所以当很多新技术、新模型出现时,我们可以很快把它们融入模型,内部迭代也非常快。
卫诗婕
你刚才说中途也有过动摇,就是一直发现没有效果的时候,可以这么概括吗?
陈龙
对。大家做了很多实验,发现还是不太 work,就会想要不要加一些规则,或者改成分段式架构。
但我觉得很好的一点是,这家公司的创始人 Alex Kendall 是剑桥大学出身的学术派,非常赞成用神经网络解决问题。他之前有很多出名的工作,比如用神经网络做分割、做定位。
他给了我们很强的信心:短期内不 work 也没关系,可以继续做实验,继续迭代。
卫诗婕
回望你信仰建立的过程,不管当时 CEO 或者同事们如何相信,那是他们的事情。最终有没有某一个 moment,让你自己也坚信神经网络这套方法是 work 的?
陈龙
我觉得这个 moment 是逐渐建立起来的。我们研发时也会自己坐在车里,体验训练出来的神经网络。之前我去湾区,也试过 Waymo 的自动驾驶车辆。
Waymo 比较偏模块化,因为它的产品要保证绝对的安全性。慢慢地,我们发现训练出来的端到端神经网络驾驶起来非常丝滑、非常拟人。
那一刻其实非常激动人心,感觉我们是在推动辅助驾驶边界的进步。慢慢做了很多实验,发现效果越来越好,还是挺开心的。
卫诗婕
如果总结一下你这些年做的事情,就是努力让智能驾驶从“人类教它怎么做”,慢慢变成车上的 AI 自己学习怎么做,甚至做得比人更好,是这样一个过程。
你前面那家公司有一个很有远见、很有信仰的 CEO,也有非常学术的氛围。在这样的氛围中,有没有养成什么做事的方法论和世界观?
陈龙
上一家公司对我的影响还蛮大的。整个以实验为驱动的研发范式,其实跟现在大模型的范式也类似:一定要设置好一个小的 baseline、一个好的评测指标,然后做大量实验,验证自己的想法,进行快速迭代。
这跟我们现在在小米做的研发范式也比较类似。包括 research taste,其实也是在前司学到了很多,特别是第一性原理和 Bitter Lesson 的思考方式。
Bitter Lesson 讲的其实就是,局部雕花可能在短期内获得一个看起来更漂亮的结果,但长期而言是无益的,所以要尽可能抵抗短期雕花的诱惑。
卫诗婕
我查了一下,好像全球首个完全由神经网络驱动的智驾系统,其实是特斯拉的 FSD,对吗?
陈龙
真正量产的,算是特斯拉的 FSD。
卫诗婕
那时候你在做什么?
陈龙
我当时还在上一家公司。我们内部其实蛮开心的,因为这也验证了我们当初坚持的方向:自己的想法被一个世界级的大佬做出来了,验证了我们的想法是正确的。
当然也有一些担心,感觉既然他们做了,那还有我们什么事呢?
卫诗婕
是的。
陈龙
但其实我们走的是不同路线,我们更像是开源路线。
4. Xiaomi Opens The Next Chapter
卫诗婕
2023 年 FSD 推出之后,2024 年国内智驾爆发。我不知道你当时在伦敦有没有感受到,国内无论是新能源车还是自动驾驶行业都非常火热。
陈龙
感受到了。我当时在伦敦,看完了整个小米汽车发布会,非常激动。
因为大学时我其实是小米 1 的用户。我看完雷总发布小米 1 之后,立刻就下单了小米手机一代。当时我觉得它是一个颠覆性的产品。
那时候我是大学生,可能比较穷。诺基亚手机可能都要 4,000 至 5,000 块,功能机有键盘、没有触屏。雷总发布小米手机一代,售价 1,999 元,是一款全触屏手机,配置、处理器、内存都采用了全球最好的供应商,系统也是 MIUI。
当时就觉得这个东西真的很颠覆,所以立刻下单了 1,999 元。那时候感觉还是蛮贵的,相当于两个月的生活费。
卫诗婕
时隔十几年之后,SU7 发布的时候,你觉得它的颠覆性体现在哪儿?
陈龙
我觉得它的颠覆性不亚于小米手机。小米手机发布时,还没有那么多国产手机;但 SU7 发布时,新能源汽车已经是一片红海。
但它还是做出了一个很有特点的产品,使用了最安全的结构,我觉得这些都非常为用户着想。
卫诗婕
那时候你想过有一天会进入小米吗?
陈龙
当时其实还没想过,只是觉得我特别喜欢这辆车。如果在英国能够买一辆,那太好了。
因为当时我也在自动驾驶行业,就想如果我的车能有自动驾驶功能,那就太好了。
卫诗婕
后来是怎么有机会跟小米接触上的?
陈龙
其实是集团这边的招聘团队联系了我。当时我也没有太强烈的回国计划,还想继续做一些前沿探索。
我之前也收到过很多公司的邀请,但觉得还没有到自己想回国的时候。不过小米联系我时,我想聊一聊。最后雷总还亲自跟我聊了一个小时,这其实是我没太想到的。
卫诗婕
雷总跟你面试时聊了些什么?
陈龙
雷总对技术有很强的认知。他本人也是投资人,所以对最新技术,包括端到端、比较早期的 VLA,都比较了解。
大多数时候是我在问他。他也问了我一些问题,我不太记得了,好像问过做主要 AI 项目需要多少资源之类的。
真正打动我的是他对未来终局的看法,包括小米“人车家”的布局,以及最终汽车、机器人和智能设备之间的连接,还有 AI 对所有设备的赋能。
这些终局确实打动了我,让我觉得在小米能有更大的作为,也可以为国家做一些贡献。
卫诗婕
面完之后你最大的感受是什么?
陈龙
最大的感受是,小米在 AI 方面有很大的投入,而且对未来的物理人工智能看得非常清楚。
小米要大力投入 AI,把 AI 带入物理世界,赋能所有设备,这件事想得非常清楚。
卫诗婕
那是 2025 年的事情吗?
陈龙
其实我当时聊了挺久。2024 年年中就开始接触了。
卫诗婕
所以对你来说,做这个决定花了多久?
陈龙
可能有大半年的时间。
卫诗婕
既然决定加入小米,你想在职业生涯中做什么样的突破?
陈龙
我更想把最新技术做成量产产品,推送到用户手中,进入千家万户的生活。
这可能是最让我开心的事情。
卫诗婕
你是 2025 年正式加入小米,对吗?
陈龙
大概是 2025 年 3 月加入小米的。
5. LLMs Bring VLA To Cars
卫诗婕
2023 年到 2025 年,经历了整个大模型浪潮和技术演进。我们一会儿要聊 VLA 和世界模型,但实际上我认为它们都站在巨人的肩膀上,这个巨人的肩膀就是 LLM。过去 3 年,LLM 在技术上不停跨越一个又一个台阶。
陈龙
Transformer 的出现,造就的不仅是语言模型,还包括很多视觉 foundation model,加速了很多智能化进程。
卫诗婕
2023 年到 2025 年,整个大模型的演进对智驾领域到底产生了什么影响?
陈龙
2022 年底 ChatGPT 出来之后,我觉得对所有行业都有比较深远的影响。
我还记得 2023 年初,我们就开始尝试使用 ChatGPT 解决自动驾驶中的一些 corner case。发现它确实 work,于是逐渐把它做成一个自动驾驶模型,部署到车上。
这个模型当时叫 Lingo,是 language 加上 go,也就是“行驶”的意思。
卫诗婕
为什么不叫 Lango?那个比较好听。
陈龙
Ling 是 linguist,也就是语言学家的意思。它基本上是全球第一个在真实车辆上测试的 VLA 模型。
卫诗婕
当时的 VLA 已经站在语言模型的基础之上了。
陈龙
对。当然这也特别激进,因为端到端在当时已经比较激进,语言模型就更加激进了。
2024 年之后,Tesla 转型到端到端,端到端方向先火了起来,之后 VLA 和世界模型方向也慢慢火了起来。
卫诗婕
从技术上看,2025 是一个特别的年份。
陈龙
2025 肯定是很特别的一年。大家普遍都在探索 what’s next,也就是端到端之后,如何让辅助驾驶变得更好、更智能。
大家也大力投入一些前沿探索,包括世界模型、VLA、强化学习。这些都是非常学术、非常前沿的方向,这一年还是取得了很多成就的。
卫诗婕
从端到端到 VLA,跨越了什么?
陈龙
我觉得更多的是认知上的跨越。
端到端虽然有很多好处,是完全数据驱动的范式,可以直接从数据中学习,但它并不具有可解释性,是一个完全黑盒的模型,我们并不知道它内心是怎么想的,有可能会输出很奇怪的行为。
卫诗婕
我们说的模型幻觉吗?
陈龙
对,有时候不是特别可控。
还有一点,端到端虽然知道在什么场景应该怎么开,但它不会真正理解这个世界。它知道看见红灯要停下来,不能闯红灯,但它不知道为什么不能闯红灯。
在某些情况下你是需要闯红灯的。比如后面有一辆救护车,你挡住了它的道路,这时可以稍微闯一下红灯,这也是交通规则允许的。但这种数据可能在训练中根本没有,这是非常长尾的场景。
卫诗婕
刚才所讲的这些对物理世界的理解,就是 VLA 里的 L,也就是 language 能够做到的,对吗?
陈龙
对。
卫诗婕
所以从端到端到 VLA,是从 VA 到 VLA?
陈龙
可以这么理解,就是把语言能力融入端到端模型。
大语言模型使用互联网上的语言模态进行预训练,里面有很多关于世界的常识。我们想做的就是让辅助驾驶模型也拥有这些常识。
卫诗婕
所以这种可解释性,是基于语言模型背后的逻辑推理才做到的吗?
陈龙
对。它基于语言模型,可以显式地把判断说出来。
卫诗婕
你把 VLA 带到辅助驾驶领域,是全球首创。为什么当时其他公司没有做这样的探索,或者没有做成?为什么是你?
陈龙
我觉得这是个很好的问题,其实我也一直在复盘,可能有几个方面。
第一个方面,是之前的公司比较看重学术领域。创始人和早期员工很多都是 researcher,早期投资人也有很多是这个行业里做 AI 前沿方向的人,甚至 Ilya Sutskever、Yann LeCun、Peter Abbeel 也是我们的投资人。他们对我们之后的发展提供了很多影响和建议。
第二,我们有一套很好的工程团队和实验方法。我们的模型特别简单,从训练到部署都很方便,一个人就可以自动化训练模型、部署到车辆上。训练好模型之后,第二天就能上车体验自己训练出来的模型。
卫诗婕
听起来组织也很扁平。
陈龙
对,组织特别扁平,所以可以快速验证很多想法。一些很新的 idea,也可以快速实现。
卫诗婕
但我理解,你的上一家公司创业公司属性更重,做的更多是前沿技术探索,没有那么追求规模化和量产落地。
陈龙
是的。在这样的前提下,比较容易维持我们刚才讲的扁平、开放的组织和文化。
卫诗婕
但当你要把一个技术成果落地,走进千家万户时,就面临规模化问题。
现在你进入小米,它是一家上市公司,拥有更复杂的组织环境,会不会有一些改变?
陈龙
改变还是蛮大的。我在小米学习到了很多。
前司比较偏学术,考虑的东西可能会少一些。但当一项技术要做成产品,需要考虑的事情就多得多。不仅要考虑技术成熟度,还要考虑安全、用户体验等问题。
卫诗婕
你在前司也是核心科学家。前司华人科学家多吗?
陈龙
说实话,不是特别多。英国的华人还是稍微少一些,肯定比硅谷少。真正做 research 的,欧洲人或者印度人会比较多一些。
卫诗婕
你觉得自己身上有欧洲风格吗?
陈龙
肯定会有,毕竟也待了十几年。
卫诗婕
你身上的中国人基因和欧洲风格,是怎么体现的?
陈龙
我觉得中国人的基因还是比较拼。从小接受的教育和成长环境,决定了中国人不管在哪里都很努力、很向上。
所以我在前司晚上也经常加班,当然这些都是自发的,因为我真的对这些东西感兴趣。
相反,欧洲人、英国人可能处在比较放松、比较 chill 的环境里,晚上五六点就走了,下班去接孩子。
欧洲文化让我学到很重要的一点:做成一件事情,不一定非要有结果,需要足够享受过程。
卫诗婕
对,过程很重要,特别是做研究。很多事情会失败,也没有结果,但这个时候要接受结果,心态一定要好,不能受到失败的影响,然后找到下一个目标。
陈龙
他们不会特别生气,也不会特别懈怠,而是转向另外一个目标。
当你足够享受过程时,会发现只要时间足够久,结果几乎自然而然就会带来。
卫诗婕
但这就变成一个很有意思的问题了。当你带着长期在欧洲生活留下的世界观烙印,回到国内这片非常卷的市场时,我很好奇,你内心有没有一个重新校准自己的过程?
陈龙
肯定会有,毕竟文化还是有一些区别的。
卫诗婕
你觉得小米有想保护你身上这一部分影子吗?
陈龙
我觉得肯定有。我比较幸运,在小米被保护得比较好。老板们没有给我特别大的压力,而是给了我一个比较宽松、自由的环境,让我做一些前沿探索,我觉得还是很幸运的。
卫诗婕
在技术层面,小米期待你的加入能够带来什么?
陈龙
我觉得更多是带来思想上的转变。小米并没有特别期待我一定要在什么期限内完成什么事情,而是希望带来视野和认知上的提升。
我回国之前,跟叶航军总聊过。他期待我去设计一个比较前沿的统一框架,把自动驾驶和机器人这两种任务统一起来。
我当时觉得这个思想非常好,这也是我真正想做的事情,也是我回国的一个原因。
卫诗婕
既然提到了叶航军总,我也想跟你聊一聊小米智驾的“梦之队”。
外界把小米智驾称为梦之队。在这个非常庞大的组织中,有一个以 4 个人为核心的科学家画像:小米元老叶航军博士、陈光博士、原图森未来首席科学家王乃岩,还有你。
很好奇你们平时梦之队的日常生活是什么样的,4 个人会有交流吗?
陈龙
我们交流还挺多的。但称为“梦之队”,我觉得有点过了。我们可能是在不同方向上的技术 leader。
我觉得现在技术 leader 其实蛮重要的。在传统行业,leader 往往比较偏管理;现在比较新的行业,包括自动驾驶、机器人、大模型,更偏重技术型 leader。
技术 leader 能够真正用自己对技术的洞察,以及自己在这个领域的视野,去影响团队做的事情,我觉得这非常重要。
当然,叶航军总、乃岩和陈光,我们交流非常多,他们人都很 nice。
我们做的方向可能不太一样。我跟陈光博士交流会更多一些,因为他带领整个辅助驾驶团队,也就是 L2 团队。我们的 VLA 可能会最先应用在 L2 上面。
乃岩老师带领 L3 团队,叶航军总是整个智驾业务的总经理。他不仅非常关注最新技术,也会亲自使用一些前沿工具。
卫诗婕
你刚才的表述中有一句话:现在的技术负责人需要更多地用自己的视野去影响整个团队。能不能解释一下这句话?
陈龙
现在前沿技术发展特别快,不仅变化快,还需要对整个行业有比较深的理解,这就需要一些在技术上深耕过的人来做 leader。
特别是在大模型方向,大模型最近几年才发展起来,更需要真正手动训练过大模型的人。只有这样,才能知道遇到问题时应该怎么解决,所以掌控全局的能力非常重要。
卫诗婕
你们现在会有技术路线的争论吗?
陈龙
技术路线的争论其实还蛮多的,不管内部还是外部,都有很多讨论。
卫诗婕
今天所有面临激烈竞争的公司,都面临同一个问题:技术变化很快,可能一个更好的技术或者更有前景的方向悄然出现。
但在强竞争环境中,所有人都需要对当下的短期结果负责。这时怎么兼顾短期结果和长期不同路线的探索?怎么既保证手头的工作有效、高效,同时还有余力看得足够远?
陈龙
这要求总经理级别的人有很好的视野,既在量产方面投入很多,又在前沿方向做探索。
当然也有一些长期目标,比如探索下一代范式、做一些更新的功能。
量产和预研其实不应该分家,而应该慢慢沿途下蛋,在预研过程中产出量产结果,交付到用户手中。这是比较健康的一种模式。
卫诗婕
具体回到你自己的日常时间分配,会花多大比例的时间关注刚才讲的那些细节雕琢?又花多大时间 follow 前沿?用什么样的方式?
陈龙
现阶段,我大概 60% 的时间花在前沿探索上,包括读 paper、跟很多 researcher 交流,以及招聘人才,这些事情会占用比较多的时间。
卫诗婕
刚才我们在楼下聊了一个很有意思的话题。自动驾驶领域现在看起来 90 后是主力军,为什么?
陈龙
自动驾驶还是一个比较前沿的行业。首先在学术界,很多新 idea 都产生于学术界,而在自动驾驶领域活跃的老师,很多是比较年轻的老师,可能是 90 后。
我个人感觉,比较新的老师可能更喜欢自动驾驶这样的方向。一些比较 established 的教授,可能更容易沿着传统研究方向延续下去。他们已经在上一个时代最热门的应用方向聚集了。
卫诗婕
对,他们已经有很多成就了,所以可能很难转型到一个比较新的方向。
我们也看到了很多 90 后的面孔在小米,包括罗福莉。90 后现在在小米是一个什么样的状态?他们是生力军吗?
陈龙
算是。我跟王乃岩年龄差不多,他比我大几天。
小米一直以来都是一个比较年轻态的公司。雷总以及一众高管,对外的形象也都很年轻。
卫诗婕
传说中需要身材管理,是吗?
陈龙
对。雷总平时也经常健身,在微博上贴健身照片。
我觉得在 AI 这个高压环境中,确实需要注意身体。不仅是身材,整体健康都需要重点关注。
卫诗婕
你有没有感受到,雷总对你们这些 90 后、95 后投入了更多观察或者精力?
陈龙
感受到了。雷总对尖端人才都会亲自下场交流,对科学家们也很宽容,提供的资源很多。
卫诗婕
你已经是全球顶级科学家了,带着全球级成果来到小米时,会有压力吗?
陈龙
压力肯定有一些,但压力也可以转换成动力。而且我觉得这是自己真正喜欢做的事情,所以总体还好。
工作时间确实比之前在英国长了一些。
卫诗婕
最近和雷军总交流过吗?
陈龙
上一次发布会的准备过程中交流了很多。雷总当时还亲自帮我,在我旁边用他的电脑修改稿子,也给我做了很多演讲培训。
卫诗婕
你能感受到他对年轻管理者的期望是什么吗?
陈龙
他对年轻管理者、科学家其实挺宽容的,当然肯定也有期待。他会不断鞭策你,虽然给你提供很多资源,也会要求你阶段性地产出结果,定期 review。
卫诗婕
他对你们和更元老级的管理者,在风格上会有不同吗?
陈龙
我觉得有一些不同。跟他交流时,感觉他非常 nice。雷总很和蔼可亲,真的会教你一些东西,也会给你很多机会。
6. MiMo Unifies Cars And Robots
卫诗婕
那我们接下来聊一聊你真正来到小米之后的成果。
这次发布会,你带着你们的具身基座大模型 MiMo-Embodied 亮相。能不能用一句话给大家解释一下,这个模型是做什么的?
陈龙
刚才也讲了,我当初来小米的一个目标,就是提出一个框架,把自动驾驶和机器人这两种任务统一起来。
MiMo-Embodied 就是这个方向上的第一次尝试,也是业界首次把自动驾驶和机器人这两种任务融合起来的具身大脑框架。
卫诗婕
为什么是智能驾驶和具身智能?为什么是车和机器人?
当然,我知道车是最简单的一种机器人。
陈龙
您说得特别对。车实际上也是具身智能的一个本体,车和机器人都是具身智能。
我们把它们融合起来,主要有几点考虑。
第一,现在机器人普遍数据比较少,没有辅助驾驶这么多数据,所以把辅助驾驶和机器人融合起来,可以提升机器人的表现。
第二,我们希望把像人类一样学习的过程注入整个框架。
人类小时候会跟很多物体交互,在这些交互中学习物理世界的规律,比如物体应该怎样运动、视角应该怎样变化。我们通过不断跟物体交互,学习到空间感知和空间推理能力。
当人类具备很强的能力之后,再学习开车就会更容易,而且开得更安全。
卫诗婕
听起来,原本是两个行业:智驾做智驾,机器人做机器人,相当于分别给车和机器人开小班、分工教学。
但小米现在试图把车和机器人放在一个班里上课。
陈龙
是的。最终我们希望有更多数据,训练一个更强大的神经网络。这也是因为 Transformer 有很好的 scaling 特性。
当我们放入不同数据时,会产生很多协同效应。刚才我们也聊到 connecting the dots,虽然有些事情看起来并不相关,但通过统一训练可以把它们结合起来,体现在两种能力的相互增强上。
卫诗婕
我理解这其实也是一个非常大胆的探索。你凭什么相信,把原来看起来是两个班的学生拉到一个班里,能够保证比小班教学更出色?
陈龙
这需要我们做大量实验。刚有这个想法时,我们也不能完全确定这两种能力到底能不能相容。
一个是室外辅助驾驶,一个是室内机器人操作,它们的视角,以及输入和输出模态的差别都很大。业界之前也没有探索过这两种模态到底能不能融合。
所以我们做了很多初期验证,也进行了很多创新。最终通过多阶段学习,以及制作很多 COT,也就是 thinking 过程的数据,把这两种模态的知识统一起来。
最后我们发现,它们确实具有协同效应:自动驾驶数据可以增强机器人的任务,机器人的数据也可以增强自动驾驶任务。
卫诗婕
这个双向增强是怎么发生的?
陈龙
需要设计一些精巧的多阶段学习方式。
MiMo-Embodied 使用了我们自研的 MiMo 模型。MiMo 模型主要是罗福莉团队做的一些预训练。
卫诗婕
是 VLA 当中 L 的部分,对吗?
陈龙
对,首先训练的是 L 的部分,也就是训练出一个大语言模型。罗福莉团队后来又把它扩展成 VL 模型,可以接收图像,是多模态模型。
我们拿到这个基座模型之后,又做了一次 continued pre-training,也就是持续预训练,进一步增强空间感知和空间推理能力。
当然,我们是分阶段做的。第一阶段增强自动驾驶能力,之后增强具身机器人能力,最后使用很多 COT 数据,把自动驾驶和机器人通过 COT 连接起来。
最后还加入了强化学习后训练,让它在这两种任务上达到 SOTA 水平。
卫诗婕
COT 是思维链吗?
陈龙
对,是思维链。刚才也讲了,两个模态差别非常大,但思考过程是可以统一的。
卫诗婕
能举个例子吗?具身智能的模态数据是什么?自动驾驶的模态数据是什么?怎么通过一种思维方式把两者结合起来?
陈龙
比如机器人看到画面,桌子上有一部手机,我们让它把手机抓起来,它就会执行抓取动作。
如果没有思维链,它可能依靠直觉推理,这需要专门训练。但增强 COT 能力之后,它的通用能力会大大增强。
它在内部会有思考过程:先思考看到桌子上有一个大概是手机的物体,用户的目标是把手机抓起来;然后进一步推断手机的坐标、下一步怎么做。
实际上,它把一个比较大的任务拆解成一个个小任务,再逐步执行。
辅助驾驶也是类似的。看到一个画面,现在要超车,它会拆分成不同的小的思考段落。
当把大任务拆解成小任务时,这些小任务可以产生协同效应,从而把自动驾驶和机器人这两个大任务统一起来。
卫诗婕
机器人能教车什么,车能教机器人什么?
陈龙
机器人数据更多提供空间感知和空间推理能力。机器人是一个交互性很强的场景,要移动各种物体,包括抓取、移动以及和物体进行各种交互。
它可以从机器人数据中学习如何与不同物体交互,所以空间感知和空间推理能力会更强。机器人教给辅助驾驶的,就是这种空间感知和空间推理能力。
辅助驾驶教给机器人,可能更多是对物体的感知和行为。自动驾驶是室外第一视角驾驶场景,不同速度下,不同物体的运动方式都不同。
它能从驾驶时不同物体的运动方式中,学习刚体或者柔性物体的行为,也就是物理状态和物理轨迹。
卫诗婕
它是不是更接近 next-state prediction,也就是下一个物理状态的预测?
陈龙
对。它通过最终目标——你要怎么开——隐式地学习如何判断距离、判断速度,这些能力可能在机器人数据中比较缺失。
卫诗婕
刚才讲到 L 的基座语言模型部分是罗福莉训练的,你们俩之间会有什么交流吗?
陈龙
我们交流挺多,也很频繁。
她要提供强大的基座模型,我们会利用这个基座模型进行持续训练,拓展到具身领域,最终应用到辅助驾驶这个垂直领域。
所以我们经常给他们很多反馈:这个基础模型需要具备什么能力。我们在数据上也会反馈,把一些数据交给他们团队,他们团队也会使用最新数据迭代基座模型,增强我们相关任务的表现。
卫诗婕
你们俩都是 90 后,交流有障碍吗?
陈龙
障碍还蛮少的。她应该比我年轻一些,但我觉得罗福莉能力很强,不仅管理能力很强,在大模型视野上也很有见解。
我们经常私下交流、一起吃饭。
卫诗婕
你比较需要她的基座模型吧?
陈龙
是的。我觉得有一个自研基座模型团队,对做辅助驾驶非常必要。
现在具备这种能力的车企并不是特别多。训练基座模型需要大量资源、大量人才和很多 know-how,普通车企可能不具备这样的能力,也没有足够资源从头训练基础模型。
但我个人判断,基础模型对实现最终的具身智能非常必要。
现在很多车企拿开源模型来训练 VLA,我觉得这是一件非常危险的事情。因为你不知道它预训练时混入了什么数据。互联网上有很多抽象甚至危险的内容,如果这些内容进入预训练数据,可能会产生蝴蝶效应。
一些微小的数据,可能在最终辅助驾驶决策时影响关键判断,造成危险行为。
有了训练基座模型的能力之后,可以进行更多筛选,把高质量数据,甚至下游任务中的 corner case 数据,反哺到预训练中,实现更安全的辅助驾驶,以及最终机器的具身智能操作。
卫诗婕
但我觉得它也很需要你,因为你相当于给它下游的一个 feedback。
陈龙
对。我们还有一些项目合作,我也会安排一些实习生到他们那边实习,具体了解下游有哪些比较难解决的任务,再反馈给他们。
卫诗婕
所以在 MiMo-Embodied 的基座模型中,肯定有 VLA。刚才已经讲到了,这其中有世界模型的影子吗?
7. World Models Predict The Future
陈龙
我感觉世界模型和 VLA 本质上是不分家的。
世界模型这个概念可能比较宽泛。我觉得语言模型其实也是世界模型,因为它可以利用语言进行未来的思考和预测,所以它是世界模型的一部分。
卫诗婕
VLA 是不是世界模型的一部分?
陈龙
对。大家对世界模型的定义其实很复杂,有比较宽泛的定义,也有比较狭窄的定义。
狭窄定义可能就是杨立昆一直提倡的:给定一个 action 之后,预测未来的状态。
当然,现在很多东西也叫世界模型。比如李飞飞做的基于 3D 重建的工作,大家也叫世界模型。辅助驾驶之前有很多世界模型工作,基于模拟器、3D 重建,或者生成下一帧,也都叫世界模型。
还有一种叫 world action model,也就是在生成时预测下一个状态,再生成 action,这可能也叫世界模型。
所以大家对世界模型到底是什么,并没有一个特别明确的定义。
卫诗婕
那你对世界模型的定义是什么?
陈龙
我认为世界模型还是应该偏向于生成下一个状态。
生成下一个状态,更像人类思考的方式。我们想象时,不会把整幅画面都描述出来,很多信息其实是高频信息。
比如在自动驾驶中,预测未来会发生什么非常重要。但如果预测这一帧叶子到下一帧具体怎么变化,对最终决策并没有影响。
现在的视频生成模型需要把这些细节显式建模起来,所以我觉得最本质的不是生成好看的下一帧视频,而是拥有好的表征,去预测未来最本质的状态,这才是有用的世界模型。
卫诗婕
所以 VLA 能够带来更多对下一个物理状态的预测,以及对应该做什么的判断?
陈龙
我们也在这方面探索,如何把预测未来状态的能力融入 VLA 框架。
VLA 框架中没有一个显式预测未来状态的过程,更多是使用 L 来解释,或者进行未来推演。它使用的是符号化语言进行推演。
卫诗婕
为什么世界模型和 VLA 会在当下被热议?虽然它们可能已经出现很久了。
陈龙
具身智能和自动驾驶现在都非常火,而且这两个方向说实话还是 research 问题,还没有真正解决。
现在大家使用的端到端,甚至 VLA 范式,可能都不是最终范式,也还没有统一。
所以新的技术出现后,大家可能会有比较大的 hype,觉得新的范式能解决所有问题,于是被炒得很热。
卫诗婕
但我觉得还是应该多回到技术本身。每一种新技术出现,虽然能解决一些问题,但肯定也有自己的问题。
当技术被炒得过热,大家对它期待过高,反而可能发现它没有想象中那么厉害,也可能因此错过一些东西。
最直观的例子就是,之前大家觉得端到端一无是处,后来又觉得端到端特别神奇,之后又发现端到端有很多缺点、很难做,于是开始推崇下一代技术。
但我们可能真的应该把一项技术迭代好、打磨好,它才能最终解决我们所有的问题。
行业里有一个很有意思的现象:突然之间,所有公司都声称自己在做 VLA,但业内人士可能会觉得,本质上还是 VLM,并没有真正走到 action 这一步。
像我们前几期节目的嘉宾王星星,也公开说过 VLA 当下的问题。所谓最后一公里,就是 action 这一步。在辅助驾驶领域,它会比具身领域稍微好一些吗?
陈龙
辅助驾驶在数据上有一些优势。
辅助驾驶数据可以很好地获得,因为我们已经有成熟产品。用户驾驶时会提供很多反馈,这些宝贵数据可以用来迭代模型。
机器人领域大部分数据还需要自己采集,所以无论成本还是数据多样性,都和辅助驾驶差得很远。这也是为什么辅助驾驶 VLA 的落地可能会更快一些。
语言数据标注方面,辅助驾驶也有一套成熟的标注标准。我们有很多感知数据,这些数据可以比较容易地生成具体决策的目的,所以语言数据生成会很快,也推动了辅助驾驶 VLA 的发展。
卫诗婕
我觉得还有一个因素:车还是相对最简单的一种机器人。它的自由度比人形机器人简单得多,action 没有机器人那么复杂。
比如送人形机器人进工厂打工,它面对的决策复杂度可能比自动驾驶高很多。
陈龙
对。辅助驾驶的 action space 更小,本质上是 2D 输出;机器人更多是 3D 输出,而且是多关节输出,可能更难。
自动驾驶也是更可控的环境,因为道路结构和交通规则并没有那么大的差异。
卫诗婕
所以小米看到,辅助驾驶跑得比具身智能快,但未来两者可能瞄向同一片大陆。
现在是在两个岛屿之间打通,希望跑得更快的跑道能够带动跑得更慢的跑道,是这样吗?
陈龙
是的。数据是一方面。如果把更多数据融合在一起,可能会产生更多涌现,在不同领域产生协同效应,创造出更智能的大脑。
最终目标肯定是把所有物理设备连接起来,形成一个具身大脑,控制汽车、机器人以及家里的智能设备。
它更像是我们对未来个人助理的想象:不仅能帮你开车,也能帮你做家务、做各种事情。
这可能也是小米集团的整体目标。
卫诗婕
你刚才讲,希望有更多数据,不管是具身领域还是原来辅助驾驶领域的数据,更多数据能够带来涌现。
这其实也呼应了 Sutton 的 Bitter Lesson:不要太多做细节雕花,只需要给它更多数据、更大算力,让机器自己学习,而不是人教它如何学习。这是大方向、大主旨。
陈龙
对。现在我们已经可以看到一些端倪。
最近很火的“龙虾”——OpenClaw 这样的 agent,已经有很强的泛化能力,可以操作电脑,甚至自己编程解决问题。
它本质上也是一个大模型,但可以分配任务,自己启动 sub-agent 去做小任务,最终完成一个大任务。
我觉得它最终进入物理世界肯定也是这样:有一个很大的模型负责调度,帮你开车、收拾家务,最终实现物理世界中的 AI。
卫诗婕
我们上一期嘉宾讲过,agent 区别于大模型 AI 能力的一个最大区别,就是 agent 是角色化的,它有任务、有目标。
当 AI 有了任务和目标之后,就可以不停自进化,能力不断迭代,可能出现涌现。本质逻辑是一样的。
陈龙
本质逻辑肯定一样,但进入物理世界会更难,受限于数据和传感器。
刚才说 VLA,V 是感知部分。感知需要很多传感器。人身上的眼睛、五官都是传感器。
卫诗婕
现在硬件传感器方面,有什么缺的要补吗?
陈龙
以前大家会觉得传感器越多越好,所以有各种模态。当然传感器数据越多,对数据量的要求也越高,需要更多不同传感器的数据,才能训练出更强的模型。
本质上,辅助驾驶可以通过纯视觉解决。但如果现在用纯视觉解决辅助驾驶,肯定存在风险,所以我们希望有各个维度的模态辅助最终决策。
这也是我最近在小米学到的量产和预研的区别。预研可能只通过视觉、语言、action 这 3 种最简单模态,就能实现一些功能。但真正进入量产后会发现,只用视觉,在现阶段的智能化水平下是不够的,肯定需要其他更直接的模态辅助决策。
卫诗婕
比如还有什么模态?
陈龙
比如雷达。雷达是一个很好的传感器,能直接获得物体的距离,一个真实的距离,而视觉不具备这个能力,因为视觉中每个像素的距离存在一定歧义。
人眼和摄像头的感知也不一样。雷达可能类似于蝙蝠,但蝙蝠通过声波测距,雷达是通过激光来测距的,能够获得更准确的距离。
雷达在一些高速场景中很关键,一定要获得最准确的距离,辅助系统做安全操作。
卫诗婕
这也呼应了刚才说的,辅助驾驶有精准感知。如果把这种精准感知给到机器人,就能提高它干活的能力。
陈龙
首先是精确度问题。更好的传感器肯定能让测距更准,获得更高精度。
还有智能问题,也就是大脑的问题:它要知道怎么做,以及做错时怎么恢复。
卫诗婕
你刚才说有很多模态,包括雷达,还有别的吗?
陈龙
声音其实也很重要,之前大家比较忽视。人开车时,声音是很重要的辅助模态。
卫诗婕
为什么?我之前也以为声音不重要,但自从戴耳机开车、感觉没有安全感之后,就觉得声音还蛮重要。你可以听见周围有没有车,也能听见别人按喇叭。辅助驾驶可能也需要这一部分信息。
刚才说了,所有信息都要无损传递。
陈龙
还有导航信息,辅助驾驶也需要这一部分输入。
卫诗婕
我有一个疑问:如果各种模态的信息发生冲突,怎么办?
陈龙
这是个很好的问题。在传统规则时代,比如激光雷达和摄像头检测出的目标不一致,确实需要做判断。
但在端到端时代,如果使用前融合方式,系统内部会自己做决策。人类也有类似过程。
比如我们没看到前面有东西,但听到前面可能有东西,视觉和听觉不一致。
卫诗婕
打架。
陈龙
对。那人会怎么办?肯定会提前检查、再观察一下,看看到底应该怎么办。人也会根据置信度判断。
比如我们可能更相信视觉,看见前面有一辆车,虽然没听见声音。系统会根据置信度,以及所在场景,进一步判断。
所以在端到端时代,不需要人来显式考虑这种冲突。
卫诗婕
刚才是 V 的感知部分,接下来聊 L。
目前大家会把 L 理解为 language,它基于语言模型的逻辑推理能力产生一系列能力。但我们也看到很多争议:语言到底是不是推理的钥匙,是理解物理世界的唯一钥匙?
你也在伦敦生活过。伦敦有另外一个很领先的 AI 团队,就是 DeepMind。它的创始人 Hassabis 一直坚持语言不是全部,你应该也了解。
陈龙
语言确实不是全部,但它是一个很好的推理模态,因为它是比较抽象的表征。
语言的表征非常本质,用几个词就能描述一幅很本质的画面。但如果用图像,可能需要很多像素才能描述一个东西。
语言对长时间记忆也很好,因为它没有明确的时间限制;如果用视频或者视觉,就需要压缩前面很多帧的信息。
所以我觉得,语言不是全部,但它是一个比较抽象、比较好的模态,也是人类目前最能够善用的工具之一。
卫诗婕
而且最主要的是,人类之前所有的知识结晶都浓缩在语言上。文字很早就出现了,我们可以用语言接触人类过去几乎所有知识,包括很多推理。
当然视觉也很重要,但相机、录像机其实发展没有多少年,互联网上的视频信息比语言信息少很多。
有人觉得语言会成为瓶颈。我理解是,当你用语言进行一系列推理时,它未必是最优的,某些事情语言可能解释不了。
陈龙
对,有些事情语言确实解决不了。刚才讲了,语言是比较抽象的模态,肯定会损失一些信息。
设计 VLA 时,我们肯定不希望把视觉转换成语言,再完全通过语言转换成 action。那就像蒙着眼睛开车,副驾告诉你现在发生了什么,你再做决定。
VLA 当初的设计其实不是这样。不是把 V 转化成 L,再转化成 A;而是把语言加入 VA 模态中,让 V 和 L 同时参与决策。
L 相当于在 V 的基础上增加推理信息。我通过思维链推理,提取出更抽象的表征,做逻辑推演,进一步增加信息量,之后共同通过 V 和 L 做出 action 决策。
卫诗婕
现在语言模型已经探索到一定阶段,它的通用泛化能力,也就是对现实世界的理解能力,可以直接加进来作为增益。
陈龙
对。人类常识、价值观都融入了语言,我们希望把这些知识融入 VA,让它拥有这部分推理能力。
8. XLA Thinks Beyond Language
卫诗婕
我留意到,你们没有说自己的技术路线是 VLA,而是 XLA。X 代表任意模态,也就是说会有更多模态输入。
第二,X 也代表不同的本体。你们不仅加入辅助驾驶数据,还加入机器人数据,以及互联网上的图像、文本数据。
具身智能和辅助驾驶可以打通,这是不是很多友商同时做车和机器人的一个小秘密?比如小鹏,我们也看到它在做机器人。
陈龙
是的,这其实是行业趋势。Tesla、小鹏都在往这个方向统一。
不仅硬件可以复用,最终的大脑,包括大模型和基座模型,肯定也需要复用、互相增强。
卫诗婕
特斯拉先做的,特斯拉算是一个。但你们的基座模型还是比较领先的,因为特斯拉虽然在硬件上做了一些统一,但并没有发布一个很强的模型,把辅助驾驶和具身智能融为一体。
把辅助驾驶和具身智能打通,应该是一个小共识。但一定也有不走这条路线的公司,他们不走,是因为不相信,还是其他因素?
陈龙
首先,同时有自动驾驶和机器人业务的公司比较少,可能就是 Tesla、小鹏、小米,以及一些小厂商。
这几家主流大公司都在走这条路线,因为这样不仅效率更高,还能产生协同效应。最终目标肯定是把一系列东西融合起来。
卫诗婕
所以从 VLA 到 XLA,意味着不仅统一模态,也统一本体,最终形成一个很大的具身大脑,实现物理世界的一加一大于二,把具身的感官打通。
陈龙
对。
卫诗婕
那在架构上,跟传统的智驾架构会有什么不同?
陈龙
XLA 是下一代认知驱动模型。传统 VLA 使用语言进行推理,我们没有使用这种显式语言推理。
卫诗婕
是潜空间推理吗?
陈龙
对。虽然语言是很高效的推理模态,但现在的算力可能还不能承载大量语言推理。
目前有些厂商会先输出一大段文字,再输出 action,这样延时很高,也不太可控。有些厂商宣传自己不输出语言,但这样又没有利用推理能力,可能就变成 VA 了。
我们使用了一种比较创新的做法,没有使用显式语言,而是使用潜空间推理模式。
潜空间推理相当于使用底层的机器语言进行多步推理。它的优点是时延更可控,思考过程更快,而且不存在把信息转译成语言的过程,所以信息量更大。
它不仅想得更快,也想得更全面。当然,我们的潜空间也可以解码成语言,需要时可以看一看它到底是怎么想的。
卫诗婕
特别巧。我们之前有一位嘉宾田渊栋,他发表过一篇专门讲潜空间推理的 paper。
我自己作为行外人的理解是,人做出判断时,并不总需要把事情从头到尾过一遍脑子,有可能是一种直觉。潜空间有点像人的潜意识推理,不一定要占用很多显式思考过程。
陈龙
对。田渊栋老师的文章我去年也第一时间看到了,特别赞成这个理念。
完全使用语言推理,其实受限于训练数据。大部分思考通过语言发生,互联网上的数据也主要通过语言存在。但人类思考时,并不需要在内心一个字一个字地思考。
有时我们甚至会非常快速地思考,使用视觉来思考。比如开车时,前面的路很窄,我们会想象把车放在这个狭窄位置,预测一下画面是什么样,判断能不能通过。
卫诗婕
这是空间推理。
陈龙
对,不一定是语言逻辑推理。
所以现在完全使用语言推理的范式,可能还不是最终范式。
我们也在做很多探索,使用潜空间推理,最终做决策。但潜空间可以解码成语言,也可以解码成未来的画面。
卫诗婕
这个解码是为了白盒化吗?
陈龙
不仅是为了白盒化,方便调查它内心怎么思考,也是为了给它的思考提供 guidance,指导它具体应该怎么思考,因为毕竟需要一些监督。
语言和视觉会同时提供监督,也就是说,我们的思考融入了对未来的想象,以及对未来语言过程的推演。
卫诗婕
有点像人计算之后,给你一台计算机,让你自己验算一下。
陈龙
对。
卫诗婕
从 VLA 到 XLA,具体到用户身上,能够带来什么样的增量体验?
陈龙
我们发布的 XLA 认知大模型,首先可以在复杂场景中运用推演能力,做出更安全的行为。
道路上出现大型障碍物时,可以利用潜空间推理快速做决策,绕行操作会更丝滑,需要人类接管的情况也会更少。
还有语音控车功能,可以直接通过小爱同学让车辆加速、减速、向左转、向右转,或者进行并线操作。
最后还有一些创新功能,比如商场车位级导航。下地库时,你可以告诉小爱同学想去哪家店,它可以把你带到离这家店铺电梯最近的位置,或者带你找到可用车位。
卫诗婕
这个功能非常实用,因为我每次去商场都不知道在哪里停车。这个模型为更优的驾驶 agent 提供了很多想象。
陈龙
是的。
卫诗婕
刚才讲到 XLA 需要一个新的架构,它用的是什么架构?还是 Transformer 吗?
陈龙
底层还是 Transformer。我们使用的是一段式 XLA 架构。
卫诗婕
这是行业独创吗?
陈龙
各家的实现方式可能都不尽相同。我觉得我们的实现方式相当于行业最优。
卫诗婕
我们来聊一下 MiMo-Embodied 的训练。
刚才讲的是把车和机器人融为一体,但怎么样才能把两套数据放进一个架构,并且让它们一起训练呢?
陈龙
车和机器人的数据确实有差别,不仅输入模态不同,最终 action 模态也不一样。
我们采用混合训练策略,把车的数据、机器人数据,以及很多通用视觉语言数据混在一起训练。
这样训练的好处是,既保留大模型的通用能力,也能让它在车和机器人这两个垂直领域有更好的表现。
比较创新的地方是使用了 CoT。罗福莉团队也给了很多帮助,告诉我们具体应该怎样标注 CoT 数据。
最终我们加入强化学习后训练,让它更加结果导向,激发 CoT 能力。
卫诗婕
我有一个比较大的感受:AI 从数字世界迈向物理世界后,更接近人类成长过程中的学习方式。
人类很多能力并不是来自书本,而是来自对真实世界的感知、理解和判断。
这让我想到 2023 年国内的一场 AI 大会。当时 Yann LeCun 和 Hinton 都到场了,他们同时讲到一个共同点:当下语言模型层面的 AI,学习方式其实跟人不太相似,还缺少一些东西。
今天越来越多地看到 AI 像人类一样学习。当然这可能不是终点。你对 AI 的学习路径,有没有路线图式的想象?
它到底会和人类很相似,还是会先经历与人类相似的阶段,再探索出一套比人类更高效的方式?
9. AI Learns Beyond Supervision
陈龙
我听过 Sutton 的一些讲座。他对深度学习有一定理解,也对未来具体的学习方式有一些想法。
我很同意他的观点。现在所谓的 supervised learning 确实有一定缺陷。它促进了深度学习发展,因为统一了离线数据集,让实验迭代更高效、更快。
但它也给学习范式加了一些限制:一定要有一个离线数据集,训练出一个模型,再让模型具备某种能力,它不能持续迭代。
所以我觉得这种学习方式没有人类学习能力强。它可以在短时间内达到很强的能力,取得短期结果,但不具备持续学习能力。
最终,人工智能肯定需要持续学习能力,特别是在具身领域。具身智能涉及和硬件本体的融合,而硬件本体和软件之间会有差异。
比如车辆在道路上行驶时,轮胎和地面的摩擦力不一样,算法没办法直接感知这件事,所以肯定会犯一些微小错误。
如果算法没有持续学习能力,就会局限在过去的世界。
端到端有一个典型问题,就是 OOD,也就是对数据分布外场景的泛化能力不足。
回到刚才的话题,具身智能中本体和环境都会变化,所以软件的适应性要求非常强。但监督学习范式的数据采集过程限制了你只能收集完美数据。
比如自动驾驶只能收集高质量数据,但当车辆处在错误状态时,它不知道怎么恢复。因此肯定需要像人类一样持续学习,在真实世界中反复练习、纠正错误。
现在的 supervised learning 范式,如果要学习新东西,就要重新做一遍预训练,这个过程很麻烦。
卫诗婕
这个过程是从监督学习到强化学习吗?
陈龙
强化学习解决了一些问题,但本质上还需要更前沿的学习范式,比如 self-evolving,也就是自己不停迭代、自己学习。
卫诗婕
索性人类也不要给它设定激励,让它自己学习。
陈龙
对。或者在真实环境中让它自由探索,学出来的东西反而可能是更加稳定的学习范式。
卫诗婕
但总体来说,你仍然认为下一个里程碑是像人一样全面学习,而不是有一天完全抛弃人类的学习方式,探索出一套更适合机器的、无限机器学习的范式?
陈龙
不排除这种可能。但沿着现在人工智能的发展,我觉得它需要自我迭代的范式。沿着现在的道路,这种方式可能更 promising。
如果突然出现一种能自己学习很多东西的方式,肯定会是重大突破。
卫诗婕
所以 MiMo-Embodied 比起你刚才最开始讲的 Lingo,本质区别是一个是 VLA,一个是 XLA,感知层面加入了更多模态。还有什么本质区别吗?
陈龙
还有刚才提到的潜空间推理,以及最终将世界模型和强化学习结合起来做后训练,让它在道路上的表现符合人类预期,更像一个完整产品。
Lingo 更像实验室 demo。
卫诗婕
你之前有一个判断。我们讲“大力出奇迹”,就是堆算力、堆数据的 scaling law,在语言模型和视觉领域都已经得到验证。
但你认为具身领域要迎来 scaling law 更难,为什么?
陈龙
我之前也验证过一些 scaling law:加入更多数据,训练得到的 loss 会更低,这符合语言模型和 Transformer 上出现的 scaling 特性。
但部署到真实世界后,它的性能并不会完全符合训练时的 scaling law。
本质问题是,具身智能是一个系统工程,不仅涉及软件,也涉及硬件,会不可避免地产生错误。如何从错误状态恢复出来,这个能力在 scaling law 中没有体现。
Scaling law 是开环训练,你只是学习了在某个场景应该做什么,学习了一条完美轨迹。但更需要学习的是,在不同状态,特别是出错时,应该怎样表现,具备随机应变的能力。
卫诗婕
高阳老师前段时间也说过,具身智能不需要高质量数据,反而需要一些很脏的数据,这样才能知道在错误状态下如何纠正回正确状态。
但它还是需要大规模应用,对吗?
陈龙
对。前提是要有大规模应用场景。
卫诗婕
你还说过,具身模型的 scaling law 可能接下来最快来自视频。
陈龙
现在我们对语言的开发已经很充分,但还有很多视频数据没有得到很好利用。
其中一个原因是,视频数据的语言标注缺失,所以没法训练出很好的视频语言模型。
另一种做法是直接从视频进行自监督学习。这个范式比较类似世界模型:不停预测下一帧是什么样,我们已经有真实的下一帧视频,因此可以用它做自监督训练。
这种方式看起来很简单,但实际上可以学到很多能力。因为要预测下一个像素往哪里变化,就要预测物体的位置、深度、自己的速度、物体变化的速度,以及物体属性。
比如道路上的行人下一秒在哪里、能跑多快、是小孩还是年轻人、离你有多远。模型需要内在地学习和理解很多信息。
这些信息不需要人工标注,只要预测它未来在哪里,就可以隐式学到。
所以世界模型通过大规模训练,可以学到物理世界很多本质规律。
卫诗婕
怎么理解“隐式习得物理规律”?
陈龙
如果显式学习,就要给它很多监督信号,也要做很多标注。
隐式学习就是不直接标注,而是直接让它预测未来会到哪里。
卫诗婕
一个是 rule-based,把各种条条框框、各种场景限定好,告诉它每个场景该怎么做,相当于老师给你上课。
另一个是进入社会之后,自己经历很多 lessons,形成对世界的理解。这就是你说的隐式推理,本质上还是 Bitter Lesson 的逻辑。
陈龙
对。
卫诗婕
具身智能和自动驾驶两个领域的融合,已经看到一加一大于二了,对吗?
陈龙
是的。我们在 MiMo-Embodied 的技术报告中,已经证明这两种模态可以互相促进、互相融合。
卫诗婕
刚才你提到强化学习之外,现在还有很多新的学习范式。这些学习范式对你们来说是很重要的探索吗?有哪些新的学习范式?
陈龙
我们团队定位比较偏预研,探索 N+2 的事情。
卫诗婕
N+2 是指这一代叫 N 代,N+1 是下一代,N+2 是往后两代?
陈龙
对。我们会不断发现最新架构,引入学术界成果,为下一代产品提供建议,也会投入一些热门方向,在技术成熟时把预研项目转化成量产产品。
卫诗婕
无论具身领域还是智驾领域,有两个词经常被提及,一个是模仿学习,一个是强化学习。这两种学习方式的占比大概是多少?
陈龙
现阶段我们也类似于大语言模型的训练范式,模仿学习训练占比更多,因为数据很多,scaling law 特性也是在模仿学习范式上体现的。
强化学习更多是激发模型的一些特性,以及和人类偏好进行对齐。这跟人类教育类似:大部分时间学习书本知识,当具备一定智能程度后,再通过特定 reward 把能力激发出来,在实践中继续学习。
当然,reward 信号可能比较稀疏。大部分时间是在学习整体知识。
卫诗婕
所以这一切仍然是基于神经网络,对吗?
陈龙
这一切的前提,是有一个很 scalable 的网络,也就是 Transformer。
10. Physical AI Enters Deep Water
卫诗婕
我经常听到一句话:智驾进入深水区。这个深水区到底指什么?
陈龙
可能有几点。
第一,智驾越来越像一个科技产品。它不仅仅是把你从 A 点带到 B 点,更重要的是智能化水平,包括有没有使用最新架构、能不能提供高级功能。
第二,智驾越来越好之后,需要接管的场景越来越少,但剩下的接管场景越来越难。看能不能解决最后百分之零点几的困难场景,这也是一个深水区。
卫诗婕
所以 2026 年,我们会看到更多自动驾驶、具身智能、语言模型三者协同进化吗?
陈龙
也要看公司具体业务。小米有很大优势,因为自动驾驶、具身智能和大模型最终肯定要融合起来,实现物理世界的 AGI,也就是大家说的 Physical AI。
卫诗婕
你说到 Physical AI。去年 GTC 大会上,黄仁勋演讲里有一张折线图,从生成式 AI 到 Agentic AI,最后才到 Physical AI。
Physical AI 是最远、最高的点,意味着难度最大。除了刚才讲的数据差异之外,还有哪些技术瓶颈需要突破?
陈龙
现在 agent 已经做得非常好。特别是 OpenClaw 出来之后,我们发现给它一个任务,它可以不断探索,最终把任务完成。
物理世界 AI 更难的地方,第一是数据非常少;第二是它不会在真实世界中试错和学习。
卫诗婕
为什么物理 AI 还无法持续学习?
陈龙
可能是监督学习发展太快了。学术界很长一段时间都在监督学习范式上探索,真正探索在线学习的学者还比较少。
但现在大家其实已经意识到这个问题。最终的智能肯定需要在物理世界中持续迭代和优化。
卫诗婕
所以你的意思是,AI 界因为大模型已经转身了,但原来的物理 AI 学界转身的人没有那么多?
陈龙
对。也受硬件限制。软件很好迭代,世界是扁平的;但硬件不同,产业链对未来的优势肯定是在中国,因为我们离产业链非常近。
卫诗婕
那你怎么定义智驾接下来短期要攻克的挑战?
陈龙
首先要进一步降低接管率,实现更高级的自动驾驶产品,进化到 L3,甚至 L4 的产品。
进入深水区之后,进一步利用 VLA、世界模型等技术,解决更长尾的场景,让它实现不需要接管的目标,最终实现 robotaxi 等应用。
卫诗婕
Physical AI 接下来如果要更上一个台阶,现在有哪些技术路线是你比较看好的?
陈龙
我觉得比较好的路线,是 World Model 如何融入 VLA 框架。
World Model 通过预测视频的下一个状态,让系统具备预测能力,解决物理世界运行规律的问题。
现在很多人感觉 VLA 没有 World Model 火了,或者 VLA 不行了。但实际上,我们仍然需要 VLA,包括语言的常识能力,因为那里面包含更多人类定义的规则和人类智慧的捷径,这些都可以通过语言表达。
所以我最终觉得,要把世界模型和 VLA 统一起来:既使用 World Model 对底层物理规律的表征,也使用人类语言这个智慧结晶进行推理,最终才能实现终极具身智能。
卫诗婕
听你讲完,我有一个理解,不知道对不对。
听起来,世界模型像是探索物理智能的一种范式、一种训练方式,通过这种方式获得对物理世界的智能。但要把物理智能应用起来,现阶段 VLA 可能是一个比较好用的架构。
陈龙
是的。VLA 本质上是一个框架,World Model 可以作为一种推理方式融入这个框架。
最终的认知、推理和决策,我觉得这个框架是没有错的。
卫诗婕
还有哪些标志性的派别吗?
陈龙
VLA 这 3 个方向都有不同探索。
V 主要是如何获得好的表征,进行表征学习,以及多模态融合。
L 主要是如何高效推理,如何使用语言、视觉,甚至潜空间进行推理。
Action 主要是如何输出更好的 action,包括使用离散 action token,或者使用 flow matching。
这 3 个方向各自都有很多探索。
卫诗婕
进入多模态和物理 AI 领域之后,我觉得华人团队其实比较有优势。
陈龙
在多模态领域至少是这样。
国内科研越来越扁平,开源大模型也促进了科研能力的发展。现在全球做科研的水平基本上已经拉齐了。
但国内还是有很多优势,包括数据优势、产业链优势,以及中国人刻苦的精神。迭代速度会更快,而且我们现在的创新性也不差。
未来更多创新性工作,可能会首先在中国产生。
卫诗婕
我知道你最近也回过伦敦。回伦敦时,你有没有跟原来圈子里的学者朋友聊天?
回到中国生活了这些时间之后,有没有一些比他们更多的增量和更高频的信息摄入?你有感受到吗?
陈龙
有,很早就感受到了。
国外有一句谚语:There’s always a Chinese person smarter than you and working harder than you。总有一个中国人比你更聪明,但又比你更刻苦。
海外其实也意识到了中国的崛起,这也是我回国的一个原因。
我进一步看到了,国内不仅硬件发展得很好,软件、智能化和 AI 也取得了很多领先成绩。
在国内,可以快速迭代、验证想法,把它做成产品推送到用户手中,这给我的成就感更多。
卫诗婕
全球现在很多团队都在做 Physical AI,你觉得最终决定差距的会是哪些因素?
陈龙
这个不太好预测。Physical AI 最大的区别是,必须在真实世界做实验,才能验证想法。
过去自动驾驶领域有很多论文,真正使用时效果可能没有那么好。因为自动驾驶有很多 benchmark,尝试在虚拟世界中建立评测指标。这当然促进了学校里对自动驾驶的研究,但最终发现很多方法并不是特别 work。
所以我觉得最终需要在物理世界中做实验,在真实环境里验证想法,才能更快达到物理世界的人工智能。
卫诗婕
最后来聊聊人才。
去年我观察到一个现象,你肯定也留意到了:很多智驾领域的人才,要么出来做具身智能创业,要么流向具身领域。这两个行业本质上在共用一批人才。
你有没有观察到两个领域人才融合的现象?随着训练趋向大一统,这两个行业会越来越重合吗?
陈龙
智驾确实面临人才流失的问题。不仅是学生,很多老师、教授也纷纷转向机器人方向。
首先,智驾和机器人本质上都是具身智能,所以转换起来会非常快。
另外,具身智能催生了更多初创公司,薪水也炒得比较高,导致很多学生转向具身智能和机器人领域。
最终这肯定是一个趋势。
但我觉得自动驾驶还是非常有意思。我在自动驾驶领域探索了很多年,特别喜欢在车里体验自动驾驶算法带来的微妙感觉。
坐在车里,感受到模型控制车辆完成每一个动作,会带来很大的震撼,成就感也会更高。
机器人可以让它完成一些任务,可能带给你的感官刺激少一些。
卫诗婕
比如让它给你按摩。
陈龙
对。现在也有很多人想找统一范式,把智驾和机器人统一起来。
卫诗婕
你们不就是吗?
陈龙
对。
卫诗婕
这会成为你们招揽人才的一个武器吗?
陈龙
当然。很多人对大模型、自动驾驶、汽车智能这 3 个方向都感兴趣。
我们招人的时候,只要做过其中两个方向,我觉得就很适合。
卫诗婕
所以你们招人时,会有什么样的偏好吗?
陈龙
首先肯定要招高潜人才。
卫诗婕
你们怎么定义高潜?
陈龙
主要看之前有没有参与过比较好的项目,或者有比较好的 idea;也会看对新事物的认知怎么样,有没有探索新事物的潜力。
卫诗婕
你加入小米之后说过,小米的企业文化很好,具体体现在哪里?
陈龙
小米的价值观是真诚、热爱。我们是真的热爱这个方向,热爱这个目标。
卫诗婕
今天 AI 领域对人才的争夺比以往任何时候都激烈。你觉得一个组织应该释放什么样的信号,才能吸引真正优秀的人才?
陈龙
首先要看组织有没有在这个方向进行大力投入。
候选人筛选企业时,一个很大的指标就是:企业是否有长期、重视的投入。只要长期投入,这个方向肯定会越来越火。
还要看团队有没有做出有影响力的工作,比如发布技术报告、发表有影响力的论文,这些对吸引人才都很重要。
此外还有价值观上的吸引,我觉得小米在这方面做得不错。
卫诗婕
我问一些大家比较感兴趣、但可能比较尖锐的问题。
任何真正的创新,都可能面对旧规则的阻力。一家企业越大,意味着旧规则可能越多、越深。你在小米碰到过吗?
陈龙
我觉得这种事情各个公司肯定都有,海外公司也有很多。
但小米还是一家比较年轻的企业,而且崇尚开放文化,任何人都可以挑战规则和限制。
卫诗婕
现在越来越多像你这样的 90 后 leader,开始承担这样的责任,扮演重要角色。大家在这个过程中会怎样践行?
陈龙
小米有一个价值观叫共创共识,会听取所有人的意见。
共识往往最难达成,但我觉得也是最需要达成的。如果没有达成共识就去做一件事,下面的成员可能不认可这个方向,也没有动力;遇到困难时,可能就会轻易放弃。
所以做一件事之前,要充分形成共识,让大家相信这个方向。
比如把自动驾驶和具身智能融合,之前没有人做过,但大家都对这个方向特别感兴趣,很想验证它。于是我们形成了共识,相信这件事能做成,也在这个信念下克服了很多阻力,把它做出来。
共识虽然很难,但非常重要。
卫诗婕
加入小米之后,印象最深的事情是什么?
陈龙
印象最深的是发布 MiMo-Embodied。
这个模型花了很大力气训练出来,也是很多团队协调合作的结果。我们和罗福莉团队、机器人硬件团队进行了很多合作,克服困难,把所有数据融合在一起,使用强大的基座模型,耗费了很多资源,最终训练出来。
我们看到它在 benchmark 上达到的效果非常好,也特别开心。雷总还在微博上转发,我觉得这件事特别有成就感。
卫诗婕
接下来的 3 年,你最期待的事情是什么?
陈龙
首先,希望看到更高阶自动驾驶落地,特别是 L4 robotaxi 服务真正实现无人驾驶。
第二,希望看到机器人在生活中有更多应用,也就是大模型进入物理世界,帮我们做更多事情,比如帮我们做咖啡,这样我们就不用自己做咖啡了。
卫诗婕
那你不是少了很多乐趣吗?你不是很爱做咖啡吗?
陈龙
对。但我们可以指导机器人怎么做更好的咖啡。
卫诗婕
刚才在楼下,你带我参观园区时,讲到小时候看的第一部美剧是《霹雳游侠》。它讲的是汽车如何真正成为你的 copilot、伙伴和助理。
我们也说到,这件事可能很快就会发生。你觉得距离《霹雳游侠》描述的场景来到现实生活,还有多远?
陈龙
我觉得其实已经非常接近了。
在小米汽车里,你可以和小爱同学自由交流,最新版本也有语音控车功能,跟美剧中描述的场景已经非常接近。
接下来就看能不能把这个能力做得更好,扩展到更多设备上。
卫诗婕
还有一个问题想追问。
刚才你说,如果一件事情跟雷总讨论 3 次,他都拒绝,就不会再有第 4 次。
假如现在你非常相信一个技术方向,已经争取了 3 次,但雷总仍然没有同意,而你真的非常相信它会成功,你还会有第 4 次吗?
陈龙
我肯定还是会坚持。
如果我相信一件事情,我觉得自己可以去影响雷总做一些决策,会尽力影响他。当然不一定能完全说服雷总,但肯定会尽力争取。
卫诗婕
好啦,这期节目就到这里。这期播客的视频版已经全网上线,欢迎前往B站、微博、小红书、视频号、腾讯视频、YouTube等平台都能找到我的视频专栏,也欢迎关注我们的同名公众号。这是一档追求深度、生动与信息质量的科技商业访谈。我们争取在每一个技术、商业时代的关键变化节点,提供负责可靠的一手信息。欢迎在评论区留下你的评论,你的转发、分享对我们来说真的很重要,也欢迎提名你想听的嘉宾,我们下期再见。