# 新年直播2：特斯拉FSD以及自动驾驶的商业战争

硅谷101 · 2026-01-14 · 39 min · https://sv101.fireside.fm/232

## 逐字稿

泓君

大家好，欢迎收听硅谷101，我是泓君，这是我们新年直播的第二集节目。

这期节目播出以后，是讨论热度最高的一期，同时也有一些小争议。争议的主要点在于，我们的两位嘉宾都是特斯拉的支持者，所以大家会问：从平衡的角度来看，为什么节目里只有一方的观点？是不是应该把持相反观点的人也请上来，让他们在节目上辩论？

这当然是我们非常理想的一种节目形态。不过大家别着急，之后我们也会在节目里引入 Waymo 以及其他 L4 厂商的观点，尽量让双方都有完整表达的机会。另外，特斯拉 V14 的进展以及它在自动驾驶领域的表现，确实可以说非常好，也值得单独讨论一期。今年特斯拉还会有很多大动作，我们会持续关注自动驾驶领域的进展。

今天跟我在一起的嘉宾，是汇尔智能的 CEO 及创始人大卫。大卫，你好。

大卫

大家好，大家新年好。

泓君

大卫也是《大小马聊科技》的主播。还有一位是 Twitter 听众们非常熟悉的、特斯拉前 AI 工程师于振华。老于，你好。

于振华

大家好，新年好。

泓君

### 自动驾驶竞争升温

最近这两周，整个自动驾驶圈发生了很多有意思的事件。比如特斯拉 V14 的升级和使用体验，我看到用户的评价和反馈都非常积极。跨年夜那天，我看到一条新闻，说有一位特斯拉车主从美国西海岸开着特斯拉 FSD 一路到了东海岸，全程没有接管，包括充电、停车时也没有人工介入，而且他说整个过程中没有出现任何险情。

另外，最近在湾区，因为大卫你也来湾区了，我们明显看到 Waymo 的车在变多。我看了一下 Waymo 的城市拓展情况：之前好多年它只拓展了 5 个城市，到了年底却突然又开辟了 5 个城市。Waymo 现在也在寻求新一轮融资，融资额大概是 150 亿美元，估值超过 1,000 亿美元。这对整个自动驾驶界来说都是一个好消息。待会儿我们也可以留一点时间，分析一下 Waymo 和特斯拉之间的竞争，我觉得这是所有关注自动驾驶行业的听众都非常关心的问题。

最后还有一个让大家有点意外的新闻。前两周旧金山发生了一次停电，结果导致旧金山交通大拥堵。为什么会拥堵？因为 Waymo 不知道该怎么开车了：路口的红绿灯不工作，它不知道该怎么办，于是就停在那里，整个旧金山陷入了一片拥堵。

我们可以一个一个来分析。老于，你要不要先跟我们分析一下？你最近用上 V14.2 的最新版本了吗？

于振华

### V14带来体验跃升

我用的还不是最新版本，因为我现在不在美国。不是 V14.2，它现在好像已经有 V14.2.2.2 了，版本精确到了这么多位。正好在它更新的时候我不在美国，不过我已经用到 V14.2 了，和最新版本是一个非常接近的版本。

在我看来，自动驾驶从技术上的进展，最近两三年基本上都是特斯拉在主导，其他公司、其他技术路线基本上处于停滞状态。

说到 V14，去年下半年刚推出第一个版本的时候，我还说自己不是非常喜欢这个版本，因为从用户体验来看，它还比较保守。车在右转的时候会等很久，到了 V14.1.4 左右的时候，我不太确定具体是哪一个版本，它马上就提升了很多。到现在 V14.2 已经非常好了。

我后来又想到，我们过去讨论过：特斯拉 FSD 这么好的产品，大家为什么不用、为什么不买？当时我会觉得是用户不懂。但现在我改变了这种想法：不是用户不懂，而是产品还不够好。

我发现舆论正在转变，特别是在美国测试 V14 之后，你会看到很多人说：“我今天又是没有接管。”因为 V14 出来之后，司机监控放松了，不需要一直盯着前方，体验一下子就上升了。它驶出停车场、进入停车场的表现也好了很多。

对我来说，最重要的还是安全性。在高速上，有时候车辆在大弯道变道，你还是会很害怕。我觉得 V14 以后，这些担忧已经少了很多。今年来看，我认为这里面的技术肯定有了很大的提升。应该是上半年特斯拉推出无人出租车，大卫也来奥斯汀和我们一起测试了；上半年积累这些能耗，到了下半年就应用到 V14 的提升上。

大卫，你有用到 V14 吗？

大卫

### Robotaxi比拼真实体验

有。我圣诞节前在湾区刚好打到了 Robotaxi，应该是最新的一个版本。那天我还发了个朋友圈：从我家到健身房，我同时打开了 2 个 App，一个是 Tesla Robotaxi，一个是 Waymo。

Waymo 过不了 101 高速，所以它给我绕了一圈，差不多要 18 美元；而我自己家到健身房，特斯拉只要 4 美元多。我当时一下就想，Waymo 在湾区耕耘了这么多年，到底在做什么？过高速肯定是刚需。

反过来我也在想，特斯拉为什么走得这么快？因为特斯拉本身是量产车，所以它和当地 DMV 打交道，或者和 SFO 机场管理局打交道时，并不是在做一款全新的自动驾驶车辆。它的推进速度会非常快。

Robotaxi 给我的感觉依旧是非常无聊。我觉得一辆自动驾驶车表现好，就是应该让人觉得无聊：坐在上面会想“就这样？它已经把我送到地方了。”不像 Waymo 在旧金山，经常会给我一些体验，比如“这个坡它也能过”“它居然能绕到 Twin Peaks 山上”。

反过来说，一个产品真正做好了，就说明它已经和你融为一体，你不需要额外感知到它的存在。

泓君

我稍微补充一下你打车和测试的场景。你的意思是，你用 Waymo 的时候因为它要绕路，所以理论上要花 18 美元，但你没有真的花这 18 美元，因为它需要绕路，你就没有乘坐，对吧？然后你打了一辆特斯拉 FSD 的车。

这里我觉得需要跟观众澄清一点：Waymo 现在可以完全不带驾驶员，但特斯拉的无人驾驶车上还需要配一个安全员，至少在湾区是这样。在奥斯汀，特斯拉开始测试时不需要驾驶员；在湾区，主驾驶位还是需要有人坐在那里。

于振华

奥斯汀也开始测试去掉驾驶员了，只是它现在主要还是配安全员，慢慢测试去掉安全员。高速是自动驾驶场景里相对简单的场景，但为什么每个玩家都是最后才把高速开放？因为它的风险太大了。一旦出事，就会非常危险。

Waymo 现在有些路径已经上高速了，可能大卫那天刚好是某个入口不上高速。

泓君

### 无人化商业化开启

所以现在特斯拉在奥斯汀的进展是怎么样的？刚才老于提到，特斯拉可能一开始还是要配安全员，然后慢慢把安全员去掉。去掉安全员是需要政府申请牌照，还是说只要技术过关，就由特斯拉自己决定？这个界限是什么？

于振华

据我所知，在奥斯汀，也就是德克萨斯州，应该不需要监管部门再次批准，现在可以直接拿掉安全员。这也是特斯拉社区非常关注的话题：马斯克不是说了吗，要在年底之前拿掉安全员，怎么还没拿掉？难道说的是农历新年？

根据我对特斯拉工作的了解，它是有节奏的。因为整个团队现在 V14 的最后一点工作还没有做完。如果技术团队根本没有完成这件事情，就不太可能在这个方面有很大进展，所以我觉得可能还会晚一些。

我觉得还要非常重视 Cybercab，也就是真正没有方向盘的车，它的量产时间。马斯克确定的是 4 月份，我的理解是 2026 年 4 月，对吗？

大卫

对。大家知道，量产车一旦出来，就会非常压资产。大家说 Waymo 已经拓展了这么多城市，但它实际上还是大约 2,000 辆车，对不对？因为这不是互联网行业那种完全的规模经济。你扩展到一个城市，就需要增加车辆，而增加车辆的成本非常高，这也是 Waymo 为什么还要融资数十亿美元。

大家都知道特斯拉现金流比较紧张。特斯拉不像 Alphabet，如果没有足够信心，就不能贸然量产这款车。因为车辆生产出来以后，如果积压在那里，不能上路接人、产生现金流，对公司来说是很大的风险。

所以我觉得，在量产之前或者量产之后用一两个月把车辆 ramp up，再去掉安全员，这是一个非常合理的时间点。

泓君

所以你们觉得，如果特斯拉现在把安全员去掉，至少在奥斯汀这样的城市，已经不是卡在技术上，也不是卡在监管上，对吗？

于振华

对，不是卡在技术上。但在加州，我觉得还是卡在监管上。奥斯汀是可以先上路、后监管的模式；加州正好相反，要先拿到牌照，再上路。

泓君

目前来看，主要还是卡在技术上。

### 停电暴露路线差异

刚刚我们聊了一些特斯拉在 Robotaxi 方向上的对比。还有一个很有意思的对比，就是今年刚开始提到的旧金山停电事故。我们发现 Waymo 停在那里，不知道该怎么办，但当天特斯拉并没有僵持，FSD 功能运行得还很顺畅。两位能不能从技术层面给大家讲一下，为什么会造成这种差异？

于振华

当时我也很惊讶。我以为 Waymo 就算是 rule-based，至少也应该有多套备份逻辑，对吧？美国的交规实际上是有路权的。假设没有红绿灯，我们还可以看到 Stop Sign，谁先到、谁先走，规则是明确的。

特斯拉看不到红绿灯时，遵循的就是路权优先：谁先来，谁先走。但我很惊讶的是，Waymo 居然没有在这套逻辑上做好处理，这让我觉得非常不应该。

至于红绿灯识别，有些人说是不是用了 V2X 之类的技术，这倒不是。美国的基础设施建设成本很高，不像国内可以搞车路云一体化，Waymo 也不会采用车路云一体化。

还有一点，对于旧金山这样的城市，我们认为它其实并不大，面积大概相当于深圳南山区，或者上海浦西某个区的范围。在这样一个范围内，Waymo 已经跑了很多年，却仍然会出现这种无法应对的 corner case，而且面对的是大面积瘫痪。

也就是说，即使你在一个城市里不断测试，最后把它完全跑通，它仍然可能面对新的 corner case。这对商业运营来说还是有风险，所以我觉得，整个技术路线可能都需要重新考虑。

泓君

所以整体上总结一下，特斯拉是一种端到端的训练方式。我们可以把它理解成一个黑盒：根据大量数据去模仿人类。Waymo 则是 rule-based 的技术路线，更像一个白盒。当规则发生变化，或者遇到未知情况时，它就不知道该怎么处理，所以会卡在那里。

而且 Waymo 有一个先天优势，就是旧金山的高精地图已经被它采集了很多年，精度非常高。只是这一次红绿灯没有亮，相当于百密一疏。但对于商业化运营来说，百密一疏也会带来很大的损失。

大卫

我可以跟大家分享一件事。有一次我在旧金山吃饭，饭店需要等位，我就在一个十字路口坐了半个小时。那半个小时里，我看到一辆 Waymo 车，当时路上有点堵，它想左转，却一直转不过去，连续等了六七轮红绿灯，把后面的车全部堵住了。

最后它突然非常快地转了过去。我猜可能是人接管了，最后一下是远程操控。

于振华

对，有可能会有远程操控技术。真正做商业化运营，都会配备远程操控。

大卫

还有一次，我带着当时还很小的儿子坐 Waymo。上车没多久，车就靠边停了，随后通过语音电话告诉我：“不好意思，小朋友太小，不能乘坐。”然后给我结了账，让我们下车。所以它是能够识别这种情况的。

泓君

所以从停电事件来看，特斯拉的训练方式在自动驾驶里还是很有优势的。

于振华

对。它遇到意想不到的 corner case 时，可以积累很多经验。不过我们开玩笑说，Waymo 有点像有轨电车。和有轨电车相比，特斯拉有时候甚至没有有轨电车跑得好。

Waymo 这条路线的优势是，发现问题之后，它肯定会马上修复。但下一个不可预见的场景会是什么，你不知道，因为你之前没有定义过。特斯拉则不一样，我觉得只要你用过 V14，就知道它在很多场景下表现得非常游刃有余、从容自然。

泓君

### 端到端破解规则困局

大家刚好提到这个事情，让我想起了特斯拉 AI 技术负责人 Ashok 的一场演讲。他在 ICCV，也就是国际计算机视觉大会上，讲过为什么特斯拉要采用端到端训练模型、它的原理以及遇到的挑战。

他提到了一个非常经典的、我觉得可以算是“迷你电车难题”的例子：前面有一条路，路上有一个非常大的水坑。你的车是直接开过去，毕竟水坑可能很深，你不知道它的深度；还是借道，暂时逆行绕过去？

如果是 rule-based 产品，这个问题很难写死。水坑有多深、对面有没有车，这些都需要判断。

于振华

但是如果是端到端模型，人面对这种情况时，基本上看一眼就知道：对面没有车，水坑不深不浅，我可以借道一下。人会权衡利弊，AI 也可以解决很多需要及时处理的情况。

对，而且这是您刚才讲的。很对，这个是表征的，还有一些隐含的。

前段时间，大概一个月以前，国内湖南某个城市的一辆无人出租车撞了人。造成事故的主要原因是，当天前面有一辆洒水车，把地面洒得很湿。车辆判断刹车距离时，路面湿滑这个因素没有写进它的参数里。

但我们想象一下，特斯拉这套体系在人驾驶的状态下，即使实验室里没有专门针对雨天去采集数据，人类在雨天的驾驶行为也会被记录下来，并被用于端到端训练。因此，它不太会因为雨天路面湿滑、刹车距离稍微变长，就完全无法应对。

当我们基于 rule-based 的路线去做解耦时，会发现永远有解不完的问题。

我想引用一下我的前老板、也是 Ashok 前任的 Andrej Karpathy。他在看到今年 V14 的进展之后，回忆起特斯拉当年的情况。我们那时候还在使用 rule-based 系统，车辆在街道上经常因为旁边停着车而刹停。如果车辆对速度检测得不好，就会刹车。

好不容易解决这个问题，结果发现有些街道不是单排车，而是两排车停在那里，于是系统又无法处理，只能重新在规则里定义一个叫作 double-parked vehicle 的情况。Andrej Karpathy 当时就在 Twitter 上回忆这个过程：有 double park，那到了其他国家，会不会有 triple park、四排、五排？

所以这种问题是无穷无尽的。当然，它的好处是修复得非常快。像刚才提到的 Waymo 场景，它回去很快就能修好。但如果是端到端系统，继续学习、继续训练，可能需要重新采集数据，修复周期会更长一些。

这也是为什么从 V13 到 V14，大家觉得等了很长时间，差不多一年才更新一次，但一更新就是革命性的更新。

泓君

老于，你刚才讲到了一点关于可解释性的问题。现在国内的技术路线大概有两派：一派认为使用 VLA 的方法一定要有可解释性；另一派认为可以把所有信息全部 token 化、打包处理，不需要可解释性。

在我看来，其实不一定需要可解释性。人去解释面前的自然世界，本身就是一种主观意识。我们面对自然世界时，很多判断都是下意识的。比如开车时，你不需要判断“这是一个红色的垃圾桶”，也不需要把它解释成这样，它就是一个障碍物。你感知到这个东西，就可以直接做判断。

所以对于可解释性，我是有些迟疑的。我觉得不需要花太多时间，让语言模型在线解释它的每一步。

于振华

如果它没有可解释性，你们怎么去相信它的安全性？

泓君

那就只能靠“力大砖飞”：数据量足够大。其实大语言模型也没有足够的可解释性。比如把大语言模型拿来做临床诊断，实际上是不行的，因为临床诊断需要可解释性，需要回溯它给出的理由：A、B、C、D 分别是什么，然后再给出药方。

但我们日常和大语言模型打交道时，比如问法律问题、医学问题，作为个人并不一定需要可解释性，只需要得到一个相对合理的结果。

举个例子，国内理想汽车第一代端到端系统叫“双系统”：一个慢思考，一个快思考。慢思考其实是在试图解释，它的输出不是给机器看的，还要给人看。前面有什么东西，它会把判断结果显示出来，就像你问 ChatGPT 一样。但这条路线现在已经被放弃了，我觉得有很多方面的原因。

其中一个很重要的原因是，在驾驶过程中，无论作为驾驶员还是未来的乘客，你需不需要知道机器在想什么、机器在告诉你什么？我认为，在线解释是在浪费时间。

于振华

AI 领域有一位很有名的科学家何恺明，他现在是 MIT 的教授。他曾经说过：你打车时，需要人类司机把他的每一步想法都告诉你吗？你也不知道他在想什么，对不对？

但刚才泓君提到的 Ashok 在 ICCV 的演讲里，专门强调了离线状态下的可解释性。可解释性对于监管很重要，也有助于模型评估、模型改进，以及下一步的数据采集。

Ashok 专门强调过，特斯拉的端到端系统是如何在离线状态下进行解释的。我觉得这很合理。像现在的大语言模型以及各种模型，不可能在线上、在车载芯片上运行特别强大的模型。但在离线状态下，有足够算力时，确实需要知道模型在某一刻为什么做出一个奇怪的操作。

刚才大卫提到 VLM、VLA、世界模型，这些名词确实让人眼花缭乱。

大卫

我非常同意最近小米汽车端到端负责人陈光说的一句话：不要制造技术焦虑，不要把各种技术名词搞得特别复杂。

你看 Ashok 的演讲，他也不会经常出来讲，更不会把各种技术名词一一摘取出来。我觉得那样完全是在迷惑消费者。真正站在技术一线的人，想的都是解决问题。

所以我提出了一个词，叫“智能密度”。Waymo 在 rule-based 这套系统上已经做得非常好了，但它还会出现刚才那种问题。这件事情暴露出来的是：Waymo 也不是纯智能。

现在已经是 2026 年，21 世纪的第 2 个季度了，我们是不是还要继续争论，到底应该用数据驱动、用 AI，还是用 rule-based？

之所以还有绝大部分玩家在使用 rule-based，我觉得只有 2 个原因。第 1 个原因是做不出来；第 2 个原因是包袱太重，不能轻易改变。我觉得这可能就是 Waymo 的问题。Waymo 连激光雷达这样的硬件都是自己制造的。

泓君

### 特斯拉的算法护城河

刚刚大家在讨论可解释性时，还有一点值得补充。Ashok 在演讲里提到，如果你想知道中间某个环节发生了什么，可以设定一个参数节点，在模型中间增加一个步骤。它其实也是解决可解释性问题的一种办法。

刚才的讨论里，老于提到“智能密度”这个词，我觉得特别好。我记得你之前有一个观点：现在特斯拉的领先，其实还没有完全用到它的数据和算力优势。我们知道特斯拉自己也在造芯片，同时拥有大量用户数据。你觉得很多厂商现在可能在算法层面都赶不上特斯拉，可以详细分析一下这个观点吗？

于振华

大家一提到特斯拉为什么 FSD 领先，通常会说是数据优势和算力优势，这一点我非常同意。但我的意思是，只有在大家都掌握已知算法的情况下，我们才去比较数据和算力。

问题恰恰在于，从特斯拉 2023 年下半年推出 V12 到今天，还没有看到任何一个玩家在算法上接近特斯拉。刚才我提到过 2 个原因：一个是包袱太重，另一个是这件事情确实很难做。

我长期关注过理想、小鹏和蔚来。它们在不同阶段都说自己在做端到端，但通过长期测评它们的表现，我认为距离真正的端到端还非常遥远。尽管它们提出了 VA、VLA 等各种概念，但实际差距仍然很大。

我们再拿大语言模型来比较。大语言模型在算法上可能已经没有太多秘密，几大厂之间的人才流动也很快。恰恰在自动驾驶这个领域，除了 Ashok 做过一次技术演讲之外，很少看到特斯拉分享具体技术。

所以它们在算法上还没有追齐，就不要先去谈数据和算力优势，那是后面的事情。

Ashok 的演讲里还有一个很有意思、也让我最受震撼的地方，就是他的 simulator。端到端，包括机器人在内，这一系列技术路线的难点都是数据采集，尤其是不同 corner case 的数据。

他的 simulator 里有一个人的方向盘，操作方式像打游戏一样，另一边可以产生新的场景，然后把这些数据采集过来。过去两三年，自动驾驶的技术更新和发展，完全就是特斯拉在引领。

泓君

你觉得算法层面的领先，拼的到底是什么？是算法核心人才，还是技术思想？

于振华

我觉得是技术思想、人才，以及置之死地而后生的勇气。另外还有计算机算力。这 3 点同时具备的，目前只有特斯拉。

从人才角度来看，现在 AI 领域的竞争，是在美国的中国人和在中国的中国人之间的人才竞争。但人才一定要处在一个好的环境里。恰恰特斯拉就是这样的环境。

真正跟随埃隆·马斯克的人，往往是内部成长起来的。再看这些人的履历，你不会看到他们是学术明星，也不会看到他们发表过多少论文。现在特斯拉的端到端团队，主要就是特斯拉内部培养起来的。

以前特斯拉的明星人物是 Andrej Karpathy，他原本是我的前老板，也是学术明星。偏偏端到端系统是在他离开之后出现的，做出这套系统的是一个内部培养起来的团队。

所以我觉得，这个土壤和环境往往更重要。外部吸纳的人才并不多，主力基本都是内部培养的。

泓君

最近 Manus 被收购，包括 C.AI 之前的案例，这些都是高科技领域非常热门的收购话题。高科技公司是轻资产模式，收购其实主要是收购人才，也就是 acqui-hire：我主要是想让你的人过来。

特斯拉当年也收购过一家叫 DeepScale 的公司，同样是 acqui-hire。它们大概有十几个人加入特斯拉，除此之外还有一些 GPU box 之类的东西。这十几个人当时也是被寄予厚望，但我觉得 DeepScale 是一次很失败的收购。

DeepScale 的创始人可能加入一两年就被解雇了，其他人也没有很好地磨合，不太适应特斯拉的文化。他们加入时曾经说：“你们做特斯拉的工作节奏，比我们这家 startup 还要 startup。”

于振华

但我觉得这不只是工作强度的问题，更是解决问题，也就是 problem-driven 的问题。关键在于，我们到底是不是一个以解决问题为核心的土壤，而不是天天创造名词、做 PPT 为核心。

整个团队里其实很少有明星工程师，大家都是默默无闻地把事情做好，以解决问题为核心。

泓君

你刚刚提到了 3 点：人才、勇气和芯片。聊一聊第 2 点。你觉得这种信念来自哪里？是来自马斯克，还是来自 AI 团队负责人，或者是上一代领导者？这个信念到底是从哪里来的？

于振华

我觉得来自马斯克。端到端这件事里也充满了一些偶然和巧合。如果在某一步没有坚持下去，也就做不出来。

现在的 Ashok 作为新任领导，同时负责 FSD 和机器人。他是第 1 个加入 FSD 团队的人。后来比他级别高的人，有的去了英伟达，有的去了 Waymo、Aurora 等公司，只有他留下来继续往下做。

就是这样一批核心骨干，把这件事情做了出来。所以我觉得，既要有埃隆·马斯克这样的领导者，也要有认同这种风格、愿意坚持下去的人。

泓君

我知道马斯克非常敢于赌方向。我想问的是，如果赌不出来会怎样？或者说，他当时看到了什么，才敢去赌这个方向？赌端到端运行模型，需要投入多少钱？

于振华

我的理解是，这是 common sense。如果你的规控工程师、算法工程师一直在修补那些永远修补不完的 corner case，你难道不会觉得这里面有问题吗？

他开始下注是在 2022 年到 2023 年吗？

泓君

其实更早一些，早到 2019 年。

于振华

对。但 2019 年到 2022 年那段时间还没有大模型。Scaling law 在 AI 界是不是已经成为共识了？

泓君

还没有那么多数据，但数据闭环肯定是共识。只是当时还没有“大语言模型”这样比较时髦的名字。要做数据闭环，肯定是因为马斯克以前做过互联网公司，他也知道要拿数据把系统跑起来，系统才能自动化。

不能把过程当成结果。比如我招很多 PNC 工程师，让他们不停调参，目的是让车跑得顺，那我直接让人开，把数据录下来，让系统跑得顺，不就可以了吗？我还是比较相信，他是从第一性原理出发，想到这个方向的。

于振华

如果你的团队今天告诉你：“我今天又修了一个 corner case，明天又修了一个 corner case”，那就说明事情不对。

这也是为什么你会看到 V11 在很长一段时间里进展非常缓慢。特斯拉没有走华为那种路线，没有招收大量人员来做 PNC，PNC 团队一直都很小。从常识上讲，这不 make sense：什么时候才是个头？

还有激光雷达的问题，这件事也是争论最激烈的。

泓君

### 芯片支撑端到端

我们刚才讨论了信念。第 3 个问题就是 GPU。你要不要讲一下当时参与开发特斯拉芯片的过程，以及芯片在特斯拉做成端到端这件事上，占据了什么位置、贡献了多大比重？

于振华

特斯拉的芯片设计在历史上有 2 条线：一条是推理芯片，也就是在车上运行的芯片；另一条是 Dojo，用来进行训练。今年 Dojo 已经被取消了，甚至它的负责人 Peter Bannon 也已经离职。

现在端到端相关的训练芯片，主要还是来自英伟达。黄仁勋曾经公开表扬过、甚至表达过对埃隆·马斯克的敬佩。他说，全世界能够这么快建成计算机集群训练中心的人，只有埃隆·马斯克：他还要建设发电和水冷系统，却能在这么短的时间内把 xAI 搞定。

当然，特斯拉所需要的 GPU 没有 xAI 那么多。我印象很深的是，马斯克特别喜欢问团队：“我能够帮你们解决什么问题？”团队接下来就会说：“我们需要更多 GPU。”他就会义无反顾地给你更多、更多的 GPU。

至于其他芯片，前 5 年我在 AI 软件团队，直接向 Andrej Karpathy 汇报；后 2 年我转到奥斯汀，做第 4 代和第 5 代芯片的设计，主要是推理芯片。

从算力角度讲，我觉得英伟达想得比较远。我加入特斯拉时，第 3 代芯片已经要上线了。今天再看，小鹏、蔚来和理想不都开始自己做芯片了吗？但在当时，大家会觉得：一个车企为什么要做芯片？那时这件事非常奇怪。

在我看来，这就是特斯拉所说的硬件和软件 co-design。Co-design 有一个问题：既然是共同设计，如果软件太差，硬件也不会太好。

对硬件工程师来说，设计芯片时最头疼的不是“给我同样大小的一块芯片，我往里面塞多少算力”，而是软件需求到底是什么。只有软件部门能够非常清晰、准确地告诉我需求，而且不只是今天的需求，还要告诉我未来 3 年、5 年、6 年的需求，我才能把芯片做好。

所以如果你问特斯拉凭什么推理硬件比别人好，我觉得核心就是 co-design。

泓君

那 Dojo 为什么失败了？

于振华

首先，Dojo 这类训练芯片的复杂度，确实比推理芯片高非常多。你要有一种置之死地而后生的勇气。但在训练芯片这件事上，特斯拉没有这种勇气，因为旁边已经有英伟达了，天天买现成的就可以。

我觉得 Dojo 缺少的就是这股勇气，所以到今天失败了。特斯拉现在还是专注于推理芯片。

泓君

第 4 代和第 5 代推理芯片有什么区别？

于振华

设计第 4 代芯片时，端到端还没有出现，所以你可以认为它是按照 rule-based 系统来设计的。设计第 5 代芯片时，已经有端到端了，而且不只是端到端，还有其他大语言模型的应用场景。

我在奥斯汀的后 2 年转到了软硬件部门。说实话，一个很大的原因是软件团队太累了。结果工作了一年多以后，埃隆·马斯克突然来硬件部门开会。他以前每周都会盯软件团队，硬件这边基本不管；有一天他突然来了，带着他的儿子开了 34 个小时的会，从晚上 7 点一直开到第二天晚上 11 点。

我觉得那时候可能和芯片、缺芯片有关，但主要原因还是 xAI。马斯克在考虑如何让 xAI 和其他玩家竞争时，意识到真正能做出最便宜推理的玩家，才会最成功。

所以在设计第 5 代芯片时，他要求把这些因素也考虑进去，不只是为了特斯拉自动驾驶。当然，未来自动驾驶也会用到大语言模型，这些因素都要考虑进去。

后面肯定还会有第 6 代、第 7 代。只做推理的话，问题会简单很多。比如最近英伟达收购的 Grok，也专注于推理。可以说，特斯拉在这个方向上已经耕耘很多年了。

泓君

稍微总结一下：你要想有好的软件，才会有好的硬件；好的硬件再去运行好的软件。

所以现在特斯拉的推理芯片，软硬件其实是在一个团队里，对吗？并没有拆分成两个完全独立的大团队？

于振华

是 2 个团队。一个在硅谷，是我前 5 年所在的地方；另一个在奥斯汀，是我后 2 年所在的地方。但两边的联系非常紧密。

泓君

你刚才把特斯拉端到端的领先归纳成第 3 点——GPU。你说的 GPU，是指马斯克很会建设数据中心，能够快速买来训练芯片；还是说特斯拉在推理这一端也很强？你们自研的推理芯片，对于端到端模型的成功推进，大概占多大比重？

于振华

我觉得这是决定性的比重。先不说特斯拉，就说理想的双系统。为什么它们要把语言模型部署到车上？它们可能会自我感动，因为这件事情确实很难。在有限的算力上，把语言模型放到车上很难，巧妇难为无米之炊。

如果你的推理芯片不行，软件这边再厉害，也推不到车上去。

我觉得特斯拉的战略眼光非常好。虽然 Dojo 失败了，但这也是一个很好的教训。搞不好有一天英伟达的 GPU 在硬件设计上推进得太慢，或者它的需求远远偏离了特斯拉的需求，特斯拉也完全有可能重新做训练芯片。

它的整体思路是正确的。今天我们赞扬 Gemini、赞扬 Google，很大一部分原因就是 Google 有 TPU。如果没有这么早的战略眼光，只注重软件而不注重硬件，我觉得不可能走得这么扎实、这么远。

泓君

### 中国厂商难追特斯拉

大卫，你在硅谷和国内两边跑。国内的新能源厂商是一类，做 L4 自动驾驶的厂商是另一类。现在大家都已经看到特斯拉端到端模型的表现，它们也在学习特斯拉。你觉得它们要学特斯拉，核心壁垒在哪里？

大卫

这是两类公司。首先，L4 Robotaxi 公司是学不会的。一方面是钱不够，另一方面是商业模式可能支撑不到它真正把这件事情实现。

特斯拉的取巧之处在于，它使用的是量产版汽车。目前在路上跑的，主要就是 Model Y 这样的量产车型，Cybercab 是例外。你让 Robotaxi 公司去做，即使是像百度这样资金比较充足的公司，也只能和别人合作开发一款车，不可能完全自己造一款车。

其次，在算力、人才储备和方法论上，它们都差得太远，现在已经很难掉头了。

回到主机厂这部分，可能主要是 L2、L3 厂商。它们从 3 个方向追赶：第 1 类是芯片公司向上游延伸，比如地平线；第 2 类是算法公司整合芯片能力向上延伸，比如 Momenta；第 3 类是零部件供应商打算包圆，类似华为。

实际上，这 3 类公司在 L2 到 L3 的产业链上，利润点并不一样。卖硬件的利润不会特别高。比如之前的 Huawei Inside，以及鸿蒙智行，我觉得它们的利润率不会高；反而是卖芯片的利润率高，地平线的利润率肯定高。

这 3 类公司我们可以继续观察。每一家都想做垂直整合，关键是看谁能继续向后走。

现在有人说自动驾驶进入下半场，但我觉得你又不是吹哨的，怎么定义上半场和下半场？上下半场不可能由你来定义。对大部分中国公司来说，现在仍然处于非常早期的阶段，刚刚找到一条门路。

而在寻找这条门路的过程中，已经有大量公司死掉了。留下来的少数公司，分别从芯片、算法和硬件端向特斯拉的方向靠拢。当然也有激光雷达公司，但激光雷达公司只提供硬件，不提供算法，所以还是要分成几类公司来看。

泓君

振华，你有补充吗？

于振华

作为特斯拉投资者，我一开始对国内情况不太了解。看到国内一些厂商最初的宣传时，我着实有些震惊：难道进展这么快吗？

但最近两三年，我认为特斯拉领先的，不管是 VLM、VLA 还是世界模型，差距不是缩小了，而是扩大了，领先优势越来越大。所以短期内，我不认为它们有机会追赶上特斯拉。

泓君

### Waymo估值经不起推敲

最后一个问题。我们刚刚聊了很多特斯拉。开始时我也提到，Waymo 最近准备以大约 1,000 亿美元的估值融资 150 亿美元。其实 Waymo 也有它的优势：首先，它已经去掉了司机，每公里的运营成本现在是 1.43 美元；特斯拉可能是 0.81 美元，这个数据来自摩根士丹利的报告。

不过摩根士丹利预测，Waymo 新的一年里，新的车型每英里的成本可能会降到 0.99 至 1.08 美元，成本还会大幅下降。

我知道两位也是特斯拉股票的持有者，这应该是对的吧？从投资者角度来看，按这个估值，你们会投资 Waymo 吗？

大卫

不会。我属于比较保守的投资者。为什么我会孤注一掷地投给特斯拉？因为我觉得，刚才那个价格无论降到多低，Waymo 真正量产运营时的成本也不会比特斯拉低，一定还是会非常高。

这里面还有一个 maintenance 的问题：你要运营一个车队，需要充电，还要管理各种传感器，传感器也会损坏。不是简单地算一辆车接了多少单、除以成本，而是一个非常大的系统。

在旧金山湾区，Waymo 的充电站里，光负责充电的人就雇了 3 个。他们坐在椅子上看着这一堆车，车来了就帮忙把充电桩插上。这是额外的人力成本。

特斯拉不需要这个人。在 Cybercab 上，它使用的是无线充电。所以我想说，对于这类技术公司，我们看账面上能不能打平，只是一方面，还要看整个生命周期内车辆能使用多久。

Waymo 使用的还不是固态激光雷达，而是机械激光雷达。这个行业里大家心里都有数：机械雷达天天在那里转，到底能转多久？两年差不多，3 年可能就不太行了。特斯拉则使用摄像头。

所以如果把折旧和均摊成本都算进去，差距还是很大。我不会投资 Waymo，而且我觉得 1,000 亿美元实在太贵了。

泓君

老于应该也不会投资吧。

于振华

当然不会。不过我觉得 Alphabet 这家公司还是非常不错的。过去这一年 Gemini 确实很优秀。但你看，Alphabet 也没有 all in Waymo，对不对？它也只是领投而已。

自动驾驶这件事，Waymo 的 rule-based 路线不是规模经济路线。你的用户增长 10 倍，成本可能也会增长很多，因为你需要部署更多车队，这是两个量级的竞争。

当然，我还是很喜欢 Alphabet 这只股票。

泓君

### 听众追问自动驾驶安全

接下来我们看听众提问。有一位听众问：如果 LLM 穷尽了所有数据，使用 test-time compute 等方法也无法达到很高的准确度，那么 FSD 在算力受限、没有硬编码 rule-based 规则的情况下，如何满足安全性的需求？

于振华

大家可能认为特斯拉端到端的算力要求非常大，其实不是。大语言模型，即使是 ChatGPT，也只是小巫见大巫。

其中一个很重要的因素是，大语言模型具有自回归特征。每生成一个 token，都要回来再走一遍，然后再产生下一个 token。特斯拉的模型不是这样。虽然它的输入非常大，但 latency 不需要像语言模型那样，每生成一个 token 就回来再运行一遍。

今天我们看 V14，甚至还没有用完第 4 代硬件上的算力，更不用说后面的第 5 代、第 6 代芯片了。这也是特斯拉还要持续设计下一代芯片的原因。不是因为它喜欢设计芯片，而是算力需求还会一直爆发式增长。

泓君

第 2 个问题，一位听众问何小鹏说：“今年自动驾驶会发生从 L2 到 L4 的直接跳跃，请问你们同意吗？”

大卫

首先，L2 到 L4 这套定义，是在自动驾驶还没有成熟时，由 SAE，也就是美国汽车工程师协会制定的。它写了很多规则。

我们先拿特斯拉举例。特斯拉有些表现，在 L2 上确实存在短板，但它有些长板在 L4 上又非常惊艳。如果一定按照 SAE 的定义、按照短板效应来判断，特斯拉就是 L2。但你不可能只这样定义它，所以我觉得这套定义本身就有问题。

在中国，大家还创造了一个中间定义，叫 L2.5。我也不知道为什么还有 0.5。实际上，何小鹏想表达的意思是：把原来 L2 的智能辅助驾驶系统，和 L4 Robotaxi 的端到端方案打通，这件事是对的，也是可以实现的。

但正如老于刚才讲的，这里有很多前提。首先，要有单一车型，不能有 20 款车型，每一款车型都要部署一套 AI，否则数据的一致性会很差。

其次是算力。还有一点更重要：你有没有孤注一掷地做这件事情？我觉得大部分新能源企业实际上把自动驾驶放在相对较低的优先级，可能换电的优先级都比自动驾驶高。那怎么可能把这件事情做好？

泓君

我不知道这位听众的问题是不是可以重新定义一下这些拗口的名词。他想问的，可能是能不能从辅助驾驶系统直接升级到自动驾驶系统。

我们拿特斯拉举例：特斯拉是可以把安全员去掉的。它根本没有在意自己是 L 几，也没有说一定要实现 L3 或者怎么样。现在何小鹏突然发现，原来还可以这样做。

今天的时间也差不多了，非常感谢大卫和老于的分享。这一期直播整体上还是比较支持特斯拉，两位也是特斯拉坚定的支持者。我相信听众中也有很多自动驾驶公司的从业者，不管是 L4 公司还是新能源厂商。如果大家有相反的观点，非常欢迎大家来讨论。我觉得很多事情越辩论，对解决问题越有帮助。

大卫

谢谢泓君，谢谢大家。

于振华

谢谢大家，新年快乐。

泓君

好的，这就是我们自动驾驶的节目，更多的观点与路线的碰撞，我们会留在今年的节目中持续的放出来。如果大家对这个话题感兴趣，记得在苹果播客、小宇宙、Spotify上持续的关注我们。我是泓君，感谢大家的收听，以及祝大家新年快乐。
