# Vol.216 产业观察41｜具身“不够卷”、世界模型和机器人大脑：再访逐际动力张巍

高能量 · 2026-05-09 · 78 min · https://www.xiaoyuzhoufm.com/episode/69fee24d1b7bd50295c9f74b?utm_source=rss

## 逐字稿

李翔

大家好，我是峰瑞资本的李翔，欢迎来到这一期的《产业观察》。这一期的《产业观察》，我们请回来了两年多以前的一位老朋友。那个时候，我们和张巍老师录机器人的时候，机器人只是在 2024 年初刚开始热，谁也没想到，尤其是具身智能机器人行业，在过去这两年里，在中美，尤其是在国内，经历了天翻地覆的变化，当然也持续了两年的热度。

今天我们有机会把张巍老师作为逐际动力的创始人和 CEO 重新请回来。当然，他有很多不同的头衔和背景。除了是美国归国的学者之外，他现在也是南方科技大学的教授，也是国内外机器人领域著名的研究学者，身兼这么多身份。这一次，我们想和他一起回过头来看一看具身智能机器人过去两年的变化，以及明天可能会发生什么。

我们先简单回顾一下。张老师，作为一家公司的创始人和 CEO，过去这两年你有什么感受？这显然是极其特殊的两年。

张巍

对整个行业来讲，我觉得是天翻地覆的变化。作为初创企业，为了应对这些变化，肯定也会有更多变化。我的整体感受就是不断地迭代和变化。

李翔

确实，过去这两年，机器人行业叫“没有最热，只有更热”。每一次大家都觉得已经很热了，结果还有更热的事情出现，还有更多新的变化出现。虽然热度带来了很多好处，比如融资、关注度，以及政府、行业和民间对这件事的热情等等，但除了这些好处之外，在这么热的两年里，焦虑和困惑主要是什么？

张巍

### 这个赛道还不够卷

先说这个行业的变化。这个赛道里的人都觉得很卷，但我觉得不卷，我真觉得还不够多人。

李翔

你说“不卷”，是因为大家还没有同质化，还是因为大家在同一个问题上还没有收敛到相似的解决方案，去拼效率？

张巍

因为大家总是带着互联网垂直到某一个赛道、要求规模化，以及只有做到第一名才能活下来这样的思路，去看这个赛道，所以总会说谁会留在牌桌上、谁会赢。

但整个赛道，我个人觉得不能泛泛地类比成某一个垂直领域。它应该类比于互联网。互联网可以有美团、阿里、字节、腾讯，在垂直领域还可以有 58 同城，也可以有非常多的公司。所以这里面的机会非常大，每个人只要好好干，我觉得都能活下来，因此不存在所谓的“卷”。

李翔

那你这么说，我觉得它更像新能源车。2014 年以来，大家一开始质疑的是新能源车本身行不行，后来又质疑造车新势力行不行。时间过得快一点，到十年后的今天，在这种硬件相关的载体里，加上自动驾驶技术，至少在阶段性上，大家都有一个生存之地。

不管是造车新势力，还是传统企业重新开始走新能源路线，或者是原来做不同类型的车、后来转型到新能源车上，比如赛力斯就是这么转过来的，再加上华为；又比如上汽，大家一路都不看好，但上汽从去年开始看起来已经转过来了——把合资车转成自主品牌，把燃油车转成新能源车。这些业务的占比都显著提高，甚至超过了一半。

大家都各自开出了各自的春天。你觉得机器人最终也会更像这样吗？当然，它也带来了一个残酷的现实：每年流行的新能源车品牌和产品都不太一样。

张巍

我觉得具身智能比新能源车这个赛道大特别多。我不好说一个具体数字，但是非常大。

新能源车本质上是从 A 到 B，完成出行这件事就基本可以了，而且主要面向 C 端。这里面会有很多家企业存在，也会有传统车企。再看车这个形态，它还可以发展出商务车、商用车、卡车、运输车；如果看移动底盘，还有物流。广义上，它们都是车，所以从一种形态来看，它可以衍生出很多服务。

具身智能比这个的广度还要广。我们聚焦在新能源车满足出行的 To C 领域时，它还是一个相对垂直的赛道。这里面可能会有一些玩家相互迭代，但具身智能面向的使用者目标要多得多。它是一个通用的载体，可以渗透到各行各业。

具身智能放在车里做无人驾驶，也可以；放在其他地方，也可以。所以大家可以发挥的空间非常巨大。我觉得现在远远没有收敛到一个具体目标，也没有收敛到在同一个目标下、面向同一种用户去拼性价比和价格。因为现在连功能都还没有完全实现，所以整体来讲，这个空间非常大。

李翔

那我们换两个具体的、可能会带来困扰的问题来问问。

第一个问题，今天大家有一个融资竞赛，要融到多少估值以上，要融到多少钱以上。因为你是比较早进入这个行业创业的，虽然赛道更早的时候也有人进入，但你是在这件事热起来之前进入这个行业的。今天大家开展融资竞赛、你争我抢的过程中，会造成焦虑和困扰吗？会被干扰吗？

张巍

会被干扰，但不太会焦虑和困扰，因为我们在这件事上还是有自己的原则和本质。

在融资和 PR 这件事情上，我们相对保守。我们坚信，你的价值和估值应该成一定比例，这才是健康的发展趋势。

当然，我们现在也要做很多融资，本质上是因为未来这个行业的发展，资金资本化是一个重要能力。它不是可有可无的能力，而是一个需要持续投入的赛道。企业以后规模化量产和交付的过程中，需要大量资金，所以融资从这个意义上来讲是必要的。

但不是说想不清楚要做什么，先拿一大笔钱融进来再说，这不是我们的目的。

李翔

### 人形不进工厂

我们再换一个角度。我印象中，大概一年以前，大家对于机器人为什么是人形，以及机器人将来干什么，还是众说纷纭。那个时候你还提到，从逐际动力要努力实现的技术方向，以及当时大家热衷讨论的场景来看，还是不要让它下工厂打工。

我不知道“不要下工厂打工”这件事，从今天的技术和公司变化来看，和一年以前相比，角度会发生变化吗？

张巍

这件事分两个方面：一个是我们个人的选择问题，一个是我们对行业的判断，这两者并不一致。

先说个人选择。我当时抛出了一个口号，应该是在上次和你聊完之后，我说的是“人形不进工厂”，不是所有机器人都不进工厂。我觉得一定要有人服务于工业，这没有问题，而且具身智能一定会在工业里发展。但两条腿的人形机器人，我们公司不把它定位成工厂里的效率工具，我们不这么认为。

我们有一个 slogan，叫 “Serve people, not process”。所以我们的人形机器人是服务于人，而不是服务于生产流程。它本质上不会是性价比最高、效率极致优化的产品，不适合在工厂里使用。工厂是为机器设计的，而我们的人形机器人是在人为人设计的环境里，为人提供服务。这是我们的定位差别，并不是对错之分。

很多形态的机器人，包括机械臂，以及一些带触觉的新型操作方式，都适合在工厂落地。我觉得工厂里还有很多枯燥、复杂、危险、有害的工作，需要被具身智能技术改进。我们也不排斥这些方向，但我们认为两条腿的人形机器人没有必要进工厂，这是我们的选择。

李翔

明白。那我们在这个问题上再拆开问一个问题。

### 人形追求最大泛化

我们一直讲具身，具身就是长得像人。但它最后的功能性，毕竟可以分成一体化的，也就是胳膊加腿；还可以分成更偏腿的，或者更偏胳膊的，也就是更偏操作，或者更偏运动、走来走去、跑来跑去。运动会刚刚举行完，肯定主要是偏跑来跑去的。

从今天的角度看，随着机器人关注热度和技术应用继续演进，不同的上下肢能力，更有可能在一段时间内分开迭代和应用，还是更有可能混在一起迭代和应用？我们先只讲应用，不讲技术问题。

张巍

首先，具身智能本质上落脚在“智能”，形态是承载这些智能的终端和载体。

到底需要什么样的形态？刚才你提到有人形，也可以把人形切一半，我管它叫轮椅型机器人，也就是上肢坐在轮子上。还可以只有下半身，像狗一样；也可以是我们的双轮足、双足，或者各种其他形态。

我们做两类产品。第一类是通用人形，两条腿、两个胳膊，只有这种我们叫人形，其他我们都叫专机，某种程度上是专用机器。

那为什么需要人形？我现在有一个公式，翔叔。这个公式是：maximize number of tasks over form factor。也就是说，能够服务最多种类的人类需求、完成最多种任务的单一形态，是最优解。

李翔

换一个更容易理解的角度，就是它能在人类的环境里做最多原来人类可以做、想做或者能做的事情。

张巍

对，单一形态能服务最多任务、能做最多任务，就是人形。

其实我只要算三四类任务，就必须是这个样子，其他形态都没有解。比如今天在楼下有人让我上来，我现在已经形成职业病了，会先看下面的地形、门的宽度。你让我下楼取个快递，取到以后还要放到货架上，我就会发现，这个构型必须是人形，它没有其他解，所以它是一个最优解。

但是这个最优解的 objective function，也就是 reward 或 cost function，是什么？是任务的种类。这是最大泛化性的单一形态。

其他类型的机器人，比如双臂、单臂，我管它叫在一定任务范围内 maximize efficiency，也就是在一种任务范式下最大化效率。四足在某种情况下可能是最好的，单臂可能是最好的，双臂也可能是最好的。

所以这些形态，我们也有一条产品线叫 TRON。它本质上不是单一形态，而是一个基座。通过一个 SKU 和不同组合，可以达到、覆盖尽可能多的形态。人形覆盖最大化的单一形态，TRON 覆盖其他的专用形态，可以这么理解。

李翔

我们先不展开技术，再问一个融资热点问题，因为这个很有意思。

### 世界模型开始升温

作为投资人来观察，最开始大家投机器人时，最受争议、最先开始讲的是具身，后来是具身智能机器人。再往下，最近大家都在讲，智能机器人要完成或突破智能的过程中，要做世界模型。

这是最近半年以来机器人行业最热的新故事。今天所有机器人公司，至少在和投资人沟通时，似乎都必须带上“世界模型”这个词。甚至很多和机器人不太相关的行业，在商业计划书里也要把这个词放进去：我是未来世界模型的一部分，可能是情绪的部分、情感的部分、记忆的部分。大家都在泛用这个词。

从具身、具身智能，到本体，再到操作、运动、全身控制，这些曾经热过的词汇，今天又来到了世界模型。我想从机器人从业者、创业公司的角度问问，你怎么看这个词？

张巍

总体来说，我觉得世界模型是一个大家值得期待的、具身智能数据 scaling law 突破的新方向。但目前它还处于相对初期的状态，很多定义也比较模糊。

我先说一下我对它的理解，再说为什么我觉得它会热。

首先，谈到“世界模型”这四个字时，第一个要做的事情就是对它去魅。世界模型的本质就是一个模型，“世界”只是修饰这个模型的词。从这个本质意义上来说，我们从小到大接触过的所有物理和非物理模型，某种意义上都可以叫世界模型，只是世界的大小、开放程度，以及我们能够观测到的物理变量不同而已。

既然它是一个模型，它基本上就是根据当前这个世界或系统的状态，也就是 state，以及我们潜在能够影响这个世界的行动，也就是 action，来预测未来一段时间这个世界的状态，以及状态对应的输出，也就是 observation。

具身智能里的世界模型，由于数据的原因，目前 observation 还是以视觉为主，力的信息相对较少。一般都是预测机器人要完成某项任务时，自己观测到的视频信息，所以它天然和视频生成模型的技术相关。

但大家发现，只预测未来视频、预测未来世界发生改变的过程还不够，因为这样完成不了任务。所以现在大家逐渐关注一个新的词，叫 world action model。也就是说，这个模型要同时预测未来完成任务的视频，以及与这个视频对应的 action。这样，它就能作为原来 VLA policy 的升级。

我们逐际动力大概在 2024 年中期，也就是两年前左右，开始探索用视频数据做操作模型的预训练。我们在 2025 年初发布了一个叫 VGM 的工作，也就是 Video Generated Motion，它是一个典型的 World X Model。去年我们还有一篇很有趣、效果也不错的 CoRL 论文，叫 GVF-Tape，是一个对数据量要求不高的 World X Model。只是当时我们没有使用“World X Model”这个词，因为当时 NVIDIA 还没有造出这个 World X Model 这个词。

张巍

技术层面，我觉得倒不是什么重大突破。本质上，大家还是看到传统意义上的 VLA 在数据 scaling 方面有局限性，而世界模型给大家看到了新的数据 scaling 希望。技术层面，它就是传统意义 VLA 范式的拓展。当然我个人觉得，VLA 的定义可以更广义一点。传统意义上的 VLA 是用 VLM 做 backbone；现在的 World X Model 是把这个 backbone 换成视频生成模型或相关技术。这样，在训练机器人操作的过程中，就可以利用带有时序信息的视频数据。相比单帧的静态视觉信息，这种时序信息更能很好地表达世界存在的物理规律，所以大家对理解背后世界运行规律还是有一定期待的。同时，作为潜在 scaling 或泛化的来源，视频数据肯定比真机数据更容易 scale、更容易采集。所以现在会看到非常多公司在采集人类操作视频，尤其是 ego-centric 视频。不仅容易采集，互联网上还有很多历史视频数据，大家也希望把它们用起来。因为这些原因，它应该不算什么重大突破，否则也不会有这么多人都会做。

李翔

### 物理规律进入模型

虽然我花了很多时间，也投资了一些世界模型相关的项目，但作为一个技术外行来看，世界模型的定义在不同人的脑海中差别其实非常巨大。

我只问一个和世界模型有关的问题。刚才你讲到，这里面有很多不同分支，有的是使用不同类型的数据，来达到世界模型的模型变化或进化。还有一类，是在模型中加入或引入更多对物理世界进行预测和表达的数学公式，或者叫物理公式。

它通过人类过去对物理世界中很多物理量的认识来工作。最容易理解的物理量，就是从小被折磨的重力。除此之外，还有流体、柔体、摩擦、温度，可能也包括电、质量、磁等等。大家把这些物理量中的一部分加入模型，不管是作为模型的一部分，还是作为一个独立部分，把它作为世界模型演进的方向之一。

从你的角度看，加入这些物理量的数学公式有没有用？

张巍

我觉得这个问题目前无法证伪，也容易引起争论。我只谈个人角度。

首先，我们要有一个统一的原则来看这件事：加入这些东西，本质上都是在加入数据。物理公式和我们训练的 neural network 一样，都是对数据的一种压缩。我们认为牛顿定律也是对所有运动数据的一种压缩和表征。把牛顿定律，或者对应的数学公式加进来，本质上就是把运动数据以最简约的方式加入模型。

用这种统一的数据观来看这件事，相对就比较清晰了。这里有两件事。

第一，加入这些物理规律的数学公式，是不是带来了新的数据增量，或者更本质地说，带来了信息增量？也就是我们对这个世界的理解，信息量有没有增加。增加了，我们才有必要做这件事。

第二，信息量可能增加，但我们能不能很好地利用这个增量？这本质上是一个 alignment，也就是对齐问题。原来其他数据的表征，和现在世界模型中的表征，能不能很好地对齐？如果对不齐，可能会起反作用。

总体来讲，从第一性原理来看，加入这些物理规律的数学公式，肯定会带来新的信息，尤其是新的模态信息。人类在抽象物理规律的过程中，使用了大量非视觉的信息，比如电的测量、磁的测量、力的测量。把这些信息的表征加入进来，本质上就是增加了这些信息，所以是有帮助的，是一种增量。

但关键问题是，原则上有增量，不代表我们就很容易使用它。因为这些表征很难和世界模型的数据对齐，这是最难的地方。所以大部分情况下，大家使用物理公式，本质上还是把它放进仿真里，生成更多容易和视觉观测数据对齐的数据。也就是通过仿真生成数据，再用这些数据训练世界模型。

但这种对齐还是很难。整个 sim-to-real 的过程，其实都在做这样的对齐。总体来说，它是有用的，但想把物理规律很好地和世界模型对齐，非常有挑战，没有想象中那么容易。

李翔

### 数据成为模型原材料

今天有一个非常热门的创业方向，和这个现象背后是同源的。因为现在尤其缺少带有这些物理量的数据，历史上几乎没有过，所以大家开始用不同方式、不同成本采集和加工数据。

这里面有两个部分：采集是硬件或者含硬件的部分，加工则是把数据加工成大家想要的、包含不同状态和物理量的数据。不管创业公司做其中一个部分，还是两个部分，这类公司都变得非常火热，尤其是数据采集相关的创业公司。

作为一个需要数据和模型迭代的具身智能机器人公司，你怎么看这件事？

张巍

生产具身模型，我认为跟制造业没有什么区别。数据本质上是原材料工业，训练是一条产线，最后生产出来的是模型。模型本质上就是数据经过采集、处理、训练，最后沉淀出来的一种表达方式。

不管把它叫不叫产线，产线源头都是数据。数据需要经过预处理、来料处理和检测，最终进行训练，训练完以后得到模型。所以从这个角度看，各种模态信息原材料的丰富程度非常重要。

李翔

### 通用与场景数据共进

回到方向和技术的讨论，从大的视角看，这些不同类型的数据，最终会使机器人在未来一到两年里更垂直、更受限，也就是在特定场景中更快落地；还是会让机器人在更不受限、更泛化的场景下，更快进行模型升级和迭代？

当然，这两件事可能同时存在。我的意思是，按照今天的情况，在未来一年到一年半里，会更偏向前者，还是更偏向后者？

张巍

我觉得两者会同时进展，而且取决于你刚才说的数据都包括什么。现在做什么数据的都有。

但我有一个不一样的观察：在具身模型落地的过程中，无论是 VLA、V-A，还是世界模型，大家训练 model 的时候，我觉得具身智能不能像大模型那样，先通用，再专用，再应用、落地。至少按照我之前的判断，这种先通用再落地的模式不适合具身智能，我们现在也在践行这个判断。

这是因为各个技能、各个任务之间，数据的相关度和数据需求非常不一样。

李翔

听众可能不太容易具象地想象，我们举个具体例子，为什么 A 和 B 的数据很难相关和通用。

语言是一个通用模态。你写律师信，还是写一篇文稿，对通用语言模型都可能有帮助。但开车、自动驾驶的数据，和剥鸡蛋的数据放在一起训练，现在还不知道是不是反而会有问题。

张巍

对。在跨技能的数据 pipeline 中，如果你不了解数据之间的关系，就期待靠堆数据产生涌现，在我看来是一种刻舟求剑的方式，所以不会这样做。

我们认为需要通用模型的能力，但这个能力是慢慢长出来的。我把它叫作“通用模型与场景数据的飞轮”。也就是说，先有一定的通用模型基础，然后在垂直领域尽量收集数据、落地，在落地过程中获得更多数据，再反哺通用模型。通用模型的能力就是这样增长起来的，而不是先做出一个特别通用的模型，再去落地。

到目前为止，我们看到的基本就是“通用与场景数据的飞轮”，现在也在践行这个战略。

李翔

那我们沿着这个问题，再问一个从普通人角度出发的简单但重要的问题。

假设最终按照这个飞轮迭代，最后变成一个更通用的机器人通用模型。听起来，它需要具备的能力远超过预测下一个字词。语言模型的能力，本质上是从概率上预测下一个字词。

如果机器人有了这样一个通用模型，我们普通人是不是可以理解为，这个模型会比今天的语言模型大无穷多倍，或者大非常多倍，而不是今天这种几千亿参数的概率模型？

张巍

如果是那么通用的一个模型，当然会非常大。但我不认同会有这么通用的东西，我觉得它应该是一个一个的技能。

李翔

因为如果这么通用，模型就会变得非常大。将来机器人使用时，虽然技术可能会发展，但最大的麻烦是，按照今天大家对大模型的使用来看，它身上需要堆很多芯片，也需要很高的功耗。

运行这么大的模型，还要求实时性。你不能剥鸡蛋时，剥第一个蛋壳想两秒钟，剥第二片又想两秒钟，等剥完以后，我可能已经不饿了。所以它既要求快，又要求实时，这样就很难妥协。

也许到那个时候芯片会进步，也许会有可控核聚变，可以随身携带一个无穷小的可控核聚变。当然，这些都是科幻小说了，但听起来确实会有这样的问题和障碍。

如果不是一个什么都能做的通用模型，那它会是怎样的解决方案和发展方向？

张巍

我始终觉得它是一个个技能。开车是一个技能，我可以不会开车，但我有脑子；剥鸡蛋也是一个技能，我不会的时候也要学习。它不需要一个什么都能做的通用模型，而是需要各种对具体场景落地有帮助的技能。

我还真不知道自动驾驶现在的模型规模大概是多少，没有准确数字。但我觉得它就是一个个技能。当下落地的是各种类型的技能，它的预训练、后训练和落地过程，我觉得已经看到了一些希望。

现在大家看不到的是，这些技能创造的商业价值，和创造技能所需要的数据成本，还没有打平。或者说，大家还没有找到能打平的某个垂直领域案例。大家都在寻找，我一直是这么看的。

李翔

自动驾驶大概也是这样。它就是具身智能中的一个技能，不是一个大脑，而是人脑的一部分。你会开车，不代表你会剥鸡蛋。

但具身智能发展到今天，最近行业里也有很多口水战。第一，要不要 L3？有一派说不要 L3，直接从 L2 到 L4。当然这里面有监管、责任和权利确认等问题，而且它对成功率的要求特别高。

除此之外，这个话题隐含的另外一件事，和刚才讨论的世界模型也有关。今天自动驾驶也遇到了一些小瓶颈，所以又回到了世界模型这个热点词。自动驾驶开始把世界模型变成技术进步中一个非常重要的词汇，可能也是因为遇到了技术进步上的挑战，当然也可能和数据有关。

从我们看到的现象来看，自动驾驶作为技能之一，也走到了这一步，走到了需要使用世界模型这个热词的阶段。

张巍

你看，自动驾驶里所需要的世界模型，至少按照他们所描述的需求，和剥鸡蛋所需要的世界模型，不一定是一样的。至少大家满意、达到要求的世界模型，应该是不一样的。

李翔

你可以说，一个大而全的世界模型什么都有。但从外行看，今天“世界模型”这个词热起来，隐含着一个大家想解决、但还没有完全解决的问题：我们怎么能够在看到世界的情况下，当然也包括其他感官，对这个世界形成某种意义上的理解？

这不一定是语义理解。比如从人的视角出发，自动驾驶完全不需要识别这是一个水瓶放在桌子上。它只需要识别这一大堆东西是一个不会移动的固定物体，就可以了。它不需要知道这是什么，也不需要知道它是刚性、柔性还是弹性。桌上的瓶子、水、摆设、凳子、桌子、桌腿，这些都不重要。重要的是，它们是一个不移动的、占据一定面积和体积的物体。

它不一定需要理解这个东西到底是什么。也许今天自动驾驶重新关注世界模型，是因为它也到了想要或者需要理解的阶段。

当然，我们对机器人的预期更高一些。所以世界模型放在机器人上，一方面是因为数据不够了，我们要想办法用更少的数据解决问题；另一方面，我猜普通人也希望机器人像我们一样，在语义层面理解世界，知道这个东西到底是什么。

比如剥鸡蛋，我需要先理解它是熟鸡蛋还是生鸡蛋，才知道接下来剥鸡蛋的技能该怎么实现。如果我知道它是铁做的鸡蛋，哪怕它长得像鸡蛋，我大概也不会拼命去剥它。这就是理解它是什么，或者说从语义层面理解物理世界。

张巍

我本来想回避这个话题，但还是说一下我的理解。

对你所关注的世界进行建模，本质上是能够表示这个世界未来会怎么发生，尤其是和我现在对它产生的 action 相关的、可以演绎出来的结果，并且能够很好地建模。在数学里，我觉得它就是一个 Markov 过程。

但你可能是 partial observable，只能观测到 pixel，也可能有一些新的模态，比如通过触觉观测力大概是多少。通过 observation，我希望能够不断建模、还原这个世界的物理规律，预测我这样做以后，世界会怎样演绎。

这非常取决于你能观测到什么，也取决于你的世界里包括什么。眼前是一个杯子还是两个杯子，它们之间的相互作用，这些都是整个过程需要 capture 的内容。

它不一定要 capture 到分子层面。比如这个房间，如果要把所有分子都弄出来，才能知道真正的温度分布，那当然不现实。所有模型本质上都是对微观事物的抽象。它本质上就是看能不能很好地 predict future。

所以我认为，一个合格的世界模型，就是通过 observation 还原事物之间的物理规律，并预测未来。我对它有一个比较严格的定义。现在大家的定义五花八门，我们不想掰扯这件事。

李翔

如果到了微观层面，每个粒子都能被知道和预测，那不就变成拉普拉斯妖了吗？

张巍

对。这个世界上，我们所有的物理规律都不是绝对正确的，都有局限。只要它和你的 observation align，也就是和你的观测对齐，就可以了。你眼见为实，但眼见也不一定为实。

我想物理规律主要是一个降维表达。

李翔

对，是对大规模描述的降维表达。

张巍

它就是一个模型，取决于你要描述的世界有多大。你说要一个世界模型，把这张桌子描述得很清楚，那需要的东西就很多。否则也不会有牛顿和爱因斯坦在不同观测层面上的体系。

李翔

我们回过头来讲，这里有一个小问题。很多人可能也持有这样的观点：从人的角度，我们希望机器像我们一样。

按照你刚才描述的角度，机器在今天模型进化和迭代时，不一定需要经过人类意义上的语义层，对吗？

张巍

它的语义和人的语义不一定一样。它的 embedding 和我们的语言，都是我们自己抽象出来的。我们也听不懂猫是怎么叫的，对吧？猫有自己的语义。我们要允许 AI 有自己的语义表达。

从某种程度上说，它可能用自己理解的某种 embedding 来表示所有客观规律，但这种表达不一定和我们的语义完全一样。

李翔

所以可以把它变成一个结论：它不一定需要经过我们意义上的 semantic 这一层。

张巍

不需要。我觉得它就是 whatever，只要它能 predict future，就可以了。

李翔

### 机器人大脑其实是操作系统

那就回到了刚才的问题。今天更时髦、也更混乱的一个词是“机器人大脑”。至少有一部分，尤其是高估值的企业，像你们这样，都必须说自己要做机器人大脑。但这个词的定义非常多样化。

从你的角度怎么看“机器人大脑”这个词？

张巍

我现在对它有比较明确的理解，当然这个理解还在不断迭代。

第一，我不觉得模型是大脑，模型不是大脑。第二，大脑也不是模型。大脑是一个操作系统，这是我的定义。

为什么我们会有 CoSA Agentic OS？大脑是一个操作系统，它不光要管理记忆、存储和思考，它还是一个 agent。我认为它是一个 Agentic OS，要调用各种模型，包括 VLM、LLM，以及各种 VLA 模型，才能完成一个任务。

它要调用很多工具，所以我们不认为通过堆操作数据、堆训练数据，就能训练出一个大脑。这样可以训练出一个技能，但训练不出大脑。大脑本质上是在模型能力之上的一个操作系统，我们是这么看的。

李翔

普通听众听起来可能会有点混淆，或者有点迷惑。你的意思是，大脑在大模型之上？

张巍

不，不是这样。我们可以把 OpenClaw 认为是一个大脑。它是基于大语言模型的，它的能力也取决于你用了哪个模型。

以前这个说法比较混淆，甚至会引来非议。现在 OpenClaw 出来以后，可以更好地解释。傅盛之前也说过，大模型不是大脑，OpenClaw 是大脑。我们也是这么认为的。

CoSA OS 是一个脑，脑是一个操作系统。各种模型是脑进行思考、完成任务时调用的工具和技能。

很多人对技能的理解比较狭义，比如机器人拿、放、拧瓶盖这样的原子动作技能。但我这里所说的技能可以非常广。比如整个自动驾驶，虽然我们现在还没有完全实现，但如果实现了，对应的那个模型就是一个技能。

这个模型和人的脑也不是完全等价的。一个人可以很聪明、非常优秀，但他没有掌握自动驾驶这个模型和技能，这也没有问题。所以，脑的本质还是模型之上的一个操作系统。

李翔

这对大部分人来说可能有点反直觉。大部分人认为模型就是大脑，而 OpenClaw 是操作能力，或者操作能力的延伸。但按照你刚才的解释，正好反过来了。

今天我们对“大脑”的理解，除了大家在描述商业模式时使用的不同场景之外，可能还比较初级。人类从人的角度看，认为大脑是自己在动物中最厉害、最发达、最与众不同的地方。

但今天我们真正意义上对大脑如何工作，包括记忆、技能完善、模型修改，以及认知层面的不断加深，仍然没有特别清晰的理解。你刚才说的“万里路”，其实也不能完全解释。

张巍

我们对机器人大脑的架构理解现在相对清晰了。这也是最近一年左右逐渐收敛和成熟的。

我们大概是三层架构，和别人也不太一样。

底层是小脑基础模型。小脑更偏运动，它只管动。你可以认为它是一个没有大脑的系统，你让它怎么动，它就怎么动，但它得能够完成这个动作。对传统机器人来说，这件事相对简单，机械臂用传统方法就可以完成；但对人形机器人来说，需要一些 AI 能力，也就是基础模型。

上一层我们叫 Human Brain VLA，是 System 1，也就是一个高阶技能。它的运动必须和环境、任务相关。我看到的东西，能够指挥我的运动把事情完成，这就是我们所说的中间 VLA 技能层。

再上一层是 System 2，也就是 Agentic OS。它是以大模型为引擎的整个 Agentic 系统。你可以把它想成 CoSA，我们自己的脑。我们认为它是脑，也就是 Agentic OS 脑。

你可以想象一个人躺在病床上，身体瘫痪了，但他非常聪明。他有脑，但他什么也动不了，只能思考。他有没有脑？当然有。但他会不会动？一动也动不了。

如果给他赋予一个技能，就好像打通了经络，他就可以去拿一个水杯了。这就是赋予他一个 VLA 能力，或者说一个技能。

模型给了我这个脑，我的脑在那里。你想象一个躺在病床上的病人，他的脑是什么？我觉得就是一个 OS。

再举一个例子：我要去楼下买一杯咖啡再回来。这件事需要思考和决策，我要看现在有没有时间，决定要不要出去。决定出去以后，我要起身，调用开门的技能，调用定位和导航；出门以后还要使用 GPS。我不可能重新训练一个模型，把 GPS 也训练进去。

这种整体的组合和思考，我觉得就是上层 CoSA OS 要做的工作。它的 smartness 和成熟度，取决于大模型的进展。

我们认为，脑最核心的还是语言模型，因为语言是思考最本质的东西。人类的思考是通过语言完成的。

李翔

那稍微反问一下：假定一个智人没有进入人类社会、没有学会语言，或者他天生聋哑，他还会不会足够 smart？

张巍

他可能有技能，有肌肉记忆，可以完成一些技能。

我们先定义他是一个智人。他是不是一个能超过一般哺乳动物、做出超越直觉反应的事情的人？现在 AI 的进化方式和技术格局里，大语言模型确实起到了推理和思考的作用。

你说没有语言，是不是也可以用其他 embedding 来完成这件事？肯定也可以，只是我们没有那些数据。因为人类通过语言和互联网，把思考逻辑用语言表达出来，沉淀成了数据，所以我们可以训练这样的模型。

所以它既是语言，又不完全是语言，因为它是人类思考过程的一种表征。智人或者其他生物，肯定也有自己的符号，也有一个我们认为的 System 2，只是那个 System 2 可能不够强。

但在当下的技术范式下，我们认为它是以大语言模型为基础的思考框架。

李翔

这里还有一个问题。今天的大语言模型本质上也是概率模型，这句话是对的吧？

当然，人思考时也可以被认为是概率模型，这没有问题。但概率模型又回到了刚才的问题。比如大语言模型对词的预测，对一段话、一篇作文的生成，或者对内容的理解，本质上都是概率预测过程。

所以我们不能说它是一个语义理解过程，这句话应该是正确的。它是一个概率预测模型，但这是否意味着它其实真的理解了这些内容？

张巍

什么是理解？这是一个好问题。

理解又回到语义层面：它真的理解语义的意思吗？它的理解和我们的理解，不一定是同一个理解。但它又是从我们的理解中投射出来、学习出来的。

所以，如果把理解做一个抽象定义，只要它能够 predict，而且和你接下来所做的事情类似或一致，那就可以叫理解。

理解很难定义清楚。我们两个人对一件事情的理解，取决于我们对这件事情所衍生出来的判断和决策。如果把理解做一个抽象定义，只要接受这个结果，我觉得它就理解了。

如果不接受这个定义，那它当然没有理解，因为它的存储方式和 embedding 肯定和我们不一样。这没有问题。就像大家和不同的人说同一句话，每个人对这句话的理解也不完全一样。

李翔

所以我们今天讲的是，大家能够对一个东西做出相同的上下文应答或描述。这一点上，人和机器、人和大语言模型可以做到类似。

但我刚才的问题是，人想要的理解或者智能，更多是用极少的数据完成对一个未知事物的理解过程。从概率模型来看，它需要超级多的数据，尽可能覆盖各种变化和不同维度的分布，才能更好地从概率上预测下一个结果。

它需要的数据，可能比我们理解一件事情所需要的数据多非常多。

张巍

我不知道它需要的数据比我们多不多。我们其实进化了好多万，七千万差不多。

李翔

啊，没那么多。

张巍

对，没关系。包括猿人，包括猴子这些东西，我们的大脑在物理世界中的这些数据沉淀了这么久，然后一代代传下去。我们传给小孩的，本质上就是一个预训练模型。小孩出生时，大脑已经有一个 pretrain model，然后再继续学习。

所以如果都这样沉淀下来，神经网络在历史上接收的数据有多少，我不知道和大模型怎么比较。我们每天这样聊天，数据量也很大。

李翔

但从所需要的语言数据来看，加上你说的这些沉淀，我猜它需要的语言数据应该没有那么多。当然我也不确定。

张巍

对，因为这是长期积累的。互联网几十年能够穷尽的公开数据，可能已经比一个个体能够接触到的信息多了。它接收到的是整个人类的 union。

概率模型的特点就是，尽可能多的概率事件都要让它见过，它才能抽象高维关系，或者说抽象出那个模型。

李翔

从刚才听起来，逐际动力现在的产品大概分成软硬两层。

硬件层，一部分是可以多用和专用的，同一套部件既可以当胳膊又可以当腿；另一部分是搭载整体功能的人形机器人，也就是既有胳膊又有腿、有人形外观。这是两类硬件。

软件部分分成两层：一层是刚才讲的、更像大脑的 Agentic OS，也就是调度和使用模型、技能的 CoSA 系统；另一层是更下面的技能层，包括你们和其他公司都在做的、用新数据和原有数据训练的技能，以及在技能基础上的强化学习过程，也就是技能的快速获得和快速收敛。

大概来说，你们提供的软件产品就是技能和 OS 两部分。中间用 VLA 训练的过程，市场上有开源方案，大家也都在做不同研究。硬件则是专用形态和人形这两类，软硬件可以用不同组合结合在一起。

听起来，公司的产品和技术产品类别，大概是这样一个组合吗？

张巍

我们还是分人形和非人形两条产品线。但我觉得产品本质上是软硬一体的，取决于你服务的用户是谁。

人形机器人不是光卖一个硬件，它也包含软件服务，是软硬一体的系统。用户不同，软硬件系统的搭配也会不一样。

TRON 本质上是服务创新、服务 POC 落地的。它有点像 Maker Market。因为它既是两条腿，也可以探索巡检、物流和 mobility 等应用，尤其是跨台阶的场景，这是以前的平台不存在的，所以我们认为它可以 enable 一些新的应用在上面长出来。

现在的 TRON 2 有双臂。我们希望把它做成最好用的双臂机器人。坦白讲，现在市面上还没有特别好用的双臂机器人。它的负载能力、易用性等都比较好，特别适合做创新科研。

所有企业如果想做场景落地，不需要重新再做一台机器人。可以直接用它，我们也会开源训练模型的方式。企业可以拿着它到场景里收集数据，做垂直领域的落地，我们也会帮助他们。落地以后，愿意用我们的方案就用，不愿意用，也可以自己做。

其实落地最关键的是早期的 POC 和 PMF。原理验证的时间往往最长，如果这个时间花得太久，就可能错失落地的核心时期。所以最好使用已有的硬件平台和技术栈，先做 POC 验证。验证通过以后，企业可以自己生产，我们不限制。

因此，我们服务的本质是创新和 POC。

李翔

从 OS 开始的三层架构，以及不同应用和技术栈，作为公司可以提供给外部用户的产品，除了公司自己使用之外，其他人也能用的，主要是哪几部分？

张巍

我们一般不用软硬件来定义产品，而是用用户类型来定义产品。

刚才说的 TRON，是服务创新、服务具身场景落地的基座，基本上所有落地都可以用 TRON 去尝试。这里面我们提供硬件平台和一些开源接口。

我们最近还开源了一个东西，没跟翔叔说过，叫 Flux VLA Engine。我们没有把 VLA 模型开源，因为我觉得当前模型还用不起来。开源模型可能对融资有帮助，但模型参数本身可能也有限。

我们讲“授之以鱼，不如授之以渔”。我们把训练 VLA 基座模型的方案和整个架构开源了。我之前说我们是在做模型生产线，那我们就把产线开源。因为最终落地的数据和模型，应该属于垂直场景里的那个人。对方需要的是数据，也需要我们的硬件平台和开源架构，数据要由他们自己去收集。

所以在 TRON 这一系列产品上，我们提供的是这样的服务。

从人形机器人的角度，我们是奔着人形终局去的。我们坚持 “Serve people, not process”，不进工厂，最终走向家庭服务。它的落地相对有争议，但我们始终坚持，它是一个最优解，是统一的本体，不改变硬件构型，而是通过不断叠加 app 的方式，增加它的功能属性。

当功能足够多的时候，大家就不会怀疑它的价值了。现在大家看到的可能只是比划、跳舞、翻跟头，会觉得价值有限。但这只是它当前的一个 app。科研可以是一个 app，表演可以是一个 app，主持可以是一个 app，导览也可以是一个 app。接下来它能够拿水、拿快递，又是新的 app。

当 app 多到一定程度，我觉得它不需要什么都能干，也可以产生商业闭环。我们就是沿着这个方式演进的。

李翔

作为投资人，我再稍微好奇一下。

### 机器人如何兑现价值

这个行业仍然处在非常热的阶段。刚才我们讲到，主要是数据和模型碰到了一些原来的天花板，所以大家又有了一些新的开创性想法，不管是世界模型，还是其他和数据有关的方向。

但一个行业不管多热、热多久，最后总要有一段比较长的时间落实到应用本身，回到产生商业价值这件事上。今天当然已经有一些商业价值，比如表演就是一种商业价值。

我想问的是，在可见的范围内，刨去表演这些应用，你觉得具身智能的商业和商用价值会在哪里开始呈现和兑现？

张巍

我们觉得，人形机器人是一种新的产品形态，它的商业价值展开方式也有些非共识。要不然我觉得也没有初创企业什么事了。

坦白讲，我觉得它会逐渐增加 app。当前的表演就是一个应用。现在我们的客户拿它可以赚钱，它已经被用起来了，而不是只有 sell-in，也已经有 sell-out。

下一个阶段，我管它叫“动口不动手”。

你不要总想着让它去干活、替代工人。其实它替代动口不动手、替代聪明人的价值更大。商业服务、导览、导购，所有这些领域都可以。它是一个装着语言能力的可移动顾问，有一定的情绪价值和新的体验价值。在前期，这些都很重要。

李翔

它是一个极其聪明的人，但它不互动，对不对？它不改变物理世界。

张巍

对，它不改变物理世界，只交互。

我把它分成三个阶段：无交互、弱交互、强交互。

无交互就是自己比划、自己表演，你按一下，它比划一圈。弱交互是通过语言和动作协同来和你交互，也就是动口不动手。

你去看什么样的工作能够被替代：站在那里一天，基本不用干什么活，但要动口、天天动口不动手，这种形态就是早期的工作。

李翔

AI 的变革本质上是替代脑力劳动者。

张巍

对，替代普通的脑力劳动者。

李翔

像您这样的应该替代不了。

张巍

也不一定。我们也属于动口不动手，所以迟早也可能被弱交互干掉。

强交互就是最后真正和物理世界交互。它取决于技能数据的演进方式：有没有一类技能，能够让预训练和后训练的数据成本，和它创造的商业价值打平。找到这样的方向就可以。

我们也抱着开放的态度去找这种方向。预训练要做，后训练也要做，但最终要摸索出一个商业方向，在单一技能下实现成本和价值的平衡。

李翔

像开车都还没有完全打平，对吧？

张巍

对。但这样的领域非常多。

李翔

我顺便插一句。我们之前讨论过这个问题，其实很多相对新的事情，落地方式确实不完全和大家预测的一样。

拿刚才的表演举例子，我原来最大的经验和教训是，投资行业的人在 2015 到 2017 年非常积极、激进地投了一批无人机企业。那时候大疆第一次特别火，大家觉得无人机会很火，估值也高得不得了。

后来大家发现无人机没法用，结果无人机第一个能够批量应用的，就是无人机表演。当然，中国那时候也正好开始禁烟花爆竹。

张巍

是在大疆拍摄之后吗？

李翔

对，拍摄其实是更早的一个单一技能。当时大家认为无人机拍摄还是专业用途，还没有进入普通消费者市场。十年前、十一年前，有一家无人机企业来找我们，说要做无人机表演。那时候还是小机队，我还觉得这不是一件大事。

结果后来这家公司靠无人机表演活了下来，而且还活得更大了一点。今天大家已经习以为常，无人机表演已经成为一个很大的应用。

张巍

我觉得这个时代，怎么替代人只是一个方面。增加一个体验维度，本身就是非常有价值的事情。

当然，如果只是表演，我觉得上限确实有限。但如果像我说的，它是众多 app 的第一步，我觉得这件事是 make sense 的。

李翔

拿无人机来打比方。无人机开始时很难找到大规模商用场景，电力巡检之类的用途，因为续航和各种问题，没有被广泛接受。除了专业拍摄之外，第一个真正被广泛接受的，就是表演。

表演变得很大之后，带来了几个能力。第一是飞控能力，第二是协同能力，因为后来从几十架变成几千架，甚至上万架。第三是通过批量商业模式把成本打下来，各种成本都随之下降。

成本下降之后，新能源车又把传感器成本进一步打下来。随着模型演进，控制系统也再次迭代。再往下，它就可以进入小 B 和偏消费者化的市场。

按照同样的逻辑继续演绎无人机，随着越来越多和机器人有关的世界模型、物理世界预测技术发展，加上自动驾驶技术进步和成本下降，最终无人机确实可以 To C。

今天大家操控无人机，还需要一点专业操作能力。我们公司出去玩，出国时也有一两个同事会带无人机，因为国内现在很多地方不让飞。但未来可能不需要这些操作能力。你可以想象一下，拿一个 3D 模型，在里面用手画一个圈，或者在电脑上画一个圈，它就按照那条路线飞一遍、拍下来；或者它能够智能地跟着你，并且完全避障。这些肯定都可以实现，那就完全 To C 了。

只不过，十二年前大家就已经这样想象过。这个事情可能比当年想象的多花了十几年，等软件和硬件都迭代到今天这个阶段，才逐渐实现。

张巍

对。人形机器人我们是不进工厂的，最终往家庭走。我觉得家庭是最大的、最 exciting 的场景，也是它最适合的场景。

家里的任务是多样性的。你一周洗不了几次衣服，本质上就是一个多样性任务。商场、酒店、各种公司等商业领域，也会是比较前瞻的应用场景。

根据这些商业目标，我们构建 CoSA OS，构建我们认为应该具备的 Human Brain VLA，同时构建底层的全身运动控制基础模型，也就是 Foundation Model。

李翔

这里要强调一下，你说的全身运动控制 Foundation Model，是指什么？

张巍

现在大家看到人形机器人跳舞、翻跟头，这种通常是一个 policy，一个 policy 地去 play。它是一个事先录好的动作 replay，当然也需要训练。

但要让人形机器人真正干活，让大脑指挥身体，就需要基础模型。不能看到一个杯子，想要这样抓，结果还要回去训练一个星期才能完成这个动作，那是不行的。

我需要实时生成动作。这不是预先编好的动作，而是我需要什么动作，就能完成什么动作。这个 Foundation Model，就是我们投入了很多时间、精力和数据去做的事情。我觉得它对人形机器人非常重要。

大家现在看到的可能大部分都是一个 policy、一个 policy 地去 play，但 Foundation Model 更多和运动控制有关，是小脑的基础能力。它执行你要求的所有动作，你要什么动作，我就能给你执行什么动作。

李翔

对普通人来说，可以理解为小朋友在成长过程中，大概两岁到五岁之间学习的那些东西。专业上叫大小动作、抓取、爬行等协调和统一，也就是感统训练、感觉统合训练，拆分下来包括大小动作协调等。

这大概相当于训练小朋友的基础 Foundation Model。

张巍

对。它和语言的 Foundation Model 也差不多。

早期如果只是预先安排好的对话，比如你问“你好”，我回答“我在”，这不是大模型。但大模型出现以后，你给它任何输入，它都能生成你想要的回复。

运动仿真也是一样。你给我一个参考轨迹，可以把它理解为一个 prompt，我就能够完成这个动作。这个底层能力，对上层外部构建以及最终完成任务非常重要。

李翔

同意。要不然人也不会有这样的成长过程和步骤。

我们先把技术问题跳开，讲点别的。

### 上市能否延续热潮

从投资人视角来看，比较有挑战的一个问题是，现在估值比较高的机器人公司，都在准备以不同形式进入资本市场，不管是 A 股还是港股，你们也在其中。

但从投资人视角看，如果一个行业处在很大的热潮里，通常热潮中的标志性公司上市、将要上市，或者刚刚上市，会成为这一轮热度的终点。Facebook、阿里巴巴都可以作为例子。

从这个意义上说，如果这些智能机器人公司在今年年底或明年陆续登陆资本市场，而上市成为这一轮热潮的顶点，会怎么办？

张巍

这个行业可能和其他行业不太一样，也不完全能和新能源汽车类比，但它可能更像新能源汽车上市时的情况。

比如小鹏上市的时候，新能源汽车行业并不是已经成熟，反而是市场热度跌下来之后，技术稍微好一点、大家开始接受的时候，资本市场的存在让上市公司拥有资金聚集效应，能够踩到新的浪。

李翔

那我们换一种问法。

今天大家除了角逐融资规模和估值，也在角逐上市。如果假定某个时间点，行业热度突然下降，不再像今天这样，甚至下降 50% 以上，作为这个行业的公司会怎么办？

张巍

各个行业都一样。但我觉得具身智能有一个好处：我管它叫比大模型的上限更高，比大模型的下限也更高。

它的上限想象力很大。你说要做一个真正通用的人形机器人，这个上限我觉得不比一个模型公司小。

第二，它不像模型公司那样，一旦某一代模型没有跟上，就可能彻底失去机会。具身智能总能找到垂直领域去使用。所以我觉得，只要做好本分，遵循真正的商业规律，同时有一定技术突破的公司，都有机会跑出来。

在当前阶段，我个人是相对乐观的。它的下限高，上限也高，因为现在大家的投入还没有到特别高的程度。

李翔

明白。没关系，等这个行业冷下去的时候，我们再来做一次，再回顾一下。上一次做的时候，行业只是刚开始变热。

### 教授创业需要五个蜕变

接下来的问题，是作为一个在国外做了较长时间科研、在国内也从事过一段科研工作，权且叫老师吧，后来从国外回来做科研，又进入创业行业的人，在角色转换以及公司从小变大的过程中，你有什么感受、经验和教训？

张巍

特别多，全是坑。

我有一个总结，之前也和别人说过。我觉得教授创业需要经历五个蜕变：从学术到技术，从技术到工程，从工程到产品，从产品到商业化。

最早期的教授，本质上是以学术为荣。学术的问题是什么？它本质上是以一个 idea、一个想法为骄傲。有一个新的 idea，就很高兴，发一篇 paper，就以发 paper 为荣，这是学术阶段。

然后是技术阶段，把 idea 呈现成一个技术展示，以这个为荣，这是第二个阶段。

从技术到工程，是把一个技术稳定、可靠地实现出来，以稳定性和可靠性为荣。到了这个阶段，可能已经和 demo 没有太大关系了。

从工程到产品，是从可靠地实现一个技术，到做出一个能够满足用户价值的产品。但产品也可能卖得越多，赔得越多，所以产品还不一定是商业格局的关键。最关键的还是商业化。

所以一定要经历这几个阶段。至少对我个人来说，我经历了几次蜕变，也就是不断否定自己。

李翔

你说的“否定自己”，是完全否定原来的想法，还是在原来的想法里增加一个非常重要的新权重？

张巍

是转换。原来的维度太小了，需要增加新的维度，也就是升维。

在创业这件事上，学术没有那么重要，技术也没有那么重要，最终商业更重要。围绕商业目标，你需要什么样的技术，就要具备什么样的能力。

现在这个阶段，就像刚才说的 VLA 找场景，你既要懂商业设计，也要对技术和技术未来的预判相对准确，才能在未来的某个焦点上找到交集。

因为它不是一个成熟、已经落地的商业化方向，所以需要预测技术的轨迹曲线，在某些想象和可能性上找到交集。这需要一定的技术实力。

李翔

这不就是投资上常说的，一种是拿着锤子找钉子，另一种是围绕一个可能合适的钉子，把锤子变成最适合砸它的样子？

张巍

对。当下最大的锤子是 AI。AI 这个范式会激活很多可能性。

所以本质上要找到一些可能性，用技术趋势和技术的 power 去解决可能的商业价值。

回到刚才说的几个蜕变，我觉得最大的坑是对组织的理解，也就是从科研范式转向市场范式。

每一次变化都不是自我否定，而是对选人、用人和整个组织的迭代。你只关注技术时，选择的人、使用人的方式、组织方式，和你关心工程、量产时，都不一样。

所以不是我自己变了就够了，还要有能力驾驭整个组织一起变化。早期要选的人，和后期要选的人，本来就不太一样。

李翔

它难道不应该是一个一直持续变化的过程吗？

张巍

我觉得当你的维度足够全面以后，就不会再发生特别大的变化。

为什么有些成功的创业者，比如雷军，如果再创业，成功概率会很大？因为他的维度已经比较全面，训练过、经历过，也丰富过。

我觉得比较纯粹的学术和技术创业者，往往缺少很多维度。这些维度不是看书或者和别人聊几次就能立刻拥有的，你需要 grounding，需要 data，需要自己有手感，得有真机数据。

只靠仿真数据进行预训练，基本上没办法让这个模型完全成型。

李翔

对，就像人看书一样，看书有帮助，但不能只看书，还是要有真机数据。

回到公司管理，公司的管理主要涉及个人管理、制度形成，以及如何激励和管理团队。在大学里，管一个研究团队，或者管博士生、博士后、硕士生，和在公司里肯定不一样。

大学里管理的是不同方向、不同职能上具备不同技能和能力的人。按照刚才说的维度，这也是五个坑、五个变化吗？

张巍

组织是最核心的能力。组织能力反映了你对这件事的认知，也反映了你对相关人员的认知。

如果只是做科研，你只要了解什么人适合做科研，怎么激发他做科研，给他好的问题，这件事就结束了。

但如果要做好的商业化，你需要对所有商业环节都有相对清晰的理解，这是前提。你要理解这件事，同时也要理解人性、理解人。

组织的本质，在我看来就是人和事的 mapping。它就像我们选择神经网络架构一样，有各种范式的架构去做这个 mapping。

如果你对事情理解不对，对人的理解也不对，这个 mapping 大概率就会出问题。即使照抄别人的 mapping，也不一定完全适合你。

在这个过程中，你对事情的认知会影响你对整个组织的看法，选人的方式也会变化。我觉得这些都挺有意思。

李翔

事情完成以后回头看，比较容易说“有意思”，但过程中通常都是折腾和痛苦的。

在我们可见的、差不多四年的成长过程中，你们也经历了一些不同的组织结构和人员变动，肯定既有经验，也有教训。作为亲身经历者，在这些变化背后，或者在变化的过程中，你自己有哪些变化、成长，以及得到的经验和教训？

张巍

我们早期换过不少高管，很早就换过三四个。

后来你会发现，成长就是不要把自己看得太高。我觉得人员选择是双向选择。如果大家觉得不合适，就要及时说出来，把事情做好，这样会比较好。

所以现在我对这件事比较坦然。最近他们还在说张丽离职，其实那是去年的事。我们在去年年中就谈好了，她可能会把重心放在北京，逐渐淡化管理。但我们彼此还是认可对方，所以过程非常 peaceful，交接和过渡也很好，她后来还做了一段时间顾问。

这件事早就发生了，对我也没有什么大的影响。因为早期更换人的时候遇到过类似问题，当时非常痛苦。第一次、第二次经历都比较痛苦，也不好意思说出来。尤其是知识分子，尤其是老师，面子上过不去。

后来就比较坦然了。人才没有绝对的好坏，关键是是否适合，以及是否和当时公司的战略匹配。合适通常是双方的需求和能力匹配，也有时间跨度的问题。所谓合适，不一定是一辈子，也可能只是这一年或两年。

李翔

尤其是 AI 变化这么快，你聊到这里，我还可以多聊很久。

张巍

我觉得这方面有非常多的思考，也挺有意思。

我们希望组织变得有活力，多招一些年轻人，多招一些 AI 原生的人。至于什么叫“年轻”，我会打引号，我们有自己的一套理解。

不一定非要按照年龄来定义。大家说零零后、九零后做 AI，有百分之八九十的道理，但也有像我们这个年纪，年龄比较大却还有少年心、少年气的人。

没有暮气，对未来有热情，保持开放。我觉得这几个点可以定义所谓的“年轻”。

李翔

听起来，更多是心态和思维。

我觉得有一点不会错：人年轻时，很多东西确实是自然而然的，比如开放度。因为经验还没有那么多，也没有那么多固守的东西，想象力会很大。

张巍

我后来发现，最关键的一点是，开放心态的人其实很多，有激情的人也很多。但经验和资历对一个年纪大一点的人最大的限制，其实在于成就感。

有可能一个人以前管过几百亿的生意，让他现在做一百万规模的事情，他找不到成就感。但年轻人没做过这件事，就会很有动力。这种动力反而是年轻人特别独有的东西，很难重新找到。

尤其经历过很多事情以后，有些人会觉得“我也不 care 这件事了”，你很难再给他正向激励和成就感。

所以我们可以把年龄放开。我们所谓的“年轻”，包括开放，也包括经历，以及他的成就感来源是不是能够因为一件小事而高兴。

李翔

这确实是判断一个人是否年轻的很重要的体会。

我岔开问一个别的问题。我们也投了很多老师创业的公司。从老师的角度出来创业，在最开始的阶段，可能是半年、一年，也可能是两三年甚至更长，我们观察到一个比较普遍的现象：老师容易相对理想化，希望所有事情都像解科研问题一样，尽量一步到位。

比如缺一个 A 技能、A 职位的人，最好找到一个完全符合 A 的人放进去，从此以后这件事就 carefree 了，高枕无忧了。

张巍

我也经历过。我现在偶尔在一些不懂的方面，还是会有这种 wishful thinking，希望找到一个人，找到以后就不用管了。

李翔

但实际上你还是要兜底。

还有一个小挑战是，有些老师创业时，一上来就想找一个 CEO。这件事更不容易。我觉得这和老师自己的定位有关。

如果他只想做技术输出者、早期贡献者，找一个职业经理人，可能也行。但如果他是大股东，在业务还没有完成从零到一、商业模式还在摸索时，过早找一个职业经理人，就比较有挑战。

某种意义上，即使要找 CEO，也应该先找 COO。这样至少有一个可以观察、调整、配合、上升或下降的空间。如果一开始就把人放到 CEO 这个位置，后来发现不合适，调整空间就很小了。因为只要把 CEO 降职，他基本就待不下去了，CEO 再往上也没有别的职位。

且不说信任如何建立，在一个高速发展、还没有完成从零到一探索的赛道里，第一大股东就是 CEO。你不管他自己叫不叫 CEO，如果在他下面再叫另一个人 CEO，本质上在我看来有点自欺欺人。

但如果是成熟业务，比如开一家奶茶店，那找一个成熟的店长就无所谓了。

张巍

我刚才想解释的是，优秀的科研工作者习惯于解题，他们更希望在每个重要问题、每个岗位上都一步到位，从此高枕无忧。

李翔

但我不知道你是否同意，或者你是否也经历过：事实上，大部分情况下，一个既称职又起作用的人选，都是在过程中慢慢展现、变化、筛选出来的，而不是第一天就一步到位，成为那个样子。

张巍

从现象上看，确实大部分是慢慢发生的。

但本质上，我认为这是创始人或一号位对事情的认知问题。如果他非常清楚做成这件事需要 A、B、C、D、E，每一件事上的人需要具备哪些能力，并且能够把这些要求梳理清楚，那么他选对人、把事情做成的概率也会比较高。

不过一般来说，创业者不管从哪个角度出发，哪怕是成熟创业者再次创业，除去少数人，大部分人也不会把自己已经完全做成过的事情重做一遍。他总是要尝试一些没做过、但觉得自己能够做成的事情。

这里面总有至少 30% 到 40% 的事情，是想象或预测出来的，而不是过去做过的事情。所以总有 30% 到 40% 的内容需要探索，需要尝试，也需要付出代价。

李翔

听上去好受一点了。

张巍

即便是一路从商业中成长起来的 CEO，也会面对这个问题。比如有些 CEO 从小就在社会中成长起来，没有像我们一样在好的大学里、接受国外教育，但他的社会阅历和社会经历可能远比我们丰富。

他小时候在社会上经历过很多事情，可能各种被骗的方式都被人骗过一遍以上。理论上，他在可以试错的范围内可能都试过错了。但即便如此，他做熟悉的事情也总有不熟悉的过程。

哪怕再次做一模一样的事情，比如曾经做成过一家机器人企业，环境、竞争条件也不一样，仍然会遇到新的问题。我觉得这是几乎不可避免的。

李翔

只不过从老师的角度看，因为他更偏解题思路，也就是提出一个问题，就要找到一个正确、必然、不能被同行质疑的答案，所以更容易希望一步到位。

也就是你说的 wishful thinking，希望找到一个一步到位、从此高枕无忧的答案。

我总结了一点：人总会在自己不懂的领域里被魅惑，而且越容易不懂，越容易被魅惑。所谓被魅惑，就是特别希望别人能够解决这件事。其实正是因为你不懂，懂了以后就不会被魅惑。

老师容易被魅惑，或者被一些因素蛊惑着做出选择，本质上是因为他在整个商业里缺少的维度比较多。

当然，也有一些成熟企业家特别容易在技术和学术上被魅惑，有一种技术崇拜。真正懂的人一看，会发现这个人并不 work。

所以人最容易在自己最不擅长的领域被骗，或者说，人总是在最不擅长、又不想暴露自己不擅长的地方，寻找一个完美答案。但最后证明，即使不擅长，也需要先了解、先做判断，才能得到一个及格答案，更不用说完美答案。

张巍

对，这件事挺有意思。

李翔

最后作为结尾，作为一个经历了五年创业、担任五年 CEO，以及做了十五年以上研究工作的学者，你经历了行业不热、融资寒冬，也经历了过去至少两年的行业大热。

回过头去看这五年，有什么特别印象深刻的事情，或者今天最想描述、重新回顾时最重要的感受？

张巍

自己需要学的东西还是很多。这五年我觉得变化非常大。

每升高一个维度，或者每增加一个维度，我都不觉得自己已经完全掌握了。增加一个维度，往往是一个急速而痛苦的过程。痛苦之后会有一段享受，但还没等你享受完，新的挑战又来了。

你会发现自己还是有不足，有些事情没有考虑清楚，或者认知上还有欠缺。这是一个以最快速度认识自己缺陷，并在商业上迅速补充学习、不断迭代的过程。

整体来讲，你每分每秒都觉得有挑战、有压力，但回过头看，整个过程又是有成就感的，大概就是这样一种状态。

李翔

确实。最后作为一个结论，大家常说创业是一个修行的过程，因为它需要学习很多东西，接触很多不同的领域，掌握很多不同的打怪技能。

在原来岁月静好的研究生涯或其他专业生涯里，我们不需要那么多打怪技能。

我最大的一个体会，有时候和投资人说不太好，但从创业本身来讲，我最大的升级感受是，去年还是前年，我已经记不清了，我突然意识到，一家创业公司是可以死的。

张巍

对。

李翔

我不知道以前有没有和你说过。我觉得这是我最大的一个升维。我觉得“输不起就赢不了”，必须能够接受一件事情是可以失败的。

认识到这一点，对我来说是突然发生的。很多人可能听不明白，也不理解，但这是我的真实感受：这可能和你刚才说的，把自我变小一点有关。

或者说，ego 太大以后，就不能接受失败；ego 小一点，就可以接受一件事情失败。说白了，就是不要把自己看得过于重要。把自己看得过于重要，就不能接受自己失败，或者不能接受别人眼中的自己失败。

把 ego 放小一点，就可以接受事情失败。总想一定要赢，很多时候反而适得其反，也很难从容地做决定，更看不到很多东西。

接受一件事情可以失败，接受一家公司甚至可以死，我个人觉得这是最大的成长。没有之一。如果要给自己的创业路程打一个 mark，我不知道是在第三年还是第四年，我在挣扎中发现了这件事，然后觉得很开心。

或者说，把底线往前推，就能把上限往前推。“输不起就没法赢”，没法赢。

张巍

好。

李翔

感谢大家耐心听完这些技术性、同时也很有意思的讨论。谢谢张巍老师。

张巍

谢谢翔叔。
