李翔
大家好,我是峰瑞资本的李翔,欢迎来到这一期的《产业观察》。这一期的《产业观察》,我们请回来了两年多以前的一位老朋友。那个时候,我们和张巍老师录机器人的时候,机器人只是在 2024 年初刚开始热,谁也没想到,尤其是具身智能机器人行业,在过去这两年里,在中美,尤其是在国内,经历了天翻地覆的变化,当然也持续了两年的热度。
今天我们有机会把张巍老师作为逐际动力的创始人和 CEO 重新请回来。当然,他有很多不同的头衔和背景。除了是美国归国的学者之外,他现在也是南方科技大学的教授,也是国内外机器人领域著名的研究学者,身兼这么多身份。这一次,我们想和他一起回过头来看一看具身智能机器人过去两年的变化,以及明天可能会发生什么。
我们先简单回顾一下。张老师,作为一家公司的创始人和 CEO,过去这两年你有什么感受?这显然是极其特殊的两年。
张巍
对整个行业来讲,我觉得是天翻地覆的变化。作为初创企业,为了应对这些变化,肯定也会有更多变化。我的整体感受就是不断地迭代和变化。
李翔
确实,过去这两年,机器人行业叫“没有最热,只有更热”。每一次大家都觉得已经很热了,结果还有更热的事情出现,还有更多新的变化出现。虽然热度带来了很多好处,比如融资、关注度,以及政府、行业和民间对这件事的热情等等,但除了这些好处之外,在这么热的两年里,焦虑和困惑主要是什么?
张巍
1. 这个赛道还不够卷
先说这个行业的变化。这个赛道里的人都觉得很卷,但我觉得不卷,我真觉得还不够多人。
李翔
你说“不卷”,是因为大家还没有同质化,还是因为大家在同一个问题上还没有收敛到相似的解决方案,去拼效率?
张巍
因为大家总是带着互联网垂直到某一个赛道、要求规模化,以及只有做到第一名才能活下来这样的思路,去看这个赛道,所以总会说谁会留在牌桌上、谁会赢。
但整个赛道,我个人觉得不能泛泛地类比成某一个垂直领域。它应该类比于互联网。互联网可以有美团、阿里、字节、腾讯,在垂直领域还可以有 58 同城,也可以有非常多的公司。所以这里面的机会非常大,每个人只要好好干,我觉得都能活下来,因此不存在所谓的“卷”。
李翔
那你这么说,我觉得它更像新能源车。2014 年以来,大家一开始质疑的是新能源车本身行不行,后来又质疑造车新势力行不行。时间过得快一点,到十年后的今天,在这种硬件相关的载体里,加上自动驾驶技术,至少在阶段性上,大家都有一个生存之地。
不管是造车新势力,还是传统企业重新开始走新能源路线,或者是原来做不同类型的车、后来转型到新能源车上,比如赛力斯就是这么转过来的,再加上华为;又比如上汽,大家一路都不看好,但上汽从去年开始看起来已经转过来了——把合资车转成自主品牌,把燃油车转成新能源车。这些业务的占比都显著提高,甚至超过了一半。
大家都各自开出了各自的春天。你觉得机器人最终也会更像这样吗?当然,它也带来了一个残酷的现实:每年流行的新能源车品牌和产品都不太一样。
张巍
我觉得具身智能比新能源车这个赛道大特别多。我不好说一个具体数字,但是非常大。
新能源车本质上是从 A 到 B,完成出行这件事就基本可以了,而且主要面向 C 端。这里面会有很多家企业存在,也会有传统车企。再看车这个形态,它还可以发展出商务车、商用车、卡车、运输车;如果看移动底盘,还有物流。广义上,它们都是车,所以从一种形态来看,它可以衍生出很多服务。
具身智能比这个的广度还要广。我们聚焦在新能源车满足出行的 To C 领域时,它还是一个相对垂直的赛道。这里面可能会有一些玩家相互迭代,但具身智能面向的使用者目标要多得多。它是一个通用的载体,可以渗透到各行各业。
具身智能放在车里做无人驾驶,也可以;放在其他地方,也可以。所以大家可以发挥的空间非常巨大。我觉得现在远远没有收敛到一个具体目标,也没有收敛到在同一个目标下、面向同一种用户去拼性价比和价格。因为现在连功能都还没有完全实现,所以整体来讲,这个空间非常大。
李翔
那我们换两个具体的、可能会带来困扰的问题来问问。
第一个问题,今天大家有一个融资竞赛,要融到多少估值以上,要融到多少钱以上。因为你是比较早进入这个行业创业的,虽然赛道更早的时候也有人进入,但你是在这件事热起来之前进入这个行业的。今天大家开展融资竞赛、你争我抢的过程中,会造成焦虑和困扰吗?会被干扰吗?
张巍
会被干扰,但不太会焦虑和困扰,因为我们在这件事上还是有自己的原则和本质。
在融资和 PR 这件事情上,我们相对保守。我们坚信,你的价值和估值应该成一定比例,这才是健康的发展趋势。
当然,我们现在也要做很多融资,本质上是因为未来这个行业的发展,资金资本化是一个重要能力。它不是可有可无的能力,而是一个需要持续投入的赛道。企业以后规模化量产和交付的过程中,需要大量资金,所以融资从这个意义上来讲是必要的。
但不是说想不清楚要做什么,先拿一大笔钱融进来再说,这不是我们的目的。
李翔
2. 人形不进工厂
我们再换一个角度。我印象中,大概一年以前,大家对于机器人为什么是人形,以及机器人将来干什么,还是众说纷纭。那个时候你还提到,从逐际动力要努力实现的技术方向,以及当时大家热衷讨论的场景来看,还是不要让它下工厂打工。
我不知道“不要下工厂打工”这件事,从今天的技术和公司变化来看,和一年以前相比,角度会发生变化吗?
张巍
这件事分两个方面:一个是我们个人的选择问题,一个是我们对行业的判断,这两者并不一致。
先说个人选择。我当时抛出了一个口号,应该是在上次和你聊完之后,我说的是“人形不进工厂”,不是所有机器人都不进工厂。我觉得一定要有人服务于工业,这没有问题,而且具身智能一定会在工业里发展。但两条腿的人形机器人,我们公司不把它定位成工厂里的效率工具,我们不这么认为。
我们有一个 slogan,叫 “Serve people, not process”。所以我们的人形机器人是服务于人,而不是服务于生产流程。它本质上不会是性价比最高、效率极致优化的产品,不适合在工厂里使用。工厂是为机器设计的,而我们的人形机器人是在人为人设计的环境里,为人提供服务。这是我们的定位差别,并不是对错之分。
很多形态的机器人,包括机械臂,以及一些带触觉的新型操作方式,都适合在工厂落地。我觉得工厂里还有很多枯燥、复杂、危险、有害的工作,需要被具身智能技术改进。我们也不排斥这些方向,但我们认为两条腿的人形机器人没有必要进工厂,这是我们的选择。
李翔
明白。那我们在这个问题上再拆开问一个问题。
3. 人形追求最大泛化
我们一直讲具身,具身就是长得像人。但它最后的功能性,毕竟可以分成一体化的,也就是胳膊加腿;还可以分成更偏腿的,或者更偏胳膊的,也就是更偏操作,或者更偏运动、走来走去、跑来跑去。运动会刚刚举行完,肯定主要是偏跑来跑去的。
从今天的角度看,随着机器人关注热度和技术应用继续演进,不同的上下肢能力,更有可能在一段时间内分开迭代和应用,还是更有可能混在一起迭代和应用?我们先只讲应用,不讲技术问题。
张巍
首先,具身智能本质上落脚在“智能”,形态是承载这些智能的终端和载体。
到底需要什么样的形态?刚才你提到有人形,也可以把人形切一半,我管它叫轮椅型机器人,也就是上肢坐在轮子上。还可以只有下半身,像狗一样;也可以是我们的双轮足、双足,或者各种其他形态。
我们做两类产品。第一类是通用人形,两条腿、两个胳膊,只有这种我们叫人形,其他我们都叫专机,某种程度上是专用机器。
那为什么需要人形?我现在有一个公式,翔叔。这个公式是:maximize number of tasks over form factor。也就是说,能够服务最多种类的人类需求、完成最多种任务的单一形态,是最优解。
李翔
换一个更容易理解的角度,就是它能在人类的环境里做最多原来人类可以做、想做或者能做的事情。
张巍
对,单一形态能服务最多任务、能做最多任务,就是人形。
其实我只要算三四类任务,就必须是这个样子,其他形态都没有解。比如今天在楼下有人让我上来,我现在已经形成职业病了,会先看下面的地形、门的宽度。你让我下楼取个快递,取到以后还要放到货架上,我就会发现,这个构型必须是人形,它没有其他解,所以它是一个最优解。
但是这个最优解的 objective function,也就是 reward 或 cost function,是什么?是任务的种类。这是最大泛化性的单一形态。
其他类型的机器人,比如双臂、单臂,我管它叫在一定任务范围内 maximize efficiency,也就是在一种任务范式下最大化效率。四足在某种情况下可能是最好的,单臂可能是最好的,双臂也可能是最好的。
所以这些形态,我们也有一条产品线叫 TRON。它本质上不是单一形态,而是一个基座。通过一个 SKU 和不同组合,可以达到、覆盖尽可能多的形态。人形覆盖最大化的单一形态,TRON 覆盖其他的专用形态,可以这么理解。
李翔
我们先不展开技术,再问一个融资热点问题,因为这个很有意思。
4. 世界模型开始升温
作为投资人来观察,最开始大家投机器人时,最受争议、最先开始讲的是具身,后来是具身智能机器人。再往下,最近大家都在讲,智能机器人要完成或突破智能的过程中,要做世界模型。
这是最近半年以来机器人行业最热的新故事。今天所有机器人公司,至少在和投资人沟通时,似乎都必须带上“世界模型”这个词。甚至很多和机器人不太相关的行业,在商业计划书里也要把这个词放进去:我是未来世界模型的一部分,可能是情绪的部分、情感的部分、记忆的部分。大家都在泛用这个词。
从具身、具身智能,到本体,再到操作、运动、全身控制,这些曾经热过的词汇,今天又来到了世界模型。我想从机器人从业者、创业公司的角度问问,你怎么看这个词?
张巍
总体来说,我觉得世界模型是一个大家值得期待的、具身智能数据 scaling law 突破的新方向。但目前它还处于相对初期的状态,很多定义也比较模糊。
我先说一下我对它的理解,再说为什么我觉得它会热。
首先,谈到“世界模型”这四个字时,第一个要做的事情就是对它去魅。世界模型的本质就是一个模型,“世界”只是修饰这个模型的词。从这个本质意义上来说,我们从小到大接触过的所有物理和非物理模型,某种意义上都可以叫世界模型,只是世界的大小、开放程度,以及我们能够观测到的物理变量不同而已。
既然它是一个模型,它基本上就是根据当前这个世界或系统的状态,也就是 state,以及我们潜在能够影响这个世界的行动,也就是 action,来预测未来一段时间这个世界的状态,以及状态对应的输出,也就是 observation。
具身智能里的世界模型,由于数据的原因,目前 observation 还是以视觉为主,力的信息相对较少。一般都是预测机器人要完成某项任务时,自己观测到的视频信息,所以它天然和视频生成模型的技术相关。
但大家发现,只预测未来视频、预测未来世界发生改变的过程还不够,因为这样完成不了任务。所以现在大家逐渐关注一个新的词,叫 world action model。也就是说,这个模型要同时预测未来完成任务的视频,以及与这个视频对应的 action。这样,它就能作为原来 VLA policy 的升级。
我们逐际动力大概在 2024 年中期,也就是两年前左右,开始探索用视频数据做操作模型的预训练。我们在 2025 年初发布了一个叫 VGM 的工作,也就是 Video Generated Motion,它是一个典型的 World X Model。去年我们还有一篇很有趣、效果也不错的 CoRL 论文,叫 GVF-Tape,是一个对数据量要求不高的 World X Model。只是当时我们没有使用“World X Model”这个词,因为当时 NVIDIA 还没有造出这个 World X Model 这个词。
张巍
技术层面,我觉得倒不是什么重大突破。本质上,大家还是看到传统意义上的 VLA 在数据 scaling 方面有局限性,而世界模型给大家看到了新的数据 scaling 希望。技术层面,它就是传统意义 VLA 范式的拓展。当然我个人觉得,VLA 的定义可以更广义一点。传统意义上的 VLA 是用 VLM 做 backbone;现在的 World X Model 是把这个 backbone 换成视频生成模型或相关技术。这样,在训练机器人操作的过程中,就可以利用带有时序信息的视频数据。相比单帧的静态视觉信息,这种时序信息更能很好地表达世界存在的物理规律,所以大家对理解背后世界运行规律还是有一定期待的。同时,作为潜在 scaling 或泛化的来源,视频数据肯定比真机数据更容易 scale、更容易采集。所以现在会看到非常多公司在采集人类操作视频,尤其是 ego-centric 视频。不仅容易采集,互联网上还有很多历史视频数据,大家也希望把它们用起来。因为这些原因,它应该不算什么重大突破,否则也不会有这么多人都会做。
李翔
5. 物理规律进入模型
虽然我花了很多时间,也投资了一些世界模型相关的项目,但作为一个技术外行来看,世界模型的定义在不同人的脑海中差别其实非常巨大。
我只问一个和世界模型有关的问题。刚才你讲到,这里面有很多不同分支,有的是使用不同类型的数据,来达到世界模型的模型变化或进化。还有一类,是在模型中加入或引入更多对物理世界进行预测和表达的数学公式,或者叫物理公式。
它通过人类过去对物理世界中很多物理量的认识来工作。最容易理解的物理量,就是从小被折磨的重力。除此之外,还有流体、柔体、摩擦、温度,可能也包括电、质量、磁等等。大家把这些物理量中的一部分加入模型,不管是作为模型的一部分,还是作为一个独立部分,把它作为世界模型演进的方向之一。
从你的角度看,加入这些物理量的数学公式有没有用?
张巍
我觉得这个问题目前无法证伪,也容易引起争论。我只谈个人角度。
首先,我们要有一个统一的原则来看这件事:加入这些东西,本质上都是在加入数据。物理公式和我们训练的 neural network 一样,都是对数据的一种压缩。我们认为牛顿定律也是对所有运动数据的一种压缩和表征。把牛顿定律,或者对应的数学公式加进来,本质上就是把运动数据以最简约的方式加入模型。
用这种统一的数据观来看这件事,相对就比较清晰了。这里有两件事。
第一,加入这些物理规律的数学公式,是不是带来了新的数据增量,或者更本质地说,带来了信息增量?也就是我们对这个世界的理解,信息量有没有增加。增加了,我们才有必要做这件事。
第二,信息量可能增加,但我们能不能很好地利用这个增量?这本质上是一个 alignment,也就是对齐问题。原来其他数据的表征,和现在世界模型中的表征,能不能很好地对齐?如果对不齐,可能会起反作用。
总体来讲,从第一性原理来看,加入这些物理规律的数学公式,肯定会带来新的信息,尤其是新的模态信息。人类在抽象物理规律的过程中,使用了大量非视觉的信息,比如电的测量、磁的测量、力的测量。把这些信息的表征加入进来,本质上就是增加了这些信息,所以是有帮助的,是一种增量。
但关键问题是,原则上有增量,不代表我们就很容易使用它。因为这些表征很难和世界模型的数据对齐,这是最难的地方。所以大部分情况下,大家使用物理公式,本质上还是把它放进仿真里,生成更多容易和视觉观测数据对齐的数据。也就是通过仿真生成数据,再用这些数据训练世界模型。
但这种对齐还是很难。整个 sim-to-real 的过程,其实都在做这样的对齐。总体来说,它是有用的,但想把物理规律很好地和世界模型对齐,非常有挑战,没有想象中那么容易。
李翔
6. 数据成为模型原材料
今天有一个非常热门的创业方向,和这个现象背后是同源的。因为现在尤其缺少带有这些物理量的数据,历史上几乎没有过,所以大家开始用不同方式、不同成本采集和加工数据。
这里面有两个部分:采集是硬件或者含硬件的部分,加工则是把数据加工成大家想要的、包含不同状态和物理量的数据。不管创业公司做其中一个部分,还是两个部分,这类公司都变得非常火热,尤其是数据采集相关的创业公司。
作为一个需要数据和模型迭代的具身智能机器人公司,你怎么看这件事?
张巍
生产具身模型,我认为跟制造业没有什么区别。数据本质上是原材料工业,训练是一条产线,最后生产出来的是模型。模型本质上就是数据经过采集、处理、训练,最后沉淀出来的一种表达方式。
不管把它叫不叫产线,产线源头都是数据。数据需要经过预处理、来料处理和检测,最终进行训练,训练完以后得到模型。所以从这个角度看,各种模态信息原材料的丰富程度非常重要。
李翔
7. 通用与场景数据共进
回到方向和技术的讨论,从大的视角看,这些不同类型的数据,最终会使机器人在未来一到两年里更垂直、更受限,也就是在特定场景中更快落地;还是会让机器人在更不受限、更泛化的场景下,更快进行模型升级和迭代?
当然,这两件事可能同时存在。我的意思是,按照今天的情况,在未来一年到一年半里,会更偏向前者,还是更偏向后者?
张巍
我觉得两者会同时进展,而且取决于你刚才说的数据都包括什么。现在做什么数据的都有。
但我有一个不一样的观察:在具身模型落地的过程中,无论是 VLA、V-A,还是世界模型,大家训练 model 的时候,我觉得具身智能不能像大模型那样,先通用,再专用,再应用、落地。至少按照我之前的判断,这种先通用再落地的模式不适合具身智能,我们现在也在践行这个判断。
这是因为各个技能、各个任务之间,数据的相关度和数据需求非常不一样。
李翔
听众可能不太容易具象地想象,我们举个具体例子,为什么 A 和 B 的数据很难相关和通用。
语言是一个通用模态。你写律师信,还是写一篇文稿,对通用语言模型都可能有帮助。但开车、自动驾驶的数据,和剥鸡蛋的数据放在一起训练,现在还不知道是不是反而会有问题。
张巍
对。在跨技能的数据 pipeline 中,如果你不了解数据之间的关系,就期待靠堆数据产生涌现,在我看来是一种刻舟求剑的方式,所以不会这样做。
我们认为需要通用模型的能力,但这个能力是慢慢长出来的。我把它叫作“通用模型与场景数据的飞轮”。也就是说,先有一定的通用模型基础,然后在垂直领域尽量收集数据、落地,在落地过程中获得更多数据,再反哺通用模型。通用模型的能力就是这样增长起来的,而不是先做出一个特别通用的模型,再去落地。
到目前为止,我们看到的基本就是“通用与场景数据的飞轮”,现在也在践行这个战略。
李翔
那我们沿着这个问题,再问一个从普通人角度出发的简单但重要的问题。
假设最终按照这个飞轮迭代,最后变成一个更通用的机器人通用模型。听起来,它需要具备的能力远超过预测下一个字词。语言模型的能力,本质上是从概率上预测下一个字词。
如果机器人有了这样一个通用模型,我们普通人是不是可以理解为,这个模型会比今天的语言模型大无穷多倍,或者大非常多倍,而不是今天这种几千亿参数的概率模型?
张巍
如果是那么通用的一个模型,当然会非常大。但我不认同会有这么通用的东西,我觉得它应该是一个一个的技能。
李翔
因为如果这么通用,模型就会变得非常大。将来机器人使用时,虽然技术可能会发展,但最大的麻烦是,按照今天大家对大模型的使用来看,它身上需要堆很多芯片,也需要很高的功耗。
运行这么大的模型,还要求实时性。你不能剥鸡蛋时,剥第一个蛋壳想两秒钟,剥第二片又想两秒钟,等剥完以后,我可能已经不饿了。所以它既要求快,又要求实时,这样就很难妥协。
也许到那个时候芯片会进步,也许会有可控核聚变,可以随身携带一个无穷小的可控核聚变。当然,这些都是科幻小说了,但听起来确实会有这样的问题和障碍。
如果不是一个什么都能做的通用模型,那它会是怎样的解决方案和发展方向?
张巍
我始终觉得它是一个个技能。开车是一个技能,我可以不会开车,但我有脑子;剥鸡蛋也是一个技能,我不会的时候也要学习。它不需要一个什么都能做的通用模型,而是需要各种对具体场景落地有帮助的技能。
我还真不知道自动驾驶现在的模型规模大概是多少,没有准确数字。但我觉得它就是一个个技能。当下落地的是各种类型的技能,它的预训练、后训练和落地过程,我觉得已经看到了一些希望。
现在大家看不到的是,这些技能创造的商业价值,和创造技能所需要的数据成本,还没有打平。或者说,大家还没有找到能打平的某个垂直领域案例。大家都在寻找,我一直是这么看的。
李翔
自动驾驶大概也是这样。它就是具身智能中的一个技能,不是一个大脑,而是人脑的一部分。你会开车,不代表你会剥鸡蛋。
但具身智能发展到今天,最近行业里也有很多口水战。第一,要不要 L3?有一派说不要 L3,直接从 L2 到 L4。当然这里面有监管、责任和权利确认等问题,而且它对成功率的要求特别高。
除此之外,这个话题隐含的另外一件事,和刚才讨论的世界模型也有关。今天自动驾驶也遇到了一些小瓶颈,所以又回到了世界模型这个热点词。自动驾驶开始把世界模型变成技术进步中一个非常重要的词汇,可能也是因为遇到了技术进步上的挑战,当然也可能和数据有关。
从我们看到的现象来看,自动驾驶作为技能之一,也走到了这一步,走到了需要使用世界模型这个热词的阶段。
张巍
你看,自动驾驶里所需要的世界模型,至少按照他们所描述的需求,和剥鸡蛋所需要的世界模型,不一定是一样的。至少大家满意、达到要求的世界模型,应该是不一样的。
李翔
你可以说,一个大而全的世界模型什么都有。但从外行看,今天“世界模型”这个词热起来,隐含着一个大家想解决、但还没有完全解决的问题:我们怎么能够在看到世界的情况下,当然也包括其他感官,对这个世界形成某种意义上的理解?
这不一定是语义理解。比如从人的视角出发,自动驾驶完全不需要识别这是一个水瓶放在桌子上。它只需要识别这一大堆东西是一个不会移动的固定物体,就可以了。它不需要知道这是什么,也不需要知道它是刚性、柔性还是弹性。桌上的瓶子、水、摆设、凳子、桌子、桌腿,这些都不重要。重要的是,它们是一个不移动的、占据一定面积和体积的物体。
它不一定需要理解这个东西到底是什么。也许今天自动驾驶重新关注世界模型,是因为它也到了想要或者需要理解的阶段。
当然,我们对机器人的预期更高一些。所以世界模型放在机器人上,一方面是因为数据不够了,我们要想办法用更少的数据解决问题;另一方面,我猜普通人也希望机器人像我们一样,在语义层面理解世界,知道这个东西到底是什么。
比如剥鸡蛋,我需要先理解它是熟鸡蛋还是生鸡蛋,才知道接下来剥鸡蛋的技能该怎么实现。如果我知道它是铁做的鸡蛋,哪怕它长得像鸡蛋,我大概也不会拼命去剥它。这就是理解它是什么,或者说从语义层面理解物理世界。
张巍
我本来想回避这个话题,但还是说一下我的理解。
对你所关注的世界进行建模,本质上是能够表示这个世界未来会怎么发生,尤其是和我现在对它产生的 action 相关的、可以演绎出来的结果,并且能够很好地建模。在数学里,我觉得它就是一个 Markov 过程。
但你可能是 partial observable,只能观测到 pixel,也可能有一些新的模态,比如通过触觉观测力大概是多少。通过 observation,我希望能够不断建模、还原这个世界的物理规律,预测我这样做以后,世界会怎样演绎。
这非常取决于你能观测到什么,也取决于你的世界里包括什么。眼前是一个杯子还是两个杯子,它们之间的相互作用,这些都是整个过程需要 capture 的内容。
它不一定要 capture 到分子层面。比如这个房间,如果要把所有分子都弄出来,才能知道真正的温度分布,那当然不现实。所有模型本质上都是对微观事物的抽象。它本质上就是看能不能很好地 predict future。
所以我认为,一个合格的世界模型,就是通过 observation 还原事物之间的物理规律,并预测未来。我对它有一个比较严格的定义。现在大家的定义五花八门,我们不想掰扯这件事。
李翔
如果到了微观层面,每个粒子都能被知道和预测,那不就变成拉普拉斯妖了吗?
张巍
对。这个世界上,我们所有的物理规律都不是绝对正确的,都有局限。只要它和你的 observation align,也就是和你的观测对齐,就可以了。你眼见为实,但眼见也不一定为实。
我想物理规律主要是一个降维表达。
李翔
对,是对大规模描述的降维表达。
张巍
它就是一个模型,取决于你要描述的世界有多大。你说要一个世界模型,把这张桌子描述得很清楚,那需要的东西就很多。否则也不会有牛顿和爱因斯坦在不同观测层面上的体系。
李翔
我们回过头来讲,这里有一个小问题。很多人可能也持有这样的观点:从人的角度,我们希望机器像我们一样。
按照你刚才描述的角度,机器在今天模型进化和迭代时,不一定需要经过人类意义上的语义层,对吗?
张巍
它的语义和人的语义不一定一样。它的 embedding 和我们的语言,都是我们自己抽象出来的。我们也听不懂猫是怎么叫的,对吧?猫有自己的语义。我们要允许 AI 有自己的语义表达。
从某种程度上说,它可能用自己理解的某种 embedding 来表示所有客观规律,但这种表达不一定和我们的语义完全一样。
李翔
所以可以把它变成一个结论:它不一定需要经过我们意义上的 semantic 这一层。
张巍
不需要。我觉得它就是 whatever,只要它能 predict future,就可以了。
李翔
8. 机器人大脑其实是操作系统
那就回到了刚才的问题。今天更时髦、也更混乱的一个词是“机器人大脑”。至少有一部分,尤其是高估值的企业,像你们这样,都必须说自己要做机器人大脑。但这个词的定义非常多样化。
从你的角度怎么看“机器人大脑”这个词?
张巍
我现在对它有比较明确的理解,当然这个理解还在不断迭代。
第一,我不觉得模型是大脑,模型不是大脑。第二,大脑也不是模型。大脑是一个操作系统,这是我的定义。
为什么我们会有 CoSA Agentic OS?大脑是一个操作系统,它不光要管理记忆、存储和思考,它还是一个 agent。我认为它是一个 Agentic OS,要调用各种模型,包括 VLM、LLM,以及各种 VLA 模型,才能完成一个任务。
它要调用很多工具,所以我们不认为通过堆操作数据、堆训练数据,就能训练出一个大脑。这样可以训练出一个技能,但训练不出大脑。大脑本质上是在模型能力之上的一个操作系统,我们是这么看的。
李翔
普通听众听起来可能会有点混淆,或者有点迷惑。你的意思是,大脑在大模型之上?
张巍
不,不是这样。我们可以把 OpenClaw 认为是一个大脑。它是基于大语言模型的,它的能力也取决于你用了哪个模型。
以前这个说法比较混淆,甚至会引来非议。现在 OpenClaw 出来以后,可以更好地解释。傅盛之前也说过,大模型不是大脑,OpenClaw 是大脑。我们也是这么认为的。
CoSA OS 是一个脑,脑是一个操作系统。各种模型是脑进行思考、完成任务时调用的工具和技能。
很多人对技能的理解比较狭义,比如机器人拿、放、拧瓶盖这样的原子动作技能。但我这里所说的技能可以非常广。比如整个自动驾驶,虽然我们现在还没有完全实现,但如果实现了,对应的那个模型就是一个技能。
这个模型和人的脑也不是完全等价的。一个人可以很聪明、非常优秀,但他没有掌握自动驾驶这个模型和技能,这也没有问题。所以,脑的本质还是模型之上的一个操作系统。
李翔
这对大部分人来说可能有点反直觉。大部分人认为模型就是大脑,而 OpenClaw 是操作能力,或者操作能力的延伸。但按照你刚才的解释,正好反过来了。
今天我们对“大脑”的理解,除了大家在描述商业模式时使用的不同场景之外,可能还比较初级。人类从人的角度看,认为大脑是自己在动物中最厉害、最发达、最与众不同的地方。
但今天我们真正意义上对大脑如何工作,包括记忆、技能完善、模型修改,以及认知层面的不断加深,仍然没有特别清晰的理解。你刚才说的“万里路”,其实也不能完全解释。
张巍
我们对机器人大脑的架构理解现在相对清晰了。这也是最近一年左右逐渐收敛和成熟的。
我们大概是三层架构,和别人也不太一样。
底层是小脑基础模型。小脑更偏运动,它只管动。你可以认为它是一个没有大脑的系统,你让它怎么动,它就怎么动,但它得能够完成这个动作。对传统机器人来说,这件事相对简单,机械臂用传统方法就可以完成;但对人形机器人来说,需要一些 AI 能力,也就是基础模型。
上一层我们叫 Human Brain VLA,是 System 1,也就是一个高阶技能。它的运动必须和环境、任务相关。我看到的东西,能够指挥我的运动把事情完成,这就是我们所说的中间 VLA 技能层。
再上一层是 System 2,也就是 Agentic OS。它是以大模型为引擎的整个 Agentic 系统。你可以把它想成 CoSA,我们自己的脑。我们认为它是脑,也就是 Agentic OS 脑。
你可以想象一个人躺在病床上,身体瘫痪了,但他非常聪明。他有脑,但他什么也动不了,只能思考。他有没有脑?当然有。但他会不会动?一动也动不了。
如果给他赋予一个技能,就好像打通了经络,他就可以去拿一个水杯了。这就是赋予他一个 VLA 能力,或者说一个技能。
模型给了我这个脑,我的脑在那里。你想象一个躺在病床上的病人,他的脑是什么?我觉得就是一个 OS。
再举一个例子:我要去楼下买一杯咖啡再回来。这件事需要思考和决策,我要看现在有没有时间,决定要不要出去。决定出去以后,我要起身,调用开门的技能,调用定位和导航;出门以后还要使用 GPS。我不可能重新训练一个模型,把 GPS 也训练进去。
这种整体的组合和思考,我觉得就是上层 CoSA OS 要做的工作。它的 smartness 和成熟度,取决于大模型的进展。
我们认为,脑最核心的还是语言模型,因为语言是思考最本质的东西。人类的思考是通过语言完成的。
李翔
那稍微反问一下:假定一个智人没有进入人类社会、没有学会语言,或者他天生聋哑,他还会不会足够 smart?
张巍
他可能有技能,有肌肉记忆,可以完成一些技能。
我们先定义他是一个智人。他是不是一个能超过一般哺乳动物、做出超越直觉反应的事情的人?现在 AI 的进化方式和技术格局里,大语言模型确实起到了推理和思考的作用。
你说没有语言,是不是也可以用其他 embedding 来完成这件事?肯定也可以,只是我们没有那些数据。因为人类通过语言和互联网,把思考逻辑用语言表达出来,沉淀成了数据,所以我们可以训练这样的模型。
所以它既是语言,又不完全是语言,因为它是人类思考过程的一种表征。智人或者其他生物,肯定也有自己的符号,也有一个我们认为的 System 2,只是那个 System 2 可能不够强。
但在当下的技术范式下,我们认为它是以大语言模型为基础的思考框架。
李翔
这里还有一个问题。今天的大语言模型本质上也是概率模型,这句话是对的吧?
当然,人思考时也可以被认为是概率模型,这没有问题。但概率模型又回到了刚才的问题。比如大语言模型对词的预测,对一段话、一篇作文的生成,或者对内容的理解,本质上都是概率预测过程。
所以我们不能说它是一个语义理解过程,这句话应该是正确的。它是一个概率预测模型,但这是否意味着它其实真的理解了这些内容?
张巍
什么是理解?这是一个好问题。
理解又回到语义层面:它真的理解语义的意思吗?它的理解和我们的理解,不一定是同一个理解。但它又是从我们的理解中投射出来、学习出来的。
所以,如果把理解做一个抽象定义,只要它能够 predict,而且和你接下来所做的事情类似或一致,那就可以叫理解。
理解很难定义清楚。我们两个人对一件事情的理解,取决于我们对这件事情所衍生出来的判断和决策。如果把理解做一个抽象定义,只要接受这个结果,我觉得它就理解了。
如果不接受这个定义,那它当然没有理解,因为它的存储方式和 embedding 肯定和我们不一样。这没有问题。就像大家和不同的人说同一句话,每个人对这句话的理解也不完全一样。
李翔
所以我们今天讲的是,大家能够对一个东西做出相同的上下文应答或描述。这一点上,人和机器、人和大语言模型可以做到类似。
但我刚才的问题是,人想要的理解或者智能,更多是用极少的数据完成对一个未知事物的理解过程。从概率模型来看,它需要超级多的数据,尽可能覆盖各种变化和不同维度的分布,才能更好地从概率上预测下一个结果。
它需要的数据,可能比我们理解一件事情所需要的数据多非常多。
张巍
我不知道它需要的数据比我们多不多。我们其实进化了好多万,七千万差不多。
李翔
啊,没那么多。
张巍
对,没关系。包括猿人,包括猴子这些东西,我们的大脑在物理世界中的这些数据沉淀了这么久,然后一代代传下去。我们传给小孩的,本质上就是一个预训练模型。小孩出生时,大脑已经有一个 pretrain model,然后再继续学习。
所以如果都这样沉淀下来,神经网络在历史上接收的数据有多少,我不知道和大模型怎么比较。我们每天这样聊天,数据量也很大。
李翔
但从所需要的语言数据来看,加上你说的这些沉淀,我猜它需要的语言数据应该没有那么多。当然我也不确定。
张巍
对,因为这是长期积累的。互联网几十年能够穷尽的公开数据,可能已经比一个个体能够接触到的信息多了。它接收到的是整个人类的 union。
概率模型的特点就是,尽可能多的概率事件都要让它见过,它才能抽象高维关系,或者说抽象出那个模型。
李翔
从刚才听起来,逐际动力现在的产品大概分成软硬两层。
硬件层,一部分是可以多用和专用的,同一套部件既可以当胳膊又可以当腿;另一部分是搭载整体功能的人形机器人,也就是既有胳膊又有腿、有人形外观。这是两类硬件。
软件部分分成两层:一层是刚才讲的、更像大脑的 Agentic OS,也就是调度和使用模型、技能的 CoSA 系统;另一层是更下面的技能层,包括你们和其他公司都在做的、用新数据和原有数据训练的技能,以及在技能基础上的强化学习过程,也就是技能的快速获得和快速收敛。
大概来说,你们提供的软件产品就是技能和 OS 两部分。中间用 VLA 训练的过程,市场上有开源方案,大家也都在做不同研究。硬件则是专用形态和人形这两类,软硬件可以用不同组合结合在一起。
听起来,公司的产品和技术产品类别,大概是这样一个组合吗?
张巍
我们还是分人形和非人形两条产品线。但我觉得产品本质上是软硬一体的,取决于你服务的用户是谁。
人形机器人不是光卖一个硬件,它也包含软件服务,是软硬一体的系统。用户不同,软硬件系统的搭配也会不一样。
TRON 本质上是服务创新、服务 POC 落地的。它有点像 Maker Market。因为它既是两条腿,也可以探索巡检、物流和 mobility 等应用,尤其是跨台阶的场景,这是以前的平台不存在的,所以我们认为它可以 enable 一些新的应用在上面长出来。
现在的 TRON 2 有双臂。我们希望把它做成最好用的双臂机器人。坦白讲,现在市面上还没有特别好用的双臂机器人。它的负载能力、易用性等都比较好,特别适合做创新科研。
所有企业如果想做场景落地,不需要重新再做一台机器人。可以直接用它,我们也会开源训练模型的方式。企业可以拿着它到场景里收集数据,做垂直领域的落地,我们也会帮助他们。落地以后,愿意用我们的方案就用,不愿意用,也可以自己做。
其实落地最关键的是早期的 POC 和 PMF。原理验证的时间往往最长,如果这个时间花得太久,就可能错失落地的核心时期。所以最好使用已有的硬件平台和技术栈,先做 POC 验证。验证通过以后,企业可以自己生产,我们不限制。
因此,我们服务的本质是创新和 POC。
李翔
从 OS 开始的三层架构,以及不同应用和技术栈,作为公司可以提供给外部用户的产品,除了公司自己使用之外,其他人也能用的,主要是哪几部分?
张巍
我们一般不用软硬件来定义产品,而是用用户类型来定义产品。
刚才说的 TRON,是服务创新、服务具身场景落地的基座,基本上所有落地都可以用 TRON 去尝试。这里面我们提供硬件平台和一些开源接口。
我们最近还开源了一个东西,没跟翔叔说过,叫 Flux VLA Engine。我们没有把 VLA 模型开源,因为我觉得当前模型还用不起来。开源模型可能对融资有帮助,但模型参数本身可能也有限。
我们讲“授之以鱼,不如授之以渔”。我们把训练 VLA 基座模型的方案和整个架构开源了。我之前说我们是在做模型生产线,那我们就把产线开源。因为最终落地的数据和模型,应该属于垂直场景里的那个人。对方需要的是数据,也需要我们的硬件平台和开源架构,数据要由他们自己去收集。
所以在 TRON 这一系列产品上,我们提供的是这样的服务。
从人形机器人的角度,我们是奔着人形终局去的。我们坚持 “Serve people, not process”,不进工厂,最终走向家庭服务。它的落地相对有争议,但我们始终坚持,它是一个最优解,是统一的本体,不改变硬件构型,而是通过不断叠加 app 的方式,增加它的功能属性。
当功能足够多的时候,大家就不会怀疑它的价值了。现在大家看到的可能只是比划、跳舞、翻跟头,会觉得价值有限。但这只是它当前的一个 app。科研可以是一个 app,表演可以是一个 app,主持可以是一个 app,导览也可以是一个 app。接下来它能够拿水、拿快递,又是新的 app。
当 app 多到一定程度,我觉得它不需要什么都能干,也可以产生商业闭环。我们就是沿着这个方式演进的。
李翔
作为投资人,我再稍微好奇一下。
9. 机器人如何兑现价值
这个行业仍然处在非常热的阶段。刚才我们讲到,主要是数据和模型碰到了一些原来的天花板,所以大家又有了一些新的开创性想法,不管是世界模型,还是其他和数据有关的方向。
但一个行业不管多热、热多久,最后总要有一段比较长的时间落实到应用本身,回到产生商业价值这件事上。今天当然已经有一些商业价值,比如表演就是一种商业价值。
我想问的是,在可见的范围内,刨去表演这些应用,你觉得具身智能的商业和商用价值会在哪里开始呈现和兑现?
张巍
我们觉得,人形机器人是一种新的产品形态,它的商业价值展开方式也有些非共识。要不然我觉得也没有初创企业什么事了。
坦白讲,我觉得它会逐渐增加 app。当前的表演就是一个应用。现在我们的客户拿它可以赚钱,它已经被用起来了,而不是只有 sell-in,也已经有 sell-out。
下一个阶段,我管它叫“动口不动手”。
你不要总想着让它去干活、替代工人。其实它替代动口不动手、替代聪明人的价值更大。商业服务、导览、导购,所有这些领域都可以。它是一个装着语言能力的可移动顾问,有一定的情绪价值和新的体验价值。在前期,这些都很重要。
李翔
它是一个极其聪明的人,但它不互动,对不对?它不改变物理世界。
张巍
对,它不改变物理世界,只交互。
我把它分成三个阶段:无交互、弱交互、强交互。
无交互就是自己比划、自己表演,你按一下,它比划一圈。弱交互是通过语言和动作协同来和你交互,也就是动口不动手。
你去看什么样的工作能够被替代:站在那里一天,基本不用干什么活,但要动口、天天动口不动手,这种形态就是早期的工作。
李翔
AI 的变革本质上是替代脑力劳动者。
张巍
对,替代普通的脑力劳动者。
李翔
像您这样的应该替代不了。
张巍
也不一定。我们也属于动口不动手,所以迟早也可能被弱交互干掉。
强交互就是最后真正和物理世界交互。它取决于技能数据的演进方式:有没有一类技能,能够让预训练和后训练的数据成本,和它创造的商业价值打平。找到这样的方向就可以。
我们也抱着开放的态度去找这种方向。预训练要做,后训练也要做,但最终要摸索出一个商业方向,在单一技能下实现成本和价值的平衡。
李翔
像开车都还没有完全打平,对吧?
张巍
对。但这样的领域非常多。
李翔
我顺便插一句。我们之前讨论过这个问题,其实很多相对新的事情,落地方式确实不完全和大家预测的一样。
拿刚才的表演举例子,我原来最大的经验和教训是,投资行业的人在 2015 到 2017 年非常积极、激进地投了一批无人机企业。那时候大疆第一次特别火,大家觉得无人机会很火,估值也高得不得了。
后来大家发现无人机没法用,结果无人机第一个能够批量应用的,就是无人机表演。当然,中国那时候也正好开始禁烟花爆竹。
张巍
是在大疆拍摄之后吗?
李翔
对,拍摄其实是更早的一个单一技能。当时大家认为无人机拍摄还是专业用途,还没有进入普通消费者市场。十年前、十一年前,有一家无人机企业来找我们,说要做无人机表演。那时候还是小机队,我还觉得这不是一件大事。
结果后来这家公司靠无人机表演活了下来,而且还活得更大了一点。今天大家已经习以为常,无人机表演已经成为一个很大的应用。
张巍
我觉得这个时代,怎么替代人只是一个方面。增加一个体验维度,本身就是非常有价值的事情。
当然,如果只是表演,我觉得上限确实有限。但如果像我说的,它是众多 app 的第一步,我觉得这件事是 make sense 的。
李翔
拿无人机来打比方。无人机开始时很难找到大规模商用场景,电力巡检之类的用途,因为续航和各种问题,没有被广泛接受。除了专业拍摄之外,第一个真正被广泛接受的,就是表演。
表演变得很大之后,带来了几个能力。第一是飞控能力,第二是协同能力,因为后来从几十架变成几千架,甚至上万架。第三是通过批量商业模式把成本打下来,各种成本都随之下降。
成本下降之后,新能源车又把传感器成本进一步打下来。随着模型演进,控制系统也再次迭代。再往下,它就可以进入小 B 和偏消费者化的市场。
按照同样的逻辑继续演绎无人机,随着越来越多和机器人有关的世界模型、物理世界预测技术发展,加上自动驾驶技术进步和成本下降,最终无人机确实可以 To C。
今天大家操控无人机,还需要一点专业操作能力。我们公司出去玩,出国时也有一两个同事会带无人机,因为国内现在很多地方不让飞。但未来可能不需要这些操作能力。你可以想象一下,拿一个 3D 模型,在里面用手画一个圈,或者在电脑上画一个圈,它就按照那条路线飞一遍、拍下来;或者它能够智能地跟着你,并且完全避障。这些肯定都可以实现,那就完全 To C 了。
只不过,十二年前大家就已经这样想象过。这个事情可能比当年想象的多花了十几年,等软件和硬件都迭代到今天这个阶段,才逐渐实现。
张巍
对。人形机器人我们是不进工厂的,最终往家庭走。我觉得家庭是最大的、最 exciting 的场景,也是它最适合的场景。
家里的任务是多样性的。你一周洗不了几次衣服,本质上就是一个多样性任务。商场、酒店、各种公司等商业领域,也会是比较前瞻的应用场景。
根据这些商业目标,我们构建 CoSA OS,构建我们认为应该具备的 Human Brain VLA,同时构建底层的全身运动控制基础模型,也就是 Foundation Model。
李翔
这里要强调一下,你说的全身运动控制 Foundation Model,是指什么?
张巍
现在大家看到人形机器人跳舞、翻跟头,这种通常是一个 policy,一个 policy 地去 play。它是一个事先录好的动作 replay,当然也需要训练。
但要让人形机器人真正干活,让大脑指挥身体,就需要基础模型。不能看到一个杯子,想要这样抓,结果还要回去训练一个星期才能完成这个动作,那是不行的。
我需要实时生成动作。这不是预先编好的动作,而是我需要什么动作,就能完成什么动作。这个 Foundation Model,就是我们投入了很多时间、精力和数据去做的事情。我觉得它对人形机器人非常重要。
大家现在看到的可能大部分都是一个 policy、一个 policy 地去 play,但 Foundation Model 更多和运动控制有关,是小脑的基础能力。它执行你要求的所有动作,你要什么动作,我就能给你执行什么动作。
李翔
对普通人来说,可以理解为小朋友在成长过程中,大概两岁到五岁之间学习的那些东西。专业上叫大小动作、抓取、爬行等协调和统一,也就是感统训练、感觉统合训练,拆分下来包括大小动作协调等。
这大概相当于训练小朋友的基础 Foundation Model。
张巍
对。它和语言的 Foundation Model 也差不多。
早期如果只是预先安排好的对话,比如你问“你好”,我回答“我在”,这不是大模型。但大模型出现以后,你给它任何输入,它都能生成你想要的回复。
运动仿真也是一样。你给我一个参考轨迹,可以把它理解为一个 prompt,我就能够完成这个动作。这个底层能力,对上层外部构建以及最终完成任务非常重要。
李翔
同意。要不然人也不会有这样的成长过程和步骤。
我们先把技术问题跳开,讲点别的。
10. 上市能否延续热潮
从投资人视角来看,比较有挑战的一个问题是,现在估值比较高的机器人公司,都在准备以不同形式进入资本市场,不管是 A 股还是港股,你们也在其中。
但从投资人视角看,如果一个行业处在很大的热潮里,通常热潮中的标志性公司上市、将要上市,或者刚刚上市,会成为这一轮热度的终点。Facebook、阿里巴巴都可以作为例子。
从这个意义上说,如果这些智能机器人公司在今年年底或明年陆续登陆资本市场,而上市成为这一轮热潮的顶点,会怎么办?
张巍
这个行业可能和其他行业不太一样,也不完全能和新能源汽车类比,但它可能更像新能源汽车上市时的情况。
比如小鹏上市的时候,新能源汽车行业并不是已经成熟,反而是市场热度跌下来之后,技术稍微好一点、大家开始接受的时候,资本市场的存在让上市公司拥有资金聚集效应,能够踩到新的浪。
李翔
那我们换一种问法。
今天大家除了角逐融资规模和估值,也在角逐上市。如果假定某个时间点,行业热度突然下降,不再像今天这样,甚至下降 50% 以上,作为这个行业的公司会怎么办?
张巍
各个行业都一样。但我觉得具身智能有一个好处:我管它叫比大模型的上限更高,比大模型的下限也更高。
它的上限想象力很大。你说要做一个真正通用的人形机器人,这个上限我觉得不比一个模型公司小。
第二,它不像模型公司那样,一旦某一代模型没有跟上,就可能彻底失去机会。具身智能总能找到垂直领域去使用。所以我觉得,只要做好本分,遵循真正的商业规律,同时有一定技术突破的公司,都有机会跑出来。
在当前阶段,我个人是相对乐观的。它的下限高,上限也高,因为现在大家的投入还没有到特别高的程度。
李翔
明白。没关系,等这个行业冷下去的时候,我们再来做一次,再回顾一下。上一次做的时候,行业只是刚开始变热。
11. 教授创业需要五个蜕变
接下来的问题,是作为一个在国外做了较长时间科研、在国内也从事过一段科研工作,权且叫老师吧,后来从国外回来做科研,又进入创业行业的人,在角色转换以及公司从小变大的过程中,你有什么感受、经验和教训?
张巍
特别多,全是坑。
我有一个总结,之前也和别人说过。我觉得教授创业需要经历五个蜕变:从学术到技术,从技术到工程,从工程到产品,从产品到商业化。
最早期的教授,本质上是以学术为荣。学术的问题是什么?它本质上是以一个 idea、一个想法为骄傲。有一个新的 idea,就很高兴,发一篇 paper,就以发 paper 为荣,这是学术阶段。
然后是技术阶段,把 idea 呈现成一个技术展示,以这个为荣,这是第二个阶段。
从技术到工程,是把一个技术稳定、可靠地实现出来,以稳定性和可靠性为荣。到了这个阶段,可能已经和 demo 没有太大关系了。
从工程到产品,是从可靠地实现一个技术,到做出一个能够满足用户价值的产品。但产品也可能卖得越多,赔得越多,所以产品还不一定是商业格局的关键。最关键的还是商业化。
所以一定要经历这几个阶段。至少对我个人来说,我经历了几次蜕变,也就是不断否定自己。
李翔
你说的“否定自己”,是完全否定原来的想法,还是在原来的想法里增加一个非常重要的新权重?
张巍
是转换。原来的维度太小了,需要增加新的维度,也就是升维。
在创业这件事上,学术没有那么重要,技术也没有那么重要,最终商业更重要。围绕商业目标,你需要什么样的技术,就要具备什么样的能力。
现在这个阶段,就像刚才说的 VLA 找场景,你既要懂商业设计,也要对技术和技术未来的预判相对准确,才能在未来的某个焦点上找到交集。
因为它不是一个成熟、已经落地的商业化方向,所以需要预测技术的轨迹曲线,在某些想象和可能性上找到交集。这需要一定的技术实力。
李翔
这不就是投资上常说的,一种是拿着锤子找钉子,另一种是围绕一个可能合适的钉子,把锤子变成最适合砸它的样子?
张巍
对。当下最大的锤子是 AI。AI 这个范式会激活很多可能性。
所以本质上要找到一些可能性,用技术趋势和技术的 power 去解决可能的商业价值。
回到刚才说的几个蜕变,我觉得最大的坑是对组织的理解,也就是从科研范式转向市场范式。
每一次变化都不是自我否定,而是对选人、用人和整个组织的迭代。你只关注技术时,选择的人、使用人的方式、组织方式,和你关心工程、量产时,都不一样。
所以不是我自己变了就够了,还要有能力驾驭整个组织一起变化。早期要选的人,和后期要选的人,本来就不太一样。
李翔
它难道不应该是一个一直持续变化的过程吗?
张巍
我觉得当你的维度足够全面以后,就不会再发生特别大的变化。
为什么有些成功的创业者,比如雷军,如果再创业,成功概率会很大?因为他的维度已经比较全面,训练过、经历过,也丰富过。
我觉得比较纯粹的学术和技术创业者,往往缺少很多维度。这些维度不是看书或者和别人聊几次就能立刻拥有的,你需要 grounding,需要 data,需要自己有手感,得有真机数据。
只靠仿真数据进行预训练,基本上没办法让这个模型完全成型。
李翔
对,就像人看书一样,看书有帮助,但不能只看书,还是要有真机数据。
回到公司管理,公司的管理主要涉及个人管理、制度形成,以及如何激励和管理团队。在大学里,管一个研究团队,或者管博士生、博士后、硕士生,和在公司里肯定不一样。
大学里管理的是不同方向、不同职能上具备不同技能和能力的人。按照刚才说的维度,这也是五个坑、五个变化吗?
张巍
组织是最核心的能力。组织能力反映了你对这件事的认知,也反映了你对相关人员的认知。
如果只是做科研,你只要了解什么人适合做科研,怎么激发他做科研,给他好的问题,这件事就结束了。
但如果要做好的商业化,你需要对所有商业环节都有相对清晰的理解,这是前提。你要理解这件事,同时也要理解人性、理解人。
组织的本质,在我看来就是人和事的 mapping。它就像我们选择神经网络架构一样,有各种范式的架构去做这个 mapping。
如果你对事情理解不对,对人的理解也不对,这个 mapping 大概率就会出问题。即使照抄别人的 mapping,也不一定完全适合你。
在这个过程中,你对事情的认知会影响你对整个组织的看法,选人的方式也会变化。我觉得这些都挺有意思。
李翔
事情完成以后回头看,比较容易说“有意思”,但过程中通常都是折腾和痛苦的。
在我们可见的、差不多四年的成长过程中,你们也经历了一些不同的组织结构和人员变动,肯定既有经验,也有教训。作为亲身经历者,在这些变化背后,或者在变化的过程中,你自己有哪些变化、成长,以及得到的经验和教训?
张巍
我们早期换过不少高管,很早就换过三四个。
后来你会发现,成长就是不要把自己看得太高。我觉得人员选择是双向选择。如果大家觉得不合适,就要及时说出来,把事情做好,这样会比较好。
所以现在我对这件事比较坦然。最近他们还在说张丽离职,其实那是去年的事。我们在去年年中就谈好了,她可能会把重心放在北京,逐渐淡化管理。但我们彼此还是认可对方,所以过程非常 peaceful,交接和过渡也很好,她后来还做了一段时间顾问。
这件事早就发生了,对我也没有什么大的影响。因为早期更换人的时候遇到过类似问题,当时非常痛苦。第一次、第二次经历都比较痛苦,也不好意思说出来。尤其是知识分子,尤其是老师,面子上过不去。
后来就比较坦然了。人才没有绝对的好坏,关键是是否适合,以及是否和当时公司的战略匹配。合适通常是双方的需求和能力匹配,也有时间跨度的问题。所谓合适,不一定是一辈子,也可能只是这一年或两年。
李翔
尤其是 AI 变化这么快,你聊到这里,我还可以多聊很久。
张巍
我觉得这方面有非常多的思考,也挺有意思。
我们希望组织变得有活力,多招一些年轻人,多招一些 AI 原生的人。至于什么叫“年轻”,我会打引号,我们有自己的一套理解。
不一定非要按照年龄来定义。大家说零零后、九零后做 AI,有百分之八九十的道理,但也有像我们这个年纪,年龄比较大却还有少年心、少年气的人。
没有暮气,对未来有热情,保持开放。我觉得这几个点可以定义所谓的“年轻”。
李翔
听起来,更多是心态和思维。
我觉得有一点不会错:人年轻时,很多东西确实是自然而然的,比如开放度。因为经验还没有那么多,也没有那么多固守的东西,想象力会很大。
张巍
我后来发现,最关键的一点是,开放心态的人其实很多,有激情的人也很多。但经验和资历对一个年纪大一点的人最大的限制,其实在于成就感。
有可能一个人以前管过几百亿的生意,让他现在做一百万规模的事情,他找不到成就感。但年轻人没做过这件事,就会很有动力。这种动力反而是年轻人特别独有的东西,很难重新找到。
尤其经历过很多事情以后,有些人会觉得“我也不 care 这件事了”,你很难再给他正向激励和成就感。
所以我们可以把年龄放开。我们所谓的“年轻”,包括开放,也包括经历,以及他的成就感来源是不是能够因为一件小事而高兴。
李翔
这确实是判断一个人是否年轻的很重要的体会。
我岔开问一个别的问题。我们也投了很多老师创业的公司。从老师的角度出来创业,在最开始的阶段,可能是半年、一年,也可能是两三年甚至更长,我们观察到一个比较普遍的现象:老师容易相对理想化,希望所有事情都像解科研问题一样,尽量一步到位。
比如缺一个 A 技能、A 职位的人,最好找到一个完全符合 A 的人放进去,从此以后这件事就 carefree 了,高枕无忧了。
张巍
我也经历过。我现在偶尔在一些不懂的方面,还是会有这种 wishful thinking,希望找到一个人,找到以后就不用管了。
李翔
但实际上你还是要兜底。
还有一个小挑战是,有些老师创业时,一上来就想找一个 CEO。这件事更不容易。我觉得这和老师自己的定位有关。
如果他只想做技术输出者、早期贡献者,找一个职业经理人,可能也行。但如果他是大股东,在业务还没有完成从零到一、商业模式还在摸索时,过早找一个职业经理人,就比较有挑战。
某种意义上,即使要找 CEO,也应该先找 COO。这样至少有一个可以观察、调整、配合、上升或下降的空间。如果一开始就把人放到 CEO 这个位置,后来发现不合适,调整空间就很小了。因为只要把 CEO 降职,他基本就待不下去了,CEO 再往上也没有别的职位。
且不说信任如何建立,在一个高速发展、还没有完成从零到一探索的赛道里,第一大股东就是 CEO。你不管他自己叫不叫 CEO,如果在他下面再叫另一个人 CEO,本质上在我看来有点自欺欺人。
但如果是成熟业务,比如开一家奶茶店,那找一个成熟的店长就无所谓了。
张巍
我刚才想解释的是,优秀的科研工作者习惯于解题,他们更希望在每个重要问题、每个岗位上都一步到位,从此高枕无忧。
李翔
但我不知道你是否同意,或者你是否也经历过:事实上,大部分情况下,一个既称职又起作用的人选,都是在过程中慢慢展现、变化、筛选出来的,而不是第一天就一步到位,成为那个样子。
张巍
从现象上看,确实大部分是慢慢发生的。
但本质上,我认为这是创始人或一号位对事情的认知问题。如果他非常清楚做成这件事需要 A、B、C、D、E,每一件事上的人需要具备哪些能力,并且能够把这些要求梳理清楚,那么他选对人、把事情做成的概率也会比较高。
不过一般来说,创业者不管从哪个角度出发,哪怕是成熟创业者再次创业,除去少数人,大部分人也不会把自己已经完全做成过的事情重做一遍。他总是要尝试一些没做过、但觉得自己能够做成的事情。
这里面总有至少 30% 到 40% 的事情,是想象或预测出来的,而不是过去做过的事情。所以总有 30% 到 40% 的内容需要探索,需要尝试,也需要付出代价。
李翔
听上去好受一点了。
张巍
即便是一路从商业中成长起来的 CEO,也会面对这个问题。比如有些 CEO 从小就在社会中成长起来,没有像我们一样在好的大学里、接受国外教育,但他的社会阅历和社会经历可能远比我们丰富。
他小时候在社会上经历过很多事情,可能各种被骗的方式都被人骗过一遍以上。理论上,他在可以试错的范围内可能都试过错了。但即便如此,他做熟悉的事情也总有不熟悉的过程。
哪怕再次做一模一样的事情,比如曾经做成过一家机器人企业,环境、竞争条件也不一样,仍然会遇到新的问题。我觉得这是几乎不可避免的。
李翔
只不过从老师的角度看,因为他更偏解题思路,也就是提出一个问题,就要找到一个正确、必然、不能被同行质疑的答案,所以更容易希望一步到位。
也就是你说的 wishful thinking,希望找到一个一步到位、从此高枕无忧的答案。
我总结了一点:人总会在自己不懂的领域里被魅惑,而且越容易不懂,越容易被魅惑。所谓被魅惑,就是特别希望别人能够解决这件事。其实正是因为你不懂,懂了以后就不会被魅惑。
老师容易被魅惑,或者被一些因素蛊惑着做出选择,本质上是因为他在整个商业里缺少的维度比较多。
当然,也有一些成熟企业家特别容易在技术和学术上被魅惑,有一种技术崇拜。真正懂的人一看,会发现这个人并不 work。
所以人最容易在自己最不擅长的领域被骗,或者说,人总是在最不擅长、又不想暴露自己不擅长的地方,寻找一个完美答案。但最后证明,即使不擅长,也需要先了解、先做判断,才能得到一个及格答案,更不用说完美答案。
张巍
对,这件事挺有意思。
李翔
最后作为结尾,作为一个经历了五年创业、担任五年 CEO,以及做了十五年以上研究工作的学者,你经历了行业不热、融资寒冬,也经历了过去至少两年的行业大热。
回过头去看这五年,有什么特别印象深刻的事情,或者今天最想描述、重新回顾时最重要的感受?
张巍
自己需要学的东西还是很多。这五年我觉得变化非常大。
每升高一个维度,或者每增加一个维度,我都不觉得自己已经完全掌握了。增加一个维度,往往是一个急速而痛苦的过程。痛苦之后会有一段享受,但还没等你享受完,新的挑战又来了。
你会发现自己还是有不足,有些事情没有考虑清楚,或者认知上还有欠缺。这是一个以最快速度认识自己缺陷,并在商业上迅速补充学习、不断迭代的过程。
整体来讲,你每分每秒都觉得有挑战、有压力,但回过头看,整个过程又是有成就感的,大概就是这样一种状态。
李翔
确实。最后作为一个结论,大家常说创业是一个修行的过程,因为它需要学习很多东西,接触很多不同的领域,掌握很多不同的打怪技能。
在原来岁月静好的研究生涯或其他专业生涯里,我们不需要那么多打怪技能。
我最大的一个体会,有时候和投资人说不太好,但从创业本身来讲,我最大的升级感受是,去年还是前年,我已经记不清了,我突然意识到,一家创业公司是可以死的。
张巍
对。
李翔
我不知道以前有没有和你说过。我觉得这是我最大的一个升维。我觉得“输不起就赢不了”,必须能够接受一件事情是可以失败的。
认识到这一点,对我来说是突然发生的。很多人可能听不明白,也不理解,但这是我的真实感受:这可能和你刚才说的,把自我变小一点有关。
或者说,ego 太大以后,就不能接受失败;ego 小一点,就可以接受一件事情失败。说白了,就是不要把自己看得过于重要。把自己看得过于重要,就不能接受自己失败,或者不能接受别人眼中的自己失败。
把 ego 放小一点,就可以接受事情失败。总想一定要赢,很多时候反而适得其反,也很难从容地做决定,更看不到很多东西。
接受一件事情可以失败,接受一家公司甚至可以死,我个人觉得这是最大的成长。没有之一。如果要给自己的创业路程打一个 mark,我不知道是在第三年还是第四年,我在挣扎中发现了这件事,然后觉得很开心。
或者说,把底线往前推,就能把上限往前推。“输不起就没法赢”,没法赢。
张巍
好。
李翔
感谢大家耐心听完这些技术性、同时也很有意思的讨论。谢谢张巍老师。
张巍
谢谢翔叔。