张小珺
我们今天来做一轮 long context 长文本对话。假设你是一个大模型,你现在能支持的上下文窗口有多大?你看,Google 和 OpenAI 现在都能支持一百万个 token,那你呢?
李想
我觉得人类的整个生理特点,和人工智能是有本质差别的。人类并不擅长处理特别复杂的信息,所以我们经常讲,人类要做熵减,而不要去做熵增。
人工智能非常擅长处理足够大的信息,包括今天预训练的规模。这个数据规模已经不是 15T 了,现在已经开始有 30T 的了,包括最新的 Llama 4。所以我说,这是一个本质的差异。
从这个角度而言,包括人类发明方法论、人类使用各种工具,都是为了减少能量的消耗,因为大脑也要消耗能量。人类应该和 AI 保持非常好的、友好的关系,各自做各自擅长的事情。
张小珺
总体来说,你是觉得人不像模型?
李想
人可能像一个更小的模型。我们去读很多书、学习很多知识,某种程度上也像是预训练。我们把这些知识变成业务去做,本身也像推理,并通过推理去调用各种工具,然后去实现。
我觉得人类可能像一个更小的模型,而且上完了不同专业的学习之后,不同的人进入了不同的领域,所以它不是一个巨大的基座大模型。今天的人工智能也是一样的,处理一些通用信息还很好,但一到专业领域里,很多时候就明显不如人。
因为这个领域需要更高质量的数据,也需要更专业的 CoT。我觉得这些都是接下来人工智能发展的挑战和价值所在。
张小珺
距离上次的 AI Talk 过去了 130 天,你最大的进步是什么?你有成为一个更智能的李想吗?
李想
这 130 天,我更高兴看到的是整个中国的进步。我觉得包括 DeepSeek、千问在内,中国无论是基座模型、推理模型,还是后边的多模态,已经跟美国的距离基本上拉近了,或者基本上在一个水平线上了。
而且,中国企业做出来的这些模型效率也更高,无论是在训练层面,还是在后边的整个推理层面,都做了很多深层的工程改造。这也让整个中国的人工智能领域更有信心。
后边我也看到了一些在 Agent 上面的突破,无论是 Manus 还是 Genspark,我觉得这些方面做得都非常好。这让我们非常惊喜,也树立了我们把 AI 做得更好的信心。
今天大家都在讲语言模型,但我仍然认为,语言模型只是世界的一个重要组成部分,并不是全部。我们要想理解物理世界,让一个终端或者一个机器人能够在物理世界和数字世界里运行,要做的工作还有非常多。我更加坚信,这条路走下去是对的。
张小珺
那你有变成一个更智能的李想吗?
李想
我没有那么大的变化。如果从实际角度而言,人工智能发展得这么好,但我每天的工作时间并没有减少,还是在增加。
张小珺
这是为什么?
李想
身边所有的同事、朋友,大家都在讲人工智能怎么好,但是大家的工作时间并没有减少,工作成果也基本上没有实质性的改善。我觉得这也是我们需要思考的一个问题。
今天这种 Chatbot 或者对话方式,包括后来大家普遍把 reasoning、推理都用上以后,能够做一些更长链条的思考和推理任务,但你也能看到它有一个严重的问题:大部分人使用它,或者说我见到的几乎所有人使用它,还是把它当成一个信息工具。
如果是信息工具,AI 作为信息工具并不完美,因为它最后一定要给你一个 next token,一定要给你一个结果。而且大家今天使用的时候,会先点上联网搜索,通过 RAG 做联网搜索,找一些索引信息,但往往索引的信息源就已经失真和不准确了。
所以最后推理的过程很认真,但你明显能看到,这个过程和结果已经开始有问题了。某种程度而言,如果不对这套机制进行改造,它其实是在做熵增,在增加大量无效信息、无效结果和无效结论。这个世界上充满了幻觉,遍布着有幻觉的信息。
你看,DeepSeek 刚推出的时候,很多人会把 DeepSeek 的推理过程转成图片发在小红书上,很多人去看。但今天没人发这些东西了,因为发了也没人看,都是千篇一律的。我觉得这是一个很大的挑战。
所以我一直在思考一个问题:如果大家在拼命使用 AI,大家在 AI 上做投资,但我的工作时长并没有减少,工作结果也没有变好,那问题到底在哪里?这是过去几个月我跟很多人交流、思考,以及我们内部讨论非常多的一个问题。
很多时候不要把东西缠绕到一起,我们可以先做一个分类。今天无论文本多么长,通过对话的方式完成的,其实都是一个信息工具。信息工具对大家而言更重要的是参考作用。
你拿它给出的股票投资结论、职业生涯决策结论或者工作结论,真正工作的时候,每天八小时还是会优先完成公司给你的 KPI、OKR。如果这些东西没有改变,其他东西并没有改变你的工作效率和工作成果,只是给了一个建议,在脑子里空转了一圈。
这是信息工具的状况。再往下,AI 变好了以后,它会变成一些辅助工具。比如我们今天做的辅助驾驶,大家在车上用人工智能语音导航、查找美团、调取音乐,它会让我们的效率更高,但仍然离不开我们。这种角色更像是辅助工具,它确实比原来的使用体验更好,但仍然是辅助工具。
什么时候才能真正改善我们的工作成果以及减少工作时长?我觉得它必须变成生产工具。我自己认为,Agent 最重要的评判条件就是它是否是一个生产工具:它是否真正能替代我去完成专业的工作,是否真的在产生有效的生产力,或者是否真的在解决我工作中最重要的八小时。
这就是我认为接下来对 Agent 最重要的衡量,也是 Agent 的意义所在。
张小珺
这是你对于工具的三个分级:信息工具、辅助工具和生产工具。
李想
对。我觉得人工智能变成生产工具,才是真正人工智能爆发的时刻。
张小珺
我也有这种感觉。AI 来了以后越来越卷,大家的时间全部都在加班。你觉得到今天为止,没有任何一个 AI 产品满足成为生产工具的基础条件,对吗?有没有一两个产品已经挨上生产工具的边了?
李想
我经常问我们的同事:一个信息工具,往往你并不愿意付钱;一个辅助工具,你认为是一个产品应该带的,因为辅助工具只是提升现有产品的竞争力。生产工具一个很重要的衡量特点,就是你愿意为它付钱,我觉得这才是生产工具。
目前我从同事身边听到的、真正有效的,他们认为算是初级生产工具的,一个是 Cursor,另一个是 OpenAI 的 Deep Research。Cursor 主要是我们的编程同事在使用,Deep Research 是我们的商业分析和战略团队在使用,而且他们是自己付费,并没有花公司的钱。
张小珺
为什么到今天所有的 AI 产品还没有成为生产工具?你觉得是因为智能水平不够吗?
李想
生产工具的要素是什么?怎么样能够成为生产工具?我认为必须有 action,不能只是知,必须行,知行合一才可以。
今天你用 o2、o3 多么聪明,用 DeepSeek R1 多么聪明,但它并没有真正去行动,它只是给出策略并做策略推演。我工作的时候,还是要通过操作电脑去处理很多工作,或者通过物理世界的东西去处理工作。所以它必须得有行动,行动才能产生价值。
Manus 就已经在行动上做了很多工作。自动驾驶也是控制一个机器在物理世界里行动。我觉得必须能够行动,才可以。
张小珺
你怎么看 Manus 这个产品?
李想
我觉得它是往生产工具走的。从整个产品创意而言,它是往生产工具走的最大一步。
包括他们通过建立虚拟机、调用工具来完成工作。至少很长一段时间,所有模型公司都认为不需要软件、不需要工具,最后模型都能够替代掉。但我拿人举个例子:你比我聪明 10 倍,然后你拿勺挖一个坑,我拿铲子去挖一个坑。我再笨,效率都比你高。
我要是比你聪明 10 倍,我不会拿手去挖。但是因为你没有工具,而工具意味着更高的确定性、更低的能量和 token 消耗。更好的大脑和更好的工具并不冲突,而且由于脑子变强,工具可以变得更强。
Manus 从调用工具的角度完成各种工作,比如分析特斯拉股票,浏览 SEC 网站,浏览特斯拉投资者关系网站,直接阅读顶级投行关注特斯拉的分析师报告,而不是简单通过 RAG 做信息索引。我觉得这更像真正的专业工作人员和生产工具要做的方式。
只是它作为一个通用 Agent,覆盖的面太广,这就是一个很大的挑战。
张小珺
为什么这样的 Agent 可能是一个创业公司做出来的,你有想过吗?
李想
我的感觉是,在一个新技术产生的时候,反而会造成过去的大公司,或者创业公司里的大公司,把分工分得太精细了。但往往一个好的产品,是多个东西的组合。
如果模型公司认为自己只要做好模型,用模型解决一切问题,那就会变成非常大的挑战。
张小珺
刚才我们聊的是过去 130 天理想的进步,你回答了我很多关于你的最新思考。那你觉得过去 130 天里,理想这家公司最大的进步是什么?它有成为一个更智能的组织吗?
李想
我们没有那么快的变化。刚才讲的其实是一些重要突破,但我们作为一个 3 万多人的企业,如果想发生很多重要变化,还是要围绕真正的用户价值去产生变化。不能只是说技术发生了一些变化,我就去改变组织。
我自己来看所有变化之间的关系,第一会把规模放到中心,因为规模是确定性的。我要做 1000 亿收入,还是做 2000 亿收入,这是确定的。
围绕这个规模,外边有 3 个动态变量:用户需求会发生什么变化,技术和产品会发生什么变化,以及组织会发生什么变化。这 3 个变量之间会相互诊断。
如果只是技术和产品发生变化,但用户需求没有变化,我不会马上调整组织。很多时候,是当我看到用户需求发生变化,产品技术的变化又和用户需求变化产生结合时,组织变化才必须跟上。
不能因为今天出了一个东西就调整一下,明天出了一个东西再调整一下,这肯定有问题。过去 130 天,最大的变化是外部环境。国际环境在发生重大变化,技术也在发生变化,但技术最大的变化还是中国带来的变化,是中国在人工智能方面带来的变化。美国的变化反而没有那么大。
张小珺
你从 DeepSeek 身上学到了什么?
李想
我从 DeepSeek 学到的最好的方式,是它运用了人类的最佳实践,而且极简地运用了人类的最佳实践。
比如 DeepSeek V3 是一个 MoE 的 6710 亿参数模型。我觉得 MoE 是非常好的架构,相当于把一堆专家组合在一起,每一个专家有一种专家能力。
当我们想构建能力时,DeepSeek 展示了一个最佳实践。第一步一定要先搞研究,这是非常重要的。任何时候,当我们想改变能力、提升能力,第一步一定是搞研究;研究完成以后才是研发。
搞完研发以后,第三步是把能力表达出来;第四步是把能力变成业务价值。这 4 个步骤是人类最佳实践的极简版本,但我们经常做着做着就忘掉了。看到什么东西就直接启动研发,不去做研究。
我们自己也非常受益。无论是在端到端和 VLM 上,还是今天做 VLA,我们的研究团队表现都非常好。国外像李飞飞,也经常引用我们在自动驾驶方面的研究论文。
研究跑通以后,研发效率会变得非常高。但研发又非常在意价值,要能够把价值表达出来,然后变成业务。这是一个很重要的过程。
比如大家使用我们的端到端,我们是端到端领域里唯一能够展示端到端是怎么工作的企业。端到端怎么取轨迹,端到端的 attention 怎么工作,VLM 怎么工作,这本身就是能力的展示,能让使用者和所有参与者理解。
这也是交互和产品。它是技术才能实现的,今天有模型以后才能实现,并不是简单产品能够实现的。我觉得这是 DeepSeek V3 做得好的一点。
DeepSeek R1 又遵循了另外一个最佳实践。它是 reasoning,说白了其实就是业务。业务没有用户就不是业务。
从它的思维链来看,它又遵循了人类业务的极简最佳实践。第一步是做索引分析,用户给你一个需求,先做索引分析。第二步是确定目标,因为用户很多时候给的是提示和方向,并不会给出直接目标,所以它分析完以后要制定接下来推理的目标。
第三步是输出策略。当然,作为一个 reasoning 模型,它的策略本身也就是推演的执行。第四步是反思,看最后的结果和目标之间有什么差异。
这方面它和人做得非常像。人做一个面向客户、面向用户的业务,也要先做用户和市场分析,再针对用户确定目标,然后制定策略并及时执行,最后进行复盘。它特别好地做了一个最佳实践。
如果有问题,就继续复盘、改正。如果是业绩差距,就增加分析、调整策略;如果是能力差距,就改善能力,继续走研究的路径。因为很多时候能力不够,硬推着去做业务也做不到。
但我要打个问号,它并不是完整的知行合一,因为它把行动的策略给出来了,却没有真正去做 action,比如控制一台机器,或者控制一台电脑去操作软件。
但某种程度上,它是一个非常好的执行知行合一的脑系统。我觉得这是特别好的一点。它其实就是人类最佳实践,只不过人类经常做着做着就忘记最佳实践了。
我们想拉动一群人一起推进业务,却是一个人在做分析、一个人在制定目标,然后逼着大家去执行。当发现目标不对时,又不做复盘、不做分析、不重新设定目标,直接改策略,所有参与者都会问:到底发生了什么?
人类反而经常没有遵循自己的最佳实践。包括构建能力时,到底是应该改善能力解决问题,还是改善策略解决问题?人类今天很多时候很忙、很辛苦,却分不清到底要解决哪些问题。我觉得 DeepSeek 做得特别棒。
张小珺
刚才我们聊了人类最佳实践的步骤,你觉得你们最容易 miss 掉的是哪个?最容易忘记的是哪个?
李想
在构建能力时,大家比较容易一上来就搞研发,既不做研究,研发完以后也不做能力展示,更不真正面对市场实战,就认为自己研发完了,拥有了一切。
在业务上,最大的麻烦是大家遇到问题只想改策略,不做复盘,不做用户和市场分析,也不一起来确定目标。每个人都想自己决定:我自己决定研发,我自己决定策略,就可以了。我觉得这是最大的问题。
张小珺
严格按照最佳实践,其实是反人性的。
李想
对。随心所欲才是满足人性的。所以一个好的组织、一个卓越的组织,以及一个卓越的人,很多时候都要跟人性做对抗。
张小珺
那你应该怎么把这个方法论贯彻下去呢?
李想
我们从创业初期就比较擅长使用和学习方法论。最开始围绕用户需求,为了让大家统一,我们建立了四步法:用户需求、我们的需求、目标和策略。其实和这个很类似。
当我看到 DeepSeek 背后隐藏的这套人类最佳实践时,我特别高兴,而且它比我们原来做的更完善。比如它不会直接从用户切入,而是先做分析。
如果做业务,必须先做分析;如果做能力,它更加确定了我们过去很多年做各种研究是对的。我们做操作系统是在做研究,做芯片是在做研究,而且做了非常深入的研究工作。做端到端和 VLM,包括今天做 VLA,也做了非常多的研究工作。
大家可以看到很多论文,包括机器人领域。大家在讲空间智能时,各个行业的大咖也在引用我们的论文。研究工作做好以后,再做研发就会更加顺利。
研发完成以后还要表达能力。比如你看到我们的车的端到端和 VLM,我们是少有的能够把人工智能怎么工作的讲明白的企业:端到端怎么从感知到轨迹选择,attention 系统怎么工作,VLM 怎么利用语义理解 ETC、红绿灯和复杂路况。
这是非常重要的能力展示。然后这个能力最后还要变成真正的业务结果,参与业务、参与作战。我们自己做着做着也经常会偏离最佳实践,但只有坚守最佳实践,才能构建最好的能力;只有坚守最佳实践,才能以用户为中心,构建最好的业务。
张小珺
你怎么看梁文锋?你觉得他是怎么找到你说的这个人类最佳实践的?
李想
我只跟他聊过一次,是去年的 9 月,印象特别深,应该是 ChatGPT 的 o1 发布前几天。
我个人感觉有两个特点。第一,他是一个特别自律的人,这一点在沟通过程中能够明显看到。第二,我认为他会在全世界范围内研究和学习最佳实践和最好的方法论。
张小珺
怎么理解自律?
李想
自律最大的特点,就是能够坚守自己相信的东西,能够坚守最佳实践,能够和人性的懒惰、走捷径做对抗。
这是我的判断,也正是如此,反而让我更加敬佩他。
包括我们的开源,我觉得 DeepSeek 的出现对我们加速做 VLA 帮助巨大。过去我们原本计划到今年年底,才能做出一个像样的、满足需求的语言模型;DeepSeek 开源以后,整个进度加速了 9 个月,给我们带来了巨大的收益和帮助。
所以我们在想,能对社会做点什么贡献,最后就把操作系统也开源了。没有大家想得那么复杂。我和谢炎内心的想法就是:DeepSeek 给我们带来这么大的帮助,我们应该为社会贡献点什么。
张小珺
这是一个几天内做出的决定?
李想
很快。我们在做 2024 年业务总结会时,操作系统团队讲了操作系统目前所有的进展,包括能力、性能,和 AUTOSAR、QNX 的对比,也包括成本节省,以及对各种国产芯片的支持。
这些团队在做工作总结时,已经把能力讲得很清楚了。过去他们并不会讲能力。我们又从最佳实践和方法论上学到了很多东西,又受益于 DeepSeek 语言和推理模型的开源,所以我们有了这些能力。这些能力又涉及到安全的问题。
既然我们占了这么大的便宜,节省了 9 个月,大概节省了几亿元的成本,那我们能不能为整个行业做一些贡献,不要让行业一直这么卷?说白了,纯粹是感谢 DeepSeek。这是一种情怀,而不是公司战略。
张小珺
DeepSeek 感觉带来了更多善良和善意。
李想
是的。
张小珺
那你觉得他们应该接住这一波流量吗?我想问的是,这一波 AI 产品的护城河是什么?用户数据量能带来护城河吗?DeepSeek 在春节时已经拥有了很高的 DAU。
李想
我只能讲我的理解。他们的卡是有限的,如果把卡都用来做推理,怎么做训练,怎么提升能力?
我觉得今天距离我们想象中的通用人工智能还很远。所以他们只保留一部分卡来获取一定量的用户,因为这些用户的 query 对他们有帮助。但用户太多也没有意义,他们保留更多卡和资源,继续提升能力。我觉得他们看得更远。
张小珺
你有没有想过,DeepSeek 为什么不是你做的?
李想
我只能做最好的自己。他的延长线是从人工智能开始的,因为他在浙大就学人工智能,那是他的延长线。
我也相信,量化交易公司对于模型能力的理解,以及后边的工程能力,不会比任何互联网公司差,甚至可能更强。
张小珺
DeepSeek 全球爆火的时候,你这个春节是怎么过的?
李想
春节过得挺好,还带孩子去看了《哪吒 2》。
我印象里应该是 1 月 20 日,DeepSeek R1 上线并开源。我们也在研究 DeepSeek 为什么做得好,包括训练和推理效率、MoE 模型部署,以及部署后对内存占用的挑战。
我们自己也已经开始在芯片上写 FP8 的工程优化。因为我们有编译团队,所以比较有意思的一点是,我没有一上来就跟模型团队聊,而是先跟谢炎聊。
我说,我们本身要做 VLA,一个重要计划是到今年 9 月做出非常好的语言模型,才能继续训练 VLA。但按照今天的预测,我们到 9 月做出的模型能力,是否会比 DeepSeek V3 加 R1 更强?至少听你们说的东西,我觉得不如它强。
而且它开源得如此彻底,我们是否应该基于它的开源,做我们的 VLA 的 L 部分?比如理想同学使用的可能是 VL,没有 A,把 vision 和 language 放在一起,包括做成端到端语音的方式。
原本这些工作我们 9 月以后才能做,但我们是否应该站在巨人的肩膀上去做?谢炎说,肯定应该这么做。
当时我们比较担心陈伟会怎么想,因为压力是挺大的。但我们发现陈伟比我们还坚决。他说,这会加速我们往下一步的工作,应该以这个为基础,加速 VLA 和端到端多模态的进展。
研究团队也在同步研究,如何让芯片跑出同样的训练和推理效率。拥抱 DeepSeek 的过程比我们想象中快,所以今天 VLA 推出的速度也会比原来的预期更快。
张小珺
为什么让陈伟向 CTO 汇报?他的汇报关系改变,是 DeepSeek 出来之后的变化,对吧?
李想
对。因为这时候我们意识到,我们会有 3 类不同的重要业务。
第一类是内部办公等业务,它比较需要 language,可能是 language 加 Agent OS 的方式来实现,需要基座模型。
第二类是理想同学,无论车机版还是手机版,它需要多模态,要能看到物理世界,还有实时语音,所以应该是端到端的 VL。
第三类是自动驾驶和工厂机器人,它们应该是 VLA。
这 3 类是不同的。今天千问团队、OpenAI 团队也是一样,它会做多模态、推理和基座。我们也需要有不同的团队,为不同业务做出适配的模型。
张小珺
你为什么一开始不敢跟模型团队聊?后来是怎么聊的?你开口第一句话是什么?
李想
让大家用别人的开源,需要一个心理建设的过程。开源程度基本接近 Linux,比 Android 开放得多。
Android 也是基于 Linux 开发出来的,有自己的组件和 API。我们可以基于这个 language 开发语言模型,再加上 Agent OS 给自己工作使用,做成多模态,并调用各种 API 服务,甚至控制机器人。这很像基于 Linux 开发出了 Android,或者在各个专业领域开发操作系统。
这就是我用来劝说大家的方式,但其实大家拥抱得很快。
张小珺
这是春节后做的第一个决定?
李想
春节期间就做了决定,上班之前就决定了。应该是 1 月底,我和谢炎打的电话最多。我们还有一个专门的人工智能战略小组,不停地在里面讨论。大家并不纠结,我们企业的基因还是要为用户推出最好的产品和服务。
春节之后,很多人问我:理想还做基座模型吗?既然都有 DeepSeek 了,为什么还要做基座模型?
因为我们的业务意味着,做好语言模型还不够。车上要有对话和多模态,仍然需要根据我们自身需求训练一个基座模型。包括做 VLA,哪怕 V 和 L 都不同于普通模型,还需要 3D vision、高清 2D vision 的 token,还需要更专业的汽车领域、交通领域、家庭用户语义语料。
另外,很多人在做 VLA 训练时,会把 VL 连在一起,把 VL 的组合语料放进去。但无论 OpenAI 还是 DeepSeek,都没有这样的数据、场景和需求,也不会解决这样的问题,只能我们自己做。
好处是,在 VLA 里,L 的部分可以站在巨人的肩膀上,但它只是其中一部分。
张小珺
所以一方面拥抱了 DeepSeek,另一方面你们把基座模型团队拆出去,并且加大了投入,是吗?加大了多大?
李想
首先训练卡,比今年原来的预期多买了 3 倍。
张小珺
你要训练多大的模型?
李想
不是固定的,会有不同版本。给理想同学用的,会是一个 300B 的模型,大概是 3000 亿参数。给自动驾驶使用的 VLA,VL 的部分是 32B 的模型。真正工作中也会用 300B 的模型,大概是这两个版本。
张小珺
你现在觉得给基座模型打多少分?希望 2025 年提升到多少?
李想
结果还没呈现,现在才几月,没有什么捷径。虽然我们借用了一些能力,但没有办法直接摘第十个包子。
如果规则算法都做不好,根本不知道怎么做端到端;如果端到端没有做到极致,也不知道 VLA 怎么训练。前面的每一步都必须走。
张小珺
接下来聊理想同学。你现在对于理想同学这个 App 的定义发生变化了吗?去年我们 AI Talk 的时候,刚好宣布要把理想同学这个 App 推出来。
李想
DeepSeek 太强了,而且借助 DeepSeek 推流量的产品,比如腾讯元宝,也很强。它们有流量,所以我对团队讲,现阶段不要做任何推广、营销。现阶段更重要的是锻炼能力、把握用户需求。
我们今天有 3 个版本。车机上有理想同学,它既是 AI 的信息工具,也是辅助工具;手机上有理想同学 App,目前还是纯粹的信息工具;未来电脑上也可以使用,还有网页版的理想同学。
我们先把这 3 个版本做好,让自己 120 多万用户在需要使用时可以连接起来,大概是这样的状况。
张小珺
今年 2 月 5 日,也就是春节之后你们第一个 AI 例会,你说 DeepSeek 更像 Linux 推出,而你们要去追逐 Android 时刻。你们准备怎么争夺 Android 时刻?
李想
这是一个比喻。Android 相当于基于 Linux 开发出来的手机操作系统。有了语言作为基础,我们的 VLA 就是把 vision 做到最强,把 action 做好,并借助 language 的能力。
VLA 更像是在汽车或者交通领域里的一个大模型或者操作系统,这是我们的机会所在。
张小珺
我今天很想把你当作一个 CEO 大模型。大模型有 MoE 架构,E 就是专家。我们先来调动技术专家,聊聊你们最近在做的 VLA 架构。
今天的智能驾驶走到了一个新的十字路口,有的人甚至觉得智能驾驶应该被叫停,你怎么想?
李想
我们这么多年从规则算法做到端到端加 VLM,今天又真正迈入 VLA 阶段,我觉得比较像黎明前的黑暗。黎明马上就要来了,但会先经历一个黑暗的过程。之所以有黑暗,是因为要迎来黎明。
正因为智能驾驶行业遇到了问题,所以我最喜欢、最开心的方式,就是去解决行业解决不了的问题。这和我们推出增程一样,是为了解决电池成本高、充电难的问题;推出 5C,是为了解决充电慢、等待时间长的问题。
我们愿意解决行业遇到的各种问题。做操作系统,也是因为传统车控和智控操作系统性能差、开发缓慢、芯片匹配周期长。这些问题恰恰是我们的价值所在。
张小珺
为什么人类一定需要智能驾驶?为什么科技不能就此止步?
李想
只要人类会雇佣司机,人工智能技术就可以把类似的功能和角色变成真正的生产力、生产工具,去进行替代。
张小珺
什么是 VLA?从用户语言来讲,不要用技术语言。
李想
机器人领域也在讲 VLA。对于理想汽车而言,VLA 是一个司机大模型,是能够像人类司机一样工作的模型。
VLA 不是突变,而是一个进化过程,经历了 3 个阶段。
第一个阶段,从 2011 年开始,通过机器学习感知,配合规划、控制、执行等规则算法,是分段式的。这个阶段比较像昆虫动物的智能,有既定规则,还依赖高精地图,比较像蚂蚁行动和完成任务的方式。
它能理解的世界非常有限,效率也比较低。它的模型规模大概只有几百万参数,相当于一个很小的脑子。你让它完成复杂的事情几乎不可能,所以只能不断限定,最后几乎做成有轨交通的方式,和蚂蚁非常相似。
第二个阶段,是我们从 2023 年开始研究、2024 年推出的端到端。端到端比较像哺乳动物的智能,比如马戏团里的动物向人类学习骑自行车。
它学习了人类的行为,学习人类怎样开车,但并不理解物理世界。它只是看到一个三维图像,知道自身速度,然后给出一个轨迹,所以应付大部分泛化没有问题。但面对从来没有学到的、特别复杂的情况,就会遇到问题。
所以我们会配合视觉语言模型,也就是 VLM。但我们使用的开源视觉语言模型,在交通上的能力非常有限,只能起到有限的辅助作用。这是第二个阶段,动物的、哺乳动物智能的运作方式。
到了 VLA,我觉得就是完全人类的运作方式。它会像人类一样,用 3D vision 和 2D vision 的组合去看真实物理世界,也能够看懂导航软件是怎么运行的,而不是像 VLM 那样只能看懂一张图片。
另一方面,它有自己的脑系统,不只是看到物理世界,还能够理解物理世界。它有 language 部分,有 CoT,有推理能力。
第三,它能够像人类一样真正执行行动。放在汽车的智能驾驶领域,我们把它称为 VLA 司机大模型。
李想
如果你感兴趣的话,我给你大概讲一下 VLA 是怎么训的。
张小珺
好啊,VLA 是怎么训练出来的,以及 VLA 自己怎么去工作的?因为确实我听了你很多期,大家都在讲 VLA,但是我觉得大家讲得并不清楚,尤其到后边训练的时候,大家就一带而过,往往只是引用一些论文。那我觉得你们是真正在干这事儿的,而且你们有足够多的语料,你可以讲讲 VLA 这三个字的关系是什么,以及怎么训练的?
李想
我还是讲怎么训练,并把它们之间的关系表达清楚。
第一个是训练环节。训练的第一部分,是先训练一个 VL 的基座,也就是 vision 和 language 的基座。我们目前训练的版本是一个 32B,也就是 320 亿参数的云端基座模型。
它和过去语言模型的差异,首先在于要放入更多 vision 语料,也就是 vision token。vision 包含两个部分:一部分是 3D vision,对物理世界的 3D 视觉要放进去;第二部分是高清 2D vision。
今天很多开源多模态 VLM 的 2D vision 清晰度太低,看的距离不够。我们放进去以后,距离基本提升了 3 到 5 倍,这非常重要。
第二,要放入足够多的、和交通及驾驶相关的 language 语料。第三,还有一个容易被忽略的部分,必须放入很多 VL 联合语料,也就是图像、三维图像,以及对世界的理解语义同时产生。
比如我要把导航地图和车辆对导航地图的理解一起放进去。
张小珺
这是原始数据吗?
李想
没有,这是我们自己产生的,所以我们才有。比如看到导航以后,人类做了什么判断,车辆是怎么记录的,我们把这些语料放进去。
所以 VL 基座模型训练包含 3 个部分:vision 数据、language 数据,以及 VL 联合数据。然后我要把这个基座模型蒸馏成一个 3.2B 的端侧模型,保证运行速度足够快,能够在两颗 Orin X 或者 Thor-U 上流畅运行。
我们蒸馏下来的是一个由 8 个专家组成的 MoE 模型。如果直接运行一个完整的 3.2B 模型,双 Orin X 和 Thor-U 的帧率达不到,token 输出率也达不到。
这就是第一步,预训练环节。
张小珺
预训练相当于什么?
李想
预训练相当于学习人类知识,先学习人类如何理解物理世界、如何看物理世界。
张小珺
蒸馏前是 32B,对吧?
李想
蒸馏前是云端 32B。后边我还会讲,云端 32B 仍然会继续使用,并不是蒸馏完以后,基座就放在那里了。
第二步是后训练。后训练要把它变成 VLA,把 action 放进去。这仍然是一种模仿学习,很像去驾校学开车。
相当于把 VL 组合成一个 VL 到 action 的端到端方式。这个时候模型规模会从 3.2B 扩大到接近 4B。
它一方面是一个 VLM,能够从视觉到理解,再到最后输出。但我们的 CoT 会很短,一般只有两到 3 步,不会做超长 CoT,因为延时太长,无法满足交通或者机器人的安全需求。
action 完成以后,还会做 diffusion 预测,预测接下来几秒会发生什么场景。这主要根据性能,做 4 到 8 秒的 diffusion 轨迹和环境预测。
这就是第二部分,比较像人去驾校学习开车。
第三部分是强化训练。人到了社会上开车,所以强化训练分成两部分。
第一部分是 RLHF,也就是带有人类反馈的强化学习。我们有很多人类数据:当模型做出某种行为时,人类会接管;当模型做出另一种行为时,人类不会接管;还包括人类的一些驾驶习惯。
这部分用来做人的反馈和强化训练,安全对齐也在这个环节完成。除了遵守交通规则,还要遵守中国人的驾驶习惯,让你的驾驶习惯融入社会。首先要开得和社会环境中的大家一样好,不能给别人带来麻烦,不能像新手司机一样成为道路阻碍。
第二部分是纯 RL。我们使用世界模型生成的数据来训练,目的是开得比人类更好。这部分不给人类反馈,只给结果:从 A 点到 B 点开过去。
中间有 3 类训练要求。第一,通过 G 值判断舒适性,给舒适性反馈;第二,碰撞反馈,发生碰撞就没有完成强化;第三,交通规则反馈,违反交通规则也没有完成。
所以就是舒适、交通规则和碰撞事故,让模型自己完成整个强化训练。
这 3 个步骤完成以后,能够跑在车端的 VLA 模型就产生了。整个过程和人非常像:先学习世界、交通和人类知识,这是预训练;然后去驾校认真学开车,这是后训练;最后到社会上开车,通过 RLHF 和人类对齐、和社会环境对齐,再通过纯 RL 和世界模型生成的数据,让它开得比人类更好,解决更复杂的问题。
这还没有完。有了 VLA 以后,人类怎么和 VLA 工作,还要搭建一个司机 Agent。
司机 Agent 由人类用自然语言与它交流。你怎么和一个司机说话,怎么和一个正常驾驶员说话,怎么和代驾说话,就怎么和司机 Agent 说话。假设你有男朋友,你男朋友在开车,你怎么跟他说,就怎么跟司机 Agent 说。
短指令会由 VLA 直接处理,不需要经过云端。复杂的长指令,则先到云端 32B 的 VL 模型那里处理,因为它理解交通的一切,再交给 VLA 执行。
最后的好处是,它能够像人一样理解物理世界,像人类司机一样开车,处理复杂问题,也能像人类司机一样和其他人类沟通。这是最终交付给用户的产品。
张小珺
这些步骤里,哪一个最难?
李想
没法预测。因为前面没有任何人走过这条路。DeepSeek 没走过,OpenAI 没走过,Google、Vivo 也没走过。我们走的是一片无人区。
张小珺
那你们为什么押注这条路?我最近做了一个技术播客,讲 VLA,感觉这条技术路线还没有收敛。为什么你们觉得自己可以做?
李想
我觉得交通领域应该是 VLA 最早实现的领域。
第一,规则清楚。做强化相对容易,交通世界里车会跑到哪里,虽然很复杂,但具备确定性。车不能开到水里,也不能开到空中,只能开到有路的地方,所以它是复杂但确定的。
第二,车的控制自由度比较少。车的左右是一个自由度,前后是一个自由度,某种程度上还有轻微旋转这一个自由度。自动驾驶最多控制两个多,撑死 3 个自由度。如果这个都不能实现,机器人一上来就是 40 多个自由度,挑战更大。
所以在车上进行模仿学习特别容易。车看到的是人能看到的,人的操作就是车的操作。
第三,它还能做很好的强化学习。用户使用过程中不满意就接管,这就是没有和人类对齐,告诉你不应该这么做,以及应该怎么做。什么是舒适、什么符合交通规则、是否发生碰撞,都能表达出来。
如果它很舒适、不违反交通规则、不发生碰撞,并且能从 A 点到 B 点,它就会越来越好。我觉得交通是最好的 VLA 第一个重要实验场。
张小珺
我听你说,有一个感受:刚开始大模型火的时候,大家都说创业做 AI 是造人,你们这个其实就是在造司机。
李想
对。我一个很重要的感觉是,只有让它变成真正的司机,它才是生产力工具,而不只是辅助工具。
今天 L2、L2+ 是辅助工具,还需要人大量参与。如果想变成生产工具,我个人认为不会出现一个通用 Agent,而是每个专业领域做专业 Agent。
要想开好车,所有 vision 语料、language 语料和 action 都不一样。你想做好一个医生、律师,背后的思维链和所有数据也完全不同。
而且如果想变成生产工具,就要和专业的人比较:是否比专业司机开得更好,是否比专业医生表现得更好,是否比专业律师表现得更好,是否比专业程序员表现得更好。
因为它会影响一个人的生产、业绩、工作结果,甚至财产和生命安全。所以我们必须非常耐心、深入地解决问题。哪怕是司机这样一个问题,也不可能通过一个泛化的大基座模型或者大语言模型直接实现。
张小珺
为什么通用 Agent 不如专业 Agent?在你看来,我们需要通用 Agent 吗?
李想
我觉得可以给通用 Agent 换个描述方式。通用 Agent 更好的描述应该是 Agent OS。
我觉得 5 年之内不会有通用 Agent,但会有一个 Agent OS,方便各个专业的人在 Agent OS 上开发自己需要的 Agent。我觉得这反而是需要的。
张小珺
所以 Agent 可能是不同的工种,它们共同使用一个 Agent OS。
李想
对。你要做一个 Agent,或者说要把它作为生产工具,就要能够替代和解放人类真实的工作,完成每天高频的工作,比如开车、编程,而不是只做一次信息索引,在脑子里转一圈就结束。
这两者是根本性的不同。它会影响你的收入,调用你的资产、工具和财产,比如你的电脑、车。这时候对齐要求也不一样。
你拿 DeepSeek 或普通 OpenAI 查找信息,它用 RAG 做索引;但你拿 Deep Research 或 Manus,它会去找信息源头,而不是简单通过 RAG。专业人员一定会找信息源头,找到最真实的源头信息,才能继续分析。
张小珺
你们是不是也要做 Agent OS?
李想
我希望我们做的 Agent OS,想来想去只有司机这一个,其他领域我们不专业。
你说我们做教育,我觉得应该由猿辅导、好未来去做。最后 Agent 可能会搭载在我们的车上,但我们更重要的是先做好公司内部的 Agent。
公司内部需要很多 Agent,比如客服 Agent、编程 Agent。所以我提出一个重要需求:信研团队、基础模型团队、操作系统团队,以及智能商业团队如何联合起来,搭建一个有效的 Agent OS,让每个专业的人在上面开发自己所在专业领域的 Agent。
智能商业团队不可能做出一个客服 Agent,应该由客服团队借助这个平台、借助 Agent OS,开发真正专业的客服 Agent,让一个人带多个 Agent 一起做客服。销售团队开发电话专家 Agent,开发人员开发编程 Agent,以及做验证实验的 Agent。
这些都应该由各个专业自己去做,不会有一个团队替大家做好。但智能商业团队可以把公司内部的 Agent OS 做出来,让所有人方便地放入自己需要的数据和语料,做专业领域的训练,并调整专业领域的思维链。
张小珺
Agent OS 是一个对内的事,不是对外的事。先做对内的,以后会开源吗?
李想
这个还没想。我们之所以开源汽车 OS,是因为我们做得真的很好,明显比 AUTOSAR、QNX 好得多。自研了 4 年,确实做得好。
如果做得不好,开源不就丢人了吗?Agent OS 还在摸索过程中。
很多人工作时会像 Manus 一样,包括像 Genspark 一样,做 To Do List。To Do List 一定不是做系统的人来做,而是先把 To Do List 的架构设计出来,每个专业再放入自己的 To Do List,每一个 To Do 里面的思维链怎么做,我觉得这才是真正的专业 Agent。
张小珺
我们刚才在聊 VLA。是不是意味着端到端才出来一年,你们就要换架构?去年端到端就被放弃了吗?
李想
没有放弃。端到端其实是 VLA 的一部分。如果把端到端想象成具身智能执行的一个环节,它就是 VLA 的 A 部分。
我的 A 部分仍然拿这些语料做训练,只是还要增加更强的语言部分、3D vision 和高清 2D vision。它组成了我的 A 部分。
张小珺
有没有可能一步直达 VLA?比如去年不推出端到端加 VLM,直接研发 VLA?
李想
没有可能,至少从我们自己的体验上没有可能。说得不太好听一点,没有办法直接摘第十个包子。虽然大家可能觉得吃第十个包子就饱了,但前面每一个包子都跳不过去。
很多时候,不想做前面的积累,只想摘第十个包子,很像练《葵花宝典》。今天 DeepSeek 的出现也不是练《葵花宝典》练出来的。它很早就构建集群能力,做链路优化和基础设施优化,这些都非常重要,所以才有低成本和高效率。
我们特别喜欢讲一个人很聪明,直接摘到了第十个包子。但现实中,至少今天这个社会的知识文明发展越来越好了,不是胆大就能超过切实积累。我看不到什么捷径。
张小珺
很多企业做端到端都很吃力,因为在规则算法阶段没有做好。但大家觉得理想才是摘第十个包子的人,因为你们做智能驾驶的时间比别人晚。
李想
我们自研的时间并不短。从 2021 年,也就是上 L9 的时候,就开始做自研。我们的研究也做得很扎实。
中国所有企业里,关于自动驾驶的论文,我们发表以及被大型会议、大型社区录取和引用的数量,应该也是最多的。我们做得很扎实。
我们是一家用户导向的公司,认为技术是一种能力,所以更多时候讲用户价值。今天大家讲冰箱、彩电、大沙发,但背后的智能化基础仍然非常强,体验完全不一样。
背后的基础是大型软件能力。今天大家做端到端和 VLM 很难,是因为 Orin 芯片不支持直接运行语言模型。我们有自己的编译团队,所以很理解 DeepSeek,一看就明白。
比如 DeepSeek 做 FP8 优化,能够运行它的训练架构。我们做相同的事情,直接写 Orin X 的底层。英伟达没有时间,我们自己写底层,让它用 INT4 的方式运行 VLM。这和做 FP8 训练是一个道理。
今天我们能够让双 Orin X 和 Thor-U 跑 VLA,对很多团队是很大的挑战。因为我们有编译团队、芯片能力、板子设计能力和操作系统能力,能够让双 Orin X 运行和其他平台同等规模的 VLA 模型。
规模小的时候无所谓,规模大了以后,基本功和能力永远无法逾越。
张小珺
这是哪一年顿悟的?
李想
我很早就顿悟了。做汽车之家时,基本功就极为扎实;做理想汽车时,只要做什么事情,基本功都做得非常扎实。
张小珺
你说做人类最佳实践往往是反人性的。你做过最反人性的事情是什么?
李想
我们做的最大的反人性的事情,就是每次遇到问题时,都愿意做巨大的变化。这个变化包括能力、业务和组织的变化。
这是我创业一路走来,认为做得最坚决的一件事。
张小珺
什么样的 corner case 是端到端加 VLM 无法解决,而 VLA 可以解决的?能不能举个例子?
李想
过去端到端有两个麻烦的问题。
第一个,它对复杂事物的理解不够。比如遇到复杂修路,如果是规则算法,可能直接撞上;端到端可能能够停下来,但不知道该怎么办。如果是 VLA,就可以比较轻松地解决。
而且这不需要真实场景,甚至可以直接生成数据训练。因为它有理解能力,不只是看到一个景象就做出结果。
规则算法遇到没见过的、规则之外的复杂情况,可能出现事故;端到端可能停下来,但不知道怎么办。我们经常遇到修路场景,它停在那里犹豫,不知道该怎么办。但 VLA 可以有效处理,而且不需要海量数据训练。哪怕最开始无法处理,我也可以保证 3 天之内处理相关场景,因为可以生成数据训练。
另一方面,还有一个很难的问题是和人沟通。今天端到端怎么做,就跟猴子一样,你影响不了它。
比如一条路有 3 条车道,最右侧是公交车道,而且限行,但公交车道长期没有维护,路面标识不清楚,车辆就会在那里跑。你可以通过调整让它回到中间车道,但过一阵它又跑回那条车道。
如果是人类有了 Agent,就可以和 VLA 沟通。我可以告诉 Agent:接下来一直在中间车道行驶,直到导航指示进入下一条道路。
如果和导航走失以后,端到端不知道该怎么办,但 VLA 不一样。VLA 在小区里可以漫游,在开放空间里可以先处理完,最后再和导航调整后的路线汇合。它和人类完全一样,只是今天它的能力还没有那么强,可能像一个刚从驾校毕业的新手司机。
张小珺
今年都会是这个状态吗?
李想
还是要看训练进度,但它的泛化能力已经完全不在一个量级上了。
张小珺
你试驾过搭载 VLA 的车吗?体验怎么样?有没有经历过什么“啊哈时刻”?
李想
很难有什么“啊哈时刻”,因为你已经理解它的原理,它就变得和人很像,真的像人。它变得更像人,其实没什么惊奇。相反,一个动物突然会了一些东西,你会觉得惊讶;但一个人把事情做好,你认为是正常的。
张小珺
为什么之前没有人做好 VLA?你觉得做好 VLA 需要哪些条件?
李想
前提第一是要有非常好的语言模型。我们开始是基于 MetaGPT,后来基于 DeepSeek,因为 DeepSeek 的语言能力更强。
DeepSeek 在 L 上对我们帮助非常大,让我们缩短了 9 个月,这 9 个月对我们非常宝贵。
另一方面,一家企业如果过去没有做过 L、没有基座模型,就要构建预训练、后训练和强化体系,还要调用算力,以及使用背后的世界模型仿真系统,这些都是非常大的挑战。
我们今天已经做到,每 1 万公里的验证成本从最开始的 18 万元降到 4000 多元。4000 多元完全来自算力。
整个效果比在物理世界做仿真和验证强得多。因为真实道路上,要把不同的车、其他交通参与者和特殊路况同时凑在一起,难度非常大,但世界模型解决了这个问题。
张小珺
VLA 以及 VL,哪个部分的数据获取难度最大?
李想
Vision 和 action 的数据最难。车装满传感器,可以收集物理世界数据;有人在车上开车,可以收集 action 数据。这两类数据最难,也没有任何公司可以替代。
张小珺
其他车企不行吗?
李想
其他车企也可以,但你有没有建立过去基座模型的预训练能力、后训练能力和强化能力?强化还需要世界模型能力,这些是不一样的。
另外,我们怎么提升能力、怎么向人类安全对齐,也是问题。要像职业司机一样足够安全、足够舒适,就必须建立强化学习体系。RLHF 非常重要,我们已经有一个成规模的团队。
很多时候,一家公司模型能力不强,根本不知道怎么做对齐。模型能力越强,越能发现对齐的重要性。你才知道伊利亚原来想得那么远。因为模型能力越强,它胡来的可能性越高。一个人能力越强,也需要职业性越强。
公司规模越大,越需要职业性。一个人能力强,干好事很强,干坏事也很强,所以需要职业性约束。比如我不可能雇佣一个职业赛车手每天给我开车,而要雇佣一个职业司机。
他除了开车能力好,还要有很强的职业性,保证舒适、安全,像人类一样开车,价值观也要对齐。这是非常重要的工作。
第三个挑战是模型是黑盒子,怎么解决?我们做了世界模型。把 VLA 放进一个交通世界模型里,如果不告诉你,你看起来和真实世界一样。
我们用重建加生成的方式,借助自己的数据,构建了一个真实的交通物理世界,包括所有交通参与者和固定物体。这样,无论最开始的端到端,还是今天的 VLA,都可以在模型里考试,模拟真实交通参与者和真实城市环境。
考什么?考从 A 点到 B 点,考舒适性、交通合规性和安全性。这就是我们一直在做的工作。
过去靠人类司机做 1 万公里验证,成本大概是 17 万到 18 万元人民币,包括车和各种费用。今天只需要 4000 多元,主要是算力成本,而且解决问题的效率提升更多。
过去解决一个问题,可能涉及一辆车、多个交通参与者、不同位置和不同道路。如果靠人类验证,要把这些交通参与者放到相同位置、以相同速度出现,几乎不可能,只能模糊验证。
有了世界模型以后,可以非常准确地验证修正后的模型是否解决问题,百分之百还原一模一样的真实场景,在世界模型里验证。
张小珺
VLA 和世界模型的关系是什么?
李想
VLA 像一个司机,世界模型相当于真实的交通世界。
世界模型有 3 个阶段。第一个,用来考试;第二个,生成训练数据。顺序上本来应该先生成数据再考试,但我们是先做考试,后来才做 IL 数据生成。
第三个阶段,是未来真正 L4 级别自动驾驶的车辆运营系统。我不可能写一套传统 IT 软件,去运营一辆跑在路上、车上没有人的自动驾驶车辆。所以未来世界模型会变成真正的全自动驾驶运营系统。
今天学术领域对世界模型有两种不同解读。我们这一派认为,VLA 更像一个人类司机模型;我构建一个交通世界模型,人类在世界里运行,既在真实世界运行,也在仿真的世界里运行。
另一种解读来自机器人领域,把 action 结束以后,通过 diffusion 预测未来几秒的环境和轨迹,叫作世界模型,也就是预测世界下一步如何运作。
但在我们的方式里,下一步 diffusion 对物理世界的生成想象,是司机能力的一部分。人类本身就具备预测轨迹和预测接下来会发生什么的能力,我们把这个能力放进 VLA;真正的仿真物理世界才叫世界模型。
我希望描述出来的东西能够和人类世界接近。如果是世界模型,它最好就是一个世界;如果是交通世界模型,它就是一个交通世界;如果是模型加 Agent,它就相当于一个人。
我们尽可能把人工智能、人类世界、人类理解和人类最佳实践对齐。这是产品公司必须做的事情。
张小珺
在说司机 Agent 时,action 会进入外部世界、物理世界,怎么解决安全问题?
李想
这非常重要。我们从去年年底成立了超级对齐团队。
比如模型能力很强,但不遵守交通规则;模型能力很强,经常在拥堵时加塞;或者做出让坐在车里的人感觉不安全的行为。
是否发生碰撞,是模型能力的问题;是否产生这些不安全行为,是价值观和模型对齐的问题。所以强化训练的第一个环节,必须把人类规则、习俗、驾驶习惯和对很多事情的判断,变成训练反馈。
我们有一个大规模的超级对齐团队,超过 100 人。
如果拿一个人来比喻,模型相当于一个人的专业能力,超级对齐相当于这个人的职业性,是他的综合职业性。
司机 Agent,包括它背后的记忆能力,如何和使用者建立信任?如果我招一个员工,我会看 3 点:第一,专业能力;第二,职业性;第三,他对别人理解以及构建信任的能力。
这 3 点都很好,才是最卓越的员工。
张小珺
超级对齐是什么时候开始做的?
李想
我们做到 1000 万公里以后开始做。因为我发现,这时候怎么有效运用模型能力非常关键。
比如它经常一拥堵就加塞,或者做很多效率很高但让人坐着不舒服的行为,和人类正常的处理方式不一样,可能学到了一些不该学的司机行为。
张小珺
你觉得 VLA 是解决自动驾驶的终极架构吗?还会有下一代吗?会不会明年又是新架构?
李想
我认为 VLA 能够解决全自动驾驶,但 VLA 是否是效率最高的方式,我打个问号,大概率还会有更高效的架构。
因为 VLA 还是基于 Transformer。Transformer 是否是效率最高的架构,也要打问号。它是现阶段能力最强的架构,能力差距太大了。
今天规则算法、端到端和人类合格司机之间的差距还是很大。VLA 是最接近人类、甚至有机会超过人类开车能力的方式。
但它是否效率最高,还是要打问号,因为它对算力的要求仍然很高。
张小珺
VLA 和最后可能形成的最终大统一模型是什么关系?它就是那个大统一模型吗?
李想
还是有一个效率问题。我们虽然有模型,但从来不放弃工具,因为工具可以增加确定性、提高效率。
举一个例子,今天 VLA 可能会解决很多问题,但我们使用 VLM 解决 ETC 时效果并不好。VLM 对位置的判断很糟糕。
如果只有两三个 ETC,很容易判断怎么进入,就是左、中、右。但像京承高速、机场高速,有十几个 ETC,它就不知道怎么处理,开始混乱,因为它缺乏位置判断能力。
团队太希望用模型解决问题,不停给 VLM 喂更多语料,但还是解决不了,因为这是 VLM 的架构问题。
我问团队,解决 ETC 为什么不能用规则算法?最多也就 15 个口,对你们来说写一个程序,一周之内甚至 3 天之内就能完成。
很多时候我们心里有个心结,觉得人类运行时都在大模型里运行。但人类也会背乘法口诀,乘法口诀就是规则算法。它让我们消耗更少脑力,也就是更少 token,而且准确性更高,它就是一个好工具。
如果是确定性的、可以用规则解决的问题,就意味着更低的能量消耗、更低的算力消耗和更高的准确性,为什么不用?
团队很快就把问题解决了,所以 ETC 变得非常稳定。过去三四个月解决不了的问题,用成本很高的方式也解决不了,后来一周不到就解决了。
所以真正往下落地时,很多时候还是要考虑效率。DeepSeek 之所以受到全世界瞩目,很重要的原因也是效率变高了。
张小珺
你在训练 VLA、做司机 Agent 时,有没有感觉自己在做一个人?
李想
当然。我一直用人的方式和团队沟通。
这得益于 2023 年 9 月战略会上陆奇对我们的启发。他问了两个问题:人类是怎么工作的?人类是怎么学习开车的?
人类没有那么辛苦、没有那么难。如果那么难,肯定是方法不对,或者能力还没到。我们应该研究什么能力,才能像人一样开车、像人一样泛化,而不是依靠规则算法。
张小珺
陆奇博士最近有没有给你新的 input?
李想
前几天我们又交流了一次。他更加强化了一个观点:研究等于能力,而不是研发等于能力。
在人工智能时代,研究等于能力,研究等于认知,认知很容易变成能力。但如果没有研究,就没有开放认知,也没有办法把认知变成能力。这是他最新的一个重要观点。
张小珺
你们 3 万人的公司,有多少人负责研究?
李想
我们没有特定比例。有一些特别重要的前沿技术,会有专门的研究团队。
但我认为,所有构建能力的部门,无论是垂直构建能力的部门,还是过去说的职能部门,都应该搞研究。
比如去年我们招了接近 3000 名研发管理人员校招生。如何让这些校招生在公司里接受更好的培训、训练和课程?人才发展团队就要先做研究。
我们会请咨询公司一起合作,研究全世界顶级公司在类似人员规模时如何做,和我们相似的公司如何做,不同公司如何做,从而看到我们的能力差距,再开发这些能力。
所以我们有了“一线历练”这样的能力:让大家去工厂接受训练,训练哪些具体内容、教材和体验;再去一线门店接触消费者,学习流程;最后开发课程,把课程放到工厂和门店里,让员工和用户去运行。
它同样是搞研究、搞研发、变成能力,最后参与业务作战,一模一样。
张小珺
什么是一个好的司机大模型的北极星指标?
李想
还是要把司机大模型和 Agent 放在一起,才是真正用户能够使用的产品。
如果只看司机大模型,我觉得判断标准和判断一个司机一样。我们家雇一个司机,第一看开车水平好不好,也就是模型能力强不强;第二看他是否职业,超级对齐和强化训练是否做得足够好;第三看他和我之间的信任关系。
我和他说什么,他是不是都听得明白?我说上半句,他是否知道下半句?甚至很多事情我不说,他能不能根据记忆独立完成?
我们要通过 Agent 和记忆构建更好的信任与理解关系。如果我什么都不说,他都知道我要做什么,这个司机开车不错,又很职业,又特别了解我,我就会一直雇佣他,每年给他涨工资。
未来所有 AI 和 Agent 的判断,都应该看这 3 点:专业能力、职业能力,以及构建信任的能力。
张小珺
你觉得这个 Agent 应该怎么定价?
李想
应该是人类雇佣成本的几分之一,具体几分之一,还是要把成本全部算出来。
比如一个月雇司机 1 万元,我是否愿意用 2000 到 3000 元雇一个司机?对车来说,可能还不需要另外付保险费,财产险也包含在里面;它可能自动充电,充电金额和一定里程的费用也可以包含在里面。最后算下来,可能是更划算的事情。
张小珺
你之前对内说过,理想的智驾原创性超过了增程。这句话是不是太自信了?
李想
我觉得我们在这方面的研究确实做得很深,所以你能看到我们的各种论文。
为了做好智能驾驶,我们做了操作系统,构建了完整训练体系,甚至直接改芯片底层软件。我们做了很多工作,这方面的工作量肯定比增程更多。
还有一个评价方式:历史上我们从来没有遇到过这样的周期,比如 2024 年和今年年初。我们的自动驾驶团队核心人员,基本上每个人都会接到 20 个以上猎头电话。
张小珺
VLA 架构会怎么改变 L3 和 L4 的进程?
李想
还是回到模型能力。今天车上放一个 3.2B 的 MoE,加上 action,大概是一个 4B 模型。对应能力可能有上限,因为算力就这么多。
两颗 Orin X 或者一颗 Thor-U 有 64GB 显存,理论上能跑一个 30B 模型,但帧率达不到。如果要达到交通和自动驾驶需要的帧数,就必须把模型规模压下去,所以端上模型规模受限。
如果有一天可以把 32B 模型直接放在端侧,可能 L4 就实现了。云端模型可能扩大到 320B,也就是 3000 亿参数的 VLA 模型。
所以云端模型规模和端侧模型规模,会限制 L3 和 L4 的能力上限。
张小珺
今年能看到 L4 吗?或者明年?
李想
这代算力不行,这代基本是 L3 水平。
张小珺
今年能看到 L3 吗?有没有时间点?
李想
还和法规有关,但能力达到的话,我认为今年第三季度,最快三季度、最晚四季度,基本能看到真正 L3 能力型产品。法规以及后边还有一些问题需要解决。
张小珺
刚才一直调用的是 CEO 大模型的技术专家,接下来调用战略专家。前几天你们刚开完 2025 年雁栖湖战略会,达成了什么新共识?
李想
战略上的核心共识,还是延续去年秋季战略会做出的判断,但延伸出一些关键想象,以及往后看 3 年、6 年可以思考和探索的关键点。
如果看战略,中间的圈是规模。圈外有 3 个变量:用户需求、技术产品和组织能力。当规模变化,这 3 个变量也会变化。
今年我们会有 1000 多亿收入,去年是 1450 亿收入。如果继续往前走,规模的限制会在哪里?如果要获得更大规模,哪些东西会成为限制?
从用户需求看,我们今天主力车型都是 SUV,可不可以靠卖 SUV 卖到 3000 亿、5000 亿甚至更高收入?这就是挑战。像路虎这样的品牌也没有做到。
去年我们的用户是 50 万辆,今年会更多。如果做到 100 万辆以上,用户群规模就和 BBA 一样大,意味着用户群扩大很多倍,和这些用户的沟通也不一样。
所以我们要思考:如果往更大规模走,要覆盖哪些过去没有覆盖的用户群,应该怎么和他们沟通?
从产品角度,家庭定位是很好的定位,但如果只做家庭 SUV,面向全球是不是有问题?我们做了分析,在面向全球、面向更大范围用户时,有必要做轿车。但应该做好的家庭轿车,而不是运动轿车。
家庭用户在空间上有优势,也应该丰富 MMPV 产品,做大空间的家庭轿车,面向更广泛的用户和全球市场。但不是出很多车,而是把 SKU 有效控制住。这是用户需求可能发生的变化。
从技术角度,可以看 3 到 6 年。车实现全自动驾驶以后,会成为人工智能时代营业收入最高的终端,可能做到千亿美元收入。一家企业做到千亿美元收入,可能会超过中国所有手机厂商的收入。
为什么车会是人工智能时代的终端?它有 4 个特点:第一,具备 360 度感知物理世界的能力;第二,具备认知决策能力;第三,必须有 action,可以操作终端上的软件,也可以直接操作机器人;第四,要有自己的反思和反馈能力。
像人一样具备这 4 个特点,才可能是 AGI 时代的终端。汽车会从智能终端变成人工智能终端。
我们还要思考,在生活范围、家庭、工作中、身体上,是否会出现符合这 4 个特点的新终端。这可能形成未来的机会。
苹果也不是只卖 Mac。发展到一定阶段,它做了 iPod 和 iPhone,而且都非常成功。微软也不只是操作系统,还做 Office 和语音服务。小米也做 IoT 和汽车。到了 5000 亿以上规模,就必须考虑这些事情。
用户群变大,用户需求更完善,我们能不能满足用户工作和生活中最主要的场景,推出最有竞争力的 AGI 终端产品?这是从技术产品角度看,未来 6 年要思考的事情。
第三是组织能力。如果要做到 3000 亿、7000 亿收入,需要哪些能力提升?规模小时,招一个人就能带来能力;规模变成千亿以后,能力怎么选择就变得关键。
这个阶段我们小时候没有看懂苹果。现在可能要重新研究苹果,发现苹果还有很多值得学习的能力。一个公司做到千亿收入,再看万亿收入公司的能力,开始能模模糊糊看懂;规模小时看不懂苹果为什么这么做。
最后还是规模。规模是可以确定衡量的,规模变化会带来用户规模和用户需求变化,也会带来技术、产品、组织和能力的变化。
张小珺
学习苹果会带来你们什么改变吗?
李想
我们一直在学习。组织能力很难自己发明,除非大到一定程度,没得可学。
最开始我们认真学习丰田的工作法,学习 GM 的研发流程,也学习 Google 的 OKR,用来对齐不同业务团队。这帮助我们完成了第一个阶段,也就是理想 ONE 的研发和交付。理想 ONE 帮我们创造了超过 100 亿美元收入,卖了 20 多万辆。
第二阶段的重要问题,是从百亿收入走向千亿收入。我们研究这个行业更像什么,也研究过苹果,但当时人才密度不够,甚至没看懂苹果。
当时有很多华为的书,华为也愿意把能力写成书分享出来,所以第二阶段我们向华为学习了组织能力,包括 IPD、财务、流程,以及人力资源三支柱。
这些能力配合理想 L 系列的平台化研发能力,以及大规模销售团队的管理能力,再加上销售团队背后三支柱的赋能和约束,让我们快速借助 L 系列产品做到超过 1000 亿收入。
我们知道靠这些能力还能做到 2000 亿、3000 亿,但 3000 亿以上怎么办?这是几年后的事情,也就是 3 年之内的事情。
张小珺
为什么是学苹果?它也不是一家 AI 公司。
李想
最重要的是学能力。苹果最开始也不是手机公司,也不是 MP3 播放器公司,它就是电脑公司。
它能从电脑公司变成音乐播放器公司,后来变成手机公司,再变成软件服务生态公司,一直在变化。
张小珺
理想是谁?
李想
往后看,我们会变得越来越清楚。到 2030 年,我觉得一个比较好的回答是:我们希望成为全球领先的人工智能终端企业。
张小珺
现在加了“终端”。
李想
对。这相比去年我们聊的时候是一个变化,因为过去没有做这个选择。今年这个选择变得很清楚了。
我也跟团队讲明白,团队要知道为什么做这样的选择。这是今年的选择,是去年年底、今年年初开始形成的。我们不断碰撞,想知道我们要成为谁,但更重要的是回答我们是谁。
1975 年出现 Apple II,后来又出现 Mac。苹果做的是终端,是软硬件结合。
同一时期也出现微软,先做 DOS,后来做 Windows。它做的是操作系统和软件生态。这两种取向没有对错,但在那个阶段,微软赢了,苹果遇到很多挑战,不过苹果至少活了下来,因为它有独特价值。
2007 年又出现了 iPhone,苹果再次选择做终端,这一次除了软件和硬件,又加入了服务。苹果的服务做得非常好,服务利润收入占比也很高,成为 3 种能力的结合,但定义仍然是终端。
紧接着出现 Android,角色从微软变成了 Google。Android 做手机操作系统和服务生态,操作系统开源,但服务属于 Google 自己,比如 Google Maps、Gmail 和 Google Play,模仿了 App Store 的体系。
如果看移动互联网时代,苹果和 Google 基本不相上下,它们是全世界仅有的两家每年净利润接近 1000 亿美元的公司。它们做出了完全不同的选择。
回到人工智能时代也是一样。今天很多问题是因为没有 action。需要 action,就需要终端,不能只知不行,知行合一才有更大的价值。
也会有企业像 OpenAI 一样做模型,后面做模型的 Agent OS,建立生态、开放 API。同样,这个时代也需要终端公司。
我们为什么先切入自动驾驶?因为自动驾驶足够大,汽车是足够大的市场。但我们可能不会局限于这一个终端。这个终端做成以后,我们的能力能不能覆盖用户,让他们生活得更好、工作得更好,覆盖更多 AGI 时代的终端?
我们不会再做上个时代的终端,但进入任何一个终端,都必须符合刚才说的 4 个特点:对物理世界 360 度感知,认知决策,真正执行 action,无论控制机器还是执行软件,以及真正的反思和反馈。
软件、硬件和服务的能力要求,也会变得不一样。
软件方面,第一要有很好的模型能力,尤其要理解物理世界,在物理世界工作,横穿物理世界和数字世界。不仅看清道路上的车,理解修路、胡同小巷,还要看懂导航地图和各种软件。
第二要有很好的操作系统能力。人工智能时代的终端要是实时的,不能像 Android 那样是后台任务排列式,也不能像传统 AUTOSAR 那样是链式的。它既要并行,还要有效使用 NPU、MCU 等计算内核,确保实时性和准确执行。
操作系统要有很高的性能,符合人工智能在物理世界和数字世界运行的需求。还要能做更好的虚拟机,用户本地电脑工具不够时,提供更高性能的虚拟机。
第三要做好各种工具,但要符合人工智能所需要的常用工具。工具也会因为人工智能变得更有效、更高效,Agent 也要调用工具。这 3 个软件能力缺一不可。
硬件方面,第一是本体发生变化。要把车控制得更好,就要自研线控系统。计算单元之间的部署关系也会变化。
车是否一定是中央大脑加几个分脑?不一定。任何端到中央大脑都有距离,所以可能既有集中式计算,也有分布式计算,而不是一个大脑独立工作。线数更少,传输效率更高。
第二是 NPU。大家现在太关注云端训练和推理,但终端上,如果只能放 3B 模型跑 10Hz,另一个人能放 30B 模型跑 10Hz,就是 10 倍性能差距。
当大脑变强,心脏也要变强,NPU 就像心脏。后边要求会越来越高,今天很多架构可能已经不实用了。
第三是制造环节会变化。为什么工厂不能变成一个机器人?小时候看《变形金刚》,有擎天柱、威震天这样的机器人,也有宇宙大帝这样的机器人,它本身是一个星球,身体就是机器人。
我们能不能拿 AGI 生产 AGI 的终端?我觉得工厂面临这样的机会。
很多人想象造一个人形机器人,到工厂替代人。我觉得有两个问题。第一,工厂里人的成本占比没有大家想象得那么高,替代起来并不划算。第二,这些就业长期而言仍然非常有必要。
我们应该关注的是,如何把一个工厂变成一个机器人,简化工厂里各种繁琐复杂的环节,让生产效率得到更大提升。AGI 在制造领域应该关注生产效率提升,而不是人的替代。只关注人的替代,我认为比较狭隘,或者这些人没有真正管理工厂的经验。
一个完整终端有 3 个部分:软件、硬件,以及 AGI 时代会发生变化的服务。
我们无法写一套传统 IT 软件,靠人去接管 AGI、管理这些 Agent,这会是一个很大的挑战。英伟达做 Cosmos,我们构建交通世界模型,做 Agent OS,核心都在运营。
一方面,如何运营跑在物理世界里的 AGI 机器人,无论是车还是其他形态;另一方面,一个人如何和几个 Agent 一起工作,或者带领几个机器人一起工作?到底是 Agent OS,还是其他形式?这必须解决。
既要解决 Agent 运营本身的问题,也要解决 Agent 和人的连接问题。这就是服务。
未来 3 到 6 年,所有企业都要解决 AGI 终端软件层面的 3 个问题、硬件层面的 3 个问题,以及 AGI 运营和 AGI 与人的连接问题。
张小珺
我感觉你要做的事情好多。
李想
其实不多。如果这些问题不解决,就会出现今天的现象:大家觉得 AI 很厉害,但每天工作时间变得更长,虚假和不靠谱的信息变得更多,陪家人的时间变少。我觉得这些都是问题。
张小珺
我知道你们把机器人分成穿戴机器人、空间机器人和家庭机器人。你们对于机器人的节奏和规划是什么样的?
李想
不可能直接上来给出节奏,还是要根据行业进展,做相应研究和分析,也要看哪些能力需要自己解决。
很多人说眼镜会是未来的穿戴终端,或者穿戴机器人,但今天还不是。它确实具备 360 度感知,但显示还不行,无论光波导显示还是集中显示,都不能成为真正长期使用的方式。
还有电池、电量、独立计算和通信的问题。这些问题解决以后,它可能成为人类穿戴 AI 的一条路径,但今天还不是。也可能解决过程中出现另一条路线,跑在前面。
在家庭里也是一样,到底是人形机器人服务所有事情,还是家里有更好的感知和更好的大脑,只需要一个简单的人形机器人,在厨房里拿人类的铲子和锅工作;也可能只需要改造一个锅,让它直接做菜。整个家里有统一的大脑和统一感知。
两种路线都有可能,每条路线都有自己的支持者。接下来这些事情可能都会发生。
张小珺
什么样的终端是理想会做的,什么样的终端是理想不会做的?
李想
这件事只和我们的规模相关。规模小时尽可能收敛,规模大时必须扩张。
如果 Google 不成功做出操作系统,就不是今天的 Google;如果它只做搜索不做 Android,也不是今天的 Google。微软如果不做 Office 和云服务,也可能不是今天的微软。苹果如果只坚持做 Mac,不做 iPad 和 iPhone,也可能是另外一家企业,和历史上那些消失的电脑企业一样。
这件事不能单独看,只和规模以及规模带来的用户变化有关。
张小珺
你说理想是人工智能公司,今天说的是人工智能终端公司,但大家对理想业绩兑现的判断仍然是销量。你觉得这合理吗?什么时候销量能够和做人工智能挂钩?
李想
我们的能力和给用户带来的价值还没有表现出来,所以如果现在就给我们人工智能方面的估值,反而会让我们心慌。
可以从两个方面看。第一,我们能不能率先做出 L4。未来大家上下班时,不是坐在方向盘前,而是坐在桌子前吃东西、看电脑,到公司就到了。我们能不能加速这一天到来?
第二,从工作效率看,今天接近 100 万人,创造 7000 多亿人民币收入。如果人工智能出现以后,我们能不能用 10 万人以内,甚至 5 万人的规模,做到 1000 亿美元收入?
如果这些都做到,就证明我们的人工智能战略真正发挥了价值。如果没有做到,就应该给我们车企估值,这很正常。光说没做,或者做了没做到,都不能算。
张小珺
你们现在又做操作系统,又做芯片,既做大模型,也在终端上做车、眼镜和机器人,会不会铺得太开?
李想
没有。苹果 2001 年推出 iPod,2000 年时已经有苹果电脑、操作系统和软件生态。那时候苹果的收入只有几十亿美元。
对比苹果那个时代,我们现在的规模做这些事情是合理的。如果只有两三百亿收入,做这些事情不合理;但如果有 1000 多亿收入,正往 2000 亿走,做这些事情是合理的。它既能增强能力,又能降低成本,不会带来坏处。
做操作系统这些年投入了 10 亿元,但节省的钱不是 10 亿元,而是 50 亿到 60 亿元,太划算了,为什么不做?
张小珺
上次我问你,理想有理想吗?这次想问,你对理想的设想会不会太过于理想?
李想
我们会看得远一点,但当下仍然很脚踏实地,因为我始终坚信基本功最重要,尤其到了这个时代、这个规模,尤其到了人工智能时代。
人工智能时代和编程时代的差异,是编程时代比较功能,人工智能时代表现能力。关键是怎么把能力变成业务,变成用户价值。
这些能力没有捷径。想跳过能力直接实现成果,在人工智能时代真的像练《葵花宝典》。我们希望成为一个练基本功的人。
张小珺
理想会因为什么消失?
李想
刚才讲的 3 个点都会消失。
如果我们没有把握住用户需求,会消失;没有掌握最好的产品和技术,会消失;组织能力出现巨大问题,也会消失。
这 3 个点是非常好的诊断。单独看一个,容易看得不全面;把 3 个点放在一起,相互支撑,整个系统的诊断能力会更强。
张小珺
战略会上有人跟你吵架吗?有人和你争执、提反对意见吗?
李想
无论战略会还是现实工作中,始终都有反对意见。
比如有些东西我们决定停掉,最后他们私下里还会继续做,做出验证结果,坚持要做下去,那我最后还是会认同他们。
刚才讲的所有讨论、争执和吵架,背后更重要的一点是能量。当人与人之间始终有能量,这些争执、讨论和吵架就是一个更完善的大脑。
当能量消失时,争执、讨论和不同想法就变成内耗。比能力和业务更重要的是,到了这个规模,到了今天这个比较混乱的时代,能量特别重要。
我过去是能量的受益者。每到关键时刻、最困难和变化的时候,我们的能量反而变得更强。后来我复盘过去如何构建能量,也尝试把这种构建方式让核心团队和更多团队掌握。
汽车之家为什么能变成第一?我们也遇到非常多困难,困难并不比别人少,上市受阻,发展初期我还差点被赶出公司。但每次遇到问题,我们都会变得更强。
很重要的一点,是有 3 个人支撑:我、秦致和樊铮。我们 3 个人形成了非常有效的支撑。
所以我经常说,一个重要支撑往往由 3 个人开始。合伙制、合伙机制、董事会,往往都是 3 个人起步。很少见两个人的董事会,但 3 个人的董事会是有的。
三个人并不内卷,而是一致对外;但三个人会通过吵架思考,形成一个更全面、更强大的大脑。三个人组合在一起,就像一个 MoE 架构。
这个强大大脑讨论出来的判断,过程可能比一个人随便想一下复杂,但一旦形成,三个人会形成更强的心脏。决定做一件事时,三个人相互支撑,不用担心倒下;缺资源时有人补,缺能量时有人给能量。
到了理想汽车也是一样。前期有我、沈亚楠、马东辉、李铁。沈亚楠离开后,马东辉接替了他的工作,但我和李铁必须成为马东辉心力的支撑。
你去做,出了任何问题都不会倒下,我们帮你撑着;需要什么调整和支持,就一定给你;遇到问题,我们一起用一个大脑去想。
后来谢炎加入,也包括邹良军的加入,5 个人形成一个更强的大脑。它一定比我一个人的大脑更强。一个人大脑可以随心所欲,但更强的大脑能力更强。
张小珺
这 5 个人怎么让能量更凝结,而不是互相内斗?
李想
我会把我怎么做告诉他们,会把他们拉在一起,促成一次次大小事件,让他们以这种方式工作。
张小珺
多少人形成的能量场连接最稳固?
李想
一般是 3 到 7 人。少于 3 人太少,两个人不太容易;多于 7 人又太多。所以我们设计很多结构时,会有意设计 3 到 7 人的组合,形成脑力和心力支撑。
张小珺
这是量化的,还是你的直观感觉?
李想
是直观感觉,能够形成更强大的能量场。
人工智能时代也是这样,更多小组织形成脑力和心力支撑,但仍然可以连接更多组织,不受影响。
张小珺
人和人连接的本质是什么?
李想
两个在意。
第一,要在意客户、在意用户,因为在意用户是一种最重要的价值观共识。第二,要在意身边这几个人,先对人再做事,而不是只对事不对人。
张小珺
你刚才说人不想改变,但人愿意成长。所以你说自己的驱动力是成长,但其实做的是改变。你最近做的成长和改变是什么?
李想
我最大的成长,是如何通过合伙合作的方式构建脑力和心力的模式,以及如何让团队和更多团队使用。
这个东西只有好处没有害处,让大家尝到构建脑力和心力的组织方式的优势。我觉得这是我最大的成长变化。
张小珺
我听说你花 80% 甚至 90% 的时间都在 AI 上,那你对车的关注还多吗?
李想
这是一个误解。如果拿一天工作时间来分配,今天大概 60% 是组织和人的工作,包括研究人工智能组织应该怎么管理,也包括面试不同的人、干部、新员工和校招生,以及沟通培训。
另外的工作,一半在车上,一半在车的业务和人工智能业务上,大概是这样的分配。
张小珺
人工智能企业转型,你觉得现在进展怎么样?有没有遇到阻力?毕竟有两种企业文化,一种是汽车制造业文化,一种是 AI 企业文化。
李想
这方面我比较有心得。高维的信息管理方式是兼容低维的。
比如数字化能力很强时,可以把传统汽车流程放进数字化体系,解决工作协作和改善;也可以把传统销售管理放进数字化体系。
传统组织方式仍然存在,但高维组织方式能够兼容它。它继续运作,不受影响。
我们做汽车以后看到一个很大的机会:没有因为管理工厂而被难住,相反,管理工厂的效率很高,质量也很好;也没有因为传统销售方式而被难住,销售效率和成本管理都变得更好。
核心是我们有管理复杂大型软件团队的能力,并理解这样的体系。人工智能也一样,人工智能管理方式可以包容和兼容传统方式,比如 IPD 流程对它而言不是问题。
张小珺
DeepSeek 的组织是一群很年轻的人,职级更少,分工也没有那么精细化,和你们完全不同。做 AI 一定需要这样的组织吗?你们内部是否也需要做一些 Lab?
李想
我不需要这么纠结。管理工厂是一种组织方式,做操作系统是另一种,研发汽车是一种,研发智能驾驶又是另一种。
我们真正做端到端的团队只有 200 人。公司内部有七八百人,因为还有做研究、做数据的人,但真正做端到端的只有 200 人,和特斯拉规模差不多。
竞争对手做规则算法,通常是 2000 人、3000 人、4000 人,甚至 5000 人、6000 人。但从最终产品体验而言,我们 200 人做的端到端,至少今天看到的体验更好。
模型团队还要做 VLA 训练和多模态训练,团队规模也是 100 多人。它不像 DeepSeek 在语言上做得那么深,但要做得更宽。
我们的智能驾驶团队和模型团队,校招生占比极高,基本有 60% 到 70% 是校招生。
我和梁文锋聊完后印象特别深的一点,是他认为应该让年轻人搞研究。很多经验对研究反而是障碍。所以我们也大胆使用校招生,很少招行业大拿。
别人会质疑我们没有大拿,但我们坚持这么做。自动驾驶没有进什么大拿,模型也没有进什么大拿。但我们的自动驾驶团队,可能是中国所有公司里被猎头盯得最紧的团队。
另一个启发是,关于强化学习如何获得有效反馈。他提到中国教辅材料是一个有反馈的、非常好的强化训练体系。
后来想想确实如此。教辅有完整的解题过程,公务员考试也有完整讲解。交通规则、人类对舒适度的判断、人类接管,都是让强化训练获得有效反馈的体系。
张小珺
他还有给你过什么 input 吗?你对他的整体印象是什么?你当时有没有预感到 DeepSeek 会很强?
李想
我们觉得他们很强,但没想到会那么强。
当时聊天时,他认为和 OpenAI 的差距还有一年的时间。那时候他们还没有做 R1。从 o1 发布到 R1 推出,大概是 9 月到次年 1 月,只有三四个月,一个季度左右,确实非常厉害。
张小珺
你觉得 OpenAI 的领先优势还能持续多久?
李想
不好说。OpenAI 是综合能力很强的公司。我最开始就讲,它的研究强、研发强、产品强,沟通能力也很强。
这一波生图,它又借助很有情感的动画漫画风格实现爆火。现在我大概有十分之一的朋友把微信头像换成了它的吉卜力风格,这也是一种炫耀。
它是综合能力非常强的公司。一周超过 4 亿访问用户,非常了不起。
张小珺
你觉得理想今天的人才密度够高吗?怎么和 DeepSeek 抢人才?
李想
DeepSeek 和我们是不同方式。但如果正常抢人才,我们的吸引力在变得越来越好。
真正做 AI 的人都知道,场景、数据和持续资金很重要,也知道公司到底是真相信,还是只在口头上说。这几个关键点背后意味着什么,大家都看得懂。
张小珺
刚才说梁文锋为什么一开始就觉得应该让年轻人做研究,他有说原因吗?
李想
成熟研究者往往已经有自己的框架。
我始终认为他自己就是一个最佳实践。可能从他在浙江大学学习,到他所在的学院,他本身就是一个最佳实践。
他做任何事情都先搞研究、先做分析,所以成功率很高。无论大家说当年炒股票、做量化,还是做其他事情,他都是成功率很高的最佳实践,只是把这个最佳实践在组织里内化了。
张小珺
那你是把什么样的最佳实践内化了?
李想
成长。
张小珺
现在你还能说自己是一个超级产品经理吗?这个标签对你还合适吗?
李想
我是通过成长去实现用户价值,形成这样一个循环。
成长是我的驱动力,变成用户价值、变成商业价值,是结果,是因果关系。
张小珺
你不是技术型 CEO,不像梁文锋那样,你担心手下 AI 高管忽悠你吗?
李想
如果是科学,他可能忽悠我;但如果是工程,他忽悠不了我。幸好 AI 不是科学,AI 是工程。
张小珺
为什么工程忽悠不了你?
李想
我从小就有很好的工程思维。
当年设计网站架构时,我们设计的是最先进的汽车之家架构,这个架构成为所有垂直网站的统一架构,到今天都没有变。
包括设计增程架构,今天大家也没有改变增程架构,只做局部修补。还有控制器如何控制增程,当时大家讨论出一个架构方式,到今天也没有变化。
我比较喜欢物理,从小就喜欢物理。只要是工程架构、工程问题,我觉得骗不了我。
工程能力很多时候在于怎么问结构性问题。我虽然不去做具体事情,但可以通过问更好的问题,帮助团队澄清问题和架构,让效率更高,内部推动事情更快。
张小珺
作为一个 CEO 大模型,你最近通过自我推理,最长的一个问题是什么?能不能展示一下你的思维链?
李想
战略是最重要的推理结构。
我会拿一个规模,因为规模和时间连在一起。比如看 2027 年,也就是 3 年时间,去推理用户会发生什么变化、用户需求会发生什么变化、技术会发生什么变化、技术带来的产品会发生什么变化、组织会发生什么变化,以及组织应该往哪里走。
这是我最近在脑子里完成的一次比较完整的推理。但推理完没有用,还要把它变成 action。有想法和能落地,仍然是最大的鸿沟。
张小珺
你们今天说自己是人工智能终端公司,好像比去年年底更具象化了。
李想
一方面是看清了要解决的问题,另一方面是更好地看清了自己。
过去我们并不清楚,但今年做了选择。后边无论机器人形态还是人工智能机器架构,尤其在物理世界运行,都会涉及生命安全和财产安全。
PC 时代,苹果输给微软;移动互联网时代,苹果和 Google 算是打了个平手。但到了人工智能时代,尤其在物理世界里,我认为可能会反过来,终端企业的价值会战胜平台企业。
因为它涉及生命安全、财产安全。一致性由一个主体解决,还是由多个主体分开解决,是不一样的。
张小珺
你们能成为下一个时代的苹果吗?
李想
这是我们努力的方向。成为 AGI 时代领先的终端企业,是我们的核心成长目标。
张小珺
马上 7 月份是理想的 10 周年。站在今天回顾理想这 10 年,脑海里最深刻的几个场景是什么?
李想
第一个最重要的画面,应该是 2018 年理想 ONE 第一次发布,一直延续到 2019 年 4 月上海车展第一次正式展示、公布价格。
那是一个非常重要的时刻:我们真的做出了一辆车,而且特别受用户喜欢。在上海车展展馆里,我们是人流量最大的展台。我们从什么都没有开始做,这是一个非常重要的画面。
另一个是 2022 年发布 L9。那真的是全世界最卓越的产品。到 2025 年,至少有 5 家以上企业,因为 L9 的成功,在打造和 L9 相同的产品。
张小珺
所以你脑海里浮现的都是幸福的时候,而不是痛苦的时候。痛苦的时候会回忆到吗?
李想
太多了。
刚刚经历 L9 的幸福,就出现了全网黑公关,说理想汽车倒闭。那一个季度我们亏了十几个亿,接近 20 亿,过去从来没有亏过那么多,忽然从巅峰掉到谷底。
但好处是,我们认识到很多能力不足,就去补了很多能力。正因为这件事,我们的调整又带来了 2023 年接近 3 倍的增长,直接做到 1200 亿收入。
创业这么多年,很多时候问题到来,也是更大机会的到来,所以我不太纠结。
我对不正常的事情耐受力很差,但对不好的东西,解决完以后记忆很差,会把它忘掉。不过让我回顾,还是能回顾起来。
张小珺
如果可以删除一段记忆,你会删掉什么?
李想
为了让自己有更好的正能量,我尽可能只保留有价值、美好的片段。
哪怕是不好的事情,我也会转换表达方式。比如被黑、被打击,我会说,正因为这件事,我们增长了 3 倍,获得了其他新势力没有的能力,面临了其他新势力没有的挑战。
张小珺
这是一种心态。
李想
对。我不希望创业变得不容易,但没必要苦哈哈的。苦和甜也是一个硬币的正反面,只是你选择看哪一面。
张小珺
甜多还是苦多?
李想
按时间轴而言,肯定苦更多。但吃苦吃多了,也就习惯了。
张小珺
余凯博士第一次见你,是在杭州一起爬山,你们是湖畔大学同学。他记得你那天穿着一件军大衣。我很好奇,军大衣包裹着一个什么样的灵魂,它和今天发生了什么变化?
李想
没什么变化。我甚至认为今天 90% 的状态和思维方式,和高中时差不多。
遇到问题就解决问题,去解决别人不愿意解决的问题,解决消费者遇到的最大问题,找更多人学习。
那时我是个人网站站长,是站长里少数有小团队的人。我知道靠自己能力不行,还要依靠别人、完善能力。到今天没变化,只是解决的问题变大了,服务的用户群变大了,公司规模变大了,组织变大了。
张小珺
过去 10 年的记忆里,如果能改变一个记忆、改变一个程序,你想改变什么?
李想
真没什么要改变的。
能赶上这样一个时代,几次创业还能一路走下来,在最难的时候总有人帮你,遇到问题总能从坑里快速爬出来,一帮人齐心协力变得更好,我觉得已经很幸运了。
无论从运气层面,还是从创造出来的价值层面,我都没什么可后悔的。
张小珺
你刚才说能量。怎么让自己成为一个更有能量、更强大的人,或者吸引到更多能量?
李想
就是关注人,尤其关注离你最近的人,关注亲密关系的人。
完整讲一下,关注人的时候,首先要关注自己。作为我自己,第一,我会接受自己的优点。我身上的很多特质,经过这么多年的积累,或者从 DNA 里带来的,本身就是优势。我要发扬自己的优势。
第二,我要接受自己的不足。往往不足是优势的另一面。一个人擅长决策,可能就没有办法做很细致的运营,因为两件事是冲突的;一个人擅长运营,可能很难跳出来几个维度做决策。
一个人很懒,可能是极品产品经理;如果很勤奋,可能是非常好的业务运营。每个人都不一样。我们如果强行改变,往往会变成一个更差的别人,以及一个更糟糕的自己。
第三,用成长替代改变。关键是有没有成长。
比如做汽车之家时,我认为做好业务就行,资本不重要,最后却折在资本上。做理想汽车后,我非常重视资本,请最好的 FA、最好的律所,设计股权架构和投票权。
今天大家可以看到,所有新势力企业里,理想汽车的股权架构、治理结构和现金管理做得最好。这没有改变我的业务,而是增强了一个能力,这就是成长。
成长能给自己带来能量。你不和自己纠结,再看待别人也一样。首先看别人的优点:这个优点能带来什么帮助,怎么让它发挥出来。
看到别人的不足,根本不是问题。从创业开始我就有合伙人,樊登是我不具备的互补,秦致也是我不具备的,李铁、马东辉、谢炎同样如此。
当看到大家的不足时,反而是我的价值。我能帮助他,他也能帮助我。
第三是看别人的成长。看到孩子成长、爱人成长、身边每一个同事成长,就有能量。成长带来能量,因为变好就有能量。
你关注的是人的成长,而不是事情。这样你能自己产生能量,也能带给别人能量,还能从别人那里获得能量。别人给你能量,也不会丢掉能量,这是一个辐射作用。
另一方面,亲密关系特别重要。亲密关系里要关注人。是我需要爱人、需要孩子、需要李铁、马东辉、刘杰、谢伟国、范浩宇,而不是他们需要我更多。
首先是我需要他们,连接就不一样。我们在一起能形成很强的脑力、心力和能量。
如果我对他们没有需求,就会进入糟糕模式:无视对方、想着战胜对方、逃避对方,或者变成内卷、内斗。
我身边无论家庭还是工作,都没有内斗。汽车之家时代也没有内斗。关键是大家相互带来能量。
张小珺
你最近看见的一个人是谁?
李想
我家里最近很有意思。过去我和我老婆之间相互支撑有限。从去年年底、春节以后,一个最大的变化是我们家的大女儿形成了第三个支撑。
她 14 岁了,对事情的理解发生巨大变化,三观逐渐完善,而且超出我们的预期。她能够和我们进行很好的沟通,讨论她的人生规划、喜好,以及她对人和事物的理解。
我们家实现了 3 个人的支撑,这让家里的能量大幅提升,也会影响其他孩子。每次和老婆聊到大女儿,我们都非常高兴,没想到她 14 岁就能成为我们两个人的支撑。
我们可以讨论事情、讨论人、讨论不同见解、讨论她的规划、出去玩,以及家里要解决的问题。我觉得特别好。
张小珺
有什么事情是你当爸爸之后才理解的?当爸爸对你有什么改变或更多认识?
李想
有 3 个重要变化。
第一,每个孩子都完全不一样。这让我认识到,人是用来发挥的,不是用来改变的。应该让他发挥特长和特性,一个人应该被放大、被发挥,而不是被改变,因为我连孩子都改变不了。
意识到这一点以后,组织就很重要。要把不同特点、不同擅长的人组合在一起,形成更完整的大脑、更完整的心力和更强的能量。
过去书上讲过这些东西,但我听不懂,有了孩子以后才真正懂。
第二,我意识到,对于身边的亲密关系,是我需要他们超过了他们需要我。我需要孩子,因为孩子让我变得更好;我需要爱人,因为爱人让我变得更好;我需要群组负责人和一级部门负责人,是他们让我变得更好。
他们对我的重要性,甚至超过我对他们的重要性,至少我是这么认为的。
所以在亲密关系里,要大胆表达自己的需求,因为所有人都希望被需要,这会产生非常好的能量场。
第三,孩子是用来完善我的。孩子出现以后,我能看到自己的更多不足,也能看到更多不同的人。孩子不会对你掩饰,每个孩子都不一样,能让你把人看得更全面、更透彻,也让你更好地处理人与人的关系。
因为孩子没得选,但你仍然要处理好,这对我们是更大的挑战。
张小珺
有了“我需要你比你需要我更多”的意识之后,会带来什么行为变化?
李想
你会更加主动、积极,不会等很多事情变成糟糕结果后才行动。
你会从关注人的角度理解问题。关注孩子的需求,他就会更多讨论自己的需求;关注孩子擅长的地方,他就会不断发扬自己的擅长。因为每个人都不一样。
这时候能量的主动权在我们自己手里。别人可以带来能量,但主动权在我们手里,我们可以主动做很多事情。
张小珺
构建家庭这个组织和构建公司这个组织,有什么不一样?
李想
首先我认为同等重要。工作的同事对我而言是不是亲密关系?当然是。
对任何人来说,工作体现社会价值。比如你是一个好的公司、一个好的管理岗位的人,去最好的学校面试,带着孩子去面试,你都会优先被录取。
为什么合理?因为你作为一个好公司,在那个岗位上创造了更好的社会价值,服务了更多群体,提供了更好的产品和服务,大家使用以后变得更好。
工作是我们的社会价值,人不能脱离社会价值。当你真正没有社会价值时,会发现社会价值非常重要。
工作做好,为客户和企业一起创造价值,这是社会价值。
家庭是亲情价值,亲情价值的终点是幸福,幸福就是高质量的陪伴。
这两者不同,却相辅相成。更好的工作带来更好的生活,更好的生活产生更好的能量,也让大家更好地工作,更好地处理连接关系,有能量把结果做得更好、更卓越。两者缺一不可。
张小珺
我之前和一位教授聊天,他说几年前和你聊过,感觉你的心灵观就是家庭观,这也反映到公司上,要创造幸福的家。他想问,你有没有更大的宇宙观、世界观?
李想
我的核心驱动力是掌控自己的命运,挑战成长的极限。
成长过程,是把个人驱动力变成个人网站的驱动力,再变成 IT 商业网站的驱动力,变成全世界第一的汽车网站的驱动力,最后变成汽车和人工智能汽车公司的驱动力。
这个驱动力很有意思。我为什么喜欢人工智能?因为人工智能本身的价值观和这个是一致的。人工智能的特点就是掌控自己的命运,挑战成长的极限。
我认为这是生命成长的意义,而且具备一定普适性。至于是不是要拯救人类,每个人观点不一样。
人从出生开始上学,到大学毕业、开始工作,有多少自己想做的事情没有做,有多少想接触的万物没有接触?
什么是智慧?智慧就是我们和万物的接触。如果没有去过森林,在森林里认真玩、住过几天,可能会认为木头只是用来做筷子、纸和桌子,而不会意识到它是一个生命,是和我们不同的生命。
如果不能和孩子长时间待在一起,只是匆匆交叉而过,没有和孩子一起生活、玩耍,就不知道什么是亲密关系,也无法真正理解孩子。
我觉得智慧就是我们和万物的关系。要提升和万物的关系,首先要有足够时间和万物接触。
今天大家很卷,但这恰恰是真正人工智能的意义。比如我们的销售人员、产品专家非常喜欢和客户接触,因为他们把好的产品、好的生活方式介绍并交付给用户,能见到不同的人,学到不同的东西,用户素质整体也比较高。
他们做这件事有能量,也有好的回报。但有些事情必须做,价值却不大,只会消耗能量。
比如每天在门店邀约客户,留下联系方式后打电话邀约到店体验和试驾。每天打很多电话,这个过程很消耗。
我和智能商业、销服负责人讲过,如果到今年结束,邀约电话还不能交给 Agent 解决,那你们的工作就是不合格的,人工智能就没有意义。
如果把这些工作交给 Agent,每天节省 20% 到 30% 的时间,减少大量能量消耗,他们就可以做更有价值的事情,时间使用率更有效,工作过程也更有能量。这是人工智能必须做的事。
张小珺
你觉得人工智能到今天,是在服务人类,还是在服务它本身?
李想
服务谁,取决于人类。
今天人工智能不能处理和万物的关系,和万物的关系仍然是人类在处理。人类希望人工智能成为生产工具,它就能成为生产工具;希望它是辅助工具,它就是辅助工具;希望它是信息工具,它就是信息工具;希望它作恶,它也能作恶。
至少很长一段时间,人类决定它做什么。
人工智能能力越来越强,但人类能量有限,算力也有限。人类应该把自己的算力和特点,用来解决智慧问题,处理和万物的关系,增加能量、做熵减。
让人工智能处理复杂信息和复杂数据,不断提升能力,压缩更多知识,自动做更多 action。人类和人工智能是合作关系,不是矛盾关系。
如果合作关系做好,人类仍然是文明的领导者。工厂里也不是人类焊接、涂装和冲压,而是机器在做。机器有取代人类的地位吗?我认为人工智能越强,就越需要人类的智慧变得更强,好的智慧和好的能力是协同关系。
张小珺
所以今天人工智能让我们更疲惫、工作时间更长,只是因为时间没到?
李想
我觉得是因为能力还没到。
张小珺
人能感受到幸福,你觉得 AI 能吗?
李想
当然不能。至少我认为,Transformer 这个架构、token 和 next token 的架构,并不具备自我意识。
张小珺
你不认为它会产生意识?
李想
我认为它没有自主意识,也不能进化。进化还是要通过再训练才能进化,可能要换架构。
未来可能产生这样的架构,但今天这个架构其实很好,而且对人类很安全。
今天大模型的架构,对信息安全、财产安全、人身安全,都可以靠人类对齐解决。人类对齐仍然能解决问题。
如果突破这个架构,人类可能就解决不了了。但能不能突破也不知道。至少今天这个架构,我认为人类还是安全的。很多人是多虑了。
张小珺
你为什么这么自信地觉得它安全?你看到了什么大家没看到的吗?
李想
它的工作原理就是安全的。如果想根本性改变输出结果,需要重新训练。仅仅通过 query 和 prompt,影响还是非常有限的。
张小珺
如果可以做一个理想的硅基生命,你会把它塑造成什么样?和你一比一复刻,还是想改变什么?
李想
我希望它变得更聪明、更有能力,但我更希望人类训练得更有智慧。
关于智慧在脑子里怎么运行,我们其实不知道。为什么很多聪明人一点都不智慧?我们今天解决的是智能问题,还没有解决智慧问题。
张小珺
你从多少岁开始觉得自己拥有智慧?你今年 44 岁。
李想
2008 年。
张小珺
这么早?
李想
对。那是我开始知道怎么处理和自己关系的时候。那次我要被赶出公司,后来又有了智慧,开始初步知道怎么掌握一点智慧。
张小珺
这几年的智慧升级是什么时候?
李想
还是因为要管理更大规模的团队,面对比原来水平更高的人。智慧也要跟着提升。
张小珺
最近一次有没有开悟的时刻?
李想
没有那么多天天不停的开悟。还是刚才讲的变化:把过去受益的、建立更强大脑、更强心脏、产生更强能量的方式,应用到更多人身上。
我发现确实有机会,至少一些实验的效果远超想象。
从战略角度,我和曾鸣教授学完战略以后,发现团队的战略能力很强。过去郎咸朋可能会说,你一个搞技术的有什么战略能力?但今天他在人工智能方面的战略能力一定很强,甚至比我更强。
过去不是他没有战略能力,而是缺少方法论。有了方法论以后,他的战略能力和战略定力就变得很强。
很多人很有能力,却没有产生好结果,可能是缺少一种模式:通过几个人,3 到 7 个人组成更强的大脑、更强的心力,产生更强的能量。
我做了一些实验,当他们按照这个方向做时,产出可能和我没有区别,甚至更强,只是过去没有掌握这个模式。
张小珺
你做了什么实验?
李想
实验目的是因为我觉得这个东西对自己好,大家也可以试试是否对大家都好。但今天一些实验结果远超预期。
张小珺
你怎么看人类内部的纷争,包括贸易战、地缘政治?
李想
还是因为人类智慧没有成长。
今天发生的事情,1930 年也在发生。我们看到的各种事情,都能从人类历史中找到对应的点。这是一个很大的挑战。
我在想,智慧能不能变成一种有效的教育和训练方式。这可能是人类解决自身问题接下来必须解决的事情。
张小珺
在培养孩子时,你会怎么让他拥有智慧?当然对小孩来说,“智慧”这个词比较重。
李想
孩子比较小的时候,我会启发他们,告诉他们怎么做,让他们思考和自己的关系:自己喜欢什么、擅长什么,什么对自己好。
很多时候我们在做潜移默化的训练,但太随机了。
比如孩子 0 到 12 岁,基本通过父母认知自己;接下来 12 年,从 13 岁到 24 岁,从初中、高中、大学到毕业,通过同学和老师认知自己;24 岁以后,又不断通过社会认知自己。
认知自己可以是随机的,也就是命。但有没有可能被训练,让你成为更好的自己,也更好地和别人相处?这些能不能成为教育的一门学科?
很多时候我和同事、校招团队沟通,就是希望沟通这些东西。它不是灌输,而是通过交流和启发。
希腊三杰也是通过对话产生智慧和哲学,所以人类需要更多智慧。
张小珺
AI 的智能有方法提升,但如果 AI 智力无限增强,人类智慧没有跟上,怎么办?
李想
有可能智慧只需要前进一点,就能解决很多问题。
人类有了民主结构、不同的组织设计,相比动物有了婚姻关系,又产生了学校和高等教育。这些都会发生变化。
你可以相信,5 到 10 年,AI 一定比人的能力更强。那人干什么?如何提升智慧,也是在解决人类自身问题。
张小珺
所以智慧的归因可以归到关系?
李想
智慧最重要的是处理和万物之间的关系,包括人与人之间的关系、人与万物之间的关系。
张小珺
你最近有改善过和谁的关系吗?所谓情商高的人,不一定是处理关系好的人,对吗?
李想
我的情商观可能是智慧的一个模块。一个有智慧的人,不只是能化解问题,还能给别人带来能量。
最近最明显的关系改善,得益于我女儿的变化。
张小珺
你最近 5 年有和谁闹掰过吗?
李想
亲密关系基本没有闹掰过,但一个人要变成我的亲密关系,很难。我会进行非常严格的筛选,不会刚见面就拍着肩膀说是好哥们、好兄弟。
核心是看他给我带来亲情价值、社会价值,还是像兄弟朋友一样互相理解。
如果不是这些,他就是社会中的普通一部分,伤害不到我,我也不需要和他闹掰。我对他没有价值索取,也不需要给他贡献什么。他只是人生中会出现、但无关紧要的人。
不要构建太多亲密关系。亲密关系太多,可能说明这个人不会经营关系。
张小珺
亲密关系的上限是多少人?
李想
没有固定人数。直系亲属,从小到大几个朋友,以及工作中和你一起扛责任的人,大概就是这些。
其他关系也有,但不是亲密关系。能给我们带来伤害的只有亲密关系,它既能带来伤害,也能带来价值和能量。如果价值和能量处理不好,就会变成伤害;解决以后,又会变成价值和能量。
张小珺
我昨天晚上问 ChatGPT,让它讲关于 AI 与人类的深刻洞察。它说,人类不一定永远站在进化之巅,人类习惯性地认为自己是最复杂的智能,但如果 AI 演化出更复杂的意识结构或更有效的集体智能,人类也许不再是中心物种。人类可能是孕育智能生命形态的中介,正在经历认知主权的让渡。你怎么看这些预言?
李想
这是一个未解的问题。人类和 AI 之间的关系是未解的问题。
如果 AI 解决了,AI 就统治人类;如果人类解决了,人类仍然统治文明。这肯定是人类出现以来最大的难题。
但我有信心认为人类可以解决。需要人类把智慧当成重要特质去发展。
不能要求每个人都拥有智慧,因为人的能力有差距。但人类最高的智慧,是否比其他生物更高,无论碳基生物还是硅基生物,只要人类掌握智慧的制高点,人类仍然是文明的带领者。
张小珺
在 AI 面前,什么是值得保留的人性?
李想
所有人性都应该保留,无论好的还是坏的。没有坏的,就没有好的。
一个人的优点,另一面就是缺点;好的另一面也有不好。只想保留好的、放弃所有不好的,并不成立。
好的和不好的都可以视为一种特质,是文化、生命、性格和能力的特质。这样才是活生生的、有生命力的世界,才是活生生的人。
叔本华的一本书里讲过,人不能改变,但人有自己的特性。
张小珺
你最近听过我的播客吗?哪一期印象比较深?
李想
小红那一期比较深。
张小珺
萧红,Red,我们叫她小红。为什么?
李想
评论区有人把你和她放在一起比较。我觉得大家对她的误解比较深,尤其是中国舆论对她的误解,认为套壳不是创新,套壳不是能力。
我觉得她把 AI 真正往 action 推进,去专业地做 action,像人一样做 To Do List,是一个非常重要的尝试。
她们也需要多融一些钱,补充更基础的能力,我觉得她们会变得更好。
张小珺
还是需要做人工智能的基础能力。
李想
对。因为现在你的对手不一样,对手能力都很强。如果对手都和你一样只是套壳,那套壳加上一定虚拟机和工具能力就够了;但如果对手都是强者,必要的模型能力还是要真正去练。