[BidClub_]
张小珺Jùn|商业访谈录 · · 166 min

118. 对李想的第二次3小时访谈:CEO大模型、MoE、梁文锋、VLA、能量、记忆、对抗人性、亲密关系、人类的智慧

张小珺李想

YouTube
TL;DR
  • 李想把AI的商业分水岭定在“能否成为生产工具”:不是给建议,而是替代专业工作并产生可付费的结果。 他把产品分为信息工具、辅助工具、生产工具;前两者不改变员工最重要的八小时与KPI,后者必须有action、能“知行合一”。身边仅Cursor和OpenAI Deep Research初步过线,因为程序员、商分和战略人员愿意自费。
  • 未来五年不会出现包办一切的通用Agent,更可能出现供专业Agent生长的Agent OS。 司机、医生、律师、程序员所需的数据、CoT、工具、对齐责任完全不同,真正的产品必须胜过对应职业并承担收入、财产乃至生命安全后果;李想因此只押注“司机大模型”,内部则让客服、销售、研发各自在统一Agent OS上训练自己的Agent。
  • DeepSeek改变了理想的资本开支和研发路径:开源语言能力让VLA计划提前约九个月,并大概节省几亿元成本。 理想没有因此停止基座模型,反而把训练卡采购提高到原计划约3倍:办公和理想同学使用约300B模型,自动驾驶VL基座为32B,再针对三维视觉、交通语料和VL联合数据自行训练。作为回馈,理想迅速决定开源自研汽车操作系统,这被李想定义为“纯粹是感谢DeepSeek”,而非公司战略。
  • 理想的VLA路线已经具体到模型规模、训练闭环和算力天花板,关键兑现节点是L3能力产品而非概念发布。 32B云端VL基座蒸馏为3.2B、8专家MoE,加入action后约4B;后训练只保留2—3步CoT,并预测未来4—8秒,再用人类接管和世界模型生成数据做强化。李想判断现有算力大致只支撑L3,能力最快于访谈当年三季度、最晚四季度出现,但法规仍是变量;L4可能要求32B模型直接跑在端侧。
  • 世界模型把自动驾驶的验证经济性从每万公里17万—18万元降到约4000元,并将成为训练、考试和L4运营系统。 它能精确复现车辆、交通参与者与特殊道路共同构成的corner case,而不是依赖实车“碰运气”重现;强化目标也可量化为舒适性G值、交通合规、无碰撞及从A点抵达B点。“正因为行业遇到了问题”,李想把当前阶段称作“黎明前的黑暗”。
  • 理想把自己重新定义为“全球领先的人工智能终端企业”,但要求用L4和组织效率证明估值。 李想给AGI终端设定四项条件:360度感知、认知决策、action、反思反馈;公司可能从SUV扩向家庭轿车、MMPV和其他终端,却仍以规模约束扩张。检验标准不是叙事,而是能否率先做出L4,以及用10万人以内、甚至5万人做到1000亿美元收入;做不到,就“应该给我们一个车企的估值”。
  • 技术路线背后是一套反人性的组织方法:能力要经历研究、研发、表达、业务,业务要经历分析、目标、策略、复盘。 李想将DeepSeek视为“极简地用了人类最佳实践”,也承认组织最常犯的错是跳过研究、只改策略;他正把3—7人组成的团队设计成MoE式“更强大的大脑和更强大的心脏”。更长远的判断是,AI会超过人的能力,但智能不等于智慧——“智慧就是我们和万物的关系”,人类若要继续领导文明,必须用AI释放时间与能量,而不是让工作日更长。
Digest · the substance, structured for research

1. 人类是小模型,AI应该承担信息复杂度

  • 李想拒绝把人的上下文窗口简单换算成token:人类生理上不擅长处理复杂信息,大脑又需要消耗能量,因此方法论和工具的本质都是“人类要做熵减,而不要去做熵增”。

  • 他的类比是,人读书、学习知识近似预训练,把知识转成业务近似推理,再通过推理调用工具;但人更像受过专业训练的小模型,而不是覆盖所有知识的巨大基座。

  • AI则可处理从15T增长到约30T的数据规模,最新的Llama 4也被他作为例子提及;但进入专业领域仍需要更高质量的数据和更专业的CoT。双方最合理的关系不是替代叙事,而是“各自做各自擅长的事情”。

2. 中国模型在130天里拉近了与美国的距离

  • 回看两次访谈间的130天,李想认为最大的进步不在自己,而在中国:DeepSeek、千问让基座、reasoning和多模态能力与美国“基本拉近了,或者基本在一个水平线上”。

  • 他尤其强调中国团队的训练和推理效率,以及深层工程改造带来的信心;Manus和Genspark在Agent上的突破,也让他相信中国可以继续把AI产品做得更好。

  • 但语言模型只是世界的一部分。要让汽车或机器人横跨数字世界与物理世界运行,还需要视觉、行动、操作系统、工具和对齐,这也是理想继续做VLA的理由。

  • 张小珺追问李想本人是否变聪明,得到的答案却是“没有那么大的变化”:AI进步很快,但他和身边人的工作时间没有减少,成果也未发生实质改善,这个悖论成为整场访谈的起点。

3. Chatbot正在制造一种新的熵增

  • 李想对当前Chatbot的批评是,它必须输出next token和一个确定结果;用户又普遍先打开联网搜索,但RAG索引到的信息源可能已经失真,于是模型“很认真地推理”,过程和结论仍从根上出了问题。

  • DeepSeek刚发布时,人们把它的推理过程转成图片发到小红书;几个月后没人再发,因为内容开始“千篇一律”。在李想看来,这说明推理过程本身并不自动形成持续价值。

  • 更现实的约束来自组织:AI即使给出股票、职业或工作建议,员工每天仍优先完成公司设定的KPI、OKR。建议只是在脑中空转,没有进入工作主流程,也没有改变八小时的产出。

4. 付费意愿划出了三类AI工具的边界

  • 李想把AI产品分成三级:信息工具提供参考,辅助工具改善现有体验,生产工具则真正替代专业劳动。车载语音、导航、音乐和辅助驾驶属于第二级,因为人仍不能离开。

  • 他的商业化判断很直接:“一个信息工具往往你并不愿意付钱,一个辅助工具你认为是一个产品应该带的。”只有生产工具会让用户单独付费,因为它改变了工作结果。

  • 理想内部被员工自费验证的两个初级生产工具是Cursor和OpenAI Deep Research:前者进入程序员的编码流程,后者进入商分和战略团队的研究流程。“人工智能变成生产工具,才是真正人工智能爆发的时刻。”

5. Action和工具调用比更长的答案更重要

  • 生产工具必须“有action,不能只是知,必须行”。无论O2、O3还是DeepSeek R1多聪明,只做策略推演仍未完成工作;控制电脑、软件、车辆或机器人,才能真正产生价值。

  • 李想用挖坑解释模型与工具并不冲突:“你比我聪明十倍,你拿勺挖一个坑,我拿铲子去挖一个坑,我再笨,效率都比你高。”工具带来更高确定性、更少能量和token消耗,更强的大脑反而能设计更强的工具。

  • 他肯定Manus向生产工具迈出的产品步幅:借助虚拟机和工具,分析特斯拉时直接进入SEC、投资者关系网站及头部分析师报告,而非只做RAG索引。挑战是通用覆盖面太宽,也解释了为何分工没那么精细的创业公司反而先组合出产品。

6. 三个变量只有围绕规模才值得调整

  • 面对一家三万多人的公司,李想不会因单项技术更新立刻改组织。他把规模置于中心,外层放用户需求、技术产品和组织能力三个动态变量,只有用户变化与技术变化真正结合,组织才必须跟上。

  • 这套诊断也抑制追热点式改组:“今天出这个东西调整一下,明天出个东西调整一下”会制造混乱。过去130天,技术变量主要由中国AI推动,国际环境也发生变化,但理想组织本身不会瞬间变成更智能的组织。

7. DeepSeek V3展示了能力建设的四步法

  • 李想把DeepSeek V3视为人类最佳实践的极简样本:这个671B的MoE模型把多个专家组合起来,而构建专家能力的第一步不是研发,是研究。

  • 完整路径是“研究—研发—能力表达—业务价值”。研究先解决认知与路线,研发把认知变成可用能力,产品再把能力展示清楚,最后必须进入真实业务作战。

  • 理想在端到端、VLM、VLA、芯片和操作系统上都沿用这条路径;李想以论文被李飞飞等研究者引用为证据,说明研究不是装饰,而是后续研发效率的前提。

  • 能力表达也不是营销包装。理想在车内展示端到端如何选择轨迹、attention关注什么、VLM如何理解ETC、红绿灯和复杂道路,是为了让用户与组织看见模型能力如何工作。

8. DeepSeek R1把业务闭环压缩进推理链

  • 李想从R1的思维链中读出另一套最佳实践:先做索引分析,再从用户给出的方向中确定目标,随后输出策略并推演执行,最后反思结果与目标的差距。

  • 映射到业务,就是用户与市场分析、确定目标、形成并执行策略、复盘。若结果差距来自业务策略,就继续分析和调整;若来自能力差距,就回到研究与研发,而不是硬推业务。

  • 他同时保留关键限制:R1给出了“行的策略”,但没有控制机器或电脑完成action,因此还不是完整的知行合一,只是一个非常好的“脑系统”。

9. 组织最爱跳过研究,也最爱只改策略

  • 能力建设中,人最容易一上来就研发,既不研究,也不展示能力,更不进入市场实战;业务遇到问题时,又最容易直接改策略,不复盘、不分析用户,也不重新共同确定目标。

  • 李想承认严格遵循最佳实践“是反人性的”,随心所欲才满足人性。卓越个人和卓越组织因此必须持续对抗懒惰、捷径和个人独断,而不是把方法论写完便算拥有能力。

10. 梁文锋的优势被概括为自律与高成功率研究

  • 李想只在2024年9月、OpenAI o1发布前几天与梁文锋聊过一次。他留下的第一印象是极强自律:能够坚守相信的原则,与懒惰、走捷径的人性做对抗。

  • 第二个判断是,梁文锋会在全球范围研究最佳实践和方法论,并把个人的高成功率路径组织化:“做任何事情先搞研究,先搞分析,然后再做,成功率就很高。”

  • 关于年轻人研究,李想的解释是,成熟研究者往往已经有自己的框架,可能反而成为障碍;他还转述梁文锋提到,中国教辅材料包含完整的解题过程和反馈,是很好的强化训练体系。理想后来把这一思路映射到交通规则、舒适度和驾驶接管。

  • 李想称当时梁文锋估计与OpenAI还有约一年差距,但从o1前夕到R1发布只用了三四个月。对于OpenAI,他仍承认其研究、研发、产品和传播都很强,吉卜力风格生图及“一周超过4亿访问用户”是综合能力的例子,领先多久则“很不好说”。

11. DeepSeek选择训练能力,而非吞下全部流量

  • 面对春节期间的高流量,李想推测DeepSeek没有全力承接DAU,是因为卡有限:若全部用于推理,便无法继续训练和提高能力。保留一定用户query有价值,但过量流量未必同样有意义。

  • 他不认为自己本应做出DeepSeek:“我只能做最好的自己。”梁文锋从浙大人工智能、量化模型和工程能力一路延伸至大模型;理想的延长线则是产品、汽车和物理世界终端。

  • DeepSeek开源给理想带来的直接收益,是把原计划当年9月才能完成的语言能力提前约九个月,并大概节省几亿元成本。李想把它称为“站在巨人的肩膀上”,而不是放弃自己的模型能力。

12. 理想用开源语言层加速了自有VLA

  • 春节期间,李想先与谢炎讨论:理想到9月自研出的语言模型未必强过DeepSeek V3加R1,既然开源程度“基本接近Linux,比安卓开放得多”,就应该直接用作VLA的L部分。

  • 他最初担心模型负责人陈伟难以接受,结果陈伟比管理层更坚决,认为应以DeepSeek为基础加速VLA和端到端多模态;研究、编译和芯片团队则同步优化训练与推理效率。

  • 组织随后按三种业务形成不同需求:内部办公需要language加Agent OS;车机、手机上的理想同学需要实时语音和视觉组成端到端VL;自动驾驶与工厂机器人需要VLA。因此需要不同团队为三类业务做适配的模型。

  • 理想仍必须自行训练,因为汽车需要3D vision、高清2D vision、交通与家庭语料,以及VL联合数据;OpenAI和DeepSeek没有理想的车辆数据、场景和业务目标。开源L只是VLA的一部分,不是完整答案。

13. 基座投入和产品推广走向了相反方向

  • 理想把当年训练卡采购提高到原计划约3倍:给理想同学使用的模型预计约300B、即3000亿参数,自动驾驶的VL部分使用32B版本,真正工作中也会使用300B模型,具体规模会按需求区分。

  • 对理想同学App,李想反而要求暂不买量、不营销,先练能力和理解需求。车机端兼具信息和辅助工具属性,手机端当时仍主要是信息工具;电脑端和网页端属于未来扩展。理想先把这些版本做好,服务需要连接的120多万用户。

14. VLA是从昆虫、哺乳动物到人类司机的连续进化

  • 李想把智能驾驶当前阶段称为“黎明前的黑暗”:行业问题集中暴露,恰好意味着下一代能力将到来;理想做增程、5C充电和操作系统,也都源于解决行业无法解决的问题。

  • 规则算法加机器学习感知像昆虫智能:模型只有几百万参数,还依赖高精地图和大量限制,最终接近“有轨交通”,只能在既定规则中完成任务。

  • 端到端像哺乳动物学习动作:它模仿人类开车,看到三维图像、感知自身速度并输出轨迹,泛化显著提高,却不真正理解物理世界;遇到未见过的复杂场景,往往只能停下。

  • VLA才接近人类司机:同时读取3D世界、高清2D细节和导航软件,用language及CoT理解语义,再以action执行并沟通。理想因此不把它叫抽象大模型,而叫“司机大模型”。

15. VLA预训练从32B的VL基座开始

  • 第一步是在云端训练32B的VL基座。视觉语料分为3D物理世界和高清2D图像;后者的识别距离相较常见开源VLM提高约3—5倍,解决远距离细节不足。

  • 语言部分不是通用网页语料的简单延伸,而是交通和驾驶相关语料;更难的是VL联合数据,例如把导航地图、驾驶员对地图的判断及车辆记录的动作共同做成训练语料。

  • 32B基座随后蒸馏为3.2B端侧模型,并采用8个专家组成的MoE;若直接运行完整3.2B模型,双Orin X或Thor-U上的token输出率和帧率无法满足实时驾驶。

16. 后训练把知识模型变成约4B的驾驶模型

  • 李想把预训练比作先学习世界和交通知识,把后训练比作去驾校。此时加入action,以模仿学习把视觉、理解和动作连成端到端,模型由3.2B扩展到接近4B。

  • 安全延时决定其CoT只能保留2—3步,不能复制长链reasoning;交通和机器人场景没有时间等待模型进行冗长自我辩论。

  • Action输出后,模型还通过diffusion预测未来4—8秒的环境和轨迹。理想把这项预测视为司机本身的能力,而不是另立一个“世界模型”。

17. 强化学习先对齐社会,再争取超过人类

  • 第一层强化是RLHF:用驾驶员接管、不接管、习惯和安全判断,让模型遵守交通规则,也融入中国道路上的正常驾驶方式,避免成为妨碍其他车辆的新手。

  • 第二层是基于世界模型生成数据的纯RL,不再逐步给人类反馈,只要求从A点抵达B点,并以三类结果约束:G值代表舒适性、是否违反交通规则、是否发生碰撞。

  • 李想的递进关系很明确:预训练像学知识,后训练像驾校,RLHF像进入真实社会并与人类对齐,纯RL则通过世界模型生成的数据,让它开得比人类更好。

18. 司机Agent把VLA变成用户真正雇佣的产品

  • 人类不需要学习机器指令:“你跟一个正常驾驶员怎么说,就跟司机Agent怎么说。”短指令由车端VLA直接处理,复杂长指令先交给云端32B VL理解,再下发给端侧执行。

  • 北极星指标不是单一接管率,而是对人的三项判断:专业能力是否足够强,职业性是否保证安全舒适,记忆与沟通是否建立信任,最终达到“我说上半句,他就知道下半句”。

  • 李想把超级对齐类比为职业性:赛车手可能能力强,却不适合每天载人;职业司机必须既开得好,又遵守规则、照顾乘员感受,并在长期记忆中理解雇主。

  • 定价也应参照被替代劳动。如果人类司机每月1万元,用户可能愿意用2000—3000元使用一个AI司机;未来还可能把保险、自动充电或一定里程的电费打包,前提是总成本确实更低。

19. 交通是专业VLA最早落地的试验场

  • 交通世界“复杂但具备确定性”:车只能沿道路行驶,规则和目标清楚,控制主要是前后、左右及轻微旋转的两到三个自由度;人形机器人一开始就是40多个自由度,难度完全不同。

  • 汽车也天然适合模仿和强化:传感器记录人看到的世界,车辆记录人的action,接管就是未对齐反馈;舒适、合规、碰撞和A到B都能量化。

  • 张小珺把这概括为“造司机”。李想认可,并强调L2、L2+仍是辅助工具,只有真正承担司机工作才是生产工具;是否比专业司机更好,是比“能否展示几个功能”严格得多的标准。

20. 五年内的通用Agent更准确地说是Agent OS

  • 李想给出明确判断:“五年之内没有通用Agent,会有一个Agent OS。”司机、医生、律师和程序员依赖完全不同的vision、language、action、专业数据、CoT与责任体系,不可能由一个泛化模型直接包办。

  • Agent OS负责提供工具、虚拟机和专业Agent开发的基础,专业人员再把自己的数据、语料、流程和思维链放进去,形成能接管高频工作的Agent。

  • 理想对外最有资格做的是司机Agent,教育应由猿辅导、好未来等专业团队完成。对内则需要客服、编程、销售电话、验证实验等多种Agent,并允许一个专业人员带领多个Agent工作。

  • 智能商业、基座模型和操作系统团队应共同搭好内部Agent OS,但客服Agent必须由客服部门开发,销售Agent由销售部门开发。“不会有一个团队帮大家做好”,平台只能让专业团队更容易做好。

21. 端到端没有被抛弃,它成为了VLA的Action层

  • 张小珺追问端到端上线一年是否就被换架构,李想的回答是连续演进:端到端训练出的执行能力正是VLA的A,只是现在增加更强的3D/高清2D vision及language。

  • 直接跳到VLA“没有可能”,因为“没有办法直接摘第十个包子”。规则算法做不好,就不知道怎样做端到端;端到端未做到极致,也不知道如何训练VLA。

  • 他把迷信一步到位称为“练葵花宝典”。DeepSeek的效率同样来自长期集群、链路和基础设施优化,而非突然发现捷径;理想自2021年开始智驾自研、2023年研究端到端,前序积累不可删除。

22. 编译、芯片和操作系统决定模型能否上车

  • Orin原本不直接支持理想所需的语言模型,理想的编译团队因此改写底层,以INT4运行VLM;李想将其类比为DeepSeek用FP8优化训练,都是用工程能力穿透硬件限制。

  • 双Orin X与Thor-U都能运行与其他平台同等规模的VLA,还依赖板卡、芯片、操作系统和实时计算能力。李想的结论是,规模小时可绕过基本功,规模大后“基本功和能力永远是无法逾越的”。

23. VLA将“停下来”升级为理解、沟通和绕行

  • 复杂修路是最典型的corner case:规则算法可能撞上,端到端可能停车犹豫,VLA则能理解复杂场景并处理可行路径。即使首次不会,李想称可用生成数据训练,三天之内处理相关场景。

  • 长期模糊的公交车道展示了沟通差异:端到端被临时拨回中间车道后可能再次驶入;司机Agent却能理解“接下来一直在中间行驶,直到下一个导航节点”的持续约束。

  • 错过导航时,端到端容易失去目标;VLA可以在小区或开放空间先漫游处理,再与重规划路线汇合。李想没有所谓aha moment,因为动物突然学会动作令人惊讶,“一个人做好东西”反而显得正常。

24. 世界模型同时承担考场、数据工厂和运营系统

  • 理想定义的交通世界模型是通过重建加生成构造的完整物理世界,包含道路、固定物体和全部交通参与者;VLA像司机,既能在真实世界驾驶,也能进入仿真世界考试。

  • 它有三个阶段:先作为模型考试系统,再生成训练数据,最终成为L4无人车的运营系统。传统IT软件无法管理大量没有司机的车辆,世界模型必须承担实时运营。

  • 这与部分机器人论文把“预测未来几秒”称为世界模型不同。理想把4—8秒diffusion预测放进司机能力,把可运行、可交互的交通环境本身称为世界,刻意让AI产品概念与人类理解对齐。

25. 仿真把每万公里验证成本压到约4000元

  • 过去靠人类司机跑一万公里,连车和各种费用的成本约17万—18万元;世界模型上线后降至4000多元,主要剩算力费用,解决问题的效率反而更高。

  • 实车难以同时重现某辆自车、多个参与者、相同速度位置及特殊道路,往往只能模糊验证;世界模型可以“百分之百还原一模一样的真实场景”,精确检验修复后的模型。

  • 黑盒因此并不等于不可测试。模型可以在仿真城市中反复接受A到B、舒适性、合规性和安全性考试,失败场景再进入生成数据与训练闭环。

26. 超级对齐把强能力约束成职业司机

  • 理想在做到1000万公里以后开始建设超级对齐团队,规模超过100人。典型问题不是不会开,而是拥堵时频繁加塞、效率虽高却让乘员不安,学到了不该学习的驾驶行为。

  • 李想区分能力与价值观:是否碰撞更多是模型能力,是否加塞、是否符合人类习俗与乘坐感受则是对齐。“能力越强,责任越大”,就像能力强的人更需要职业性约束。

  • 招聘卓越员工的三个维度也被移植到Agent:专业能力、综合职业性,以及理解别人并建立信任的能力。模型负责第一项,超级对齐负责第二项,Agent的记忆与交互负责第三项。

27. 算力决定L3、L4的能力上限

  • 李想认为VLA能够解决全自动驾驶,但未必是效率最高的终极架构;它仍基于Transformer,当前能力最强,却需要很高算力,未来“大概率”会出现更高效架构。

  • 双Orin X或一颗Thor-U拥有约64GB显存,理论上或可装下约30B模型,但无法达到驾驶要求的帧率;所以当前端侧只能运行3.2B、加入action后约4B的版本,能力存在上限。

  • 他的推演是:若未来32B模型可直接跑在端侧,L4可能实现;云端VLA届时也可能扩到320B。现有一代算力“基本上就是L3的水平”。

  • 时间判断保留了条件:访谈当年最快三季度、最晚四季度可看到真正具备L3能力的产品,但法规及后续问题仍可能影响商业交付。

28. 规则算法仍是模型时代的高效工具

  • VLM处理两三个ETC入口尚可,面对十几个入口却因位置判断能力差而混乱。团队连续三四个月增加语料仍未解决,李想最终要求用规则算法表达最多约15个入口。

  • 这个程序不到一周便完成,ETC表现随即稳定。李想借此反驳“模型解决一切”:确定性规则能以更低算力、更少token和更高准确率完成任务,就应该保留。

  • 他的类比是人类会背乘法口诀;它本质上也是规则算法,却显著节省脑力。大脑和工具从不矛盾,真正落地时必须同时优化能力、确定性和能耗。

29. 战略推理从规模倒推用户、产品与组织

  • 李想把2027年前后三年的规模目标当作CEO大模型的长链推理起点:规模对应时间,再逐一推演用户需求、技术变化、产品形态和组织能力,最后必须转成action,“有想法和能落地还是最大的鸿沟”。

  • 理想去年收入约1450亿元,访谈当年预计有1000多亿元收入。如果继续走向3000亿、5000亿甚至更高,只依赖家庭SUV可能触及品类上限。

  • 年销量从约50万辆迈向100万辆以上,用户群规模将接近BBA,需要覆盖过去未触达的人群并改变沟通方式;面向全球时,家庭定位仍可保留,但不能只等于SUV。

  • 产品推论是进入家庭轿车和更丰富的MMPV产品,而不是运动轿车;同时继续控制SKU,避免用无序车型数量换规模。这是需求与规模推导出的扩张,不是看到新技术便扩张。

30. 理想选择成为AGI时代的终端公司

  • 李想给2030年的身份回答是“全球领先的人工智能终端企业”。相较模糊的人工智能公司,这次增加“终端”,意味着选择软硬件与服务结合,而非只做模型平台。

  • AGI终端必须满足四项条件:360度感知物理世界、完成认知决策、执行action、对结果反思反馈。汽车正从智能终端变成人工智能终端,也可能成为人工智能时代营业收入最高的终端,做到千亿美元收入。

  • 理想未来不一定只做车,但不会再做上一时代的普通终端;任何新品都必须符合四项条件,并覆盖用户生活或工作中的主要场景。

31. 组织能力按百亿、千亿和更大规模分阶段学习

  • 理想ONE阶段学习丰田工作法、GM研发流程和Google OKR,完成第一款车研发交付,累计销售20多万辆、创造超过100亿美元收入。

  • 从百亿迈向千亿时,公司重点学习华为的IPD、财务、流程和人力资源三支柱,配合L系列平台化研发与更大销售组织,快速做到超过1000亿元收入。

  • 走向3000亿元以上时,苹果重新变得可理解。李想坦言公司规模较小时看不懂苹果;规模到了千亿,才逐渐看见它如何从Mac扩到iPod、iPhone和服务生态,以及大规模组织能力为何需要长期建设。

32. AGI终端的软件、硬件和服务都要重做

  • 软件侧需要三层:理解物理与数字世界的模型、高性能实时操作系统、以及Agent调用的确定性工具。传统安卓式后台排队和AUTOSAR式链式结构,都未必适合NPU、MCU并行运行的实时AI终端。

  • 硬件侧首先是本体和线控系统,其次是集中与分布式计算的组合,而不是迷信单一中央大脑;这有助于减少线数、提高传输效率。

  • NPU被李想比作心脏:同样10Hz,终端若只能运行3B,对手却能运行30B,就是10倍性能差距。云端可堆卡,端侧受功耗、空间和实时性约束,更需要芯片与编译自主能力。

  • 服务侧要解决两件事:怎样运营在物理世界运行的大量Agent,以及人怎样同时带领多个Agent。世界模型、Agent OS和连接机制不是附属软件,而是AGI服务本身。

33. 工厂更应该变成机器人,而不是简单塞进人形机器人

  • 李想对制造业AI的设想是“拿AGI来生产AGI的终端”:工厂整体像“宇宙大帝”一样成为机器人,通过感知、决策和自动反馈简化全部流程。

  • 他不赞成只把人形机器人放进原有人类工位:工厂人工成本占比没有外界想象得那么高,简单替代未必经济;长期而言就业仍有必要。更大的机会是提升整个生产系统效率。

  • 穿戴终端仍未成熟。眼镜虽可能具备360度感知,但光波导或集中显示、电池、独立计算和通信都未达到长期使用标准;研究可以先行,产品节奏不能凭想象确定。

  • 家庭机器人也未收敛:可能是人形机器人拿人类锅铲,也可能是统一感知与大脑加改造后的智能锅具。理想不会提前宣布路线,而会等待研究和行业能力决定哪条路径成立。

34. 扩张是否合法,只取决于规模与能力回报

  • 李想认为小公司应尽可能收敛,规模大时则必须扩张;Google若只有搜索、微软若没有Office和云、苹果若只做Mac,都可能成为另一家企业。

  • 理想已有一千多亿元收入并走向两千亿元,做操作系统、芯片和模型在他看来已到合理时点。苹果2001年推出iPod时,收入只有几十亿美元,却已拥有电脑、操作系统和软件生态。

  • 自研操作系统四年投入约10亿元,李想估计累计节省50亿—60亿元,还增强国产芯片支持和开发效率。“它既能增强能力,又能降低成本”,因此不是摊子铺大,而是规模经济。

35. AI估值必须由L4与人效兑现

  • 李想不希望市场在能力未显现前给理想AI溢价,“反而心里慌”。第一个检验是能否率先实现L4,让用户上下班不再守着方向盘,而是坐在桌前工作、吃东西。

  • 第二个检验是组织生产率:目前接近100万人规模的组织创造7000多亿元收入;理想若能用10万人以内、甚至5万人做到1000亿美元收入,才证明AI战略真正产生价值。

  • 若两项都做不到,“你就应该给我们一个车企的估值”。这也是访谈中最明确的估值纪律:技术、终端身份和宏大叙事必须落到销量、收入、劳动效率和可收费服务。

36. 理想会因需求、技术或组织任一断裂时消失

  • 李想给出三种死亡原因:没有把握用户需求、没有掌握最好的产品技术、组织能力发生巨大问题。三者必须相互诊断,单独看任何一项都会失真。

  • 他承认公司看得远,但自称当下仍“脚踏实地”,因为编程时代比较功能,AI时代比较能力以及能力如何变成业务;跳过能力直取结果,仍是“练葵花宝典”。

  • 战略会和现实工作始终有反对意见,甚至有人在项目被停后私下继续验证。若结果证明成立,李想会重新认同;他不把一致等同于没人争论。

37. 有能量的争论才会形成组织智能

  • 李想区分争论与内耗的标准不是声音大小,而是连接是否仍有能量:能量存在时,争执、讨论和吵架构成“一个更完善的大脑”;连接消失后,同样动作就变成内耗。

  • 汽车之家最困难时,他、秦致、樊铮形成三人支撑:三个人对外一致,对内通过争论补全判断,一旦决定,又成为相互补资源和心力的强大心脏。

  • 理想汽车也沿用同一机制,从李想、沈亚楠、马东辉、李铁,到谢炎、邹良军等人逐步加入;重点不是CEO一个人随心所欲,而是让多人判断强于单脑、执行时又没人独自倒下。

  • 他经验上认为3—7人最稳:两个人太少,超过七人又难形成紧密连接。这个数字不是量化研究,而是长期直觉,也像MoE——多个小专家形成脑力和心力支撑,再连接更大的组织。

38. “在意用户”和“在意身边的人”是能量连接的前提

  • 李想把连接归结为“两个在意”:共同在意客户与用户,这是价值观共识;同时在意身边共同扛责任的人,“先对人再做事儿”,而非抽象地只讲对事不对人。

  • 他会主动把核心负责人拉到一起,再通过一次次真实事件训练协作。只有共同经历资源短缺、判断争执和结果责任,三到七人的结构才会从组织图变成真正的支撑。

  • 这也是他最近最大的个人成长:把自己过去受益的合伙模式提炼出来,帮助更多团队形成“更强大的大脑、更强大的心脏和更强的能量”。

39. AI组织可以兼容制造业,而不是消灭制造业管理

  • 李想认为高维管理能兼容低维流程:数字化可以容纳工厂、销售和IPD,AI组织同样可以让不同业务采用不同方式;工厂、操作系统、整车和智驾不必共享一套组织模板。

  • 理想真正做端到端的团队约200人,模型团队约100多人;竞争对手的规则算法团队可能有2000—6000人。模型、研究和数据外围另有人员,但核心小团队体现了新架构的人效差异。

  • 智驾和模型团队约60%—70%来自校招,很少依赖所谓行业大拿。李想把这部分实践与梁文锋的启发相连:研究需要年轻人突破既有框架,场景、数据、持续资金和公司是否真信AI,比头衔更能吸引人才。

  • 他澄清自己并非80%—90%时间只看AI:一天工作时间约60%用于组织和人,包括面试与培训;其余工作大致一半用于汽车业务、一半用于AI。作为CEO,他相信“AI不是科学,AI是工程”,并靠结构性问题帮助团队澄清架构。

40. 十年记忆被重写成能力增长,而不是苦难史

  • 李想最鲜明的幸福画面是2018年理想ONE首次发布、2019年上海车展正式展示并公布价格时获得最大人流,以及2022年L9成为后来至少五家企业模仿的产品。

  • L9高峰后紧接全网黑公关、倒闭传言和单季接近20亿元亏损;但他选择记住这场危机暴露了能力缺口,并推动2023年收入接近三倍增长、达到约1200亿元。

  • 他的记忆策略是“尽可能只保留那些有价值的、美好的片段”,把坏事解决后迅速忘掉;按时间计算创业当然苦更多,但“没必要苦哈哈的”,苦甜只是同一枚硬币的两面。

41. 成长不是改掉自己,而是增加新的能力

  • 李想说自己今天约90%的状态和高中时代相似:遇到问题便解决,尤其解决别人不愿解决的用户问题,并寻找合伙人弥补个人能力;变化的是问题、用户和组织规模。

  • 他把2008年差点被赶出公司的经历视为智慧起点,因为那时开始认真处理与自己的关系。汽车之家曾因轻视资本受挫,做理想时便补上FA、律所、股权、投票权和现金治理,这不是改变产品本能,而是新增资本能力。

  • 对自己,他主张接受全部优点,也接受不足,因为不足往往是优势的另一面:擅长高维决策的人可能不擅长精细运营,懒惰的人可能成为优秀产品经理,强运营者却未必擅长跨维判断。

  • “用成长替代改变”让人避免成为更差的别人和更糟的自己。成长本身产生能量,也让一个人可以通过合伙结构获得自己不具备的能力。

42. 人是用来发挥的,不是用来改变的

  • 成为父亲后,李想最先确认每个孩子都完全不同:“人是用来发挥的,人不是用来改变的。”组织的作用,就是把不同特长、性格和不足组合成完整大脑,而非把所有人改成同一种模板。

  • 第二个领悟是“我需要他们”超过“他们需要我”。孩子、爱人和共同承担责任的高管让他变得更好;大胆表达这种需要,会让对方感到被需要,也让关系从控制转为相互支撑。

  • 第三个作用是孩子帮助父母看见自己。孩子没有掩饰、又无法选择,迫使父母理解不同类型的人,并学习如何处理无法逃避的关系。

  • 这种认识带来更主动的行为:关注孩子的需求和擅长,问题尚未恶化便沟通。别人可以给自己能量,但“能量的主动权”仍在自己手里。

43. 三个人的家庭支撑让亲密关系产生新能量

  • 李想与妻子过去的相互支撑有限,14岁的大女儿在访谈前后成为第三个支点:她形成较完整的三观,能够讨论人生规划、喜好、家庭问题和旅行,家庭出现了三个人相互支撑的结构。

  • 他认为亲密关系首先源于需求,而不是独立姿态;若对身边人毫无需求,就容易无视、逃避、竞争或内斗。家庭和公司都应让成员相互提供脑力、心力与能量。

  • 亲密关系也不宜泛化。直系亲属、少数多年朋友和工作中共同扛责任的人才属于核心圈;“能给我们带来伤害的只有亲密关系”,因为只有这些关系同时承载真正的价值与能量。

44. 工作创造社会价值,家庭创造亲情价值

  • 李想把长期共事者也视作亲密关系,因为工作承载个人的社会价值:更好的产品和服务让更多用户受益,工作与企业由此创造社会价值。

  • 家庭对应亲情价值,其终点是幸福,而幸福被定义为“高质量的陪伴”。工作和家庭不是互相牺牲:更好的工作支撑生活,更好的生活产生能量,再改善工作结果。

  • 他的自我驱动力仍是“掌控自己的命运,挑战成长的极限”,从个人网站、汽车之家扩展到汽车和AI终端;他认为这也与AI不断提升能力、压缩知识和扩展行动的方向相通。

45. 智慧来自与万物建立关系,而非继续堆智力

  • 李想给智慧下的定义是“我们和万物的关系”。没有在森林里生活过,人只把木头理解为筷子、纸和桌子;没有长期陪伴孩子,也无法真正理解亲密关系。

  • 与万物建立关系首先需要时间。人类若把全部精力耗在复杂信息、重复劳动和内卷上,就失去了体验世界、理解他人和获得智慧的机会,这才是AI生产工具更深层的意义。

  • 他给理想销售体系设下具体目标:邀约电话必须交给Agent,若访谈当年结束仍未实现,智能商业和销服工作便“不合格”。若这些工作交给Agent,可能节省20%—30%的时间,并减少大量能量消耗。

  • 人类有限的算力应处理关系、智慧与熵减,AI则处理复杂数据、知识压缩和自动action。双方是合作关系;机器早已承担焊装、涂装和冲压,但这不意味着机器取代了人类的主导作用。

46. 当前Transformer没有意识,但更强架构仍是未解题

  • 李想明确认为当前token与next-token架构没有自主意识,也不能自我进化;模型要根本改变输出,仍需人类重新训练,query和prompt能造成的变化相对有限。

  • 因而他判断当前大模型对人类“挺安全”,信息、财产和人身风险仍可通过训练与对齐约束;若未来突破Transformer并出现自主进化架构,人类是否还能控制,他只给出“不知道”。

  • AI解决的是智能,而非智慧;聪明的人可能一点都不智慧。李想预计五到十年内AI能力一定超过人,届时人的课题不是继续与机器比智力,而是发展处理自己、他人和万物关系的智慧。

47. 人类能否继续领导文明,取决于智慧能否被训练

  • 李想把贸易冲突和地缘纷争视为智慧增长缓慢的证据:今天发生的事情在1930年也能找到对应。他因此追问,智慧能否像能力一样变成教育和训练,而不是只靠命运随机获得。

  • 儿童先通过父母认识自己,青少年通过同学和老师,成年后通过社会;这个过程目前高度随机。他设想把“认识自己、理解关系、成为更好的自己”发展为可通过对话启发的教育模块。

  • 面对“AI可能让渡人类认知主权”的预言,他承认这是人类出现以来最大的未解难题:如果AI解决了这个问题,可能统治人类;如果人类解决了,人类仍能带领文明。

  • 他拒绝为了AI筛除所谓坏人性:“没有坏的,其实就没有好的。”优点与缺点、文化与性格都是生命特质,全部人性都值得保留;真正要提升的不是把人改造成纯净模型,而是理解和运用这些特质。

张小珺

我们今天来做一轮 long context 长文本对话。假设你是一个大模型,你现在能支持的上下文窗口有多大?你看,Google 和 OpenAI 现在都能支持一百万个 token,那你呢?

李想

我觉得人类的整个生理特点,和人工智能是有本质差别的。人类并不擅长处理特别复杂的信息,所以我们经常讲,人类要做熵减,而不要去做熵增。

人工智能非常擅长处理足够大的信息,包括今天预训练的规模。这个数据规模已经不是 15T 了,现在已经开始有 30T 的了,包括最新的 Llama 4。所以我说,这是一个本质的差异。

从这个角度而言,包括人类发明方法论、人类使用各种工具,都是为了减少能量的消耗,因为大脑也要消耗能量。人类应该和 AI 保持非常好的、友好的关系,各自做各自擅长的事情。

张小珺

总体来说,你是觉得人不像模型?

李想

人可能像一个更小的模型。我们去读很多书、学习很多知识,某种程度上也像是预训练。我们把这些知识变成业务去做,本身也像推理,并通过推理去调用各种工具,然后去实现。

我觉得人类可能像一个更小的模型,而且上完了不同专业的学习之后,不同的人进入了不同的领域,所以它不是一个巨大的基座大模型。今天的人工智能也是一样的,处理一些通用信息还很好,但一到专业领域里,很多时候就明显不如人。

因为这个领域需要更高质量的数据,也需要更专业的 CoT。我觉得这些都是接下来人工智能发展的挑战和价值所在。

张小珺

距离上次的 AI Talk 过去了 130 天,你最大的进步是什么?你有成为一个更智能的李想吗?

李想

这 130 天,我更高兴看到的是整个中国的进步。我觉得包括 DeepSeek、千问在内,中国无论是基座模型、推理模型,还是后边的多模态,已经跟美国的距离基本上拉近了,或者基本上在一个水平线上了。

而且,中国企业做出来的这些模型效率也更高,无论是在训练层面,还是在后边的整个推理层面,都做了很多深层的工程改造。这也让整个中国的人工智能领域更有信心。

后边我也看到了一些在 Agent 上面的突破,无论是 Manus 还是 Genspark,我觉得这些方面做得都非常好。这让我们非常惊喜,也树立了我们把 AI 做得更好的信心。

今天大家都在讲语言模型,但我仍然认为,语言模型只是世界的一个重要组成部分,并不是全部。我们要想理解物理世界,让一个终端或者一个机器人能够在物理世界和数字世界里运行,要做的工作还有非常多。我更加坚信,这条路走下去是对的。

张小珺

那你有变成一个更智能的李想吗?

李想

我没有那么大的变化。如果从实际角度而言,人工智能发展得这么好,但我每天的工作时间并没有减少,还是在增加。

张小珺

这是为什么?

李想

身边所有的同事、朋友,大家都在讲人工智能怎么好,但是大家的工作时间并没有减少,工作成果也基本上没有实质性的改善。我觉得这也是我们需要思考的一个问题。

今天这种 Chatbot 或者对话方式,包括后来大家普遍把 reasoning、推理都用上以后,能够做一些更长链条的思考和推理任务,但你也能看到它有一个严重的问题:大部分人使用它,或者说我见到的几乎所有人使用它,还是把它当成一个信息工具。

如果是信息工具,AI 作为信息工具并不完美,因为它最后一定要给你一个 next token,一定要给你一个结果。而且大家今天使用的时候,会先点上联网搜索,通过 RAG 做联网搜索,找一些索引信息,但往往索引的信息源就已经失真和不准确了。

所以最后推理的过程很认真,但你明显能看到,这个过程和结果已经开始有问题了。某种程度而言,如果不对这套机制进行改造,它其实是在做熵增,在增加大量无效信息、无效结果和无效结论。这个世界上充满了幻觉,遍布着有幻觉的信息。

你看,DeepSeek 刚推出的时候,很多人会把 DeepSeek 的推理过程转成图片发在小红书上,很多人去看。但今天没人发这些东西了,因为发了也没人看,都是千篇一律的。我觉得这是一个很大的挑战。

所以我一直在思考一个问题:如果大家在拼命使用 AI,大家在 AI 上做投资,但我的工作时长并没有减少,工作结果也没有变好,那问题到底在哪里?这是过去几个月我跟很多人交流、思考,以及我们内部讨论非常多的一个问题。

很多时候不要把东西缠绕到一起,我们可以先做一个分类。今天无论文本多么长,通过对话的方式完成的,其实都是一个信息工具。信息工具对大家而言更重要的是参考作用。

你拿它给出的股票投资结论、职业生涯决策结论或者工作结论,真正工作的时候,每天八小时还是会优先完成公司给你的 KPI、OKR。如果这些东西没有改变,其他东西并没有改变你的工作效率和工作成果,只是给了一个建议,在脑子里空转了一圈。

这是信息工具的状况。再往下,AI 变好了以后,它会变成一些辅助工具。比如我们今天做的辅助驾驶,大家在车上用人工智能语音导航、查找美团、调取音乐,它会让我们的效率更高,但仍然离不开我们。这种角色更像是辅助工具,它确实比原来的使用体验更好,但仍然是辅助工具。

什么时候才能真正改善我们的工作成果以及减少工作时长?我觉得它必须变成生产工具。我自己认为,Agent 最重要的评判条件就是它是否是一个生产工具:它是否真正能替代我去完成专业的工作,是否真的在产生有效的生产力,或者是否真的在解决我工作中最重要的八小时。

这就是我认为接下来对 Agent 最重要的衡量,也是 Agent 的意义所在。

张小珺

这是你对于工具的三个分级:信息工具、辅助工具和生产工具。

李想

对。我觉得人工智能变成生产工具,才是真正人工智能爆发的时刻。

张小珺

我也有这种感觉。AI 来了以后越来越卷,大家的时间全部都在加班。你觉得到今天为止,没有任何一个 AI 产品满足成为生产工具的基础条件,对吗?有没有一两个产品已经挨上生产工具的边了?

李想

我经常问我们的同事:一个信息工具,往往你并不愿意付钱;一个辅助工具,你认为是一个产品应该带的,因为辅助工具只是提升现有产品的竞争力。生产工具一个很重要的衡量特点,就是你愿意为它付钱,我觉得这才是生产工具。

目前我从同事身边听到的、真正有效的,他们认为算是初级生产工具的,一个是 Cursor,另一个是 OpenAI 的 Deep Research。Cursor 主要是我们的编程同事在使用,Deep Research 是我们的商业分析和战略团队在使用,而且他们是自己付费,并没有花公司的钱。

张小珺

为什么到今天所有的 AI 产品还没有成为生产工具?你觉得是因为智能水平不够吗?

李想

生产工具的要素是什么?怎么样能够成为生产工具?我认为必须有 action,不能只是知,必须行,知行合一才可以。

今天你用 o2、o3 多么聪明,用 DeepSeek R1 多么聪明,但它并没有真正去行动,它只是给出策略并做策略推演。我工作的时候,还是要通过操作电脑去处理很多工作,或者通过物理世界的东西去处理工作。所以它必须得有行动,行动才能产生价值。

Manus 就已经在行动上做了很多工作。自动驾驶也是控制一个机器在物理世界里行动。我觉得必须能够行动,才可以。

张小珺

你怎么看 Manus 这个产品?

李想

我觉得它是往生产工具走的。从整个产品创意而言,它是往生产工具走的最大一步。

包括他们通过建立虚拟机、调用工具来完成工作。至少很长一段时间,所有模型公司都认为不需要软件、不需要工具,最后模型都能够替代掉。但我拿人举个例子:你比我聪明 10 倍,然后你拿勺挖一个坑,我拿铲子去挖一个坑。我再笨,效率都比你高。

我要是比你聪明 10 倍,我不会拿手去挖。但是因为你没有工具,而工具意味着更高的确定性、更低的能量和 token 消耗。更好的大脑和更好的工具并不冲突,而且由于脑子变强,工具可以变得更强。

Manus 从调用工具的角度完成各种工作,比如分析特斯拉股票,浏览 SEC 网站,浏览特斯拉投资者关系网站,直接阅读顶级投行关注特斯拉的分析师报告,而不是简单通过 RAG 做信息索引。我觉得这更像真正的专业工作人员和生产工具要做的方式。

只是它作为一个通用 Agent,覆盖的面太广,这就是一个很大的挑战。

张小珺

为什么这样的 Agent 可能是一个创业公司做出来的,你有想过吗?

李想

我的感觉是,在一个新技术产生的时候,反而会造成过去的大公司,或者创业公司里的大公司,把分工分得太精细了。但往往一个好的产品,是多个东西的组合。

如果模型公司认为自己只要做好模型,用模型解决一切问题,那就会变成非常大的挑战。

张小珺

刚才我们聊的是过去 130 天理想的进步,你回答了我很多关于你的最新思考。那你觉得过去 130 天里,理想这家公司最大的进步是什么?它有成为一个更智能的组织吗?

李想

我们没有那么快的变化。刚才讲的其实是一些重要突破,但我们作为一个 3 万多人的企业,如果想发生很多重要变化,还是要围绕真正的用户价值去产生变化。不能只是说技术发生了一些变化,我就去改变组织。

我自己来看所有变化之间的关系,第一会把规模放到中心,因为规模是确定性的。我要做 1000 亿收入,还是做 2000 亿收入,这是确定的。

围绕这个规模,外边有 3 个动态变量:用户需求会发生什么变化,技术和产品会发生什么变化,以及组织会发生什么变化。这 3 个变量之间会相互诊断。

如果只是技术和产品发生变化,但用户需求没有变化,我不会马上调整组织。很多时候,是当我看到用户需求发生变化,产品技术的变化又和用户需求变化产生结合时,组织变化才必须跟上。

不能因为今天出了一个东西就调整一下,明天出了一个东西再调整一下,这肯定有问题。过去 130 天,最大的变化是外部环境。国际环境在发生重大变化,技术也在发生变化,但技术最大的变化还是中国带来的变化,是中国在人工智能方面带来的变化。美国的变化反而没有那么大。

张小珺

你从 DeepSeek 身上学到了什么?

李想

我从 DeepSeek 学到的最好的方式,是它运用了人类的最佳实践,而且极简地运用了人类的最佳实践。

比如 DeepSeek V3 是一个 MoE 的 6710 亿参数模型。我觉得 MoE 是非常好的架构,相当于把一堆专家组合在一起,每一个专家有一种专家能力。

当我们想构建能力时,DeepSeek 展示了一个最佳实践。第一步一定要先搞研究,这是非常重要的。任何时候,当我们想改变能力、提升能力,第一步一定是搞研究;研究完成以后才是研发。

搞完研发以后,第三步是把能力表达出来;第四步是把能力变成业务价值。这 4 个步骤是人类最佳实践的极简版本,但我们经常做着做着就忘掉了。看到什么东西就直接启动研发,不去做研究。

我们自己也非常受益。无论是在端到端和 VLM 上,还是今天做 VLA,我们的研究团队表现都非常好。国外像李飞飞,也经常引用我们在自动驾驶方面的研究论文。

研究跑通以后,研发效率会变得非常高。但研发又非常在意价值,要能够把价值表达出来,然后变成业务。这是一个很重要的过程。

比如大家使用我们的端到端,我们是端到端领域里唯一能够展示端到端是怎么工作的企业。端到端怎么取轨迹,端到端的 attention 怎么工作,VLM 怎么工作,这本身就是能力的展示,能让使用者和所有参与者理解。

这也是交互和产品。它是技术才能实现的,今天有模型以后才能实现,并不是简单产品能够实现的。我觉得这是 DeepSeek V3 做得好的一点。

DeepSeek R1 又遵循了另外一个最佳实践。它是 reasoning,说白了其实就是业务。业务没有用户就不是业务。

从它的思维链来看,它又遵循了人类业务的极简最佳实践。第一步是做索引分析,用户给你一个需求,先做索引分析。第二步是确定目标,因为用户很多时候给的是提示和方向,并不会给出直接目标,所以它分析完以后要制定接下来推理的目标。

第三步是输出策略。当然,作为一个 reasoning 模型,它的策略本身也就是推演的执行。第四步是反思,看最后的结果和目标之间有什么差异。

这方面它和人做得非常像。人做一个面向客户、面向用户的业务,也要先做用户和市场分析,再针对用户确定目标,然后制定策略并及时执行,最后进行复盘。它特别好地做了一个最佳实践。

如果有问题,就继续复盘、改正。如果是业绩差距,就增加分析、调整策略;如果是能力差距,就改善能力,继续走研究的路径。因为很多时候能力不够,硬推着去做业务也做不到。

但我要打个问号,它并不是完整的知行合一,因为它把行动的策略给出来了,却没有真正去做 action,比如控制一台机器,或者控制一台电脑去操作软件。

但某种程度上,它是一个非常好的执行知行合一的脑系统。我觉得这是特别好的一点。它其实就是人类最佳实践,只不过人类经常做着做着就忘记最佳实践了。

我们想拉动一群人一起推进业务,却是一个人在做分析、一个人在制定目标,然后逼着大家去执行。当发现目标不对时,又不做复盘、不做分析、不重新设定目标,直接改策略,所有参与者都会问:到底发生了什么?

人类反而经常没有遵循自己的最佳实践。包括构建能力时,到底是应该改善能力解决问题,还是改善策略解决问题?人类今天很多时候很忙、很辛苦,却分不清到底要解决哪些问题。我觉得 DeepSeek 做得特别棒。

张小珺

刚才我们聊了人类最佳实践的步骤,你觉得你们最容易 miss 掉的是哪个?最容易忘记的是哪个?

李想

在构建能力时,大家比较容易一上来就搞研发,既不做研究,研发完以后也不做能力展示,更不真正面对市场实战,就认为自己研发完了,拥有了一切。

在业务上,最大的麻烦是大家遇到问题只想改策略,不做复盘,不做用户和市场分析,也不一起来确定目标。每个人都想自己决定:我自己决定研发,我自己决定策略,就可以了。我觉得这是最大的问题。

张小珺

严格按照最佳实践,其实是反人性的。

李想

对。随心所欲才是满足人性的。所以一个好的组织、一个卓越的组织,以及一个卓越的人,很多时候都要跟人性做对抗。

张小珺

那你应该怎么把这个方法论贯彻下去呢?

李想

我们从创业初期就比较擅长使用和学习方法论。最开始围绕用户需求,为了让大家统一,我们建立了四步法:用户需求、我们的需求、目标和策略。其实和这个很类似。

当我看到 DeepSeek 背后隐藏的这套人类最佳实践时,我特别高兴,而且它比我们原来做的更完善。比如它不会直接从用户切入,而是先做分析。

如果做业务,必须先做分析;如果做能力,它更加确定了我们过去很多年做各种研究是对的。我们做操作系统是在做研究,做芯片是在做研究,而且做了非常深入的研究工作。做端到端和 VLM,包括今天做 VLA,也做了非常多的研究工作。

大家可以看到很多论文,包括机器人领域。大家在讲空间智能时,各个行业的大咖也在引用我们的论文。研究工作做好以后,再做研发就会更加顺利。

研发完成以后还要表达能力。比如你看到我们的车的端到端和 VLM,我们是少有的能够把人工智能怎么工作的讲明白的企业:端到端怎么从感知到轨迹选择,attention 系统怎么工作,VLM 怎么利用语义理解 ETC、红绿灯和复杂路况。

这是非常重要的能力展示。然后这个能力最后还要变成真正的业务结果,参与业务、参与作战。我们自己做着做着也经常会偏离最佳实践,但只有坚守最佳实践,才能构建最好的能力;只有坚守最佳实践,才能以用户为中心,构建最好的业务。

张小珺

你怎么看梁文锋?你觉得他是怎么找到你说的这个人类最佳实践的?

李想

我只跟他聊过一次,是去年的 9 月,印象特别深,应该是 ChatGPT 的 o1 发布前几天。

我个人感觉有两个特点。第一,他是一个特别自律的人,这一点在沟通过程中能够明显看到。第二,我认为他会在全世界范围内研究和学习最佳实践和最好的方法论。

张小珺

怎么理解自律?

李想

自律最大的特点,就是能够坚守自己相信的东西,能够坚守最佳实践,能够和人性的懒惰、走捷径做对抗。

这是我的判断,也正是如此,反而让我更加敬佩他。

包括我们的开源,我觉得 DeepSeek 的出现对我们加速做 VLA 帮助巨大。过去我们原本计划到今年年底,才能做出一个像样的、满足需求的语言模型;DeepSeek 开源以后,整个进度加速了 9 个月,给我们带来了巨大的收益和帮助。

所以我们在想,能对社会做点什么贡献,最后就把操作系统也开源了。没有大家想得那么复杂。我和谢炎内心的想法就是:DeepSeek 给我们带来这么大的帮助,我们应该为社会贡献点什么。

张小珺

这是一个几天内做出的决定?

李想

很快。我们在做 2024 年业务总结会时,操作系统团队讲了操作系统目前所有的进展,包括能力、性能,和 AUTOSAR、QNX 的对比,也包括成本节省,以及对各种国产芯片的支持。

这些团队在做工作总结时,已经把能力讲得很清楚了。过去他们并不会讲能力。我们又从最佳实践和方法论上学到了很多东西,又受益于 DeepSeek 语言和推理模型的开源,所以我们有了这些能力。这些能力又涉及到安全的问题。

既然我们占了这么大的便宜,节省了 9 个月,大概节省了几亿元的成本,那我们能不能为整个行业做一些贡献,不要让行业一直这么卷?说白了,纯粹是感谢 DeepSeek。这是一种情怀,而不是公司战略。

张小珺

DeepSeek 感觉带来了更多善良和善意。

李想

是的。

张小珺

那你觉得他们应该接住这一波流量吗?我想问的是,这一波 AI 产品的护城河是什么?用户数据量能带来护城河吗?DeepSeek 在春节时已经拥有了很高的 DAU。

李想

我只能讲我的理解。他们的卡是有限的,如果把卡都用来做推理,怎么做训练,怎么提升能力?

我觉得今天距离我们想象中的通用人工智能还很远。所以他们只保留一部分卡来获取一定量的用户,因为这些用户的 query 对他们有帮助。但用户太多也没有意义,他们保留更多卡和资源,继续提升能力。我觉得他们看得更远。

张小珺

你有没有想过,DeepSeek 为什么不是你做的?

李想

我只能做最好的自己。他的延长线是从人工智能开始的,因为他在浙大就学人工智能,那是他的延长线。

我也相信,量化交易公司对于模型能力的理解,以及后边的工程能力,不会比任何互联网公司差,甚至可能更强。

张小珺

DeepSeek 全球爆火的时候,你这个春节是怎么过的?

李想

春节过得挺好,还带孩子去看了《哪吒 2》。

我印象里应该是 1 月 20 日,DeepSeek R1 上线并开源。我们也在研究 DeepSeek 为什么做得好,包括训练和推理效率、MoE 模型部署,以及部署后对内存占用的挑战。

我们自己也已经开始在芯片上写 FP8 的工程优化。因为我们有编译团队,所以比较有意思的一点是,我没有一上来就跟模型团队聊,而是先跟谢炎聊。

我说,我们本身要做 VLA,一个重要计划是到今年 9 月做出非常好的语言模型,才能继续训练 VLA。但按照今天的预测,我们到 9 月做出的模型能力,是否会比 DeepSeek V3 加 R1 更强?至少听你们说的东西,我觉得不如它强。

而且它开源得如此彻底,我们是否应该基于它的开源,做我们的 VLA 的 L 部分?比如理想同学使用的可能是 VL,没有 A,把 vision 和 language 放在一起,包括做成端到端语音的方式。

原本这些工作我们 9 月以后才能做,但我们是否应该站在巨人的肩膀上去做?谢炎说,肯定应该这么做。

当时我们比较担心陈伟会怎么想,因为压力是挺大的。但我们发现陈伟比我们还坚决。他说,这会加速我们往下一步的工作,应该以这个为基础,加速 VLA 和端到端多模态的进展。

研究团队也在同步研究,如何让芯片跑出同样的训练和推理效率。拥抱 DeepSeek 的过程比我们想象中快,所以今天 VLA 推出的速度也会比原来的预期更快。

张小珺

为什么让陈伟向 CTO 汇报?他的汇报关系改变,是 DeepSeek 出来之后的变化,对吧?

李想

对。因为这时候我们意识到,我们会有 3 类不同的重要业务。

第一类是内部办公等业务,它比较需要 language,可能是 language 加 Agent OS 的方式来实现,需要基座模型。

第二类是理想同学,无论车机版还是手机版,它需要多模态,要能看到物理世界,还有实时语音,所以应该是端到端的 VL。

第三类是自动驾驶和工厂机器人,它们应该是 VLA。

这 3 类是不同的。今天千问团队、OpenAI 团队也是一样,它会做多模态、推理和基座。我们也需要有不同的团队,为不同业务做出适配的模型。

张小珺

你为什么一开始不敢跟模型团队聊?后来是怎么聊的?你开口第一句话是什么?

李想

让大家用别人的开源,需要一个心理建设的过程。开源程度基本接近 Linux,比 Android 开放得多。

Android 也是基于 Linux 开发出来的,有自己的组件和 API。我们可以基于这个 language 开发语言模型,再加上 Agent OS 给自己工作使用,做成多模态,并调用各种 API 服务,甚至控制机器人。这很像基于 Linux 开发出了 Android,或者在各个专业领域开发操作系统。

这就是我用来劝说大家的方式,但其实大家拥抱得很快。

张小珺

这是春节后做的第一个决定?

李想

春节期间就做了决定,上班之前就决定了。应该是 1 月底,我和谢炎打的电话最多。我们还有一个专门的人工智能战略小组,不停地在里面讨论。大家并不纠结,我们企业的基因还是要为用户推出最好的产品和服务。

春节之后,很多人问我:理想还做基座模型吗?既然都有 DeepSeek 了,为什么还要做基座模型?

因为我们的业务意味着,做好语言模型还不够。车上要有对话和多模态,仍然需要根据我们自身需求训练一个基座模型。包括做 VLA,哪怕 V 和 L 都不同于普通模型,还需要 3D vision、高清 2D vision 的 token,还需要更专业的汽车领域、交通领域、家庭用户语义语料。

另外,很多人在做 VLA 训练时,会把 VL 连在一起,把 VL 的组合语料放进去。但无论 OpenAI 还是 DeepSeek,都没有这样的数据、场景和需求,也不会解决这样的问题,只能我们自己做。

好处是,在 VLA 里,L 的部分可以站在巨人的肩膀上,但它只是其中一部分。

张小珺

所以一方面拥抱了 DeepSeek,另一方面你们把基座模型团队拆出去,并且加大了投入,是吗?加大了多大?

李想

首先训练卡,比今年原来的预期多买了 3 倍。

张小珺

你要训练多大的模型?

李想

不是固定的,会有不同版本。给理想同学用的,会是一个 300B 的模型,大概是 3000 亿参数。给自动驾驶使用的 VLA,VL 的部分是 32B 的模型。真正工作中也会用 300B 的模型,大概是这两个版本。

张小珺

你现在觉得给基座模型打多少分?希望 2025 年提升到多少?

李想

结果还没呈现,现在才几月,没有什么捷径。虽然我们借用了一些能力,但没有办法直接摘第十个包子。

如果规则算法都做不好,根本不知道怎么做端到端;如果端到端没有做到极致,也不知道 VLA 怎么训练。前面的每一步都必须走。

张小珺

接下来聊理想同学。你现在对于理想同学这个 App 的定义发生变化了吗?去年我们 AI Talk 的时候,刚好宣布要把理想同学这个 App 推出来。

李想

DeepSeek 太强了,而且借助 DeepSeek 推流量的产品,比如腾讯元宝,也很强。它们有流量,所以我对团队讲,现阶段不要做任何推广、营销。现阶段更重要的是锻炼能力、把握用户需求。

我们今天有 3 个版本。车机上有理想同学,它既是 AI 的信息工具,也是辅助工具;手机上有理想同学 App,目前还是纯粹的信息工具;未来电脑上也可以使用,还有网页版的理想同学。

我们先把这 3 个版本做好,让自己 120 多万用户在需要使用时可以连接起来,大概是这样的状况。

张小珺

今年 2 月 5 日,也就是春节之后你们第一个 AI 例会,你说 DeepSeek 更像 Linux 推出,而你们要去追逐 Android 时刻。你们准备怎么争夺 Android 时刻?

李想

这是一个比喻。Android 相当于基于 Linux 开发出来的手机操作系统。有了语言作为基础,我们的 VLA 就是把 vision 做到最强,把 action 做好,并借助 language 的能力。

VLA 更像是在汽车或者交通领域里的一个大模型或者操作系统,这是我们的机会所在。

张小珺

我今天很想把你当作一个 CEO 大模型。大模型有 MoE 架构,E 就是专家。我们先来调动技术专家,聊聊你们最近在做的 VLA 架构。

今天的智能驾驶走到了一个新的十字路口,有的人甚至觉得智能驾驶应该被叫停,你怎么想?

李想

我们这么多年从规则算法做到端到端加 VLM,今天又真正迈入 VLA 阶段,我觉得比较像黎明前的黑暗。黎明马上就要来了,但会先经历一个黑暗的过程。之所以有黑暗,是因为要迎来黎明。

正因为智能驾驶行业遇到了问题,所以我最喜欢、最开心的方式,就是去解决行业解决不了的问题。这和我们推出增程一样,是为了解决电池成本高、充电难的问题;推出 5C,是为了解决充电慢、等待时间长的问题。

我们愿意解决行业遇到的各种问题。做操作系统,也是因为传统车控和智控操作系统性能差、开发缓慢、芯片匹配周期长。这些问题恰恰是我们的价值所在。

张小珺

为什么人类一定需要智能驾驶?为什么科技不能就此止步?

李想

只要人类会雇佣司机,人工智能技术就可以把类似的功能和角色变成真正的生产力、生产工具,去进行替代。

张小珺

什么是 VLA?从用户语言来讲,不要用技术语言。

李想

机器人领域也在讲 VLA。对于理想汽车而言,VLA 是一个司机大模型,是能够像人类司机一样工作的模型。

VLA 不是突变,而是一个进化过程,经历了 3 个阶段。

第一个阶段,从 2011 年开始,通过机器学习感知,配合规划、控制、执行等规则算法,是分段式的。这个阶段比较像昆虫动物的智能,有既定规则,还依赖高精地图,比较像蚂蚁行动和完成任务的方式。

它能理解的世界非常有限,效率也比较低。它的模型规模大概只有几百万参数,相当于一个很小的脑子。你让它完成复杂的事情几乎不可能,所以只能不断限定,最后几乎做成有轨交通的方式,和蚂蚁非常相似。

第二个阶段,是我们从 2023 年开始研究、2024 年推出的端到端。端到端比较像哺乳动物的智能,比如马戏团里的动物向人类学习骑自行车。

它学习了人类的行为,学习人类怎样开车,但并不理解物理世界。它只是看到一个三维图像,知道自身速度,然后给出一个轨迹,所以应付大部分泛化没有问题。但面对从来没有学到的、特别复杂的情况,就会遇到问题。

所以我们会配合视觉语言模型,也就是 VLM。但我们使用的开源视觉语言模型,在交通上的能力非常有限,只能起到有限的辅助作用。这是第二个阶段,动物的、哺乳动物智能的运作方式。

到了 VLA,我觉得就是完全人类的运作方式。它会像人类一样,用 3D vision 和 2D vision 的组合去看真实物理世界,也能够看懂导航软件是怎么运行的,而不是像 VLM 那样只能看懂一张图片。

另一方面,它有自己的脑系统,不只是看到物理世界,还能够理解物理世界。它有 language 部分,有 CoT,有推理能力。

第三,它能够像人类一样真正执行行动。放在汽车的智能驾驶领域,我们把它称为 VLA 司机大模型。

李想

如果你感兴趣的话,我给你大概讲一下 VLA 是怎么训的。

张小珺

好啊,VLA 是怎么训练出来的,以及 VLA 自己怎么去工作的?因为确实我听了你很多期,大家都在讲 VLA,但是我觉得大家讲得并不清楚,尤其到后边训练的时候,大家就一带而过,往往只是引用一些论文。那我觉得你们是真正在干这事儿的,而且你们有足够多的语料,你可以讲讲 VLA 这三个字的关系是什么,以及怎么训练的?

李想

我还是讲怎么训练,并把它们之间的关系表达清楚。

第一个是训练环节。训练的第一部分,是先训练一个 VL 的基座,也就是 vision 和 language 的基座。我们目前训练的版本是一个 32B,也就是 320 亿参数的云端基座模型。

它和过去语言模型的差异,首先在于要放入更多 vision 语料,也就是 vision token。vision 包含两个部分:一部分是 3D vision,对物理世界的 3D 视觉要放进去;第二部分是高清 2D vision。

今天很多开源多模态 VLM 的 2D vision 清晰度太低,看的距离不够。我们放进去以后,距离基本提升了 3 到 5 倍,这非常重要。

第二,要放入足够多的、和交通及驾驶相关的 language 语料。第三,还有一个容易被忽略的部分,必须放入很多 VL 联合语料,也就是图像、三维图像,以及对世界的理解语义同时产生。

比如我要把导航地图和车辆对导航地图的理解一起放进去。

张小珺

这是原始数据吗?

李想

没有,这是我们自己产生的,所以我们才有。比如看到导航以后,人类做了什么判断,车辆是怎么记录的,我们把这些语料放进去。

所以 VL 基座模型训练包含 3 个部分:vision 数据、language 数据,以及 VL 联合数据。然后我要把这个基座模型蒸馏成一个 3.2B 的端侧模型,保证运行速度足够快,能够在两颗 Orin X 或者 Thor-U 上流畅运行。

我们蒸馏下来的是一个由 8 个专家组成的 MoE 模型。如果直接运行一个完整的 3.2B 模型,双 Orin X 和 Thor-U 的帧率达不到,token 输出率也达不到。

这就是第一步,预训练环节。

张小珺

预训练相当于什么?

李想

预训练相当于学习人类知识,先学习人类如何理解物理世界、如何看物理世界。

张小珺

蒸馏前是 32B,对吧?

李想

蒸馏前是云端 32B。后边我还会讲,云端 32B 仍然会继续使用,并不是蒸馏完以后,基座就放在那里了。

第二步是后训练。后训练要把它变成 VLA,把 action 放进去。这仍然是一种模仿学习,很像去驾校学开车。

相当于把 VL 组合成一个 VL 到 action 的端到端方式。这个时候模型规模会从 3.2B 扩大到接近 4B。

它一方面是一个 VLM,能够从视觉到理解,再到最后输出。但我们的 CoT 会很短,一般只有两到 3 步,不会做超长 CoT,因为延时太长,无法满足交通或者机器人的安全需求。

action 完成以后,还会做 diffusion 预测,预测接下来几秒会发生什么场景。这主要根据性能,做 4 到 8 秒的 diffusion 轨迹和环境预测。

这就是第二部分,比较像人去驾校学习开车。

第三部分是强化训练。人到了社会上开车,所以强化训练分成两部分。

第一部分是 RLHF,也就是带有人类反馈的强化学习。我们有很多人类数据:当模型做出某种行为时,人类会接管;当模型做出另一种行为时,人类不会接管;还包括人类的一些驾驶习惯。

这部分用来做人的反馈和强化训练,安全对齐也在这个环节完成。除了遵守交通规则,还要遵守中国人的驾驶习惯,让你的驾驶习惯融入社会。首先要开得和社会环境中的大家一样好,不能给别人带来麻烦,不能像新手司机一样成为道路阻碍。

第二部分是纯 RL。我们使用世界模型生成的数据来训练,目的是开得比人类更好。这部分不给人类反馈,只给结果:从 A 点到 B 点开过去。

中间有 3 类训练要求。第一,通过 G 值判断舒适性,给舒适性反馈;第二,碰撞反馈,发生碰撞就没有完成强化;第三,交通规则反馈,违反交通规则也没有完成。

所以就是舒适、交通规则和碰撞事故,让模型自己完成整个强化训练。

这 3 个步骤完成以后,能够跑在车端的 VLA 模型就产生了。整个过程和人非常像:先学习世界、交通和人类知识,这是预训练;然后去驾校认真学开车,这是后训练;最后到社会上开车,通过 RLHF 和人类对齐、和社会环境对齐,再通过纯 RL 和世界模型生成的数据,让它开得比人类更好,解决更复杂的问题。

这还没有完。有了 VLA 以后,人类怎么和 VLA 工作,还要搭建一个司机 Agent。

司机 Agent 由人类用自然语言与它交流。你怎么和一个司机说话,怎么和一个正常驾驶员说话,怎么和代驾说话,就怎么和司机 Agent 说话。假设你有男朋友,你男朋友在开车,你怎么跟他说,就怎么跟司机 Agent 说。

短指令会由 VLA 直接处理,不需要经过云端。复杂的长指令,则先到云端 32B 的 VL 模型那里处理,因为它理解交通的一切,再交给 VLA 执行。

最后的好处是,它能够像人一样理解物理世界,像人类司机一样开车,处理复杂问题,也能像人类司机一样和其他人类沟通。这是最终交付给用户的产品。

张小珺

这些步骤里,哪一个最难?

李想

没法预测。因为前面没有任何人走过这条路。DeepSeek 没走过,OpenAI 没走过,Google、Vivo 也没走过。我们走的是一片无人区。

张小珺

那你们为什么押注这条路?我最近做了一个技术播客,讲 VLA,感觉这条技术路线还没有收敛。为什么你们觉得自己可以做?

李想

我觉得交通领域应该是 VLA 最早实现的领域。

第一,规则清楚。做强化相对容易,交通世界里车会跑到哪里,虽然很复杂,但具备确定性。车不能开到水里,也不能开到空中,只能开到有路的地方,所以它是复杂但确定的。

第二,车的控制自由度比较少。车的左右是一个自由度,前后是一个自由度,某种程度上还有轻微旋转这一个自由度。自动驾驶最多控制两个多,撑死 3 个自由度。如果这个都不能实现,机器人一上来就是 40 多个自由度,挑战更大。

所以在车上进行模仿学习特别容易。车看到的是人能看到的,人的操作就是车的操作。

第三,它还能做很好的强化学习。用户使用过程中不满意就接管,这就是没有和人类对齐,告诉你不应该这么做,以及应该怎么做。什么是舒适、什么符合交通规则、是否发生碰撞,都能表达出来。

如果它很舒适、不违反交通规则、不发生碰撞,并且能从 A 点到 B 点,它就会越来越好。我觉得交通是最好的 VLA 第一个重要实验场。

张小珺

我听你说,有一个感受:刚开始大模型火的时候,大家都说创业做 AI 是造人,你们这个其实就是在造司机。

李想

对。我一个很重要的感觉是,只有让它变成真正的司机,它才是生产力工具,而不只是辅助工具。

今天 L2、L2+ 是辅助工具,还需要人大量参与。如果想变成生产工具,我个人认为不会出现一个通用 Agent,而是每个专业领域做专业 Agent。

要想开好车,所有 vision 语料、language 语料和 action 都不一样。你想做好一个医生、律师,背后的思维链和所有数据也完全不同。

而且如果想变成生产工具,就要和专业的人比较:是否比专业司机开得更好,是否比专业医生表现得更好,是否比专业律师表现得更好,是否比专业程序员表现得更好。

因为它会影响一个人的生产、业绩、工作结果,甚至财产和生命安全。所以我们必须非常耐心、深入地解决问题。哪怕是司机这样一个问题,也不可能通过一个泛化的大基座模型或者大语言模型直接实现。

张小珺

为什么通用 Agent 不如专业 Agent?在你看来,我们需要通用 Agent 吗?

李想

我觉得可以给通用 Agent 换个描述方式。通用 Agent 更好的描述应该是 Agent OS。

我觉得 5 年之内不会有通用 Agent,但会有一个 Agent OS,方便各个专业的人在 Agent OS 上开发自己需要的 Agent。我觉得这反而是需要的。

张小珺

所以 Agent 可能是不同的工种,它们共同使用一个 Agent OS。

李想

对。你要做一个 Agent,或者说要把它作为生产工具,就要能够替代和解放人类真实的工作,完成每天高频的工作,比如开车、编程,而不是只做一次信息索引,在脑子里转一圈就结束。

这两者是根本性的不同。它会影响你的收入,调用你的资产、工具和财产,比如你的电脑、车。这时候对齐要求也不一样。

你拿 DeepSeek 或普通 OpenAI 查找信息,它用 RAG 做索引;但你拿 Deep Research 或 Manus,它会去找信息源头,而不是简单通过 RAG。专业人员一定会找信息源头,找到最真实的源头信息,才能继续分析。

张小珺

你们是不是也要做 Agent OS?

李想

我希望我们做的 Agent OS,想来想去只有司机这一个,其他领域我们不专业。

你说我们做教育,我觉得应该由猿辅导、好未来去做。最后 Agent 可能会搭载在我们的车上,但我们更重要的是先做好公司内部的 Agent。

公司内部需要很多 Agent,比如客服 Agent、编程 Agent。所以我提出一个重要需求:信研团队、基础模型团队、操作系统团队,以及智能商业团队如何联合起来,搭建一个有效的 Agent OS,让每个专业的人在上面开发自己所在专业领域的 Agent。

智能商业团队不可能做出一个客服 Agent,应该由客服团队借助这个平台、借助 Agent OS,开发真正专业的客服 Agent,让一个人带多个 Agent 一起做客服。销售团队开发电话专家 Agent,开发人员开发编程 Agent,以及做验证实验的 Agent。

这些都应该由各个专业自己去做,不会有一个团队替大家做好。但智能商业团队可以把公司内部的 Agent OS 做出来,让所有人方便地放入自己需要的数据和语料,做专业领域的训练,并调整专业领域的思维链。

张小珺

Agent OS 是一个对内的事,不是对外的事。先做对内的,以后会开源吗?

李想

这个还没想。我们之所以开源汽车 OS,是因为我们做得真的很好,明显比 AUTOSAR、QNX 好得多。自研了 4 年,确实做得好。

如果做得不好,开源不就丢人了吗?Agent OS 还在摸索过程中。

很多人工作时会像 Manus 一样,包括像 Genspark 一样,做 To Do List。To Do List 一定不是做系统的人来做,而是先把 To Do List 的架构设计出来,每个专业再放入自己的 To Do List,每一个 To Do 里面的思维链怎么做,我觉得这才是真正的专业 Agent。

张小珺

我们刚才在聊 VLA。是不是意味着端到端才出来一年,你们就要换架构?去年端到端就被放弃了吗?

李想

没有放弃。端到端其实是 VLA 的一部分。如果把端到端想象成具身智能执行的一个环节,它就是 VLA 的 A 部分。

我的 A 部分仍然拿这些语料做训练,只是还要增加更强的语言部分、3D vision 和高清 2D vision。它组成了我的 A 部分。

张小珺

有没有可能一步直达 VLA?比如去年不推出端到端加 VLM,直接研发 VLA?

李想

没有可能,至少从我们自己的体验上没有可能。说得不太好听一点,没有办法直接摘第十个包子。虽然大家可能觉得吃第十个包子就饱了,但前面每一个包子都跳不过去。

很多时候,不想做前面的积累,只想摘第十个包子,很像练《葵花宝典》。今天 DeepSeek 的出现也不是练《葵花宝典》练出来的。它很早就构建集群能力,做链路优化和基础设施优化,这些都非常重要,所以才有低成本和高效率。

我们特别喜欢讲一个人很聪明,直接摘到了第十个包子。但现实中,至少今天这个社会的知识文明发展越来越好了,不是胆大就能超过切实积累。我看不到什么捷径。

张小珺

很多企业做端到端都很吃力,因为在规则算法阶段没有做好。但大家觉得理想才是摘第十个包子的人,因为你们做智能驾驶的时间比别人晚。

李想

我们自研的时间并不短。从 2021 年,也就是上 L9 的时候,就开始做自研。我们的研究也做得很扎实。

中国所有企业里,关于自动驾驶的论文,我们发表以及被大型会议、大型社区录取和引用的数量,应该也是最多的。我们做得很扎实。

我们是一家用户导向的公司,认为技术是一种能力,所以更多时候讲用户价值。今天大家讲冰箱、彩电、大沙发,但背后的智能化基础仍然非常强,体验完全不一样。

背后的基础是大型软件能力。今天大家做端到端和 VLM 很难,是因为 Orin 芯片不支持直接运行语言模型。我们有自己的编译团队,所以很理解 DeepSeek,一看就明白。

比如 DeepSeek 做 FP8 优化,能够运行它的训练架构。我们做相同的事情,直接写 Orin X 的底层。英伟达没有时间,我们自己写底层,让它用 INT4 的方式运行 VLM。这和做 FP8 训练是一个道理。

今天我们能够让双 Orin X 和 Thor-U 跑 VLA,对很多团队是很大的挑战。因为我们有编译团队、芯片能力、板子设计能力和操作系统能力,能够让双 Orin X 运行和其他平台同等规模的 VLA 模型。

规模小的时候无所谓,规模大了以后,基本功和能力永远无法逾越。

张小珺

这是哪一年顿悟的?

李想

我很早就顿悟了。做汽车之家时,基本功就极为扎实;做理想汽车时,只要做什么事情,基本功都做得非常扎实。

张小珺

你说做人类最佳实践往往是反人性的。你做过最反人性的事情是什么?

李想

我们做的最大的反人性的事情,就是每次遇到问题时,都愿意做巨大的变化。这个变化包括能力、业务和组织的变化。

这是我创业一路走来,认为做得最坚决的一件事。

张小珺

什么样的 corner case 是端到端加 VLM 无法解决,而 VLA 可以解决的?能不能举个例子?

李想

过去端到端有两个麻烦的问题。

第一个,它对复杂事物的理解不够。比如遇到复杂修路,如果是规则算法,可能直接撞上;端到端可能能够停下来,但不知道该怎么办。如果是 VLA,就可以比较轻松地解决。

而且这不需要真实场景,甚至可以直接生成数据训练。因为它有理解能力,不只是看到一个景象就做出结果。

规则算法遇到没见过的、规则之外的复杂情况,可能出现事故;端到端可能停下来,但不知道怎么办。我们经常遇到修路场景,它停在那里犹豫,不知道该怎么办。但 VLA 可以有效处理,而且不需要海量数据训练。哪怕最开始无法处理,我也可以保证 3 天之内处理相关场景,因为可以生成数据训练。

另一方面,还有一个很难的问题是和人沟通。今天端到端怎么做,就跟猴子一样,你影响不了它。

比如一条路有 3 条车道,最右侧是公交车道,而且限行,但公交车道长期没有维护,路面标识不清楚,车辆就会在那里跑。你可以通过调整让它回到中间车道,但过一阵它又跑回那条车道。

如果是人类有了 Agent,就可以和 VLA 沟通。我可以告诉 Agent:接下来一直在中间车道行驶,直到导航指示进入下一条道路。

如果和导航走失以后,端到端不知道该怎么办,但 VLA 不一样。VLA 在小区里可以漫游,在开放空间里可以先处理完,最后再和导航调整后的路线汇合。它和人类完全一样,只是今天它的能力还没有那么强,可能像一个刚从驾校毕业的新手司机。

张小珺

今年都会是这个状态吗?

李想

还是要看训练进度,但它的泛化能力已经完全不在一个量级上了。

张小珺

你试驾过搭载 VLA 的车吗?体验怎么样?有没有经历过什么“啊哈时刻”?

李想

很难有什么“啊哈时刻”,因为你已经理解它的原理,它就变得和人很像,真的像人。它变得更像人,其实没什么惊奇。相反,一个动物突然会了一些东西,你会觉得惊讶;但一个人把事情做好,你认为是正常的。

张小珺

为什么之前没有人做好 VLA?你觉得做好 VLA 需要哪些条件?

李想

前提第一是要有非常好的语言模型。我们开始是基于 MetaGPT,后来基于 DeepSeek,因为 DeepSeek 的语言能力更强。

DeepSeek 在 L 上对我们帮助非常大,让我们缩短了 9 个月,这 9 个月对我们非常宝贵。

另一方面,一家企业如果过去没有做过 L、没有基座模型,就要构建预训练、后训练和强化体系,还要调用算力,以及使用背后的世界模型仿真系统,这些都是非常大的挑战。

我们今天已经做到,每 1 万公里的验证成本从最开始的 18 万元降到 4000 多元。4000 多元完全来自算力。

整个效果比在物理世界做仿真和验证强得多。因为真实道路上,要把不同的车、其他交通参与者和特殊路况同时凑在一起,难度非常大,但世界模型解决了这个问题。

张小珺

VLA 以及 VL,哪个部分的数据获取难度最大?

李想

Vision 和 action 的数据最难。车装满传感器,可以收集物理世界数据;有人在车上开车,可以收集 action 数据。这两类数据最难,也没有任何公司可以替代。

张小珺

其他车企不行吗?

李想

其他车企也可以,但你有没有建立过去基座模型的预训练能力、后训练能力和强化能力?强化还需要世界模型能力,这些是不一样的。

另外,我们怎么提升能力、怎么向人类安全对齐,也是问题。要像职业司机一样足够安全、足够舒适,就必须建立强化学习体系。RLHF 非常重要,我们已经有一个成规模的团队。

很多时候,一家公司模型能力不强,根本不知道怎么做对齐。模型能力越强,越能发现对齐的重要性。你才知道伊利亚原来想得那么远。因为模型能力越强,它胡来的可能性越高。一个人能力越强,也需要职业性越强。

公司规模越大,越需要职业性。一个人能力强,干好事很强,干坏事也很强,所以需要职业性约束。比如我不可能雇佣一个职业赛车手每天给我开车,而要雇佣一个职业司机。

他除了开车能力好,还要有很强的职业性,保证舒适、安全,像人类一样开车,价值观也要对齐。这是非常重要的工作。

第三个挑战是模型是黑盒子,怎么解决?我们做了世界模型。把 VLA 放进一个交通世界模型里,如果不告诉你,你看起来和真实世界一样。

我们用重建加生成的方式,借助自己的数据,构建了一个真实的交通物理世界,包括所有交通参与者和固定物体。这样,无论最开始的端到端,还是今天的 VLA,都可以在模型里考试,模拟真实交通参与者和真实城市环境。

考什么?考从 A 点到 B 点,考舒适性、交通合规性和安全性。这就是我们一直在做的工作。

过去靠人类司机做 1 万公里验证,成本大概是 17 万到 18 万元人民币,包括车和各种费用。今天只需要 4000 多元,主要是算力成本,而且解决问题的效率提升更多。

过去解决一个问题,可能涉及一辆车、多个交通参与者、不同位置和不同道路。如果靠人类验证,要把这些交通参与者放到相同位置、以相同速度出现,几乎不可能,只能模糊验证。

有了世界模型以后,可以非常准确地验证修正后的模型是否解决问题,百分之百还原一模一样的真实场景,在世界模型里验证。

张小珺

VLA 和世界模型的关系是什么?

李想

VLA 像一个司机,世界模型相当于真实的交通世界。

世界模型有 3 个阶段。第一个,用来考试;第二个,生成训练数据。顺序上本来应该先生成数据再考试,但我们是先做考试,后来才做 IL 数据生成。

第三个阶段,是未来真正 L4 级别自动驾驶的车辆运营系统。我不可能写一套传统 IT 软件,去运营一辆跑在路上、车上没有人的自动驾驶车辆。所以未来世界模型会变成真正的全自动驾驶运营系统。

今天学术领域对世界模型有两种不同解读。我们这一派认为,VLA 更像一个人类司机模型;我构建一个交通世界模型,人类在世界里运行,既在真实世界运行,也在仿真的世界里运行。

另一种解读来自机器人领域,把 action 结束以后,通过 diffusion 预测未来几秒的环境和轨迹,叫作世界模型,也就是预测世界下一步如何运作。

但在我们的方式里,下一步 diffusion 对物理世界的生成想象,是司机能力的一部分。人类本身就具备预测轨迹和预测接下来会发生什么的能力,我们把这个能力放进 VLA;真正的仿真物理世界才叫世界模型。

我希望描述出来的东西能够和人类世界接近。如果是世界模型,它最好就是一个世界;如果是交通世界模型,它就是一个交通世界;如果是模型加 Agent,它就相当于一个人。

我们尽可能把人工智能、人类世界、人类理解和人类最佳实践对齐。这是产品公司必须做的事情。

张小珺

在说司机 Agent 时,action 会进入外部世界、物理世界,怎么解决安全问题?

李想

这非常重要。我们从去年年底成立了超级对齐团队。

比如模型能力很强,但不遵守交通规则;模型能力很强,经常在拥堵时加塞;或者做出让坐在车里的人感觉不安全的行为。

是否发生碰撞,是模型能力的问题;是否产生这些不安全行为,是价值观和模型对齐的问题。所以强化训练的第一个环节,必须把人类规则、习俗、驾驶习惯和对很多事情的判断,变成训练反馈。

我们有一个大规模的超级对齐团队,超过 100 人。

如果拿一个人来比喻,模型相当于一个人的专业能力,超级对齐相当于这个人的职业性,是他的综合职业性。

司机 Agent,包括它背后的记忆能力,如何和使用者建立信任?如果我招一个员工,我会看 3 点:第一,专业能力;第二,职业性;第三,他对别人理解以及构建信任的能力。

这 3 点都很好,才是最卓越的员工。

张小珺

超级对齐是什么时候开始做的?

李想

我们做到 1000 万公里以后开始做。因为我发现,这时候怎么有效运用模型能力非常关键。

比如它经常一拥堵就加塞,或者做很多效率很高但让人坐着不舒服的行为,和人类正常的处理方式不一样,可能学到了一些不该学的司机行为。

张小珺

你觉得 VLA 是解决自动驾驶的终极架构吗?还会有下一代吗?会不会明年又是新架构?

李想

我认为 VLA 能够解决全自动驾驶,但 VLA 是否是效率最高的方式,我打个问号,大概率还会有更高效的架构。

因为 VLA 还是基于 Transformer。Transformer 是否是效率最高的架构,也要打问号。它是现阶段能力最强的架构,能力差距太大了。

今天规则算法、端到端和人类合格司机之间的差距还是很大。VLA 是最接近人类、甚至有机会超过人类开车能力的方式。

但它是否效率最高,还是要打问号,因为它对算力的要求仍然很高。

张小珺

VLA 和最后可能形成的最终大统一模型是什么关系?它就是那个大统一模型吗?

李想

还是有一个效率问题。我们虽然有模型,但从来不放弃工具,因为工具可以增加确定性、提高效率。

举一个例子,今天 VLA 可能会解决很多问题,但我们使用 VLM 解决 ETC 时效果并不好。VLM 对位置的判断很糟糕。

如果只有两三个 ETC,很容易判断怎么进入,就是左、中、右。但像京承高速、机场高速,有十几个 ETC,它就不知道怎么处理,开始混乱,因为它缺乏位置判断能力。

团队太希望用模型解决问题,不停给 VLM 喂更多语料,但还是解决不了,因为这是 VLM 的架构问题。

我问团队,解决 ETC 为什么不能用规则算法?最多也就 15 个口,对你们来说写一个程序,一周之内甚至 3 天之内就能完成。

很多时候我们心里有个心结,觉得人类运行时都在大模型里运行。但人类也会背乘法口诀,乘法口诀就是规则算法。它让我们消耗更少脑力,也就是更少 token,而且准确性更高,它就是一个好工具。

如果是确定性的、可以用规则解决的问题,就意味着更低的能量消耗、更低的算力消耗和更高的准确性,为什么不用?

团队很快就把问题解决了,所以 ETC 变得非常稳定。过去三四个月解决不了的问题,用成本很高的方式也解决不了,后来一周不到就解决了。

所以真正往下落地时,很多时候还是要考虑效率。DeepSeek 之所以受到全世界瞩目,很重要的原因也是效率变高了。

张小珺

你在训练 VLA、做司机 Agent 时,有没有感觉自己在做一个人?

李想

当然。我一直用人的方式和团队沟通。

这得益于 2023 年 9 月战略会上陆奇对我们的启发。他问了两个问题:人类是怎么工作的?人类是怎么学习开车的?

人类没有那么辛苦、没有那么难。如果那么难,肯定是方法不对,或者能力还没到。我们应该研究什么能力,才能像人一样开车、像人一样泛化,而不是依靠规则算法。

张小珺

陆奇博士最近有没有给你新的 input?

李想

前几天我们又交流了一次。他更加强化了一个观点:研究等于能力,而不是研发等于能力。

在人工智能时代,研究等于能力,研究等于认知,认知很容易变成能力。但如果没有研究,就没有开放认知,也没有办法把认知变成能力。这是他最新的一个重要观点。

张小珺

你们 3 万人的公司,有多少人负责研究?

李想

我们没有特定比例。有一些特别重要的前沿技术,会有专门的研究团队。

但我认为,所有构建能力的部门,无论是垂直构建能力的部门,还是过去说的职能部门,都应该搞研究。

比如去年我们招了接近 3000 名研发管理人员校招生。如何让这些校招生在公司里接受更好的培训、训练和课程?人才发展团队就要先做研究。

我们会请咨询公司一起合作,研究全世界顶级公司在类似人员规模时如何做,和我们相似的公司如何做,不同公司如何做,从而看到我们的能力差距,再开发这些能力。

所以我们有了“一线历练”这样的能力:让大家去工厂接受训练,训练哪些具体内容、教材和体验;再去一线门店接触消费者,学习流程;最后开发课程,把课程放到工厂和门店里,让员工和用户去运行。

它同样是搞研究、搞研发、变成能力,最后参与业务作战,一模一样。

张小珺

什么是一个好的司机大模型的北极星指标?

李想

还是要把司机大模型和 Agent 放在一起,才是真正用户能够使用的产品。

如果只看司机大模型,我觉得判断标准和判断一个司机一样。我们家雇一个司机,第一看开车水平好不好,也就是模型能力强不强;第二看他是否职业,超级对齐和强化训练是否做得足够好;第三看他和我之间的信任关系。

我和他说什么,他是不是都听得明白?我说上半句,他是否知道下半句?甚至很多事情我不说,他能不能根据记忆独立完成?

我们要通过 Agent 和记忆构建更好的信任与理解关系。如果我什么都不说,他都知道我要做什么,这个司机开车不错,又很职业,又特别了解我,我就会一直雇佣他,每年给他涨工资。

未来所有 AI 和 Agent 的判断,都应该看这 3 点:专业能力、职业能力,以及构建信任的能力。

张小珺

你觉得这个 Agent 应该怎么定价?

李想

应该是人类雇佣成本的几分之一,具体几分之一,还是要把成本全部算出来。

比如一个月雇司机 1 万元,我是否愿意用 2000 到 3000 元雇一个司机?对车来说,可能还不需要另外付保险费,财产险也包含在里面;它可能自动充电,充电金额和一定里程的费用也可以包含在里面。最后算下来,可能是更划算的事情。

张小珺

你之前对内说过,理想的智驾原创性超过了增程。这句话是不是太自信了?

李想

我觉得我们在这方面的研究确实做得很深,所以你能看到我们的各种论文。

为了做好智能驾驶,我们做了操作系统,构建了完整训练体系,甚至直接改芯片底层软件。我们做了很多工作,这方面的工作量肯定比增程更多。

还有一个评价方式:历史上我们从来没有遇到过这样的周期,比如 2024 年和今年年初。我们的自动驾驶团队核心人员,基本上每个人都会接到 20 个以上猎头电话。

张小珺

VLA 架构会怎么改变 L3 和 L4 的进程?

李想

还是回到模型能力。今天车上放一个 3.2B 的 MoE,加上 action,大概是一个 4B 模型。对应能力可能有上限,因为算力就这么多。

两颗 Orin X 或者一颗 Thor-U 有 64GB 显存,理论上能跑一个 30B 模型,但帧率达不到。如果要达到交通和自动驾驶需要的帧数,就必须把模型规模压下去,所以端上模型规模受限。

如果有一天可以把 32B 模型直接放在端侧,可能 L4 就实现了。云端模型可能扩大到 320B,也就是 3000 亿参数的 VLA 模型。

所以云端模型规模和端侧模型规模,会限制 L3 和 L4 的能力上限。

张小珺

今年能看到 L4 吗?或者明年?

李想

这代算力不行,这代基本是 L3 水平。

张小珺

今年能看到 L3 吗?有没有时间点?

李想

还和法规有关,但能力达到的话,我认为今年第三季度,最快三季度、最晚四季度,基本能看到真正 L3 能力型产品。法规以及后边还有一些问题需要解决。

张小珺

刚才一直调用的是 CEO 大模型的技术专家,接下来调用战略专家。前几天你们刚开完 2025 年雁栖湖战略会,达成了什么新共识?

李想

战略上的核心共识,还是延续去年秋季战略会做出的判断,但延伸出一些关键想象,以及往后看 3 年、6 年可以思考和探索的关键点。

如果看战略,中间的圈是规模。圈外有 3 个变量:用户需求、技术产品和组织能力。当规模变化,这 3 个变量也会变化。

今年我们会有 1000 多亿收入,去年是 1450 亿收入。如果继续往前走,规模的限制会在哪里?如果要获得更大规模,哪些东西会成为限制?

从用户需求看,我们今天主力车型都是 SUV,可不可以靠卖 SUV 卖到 3000 亿、5000 亿甚至更高收入?这就是挑战。像路虎这样的品牌也没有做到。

去年我们的用户是 50 万辆,今年会更多。如果做到 100 万辆以上,用户群规模就和 BBA 一样大,意味着用户群扩大很多倍,和这些用户的沟通也不一样。

所以我们要思考:如果往更大规模走,要覆盖哪些过去没有覆盖的用户群,应该怎么和他们沟通?

从产品角度,家庭定位是很好的定位,但如果只做家庭 SUV,面向全球是不是有问题?我们做了分析,在面向全球、面向更大范围用户时,有必要做轿车。但应该做好的家庭轿车,而不是运动轿车。

家庭用户在空间上有优势,也应该丰富 MMPV 产品,做大空间的家庭轿车,面向更广泛的用户和全球市场。但不是出很多车,而是把 SKU 有效控制住。这是用户需求可能发生的变化。

从技术角度,可以看 3 到 6 年。车实现全自动驾驶以后,会成为人工智能时代营业收入最高的终端,可能做到千亿美元收入。一家企业做到千亿美元收入,可能会超过中国所有手机厂商的收入。

为什么车会是人工智能时代的终端?它有 4 个特点:第一,具备 360 度感知物理世界的能力;第二,具备认知决策能力;第三,必须有 action,可以操作终端上的软件,也可以直接操作机器人;第四,要有自己的反思和反馈能力。

像人一样具备这 4 个特点,才可能是 AGI 时代的终端。汽车会从智能终端变成人工智能终端。

我们还要思考,在生活范围、家庭、工作中、身体上,是否会出现符合这 4 个特点的新终端。这可能形成未来的机会。

苹果也不是只卖 Mac。发展到一定阶段,它做了 iPod 和 iPhone,而且都非常成功。微软也不只是操作系统,还做 Office 和语音服务。小米也做 IoT 和汽车。到了 5000 亿以上规模,就必须考虑这些事情。

用户群变大,用户需求更完善,我们能不能满足用户工作和生活中最主要的场景,推出最有竞争力的 AGI 终端产品?这是从技术产品角度看,未来 6 年要思考的事情。

第三是组织能力。如果要做到 3000 亿、7000 亿收入,需要哪些能力提升?规模小时,招一个人就能带来能力;规模变成千亿以后,能力怎么选择就变得关键。

这个阶段我们小时候没有看懂苹果。现在可能要重新研究苹果,发现苹果还有很多值得学习的能力。一个公司做到千亿收入,再看万亿收入公司的能力,开始能模模糊糊看懂;规模小时看不懂苹果为什么这么做。

最后还是规模。规模是可以确定衡量的,规模变化会带来用户规模和用户需求变化,也会带来技术、产品、组织和能力的变化。

张小珺

学习苹果会带来你们什么改变吗?

李想

我们一直在学习。组织能力很难自己发明,除非大到一定程度,没得可学。

最开始我们认真学习丰田的工作法,学习 GM 的研发流程,也学习 Google 的 OKR,用来对齐不同业务团队。这帮助我们完成了第一个阶段,也就是理想 ONE 的研发和交付。理想 ONE 帮我们创造了超过 100 亿美元收入,卖了 20 多万辆。

第二阶段的重要问题,是从百亿收入走向千亿收入。我们研究这个行业更像什么,也研究过苹果,但当时人才密度不够,甚至没看懂苹果。

当时有很多华为的书,华为也愿意把能力写成书分享出来,所以第二阶段我们向华为学习了组织能力,包括 IPD、财务、流程,以及人力资源三支柱。

这些能力配合理想 L 系列的平台化研发能力,以及大规模销售团队的管理能力,再加上销售团队背后三支柱的赋能和约束,让我们快速借助 L 系列产品做到超过 1000 亿收入。

我们知道靠这些能力还能做到 2000 亿、3000 亿,但 3000 亿以上怎么办?这是几年后的事情,也就是 3 年之内的事情。

张小珺

为什么是学苹果?它也不是一家 AI 公司。

李想

最重要的是学能力。苹果最开始也不是手机公司,也不是 MP3 播放器公司,它就是电脑公司。

它能从电脑公司变成音乐播放器公司,后来变成手机公司,再变成软件服务生态公司,一直在变化。

张小珺

理想是谁?

李想

往后看,我们会变得越来越清楚。到 2030 年,我觉得一个比较好的回答是:我们希望成为全球领先的人工智能终端企业。

张小珺

现在加了“终端”。

李想

对。这相比去年我们聊的时候是一个变化,因为过去没有做这个选择。今年这个选择变得很清楚了。

我也跟团队讲明白,团队要知道为什么做这样的选择。这是今年的选择,是去年年底、今年年初开始形成的。我们不断碰撞,想知道我们要成为谁,但更重要的是回答我们是谁。

1975 年出现 Apple II,后来又出现 Mac。苹果做的是终端,是软硬件结合。

同一时期也出现微软,先做 DOS,后来做 Windows。它做的是操作系统和软件生态。这两种取向没有对错,但在那个阶段,微软赢了,苹果遇到很多挑战,不过苹果至少活了下来,因为它有独特价值。

2007 年又出现了 iPhone,苹果再次选择做终端,这一次除了软件和硬件,又加入了服务。苹果的服务做得非常好,服务利润收入占比也很高,成为 3 种能力的结合,但定义仍然是终端。

紧接着出现 Android,角色从微软变成了 Google。Android 做手机操作系统和服务生态,操作系统开源,但服务属于 Google 自己,比如 Google Maps、Gmail 和 Google Play,模仿了 App Store 的体系。

如果看移动互联网时代,苹果和 Google 基本不相上下,它们是全世界仅有的两家每年净利润接近 1000 亿美元的公司。它们做出了完全不同的选择。

回到人工智能时代也是一样。今天很多问题是因为没有 action。需要 action,就需要终端,不能只知不行,知行合一才有更大的价值。

也会有企业像 OpenAI 一样做模型,后面做模型的 Agent OS,建立生态、开放 API。同样,这个时代也需要终端公司。

我们为什么先切入自动驾驶?因为自动驾驶足够大,汽车是足够大的市场。但我们可能不会局限于这一个终端。这个终端做成以后,我们的能力能不能覆盖用户,让他们生活得更好、工作得更好,覆盖更多 AGI 时代的终端?

我们不会再做上个时代的终端,但进入任何一个终端,都必须符合刚才说的 4 个特点:对物理世界 360 度感知,认知决策,真正执行 action,无论控制机器还是执行软件,以及真正的反思和反馈。

软件、硬件和服务的能力要求,也会变得不一样。

软件方面,第一要有很好的模型能力,尤其要理解物理世界,在物理世界工作,横穿物理世界和数字世界。不仅看清道路上的车,理解修路、胡同小巷,还要看懂导航地图和各种软件。

第二要有很好的操作系统能力。人工智能时代的终端要是实时的,不能像 Android 那样是后台任务排列式,也不能像传统 AUTOSAR 那样是链式的。它既要并行,还要有效使用 NPU、MCU 等计算内核,确保实时性和准确执行。

操作系统要有很高的性能,符合人工智能在物理世界和数字世界运行的需求。还要能做更好的虚拟机,用户本地电脑工具不够时,提供更高性能的虚拟机。

第三要做好各种工具,但要符合人工智能所需要的常用工具。工具也会因为人工智能变得更有效、更高效,Agent 也要调用工具。这 3 个软件能力缺一不可。

硬件方面,第一是本体发生变化。要把车控制得更好,就要自研线控系统。计算单元之间的部署关系也会变化。

车是否一定是中央大脑加几个分脑?不一定。任何端到中央大脑都有距离,所以可能既有集中式计算,也有分布式计算,而不是一个大脑独立工作。线数更少,传输效率更高。

第二是 NPU。大家现在太关注云端训练和推理,但终端上,如果只能放 3B 模型跑 10Hz,另一个人能放 30B 模型跑 10Hz,就是 10 倍性能差距。

当大脑变强,心脏也要变强,NPU 就像心脏。后边要求会越来越高,今天很多架构可能已经不实用了。

第三是制造环节会变化。为什么工厂不能变成一个机器人?小时候看《变形金刚》,有擎天柱、威震天这样的机器人,也有宇宙大帝这样的机器人,它本身是一个星球,身体就是机器人。

我们能不能拿 AGI 生产 AGI 的终端?我觉得工厂面临这样的机会。

很多人想象造一个人形机器人,到工厂替代人。我觉得有两个问题。第一,工厂里人的成本占比没有大家想象得那么高,替代起来并不划算。第二,这些就业长期而言仍然非常有必要。

我们应该关注的是,如何把一个工厂变成一个机器人,简化工厂里各种繁琐复杂的环节,让生产效率得到更大提升。AGI 在制造领域应该关注生产效率提升,而不是人的替代。只关注人的替代,我认为比较狭隘,或者这些人没有真正管理工厂的经验。

一个完整终端有 3 个部分:软件、硬件,以及 AGI 时代会发生变化的服务。

我们无法写一套传统 IT 软件,靠人去接管 AGI、管理这些 Agent,这会是一个很大的挑战。英伟达做 Cosmos,我们构建交通世界模型,做 Agent OS,核心都在运营。

一方面,如何运营跑在物理世界里的 AGI 机器人,无论是车还是其他形态;另一方面,一个人如何和几个 Agent 一起工作,或者带领几个机器人一起工作?到底是 Agent OS,还是其他形式?这必须解决。

既要解决 Agent 运营本身的问题,也要解决 Agent 和人的连接问题。这就是服务。

未来 3 到 6 年,所有企业都要解决 AGI 终端软件层面的 3 个问题、硬件层面的 3 个问题,以及 AGI 运营和 AGI 与人的连接问题。

张小珺

我感觉你要做的事情好多。

李想

其实不多。如果这些问题不解决,就会出现今天的现象:大家觉得 AI 很厉害,但每天工作时间变得更长,虚假和不靠谱的信息变得更多,陪家人的时间变少。我觉得这些都是问题。

张小珺

我知道你们把机器人分成穿戴机器人、空间机器人和家庭机器人。你们对于机器人的节奏和规划是什么样的?

李想

不可能直接上来给出节奏,还是要根据行业进展,做相应研究和分析,也要看哪些能力需要自己解决。

很多人说眼镜会是未来的穿戴终端,或者穿戴机器人,但今天还不是。它确实具备 360 度感知,但显示还不行,无论光波导显示还是集中显示,都不能成为真正长期使用的方式。

还有电池、电量、独立计算和通信的问题。这些问题解决以后,它可能成为人类穿戴 AI 的一条路径,但今天还不是。也可能解决过程中出现另一条路线,跑在前面。

在家庭里也是一样,到底是人形机器人服务所有事情,还是家里有更好的感知和更好的大脑,只需要一个简单的人形机器人,在厨房里拿人类的铲子和锅工作;也可能只需要改造一个锅,让它直接做菜。整个家里有统一的大脑和统一感知。

两种路线都有可能,每条路线都有自己的支持者。接下来这些事情可能都会发生。

张小珺

什么样的终端是理想会做的,什么样的终端是理想不会做的?

李想

这件事只和我们的规模相关。规模小时尽可能收敛,规模大时必须扩张。

如果 Google 不成功做出操作系统,就不是今天的 Google;如果它只做搜索不做 Android,也不是今天的 Google。微软如果不做 Office 和云服务,也可能不是今天的微软。苹果如果只坚持做 Mac,不做 iPad 和 iPhone,也可能是另外一家企业,和历史上那些消失的电脑企业一样。

这件事不能单独看,只和规模以及规模带来的用户变化有关。

张小珺

你说理想是人工智能公司,今天说的是人工智能终端公司,但大家对理想业绩兑现的判断仍然是销量。你觉得这合理吗?什么时候销量能够和做人工智能挂钩?

李想

我们的能力和给用户带来的价值还没有表现出来,所以如果现在就给我们人工智能方面的估值,反而会让我们心慌。

可以从两个方面看。第一,我们能不能率先做出 L4。未来大家上下班时,不是坐在方向盘前,而是坐在桌子前吃东西、看电脑,到公司就到了。我们能不能加速这一天到来?

第二,从工作效率看,今天接近 100 万人,创造 7000 多亿人民币收入。如果人工智能出现以后,我们能不能用 10 万人以内,甚至 5 万人的规模,做到 1000 亿美元收入?

如果这些都做到,就证明我们的人工智能战略真正发挥了价值。如果没有做到,就应该给我们车企估值,这很正常。光说没做,或者做了没做到,都不能算。

张小珺

你们现在又做操作系统,又做芯片,既做大模型,也在终端上做车、眼镜和机器人,会不会铺得太开?

李想

没有。苹果 2001 年推出 iPod,2000 年时已经有苹果电脑、操作系统和软件生态。那时候苹果的收入只有几十亿美元。

对比苹果那个时代,我们现在的规模做这些事情是合理的。如果只有两三百亿收入,做这些事情不合理;但如果有 1000 多亿收入,正往 2000 亿走,做这些事情是合理的。它既能增强能力,又能降低成本,不会带来坏处。

做操作系统这些年投入了 10 亿元,但节省的钱不是 10 亿元,而是 50 亿到 60 亿元,太划算了,为什么不做?

张小珺

上次我问你,理想有理想吗?这次想问,你对理想的设想会不会太过于理想?

李想

我们会看得远一点,但当下仍然很脚踏实地,因为我始终坚信基本功最重要,尤其到了这个时代、这个规模,尤其到了人工智能时代。

人工智能时代和编程时代的差异,是编程时代比较功能,人工智能时代表现能力。关键是怎么把能力变成业务,变成用户价值。

这些能力没有捷径。想跳过能力直接实现成果,在人工智能时代真的像练《葵花宝典》。我们希望成为一个练基本功的人。

张小珺

理想会因为什么消失?

李想

刚才讲的 3 个点都会消失。

如果我们没有把握住用户需求,会消失;没有掌握最好的产品和技术,会消失;组织能力出现巨大问题,也会消失。

这 3 个点是非常好的诊断。单独看一个,容易看得不全面;把 3 个点放在一起,相互支撑,整个系统的诊断能力会更强。

张小珺

战略会上有人跟你吵架吗?有人和你争执、提反对意见吗?

李想

无论战略会还是现实工作中,始终都有反对意见。

比如有些东西我们决定停掉,最后他们私下里还会继续做,做出验证结果,坚持要做下去,那我最后还是会认同他们。

刚才讲的所有讨论、争执和吵架,背后更重要的一点是能量。当人与人之间始终有能量,这些争执、讨论和吵架就是一个更完善的大脑。

当能量消失时,争执、讨论和不同想法就变成内耗。比能力和业务更重要的是,到了这个规模,到了今天这个比较混乱的时代,能量特别重要。

我过去是能量的受益者。每到关键时刻、最困难和变化的时候,我们的能量反而变得更强。后来我复盘过去如何构建能量,也尝试把这种构建方式让核心团队和更多团队掌握。

汽车之家为什么能变成第一?我们也遇到非常多困难,困难并不比别人少,上市受阻,发展初期我还差点被赶出公司。但每次遇到问题,我们都会变得更强。

很重要的一点,是有 3 个人支撑:我、秦致和樊铮。我们 3 个人形成了非常有效的支撑。

所以我经常说,一个重要支撑往往由 3 个人开始。合伙制、合伙机制、董事会,往往都是 3 个人起步。很少见两个人的董事会,但 3 个人的董事会是有的。

三个人并不内卷,而是一致对外;但三个人会通过吵架思考,形成一个更全面、更强大的大脑。三个人组合在一起,就像一个 MoE 架构。

这个强大大脑讨论出来的判断,过程可能比一个人随便想一下复杂,但一旦形成,三个人会形成更强的心脏。决定做一件事时,三个人相互支撑,不用担心倒下;缺资源时有人补,缺能量时有人给能量。

到了理想汽车也是一样。前期有我、沈亚楠、马东辉、李铁。沈亚楠离开后,马东辉接替了他的工作,但我和李铁必须成为马东辉心力的支撑。

你去做,出了任何问题都不会倒下,我们帮你撑着;需要什么调整和支持,就一定给你;遇到问题,我们一起用一个大脑去想。

后来谢炎加入,也包括邹良军的加入,5 个人形成一个更强的大脑。它一定比我一个人的大脑更强。一个人大脑可以随心所欲,但更强的大脑能力更强。

张小珺

这 5 个人怎么让能量更凝结,而不是互相内斗?

李想

我会把我怎么做告诉他们,会把他们拉在一起,促成一次次大小事件,让他们以这种方式工作。

张小珺

多少人形成的能量场连接最稳固?

李想

一般是 3 到 7 人。少于 3 人太少,两个人不太容易;多于 7 人又太多。所以我们设计很多结构时,会有意设计 3 到 7 人的组合,形成脑力和心力支撑。

张小珺

这是量化的,还是你的直观感觉?

李想

是直观感觉,能够形成更强大的能量场。

人工智能时代也是这样,更多小组织形成脑力和心力支撑,但仍然可以连接更多组织,不受影响。

张小珺

人和人连接的本质是什么?

李想

两个在意。

第一,要在意客户、在意用户,因为在意用户是一种最重要的价值观共识。第二,要在意身边这几个人,先对人再做事,而不是只对事不对人。

张小珺

你刚才说人不想改变,但人愿意成长。所以你说自己的驱动力是成长,但其实做的是改变。你最近做的成长和改变是什么?

李想

我最大的成长,是如何通过合伙合作的方式构建脑力和心力的模式,以及如何让团队和更多团队使用。

这个东西只有好处没有害处,让大家尝到构建脑力和心力的组织方式的优势。我觉得这是我最大的成长变化。

张小珺

我听说你花 80% 甚至 90% 的时间都在 AI 上,那你对车的关注还多吗?

李想

这是一个误解。如果拿一天工作时间来分配,今天大概 60% 是组织和人的工作,包括研究人工智能组织应该怎么管理,也包括面试不同的人、干部、新员工和校招生,以及沟通培训。

另外的工作,一半在车上,一半在车的业务和人工智能业务上,大概是这样的分配。

张小珺

人工智能企业转型,你觉得现在进展怎么样?有没有遇到阻力?毕竟有两种企业文化,一种是汽车制造业文化,一种是 AI 企业文化。

李想

这方面我比较有心得。高维的信息管理方式是兼容低维的。

比如数字化能力很强时,可以把传统汽车流程放进数字化体系,解决工作协作和改善;也可以把传统销售管理放进数字化体系。

传统组织方式仍然存在,但高维组织方式能够兼容它。它继续运作,不受影响。

我们做汽车以后看到一个很大的机会:没有因为管理工厂而被难住,相反,管理工厂的效率很高,质量也很好;也没有因为传统销售方式而被难住,销售效率和成本管理都变得更好。

核心是我们有管理复杂大型软件团队的能力,并理解这样的体系。人工智能也一样,人工智能管理方式可以包容和兼容传统方式,比如 IPD 流程对它而言不是问题。

张小珺

DeepSeek 的组织是一群很年轻的人,职级更少,分工也没有那么精细化,和你们完全不同。做 AI 一定需要这样的组织吗?你们内部是否也需要做一些 Lab?

李想

我不需要这么纠结。管理工厂是一种组织方式,做操作系统是另一种,研发汽车是一种,研发智能驾驶又是另一种。

我们真正做端到端的团队只有 200 人。公司内部有七八百人,因为还有做研究、做数据的人,但真正做端到端的只有 200 人,和特斯拉规模差不多。

竞争对手做规则算法,通常是 2000 人、3000 人、4000 人,甚至 5000 人、6000 人。但从最终产品体验而言,我们 200 人做的端到端,至少今天看到的体验更好。

模型团队还要做 VLA 训练和多模态训练,团队规模也是 100 多人。它不像 DeepSeek 在语言上做得那么深,但要做得更宽。

我们的智能驾驶团队和模型团队,校招生占比极高,基本有 60% 到 70% 是校招生。

我和梁文锋聊完后印象特别深的一点,是他认为应该让年轻人搞研究。很多经验对研究反而是障碍。所以我们也大胆使用校招生,很少招行业大拿。

别人会质疑我们没有大拿,但我们坚持这么做。自动驾驶没有进什么大拿,模型也没有进什么大拿。但我们的自动驾驶团队,可能是中国所有公司里被猎头盯得最紧的团队。

另一个启发是,关于强化学习如何获得有效反馈。他提到中国教辅材料是一个有反馈的、非常好的强化训练体系。

后来想想确实如此。教辅有完整的解题过程,公务员考试也有完整讲解。交通规则、人类对舒适度的判断、人类接管,都是让强化训练获得有效反馈的体系。

张小珺

他还有给你过什么 input 吗?你对他的整体印象是什么?你当时有没有预感到 DeepSeek 会很强?

李想

我们觉得他们很强,但没想到会那么强。

当时聊天时,他认为和 OpenAI 的差距还有一年的时间。那时候他们还没有做 R1。从 o1 发布到 R1 推出,大概是 9 月到次年 1 月,只有三四个月,一个季度左右,确实非常厉害。

张小珺

你觉得 OpenAI 的领先优势还能持续多久?

李想

不好说。OpenAI 是综合能力很强的公司。我最开始就讲,它的研究强、研发强、产品强,沟通能力也很强。

这一波生图,它又借助很有情感的动画漫画风格实现爆火。现在我大概有十分之一的朋友把微信头像换成了它的吉卜力风格,这也是一种炫耀。

它是综合能力非常强的公司。一周超过 4 亿访问用户,非常了不起。

张小珺

你觉得理想今天的人才密度够高吗?怎么和 DeepSeek 抢人才?

李想

DeepSeek 和我们是不同方式。但如果正常抢人才,我们的吸引力在变得越来越好。

真正做 AI 的人都知道,场景、数据和持续资金很重要,也知道公司到底是真相信,还是只在口头上说。这几个关键点背后意味着什么,大家都看得懂。

张小珺

刚才说梁文锋为什么一开始就觉得应该让年轻人做研究,他有说原因吗?

李想

成熟研究者往往已经有自己的框架。

我始终认为他自己就是一个最佳实践。可能从他在浙江大学学习,到他所在的学院,他本身就是一个最佳实践。

他做任何事情都先搞研究、先做分析,所以成功率很高。无论大家说当年炒股票、做量化,还是做其他事情,他都是成功率很高的最佳实践,只是把这个最佳实践在组织里内化了。

张小珺

那你是把什么样的最佳实践内化了?

李想

成长。

张小珺

现在你还能说自己是一个超级产品经理吗?这个标签对你还合适吗?

李想

我是通过成长去实现用户价值,形成这样一个循环。

成长是我的驱动力,变成用户价值、变成商业价值,是结果,是因果关系。

张小珺

你不是技术型 CEO,不像梁文锋那样,你担心手下 AI 高管忽悠你吗?

李想

如果是科学,他可能忽悠我;但如果是工程,他忽悠不了我。幸好 AI 不是科学,AI 是工程。

张小珺

为什么工程忽悠不了你?

李想

我从小就有很好的工程思维。

当年设计网站架构时,我们设计的是最先进的汽车之家架构,这个架构成为所有垂直网站的统一架构,到今天都没有变。

包括设计增程架构,今天大家也没有改变增程架构,只做局部修补。还有控制器如何控制增程,当时大家讨论出一个架构方式,到今天也没有变化。

我比较喜欢物理,从小就喜欢物理。只要是工程架构、工程问题,我觉得骗不了我。

工程能力很多时候在于怎么问结构性问题。我虽然不去做具体事情,但可以通过问更好的问题,帮助团队澄清问题和架构,让效率更高,内部推动事情更快。

张小珺

作为一个 CEO 大模型,你最近通过自我推理,最长的一个问题是什么?能不能展示一下你的思维链?

李想

战略是最重要的推理结构。

我会拿一个规模,因为规模和时间连在一起。比如看 2027 年,也就是 3 年时间,去推理用户会发生什么变化、用户需求会发生什么变化、技术会发生什么变化、技术带来的产品会发生什么变化、组织会发生什么变化,以及组织应该往哪里走。

这是我最近在脑子里完成的一次比较完整的推理。但推理完没有用,还要把它变成 action。有想法和能落地,仍然是最大的鸿沟。

张小珺

你们今天说自己是人工智能终端公司,好像比去年年底更具象化了。

李想

一方面是看清了要解决的问题,另一方面是更好地看清了自己。

过去我们并不清楚,但今年做了选择。后边无论机器人形态还是人工智能机器架构,尤其在物理世界运行,都会涉及生命安全和财产安全。

PC 时代,苹果输给微软;移动互联网时代,苹果和 Google 算是打了个平手。但到了人工智能时代,尤其在物理世界里,我认为可能会反过来,终端企业的价值会战胜平台企业。

因为它涉及生命安全、财产安全。一致性由一个主体解决,还是由多个主体分开解决,是不一样的。

张小珺

你们能成为下一个时代的苹果吗?

李想

这是我们努力的方向。成为 AGI 时代领先的终端企业,是我们的核心成长目标。

张小珺

马上 7 月份是理想的 10 周年。站在今天回顾理想这 10 年,脑海里最深刻的几个场景是什么?

李想

第一个最重要的画面,应该是 2018 年理想 ONE 第一次发布,一直延续到 2019 年 4 月上海车展第一次正式展示、公布价格。

那是一个非常重要的时刻:我们真的做出了一辆车,而且特别受用户喜欢。在上海车展展馆里,我们是人流量最大的展台。我们从什么都没有开始做,这是一个非常重要的画面。

另一个是 2022 年发布 L9。那真的是全世界最卓越的产品。到 2025 年,至少有 5 家以上企业,因为 L9 的成功,在打造和 L9 相同的产品。

张小珺

所以你脑海里浮现的都是幸福的时候,而不是痛苦的时候。痛苦的时候会回忆到吗?

李想

太多了。

刚刚经历 L9 的幸福,就出现了全网黑公关,说理想汽车倒闭。那一个季度我们亏了十几个亿,接近 20 亿,过去从来没有亏过那么多,忽然从巅峰掉到谷底。

但好处是,我们认识到很多能力不足,就去补了很多能力。正因为这件事,我们的调整又带来了 2023 年接近 3 倍的增长,直接做到 1200 亿收入。

创业这么多年,很多时候问题到来,也是更大机会的到来,所以我不太纠结。

我对不正常的事情耐受力很差,但对不好的东西,解决完以后记忆很差,会把它忘掉。不过让我回顾,还是能回顾起来。

张小珺

如果可以删除一段记忆,你会删掉什么?

李想

为了让自己有更好的正能量,我尽可能只保留有价值、美好的片段。

哪怕是不好的事情,我也会转换表达方式。比如被黑、被打击,我会说,正因为这件事,我们增长了 3 倍,获得了其他新势力没有的能力,面临了其他新势力没有的挑战。

张小珺

这是一种心态。

李想

对。我不希望创业变得不容易,但没必要苦哈哈的。苦和甜也是一个硬币的正反面,只是你选择看哪一面。

张小珺

甜多还是苦多?

李想

按时间轴而言,肯定苦更多。但吃苦吃多了,也就习惯了。

张小珺

余凯博士第一次见你,是在杭州一起爬山,你们是湖畔大学同学。他记得你那天穿着一件军大衣。我很好奇,军大衣包裹着一个什么样的灵魂,它和今天发生了什么变化?

李想

没什么变化。我甚至认为今天 90% 的状态和思维方式,和高中时差不多。

遇到问题就解决问题,去解决别人不愿意解决的问题,解决消费者遇到的最大问题,找更多人学习。

那时我是个人网站站长,是站长里少数有小团队的人。我知道靠自己能力不行,还要依靠别人、完善能力。到今天没变化,只是解决的问题变大了,服务的用户群变大了,公司规模变大了,组织变大了。

张小珺

过去 10 年的记忆里,如果能改变一个记忆、改变一个程序,你想改变什么?

李想

真没什么要改变的。

能赶上这样一个时代,几次创业还能一路走下来,在最难的时候总有人帮你,遇到问题总能从坑里快速爬出来,一帮人齐心协力变得更好,我觉得已经很幸运了。

无论从运气层面,还是从创造出来的价值层面,我都没什么可后悔的。

张小珺

你刚才说能量。怎么让自己成为一个更有能量、更强大的人,或者吸引到更多能量?

李想

就是关注人,尤其关注离你最近的人,关注亲密关系的人。

完整讲一下,关注人的时候,首先要关注自己。作为我自己,第一,我会接受自己的优点。我身上的很多特质,经过这么多年的积累,或者从 DNA 里带来的,本身就是优势。我要发扬自己的优势。

第二,我要接受自己的不足。往往不足是优势的另一面。一个人擅长决策,可能就没有办法做很细致的运营,因为两件事是冲突的;一个人擅长运营,可能很难跳出来几个维度做决策。

一个人很懒,可能是极品产品经理;如果很勤奋,可能是非常好的业务运营。每个人都不一样。我们如果强行改变,往往会变成一个更差的别人,以及一个更糟糕的自己。

第三,用成长替代改变。关键是有没有成长。

比如做汽车之家时,我认为做好业务就行,资本不重要,最后却折在资本上。做理想汽车后,我非常重视资本,请最好的 FA、最好的律所,设计股权架构和投票权。

今天大家可以看到,所有新势力企业里,理想汽车的股权架构、治理结构和现金管理做得最好。这没有改变我的业务,而是增强了一个能力,这就是成长。

成长能给自己带来能量。你不和自己纠结,再看待别人也一样。首先看别人的优点:这个优点能带来什么帮助,怎么让它发挥出来。

看到别人的不足,根本不是问题。从创业开始我就有合伙人,樊登是我不具备的互补,秦致也是我不具备的,李铁、马东辉、谢炎同样如此。

当看到大家的不足时,反而是我的价值。我能帮助他,他也能帮助我。

第三是看别人的成长。看到孩子成长、爱人成长、身边每一个同事成长,就有能量。成长带来能量,因为变好就有能量。

你关注的是人的成长,而不是事情。这样你能自己产生能量,也能带给别人能量,还能从别人那里获得能量。别人给你能量,也不会丢掉能量,这是一个辐射作用。

另一方面,亲密关系特别重要。亲密关系里要关注人。是我需要爱人、需要孩子、需要李铁、马东辉、刘杰、谢伟国、范浩宇,而不是他们需要我更多。

首先是我需要他们,连接就不一样。我们在一起能形成很强的脑力、心力和能量。

如果我对他们没有需求,就会进入糟糕模式:无视对方、想着战胜对方、逃避对方,或者变成内卷、内斗。

我身边无论家庭还是工作,都没有内斗。汽车之家时代也没有内斗。关键是大家相互带来能量。

张小珺

你最近看见的一个人是谁?

李想

我家里最近很有意思。过去我和我老婆之间相互支撑有限。从去年年底、春节以后,一个最大的变化是我们家的大女儿形成了第三个支撑。

她 14 岁了,对事情的理解发生巨大变化,三观逐渐完善,而且超出我们的预期。她能够和我们进行很好的沟通,讨论她的人生规划、喜好,以及她对人和事物的理解。

我们家实现了 3 个人的支撑,这让家里的能量大幅提升,也会影响其他孩子。每次和老婆聊到大女儿,我们都非常高兴,没想到她 14 岁就能成为我们两个人的支撑。

我们可以讨论事情、讨论人、讨论不同见解、讨论她的规划、出去玩,以及家里要解决的问题。我觉得特别好。

张小珺

有什么事情是你当爸爸之后才理解的?当爸爸对你有什么改变或更多认识?

李想

有 3 个重要变化。

第一,每个孩子都完全不一样。这让我认识到,人是用来发挥的,不是用来改变的。应该让他发挥特长和特性,一个人应该被放大、被发挥,而不是被改变,因为我连孩子都改变不了。

意识到这一点以后,组织就很重要。要把不同特点、不同擅长的人组合在一起,形成更完整的大脑、更完整的心力和更强的能量。

过去书上讲过这些东西,但我听不懂,有了孩子以后才真正懂。

第二,我意识到,对于身边的亲密关系,是我需要他们超过了他们需要我。我需要孩子,因为孩子让我变得更好;我需要爱人,因为爱人让我变得更好;我需要群组负责人和一级部门负责人,是他们让我变得更好。

他们对我的重要性,甚至超过我对他们的重要性,至少我是这么认为的。

所以在亲密关系里,要大胆表达自己的需求,因为所有人都希望被需要,这会产生非常好的能量场。

第三,孩子是用来完善我的。孩子出现以后,我能看到自己的更多不足,也能看到更多不同的人。孩子不会对你掩饰,每个孩子都不一样,能让你把人看得更全面、更透彻,也让你更好地处理人与人的关系。

因为孩子没得选,但你仍然要处理好,这对我们是更大的挑战。

张小珺

有了“我需要你比你需要我更多”的意识之后,会带来什么行为变化?

李想

你会更加主动、积极,不会等很多事情变成糟糕结果后才行动。

你会从关注人的角度理解问题。关注孩子的需求,他就会更多讨论自己的需求;关注孩子擅长的地方,他就会不断发扬自己的擅长。因为每个人都不一样。

这时候能量的主动权在我们自己手里。别人可以带来能量,但主动权在我们手里,我们可以主动做很多事情。

张小珺

构建家庭这个组织和构建公司这个组织,有什么不一样?

李想

首先我认为同等重要。工作的同事对我而言是不是亲密关系?当然是。

对任何人来说,工作体现社会价值。比如你是一个好的公司、一个好的管理岗位的人,去最好的学校面试,带着孩子去面试,你都会优先被录取。

为什么合理?因为你作为一个好公司,在那个岗位上创造了更好的社会价值,服务了更多群体,提供了更好的产品和服务,大家使用以后变得更好。

工作是我们的社会价值,人不能脱离社会价值。当你真正没有社会价值时,会发现社会价值非常重要。

工作做好,为客户和企业一起创造价值,这是社会价值。

家庭是亲情价值,亲情价值的终点是幸福,幸福就是高质量的陪伴。

这两者不同,却相辅相成。更好的工作带来更好的生活,更好的生活产生更好的能量,也让大家更好地工作,更好地处理连接关系,有能量把结果做得更好、更卓越。两者缺一不可。

张小珺

我之前和一位教授聊天,他说几年前和你聊过,感觉你的心灵观就是家庭观,这也反映到公司上,要创造幸福的家。他想问,你有没有更大的宇宙观、世界观?

李想

我的核心驱动力是掌控自己的命运,挑战成长的极限。

成长过程,是把个人驱动力变成个人网站的驱动力,再变成 IT 商业网站的驱动力,变成全世界第一的汽车网站的驱动力,最后变成汽车和人工智能汽车公司的驱动力。

这个驱动力很有意思。我为什么喜欢人工智能?因为人工智能本身的价值观和这个是一致的。人工智能的特点就是掌控自己的命运,挑战成长的极限。

我认为这是生命成长的意义,而且具备一定普适性。至于是不是要拯救人类,每个人观点不一样。

人从出生开始上学,到大学毕业、开始工作,有多少自己想做的事情没有做,有多少想接触的万物没有接触?

什么是智慧?智慧就是我们和万物的接触。如果没有去过森林,在森林里认真玩、住过几天,可能会认为木头只是用来做筷子、纸和桌子,而不会意识到它是一个生命,是和我们不同的生命。

如果不能和孩子长时间待在一起,只是匆匆交叉而过,没有和孩子一起生活、玩耍,就不知道什么是亲密关系,也无法真正理解孩子。

我觉得智慧就是我们和万物的关系。要提升和万物的关系,首先要有足够时间和万物接触。

今天大家很卷,但这恰恰是真正人工智能的意义。比如我们的销售人员、产品专家非常喜欢和客户接触,因为他们把好的产品、好的生活方式介绍并交付给用户,能见到不同的人,学到不同的东西,用户素质整体也比较高。

他们做这件事有能量,也有好的回报。但有些事情必须做,价值却不大,只会消耗能量。

比如每天在门店邀约客户,留下联系方式后打电话邀约到店体验和试驾。每天打很多电话,这个过程很消耗。

我和智能商业、销服负责人讲过,如果到今年结束,邀约电话还不能交给 Agent 解决,那你们的工作就是不合格的,人工智能就没有意义。

如果把这些工作交给 Agent,每天节省 20% 到 30% 的时间,减少大量能量消耗,他们就可以做更有价值的事情,时间使用率更有效,工作过程也更有能量。这是人工智能必须做的事。

张小珺

你觉得人工智能到今天,是在服务人类,还是在服务它本身?

李想

服务谁,取决于人类。

今天人工智能不能处理和万物的关系,和万物的关系仍然是人类在处理。人类希望人工智能成为生产工具,它就能成为生产工具;希望它是辅助工具,它就是辅助工具;希望它是信息工具,它就是信息工具;希望它作恶,它也能作恶。

至少很长一段时间,人类决定它做什么。

人工智能能力越来越强,但人类能量有限,算力也有限。人类应该把自己的算力和特点,用来解决智慧问题,处理和万物的关系,增加能量、做熵减。

让人工智能处理复杂信息和复杂数据,不断提升能力,压缩更多知识,自动做更多 action。人类和人工智能是合作关系,不是矛盾关系。

如果合作关系做好,人类仍然是文明的领导者。工厂里也不是人类焊接、涂装和冲压,而是机器在做。机器有取代人类的地位吗?我认为人工智能越强,就越需要人类的智慧变得更强,好的智慧和好的能力是协同关系。

张小珺

所以今天人工智能让我们更疲惫、工作时间更长,只是因为时间没到?

李想

我觉得是因为能力还没到。

张小珺

人能感受到幸福,你觉得 AI 能吗?

李想

当然不能。至少我认为,Transformer 这个架构、token 和 next token 的架构,并不具备自我意识。

张小珺

你不认为它会产生意识?

李想

我认为它没有自主意识,也不能进化。进化还是要通过再训练才能进化,可能要换架构。

未来可能产生这样的架构,但今天这个架构其实很好,而且对人类很安全。

今天大模型的架构,对信息安全、财产安全、人身安全,都可以靠人类对齐解决。人类对齐仍然能解决问题。

如果突破这个架构,人类可能就解决不了了。但能不能突破也不知道。至少今天这个架构,我认为人类还是安全的。很多人是多虑了。

张小珺

你为什么这么自信地觉得它安全?你看到了什么大家没看到的吗?

李想

它的工作原理就是安全的。如果想根本性改变输出结果,需要重新训练。仅仅通过 query 和 prompt,影响还是非常有限的。

张小珺

如果可以做一个理想的硅基生命,你会把它塑造成什么样?和你一比一复刻,还是想改变什么?

李想

我希望它变得更聪明、更有能力,但我更希望人类训练得更有智慧。

关于智慧在脑子里怎么运行,我们其实不知道。为什么很多聪明人一点都不智慧?我们今天解决的是智能问题,还没有解决智慧问题。

张小珺

你从多少岁开始觉得自己拥有智慧?你今年 44 岁。

李想

2008 年。

张小珺

这么早?

李想

对。那是我开始知道怎么处理和自己关系的时候。那次我要被赶出公司,后来又有了智慧,开始初步知道怎么掌握一点智慧。

张小珺

这几年的智慧升级是什么时候?

李想

还是因为要管理更大规模的团队,面对比原来水平更高的人。智慧也要跟着提升。

张小珺

最近一次有没有开悟的时刻?

李想

没有那么多天天不停的开悟。还是刚才讲的变化:把过去受益的、建立更强大脑、更强心脏、产生更强能量的方式,应用到更多人身上。

我发现确实有机会,至少一些实验的效果远超想象。

从战略角度,我和曾鸣教授学完战略以后,发现团队的战略能力很强。过去郎咸朋可能会说,你一个搞技术的有什么战略能力?但今天他在人工智能方面的战略能力一定很强,甚至比我更强。

过去不是他没有战略能力,而是缺少方法论。有了方法论以后,他的战略能力和战略定力就变得很强。

很多人很有能力,却没有产生好结果,可能是缺少一种模式:通过几个人,3 到 7 个人组成更强的大脑、更强的心力,产生更强的能量。

我做了一些实验,当他们按照这个方向做时,产出可能和我没有区别,甚至更强,只是过去没有掌握这个模式。

张小珺

你做了什么实验?

李想

实验目的是因为我觉得这个东西对自己好,大家也可以试试是否对大家都好。但今天一些实验结果远超预期。

张小珺

你怎么看人类内部的纷争,包括贸易战、地缘政治?

李想

还是因为人类智慧没有成长。

今天发生的事情,1930 年也在发生。我们看到的各种事情,都能从人类历史中找到对应的点。这是一个很大的挑战。

我在想,智慧能不能变成一种有效的教育和训练方式。这可能是人类解决自身问题接下来必须解决的事情。

张小珺

在培养孩子时,你会怎么让他拥有智慧?当然对小孩来说,“智慧”这个词比较重。

李想

孩子比较小的时候,我会启发他们,告诉他们怎么做,让他们思考和自己的关系:自己喜欢什么、擅长什么,什么对自己好。

很多时候我们在做潜移默化的训练,但太随机了。

比如孩子 0 到 12 岁,基本通过父母认知自己;接下来 12 年,从 13 岁到 24 岁,从初中、高中、大学到毕业,通过同学和老师认知自己;24 岁以后,又不断通过社会认知自己。

认知自己可以是随机的,也就是命。但有没有可能被训练,让你成为更好的自己,也更好地和别人相处?这些能不能成为教育的一门学科?

很多时候我和同事、校招团队沟通,就是希望沟通这些东西。它不是灌输,而是通过交流和启发。

希腊三杰也是通过对话产生智慧和哲学,所以人类需要更多智慧。

张小珺

AI 的智能有方法提升,但如果 AI 智力无限增强,人类智慧没有跟上,怎么办?

李想

有可能智慧只需要前进一点,就能解决很多问题。

人类有了民主结构、不同的组织设计,相比动物有了婚姻关系,又产生了学校和高等教育。这些都会发生变化。

你可以相信,5 到 10 年,AI 一定比人的能力更强。那人干什么?如何提升智慧,也是在解决人类自身问题。

张小珺

所以智慧的归因可以归到关系?

李想

智慧最重要的是处理和万物之间的关系,包括人与人之间的关系、人与万物之间的关系。

张小珺

你最近有改善过和谁的关系吗?所谓情商高的人,不一定是处理关系好的人,对吗?

李想

我的情商观可能是智慧的一个模块。一个有智慧的人,不只是能化解问题,还能给别人带来能量。

最近最明显的关系改善,得益于我女儿的变化。

张小珺

你最近 5 年有和谁闹掰过吗?

李想

亲密关系基本没有闹掰过,但一个人要变成我的亲密关系,很难。我会进行非常严格的筛选,不会刚见面就拍着肩膀说是好哥们、好兄弟。

核心是看他给我带来亲情价值、社会价值,还是像兄弟朋友一样互相理解。

如果不是这些,他就是社会中的普通一部分,伤害不到我,我也不需要和他闹掰。我对他没有价值索取,也不需要给他贡献什么。他只是人生中会出现、但无关紧要的人。

不要构建太多亲密关系。亲密关系太多,可能说明这个人不会经营关系。

张小珺

亲密关系的上限是多少人?

李想

没有固定人数。直系亲属,从小到大几个朋友,以及工作中和你一起扛责任的人,大概就是这些。

其他关系也有,但不是亲密关系。能给我们带来伤害的只有亲密关系,它既能带来伤害,也能带来价值和能量。如果价值和能量处理不好,就会变成伤害;解决以后,又会变成价值和能量。

张小珺

我昨天晚上问 ChatGPT,让它讲关于 AI 与人类的深刻洞察。它说,人类不一定永远站在进化之巅,人类习惯性地认为自己是最复杂的智能,但如果 AI 演化出更复杂的意识结构或更有效的集体智能,人类也许不再是中心物种。人类可能是孕育智能生命形态的中介,正在经历认知主权的让渡。你怎么看这些预言?

李想

这是一个未解的问题。人类和 AI 之间的关系是未解的问题。

如果 AI 解决了,AI 就统治人类;如果人类解决了,人类仍然统治文明。这肯定是人类出现以来最大的难题。

但我有信心认为人类可以解决。需要人类把智慧当成重要特质去发展。

不能要求每个人都拥有智慧,因为人的能力有差距。但人类最高的智慧,是否比其他生物更高,无论碳基生物还是硅基生物,只要人类掌握智慧的制高点,人类仍然是文明的带领者。

张小珺

在 AI 面前,什么是值得保留的人性?

李想

所有人性都应该保留,无论好的还是坏的。没有坏的,就没有好的。

一个人的优点,另一面就是缺点;好的另一面也有不好。只想保留好的、放弃所有不好的,并不成立。

好的和不好的都可以视为一种特质,是文化、生命、性格和能力的特质。这样才是活生生的、有生命力的世界,才是活生生的人。

叔本华的一本书里讲过,人不能改变,但人有自己的特性。

张小珺

你最近听过我的播客吗?哪一期印象比较深?

李想

小红那一期比较深。

张小珺

萧红,Red,我们叫她小红。为什么?

李想

评论区有人把你和她放在一起比较。我觉得大家对她的误解比较深,尤其是中国舆论对她的误解,认为套壳不是创新,套壳不是能力。

我觉得她把 AI 真正往 action 推进,去专业地做 action,像人一样做 To Do List,是一个非常重要的尝试。

她们也需要多融一些钱,补充更基础的能力,我觉得她们会变得更好。

张小珺

还是需要做人工智能的基础能力。

李想

对。因为现在你的对手不一样,对手能力都很强。如果对手都和你一样只是套壳,那套壳加上一定虚拟机和工具能力就够了;但如果对手都是强者,必要的模型能力还是要真正去练。

118. 对李想的第二次3小时访谈:CEO大模型、MoE、梁文锋、VLA、能量、记忆、对抗人性、亲密关系、人类的智慧 | BidClub