[BidClub_]
屠龙之术 · · 76 min

Vol.52 74页PPT解读Deepseek与AI Agent

庄明浩

Podcast
TL;DR
  • 庄明浩认为,2025年初大概率的共识是,头部厂商已经处在L2“推理者”与L3 Agent之间。 从ChatGPT式对话到o1、DeepSeek R1、Kimi 1.5,能力先“会想”,再要“能采取行动”;“今天唯一的结论”不是AGI已到,而是产业竞争正从模型问答转向真实交付。对产业和投资讨论而言,模型分数仍重要,但应用执行、工作流和组织协同的重要性开始上升。
  • DeepSeek的爆火不是R1单点突破,而是技术、产品、舆论与春节情绪按日期接力的结果。 V3于2024年12月26日奠定能力基础,App在1月10日上线,R1于1月20日发布;真正的产品拐点是1月24日“深度思考”与“联网搜索”首次可以同时开启,再叠加美国科技圈讨论和冯骥1月26日那句“可能是国运级别的科技成果”,流量才被彻底引爆。
  • “560万美元训练出DeepSeek”的比较严重失真,但推理成本的指数下降是真命题。 560万美元只是V3最后一次成功训练的算力成本,不包括设备、人员和此前投入;庄明浩援引的美国头部模型单次训练估算约为数千万至五六千万美元,差距更可能是数倍至十倍。Sam Altman给出的经验是调用成本“每十二个月降十倍”,GPT-4到GPT-4o约18个月下降150倍,低价可能通过杰文斯悖论扩大而非压缩总需求。
  • DeepSeek没有终结算力投资,2025年的CapEx叙事反而仍在加速。 微软、亚马逊、Meta、Google的相关投入由2024年约2220亿美元升至2025年约3200亿美元,按庄明浩口径再叠加Stargate首年1000亿美元,接近4200亿美元;“更多的钱—更好的基础设施—更好的训练—更好的模型”至少今年不会停。英伟达因DeepSeek单日跌17%、蒸发约5600亿美元,却在不到一个月内基本涨回,也说明市场尚未放弃卖铲人逻辑。
  • 一条真正改变技术叙事的路径,是从人类标注过程转向结果奖励驱动的强化学习。 R1-Zero像AlphaZero一样,让模型在客观可验证任务上自行探索、允许犯错,只奖惩结果;R1再用少量高质量冷启动数据、语言一致性奖励、通用数据和混合奖励修正可用性。若“所有结构化方法都会限制模型的效果”成为主流,不仅削弱大规模过程标注的价值,也让Scale AI式商业模式直接承压。
  • 模型接入正在迅速商品化,搜索、云和应用公司的护城河必须在模型之外寻找。 密塔AI搜索、纳米搜索、知乎直答、Perplexity乃至微信、元宝、车机和多维表格都能接入DeepSeek;信息源差异能否形成壁垒、两个按钮式产品设计乃至是否自研模型的差异都在缩小。接下来更可交易的指标仍是ARR及增长,而长期壁垒可能来自垂直行业、分发、运营、品牌或网络效应——“钱依然是最粗暴的标准”,只是远非完整答案。
  • Agent不是一个已经收敛的品类,而是场景、技术和产品能否闭环的统称。 搜索和Coding一旦交付清晰,就会被称作AI搜索、Cursor或Devin;那些边界尚不清楚的能力才继续装进Agent这个筐。扫地机器人加机械臂展示了真实难点:视觉与推理模型只是起点,分类、抓取、避障、定价、事故处理和持续迭代才构成产品,因此“能力没有收敛之前,谨慎做应用”与“模型即应用”仍在拉扯。
Digest · the substance, structured for research

1. 2025年的产业坐标已经落在L2与L3之间

  • 这份74页PPT约四分之一沿用2024年总结,其余四分之三在2025年2月重写。DeepSeek带来的变化太快,庄明浩再看旧稿时,觉得原来的内容已经像“上个时代的东西”。

  • 按OpenAI的五级路线图,L1是聊天机器人,L2是能解决问题的“推理者”,L3是既能思考又能行动的Agent,L4是协助发明创造的“创新者”,L5则能组织并完成整个工作。

  • 庄明浩把o1、DeepSeek R1、Kimi 1.5及各家即将推出的推理模型放在L2,把下一步指向L3:“从原来的基础对话式形态,开始进化到推理模型,然后基于推理模型构建真正意义上的Agent。”

2. DeepSeek的爆发是一条精确到日期的事件链

  • 2024年12月26日,DeepSeek V3发布,中美技术圈当时已经高度评价它,媒体甚至称其为“大语言模型里的拼多多”;1月10日官方App上线,但尚未形成大众爆款。

  • 1月20日R1发布,同日晚梁文锋出席李强主持的企业座谈会。庄明浩强调,邀请不可能因当天才发布的R1临时发生,这反而证明真正先获得认可的是V3。

  • 1月21日,特朗普公布规模5000亿美元的Stargate AI基础设施计划;1月24日,Marc Andreessen、Scale AI的Alexandr Wang等美国企业家和投资人集中讨论DeepSeek,随后经国内媒体“出口转内销”。

  • 1月26日23时32分,冯骥公开推荐DeepSeek;1月27日(庄明浩说“如果没记错”)英伟达单日下跌17%,市值蒸发约5600亿美元。1月28日除夕,虚构的黄仁勋内部信和梁文锋知乎回复又完成了第二轮传播。

3. V3、R1与产品完全体共同制造了差异

  • 同期Kimi、MiniMax、阶跃星辰和通义千问都发布过模型,千问也开源且榜单成绩突出。庄明浩追问的核心是:“为什么只有DeepSeek火了?”答案不能简化成模型强或开源其中任何一项。

  • V3和R1的榜单能力足够靠前,部分成绩接近o1乃至o3;与此同时,它又被包装为中国模型、开源模型和“极其便宜”的模型,技术实力因此与国家叙事、成本冲击同时发生。

  • 1月24日前,“深度思考”和“联网搜索”不能同时开启:前者展示思维链但知识截止到2023年12月,后者联网却只用V3快速回答。两个按钮可以一起按之后,推理、实时信息和过程展示才合成了产品完全体。

  • 这也解释了App为何1月10日上线却没有立刻爆发:更多大众第一次免费看到推理过程,并且能让模型针对最新资料继续思考,不只是换了一个聊天入口。

4. 560万美元是单次成功训练成本,不是公司总投入

  • V3论文披露的约560万美元,来自约280万小时训练量乘以单位价格,指最后一次成功训练的算力成本。庄明浩提醒,它不包括购卡、人力和过往研发投入,不能直接对比OpenAI全年亏损或Stargate的总投资。

  • 按他引用的媒体估算,OpenAI、Anthropic、Meta头部模型的单次训练成本大致在数千万至五六千万美元;差异或许是数倍、甚至十倍,但不是舆论渲染的几个数量级。

  • 使用成本的下降则更确定。Sam Altman称,同等头部模型的调用成本大约每12个月下降十倍;GPT-4到GPT-4o约18个月下降150倍。“两年是一百倍,两年可不是二十倍。”

5. “国运”叙事放大了流量,也放大了真假边界

  • 冯骥的推荐同时抓住五个要素:模型强、成本低、开源协议宽泛、免费、支持联网,最后给出“DeepSeek可能是国运级别的科技成果”。从此它不再只是模型公司,而成为中美AI竞争的代表选手。

  • 两篇AI生成的假文章恰好说明这轮传播的悖论。庄明浩判断知乎回复是假的并联系平台删除,但仍有人回应:“但是写得很好啊,情绪很对啊。”截图的传播已经脱离原始账号。

  • 他在大年初一追问:“如果再发展几年,谁是真,谁是假?如果绝大多数人都相信了那个假的东西,那它还是假的吗?”DeepSeek爆火与AI伪内容刷屏,在同一天构成了能力展示的正反两面。

  • 截至2月24日,他看到DeepSeek的Web访问量和App DAU相较峰值可能已跌约70%。其中有团队未主动承接流量的因素,但“泼天的富贵还剩多少”已经成为比下载榜更现实的问题。

6. DeepSeek最难的问题已经从训练转向战略取舍

  • 第一项取舍是安全。模型对齐、App与网页数据处理、不同国家AI政策适配确实存在瑕疵;庄明浩反对把所有质疑归为敌对声音,但处理到什么程度并没有简单答案。

  • 第二项是To C:App和Web以及这批个人用户究竟重不重要?若承接流量,就要决定是否收费、是否运营、是否进入细分场景;若不承接,则必须回答模型未来以何种产品形态存在。

  • 第三项是To B。宽泛的MIT协议像是在表态“你们愿意接就接”,高峰期DeepSeek甚至关闭API充值入口,但不重视收费不等于商业化定价可以永远搁置。

  • 融资更棘手:纯财务投资“拿来干嘛”,美元VC意义也有限;接受阿里、腾讯或华为的战略投资又等于站队。国家社保基金式“国家队”资金是否接受,庄明浩称这是“非常非常难的问题”,选择静观其变。

7. 过去两年的主叙事仍是资本推动Scaling

  • 庄明浩把2022年底至2024年底的产业逻辑压缩成四步:“更多的钱,更好的基础设施,做更好的训练,得到更好的模型。”OpenAI估值一路升至1550亿美元,正是这条递进关系的缩影。

  • 美股科技七巨头总市值由2024年初11.8万亿美元升至年底17.6万亿美元,峰值约18万亿美元,并贡献标普500全年超过55%的上涨,其余公司合计约45%。

  • 英伟达从2023年约1.2万亿美元升至3万多亿美元,叠加游戏、加密挖矿和AI三轮红利。DeepSeek冲击下单日暴跌17%后,它又在不到一个月内基本收复跌幅,数据中心业务可能已占其收入约70%至80%。

8. 云、CapEx、芯片和能源仍在同步扩张

  • AWS、微软Azure和Google Cloud在2020年前后仍能保持每季35%至40%增长,2022至2023年降至百分之十几;ChatGPT发布后,增速自2023年下半年重新回到20%至25%以上。

  • 微软、亚马逊、Meta、Google的CapEx由2024年约2220亿美元升至2025年约3200亿美元,增幅44%;分项预期约为800亿、1000亿、600亿和700亿至750亿美元。

  • 若再按庄明浩的口径加入Stargate第一年1000亿美元,相关投入将接近4200亿美元,较2024年近乎翻倍。“成年人的世界,钱是最简单的标准”:科技巨头以百亿、千亿美元计,主要玩家以几十亿美元计,挑战者才是几亿美元。

  • 巨头一边买英伟达的卡,一边开发自有芯片,避免被单一供应商“卡脖子”;数据中心又开始触及能源天花板,核能成为共识方向。庄明浩引用的预测是,到2030年美国数据中心用电量可能超过日本或英国一国的全年用电。

9. 生态投资与中国“抄作业”形成同一套资本路径

  • 美国巨头通过投资和并购把挑战者装进各自生态,2024年出现了“掏空式并购”:Character.AI卖给Google、Inflection团队去了微软、Adept团队去了亚马逊,01.AI也把团队交给了阿里。

  • 巨头自身业务也不会缺席:英伟达芯片、微软Copilot、Apple Intelligence、Google模型、Amazon Nova、Meta Llama、特斯拉FSD与xAI,都服务于“基础设施加自有应用”的闭环。

  • 中国的阿里、百度、字节、华为、腾讯同样覆盖模型、云、应用和多模态。阿里提出未来三年阿里云基础设施投入超过过去十年总和;庄明浩认为可能是每年1000多亿元人民币,并举例估算约1200亿至1300亿元,勉强触到美国科技巨头的投入门槛。

  • 初创公司则已分化:01.AI转向To B实施,百川智能聚焦医疗,阶跃星辰与智谱分别绑定上海和北京;MiniMax与月之暗面仍坚持基础大模型研发,但DeepSeek让这条路线的战略压力陡增。

10. 杰文斯悖论为“低价是否摧毁算力需求”提供了反答案

  • 英伟达暴跌当天,维基百科“杰文斯悖论”页面访问量增长约200倍。煤炭效率提升最终扩大煤炭使用场景的历史类比,被用来讨论模型成本下降究竟利空供给方,还是会释放更多AI需求。

  • 预训练数据可能在极限情况下于2028年前后接近上限,人类可能已没有更多数据可以喂给大模型。Ilya Sutskever曾说,“如果你有一个巨大的数据集训练一个超大的神经网络,那么必然成功”;庄明浩随后表示,现在这套公式已经失效,预训练Scaling Law不再能独自解释进步。

  • 2024年6月Claude 3.5在文案和Coding上显著提升,Anthropic内部也把它视为推理模型;9月OpenAI发布o1,强化学习、后训练、数学和编程开始共同形成新的技术范式。

11. R1-Zero展示了结果奖励可以不依赖过程模仿

  • 复现o1的早期路线是让模型“慢下来”:用更长的思维链刺激更多内部信息,再通过PRM逐步奖励每个推理环节。如果这条路成立,数据标注需求会随每一个Step增长,Scale AI自然受益。

  • Kimi一位员工公开复盘后的结论却相反:“有精确的奖励,不要采取结构化的方法,最终所有的结构化方法都会限制模型的效果。”模型应自行搜索、允许犯错,只对最终可验证结果奖励。

  • 庄明浩用AlphaZero解释R1-Zero:只告诉围棋规则,让模型自我对弈、赢奖输罚,就能摆脱人类棋谱和偏好。对应到推理训练,就是让V3在客观可衡量的任务上纯强化学习,“真正超越人类的束缚”。

  • R1-Zero仍有中英文混杂、思维链过度复杂、通用问答不佳等问题。R1因此加入少量高质量冷启动与思维链数据、监督微调、语言一致性奖励,再混入推理和通用数据完成最终微调及强化学习;o3-mini早期的语言混杂也被他视为相似现象。

12. 蒸馏让DeepSeek输出的不只是一个模型,而是一套方法

  • DeepSeek把同一套训练方法用于蒸馏不同尺寸的千问和Llama模型,论文评分显示这些模型的能力也得到提升。关键在于,这套方法论不仅DeepSeek自己能用,其他开源模型也能用。

  • 市面上大量“本地部署R1”教程,实际部署的并非满血R1,而是这些蒸馏小模型。

  • 这也解释了Alexandr Wang为何强烈把DeepSeek上升到中美竞争:若结果奖励和自我探索减少大规模人类标注需求,Scale AI的业务空间就会收缩。庄明浩的判断不是其安全质疑全错,而是商业利益不能从表态中剥离。

13. AI搜索正在变成两个按钮和同一批模型的竞争

  • DeepSeek现在有四种用法:纯对话、联网搜索、深度思考,以及两个按钮同时开启。最后一种最重要,因为它把实时信息、推理和可见思维链结合,而此前o1要付费使用,20美元的门槛对很多人仍然很高。

  • 密塔AI搜索、360纳米搜索、知乎直答、Perplexity等相继接入DeepSeek。信息源差异能否形成足够壁垒已经成疑,产品设计则基本收敛成相似的两个按钮;“AI搜索公司应不应该做自己的模型”,此时看上去也不再有肯定答案。

  • 安克一款140W充电器的详情页直接展示DeepSeek和豆包回答,标题是“热门AI首推的充电器品牌”,并标注“数据无任何修改,未训练直接回答,真实可测”;上海一家拉面店也把DeepSeek推荐做成门口招牌。

  • 元宝回答中出现58同城、易家宝、应用下载等链接,又让用户联想到SEO。庄明浩认为在这个节点还没有人在专门做这件事,但当品牌开始把AI答案当标准,“今天自然产生的结果”未来很可能演化成面向AI搜索的新优化产业。

14. DeepSeek外溢流量把云、终端与分发渠道重新串了起来

  • DeepSeek无法承接峰值需求,云和推理服务商成为直接受益者。硅基流动流量暴涨并获得融资,庄明浩引用的阶段性统计甚至显示其流量一度超过腾讯云,“对于一家初创公司而言简直不可想”。

  • 接入范围从雪球接入华为小艺、OPPO Find N5、比亚迪车机、飞书多维表格和文心一言延伸到微信。新华社专门确认微信测试接入,庄明浩调侃:“国运级的大模型加国民级的微信应用,当然需要国社来报道。”

  • 抖音创作者的一种路径,是用扣子生成AI分身,再分发到搜索、直播间、群聊和评论区,用于答疑或卖货。这把模型能力直接嵌入既有内容和交易网络。

  • 当所有公司都能接同一模型,护城河只能重新追问:产品执行、用户运营、品牌、网络效应还是垂直行业?美国一级市场仍先看ARR及其增长,庄明浩称Cursor应该是最快达到1亿美元ARR的AI公司,“钱依然是最粗暴的标准”。

15. Agent的真正门槛是产品闭环,而不是换一个名称

  • Coding展示了能力递进:ChatGPT能按提示生成代码,却不能完整调试;GitHub Copilot理解代码并给建议;Cursor加入逻辑理解、文件和命令行执行;Devin进一步引发了“初级程序员是不是不需要了”的讨论。

  • 搜索系统会拆解任务、调用信息源、整理并呈现答案,可以叫Search Agent;Coding系统理解目标后持续执行,可以叫Coding Agent。庄明浩的尖锐定义是:场景和交付一旦清楚,就叫AI搜索或AI Coding;尚未清楚的,才统称Agent。

  • 传统Agent至少需要计划、记忆、工具调用和与其他Agent通信。2024年以来,构建方式已从代码/API转向窗口拖拽和工作流,任务从单线走向Multi-Agent,评价标准也从模型本身转向“解决问题的能力”。

  • 扫地机器人加机械臂把抽象问题落到实处:视觉模型成熟只是起点,还要区分垃圾、鞋和脏衣服,处理重量、抓取、避障、主动服务、定价、事故和迭代。难点是“场景确定—技术边界—产品交付—更新迭代”的完整链条。

  • 组织也开始按这条链拆分:阿里把通义App划入含夸克、UC等产品的智能信息事业群,模型留在阿里云;百度、字节分别拆开应用与模型团队,腾讯则把元宝、搜狗、搜狗输入法、QQ浏览器和ima归入CSIG,模型研发留在TEG。

  • 但“模型即应用”仍在挑战这种分工:有观点认为,DeepSeek几乎没有产品形式创新,爆发核心就是智能与开源;AI原生社交所需的实时文字、语音、视频与嘴型匹配又被判断仍需两三年。李翔的提醒因此成为结尾:“能力没有收敛之前,谨慎做应用。”

庄明浩

大家好,我是明浩。很久没有录自己的单口播客了。这期节目之所以拖了这么久,是因为春节之前,有一位很好的朋友找到我,希望我给他们内部做一次关于 AI 的培训和分享。

我说,春节前时间比较紧,不过我有现成的内容,就是我之前做的《2024 年 AI 行业整理》。他说,可能春节之后再讲,到时候做一些更新就好了。于是我就把这件事应下来了。

过去这个春节,关注这个行业的人应该都知道,整个行业发生了非常大的变化。春节回来以后,我又跟朋友说,如果按照原来的方式来讲,感觉像上个时代的东西,因为过去两个月发生了太多事情。他说,那怎么办?我说,这样吧,我帮你把内容更新一下,于是就有了今天这份 PPT。

我其实是今天白天才在他们内部分享完,半夜又把这批内容更新上。这份 PPT 大概有 1/4 是去年我的年度 132 页整理中的内容,主要关于海外科技巨头的共识,或者说过去两年整个 AI 行业最大的叙事结构。其余 3/4 的内容完全是新的。

今天整个内容有 74 页 PPT。你会发现,我刚刚又重做了一遍。整个创作过程应该是从 2025 年 2 月、春节之后开始的。今天是 2 月 24 日,过去整整一个月,大家基本上都被以 DeepSeek 为代表的这一波 AI 内容轰炸了,占据了所有人的注意力。

所以我们今天来做一次梳理,也算是给 2025 年做一个开端。今天的内容大概从 DeepSeek 说起,讲到 DeepSeek 的整个过程,包括 DeepSeek 的源头、一些粗浅的技术解读、新叙事的可能性,以及我对 2025 年的一些个人感觉和看法。内容不是特别成体系,希望能够对大家有所帮助。

今天分享的标题叫《从 DeepSeek 爆火看 2025 年 AI 行业的发展》。这是一个非常简单、明晰的标题,我没有做太多比喻,也没有做太多抽象的理解。

1. AI行业进入推理时代

首先,我希望大家了解一下当下 AI 行业的现状。我在 PPT 里放了一张看到的梗图,非常有意思。图里画了一只大象,大象代表公司;旁边画了一条蛇,蛇代表 AI。所有人都希望自己的公司能够和 AI 结合,于是那条蛇开始咬大象,从尾巴开始咬,并且说:“让我们建立一个 AI 功能吧。”

它逐渐把大象整个咬上去,最后变成了一只恐龙。你可以理解为,蛇的整个身体套在了大象身上,大象把鼻子伸出来,于是它就变成了一家 AI 公司。这可能代表了当下这个行业的现状:很多公司的 AI 业务,本质上都是新瓶装旧酒。这是一个典型现象。

再回头来看,得亏我之前那版报告在去年 12 月就做完了。因为从 12 月开始,整个行业发生了非常多的变化。现在回头看,那 130 多页的报告,真的感觉像上个世纪的叙事。得亏那份报告是在 12 月完成的。

如果我们今天对整个内容的梳理只能用 1 页 PPT 来讲,我做了一个非常简单的整理。

OpenAI 在去年年中的时候,发布了一个它认为从现在到 AGI 的路线图,用类似自动驾驶的方式定义了 L1 到 L5。也就是说,一共有 5 个阶段。

L1 是我们看到的、以 ChatGPT 为代表的聊天机器人,它具有对话能力,这叫 L1。L2 叫推理者,它能像人类一样解决问题,推理模型就是 L2。OpenAI 在 9 月发布的 o1,以及今天大家都知道的 DeepSeek R1、Kimi 1.5,包括最近一段时间所有头部厂商正在或准备推出的自家推理模型,都属于 L2。

L3 是 Agent 智能体,不仅能思考,还可以采取行动。L4 是创新者,能够协助发明和创造的 AI。L5 是组织者,可以完成整个工作,也就变成 AGI 了。这是 OpenAI 在去年年中定义的技术路线图。

现在的问题是,在 2025 年初这个时间点,我们走到哪儿了?大概率比较共识的结论是,头部厂商已经在 L2 和 L3 之间。也就是说,头部厂商在推出自己的推理模型的同时,也在向 Agent 走。

所以,如果今天只有一个结论,那就是:我们正在从原来的基础对话形态,进化到推理模型;基于推理模型的能力,我们开始尝试构建真正意义上的 Agent。这就是今天唯一的结论。

今天的内容大概有 4 个部分。第一部分是 DeepSeek 爆火的过程。即便到了今天,DeepSeek 已经火成这个样子,关于 DeepSeek 仍然有非常多的谬论和误解。

我上一期和 Lily、张鹏、张涛老师讨论 DeepSeek 的那期播客,应该已经解答了很多错误。有兴趣可以回头去听那期节目。那期没有上首页,也没有上推荐,好像只上了一天锋芒榜。但因为这个话题的热度很高,而且当期内容讨论的质量确实不错,Lily 上了首页,那期现在回头看已经有 1.5 万的阅读量。

对于我这样一个只有 2 万多订阅的播客而言,在没有任何推荐的情况下,这个阅读量还是能够让人理解 DeepSeek 这一轮的状态的。

今天第一部分是关于 DeepSeek 爆火。第二部分沿袭去年 132 页 PPT 中的一块内容,讲过去两年的主流叙事,也就是中美头部科技巨头在过去两年 AI 行业中的核心逻辑。第三部分,我会开始探讨和整理新一波叙事的可能性。最后,我们再往 2025 年推一推,聊聊我对 Agent 的一些想法。

所以大概就是 4 块内容:DeepSeek 爆火、过去两年的叙事、新叙事的可能性,以及“万物皆可 Agent”。

我们正式进入第一部分,关于 DeepSeek 的种种。

我用了一张外媒在 DeepSeek 爆火那几天制作的图:梁文锋在座谈会上的模糊背景、DeepSeek 的 App,以及股市上涨的红线。这张图大概代表了那段时间大家对这件事情的各种讨论。

2. DeepSeek独自引爆行业

不知道大家有没有想过这样几个问题。春节前后,国内的头部大模型厂商其实都发布了 1.5 版本。阶跃当时发布了 2 个开源小模型,最近两天又发布了新的多模态和语音模型,并且开了发布会。Kimi 差不多在同一时间推出了推理模型 1.5,MiniMax 在 DeepSeek 之前也发布了 2 个小的开源模型,通义千问也发布了新的模型。

大家会想,为什么只有 DeepSeek 火了,其他人没有火?这是第一个问题。

有人会说,很多模型是闭源的,而 DeepSeek 是开源的。那在春节假期中间,千问也发布了一个非常好的模型,各种榜单成绩也非常棒,为什么千问没有火?

大家可能又会说,千问是阿里的,属于科技巨头。无论是中国还是美国,核心科技圈和媒体圈对于科技巨头的开源模型,天然还是有一定顾虑的。

DeepSeek 现在大家用得最多的推理模型叫 R1。R1 是 1 月 20 日才发布的。在 R1 之前,DeepSeek 在 2024 年 12 月底发布了基础模型 V3。

所以回头来看,对于整个事件而言,到底是 V3 重要,还是 R1 重要?这是第三个问题。

第四个问题是,此前如果用户想使用 DeepSeek,只能使用网页端。DeepSeek 自己的 App 是什么时候上线的?我查了一下,是 1 月 10 日才上线。可是 DeepSeek App 1 月 10 日上线后,为什么没有火起来?它是在春节期间、1 月 20 多号才火起来的。这两个时间点之间发生了什么?

不知道大家是否想过这些问题。想过的话,可能自己已经有答案;没想过也没关系,今天我会一一解答。

3. DeepSeek爆火时间线

首先,我们梳理一下整个事件发展的时间线。我做了一张重要节点的时间线。

2024 年 12 月 26 日,DeepSeek 基础模型 V3 发布。在那个时间点,中美核心技术圈对 DeepSeek V3 的评价就已经非常高了。如果大家有心回去翻新闻,会发现那个时候已经有媒体开始写,DeepSeek V3 是大语言模型里的拼多多。

刚才提到,1 月 10 日,DeepSeek 官方 App 发布。1 月 20 日,DeepSeek 推理模型 R1 发布。1 月 20 日晚上,国务院总理李强进行了一次企业座谈会。那天晚上,梁文锋已经出现在座谈会的会议室里。

可是,1 月 20 日当天才发布 R1,梁文锋受邀参加这次座谈会,绝对不是因为 R1,而是因为 V3。因为时间来不及。如果是因为 R1,显然不可能当天发布、当天就被邀请。所以 V3 在那个时间点已经得到了非常大的关注。

1 月 21 日,特朗普上任后的第一个重大计划——“星际之门”计划。这个计划涉及 5,000 亿美元的 AI 基础设施投资,把 AI 基础设施投资、把“花很多钱”这件事情提升到了一个新的高度。

1 月 24 日,美国科技界主流的一些大 V、意见领袖、企业家和投资人开始讨论 DeepSeek。无论是推特还是各种新闻媒体,讨论都非常多。典型的比如 a16z 创始人 Marc Andreessen、Scale AI 的 Alexandr Wang,他们的言论都发生在 1 月 24 日。美国主流媒体和创投圈的表态,也集中发生在 1 月 24 日。

这些新闻和表态随后被“出口转内销”,被国内媒体报道。更重要的是,从我的观察来看,DeepSeek App 在 1 月 24 日更新了一个版本。

DeepSeek App 刚上线的时候没有深度思考功能,只有联网搜索。发布推理模型 R1 后,App 里多了“深度思考”这个按钮。所以现在我们看到的 DeepSeek App 里有 2 个按钮,一个叫“深度思考”,一个叫“联网搜索”。

从 1 月 10 日发布到 1 月 24 日之前,这 2 个按钮不能同时按。也就是说,如果两个按钮都不按,那就是最简单、最基础的对话模型,你问它答,很快给你结果。

如果在 1 月 24 日之前按“深度思考”,它会展示完整的思维链过程,和我们今天使用的方式一样,但不联网,数据只截止到 2023 年 12 月。

在不能同时按的时候,如果按“联网搜索”,它是基于 DeepSeek V3 做的快速问答搜索,无法展示思维链。

什么时候这两件事可以同时进行?就是 1 月 24 日。这个节点非常重要。

到了 1 月 26 日晚上,游戏科学 CEO、《黑神话:悟空》制作人冯骥老师在微博上发了一条微博,公开推荐 DeepSeek。我们第一次在公开渠道看到 2 个关键字:“国运”。

至此,这件事情彻底引爆了。

1 月 27 日,DeepSeek 引发了关于美股的爆炸性事件:英伟达大跌 17%,一天之内。1 月 27 日如果我没记错,应该是大年二十八,因为今年没有大年三十。1 月 28 日是大年二十九,也就是除夕。

除夕当天,两篇 AI 写的假文章被无数人转发。先是早上起来,一封所谓的黄仁勋内部信,回应前一天晚上英伟达 17% 的暴跌,最后被证明是假的。到了除夕晚上,一篇关于梁文锋回复冯骥的知乎回答,也被无数人转发。

这就是整个事件的时间线。

4. 低成本模型引爆讨论

我们回头来看,为什么会引起这样的讨论?先看基础,看这个模型本身。

首先,DeepSeek V3 和 R1 的模型能力非常强,在各种榜单和数据排名上都非常靠前,甚至有些成绩已经接近 o1,甚至 o3。

更重要的是,DeepSeek 代表的是中国的模型,是开源模型,并且是极其便宜的模型。当然,这里的“便宜”需要加引号。

在这一轮讨论当中,关于大模型训练成本的讨论最多。DeepSeek V3 的论文明确指出,V3 最后一次成功训练所需要的算力,是 278.8 万 GPU 小时。按照每小时 2 美元计算,大约是 560 万美元。

很多人拿 560 万美元去对比很多数字,比如 5,000 亿美元的“星际之门”,比如 OpenAI 过去一年 50 亿美元的亏损,比如几家头部公司在资本性支出上投入的 1,000 亿美元。这些数字之间巨大的差别,造成了非常多的讨论。

我在上一期播客里也讲过,DeepSeek V3 最后一次成功训练的成本是 560 万美元,并不代表 DeepSeek 只花了 560 万美元就把 V3 做出来了。显卡成本、过往投入、人力成本都没有算进去。但你去对比的那几个几十亿、上百亿美元,往往都是完整成本,所以这种对比并不合适。

也有一些媒体做过推算。OpenAI、Anthropic、Meta 等头部美国公司的模型,单次训练成本应该在几千万美元到五六千万美元这个体量。可能 10 倍是一个可以接受的差距,甚至几倍,但远远没有达到很多媒体渲染的程度。

所以,模型本身的能力首先足够强,但它引发如此大讨论,是因为它是中国的、开源的,并且以极低的成本实现。

从模型使用成本来看,指数下降也非常明显。DeepSeek 推出 R1 之后,它的 API 调用成本,无论是输入还是输出,很多媒体都拿来和 xAI、OpenAI、Google、亚马逊 Nova 的模型做对比。确实,DeepSeek 的使用成本非常便宜。

最近一段时间,OpenAI CEO Sam Altman 在全世界各地参加各种活动、接受访谈、发表讲话。有一天他在一个重要场合说,基于他们的经验,大概每 12 个月,头部模型的使用成本,也就是调用模型进行输入和输出的成本,会下降 10 倍。

他又举例说,回头看 OpenAI 从 GPT-4 到 GPT-4o,大概是从 2023 年初到 2024 年中,1 年半的时间,GPT 模型的调用成本应该下降了 150 倍。这符合每年下降 10 倍的趋势。

我在做年度总结的时候也用过“10 倍”这个关键词。10 倍的意思是,2 年就是 100 倍,2 年可不是 20 倍。

刚才提到一个很重要的时间点:1 月 24 日,所有主流科技媒体、美国头部媒体和 KOL 都在疯狂发表关于 DeepSeek 的内容,无数讨论出现了。

到了 1 月 26 日晚上 23 点 32 分,冯骥老师发了一条微博,说了一句很有冲击力的话:“DeepSeek 可能是国运级别的科技成果。”

1 月 26 日是周日,27 日是周一,28 日就是除夕。那个时间点,很多国内的人已经提前放假回家,或者正在回家的路上。大家的心情也不一样,再加上“国运”这样的词,自然就引爆了。

冯骥老师在那条微博里列举了几个关键词。第一,他说模型非常强大,因为对于没有接触过推理模型的人而言,推理模型的能力确实非常强。第二,模型成本非常便宜。第三,因为它严格遵守非常宽泛的开源协议,所以部署比较简单。第四,他提到免费。

这里的“免费”,相当于把这件事情从模型层面转到了 App 层面。他还提到可以支持联网搜索,这也是 App 的体验。最后,他把这件事定义成了“国运”。

从此开始,DeepSeek 的位置就不再是一个简单的大模型公司,而变成了中美对抗,尤其是科技和 AI 领域的排头兵。

我找到了一张很有意思的图。如果大家和我年纪差不多,应该玩过街机上的《街头霸王》。网上有一张类似的地图,后面还带着国旗:中国的代表选手是 DeepSeek,美国的代表选手是 OpenAI。

当这件事情被推到这种程度时,很多事情就变得一发不可收拾。

于是出现了那两篇文章:早上起来看到的黄仁勋内部信,看上去是在回应前一天晚上的暴跌;当天晚上又出现了所谓梁文锋在知乎上的回复。

当天晚上我第一时间看到了那篇知乎回答,就转给知乎的运营,说这一定是假的。因为如果平时接触 AI 比较多,对于 AI 生成的文字会有一定感觉,大概能够读出所谓的“AI 味”。

很快,知乎就把那个虚假的梁文锋账号封掉,把帖子删掉。但没有办法,截图已经被无数人转发。看上去写这篇文章的人非常熟悉 AI 创作的方式,包括提示词的准备,以及如何一条一条回应冯骥在微博中列出来的内容。

所以那篇文章当天晚上和第二天都被无数人转发。

当时在除夕晚上,后半夜我发了一条即刻,说:“谁曾想,2024 年龙年的最后一天,是两篇 AI 写的 fake 文刷屏了所有人的社交媒体呢?”然后我就睡了。

大年初一早上起来,我一睁眼刷手机,发现还有很多人在转。因为前一天晚上我已经在很多人的朋友圈下面留言,说这是 AI 写的,是假的。有些人会说:“但是写得很好啊,情绪很对啊。”

第二天早上大年初一,还是有很多人转发,我还是在下面评论说这是假的。整个朋友圈刷完以后,我又在即刻上发了一条,说:

“大年初一睁眼,又叫醒了几个被 AI 骗了的人类。但又想,如果再发展几年,谁是真,谁是假?如果绝大多数人都相信了那个假的东西,那它还是假的吗?”

这就是大年初一发生的事情。

从此开始,整个 DeepSeek 的爆炸就一发不可收拾了。我们从很多榜单上都能看到,DeepSeek App 的增长曲线非常夸张,尤其是从春节开始,增长速度超过了所有的“六小龙”产品。春节那天,应该也超过了豆包,超过了去年看上去在国内唯一值得被讨论的、字节的豆包。

泼天的富贵就来了。

5. 爆火之后的战略难题

但今天是 2025 年 2 月 24 日,距离这件事情过去已经快 1 个月了。大家可以猜一下,在这个时间点,DeepSeek 那波泼天的富贵还剩多少?

当然,这里面有 DeepSeek 自身不想承接的原因。但从正常发展角度来看,DeepSeek 现在的流量可能已经跌了 70% 左右,无论是 Web 访问量,还是 App 的 DAU。最近几天也有一些媒体发布了相关数据,大家可以参考。

这就引发了一些问题。我的日常工作偏企业战略,会帮助企业做很多决策和取舍。我们做一个假设:如果今天你是梁文锋,是 DeepSeek 的负责人——当然,你也可以设想他的性格、偏好、过往做事的风格,以及各种媒体对他的报道和访谈——假设你是梁文锋,首先会遇到什么问题?

过去这段时间,DeepSeek 爆火之后,很多媒体、合作方,包括一些外国声音,都在说 DeepSeek 的安全存在一定瑕疵。无论是模型本身的对齐,还是 App 和网页端的数据安全处理,或者针对各国当前 AI 政策的适配,这些宽泛的安全问题确实存在。

我们不能因为有一些所谓敌对的声音,就说他们一定不对。这些问题确实存在。如果你是梁文锋,针对这些问题,你要不要处理?处理到什么程度?这是第一个问题。

第二个问题,这个问题其实在海瑞独角兽的那篇关于 DeepSeek 的文章里也问到了。我甚至还发过微博和即刻,说广密问了一个非常好的问题:这波泼天的流量,要不要承接?

进一步说,App 或 Web 对于 DeepSeek、对于幻方而言重要吗?这波个人用户重要吗?如果不接这波流量,未来模型的产品形态应该是什么?如果想接,或者想进一步做运营,应该往哪里做?要不要收费?要不要尝试细分场景?

如果你是梁文锋,这些问题怎么选?这是 To C 的问题。

第三个问题,自然是 To B。或许最宽泛的 MIT 协议,已经代表了 DeepSeek 的某种态度:我不针对任何人做倾向性的偏重,你们愿意接就接。

但因为 API 调用量快速提升,他们没有办法承接。幻方的 DeepSeek 甚至把 API 充值接口都关了,当然后面肯定还会重新开放。可是,收钱就不重要吗?未来定价和商业化的选择应该是什么样?这是关于 To B 的问题。

最后一个问题,是过去 1 个月讨论非常多的:要不要融资?

前两天《The Information》还发了一篇文章,说 DeepSeek 在接触投资方,点名的是阿里和国家社保基金。但那篇文章更像是受此前国内一条假新闻的发酵影响。此前有传言说阿里投了 10 亿美元,或者投资了 100 亿美元,阿里很快就辟谣了。我觉得正是这条新闻的发酵,引发了外媒的关注。

当天晚上看到新闻时,我就说这大概率是假消息。第一,整篇文章没有任何意义上的信息增量。第二,“接触”和“考虑接触”是非常宽泛的定义,什么叫接触?

大家最近关注新闻应该知道,几位大佬开了一次企业座谈会,梁文锋也在。梁文锋旁边坐的是腾讯的 Pony Ma。他们俩肯定在会上聊天了,那看上去 DeepSeek 和腾讯也接触了,对吗?所以,“接触”本身没有任何意义。

如果今天你是梁文锋,财务投资看起来是没有意义的。朱啸虎老师也表达过,多少钱都愿意投。但在今天这个时间点,拿一个财务投资干什么?甚至拿美元 VC 干什么?

战略投资呢?阿里、腾讯、华为,看起来也都有坏处,因为你站队了。

再延展这个问题,如果是国家社保基金这样的国家队,接还是不接?我觉得这是一个非常难的问题。我也没有答案,或者说我有自己的答案。但如果是梁文锋会怎么选,我们静观其变。

以上就是第一部分关于 DeepSeek 的整理,希望能够帮助大家澄清一些问题,形成一定共识,然后再去讨论别的问题。

6. 过去两年的行业主线

下面进入今天内容的第二部分:过去两年的行业主趋势。

我在 PPT 里放了一张海外非常有名的企业 newsletter 科技博主制作的图,内容是 OpenAI 过去两年估值上涨的时间节点。从 OpenAI 成立,到去年最后一轮融资、估值达到 1,550 亿美元,过程中发生了一些重要节点,图上的估值曲线非常漂亮。

为什么是这张图?我觉得,过去两年,从 2022 年底 ChatGPT 发布,到可能 2024 年底,整个行业有一个非常简单的叙事结构:

更多的钱,更好的基础设施,更好的训练,得到更好的模型。

更多的钱、更好的基础设施、更好的训练、更好的模型,这 4 个维度构成了一个简单而质朴的递进关系,也造成了以美股“七巨头”为代表的这一轮 AI 浪潮的暴涨。

这部分内容其实是我去年做的整理。

如果把七巨头看成一个整体,Google、苹果、特斯拉、Meta、微软、亚马逊、英伟达这 7 家头部公司,从 2024 年初的 11.8 万亿美元涨到了 2024 年底的 17.6 万亿美元,巅峰时达到过 18 万亿美元,而且这个数字还在涨。

这 7 家公司贡献了 2024 年整个标普 500 指数 55% 以上的增长。也就是说,其他所有公司只贡献了 45%,而它们贡献了超过一半。

这 7 家公司可能又分成 3 个等级:市值超过 3 万亿美元的苹果、英伟达和微软,经过一段时间就会争夺世界第一大公司的宝座;市值超过 2 万亿美元的 Google 和亚马逊;市值超过 1 万亿美元的 Meta 和特斯拉。当然,市值超过 1 万亿美元之后,现在又有了博通。

把时间拉长到 20 年来看,2015 年之前,这些公司都没有那么大。过去 10 年波澜壮阔,它们长成了所谓的参天大树。

这些公司形成了一些共识。

7. 巨头共识持续扩张

第一个共识是英伟达。英伟达从原来半导体行业的一家小公司,涨成了半导体行业一半以上市值的公司。所有头部巨头都变成了老黄的“狗”。

同一时间,因为英伟达的这种状态,它超过 3 万亿美元的估值波动性也非常大。如果我们拉一张单日一家公司能够上涨或下跌的市值表,前 10 名和后 10 名这 20 个选项里,可能有 70% 都和英伟达有关。

这张表我在去年年底做的时候是一个样子,今天又是另外一个样子。为什么?因为有了那一天 17% 的史诗级大跌。当日英伟达市值跌了 5,600 亿美元,远远超过另外 9 次可能一两千亿美元的单日跌幅。

但是截至上周,英伟达已经涨回来了。那天跌了 17%,不到 1 个月就已经涨回来了。

英伟达这家公司非常幸运:从游戏起家,赶上了游戏爆发;又赶上了区块链和挖矿的爆发;这一波又赶上了 AI。3 个浪潮叠加,造成英伟达从 2023 年可能 1.2 万亿美元的市值,涨到了现在的 3 万多亿美元。

第二个共识是关于公有云。AWS、微软 Azure 和 Google Cloud 是美国公有云的 3 家头部公司。

大约在 2020 年,这 3 家公司加在一起,每个季度还能保持 35% 甚至 40% 的增长。到了 2022 年到 2023 年,增长跌到了每季度只有 10% 多。所以整个公有云市场在 2022 年到 2023 年基本趋于稳定。

但 2022 年底 ChatGPT 发布之后,尤其是 2023 年下半年开始,整个公有云市场开始恢复到 20%、25% 甚至更高的增长速度。这几家公有云厂商,尤其是头部厂商,过去几个季度的收入增长非常快。

第三个共识是 CapEx,也就是资本性支出。这个数字和这张图我已经用了无数次,也更新了无数次。

微软、Google、Meta 和亚马逊都是在春节前后发布了去年第四季度财报。财报季上,它们都会公布下一年的预期。不约而同地,几家公司对明年 CapEx 的投入都大幅上涨。

2024 年,这 4 家公司在 CapEx 上的投入是 2,220 亿美元。2025 年的预期,因为 4 家公司的财报都已经公布,财报电话会议上 CEO 们也讲了明年的预期:微软 800 亿美元,亚马逊 1,000 亿美元,Meta 600 亿美元,Google 应该是 700 亿到 750 亿美元,加起来约 3,200 亿美元,增长 44%。

大家要知道,特朗普“星际之门”计划第一年也是 1,000 亿美元。如果再把这 1,000 亿美元加上,相当于从 2024 年已经暴涨的 2,220 亿美元,到 2025 年接近翻番,达到 4,200 亿美元。

所以,过去两年“更多的钱导致更好的模型”这套主流叙事,至少在 2025 年不会停下来。

大家拿这些钱疯狂买卡。2025 年的预期,基本上这些头部公司的显卡数量要翻几番,因为这些钱要去买卡。当然,很多人也在做“卖铲子”的生意:所有人都去买英伟达显卡,然后再把英伟达的卡卖给别人,就像挖矿时给掘金的人提供铲子一样。

所以我又用了这张已经用了无数次的图。大猛有一句名言:“成年人的世界,钱是最简单的标准。”

什么叫科技巨头?衡量它在 AI 上投入的数字单位是百亿美元,甚至千亿美元,这就叫科技巨头。刚才提到的这些公司,在这件事情上的年度投入,全部是几百亿甚至上千亿美元。

什么叫主要玩家?一年投入几十亿美元,比如 OpenAI、Anthropic、xAI。什么叫主要挑战者?一年投入几亿美元。

这两天阿里涨得很好,中概股也涨得很好。阿里发布财报之后,吴泳铭说未来 3 年阿里云在基础设施上的投入会超过过去 10 年的总和。有分析师算过,大概是每年 1,000 多亿元人民币。

过去 10 年可能是 3,600 亿或者 3,800 亿元人民币,如果分 3 年,每年就是 1,200 亿到 1,300 亿元人民币,也就是 100 多亿美元、不到 200 亿美元,勉强到了所谓科技巨头的线。

所以不就是钱吗?

二级市场是这样,一级市场也是这样。整个 AI 领域的投资,2024 年应该是 1,100 亿美元的一级市场投资。过去一年一级市场最大的 9 笔融资里,有 7 笔给了 AI 公司,比如 OpenAI、xAI、G42,以及其他 AI 公司。AI 当然是一级市场和二级市场绝对的主题。

特朗普再次上任之后,第一把火也烧到了这里。他联合 OpenAI、甲骨文和软银一起做了“星际之门”计划。关于“星际之门”计划的解读,大家有兴趣可以去翻我上上期播客,那是我在计划发布第二天做的一场直播音频,讲得非常详细。

所有这些事情当然再次成就了英伟达,尤其是英伟达的数据中心业务。数据中心业务可能已经是英伟达 70% 到 80% 的收入来源。

第四个共识,是继续往上游走。所有人确实都在买卡,但同时也在做自己的卡、做芯片。Google、微软、Meta 都在做,苹果就不用讲了,苹果原来就有自己的芯片,它们甚至开始把手伸到芯片设计这一层。

说白了就是一个很简单的道理:没有人想被卡脖子。同时,它们也会扶持相关的投资和并购企业,用自己的卡来建立整个生态。所以这里形成了往上游走、尤其是往芯片层走的共识。

第二个往上游走的共识,是去能源。庞大的数据中心已经开始触碰人类能源的天花板。我之前看到一个数据,预计到 2030 年,美国仅数据中心的用电量,可能就会超过日本或者英国一年的用电量。

所以,头部巨头为了满足自身业务需要,开始进入能源领域。共识就是去碰核能。

第五个共识与此相辅相成:既然要扶持生态,就要让更多人进入你的生态。除了提供业务之外,更重要的手段是投资和并购。

那些每年花几亿美元、甚至几十亿美元的 AI 主要参与者和挑战者,背后基本都有这几家科技巨头的投资,几乎全部都有。

当然,2024 年出现了一种并购方案,叫“掏空式并购”。Character.AI 卖给 Google,Inflection 的团队去了微软,Adept 的团队去了亚马逊,01.AI 也把团队交给了阿里,其实都是类似的掏空式并购,没有什么意外。

最后,所有人的自身业务也不会落下。英伟达有芯片,微软有 Copilot,苹果有 Apple Intelligence,Google 有自己的模型,亚马逊有 Nova 模型,Meta 有 Llama 模型,特斯拉有 FSD 以及 xAI,OpenAI 和 Anthropic 也都有自己的模型。所有人都不会放下自身业务,所以这些全部都是共识。

那中国的巨头们呢?一样吗?

我在最早做去年版本的时候,用了一张图,也用了一句话:“抄作业还不会抄吗?”

阿里、百度、字节、华为、腾讯,在模型层、云、应用层、多模态等方面全部覆盖。小一点的巨头,昆仑、360、科大讯飞、小米,包括最近表态要做自有模型的理想,其实都一样,抄作业就好了。

这套叙事结构在过去两年首先出现在美国。今天因为中概股的重估和情绪反转,你会发现,最大的几家公司也可以用类似的逻辑讲故事。

最典型的是阿里这次的季度财报,最引人注目的就是关于基础设施未来投入的内容。我当时看到新闻,一拍大腿,说可以了,我去年写的报告还有用,继续抄作业就行了。

再看所谓的中国 AI 初创公司。量子位去年做年度报告时,把初创公司的模型公司概括成“六加二”:六小虎,加 DeepSeek,再加面壁智能。那份报告应该是 11 月写的,DeepSeek 还没有火。

现在来看,如果不算面壁智能,就是“六加一”。其中很多公司已经出现了分化,或者说这些公司的 CEO 已经做了一些选择。

比如刚才提到的 01.AI,李开复老师已经把能拆的东西全部拆掉了,安心做 To B 的模型实施。小川总他们则安心做医疗,因为医疗市场足够大,也没有什么问题。

阶跃和智谱,一家绑定上海,一家绑定北京,都在沿着自己的技术路线实施。阶跃最近应该在上海开了一个很大的发布会,发布了一堆模型。

剩下两家,MiniMax 和 Kimi,也就是月之暗面,还在基础大模型研发这条路上继续深耕。但对它们而言,战略挑战变成了更复杂的问题,因为 DeepSeek 出现了。

以上就是过去两年行业的主流叙事,其实是我之前年度报告的一次再整理。

下面进入第三部分。我给这一部分起的标题叫“新的阶段,新的叙事?”带一个问号。也就是说,我们真的迎来新的阶段了吗?新的阶段真的会有新的叙事吗?

8. 强化学习接棒预训练

DeepSeek 爆火的第二天,也就是英伟达下跌 17% 的那一天,维基百科上有一个页面的访问量暴增了 200 倍。这个页面讲的是一个经济学理论,叫杰文斯悖论。

杰文斯悖论讲的事情很简单:煤炭价格降低,最后对于煤炭公司而言反而可能是好事,因为煤炭的使用场景变多了。

于是大家开始讨论,DeepSeek 的出现让 AI 大模型成本降低,到底是好事还是坏事?看起来,从长远来看,这可能是对行业非常好的事情。

那新的叙事结构到底从什么时候出现?我们先看一张我去年做年度报告时使用的图,内容是 AI 大模型预训练数据的收敛问题。

到了 2028 年,在极限情况下,人类可能已经没有更多数据可以喂给大模型了。所以去年大概 9 月、10 月的时候,OpenAI 前联合创始人 Ilya Sutskever 在一次大会上说:“如果你有一个巨大的数据集,训练一个超大的神经网络,那么必然会成功。”但现在这套公式失效了。

也就是说,从那个时候开始,大家开始讨论所谓预训练 Scaling Law 失效的问题。

去年 9 月左右,张晓俊去访谈海外独角兽,我跟广密聊的时候也是去年 9 月。广密提到,在硅谷,很多头部公司从 9 月开始就尝试用强化学习的方式训练模型。

当时的说法是,让 AI 通过随机路径尝试新的任务。如果效果超预期,就更新神经网络的权重,让 AI 记住并更多地使用这个成功事件,再开始下一次尝试。这就是强化学习。

但在去年 9 月这个时间点,这件事还没有形成真正意义上的共识。

同样,去年 6 月,Anthropic 发布 Claude 3.5,模型能力得到极大提升。Anthropic 内部把 Claude 3.5 也定义成推理模型,因为 Claude 3.5 的能力提升,尤其是在文案和编程领域爆发。Cursor 就是基于 Claude 3.5 出现的。

到了 9 月,OpenAI 发布 o1,纯粹意义上的推理模型出现,真正引领了大模型技术范式的改变。强化学习和后训练能力被提到了新的高度,数学领域、编程领域、AI 领域开始被频繁提及。所有这些事情,都是在 2024 年 9 月这个时间点出现的。

对于其他公司而言,一个核心命题就变成了:如何复现 o1?我们自己的推理模型应该怎么做?

当时有一些团队尝试的方式是:既然大语言模型的基本逻辑是,我给模型一段 token,也就是提示词,这段 token 刺激模型中的一部分信息,模型再反馈给我一个答案,那么今天这种一问一答的方式就是快速问答。

那能不能让模型慢下来?能不能让输入的这段 token 变长,让它有所谓的“思考”?思考之后,输入变成一段更长的 token,去刺激模型更多内容,然后返回一个更长、更复杂的结果。这样是不是就实现了所谓的推理?

为了复现这件事,当时主要有两种方式。

第一种叫思维链,也就是 CoT。我输入一段话的同时,让大模型针对这个问题进行思考,就像我们今天使用 DeepSeek 的应用一样,有一个思维链过程。

第二种,是针对思维链过程中的每一步进行激励,也就是 PRM,过程奖励模型。通过对每一步进行奖励,让模型达到更好的效果,并且不断调整权重。

如果很多人都开始用思维链和思维链奖励的方式训练模型,就产生了边际增强效应。它带来的需求是什么?数据标注。

因为你需要对所有问题重新进行标注,并且对每一个过程、思维链的每一个环节、每一个 step,再去做过程奖励。这就是一个边际增强效应。

所以那段时间,美国头部数据标注公司 Scale AI 发展得非常好。Scale AI 去年拿到了一轮非常大的融资,几乎所有头部科技公司、基金和 AI 公司都是它的投资者,它在 2024 年的 ARR 增长也非常多。

如果针对过程奖励的强化学习路径是对的,故事应该这样演进。但今天回头来看,这个故事是错的。

Kimi 和 DeepSeek 差不多时间发布了推理模型 k1.5。知乎上有一个问题,问如何评价 Kimi 发布的多模态推理模型 k1.5。Kimi 的一位员工回复了这个问题,相当于把 Kimi 内部从去年 9 月开始尝试复现 o1 的整个过程,做了一次非常完整的整理。

如果大家有兴趣,可以去找这个问题。我把它放在 PPT 里了。他的结论其实非常简单:

训练大语言模型,通过强化学习做题,并使用精确的奖励,不要采取结构化的方法。最终,所有结构化方法都会限制模型效果。要让模型自己探索思考范式,允许思考包含搜索过程,也允许犯错。它不是针对过程进行奖励,也没有做任何结构化限制,只针对结果进行激励。

9. DeepSeek R1的训练路径

回头来看,如果大家关注行业,应该知道 DeepSeek 发布的基础模型叫 V3,推理模型叫 R1,中间还有一个模型叫 R1 Zero。为什么会定义 Zero 这样一个代号?

有一位自媒体作者说,这可能是在向当年的 AlphaZero 致敬。

大家知道 AlphaGo 是下围棋的。AlphaGo 击败李世石和柯洁之后,团队说其实还有一个更强的模型没有出战,那个模型叫 AlphaZero。

AlphaZero 是怎么来的?他们说,根本不需要给 AI 喂人类高手的对局棋谱,只需要告诉它围棋的基本规则,让模型自我对弈,赢了就奖励,输了就惩罚。模型很快就能从零开始学会围棋,并且超越人类。

研究人员把这个模型称为 AlphaZero,因为它不需要人类的任何知识,摆脱了人类的经验。此后,围棋变成了比谁更像 AI 的游戏,因为 AI 的棋力已经超越了人类的认知范围。想要超越人类,就必须让模型摆脱人类经验和好恶的判断,哪怕是最强人类的经验也不行。

要摆脱这些限制,只有让模型自我博弈,真正超越人类的束缚。这就是当时做 AlphaGo 和 AlphaZero 时的逻辑。

现在,从 DeepSeek V3 基础模型到 R1 Zero,其实也是类似的逻辑。这是另一个 AlphaZero 时刻:在 R1 Zero 的训练过程中,完全不依赖人类的智商、经验和偏好,仅靠强化学习去探索那些客观、可测量的人类真理,最终让推理能力远强于现有的非推理模型。

那又是怎么从 R1 Zero 走到今天用到的 R1 的?

首先,收集少量高质量数据,尤其是思维链数据,然后对 V3 基础模型进行初步监督微调,解决输出语言不一致的问题。

R1 Zero 做出来之后,存在语言不一致的问题。OpenAI 很快发布了推理模型 o3-mini。大家在使用 o3-mini 最初版本时会发现,它经常中英文混杂。这就是因为用这种方式训练的初代模型,对于语言一致性的处理还不够好,还需要继续调整。

然后,DeepSeek 在这个冷启动模型上进行了类似 R1 Zero 的纯强化学习训练,并加入语言一致性奖励:如果你始终使用一种语言,就给你奖励。

最后,为了适应更普遍、更广泛的非推理任务,比如我问“北京的天气怎么样”,或者问“从上海到北京有多远”,这些基础问题也要能够回答。于是他们又对模型进行了一次微调,结合推理数据和通用数据,使用混合奖励信号进行最终一次强化学习,最终出现了 R1。

这就是 R1 产生的过程。

我们回头看,从 DeepSeek V3 基础模型到今天用到的 R1,大概分了几步。

第一步,基础模型纯靠强化学习产生 R1 Zero。当然,Zero 存在一些问题:语言不一致,思维链过于复杂,以及对一些基础的、非推理类问题回答得不好。

怎么解决?先使用冷启动数据,包括一些基础的推理型文案写作和事实型数据,再加入少量已经被证明效果不错的高级思维链数据,然后进行强化学习和微调,最终产生 R1。

但在技术圈,R1 之所以能够被这样讨论,不仅仅是因为做到了这一步。DeepSeek 还做了另外一件事:刚才说的这套强化学习加冷启动数据、思维链和适应性数据的训练方式,不仅可以用来训练和调整 R1,也可以用来调整其他开源模型。

所以 DeepSeek 团队又做了 DeepSeek R1 蒸馏千问的各个大小模型,以及 DeepSeek R1 蒸馏 Llama 的各个体量模型。

在 DeepSeek 的论文里,我们看到一张打分表。它蒸馏的那些其他模型,评分也得到了提升。相当于这套方法论不仅 DeepSeek 自己能用,别人也能用。

这件事引爆了所有讨论。甚至到了今天,很多所谓的教程、所谓教你如何本地部署 R1 模型,部署的其实都不是 R1 满血版,而是这些蒸馏模型。

故事讲到这里,你就会知道,为什么在 1 月 24 日,Scale AI CEO Alexandr Wang 一定要公开反对、抵制 DeepSeek,一定要把这件事推到中美对抗的高度。

因为如果所有人都认可绝对意义上的强化学习能力,Scale AI 的业务就会萎缩。它不再需要人类标注,或者不再需要大范围的人类标注。

故事讲到这里,出现了一个结果:大家开始讨论,DeepSeek 瞬间超过了其他很多 AI 应用,瞬间超过了豆包,接近 ChatGPT 70% 的使用量,瞬间登上所有 App Store 榜单的第一名。

看上去,没有人有护城河了,对吗?

关于这部分内容,我强烈推荐上一期我们关于 DeepSeek 的讨论。张涛老师在那期节目中做过一次分享。那次分享是在真格基金内部进行的,真格基金官方公众号以及他自己的 B 站视频号都发布了完整内容,时长大概 2 个小时,把刚才我讲到的 DeepSeek 从 V3 到 R1 的过程,做了一次非常深入浅出的整理。

如果大家对这件事感兴趣,我非常推荐花 2 个小时把视频看一下。

这就是今天第三部分关于新叙事结构可能性的内容。

下面进入最后一部分。我给这一部分起的标题叫:“一千个人眼中有一千个 Agent。”每个人对 Agent 都有自己的概念,而这个概念太难解释了。

10. Agent正在泛化应用

我们先回头看 DeepSeek。最开始,DeepSeek 的功能叫智能对话,就跟现在所有头部大模型产品一样,和它对话。

后来,它的 App 增加了“联网搜索”功能,也就是 AI 搜索,你可以让它搜索一些东西。

R1 模型发布之后,它增加了“深度思考”功能。大家可以看到 AI 的整个思考过程、思维链,以及它如何解析问题并给出答案。

到了 1 月 24 日,两个按钮可以同时按,真正意义上变成了完全体。

所以 DeepSeek 有 4 种用法。什么按钮都不按,就是最基础的问答;按“联网搜索”,就是普通的 AI 搜索;按“深度思考”,让它帮你思考一个问题;最后一种是最完整的用法,两个按钮同时按下。

我为什么一次又一次强调“同时按下”的重要性?其实张涛老师上一期播客里也提到过。

在 DeepSeek 出现之前,市面上虽然已经有 o1 这样的推理模型,但 OpenAI 的 o1 要付费使用。哪怕是 20 美元的门槛,对于很多人而言也很高。所以市面上绝大部分人没有用过推理模型,更没有见过 AI 的完整思维过程,也就是思维链展示。

同时,如果不联网,就会有数据时效性问题。你问它一些非时效性问题可能还可以,但凡问题涉及新的信息,不联网搜索就没有办法解决。

大模型聊天产品出现的第一天,无数人就说过,它是瞄着搜索去的。

Kimi 发布 k1.5 之后,产品里也有两个按钮,一个是 Kimi 长思考 k1.5 模型,一个是联网搜索。

我们说到搜索了。

DeepSeek 火了之后,很快就有很多产品接入 R1。比如密塔的 AI 搜索接入 R1,360 的纳米搜索也接入 R1,知乎直答也接入了 DeepSeek 的深度思考功能。知乎最近涨得也很好。

问题就出现了:这些不都是做 AI 搜索的公司吗?Perplexity 也做 AI 搜索,也接入 DeepSeek。

以前大家会说,AI 搜索公司之间的差别,可能更多来自信息源。我在去年的总结报告里也这么写过:小红书有点点,知乎有知乎直答,小宇宙甚至都有它的 AI 搜索,元宝更不用讲,因为它能够搜索微信公众号。

信息源上的差距,真的能够造成差距吗?

第三个问题是,产品设计上有差异吗?大家会发现,基本没有差异,全是两个按钮。

还有一个问题,之前很多人会问,AI 搜索公司应不应该做自己的模型?现在看上去都不做了,对吗?大家都是做 AI 搜索,然后接入模型。

AI 搜索在这个时间点被进一步讨论,有几个例子很有意思。

前两天我想买一个充电头,就去拼多多上找。大家知道,国内上市公司安克的充电头口碑很好。安克最近在推一款 140 瓦的充电头,官方店里这款主推产品详情页的第一张图,就是 2 个 AI 大模型的聊天记录,分别是 DeepSeek 和豆包。

图片标题叫“热门 AI 首推的充电器品牌”,下面写着“数据无任何修改,未训练直接回答,真实可测”。

什么意思?品牌商卖东西时,把 AI 大模型的答案认作一种标准。

上海最近还有一家拉面店,在门口摆了一张牌子,牌子上也是 DeepSeek 的聊天记录。它问 DeepSeek:“上海最好吃的日本拉面有哪些?”第一名的答案就是它们家。牌子上写着“DeepSeek 推荐的上海日本拉面”。

第三个例子是元宝接入 DeepSeek 之后,很多人在搜索过程中发现,元宝的回答会引导到 58 同城、易家宝,以及各种应用下载页面。

很多人会说,这不是 SEO 吗?搜索引擎优化。但其实这些还不是真正的 SEO,至少在这个节点,没有人在专门做这件事情。

但是,当 SEO 再往前推进一步的时候,这些今天看上去自然产生的结果,未来会不会和 SEO 产生关联?这可能就是 AI 搜索发展的一个标志。

再从另一个角度看,DeepSeek 爆火之后,因为没有办法承接那么多需求,无数云厂商和推理服务厂商把需求接了下来。

我觉得这个影响非常深远,甚至今天还没有办法准确评判。对于中国所有云厂商和推理服务厂商而言,都应该感谢 DeepSeek。

典型的比如硅基流动,最近也拿到了一轮融资。它们的流量暴涨,某一段时间我看第三方统计,流量甚至超过了腾讯云。对于一家初创公司而言,这简直不可想象。

我们看到无数产品接入 DeepSeek。典型的比如雪球接入华为的小艺智能助手,OPPO 最新发布的 Find N5 折叠屏手机的助手也接入了 DeepSeek,再到比亚迪的车机系统、飞书多维表格、百度的文心一言,所有人都在接。

后来微信也接入了。

微信开始测试接入 DeepSeek 的当天下午,新华社发了一篇推送,确认微信正在测试接入 DeepSeek。我的一位腾讯朋友转发新闻时发了一条朋友圈,说:“都惊动国社了。”

我在他的朋友圈下回复:“国运级大模型和国民级微信应用的合作,当然需要国社来报道。”

这也引发了最近关于中概股的讨论。原来是 ABC——除了中国,其他都可以;现在 ABC 是 AI、A 股和 China,对吧?只有中国的 AI 才能有代表意义。

所以你看,从 1 月开始,阿里、腾讯都已经涨了很多。这么大的公司也涨了很多,大家开始唱多中国资产。

微信测试接入 DeepSeek,抖音怎么做?

抖音在这段时间做了一件我觉得很有意思的事情。这是特工宇宙的公众号“特工少女”发给我的:他们用扣子的方式创建了抖音 AI 分身。

如果你是抖音创作者,可以在扣子上创建一个自己的分身。这个分身可以分发到搜索、直播间、群聊,甚至评论区。

比如你卖货,这个 AI 可以帮你回答问题,再分发到不同场景。所有人都在接入模型,于是又产生了另外一个问题:

如果你是一家搜索公司,所有搜索公司都接入了 DeepSeek,那怎么构建所谓的护城河?

靠产品执行吗?靠用户运营吗?靠品牌效应吗?靠网络效应吗?还是要扎根垂直行业?

没有答案。

如果没有更好的分类方式,钱依然是最好的标准。

所以在美国,一级市场投资者看 AI 公司,最核心的指标一定是 ARR 以及 ARR 的增长。典型的比如去年 Cursor 涨得很好,应该是最快达到 1 亿美元 ARR 的 AI 公司。

无论是看 OpenAI、Cursor,还是 Scale AI,也都在看 ARR。钱依然是最粗暴的标准,但钱又过于简单了。

我们再讲另外一个案例。刚才讲的是偏搜索的案例,再讲一个代码生成的场景。

从 ChatGPT 发布到今天,ChatGPT 发布的时候就已经能做代码,只不过做得不好。它能根据输入产生代码,但没有办法调试,也没有办法完成后面的事情,这是从 0 到 1 的阶段。

后来 GitHub Copilot 出现了。很多人原来就在 GitHub 上托管代码,GitHub Copilot 可以理解你的代码并给你建议,帮助你提升执行效率。

然后 Cursor 出现了。大家认为,代码生成的 Agent 出现了,或者说 ChatGPT 时刻出现了。它有逻辑理解能力,支持文件和命令行的执行。

没过多久,Devin 又出现了。大家说,初级程序员是不是不需要了?

在代码执行这个板块,我们看上去经历了从 0 到 1,到真正意义上出现所谓 Agent 的过程。

我们看这两个故事:一个是搜索,一个是代码生成。

AI 搜索公司是不是就是 Search Agent?它分析你的问题,分析你的任务,用各种工具和信息源收集、整理信息,再总结、整理、呈现,最后给你答案,解决你的问题。那它是不是就叫 Search Agent?

代码生成也是一样。你告诉它:“我今天要做一个抖音。”它其实也在吭哧吭哧地做,最后能不能做成是另外一件事,但它知道你要干什么。未来某一天,它没准真的可以做成。那这是不是就是 Coding Agent?

如果是这样,你会发现 Agent 这个概念其实被严重泛化了。

当一个场景能够被定义得非常清楚,并且能够实现不错的交付时,它应该叫那个场景的 AI:AI 搜索、AI Coding。

但今天有太多场景和方向,既没有办法定义得这么清楚,也没有这么好的交付,所以我们叫它 Agent。

看各种各样的第三方报告,关于 AI Agent 的行业地图梳理,无数厂商都在上面,特别复杂。

回头翻最早对 Agent 的定义:第一,它有计划性;第二,它有记忆;第三,它能使用各种工具;第四,它能和其他 Agent 通信、交互。

这是我们传统定义 Agent 的逻辑。

2024 年关于这些讨论已经很多了,也出现了一些趋势。

第一,之前我们的各种 App 是基于各种 API 构建的,但在 2024 年,开始基于 Agent,用大语言模型调用各种 App 的 API。

第二,原来的大模型是快速问答方式,今天开始变成有思维链,开始做分类,开始进入垂直场景。

第三,之前的 Agent 是基于代码搭建的,使用函数和 API;但在 2024 年,大家开始基于窗口拖拽、工作流等方式来做。

第四,之前只能解决简单的单线任务,现在开始出现多个智能体,也就是多个 Agent 共同构建解决复杂问题的系统。

同时,我们对 Agent 的评价,原来更多集中在模型本身,现在开始评价它解决问题的能力。这可能是过去一年 Agent 领域已经发生的趋势,而且这些趋势在 2025 年依然会延续。

我们再举一个更现实的例子。Agent 的中文翻译有很多,有些人翻译成“智能体”,有些人会说是“机器人”。

那我们就看一个真正的机器人案例。

今年 CES 上,头部扫地机器人公司不约而同地做了一个战略选择:给扫地机器人加机械臂。我昨天看韩璐的微博,说石头已经给他发了加机械臂的样机。这已经不是概念产品,而是真的在做了。

大家形成了一个共识:新一代扫地机器人可能都会增加机械手臂。为什么在这个时间点,头部厂商不约而同选择这条路线?

追根溯源,如果只有一个原因,一定是因为 AI 大模型的能力到了,尤其是视觉模型的能力到了。大家觉得,这件事情可以做了。

为了实现扫地机器人加机械臂,我们要做什么?

首先确定场景。这个机械臂拿来干什么?它要清理杂物,能够辨别物品的种类;能够辨别什么东西是垃圾,要扔进垃圾桶;什么东西是鞋,要放到鞋柜上;什么东西是脏衣服,要放进洗衣机。它要进行分类和整理。

场景中甚至还要考虑重量边界:什么东西能够夹起来,什么东西夹不起来。无数场景的限定和边界都要考虑。

然后再考虑技术边界。刚才说过,最重要的是视觉模型的能力肯定已经到了。推理模型的能力到了没有?看上去也到了。

实施路径的规划、抓取精度、避障逻辑,这些技术边界开始被设定。

再到产品层面,是主动服务还是被动选择?怎么和现有的扫地模块搭配?兼容性怎么测试?承诺的服务范围是什么?如何定价?这些都是产品要解决的问题。

交付给用户之后,还没有结束。要测试,要更新迭代,要整理用户反馈,还要处理严重事故。就像自动驾驶一样,要寻找原因,进行更新。

你会发现,场景确定、技术边界、产品交付、更新迭代,看起来是不是很熟悉?

在今天的 AI 时代,我觉得从场景到技术,再到产品的结合,才是难点。大模型本身的技术边界其实正在逐渐清楚,即便它还在疯狂变化。

而从场景到产品,恰恰是我们这些熟悉互联网的“古典互联网人”擅长的经验。

11. 组织架构必须重新设计

当然,如果是这样,这件事又提出了一个很大的挑战,就是组织架构的挑战。

比如,模型研发是不是只能存在于实验室这样的形态里?模型团队和产品团队是不是要严格分开?一个公司的产品只能使用自家的模型吗?现在看,答案似乎都不是。

模型的迭代需要产品跟进吗?以上问题目前只集中在模型和产品上。如果组织架构层面还有运营和商业化团队,这件事就变得更加复杂。

既然复杂,我们就看现在的公司是怎么做的。

很有意思的是,最近两个月,头部中国科技公司,尤其是 AI 业务比较多的公司,都进行了非常大的组织架构调整。

阿里把通义 App 团队划归智能信息事业群。这个事业群还有谁?有夸克、UC 浏览器、书旗小说和网盘。这个团队专门做 To C 产品,而通义千问的模型团队留在阿里云。

百度的文心一言 App,包括百度文库、百度搜索、百度地图、百度网盘,都属于移动生态事业群,是做 App 的。文心大模型团队则留在 TPG 技术中台事业群。

字节更明显。字节的 Flow 和 Seed 两个团队,一个做应用,一个做技术模型研发。最近一段时间,基础大模型研发团队的新负责人也已经找到了,是原来 Google 的一位核心技术负责人。

腾讯也是如此。春节前,腾讯把元宝团队划给了 CSIG,也就是云与智慧产业事业群。同时,腾讯元宝的产品研发团队和腾讯会议的产品研发团队在一起,都是做 App 的。

更近的变化发生在上周:腾讯又把搜狗、搜狗输入法、QQ 浏览器,以及最近有些热度的知识管理产品 ima,也划归到了云与智慧产业事业群。

也就是说,腾讯内部关于 AI 应用层的尝试,现在全部放在云与智慧产业事业群,而腾讯混元的模型研发团队放在 TEG,也就是技术工程事业群。

似乎大家已经形成了一定阶段性的共识,但 App 的爆火又打破了一些共识。

比如有观点说,DeepSeek 验证了一件事:模型即应用。DeepSeek 在产品形式上没有任何创新,核心就是智能加开源。

我也不禁思考,在 AI 时代,任何产品和商业模式的创新,都比不上智能本身的创新吗?

在另外一个讨论中,出海同学会做过一次关于 AI 原生社交产品的讨论。大家的核心观点是,在今天这个时间点做 AI 社交,效果都不是很好。

原因其实很简单:技术还不到位。

理想状态下,AI 应该能够实时生成匹配情感的文字、语音和嘴型,真正做到端到端的多模态交互。但目前这项技术可能还需要 2 到 3 年才能成熟。

所以在这个时间点,产品和模型要分得那么开吗?

李翔总说得更直接。DeepSeek 火了之后,他说:“能力没有收敛之前,谨慎做应用。”

同样是在出海同学会关于 AI 原生社交的讨论中,还有这样一段话:

“乐观一点看,多模态 AI 终将走入千家万户。文字和语音已经较为成熟,视频和动态图像也到了勉强可用的阶段。关键问题是,如何在当前产品形态中合理接入逐渐成熟的模态,以增强情感表达。这既需要技术理解,也考验产品决策。”

小公司可以快速堆叠新技术,但真正的挑战,是在正确的节点投入资源,确定什么时候开始买量和投流。

大家在过去一周已经看到,DeepSeek、元宝都在疯狂买量和投流。

我今天的内容就这些。大家可能会觉得,怎么突然结束了?

我在做最后一页的时候发现,整个内容似乎没有什么结论。但我觉得这样也挺好,权当是为这疯狂的两个月做一次记录。感谢大家收听《屠龙之术》,我的 PPT 在生Note里,有需要可以随便下载。再次感谢。

Vol.52 74页PPT解读Deepseek与AI Agent | BidClub