[BidClub_]
高能量 · · 59 min

Vol.156 产业观察27|关于DeepSeek的七个核心问题和DeepSeek关键技术拆解

李翔李丰刘鹏琦颜黔杭

Podcast
TL;DR
  • 刘鹏琦把 DeepSeek 爆火拆成“20% 技术创新、80% 开源影响力与中国元素”,投资上首先要区分能力跃迁与情绪重估。 V3 以显著更低成本逼近一线预训练模型,R1 则首次公开了一条用强化学习复现 o1 级推理能力的路径;但真正放大冲击的是后来者以开源打破闭源垄断,以及“中国团队能否做原始创新”的预期重估。“光脚的不怕穿鞋的。”
  • V3 改写的首先是成本曲线,其壁垒来自算法、infra 与硬件优化的系统协同,而非某个孤立概念。 颜黔杭给出的数字是:V3 使用约278万 H800 GPU 小时、训练成本约500多万美元,对比 GPT-4 约6300万美元、Llama 3.1 约5800万美元;671B 总参数每次仅激活37B,并以 MLA、MoE、FP8、DualPipe 和 PTX 同时压低算力、显存与通信开销。刘鹏琦的定性更克制:“没有太多概念创新”,但有“非常高的工程创新壁垒”。
  • R1 的意义不是发明了强化学习或 test-time compute,而是把闭源时代的推理范式变成了可复现、可蒸馏的开源工程。 R1-Zero 直接在 V3 上用数学、代码等 ground truth 做强化学习,证明不依赖 SFT 也能激发长链推理;R1 再加入冷启动数据、多阶段 SFT 与 RL,修复可读性和语言混用。关键约束是基模必须足够强——“一百个结果当中就能找到一次答案”,否则同样框架可能根本训不出来。
  • Scaling Law 没有失效,而是正从预训练转向后训练和推理阶段。 两位嘉宾都认为预训练受制于高质量数据枯竭,继续堆参数和算力的边际收益正在下降;后训练目前使用不到预训练1%的算力,R1 可能已接近10%,仍有扩展空间,但 reward、专业问答与 CoT 数据成为新瓶颈。推理阶段则可用更长输出和自我修正换取准确率,“模型的输出过程本身也是一个计算过程”。
  • 竞争格局中,DeepSeek 对国内 To C 模型厂商的影响可能更大,To B 的长期影响仍要等待真实部署验证。 Kimi、MiniMax 的技术并不弱,Kimi 1.5 也获得正面评价,但它们必须回答闭源能否持续保持一线能力、开源又会不会颠覆既有商业模式;海外大厂仍在多模态、泛化、工具链和开发者生态上领先。DeepSeek 自己也要决定如何接住“泼天的富贵”:融资扩张,还是维持小团队和研究导向。
  • DeepSeek 对英伟达并非单向利空,而是扩大 AI 总需求的同时削弱部分稀缺性定价。 市场教育带动更多公司采购算力,嘉宾听到 H100、H200 价格反而上涨;持续变化的模型架构也更适合通用 GPU。另一面,MoE 降低互联需求,PTX 级优化展示了绕开高层 CUDA 库的可能性,国产卡与新架构获得窗口,但长期胜负仍取决于编译器和软件生态,而不只是单芯片性能。
  • 应用端真正可交易的变量是 token 成本下降带来的 ROI 扩张,但短期国内预期明显跑在效果前面。 DeepSeek 在几周内完成政府、企业管理层和普通用户的市场教育,蒸馏模型也可能把推理能力带到 PC、手机和 AI 硬件;然而峰瑞被投企业实测称,DeepSeek 并未在所有行业任务领先,部分蒸馏出的 Qwen 模型在很多任务上甚至可能不如原始模型。长期更值得关注的是强化学习能否从数学、代码迁移到 Agent、具身智能和物理世界,但当前结论仍应是“让子弹再飞一会儿”。
Digest · the substance, structured for research

1. DeepSeek 的技术突破只解释了爆火的一小部分

  • 刘鹏琦的核心判断是“20% 技术创新、80% 开源生态和中国元素”:低成本 V3 与开源 R1 都是好工作,但单靠技术不足以解释全球市场如此剧烈的反应。

  • 中国团队在资源约束下逼近一线模型,击中了海外的信息差,也引发质疑;刘鹏琦认为短期主要是情绪,长期价值则是重建市场对“中国能做真正技术创新”的信心。

  • 开源让后来者获得不对称优势。DeepSeek 相比海外大厂没有那么多既有包袱,得以冲击 OpenAI、包括 o1 在内的一系列模型的封闭地位,正所谓“光脚的不怕穿鞋的”。

2. V2 已先打穿 API 价格,V3 再把训练成本砍到十分之一

  • 颜黔杭回溯到2024年5月6日:DeepSeek-V2 以接近 GPT-4 的能力,将每百万 token 输入、输出价格分别压到1元和2元;他列出的6月13日那款 GPT-4 模型的输入、输出价格则为217元和434元,由此触发行业第一轮价格战。

  • 2024年12月底发布的 V3,把冲击从 API 延伸到训练端:约278万 H800 GPU 小时折合500多万美元,而颜黔杭给出的 GPT-4、Llama 3.1 预训练成本分别约为6300万美元和5800万美元。

  • 媒体早期对“500万美元训练成本”存在误读,刘鹏琦提醒相关信息修正后再看;但其结论没有改变——V3 仍以低一个数量级的算力成本,做到接近 GPT-4o、Claude 3.5,并超过当时千问2.5、Llama 3.1 等开源模型的表现。

3. MLA 把最昂贵的 KV Cache 压缩了九成以上

  • 颜黔杭从 Attention 的 Q、K、V 讲起:生成新 token 时,历史 token 的 K、V 会被反复调用,因此必须缓存;长上下文下,KV Cache 很快让显存容量和带宽比纯算力更早成为瓶颈。

  • MLA 的办法是对完整 KV 矩阵做低秩压缩。颜黔杭用“保存三维物体在平面上的影子”作比喻:不必存下完整结构,而只需保存低维矩阵。

  • V2 论文给出的结果是,MLA 相比此前 DeepSeek 模型将 KV Cache 缩减93%以上,“相当于只剩下原来的十分之一”。刘鹏琦将其概括为“用时间换空间”,从而降低显存与显存带宽需求。

4. MoE 的关键不只是专家多,而是让专家都真正工作

  • V2 拥有236B 总参数、推理时约激活21B;V3 扩至671B 总参数,却仅激活37B。刘鹏琦描述的路由是一个共享专家加256个独立专家,每次只调用共享专家与其中8个专家,以“用空间换时间”。

  • 颜黔杭解释,DeepSeek 将常见的约32个专家扩大到256个,再加入承载通用知识的共享专家。“三个臭皮匠顶一个诸葛亮”,更多、更细的专家可以降低单个专家知识偏见,并形成更稀疏的计算。

  • 难点是训练中的马太效应:强专家持续获得数据,弱专家越来越少被调用。DeepSeek 采用 Loss-Free Load Balancing,按每步负载动态纠偏,避免“强者恒强、弱者恒弱”;颜黔杭的总结是“人多力量大,而且每个人都要贡献自己的力量”。

  • 两位嘉宾对原创性的尺度略有差别:颜黔杭把 MLA 称为“从零到一,再到十到一百”的创新;刘鹏琦则认为 V3 多数工作站在前人肩膀上,真正难复制的是算法、框架与硬件共同形成的工程壁垒。

  • 刘鹏琦也提醒,Dense Model 在专用领域的 To B 场景和端侧小模型上仍有优势,不能据此断言 MoE 会“一统江湖”。他还提出一个未决问题:V3 的创新究竟是主动选择,还是算力受限下的被动适应;如果拥有更多算力,这些创新是否仍会出现、是否仍有必要,仍值得思考。

5. FP8、DualPipe 与 PTX 把低成本变成系统工程

  • 颜黔杭称,DeepSeek 自建了一套高性能、经济高效的 AIPC 集群,规模约为几万张英伟达 GPU,并在节点通信、训练管线并行和 FP8 混合精度训练等方面做了大量工程优化;算法侧还使用 MTP,即多 token 预测技术,提升推理效率。

  • V3 使用 FP8 混合精度,在尽量维持训练精度的同时减少数字存储空间;DualPipe 则填补 GPU 管线中的空闲时间,让 token 遍历节点时尽可能减少设备等待。

  • 刘鹏琦特别强调 PTX:团队没有只依赖高层 CUDA 库,而是直接编写更底层的代码,压缩计算和通信开销,极致释放硬件性能。这种能力与算法设计必须同步,否则 MLA、MoE 各自的新瓶颈会抵消理论收益。

  • 因而 V3 的成本不是一个 trick 的结果。颜黔杭认为 DeepSeek 的算法与 infra 协同处在“行业第一梯队,甚至最好的层级”;这也解释了为什么相同论文思路落到不同团队手中,最终效率可能完全不同。

6. R1-Zero 证明了纯强化学习能激发长链推理

  • R1-Zero 直接以 V3 为基模,不先加入人类高质量对话或推理数据,而用数学、代码等存在 ground truth 的任务做强化学习;结果证明,模型能够自行激发长链推理能力。

  • 代价同样明确:未经语言约束的 R1-Zero 可读性很差,还会混用语言。颜黔杭解释,奖励函数主要要求答案朝正确方向优化,并不会自动要求推理过程符合人类表达习惯;但语言混用并不影响最终结果。

  • 刘鹏琦的降温判断是,GRPO、客观答案奖励等方法本身并不复杂,OpenAI 发布 o1 时也已指出强化学习和 test-time compute 的方向;DeepSeek 的贡献是行动更快,率先把可行路径跑通并公开。

7. R1 用多阶段训练把实验模型变成可用产品

  • R1 没有坚持 R1-Zero 的纯粹路线,而是先使用冷启动数据进行 SFT,再以强化学习激活推理能力;中间状态的模型继续生成新的冷启动数据,循环进行强化学习,最终改善语言表达和综合性能。

  • 颜黔杭将其称为行业首次复现 GPT-o1 级推理模型,也是“推理大模型时代的 Llama”:闭源能力第一次以低成本开源基模、训练路径和蒸馏模型的形式进入社区。

  • test-time compute 是这套能力的外在表现:用户看到的“自言自语”不是装饰,而是通过扩大输出时间和 token,让模型把生成过程本身用于搜索、检验与纠错。

8. 强基模决定强化学习究竟能不能收敛

  • 刘鹏琦给出的关键机制是搜索命中率:V3 可能在“一百个结果当中就能找到一次答案”,奖励信号足以推动快速迭代;较弱模型若要在一万个结果里才偶然命中,同样的 RL 框架可能根本训练不出来。

  • DeepSeek 又让 R1 充当老师,蒸馏千问与 Llama,发布从1.5B到70B的六个小模型;颜黔杭称其中32B 模型基本与 GPT-o1 一致,且这些蒸馏模型都强于直接在基座模型上做强化学习后训练的结果。

  • 他的类比是:好老师能显著抬高学生的基础水平,而“特别聪明的小孩子”才可能靠自学超过受教者。由此,蒸馏利好端侧模型,纯 RL 则仍高度依赖强基模。

9. DeepSeek 的量化基因把纳秒级优化迁移到了 GPU

  • 刘鹏琦认为行业认知差正在缩小:学术界和产业界的方法逐渐收敛,纯概念创新放慢后,中国团队擅长的工程实现能力开始成为决定性变量。

  • 孵化 DeepSeek 的幻方量化提供了特殊基因。量化交易中,哪怕纳秒级执行优势也可能决定盈亏,因此团队早已习惯定制 FPGA、在 C 语言中嵌入汇编,再把这种底层优化能力迁移到 GPU、PTX 与训练通信上。

  • 组织形态同样重要。颜黔杭称 DeepSeek“不太像一个商业化的公司”,更像协作性很强的科研团队;刘鹏琦则强调其较小的营收和商业化压力、开源文化与长期性,让团队能快速判断论文价值并立即工程化,而不是先服从短期商业目标。

10. Scaling Law 正从预训练迁往后训练和推理

  • 预训练阶段的共同瓶颈是新数据不足:继续增加参数可能导致过拟合,GPT-5 的“难产”被刘鹏琦视为一个端倪。因此,并非算力完全无效,而是单纯堆数据、参数和 GPU 的边际回报正在逼近上限。

  • 后训练仍有明显扩展空间。目前后训练使用的算力通常不到预训练1%,刘鹏琦援引分析称 R1 可能已接近10%;继续扩大 RL 有望提升能力,但 reward 如何定义、专业问答和高质量 CoT 数据如何获得,成为新的稀缺资源。

  • 推理阶段则通过更长思考时间扩大计算:模型先给出草案,再发现错误、反思并调整。刘鹏琦的结论不是 Scaling Law 失效,而是“体现的角度发生了一些变化”。

11. Grok 3 的二十万卡没有证明暴力扩算力仍然划算

  • 2月18日发布的 Grok 3 使用20万张 GPU。两位嘉宾都承认其数学、科学和编程 benchmark 有提升,却认为相对 OpenAI 等竞争对手多用了一个数量级、相对 DeepSeek 多用了两个数量级的算力投入,边际提升只有几个百分点。

  • 颜黔杭称 Grok 3 的成本投入是 DeepSeek 算力成本的100倍以上,并认为实际可能达到数百倍;他还质疑发布图表将纵轴设置成类似40到100而非0到100,视觉上夸大差距。考虑到 Grok 2 也曾出现标准评分高、实际表现需要打折的情况,他的态度是“先让风吹一两天”。

  • 刘鹏琦进一步指出,现有提升更多来自后训练塑造的推理能力,而非预训练规模本身;Grok 3 因此反而佐证了旧式预训练 Scaling Law 正在减弱。

12. 模型竞争将迫使国内厂商重选开源与商业化路径

  • DeepSeek 当前仍主要是语言模型,缺少多模态能力,直接与完整多模态产品横比并不公平。刘鹏琦提醒,OpenAI、Anthropic、Google 仍在多模态、泛化、工具链、开发者生态、储备技术和算力上占优,“离真正超越还有挺长的路”。

  • 国内 To C 压力更直接。Kimi、MiniMax 并非技术落后,Kimi 1.5 的工程工作也得到学术界认可;难题是闭源能否持续保持一线水平,以及开源会不会反过来颠覆原有收费模式。

  • To B 客户长期会回归理性选型,但短期已被情绪推动集中尝试 DeepSeek。它完成了市场教育,却没有自动消除交付、适配和效果评估的门槛。

  • 对 DeepSeek 自己,流量也是“泼天的富贵”:是否融资,还是维持较小规模、继续专注研究,将决定其组织优势能否保留。

13. 英伟达短期受益,但硬件壁垒面临重估

  • 刘鹏琦认为英伟达的核心壁垒不只是单芯片设计,而是芯片互联能力,包括 Infinity Fabric、NVLink,以及 CUDA 软件生态共同形成的生态壁垒。

  • DeepSeek 一方面教育了市场、提升了 AI 应用信心,并可能带动更多公司采购硬件。刘鹏琦通过一些渠道听到,DeepSeek 发布应用后 H100、H200 的价格反而有所上涨;持续变化的模型架构也更需要通用 GPU,未必利好专用芯片。

  • 另一方面,MoE 降低了对芯片间互联能力的要求。PTX 被刘鹏琦称为比 CUDA 更底层的编程技术,但它本身也是英伟达的底层技术;DeepSeek 直接编写底层代码,展示了减少对高层 CUDA 库调用的可能性。若更多模型采用相对确定的架构路线,其他硬件也可能承接这类模型。

  • 短期内,DeepSeek 会带动低性能卡、包括国产卡的使用;长期机会则可能出现在3D封装、高速互联、高显存设计和整个编译生态。刘鹏琦强调,只有单芯片或互联能力并不足够,完整的软件生态才是长期成功的关键。

14. 应用 ROI 已改善,但行业落地仍需穿过实测关

  • token 费用下降直接扩大应用利润空间。颜黔杭认为,过去 AI 创业必须在模型调用成本与用户付费之间挤利润;价格战让开发者终于获得足够便宜、自由的试验土壤,R1 后 OpenAI 发布 o3 并下调 o1 价格也是这种竞争的体现。

  • DeepSeek 在几周内让政府和企业高层、普通消费者乃至父母辈开始使用,显著提升 To C、To B 的采用意愿;但刘鹏琦明确认为国内市场短期高估,尤其企业端真实效果可能低于预期。

  • 峰瑞被投企业的实测构成重要反证:客户部署呼声很高,但 DeepSeek 并非在所有行业任务都领先,部分由其蒸馏出的 Qwen 模型在很多任务上甚至可能不如原始模型。蒸馏方向“可能”利好 PC、手机和 AI 硬件,仍需业界验证。

  • 更长期的问题是,已经在数学、代码等客观领域验证的强化学习,能否迁移到现实世界推理、AI Agent 和具身智能。刘鹏琦对此保持期待,但也主张“让子弹再飞一会儿”。

15. 开源既是分发机制,也是下一轮研发基础设施

  • 颜黔杭援引一位创业者的说法:“DAU 对模型的研发来说并不是一个有价值的因素,但是开源是的。”DeepSeek 在1月27日开源产品并将应用上线应用商店后,DAU 很快超过字节的豆包和 Kimi 聊天助手,几乎零成本获得热度和流量。

  • 更深的价值类似早期 Android:开发者可以部署、研究和迭代,逐渐形成平台共识;共识提出者则获得人才、关注度和后续商业化优势,同时迫使 Llama 等开源模型继续创新,并对闭源厂商形成促进。

  • R1 当前的客观奖励主要适用于数学和代码。颜黔杭则用 AlphaGo 到 AlphaZero 的变化追问,减少人类监督、增加自我强化,是否可能让模型突破人类数据的上限。

  • 这个远景仍被明确保留为假设:“也许强化学习才能实现真正超越人类的 AGI。”在 reward 和真实世界迁移问题尚未解决前,刘鹏琦最后的收束仍是尊重突破、保持观察,“让子弹再飞一会儿”。

Speaker 1

大家好,欢迎大家来到今天的《高能量》,我是峰瑞资本的李丰。这一期我们做产业观察,因为在这个春节期间,最热闹的话题之一就是 DeepSeek 在中国和全世界的出圈。

作为一家投资机构,我们也要求科技相关的同事分别描述自己的看法。科技组的同事们每个人都写了一篇小作文,从投资、技术和科普的角度,讲了一遍自己怎么看待 DeepSeek 为什么会火、它背后到底有多少创新,以及它可能会给行业带来什么改变。欢迎大家在听完以后,提出自己的观点、意见或者建议。

刘鹏琦

大家好,我是峰瑞资本的刘鹏琦,平时主要关注 AI、机器人和产业数字化方向。今天我希望通过 7 个问题,尝试解读这次 DeepSeek 爆火的原因,以及它对整个 AI 生态带来的一些影响。

我们会先尝试解读 DeepSeek 为什么会这么火,以及它背后带来的真正技术创新是什么;讨论为什么是 DeepSeek 这家公司做成了这件事情;还会做一些预测,比如 Scaling Law 这件事情是不是还成立,以及 DeepSeek 对其他模型厂商、整个硬件生态和应用生态的影响。

下面我们就针对这 7 个问题,一一作答。

1. DeepSeek爆火来自开源

首先,我们先来回答第 1 个问题:DeepSeek 到底为什么这么火?我先抛出个人结论,我认为 DeepSeek 这一轮的爆火,大概有 20% 得益于技术创新,80% 来自于它从开源生态中获得的影响力,以及它背后的中国元素。

技术上简单来说,就是它用极低的算力成本,实现了比肩全球一线预训练大模型的能力,同时第一次真正公开了用强化学习来做推理模型的可能路径。但说实话,仅仅看这些技术创新,可能确实是一个非常好的工作,可我觉得还不足以引起全球范围内如此强烈的反应,这一点我一会儿还会再详细展开。

我觉得 DeepSeek 更多的影响力,其实要归功于这些技术创新背后的中国元素。某种程度上,因为这些信息差,整个世界确实受到了震动,同时也引发了一些质疑和讨论。当然,我觉得这些都是短期影响;从长期来看,我还是相信它给市场、给整个中国做真正技术创新这件事情带来了信心。

另外,开源对它的成功也是功不可没。DeepSeek 作为后来者,不像那些海外大厂一样有很多包袱。所谓光脚的不怕穿鞋的,所以它也打破了 OpenAI,包括 o1 在内的一系列模型的垄断地位。

如果我们理性地看 DeepSeek 出圈这件事,我觉得市场情绪的因素肯定占大头。当然,我们也不能否认 DeepSeek 团队确实在技术上做了很多创新。

2. V3建立工程创新壁垒

接下来我们回答第 2 个问题:DeepSeek 背后到底带来了什么真正的技术创新?

DeepSeek 从成立至今,一共发布过 9 篇论文。在整个大模型圈子里,大家其实早就知道它的技术实力。今天我们着重来看它最近出圈的两个核心工作,答案其实都体现在它去年年底和今年年初发布的两篇技术报告,以及开源的 3 个模型当中,分别是 DeepSeek-V3、DeepSeek-R1-Zero 和 DeepSeek-R1。

我们先来看看 DeepSeek-V3。V3 相当于对标 OpenAI GPT-4o 的预训练大模型,它最大的贡献是,在同等条件下,甚至在某些任务上表现得更好,但使用的算力成本却极低。

当然,DeepSeek 最开始热起来的时候,媒体对它训练所需要的低成本算力产生了一些误读。不过在相关信息被纠正之后,大家还是发现,它所需要的算力仍然比其他现有闭源模型低了一个数量级。

它之所以能够做到这一点,我觉得必须归功于团队在算法、软件框架,以及软硬件协同实现方面做了大量工作和创新。

先看软件层面,核心其实有两点。第 1 点是 MoE,也就是专家混合模型架构。它相当于用空间换时间,把前馈神经网络划分成 1 个共享专家和 256 个路由专家。

每次进行预测时,它只需要激活那个共享专家,以及 256 个专家中的其中 8 个。这样就大大降低了整体算力消耗。

第 2 点是通过 MLA,也就是多头潜在注意力机制,对模型每次预测所需要缓存的多头注意力向量矩阵进行压缩。它相当于用时间换空间,这样就大幅降低了 KV Cache,进而降低了对硬件显存和显存带宽的需求。

把这两点结合在一起,就同时降低了整个模型运行所需要的硬件算力和显存带宽,最终让我们看到了整体成本下降一个数量级的结果。

但这两点也不是 DeepSeek 在 V3 中第一次提出的。它们其实在之前的 V2 版本中就已经做过验证了。这一次,DeepSeek 进一步做了一些优化,比如负载均衡方面的优化。因为时间原因,今天在播客里没法特别详细地展开这两个技术点。大家如果感兴趣,我也强烈建议去读一读他们的原始技术报告,写得非常清晰。

前面谈到的是软件层面的创新。在硬件实践上,V3 确实在这次报告中第一次公开了很多新的工作,比如用低精度的 FP8 做大量计算,以及使用大量 PTX 底层开发能力,极致压榨硬件性能,从而降低计算和通信开销。所以这一部分我也不再特别详细地展开。

总结来看,DeepSeek-V3 没有太多概念上的创新,更多是站在前人的肩膀上,但它形成了非常高的工程创新壁垒。

除了极高的工程创新壁垒之外,MoE 架构也很有价值。但在很多其他场景下,Dense Model 也有自己的优势,比如一些专用领域的 To B 场景,或者应用在端侧的小模型上。所以不能说 MoE 未来就会一统江湖,不同的模型架构都有各自适合的应用场景。

还有一个问题非常值得思考:V3 中的这些工作,到底是团队主动创新的结果,还是在硬件资源受限情况下的被动选择?假设 DeepSeek 团队能够拥有更多、更强的算力资源,那么这些创新还会不会出现,甚至还有没有必要?我觉得这个问题可以留给大家进一步思考。

3. R1开启强化学习推理

接下来我们再看看 R1-Zero 和 R1 这两个模型。它们对标的是 OpenAI o1 系列推理模型。

我们都知道,OpenAI 发布 o1 之后,整个业界和学术界对它的具体实现方法有很多猜想,甚至有人说 OpenAI 团队主动放出了一些与实际情况不相关、甚至错误的方向来误导大家。当然,我们抛开这些阴谋论不谈,这次 R1 的发布确实是通过自己的探索,用强化学习的方式实现了比肩 o1 的推理大模型,并且把相关工作全部开源了,这还是非常厉害的。

简单来说,R1-Zero 和 R1 还是有所区别的。R1-Zero 是一个更纯粹的、基于强化学习的大模型。它直接使用 DeepSeek 自己预训练好的 V3,也就是刚才讲到的 V3,没有经过任何人类知识先验的调教,而是直接使用数学或者代码这类具有 ground truth 的问题进行强化学习,最终取得了不错的结果。

R1 相比 R1-Zero 加入了更多工程化方法,也加入了更多类似模仿学习的 SFT 监督训练。在 R1-Zero 的基础上,它进一步提升了语言表达能力和整体性能,所以对用户来说更加友好。

具体的技术细节和评测结果我这里也不详细展开了,同样强烈建议大家去读 R1 的论文,里面写得非常清楚,也非常优美。

从我的角度来看,DeepSeek-R1 其实也没有发明新的范式。OpenAI 早在发布 o1 时,就已经给大家指明了方向:一是纯粹使用强化学习,而不是人类反馈,来训练模型、提升推理能力;二是 test-time compute,也就是利用模型输出的过程本身进行计算,从而提升推理能力。

相信大家都用过 DeepSeek。在使用过程中,大家会看到它中间有一段自言自语式的思考过程。通过扩大输出时间和 token 数量,它就把整个推理过程实现了出来。

DeepSeek 相对来说行动更快,也把这件事情开源了,所以它帮助这两个新的范式快速出圈。但无论是 R1 中的强化学习框架 GRPO,还是使用数学、代码这类 ground truth 结果来制作奖励函数,其实都还是相对简单的方法。

它之所以能够做出 R1,更多还是因为 V3 本身的能力足够强,这样它就能够在有限的搜索空间内找到正确答案。比如说,它可能在 100 个结果当中就能找到 1 次正确答案,而不是在 1 万个结果中才能找到 1 次。这样就能够帮助模型快速迭代和收敛。

但相比之下,如果换成另外一个小模型,依然使用同样的强化学习框架和同样的 ground truth 奖励,可能就训练不出来。

关于第 2 个问题,也就是 DeepSeek 真正的技术创新是什么,我们花了比较多的时间来讲。相信大家现在能够理解,为什么我说 DeepSeek 的爆火大概有 20% 来自技术创新,更多的市场反应还是出于中国元素和开源带来的影响。所以,我们还是需要用更加理性的心态来看待这件事情。

4. DeepSeek胜在团队基因

现在我们尝试回答第 3 个问题:为什么是 DeepSeek 这家公司做到了这一点?

我认为主要有 3 点。

第 1 点是宏观情况。整体 AI 市场的创新正在变慢,不同团队之间的认知差距也在缩小,大家能够想到的方法正在逐渐收敛。所以这件事情其实跟国界无关,也跟中美没有关系,而是整个学术界和产业界共同面对的情况。

当技术创新变慢之后,中国团队的工程能力优势就体现出来了。这也是 DeepSeek 能够发展这么快的原因。

第 2 点,我们不能忽视孵化 DeepSeek 的公司——幻方量化——带来的基因影响。

我之前也关注过一段时间金融科技,看过很多量化和高频交易项目。我知道,想把量化做好,一方面策略要非常强;但同时,你能不能把这个策略以最快的速度执行好,可能更重要。

你能不能比竞争对手更快,哪怕只有纳秒级别的速度优势,都可能决定你能不能在一两次交易中赚到钱。

所以,幻方的量化基因决定了它原本就在底层硬件优化和开发、加速算法方面积累了很多经验。比如,它过去可能需要对 FPGA 做大量深度定制的研发,也会在普通的 C 语言中嵌入很多汇编语言,以提高硬件调度效率。

这些原有的工程经验,最终都反映在 V3 如何优化 GPU,以及如何绕过 CUDA、直接使用 PTX 编程等工作上。

第 3 点是它的商业模式和开源文化支撑了团队的长期性。这种长期性能够帮助团队建立研究导向和创新文化。

它没有太大的营收和商业化压力,也能够吸引更多真正想做事情的人才,支撑团队在行动和结果上都比其他团队做得更好一些。

5. Scaling Law仍然成立

接下来我们再问一个问题:DeepSeek 发展到今天,大模型的未来会走向哪里?

我们知道,大模型最开始出现的根基就是 Scaling Law。Scaling Law 代表着,从 GPT-1 到 GPT-4 这个过程中,随着我们使用更多数据、更多算力和更多模型参数,把这些因素叠加起来训练模型,模型效果就会更好。

它的 scale 主要体现在数据、算力和模型参数上。那么 Scaling Law 是不是还会继续成立?我们也分 3 个方面来看。

首先是 pre-train,也就是预训练阶段。目前来看,业界共识是,预训练阶段的 Scaling Law 已经接近极限了,主要问题在于没有更多新的数据可用。

在这种情况下,如果盲目增加参数,可能容易导致模型过拟合,结果反而不会很好。从 OpenAI 的 GPT-5 难产中,我们其实也能看出一些端倪。当然,业界肯定还在持续推进这件事情,但看起来离上限也越来越近了。

第 2 个方面是 post-train,也就是后训练。在后训练阶段,Scaling Law 能够体现出的优势会越来越明显。

无论是过去传统的 SFT 监督训练,还是基于人类反馈的强化学习,包括最新的 DeepSeek,以及 o1、o3 系列模型,都开始使用基于强化学习的后训练范式,已经能够看出越来越好的规模优势。

这里好的一点是,算力其实不是问题。目前来看,后训练阶段使用的算力还不到预训练的 1%。当然,这个比例正在逐渐增加。大家也分析过,R1 的后训练算力占比可能已经接近 10%,但这距离预训练的算力规模仍然有很大差距。

所以,如果能够进一步提高后训练的规模效应,整个模型的结果可能还有进一步提升的空间。

但这一块肯定也有一些挑战需要解决,比如如何定义算法,尤其是如何更好地定义 reward。这对于做好强化学习非常关键。

另外,我们依然缺乏高质量数据,尤其是用于后训练的数据。无论是高质量的专业问答,还是思维链的 CoT 数据,都还比较缺乏。

所以,业界和学术界也在持续探索。无论是人工标注,还是使用更多合成数据的方法,我觉得这两方面都非常值得关注和投入。

第 3 个方面是推理阶段的 Scaling Law,也就是前面谈到的 test-time compute。模型完整的输出过程,本质上也是一个计算过程。

如果允许模型有更长的思考时间,它就会通过反复尝试和自我修正来优化答案。比如,模型可能一开始简单地算出一个答案,但中间发现不对,就会进行反思和调整,最终得到更加准确的结果。

所以,通过延长推理时间来给出更准确的答案,也能够非常显著地带来效果提升,这同样是 Scaling Law 的一种体现。

在这方面,我们已经看到很多新的突破和前景。总结来说,我觉得 Scaling Law 依然成立,只不过它体现的角度发生了一些变化。

不知道是不是巧合,DeepSeek-R1 发布后短短 1 个月内,我们就看到了各种模型发布的大乱斗。其中最受关注的,就是马斯克的 xAI 团队会用它的 20 万张卡集群交出怎样的答卷。

2 月 18 日,Grok 3 正式发布。虽然从发布会现场展示的数据来看,Grok 3 在一些数学、科学和编程基准测试上超过了目前所有主流模型,但通过详细的对比研究和测试发现,它的实际能力可能并没有马斯克宣传的那么突出。

即便真的有几个百分点的提升,相比 OpenAI 等竞争对手多用了一个数量级的算力资源,以及相比 DeepSeek 多用了两个数量级的算力资源,它的边际收益确实太小了。

而且,这些提升更多反映在通过后训练实现推理能力上。这也进一步佐证了,在预训练阶段,Scaling Law 可能正在逐渐消失。

6. 开源冲击模型厂商

接下来我们展望一下,DeepSeek 到底会给模型厂商、硬件生态和整个应用生态带来什么变化。

先回答它对其他模型厂商的影响。首先我们不得不说,DeepSeek 目前还仅仅是一个大语言模型,并不具备多模态能力,所以把它和很多其他多模态大模型直接比较,也并不完全公平。大家可以先有这样一个认知。

我们先讨论它对海外大厂的影响。代表性的当然包括 OpenAI 的 GPT-4o、o1、o3 系列模型,Anthropic 的 Claude 3.5,以及 Google 最新发布的 Gemini 2.0。

我们不得不承认,这些海外大厂在多模态能力、泛化能力、工具链和开发者生态等方面,依然有很强的优势。同时,它们还有很多储备技术,出于战略考虑可能不会全部公开;在算力资源方面,它们也依然有非常明显的优势。

所以,看到 DeepSeek 这么火,我们依然要正视差距。我们距离真正超越这些海外一线公司,其实还有很长的路要走。

再看国内其他厂商。我认为,DeepSeek 对做 To C 的国内厂商影响可能更大,对 To B 的整体影响相对小一些,但目前来看,即便是 To B,也受到了一些市场情绪的影响。

对于 To C 厂商来说,影响最大的可能包括 Kimi、MiniMax 等。我觉得 Kimi、MiniMax 从技术角度看其实并不差,我们不能低估国内其他团队的技术创新能力。

比如 Kimi 最新发布的 Kimi 1.5,在很多学术界人士看来并不差,甚至它公开的很多工程创新也非常值得学习。

但它们面临的挑战,可能更多在于如何在开源和商业化之间做选择。如果持续保持闭源,能不能依然达到一线模型的水平?如果选择开源,会不会颠覆自己原来的商业模式?这个问题我没有答案,可能确实需要这些厂商自己思考。

对于其他 To B 厂商,我觉得从长期来看,企业端还是会做理性决策。但短期内可能确实会受到市场情绪影响,大家会去尝试 DeepSeek。它的好处肯定是帮助教育了市场,但长期会怎么样,还是要拭目以待。

对于 DeepSeek 自己来说,也要考虑如何应对这份“泼天的富贵”:它的流量到底要不要转化为融资,还是继续保持相对较小的规模、专注研发?这件事情也值得我们拭目以待,可能更多取决于团队个人的选择。

对于开源社区的影响,我觉得毫无疑问是利好。DeepSeek 对其他开源模型,比如 Llama,造成了很大冲击。我相信,这也会促使其他开源模型更多地进行创新,而不是守着之前的成果。

这对整个社区的发展非常好。开源社区发展得越好,对很多闭源厂商也会形成促进作用。

第 4 点是对其他小模型公司的影响。DeepSeek 的文章中其实也谈到,它可以把 R1 大模型的能力蒸馏出来,应用到 Qwen 或者 Llama 这样的小模型上。

这就证明,大模型的推理能力也可以通过蒸馏放到相对较小的模型上,从而提高小模型的推理能力。当然,这件事情还需要业界进一步验证。

如果确实成立,我觉得这对自研模型的中小企业比较有利,尤其是能够在端上部署的模型。无论是 C 端应用还是 B 端应用,都会得到比较大的帮助。

7. 英伟达壁垒面临重估

接下来我们谈谈 DeepSeek 对硬件生态的影响。

这个问题的出发点是,在 DeepSeek 最火的那几天,它对整个美股市场,尤其是英伟达的股价,造成了短时间的冲击。

我们先回答它到底会不会挑战英伟达的地位。在回答这个问题之前,还是要先回到基本面:英伟达的核心壁垒是什么?

英伟达的核心壁垒肯定不是单芯片设计能力,但毫无疑问,它的单芯片设计能力非常强。它更多的壁垒,来自芯片互联能力,比如 Infinity Fabric、NVLink,以及软件生态 CUDA。这些能力共同形成了一套非常强的生态壁垒,也是它最核心的能力。

了解了它的壁垒之后,我们就可以回答这个问题了。DeepSeek 对英伟达确实既有正面影响,也有负面影响。

正面影响毫无疑问是,DeepSeek 教育了市场,给整个市场带来了更强的 AI 应用信心,也吸引了更多初创企业尝试开发应用。

我也是通过一些渠道听到消息,自从 DeepSeek 发布应用以来,市场上 H100 和 H200 的价格其实有所上涨。这从侧面印证了,确实有更多公司开始购买这些硬件,开发自己的模型和应用。

另外,像 DeepSeek 这样的厂商持续在模型架构上做创新,其实对英伟达这种通用 GPU 芯片厂商更加有利。因为大家需要不断尝试新的方案,通用芯片显然更有优势;对于一些专用芯片来说,可能就不一定是利好。

刚才说的是正面影响,但毫无疑问,DeepSeek 也给英伟达带来了一些负面影响,冲击了它的市场定价策略。

首先,前面谈到的 MoE 架构显著降低了对芯片间互联能力的要求。同时,DeepSeek 也提供了潜在的绕过 CUDA 的可能性。这里的“绕过”需要打引号,因为它使用的是比 CUDA 更底层的一种编程语言——PTX。

但 PTX 本身也是英伟达的核心底层编程技术。对于 DeepSeek 团队来说,它没有直接调用更高层的库,而是直接编写最底层的代码,从而更好地发挥硬件性能。

同时,DeepSeek 也对如何适配自身模型提出了一些硬件架构设计需求。这样看来,其他架构的硬件也有机会承接 DeepSeek 这类模型架构的能力。

如果未来越来越多模型厂商开始采用 MoE 这样的架构,或者采用某条相对确定的技术路线,就会带来新的硬件机会。

这就引出了第 2 个相关话题:DeepSeek 是否会推动英伟达之外的 AI 芯片行业出现新的创新机会。这也是我们作为投资机构比较关注的热点方向。

从短期来看,DeepSeek 肯定带动了一些低性能卡,包括国产卡。只要工程优化能力足够强,这些卡就能够被使用起来,从而实现软件和硬件完全自主创新的闭环。

从长期来看,我觉得 AI 芯片一定会出现新的机会。除了近期非常关注的新硬件架构,比如 3D 封装、高速互联技术、高显存设计等,也要格外重视整个编译生态的建设。

从刚才讲到的英伟达壁垒来看,仅有单芯片能力或者互联能力是不够的,完整的软件生态才是能否长期成功的关键。

8. 应用落地需要保持理性

最后,我们讨论一下 DeepSeek 对整个应用生态的影响。前面其实已经回答了相关问题,我们也分 3 个方面来看。

首先,毫无疑问,它提供了一种非常低成本的方案,能够为 To C 和 To B 应用带来更高的 ROI,推动更多行业应用落地。

前面也谈到,DeepSeek 在非常短的时间内完成了整个市场的教育。短短几周、1 个月的时间里,无论是政府和企业高层管理人员,还是普通 C 端用户,包括我们父母这一辈的人,都开始使用 DeepSeek 或者其他相关大模型。这毫无疑问是一件非常利好的事情。

但我们也不得不承认,国内市场短期内处于一个高估状态。尤其对 B 端来说,To B 的实际落地效果可能会和大家的预期存在一些偏差。

这两天我也问了一些我们投资的、做大模型行业应用的企业。确实,客户呼声都很高,都想赶紧部署。但从这些被投企业自己实测的角度来看,DeepSeek 也没有外界听到的那么领先,包括它们蒸馏出来的 Qwen 模型,在很多任务上的表现甚至可能还不如原始模型。

所以在这一点上,我觉得大家还是需要保持理性。但市场可能确实很难做到完全理性。

第 2 点,大模型蒸馏小模型已经被 R1 验证为可行。未来我们尤其要关注它在端侧应用上的可能性,无论是 PC、手机,还是更多新的智能硬件。

它可能大幅降低部署成本,推动很多新应用落地。所以,对我们投资端侧应用来说,也会有很大帮助。

最后一点可能更加长期:强化学习这一计算范式已经被 R1 验证并开源了。它现在可能还局限在数学、代码这类相对客观的领域,但未来是否能够迁移到物理世界,去解决更多现实世界中的推理问题?

包括大家讨论很多的 AI Agent 应用,以及我们去年一直在关注的具身智能落地,强化学习是否能够发挥更大的价值?我觉得这是一件更加令人兴奋的事情。

以上就是我尝试通过 7 个问题,对 DeepSeek 做的一些浅显解读。毫无疑问,我觉得 DeepSeek 的贡献非常令人敬佩,但现实情况是,目前市场肯定也明显过热。

无论是投资人、创业者,还是正在使用大模型的朋友,我觉得都可以让子弹再飞一会儿,继续观察市场的发展。同时,我们也期待中国市场能够诞生更多像 DeepSeek 一样的原始创新成果。

谢谢大家。

颜黔杭

大家好,我是来自峰瑞资本科技组的颜黔杭。目前我主要关注前沿科技和泛交叉领域的科技赛道,AI 和机器人一直是我们这几年比较关注的重点方向。

今天我们简单对 GPT-4 是怎么走到今天这一步,做一个比较概括性的解读,也让大家了解一下 DeepSeek 为什么能做得这么便宜、这么好,以及为什么 DeepSeek 会在今年春节前让全世界震惊一波。

9. 低价模型始于V2

首先,DeepSeek 并不是在 V3 出来之后才受到行业关注。2024 年 5 月 6 日,DeepSeek 发布了 DeepSeek-V2 模型。这个模型当时就震惊了整个行业:它拥有逼近 GPT-4 的能力,但使用价格仅为 GPT-4 的三十五分之一,也掀起了行业内的第一波价格战。

各家大模型公司纷纷跟进,降低模型的输入和输出价格,甚至有公司为了竞争,直接把模型变成免费模型,以吸引行业关注。

2024 年 5 月,DeepSeek-V2 的输入价格是每百万 token 1 元,输出价格是 2 元。同期的 GPT-4,在 6 月 13 日那款模型中,输入价格是每百万 token 217 元人民币,输出价格是 434 元人民币。

这样的价格差距,直接让 DeepSeek 在行业内迅速出圈,尤其是在下游做 AI 应用和 AI 硬件的客户中。行业人士发现,这是一个完全颠覆想象力的价格。为什么会这样,我们后面会讲到。

2024 年 12 月底,DeepSeek 发布了最新的 V3 模型。相比 V2,V3 有什么优势?从新闻角度看,最吸引眼球的就是 500 万美元的训练成本。

当时一位 Twitter 博主甚至发帖说,Meta 一名高级工程师,甚至一个小领导,一年的年薪就要 500 万美元;而 DeepSeek 用一个人的工资,训练出了这么强的模型。

V3 的整体性能甚至超过了此前开源最强的 Qwen 2.5 和 Meta 发布的 Llama 3.1,也接近 Claude 和 GPT-o1 等闭源模型的性能。其中,它在数学和编程方面的表现远超同类开源模型。

V3 的训练成本是 500 万美元,这应该怎么理解?模型训练行业通常会用一个非常直接的方式来解释训练成本,也就是 GPU 时间。

DeepSeek 使用了 278 万个小时的 H800 训练时间,换算成训练成本后,大约是 500 多万美元。

同期,OpenAI 在 2023 年发布的 GPT-4,如果用 GPU 时间估算,训练成本大约是 6,300 万美元。再看相关的开源模型,2024 年 7 月 Meta 发布的 Llama 3.1,预训练成本是 5,800 万美元。

所以,DeepSeek 不仅把模型 API token 的费用打成了白菜价,甚至还把整个模型的训练成本砍到了原来的十分之一。这几件事对行业来说都是非常大的冲击。

V2 和 V3 的技术架构比较相似。V2 当时就使用了 MoE,也就是专家混合网络模型架构,同时使用了一些创新技术,比如 MLA,来降低模型成本。

MoE 的概念是,每个 token 进入模型进行推理时,虽然模型总共有 236B 参数,但实际推理过程中只需要激活其中一部分,比如 21B 参数。

V3 继承了 V2 的技术路线,依旧采用 MoE 架构。它的总参数量达到了 671B,相比 V2 接近提升了 3 倍,但激活参数量是 37B。

V3 是在 V2 基础上的进一步升级,所以它的性能相当于赶上了去年的闭源模型,比如 GPT-o1 和 Anthropic 发布的 Claude 3.5。

它之所以能够实现低成本的推理和训练,同时性能又逼近、甚至超过业内第一梯队模型,我们需要看看背后的原因。

第 1 个明显而核心的原因,是它的算法团队和 AI 基础设施团队之间的协同程度,应该处于业内第一梯队,甚至是最高水平。

算法层面做了很多降低推理成本、训练开销的创新,同时基础设施层面又配合这些创新,进一步提升训练和推理效率,以及训练过程的稳定性。

在算法方面,他们做了哪些创新?他们提出了新的注意力机制,叫 MLA,也就是多头潜在注意力机制;同时推出了自己的 MoE 框架,叫 DeepSeekMoE。

此外,他们还采用了 MTP,也就是多 token 预测技术,来提升推理效率,并通过一系列算法工程创新,实现模型高效率、低成本的推理和训练。

基础设施方面,DeepSeek 自建了一套高性能、经济高效的 AIPC 集群,大约有几万张英伟达 GPU。同时,它还在节点通信、训练管线并行,以及 FP8 混合精度训练等方面使用了很多工程技术,降低推理成本,提升训练稳定性。

大家可能会觉得这些词比较陌生,或者不太容易理解。后面我会针对一些具体技术点,介绍它们为什么能够带来这些进展。

首先介绍 MLA,也就是多头潜在注意力机制。我觉得,这是 DeepSeek 从 V2 开始成为“价格屠夫”的核心秘密之一。

大家都知道,大语言模型底层 Transformer 内部,有一个最核心的计算叫注意力机制。最直观的理解是:一个长文本进入模型后,在生成每一个 token,也就是每一个新词或新字时,这个 token 都要和长文本中的每个 token 计算一次相关性。

这个相关性就是 attention,也就是注意力。注意力机制的公式本质上是矩阵相乘,可以分解为 Q、K、V 3 个矩阵的运算。

Q 代表 query,也就是查询矩阵;K 是索引矩阵;V 是 value,也就是内容矩阵。每个 token 都有自己已经计算好的 Q、K、V。

计算相关性时,只需要把这些矩阵代入 Attention 公式进行计算。在计算过程中,一个句子中所有 token 的 K、V 会被反复使用,所以在实际的大语言模型工程中,这些 K、V 会被存储下来,这就是 KV Cache。

当序列变得很长、需要进行长序列推理时,Attention 的计算方式会导致 KV Cache 变得非常庞大。因此,KV Cache 是大语言模型中最主要的存储开销。

在推理阶段,显存容量就成为硬件瓶颈,它的需求甚至超过算力。DeepSeek MLA 就是通过压缩 K、V 矩阵来降低存储开销的技术。

它大概是怎么做的?就是将完整的 K、V 矩阵进行低秩压缩。简单举个例子,一个 10×10 的矩阵,其实可以拆成一个 10×2 矩阵与一个 2×10 矩阵的乘法。通过这样的分解,只需要存储一个 10×2 的矩阵即可。

更具象地理解,就像我们面对一个三维物体,用一束光把它照射到一个平面上。我们只存储它在平面上的影子,所需要的数据量远少于存储整个三维物体。

通过这种特定的矩阵分解方式,就不需要存储完整的 K、V 矩阵,而只需要存储一个低维矩阵。

这有什么效果?在 V2 的论文中可以看到,相比之前没有使用 MLA 的 DeepSeek 模型,DeepSeek-V2 的 KV Cache 直接缩减了 93% 以上,相当于只剩下原来的十分之一。所以从这里来看,它的推理开销得到了大幅压缩。

MLA 是 DeepSeek 首先提出的技术,可以说是从零到一的创新;而现在,他们已经把它做成了工程化方案,相当于从零到十、再到一百的创新。

第 2 个技术创新点,我们来看 MoE。MoE 并不是新鲜事物,比如欧洲的 Mistral 推出的模型也采用了 MoE 架构。

MoE 是什么概念?大语言模型里有一个东西叫前馈网络。计算完 Attention 之后,再通过前馈网络进行计算,而目前人类的大部分知识基本上都存储在前馈网络中。

传统前馈网络有一个问题:它涵盖的知识即使再多,只使用一个前馈网络时,知识总会带有一定偏见,不够全面。

MoE 的方式是,把很多并列的专家网络放在一起。这样,就可以挑选一些与输入 token 相关性比较高的专家,把它们的知识结合输入 token,进一步进行推理计算,并计算出最终输出。

DeepSeekMoE 和原来的 MoE 有什么区别?原来的 MoE 大概只使用 32 个专家,但 DeepSeek 这次直接把专家数量提升到了 256 个。同时,它还引入了共享专家的概念。

共享专家主要记录通用知识,在每次推理时都会被激活。256 个专家虽然让每个专家模型变小了,单个专家的性能下降了,用人话讲就是“变笨了”,但整体性能却提升了。

为什么会这样?这很像“三个臭皮匠,顶个诸葛亮”。当专家的平均数量足够多时,整体模型的方差,或者说专家知识带来的个体偏见,就会被降低。模型变得更加平均,而整体发挥的力量反而更强。

过去大家训练 MoE 时会发现一个问题:输入不同的训练数据后,不同专家得到的训练强度是不一样的。

比如,一批数据进来,全部都适合第 1 个专家,那么第 1 个专家就会得到非常充分的训练,而后面几个专家训练得不够强。这会导致训练过程中出现马太效应,强者恒强、弱者恒弱。

训练强的专家会变得特别强,训练弱的专家甚至得不到充分训练。这样一来,整个专家网络就很不均衡,最后很难发挥群体作用的优势。推理时也只会有那些特别强的专家发挥作用,专家数量实际上就被缩小了。

为了解决这个问题,DeepSeek 在训练过程中采用了 Loss-Free Load Balancing,也就是一种无损负载均衡的动态纠偏方法。

在每一步训练中,它都会观察各个专家系统的负载,然后引入动态偏置系数,调整每个专家的训练负载,最后实现泛化性能比较好的 MoE 模型。

所以,这里可以抽象成一句话:DeepSeekMoE 的核心就是人多力量大,而且每个人都要贡献自己的力量,整体能力要尽可能平均,不能出现过大的偏差。

回过头来看,DeepSeekMoE 在训练和推理上能不能降低成本、提升效率?答案是肯定的。

刚才我们一直在讲,它是如何提升模型性能的。实际上,当 DeepSeek 把专家数量增加到足够多之后,MoE 就变成了一个大型稀疏矩阵。

每次激活使用时,激活参数不需要很多。专家之间传递数据时,对通信资源的占用也会相对较小,所以它在训练和部署效率上,会比传统 MoE 更好一些。

刚才介绍了两个技术点。除此之外,DeepSeek 还有很多核心技术,也能够提高整体效率。

这里我想补充一点 DeepSeek 在基础设施方面的优势。这次我们特别感兴趣的第 1 个点,是 DeepSeek 基础设施团队实现的 DualPipe,也就是管线并行策略。

这个策略大概是什么意思?可以这样理解:每个 token 输入训练或推理管线后,需要遍历一个个 GPU 节点,进行 token 关联性探寻和计算。

在这个管线过程中,如果某个 GPU 节点没有 token 进入,就会处于闲置状态。DualPipe 的作用,就是尽可能减少推理或训练过程中 GPU 闲置的时间块,把这些空白时间填满,让资源利用率尽可能高。

这样就能提升整体推理效率和资源利用率。

同时,DeepSeek 还使用了 FP8 精度的混合计算方式。FP8 指的是 8 位精度的浮点数,相比 16 位或 32 位,它占用的显存容量更小。

在保证整体训练精度不降低的情况下,降低存储数字的精度,可以减少显存占用,也让模型训练开销进一步降低。

所以回过头看,DeepSeek-V2 和 V3 这类基础模型,就取得了成本低、性能好的结果。当然,这是一整个基础设施团队和算法团队相互合作的过程。

每一步都有对应的问题:MoE 有 MoE 的问题,MLA 在注意力计算中也有自己的问题。如何实现样本效率和训练表现最大化,都需要基础设施团队配合优化。

这也是为什么我们在讲 V2 和 V3 为什么这么好时,首先提到 DeepSeek 的基础设施团队和算法团队的协同,应该处于行业第一梯队,甚至是最好的水平。

10. R1复现推理大模型

下面介绍一下 DeepSeek-R1。R1 在 1 月发布,发布之后直接带来了最大一波舆论关注。

R1 到底是什么,为什么会引起这么高的关注?在 R1 这篇报告中,它发布了两个模型。第 1 个叫 R1-Zero。

R1-Zero 基于前面讲到的 DeepSeek-V3 预训练基础模型。但在 OpenAI 传统的语言模型训练框架中,基础模型训练好之后,虽然已经使用大量人类文本数据进行训练,却还需要使用人工标注的高质量人类对话数据,也就是人类语言数据,进行监督微调,以激发语言生成能力。

监督微调之后,OpenAI 原来的做法还要再使用一套基于人类反馈的强化学习,进一步优化模型的对话性能。

大家可以这样理解:基础模型、监督微调、基于人类反馈的强化学习,这是此前非常经典、由 OpenAI 确立的一套后训练范式。

DeepSeek-R1-Zero 做了什么?它直接放弃了监督微调。为什么要放弃监督微调?因为现在如果要提升模型的推理能力,人类对话数据比较容易获得,但高质量的人类推理数据相对匮乏。

如果坚持使用 SFT,就会面临数据不足的问题。所以 DeepSeek 做了一个实验,直接用强化学习训练,取代原来的 SFT,也就是监督微调。

结果证明,这种方式确实能够激发大语言模型的长链条推理能力,并且在数学、代码等推理任务上展现出不错的性能。

当然,它也存在一些问题,比如推理过程的可读性很差,以及语言混用的问题。

这怎么解释?强化学习本质上是使用奖励函数,激励模型朝某个方向迭代优化,这个过程可能和人类逻辑并不一样。

另外,它在语言上也没有被要求必须只使用中文或者只使用英文。因为没有这样的约束,所以会出现语言混用,但这并不影响最终结果。

后来,DeepSeek 又推出了 DeepSeek-R1。这个模型是在 R1-Zero 基础上,针对可读性差和语言混用问题,采用多阶段训练方式复现出的推理模型。它的性能基本达到了 GPT-o1 的水平。

这也是行业内第一次复现出 GPT 所展示的推理水平。类比来说,它就是推理大模型时代的 Llama。

当时 Llama 复现了 ChatGPT,而且 token 费用非常便宜,因为它的基础模型本身就是低成本模型。

R1 大概是如何实现的?它没有过于极端地抛弃监督微调数据,而是保留了 SFT 的作用,先使用一些冷启动数据进行微调,再用强化学习激活推理能力。

强化学习之后,再用中间状态的模型生成新的冷启动数据,循环进行强化学习。经过多次循环,最终得到 R1 模型。

R1 的性能非常了不得。在各种 benchmark 数据集测试中,它基本达到了 GPT-o1 的水平。

回过头看,DeepSeek 为什么这么厉害,R1 为什么会获得这么多热度?第 1 点,是它第一次复现了 GPT-o1 这样的推理大模型。

在此之前,行业内其实有各种尝试。GPT-o1 发布时已经是一个闭源 AI,它没有告诉大家具体是怎么实现的,所以大家一直在尝试不同方法,包括过程奖励、增加推理计算时间等,但效果都不好。

此前也有人提出过使用强化学习的方式,但没有人第一次真正复现出来。DeepSeek-R1 做到了这一点。

同时,它们还做了一件很有意思的事情:用 DeepSeek-R1 作为老师,去教 Qwen 和 Llama 这两个开源模型,蒸馏出参数量更小的 6 个模型,规模从 1.5B 到 70B。

其中,32B 的小参数模型,性能基本和 GPT-o1 一致。

这里有一个特别有意思的现象:R1 蒸馏出来的小模型,性能都强于直接对基座模型进行强化学习后训练的结果。

这背后的逻辑可以得出两个结论,大家也可以思考一下为什么会这样。

第 1 个结论是,在有一个好老师的基础上,教这些没有推理能力的基础模型去学习和蒸馏,性能远高于基础模型在不会推理的情况下通过自我强化所达到的水平。

也就是说,在老师足够好的情况下,学生的基础水平会被大幅拔高。

第 2 个结论是,如果想要自己通过强化学习做后训练、实现推理能力,对基础模型本身的性能要求非常高。

可以把它类比成人:一个特别聪明的小孩子,通过自学学到的水平,往往可能比一个没那么聪明的小孩子通过老师教出来的水平还要高。

这两个结论也欢迎大家进一步思考。

为什么 DeepSeek-R1 现在会这么火?一句话总结,我觉得 DeepSeek-R1 从某种程度上告诉了大家,或者说给行业带来了一个面向推理时代的新后训练范式。

之前大家经常会听到一种观点:Scaling Law 在知识学习上已经接近瓶颈。下一步,DeepSeek-R1 揭示了推理能力如何实现,也就是说,进一步扩大规模,能够推动推理 Scaling Law 继续延展。

2 月 18 日,马斯克带领的 xAI 发布了最新版的 Grok 3 系列模型。这个模型最吸引眼球的地方,是使用了 20 万张 GPU 组成的集群进行训练,成本投入甚至是 DeepSeek 算力成本的 100 倍以上。

目前对于它的表现,我只能评价为差强人意。它在性能对比图中采取了比较取巧的方式,把纵坐标设置成并非 0 到 100,而是类似 40 到 100 的区间,从而在图表上拉大了它与其他模型之间的差异。

但实际上,它的性能差异相对有限。可能使用数百倍的成本,只获得了 10%,甚至不到 10% 的性能提升。

至于实际场景中的表现如何,我觉得还需要进一步测评。目前来看,Grok 3 的发布也揭示了一件事情:通过投入算力获得预期的线性性能回报,Scaling Law 正在逐步减弱。

这也说明,我们必须寻找新的方向投入力量,才能获得更高的智能水平。

其实从 Grok 2 发布时开始,就一直有一些评分显示,它在标准数据集上的测评得分非常高,但实际性能需要打折扣。对于 Grok 3,既然投入了这么高的成本,我们还是先让风吹一两天,再看看实际评价如何。

刚才讲的都是偏技术的内容。回过头来看,为什么除了 DeepSeek,其他公司没有第一时间实现这样一个比较好的推理模型?

我们可以回忆一下,2024 年夏天 V2 发布之后,有一篇对梁文锋的采访,大概揭示了他如何管理公司,以及他希望团队形成什么样的组织形式。

从我的观察来看,DeepSeek 不太像一家商业化公司,更像一个非常纯粹、协作性很强的科研团队。

他们在做决策、工程和研发时,主要由技术和底层原理驱动。举个例子,前面提到的很多技术,可能都是其他团队先发表论文,但 DeepSeek 会判断这些论文能不能实现自己的研发目标,在工程上是否可实现,以及如何配合落地。

一旦判断某项技术在技术上可行,并且有助于实现目标,他们就会以非常快的速度把它落地、工程化开发,并集成到模型中,推动模型进一步提升。

11. 开源重塑产业机会

最后,我想聊一下 DeepSeek 对投资带来的一些观点和影响。

第 1 点,我们觉得它最大的意义,还是开源了 GPT-4 之后的一些前沿进展和实现方法,包括低成本、高效率的推理训练,以及通过强化学习提升推理能力的后训练范式。

第 2 个我们很感兴趣的点,是 DeepSeek 给行业带来的变化。其中非常重要的一点,就是 token 费用的下降。

token 费用下降以及随之而来的价格战,促使全行业 token 的平均费用持续下降。大家也看到,o1 发布之后,OpenAI 很快发布了 o3,并降低了 o1 的价格。

这会带来什么?过去我们看 AI 应用创业时,有一个问题始终困扰着我们,就是 token 费用的 ROI 问题。

AI 应用创业,本质上是把 ROI 包装成各种应用产品,再向用户收费。它必须在 token 成本和用户付费之间形成利润空间。

如果 token 费用过高,利润空间就会过薄,应用的生存环境会比较困难。token 费用快速下降之后,下游开发者就会拥有更加自由、更加充分的土壤,去尝试各种 AI 应用构想。

第 2 点,DeepSeek 带来了开源的本地部署蒸馏模型。如果这些蒸馏模型能够本地部署并低成本推理,下游的端侧应用,包括 AI 硬件,也可以继承这些推理能力,应用可能会迎来新的创意和实现方式。

第 3 点,我想谈谈开源。开源和闭源始终是行业争论的话题。

我在社交媒体上也看到有人不理解:DeepSeek 做出了这么强的模型和应用,为什么还要选择开源?开源不就是让竞争对手都看到它做了什么,从而失去竞争优势吗?为什么不把它藏起来做?

去年 12 月,一位大模型创业者提出过一个观点:DAU 对模型研发来说不是有价值的因素,但开源是。

开源最简单、最直接的价值,就是带来热度和流量。DeepSeek 在 1 月 27 日开源产品并将应用上线应用商店之后,DAU 快速超过了字节的豆包和 Kimi 聊天助手。

它带来的热度几乎是零成本实现的,这就是开源带来的第一个直观感受。

第 2 点,开源产品能够让全行业的研发者去尝试部署和使用,在上面研究、迭代。这就像早期的 Android,它基本上确立了一个平台共识和底层技术。

作为共识的提出方,你在后续商业化上会拥有很多优势,同时也有助于吸引人才和行业关注。

第 3 点,开源对整个行业都有好处。自从 OpenAI 隐藏 GPT-4 等模型的很多技术细节之后,大模型在推理层面的一些进展已经延迟了比较长的时间。

这是一个新的、技术还不算特别成熟的赛道,我们今天还没有通向 AGI。但如果采用开源,也会极大帮助大家实现 AGI 的未来。

并不是谁在过程中藏着掖着,或者把自己的技术诀窍藏起来,就能始终占据行业第 1 的位置。研发从来不是谁占据优势、获得垄断地位,再通过垄断技术就能实现的事情。它永远需要依靠强大的研发能力持续推进。

最后还有一个很有意思的启示。大家可以回忆一下 2016 年 AlphaGo 和 AlphaZero 出现时的情况。

当时的 AlphaGo 使用人类棋谱训练下围棋的 AI。它和李世石对弈时,被李世石用一招非常精妙、甚至从未在训练数据中见过的棋法打懵了。

这是 AlphaGo 遇到的问题:在人类棋谱的监督数据下,它很难真正超越人类。

后来,AlphaZero 放弃人类棋谱数据的介入,直接用强化学习训练下棋 AI,结果很快超越了人类。

所以,强化学习能不能通向 AGI,以及强化学习和监督数据之间如何平衡、最终通向 AGI,始终是行业研究者关心和探索的问题。

大家目前可能形成的共识是,也许强化学习才能真正实现超越人类的 AGI。

未来,既然 DeepSeek 和 OpenAI 都已经把强化学习用于大语言模型推理能力的提升,实现了大语言模型推理能力的延展,那么未来大语言模型是否能够在聪明程度和推理能力上达到超人的状态?

强化学习这种方式非常值得期待。未来也许推理 Scaling Law 会进一步实现,并成为行业新的发展方向。

我就介绍这么多,谢谢大家。

Vol.156 产业观察27|关于DeepSeek的七个核心问题和DeepSeek关键技术拆解 | BidClub