# 158: V4发布前的DeepSeek：人才竞争、组织特点和独特的AGI目标|Solo

晚点聊 LateTalk · 2026-04-06 · 31 min · https://podcast.latepost.com/158

## 逐字稿

程曼祺

今天这期节目是一期 solo，来聊一聊 DeepSeek 这家公司和它近期的变化。上周四，晚点 LatePost 发布了一篇关于 DeepSeek 的报道，题目是《V 四发布前的 DeepSeek：特质、组织和梁文锋的独特目标》。我在那篇文章里写了我认为非常确切、可以公开表达的关于 DeepSeek 的情况，以及这家公司过去的历史和它的一些特质，还有梁文锋这个人对 AGI 以及如何实现 AGI 目标的独特理解。

如果你已经看过这篇文章，播客本身其实不会有太多新增信息，但会有一些个人感受和观察，以及文章发布后的一些反馈与补充。首先，DeepSeek 给我的综合感受就是，这是一朵 AI 界的奇葩。这里的“奇葩”是它原本的意思：阆苑仙葩，怎落凡家？

在中国这个非常追求效率、追求投入性价比、追求用实力说话的市场环境里，DeepSeek 的目标和风格都非常独特，找不到第二家。比如，它有一个显著的特点就是不怎么加班。如果没有特殊情况，平日里大部分员工会在 6 点到 7 点左右离开公司。

这和梁文锋的一个理念有关。他认为，一个人每天能高质量输出和工作的时间很难超过 6 到 8 个小时，超长工作带来的疲劳和昏庸判断，反而会浪费宝贵的算力，得不偿失。这造就了它的不平凡和传奇，而某种程度上，也成为它如今一些内外部变化的源头之一。

那我们就来聊一聊 DeepSeek 从去年年底到今年的一些具体变化。目前这家公司不到 200 人，其中大概有 100 多人是研发团队，包含数据和 infra 团队，另外有几十人是产品团队。

### Key Researchers Start Leaving

近期一个明显的变化就是，研发团队里有数人集中在春节前后离开。这包括 2025 年年底被腾讯的姚舜宇挖走的王炳轩，他是 DeepSeek LLM，也就是 DeepSeek 第一代大语言模型的核心作者，此后参与了历代模型的训练。

约在春节前后离开的魏浩然，是 DeepSeek-OCR 系列的核心作者，他可能会加入某家大厂。第三位是近期正式离职的郭达雅，他是 DeepSeek-R1 的核心作者，也可能会加入某家大厂。此外还有一位阮冲，他在 2026 年 1 月官宣加入了一家自动驾驶创业公司——元戎启行。

顺便说一句，元戎启行和 DeepSeek 在北京的办公室还在同一栋楼里，都在融科。不过，阮冲其实离职得比较早。据我了解，应该是在 2025 年上半年。离职后，他休息了一段时间。阮冲是从幻方时期就加入的老成员，是 Janus Pro 等 DeepSeek 多模态成果的核心贡献者。

其实，在 100 多人的研发团队里有 3 个人离职，真的不算多。但为什么这件事比较受外界关注？因为对比来看，DeepSeek 之前其实没有什么全职员工离开。据我所知，之前离职的就是 2024 年 3 月比较早离开的张博，他是 DeepSeek-VL，也就是 DeepSeek 一个开源多模态大模型的负责人。他现在回到了浙大，担任教授。

下一个是 2025 年初离开的罗福莉，这位应该是市场比较关注的，后来加入了小米。还有前后脚离开的阮冲。不过，之前这 3 个人里面，除了罗福莉，其实张博和阮冲都没有加入别的 AI 公司。张博应该也在创业。

而这次的人员变动，首先大家都直接加入了可以说是同行，或者竞争对手。然后另一个比较受关注的关键背景就是，DeepSeek V4 到现在还没有发布。

我们在那篇文章里也提到，其实在春节前、2026 年 1 月左右，V4 的一个小参数版本已经给到了一些开源框架社区，开始做适配。按照此前相对乐观的预期，更大参数版本的 V4 原本有可能在 2 月中旬、春节前后发布和开源，但确实到现在大家一直在等，一直在问：DeepSeek V4 在哪儿？

据我了解，V4 应该会在 4 月开源，至少会开源其中的几个版本。从社区的信息看，至少会有一个接近 300B 的版本，以及一个 500B 到 600B 的版本。更晚可能还会有一些新的成果释放。

这一轮人员变动的直接外部原因，当然是所有人都看到的、日趋激烈的 AI 人才争夺战。最近离职的这 3 位，都是加入了中国的大型科技公司。

就我个人的观察，对 DeepSeek 的人员，或者说对所有 AI 研究者来说，最有吸引力的应该是两个团队：字节的 Seed，还有腾讯的 AI 团队。字节的 Seed 虽然已经有 1,500 人，以往被诟病不同小团队之间会有很多 overlap 和赛马，但其实在全球来看，像 DeepMind，也就是 Google 的 AI 研发团队，已经超过了 7,000 人，接近 8,000 人。所以也会有人认为，Seed 的人数并不多。

面对现在越来越多值得探索的 AI 方向，一个组织是可以容纳更多研究员的。相应地，这需要更多算力来支持大家做研究，而字节在这方面肯定有优势。

腾讯现在比较吸引研究员的一点，是去年下半年他们招募了姚舜宇来领军 AI 研发。新帅到岗，肯定就得建立自己的团队。所以腾讯一方面在比较激进、广泛地接触和招募优秀人才，另一方面，这个时期加入腾讯的人，也更有可能获得核心和重要的位置。

比较有意思的一个小插曲是，我们发布 DeepSeek 这篇报道之后的第二天，又发了一篇关于 Kimi 的报道，提到了 Kimi 开始给实习生发期权，想提前锁定这些人才。

这篇文章发布后，在晚点聊的播客讨论群里，有人贴出了清华姚班同学在腾讯的实习信息，上面的薪资描述是每天 5,500 元，括号里写着税前。下面还有一条评论说，同样在清华姚班，在千问实习只有每天 4,200 元。

其实，这两个价格都刷新了我自己了解的记录。我之前知道的最贵的实习工资，是去年 Cursor 团队给一些 top 实习生开的每天 4,000 元。如果每天 5,500 元是真的，假如这个实习生每天都去上班、上满一个月，那月薪就超过 10 万元人民币。

这么高额的实习工资，也侧面说明了现在 AI 人才的竞争有多激烈。从这个直接的外部原因往下看，就涉及 DeepSeek 自身的一个特殊情况，这让它在人才竞争中处于相对弱势，也就是期权定价问题。

### DeepSeek Faces an Equity Problem

大部分公司给的总包，都包含现金以及股份或期权部分。但 DeepSeek 目前没有一个明确的公司估值和定价，所以 DeepSeek 的员工虽然签了期权协议，但他们对这些期权到底值多少钱，感到比较疑惑。

而从去年年底开始，有一个外部变化会让成员对期权这个问题感到更加急迫，或者说更加疑惑。就是 MiniMax 和智谱这两家第一批大模型公司上市，上市之后股价涨得非常好，到现在已经翻了 5、6 倍，两家公司的市值都来到了 2,500 亿到 3,000 亿元人民币左右。

到了春节之后，阶跃星辰和 Kimi 也都传出了要 IPO 的计划。因为 AI 研究圈其实很小，大家都是同学、师兄弟姐妹、校友，或者以前的同事。这种财富效应的对比，多多少少还是会对各个公司里的人产生一些影响。

这也是 DeepSeek，或者说梁文锋最近在求变的地方。他正在行动起来，想办法给公司一个更明确的估值，从而给团队成员提供更明确的预期。

### Liang Wenfeng Defines AGI Differently

变化的最底层、最长期的原因，则是一个目标和共识的问题。这就触及梁文锋自己对 DeepSeek 要做成什么样的想法，他怎么理解 AI 这个目标，以及他的理解和拆解能否让 DeepSeek 一直保持竞争力，能否被团队的其他成员所认可和接纳。

要解释清楚这个问题，我们可以往回倒一点。正如文章里所写，其实梁文锋不是从 2023 年 DeepSeek 成立时才开始关注 AI 的。

这里有一个有意思的对比，或者说一种双向交错。在马拉比的新书《The Infinity Machine》里，写到 2016 年的时候，AGI 的提出者、DeepMind 创始人德米斯·哈萨比斯，其实想把 DeepMind 从 Google 里独立出来。

当时他尝试了一些方法去自己造血赚钱，其中之一就是组建一个小团队做量化交易。后来作者问哈萨比斯这件事结果如何，他说没有赚到钱，团队解散了。

而差不多同时，梁文锋在 2015 年创立了幻方这家量化基金。当时，1985 年出生的梁文锋是 30 岁，他已经做量化投资 7 年了。他是浙大的本科和硕士生，也就是上学的时候，他就在自己做量化交易、炒股赚钱。

正式创立幻方之后，2016 年幻方就开始用 GPU 跑深度学习算法的实盘交易。幻方的官网里特别提到，当时行业里的大部分交易都是用 CPU 来做的。到 2017 年底，幻方实现了几乎所有交易策略 AI 化。

2019 年，幻方开始建立第一个算力集群，有 1,100 张 GPU 的“萤火一号”。也是在 2019 年，幻方 AI 这家公司正式注册。当时梁文锋招人面试时，就会提到 AI。

后面幻方又建了“萤火二号”，所以到 2021 年时，幻方已经拥有 1 万张 GPU。2023 年 5 月，梁文锋接受当时在 36 氪“暗涌”的余丽丽和刘晶采访时，描述过在 AI 热潮之前购买 GPU 的过程。

他说，其实如果只做量化投资，不需要这么多卡。当时建“萤火一号”和“萤火二号”，更多是想满足一种好奇心。因为 2020 年他看到 GPT-3 之后，认为方向是很明确的，就是扩大算力。

当时幻方想扩大算力去研究的方向，是看有没有什么方式能够更完整地描述金融市场，不同范式的能力边界在哪里，以及在金融里的这些方法和范式有没有更广泛的用途。

他把买 GPU、烧钱的行为形容为“就像家里买钢琴”：一来买得起，二来是因为有一群急于在上面弹奏音乐的人。这里指的就是要用 GPU 来做研究的研究员。

继续往下说，梁文锋自己的目标，其实他说的“满足好奇心”和“弹钢琴”的比喻，我觉得都挺反映他和 DeepSeek 这家公司的特质的。

DeepSeek 并不是一个典型的创业公司，它从最开始就没有迫在眉睫的生存问题。所以对梁文锋和他招募的这个小型而精简的研发团队来说，他们的目标和做事风格从一开始就非常独特和纯粹。

据我们了解，梁文锋自己对 AGI 的目标，或者说他对当前事项优先级的理解，并不是一味追求模型性能。除了追求大模型的智能上限，他认为还有两个很重要的工作。

一是基于国产生态来做大模型。比如，他们去年 8 月更新 V3.1 之后，就采用了 UE8M0 FP8 这样一种数据压缩格式。当时在留言区，DeepSeek 自己回复说，这种数据格式是针对下一代国产芯片设计的。

2025 年 9 月底更新 DeepSeek-V3.2 时，我们还可以从技术报告里看到，当时 DeepSeek 甚至把底层的算子库从主流的 CUDA 和 Triton 换成了 TileLang。

CUDA 是英伟达提供的、最底层的、可以用来操控 GPU 的语言；Triton 是 OpenAI 早年开源的一种语言，它在 CUDA 上又抽象了一层。而 TileLang 则是一个国产开源项目，由北京大学杨智老师的团队发起。

第二个他认为很重要的方向，是原创式的创新，做一些大厂或其他创业公司可能不会去试的方向。比如，2024 年下半年，DeepSeek 就开始了 Janus 系列，这是比较早开始做统一多模态理解和生成的尝试。

我们最近访谈过的另一家公司智元动力，是一家具身智能公司。他们发布的具身模型 GO-1，底层基模就是 DeepSeek 开源的 Janus-Pro-7B。

DeepSeek 也做过 Prover 系列，探索形式化证明；还有在 2025 年连续发布的两篇 OCR 论文。OCR 其实就是把文字序列转成图片，再输入给模型。这个思路是让模型按照更接近人类看文字的方式去理解段落与层级，提升对复杂文档的理解力。

梁文锋还在 2025 年招募了一些有神经科学和脑科学背景的顾问，想探索更接近人脑的学习机制。

有接近 DeepSeek 的人士告诉我们，梁文锋觉得，在提升模型效率和性能的主线之外，需要做一些当下回报不明确的方向。因为国外那些算力更多的公司，比如 Google、OpenAI，内部肯定在试各种各样的方向。

而如果只是卷性能，靠中国其他的公司，比如千问、MiniMax、Kimi、智谱，大家也可以做得非常好。但梁文锋自己的这个目标，和外界，甚至和团队内部的部分成员，都有一定的分歧。

因为他的目标并不是简单地追求最强、卷性能、碾压，这与外界现在对 DeepSeek 的部分期待是不匹配的。一些人希望 DeepSeek 每次出手都能像 R1 那样石破天惊。说实话，这有些强人所难。

某种程度上，我觉得这也造成了 DeepSeek 团队现在的一些压力。在 DeepSeek 内部，或者说对绝大多数年轻的 AI 研究员来说，他们比较看重的事情就是：自己能持续参与业界最强的模型，在那些受关注的技术报告上署名，以及能有丰富的 GPU 资源来做他们想做的实验。

而 DeepSeek 在这两点上——持续保持最强，以及拥有充沛的算力资源——并不能满足所有人的需求。持续最强更多还是一个现象，而不是一个问题，因为它想做很多更原创的探索，这里面确实有一些方向的回报非常不确定。

前沿研究本来就应该承担这种不确定，但这对习惯了看成绩、看分数、看排行榜比拼的整个环境来说，可能有些水土不服。

### Strength Gets Harder to Measure

然后是“强”这件事的标准。在 AI 领域，本来就变得越来越模糊和主观了。比如现在，如果一个模型发布之后只去看 benchmark，其实已经看不出来这个模型到底有多强，尤其是进入 agentic 模型，也就是智能体模型的竞争之后。

很多人会发现，体感和实际的使用体验是更重要的。也许两个模型的跑分差不多，但用起来感觉就是不一样。

我觉得其中一个原因，是产品触达，以及产品触达带来的长尾使用案例和多样化数据，变得更重要了。而这恰恰是之前专注于模型研发、对产品投入比较少的 DeepSeek 相对短板的地方。

即将发布的 V4，大概率仍然会是开源模型里最强的。但现在对不同场景、不同开发者和不同用户来说，“强”的标准和体感本来就越来越多样。

同时，客观上，在去年下半年到今年如火如荼的 Agent 应用竞争中，DeepSeek 是相对缺席的。DeepSeek-V3.2 确实强化了 Agent 能力，但整个 DeepSeek 的模型迭代频次，远低于其他小厂。

从 2025 年初至今，智谱、MiniMax、Kimi 分别已经更新了 5 版、4 版和 3 版模型。像 MiniMax，从今年 1 月到现在就已经更新了 3 次：MiniMax M2.1、M2.5，还有最新的 M2.7。

智谱则直接推出了面向 OpenClaw、专门优化的模型 GLM-5-Turbo。我们可以从 OpenRouter 的数据来看看，在个人和中小开发者使用 OpenClaw，也就是“小龙虾”这类应用时，消耗了哪些底层模型。

这张图我们当时也用在了文章里，统计的是 2 月 24 日到 3 月 26 日这 30 天的 OpenClaw 模型消耗量。排在前 10 的模型里面，有 6 个都来自中国公司，而 DeepSeek-V3.2 排在第 12 位。

这里补充说明一下，发了文章之后，我获得了更具体的信息。在这个排名里，排在第一、用量远远超过其他模型的 Step-3.5-Flash，来自阶跃星辰。这个模型是免费的，所以排名非常高，当然它应该也相对比较好用。

同样，排在第五的 Trinity Large Preview，是一家美国公司 Arcee AI 发布的模型。它排得很靠前，也是因为在 Preview 阶段这个模型是免费的。

如果把这些免费的模型不算，单独排付费模型的话，DeepSeek-V3.2 在 OpenClaw 里面是排在前 10 的。

我觉得这个排名一方面说明，在 Agent 相关的模型消耗上，DeepSeek 至少在中小开发者里相对比较靠后。当然，OpenRouter 也只能做个参考，不代表每家公司完整的用量。

另一方面，它也说明 V3.2 是个挺老的模型。别的模型都已经更新了好几轮了，V3.2 以一个这么老的模型还能排在前面，你也可以侧面说 DeepSeek 挺厉害。这个事情就看你怎么理解了。

如果来比应用的话，智谱、MiniMax、Kimi、阶跃星辰等，包括字节的飞书，都做了“小龙虾”相关的应用，DeepSeek 更是没有什么这方面的投入。

前面我也提到，DeepSeek 其实有一个几十人的产品团队，但到目前为止，他们没有涉足 AI 编程、通用 Agent、OpenClaw、“小龙虾”这些热门方向。DeepSeek 在 C 端的产品，仍然是一个典型的 chatbot。

相应的变化和调整，是从 2025 年秋天开始的。梁文锋也开始更多地在公司里提要做产品化和商业化。DeepSeek 确实也会更多地投入产品，这一点从招聘信息里已经有所反映。

比如在 3 月中旬的最新招聘中，DeepSeek 第一次在招聘启事里提到了其他具体产品的名称，说是要招募 Agent 方向的模型策略产品经理，要求包括持续跟踪行业前沿，熟悉并深度使用过 Claude Code、OpenClaw、Manus 等知名 Agent。

### The Compute Constraint Tightens

然后是算力资源的问题。其实，3 年前梁文锋讲的那个比喻——买卡就像买钢琴，一是买得起，二是因为有一群要在上面弹奏音乐的人——后半句现在仍然成立，而且急于弹琴的人更多了，能弹的曲子也更多了，也就是研究方向更多了。

在语言模型的主线之外，我们可以看到世界模型、持续学习、在线学习、新的、更像人脑的学习机制等等。这些都需要算力资源去支持实验。但是，“买得起”这件事情已经在变化。

因为在全球过去几年大幅扩张的算力资源军备竞赛中，DeepSeek 并不占优势。它和全球乃至中国一些核心大公司的差距，可能是在拉大。

结合上面的多重原因，我们现在可以理解，为什么以往很难挖动的 DeepSeek 的人，有了松动的迹象：有人离开，更多人选择留下。

可以澄清一下，近期外界有一些传闻是不准确的，比如说 DeepSeek 出现成组流失的情况，这并没有发生。留下的人中，大多数认可梁文锋追求 AGI 的方式。他们想去做那些并非由于竞争驱动的探索，也比较习惯 DeepSeek 相对宽松、从容的研究氛围。

这是 DeepSeek 相对不变的部分，至少到目前为止，还没有看到明显的变化。这些不变的部分，来自梁文锋的特质。一个小型创业组织的氛围，很大程度上就是创始人特点的外溢和外化。

这些特点包括我前面提到的不加班。梁文锋确实认为，一个人一天能高质量工作和输出的时间，就是在 6 到 8 个小时左右。尤其是做 AI，如果长期疲劳，做出一些昏庸、糟糕的判断，反而会浪费宝贵的算力资源。

这个想法看着挺平常，但在全球 AI 核心公司里，不加班、少加班真的极为罕见。别说本来就以卷著称的中国公司，其实在美国，核心 AI 研究人员也常常需要高强度工作。

哪怕是在提倡给工程师 20% 自由时间的 Google，DeepMind 的核心 AI 团队也是非常忙碌的。还有以高强度工作著称的马斯克带领的 xAI，有些研究员的周工作时间甚至可以达到 80 个小时。

梁文锋自己是一个只做少数几件事、会把它做到极致、做得细致的人。比如作为公司 CEO，他以往并没有花特别多时间融资。

我们文章里也写到，2023 年的时候，他其实见过一些投资人。但当时他提出了一个类似于微软和 OpenAI 早期投资协议的方式，就是希望投资方能接受一个固定的回报上限。这对 VC 来说其实没什么道理，所以那一轮见完之后，没有人投资 DeepSeek。

2025 年 R1 爆火之后，梁文锋其实就不再见投资人了，甚至不建立新的联系，不认识新的机构。对大多数 CEO 来说，即使不在融资窗口期，也不会拒绝去认识一下一线机构的合伙人。

但我确实知道有一些合伙人，当时通过各种途径想办法和梁文锋建立联系，但他拒绝了大多数这样的请求。这并不是说梁文锋是个很自闭的人。据我所知，他跟 AI 从业者的交流还是挺多的。

所以说，梁文锋只是选择把最多时间花在他认为最重要的事情上，那就是模型研发。

在具体的技术判断上，梁文锋之前认为，语言、推理、逻辑这条线才是智能的主线。DeepSeek 其实没有花太多精力去做多模态生成，但这并不是说他们没有做多模态，因为多模态还包括多模态理解、多模态推理。

比如张博之前在 DeepSeek 做的 DeepSeek-VL，以及理解与生成的统一，比如我前面提到的 Janus。

与梁文锋的风格相应，DeepSeek 的组织是非常扁平的，而且形成了各团队之间交叉分工的状态。创立幻方的时候，梁文锋是有合伙人的，但在 DeepSeek 没有二把手，尤其是在研究团队，只有梁文锋和其他研究员两个层级。

这部分团队就像一个大型实验室，大家会习惯称梁文锋为“梁老板”。这个老板的角色更接近导师：他会组织研发、协调资源，也自己做一些具体的研究。

比如我们可以看到，梁文锋会在 DeepSeek 的一些论文里署名，会当通讯作者。他自己直接带的是基模架构团队。这个 team 有几十人，是预训练的主力。

梁文锋会和这个团队深入讨论，确定每一代基模的架构定版。然后是和基模架构合作比较密切的数据和 infra 团队，因为在定版的过程中，就需要考虑数据的选择和 infra 怎么实现。

之前在千问那期播客里也提到过，其实这种 infra、数据和基模紧密合作的方式，对研究员来说是一种最自然的方式。这也是为什么从 2025 年年终开始，林俊阳带领的千问小团队，其实想自己招一些 infra 的人，想不再依赖当时支持他们的阿里 PAI 团队。

但是这件事情在更大的公司里可能更难实现，而 DeepSeek 非常自然地就保持了这种状态。在有些公司里，infra 会像一个内部的乙方：模型团队会给它提一些要求，而且大公司里的 infra 人员可能会很多，比如有几百人也是很正常的。

然后，你作为这个几百人的、其实已经不少的团队里的成员，可能很难和算法、模型团队之间进行非常密切的交流。但在 DeepSeek，很多人都会有交叉学习的机会。

梁文锋自己就是串起这些不同模块的连接器和粘合剂。他会参加每一个团队各自的周会，去了解全局的进度和卡点。DeepSeek 大部分团队的周会也向其他组的人开放，大家可以跨组参会、讨论，所以至今 DeepSeek 依然可以做到自然分工。

有时候开始一个新的方向，就是因为有 3、5 个人都觉得一个 idea 不错。这 3、5 个人甚至可能都不是一个组的，然后他们就一起去做了。如果公司层面也觉得这个方向不错，那可能就会在小规模实验之后给到更多资源，去验证这个方向的潜力。

所以，这次在做这篇报道的过程中，有接近 DeepSeek 的人士非常发自真心地告诉我，DeepSeek 是一个真心想做研究的人，在国内甚至是全球能找到的最好的地方。

这里推荐大家去看 2025 年初晚点做的一期关于 DeepSeek 人才画像的视频，我会把链接贴在 show notes 里。哦，抱歉，这个微信的视频好像是贴不了链接的，大家可以去晚点的视频号上搜，也可以搜 DeepSeek。DeepSeek 之前的人员主要是以应届生和实习生留任为主。我们当时梳理了 DeepSeek 的 3 代模型，即 LLM、V2、V3 和 R1 的 172 名研究者，其中包括实习生，然后找到了其中 84 个人的履历，做了一些数据分析。

可以看到，在这些能找到履历的人中，超过 7 成是本科生和硕士生。其实 DeepSeek 的博士比例并没有那么高，这和当年“四小龙”，比如商汤，当年讲的“博士军团”还不太一样。

然后，超过 7 成的人年龄小于 30 岁。这也让我们想起前不久和 Dink——就是做 AI 招聘人才的那家公司——的创始人 Sam 高旦恒聊到的一个观点。他之前在达摩院做研究，在自己的博客里列举了很多 AI 成果，如数家珍地写了好几个，然后说当时做出这些成果的人年龄都小于 30 岁。

回到 DeepSeek，前面提到，DeepSeek 现在不到 200 人。在 2025 年初的时候，人更少。字节的 Seed 现在是 1,500 人，去年夏天前后的高峰期应该有 2,000 多人。

所以，在 V3 和 R1 之前，DeepSeek 其实是以大厂约 1/10 的人数、约 1/3 到 1/2 的人均工作时间，做到了全球大模型的第一梯队。

我们可以继续观察，在越来越激烈的竞争中，DeepSeek 这样的研发方式和组织氛围是否会调整。我想对研究员来说，他们想追求的是一种成就和投入的平衡。没有人想被竞争，或者被完全落后的恐惧驱策着去做研究，这种情况下大概率也做不出好的研究。

但另一方面，这群非常自驱的 AI 人才也真的希望自己能一直产出强的、厉害的、有影响力的成果。当然，每个人对“强”和“厉害”的标准，如前面所说，已经变得越来越多元了。有的人可能会更看重外部反馈，也有人会有自己内心的衡量坐标。

### Liang Wenfeng Resists the Noise

最后来说一说梁文锋这个人，准确地说，是我们从各种渠道了解到的梁文锋这个人。作为一个不到 30 岁就财富自由的人，梁文锋的生活是简单而神秘的。

他不是特别在意穿着和用度。他在杭州的时候曾长期住在酒店里，而在多数 DeepSeek 研发人员所在的北京，他现在应该是租房住。

之前和极智嘉的贾鹏那期播客里我们聊到过，在英伟达全球有几千人的时候，黄仁勋还会邀请一些员工去自己家里做客，喝酒聊天、聊家常，展示自己的跑车。

而梁文锋不怎么参与 DeepSeek 的团建活动，很少和成员聚餐。年底大团建时也只在讲话时露面，不会参与全程。

一个关于他的流传甚广的轶事是，2022 年的时候，幻方有一位员工，化名“一只平凡的小猪”，个人向慈善机构捐助了 1.38 亿元。后来很多人猜，这只小猪就是梁文锋。

幻方工作人员的回复是，员工捐款都是匿名的，公司内部也不知道“小猪”的真实身份。

接触梁文锋的人曾经评价他，是一个特别能抵抗噪音的人。我觉得最恼人的噪音，往往出现在两种情形：一种是高峰期的追捧，另一种是焦灼期的质疑。

在 2025 年 R1 爆火之后，梁文锋已经显示出了对追捧的淡然。而现在他面临的是另一种情形：在外部竞争加剧时，如何分辨噪音与信号，坚持该坚持的，改变要改变的，怎么做这个判断。

这是梁文锋和 DeepSeek 的工作。而曾被这家公司震动过的更多人，能做的很简单：卸下爽文叙事，用更多平常心去看待一家公司和技术创新。

这次了解 DeepSeek 的过程中，有一位从业者是这么评价这家公司的：“低头做事的人，也许不一定能在浮躁的市场洪流里笑到最后，但是只有更多 DeepSeek 这样的公司出现，中国科技才有从复刻到领跑的可能。”

很多人觉得 2025 年出的 R1 是一个奇迹。奇迹之所以是奇迹，就是因为它不常发生，是小概率事件。

在中国这个崇尚竞争和结果说话的环境里，敢于追求独特目标的 DeepSeek，它的存在本身就是一个令人惊喜的小概率事件，它真的不一定会发生。

最后附上我转发这篇文章到朋友圈时的想法。我当时写的是：“不用成为全村的希望，DeepSeek 就是 DeepSeek。其实每家公司最后都会是它自己。”

期待 V4 发布，但我内心也祈祷，希望 V4 能在 4 月偏中上旬发布，离五一假期远一点。拜托。本期节目就到这里，欢迎收听。如果你对今天聊的话题有观察、好奇或疑问，欢迎在评论区分享想法，这也会成为我们节目的一部分，让整个讨论更完整。你也可以把我们的节目分享给对这个话题感兴趣的朋友，欢迎推荐更多你想听的主题和嘉宾。你可以从小宇宙、苹果 Podcast 等渠道关注晚点聊 Late Talk，也欢迎关注我们的公众号晚点 Late Post，下期再见。
