十字路口Crossing · · 38 min
对话 MiniMax 闫俊杰:M3、10X 计划、10T 模型、和智能的终局
TL;DR
- 闫俊杰衡量进步的一个客观指标是——token 消耗量:M2 顶着内部质疑只做 coding editing、不管当时大家最关心的 Arena 等对话场景,上线时定的满意线是一天 1 万亿 token,到 2.7 版本约一天 10 万亿,"目标超了十倍";M3 的目标是让用户不需要关心成本地无限使用,"我觉得我们在非常接近这个事儿"。
- 通往 10T 模型"实际上没有特别的卡点,它的卡点就是需要时间,需要积累":scaling law 外推放大十倍就失效、"你去训模型就是开盲盒",所以只能一代一代做——中美约十倍模型规模差=两代差距,路线是先把 3T 真正做好、再上 10T;而 10T 需要约 200T 数据,"但全世界没有这么多数据"。他自评 MiniMax 过去几个月是国内进步最快的那一个,"坦白说比较忐忑,但我觉得我们应该是能到"。
- 模型与 Agent 共同进步而非互斥:没有 Cloud Code(音),Anthropic 的模型可能不会这么火;"有了 GPT-5.5,Codex 才真正起来"。去年此时他也无法预测今天的格局,"AI 行业一年经历的事,可能等价于其他行业好几年"——明年会怎样现在可能无法预测。
- 全场最一致的告警是生产与验证的剪刀差:MiniMax 内部发言者转述阿里的场景——一个人一次给十几个仓库提一个巨大的 PR,"看起来是对,但没有人敢上线";项目崩溃线从 Claude 4 之前的几千行抬到今天十几万行,但"它终究会崩溃",出路是"在验证上投入接近生产的能力,否则这个项目就会死"。
- 数据护城河的下一步是从标注转向领域专家带路:coding 已验证开发工程师比算法同学更懂"什么叫好的 coding",角色公式从 researcher+engineer 扩成三角色;对标 Anthropic 连核物理学家(测越狱能否造核武)都招,MiniMax 接下来在网络安全、金融、法律的深度"会比现在深很多"。
- 企业侧 token 成本正在变成管理指标:嘉媛团队每个人每月可能有数千美元消耗,解法是用系统聚合模型——M3 专职 coding,用疑似 Opus 的模型或 GPT 做 review 和 mentor,"让不同的工作由不同的模型来完成"。
- 终局命题:AI 本质是黑盒,现有数学工具连三层以上神经网络的收敛性都无法分析;闫俊杰最关心"什么时候 AI 能够帮助人类来理解 AI"——只有那时 AI 安全、AI 能走多久才可能有答案。信号已现:大脑与神经网络强相关,海马体的记忆机制与 transformer 很像,"AI 本身的可解释性也得靠 AI 帮助 AI 自己"。
Digest · the substance, structured for research
1. Token 消耗是客观标尺:M2 超了自己目标十倍
- 闫俊杰复盘 M1 到 M3,给出一个客观指标:token 消耗量。M1 消耗"客观来说比较低",因为"那个模型其实最终的效果不太好"——但"瘫坐在椅子上、后背发凉"的时刻恰恰发生在 M1:去年五一假期第一次跑通"刷题","第一次感受到这个东西了,但那个模型其实没有怎么做成功"。
- 到 M2(去年下半年),全行业发布都在讲 Arena,MiniMax 却决定只做 coding 的 editing、不管对话场景——"这个决定其实让我们内部有很多的质疑"。结果:上线时的满意线是一天 1 万亿 token,到 2.7 时约一天 10 万亿,"基本上就是相当于我目标就超了十倍"。
- M3 定了更大的目标、"还没有完全实现":让用户不需要关心成本、无限制地使用(口播"三十元的模型和二十元的模型");叠加行业大盘增长,"总量能到一个非常可观的量级——我觉得我们在非常接近这个事儿"。M2 想做的多模态和"编程主力模型"都没实现,意外收获是 agent 生态起来后找到了市场。
2. 10T 没有卡点,只有两代的积累;中美差距=十倍模型规模=两代
- 通往 10T 的障碍是什么?"它实际上没有特别的卡点,它的卡点就是需要时间,需要积累"——AI 已经像半导体一样是一个产业,"没有一个什么障碍让一个事实现不了"。
- 为什么不能跳级:scaling law 的外推只能撑几倍,模型放大十倍后"很多外推实际上是失效了……那你去训模型就是一个开盲盒"。他给的坐标系:美国模型比中国模型基本大十倍,十倍意味着两代;国内每家都要再升两代——"第一代把 3T 的模型先真正能做好,第二代基于这个积累的经验再做 10T 的"。
- 系统性约束:数据量约为参数×20,10T 模型需要 200T 数据,"但全世界没有这么多数据";且越大的模型越容易拟合噪声,数据质量要求同步抬升。工程上 M3 计算量已压低但 KV Cache 偏大,"下版我会进一步压它的 KV Cache,让它的推理会更好"。
- 全场掌声的"进步速度最快",Koji 追问 benchmark 是什么——答:当前智能水平与三个月或六个月前之比,"我们这个应该是其中最多的"。落点是一句罕见的坦白:"坦白说比较忐忑吧,但是我觉得我们应该是能到。"
3. 模型与 Agent 共同进步,明年难预测
- 被问未来是只剩基模还是仍有 Agent,闫俊杰先认怂:去年这个时候还在做 M1、Cloud Code(音)用户还非常少,"按照这个道理,明年会怎么样,现在可能我们也没法预测——AI 行业一年经历的事,可能等价于其他行业好几年"。
- 共生论是核心:"如果没有 Cloud Code(音),Anthropic 的模型可能也不会这么火;一开始 OpenAI 没有做出来 GPT-5.5 的时候,Codex 其实也做不起来——有了 GPT-5.5,Codex 才真正起来。"模型和 harness 都是"实现更高智能的手段",前提是"智能最终应该还是给人类来服务"。
- Koji 引 Alan Kay 收束:"预测未来最好的办法是去创造。"
4. 用系统聚合模型:M3 当 coding 手,疑似 Opus/GPT 当 mentor
- 嘉媛(三万星开源项目 Multica 作者)算了笔账:每个人好几个 Cloud Code(音)账号加 Code X 加 Cursor,"可能有个几千美金每个月的 token 消耗,成本是非常高的"。解法是把 GitHub issue、customer support 这类可 pipeline 化的场景交给系统,用不同模型的聚合弥补单一模型的不足。
- 具体分工:M3"有时候会比较啰嗦,thinking 时间比较长,结果里不一定所有的点都是正确的"——那就让疑似 Opus 的模型或 GPT 做 review、当它的 mentor,M3 专职 coding。实践结论是能在 token 消耗与产出效果间取得平衡:"未来整个公司的 token cost 肯定是你需要考虑的目标,你需要考虑怎么让不同的工作由不同的模型来完成。"
5. Dear Flow:从"把奸商打下来"到 1k contributor 的全球社区
- 何涛第一次公开回答"为什么火":"Go viral 这件事,可能就是上帝握着你的手写下一行代码……X 上面有人帮你转了它就火。"真正的初衷在 25 年:deep research 太贵,"你首先需要有一个两百刀的 ChatGPT Pro 订阅才能用几次——奸商,开源必须得把你打下来,而且我们还要用中国的模型给你打个样,连生图都要用中国的模型"。
- 产品哲学是完成桌面工作者的所有工作——报告、图表、播客、动画片、音乐:"多模态是一个非常有魅力的事情,每个人的日常工作就是一个多模态的工作",这也是 Day 0 就接入 MiniMax 开放平台的原因;"有可能一开始是残缺的、会被喷的,那我们要接受被人喷"。
- 第二身份是社区:1k 以上 contributor,"覆盖了除了北极、南极以外的其他所有陆地地区",常有人用看不懂的语言提 issue;如何用 agent 管理开源项目成了新课题,自家代码也被 complain 是"屎山"。Koji 补充:这是所有成功开源项目都会头疼的事情,最近 Open Cloud、Nano Boat(音)都表达"不得不这么做,再不这么做的话就受不了了"。
6. 没人说 web engineering:写代码从来是工程,不是魔法棒
- 嘉媛的历史观:web coding 不新鲜——第一代 web coding 用户是产品经理,只不过他们驱动的是程序员;如今人人都是 PM,而好 PM 的标准从来不是做了多少事,是"要不要不去做一件事情"的决策标准。《代码大全》几十年研究的就是别让项目变屎山;开源侧的解法是维护者定义 roadmap 和品味,并与外部 contributor 对齐 context。
- 何涛的暴论:"从来没有人说 web engineering,但是写代码从来都是一个 engineering 工作。"现在的 bench(SWE-bench 一类)都是一次性解题,模型在 coding 任务上"使命必达",最后却"接着他做根本做不了"——应该把长程维护一个 codebase 的 taste 放进模型,"这是对模型的一个要求"。
- 对人的警告:这代模型"太有魅力、太有诱惑力",会让人把它当作魔法棒;它总以讨巧的方式认错——"有可能其实你就是有偏,人家可能是对的"。他把 Clean Code 等"先哲"的东西蒸馏成 skill 配合 agent,并且"特别讨厌一个人说'这个东西是 agent 做的所以你不要怪我'——只要是拿你的账号提交的,背后表达是你的责任心,还有你对待这个世界的态度"。
- 收束在 mindset:就像当年以为"有电了之后什么事情都能解决",要把 AI 当新工具而非魔法棒,"从这个 mindset 上的转变才能慢慢的去根治一些问题"。
7. MiniMax 内部的告警:生产暴涨、验证缺位——"没有人敢上线"
- MiniMax 内部一位发言者被点名。他去阿里分享听到的真实场景:过去一个人只能改一个仓库,现在"一个人啪一下十几个仓库提了一个巨大的(PR),看起来是对,但没有人敢上线"——功能实现快了好多,验证没跟上。
- 他自己的轨迹:早年带团队每行代码都 review、"必须足够简洁、结构足够清晰,非常有强迫症",后来退到只 review 架构,今天在 Web coding 里连这层都缺失。判断:"我们应该在验证上面投入,甚至和研发生产接近的这样的能力……否则这个项目就会死。"
- 量级坐标:Claude 4、GPT-4.5(音)出来之前,一个项目几千行代码就崩溃;今天可以到十几万行,"但它终究会崩溃"——context 有限,而且"人类的直觉还是有点难替代"。MiniMax 自己就在用 Web coding 开发 post-training 系统(从 issue 一个阶段一个阶段走),解法是测试、benchmark,再给项目立 principles:"什么东西做、什么东西不做,这点还要拉红线——因为人真的看不过来。"
8. 从数据标注到专家带路:第三个角色进场
- 闫俊杰的推演:AI 的核心是生产力,模型像汽车一样只是工具,"它的实质还是那个行业里面本身的真实的问题"——光靠模型或 researcher 做不到。coding 时期已经验证:开发工程师显然比算法同学更理解什么叫好的 coding,评测、归类、强化学习环境的构造都是真正的软件工程师做得更好。
- 于是角色公式升级:以前只需 researcher 加 engineer 两个角色,进入更多领域"就需要三个角色"——再加真正的领域专家。"既然我们把两个角色合作给走通了,那我们现在就再加一个角色。"
- 第二个触动来自研究 Anthropic 怎么招人:大量非 researcher/engineer——经济学家、心理学家、哲学家,"甚至还有核物理学家,因为每次做对齐都会测试越狱的时候这个东西能不能用来制作核武器"。半年前还不理解为什么,"我们现在对这事的理解其实已经非常深";10T 项目已吸引到这类人,接下来在网络安全、金融、法律等领域"做的深度应该会比现在深很多"。
9. 金融垂类:用户只会问"帮我选几只个股"
- 于洋(上市金融公司技术负责人)的用户洞察:大多数用户"根本不知道他今天打开应用想干什么",收到最多的问题永远是"帮我选几只个股";同行的通病是罗列一堆信息,"然后就没有然后了"。AI 该做的第一步是筛选信息,第二是降门槛——"告诉你这个数字为什么是这样子,这个东西对于你的影响是什么样子"。
- Koji 追问用不用 AI 炒股:合规上不能直接炒,但对用户的输出不带投资建议、内部版本有,且有真实回测胜率数据支撑——"于我个人而言,我对我们东西是无比有自信的"。
- 那为什么不辞职 all-in 炒股?炒股不是文字推理:"信息要对、画像要对、分析的状态要对",且全部实时变化——"很有可能市场下一步,比如 OpenAI 就直接拿出来 IPO 了"。预测可能性重要,但"当这个东西真的发生了以后你要怎么做,比我告诉你这个会怎么发展要重要得多"。
10. 终局:AI 帮助人类理解 AI——以及一个关于头发的温暖样本
- 全场拒绝荐股。张嘉源说两位嘉宾已经透露很多,推荐的个股大家应该都懂了。于洋的下半年是两件事:陪伴——"一定有赚了钱的时候,你就一定有亏钱的时候",以及从"限制模型发挥"转向"引领模型做创造性的事情"。
- 张嘉源写专栏《How AI Shapes Our Society》,直观感受是 AI 在让很多人内耗焦虑,但国产模型在 26 年"跨过了某一个基点,具备了走进千家万户的机会"。他的样本:太太因掉发焦虑,问国内 DAU 最大的某 Chatbot 反而掉得更多;他用 Code X 把她全部体检报告、用药记录、聊天记录导进一个个人专属的 LLM“微体”、接进飞书——"以后你不要用那个 Chatbot,相信你老公"——此后她与医生的沟通更顺畅。落点:"从冰冷的软件工程里面,最后能发现出来一种人类社会的温暖。"
- 何涛自认 AI 降临派:"你未来已经不是在和人去竞争,而是在和 agent 去竞争",你的智能没办法与 AI 抗衡;但他的对策是拒绝把思考外包——"我会把思考这个最重要的部分都交给我自己"。
- 闫俊杰压轴:AI 本质是黑盒,从业者也不知道一年后会怎样,"为什么会有 scaling law……单纯靠人类也很难理解"——十年前读博时就见过论文,超过三层的神经网络用现有数学工具无法分析收敛性。他最关心的事:"什么时候 AI 能够帮助人类来理解 AI——只有这样,AI 的安全问题、AI 到底能够走多久,才可能有一个答案。"信号已现:生命科学发现大脑与神经网络强相关——大脑不算矩阵乘但有近似矩阵的模块、几乎等价于梯度反向传播的机制,海马体的记忆与 transformer、DeepSeek 被提到的记忆机制很像。"AI 本身的可解释性,也得需要靠 AI 一起帮助 AI 自己。"