苔藓之火 · · 76 min
43.「26Q2」大模型半年报:RSI,Fable,5.2,混元3,龙猫,到处都是斩杀线 - 王铁震
TL;DR
- 王铁震的期中考判断:中国模型迭代速度已经上来;在后续中国模型持续超过 GLM-5.2 的前提下,超过 Fable 只是时间问题。 GLM-5.2 在他的实战工作流里“基本把 Opus 4.8 取代了”——Fable 做任务拆解、GLM-5.2 干活。王铁震认为 Fable 没有范式变化,给足算力、语料、研究人员和时间就能做成。Raymond 转述的市场对话是:马斯克称中国模型将在 2027 年一季度达到 Fable 水平,唐杰回“不用那么久”;次日智谱股价涨了“20% 还是 30%”,创近期新高。
- 100% 的 RSI(递归自我改进)被认为很难达到:像熵增,完全自主的循环迭代会写出越来越大的屎山,复杂度最终超过模型的上下文和智能能力。 它必须持续从外界摄取低熵、很有价值的人类 input。Anthropic 文章被 Raymond 转述为称 Claude Code 里 80% 的代码由自己写;王铁震估计,其中“可能 60% 是人类直接下达的旨意”。衡量 RSI 进展的潜在指标是人类参与比例逐渐降低,但原话随后说“永远趋近 100%”,比例指向存在歧义。
- 模型的根本天花板是“模型吃进的语料,实际上是它的枷锁”。 它能把 A 领域的方法迁移到 B 领域,但创造全新的 C 领域、使用完全独立的方法,在它的训练目标看来像幻觉。人类能通过抽象把复杂系统压缩成不变量和模块,这也是 researcher taste 值钱、Recursive 大额融资成立的重要背景;当前 RSI 至少更容易推进效率边界。
- Fable 的国家安全式发布被王铁震定性为“非常好的 marketing”,而非范式上的巨大跳跃。 他用 Kimi K2.5、K2.6,在给出 hint 后找到了 Fable 宣传的 FreeBSD 漏洞。按他的猜测,差距主要在攻击型安全语料和模型尺寸,而不在范式;“开源模型的斩杀线已经上来了”,Fable 必须拉开一个身位并讲好故事。Anthropic 因此被 Raymond 比作训练了一个“黑化的爱因斯坦”。
- 开源把模型推向商品化,投资含义直接:“第一名肯定还是茅台,还是卖得贵;但第二名的白酒,就很难提价了”。 中国至少有 10 家能做模型,包括美团和小米;赛道人太多、还有免费模型,第一名也未必能长期提价。开源在一级市场起过“一百进十”的过滤作用,但“去投第八名的白酒,是有点傻的事情”。
- 中国“斩杀线到处都是”,数据孤岛则可能把行业推向“人均一个大模型”。 美团用 5 万卡国产卡集群训出 1.6T 的龙猫(LongCat)2.0,非模型厂商也在不断推高底线。由于中国各家 App 数据不打通,Raymond 担心每家大厂都做自己的模型;王铁震认为数据孤岛确实是各家必须出模型的原因之一,美国也有类似情况,xAI 收购 Cursor 与其编程数据有关。
- 混元 3 是季度的重要信号:结构相比 preview 没有变化,只换数据和训练方法就实现巨大性能飞跃。 王铁震作为局外人的合理推断是,模型结构研究主要为了降本,不一定直接提升能力;这反过来说明数据的作用可能非常大。腾讯拥有 WorkBuddy、微信、公众号等数据端口,若能合理合法使用,混元 3.5、混元 4 可能还有质的飞跃;它比 GLM-5.2 小,国内单机 8 卡即可运行。
- Raymond 的非共识:Coding 这个词用错了,“不应该叫 Coding,应该叫 Automation”。 所有模型厂转向 coding,是因为它能覆盖较高可替代时薪的工作、是许多数字任务的底座,并拥有编译和运行结果带来的天然反馈闭环。TAM 不是程序员工资,而是数字世界里一切可自动化的交互。关于 OpenAI 是否该用 600 亿美元、以自有股票换购 Cursor,王铁震认为 Sam 的动力不如拥有闲置算力的马斯克强;Raymond 则认为这笔交易主要看数据。三季度的悬念仍是:Anthropic 和 OpenAI 是否 very likely 上市、财报如何、AI 板块会否重估,以及斩杀线最终在哪里。
Digest · the substance, structured for research
1. GLM-5.2 顶掉 Opus 4.8:RSI 是让马自己给自己造鞍
- Raymond 把 RSI 列为二季度关键词,并提到 Recursive 大额融资、田渊栋以 co-founder 加入,以及 Raymond 转述的 Anthropic RSI 文章。王铁震开场交底:过去三个月对他震撼最大的是 GLM-5.2 发布,"在实战场景,它基本把 Opus 4.8 取代了"。他的工作流已接近自我进化:Fable 做分工拆解、派活给 GLM-5.2。Opus 4.8 "像公司里很资深的员工,总跟我讨价还价……是个会顶嘴的员工";GLM-5.2 稍不如 Fable 聪明,"但非常努力认真用功,能一鼓作气把事情做完"。
- RSI 与 AutoResearch 的区分,用编译器"自举"讲透:C 编译器第一版由更早语言写出,之后自己编译自己。AutoResearch 是"我优化别的东西",尝试本身没被优化;RSI 是"我优化我自己——在 AutoResearch 的基础上把自己串起来,变成一个环"。
- 对 Anthropic 文章中"Claude Code 里 80% 的代码由 Claude Code 自己写"及其监管担忧的拆解,应区分两层:纯手写代码与机器代码的比例,以及机器代码背后是否仍由人类 prompt 直接下达旨意。王铁震估计,80% 的机器代码里"可能 60% 是人类直接下达的旨意"。软件工程会从白盒变灰盒、黑盒,但他"倒没那么悲观":就像人类从写汇编换到高级语言,未来人写的是更高级的"代码"——prompt、设计、business 逻辑。
2. 100% 的 RSI 达不到:这是个熵的问题
- 王铁震认为 100% RSI 很难达到。他的物理直觉是:让一个东西完全自主、无外界信息地循环迭代有瓶颈,"它写的屎山会越来越大,直到复杂度远远超过模型的上下文处理能力和智能本身,然后越来越差。它必须在过程中不停从外界摄取低熵的信息、非常有价值的人类 input"。
- 衡量 RSI 进展的潜在指标被他说成是人类参与比例逐渐降低,但原话又说该比例"永远趋近 100%,但很难达到";比例的指向存在歧义,未作额外解释。
- 他自己的 RSI 实验链路值得留档:让 GLM-5.2 从生成自己专用的 Harness 开始——"让马自己给自己造鞍",先用"大马加大鞍"(Fable 加 Claude Code)给小马造小鞍;再做 GLM-5.2 自己的推理引擎(已经能跑,只是慢);下一步从 LoRA 开始做训练。"这条链跑通,我的 RSI 链路就通了"——现在目标只是自举,之后才是提升某项性能。
3. 许愿式编程是刮彩票,抽象和语料都是模型的约束
- 王铁震的路径自述:从补一个函数,一路走到"许愿式开发",然后发现"这项目跟我完全没关系了……我花了很多精力,其实只是在按 Next、Next、Yes"。他给出的 metrics 是"它一口气能做对的项目的 size":两万行原型没问题,但往上加新东西时"它会把原型的代码改得六亲不认"。解法是人定抽象、锁死模块边界,只允许它改指定的 ABC 三个模块。
- 背后的差异是:模型更像把世界平均地记进权重,人类则能从大量现象中抽象出不变量和模块。王铁震举例,人类能从地球上大量事件中抽象出牛顿第二定律,也能把 30 万行、100 万行代码压缩成几个衔接良好的模块;他能做的就是把好的抽象告诉模型,让模型照着实现。
- 许愿式编程何时成立?"当你对结果有期盼、但对可复制性和稳定输出没有期待的时候……这就是刮彩票"——线上出现 10 亿资金缺口时,"你不可能瞬间刮一张彩票出来"。
- 实验中发现:语料里见过一次的事模型能做(写 CUDA kernel 没问题),但"让它优化一个目标,它就在那绕、绕、绕不出来"。创造没人知道对不对的东西,"在它的训练看来,是一个幻觉"。Raymond 的接话是,任何科学发明当时看都像幻觉,"过去 20 年,大家也都认为马斯克有幻觉";模型面对回收火箭,可能会从现存语料中列出"137 种原因做不到"。
- 由此引出智能的网络效应:"我们都知道 Anthropic 在蒸馏我们所有人"——新版本解决老问题,智能不是凭空从模型本身来的,而是"地球另一端的一些人探索出了新路径,恰巧被蒸馏进去而已"。所以"古法手作还是非常有价值的——不然我们就被锁死了"。
4. 智能无处不在的代价:"卖的不就是我自己"
- 对 OpenAI Record and Replay(录屏学习你的工作再复刻)的定性:王铁震认为这是必然方向。未来做产品只有两件事——以最高效的方式收集人类智能交互数据,以及把智能尽快下发到每个场景,"抢占你每一块需要动脑的碎片"。
- 下发路径也在扩张:Claude Code、Codex 从 TUI(命令行界面)起家,之后要做 App,因为 App 用户更多;Anthropic 还有快捷键呼出提问框的功能,能在屏幕任何地方随时提问。更进一步,应用可能随时弹出用户感兴趣的信息、过去做过的事和下一步提示。
- 隐私提醒带着刺:ChatGPT 企业版默认不拿数据训练,订阅版默认加入训练、需要用户反选,"想想为什么这两个的价格差一百倍——卖的不就是我自己"。王铁震的建议是"能用开源就用开源",但他也认为生活在社会中无法完全避免这种数据收集。
5. Fable 发布是国家安全大戏:Anthropic 训练了黑化的爱因斯坦
- 王铁震对 Fable 发布的定性只有一句:"非常好的 marketing","国家安全是个筐,什么都可以往里装"。Raymond 则补充,他最初曾把 Fable 假设为国家安全级别的能力,因其主打能发现大量 0-day 漏洞;首批可信任用户据 Raymond 记忆大多是金融机构,五角大楼是否在其中他不记得。
- 王铁震的实证是:拿 Kimi K2.5、K2.6 去挖 Fable 提到的漏洞,比如 FreeBSD 漏洞,给出 hint 后"能找到一样的问题"。他猜差距主要在两处——开源模型没有被攻击型安全语料训练过,以及模型尺寸仍有差距:开源模型在 1T 规模时,几个月前已经能做到"告诉它哪个文件,它能找到问题";如果 MiniMax 做到 2T、3T,或许只需更少 hint 就能直接找到问题。
- 结论是范式没有本质差距,但"开源模型的斩杀线已经上来了",Fable 必须拉开开源模型一个身位并讲好故事,否则开源更便宜且有其他优势。Raymond 进一步追问:自称最高道德标准的人反而汇集恶人语料;王铁震确认,Dario 相当于"训练了一个黑化的爱因斯坦",并把这归为"没有事,创造事也要搞事"的思潮。Raymond 的心态也从刚发布时的焦虑变成"这也不是不能做"。
6. 马斯克的六到九个月赌局,与茅台之外的白酒
- Q2 最大的瓜:马斯克称中国模型将在 2027 年第一季度达到 Fable 水平,唐杰接话"不用那么久",马斯克回应"不是刷榜的"——useful intelligence 的唯一标准是收入。Raymond 将 2027 年一季度解读为距当时六到九个月;次日智谱股价涨了"20% 还是 30%",创近期新高,Raymond 自曝已经买了中国模型股票。
- 王铁震修正上期判断:原以为中国模型迭代速度可能比美国慢,"但你看这几个月,不是这样"。原因不清楚,可能是中国在 Infra 上投入很多,也可能是模型结构更高效;如果迭代速度确实上来,且每个将发布的中国模型都要超过 GLM-5.2——"没有它好,可能就发不出来了"——那么超过 Fable 只是时间问题。
- 谁下桌的问题他拒绝给出硬答案:"很难说下桌"。Meta 的新模型号称接近 5.5,xAI 收购 Cursor 后也重新跑起来,"好像所有人隔几个月都能翻盘"。开源的意义在于"开源的进步,是所有人的进步":没有开源,2023 年百模大战里的套壳智能全不透明,根本没法投;开源起了"一百进十"的过滤作用。王铁震称中国至少有 10 家能做模型,包括美团和小米。
- Raymond 的投资人式泼冷水是桌上人太多:Anthropic 二季度还是断档式领先,"要什么价格、什么估值都可以",但现在好像不是了。王铁震的收束是:开源让模型变成供应链商品,"第一名肯定还是茅台,还是卖得贵;但第二名的白酒,就很难提价了。这不是坏事……只是去投第八名的白酒,是有点傻的事情"。
7. 龙猫、混元 3 与数据孤岛:可能人均一个大模型
- 美团龙猫 2.0:1.6T、5 万卡国产卡集群、完全没有 N 卡训出来——比蚂蚁百灵的混合卡尝试更进一步,王铁震认为这是"非常大的突破"。训练远难于推理:GPU 速度、GPU 间通讯、算术精度稳定性和软件适配都是硬仗。模型本身也优化得不错,运行很快。
- Raymond 的引申是"中国的斩杀线到处都是":美团这个非模型厂商的副业做到这种程度,就不会随便买别人的 API;加上中国各家 App 数据完全不打通,点评甚至回答不了"商场 300 米内最安静的咖啡店"这类问题,他担心行业可能走向每家大厂都做自己的模型、"人均一个大模型"。王铁震补充,美国也有类似情况:Cursor 用户亲手摸过的编程数据非常值钱,"xAI 为什么要买它?我觉得跟数据离不开关系"。
- 混元 3 是给被套腾讯股东的重点段落:模型结构相比二、三月份的 preview 没有变化,使用经典架构,只换数据和训练方法,"却实现了巨大的性能飞跃"。王铁震明确这是作为局外人的合理推断:"大家研究模型结构,主要是为了降本,而不是提升性能";反过来说明数据的作用可能非常大。
- 腾讯的弹药包括 WorkBuddy、微信和公众号数据。Raymond 说"我在腾讯面前没有什么秘密";若公众号数据能被混元合理使用,"混元 3.5、混元 4 可能还有更大的质的飞跃"。混元 3 的结构比 GLM-5.2 小,国内单机 8 卡即可运行。
- Raymond 引用《晚点》的独家深度报道:腾讯过去一年给混元很大的组织空间;姚顺雨不追求奇技淫巧、不做架构创新、不刷榜,而是"先扎马步,扎六个月,这才是大智慧"。数据是活的,程序员写复杂任务、给反馈、自己修 bug 是很贵的数据,"我跟我妈聊天,就不太值钱"。王铁震补充,数据必须合理、合法地使用,在保护隐私的同时利用群体智慧是重要问题。MiniMax 的 2.7T 顺带一句:能发出来就说明模型不错,和友商差距太远会伤品牌。
8. Coding 是个用错的词:它讲的是 Automation
- 所有模型厂转向 coding 的逻辑,王铁震说得干脆:它能覆盖较高可替代时薪的工作(谷歌工程师年薪可能三四十万美元、30% 到 40% 的工作可能被取代);代码是许多任务的底座;且"写代码还天然有数据闭环"——编译、运行结果及与预期的差距都能反馈回来,role-play 模型拿不到这么好的数据。
- Raymond 认为这在 2026 年 7 月仍是非共识:"这个词用错了,不应该叫 Coding,应该叫 Automation。" 投资人按程序员人数计算 TAM 是误解——会计师的 Excel、设计师的前端,最后都是 Coding 的实现;公司起名"叫 Buddy 没问题,前面不能有 Code"。两人畅想词义演进:"也许我儿子长大后,他理解的 Code 就是说段话、许个愿"——阿拉丁神灯,make a wish。
- 关于 OpenAI 是否该用 600 亿美元、以自己的股票换购 Cursor 的脑洞,王铁震认为 Sam 的动力没有马斯克强:xAI 曾有闲置算力,马斯克更需要一个有数据、有产品的公司,而且"马斯克是非常有想象力的人"。Raymond 承认当时没看懂这笔交易:Claude Code 已存在、Cursor 又推出 Composer,此时还买,"看的就完完全全是数据了"。
- 收尾全是三季度的开放题,Raymond 一连串"不知道":Anthropic 还能不能交出更惊艳的答卷;他判断三季度“very likely” Anthropic 和 OpenAI 会上市;财报长什么样、上市表现如何、会不会带来 AI 板块重估、中国是否还有更多厂商发模型,以及斩杀线最终在哪里,"这些,都是三季度的问题"。
Verification Notes
- RSI 指标处原文同时出现“人类参与比例逐渐降低”与“永远趋近 100%”;该比例的指向有歧义,已保留原话而未擅自校正。