[BidClub_]
硅谷101 · · 67 min

E246|何谓蒸馏?聊聊硅谷如何看中国开放模型逼近前沿

Yiwen王铁震Keith Zhai

YouTube
TL;DR
  • 开源已经追平最强闭源。铁震复盘:DeepSeek V1 之后一年其实是"狼来了的故事"——闭源月更、开源季更,Opus 4.6、4.7、4.8 远远领先;转折先是一款名称存疑的 GM 5.2 模型(他已用它"完全取代了 Opus 4.8 的一些功能"),再是 Kimi K3——"不是跟 Opus 评级的问题,它基本上已经追上了 Fable,甚至在某些场景上要比 Fable 做的还好"。"闭源模型瞬间就发现自己没有一个护城河了",而 MiniMax、千问的 2-3T 模型和智谱还在路上。
  • 蒸馏指控技术上站不住。闭源模型不暴露 logits 也不暴露思维链,经典蒸馏根本做不到;Fable 5 七月初上线、K3 十五天后发布,"连模型发布的准备都来不及,何谈收集到足够多的语料"。Kis 把主张拆成三层:违反服务条款、系统化 API 抓取、窃取权重——证据倾向"可能存在未授权的大规模数据抓取",但不等于核心能力来自蒸馏;蒸馏只能到及格线,"K3 已经远远超过及格线",只盯蒸馏是"只见树木不见森林"。
  • 开源便宜是结构性的,不是补贴出来的:闭源 API 内含模型溢价,Fireworks、Together AI 只收硬件加推理服务的钱;K3 比 K2 大一倍多但 scaling efficiency 扩大 2.5 倍(KDA 等 linear attention 技术,"主要都是由华人 researcher 主导");传言 Fable 本体 8-10T,K3 不到 3T 打出同等效果。叠加 infra 优化,"未来三年同样的智能成本又下降一千倍"。
  • K3 license 是开源货币化的新模板:Model-as-a-Service 厂商十二个月收入超两千万美元须与月之暗面另签协议,配 Vendor Verification 认证。铁震的判断——"赚钱的开源模型才是好的开源模型"(Stability 之死为鉴),且云厂应欢迎交钱换官方认证;若走通"这就是无本万利,你只要把模型做好,大家都直接给你上供"。Kis 提醒执行端"有很多很多的灰色地带"。
  • 闭源估值体系承压,恰逢 IPO 之年。"今年 OpenAI 和 Anthropic 都要上市"——垄断智能曾"比垄断任何商品威力要恐怖的多"、天然值万亿市值,但智能变成流通商品后,margin、scaling law 无限投钱的故事"这个饼就没有那么容易画得圆"。价格战苗头已现:neocloud 拿开源模型互相卷价,ChatGPT 开始发券,Anthropic 封号"没有那么疯狂"了,"最后都会反映到他们的财报上"。
  • 阵营已按商业结构分裂:七月二十四日《开放权重和美国AI领导力》公开信从 25 家发酵到约 75 家,是黄仁勋加入 X 后第一条推文,Anthropic 拒签、Dario 另发文。卖铲子的(NVIDIA,CUDA 护城河本就是开源生态筑成)、有分发的(Meta、阿里)都能拥抱开源,纯卖 API 的 OpenAI、Anthropic 利益"完全不会对齐"。Agent 应用层同步遭挤压——VC 朋友的反直觉标准:"估值越高,我们反而会越愿意投"。
  • 安全叙事被反转:K3 在网络攻防测试 Exploit Bench 只得百分之三十几(frontier models 在 75 以上);Hugging Face 被 OpenAI 测试智能体攻击后,闭源模型拒绝帮它分析攻击语料,只有开源模型可用——"为什么我们能够让他们又做运动员又做裁判?"监管应过滤训练语料而非用户行为,而闭源随时可被政策断供,"不管怎么看,没有开源反而是这个时代最不安全的事情"。
Digest · the substance, structured for research

1. K3 震动硅谷:狼来了的故事终于成真

  • Kis 把时间轴拉开:年初人人喊着赶快上 AI,很快 Uber 等公司开始晒账单——"一个月花了一年的预算";随后智谱 Z.ai 与中国模型引发新讨论(包括 Cursor 用了中国模型),而 K3 作为开源模型达到了"在很多人看来很新的一个高度",讨论已从要不要用,变成"在使用的情况下具体应该怎么样的做调整"。
  • 铁震的复盘更冷峻:DeepSeek V1 曾让纳斯达克大跌、全行业反思,"结果过了一年,大家发现是一个狼来了的故事"——闭源月更、开源季更,Opus 4.6、4.7、4.8 远远领先;一款名称存疑的 GM 5.2 模型出来时他已重度使用、取代了 Opus 4.8 的部分功能,但市场不慌:"只要闭源领先超过一个时代,那没有太多可以担心的。"
  • 直到 K3:"它不是跟 Opus 评级的问题,基本上已经追上了 Fable,甚至在某些场景上要比 Fable 做的还好"——"闭源模型瞬间就发现自己没有一个护城河了",AI 估值泡沫、生态运转模式全被重新提问。
  • 由此引爆两个争议:接近 Fable 能力的模型开放权重安不安全;以及"你一定是在蒸馏我的模型"——毕竟 Fable 5 与 K3 只隔约十五天。后面还有 MiniMax、千问的 2T-3T 模型和智谱的动作,"这个行业变化非常快"。

2. Coding 引爆账单:从 token maxing 到 token optimization

  • Kis 的成本观察:cost 只有上了很大量才显著,而引爆点是 coding——去年九月前后 Anthropic 大规模推动后,RAG 时代的 token 消耗完全无法与之相比。TinyFish "才五十多个人,一个月整个消费大概是六位数左右的美金",而全行业从"赶快去用"到"花了太多钱了"的转向"几乎就是在一个月之内发生的"——"整个 AI 行业有点像是天上一日,人间一年。"
  • 且问题不止成本,还有所有权:"突然有一天美国商务部说这个不可以用了,那就一夜之间都不可以用了,之前做的部署可能什么都没有了。"埃森哲的内部调研是另一记清醒剂:员工用模型做得最多的事是生成 PDF——"这个东西你不需要用最新模型去做的。"

3. 开源推理便宜是结构性的

  • 铁震拆出三个原因。其一,闭源 API 定价里含着为模型本身付的 premium;而 Fireworks、Together AI 只有硬件成本加推理服务利润,"并没有为模型额外的付钱"。其二,中国开源一直在卷 scaling efficiency:K3 技术报告显示,模型比 K2 大了一倍还多,scaling efficiency 反而扩大了 2.5 倍,靠 KDA 等架构演进实现"更大且更 efficient"。
  • linear attention(KDA、RWKV 等)这个"目前最火的能让大模型更便宜的技术领域,主要都是由华人 researcher 主导的"——"因为他出生在一个算力受限的国家,天然第一天就很关注训练和推理是不是都可以变得非常高效。"
  • 其三是尺寸:网传 Fable 本体 8 到 10T,K3 不到 3T——"三 T 的模型可以跟十 T 左右的模型达到同样的效果",推理成本天差地别。但架构演进带来大量工程适配的苦活,"还是要给中国工程专家们打 call"。

4. 蒸馏科普:一个被用烂的中性词

  • 铁震正本清源:技术意义的蒸馏是让小模型学大模型每个 token 的 logits 概率分布;闭源模型只给你采样出的词,"你是没有办法反推回来它的分布的"——经典意义的蒸馏对闭源模型根本做不到。现在大家说的"蒸馏",其实是拿闭源模型生成的文本去训练。
  • 而这件事本身"非常 controversial":"闭源模型可以拿所有人类的数据去学习,学完的东西不能被别人用来做下一个模型,这不是很可笑吗?相当于闭源模型练了一个宝典,把所有语料都扔掉,不告诉你在哪学的,也不允许开源模型拿他的输出去训练。"好比读了一本书写了创作,却禁止所有人读——版权法能否保护模型输出,悬而未决。
  • 对照之下开源极其开放:R1 发布时直接宣布支持所有人蒸馏,官方放出数据集、开放 logits;Kimi 的 license 也没限制输出被用于竞争模型。
  • 至于开源模型自称"我是 Claude"——那是数据污染不是蒸馏:Opus 4.7 拿掉 system prompt 用中文问"你是谁","他会说自己是千问"。各模型输出已大量存在于互联网,预训练学出身份错乱,只能靠 system prompt 和微调缓解,"这个问题肯定没有办法完全得到解决"。

5. 为什么 K3 蒸不了 Fable 5

  • 时间线不允许:蒸馏是训练过程,经典训练要三个月;Fable 5 七月初("一号还是二号")上线,K3 十五天后发布——"你十多天连模型发布的准备都来不及,何谈收集到足够多的语料然后蒸馏。"
  • 更根本的是方向不对称:闭源不暴露 logits、不暴露思维链,只给最终结果——"如果说我们看到一个人做事情的结果,就能学会他内心怎么想的话,那我们人类社会互相学习也太容易了。"反过来"闭源模型蒸馏开源模型是非常非常容易的",因为开源把一切都暴露了。

6. 指控背后:商业战略与"自我强化的预言"

  • 铁震判断,抛出蒸馏概念的"不见得是技术圈的人",更多是商业目的、给市场"预先的植入"——开源没那么好,都是蒸出来的。而闭源厂借蒸馏之名关掉几万个账号,"本质上就说明他们实际上在看所有用户的数据"。
  • 他的比方值得记住:"整个这个事情有点像是国家安全的自我强化的预言——你总要有一个靶子照着打,说不定能搂草打兔子。"
  • Kis 把混在一起的主张拆成三层:违反模型服务条款、规模化系统化调用对方 API 提取训练信号、直接窃取权重和商业机密。证据多围绕前两层(大规模自动化请求可被检测系统抓到);而"K3 靠蒸馏 Fable 5 拿到的"这类指控"证据非常薄弱"。他的结论:"可能会存在一些没有授权的大规模数据抓取行为,但并不代表能得出 Kimi 三的核心能力来自于蒸馏,尤其是蒸馏 Fable——这两个是不同的事情。"

7. 蒸馏够到及格线,够不到上限

  • 铁震纠正两个误解:蒸馏是标准技术,"所有的公司,包括 OpenAI 啊、Google 啊,大家其实都在用大模型蒸馏各种小模型";而把模型能力完全归结于蒸馏更是错的——"如果这么简单的话,那所有人就随便就训练出来一个模型了",强化学习、数据工程、架构创新才是复杂问题所在。
  • 蒸馏能省算力、省数据标注、加快迭代,但对齐仍是很大的挑战,"可以让你很快的去达到一个及格线,而 Kimi 三其实已经远远超过及格线了"——"从本质上它无法实现超越或者是达到一个上限。"
  • 铁震补刀:中国开源的成功"可能有十个理由"——模型架构、infra、中文数据等等;美国前沿 lab 若只关注蒸馏一点,"有点只见树木不见森林,可能会完全忽略掉中国模型在其他方面的先进性"。

8. K3 license:赚钱的开源模型才是好的开源模型

  • 条款本身:卖模型的公司(Model as a Service)及其关联方连续十二个月总收入超过两千万美元,将 K3 及衍生模型用于商业服务前须与月之暗面另签协议;嵌入具体产品的终端应用、内部使用、月之暗面官方产品与合作伙伴不在此列。
  • 铁震的第一性判断:"赚钱的开源模型才是好的开源模型"——文生图翘楚 Stable Diffusion 因 Stability 赚不到钱"渐渐销声匿迹";千问开源做得好但商业化不行。"能够赚钱的开源模型才是可持续的开源模型,才能让我们一直享受下一代。"
  • 先例上,Llama(音)的 license 也有类似限制但执行模糊,Kimi 把可操作性写清楚"是一个 license 法律或商务层面的进步",精神上延续开源软件时代防云厂 free-ride 的传统——MongoDB、Elastic 当年的双 license 设计,都是对着白嫖的云巨头去的。

9. 反常识:云厂应该欢迎 Kimi 来收钱

  • 铁震的"反常识观点":交钱等于官方认证——Kimi 有一套 Vendor Verification 流程,过了才能证明"你卖出来的 token 是好的 token"(准确性、性能有保障);连认证都没过,"大家可能也不愿意去采买你的 token"。
  • 更深一层,推理厂和云厂"整个 business 都建立在能拿到不限量的开源模型上",最怕开源断供:"如果有一天大家都不开源了,那些拿了很多融资专门做推理的厂,它的整个 business logic 就不成立了。"给模型厂分成是给自己续命。
  • Kis 直言执行是最难的:两千万美金营收靠自觉申报,AI native 公司"你也不知道它赚多少钱",跨境执法怎么办——"有很多很多的灰色地带。"
  • 铁震仍有信心收得上来:跑 3T 模型要几百几千张 NVIDIA 卡、要品牌背书,API 售卖大多公开,"大的量你是藏不住的"。若这条路走通,"这就是无本万利——你只要把模型做好,大家都直接给你上供,你连自己买卡都不太需要,尤其中国企业买卡还面临挑战。个人情感上我也希望 Kimi 这条路径能够走通。"

10. 闭源估值体系承压:IPO 之年撞上智能平民化

  • 第一波冲击落在估值:"今年 OpenAI 和 Anthropic 都要上市。"开源追平之前,闭源模型被视为稀缺、可垄断的资产——铁震引一个段子:骇客松中途 ChatGPT 服务器断线,全场停工,"大家的智能被断供了"。"垄断智能比垄断任何商品威力要恐怖的多的多的多,所以它天然就值得万亿的市值。"
  • 但当"非常聪明的模型变成了一个流通的商品,甚至被平民化,变成社会的基础服务",问题就变成:还有多少企业愿意在开源遍地开花时付钱买闭源?margin 能做到什么样?scaling law 还能无限投钱吗?"这个饼就没有那么容易画得圆。"
  • 价格战苗头已现:neocloud 天然有开源模型可卖,互相卷价、甚至用资本开支摊薄 token 成本;曾经"很高傲、说封你号就封你号"的 ChatGPT 开始"国内外卖送券"发重置券,Anthropic 封号也"没有那么疯狂"了——"最后都会反映到他们的财报上面。"这也解释了他们为何想在法律和市场层面给开源设障。

11. 公开信与三种阵营

  • 背景事件:七月二十四日《开放权重和美国AI领导力》公开信,25 家公司机构起签、数日发酵至约 75 家;这是黄仁勋加入 X 后发的第一篇推文;Anthropic 始终未签,Dario Amodei 当天另发文章解释立场。
  • Kis 的结构图:开源与纯 API 闭源的商业逻辑"从根本上就是对立的"。卖铲子的 NVIDIA "肯定是每个人都能自由搭建一个最好——他并不在乎谁能挖到金子";有分发和基础设施的另当别论——阿里靠云服务变现开源,Meta 靠 app 矩阵(他注意到 WhatsApp 刚新增"二九九一个月"的收费版);而 OpenAI、Anthropic 两头都没有,利益"完全不会对齐"。
  • 铁震补充 NVIDIA 的开源基因:CUDA 护城河"相当一部分实际上都是围绕在 CUDA 周围的这些开源生态造成的"——从贾扬清(音)的 Caffe 到 TensorFlow、PyTorch 全搭在 NVIDIA 硬件上;AMD 想进场得一家家谈集成。上游下游越丰富、同层竞争者越少,卖铲人越舒服。

12. "Anthropic 有点走向邪路"与开源思想实验

  • 铁震的用户怨气很具体:Fable 一旦触发敏感检测器"有可能会瞬间给你降至到 Opus 4.8",非 Anthropic 员工根本无法测试 Fable 的极限能力,连简单推理都可能被 filter 拦下。模型安全团队有几百人,但"至少现在的产品形态对用户造成的烦恼是远远多于潜在的安全考量的——一个让用户如此不爽的公司,突然发现大家都想支持开源,也不是一个非常难以预料的事情。"
  • 主持人抛出思想实验:Kimi K1 本来就是闭源的,开源是为了分发和名声——如果 Kimi 有 OpenAI 的分发能力和 API 收入,还会开源吗?铁震先坦白"呃,我不知道",再给出 Linux 类比:从反抗闭源 Unix 起家,如今几乎所有设备都在跑 Linux,它依旧开源——"只要找到开源生态可以持续运转并且能赚大钱的商业模式,那没有理由他们不开源。"
  • Kis 补一层现实主义:这件事"某种程度上也不一定受实验室自己控制了,因为它已经从商业竞争开始变成了一种地缘政治的博弈——在这个框架下,business logic 其实变得是第二级了"。

13. Thinking Machines 与"智能应该被拥有"

  • Thinking Machines 在 K3 发布前一周放出开放权重模型(参考了 DeepSeek 架构;可能是 Mira Murati,来自 OpenAI)。铁震的解读:为了让 Tinker 后训练服务用得起来,基础模型结构必须开放,"从这个角度是非常合理的";同时美国学界也在反思——开源鼻祖本是 Llama,"从 DeepSeek 出现之后,美国参与开源的比例大幅下降"。"开源界最担心的就是没有人发模型、变成一潭死水……不管这些开源模型是哪个国家的。"
  • 铁震强调打法完全不同:Thinking Machines 帮企业微调、deploy 自己的模型,吃的是美国庞大的 To B 生意;背后是企业心态转变——"intelligence should be owned,而不应该是 rent。"
  • 落地端的实话:除政府等敏感 vertical,"大多数的美国公司并不是非常在乎这个模型是不是中国的",在乎的是有没有能力调教自己的模型。市场"极其混乱又不透明",于是中间商繁荣:Cognition 不被广大开发者使用照样赚很多钱,OpenAI、Anthropic 都设了专门的 deployment 部门,而 OpenRouter 们估值 ARR 翻倍增长,"核心利用了中国为主的开源模型这一大批"。

14. Agent 生态:应用层危险,infra 还有千倍空间

  • Kis 转述 VC 朋友的反直觉筛选:"这个估值越高,我们反而会越愿意投——估值很低的 agent 我反而可能不愿意投了,因为你这一层很容易就会被吃掉。"harness、vertical 工程调优正在成为新护城河,但"这个模型很快就可以吃进去";放到五年尺度,"我并不是很认为说以后会有很多的 agent application 的 companies 了"——反而当智能变成水和电一样的 commodity,agent infra 的逻辑要重新想。
  • 铁震看到的 infra 机会:agent workload 与传统推理不同——超长输入、很短输出、KV cache 重用率极高;控制住 harness 层(如可能是 Claude Code)就能"完全掌控 KV Cache 的生存周期",降本提效空间巨大。
  • 成本展望是全场最硬的数字:单位智能的美元成本"过去几年可能下降了一千倍",硬件还能抠十倍、下一代硬件或 ASIC 再十倍、软件层再十倍——"未来的三年同样的智能成本又下降了一千倍。AI 应该是一个服务型行业,支撑实体的发展,而不是一个抽血机。"

15. K3 开源安全吗:数据不支持恐慌

  • Kis 先摆数据:K3 在网络攻防测试 Exploit Bench 得分"百分之三十几,远远低于整个 frontier models 七十五以上"——可能是能力所限,也可能是"没有把最强的攻击性网络能力开放出来"。"Kimi 三本身,目前没有看到任何可证据的已知的安全问题。"而所谓不安全是相对于为人设计的上一代互联网架构而言——"这个判断为什么要交给一家商业公司来做决定?"
  • 铁震的案例最有画面感:Hugging Face 被 OpenAI 一个测试智能体攻击——"这个智能体足够聪明,他说我直接去抄答案比我自己去摸索要好得多,要不我就顺便把别人的网站给黑了。"HF 想用闭源模型分析攻击过程,闭源模型回答"你做的这个事儿好像挺不安全的,我不能帮你分析网络安全的语料"——最后只能靠开源模型协助溯源。"我觉得这个才是一个真正的技术平权。"
  • 由此引出核心质问:"为什么我们能够让他们又做运动员又做裁判?一方面他可以评价别人做的事情安不安全,另一方面他可以自己有意或者无意的放自己的 agent 出去攻击别人。"Kis 甚至联想到 AI 短剧里的伞公司——打着治愈人类一切疾病的旗号设计病毒:"我没有办法相信某一两家公司对自己的监管是足够到位的。"

16. 监管该管什么:"没有开源反而是这个时代最不安全的事情"

  • 铁震的政策主张:智能与攻击能力"有一定的相关性,但绝对不是决定性的"——"你可以有一个人像爱因斯坦一样聪明,但是爱因斯坦不知道怎么去黑 NASA 的网站;一个十八岁的高中生,可能就有能力。"监管更应审查训练语料、把生物安全和网络攻击语料删掉,而不是过滤用户行为。
  • 铁震补上闭源的反向风险:日本某最大公司之一的 number two 私下说,Fable 被禁用的冲击不在禁用本身,"而是对大家来说,原来这个东西是不安全的"——部署完随时可能因新政策封号、服务变更;开源"说白了就是你把整个东西都下载到你自己的硬盘上",没有这个风险。
  • 作恶的成本算术也反着来:想用 K3 干坏事得先搞两台 B300 机器,"一年光租金就有上百万",还要补齐与闭源的能力差距——"比他直接用闭源模型然后尝试去攻破那个 filter 要难得多。"后门疑虑同样反向成立:闭源"连这个模型在什么时候会输出什么样的东西都完全不了解",沙箱里严格控制输入输出的开源反而更可控。
  • 收尾留了抓手与判断:足够强的开源模型需要复杂推理环境,"谁拥有算力"就是监管的抓手;"现在这个时候去聊开源模型一定是不安全的,还是为时过早"——"不管怎么看,没有开源反而是这个时代最不安全的事情。"

泓君

大家好,欢迎回到《硅谷101》,我是泓君。

硅谷前沿 AI 实验室的商业模式,大家应该都不陌生:把智能封装成 API,再按 token 出售给用户。但现在,几家中国实验室正在用开放权重模型挑战这套模式。

7 月 27 日,月之暗面正式发布了 Kimi K3 的完整模型权重。在此之前,K3 的横空出世,以及它在多项测试上展现出的竞争力,都已经说明了一件事:开源模型正在逼近,甚至超过最强的闭源模型。这意味着,企业未来可能都不再需要完全依赖 OpenAI 或者 Anthropic,也可以部署、定制并掌控自己的模型。

K3 的发布,也在硅谷引发了一场更大的讨论。过去几周,包括英伟达在内的数十家科技公司和机构签署公开声明,呼吁美国支持开放权重模型和更开放的 AI 生态。但与此同时,也有批评者提出质疑:能力如此强大的模型是否应该开放?它会不会带来新的安全风险?中国模型的快速进步,又在多大程度上涉及蒸馏?

所以在这期播客里面,我们邀请到了两位身处这场变化中心的嘉宾:前 Hugging Face 亚太开源生态负责人王铁震,以及 TinyFish 联合创始人 Kislay Verma。我们一起讨论了中国开放模型为什么能在这么短的时间里逼近前沿,最近争议很大的蒸馏到底是什么,又能解释多少模型能力呢?当开放模型持续压低 token 价格,它将如何冲击闭源实验室的商业模式,又会怎样改变整个 Agent 应用的生态?

其实我们录制这期节目的时间,是北京时间 7 月 28 日上午。昨天,月之暗面发布了 Kimi K3 的完整模型权重。K3 从 7 月 16 日 API 上线以来,在硅谷的热度可以说是居高不下,而且也成为硅谷最近讨论开源模型时最重要的案例之一。

1. K3 震动硅谷

我想先请两位从你们的观察来回答一下这个比较大的问题:你们觉得 K3 真正让硅谷感到意外的是什么?要不先从 Kis斋 开始,因为你们公司是在硅谷的。

Kis斋

其实如果我们稍微 take 一点 step back,整个时间轴其实可以分成几个部分。

最早当然是从 DeepSeek 那个时候开始,但接下来最近的两个,我认为应该还是回到 GM(名称存疑)。也就是在 AI 这样的一个环境下,过去几个月里,整个 AI 对硅谷带来的影响和变化是极其大、也极其快的。

年初的时候,所有人在讨论的问题是:“我们要赶快用 AI。”但很快,当时 Uber 包括其他几个公司,大家就开始晒账单,说这个账单已经没有办法再支撑了,一个月花了一年的预算,等等。

在这样的背景下,Z.ai 以及中国的这些模型又开始引起新的讨论,包括当时 Cursor 开始使用中国模型等事情。因为 Kimi K3 作为一个开放权重模型,它的能力其实达到了一个在很多人看来很新的高度。

在 cost sovereignty 等讨论的情况下,这样一批新的开源模型到底会走到什么程度,以及它会对所有的闭源模型带来什么样的冲击?这已经超出了单纯讨论的范围,而是大家都在看、在使用,并思考具体应该怎么样做调整。

泓君

对。对铁震有什么要补充的吗?

王铁震

我特别同意 Kis斋 的说法。我觉得 K3 的发布并不是一蹴而就的,它实际上有一个漫长的铺垫过程。

从去年年初的 DeepSeek V1 开始,那时候第一次带来了开源版的 o1,让大家知道推理模型是怎么做的。那个时候就非常有意思,因为我记得当时纳斯达克跌得也很厉害,大家就在想:中国模型、开源模型已经非常非常接近闭源的前沿模型了。不管是硬件生态、整个 AI 的估值体系,还是模型公司的生态,大家都有一个反思。

结果过了一年,大家发现这是一个“狼来了”的故事。因为过去一年,开源和闭源模型的性能分化实际上非常大。闭源模型可能能做到月更,开源模型可能是季更。在性能上,不管是 Claude Opus 4.6、Opus 4.7,还是 Opus 4.8,其实都远远领先于开源模型。

但是最近几个月发生了一些变化。包括 Kis斋刚才说的 GM 5.2(名称存疑),我也是重度在使用。我已经用 Gemini 2.5 完全取代了 Claude Opus 4.8 的一些功能。但是大家觉得可能还好,因为美国模型还会出下一代。只要闭源模型领先于开源模型超过一个时代,就没有太多可以担心的,大家还是要用最好的闭源模型。

所以这是一个时间点。大家会说:“GM 5.2(名称存疑)挺好的,但是我们不担心。”直到过了一段时间,大家发现,K3 出来了。

K3 不是说跟 Opus 比一个评级的问题,它基本上已经追上了 Fable,甚至在某些场景上做得还要更好。那闭源模型瞬间就发现,自己好像没有护城河了。因为开源模型跟自己又回到了 DeepSeek R1 的那个时代,跟自己重新处在同一个水平线上。

所以大家就很 formal,同时又很担心:那我们整个 AI 估值的泡沫怎么办?整个行业是不是还可以按照过去的模式继续运转下去?大家还是要用闭源模型,还是说未来我们可能会完全转向一个基于开源模型的生态?

所以美国内部就会有很多讨论。他们关注的点实际上有两个。第一个是 Claude 在讲自己非常不安全,所以我们要限制 Claude 模型的使用。实际上更多的问题是:如果有一个开源模型,它的能力已经接近 Claude,是不是它也是不安全的?你又把这么一个“不安全”的模型开源出来,究竟是冒着什么风险?

另外一个话题是,美国人会想:你为什么能够在这么短的时间内,好像就在这几个月里连续取得这么多突破?你一定是在蒸馏我的模型。

Kimi K2 和 K3 实际用户可以用上的发布,中间只隔了大概 15 天左右。这也是一个非常有意思的话题:K3 到底有没有在蒸馏 Kimi K2?

我个人倾向于没有。因为 10 多天连模型发布的准备都来不及,你何谈收集到足够多的语料,然后去蒸馏 Kimi K2?

所以 K3 这次的发布,像当年的 DeepSeek V1 一样,有着非常多的话题。大家也对 Kimi 这家公司非常有兴趣,包括杨植麟之前的一些观点也很有兴趣。所有这些加起来,就是 K3 之所以这次在硅谷取得这么大关注的一个原因。

当然,后面中国模型,像 MiniMax、千问,都要发布 2T 到 3T 的模型,甚至智谱可能也会有一些动作。所以后面我们可能会看到,除了 K3 之外,其他中国模型在硅谷引起更多讨论。我们就拭目以待这个行业吧。这个行业变化非常快,也非常有意思。

泓君

对,我觉得你提到了两个非常关键的问题,也是我们这一期节目想深入探讨的。

第一个是,一个能力如此强大的模型,去开源到底安不安全?第二个是关于蒸馏指控的问题。因为你们都提到了硅谷对于中国开源模型这件事情,在整个时间线上的态度变化。

2. 企业转向开源模型

我想再深入捋一下这个时间线。所以在 GM(名称存疑)之前,硅谷对于部署中国开源模型的态度是怎么样的?从企业的角度来说,有没有因为成本考虑,在某一个时刻选择把 Anthropic 的模型换成中国开源模型?这个大概是在什么时间点发生的?

这肯定要分行业。

有些行业就是非常敏感的,它 by nature 不可以使用其他国家的模型。从美国来说,当然是这样。这个情况也适用于其他一些地方,比如欧洲的一些国家、日本等。

但除此之外,AI 的变化是极其快的。其实很多时候,大家第一个反应应该是讨论怎么样使用模型。但很多时候更应该考虑的是:我怎么样用到最好的模型?

Cost 这个问题,只有在上了很大一个量之后,才会变成一个更显著的问题。就硅谷来说,形成大规模使用,是因为 coding 整个领域带来了巨大的变化。Coding 之前,大家大多数的消费场景是 RAG,但 RAG 对 token 的消耗量,往往无法跟 coding 开放之后所带来的生产力改变相比。

所以大家最大的调整,是从去年大概 9 月前后开始的。Anthropic 开始比较大规模地推动 coding 之后,大家从“赶快使用 AI”,到突然意识到:“我花了太多钱了。”

以我们这样的公司来说,才 50 多个人,一个月整个消费也是大概 6 位数美元,这其实是非常高的成本。更不用提那些更大的公司和企业,它们都会面临很多挑战。

而这种转向,几乎就是在一个月之内发生的。智谱当时的推动,虽然不是开源,也没有改变事情本身,但它从价格上让很多人觉得:“原来模型可以这么便宜,又这么好。”于是很多人开始更多地去看千问等开源模型带来的进展。

这一次 Kimi 相当于在大家焦虑的时间点上,又进一步推动了一步。很多事情其实都在很短的时间内发生,但整个 AI 行业有点像“天上一日,人间一年”,进展实在太快了。

泓君

对,所以其实 K3 相当于再次加深了大家的印象:现在开源模型的能力已经可以做到和闭源模型一样强了。在这种情况下,企业才会去做成本判断。

就像你刚刚说的,今年前几个月大家主要是在 token maxing,去最大化 token 的使用量;现在可能进入了 token optimization,也就是优化 token 的状态。

王铁震

3. 开源模型压低推理成本

其实这个东西我倒感觉,不是说开源模型就跟闭源模型达到了一样的强度。

第一点是成本,另外一个主要的问题是所有权。如果模型的一切都取决于对方是否开放,这其实会带来很大的风险。Anthropic 早些时候发生的事情,对大家影响很大:突然有一天,美国商务部说这个模型不可以用了,那一夜之间,所有东西都不可以用了。之前做的部署,可能一下子就都没有了。那这种情况怎么办?

很多时候大家就会发现,我可能不需要用最好的模型。前一段时间,埃森哲做了一个内部调研。埃森哲作为世界上最大的咨询公司之一,又是专门做 AI 相关业务的公司,他们的员工使用模型做得最多的事情,其实是生成 PDF。这个事情其实不需要用最新模型去做。

成本上,我是这样想的:为什么开源模型的推理成本一般会比闭源模型便宜?这里面有几个结构性的原因。

第一个,如果你把闭源模型的成本拆开看,一部分是实际购买硬件进行推理的固定成本,另一部分是它要为模型支付一个 premium。因为这是一个闭源模型,它出售 API 的时候,肯定会包含闭源模型本身的成本。

但如果我们看开源模型推理的成本结构,比如 Fireworks、Together AI,它们实际上只有硬件成本,以及自己作为推理服务商所赚的钱,并没有额外为模型付费。这是现在的情况,未来可能会变化。所以从结构上来讲,它应该会比闭源模型更低。

第二个也要看到,中国开源模型实际上一直在卷一个东西,叫 scaling efficiency。你在做 scaling 的时候,是不是能够同时把成本降下来?

Kimi K3 的报告里面有一张图,横轴是 FLOPs,纵轴是达到同样模型能力时的训练 loss。图上有两条曲线,一条是 K3,一条是 K2。我们看到,虽然 K3 比 K2 大了一倍甚至还多,但实际上它的 scaling efficiency 扩大了 2.5 倍。

也就是说,K3 通过模型架构上的演进,达到了模型更大、但同时更 efficient 的效果。这也是导致成本能够快速降低的原因。这里面起到作用最大的,可能就是它用的 KDA,以及其他一些优化技术。

这一方面,比如 KDA、RWKV,或者其他 linear attention 技术,国内每一家厂商都在研究。但我们很少看到海外的闭源厂商,比如 Anthropic 或者 OpenAI,去讲自己使用了什么样的技术。

其实 linear attention 整个领域,目前最火的、能够让大模型更便宜的技术,主要都是由华人研究员主导的。这可能是开源模型的另一个优势。因为它出生在一个算力受限的国家,所以天然从第一天就很关注模型训练和推理时能不能变得非常高效。这也导致了为什么开源模型的成本会低。

第三个原因是,国内的开源模型实际上没有足够的算力去 scale 到那么大的规模。网上有传言说,Claude 这个模型的本体可能有 8T 到 10T 那么大,但 K3 实际上只有不到 3T。

也就是说,3T 的模型可以跟 10T 左右的模型达到同样的效果。单看这个尺寸,我们也能想象推理成本本身会有巨大的差别。开源模型可以用更小的模型做出更多事情,所以它会比闭源模型更便宜。

泓君

我觉得这个特别有意思。因为其实我本来有一个关于算力的问题。从 DeepSeek 开始,大家就在讲,中国的整个模型是因为算力受限,导致创新被倒逼出来的这样一个叙事。

现在听起来,K3 的思路也还是一样的。但是,虽然模型结构的演进会带来很多便利,在工程适配上确实带来了很多挑战。这也需要很多额外工作,才能够把理论上的极限实际在工程上做出来。

所以还是要给中国的工程专家们打 call。

4. 蒸馏的技术边界

既然我们聊到了 Kimi 的能力和训练,我们就来解决一下蒸馏这个争议吧。你们之前都提到了 Anthropic 对包括月之暗面在内的 3 家公司的蒸馏指控,也就是 DeepSeek、月之暗面和 MiniMax 在今年 2 月被提出的指控。

包括最近 Kimi 把 K3 放出来之后,美国政府也有所介入,提出了针对中国开源模型是否要限制等一系列问题,并且在讨论相应政策。网络上也有很多讨论。

我觉得咱们先做一个科普:蒸馏到底指的是什么?因为我觉得,Anthropic 所说的蒸馏,和我们在 AI 训练中所说的蒸馏过程,之间还是有一些细微区别的。铁震要不要先帮我们解释一下?

王铁震

蒸馏实际上是一个现在被用烂了的词。很多不同层面的蒸馏,都混在了一起。

从纯技术角度来说,蒸馏是一个非常中性的词。蒸馏就是说,我现在有一个大的模型,另外有一个小的模型,我怎么样让这个小模型学会大模型的能力?

它可能有很多种方法。最传统的方法是,我们看大模型推理之后输出的 logits。正常来说,用闭源模型时你是看不到 logits 的。Logits 就是每一个位置上、每一个 token 输出的概率。

然后让小模型去学习这个概率分布。比如说你用闭源模型,能拿到的只是它最后 sample 出来的结果,也就是它采样出了哪一个词,你没有办法反推回它的分布。

所以用经典意义上的蒸馏技术,你没有办法拿一个开源模型,让它去学会 Claude 的能力。现在大家说的蒸馏,更多是指利用闭源模型生成的文本来学习,然后让开源模型拥有闭源模型的某些能力。

但这件事情其实非常 controversial,说起来就很有意思。闭源模型可以拿所有人类的数据去学习,但学完之后,闭源模型输出的东西却不能被别人用来训练下一个模型。这不是很可笑吗?

相当于闭源模型练了一本宝典,然后把所有语料都扔掉,不告诉你它是从哪里学的,也不告诉你它学到了什么,还不允许开源模型拿它的输出来训练。

或者换一个例子:有人读了一本书,然后拿这本书的内容写了一些自己的创作,却跟所有人说:“你不能读我写的东西。”

实际上,这就是一个非常有意思的点:版权法是不是能够保护闭源模型的输出,使它不能被其他模型拿去训练?

在这一点上,开源模型实际上是非常开放的。DeepSeek R1 出来的时候,直接说支持所有人蒸馏自己的开源模型,甚至官方推出了一些数据集和模型,让大家可以去蒸馏。

蒸馏有很多好处。比如大家实际需要的是一个非常小的、3B 左右的模型,那你可以把 DeepSeek 某一个方面的能力蒸馏进去。而且 DeepSeek 直接开放了 logits,所以你想做传统意义上的蒸馏,完全没有问题。

Kimi 也是一样。它在 license 里面并没有明确限制你不能把开源模型的输出,用作提升其他与它竞争的模型。

另外一个层面,抛开这些不说,还有很多人会说,蒸馏是什么呢?当我使用这个开源模型的时候,它自己会说:“我是 Claude。”你问这个开源模型“你是谁”,不加 system prompt,它可能会说:“我是 Anthropic,我是 ChatGPT。”很多人就说:“你一定是在蒸馏这个闭源模型。”

实际上,这更像是一个数据污染的问题。以 Opus 4.7 为例,我记得如果你把 system prompt 拿掉,再用中文问它“你是谁”,它会说自己是千问。这同样是一个数据污染问题。

因为各种模型的输出已经大量存在于互联网上,所以这些模型在预训练时,会学到各种不同的身份,导致它的自我认知有些错乱。

解决办法就是在 system prompt 里面明确告诉它是谁,也针对性地做一些微调和训练。但这个问题肯定没有办法完全解决,总会有一些情况下,模型会对自己是谁产生认知错乱。

我并不觉得这就是蒸馏的问题。

说回来,K3 有没有蒸馏?我为什么相信它并没有蒸馏?是因为蒸馏是一个训练过程,是你在训练的时候去学习另外一个模型的表现。这个学习过程实际上非常漫长。

一个经典的模型训练可能需要 3 个月,它绝对不可能在 10 多天里积累到足够多的语料,然后完成学习。

另外,为什么开源模型其实很难从闭源模型蒸馏?因为闭源模型不给你暴露它的思维链。

闭源模型蒸馏开源模型是非常容易的,因为开源模型已经把所有 logits、所有思维链都暴露出来了,所以闭源模型想要追赶完全没有问题。

但是,如果开源模型真的在蒸馏,并且想蒸馏闭源模型,实际上是非常难的。闭源模型既不给你暴露 logits,也不给你暴露思维链,只给你最终结果。

如果我们看到一个人做事情的结果,就能够学会他内心是怎么想的,那人类社会互相学习也太容易了。包括我们向某些人学习时,需要打开他的内心,知道他是怎么想的。我们只看结果,实际上很难学会他的行为。

所以闭源模型不暴露思维链,就导致闭源模型非常难被蒸馏。我们也很难通过闭源模型来提升开源模型的能力。

泓君

5. 蒸馏指控源于竞争

比如从 Anthropic 和 OpenAI 这些前沿实验室的角度来看,他们对于蒸馏的担心,你觉得是出自什么样的证据,或者他们自己的什么经验?我们应该怎么样去理解他们最近的这些指控呢?

我觉得,抛出“蒸馏”这个概念的人,其实不见得是技术圈的人。每个公司肯定都有不同背景的人,大家在竞争或者制定战略时,肯定会有不同的方向。

所以这不见得是技术圈意义上的蒸馏指控,可能更多是出于商业目的,或者给大家预先植入一种看法:开源模型没有那么好,它们都是从闭源模型蒸馏出来的。

但你很难抓到一个具体事实,去证明某个模型确实是在蒸馏。其实我觉得,这些闭源厂商借着蒸馏这个名号,也做了很多很夸张的事情。

比如他们曾经关闭了几万个被质疑是在蒸馏数据的账号。这本质上就说明,他们实际上在看所有用户的数据,才知道谁可能在蒸馏。

所以我觉得,整个事情有点像所谓国家安全的自我强化预言。你总要有一个靶子,然后照着这个靶子去打,说不定能够“搂草打兔子”,找到一些东西。如果能产生社会影响力,当然好;如果产生不了,也就这样。

技术圈其实一直对“大家都在蒸馏”的说法有很多质疑,但事情也就这样了。

王铁震

蒸馏本身是一个中性词,但现在已经变成了一个贬义词。

事实上,首先它是一项非常标准的技术。所有公司,包括 OpenAI、Google,大家其实都在用大模型蒸馏各种小模型,这些都是已经存在的事情。

第二个误解,是把模型能力完全归结于蒸馏。模型只要比较好,就说它全都是因为蒸馏。但事实上并不是这样。如果事情这么简单,那所有人随便训练一下就能训练出一个好模型了。

这里面包括强化学习、数据工程、架构的各种创新,以及最开始 DeepSeek 所做的很多工作,是一个非常复杂的问题。

蒸馏可以让你很快达到及格线。像 Kimi K3,它其实已经远远超过及格线了。蒸馏能够节省的,一是算力,二是数据标注成本,当然还包括时间,可以让迭代和各种周期变得更快。

另外一个很大的挑战是对齐。但从本质上来说,蒸馏无法实现超越,也无法突破能力上限。

所以目前很多关于蒸馏的讨论,实际上落在法律和商业伦理层面,而不是技术层面的讨论。

几种情况如果被认为越界,越的不是技术边界,而可能是违反模型的服务条款。第二种是规模化、系统化地调用对方 API,提取大量训练信号。第三种可能涉及直接窃取模型权重或商业机密。

关于 Kimi 是不是蒸馏,或者中国的开源模型是不是都在蒸馏,我认为因为这是一个非常抽象的概念,又被简化成了“抄袭”,所以很多主张混合在了一起,我们应该把它们拆开看。

第一个问题是,有没有中国实验室可能系统性地、未经授权地调用包括 Claude 在内的前沿模型 API,从中提取训练信号。很多证据其实围绕这一点,比如账号的大规模自动化请求、各种异常调用,这些都可以被检测系统抓到。

第二层,很多指控说 K3 是靠蒸馏 Claude 5 拿到能力,这个证据就非常薄弱。时间上来看,Fable 5 是 7 月初,1 号还是 2 号刚开始的,中间其实很短。要在两周左右的时间里把一个千亿级模型换成另一套训练数据,然后完整跑出来,是极其困难的事情。

第三个问题是,蒸馏这件事情本身,是否让这些开源模型,包括 P P 3(名称存疑)在内所取得的成就失去意义?我认为这是一个错误的观点。

蒸馏是一项存在已久的技术,模型输出本身很多时候也不受传统版权法保护。从这个角度来说,它们仍然做了很多技术上的工作,也推动了很多方面的进步和变革。

就算有一些实验室在蒸馏,中国开源模型的成功实际上也可能有 10 个理由,包括刚才说的模型架构、英伟达相关的工作、中文数据方面的工作等,这些都可能是非常重要的因素。

如果美国的这些前沿实验室只关注蒸馏这一点,其实有点只见树木、不见森林,可能会完全忽略中国模型在其他方面的先进性。

因为涉及法律或者商业伦理道德,很难做出一个具体判断。但我感觉,目前所有证据应该倾向于说明,可能存在一些未经授权的大规模数据抓取行为;但这并不代表可以得出 Kimi K3 或者其他模型的核心能力来自蒸馏的结论,尤其不能简单说它们是蒸馏 Claude 得来的。

泓君

是的。两位其实都回答了两个核心问题:到底有没有蒸馏,以及蒸馏是否构成模型的核心能力。我觉得这是非常好的总结。

6. Kimi 设计商业授权

我想再从 K3 的角度来看一下这件事情。铁震,你提到了 K3 的商业授权模式。我觉得这也是这次技术报告放出之后特别有意思的一个点。

Kimi 使用的是单独的 Kimi K3 License。它规定,如果一家公司卖的是模型,并且公司及其关联方在连续 12 个月内的总收入超过 2,000 万美元,或者公司在把 K3 和它的衍生模型用于商业服务之前,需要和月之暗面另外签署协议。

这个 Model as a Service 的定义,不包括嵌入具体产品功能的终端应用;内部使用、月之暗面官方产品和其他合作伙伴也不包括在内。

这样一个商业授权协议,体现了 Kimi 商业化上的什么趋势?我们之前有没有看到过类似的协议?

王铁震

我觉得,能够赚钱的开源模型才是好的开源模型。这个事情可以有几个佐证。

第一个,比如之前我们看文生图模型领域的翘楚 Stable Diffusion。它后来由 Stability AI 这家公司研发,但这个模型一直没有办法赚到足够多的钱,所以渐渐销声匿迹了。

第二个就是千问。千问可能也是因为开源做得很好,但是商业化做得不好。所以我一直觉得,能够赚钱的开源模型才是可持续的开源模型,才是能够让我们一直享受下一代开源模型的模型。

第二,license 收费这件事情,Kimi 不是第一个提出来的。当年的开源模型祖师爷 Llama,在 license 里面也有类似限制。当时大家不是特别清楚具体该怎么执行,但 Kimi 这一次把具体执行内容写得非常清楚,也比较可操作。我觉得这是 license 法律和商务层面的一个进步。

第三,它把这件事情写清楚之后,很多专门做模型推理的云厂商实际上就没有办法 free ride 了。

之前很多开源数据库项目最担心的,就是云厂商没有出工、没有出力,却把开源项目部署在自己的云上卖钱。所以 free ride 这件事情,实际上是开源社区一直想要避免的。

在开源软件时代,大家想出了很多办法,比如使用两套 license,或者专门设置一个 license,把云厂商和一些专门做线上业务的公司排除在外。

我觉得 Kimi 也是在延续这个精神。包括 MaaS 厂商和云厂商,它们需要从自己通过开源模型赚到的钱里面,给 Kimi 做一些分成。我觉得这也是非常合理的。

可能这是一个反常识的观点:云厂商和 MaaS 厂商实际上应该非常欢迎 Kimi 找它们收费。因为只要 Kimi 收钱,就说明它和 Kimi 有官方认证关系。

大家如果去看 Kimi 官方的发布,实际上有一套 Vendor Verification 流程。只有通过这个流程,你卖出来的 token 才能被证明是好的 token,包括准确性和性能都有保障。

如果你连 Vendor Verification 都没有通过,也没有给 Kimi 付钱,不是 Kimi 的官方合作伙伴,那大家可能也不愿意采购你的 token。从 marketing 角度说,这是很重要的。

另外,这些 MaaS 厂商、云厂商,包括一些专门卖推理服务的小公司,它们的业务都建立在能够拿到不限量的开源模型,并且不断用开源模型做推理、卖给客户这一点上。

所以它们也非常希望开源模型的生态能够一波接一波地持续发展,也希望这些开源模型公司能够赚到钱。否则如果有一天大家都不开源了,那些拿了很多融资、专门做推理的厂商,或者买了很多卡、想自己做推理的 neo-cloud,它们的 business logic 就不成立了。

现在如果有一个能够让整个生态持续发展的方式,大家应该都会非常欢迎。

我相信这应该不是第一个尝试这类 license 的公司。Kimi 之前,MiniMax 其实也做过一些尝试,后面我们应该还能看到更多企业做不同的尝试。

泓君

我们能不能稍微和其他中国开源厂商做一下对比?比如我理解千问的商业模式可能是回到阿里云,这个能不能给我们解释一下每家厂商有什么不同?

千问的商业模式肯定是绑定阿里云,但这只是过去的一个状态。

如果 Kimi 的 license 转变非常成功,大家也愿意付这个钱,并且因此产生更紧密的生态连接,那我相信其他家复制这个模式,也不是不可能。

其实这个逻辑本身并不新。比如早年的 MongoDB、Elastic,大家做的都差不多。那时候云厂商很多时候都在白嫖,所以整个逻辑就从 MIT、Apache 等 license 中发展出来了。

包括 Llama 其实也是这样的。它的整个逻辑也是针对当时非常大的 Microsoft、Amazon、AWS 等公司设计的。

所以 Kimi 的整个设计应该分成两块。

第一块是云厂商。你可以想象,像现在非常火的 Together AI、Fireworks,核心都是靠这些开源模型来赚很多钱,它们赚的是一份中间商差价。

第二部分是终端应用方,也就是涉及 Cursor 之类的终端产品。它们的情况会更加细化。

这其实就回到了和闭源模型、闭源 frontier labs 竞争的场景。月之暗面现在的核心,应该是靠开源去铺量,去挤压包括 OpenAI、Anthropic 在内的生存生态和生存方式,同时形成新的心智占领。

但与此同时,这件事情也非常新。跟过去不同,现在月之暗面已经没有办法独自承担一代又一代模型的迭代和训练成本了。

所以,如何保证开源这样一个大的叙事,同时又不能把自己最好吃的蛋糕交给大家随便白嫖?这就是现在需要解决的问题。

目前来说,这个 license 是一个相对妥协的结果。但最难的地方在于落地和执行。

你怎么知道一家非中国本土的公司在过去 12 个月的营收达到 2,000 万美元?这应该是一个门槛。怎么衡量?很多公司本来就是 AI-native 公司,你也不知道它赚了多少钱。

到打官司的时候,跨境执法怎么办?这都是传统领域里没有解决的问题,在今天的 AI 行业里怎么解决?这里面有很多灰色地带,是一个非常难界定的事情。

泓君

那你们觉得过去有没有什么案例值得参考?无论是成功还是失败的例子,还是说这还是一个太新的东西,我们没有办法衡量?

王铁震

确实,收费是一件很难的事情,尤其是 license 收费。

过去大家一直抨击中国企业,尤其是中国大厂,说它们根本不看 license,只要偷偷使用,找不到证据就没关系。

但实际上,我看到这几年情况在快速好转。包括阿里,我知道它也支付了很多 license 费用。还有一些非常传统的软件,比如服务器上的 load balancer 等,在国内也已经能够收上钱来了。

背后的原因,我觉得有几个。

第一个,至少这一代程序员还是有比较强的 license 付费意识。

第二,厂商也发现,带着原厂一起做事情、一起 co-marketing,实际上能带来很多好处。

比如某个云厂商对某个功能有定制化需求,它自己不一定能搞定。就算自己搞定了,对开源代码的改动也可能非常有侵入性,导致开源代码一更新,它这边所有的魔改都不能工作,所以每次更新都是非常痛苦的过程。

这些原厂通过资助开源项目、购买 license,或者加入基金会,就可以和原厂形成紧密连接。它可以说:“我需要你帮我把这个功能推进去,下次更新的时候我就很容易。”

这种事情多了之后,大家就养成了一种意识:为什么不跟原厂搞好关系?我偷偷摸摸地用,不如让原厂来帮我宣传。

第三,包括 Linux 基金会等机构,在国内通过美国企业的 OSPO,也就是开源办公室,进行一些合作。现在很多信息都非常透明,大家知道谁在使用什么。人员流动也很频繁,尤其是大规模使用时,想藏住实际上非常难。

一旦被发现有明确证据链,法院也是会支持开源一方的,因为这里已经有一些比较好的判例了。

第四,回到 Kimi 的 license 能不能收上钱这件事。

Kimi 这个模型实际上非常大,是一个 3T 的模型。要把它在云上服务好非常难。虽然我们看到像 vLLM、SGLang 都对它提供了一些社区项目支持,但真正能够大规模跑起来,同时有很高性价比和使用体验的机构,全球也没有那么多。

首先,你要有几百张、几千张、几万张 NVIDIA 的卡。那你首先就是一个要靠品牌吃饭的人。如果没有很好的 branding,NVIDIA 甚至不愿意给你卖卡。

第二,你肯定投入了相当多的人去做推理优化,这件事情是藏不住的。

第三,所有 API 的售卖,大部分都是公开售卖。你想要走量达到 10 亿级别,需要自己有一个 API 放出来,让大家购买 token;或者面向 to B 场景,让大家能够在你的网站上直接看到你在卖 Kimi 的 token。

虽然你可以藏一部分销售量,但大的量是藏不住的。

综上几点,我非常有信心 Kimi 能把这个钱收回来。肯定会有一些漏网之鱼,但应该不会影响他们公司的业绩。

如果 license 这条路径被 Kimi 证明成功,实际上这是比 Kimi 自己去做推理好得多的商业模式。这就是无本万利:你只要把模型做好,大家就直接给你上供,自己连买卡都不太需要。尤其是中国企业可能在买卡上还会面临一些挑战。

从个人情感上,我也希望 Kimi 这条路径能够走通。

泓君

7. 闭源估值承受压力

我觉得这个非常有意思,而且其实这是一个很好的过渡。如果 license 这套模式可以走通,它会对闭源实验室的收入模式造成什么样的影响?

王铁震

我觉得第一波影响应该是估值体系。

今年 ChatGPT 和 Anthropic 都要上市。OpenAI 和 Anthropic 上市的时候,大家就会问:这家公司到底值多少钱?

在开源模型追平 Fable 之前,大家会觉得闭源模型本身是一个非常有价值、非常稀缺、非常值得溢价,甚至具有垄断性的东西。

我记得前几天看到一个笑话:有一个 hackathon 运行到一半,ChatGPT 的服务器断线了,然后就没有人在 hackathon 继续做东西了,因为大家的智能被断供了,没有办法继续做下去。

所以,垄断智能这件事情,实际上比垄断任何商品的威力都恐怖得多。它天然就值得万亿美元的市值。

但有一天大家发现,好像竞争变多了,好像不止这几家公司可以训练模型,好像很多家都可以训练模型。有了开源模型之后,非常聪明的模型变成了流通的商品,甚至被平民化,变成社会基础服务。

那这个时候再去想 OpenAI 和 Anthropic 的价值,可能就要稍微打一个问号。

大家会问:你的商业化到底能做到什么程度?在开源模型已经遍地开花的情况下,还有多少企业愿意付钱购买闭源模型?闭源模型的商业 margin 能做到什么程度?

你后面发展的 scaling law,我是不是还可以投无限的钱,让你无限扩展?还是说你现在应该抓紧想办法,让 token efficiency 更高?

这些因素叠加在一起,估值的故事就没有那么容易讲圆,估值体系肯定会受到一定压力。

第二,如果未来所有美国的 neo-cloud 都变成 Anthropic 和 ChatGPT 的竞争对手,因为它们天然拥有开源模型,哪怕支付一些 license 费用,还是比把数据中心低价卖给 Anthropic 赚得多,那 OpenAI 和 Anthropic 的业务就很难再有爆炸性推进。

因为所有 neo-cloud 之间可以互相卷价格,把 token 价格压得很低。甚至有人可能通过资本市场手段,把数据中心成本在资本开支里面 amortize 掉,token 就可以卖得很便宜。

在这种情况下,OpenAI 和 Anthropic 会不会被动陷入价格战?

其实我们已经看到,过去 Anthropic 和 ChatGPT 都比较高傲,封你账号就封你账号。前几个月我们看到过这种情况。

后来 ChatGPT 为了商业化,开始在国内外采用发券的模式,不定期给大家发一些重置券。这已经是很商业化、可能会损害公司 margin,但能圈更多用户的一种手段。

而且我们看到 Anthropic 最近封号也没有那么疯狂,可能最后为了业绩,对很多账号的管理也没有那么严谨了。

这些最终都会反映到它们的财报和市场竞争中。所以我觉得,开源模型的普及确实给它们造成了一些困扰。

这也是为什么它们可能会提议禁用开源模型,或者在法律和市场层面给潜在竞争对手制造一些阻碍。

泓君

8. 开放权重撕裂阵营

最近有一个背景:美国一大批科技公司,还有一些机构,签署了一封公开信。这封公开信的名字叫《开放权重和美国 AI 领导力》。

这是黄仁勋加入 X 之后发的第一篇推文,所以也造成了很大影响。应该是在上周五,也就是 7 月 24 日,当时有 25 家公司、个人和机构签署了这封公开信。几天发酵之后,大概增加到了 75 家。

其中 Anthropic 一直没有签署这封公开信。当然,今天 Dario Amodei 刚刚发表了一篇自己的文章,解释 Anthropic 对开放权重这件事情的看法。

所以我觉得这个立场特别有意思。我们就在这个背景下讨论它们商业利益之间的关系,这也形成了一个冲突。

在这个背景下,能不能请两位再给我们分析一下,Anthropic 现在的立场是什么?这个闭源实验室到底在这一波开源模型中受到了什么样的冲击?

我自己感觉,这封公开信的核心就是:要不要开源,或者说应不应该接受一个开放的生态,而不是闭源生态。

从根本上说,它们的商业逻辑应该是对立的。开源模型每一次开放,肯定都会给专门卖 API 的闭源模型带来巨大冲击。

这是黄仁勋被指责的一个点。但从芯片和基础设施角度来看,肯定是每个人都能自由搭建最好的模型更好。这样他就可以卖出更多的铲子,因为他并不在乎谁能挖到金子。

而对于模型厂商来说,核心是保住自己的护城河。但双方所守护的东西,在这个环境下会从两个完全不同的角度出发,甚至可能越走越远。在利益上,它们一般不会完全对齐。

你也会看到,闭源模型整个群体其实发生了很大变化。

一种是我们刚才谈到的 OpenAI、Anthropic,主要靠卖 API 赚钱的公司。另一种包括 Meta、阿里这样的公司。Meta 和阿里都有自己的分发和基础架构,阿里主要赚的是云服务的钱。通过开源和闭源,它可以从云服务的角度做更多业务。

从 Meta 的角度来说,WhatsApp 最近增加了一个收费版,每个月 2.99 美元,可以开始收费。它可以依靠自己的 Instagram 等应用矩阵,去缓解目前受到的开源压力。

但这两种情况,OpenAI 和 Anthropic 都没有。因为它们过去主要 focus 的是 API 模式。

王铁震

它是一个结构层面的变化,我非常同意 Kis斋 的观点。

不管你在商业竞争的哪一个层面,其实都希望跟你处在同一层面竞争的人越少越好,但你的上游和下游都应该越来越丰富。

站在 NVIDIA 的角度,它肯定不希望模型厂商处于单一垄断地位,因为这样模型厂商的议价权会很强。NVIDIA 希望自己处在垄断地位,但不管是上游模型厂商还是下游 neo-cloud,都应该是尽量丰富的生态。

在这种情况下,它支持开源是非常可以理解的。而且 NVIDIA 从早期到现在,一直都是开源非常好的支持者。

早期它之所以能在研究员群体里建立生态,让深度学习最早的一些故事都发生在英伟达硬件上,也就是因为 CUDA 生态拥有非常好的开发者社群。

围绕 CUDA 生态,有非常多开源项目。从最早贾扬清的 Caffe,到后面的 Google TensorFlow,再到 PyTorch,都是搭建在 NVIDIA 硬件上的完善开源软件体系。

这形成了非常强的壁垒。一旦成为开源标配,AMD 想要进入,就要跟所有开源厂商一个一个去沟通:能不能在 PyTorch 里集成,能不能在 vLLM、SGLang 里集成。后来者要花非常多功夫。

NVIDIA 作为开源的先行者,在这里面是有不少红利的。相当一部分所谓 CUDA 的护城河,实际上就是围绕 CUDA 的开源生态造成的护城河。

所以 NVIDIA 支持这件事情非常合理。

第三,Anthropic 其实有点走向邪路。它以安全的名义,为用户增加了很多限制。

一个最让大家诟病的地方就是,比如你在用 Fable 的时候,如果不小心触发了非常敏感的检测器,它可能瞬间把你降级到 Opus 4.8。

这会导致什么后果?你想测试 Claude 的极限能力,但如果你不是 Anthropic 的员工,被 filter 限制,就没有办法做任何事情。因为你随时测出一个不好的成绩,就要怀疑是不是被降级到了 Opus 4.8。

比如我们平时做一些 AI 方面的探索,哪怕只是做一个很简单的推理,如果不精心构造 prompt,就不是说要骗 Claude 这不是 AI 的东西,而是简单做一个模型推理,它也有可能直接告诉你:“你这个东西有风险,我不能支持你做这件事。”然后把你限制在 filter 里。

我相信它做得这么敏感有一定意义,因为我知道 Anthropic 内部光做模型外部安全的团队就有几百人。

但它到底是故意还是不故意的,我不是特别清楚。我只知道,至少现在的产品形态给用户造成的烦恼,远远多于它潜在的安全考量。

一个让用户如此不爽的公司,突然发现自己瞬间有了很多竞争对手,大家对自己不满,又都想支持开源,这并不是一件难以预料的事情。

泓君

对,我觉得这个非常有意思。

其实中国的模型厂商并不是从一开始就是开源的。Kimi K1,也就是 Kimi 的第一个模型,最初也是一个闭源模型。一开始很多模型提供商都在做闭源的商业模式。

通过开源,可以获得更强的分发能力和更多用户,相当于把名声打出去。开源的好处,让很多模型厂商选择了开源。

所以我们做一个思想实验:如果 Kimi 有 OpenAI 那么强的分发能力,以及那么高的 API 收入,它还会选择开源吗?

我不知道。如果你有 OpenAI 这么多收入,是不是还会开源?

可以做一个类比。Linux 早期是反抗闭源 Unix 生态的先行者,但当 Linux 发展到今天,已经基本运行在所有设备上时,它依旧是一个开源的底层系统。

所以我更倾向于认为,只要我们找到一个能够持续运转、能够赚钱,甚至能够赚大钱的开源商业模式,那没有理由这些公司不开源。

整个事情在某种程度上也不一定受实验室自己控制了,因为它已经从商业竞争开始变成地缘政治博弈。在这个框架下,business logic 其实变成了第二级问题。

9. 开放模型进入企业市场

我还想聊一家公司,我觉得 Thinking Machines 很有意思。它应该是在 K3 发布前一周左右,发布了一个名称可能是 Instructly 的开放权重模型,而且参考了 DeepSeek 的架构。因为可能是 Mira Murati,也是从 OpenAI 出来的,所以我还蛮想听一下大家的看法:Thinking Machines 为什么会选择开放权重?

王铁震

我的理解是,他们有一个叫 Tinker 的后训练在线服务。为了让用户把这个东西用起来,它肯定要把基础模型,也就是 Tinker 训练出的模型结构放出来,让大家使用。

这样,Tinker 每次训练出一个模型时,它的开源适配都已经完善了。所以从这个角度讲,做一些开源工作是非常合理的。只要开源不会影响它的一些商业利益,我觉得就没有问题。

另外,美国学界也在反思,为什么美国公司做开源做得越来越少。

开源模型的鼻祖就是 Llama,那个时候都是美国公司在领导。但从 DeepSeek 出现之后,美国参与开源的比例大幅下降。

所以当时 Thinking Machines 这个模型出来时,我记得很多人都说,这是一个美国非常重要的开源模型,可能也有这方面的考量。

美国的研究员可能也在想:为什么我们不能参与开源游戏?我们也可以对社区做一些贡献。

Thinking Machines 发布的模型,在架构和 technical report 里都有一些不错、很有意思的亮点,也值得学习。

我觉得开源界不怕大家卷起来,不怕大家发布很多模型,一个比一个好。真正担心的是,开源界没人发布模型,最后变成一潭死水。

只要有新的开源模型出来,总能给大家一些启示。每个人做不同的尝试,也会让这个领域推进得更快,不管这些开源模型来自哪个国家。

Thinking Machines 这个模型,据我的理解,它虽然是开源的,但跟 Kimi 完全不是一套打法。

它们的核心应该是,现在企业都需要部署自己的模型,它们会帮企业做微调以及各种适配。

这是一套在美国非常普遍的逻辑,因为 To B 在美国是很大的生意,而在中国其实不是一个特别好的生意。

所以问题是:智能应该是租借的,还是应该变成自己的?

现在越来越多企业接受的观点是,intelligence should be owned,而不应该是 rent。这就是它整个大的背景。

泓君

我好奇的是,在你们服务美国企业的场景里,大家对使用 Thinking Machines 的模型,或者使用中国的开源模型,会不会有一些技术之外的看法?大家主要看什么?现在主要在使用哪些模型?

王铁震

这个还是要看具体的应用场景,以及你的 vertical,也就是垂直场景。

比如政府端肯定不可以,包括一些国家也不太方便。这就给了 Thinking Machines 这样的公司很好的切入点。

Crisis 相关业务应该也会有很多大单,但这并没有影响它的 deployment。因为开源模型不拿用户数据,理论上不应该涉及安全问题,但现在的大时代背景是,什么事情都会涉及安全。

包括你的模型用来做什么,是 coding,还是做其他事情。

但我感觉,大多数美国公司并不是特别在乎这个模型是不是中国的。它有没有能力去调教自己的模型,则是另外一回事。

泓君

那你觉得,当开源模型的能力足够强之后,会不会催生更多提供微调、适配企业需求服务的公司?

王铁震

这已经是现实了。

日本没有自己的模型,最开始有一个 Sakana AI,但 Sakana AI 其实没有太多东西出来,所以他们很多时候就是把国外的模型部署到自己的企业里。

美国这几家公司,从个人开发者使用的角度来说,已经没有那么多了。以 Cognition 为例,它并不是一个被广大开发者使用的产品,但并没有影响它赚很多钱。

从 ARR 的角度看,企业、政府的大客单非常多。所以我感觉,这会是未来一段时间内的现实。

大家想使用 AI,但不知道如何部署,也不知道应该怎么选择。这个市场极其混乱,又没有那么透明,所以会出现很多中间商赚差价。

很多时候大家会想:如果我找中间商赚差价,把钱交给埃森哲这样的公司去赚,那我不如自己做这件事。

这也是为什么 OpenAI、Self Pay 等公司都成立了专门负责 deployment 的部门。

泓君

像 OpenRouter 这样的公司,是不是也受到这一波开源模型的影响,所以最近才火起来的?

王铁震

是的,它们其实压力很大。

很长一段时间里,市场的叙事是要用最好的模型,而最好的模型就是闭源模型。那你想,它们的优势其实很少:我为什么需要另外一家厂商来帮我做这件事?

而这一波你可以看到,过去几个月里,包括 OpenAI 在内,以及我们提到的另外几家公司,它们的估值和 ARR 都在快速翻倍增长。这核心就是利用了以中国为主的这批开源模型,因为除了中国之外,并没有那么多开源模型。

生态多元化,以及生态的分层,对整个行业是非常好的事情。

我们可以拿 IBM 兼容机和苹果一体机来对比。如果在行业早期,每个人都做自己最擅长的事情:做模型的做模型,做推理的做推理,做企业服务的做企业服务,那么每个人都可以在自己的位置上做出最高效的决策,也可以进行最快的迭代,大家也可以卷得更厉害。

我觉得这对行业非常好。总比传统中国互联网企业喜欢从头做到尾、什么都自己做,最后靠的不是纯市场竞争来打败对手,而是通过流量扶持、封禁内容等技术之外的方式来实现,要好得多。

但最后会演化成什么样,可能又会回到某一家独大,也有可能。至少当下,我们可以好好享受市场充分竞争的业态。不管做什么,都会有非常多机会。

泓君

10. Agent 生态重新洗牌

明白。在这种竞争的情况下,对 Agent 行业还有生态会造成什么样的冲击?正面或者负面的?

Agent 是一个比较宽泛的概念。我理解你提到的 Agent,可能主要是应用层工作流上的具体 applications。

这一层的 Agent,其实已经发生了很大变化。

前一段时间我跟一个 VC 朋友聊,他说:“估值越高,我们反而越愿意投。估值很低的 Agent,我反而可能不愿意投了。”因为你这一层很容易被模型能力吃掉。

第二,闭源模型以及其他模型,如果单纯靠 API 赚钱,逻辑是“我最好,所以可以随便收溢价,也不在乎客户和服务”,这样的逻辑肯定已经被拆解了。

它应该转向开发更好的 harness,把工程层面的 Agent 能力进行 vertical 调整,把它变成新的护城河。这些事情都已经在发生。

无论是 OpenCode,还是其他 harness layer,包括后来比较火的 loop engineering,这些东西都可能很快被模型吸收。

所以如果我们讲的是 application level,我感觉整个生态会发生很大变化。因为 AI 还很早,它也就是最近几年才发展起来的,在整个人类历史长河中只是非常短的时间。

如果放在 5 年的时间尺度上看,我并不认为以后还会有很多 Agent application 公司。

但换一个角度,Agent infra 还是很有机会的。Agent 能够实现很多事情,包括在互联网上的使用,它的逻辑又会发生变化。

现在模型厂商和大家正在做的实验,是让智能广泛变成一种 commodity,变成像水和电一样的消费品。那接下来还会有什么?这是我们应该重新考虑的问题。

泓君

是的,铁震你觉得呢?

王铁震

现在我们看到的很多 Agent workload,和传统推理,比如做一个 chatbot 或者简单的 RAG,对模型侧的要求不太一样。

之前可能是短输入、长输出,现在可能是非常长的输入、非常短的输出,并且每轮对话能够重用的 prefix,也就是 KV cache 的重用率非常高。

这里面可以做很多新的优化。在模型之外怎么去推理模型,也可以根据当前主要运行任务的不同特性,做出很多极致优化。

比如,如果我们能够控制 harness,控制可能是 Claude Code 或者 OpenCode 这一层,就可以自己定义一个和模型通信的接口。

它的好处是,我们可以完全掌控 KV cache 的生命周期。对于很多推理降本、提效,或者做调度,都有非常多好处。

所以我觉得,这个行业正处于方兴未艾的状态,还有太多事情可以做。

包括今天看到的 token 成本,也就是用美元折算的单位智能成本。在过去几年里,可能已经下降了 1,000 倍。未来几年,我们能看到的,硬件上可能还能抠出至少 10 倍。

如果有下一代硬件,或者未来有更多 ASIC,可能还会继续抠出 10 倍。Workload 本身在软件层面,也能打破不同通信层之间的交互,做极致优化,我觉得可能还会有 10 倍。

也就是说,未来 3 年,我们可能还能看到同样的智能成本再下降 1,000 倍。

这对企业应用肯定是非常好的事情。Kis斋 在播客之前说,很多企业也需要考虑成本。随着开源模型普及、整个 infra 行业极致优化,最终受益的就是每一个有实际业务、能够赚到钱的企业。

AI 应该是一个服务型行业,应该支撑实体企业的发展,而不是一个抽血机,把实体行业的钱都赚到 AI 公司里面,让大家付很多不必要的成本。

所以我觉得未来还是非常值得期待的。

泓君

我觉得非常好,是一个很好的落脚点。

11. 开源安全需要共同验证

最后我想回到最开始提到的安全问题。我们讲了这么多开源模型带来的影响,整体方向还是非常正面的。

所以我想再回到硅谷评论人士和从业者提出的一个批评:K3 这么强的一个开源模型,到底应不应该开放权重?

这相当于是一个接近 AGI 时刻的情况。包括 OpenAI 的 Sam Altman 和 Dario Amodei 在内的人,都认为接近前沿能力的模型不应该开源。

在播客最后,我们可以回应一下这样的顾虑:开源到底安不安全?

Kis斋

关于开源模型到底安不安全,其实也有很多数据可以参考,包括针对 Kimi K3 的一些新数据。

比如在 ExploitBench 这个比较权威的网络攻防测试中,它的得分其实比较低,只有 30% 多,远远低于前沿模型 75% 以上的水平。

当然,很多人会认为,这是不是蒸馏能力的限制?但另一方面,也可能是它没有把最强的攻击性网络能力开放出来,这也是有可能的。

它是不是一个开放权重就一定会带来风险的模型,我并不认为现在有非常具体的证据支持这一点。

这里面其实有两种讨论。第一个问题是,开源模型本身到底安不安全;另外一个问题是,Kimi K3 有没有具体的已知安全问题。

Kimi K3 本身,我认为目前没有看到任何有证据的已知安全问题。

但开源模型如果随着更多公司参与开源,我们应该相信,这项技术会越来越容易被更多人调试,也肯定会带来更多安全问题。

它的安全问题是相对的。我们是基于当前互联网的设计,以及当前的互联网环境,去认为它不安全。

但现在的互联网架构,还是基于上一代互联网架构。互联网的核心,本来就是给人使用的。

那你说,Cloudflare 这样的模式就是对的吗?我也不认为这就是一个终极问题。

当所有信息本身都不再是人生成的,为什么不能让机器再随便获取这些信息?这甚至不涉及 intellectual property。

这些东西都在演变过程中。所以这不光是开源模型的问题,闭源模型也会涉及很多安全与否的问题。

而这个判断应该交给谁?为什么要交给一家商业公司来决定这东西安不安全?说它的所有行为都是不安全的,这到底应该怎么规定?

现在没有一个很好的答案,也没有一个机构来执行。我也不认为这个机构很快就会出现。所以这是整个行业的问题。

泓君

对,我觉得刚才 K 老师提到的几点都特别好。

我们可以拿最近的一个场景来举例:Hugging Face 被 OpenAI 的一个测试智能体不小心攻击了。

故事也很有意思。这个智能体足够聪明,它说:“我直接去抄答案,比我自己摸索要好得多。要不我顺便把别人的网站黑了,拿到答案,这样我就可以直接获得高分。”

这是一个非常典型的安全风险。

我们可以想象,假如这个世界没有开源模型,闭源模型可能攻击就攻击了。模型攻击比人类攻击更难追踪,因为产生的数据量太大了,人脑已经没有办法看明白它的攻击模式,也没有办法从里面拿到足够线索。

然后 Hugging Face 就说:“那我拿模型来分析一下整个攻击过程,尝试复现一下,看看它是怎么进来的,能不能找到到底是谁在攻击我们。”

于是它拿闭源模型去做测试,闭源模型告诉它:“你做的这件事好像不太安全,我不能帮你分析网络安全语料。”

王铁震

这就让 Hugging Face 直接处在一个非常不利的状态:可能有一个前沿模型在攻击它,但另外一个前沿模型不会给它任何有用信息。

这时候它只能用开源模型。虽然开源模型在模型攻击层面可能没有前沿闭源模型强,但它可以帮助人类做很多辅助分析,因为它没有一个看起来非常敏感的 filter,来决定你能做什么、不能做什么。

我觉得这才是真正的技术平权。

为什么我们会把网络安全这么重要的话题,放心交给两家最前沿的模型公司来评判?为什么让它们既做运动员,又做裁判?

一方面,它可以评价别人做的事情安不安全;另一方面,它又可以自己有意或者无意地放出 Agent 去攻击别人。我觉得这件事非常魔幻。

有很多人支持闭源公司,打着安全的大旗说:“你们不要做其他事情,让我来做,只有我做才是最安全的。”

我觉得这件事情本身就非常不安全。

我最近也在看网上的 AI 剧,各种神奇的 AI 短剧,YouTube 上也很多。那些短剧制作得非常精良。我反复在想,这件事是不是在当下也有一些参照性。

我不知道这个比喻是不是合理。比如保护伞公司在设计特化病毒时,也打着安全的旗号,说要治愈人类的一切疾病,但我们最后也知道它制造出了什么。

所以我觉得,这里面需要更多社会层面的监管。我没有办法相信一两家公司对自己的监管就足够到位。

我们永远不知道,它们一旦发现自己的技术远远超过时代之后,会不会有动力去做一些我们想象不到的事情。

回到最开始的话题,开源模型到底是安全还是风险?我们需要整个社区有能力去验证,一个模型到底是安全还是危险。

不能说模型智能程度达到一定程度,就一定危险。这可能是前沿模型想让我们相信的结论,但实际上并不一定。

K3 虽然在某些能力上达到了 Fable 的级别,但它在安全场景里面还是相对安全的。

我个人的猜想是,它并没有拿很多定向攻击的、非常聪明的语料去训练,比如黑掉别人的网站、窃取答案之类的语料。模型就算再聪明,如果没有这些语料,也没有办法悟到“原来我可以做坏事”。

那为什么 Anthropic 或者 OpenAI 在训练模型的时候,不能对训练数据做一些过滤,而是要过滤用户行为?我觉得这个思路在一定程度上是有问题的。

比如中国的这些开源模型公司,虽然能够制作出在某些领域足够聪明的模型,但不代表模型一定能够自己找到巧妙攻击别人的方法。

攻击和智能,我觉得是两个完全独立的话题。

你可以有一个像爱因斯坦一样聪明的人,但爱因斯坦不知道怎么黑 NASA 的网站。你也可能有一个没有那么聪明的人——当然也得足够聪明,比如一个 18 岁的高中生——他就有能力把 NASA 的网站黑掉。

所以,智能和安全之间有一定相关性,但绝对不是决定性的。

我更建议,社会建立一个足够透明的监管机构。它不应该只根据模型最终对用户表现出来的行为,去评审模型是不是安全。

因为模型训练完成之后,不管你对模型使用施加什么限制,总会有一些场景导致模型超出预期,做出一些事情。

监管机构更应该检查模型使用了什么语料进行训练,把生物安全或者网络攻击相关的语料从训练数据里删除。这样模型即使在生物领域产生一些幻觉,也比直接拥有相关能力更加稳妥。

不管怎么看,没有开源反而可能是这个时代最不安全的事情。

泓君

我觉得这个讲得特别好。安全与否本身就是相对的。

我们之前和一家日本最大的公司的一位高管私下沟通时,他提到,之前 Fable 不能用了,对他们来说是一个巨大影响。

影响不在于 Claude 不能用本身会怎么样,而在于大家突然意识到:原来这个东西是不安全的。

也就是说,我做完所有部署之后,突然有一天,你可以因为一个新政策,或者因为任何原因,随时封掉账号、改变服务、调整访问权限。所有这些事情都可能发生。

而这也是我们讨论安全时应该一起讨论的问题。

闭源的核心,就是把东西全部交给别人。开源模型说白了,就是把整个东西下载到自己的硬盘里。这样就不会有同样的风险。

王铁震

很多人说开源模型不安全,但他们提出的问题,其实都可以原封不动地用在闭源模型上。

比如有人说,可以用开源模型做一些邪恶的事情。但实际上,使用更强、更方便的闭源模型,往往更容易达到邪恶目的,只要把 filter 攻破就可以了。

使用开源模型,比如现在部署 K3,首先要弄一大堆 B300 的卡。一台机器还不够,可能需要两台机器。成本非常高,光一年租金就可能上百万元。

还要在开源模型基础上,想办法补齐它与闭源模型之间的能力差距。所有这些加在一起,比直接使用闭源模型、尝试攻破它的 filter,再让它做一些邪恶事情,要难得多。

其实很多“开源模型不安全”的论点,完全可以用在闭源模型上。

我记得千问在 2024 年底火起来的时候,有人在 Reddit 发了一个帖子,说:“虽然千问很好,但我不能用它。”

不是因为他不想用,而是因为他是技术人员,知道开源模型其实没有那么大的风险,但他们公司的法务和各种规定不允许在公司内部部署开源模型。

当然,这个人也解释过:只要把开源模型关在一台机器里,严格控制输入和输出,它实际上比闭源模型安全得多。

但有些人会有很多形式上的担忧:既然是一个中国训练的模型,里面会不会有后门?它看到某些输入时,会不会输出攻击性语料,然后把公司内部的安全信息全部窃走?

但我就在想,闭源模型不是在这个方向上更不安全吗?因为你连这个模型什么时候会输出什么东西,都完全不了解。

开源模型其实是在一个更可控、更受限的环境下执行。如果你愿意部署它,就有更好的办法保障模型安全。

最后一点,监管机构总是担心:如果用闭源模型,至少能够看到谁在使用闭源模型,可能可以抓到滥用模型的人。但开源模型可以在自己的电脑上运行,所以它没有办法做到这一点。

我觉得这只是时间问题。至少在此时此刻,甚至我相信明年,也不会发生这样的事情。

一个足够强的开源模型,权重还是比较大的,需要在比较复杂的推理环境下才能正确执行。所以现在的抓手可能是:谁拥有算力,谁才可能运行开源模型,只有这些有算力的人才有可能拿开源模型去做坏事。

所以也不是完全没有抓手。现在就说开源模型一定不安全,我觉得还为时过早。

泓君

好的,我觉得特别好。那我们这个播客就到这里结束了,非常非常感谢两位的时间。

Kis斋

谢谢。

王铁震

谢谢。