[BidClub_]
屠龙之术 · · 43 min

Vol.83 25页PPT记录一场中国AI“全明星赛”

庄明浩

Podcast
TL;DR
  • 论坛里一个重要判断是:ChatGPT 这一仗似乎已经打完,下一仗将转向真正“做事”的 Agent。 唐杰将下一仗指向通过 Agent 解决实际问题,智谱过去一年也推进了 Coding 和 Agent;姚顺禹更判断,即使模型研发今天全部停滞,现有能力向 To B 渗透和部署仍可能有 10—100 倍空间。检验商业价值的核心将是任务时长与部署规模,以及“问题价值、运行成本、迭代速度”能否形成平衡。
  • 模型和应用正在沿 To C、To B 裂成两套逻辑:前者趋向强耦合的 All in One,后者更拆分、也更需要强模型。 姚顺禹认为,普通用户今天与一年前向 ChatGPT 提问,答案体感差距未必很大;企业端却在把更强模型持续嵌入业务,钉钉就是典型例子。腾讯的 To C 重点是复杂上下文与记忆,To B 则仅改造自身众多场景就“已经足够大”。
  • 中国三至五年内诞生世界第一 AI 公司的概率,现场最谨慎的数字是林俊旸所说的“20% 可能都是乐观的”。 他判断中美算力相差一至两个量级,美国头部供应商已将更多研发算力和能力押向下一代范式;姚顺禹则相对乐观,理由是电力、基础设施和人才正在跟紧,但光刻机、To B 交付与付费意愿仍是约束。林俊旸甚至担心 gap 是否还在变大。
  • 持续学习已是硅谷共识,但姚顺禹认为它不会由某个产品突然宣告完成,而会是一个渐变过程。 个性化聊天、适应公司代码习惯的 Coding 工具,乃至“Claude Code 自己 95% 的代码由 AI 写成”,都可能是受限场景中的早期形态。林俊旸同时警告:当环境而不只是用户提示词能够刺激模型采取行动,也会引发更多安全问题。
  • 多模态在唐杰口中反而是 2025 年的“失意年”,这意味着 2026 年可能迎来更激烈的补课与投入。 千问已把高级推理、顶尖代码能力和原生全模态并列,并期待实现输入、输出均覆盖多模态的“三进三出”。其图像编辑用两张图叠加检查非编辑区域是否漂移,是比演示效果更硬的工程指标;最新 2.5.1 版本中,这一问题已经得到明显改善。
  • Kimi 的差异化不是堆功能,而是提高 token ROI、扩展超长上下文与记忆,并把创造者的 taste 融入模型创作。 杨植麟称,“一个好的 AI 应该追求什么样的价值”,这种 taste 使模型彼此区分,“它不是商品”。他透露 K3 即将发布,并以“悲观意味着停滞,而乐观即使有风险,也代表着无限的可能性”解释自己的选择。
  • 张钹给出的 AGI 标尺不是更会聊天,而是“可执行、可检验”:多模态理解、在线适应、长期规划、反思与认知、跨任务泛化缺一不可。 相应路径覆盖具身交互、证据落地、知识对齐、工具执行和约束治理;而最重要的治理对象“不是机器,而是人类”。对企业而言,这把竞争从模型能力继续推向知识、伦理与应用能否成为像水电一样可复用、可普惠的基础能力。
Digest · the substance, structured for research

1. 高规格同台给中国开源大模型做了一次路线校准

  • 1 月 10 日的 AGI Next 由清华大学基础模型北京市重点实验室主办、唐杰召集。杨植麟、林俊旸先后演讲,杨强、唐杰、林俊旸、姚顺禹参与圆桌,广密主持,91 岁的张钹总结;现场共有四位院士,开场嘉宾还包括清华大学校长与海淀区委书记。

  • 庄明浩称这套阵容为中国大模型的“全明星首发”,听众则开玩笑叫“元婴强者交换会”。除刚上市、当天晚上应该正忙于年会的 MiniMax、几乎从来不对外露面和表达的 DeepSeek,以及以闭源模型为主的字节 Seed 团队外,产业核心力量已高度集中。

  • 他把现场速记、照片和个人笔记交给 NotebookLM,先生成三四份 PPT,再人工整合成 25 页。这是他第一次在主节目中以 AI 生成的 PPT 作为展示内容;“NotebookLM 做了大部分工作,我做了小部分工作”,本身也成了 AI 进入内容生产流程的注脚。

2. 唐杰把开源成果后的最大风险指向“差距也许还在拉大”

  • 唐杰回顾的演进链条从小模型、大模型、Transformer,一直走到今天的 SOTA;能力则从语言走到 Coding 与 Agent。2025 年,RLVR,即可验证奖励的强化学习,成为主流方向。智谱也做了 Coding 和 AutoGLM。

  • 他最冷静的警告是:“我们的差距也许还在拉大。”美国的大模型更多在闭源方向上演进,中国不能只因开源成果而“沾沾自喜”。

  • 唐杰把 2026 年的第一任务仍定义为探索智能上界:一面沿已知方向 scaling,让基座模型进入 Coding、Agent 乃至物理世界;另一面寻找 o 系列推理之外的新范式。

  • 技术清单则包括新模型架构、超长上下文、更高效的知识压缩、记忆机制与持续学习、多模态融合、复杂任务 Agent、机器人和 AI for Science。其中“模型自主学习”被他视为 AI 超越人类、走向超级智能的关键,也成为全天被重复最多的关键词。

3. 杨植麟把 Kimi 押在 token 效率、长内容与模型 taste

  • 杨植麟以“回归第一性原理,推动 AGI 的边界”为核心表述,把 Kimi 的训练路线压缩为两件事:提高 token 效率,以及处理超长内容、上下文和记忆。他提到,这一轮 AI 智能的提升本质上是“从能源到智能”,因此特别强调 token ROI。

  • 他认为,做模型的人实际上会把自己的品味融入模型的创作过程:“一个好的 AI 应该追求什么样的价值?这种 taste 将一个模型与另一个区分开,它不是商品。”

  • 谈及如何与 AI 相处,他说:“我选择乐观,因为悲观意味着停滞,而乐观即使有风险,也代表着无限的可能性。”他把 AGI 的终极愿景指向科学、健康与能源等未知问题,并提及现在明显是 K2,马上还会发布 K3。

4. 千问把 2026 年的胜负手押向原生全模态

  • 林俊旸首先建议用户通过 chat.qwen.ai,而不是 App 体验千问的各种模型能力。千问从 1.8B、7B、72B 到中间可能还有 3B、4B 等众多尺寸,是一次次响应客户需求的结果。

  • 其当前核心被概括为高级推理与上下文、业界顶尖的代码能力,以及“真正的原生全模态能力”。林俊旸期待千问在 2026 年实现“三进三出”——输入和输出都覆盖多种模态;他的价值判断也很直接:“如果做大模型不是为了全人类来做,就不要做了。”

  • 图像生成的示例不是单张漂亮图片,而是一幅可能有十二宫格的“人的一天”:每格同时生成固定时间、对应文字与人物动作。林俊旸借此说明,图片模型正在获得类似 Nano Banana 那样的理解能力,而不只是根据关键词合成视觉元素。

  • 更硬的检验来自社区:让女模特放下右手,再将编辑前后两张图叠加,若除手臂外的衣服、身体与面部也发虚,就说明未编辑区域发生漂移。千问据此迭代,在最新 2.5.1 版本中发现漂移问题已得到很好的改善;这个工程细节也让庄明浩期待其在多模态和全模态领域的进展。

5. 大模型赛道正沿 To C 与 To B 裂成两套逻辑

  • 庄明浩对姚顺禹以腾讯 AI 一号位身份公开亮相的最大观察,是他回答四个问题时都先切分 To B 与 To C。这种强烈的边界感,可能来自他加入腾讯后与管理层、业务部门及中国 To C 互联网场景的交流。

  • 姚顺禹判断,To C 用户今天问 ChatGPT 一个问题,与一年前得到的回答未必有巨大体感差距,用户不一定始终需要最强模型;To B 却在使用更强模型,并把它们更深地嵌入业务,钉钉就是典型例子。应用层也随之分化:To C 强耦合并走向 All in One,To B 的拆分会更强烈。

  • 被追问腾讯究竟在押注什么时,他仍以两端作答:To C 的核心是复杂上下文与记忆;To B 更难,但腾讯自身已有大量场景和业务,仅将模型能力用于内部生产力提升,空间就“已经足够大”。

  • 其他嘉宾给出了不同切面:林俊旸强调从真实用户需求出发,并认为公司未必有固定基因,“一代一代的人可能会塑造这些公司”;杨强看到产业界快速奔跑后,学术界正在跟上;唐杰则判断“似乎 ChatGPT 这一仗已经打完”,下一仗是 Agent 做事。

6. 持续学习已成共识,但它更像渐变而非单点突破

  • 姚顺禹说,硅谷对自主学习已有共识,但 online learning、continual learning 的概念仍然模糊,每个人谈的可能不是同一件事。他倾向于认为这不是单一方法论或崭新研究范式,而是数据、任务以及相应奖励函数的问题。

  • 个性化聊天工具会逐渐拟合用户风格,Coding 工具也会越来越了解一家公司的代码习惯;这些是否已经算持续学习?他又举出两个边界案例:ChatGPT 用用户数据拟合聊天风格,以及“Claude Code 自己 95% 的代码是 AI 写的”。他认为在一些特定场景下,持续学习或自主学习其实已经发生,只是受限于具体场景。

  • 林俊旸指出,国内几家模型厂商的 RL 算力投入没有那么激进,xAI 等海外玩家则把大量算力压在强化学习上。AI for Science 让模型自己找材料、确定问题、通过实验得到结果并产出报告,这个过程本身似乎也是一种学习过程;但当环境能够主动刺激模型时,也会引发更多安全问题。

  • 唐杰相对乐观,认为 2026 年可能出现范式创新:scaling 的效率瓶颈已经显现,学术界也开始积累经验,尽管学校算力可能仍比产业界少一个数量级。对模型公司而言,真正的决策是如何在固定算力投入下统筹预训练、后训练、新数据和新范式的投入产出比。

7. Agent 的经济价值先在 To B 兑现,再向物理世界延伸

  • 姚顺禹认为 To B 曲线会“肉眼可见地持续上升”:哪怕所有模型研发立即停滞,仅凭当前能力继续做渗透和部署,也仍可能存在 10—100 倍空间。2026 年大家预期 Agent 执行任务的时长会变得更长,也会做更多部署工作。

  • 人与 Agent 合作越深入,教育越重要,因为如何发挥人类的能力、帮助 Agent 变得更好,将成为关键。庄明浩把它与田渊栋所说的“费米能级”联系起来:一个人能让 AI 变得多好、多强,可能决定其未来价值。

  • 林俊旸认为 Agent 当前主要运行在电脑环境,2026 年会更多进入非电脑环境,自然延伸至机器人和具身智能。杨强则以目标和规划由人还是机器产生等方式划出四个象限,认为今天看到的很多位置仍处于早期第一象限,其他象限仍值得期待。

  • 唐杰把应用成功收束为三个必须同时成立的变量:“解决问题的价值、运行的成本以及迭代的速度。”Agent 能否创造经济价值,不只看能力上限,还取决于每次运行是否值得,以及能否快速迭代。

8. 世界第一 AI 公司的中国概率,现场从乐观落到“20% 都乐观”

  • 姚顺禹对未来三至五年相对乐观:在电力、基础设施和人才等要素上,中国“跟得很紧,并且越来越紧”。他同时保留光刻机、To B 市场交付和付费意愿等现实约束,但认为这些问题仍可能出现转机;他期待越来越多具有冒险精神、能够做创新的人才出现。

  • 林俊旸明显更谨慎,判断中国在算力层面相比美国差了一至两个数量级,而且美国头部供应商已将更多研发算力和能力投入下一代范式。阿里芯片负责人曾提前三年询问未来是否仍是 Transformer、是否仍做多模态,因为流片周期就是三年;林俊旸当时的回答是:“三年之后我在不在阿里都不知道。”

  • 当广密要求给出明确概率时,林俊旸说“20% 可能都是乐观的”,并担心 gap 是否还在扩大。唐杰没有给数字,而把必要条件归纳为一群聪明且敢冒险的人、更好的营商环境,以及更多人愿意在“偏笨的事情”上长期坚持。

9. 张钹把可检验 AGI 的终点落在治理与企业家责任

  • 张钹要求从语言模型走向 Agent、从语言走向行为,在复杂环境中完成复杂任务。他给“可执行、可检验的 AGI”列出五项能力:时空一致的多模态理解与落地、可控在线学习与适应、可验证推理与长期规划执行、可校准的反思与认知,以及跨任务强泛化。

  • 相应研究路径包括多模态、具身与交互、检索与证据落地、结构化知识对齐、工具执行与落地,以及对齐与约束。这些路径与上述能力可能存在对应关系。

  • 他把 AI 主体性分成三层:从功能走向行动主体,走向规范与责任主体,最终才是可能具有意识与体验的主体。站在终局倒推,当务之急仍是对齐和治理,而且“最主要的治理不是治理机器,而是治理人类”。

  • 张钹称 AI 企业提供的不再只是产品和服务,而是让知识、伦理与应用成为可复用工具,最终让人工智能像水和电一样成为通用技术;企业家因此是“光荣而神圣的职业”,也必须承担治理、普惠与可持续增长责任。91 岁的他听会期间仍去休息室修改最后的 PPT;庄明浩则以“我只是一个记录者”自况,并借“做‘真的’可能是唯一的出路”收束这次现场记录。

庄明浩

大家好,我是明浩。现在是北京时间1月11日凌晨0点24分,我刚从北京飞回上海,到家了。

在刚刚过去的1月10日,也就是这个星期六,我去参加了一场在北京举办的活动,叫 AGI Next。如果你关注 AI 行业,应该在卡兹克、赛博禅心、机器之心、新智元、腾讯科技、36氪、凤凰科技等平台上都看到了相关推送。北京举办了一场非常重要的 AI 论坛,我去参与了这场论坛。

这可能是少有的、我觉得整场活动非常干、非常紧凑,嘉宾阵容也非常强的一场活动。我在现场认真听完了所有内容,觉得需要跟大家分享一下,所以有了今天这期节目。

我之前也在极客公园和我的粉丝群里跟大家说,我正在准备这个内容。今天下午的活动大概5点半多结束,我打车去了机场。在去机场的路上,我把这场活动的速记——你们现在看到的绝大部分公众号推送内容,应该都来自于现场速记——以及我的照片、我在日记里记录的一些纪要和观点,全部放给了 NotebookLM,让 NotebookLM 生成了几个 PPT 文档。

然后我基于这三四个 PPT 文档,又做了加工和整合,形成了现在这份25页的 PPT。这可能也是我第一次真正意义上在播客、在自己的主节目里,用 AI 生成的 PPT 来作为展示。我觉得这似乎也可能是一个比较关键的节点。

今天这期播客也是我在2026年的第一期播客。虽然说“新年快乐”有点晚了,但还是要说一声,祝大家新年快乐。现在正式开始今天的内容。

NotebookLM 起的标题,其实是我给它的建议。这个标题叫《一场亲历的中国 AI 全明星赛:AGI Next 峰会前沿观察与思考》。

首先,我是在昨天下午大概6点左右接收到这份邀请的。智谱的小伙伴跟我说,他们有这样一场活动,觉得我可能会有兴趣,问我能不能过去。

本来我今天安排了一件很重要的事情,就是带我的儿子小庄去参加一个比赛。后来我临时跟老婆商量了一下,我们家还有老二,还好老二周六的课不是太多,就让老二周六请了假。

他那个比赛早上8点要签到,所以我们一家人早上6点多起床,收拾了一下,7点多出发。我带着他们几个到了我儿子比赛的现场,把他们送到那儿、安顿好之后,就直奔机场,坐早上的飞机,中午落地北京,参与到这场论坛里。

我觉得这一切都是值得的。当然,也很感谢我的太太给我这样的空间。

这场活动叫 AGI Next 前沿峰会,主办方是清华大学基础模型北京市重点实验室,智谱首席科学家唐杰教授作为召集人,召集了这些嘉宾。

当天的嘉宾包括谁呢?第一个开场发言的嘉宾当然是唐杰,清华大学教授、智谱创始人,也是智谱的首席科学家。第二位是杨植麟,月之暗面 Kimi 的 CEO。第三位是林俊旸,这个名字可能对一些不太了解行业的人来说有些陌生。他是千问的技术负责人,你可以理解为,在今天这个时间点,他是千问大模型技术的一把手。

当时我看到邀请函上的这三位嘉宾,就觉得这个论坛的阵容和嘉宾状态不得了。

在三位演讲嘉宾发言之后,还有一个论坛环节。论坛嘉宾包括杨强院士、唐杰、林俊旸和姚顺禹。姚顺禹就是刚刚接手腾讯 AI 大模型业务的一把手,之前是 OpenAI 的研究员。

更重要的是,这场论坛的主持人是广密,也就是“硅谷和哈佛教授”项目的创始人。如果大家听张小珺的播客,应该知道小珺和广密每个季度的大模型季报,几乎是这个行业里所有人都会听的内容。

所以,当我看到姚顺禹和广密的名字出现时,内心其实就在纠结:这是一场非常值得去的活动。

最后,这场活动由清华大学张钹院士作总结。张钹院士也是清华大学人工智能研究院的负责人,已经91岁高龄。其实我之前上过一个清华的班,张院士给我们讲过课。他可能是中国当前人工智能领域最德高望重的一位院士。

看到这里,把这个阵容称之为“全明星”,应该没什么毛病吧?后来我把邀请发到群里,粉丝群里有人说,这是“元婴强者交换会”。如果你不看《凡人修仙传》,可能不太能理解这个梗。《凡人修仙传》最近的剧情是,主人公升到了元婴境界,元婴强者开了一个大的集会,所以他用这个梗来形容这场活动。

NotebookLM 的总结是:群星璀璨,中国大模型领域的首发阵容。

当天现场开场的时候,唐杰教授在介绍嘉宾。我数了一下,除了张钹院士之外,还有另外3位院士坐在下面,所以整场活动一共有4位院士。

整场活动的开场嘉宾是清华大学校长,第二位发言嘉宾是海淀区区委书记。你就知道这场活动的规格了。

产业内的核心玩家包括唐杰、杨植麟、林俊旸、姚顺禹和广密。这个阵容基本集齐了中国大模型领域的核心力量,除了刚刚上市、当天晚上应该正在忙年会的 MiniMax,以及几乎从来不对外露面和表达的 DeepSeek,还有以闭源模型为主的字节 Seed 团队。

因为这场活动更多还是在讲开源,主题是 AGI Next 的关键路径与中国的开源影响力,所以字节没有参加也合理。除了这几家之外,我觉得这已经是全明星首发级别的阵容了。

我们一个个看。首先是3位演讲嘉宾:唐杰教授、Kimi 的杨植麟,以及千问的林俊旸。

1. 唐杰警告差距拉大

唐杰教授演讲的标题叫《让机器像人一样思考》。他的逻辑是,是否能够、或者说他一直以来的学术研究方向,都是从人的角度出发,让机器成为一种类似人的状态。

他总结了过去这些年 AI 大模型的发展:从最开始的小模型到大模型,从 Transformer 到今天这个时间点的 SOTA;从语言走到 Coding,走到 Agent;到了2025年,大家都在强调 RLVR,也就是可验证奖励的强化学习成为主流。

他也提到,智谱在今年做了 Coding 和 AutoGLM,在 Coding 领域的进展也很强。

但在唐教授整个演讲过程中,有几句话让我印象很深。他表达了一个观点:我们的差距也许还在拉大。这里的“我们的差距”,指的是相对于美国开源模型的差距。

他说,美国的大模型更多是在闭源方向上演进,我们不能仅仅因为开源成果而沾沾自喜。从这个角度来说,无论是作为科研人员,还是作为一家产业公司的核心创始人,我觉得这个认知还是非常谨慎的。

在唐教授演讲的最后,他放了一页叫《2026年的专注与创新》。我觉得这页内容基本上代表了,不仅仅是智谱,可能也是今天市场上大部分头部模型公司在2026年的研究重点。

第一件事情,是探索智能上界仍然是 AGI 最本质的事情。对已知方向进行 scaling,仍然是基座模型的关键,比如 Coding、Agent,甚至物理世界;而对于未知方向,要探索除了 o 系列、也就是推理之外,新的范式是什么。

第二点是技术创新,包括全新的模型架构、解决超长上下文、更高效的知识压缩,以及记忆机制与持续学习。模型自主学习,是 AI 超越人类、实现超级智能的关键。

持续学习,或者叫自主学习,是今天这场论坛被提及最多的关键词,没有之一,后面会无数次讲到。

此外还有多模态融合、Agent 完成复杂任务、机器人,以及 AI for Science。AI for Science 也是这场论坛聊到比较多的话题,可能因为这是一个更偏学术的论坛,所以大家会讨论这些内容。

这些关键词,基本上代表了在这个时间点,主流模型厂商对于2026年的期待。其实我还在准备一个1月底的超长 PPT,内容是关于模型进展和2026年趋势的演化,基本上还是这些内容。

这是唐杰教授。下一位是 Kimi 的杨植麟。

2. Kimi押注长上下文

我刚才回来的时候,刘军老师他们已经推送了一篇文章,是关于 Kimi 创始人杨植麟演讲的。其实大部分科技媒体都发了杨植麟演讲的全文,大家有兴趣可以去看一下。

因为这是一场偏技术的论坛,又是唐杰教授组织的,所以唐杰教授在邀请所有嘉宾时都会说,这场论坛偏技术。杨植麟也遵守了这个规则,他整场演讲几乎都围绕 Kimi 的训练方式、方法和路径,以及可能得到的结果展开。

他当时的说法是:回归第一性原理,推动 AGI 的边界。其实这件事情跟刚才唐杰教授在2026年展望中讲的第一条是一模一样的。

Kimi 在这件事情上,核心只做两件事:一个是 Token 的效率,另一个是长内容,或者说超长上下文、记忆的问题。

在杨植麟整个演讲的最后,除了这些技术内容之外,如果大家有兴趣了解,可以去看腾讯科技的推送,应该有杨植麟演讲的全文,我就不展开了。

我只说一些自己印象比较深的内容。比如说,杨植麟最后谈到,模型具有独特品味的创造。他认为,在今天这个时间点,做模型的人,本质上是在把自己的品味融入模型的创作过程中。

他说,一个好的 AI 应该追求什么样的价值?这种 taste 会将一个模型与另一个模型区分开,它不是商品。

演讲最后,他分享了一段自己和 Kimi 的对话。大概意思是,他想问 Kimi:AI 发展得这么强,到底我们该怎么与它相处?会不会担心很多事情?

杨植麟说:“我选择乐观,因为悲观意味着停滞,而乐观即使有风险,也代表着无限的可能性。”

他的终极愿景,是将 AGI 作为探索未知的终极工具,用于解决人类在科学、健康、能源等领域的宏大挑战。

他还提到,马上他们会发布 K3。因为现在明显是 K2,未来可能还有 K4,甚至 K100。

这是杨植麟。第三位是林俊旸。

3. 千问走向全模态

我觉得,或者说今天整场论坛下来,林俊旸是圈粉最多的一个。他的表达非常犀利、有趣,也很直接。他的年纪应该跟杨植麟差不多,都是1993年左右。姚顺禹应该是1998年的。这一批创始人和核心负责人真的非常年轻。

林俊旸演讲一开始就提到,如果要体验千问的各种模型能力,推荐大家使用 chat.qwen.ai,而不是使用 App。大家如果知道最近阿里整个架构的调整,应该知道他为什么会强调这一点。

他还解释了,为什么今天这个时间点千问的模型尺寸特别多。因为这是一次次面对客户的要求,从最开始最小的 1.8B,到 7B、72B,中间可能还有 3B、4B 这样的模型。

在今天的陈述过程中,林俊旸把比较多的篇幅放到了多模态上。相较于智谱和 Kimi,千问的多模态能力确实走得更远一点。他也提到了一些推理和 Coding。

在核心逻辑上,林俊旸说,千问是在真实世界的需求中迭代核心技术。现在做的是高级推理、上下文、业界顶尖的代码能力,以及真正的原生全模态能力。

这可能是林俊旸相较于杨植麟和唐杰教授更多强调的一个观点,就是多模态或者全模态。

在整个全模态进化过程中,他特意强调了他们过去一年在图像领域的进展。比如在图像推理能力上,他举了一个例子:模型可以生成一张可能有12宫格的照片,代表一个人的一天,展示这个人在每天固定的时间做什么。对应的时间、行为文字,以及当时的动作本身,可以在一张图里一次性生成出来。

这代表图片生成已经有了类似 Nano Banana 那样的理解能力。

他还讲了另一个更有意思的例子。他们把图片编辑能力开源到社区之后,一些开源社区的技术贡献者提出了一个他们原来完全没有想到的角度。

他举的例子是,有一张图里有一个女性模特,她举着右手。你给模型下指令,让它把右手放下来,于是就生成了第二张结果。

然后他们把这两张图混合在一起,会发现那张图有些发虚。这个“虚”就代表,除了被挪下来的右手之外,模特身上的其他部分,比如衣服、身体部位和脸部特征,其实都出现了漂移。

如果用 Photoshop,除了被放下来的右手之外,其他部分应该可以贴在一起,这才是一个合理的、合格的图片编辑功能。

所以,他们在改进模型的过程中,就通过这样的方式去验证模型有没有改进。在最新的 2.5.1 版本里,他们又做了类似的实验,发现漂移问题得到了很好的改善。

你想,他为什么会把这件事放到这么重要的场合上来讲?我觉得大家似乎可以期待一下,千问在2026年于多模态和全模态领域的进展。

以上是3位发言嘉宾的内容。科技媒体上应该也有一些媒体发了他们演讲的全文,有兴趣可以去翻一下。

接下来我稍微再多讲一讲那场论坛。确实,这场论坛可能更是我期待的内容。甚至在我们过去几个小时看到的公众号推送里,很多公众号应该都选择把这场论坛的速记作为核心内容推送出来。

如果我没记错的话,卡兹克、机器之心,还有其他一些媒体也都做了相关报道。

当天现场并没有给这场对话起名字,但 NotebookLM 起了一个名字,叫《AGI 的下一个篇章》。

广密针对4位嘉宾的背景,设计了4个我觉得非常好的问题,而且每个人都问到了关键点。

这4位嘉宾里,杨强比较特殊,他是加拿大皇家科学院院士、香港科技大学荣休教授,所以更偏学术。但另外3位,唐杰、林俊旸和姚顺禹,完全是产业界从业者。当然,唐杰教授也有学术身份,但更多是作为今天智谱的首席科学家参与这场会议。

这4位嘉宾的角色、年纪、位置和行业经验完全不同,或者说不尽相同。针对这样的嘉宾构成,设计了4个偏通用的问题,我觉得广密的能力还是非常强的。

这4个问题分别是:第一,赛道的分化。今天你会发现,虽然大家都是大模型公司,但大家押注的东西出现了变化。

第二,下一个范式。刚才前面提到的自主学习,或者叫 continual learning,似乎已经成为共识。

第三,Agent。大家会认为,Agent 经过2025年的发展之后,2026年是一个非常重要的年份,期待 Agent 真正带来所谓经济价值的爆发。

第四个问题更宏观,也更强烈,是中美对抗的问题。广密问几位嘉宾:3到5年之后,世界上最领先的一家公司有没有可能是一家中国公司?这个概率是多少?如果有可能,为了达到这个目标,我们需要什么样的条件?

我们一个问题一个问题看。

首先,很多媒体很默契,大家选择了差不多同一张照片作为这条新闻的头图。这张照片就是姚顺禹的大头照。

为什么是他的大头照呢?因为当天现场姚顺禹没有到场,他是在线参与。论坛现场有广密和3位嘉宾,姚顺禹的腾讯会议头像显示在屏幕上,所以头显得特别特别大。

大家就开玩笑说,这位腾讯 AI 巨头参与了这场会议,真的是非常非常“巨”的巨头。

这应该是姚顺禹入职腾讯之后第一次公开亮相,也可能是当天现场很多人期待听到他表达的原因。

这位年仅28岁的中国最大互联网公司 AI 一号位,看起来有一点紧张。但随着讨论深入,我觉得他答得还是不错的。

4. 巨头分化成为现实

先看第一个问题,关于赛道分化和每家巨头的选择。姚顺禹被第一个问到。

今天在现场,我跟《晚点》的曼琪聊天时,她也问我,听完这个论坛之后觉得姚顺禹怎么样,有什么想到的点。

我觉得自己想到的唯一一个、也是最重要的点是:今天有4个问题,每个问题姚顺禹的回答方式和逻辑几乎一模一样,或者说他的切入点一模一样,就是把所有问题分成 To B 和 To C。

我们似乎可以推演,在过去一段时间,也就是他加入腾讯之后,跟腾讯管理层、业务部门和同事交流的过程中,他可能或多或少受到了很多中国 To C 互联网经验的熏陶,所以在这件事情上有非常强烈的界限感。

这是我最大的感受。

广密问的第一个问题是:怎么看巨头之间的分化?

姚顺禹的回答是,从结论上来说,在今天这个时间点,To B 和 To C 是分化的。

在 To C 领域,今天我们去问 ChatGPT 一个问题,和一年前去问它一个问题,得到的答案差别没有那么大。似乎 To C 用户并不真正需要一个那么强的模型。

但 To B 领域恰恰相反。To B 领域正在使用越来越多强大的模型,并且让越来越多的强模型深入业务当中,钉钉就是最典型的例子。

他同时说,模型和应用层也出现了分化。在 To C 领域,模型和应用的耦合性会更强,所以出现了类似大一统、All in One 的趋势;但 To B 领域的拆分会更强烈。

顺着这个问题,广密又追问姚顺禹:你今天加入腾讯之后,作为腾讯 AI 一号位,你在押注什么?

姚顺禹依然用 To B 和 To C 的角度拆分。他说,To C 领域的核心还是复杂上下文和记忆;To B 领域更难一些,他没有展开太多。

但他说,腾讯是一家拥有非常多场景和业务的公司,所以提升自身模型能力,并将其应用到已有场景和业务中来提升生产力,这件事情本身已经足够大了。

这是他的答案。

第二位回答的是千问的林俊旸。俊旸说了一句很有意思的话:虽然他是千问的技术负责人,但似乎也不能代表公司;反过来讲,他觉得姚顺禹也不能代表腾讯。

他的表达是,在今天这个时间点,每家公司的核心,或者说每家公司未来的发展,可能都不一样。他在主题演讲里提供了一个角度,就是更多从用户角度去思考,如何服务好用户可能还是更重要的事情。

杨强院士的观点是,因为他来自学术界,所以他认为今天学术界和工业界、产业界之间也出现了比较大的分化。产业界在快速奔跑,但学术界在过去一段时间开始慢慢跟上。

最后是唐杰教授。唐杰教授说,似乎 ChatGPT 这一仗已经打完了,下一仗应该是“做事”,也就是通过 Agent 解决实际问题、实现差异化。

这似乎也可能是为什么智谱在过去一年比较积极地推进 Coding 和 Agent 领域的演进。

这是第一个问题,关于分化。

5. 自主学习正在发生

第二个问题是关于范式的:下一代范式到底是什么?有没有什么苗头?

依然是姚顺禹第一个回答。他说,在硅谷,自主学习基本上已经成为共识。但他认为,今天大家讨论 online learning 和 continual learning 的时候,其实概念也是模糊的,每个人都在说自己的角度,这可能和 AI 行业过去几年很多概念的情况一样。

他的第一个观点是,online learning 或者 continual learning 可能不是一种方法论,也不是一个新的研究范式,而是数据、任务,以及包括数据和任务在内的奖励函数。

他会认为,这更多是数据和机制模型的问题。比如今天各种聊天工具变得越来越个性化,这个个性化的过程,其实也是一种广义上的 continual learning。

再比如,AI Coding 工具随着使用越来越多,也越来越了解每家公司代码的倾向和习惯,那这算不算自主学习?

他的第二个观点可能是一种非共识。他说,ChatGPT 用用户的数据拟合聊天风格,从这个角度来说,有一种非共识是:ChatGPT 用用户数据拟合聊天风格,算不算自主学习?

今天世界上最好的 AI Coding 工具 Claude Code,它自己95%的代码都是 AI 写的,那它算不算自主学习?

所以,他觉得在今天这个时间点,在一些特定场景下,持续学习或者自主学习其实已经发生了,只不过受限于具体场景。

他认为这是一种渐变过程,不会因为突然有某一个事件、某一个产品或者某个东西做出来,就说“这就是自主学习”。他认为不是这样。2025年其实已经出现了很多信号。

林俊旸的观点,则是从另外一个角度来解读。

他说,RL 的算力,也就是强化学习的算力,在国内几家大模型厂商中的分布并不多,没那么激进。但在海外,尤其是像马斯克的 xAI,很多算力都投入到了比较激进的强化学习领域。

如果把这个角度继续往前推演,他说,大家讨论的 AI for Science,就是让模型自己去研究一件事情:寻找材料、确定问题、解决问题、通过实验得到结果,甚至产出报告。这个过程本身似乎也是一种学习过程。

但他也说,这个问题就是主动学习的反面,可能会引发更多安全问题。今天大家是通过用户的提示词,让模型产生答案;如果未来环境本身也能给模型产生刺激,那么模型在自己做一些事情的时候,必然会产生安全问题。

这是他的观点。

唐杰教授则是偏乐观的观点。他认为,2026年可能会出现新的范式创新,因为 scaling 效率的瓶颈已经是所有人都看得到的事情,学术界的深入研究也跟上来了。

虽然学校的算力卡可能比业界少一个数量级,但至少学术界已经开始积累经验,也做过一些尝试,所以从逻辑上讲,应该会有一些新的东西出现。

唐杰教授在这件事情上比较乐观。

他认为,更重要的是,对于一家模型公司而言,如果每年的算力投入是一个固定值,那么今天要考虑的就是,究竟应该把算力投入预训练、后训练、新数据训练,还是其他新的方向。需要有全局思维,整体考虑投入,考虑投入产出比。

第三个问题,是 Agent 创造经济价值的关键点。

大家会认为,2026年 Agent 执行任务的时长会变得更长,也会做更多部署相关的工作。

首先还是姚顺禹。他认为,To B 的这条曲线应该会肉眼可见地持续上升。他甚至举了一个更极端的例子:哪怕今天所有模型研发都停滞了,模型能力就停留在现在这个水平,仅仅基于现有模型能力做更多渗透和部署,在 To B 领域依然可能有10倍到100倍的空间。

他认为,在新的时代,人类和 Agent 的合作中,教育变得更重要。如何发挥人类的能力,帮助 Agent 变得更好,这件事情更重要。

这可能和最近另一位刚刚离开 Meta 的技术大神田渊栋在知乎上发布的《二〇二五年总结与展望》中的内容相互呼应。他提出了一个观点:类似“费米能级”这样的概念,决定未来人类价值的,是一个人到底能让 AI 变得多好、变得多强。

在这个问题上,林俊旸的角度是,今天这个时间点,Agent 更多还是运行在电脑环境下。肉眼可见的是,2026年大家会越来越多地尝试电脑之外的环境,也就是物理世界的环境,自然而然地就会引出机器人和具身智能。

杨强院士说,如果按照目标和规划,以及是人为的还是机器自动的方式来划分四个象限,那么今天我们看到的很多位置,还处于比较早期的第一象限阶段。未来其他几个象限的发展,依然非常值得期待。

唐杰教授的观点是,一个 AI 应用的成功,取决于3个要素之间的平衡:解决问题的价值、运行的成本,以及迭代的速度。

6. 中国冲击世界第一

最后一个问题,广密问了一个更直接的问题:未来3到5年,中国是否会诞生世界第一的 AI 公司?如果希望达成这个目标,我们需要做些什么?有哪些关键要素需要补充?

姚顺禹的观点比较乐观。他认为,我们在电力、基础设施、人才等很多因素上,都跟得很紧,而且越来越紧。

当然,也会有一些客观现实因素,比如光刻机,以及 To B 市场的交付情况和付费意愿。但这些事情可能会出现一些转机。

他期待的是,越来越多具有冒险精神、能够做创新的人才出现。

这是姚顺禹的观点。

林俊旸的观点相对冷静一些。他认为,我们在算力层面上,相比美国肯定差了1到2个数量级,而且美国的头部供应商已经把更多研发算力和能力投入到了下一代范式的研发上,但我们还不是。

他举了一个例子:之前阿里的“光头哥”,也就是芯片业务负责人,曾经找到林俊旸,问他3年之后未来是不是还会是 Transformer,是不是还会是多模态。

林俊旸当时回答说,3年之后我在不在阿里都不知道了。

为什么是3年这样一个周期?因为当时那位负责人说,3年是我们流片的时间。

所以,似乎我们在这件事情上确实存在一定差距。

广密又追问林俊旸:你觉得这个概率到底有多大?

林俊旸说,20%可能都是乐观的。

我觉得他的判断相对悲观一些,他甚至在担心,这个 gap 是否还在变大。

最后,唐杰教授做类似总结的时候说,他更期待的,是像姚顺禹刚才讲的那样,一群聪明的人敢于冒险;同时拥有更好的营商环境,希望越来越多的人在一些偏笨的事情上坚持下去,最后能够得到一些好的结果。

这是唐杰教授的期待。

到这里,今天整场论坛的演讲和圆桌讨论基本结束。

7. 张钹定义可检验AGI

最后一个环节本来是总结,但意外的是,91岁的张钹院士做了一个非常精彩的总结。他的观点叫《超越语言模型:通往可检验 AGI 之路》。

他似乎把我们前面聊到的很多事情,都做了一个更精炼的总结。当然,张院士之前应该做过很多类似的演讲,可能很多观点也不是今天才有,但他把很多东西收束得更加清楚。

还有一个现实问题是,张院士最后一个发言,所以他的速记最后才发出来。很多媒体发稿的时候,还没有拿到他的速记,因此很多媒体文章里并没有记录张院士到底讲了什么。我稍微展开讲一下。

第一个观点似乎不需要过多论证:我们要从语言模型走向 Agent,去做复杂环境下的复杂任务,也就是从 LM 到 Agent,从语言到行为。

那么,一个可执行、可检验的 AGI 定义到底是什么?张院士认为,它需要具备5大关键能力。

第一,时空一致的多模态理解与落地。他把多模态放在了第一位,并且加了一个非常重要的形容词,叫“时空一致性”。

第二,可控的在线学习与适应。

第三,可验证的推理与长期规划执行。

第四,可校准的反思与认知。

第五,跨任务的强泛化。

他认为,这些是今天这个时间点、未来一段时间需要解决的问题。

那如何解决这些问题?张院士说,可能有6个路径或者6个研究方向。

第一,多模态。第二,具身与交互。第三,检索与证据落地。第四,结构化知识对齐。第五,工具的执行与落地。第六,对齐与约束落地。

这6件事情,可能分别和刚才提到的5项关键能力存在一定对应关系。

这个问题还可以上升到更高的高度。毕竟张院士是做学术研究的,他认为,在哲学层面,人工智能可能成为未来世界的主体存在,那么人类到底该如何与人工智能相处?

这个问题其实也是很多人探讨过的问题。他认为有3层。

第一层叫功能到行动主体。AI 有了功能,这件事情今天其实已经达到了,并且还在不断提升。

第二层叫规范与责任主体。也就是当它真的很强时,它的规范和责任到底是什么样的。

第三层是最科幻的想象:它真的有了意识,有了所谓的体验之后,我们人类该如何与它相处?

他认为,从这个角度去思考,从终局去思考,当务之急还是对齐与治理。

最主要的治理不是治理机器,而是治理人类,也就是今天深夜还在做 AI 研究,以及使用大模型的相关人群。

张院士最后还提到了企业家。这个其实让我有点意外。

他说,大模型时代,最优秀的学生——他的学生都是搞人工智能的——都应该去搞企业,因为人工智能重新定义了企业家。

AI 企业提供的不再是简单的产品和服务,而是把知识、伦理和应用变成可复用的工具,以此造福全人类。目标是把人工智能变成像水和电一样的通用技术。

企业家是一个光荣而神圣的职业。人工智能时代的企业家,必须承担新的社会责任,包括治理,以及实现普惠、可持续的增长。这是新的使命,也使 AI 时代的企业家成为一个光荣而神圣的职业。

张钹院士最后把问题拔到了这样的高度。

这大概就是今天绝大部分现场论坛的内容。我把它做成了 PPT,大家有兴趣可以去看。

8. AI群像带来信心

整理完这些内容之后,我回看了今天做的记录,发现自己记下了一些很有意思的发言。这些发言或多或少代表了,在今天这个时间点,可能是世界上最优秀的 AI 研究者和创业者正在思考的事情。

我一个个说。当然,这些都是比较零散的 tips。

第一句让我印象很深的话,是唐杰教授说的:2025年可能是多模态的“失意年”。

这个结论其实有点意外,因为很多人会觉得,多模态在2025年发展得很好。

当时唐教授的意思是,除了 Nano Banana 和 Nano Banana Pro 之外,大家似乎并没有看到其他厂商在多模态上有非常强的进展。他会认为,2025年是多模态的失意年,这是从厂商角度来看。

反过来讲,如果厂商意识到这件事情,那么2026年多模态领域的竞争,应该可想而知会越来越激烈。

第二句,是杨植麟在整篇演讲最开始写到的:这一轮 AI 智能的提升,本质上是从能源到智能。

所以,他为什么会那么强调 Token 的 ROI,也就是 Token 的使用效率,本质上就是在做这件事情。

第三句话是林俊旸说的:“今天如果做大模型不是为了全人类来做,那就不要做了。”

我完全没有想到,一个1993年出生的技术研究员,会以这样的方式去看待这件事情。十分敬佩,respect。

第四句话依然是林俊旸说的。他说,他们期待千问在2026年可以做到“三进三出”,也就是全模态模型,输入和输出都是多模态的。

我在去年做总结的时候说过,如果以“桌”来论述 AI,大家会说语言模型是一桌,多模态是一桌,可能 CoT 是半桌。

但现在看起来,无论是 Google 的 Gemini 模型,还是今天千问所表达的状态,以及其他一些模型厂商努力的方向,都说明语言、多模态和高级推理可能正在变成一个整体,而不是分开的3种能力。

下一句话叫:“吃得好了很多。”

这是姚顺禹说的。现场广密第一个问姚顺禹的问题其实是:感觉怎么样?因为这是他第一次回国接受这样的公开采访,他当时有点紧张,然后说了一句“吃得好了很多”。

我觉得他还是一个挺平和的人。

下一句话,刚才前面也提到过,是林俊旸在回答巨头分化问题时说的。

他说:“理论上我是不能评论公司的,但我觉得公司也不一定有那么多基因之分。一代一代的人可能会塑造这些公司,比如今天顺禹到腾讯之后,可能腾讯就变成了一个有着顺禹基因的公司。”

当时现场大家都笑了。

我觉得这一代研究员、这一代最年轻的企业家,有一种特别怎么讲,特别云淡风轻、特别开玩笑、特别自然的状态。我觉得挺好的。

最后两句话是张钹院士说的。

91岁的张院士在总结陈词时,第一句话说:“我可能没资格来做这个总结。”

你要知道,张钹院士是今天这个时间点整个中国人工智能行业最德高望重的人之一。他的学生遍布各家头部 AI 公司,但今天他说了这样一句话。

他说这句话的逻辑是,可能他听到前面很多嘉宾讲了很多新的问题、新的议题,也看到很多年轻人的状态,所以会觉得自己已经老了。

但今天这位91岁的院士,你在现场看到他,完全不会觉得那是一位91岁的老人。他特别有能量,状态特别强。

这个体验最明显的地方是最后一句话。他说,自己在听今天下午的活动过程中,中间还去了一趟休息室,修改了最后的 PPT。

我听到这里的时候都惊了。就是一位91岁的院士,为了这样一场活动,在会议中间听到很多人的新内容之后,回去修改自己的 PPT。

你会觉得特别佩服,特别 respect。

今天整场活动听下来,你会觉得,自己对中国人工智能行业还是挺期待、挺有信心的。

这些嘉宾的年纪跨度非常大。姚顺禹是1998年的,林俊旸和 Kimi 创始人杨植麟是1993年的,唐杰教授应该是70后,MiniMax 创始人闫俊杰应该是80后。

你会发现,在今天这个时间点,很多 AI 大模型公司里已经有很多00后。这些人共同构成了中国 AI 行业的群像。

这是我第一次如此明显地感觉到,这些人的群像状态在一场活动中集中呈现出来。

再把问题扩大一点。

我参加完活动之后特别想表达,想把这些事情告诉大家。但因为要去机场,在机场没法录音,只能先做内容。

后来看到很多在场的媒体朋友很快就把速记发了出来,我也有过一点小小的失落:我不是最早把这些内容和信息传播给大家的人。

但后来又想,我只是一个记录者。我是司马迁,我只负责记录就好了。

不过在记录的过程中,我也会有自己的倾向、偏好和想表达的东西,甚至包括表达方式:是播客,是 PPT,是带着感情、带着一些别的东西的表达。

我似乎也觉得,今天这些事情是有重量、有效用的。

我刚才下飞机回来的路上,正好在听这期《四十二章经》,是曲凯采访金建杭。最后,曲凯问金建杭,未来3年有什么建议。

金建杭说,随着 AI 能力越来越强,人类已经越来越难去伪装和掩饰什么了。所以,做真的——这里的“真”要加引号——可能是唯一的出路。

这也是我今天想表达的一些东西。可能有些零散,有些临时,有些不成体系,但我很想在最短的时间里把这些东西告诉大家。

感谢大家收听我的播客。我的 PPT 在生动那里,如果需要可以去下。当然,我说了这是 Notebook 做了大部分工作,我做了小部分工作。再预告一下,一月底如果不出意外,应该会在1月底或者2月初再更新一版 PPT,预计会超过150页,把去年11月做的内容全部推翻重做。感谢大家,我去睡觉了。啊不,我要去剪辑,然后写成 note,大家听到的时候应该已经是凌晨了,感谢。

Vol.83 25页PPT记录一场中国AI“全明星赛” | BidClub