[BidClub_]
张小珺Jùn|商业访谈录 · · 72 min

88. 和吴翼技术解读OpenAI Operator:推理从抽象世界走向物理世界的开端

张小珺吴翼

YouTube
TL;DR
  • Operator 的关键跃迁不是“会点网页”,而是把 o1、o3 的单次深推理扩展成多模态、闭环的环境交互。模型会观察、行动、接收新反馈再行动,甚至关掉弹窗、点击失败后退回、浏览器计算失败后改用计算器;吴翼称其为从纵向思考深度向横向通用能力扩展,“回溯发生在动作上,但不是它的思维链”。这让 AI 的价值边界从生成答案推进到执行任务,但可靠性也随之成为商业转化的硬门槛。

  • Operator 没有神秘的技术秘密,但其壁垒是三块能力同时做到极致。一是高质量的原生多模态基座模型,二是数量不必巨大但行为足够好的演示数据与任务,三是能在几千卡乃至一万卡上高效驱动浏览器或操作系统交互的强化学习系统。OpenAI 早在 2016 年的第一个大型项目就是 Web Agent,却因只有强化学习、没有基座模型和标注数据、连算力都没有而失败并裁掉约二三十人;九年后的关键配方正是基座模型与强化学习的结合。

  • Operator 更像“多模态、闭环的 o1”,而不是给 o3 装上一双手。它的思维链较短,主要通过动作试错,且很可能采用不同于 o1、o3 的基座模型,因此单独入口既反映模型差异,也像产品过渡态;当前 OSWorld 只有三十多分,吴翼却判断按 OpenAI 的节奏,“今年肯定给你干到七八十”。能力曲线可能仍很陡,但眼下发布代表技术突破,并不等于商业产品已经成熟。

  • Operator 的商业模型本质上是出售时间,而非出售聊天次数。如果三个可靠 AI 能并行处理退货、采购、报税等任务,吴翼保守地估计人的有效时间或可“乘以二”;在企业端,它对应一个比新增员工更便宜的“AI 员工”。但 OpenAI 的产品收入首先提供的是现金和融资杠杆——“用户提供的不是数据,用户提供的是钱”——用户数据虽是护城河,却不会像推荐系统那样自动转成智能飞轮。

  • 通用模型公司将占据共识主战场,创业公司的机会在其尚未覆盖的 1% 长尾。全球软件和网站数量巨大,即便 Operator 覆盖 99%,剩余 1% 仍足以支撑客服、物流、报税、订单等垂直 To B Agent;吴翼称美国已有十多家此类公司,而中国这样的 Agent 公司相对少一些。GUI Agent 通用却低效,可能只是中间态:若两三年后大量请求由 Agent 发起,网站可能同时开“给人”和“给 Agent”的两扇门。

  • Operator 对应 OpenAI 分级中的 L3 Agents,距离 L4 Innovators 仍有结构性鸿沟。L1 到 L3 都属于可验证的 instruction following:聊天、深思、再到与外部世界交互;L4 要在缺乏明确指令和标准 verifier 的情况下提出“原来没见过、而且更好”的东西,吴翼认为“三到四是特别大的改变”,可能不止两三年。低级的 L5 组织或许会因多个 Agent 被动协作而先出现,但自主组织仍依赖创造力。

  • 2025 年更像 Agent 的能力拐点,而不是商业化终局。多模态基模、强化学习和交互基础设施都到了新的阶段,行业会把开环文本推理改造成闭环多模态推理;但赛道已经高度共识化,巨头会“开着坦克”推进,资源较少的团队只能沿“乡间小道”寻找非共识机会。Operator 只是指针从抽象世界的“九十度”向物理世界偏到“八十度”的信号,真正的物理智能、个性化记忆和 Agent 间协作仍待探索。

Digest · the substance, structured for research

1. Operator 的震撼来自细节,而不是概念首发

  • 吴翼的第一反应是“意料之中”,因为 OpenAI 必然会在 2025 年推出 GUI Agent;真正看到模型连续行动时,却仍然“挺震撼”,因为这些行为细节已经很拟人。

  • 最能说明问题的不是模型完成了某个网页任务,而是它会主动关掉弹出广告;计算退款金额时,它在浏览器里尝试数次失败,又转向计算器按键,像人一样换工具解决问题。

  • 吴翼看重的是这种行为可以经强化学习规模化、通用化:模型不是记住某个网站的固定步骤,而是表现出“人也会这么去做”的试错、退回与替代路径。

2. 闭环交互补上了通用智能的横轴

  • o1、o3 展示的是聚焦问题上的深度:用户给出指令,模型内部思考二十秒再返回答案,中途既没有环境反馈,也没有真正的多模态交互,整体仍是开环系统。

  • Operator 则把过程改成“观察—思考—动作—新观察”:模型点一下网页,读取外界变化,再决定下一步。它不只看自己的 token,还把不断变化的互联网或软件界面纳入 context。

  • 吴翼用两根轴概括路线:纵轴是思考深度,横轴是多模态、环境交互和通用广度。Operator 没有刷新纯逻辑智力上限,却明显把 OpenAI 的能力向横轴拓开。

3. Operator 是向宽处走的 o1,而非 o3 的直接延伸

  • 主持人追问它是否延续 o1、o3,吴翼的修正是“不完全是”:三者共享 post-training 和强化学习路线,但 o1、o3 把长思维链推到极致,Operator 更强调任务广度与连续行动。

  • 观察公开思维链,Operator 的内部推理相对短,不像 o1、o3 那样很长、包含很多回溯;它点错、打不开或走不通时会后退,因此“回溯主要出现在动作上,但不是它的思维链”。

  • 吴翼由此把它定位成“多模态闭环的 o1”或偏早期一点的 Agent o1,而非多模态 o3。若未来叠加更强思维链、视觉理解和泛化能力,模型仍有相当大的上升空间。

  • 单独产品入口也可能说明它采用了不同于 o1、o3 的基座模型;两类能力最终可以融合,但现阶段拆开既降低产品认知成本,也符合一个“中间态过渡模型”的位置。

4. 多模态让泛化成为 Operator 的出厂要求

  • o1、o3 可以先在数学、科学理解、coding 和纯文本推理上做窄,再逐步解决泛化;Operator 从第一天就必须面对形形色色的网站、软件、广告、按钮与任务,窄模型根本无法工作。

  • 吴翼最直白的解释是“它有了眼睛”:视觉输入天然带来更好的泛化能力,Operator 也因此必须处理比 o1、o3 更广泛的任务。

  • 相应地,Operator 需要一个更复杂的 Reward Model,因为它要面对各种网页操作及其是否成功的结果,而不是相对集中的纯文本或 Coding 任务。

5. 三项工程共同构成真正壁垒

  • 第一项是足够好的原生多模态基座模型。吴翼结合自身训练经验、DeepSeek 的报告和 OpenAI 的模型演进强调,后训练能激发多少能力,高度受制于基座模型已经拥有多少语言与视觉潜力。

  • 第二项是高质量的人类演示和任务数据,例如关广告、失败后返回、改用另一工具。后训练不需要预训练那样巨量的数据,但数据和任务本身必须准备好,并准确展示此前基模不自然具备的行为模式。

  • 第三项是可规模化的 Agent 强化学习系统。数学推理只需模型持续吐 token;网页任务却每生成一段 token 就要让电脑执行鼠标或键盘动作,再把屏幕反馈送回模型。

  • 当训练扩展到几千卡或一万卡,如何让浏览器或操作系统环境高效等待、执行并返回反馈,会使训练系统复杂很多。如何支持高效训练,本身也是一个课题。

6. CUA 的新意在专门训练,而不在 Agent 这个词

  • OpenAI 将新模型称为 Computer-Using Agent(CUA);吴翼指出,Anthropic 的 Claude 更早公开过类似能力,而“模型与环境闭环交互”本身更是强化学习时代已有的基本框架。

  • 传统大模型接到指令后一次性输出,context 基本不随外部反馈变化;CUA 会输出 thinking 和 action,主动等待环境返回新状态,再据此继续推理,context 因而在执行过程中持续变化。

  • 过去的 workflow Agent 通常靠 Agent Prompting 或其他工程实现,把一个并非为交互设计的通用模型包装成 Agent;CUA 则是经好的基座模型和强化学习训练、专门为交互与 Agent 定制的模型,质量差距会“非常大”。

  • 因此国内复刻 Operator 并不存在神秘 secret:路线已经清楚,许多基建也处于“half there”。真正的不确定性是各环节能否同时做到极致,以及 OpenAI 尚未公开的“水下”模型领先多少。

7. OpenAI 用九年补齐了 2016 年失败的配方

  • OpenAI 成立后的第一个大型项目就是 Web Agent:让通用视觉智能体在网页上点击。2016 年强化学习正盛,团队试图直接用一个大的 LSTM(CommNet)与互联网环境交互。

  • 那次尝试缺少基座模型、人工标注和算力,只靠强化学习无法从零学出通用网页能力;复杂环境工程投入巨大,项目失败后约有二三十人被裁。

  • 吴翼把九年后的反转归结为配方补齐:“没有好的基座模型,光靠强化学习是不行的;光靠好的基座模型也不太行。”多模态基模与 o1、o3 验证过的强化学习结合,才使 2025 年成为 Agent 突破年。

8. L1 到 L3 扩大的是执行范围,L3 到 L4 改写的是任务定义

  • 吴翼将 L1 Chatbot 描述为反应式系统:人说一句,机器答一句;L2 Reasoners 仍是人机两方,但模型会在内部规划和推理很多步后再回答。

  • L3 Agents 加入第三方——外部世界。模型既要思考,又要观察互联网或软件的变化,在没有人逐步指挥的情况下完成动作,但任务仍由人给定,也仍有 verifier 判断是否完成。

  • L4 Innovators 的难点是人只能给方向,无法给出完整指令;结果不仅要“对”,还要好、要超越原有知识体系。吴翼认为“三到四是一个特别大的改变”,未必两三年就能完成。

  • L5 Organizations 与 L4 的先后未必绝对:多个软件各带一个 Agent 时,低级组织可能被动形成;但要让 AI 自发提出组织方案并形成组织,仍然需要 L4 式创造力。

9. Agent 的经济价值来自减少人类介入

  • 从 Chatbot 到 Agent,人类介入逐级减少,自动化范围持续扩大。报税、退货、采购等任务原本占用同一个人的注意力,可靠 Agent 则允许多个进程并行运行。

  • 吴翼没有把效率夸成线性叠加:即使有三个可靠 AI,也未必让时间乘三,但“让我的时间乘以二”已经很有价值,因为它释放了原本无法并发的脑力与操作时间。

  • 对企业而言,这一逻辑直接变成 AI 员工:只要 Agent 真能独立交付,它相对于新增秘书或员工的成本优势就应该容易收回。商业模式不是卖模型概念,而是让客户“花钱买时间”。

10. 自主性越高,产品层的刹车越重要

  • 从公开 demo 看,Operator 在下单、付款等敏感动作前会暂停并要求人接管。吴翼倾向于认为,这不是模型训练时解决了全部安全问题,而是产品和安全团队在外层持续监控并按动作类别拦截。

  • 理解侧可能来自 GPT-4o 的某个原生多模态版本,但吴翼明确说“不知道是哪个版本的四O”;动作侧则较简单,主要是点击和输入,可用结构化 thinking、action 与特殊 token 约束。

  • 所谓长期规划并未改变强化学习原理:一些人类数据先示范拖动页面、关闭弹窗、失败后修正等行为,再由复杂环境中的强化学习激发自我探索与自我修正,细节全部做对后才会涌现。

  • 对失控问题,吴翼的判断带有明确条件:若训练方式正确、训练中充分保证安全,目前还没有进入“完全不可控”的状态。他借导师 Stuart Russell 开玩笑——导师一直健在,说明邪恶 AI 还没穿越回来阻止他。

11. 固定任务暂时不需要多 Agent

  • 吴翼不看好短期内用多个 Agent 共同完成一个网页任务:一个拥有原生多模态、长 context、记忆和强推理能力的大模型,已经可以独自处理固定目标,多 Agent 未必增加价值。

  • 真正的多 Agent 会在外部服务也由 Agent 接管时被动出现,例如 Operator 访问的网站本身也有一个 Agent,协作来自系统边界而非人为编队。

  • 未来一两年,他仍预期以单智能体操作人类 GUI 为主;两三年后,如果人的工作中有 80% 的 Query 由 Agent 发起,网站可能出售专门入口,让 Agent 直接调用,跳过低效的鼠标点击。

12. Operator 数据比聊天更有价值,但仍不是智能发动机

  • 吴翼认同“Chatbot 不是提取智能最有效的形态”:日常闲聊默认不要求深思熟虑,大量用户反馈更多改善语气和舒适度,而非突破模型最难能力。

  • Operator 的 query distribution 不同。愿意委托 AI 点网页的任务通常更重,如复杂行程、报税或多次检索;指令、执行轨迹和最终成功与否,天然构成更适合强化学习的任务—结果数据。

  • 围绕 Reinforcement Fine-Tuning API,外界调侃 OpenAI“又来收数据”,并非毫无依据:强化学习对数据量要求不大,一个真正困难且可判断结果的任务,就可能帮助模型补上一块能力。

  • 但吴翼随即限定:用户数据价值更高,不等于产品自动产生下一代智能,“依然可能不如你自己去标”。他的因果方向是先有更好的智能,再涌现新产品,而不是靠产品使用量倒逼智能升级。

13. OpenAI 把智能、后训练与交付拆成三层

  • 吴翼描述的组织形态是:人数相对少的核心研究部门推进预训练和 reinforcement training;更大的 post-training 团队基于产品需求和用户数据继续训练、调整;产品团队负责最终交付。

  • 这种分工解释了为何研究员可以专注“最难的问题”,而 post-training 团队仍不可省略:数学或科学 pipeline 跑通,不代表模型已经适合普通用户,也不代表产品需求已经得到匹配。

  • OpenAI 持续发产品也不是单纯“秀肌肉”。它是一家处在激烈竞争中的赚钱公司;产品让用户交钱,再去提升智能,也可能以此为杠杆拿到更多的钱。主持人的总结很尖锐:“用户提供的不是数据,用户提供的是钱。”

  • AI 数据因此是护城河,却不是推荐系统式自动飞轮。淘宝或抖音可以随着点击自然优化,通用 AI 数据却充满噪声,必须经研究员找出关键缺口、清洗数据并处理,闭环至多是“半自动”。

14. 2025 年先刷能力分数,商业化仍需等待可靠性

  • 吴翼把 2025 年称为“看到突破的年份”,而非商业变革完全落地的一年。o1 很强却仍有人抱怨产出不好,说明从能力第一次可见,到产品稳定、经济地运行,中间还有距离。

  • 今年会看到的是纯文本推理走向多模态推理,开环回答走向闭环环境交互,并出现大量为 Agent 定制训练的模型;他判断公开榜单分数会被大幅推高。

  • Operator 当前 OSWorld 只有三十多分,这“不像 OpenAI 的风格”;吴翼的明确预测是“今年肯定给你干到七八十”,甚至不排除内部已经刷到更高,只是尚未公开。

  • 资源上,他判断 GPT-4o 衍生的 Operator 模型本身应相对较小,训练不至于达到十万卡级别;但外界无法从最终一次训练反推此前做过多少轮研究和实验,总投入仍不可知。

15. 产品路线将从点屏幕扩展到接口和嵌入

  • GUI Agent 只是首种形态。吴翼猜测,如果它已集成进苹果系统,可能调用操作系统里的 API;也可能与企业合作获得代码或专门接口,不必永远模仿人类点击。

  • OpenAI 目前没有提供 Operator API,但吴翼按其惯例推测,部分早期合作方可能已经开始集成;后续既可能出现 Operator v2、v3,也可能更换基座后采用新的命名。

  • GUI 的优势是在“为人设计的世界”里最通用,缺点是效率低,因此它更像必经的中间态。若未来人们愿意把约 80% 的工作交给 Agent,软件界面和调用方式可能会反向适配。

16. 物理世界、垂直创业与非共识研究仍在起跑线上

  • 吴翼把智能分为抽象文本推理与视觉信号推理,并进一步讨论物理世界推理。Operator 仍只操作网页,而网页本质上是“把文本图像化”,既没有寻找袜子、收拾行李那类空间推理,也没有提高 o3 的纯逻辑上限。

  • 他的比喻是:OpenAI 原来沿九十度方向朝抽象智力前进,现在指针向物理世界偏到八十度,“那只手好像刚刚伸过去,还没有真正触碰到”。商业上它会优先赚数字世界的钱;物理智能也可能通过投资 Physical Intelligence 等公司布局,“做大脑就好了”。

  • 基座模型并非 Agent 创业的入场券。即便通用模型覆盖 99%,余下 1% 的客服、物流、报税和订单流程仍是巨量市场;美国已有十多家垂直 Agent 公司,中国这类 Agent 公司相对少一些,但在大模型尚未覆盖的垂直领域仍有机会。

  • 2025 年的多模态、reasoning、Agent 已高度共识,巨头会“开着坦克”占领主路,创业者可以开摩托车走乡间小道。吴翼也因此重新思考学术定位:ICML 前因 DeepSeek、Operator 发布后觉得部分结论已经被别人说了而放弃投稿,并举出个性化记忆、人类反馈和真正的 Agent 间交互等可能在两三年后变重要的开放问题。

吴翼

如果你觉得这件事情很有意思,可以去看 OpenAI 的历史。你会发现,OpenAI 成立之后做的第一个项目就是 Web Agent,也就是有一个通用的视觉智能体在网页上点击。

如果回溯到 2016 年,当时 OpenAI 开的第一个大型项目就是这个。当然,他们当时的做法失败了。我很多时候在深度学习课程里也会跟同学讲这个故事:为什么会失败?因为当时他们只有强化学习,没有基座模型,甚至没有人去标数据,连算力都没有。他们用了一个大的 LSTM,叫 CommNet,然后用强化学习让它在网页上不断点击,最后失败了,还裁掉了很多人。

张小珺

哈喽,大家好,欢迎收听《张小珺商业访谈录》,我是小俊,这是一档提供一手高密度信息的商业访谈节目。

2025 年刚开年,全球 AI 界就已经形成了高度共识,把 2025 年定义为智能体元年。北京时间 1 月 24 日凌晨,OpenAI 率先发布了首个智能体产品 Operator,打响了全球智能体竞赛的第一枪。

在 Operator 发布前,广密在我们的节目中预言,2025 年的核心关键词就是 Agent、Agent、Agent,而这些 AI 产品最终会演变成为一个任务容器,朝着下一个 Google 的方向进发。

在本期节目中,Operator 发布之后,我邀请了前 OpenAI 研究员、清华大学交叉信息研究院助理教授吴翼,从技术视角为我们解读 Operator 和智能体产品。先请你跟听众朋友们打个招呼。

吴翼

大家好,我叫吴翼,是清华大学交叉信息研究院的助理教授。我一直的研究方向都是强化学习。我在 2020 年回到清华任教,在这之前从加州大学伯克利分校获得了博士学位,并在 2019 年到 2020 年之间于 OpenAI 工作。

如果大家还记得,吴翼在《商业访谈录》第 75 集曾经从技术视角为大家解读过 O1。如果大家对他在 OpenAI 的亲身经历,或者他关于 O1 的看法感兴趣,欢迎前往第 75 集收听。

距离上一集节目已经过去了 4 个月。2025 年 1 月 24 日凌晨,OpenAI 突然发布了另一个重磅项目,一个叫 Operator 的 Agent 项目,所以我们再一次邀请吴翼来做技术解读。对于 Operator,你的整体感受怎么样?

吴翼

首先是意料之中,第二,真正看到的时候还是挺震撼的。

哪些是预期之内,哪些是预料之外?

吴翼

你知道 OpenAI 今年一定会做多模态智能体,一定会做这种 GUI Agent,也就是图形界面的智能体。你知道它今年一定会放出来,也一定会把这件事情卷到很高,但它真的放出来以后,仔细看它的这些行为,还是会觉得真的很厉害。

震撼你的点是什么?

吴翼

有意思的地方是,你去看它放出来的一些 Demo,会发现有很多特别细节的点。比如有一个 Demo 是 AI 会去把弹出的广告关掉。

还有一个例子是,AI 要计算退款金额。它会先尝试在浏览器上计算应该退多少钱,尝试几次失败之后,再去计算器里按一下。你会发现它真的会用一种人也会采用的方式去做事情,然后通过强化学习把这种方式规模化、通用化,所以这个 AI 的很多行为看起来真的很像人。

Operator 的发布,在通往 AGI 的路线图上标志着什么?

吴翼

我觉得它是一种通用性的变化。像 O1、O3,它们是在聚焦的问题上思考得更深,但中间其实没有环境交互,这是第一点。第二点,它们没有多模态。

如果需要一个通用的大脑,除了要想得很深,还需要多模态能力,需要在和环境交互之后形成一个闭环控制系统。什么叫闭环?比如 O1,你给它一个指令之后,中间没有任何外界交互,它想了 20 秒,最后给你一个答案,中间没有反馈控制。

但真实世界是不一样的。比如我要去做软件操作,或者进行 Operator 这样的操作,我需要先想一会儿,然后点一下,看看外部的反馈。之前所有类似 GPT-4o 的模型,它对图片的理解也好,对语言指令的理解也好,基本都是单步的,动作也基本是一步的。

很少有模型能够做到:我看到一个观测,做一步动作,然后看到新的观测,再做下一步动作,并且连续进行很多轮交互。之前没有这样的能力。当然,这件事情一定会发生,因为通用智能体一定需要这种横向能力。纵向是思考深度,横向是广度和通用能力,最终一定要具备这种能力,OpenAI 终于把它拿出来了。

我们上次聊 O1 的时候,你当时说,O1 标志着预训练能挖的金矿越来越少,而以强化学习为基础的后训练是一个大金矿,使迈向 AGI 的梯子多了几节。

过去 4 个月,我们先倒回去说说 O1。它的后训练进展符合你的预期吗?比如说,它验证了 Scaling Law 吗?它的泛化性如何?

吴翼

首先,Scaling Law 这件事情我觉得符合预期。甚至因为各种原因,OpenAI 还没有把最好的东西拿出来,所以我也不知道他们内部现在做到什么程度了。

其实和一些朋友聊,应该比较肯定的是,OpenAI 内部还有更好的模型。所以从智力水平上看,O1、O3,以及后面可能还有 O4,很快可能会把智力水平刷得很高。智力上的 Scaling Law,我还是很有信心的,它能够变得更聪明。

泛化方面,我觉得 Operator 是一个比较明显的例子,它是带有泛化性的。比如它能够做各种各样的网页操作,也能做图形界面的泛化。O1 其实没有把泛化做得特别好,但我觉得这应该是他们水下的东西。

我知道有些团队在内部已经把泛化放在日程上,并且看到了一些效果,所以我对这件事情不担心。我觉得今年可能可以拭目以待。

所以 Operator 是延续着 O1、O3 的一个产品吗?

吴翼

其实不完全是。更准确地说,它符合后训练、强化学习这条路径,但没有像 O1、O3 那样走得极致,而是在广度上往旁边、往宽里走。

如果你观察 Operator 的思维链,它的思维链相对比较短。O1、O3 放出来的思维链很长,会有很多回溯。但 Operator 的思维链相对较短,它的回溯主要发生在动作上。

比如你会看到它点了一个网页,发现点了半天没有打开,它会点后退。它的回溯发生在动作上,而不是思维链里。所以我倾向于认为,它应该不是 O3 那么极致的模型,但可能是类似 O1、同时具备多模态和闭环能力的一个 Agent O1。

这是我的理解。所以我觉得它还有很大的空间。比如,如果它有更好的思维链,会怎么样?如果它有更好的多模态理解模型,或者更好的泛化能力,又会怎么样?我觉得它还有空间。它比较像多模态世界里的 O1,或者比 O1 再往前推一点的位置。

为什么 Operator 这次是以一个单独入口的形式呈现?

吴翼

我理解应该是因为它用了不同的基座模型。我觉得这件事情有两个方面。

一方面,它明显是一个和 O3 不一样的基座模型。它本身是一个多模态模型,用不一样的数据激发出了 Agent 的潜力,然后再做强化学习,所以它的模型性质肯定和 O3 不一样,或者说和 O1、O3 这一系列模型不太一样。从产品上看,第一点就是模型不太一样,所以它后侧是两个模型。

第二,从产品角度来说,当你有两个很强的模型之后,能不能把它们融合起来?我觉得当然可以。某种程度上,OpenAI 是刻意从产品角度出发,把这样一个更像中间态、过渡性的模型放在单独的产品里。

大家已经习惯了 ChatGPT 的使用方式,如果给它一个完全不一样的用法,可能确实更适合作为单独的产品发布出来。

你刚才提到 Operator 更好地解决了泛化性问题,这一点是怎么做到的?

吴翼

我觉得有几件事情。首先,O1、O3 是做深度推理的,所以它们解决的任务相对比较集中,比如科学计算、科学理解。

对于 Operator 来说,它至少有多模态输入,这一点天然会带来更好的泛化性。比如它可以看网页,它有了眼睛,自然会有一些更好的泛化能力。

从任务上看,O1、O3 基本还是做 Coding,或者做纯文字的推理任务。Operator 因为需要点击网页,自然要完成各种各样的任务,它确实需要一个更复杂的 Reward Model。这件事情会让它从第一天开始就必须具备一些泛化能力,否则没法去点击网页、操作操作系统。

O1、O3 可以一开始先做得窄一点,再慢慢解决泛化问题。但 Operator 从一开始就需要面对更广泛的任务。

对于 OpenAI Operator,你觉得有哪些核心技术要点需要关注?能不能帮听众朋友们画一下重点?

吴翼

还是三件事情,和 O1 是一样的。

首先,你需要一个很好的基座模型,特别好的原生多模态基座模型。这件事情非常重要。无论是我们自己的训练经历,还是 DeepSeek 之前发布的报告,或者 OpenAI 自己发布的很多模型,都说明基座模型非常重要。所以第一件事,就是多模态基座模型一定要好。

第二件事特别明显,就是需要高质量的数据和任务。这个数据集其实不需要特别复杂。我们还是回到 OpenAI 自己发布的那些例子:你看到有些智能体真的会去关广告,也会在网页没有点击成功之后后退。这些都是非常拟人的动作。

我相信 OpenAI 肯定有相当一部分这样的数据,因为它的行为模式和基座模型还是很不一样的。为了这件事情,它一定准备了一些数据。但我感觉这个数据不需要特别大的量。和预训练相比,后训练的数据量还是不需要那么大。不过,数据本身以及任务本身依然需要准备好。

第三件事就是强化学习。强化学习除了需要一个很好的训练系统,还需要把它规模化。在 Agent 的环境里,比较麻烦的是后面还需要交互环境。这个环境可能是网页,也可能是操作系统,需要对这些事情做很多工程优化。

尤其是在几千卡或者 1 万卡这样的大规模训练中,怎么高效率地完成交互,是一个比较麻烦的问题。原来如果是 O1、O3 做数学题,中间没有交互,只要让模型不断输出 Token 就可以了,比较简单。

但现在模型吐出几百个 Token 之后,还要在屏幕上点击一下。你需要有一台电脑在那里等着 AI 去点击,再给它做模拟,然后才能让 AI 继续输出。训练系统会复杂很多,如何让它支持高效训练,本身也是一个课题。

所以三件事情加起来,就是好的基座模型、高质量的人类数据,以及高效率的大规模 Agent 强化学习系统。

他还提到,这次用了一个新模型,叫 Computer-Using Agent,CUA。请你给大家解释一下这个概念。

吴翼

这个概念最早我觉得是 Claude,也就是 Anthropic 比较早提出来的。在它的新版模型里,其实已经提出了这样的概念。

核心差别在于交互能力。传统大模型就是输出 Token,不会真的和环境交互、拿到新的反馈之后再继续输出。新的概念希望模型形成一个闭环控制系统。

传统大模型是一个开环系统:你给它一个指令,它直接输出,中间不会需要任何人的反馈。但现在这种智能体模式是一个闭环系统,也就是 Closed-loop System。模型接到一个指令之后,先输出一些 Token,然后主动调用外部环境;这时模型会预期得到下一个反馈,再基于新的反馈进行下一步思考。

所以这种模型的训练模式和 Context 都不再是固定的,Context 会不断发生变化。同时,这里面又加入了多模态。两件事情加起来,就是这样一个新的概念。

其实这件事情的本质并不新。在 Agent 概念被提出的时候,本质上就是这样一个框架。传统上,在 Claude 和 OpenAI Operator 之前,所谓 Agent 往往是通过 Agent Prompting 或一些工程实现,把一个原本开环的基础模型,也就是没有针对特定任务训练的模型,变得看起来可以完成这些任务。

但新一代的模型,比如 Claude 之前的 Sonnet,或者 OpenAI Operator,是专门为这个任务训练的,所以会比传统的 Workflow Agent 效果好很多,也更智能。

CUA 就是你说的那个好的基座模型吗?

吴翼

它是经过一个好的模型和强化学习训练之后,得到的一个专门为了交互和 Agent 使用而定制化训练的模型。

如果国内团队想要复刻 Operator,这件事情难吗?通过 Operator 这次的发布,我们能反向还原出哪些技术细节?

吴翼

这件事情并没有什么秘密,也没有那么神秘。很多人看到它发布之后,都会有一种“我知道你一定会放,终于你放出来了”的感觉。

只是它确实做得很极致:基座模型、收集到的演示数据或人类数据,以及强化学习训练,这三件事情都做得很好。

国内之前也有很多团队,用开源多模态模型做 SFT、微调或者 Prompting,也能做出类似效果。但这个质量和 OpenAI,或者之前 Anthropic 发布的模型,还是有比较大的差别。

这就是用一个通用的、没有为这件事情定制的模型,做一些简单的 Prompt、SFT,和真正通过完整的强化学习训练把模型打磨出来之间的差别。这个差别会非常大。

国内团队要做,首先需要一个好的基座模型,然后需要这样的数据,还需要一个好的强化学习训练系统。但如果只看 Operator 这件事情,我觉得国内团队要追赶并没有那么远。

其实我理解,很多团队应该已经在路上了。它不像当时追 ChatGPT 或者 DALL·E 那么难。

对,至少路线是清楚的,而且很多基础设施本身已经具备了,算是一个 Halfway There 的状态。

但问题在于,你不知道 OpenAI 水下还有多少东西。

吴翼

对。当它发布一个东西的时候,说明这个东西已经被打磨得不错了。我觉得这是 OpenAI 一向的习惯:真正放出来给大家用的,一般已经在公司内部运行了一段时间,并且打磨到了可以给人使用的状态,或者说可以出来收集一波用户反馈了。

你觉得为什么 OpenAI 选择在这个时候发布 Operator?

吴翼

我觉得就是开年了,发布完了再发点新东西。

张小珺

对,嗯,我觉得这个也是挺不好的,非要在中国春节之前发这个东西。不让我们过年,应该等,对吧?就是让大家过年。

吴翼

对对,应该应该应该对吧?主要是 OpenAI 中国人很多人都走了,对吧?或者说要是高层的中国人在,那可能应该等春节之后再发。

现在很多人都说 2025 年是 Agent 之年,你怎么看?

吴翼

我很同意。我觉得原因是,各方面的技术都到了一个阶段。

我们还是以 Agent 为例。之前我说过,如果你希望用强化学习这种好的训练模式,做出一个真正通用的 Agent,需要什么?你需要一个好的基座模型。数据其实还可以,因为很多人已经知道数据该怎么做。抛开数据本身,你需要一个好的基座模型,以及一个成熟的强化学习训练框架。

从 GPT-4o 到 GPT-4V,大家能看到基座模型越来越好,越来越能够激发基座模型本身的潜力。到了 2024 年,你看到了 O1、O3,也看到国内团队在强化学习上追赶上来。

很多人开始思考,强化学习的技术究竟在哪里?至少大家已经看到 O1、O3,知道原来强化学习加上一个好的基座模型,可以激发出这么大的潜力。

这时候自然会想:把多模态模型加上强化学习,会有怎样的潜力?原来是纯文本模型,纯文本模型加上强化学习,我们看到了 O1、O3。自然再往后一步就是,多模态模型呢?

多模态模型最直接的用户使用方式,就是 Agent,或者通用的图形界面 Agent。所以这件事情是技术到了。单模态已经有了,再往多模态走,是一个很自然的演进。

我再多说两句。Web Agent 这个东西,如果你去看 OpenAI 的历史,会发现 OpenAI 成立之后做的第一个项目就是这件事情,就是 Web Agent:有一个通用的视觉智能体在网页上点击。

如果回溯到 2016 年,当时 OpenAI 开的第一个大型项目就是这个。当时他们的做法失败了。我经常在深度学习课程里给同学讲这个故事:为什么失败?当时他们只有强化学习,没有基座模型,甚至没有人手标数据,连算力都没有。

他们用了一个大的 LSTM,叫 CommNet,然后用强化学习让它在网页上不断点击,最后失败了,还裁掉了很多人。

当时裁掉了多少人?

吴翼

我还问过 John 这个问题,当时应该裁了二三十个人。

你想,要搭建一个让强化学习智能体能够点击网页的训练环境,背后连接的是整个互联网。你需要做很多工程上的事情,让 AI 真正能够点击,还要把互联网接进来,并且支持这么复杂的训练。最后出现了一堆工程问题,所以只能考虑这些人怎么办,最后就把团队裁掉了。

当时网上还有人讨伐 OpenAI,说它开除员工。但你看,10 年之后,他们把这件事情做成了。从 2016 年到 2025 年。

当时缺少的关键要素,就是基座模型。没有好的基座模型,光靠强化学习是不行的。但光靠好的基座模型也不行,还是要把基座模型和强化学习结合起来。

OpenAI 不是发布过一个五级分层吗?第一级是聊天机器人 Chatbot,第二级是推理者 Reasoners,第三级是 Agents,也就是现在发布的这个产品,第四级是创新者,第五级是组织。

这个分级是哪一年开始有的?听起来 OpenAI 从 Day One 开始想做的就是 Agent,也就是第三级。

吴翼

这个分级其实是比较晚才出现的,应该是在 ChatGPT 时代之后,可能是 2022 年或 2023 年,我不确定具体时间,但肯定不是最早时候的分级。

最早的时候没有想得那么清楚,当时想的东西还比较多。2016 年正好是强化学习最鼎盛的时代,大家想的无非是强化学习能做什么。所以我觉得当时他们能搞这个项目,还是因为大家在思考操作这件事情。

从 L1 到 L5,它是一个技术演进上的迭代吗?是先有 A 才能有 B 的关系吗?

吴翼

技术上我觉得大体是这样的。

Chatbot 本质上是 Reactive,也就是反应式的:你告诉我一句话,我回应一句话。Reasoning 则是说,它有推理和规划能力。

Agent 肯定需要推理和规划能力。比如我去点击一个网页,点错了还得返回。同时它还需要具备和现实世界交互的能力,因为模型不能只看自己的输出,还要看世界的输出。

并且,这个过程中不再需要人的逐步指令。你给它一个指令,它还要观察世界的变化、互联网的变化,然后超脱于人的详细指令,和另外一个世界进行交互。

原来 Chatbot 是一个反应系统:我说一句话,你说一句话,只有人和机器之间的交互。第二步是,我说一句话,你在脑子里想 10 秒钟,再说一句话,仍然是人和机器,但中间多了很多步思考。

第三步是,人、机器和外部世界同时存在。机器需要思考,而它的思考过程本身也和外部世界交互。它既有自己脑子里的思考,也有和外部世界交互的过程,这是一个三方过程。

所以这个事情本身扩大了 AI 的 Scope。

但从 L3 到 L4,我觉得是一个特别大的 Gap。L1、L2、L3 里面讲的都是 Instruction Following 或 Instruction Execution:我给你一个指令,告诉你做什么,你去完成。最后还有一个 Verifier,判断它是不是正确。

创新不一样。创新只能给方向性的建议。比如博士生写论文,你不能简单地说这个东西是对的还是错的,因为如果要创新,它当然应该是对的,但同时还要是好的、原来没见过的。

这件事情需要判断好坏,不再是给你一个指令、判断你是否完成,还要判断它是不是足够好,是不是超越了原有知识体系。所以它更难。你希望 AI 能够超出人的具体指令,这是第四级。

我觉得 L3 到 L4 是一个特别大的变化,可能不止两三年就能做成。

L4 到 L5 也是一个变化。你有很多智能体,很多智能体会形成组织。但 L5 和 L4 哪个先来不一定。

即使没有创造力,未来世界上也可能存在很多大模型和智能体,它们依然可能形成某种组织。比如以后每个软件都带一个 Agent,或者你有几个 Agent 帮你做事情,它们之间就会存在交互。

现在是一个 Operator,网站上也可以放一个 Operator。这个 L5 可能会以一种比较低级的形态先出现。

但如果你说真正的 L5,是希望它形成自发的组织,那当然更难。因为形成自发组织肯定需要创造力,需要提出真正的组织方案。最后如果有很多 AI 形成了组织,那确实可能会危及人类。

不过,组织也可能是被动形成的。比如这个世界上每个人都有几个 Operator 帮自己干活,它们之间可能自然形成一种比较低级的组织。

从一级到五级,是不是越来越不需要人参与?

吴翼

是的,人需要介入的越来越少,自动化程度越来越高。

这也是为什么我觉得 Agent 这件事情有商业价值。它的商业价值在于人参与得更少,也就意味着扩展了人的时间,因为每个人的时间是有限的。

比如我要退一个货、买一个东西,或者报税。美国的同学可能对报税深恶痛绝,因为报税可能半天就过去了。报税的同时,你可能不能去买东西,因为人只有一个脑子。

但有了 AI 之后,我可以同时做一些事情。如果我有 3 个可靠的 AI,它们能够可靠地完成一些任务,我的时间可能就相当于变多了。当然不一定是乘以 3,乘以 3 有点过分,因为有些事情本来我的脑子就不能多进程处理。但如果 3 个 AI 能让我相当于多出 2 倍时间,那人的时间就变多了。这件事情是有价值的。

为什么说 Operator 推动了 AI 从一个被动工具向主动行动者转变?这个转变对于 AI 技术的发展来说意义大吗?

吴翼

我觉得它本质上还是推理的一种延续。原来 AI 只能自己思考,现在它还能和外部世界交互,所以人可以给它越来越复杂的指令,它能做的事情也越来越多。

AI 最后还是一种生产力工具,希望解放人的生产力。假设我们能做到它非常可靠,先不考虑它是怎么做到可靠的,只假设它能够可靠地完成任务,那么我就可以有很多个和我一样、或者比我更好的忠诚助手,同时帮我做很多事情,我的时间就能被解放出来。

这其实就是 AI 的目标。AI 是自动化的终极形态,人的介入越少,就越接近我们所需要的、和人一样的通用 AI。

它最后会主宰人类吗?如果人类的参与度越来越低的话?

吴翼

我觉得这个问题完全取决于我们怎么看待它。我的导师是 Stuart Russell,他现在一直在做 AI Safety,也就是人工智能安全工作。他之前还和联合国合作,推动一些关于人工智能安全性的呼吁和公开文件。

经过我导师的训练,我觉得如果我们采用正确的训练方式,并且在训练过程中做好安全性保证,应该还是可以的。现在的训练还没有真正超出一个完全不可控的状态。

我经常和人开玩笑说,如果我的导师一直健在,那就说明他应该成功了。因为如果有一个很邪恶的 AI 从未来穿越回来要把他杀掉,那他可能就不在了。既然他还在,说明他应该成功了。

我们来讨论一些 Operator 的细节问题。因为 Operator 的交互能力很强,它在和人类协作时,怎么平衡自主决策和人类指令之间的优先级?

吴翼

我觉得这是一个特别好的问题。我看了一下它提供的很多 Demo,基本能看出来,有些地方是比较 Rule-based 的。

比如在点击的时候,它会对点击进行分类。有些分类涉及下单或者付款,就会跳出来让人来处理。这好像是他们安全团队专门做的一层机制。

我不确定他们具体是怎么做的,有可能在训练过程中也做了相关工作。但我更倾向于认为,这件事情是在训练完成之后,由产品和安全团队在外面套了一层。

相当于一直有人在监控 AI 在做什么。当它需要人类介入时,就让它停下来。根据它的报告和 Demo,我倾向于这么认为。

Operator 这次在多模态交互上也有一些突破。它是怎么整合语言、视觉和动作这些不同模态的信息的?

吴翼

首先,这件事情可以分成两块。一块是理解,也就是语言和视觉。

它有一个非常好的多模态基座模型。它号称是 GPT-4o,但我也不知道具体是哪个版本的 4o。不过我们知道,GPT-4o 本身就是原生多模态基础模型,它同时具备语言、视觉和文本能力。

在这个多模态模型的基础上,再加上强化学习训练,所以理解部分主要依靠基座模型的预训练质量。

第二部分是动作。你看它的动作其实是文本交互,而且非常有结构。它会先 Thinking,思考一段,然后有一个 Action。这个 Action 基本就是 Click 或 Type,也就是鼠标和键盘。

键盘和鼠标的动作是有限的,所以我倾向于认为,它使用的是一种比较简单的格式。这和 O1、O3 也是类似的。你去看 O1、O3,它们的思维链里也会有一些特殊 Token,用来规定这一段是思考过程,另一段是 Action。

所以我倾向于认为,Operator 也有一套格式规定,然后再用强化学习,让模型在给定格式下探索动作和任务。学习这个格式本身很容易,因为它的 Action 没有那么复杂。

张小珺

Operator 能不能支持和其他 Agent 进行协作?这种协作机制是什么?

吴翼

这是一个特别好的问题。我先说我的观点:短时间内暂时不会出现多个 Agent 之间交互的情况。

如果你的目标是完成一个任务,比如我要去网页上买一个东西,那么一个足够通用的大模型就可以自己完成所有事情。O1 和 O3 已经证明了,如果强化学习训练让模型拥有很长的 Context 和记忆,比如 1 万个 Token,也完全没有问题,它依然可以把推理过程做得很清楚。

所以,如果只是给定一个固定问题并完成任务,一个具备原生多模态、长文本能力、记忆能力和很强推理能力的大模型自己就可以完成。完成任务本身,一个模型就够了。

什么时候可能出现多模态、多 Agent 交互?一定是完成任务的过程中,涉及一个 AI 被动触发另一个 AI。比如以后所有网站本身也有一个 Agent,那可能就会涉及多个 AI。

如果对面的网站上是一个 Chatbot,比如你说“帮我去豆包上查一个东西”,或者“帮我去 ChatGPT 上查一个东西”,它就要打开 ChatGPT 网站,去询问另一个 Agent。这是被动触发的多模态 Agent。

但我觉得短时间内不会出现。因为大部分人机交互界面仍然是图形化界面,是为人设计的。所以未来一两年,可能仍然是单智能体状态。

但两三年之后,有一天所有网站的界面因为 AI 的出现而发生很大变化,必须适配 Agent,让 Agent 直接去查询,我觉得这是有可能的。

假设两三年之后,你的工作中有 80% 的 Query 不是你自己发出的,而是你的 Agent 或 Operator 帮你发出的,那么你常用的网站是不是要为这件事情做出改变?

你可能会付费,说“我花 10 块钱,你帮我打开一个 Agent 入口,以后我的 Agent 就可以直接调用,不用我去点击了”。因为图形界面虽然通用,但相对来说效率比较低。

所以我不觉得 Operator 会是最终形态,它更像一个中间态。但在现在这个为人设计的世界里,它是最通用的一种方式。未来我觉得这种改变会很快出现,但短时间内还不会。

张小珺

OpenAI 还提到 Operator 可以进行长期规划。这个能力是怎么实现的?它和之前我们聊的传统强化学习有什么不同?

吴翼

其实它和传统强化学习没有什么不同。本质的不同在于,有一个基座模型,并且在一个足够复杂、需要泛化的任务上,激发出了模型的泛化能力。这和 O1、O3 是一脉相承的。

比如 O1、O3 的反思能力,就是强化学习激发出来的。模型本身,或者一些人类标注数据,可以引导模型朝某个方向行动,最后再通过强化学习把这种能力激发出来。

比如点击网页,我相信有些人确实会有这样的习惯:进入网页之后先拖动一下,或者把弹出的窗口关掉。先有一些简单的数据,指引大模型形成这样的行为,再通过强化学习,它自然就会涌现出自我探索、自我修正的行为。

所以它本身没有太大变化,只是因为有好的基座模型、好的人类数据,以及足够复杂的测试环境,这些能力就会自己涌现出来。大的方向没有变化,但细节很多,必须全部做对,能力才会涌现。

张小珺

上一期节目里,广密说 Chatbot 这种对话形态,大概率不是提升智能最有效的交互方式。你觉得像 Operator 这样的 Agent,能更有效地从人类社会中提取智能吗?

现在有一种讨论是,人类反馈,比如人类使用 Chatbot 所产生的反馈,并不能帮助 AI 提升智能。提升智能是一条线,作为产品运转是另一条线,两者之间现在其实没有交互关系。

吴翼

首先,我非常同意广密说的那句话:Chatbot 这个东西并不能帮助你提升智能。

原因很简单,闲聊有什么智能?对话这种形式,默认不会出现深思熟虑的过程,也不会涉及特别难的事情。智能基本是由困难问题带动长尾能力,因为有了更好的能力,才能覆盖更长尾的任务。

如果只是通过用户大量反馈,它不能提高智能,只能提高产品的舒适度,这没有问题。

但 Operator 相对有一点不一样。什么时候你需要一个人帮你点击网页?一般来说都是带着目的的。它和 Chatbot 不一样,Chatbot 大部分时候只是问一个问题,但你要让一个软件帮你点击网页,通常是因为事情比较麻烦。

比如报税,或者安排一个复杂的行程,需要查询很多次。所以它的 Query Distribution,也就是用户给出的指令,会和 Chatbot 很不一样。因为它比较重,如果能够收集用户反馈,以及任务最后是否完美完成的信号,我觉得有助于提升模型的通用能力。

Operator 也有一个选项,可以不提交你的用户数据。大家之前也说过,OpenAI 推出 Reinforcement Fine-tuning API 的时候,就是又来收集数据了。因为这种带着复杂任务的指令,以及任务是否完成的判断,非常适合强化学习。

如果一个难题被找到,强化学习可能很快就会带来智能提升。所以总体上,我觉得 Operator 的用户数据价值会更高。当然,可能还是不如自己去标注。

张小珺

如果说 AI 产品都不能带来智能水平提升,这个说法可能太武断了。也有可能是产品形态不对,还没有找到更好的产品形态去帮助 AI 提升智能。

吴翼

我的观点是反过来的:你得先有好的智能,然后好的智能会带动产品。

如果希望通过产品本身来提升智能,我觉得这个方向不一定对。比如我还和一些人聊过,据说 OpenAI 很多时候做智能提升训练,并不用用户数据。

我个人觉得,产品需要考虑的是,在当前智能水平下,怎么做出一个最好的产品,让大家用得舒服。但如果希望实现下一个层级的智能,我觉得还是应该由研究人员,或者做模型的人来决定。

这里有一个很大的问题。做产品的人应该知道,一个用户问某个问题,有可能不是因为他不想问别的,而是模型答不对。所以他只问“帮我写一个报告”“帮我写一个文书”,是因为他发现只有这些事情模型能做好。

所以我觉得,智能应该稍微提前于产品。但产品团队要做的是:有了这种智能之后,能够涌现出什么样的产品。不同的人会做出很大的差别。

张小珺

我很好奇,OpenAI 是怎么看待模型的智能水平和产品之间的关系的?

吴翼

它们是分开的。

张小珺

那它为什么要不停地发布新产品?

吴翼

我觉得和我刚才说的很像:因为它有更好的智能,有更好的智能之后,就会产生新的产品。当然,它也有失败的产品,不是所有产品都很好用。但它一直沿着智能提升的路径往前走,知道有更好的能力出现之后,应该会产生新的产品。

所以它现在其实是比较割裂的状态:有一个核心研究部门,研究部门人数比较少;还有一个大的后训练团队;再加上产品团队。

研究人员相对来说不太需要考虑产品问题,他们只需要往前走,做更好的预训练和强化学习训练。之后会有更偏产品的后训练团队,基于产品需求继续训练和对齐,最后再由产品团队完成交付。

张小珺

所以智能提升是核心研究团队在做?

吴翼

是的。因为这两件事情其实差别很大。强化学习、O1、O3 这条路线,需要有人天天想办法,让模型解决最难的问题。

如果你天天想的是产品,很难在没有产品的情况下凭空想出一个产品。你很难让产品团队空想出一个从来不存在的产品。

张小珺

为什么后训练要有一个单独的团队来做?

吴翼

很简单。做 O1、O3 的团队,可能只负责把数学能力刷上去,发现算法和 Pipeline 是通的。但真正的用户数据不在他们那里。

智能提升需要一帮研究员来完成,但模型还得发布出来让人使用,所以还需要根据用户数据,用类似的方式继续做训练和调整。因此就需要一个单独的后训练团队。

张小珺

既然这样,为什么他们不一门心思提升智能水平,为什么还一定要发布用户产品?是为了秀肌肉吗?

吴翼

我觉得也不是,因为它确实有收入。它是一家赚钱的公司,还是处在非常激烈的竞争状态中的赚钱公司。所以 OpenAI 是 closed source,赚钱的;不赚钱的开源,赚钱的都不愿意开源。

产品是让用户交钱,然后再去提升智能。

张小珺

所以用户提供的不是数据,用户提供的是钱。

Speaker 1

对。或者用户提供了一些钱,让 OpenAI 可以以此为杠杆拿到更多的钱。

张小珺

这个逻辑就说得通了。

所以 AI 时代大家常说数据飞轮、数据飞轮,其实 AI 时代的数据飞轮有一些不一样。数据是护城河,但它是不是飞轮?

吴翼

我觉得不太一样。我原来做过一段时间推荐系统。在推荐系统里,确实是数据飞轮:系统跑起来之后,你不用管它,让它持续运行,它就会越来越好。

比如淘宝,或者抖音刷视频,你使用得越多,系统就会越来越了解你,推荐也越来越好。系统团队可能没有做什么特别大的调整,但系统还是会变好。

对于 AI 来说就不是这样。AI 可以有护城河,有很多很多数据,但这些数据中间可能大部分都是噪音。你需要很聪明的研究员和团队花很多时间,找出数据里面真正有用的部分。

所以它不是一个自动飞轮。即使是产品反馈,也不会自动转起来,仍然需要人不断介入、清洗数据。这和推荐系统确实不一样。

张小珺

理想状态下,AI 产品的数据飞轮和闭环应该形成什么样子?

吴翼

它依然是一个闭环,只是不能处于人完全撒手不管的状态。

你会有更好的数据积累,用户数据也能让你知道模型能力具体欠缺在哪里。或者说,如果你想服务好用户,需要提升模型什么样的能力,提供什么样的功能。你可以和用户沟通,了解他们到底需要什么,这些都是可以的。

但你不能指望反馈拿过来之后,立刻就能变成算法,让准确率提高两个点。这件事情很难。你可能还是需要把信息交给研究员,由研究员进行处理。

所以它是一个半自动的闭环。

张小珺

我们刚才也谈到了 Agent。大家说 2025 年是 Agent 之年,其实抵达 Agent 之年需要满足很多生产要素。我们今天已经达到了吗?

吴翼

我觉得今年是看到突破的年份,但商业化变革还需要一点时间。不过我觉得不会特别久。

像 O1、O3,很多人会抱怨说,O1 很厉害,但它产生的东西很糟糕,很多人也因此骂它。我觉得它更多体现的是能力变化:原来你看不到的能力,现在看到了。

但从“看到了”到“变成一个商业化产品,并且运行得很好”,我觉得还需要一点时间。

之所以说 2025 年是 Agent 之年,是因为今年我们会看到很多东西。原来是纯文本推理,今年会变成多模态推理;原来是开环的、给一句指令再给一个反馈,今年会变成闭环,真正能够和环境交互。

原来这些东西看不太见,或者只是很初级,没有定制化模型。今年会看到很多定制化模型,也会看到很多分数被大幅提高。

OpenAI 现在做到 30 级的东西,年底应该都会刷爆。可能他们已经刷爆了,只是没有告诉我们。

张小珺

在 AI 领域,Agent 这个词是怎么来的?现在太多人聊 Agent 了,已经听麻了。

吴翼

Agent 这个概念最早是在博弈论里使用的。比如两个玩家,或者两个 Agent,在玩剪刀石头布,我们会说两个 Agent 在玩一个零和博弈,也就是 Two Agents Are Playing a Zero-Sum Game。

后来这个词进入强化学习。在强化学习的序列决策问题里,一个和环境交互的 AI,就叫 Agent,也就是智能体在环境中进行交互。所以在博弈论和强化学习里,Agent 原本是一个相对小众的概念。

到了大模型之后,突然有一天大家都开始讲 Agent。在大模型时代,很多时候大家说 Agent,等价于大模型可以调用外部世界的接口。

尤其是如果一个人的研究背景是自然语言处理,他可能原来从来没有接触过 Agent 这个词。他第一次看到 Agent,可能就是大语言模型不光能输出文本,还能调用外部 API,调用外部世界。

从 2023 年开始,大家熟知的、最火爆的 Agent 概念,就是大语言模型可以调用外部世界。它可以调用 API,也可以在屏幕上点击,形式不同,但本质都是大语言模型能够调动外部世界。

这件事情本质上还是输出了一段文字,但到了 Operator 这个时刻,很多概念终于混合起来了。真的有一个模型和环境交互,并且通过强化学习训练它。

强化学习最后回来了,或者说,它把强化学习原来的那套概念重新合并了。大语言模型和强化学习结合在一起,形成了 Operator,所以两边的 Agent 最后走到了一起。

张小珺

现在 OpenAI 说 Operator 是他们的首批智能体、首批 Agent 之一,未来会推出更多智能体。对于这些尚未发布的 Agent,你有哪些预期?能不能做一些猜想?

吴翼

我觉得首先是产品形态。GUI Agent 只是一种形态。比如 OpenAI 已经集成进苹果系统了,它是不是可以调用苹果操作系统里的 API?这可能会比点击更智能。

它还可以和一些大公司合作。现在 Operator 没有提供 API,但肯定已经开始和大公司合作了。它说未来会做这些事情,这也是 OpenAI 一贯的套路:它说未来会做,但其实早期用户可能已经合作起来了。

所以早期用户集成时,不一定非要让 Agent 去点击。对方可以把代码开放给 OpenAI,或者通过代码、接口完成其他事情。它的产品形态其实很多,可能会和其他公司合作,把 Operator 嵌入进去。

第二,这个版本肯定只是一个 Operator。后面可能有 Operator V2、Operator V3,也可能觉得这个模型不够好,重新换一个基础模型,叫做 Operator O。

我觉得今年肯定会有更新。至少很简单,OSWorld 这个榜单它现在才 30 多分,这肯定不是 OpenAI 的风格。到今年年底,肯定会给你做到七八十分。

张小珺

未来会有更多 Agent 被推出,那这些 Agent 会不会成为一个生态系统?

Speaker 1

还早。我觉得当这个东西普及之后,它必然会成为生态系统。因为如果你的工作有 80% 都由 Agent 完成,那它必然会成为生态系统。

但首先得有一个阶段,大家愿意把自己 80% 的工作交给 Agent 去做。这件事情还需要一点时间,不过今年大家会看到很多这样的产品。

张小珺

必须要有基座模型的公司才能做 Agent 吗?没有基座模型的创业公司能做吗?

Speaker 1

创业公司当然也可以做。我和很多创业公司比较熟,Agent 这件事情,创业公司同样有机会。

Agent 具备多模态能力,泛化性更好,但它所需要的数据和领域知识也会更复杂。因为它的 Scope 越来越大,至少以 OpenAI 现在的模型,还没有办法覆盖那么长尾的分布。

世界上的软件和网站太多了。就算模型覆盖了 99%,剩下的 1% 网站和软件依然是一个巨大的数量。

所以创业公司可以做垂直领域。中国这样的 Agent 公司相对少一些,因为它本质上是一个 To B 服务工作;美国已经有十几家公司做出了这样的 Agent。

它们会进入各种垂直领域。有些做客服,有些做传统行业,有些做通用 Agent,也有些服务物流公司、快递公司,或者中小企业,帮它们报税、处理订单、做各种商业工作。

所以小公司在美国至少有垂直领域的机会。我们不确定 OpenAI 会不会最终做出一个巨大模型,把所有事情都完成。在它做到之前,小公司肯定有机会。

因为这种可能性很大,所以小公司可以在某个垂直领域积累更好的数据。在 OpenAI 的大规模强化学习还没有覆盖到这个领域之前,它们有机会。

张小珺

你刚才对 Agent 的定义是“大模型调动外部世界”。我脑海里出现了一个画面:从 OpenAI 的产品形态,也就是那个对话框里,突然伸出很多只手,往外部世界抓取东西。

Speaker 1

确实是这样。不过现在可能还不是很多只手,主要就是鼠标和键盘。

张小珺

鼠标和键盘其实就是手。

你推测 OpenAI 的 Operator 需要多少硬件资源?

吴翼

这个很难说,因为大家也不知道它的模型多大。

如果它是基于 GPT-4o 的,4o 那个模型其实不大,是比较小的一个模型。但它也可能是 GPT-4o 的某个更大的版本。

我觉得既然它这么说了,那肯定不是一个特别大的模型,应该不需要很多人来做科研。但做产品可能还需要很多人。

至于算力,很难说。我只能说,它应该不是预训练那种 10 万卡级别,我觉得肯定不是,应该远小于这个规模。

但中间做了多少步研究,就不知道了。我们不能只看最后一步训练出来的那一版模型。它肯定是相对小规模的,因为模型本身不会特别大。

张小珺

从商业角度看,它的商业模式可能是什么?

吴翼

首先,前提是这个东西真的能够在托管状态下帮你做事。如果这件事情存在,商业模式其实比较清楚:你花钱买时间。

本质上,这是一个提高生产力的事情。你愿意为多出来的时间、更多的生产力付多少钱?相当于你雇了一个秘书,或者雇了一个员工。

美国 To B Agent 公司的逻辑也是这样:我可以提供一个 AI 员工,这个员工比原来雇的人便宜,或者说你原本需要花多少钱招一个人,现在用一个 AI 员工会更便宜。

核心在于,它真的要能够成为一个员工。只要真的做到了,这笔钱应该很容易收回来。

张小珺

从技术角度看,Operator 能够为未来更高级别的 AI 奠定技术基础吗?如果 Operator 是一个过渡性产品,它在 AI 实现更高智能水平上能够扮演什么角色?

吴翼

我一直有一个观点:智能其实分成两块。一块是纯文本模态的推理,另一块是视觉信号的推理,这两者其实不太一样。

现在来看,Operator 还没有真正进入物理世界,它仍然是在软件和网页层面。网页的物理感觉没有那么多,因为网页大部分还是为人浏览设计的,文本概念比较强。

所以我觉得,Operator 是 OpenAI 发出的一个信号:它希望智能不只有 O1、O3 那样纯抽象的逻辑推理,也希望具备视觉世界里的推理能力。

它现在展现出的第一种可能性,是在网页里进行推理。网页其实是把文本图像化了,本质上还是文本。它只是展现了这种可能性的开端,还没有把这种可能性真正拓展出去。

真正有意思的是,有一天 AI 能够把智能从逻辑抽象的世界带到物理世界。比如在家里找袜子,或者收拾行李时寻找某件物品,这些事情需要物理世界的推理。又比如我想收拾某个东西,也需要理解物理世界。

如果有一天,AI 能够把智能从逻辑抽象的文本世界带到物理世界,那会很有意思。但 OpenAI 现在还没有做到,它仍然聚焦在网页和软件层面。

所以我觉得 Operator 拓展了能力边界,但没有提高智力上限。它在纯逻辑推理上还没有比 O3 更强;在物理世界推理上,也还没有真正进入物理世界。

不过它是一个信号。原本它像一个 90 度的指针,一直朝北走,北方可能是图灵奖或者诺贝尔奖。右边是物理世界的智能。现在这根指针从 90 度向右扩展了一点,可能到了 80 度。

它开始伸向物理世界,但那只手好像刚刚伸过去,还没有真正触碰到。这是一种信号,会激发大家的想象,让人期待未来到底会推出什么东西。

张小珺

你觉得 OpenAI 最后会走向物理世界吗?

Speaker 1

这是个好问题。从商业上看,物理世界的钱比较难赚,所以 OpenAI 一定会先从数字世界赚钱。它能不能走到物理世界,就不知道了。

美国也有专门做物理世界智能的公司,比如 Physical Intelligence,它专注于物理世界的大模型预训练。不过也不知道它能不能最终走通。

对 OpenAI 来说,它其实没有必要自己做物理世界,可以选择投资。就像当年 OpenAI 把机器人团队裁掉,后来也可以通过投资进入这个领域。

它把大脑做好就行了,因为大脑确实更快赚钱。

张小珺

如果 Agent 在未来成为主流,你觉得人类和 AI 的协作方式会发生哪些变化?

吴翼

我觉得有两件事情值得聊。

第一,Agent 和人的交互模式是不是可以更有互动性?现在的方式是,我把要做的事情一五一十地讲清楚,然后 Agent 去执行。

虽然这个 AI 是闭环的,可以和人对话,也可以和物理世界交互,但你依然需要把指令说得很清楚。有没有可能,AI 和你的交互次数变多之后,会越来越懂你?

比如有一个 AI,知道你经常去淘宝或者飞猪买酒、买机票、订酒店。以后你要买机票,它知道你会去飞猪买,用你的会员号去买机票、订酒店。

这种个性化有没有可能出现?现在的智能体通常还不够个性化,比较通用。你每一次都需要把指令讲清楚,它还是 Instruction Following。

有没有可能通过 Personalize,让 AI 具备更好的记忆模式,不需要你每次都说得这么详细?

现在其实是人在适应 AI。就像最近 Twitter 上有一个很火的帖子,有人说“我觉得 O1 不好用”,但后来发现是自己使用 O1 的方式错了。

大家原来习惯了 ChatGPT,说一句话也不说完整,就像聊天一样。但 O1 不行,你得把指令说完整,它想 20 分钟,再帮你把事情做完。

其实是人在适应 AI。有没有可能最后是 AI 适应人?我觉得这是一个长期来看比较深、也比较难的问题。

第二个有意思的问题是,当大家习惯于使用 AI 之后,会不会出现新的变化?

现在这个世界上没有 AI,我告诉你有一个产品,你可以和它聊一聊。但如果以后每个人都习惯使用 AI,还会不会是这样的模式?

GUI Agent 之所以存在,是因为这个世界不是为 AI 设计的。但如果未来很多人都在使用 AI,软件的界面会不会发生变化?它可能会留下两扇门,一扇给 Agent,一扇给人。

这件事情还不好说。我觉得交互模式的改变,肯定是一个先普及、再改变的过程。也有可能大家会觉得,AI 就是这样,你直接用就行,人去适应它。

就像很多人一开始觉得手机一定要有键盘,后来不也适应了吗?

我本身是做强化学习的,所以这对我来说肯定是一个很好的信号。我们也在讨论,今年无论是学术界还是工业界,大家可能都会在多模态推理和交互上投入很多精力。

OpenAI 今年打响了第一枪,对我的研究也有影响。我现在想的是,那我们要不要再想得更远一点:后年 OpenAI 会做什么,后年大家会做什么?

因为你不能等别人先做出来,自己再跟进,那就又落后了。所以对学术界来说,接下来做什么是一个很好的问题。你不能做完之后,发现 OpenAI 又把它全部做完了。

张小珺

你想好答案了吗?

吴翼

还没有想得特别具体,只是想了一些比较 High Level 的东西。反正现在是过年,慢慢再想。

张小珺

你对 2025 年的技术演进方向有什么预测?有哪些看好的应用落地方向?

吴翼

我觉得 2025 年不会出现特别多全新的东西,更多还是主赛道的大竞争。

比较好的事情是,技术开始接近一些拐点。比较不好的事情是,这些拐点太有共识了。大家看的东西差不多,觉得要做的事情也差不多:多模态、物理世界和软件世界的交互、Reasoning,以及 Agent。

共识太强的时候,就很难突然长出一个大家没有想到的东西。我觉得新产品或新方向比较容易在非共识里出现。在共识之下,巨头们会形成主战场。

所以我觉得今年仍然是技术演进的一年。我给大家的建议是,不妨想想 2026 年要做什么,提前在 2025 年开始做,说不定到了 2026 年就会有新东西出现。

张小珺

就像你上次说的,现在是大家都开着坦克往前跑。因为太有共识了,所以变成了一些大公司在重装推进,自己开一辆摩托车是不行的。

吴翼

对,你可以开摩托车走乡间小道,但不要去高架上。人家开坦克,你在高架上确实比不过。但如果走乡间小道,坦克不一定会往那里开,这就有机会。

最后问你一个小问题。我们知道,你最近几个月的工作发生了一些变化,有没有什么想和大家分享的?未来你的研究方向会是哪些方面?

吴翼

1 月底有一个机器学习顶会,ICML,也就是 International Conference on Machine Learning,它有一个 Deadline。

我们本来有一些 Paper,后来 DeepSeek 和 Operator 发布之后,我们想,算了,不投了,结论都被别人说了,不投了。一个直接影响就是,我们可以放假了。

当然,我们还是有一些论文可以投。但这些进展让我开始思考,学术界应该怎么找自己的定位。

我觉得学术界可能应该去做非共识和探索,应该提前去想。如果一件事情是 OpenAI 一定会做的,那么对于学术界来说,最好选择不做。

Yann LeCun 以前说过一句话:如果你现在读 AI 的 PhD,就不应该做大语言模型。当然,他的话经常比较极端,也会为了反驳而反驳,但这句话其实有道理。

因为对于做研究来说,如果你现在做一件事情,一年之后大公司做出来,并且所有方向都做得比你好,那确实没有意义。

学术界可以探索一些没谱的东西。但 AI 变化很快,说不定两三年之后,这些没谱的东西就变成正确的方向。

比如我们刚才讲 Agent 之间的交互。如果每个人都有一个 Agent,它们的交互模式应该是什么?这是一个特别有意思的问题。

我觉得这才是真正的 Multi-Agent Problem,而不是让很多 Agent 一起完成一个点击网页的任务。后者其实没有太大意义,因为 OpenAI 直接会用它的推土机,把坦克车上的所有东西都做完。

但如果我们去想一想,这个世界上的每个人都使用 Agent,它们的交互模式应该是什么?有没有个性化的 AI?人向 AI 提供反馈和介入时,应该提供什么样的信号?

人可以给很多反馈,不只是给一个成功例子,或者给一个错误例子。这些问题都很开放,反而是学术界可以去思考的。

我只是随口说了一下,自己还得再想想。但我觉得,学术界可能确实应该少做一些已经确定的问题,多想一些更开放的问题。说不定两三年之后,这些问题就会变得非常重要。

张小珺

好啦,这期节目就是这样。如果你喜欢我的节目,欢迎前往腾讯新闻、小宇宙、苹果 Podcast、喜马拉雅、QQ 音乐订阅《张小俊商业访谈录》。如果你有其他想邀请的嘉宾、想听的内容,或者你有任何想探讨的话题,都欢迎各位听众朋友们在评论区里留言。那我们下期再见,拜拜。

88. 和吴翼技术解读OpenAI Operator:推理从抽象世界走向物理世界的开端 | BidClub