[BidClub_]
屠龙之术 · · 52 min

Vol.56 没有人知道到底什么TM是Agent…

庄明浩

Podcast
TL;DR
  • Agent的行业热度尚未转化为真实需求,供需两端都在对“只有概念、没有方案”投票。 群响一万多会员、往届单场常有2,000—3,000人参会,AI创业课首日却仅报900人;庄明浩援引的美国To B调研则显示,94%的企业不满意其AI vendor。“大家都知道AI是一个宝藏”,但至今多数服务仍停留在“收割焦虑和讲点逻辑”。

  • 从L1到L2已形成“通用、少控制、只奖励结果”的路径共识,但这套法则能否把行业带到L3仍是最大悬念。 OpenAI路径中的L1聊天机器人、L2推理者、L3 Agent、L4创新者、L5组织者,头部公司正处在从L2向L3走的节点;2025年从企业尝试走向真正落地、由Agent承接答案的时间点共识,庄明浩认为仍有较多一厢情愿成分。DeepSeek R1等强化学习实践支持“更少的控制,更多的智能”,却不等于Agent也能摆脱边界、工作流与人为结构。

  • 应用层最大的投资风险,仍是模型一次升级就吞掉创业公司多年构建的产品能力。 归藏认为,GPT-4o图像生成几乎可以用自然语言覆盖复杂Stable Diffusion工作流,再次提示“能力没有收敛之前,谨慎做应用”;但产品并非没有价值,Manus给出的“看见”范式——规划、to-do list、逐步执行、归纳与完整交付——正在成为L3的人机交互语言。

  • Agent尚无统一定义,但行业正在收敛到记忆、规划、工具使用和行为四项特征。 真正的跃迁不是更会说,而是“从语言到行为”:调用现有工具已足以完成大多数通用任务,难点转向上下文、权限、数据与安全架构,以及如何把搜索、浏览器、商业软件和代码执行串成端到端结果。Deep Search与Deep Research的底层差异,对用户而言最终都要让位于结果质量。

  • 机会结构已开始分层:通用Agent与平台生态看起来偏向巨头,早期投资相对集中于专业Agent;基础设施虽不完善,却因此涌现大量项目。 Browser Use在3月22日融资1,700万美元,Browserbase成为Enterprise Tech 30早期榜首,A1Base甚至只为Agent提供Email、WhatsApp和电话号码身份;“产业链分工太细了”本身,正是Infra层尚未定型的机会信号。

  • “边界不清楚的叫Agent,边界清楚的就不叫了”,意味着概念估值最终必须让位于具体业务。 按这一暴论,AI搜索、AI Coding、Deep Research一旦明确交付边界,可能就不再强调Agent标签;所谓微信Agent虽有小程序作为“手”的潜在优势,却受隐私、权限与微信谨慎节奏约束。“上一次遇到包容这么多东西的概念还是Metaverse呢。”

  • 庄明浩认为,Agent商业化未必会长期停在每月20美元,任务级成本、ARR与自动化价值将更早接受市场检验。 Manus按约1美元兑100积分收费:15分钟的数据分析约2美元、25分钟网页开发约3.6美元、80分钟应用开发约9美元,用户必须判断“什么任务值得你花几美金去执行”;在推理仍贵、复杂环境不可靠、用户仍需盯守的现实下,普通白领工作自动化可能比“诺贝尔水平”的科研推理更有利可图。

Digest · the substance, structured for research

1. 热度没有转化为需求,概念先于解决方案爆炸

  • 庄明浩用群响的报名反差开场:一万多付费会员、往届大课通常到场2,000—3,000人,AI创业课在全力推荐后首日却只有900人,远低于原先“第一天三千人就满了”的预期。

  • 刘思毅给出的解释被完整保留:“大家都知道AI是一个宝藏”,但创业者同样清楚,除了焦虑营销和逻辑讲解,市场仍没有探索出一套真正可服务他们的解决方案。

  • 另一侧也不乐观:庄明浩援引美国To B企业调研称,回看2024年,94%的企业不满意其AI vendor,满意者只有6%。与此同时,他提到市面上应该已经出现《Manus极简入门》,形成一种荒诞对照。

  • 智谱又发布了AutoGLM沉思,一个类似Deep Research的AI Agent;Agent、Deep Research、AutoGLM、GLM、沉思层层叠加,让非行业用户无从理解,也暴露技术、产品与市场团队之间的巨大语言裂缝。

2. L1到L2的成功法则,未必能直接复制到L3

  • OpenAI描述的AGI路径是L1聊天机器人、L2推理者、L3 Agent、L4创新者、L5组织者;庄明浩判断,全球头部公司大体处在从L2向L3移动的节点。

  • L1的突破是“通用”:从规则、机器学习、神经网络到Transformer,再到GPT-3和ChatGPT,模型不再依靠单一领域数据集只完成一个任务。上一代AI最终扎堆视觉、摄像头与安防,恰是场景被限定后的结果。

  • L2则来自更复杂的输入、思维链与后训练。行业曾争论应奖励每一步过程还是最终结果,后来的实践指向强化学习只激励结果、不强加结构;DeepSeek以V3为基础得到R1-Zero,再通过冷启动数据等后训练改善可用性,并把方法复现到Llama和Qwen。

  • 因而已有两条共识:“通用”,以及“更少的控制,更多的智能”。庄明浩真正追问的是:L3也应不限定场景、不加工作流,只依靠结果激励吗?节目没有假装给出确定答案。

  • 2025年被寄望于让企业从AI尝试走向真正落地,并由Agent承接这一答案;但庄明浩认为,这种时间点上的收敛共识仍有较多一厢情愿成分,场景与垂类同样存在空间。

3. 模型升级仍在吞掉应用层护城河

  • 过去两年主线仍是更多资本、基础设施和训练换取更强模型。DeepSeek爆火时,产品形式并无根本创新,核心仍是“智能加开源”;这让庄明浩继续怀疑,产品与商业模式创新是否始终敌不过智能本身。

  • GPT-4o图像能力引爆吉卜力风格内容。归藏认为,它几乎可以通过自然语言完成复杂Stable Diffusion图像生成工作流的各种玩法;有人前一天还在学习Stable Diffusion教程,第二天便发现“全部都白看了”。

  • 庄明浩引用雨森关于Perplexity的例子:技术人员可能认为它几天就能复现,但如果早期能投几亿美元,如今Perplexity已经是一家100多亿美元的公司;它能否干掉Google另说,早期投资回报本身已经成立。

  • 但“套壳”也低估了工程难度。即使只在模型上叠一层薄产品,从需求定义到可靠交付仍很复杂;智谱AutoGLM沉思的实现并不理想,说明“大家知道该怎么做”与真正做出好产品是两回事。

4. 产品趋势开始抬头,“看见”成为Agent的交互语法

  • ChatGPT的魔法时刻,是用户看见机器吐字;DeepSeek R1的魔法时刻,是看见模型思考。Manus给出的L3定义把这一逻辑推进到:用户要看见规划、to-do list、网页与代码操作、资料整理、归纳,以及最终网页或报告的完整交付。

  • 秘塔搜索把长答案转成互动网页时,特意显示滚动的HTML代码和0%到100%的进度条。生成本身并不神秘,但产品选择让用户“看见过程”,从而把等待转成可感知的劳动。

  • 戈飞提出的“4-2-4”原则说明,技术实现只是中间的“2”;前面的需求和产品边界、后面的运营推广,各占更重的“4”。这也是开源方案与用户可用产品之间的真实距离。

  • Enterprise Tech 30提供了弱但明确的旁证:AI-native公司占比从2019—2020年的0、2021年的3%,升至2023年33%、2024年40%、2025年50%;非技术导向PLG则由此前约15%—20%升至25%,产品、销售与品牌叙事正在小幅回归。

5. “Agent”仍是盲人摸象,工作流既是补丁也是边界

  • 游戏早已有脚本、机器学习和自动行为:足球游戏中不受玩家控制的队友与对手,乃至《吃豆人》中规则各异的四个敌人,都被庄明浩拿来追问是否算Agent。今天争论的其实是大语言模型这一代Agent,而非Agent第一次出现。

  • 庄明浩回看2023年至2024年初的YC项目,Agent当时已是第七大分类;项目分别依靠录屏、拖拽、自然语言、RPA、逻辑树和工作流做代理,彼此差异却很小,“又一个共识Agent”甚至可能只是中间态。

  • 当时的逻辑是“模型能力不够,workflow来凑”,但工作流无法穷举全部情况,只能限定场景与边界。行业于是反复走过简单、复杂、再简单、再复杂:自然语言之后出现提示词与思维链,推理增强后又为Agent堆上工作流。

  • GPT-4o用自然语言覆盖复杂图像工作流,再次提示人类可能被路径依赖带进“弯路”。若L3延续通用与少控制的方向,它最终或许也不应依赖被人工穷举的workflow。

6. 收敛的不是定义,而是记忆、规划、工具与行为

  • 庄明浩把当前共识压缩为四个特征:记忆、规划、使用工具、产生行为。记忆仍受上下文窗口制约,Manus常见的上下文超限报错说明,这个基础问题并未解决。

  • 规划曾依靠工作流等“战术上的努力”,推理模型出现后才显得可行;工具侧则不必急着发明新工具,现有生态已经能完成大多数通用任务,真正问题是怎样可靠调用。

  • 工具调用继续带来访问权限、数据架构和安全架构问题。所谓端到端训练并未消除边界,而是与必要限制、强化学习、推理和外部系统连接成新的工程整体。

  • 他区分了Deep Search与Deep Research:前者基础是搜索,后者被描述为端到端训练的模型;但用户并不关心底层是RAG还是端到端,只关心结果质量。

  • 游戏落地不理想的解释很直接:“这一波的模型叫大语言模型,语言;可是游戏里需要的是行为。”从Computer Use到OpenAI Operator,头部厂商都在尝试让语言模型真正行动,这是L2走向L3的核心。

7. 通用机会归巨头,早期资金偏向专业Agent,基建项目众多

  • CB Insights的Agent地图分为三层:Infra;软件开发、数据分析、安全、销售、HR、Marketing等水平工作层;以及法律、游戏、健康等垂直行业层。这个分层也对应不同资本可进入的机会。

  • 通用模型厂商与大型科技公司不仅做Agent,也会做开发工具和平台,争夺生态;通用Agent因此更像巨头机会。早期投资则相对集中在专业Agent,垂直行业能否走出类似美国SaaS的格局仍有待验证,国内此前SaaS投资项目的教训也无法回避。

  • Infra不完善,反而催生最多项目:开发平台、Multi-Agent、自动化执行、Web测试、数据分析、支付、记忆与搜索服务。MCP之所以突然升温,正因为它试图解决“现有工具如何被调用”;OpenAI也发布了兼容MCP的Agents SDK。

  • 具体融资显示资本已下注:Browser Use在3月22日融资1,700万美元;Browserbase登上Enterprise Tech 30早期公司榜首;A1Base只为Agent提供WhatsApp、Email和电话号码,让它拥有注册、收验证码和进入服务所需的“身份”。

8. 边界一旦清楚,“Agent”这个名字可能就会消失

  • 庄明浩的第一条暴论是:“边界不清楚的叫Agent,边界清楚的就不叫了。”按这一说法,AI搜索就是AI搜索,AI Coding就是AI编程;Deep Research明确承担研究任务后,人们似乎也不再强调它是Agent。

  • 群友的吐槽精准概括了概念风险:“上一次遇到包容这么多东西的概念还是Metaverse呢。”Agent越能解释一切,越可能缺乏可检验的业务边界。

  • 对流传的微信Agent路线图,庄明浩认为是假消息:IMA属于CSIG,难成为微信中枢;微信数据高度私人化,权限调用极难;微信连AI搜索都未全量开放,更不可能突然大步放开Agent。

  • 他的判断是,微信未来一定会做Agent,而小程序确实可以成为Agent的“手”。但实现方式与开放节奏会受到隐私、安全及微信一贯谨慎的产品节奏约束。

9. 定价与自动化价值将比概念更早接受检验

  • “黑猫白猫,抓到耗子就是好猫。”统一入口是否会让超级App重新占优,输入是否只能是自然语言,Agent还能否获得浏览器、小程序、虚拟机,垂类场景数据是否仍有价值,都暂时没有答案;项目只能先看ARR与增速。

  • 庄明浩认为Agent未必会永远沿用每月20美元:他列出OpenAI从Free、Plus每月20美元、Pro每月200美元,到设想中的Max每月2,000美元和“博士模型”每月20,000美元,能力差异正在打开定价空间。

  • Manus则把成本落到任务:39美元含3,900积分,199美元含19,900积分,免费用户每月1,000积分。NBA得分效率象限图约15分钟、200积分即2美元;婚礼邀请网页约25分钟、3.6美元;复杂交互应用约80分钟、9美元。

  • Epoch AI的谨慎判断与此呼应:在“可见的未来”,让Agent浏览互联网、操作商业软件、执行标准白领工作,或比培养诺贝尔水平的科研推理模型更有利可图。但推理仍贵、复杂环境仍不可靠、用户仍需盯守和调整——“还有很多事情要做”。

庄明浩

看了一下《屠龙之术》的后台,上一期关于 Manus 的播客更新时间是 3 月 14 日,过去了 2 周。过去 2 周里,行业内关于 Agent 的探讨非常热烈。但是,即便我在上一期播客里就提到,今天这个时间点,大家谈论很多 Agent 的事情,其实是在空对空地谈概念,即便有了 Manus 这件事情,依然没有得到特别多的改善。

近期有朋友找我,想让我给他的同事们聊一聊 AI Agent 的事情,所以有了今天的内容。今天的内容当中,有一部分来自上一期关于 Manus 的内容,大概三分之一左右,还有一部分是一些延展和展开。我们正式进入今天的主题。

我给今天的主题起了个名字,叫“没有人知道到底什么是他妈的 Agent”,用了一个有一些情绪的表达,这可能就是代表了今天这个时间点的状态。在正式内容开始之前,先讲一个小故事。

听我播客的人,大部分应该都知道一个社群叫群响,对,就是刘思毅做的那个群响。它主要做付费社群,付费会员大部分是做 IP 的、做自媒体的、做所谓操盘手的、做直播的,包括 MCN 老板,以及做消费品的,可能还有一些网红。

群响在上上周公开了一次活动介绍。他们原本预计在 4 月 12 日到 13 日于北京线下举办一次大课,两天一夜,有 12 位嘉宾。这个大课的主题叫“AI 赛道的创业大课”,会讲 AI 行业概览、AI 与 IP、AI 与私域、AI 与创业者。

群响的组织者刘思毅找了十几位他认为非常适合这个话题的嘉宾,来做这样一个课程。群响的会员每年没记错的话应该是 1,999 元会费,所有会员都可以免费参加这种大课。按照群响之前的经验,每次这种大课无论是什么主题,一般参会人数应该在 2,000 到 3,000 人,因为它有 1 万多名会员,这是一个常见的数字,所以每次大会都会有非常多人参加。

大家可以猜一下,面对 AI 这样的主题,这次大会大概有多少人报名?之前的参考是 1 万多名会员,每次大会会有 2,000 到 3,000 人参加。这一次关于 AI 这样的主题,大家想一想,应该会有多少人?

最后的答案是,其实没有太多人报名。刘思毅在他的公众号里写道,原先以为这种话题会立刻爆炸,第一篇推文发出去,第一天可能就有 3,000 人报名,直接报满。但实际上,在他们全力推荐的情况下,第一天只有 900 个人报名,比往期少了一半还多。

刘思毅就想,为什么会这样?按理说,AI 不应该是最热的话题吗?所有人不应该最关心 AI 吗?他后来想清楚一件事情:中国创业者面对 AI 的基本事实是,大家都知道 AI 是一个宝藏,但是大家心里都很清楚,没有人——至今为止,除了收割焦虑和讲点逻辑,没有人真的探索出一套解决方案来服务大家。

我觉得这句话写得非常真实,这可能也代表了今天这个时间点,我们探讨所谓 AI 落地、AI Agent 的一个角度。差不多在同一时间,我平时看 Newsletter 比较多,有一份专门写 AI 的 Newsletter,当天写了一个统计数据:在美国 To B 企业的调研统计里,2025 年初回看整个 2024 年,有 94% 的企业对 AI Vendor,也就是给他们提供 AI 服务的服务商,不满意。94% 不满意,也就是说只有 6% 是满意的。

这可能也跟前面讲的事情相关。同时,更讽刺的是,上周我们在市面上可能也看到了,应该是机械工业出版社出了一本《Manus 极简入门》。关于 Manus 的书已经出现了,特别特别讽刺,对吧?这种冲突和对立,可能也是当下这个时间点行业的状态。

再看一个热乎的新闻。就在我录直播课的前一天,中国头部 AI 模型公司智谱发布了他们的 Agent 产品,叫智谱 AutoGLM 沉思。这是一个类似 Deep Research 的 AI Agent 产品。我再重复一遍,智谱发布的这个东西叫 AutoGLM 沉思,是一个类似 Deep Research 的 AI Agent 产品。

我们回看这句话,假想如果今天你是一个不太关心 AI 行业的人,看到这几个英文单词,你会冒出无数个问号:什么叫 Agent?什么叫 Deep Research?AutoGLM 是什么?是不是还有一个叫 GLM 的东西?“沉思”又是什么意思?每一个关键词,我觉得都够我写几十页 PPT 来展开。

这或许也代表了这个行业当下的一种状态。你会发现,概念被无限泛化,从业者和用户之间对于这些东西的理解无限割裂,产品和技术之间的边界无限模糊。从公司内部的视角来看,技术产品团队跟市场、公关、PR 团队互相不理解,甚至互相骂对方傻逼,这就是现在的状态。

讲完这两个小故事,我们正式进入今天的内容。我把今天的内容分成 6 块:第一块,AI 的 L1 到 L5,如果听过我播客比较多,应该知道这是一个老生常谈的问题;第二块,模型还是产品,也是上一期讲 Manus 时谈过的一些内容;第三块,盲人摸象,我用“盲人摸象”来形容当下这个行业的状态;第四块,共识形成,也就是说,在 2025 年初这个时间点,对于 Agent 的共识其实有一些收敛。

第五个部分是“正在发生什么”,第六个是我的保留节目——暴论输出。你会发现,今天的内容可能没有什么结论,几乎没有什么结论,更多是一些逻辑的推演和现状的罗列。

1. 从 L1 走向 L3

我们进入第一部分,AI 的 L1 到 L5。听我播客的人应该知道,这件事情已经重复了不知道多少次了。OpenAI 定义的 AGI 发展路径是:L1,聊天机器人;L2,推理者;L3,Agent;L4,创新者;L5,组织者。

如果只说今天这个时间点的状态,世界范围内的头部公司现在大部分都处在从 L2 往 L3 走的节点上。前两天光明和小军的每季度大模型更新里,其实也回应了这个时间点:我们正在从 L2 往 L3 走。

我们回头来看,我们是怎么走到 L1 的。从几年前的非通用大模型走到了通用大模型。我们最早研究人工智能的时候,基于的是规则,后来有了机器学习,再后来有了神经网络,之后 Google 发布了 Transformer 架构,引发了这一轮 AI 热潮的兴起。然后到 2022 年有了 GPT-3,2022 年底有了 ChatGPT,正式引爆了这一轮 AI 的探讨。

所以,我们在那个年代,或者说在 L1 获得了什么?我在上一期讲 Manus 的时候也讲过,我们获得了通用大模型。通用大模型相较于上一代 AI 模型而言,最重要的是,它不需要限定具体场景,不只解决一个具体问题。

上一代的 AI 公司为什么大多都是做视觉的,为什么最后大家都在做摄像头和安防?就是因为上一代 AI 的能力,更多是基于单一领域的数据集完成单一任务。而今天在 L1,我们得到的是一个通用的大模型,通用模型。

那我们又是怎么走到 L2 的?这个我也讲过好几遍了,也要感谢 Max 团队张涛老师那次分享。我们在得到 L1 之后,大家发现,大模型像一个巨大无比的知识库,我们通过输入的方式刺激它的输出。你的输入总是有限的,所以它的输出也总是有限的。

大家就会想,能不能用什么方式让输入变得复杂,进而刺激大模型返回更复杂的结果?于是有了 CoT,也就是思维链。有了思维链之后,大家又发现一个现实问题:可能从大模型训练的 Pre-training 角度而言,数据已经几乎没有了,于是开始强调 Post-training,也就是后训练。

后训练的时候又会出现一些争论:我们到底是针对思维链的每一环、每一个 Step 做激励,还是针对最终结果做激励?当时就有了 PRM,也就是针对过程做激励的探讨。但事后的证明大家也知道,按照现在的情况来看,我们并不需要针对过程中的这些东西做限制和激励,只需要针对结果做激励,再通过非常简单的强化学习,我们就得到了 L2。

当时在 DeepSeek 那期播客里探讨 L2 时,我们提到,无论是 Kimi 还是 DeepSeek,在复现 o1 的过程中,都遵循了一个原则,叫“更少的控制,更多的智能”。截止到今天,这件事情已经成为了共识。

比如说,我们是怎么走到 L2 的?我们通过强化学习,只针对结果做激励,不做结构上的限制,于是走到了 L2。这个过程确实很像当时从 AlphaGo 使用人类棋谱,到 AlphaGo 了解围棋规则之后,通过强化学习、不受人类棋谱限制,得到更强的 AlphaGo Zero。DeepSeek 也复现了这样一个过程。

DeepSeek 基于基础模型 V3 做强化学习,做出了 DeepSeek-R1-Zero 版本。但 R1-Zero 版本在可用性上有一些问题,于是做了一些后训练限制,包括加入一些冷启动数据,做出了我们现在使用的 R1。

这是当时的过程。DeepSeek 做完 R1 之后,又把这套强化学习的方式复现在了 Llama 和 Qwen 上,也帮助 Llama 和 Qwen 的能力得到了提升。它把这个东西又复现了一遍,所以这就是我们走到 L2 的过程。如果大家对此有兴趣,可以回头去听我上上期讲 DeepSeek 的播客。

截止到这个时间点,我们回看整个从 AI 早期到 L1、L2 的路程,似乎有两个共识。第一个共识叫“通用”。我们不是垂类的,不限定具体场景,不设置边界。当然,这会非常非常难,所以初期的通用模型和通用能力看上去一定都不完美。

我在上一期讲 Manus 的时候也讲过,但凡限定好场景和所谓的垂类,现在一定有更好的解决方案去实现你的结果,但那不是我们要的东西。第一个共识叫通用,第二个共识叫“更少的结构”。

强化学习不需要干预,不要添加条件,减少限制,做好更好的激励模型,只对结果做激励,我们就得到了 L1 和 L2。在这个过程中,对于追寻这条路径的头部厂商而言,试错成本和最终结果之间的博弈,就是他们面对的难度。

如果这两个共识是我们走到 L2 的共识,那现在问题就变成了:走到 L3 也是这样吗?以上是第一部分。其实我在上一期讲 Manus 的时候也在讲这些话题,几乎是一样的。

2. 模型正在吞噬产品

我们进入第二个部分,模型还是产品。模型是什么?GPT-3、GPT-3.5 是模型。产品是什么?ChatGPT 是产品。

回想过去两年多的整个行业发展,其实还在遵循一个非常简单粗暴的、基于钱和 KPI 投入的逻辑:更多的钱、更好的基础设施、更好的训练,得到更好的模型。头部科技巨头们每年在 KPI 上的投入还在疯狂增长,所有的图表、所有的数字,我已经重复过无数次了。

那在产品层面的考验是什么?就像之前 DeepSeek 爆火的时候,光明所说的,DeepSeek 这次验证了一件事情:模型的应用,也就是模型级应用。DeepSeek 在产品形式上没有任何创新,核心就是智能加开源。

我也不禁思考,在 AI 时代,任何产品和商业模式的创新,都比不上智能的创新吗?这也像李翔老师讲的,在能力没有收敛之前,谨慎做应用。最近似乎又再次印证了这件事情。

GPT-4o 发布了新的图像生成能力,吉卜力风格的照片风靡了所有社交网络。有一篇推文也被很多人转发,那个人说:“今天情绪非常低落,压力非常大,我不清楚我现在在做什么。从现在开始到将来都还有价值的东西到底是什么?”

比如 GPT-4o 的图像能力,直接干翻了之前很多创业公司的产品。它们花了那么多时间、人力和投资人的钱去调优算法、工作流和模型,直接被一次大模型更新取代。昨天我还在看 Stable Diffusion 的教程,今天发现全部都白看了。

这种事情在过去两年多里无数次发生。那张梗图就是:创业公司把能力建设在大模型基础上,结果大模型冲过来把你冲垮了。似乎我们在不断重复这样一个叙事结构。

那产品的叙事结构呢?我在上一次讲 Manus 的播客里也提过,普通人应该怎么看待 Manus。AI 大模型或者 AI 产品在今天已经走向深水区,对于普通人而言,事情变得越来越复杂。

大家会说“这不就是 MaaS 套壳吗?”可是你会发现,从工程实践的角度来讲,哪怕只是做每一层薄薄的叠加,也是非常复杂的事情。包括智谱发布的所谓 AutoGLM 沉思版,从产品实现和功能角度来讲,都不是特别理想。即便大家知道应该怎么做,真正做出来的东西也不是特别好。

所以又回到我上一期播客所讲的,从 MaaS 的角度,或者从用户和产品的角度来看,MaaS 的意义到底是什么?叫“看见”。

我们回头想一想,这么多年使用 AI 产品,什么时候感受到了所谓的魔法时刻?第一次使用 ChatGPT 的时候,你看见了一个机器在吐字。第一次使用 DeepSeek-R1 的时候,你看到了模型在思考、在推理。这种“看见”,成为了今天这个时间点的产品范式,也就是说,做相关产品就得这么做。

3. Agent 必须让用户看见

那 L3 时代,Agent 用户需要看见什么?Manus 给出的定义是,用户要看见所有事情:要看见 Agent 在规划,它要有 To-do List,要把 To-do List 给你;要看见它基于这个 To-do List 一步一步地执行,打开网页、编程、整理;要看见它归纳,把所有东西做好之后进行归纳;最后,它的交付也要让你完整地看到,无论是一个网页、一份报告,还是其他什么东西,都要让你看见。

更有意思的是,“看见”这件事情,也被称为这个时间点 Agent 的一种范式。前两天秘塔搜索上线了一个功能:你搜索一个东西之后,会形成一段非常长的内容,但大家会发现,那段内容太长了,看起来有点累。

所以它做了一件什么事情?它说,基于你的搜索答案,可以把这段非常长的文字转换成一个可互动的网页,里面有各种文字框。这个功能对于今天的大模型而言,其实不是什么太难的实现。

但在做这个功能的时候,秘塔做了一个动作,我觉得非常有意思。比如说,我搜索一个问题或者一件事情,形成答案之后,点击“转换成互动网页”的按钮,秘塔会展现一个新的页面。那个新页面上半部分是 HTML 代码滚动,底下是一个从 0% 到 100% 的进度条,然后它开始制作这个互动网页。

它为什么要在中间做这一步?就是为了让用户看到这个过程,让用户看见。

同样的,我上一轮聊 MaaS 的时候讲过,从一个开源技术方案到真正面向用户可用的产品,中间的差距是非常大的。有戈飞老师讲的 4-2-4 原则,所谓技术实现可能只做了中间那个 2,前面的 4 是确定需求、确定产品边界,后面的 4 是运营推广,可能是更重要的事情。

当时我讲这些逻辑、判断和观点的时候,是我自己的认为。很巧合的是,过去这两周发生了一些事情,证明了这件事情,或者说证明了我这个观点有一点正确。

我在我的 IMA 知识库里分享了最近看到的一份非常不错的报告,是美国一个机构做的创业公司榜单。大家听起来可能觉得没什么特别的,为什么我会说这份报告很不错呢?

首先,这是一份已经连续做了 7 年的榜单,叫 Enterprise Tech 30。它每年会选出 30 家创业公司,今年因为公司特别多,变成了 60 家。60 家公司又按照阶段分成早期、中期、晚期和超后期。评选方式是找 100 多位头部基金合伙人和 CVC 负责人来进行评比。

在这份榜单里出现了一个趋势。第一个趋势是,所谓 AI-native 公司的比例在急剧提升。从第一次做榜单的 2019 年到 2020 年,当时没有公司做 AI-native 业务;2021 年是 3%,2023 年是 33%,2024 年榜单是 40%,今年的榜单已经达到 50%。

更重要的是,为什么说它验证了我的一些暴论?刚才我们讲过,原来的整个 AI 行业是纯技术趋势,几乎没有产品趋势。但是今天你会发现,产品趋势开始有一些抬头。

我们看这份创业公司榜单。榜单当中定义的 PLG,也就是通过产品形态实现增长的公司,占比一直比较高,大概一直占 60% 甚至 70%。它又把 PLG 分成技术导向的 PLG 和非技术导向的 PLG,这两个类别的比例也出现了一些变化。

纯技术导向的公司还是占多数,至少几年前是这样。巅峰时期,比如 2023 年和 2024 年,占比是 55% 和 60%;非技术导向公司的占比大概是 20%、15%,但今年涨到了 25%。也就是说,非技术导向叙事公司的占比在小幅提升,虽然没有很多,但确实在提升。

当然,这个榜单出来之后,很多人也会说:还不是你们投资人做的榜单吗?你们投资人只认那些非技术的事情,销售渠道、品牌、产品。

包括之前我也讲过,雨森讲过一个例子。当时怎么看 Perplexity?技术人员会认为这是一个几天就可以复现的东西,虽然有点意思。但如果我没有时光机,今天允许你拿几亿美元投到 Perplexity,那现在来看,Perplexity 已经是一家 100 多亿美元的公司了。

最后它能不能干掉 Google,最后 AI 搜索到底成不成立,那是后话。但是对于一家早期基金而言,如果能拿几亿美元投到 Perplexity,那你今天的成绩一定很好。

但是这里面出现了另外一个问题:这一章的标题叫“模型还是产品”。你会发现,头部厂商似乎认为 Agent 并不是产品。

OpenAI 的 Deep Research 不是普通的聊天机器人,它是一个专门面向研究、为端到端完成搜索类任务而设计的模型。它是在 o3 的基础上训练出来的一个新模型,不是套了一层壳。所以大家会说,这是模型级产品。

那这时候就出现了问题:到底应该怎么探讨这个问题?Agent 到底是什么?

4. 盲人仍在摸象

我们进入第三个部分,盲人摸象。我觉得“盲人摸象”这个成语特别适合今天这个时间点行业对于 AIGC 的讨论。

有些人摸到象鼻子,有些人摸到大象的牙齿,也就是象牙;有人摸到大象的腿,有人摸到大象的耳朵,有人摸到大象的肚子,有人摸到大象的尾巴。没有太多人对这件事情有一个非常明确的整体共识,大家更多是基于特征来描述,基于特征来描述。

前两天,集合做了一期节目,我觉得做得很有意思。他探讨的是,为什么到今天这个时间点,AI 在游戏领域的应用并没有那么强。但这个问题探讨到最后,大家会发现,AI 在几十年前就开始应用于游戏领域了。机器学习不是吗?脚本不是吗?

只不过这一代所谓大语言模型代表的 AI,在游戏行业还没有得到特别好的应用展现。举个更现实的例子,如果大家玩实况或者 FIFA 这样的足球游戏,你在控制自己那个人物的同时,你的队友和敌人是不是就是 Agent?他们有自己的行为方式、规则和脚本,甚至有一定程度的 AI 渗透。

比如更古老的游戏《吃豆人》,你在吃豆子的时候,4 个敌人的规则是不一样的。有些敌人就是靠近你,有些敌人可能在离你 6 格左右之后随机运动,它们的这些规则其实也是 AI。那这些是 AI Agent 吗?

就像我上一次讲 Manus 的时候,甚至讲 DeepSeek 的时候,我列了很多关于 Agent 的 PPT。比如“一千个人眼中有一千个 Agent”,典型的 Agent 定义,以及 2024 年、2025 年 Agent 行业发展的趋势。

甚至更早的时候,去年我跟扣基[?]做 YC 项目整理时,2024 年 5 月我们整理的是 2023 年和 2024 年初的 YC 项目。大家记得,是 2023 年和 2024 年初的 YC 项目。ChatGPT 是 2022 年底才发布的,我回头去看我们当时的整理,从项目分类角度来讲,在那个时间点,Agent 相关项目已经是第 7 大分类了。

也就是说,在那个时候,Agent 就已经形成了共识。我当时写的是:“又一个共识,Agent。”但出了一个问题:它是不是一个中间态的解决方案?当时写的评论是,可能正因为太过于共识,AI 这个方向的项目之间差异性是最小的,大家做的事情差不多。

既然叫 Agent,也就是代理,那么代理的实现方式就是各家的不同。当时大家用录屏、拖拽、工作流、自然语言、RPA、逻辑树,做各种各样的 Agent。这些都是 2023 年的项目。

当然,过去这几年你也看过非常多所谓 Agent 行业地图,特别多,各种各样的分类方式。在那个时候,大家公认的是,因为模型能力不够,所以我们要加很多花活。就像刚才讲的工作流、拖拽、录屏,或者 RPA。

模型能力不够,Workflow 来凑,对吧?但是 Workflow 这件事情大家会发现,你能穷举所有 Workflow 吗?不太可能。所以你在做的时候,就要限定边界、限定场景。

可是,这又引发了另外一条暗线,也就是过去几年整个行业发展的暗线:似乎我们从 L1 到 L2,再到 L3 的过程中,不断经历着从简单到复杂、再到简单、再到复杂的过程。

L1 的时候,大家会说自然语言就可以了,可是后来发现不是这样,你要有提示词工程,要有思维链。到了 L2,看上去提示词不重要了;为了做 L3,又开始加 Workflow。

如果按照这个逻辑,L3 似乎不应该需要 Workflow,也不应该限定场景。也是因为最近 GPT-4o 发布了新的图像模型之后,归藏写了这样一条:“昨晚 OpenAI 更新了 GPT-4o 的图像生成功能,很多朋友还在按照传统图像模型测试美学表现和编辑能力。但其实它真正强大的地方,是几乎可以通过自然语言对话,完成现在复杂 Stable Diffusion 图像生成工作流的所有玩法。”

那篇文章的标题叫《干废一切图像工作流》,告诉你 GPT-4o 图片生成真正强大的地方。所以从技术实践角度来讲,人类的路径依赖似乎一次又一次把我们推到了所谓的弯路上。

我们来看整个 Agent。从最早的 Chatbot,到所谓的 Copilot,它只能回答问题,后来可以有记忆。到了 Agent 的探讨阶段,它需要调用工具,需要进行规划,这是大家在这个时间点对于 Agent 的普遍共识。

5. Agent 共识正在收敛

那正在收敛中的共识是什么?为什么时间点是 2025 年?2022 年底 ChatGPT 发布,大家认为 2023 年是模型竞争年,2024 年是应用年。但从结果来看并不是特别理想,所以 2025 年就要有一个新的概念。

从 To B 市场来看,2023 年大家在做模型,2024 年企业开始尝试 AI,2025 年应该就要从尝试变成真正意义上的落地。那它落地到底是什么?是不是这样一个 Agent 的东西?你会发现,这种时间点上的收敛共识,我觉得还是那个观点:一厢情愿的成分多了一些。

第一个共识是时间点,第二个共识是通用。刚才也讲过,通用其实是过去整个 AI 行业发展中的一种惯性。大家都是瞄着皇冠上的明珠去的,当然这也是最大的机会。

但反过来讲,场景和垂类也存在空间。当一个新的通用阶段出现时,就会进一步加强整个产业链的分工,因为我们已经经历过好几次了。

第三个共识是如何实现。现在看上去的共识是要做端到端训练,强化学习加推理是基础,同时要做必要的边界限制。这就是实现路径。

当然,为了实现这件事情,也出现了很多新的问题。比如在使用 Agent 产品时,经常出现的报错是上下文长度超标。大模型的记忆和上下文窗口问题非常麻烦,在这个时间点依然没有解决好。

从语言模型的语言到使用工具,外部工具应该如何调用,也变成了问题。在调用过程中,访问权限、数据架构,甚至安全架构也出现了新的问题。我们出现了很多新的问题。

再回头来看整个 Agent 的概念,今天大家比较有共识的描述,基本上有 4 个特征。你看,我描述的依然是特征,而不是整体概念。它要有记忆,要有规划能力,要能够使用工具,还要有行为。

记忆方面,这一波大模型发展中,上下文长度的内卷一直存在。如果大家还有印象,Kimi 当年刚出来时主推的卖点就是超长上下文。Manus 的使用过程中经常报错的,也就是上下文超限。

那计划呢?在大模型能力达到推理之前,我们刚才讲过,YC 那个时候的很多项目,是用战术上的努力来实现计划。但当推理模型出现之后,这件事情看上去就不那么难了,所以才引发了 Agent 的讨论。

工具的使用,我想强调一点:当前这个时间点,现存的工具生态已经非常丰富,能够使用好现存工具,就已经足够完成大多数通用任务。所以在工具使用这件事情上,这个节点要做的不是发明新的工具,而是解决如何调用现有工具的问题。

最后是行为,还是刚才游戏的例子。那期集合的播客有一个核心角度,我觉得特别简单,但特别直接:为什么这一波大语言模型的能力在游戏领域落地得并不理想?

因为这一波的模型叫大语言模型,关键词是“语言”。可是游戏里需要的是什么?需要的是行为。大语言模型是语言,但我们需要行为,Agent 需要的是行为。

所以我们回头来看,从 Anthropic 的 Computer Use 到 OpenAI 的 Operator,大语言模型头部公司最近一段时间都在做从语言到行为的努力。这也是我们从 L2 到 L3,甚至再往 L4、L5 发展的开始——从语言到行为。

然后就是前面很重要的关键词:模型级产品。这也是最近非常热门的一个方向。我们回头来看,还是模型级产品的讨论。国外这些产品全部叫 Deep Search、Deep Research,包括 AutoGLM 起的名字叫“沉思版”,也就是 Deep Thinking。

可是这些关键词之间还是有一些细微区别。Deep Search 是更好的搜索,但它的基础是搜索。我们讲 Deep Research,它不是搜索,它是一个端到端训练的模型。

可是这里出现一个问题:今天你是一个用户,想找一个东西,或者研究一件事情,你会关心使用的工具背后是 Deep Search 还是 Deep Research 吗?你会关心它是 RAG 还是端到端训练的模型吗?你不关心,你只关心结果的质量。

6. Agent 生态开始分层

我们进入下一个话题。刚才讲的都是收敛中的共识,那现在我们讲“正在发生什么”。

我用了一张 CB Insights 刚刚发布的 AI Agent 行业地图。讲完前面那些概念和逻辑之后,你会发现,再去看这种把几百家公司贴在一张图上的行业地图时,会相对清楚一点。

CB Insights 把 Agent 分为 3 类,或者说把 Agent 的整个行业地图分成 3 层。第一层叫 Infra 层,也就是基础设施;第二层叫水平层,或者工作层,比如软件开发、数据分析、安全、销售、HR、Marketing 等领域的 Agent;第三层叫垂直 Agent,也就是垂直在某个行业,比如法律、游戏、健康行业。

那正在发生什么?第一,大家都会做、通用模型厂商也都会做的事情是,无论是美国的那七姐妹,还是 OpenAI、Sierra,它们除了提供所谓 AI Agent 服务之外,也在做 AI Agent 的开发工具和开发平台。也就是说,它们不单纯只做 Agent 本身,也想做 Agent 生态。

国内也是一样。腾讯、字节、阿里、华为、智谱肯定会做,甚至已经在做了。那 MiniMax 要做吗?Kimi 要做吗?应该也会做。

似乎看上去,通用 Agent 应该是大公司和模型厂商的机会。那这里就出现了问题:Manus 是什么?

然后又回到刚才那个话题——模型级应用。我们看谁在沿着这条路,或者说基于这个规则做事情:ChatGPT、Claude、xAI、Google Gemini、微软 Copilot,包括 Perplexity。你发现一个趋势了吗?似乎都是那些最大的公司。

我的好友 Tom Xu 在极客公园上发表过一个观点。他说,讲模型级应用的人,大概率没有做过高留存,或者日均使用时长 1 个小时以上的 App。全世界能匹配模型级应用这顶皇冠的,其实只有 GPT 和 DeepSeek 这样的公司,类似哥德巴赫猜想。

他说,日活才是王道的人,大部分是 1970 年到 1995 年前后出生的老登。我们这些人享受过先发优势、网络效应和规模效应的时代红利,也有很重的历史包袱,包括深入骨髓的古典互联网路径依赖。

但我们这些人要知道,一切还没有到定局。每天都是日新月异的新篇章,整个行业还在动态变化。

从投资角度来讲,早期投资相对集中在刚才说的第二个板块,也就是各种各样的专业 Agent。但有人会说,那是因为通用 Agent 你们投不起,对吧?因为做通用 Agent 的都是大公司和那几家头部公司,早期基金投不起来。

至于垂直行业,刚才讲的那几个 A 轮项目,从美国的意义上来讲还处于发展阶段,甚至可能跟美国 To B SaaS 行业的格局有些类似。早年的 To B SaaS 行业也经历过一些波折期。

讲到 To B 和 SaaS,又引发了一个送命题。当年延续美国企业服务和 SaaS 的国内投资人和项目方,基本上全军覆没。这一波 AI 会不一样吗?

7. 基础设施争夺平台入口

然后下一个观点是,基础设施、研发这一层非常不完善。非常不完善导致的结果是,这一层的项目最多。有做 AI Agent 开发平台的,做 Multi-Agent 的,做自动化执行的,做 Web 端测试和工具应用的,做数据分析的,做支付的,做记忆的,无数公司都在做。

举一个很现实的例子,最近很多人问这样一个问题,不是一个人问,而是很多人问:比如说 Deep Research,或者 DeepSeek、Kimi,你现在可以在使用推理模型的同时使用搜索,那搜索这一层的服务是谁提供的?

DeepSeek 和 Kimi 不会自己做一个搜索引擎,对吧?那一层的服务是谁提供的?美国有没有公司提供这种服务?大家都是用 Google 的中间 API 吗?这就叫基础设施。

再次回应前面讲的,所有人都不会放弃 Agent 成为平台的可能性。也就是说,除了提供 Agent 之外,所有头部厂商和做相关业务的公司,都会想做 Agent 的开发平台。在美国已经是这样,在中国应该也是这样。

同样,为什么最近关于 MCP 的讨论那么多?因为它做的事情就是基础设施,尤其是工具调用。最近两周关于 MCP 的文章非常非常多。

这个逻辑我这么讲都很清楚,别人也不会不了解,所以看上这个机会的人非常多。OpenAI 刚刚也做了动作,发布了 Agents SDK,包括兼容 MCP,也在努力做这件事情。

当然,也有很多享受到红利的公司。典型的比如 Browser Use。知道 Manus 实现原理的朋友应该知道,Manus 使用了很多 Browser Use 的能力,也就是让 Agent 调用浏览器功能。

Browser Use 在 3 月 22 日,也就是两周之前,刚刚融了新一轮 1,700 万美元。另一家公司叫 Browserbase,听这个名字也知道大概是做什么的。

这家公司也很有意思,它就是刚才我讲的、我很喜欢的那份 Enterprise Tech 30 报告今年榜单的第一名,也是早期公司的第一名。无数公司和投资人都在看这家公司的未来,这些都是做 Agent Infra 的公司。

再往下挖,我发现了一家更有意思的公司。因为 YC 刚刚结束了 2025 年这一批项目的评选,有一家公司叫 A1Base。我看到公司的第一时间,就把它的介绍发给了张鹏老师,也就是 Manus 的产品合伙人。

张老师跟我说,美国这个生态的产业链分工真的是太细了。这家公司是做什么的?大家现在会遇到一个问题:你在调用各种各样的 API 时,要访问一个网站,但那个网站需要注册,需要身份,需要邮箱地址,需要电话号码,甚至需要一个能够接收验证码的邮箱,要不然你进不去。

怎么办?A1Base 的服务就是给 Agent 一个身份。它只做这一件事情:给你一个 WhatsApp 号码、一个 Email 地址、一个可以群聊的地址、一个电话号码,然后你的 Agent 就变成了一个有身份的人。

它只做这一件事情。所以什么叫产业链分工?以上就是正在发生的事情。

8. Agent 边界正在消失

最后一部分,我的暴论输出:什么他妈的叫他妈的 Agent?

第一个暴论,边界不清楚的叫 Agent,边界清楚了就不叫了。AI 搜索就叫 AI 搜索,不叫 AI 搜索 Agent。AI 编程就叫 AI 编程,AI Coding,不叫 Coding Agent。

今天 Deep Research 是做研究的,大家似乎也不再提它是一个 Agent。凡是边界被定义清楚了,它可能就不叫 Agent 了。

Agent 是一个看上去如此包容万物的概念。那天我聊到这个角度时,一位群友说:“上一次遇到包容这么多东西的概念,还是 Metaverse。”死去的记忆开始疯狂攻击我。

前两天,我的第二个暴论是,很多人转发了一篇关于微信 Agent 路径的截图,应该很多人都看过。截图说,腾讯在人工智能领域的战略布局浮出水面,微信 Agent 或成为 3 月最值得期待的应用。

现在 3 月已经过去了,它还没有出来。然后有人会说,IMA 是微信 Agent 的雏形,之后会逐步开放权限,包括朋友圈、本地文件,然后激活小程序生态,微信成为 Agent 最大的入口。

那张截图应该很多人都看过,但我会觉得这是假的。现在你去转发这张截图时,微信也会主动提示你这是虚假新闻,做了辟谣。但为什么我第一时间就反应过来这不是真的?这特别简单。

第一,IMA 是 CSIG 做的,微信怎么可能让一个 CSIG 的产品成为自己的中枢?第二,微信上的数据几乎全部都是个人隐私数据,怎么来做 Agent 的调用,是一个巨大的考验。

微信以及张小龙一直都不是迈大步子的选择,他们一直都迈得比较小。回头来看,比如 DeepSeek 火了之后,微信上线了 AI 搜索,但直到今天,微信的 AI 搜索依然没有全量开放。光一个搜索都不敢全量开放,Agent 怎么敢全量开放?

但纯粹从实现角度来看,我觉得如果未来微信真的有 Agent,小程序确实是一个好东西。它是那只手,是行为的实现方式,而且这种架构其实比较接近理想中的 Agent。微信一定会做,但怎么做,以及节奏如何,会非常考验微信团队。

第三个暴论也是我无数次讲过的:“黑猫白猫,抓到耗子就是好猫。”对于今天这个时间点想做业务的很多公司而言,有一些问题需要回答。

一定要有一个大一统的入口吗?比如最近夸克的更新,它把所有功能模块都包在了搜索框里。如果是这样一个统一的大入口,那是不是超级 App 又赢了?微信、抖音、夸克。

一定只能用自然语言作为输入方式吗?别的不行吗?我们可以给 Agent 浏览器权限、Agent 的小程序调用权限,甚至直接给 Agent 一台虚拟机。除此之外,我们还能给 Agent 什么?我能不能给 Agent 一个网吧?

大家会说,这一波探讨当中,Workflow 没有意义了,那垂类场景的数据有意义吗?这些问题看上去都没有答案,又回到我无数次强调的那个结论:我们只能看收入,看 ARR,看 ARR 的年度数字和增速,来评判一个 AI 项目。

说到钱的时候又出现了一个问题。前两天光明和小军的播客里也提到这个观点:为什么今天这个时间点,投 AI 模型产品的定价都是每月 20 美元?Agent 来了之后,还会延续这个定价吗?

我觉得不会。我们看 OpenAI 的定价,Free,也就是最基础的版本,不要钱;稍微好一点的 Plus 版本,每月 20 美元;更厉害的 Pro 版本,每月 200 美元。然后 OpenAI 会说,他们会发布一个每月 2,000 美元的 Max 版本,以及一个每月 20,000 美元的博士模型。

针对模型能力的提升,会以这样的方式做定价。这里面就出现了一个新的议题:我觉得在 Agent 时代,产品定价会非常重要,是一门艺术。

很巧合的是,也是在上周,Manus 发布了他们的定价,两档。39 美元一档,提供 3,900 积分;Pro 199 美元一档,提供 19,900 积分。免费用户每个月赠送 1,000 积分。

也就是说,如果按它们的收费来看,就是 1 美元 100 积分。它们给了几个例子:如果你想做一个 NBA 球员得分效率的象限图,这是一个数据分析加可视化任务,大概需要执行 15 分钟,消耗 200 积分,也就是 2 美元。

比如,中等难度的任务是做一个婚礼邀请网页,涉及网页开发、代码和部署,可能需要执行 25 分钟,消耗 360 多积分,也就是 3.6 美元。

再比如做一个复杂的、基于位置和每日天象、天气事件的 Web 应用。它需要应用开发和数据集成,网站部署之后还要可以交互,大概需要执行 80 分钟,消耗 900 积分,也就是 9 美元。

你听完之后,包括 Manus 上线积分系统之后,从用户角度而言,就出现了一个巨大的挑战:你要慎重思考,什么任务值得你花几美元去执行。什么任务值得你花几美元去执行?

最后,Epoch AI 这个专门研究 AI 进展的科研机构,最近发表了一篇文章。它说,大部分 AI 的价值来自自动化,来自其他事情,而不是来自研发。这可能回应了我前面讲的叙事的一部分。

它说:“从商业角度来看,我们怀疑在可见的未来,人工智能实验室专注于尝试自动化普通工作任务将更有利可图。例如,创建计算机使用代理,也就是 Agent,使其能够浏览互联网、操作商业软件并执行标准的白领工作,而不是专注于培养诺贝尔奖水平的推理模型,去狭义地帮助生物学、医药学等领域的研究人员。”

“我们还认为,相比 AI 在研发任务中的表现,这些所谓的普通能力可能更重要。”

9. Agent 现实仍然受限

最后,让我们回到现实。我们谈论了很多 Agent 的事情,无数媒体都在写 Agent 的时代要来了,Agent 多么厉害,Agent 强大到不行。但实际情况并不是这样:推理成本依然很高,复杂环境下 Agent 依然不行,用户不信任,交互体验依然有待创新。

它需要不断地盯着,需要不断地调整,这就是现实。我们当然期待 AIGC 会爆发、会到来、会变得越来越好,但是在这个时间点,现实仍然是,还有很多事情要做。感谢大家收听我的节目,我的 PPT 也会放在 Show Notes 里,如果需要可以自行下载,谢谢。

Vol.56 没有人知道到底什么TM是Agent… | BidClub