[BidClub_]
硅谷101 · · 80 min

E201|从Manus到ChatGPT Agent:底层技术架构有何不同?(上)

泓君朱哲清

YouTube
TL;DR
  • ChatGPT Agent把Deep Research、Operator与虚拟机串成端到端流程,但首轮体验更像抢占通用Agent入口的工程整合,而非成熟的技术跃迁。 朱哲清测试“先研究、再做幻灯片”需35分钟至1小时,旅行任务也要二三十分钟;他认为主要与Deep Research和Operator原有的速度有关,两者结合后更慢。优势是依靠较强的vision在网页上执行,但整体效果低于预期,速度也比想象中慢很多。

  • 消费级Agent当前最难跨越的并非点击网页,而是个性化、支付信任与任务本身是否值得代理。 ChatGPT Agent选出的新加坡航班和酒店最终都被推翻,因为它没记住用户偏好凯悦、直飞和低价;到支付又必须由人接管。泓君提醒人类秘书同样需要沟通,朱哲清承认这一点,但认为复杂偏好的记忆仍不完整,冷启动没有解决。

  • 通用Agent的四条架构路线,本质是在万能性、速度、可靠性和权限覆盖之间做取舍。 浏览器路线“确实是万能的”,代价是高token与网络延迟;开放虚拟机适合代码和数据分析,却难处理登录授权;受限环境靠模板换速度;Pokee式第三方API/SDK集成更快、更可靠,却只能执行平台正式开放的动作。

  • 产品分化已经从“谁更通用”转向“谁能在目标工作流里稳定复用”。 Manus以浏览器加虚拟机覆盖面取胜,但可能受长上下文、幻觉与小时级耗时拖累;JSBox把超级智能体拆成幻灯片、表格、AI电话等模板,速度更快却趋向垂直平台;朱哲清称Pokee速度可达同类的4至10倍、单次工具调用成本可降50%至60%,代价是放弃部分个人账户场景。

  • 真正更清晰的商业市场是专业用户的重复工作流,而非普通消费者的一次性“万能助手”。 朱哲清观察到许多消费Agent留存差,是因为任务“用一次就结束了”;相反,Pokee用户会每周重复跑同一流程。标准化出差适合API型Agent,变量众多的休闲旅行则更适合浏览器型Agent,这一分界直接决定留存与单位经济性。

  • 未来一到两年若Agent成为入口,门户流量、协议控制权和内容付费方式都可能被重写。 朱哲清判断电商、搜索、视频等门户流量会快速下降;他以Google推出A to A为例,并认为ChatGPT、Cloud及Pokee推出协议,同样是在争夺Agent入口。他同时估计近2万个MCP中可用者不到200个,维护与可靠性仍是协议生态的硬约束。

  • 创作者经济未必消失,但广告和推荐可能从“页面排名”迁移到“对话时序”。 面对泓君关于AI摘要侵蚀播客广告的质疑,朱哲清设想Agent按调用向内容方付费,再在没有唯一答案的节点插入商业推荐;传统一次展示5至10条内容的排序机制,则可能被五至十轮、每轮争取下一次交互的推荐逻辑替代。他明确保留不确定性:“我也不是100%确定说,这个一定是未来的方向。”

Digest · the substance, structured for research

1. ChatGPT Agent的浏览器执行领先,但分钟级任务仍难证明实用性

  • 朱哲清在发布当天下午试用后的判断偏冷:ChatGPT Agent总体效果低于预期,速度也比想象中慢很多;“先做深度研究,然后再去创建一个幻灯片”通常需要35分钟至1小时。他认为主要原因与Deep Research和Operator原有的速度有关,两者结合后延迟进一步叠加。

  • 新加坡三日行展示了它相对突出的部分:先规划,再搜索往返航班与酒店,依靠vision language model理解页面并获得反馈。相较只抓取HTML组件的方案,这种接近机器人架构的视觉导航更能处理真实网页,朱哲清认为其点击能力超过多数浏览器Agent。

  • 但任务耗时二三十分钟,最终只推进到支付前;朱哲清直言:“我宁可说自己花点时间,十几分钟全部搞定。”支付不是技术上卡死,而是“产品上卡死”——用户尚不信任Agent动用资金,Pokee已集成的相关能力也因此没有开放。

2. 消费Agent首先败在偏好记忆,而非缺少更多操作能力

  • 旅行结果暴露了执行正确与决策正确的差别:Agent推荐的酒店和航班都未被采用。朱哲清习惯住Hyatt,航班偏好直飞中的较低价格,但系统只在高层问三四个问题,之后缺少反馈循环,最后交付的是“笼统的这么一个解决方案”。

  • 泓君的反驳值得保留:人类秘书也需要先知道酒店、时间、价格和舱位偏好,而且Agent理论上“告诉它一次”便可长期复用。朱哲清承认沟通不可避免,问题在于ChatGPT只较好记住行文偏好,复杂旅行反馈并未从早期对话延续到本次任务,“冷启动问题”仍未解决。

  • 电商也未必是高价值突破口。朱哲清认为购物从明确需求到下单通常只有三四步,人点几次即可;真正费时的是形成偏好的选择阶段,而现有Agent既慢,也未必能替用户做出满意选择,不像调研、幻灯片或电子表格那样能节省显著工时。

3. ChatGPT Agent是检索、执行与虚拟机的工程合流

  • 朱哲清把新产品概括为Deep Research负责“从哪里得到更完整的信息”,Operator负责“基于这些信息怎么执行”。过去前者交付一份巨大报告、后者要求用户已经知道自己要什么;合并后的价值,是把信息获取到网页执行做成端到端体验。

  • 其路由逻辑在他看来并不神秘:复杂信息需求先进入Deep Research,再携带结果执行;简单需求则直接执行。虚拟机补上第三条路径,可用Python或Bash脚本生成PPTX、处理任务,因此整体是“从深度研究到浏览器,到虚拟机的一个结合体”。

  • 这也是朱哲清对发布时机的保留意见:整合难度“其实没有很大”,更像OpenAI看到Manus、Genspark等通用Agent后争夺市场的动作。发布演示和产品状态都不算成熟,部分任务甚至比现有产品更慢、效果更差。

4. 四种架构没有全胜路线,只有不同的失败方式

  • 第一类纯浏览器Agent相信所有互联网服务最终都呈现在网页上,因此只要能“看见并操作”便近乎万能,过程也对用户可见。代价是每一步都可能重新读取HTML与JavaScript,token消耗高;单次网页下载本身就可能花三四秒,network call成为无法消除的瓶颈。

  • 第二类浏览器加开放虚拟机,可临时安装包、运行Python或Bash,尤其适合表格等数据分析。它在线下计算上灵活,却常无法访问需要完整身份验证的服务,例如登录个人Facebook账户。

  • 第三类以语言模型写代码、在受限环境运行;以JSBox为例,环境可能只预置少量包,不能临时下载图像处理工具。能力边界更窄,却能通过幻灯片、表格等标准模板降低token和等待时间。

  • 第四类沿Zapier、n8n、UiPath的集成路线,由第三方API或SDK完成每个节点。其交付更可靠,因为权限直接来自平台;限制也同样清楚——Facebook、Instagram若只允许创作者或商业账户自动发帖,Agent便不能替个人账户绕过规则。

5. OpenAI、Manus、JSBox与Pokee押注不同的产品边界

  • 在朱哲清的比较中,OpenAI目前应该仍拥有最强的浏览器操作能力,尤其是在把Deep Research和浏览器操作放在一起以后。比如在最新的browsing camp中,它们能够达到50%多的基准测试分数,其他最高目前也只有20多分,而且是在开源环境下。问题是它“什么东西都想往浏览器里面塞”,能力增加的同时也把速度拖慢。

  • Manus用规划模型、独立Browser Agent和虚拟机搭出近乎万能的环境:浏览器获取信息,汇总后再进虚拟机执行。理论覆盖面很大,却会因上下文过长出现幻觉,也难在复杂页面完成上传、格式调整等细粒度动作。泓君认为三十多分钟已经比早期一两个小时快;朱哲清回应,基础设施虽已搭起,但浏览器和network call的瓶颈仍在,下载网页本身可能需要三四秒。

  • Perplexity的浏览器产品走的是另一条路线:不是让Agent自主导航整个浏览器,而是在用户浏览时提供sidebar,让用户说明要在当前页面完成什么,再由它执行。

  • JSBox则从“超级智能体”逐步拆成幻灯片、AI电话、表格、浏览器等模板,以固定工具和标准工作流改善体验与速度。朱哲清猜测它想随着应用场景逐一完善,成为承载很多小任务的大平台;泓君将此类比为微信小程序。由于浏览器导航和虚拟机都受到限制,它的速度也比Manus和ChatGPT快一些。

  • Pokee主动放弃部分万能性,依靠第三方SDK、工具集成和上下文工程提速;朱哲清预计加入自研Deep Research后,整体速度应该可比市场产品快4至10倍,工具调用成本可能削减50%至60%,整体成本相对OpenAI的ChatGPT Agent及原话所称的“Manner”有数量级差距,和Verticalize JSBox这类产品相比则可能有几倍差距。这些均是其团队口径,且个人社交账户等未开放权限的任务明确做不到。

6. 重复性工作流把专业Agent与消费Agent分开

  • 朱哲清不把市场简单切成To B与To C,而是锁定“专业用户及以上”:普通用户需要高频省时Agent的概率不高,许多通用Agent留存差,根因是工作流没有重复性;Pokee看到的有效信号,则是用户每周反复执行相同流程。

  • 出差与旅游的对比把边界说得最清楚:每两周飞一次湾区、入住同一家酒店,适合标准化自动执行;普通游客可能换目的地、探索酒店,甚至因刚发奖金临时改坐商务舱,变量太多,更适合让浏览器Agent边探索边确认。

  • 平台开放程度决定这条路线的天花板。美国科技公司普遍重视开发者生态,国内接口相对少一些,但企业微信、创作者级别的微信等专业场景已有自动回复能力;朱哲清以高德地图为例,认为MCP浪潮正在迫使更多公司开放API和SDK。

7. Agent入口之争将门户流量与协议变成同一场战争

  • 朱哲清给出的未来工作流是:用户只需让Agent抓取Replit CEO的YouTube演讲、生成增长策略报告,全程不打开YouTube;购物也可能从理解身材、试穿正装到发现折扣都在ChatGPT内完成。由此他判断,未来一到两年电商、搜索、视频门户流量“会非常快速地下降”。

  • 协议的战略意义因此不是技术整齐,而是控制入口。他以Google推出A to A为例,设想如果某家公司占据这一协议并率先在Gemini中部署,就可能成为智能体入口的赢家;ChatGPT、Cloud和Pokee推出协议,同样是在争夺专业化或通用化场景下的入口。

  • 泓君追问为何不直接加入统一MCP生态。朱哲清的回答是维护质量:市面上应该快有2万个MCP,但他认为真正可用的不到200个,且多数无人维护;Pokee希望服务商只交出API,由平台承担封装与维护,并换取额外流量入口。

8. 广告不会消失,但创作者付费与推荐目标可能被重写

  • 泓君从创作者立场提出关键反例:若听众只看AI总结,播客中的口播广告便失去曝光,免费内容的商业循环可能断裂;而Agent每次可能只引用少量精准来源,也不像推荐页面能同时给10条或12条播客、视频内容分配流量。

  • 朱哲清的设想是把付费责任从创作者转给Agent:Agent每次调用或访问播客知识产权时直接付款,再在工作流中没有唯一答案的节点引入商业排序,例如推荐用户尝试哪个Agent并向相关公司收费。“广告这个行业会永远存在,但是它的发生形式会发生改变。”

  • 他甚至认为这可能改善创作者与SaaS生态:内容方不必免费交给YouTube换广告分成,支持API、第三方插件的产品或知识产权本身也可以按调用获得收入。不过这仍是未来机制设想,如何定价、归因以及覆盖被遗漏的内容,节目没有给出确定方案。

  • 推荐系统本身也可能由空间排名转向时间序列:不再一次呈现第1至第10名,而是在五至十轮对话中,每轮给出基本上“一定会去点击”的最精确结果,并以促成下一轮交互为目标;只有相关性相当时才选择收入更高的内容。朱哲清最后保留了边界:“我也不是100%确定说,这个一定是未来的方向。”

泓君

上一集节目我们刚刚复盘完AI智能体的投资逻辑,OpenAI就发布了它的第一款通用型智能体ChatGPT Agent。今天我们为你带来了一个重磅消息:我们将推出ChatGPT智能体。人们一直希望有一个统一的代理,它能够自主运行,使用自己的计算机去完成真正复杂的任务。今天我们邀请来了Pokee.ai的创始人朱哲清,他也是前Meta AI应用强化学习团队的负责人,本科与斯坦福博士阶段的研究方向都是强化学习。

很多网友问,怎么感觉这个有一点点像我们经常用到或者提到的Manus跟Genspark?这一期我们会聊聊,Manus、Genspark、ChatGPT Agent这些看上去很像的通用型AI智能体,它们在技术架构和设计逻辑上有什么不同;也会聊到全世界最顶尖的强化学习人才分布,以及AGI,也就是通用人工智能的5个层次。

从这两三年的AI发展来看,OpenAI定义的前3个层次的通用人工智能可能已经实现,或者部分实现了。而对于一些前沿研究者来说,我们现在正处在从第3层到第4层的跨越期,强化学习正是揭开谜底的钥匙。

另外,嘉宾的学习与工作语言都是英文,所以今天的播客中出现了很多中英夹杂的专业术语。对非技术听众来说,听起来可能会有一点不友好,但比起语言的问题,这依然是一期很高质量、极具前瞻性的对话。如果大家理解有困难,可以在B站或者YouTube上观看我们的字幕版。

欢迎Pokee.ai的创始人朱哲清,Bill Zhu。哈喽,Bill。我们今天录制的时间,正好是在OpenAI刚刚发布ChatGPT智能体的这个周末。它其实是周五上午发布的,我不知道在它发布以后,差不多过去一天半的时间,你有没有使用?

朱哲清

对,我们确实第一时间就使用了它。因为在它发布前一天,大家其实都已经看到了它们在Twitter上的一些预热,我们在当天下午三四点钟就开始试用它了。

感觉它的总体效果可能比我们想象中要差一些,速度也比我们想象中慢很多。核心原因应该是跟它原生的Deep Research和Operator本身的速度有关。因为深度研究相对于市面上所有的产品来说,还是相对比较慢的一个研究产品;再加上Operator本身,我们也知道它的基准测试上的速度也很慢,所以它把两者结合以后,整体速度就更慢了。

比如说,有一个比较简单、大家都在对比的用例,就是先做深度研究,然后再去创建一个切片。像这种用例,时间基本上在35分钟到1个小时之间,所以是一个非常慢的过程。

我觉得它的优势在于,它在浏览器上真的要做操作的时候,是相对有优势的。比如说它去定制衣服,或者预订旅程的时候,它在浏览器上的点击能力要超过市面上大多数基于浏览器的智能体。

所以非常取决于你的使用方向是什么。如果是偏运营相关的一些工作,可能不是很适用;但如果是偏消费者相关的,它可能会更适用一些。

泓君

你可不可以具体举一下例子?你具体用了它哪些方面?刚刚你提到,在挑衣服或者做旅行规划的时候,它看起来比其他基于浏览器的智能体更有优势。可不可以讲一下你的整个使用场景,包括我们对比它跟其他使用浏览器的智能体时,它的不一样是什么?

朱哲清

我可以简单举两个例子。一个就是我想去新加坡待3天,我就问它:“你能不能帮我把整个旅程定下来,然后去找对应的航班、酒店信息,并把它定下来?”

它确实花了很长的时间。一开始它先去做规划,这个规划所有的语言模型现在都可以做,所以没什么可让我赞叹的地方。之后它去搜往返的航班,以及对应的酒店,其实难度也没有很大,但是目前市面上大多数基于浏览器的智能体,在这方面做得都不是很好,ChatGPT相对会好一些。

因为它的vision,也就是视觉感知能力,相对更好。它有点像机器人的感知架构,里面有vision-language model,也就是视觉语言模型。它会根据视觉感知的结果,再进行反馈。

泓君

你的vision model,是指它在比如找航班的时候,能看到搜索页面的信息?它不一定要通过后台数据或者API接口调用的方式,指的是这个不同?

朱哲清

大多数基于浏览器的智能体里面,都有一些视觉感知的部分。也就是说,它要去看那个页面到底长什么样。

因为很多时候,如果靠基于浏览器的方式,它完全是靠后端想办法,把页面里面所有的HTML组件拉下来。拿到组件以后,再去判断每个组件是什么,然后选择要点哪个地方,再去执行。

很多时候,第一,你有可能在访问页面的时候就会被卡住,因为你等于是在爬虫爬人家的页面。第二,作为一个基于浏览器的智能体,你希望它能够看到整个视觉层的结构是什么样子,所以视觉感知能力就会有帮助。

当然,很多计算机使用智能体都带有视觉感知能力,所以也不算是一个很大的创新。但因为它的视觉感知能力相对强一些,所以导致它真的去执行的时候,要比我现在看到的市面上其他浏览器智能体好一些。

泓君

它帮你订机票、酒店,然后做旅行规划,整体花了多久?它最后完成支付环节了吗,还是只是把所有航班选好了?

朱哲清

我记得应该是二三十分钟。只是选好了,到了支付环节,都是人去接管操作的。

我觉得支付环节是所有智能体业务范围内最麻烦的一个点。因为正常的人类不会信任智能体去做支付,所以很多时候所有智能体一旦涉及支付,都会卡死在那里。

不是技术上卡死,而是产品上卡死,因为人和智能体之间的信任还没有达到那个标准。所以导致大多数智能体,像我们也一样,其实有很多跟支付相关的功能已经集成完了,但是一直没有开放。

因为我觉得不会有人那么轻易地信任Pokee去做这件事情。OpenAI也有一样的问题,到了支付环节,还是需要人类去接管,然后完成支付任务。

等于说它花了20多分钟,但当中你还是得花时间说“我要去付钱”。总体来说,我觉得实用性没有很大,我宁可自己花点时间,十几分钟全部搞定。

另外一个相对比较常用的用例,就是它们在电商方面也花了很多力气。比如说根据你的要求,再去找相对应的产品。

我个人还不是很喜欢这种产品方式,因为我感觉它整个帮你搜索产品、找相对应产品的过程,比如什么颜色、什么样的款式,其实是一个挺慢的过程。而人去选的话,也就是点几个键的事情。

我一直认为,电商这个方向的决策链路很短,导致智能体真正能够给你带来的优势很小。因为它真正需要人类决策的范畴,可能也就是3到4步,最多了。

它不像其他事情,比如你要做一个调研、写一个幻灯片、写一个电子表格,这些都很花时间,而购物可能没有那么花时间。我觉得购物最花时间的地方,其实不是你已经想好了要什么,到下单的这个过程,而是你在选择的那个过程。

泓君

刚刚你提到,用它订航班和酒店的时候,我特别想问,你最后自己订的那家酒店,跟它做旅行规划、帮你找到的那家酒店是一致的吗?你对它找的结果满意吗?

朱哲清

不一致。航班也不是,因为它有很多信息都不知道。

我举个例子,我一般出门都住Hyatt,飞航班的话,我一般都会尽可能在直飞里面找价格比较低的。但它在找的时候其实没有反馈机制,一开始只会在高层次上问你三四个问题,就是深度研究的那种问题。

它一轮完成以后,后面没有再跟你有反馈,它就一直自己执行。所以它定的相当于是一个笼统的解决方案,到最后我得全部推翻重来,因为它没有用任何我喜欢的品牌,也没有加入个性化的部分。

这是我认为目前市面上Agent产品,特别是To C、面向消费者的智能体产品,而且跟生产效率不相关的智能体产品的一个最大痛点。

OpenAI一直在强调它们的记忆能力,这确实很重要。但是它们从哪里去一开始收集这些记忆,就变成了一个没有办法解决的冷启动问题。

泓君

但其实只要你告诉它一次,你喜欢住凯悦酒店,它可能以后就记住了,跟一个人类助理一样,你越用才会越顺手。假设让你的秘书帮你订机票,你可能也得跟他沟通:“我要凯悦酒店,我在飞机上偏好什么时间段、什么价格、什么舱位。”

朱哲清

对,确实是这样的。但是,人类会不会愿意做这么一两轮沟通,说完以后它是不是能记住,这其实是个问题。

我目前用ChatGPT下来,它对于你的一些行文偏好是有一些记忆的,但是更复杂的偏好,它的记忆其实没有那么完整。ChatGPT刚出来的时候,我问过它跟旅行相关的问题,但这次再问它的时候,它仍然没有记住当时给它的一些反馈。

所以它并不能够很完整地把你所有的反馈都记下来。

泓君

我们知道,在OpenAI推出这一轮ChatGPT智能体以前,刚刚我们反复提到过,它有两个智能体:一个是Operator,处理跟电商购物相关的智能体调用;另一个是Deep Research,用来做深度研究。

我看它这次的整个发布,自己的感受是,它有一点像这两个智能体之间的结合体。因为你也在开发智能体相关的产品,你觉得OpenAI在这个中间的核心技术壁垒是什么?把这两个智能体放在一起,难度大吗?

朱哲清

其实没有很大。这次的产品甚至让我感觉,它们是因为看到市面上有很多通用智能体出现,想要占领市场而做的一个动作,而不是说它们真的已经准备好了。

像它们发布会上给出的产品演示,其实也并不是很成熟的状态。说句实话,它们做的很多任务,和市面上的通用智能体相比,效果可能更差一些,速度又更慢。

它为什么要把深度研究和Operator放在一起变成一个智能体?核心原因是,深度研究是帮你检索信息,也就是“我从哪里可以得到更完整的、面向用户需求的信息”;Operator则是基于这些信息,去执行任务。

过去这两个方向基本上是割裂开的。如果要了解更完善的信息,你只能直接用深度研究。用完以后,它可能给你一个巨大的报告,但这个报告也不足以让你去做什么事情,你可能只能把报告复制粘贴到某个文档里面。

Operator也是一样,你必须已经知道自己想要什么,然后基于想要的东西,再去找Operator,让它帮你操作网页来完成任务。

这两个方向在各自的领域里可能都做得比较好。它希望能够把从信息获取、信息检索到执行的端到端体验打通,通过这两个能力实现这一点,这是一个比较符合常理的决策。

但我目前看起来,它相当于是一个工程解决方案,也就是做一个判断:如果用户需要非常复杂的信息检索,那就去做深度研究;完成深度研究以后,拿着这些信息再去执行。如果不需要,那就直接执行。

当中还有一个偏编程和虚拟机的解决方案,这一点跟Manus很像。它确实有虚拟机,可以执行比如生成PPTX文件、用Python脚本写一些脚本,或者写一些Bash脚本,让虚拟机去执行任务。

所以它基本上就是一个从深度研究到浏览器,再到虚拟机的结合体。

泓君

你觉得它跟市面上的通用型AI智能体,主要区别是什么?或者说,市面上所有这些通用型AI智能体,如果我们把它们放在一个池子里,看各家各自的优劣势,分别是什么?因为我相信,它们在解决不同场景的问题时,还是会有一些区分度的。

朱哲清

目前的通用智能体,我把浏览器和非浏览器的全部列出来,可能包括这么几家:Perplexity、OpenAI。Anthropic其实没有推出自己的通用Agent,但它们有编程Agent。我们相对比较小一些,比较晚才出来,还有Manus、Genspark。浏览器方面可能有Yutori、Fellou,还有Flowith,Flowith可能更偏垂直领域一些。

首先,在浏览器能力和操作能力上最强的,目前应该还是OpenAI。特别是在把深度研究和浏览器操作放在一起以后,它们绝对是最强的。

如果你去看一些基准测试,比如像最新出来的browsing camp,它们能够达到50%多的基准测试分数,其他最高目前也只有20多分,而且是在开源环境下。

在浏览器的实际执行上,Operator做得还是相对比较好的。因为当年的Operator是跟很多有API、有虚拟机的环境去对比的,它只有一个浏览器。所以现在加上虚拟机能力以后,Operator加上OpenAI的虚拟机,应该会超过市面上一些浏览器加虚拟机的工具。

但是它唯一比较麻烦的一点,在于OpenAI的虚拟机装了太多东西,什么都想往浏览器里面塞,导致速度很慢。

浏览器方向包括OpenAI、Fellou以及Manus的一部分,因为Manus也使用浏览器。另一个方向是完全只有语言模型,再加上一些执行能力,可能也可以算虚拟机,但它是一个受限的虚拟机。

它并不是可以调用整个系统里的所有包,而是有一些预设的包,然后去完成任务。

当然,我们也不能忘记Perplexity。Perplexity在浏览器方面做了一个相对比较另类的产品:它的浏览器不是一个能够导航浏览器的智能体,而是在用户使用浏览器的时候,给你一个sidebar,也就是侧边栏,让你告诉它“我需要在这个页面上做些什么”,然后它去帮你执行。

泓君

Browser就是浏览器的意思,sandbox就是虚拟机。所以刚刚你提到了基于浏览器和基于虚拟机的两种搭建方式,可不可以整体跟听众科普一下,现在整个AI智能体的搭建,在底层架构上有哪几种?

朱哲清

现在的智能体有4种大的方向。

一个是基于浏览器的智能体;第二种是浏览器加虚拟机的智能体,在这种智能体里面,会有很多操作通过虚拟机里的代码以及命令行来完成;第三种是只有虚拟机,但是虚拟机内部有非常大的限制,主要通过语言模型生成代码,然后只能运行某一种类型的代码;最后一种,是可以横跨很多工具、进行很多集成的智能体。

我先讲一下浏览器和非浏览器。浏览器、虚拟机、纯语言模型,再加上Pokee这种方式,这4个方向之间都有可以互相借鉴的代码,而且也有互相重叠的地方。

浏览器的意义在于,我认为世界上所有的网页和互联网服务,都可以在某个网页上呈现。所以我只需要让智能体能够看到那个网页、操作那个网页,就可以完成任务。

基于浏览器的智能体,用户可以看到它在页面上点击哪些地方,它可以一页一页地去看,就像人在操作网页一样。

它的缺点是什么?就是很慢,而且token消耗特别高。原因在于,你去看一个网页,就等于要把HTML文件直接拉下来,里面可能还包括一些JavaScript脚本,然后把它们全部拉下来,从零开始全部读一遍,只为了操作一个网页。

但它确实是万能的。

第二个是虚拟机。虚拟机的意义是,我可以在线下写一些Python脚本、Bash脚本,或者JavaScript脚本,然后直接在虚拟机环境里运行这些脚本,来完成任务。

比如说你要做数据分析,完全可以告诉虚拟机智能体:“这是一个表格文件,它的表头是时间、每周销售、品类等。”拿到这个文件以后,你就直接告诉虚拟机:“你能不能照着这个文件,帮我做一个每周的数据分析?”然后它就给你写一个Python脚本,帮你运行,得到结果。

虚拟机环境的好处是,它可以运行很多线下的、开源的包。它的缺点是,很多情况下无法访问互联网,特别是那些需要完整授权和身份验证的产品。比如说你要登录自己的Facebook,这些事情它肯定做不到。

第三种是语言模型加虚拟机的Agent。它可能限定在一个大环境里,JSBox就是一个这样的例子。它不给你完整的虚拟机,这个例子里面甚至连浏览器都没有。

以JSBox为例,它有一个以语言模型为主体的推理过程,写代码也完全靠语言模型。它有一个虚拟机,让它运行一些代码、生成一些东西,然后再把结果转化成可视内容。

但那个环境甚至不能叫虚拟机,因为它是非常受限的。它只有三四个包,环境是完全被控制的,无法临时下载一个开源包。比如说我现在需要临时修改一张图片,如果这个任务在它原始设计的工具包里没有,它自己不会去下载一个包再完成这件事情。

所以这种设计是JSBox,比如幻灯片智能体、表格智能体,在设计的时候就把可用的包限制住,不让用户使用更多的包。这是一个相对封闭的工作流:在受限环境下,用语言模型作为主体写代码,同时用一个小型环境去执行。

最后一种,可能跟我们以及以前的Zapier、n8n、UiPath比较像,但工作流内部的每一个节点,是通过和第三方服务提供商直接集成来完成的。

这种方式的优势在于,可以保证每一个服务的交付都非常可靠,因为是第三方直接提供的。比如Facebook,它把权限给我们,就不会出错。

但与此同时,它也有局限,就是不可能把每件事情都实现。很有可能用户想要在个人Facebook账户上发图片,但我们做不到,因为Facebook只允许创作者和商业用户自动发布这类帖子。

所以这是我们和以前的UiPath、Zapier、n8n相近的一条路径。总的来说,就是这4种类型。

第二种和第三种之间的边界很模糊。唯一的区别在于,第二种的虚拟机是语言模型执行完以后,提供给用户使用的一个几乎开放的虚拟机,你可以自己选择下载新的包,再去执行任务。所以虚拟机本身的能力,是整个智能体能力的主体。

而第三种可能是语言模型在现有的包之下生成什么代码,这件事已经成为限制整个智能体能力的主体。

泓君

从用户的使用体验上说,如果我们把Pokee、Genspark、Manus和OpenAI的ChatGPT智能体放在一起,你觉得用户体验会有什么非常明显的不一样吗?

朱哲清

其实有很多地方都不一样。我们先讲Manus,因为它是第一家出来的。

Manus的体验是,尽可能用一个虚拟机加浏览器的环境,搭建一个几乎让人觉得万能的环境。它有一个语言模型作为规划主体,规划完以后进入Browser,由另外一个Agent完成浏览器导航。它得到的信息会被总结下来,再进入虚拟机执行,如果有必要的话,它确实可以做很多事情。

虽然它有很多时候会出现幻觉,因为它看到的上下文太长了,但理论上它确实可以涵盖市面上你所需要的所有功能。

但与此同时,它也被浏览器能力限制住了。比如说你要真的发一个帖子,它就做不到,因为它需要在页面上导航,选择那个小按钮,选择完以后再上传图片、生成视频,各种各样的操作都很难。

比如说你要建一个Google表格,或者把Google表格里的某个表格改成一种格式,也比较难,因为注意力空间太小了。浏览器就是它的主要限制。

第二点就是它很慢,这也是Manus和ChatGPT智能体的一个共同问题。因为用了浏览器,所以速度会非常慢。

泓君

三十多分钟做一个任务,我觉得还是快的。我最开始使用的时候,可能要一两个小时,不过那个时候还比较早。

朱哲清

对,现在肯定比以前快了,因为它们整个基础设施都已经搭起来了。但是它的瓶颈还在那里,甚至最后会变成network call,也就是网络请求。

下载一个网页本身可能就需要三四秒,这个时间是跳不过去的。

ChatGPT的优势在于,它们的深度研究做得好,能够做出很详尽的报告。如果你通过这个报告再去执行某些任务,结果会相对更详尽一些。

Manus的总体优势,可能在于它的虚拟机环境搭得比ChatGPT更好一些。但这个我还需要更详细地去查,因为我还不太清楚ChatGPT里面的虚拟机能做到什么程度。不过我猜,Manus已经在虚拟机上花了很多精力去部署,应该会有一个比较小的优势。

JSBox一开始有一个超级智能体,几乎是说“我可以做任何事情”。但后面它发现能够处理的工具数量还是有限,所以开始做模板。

比如幻灯片是一个智能体,AI电话是一个智能体,表格是一个智能体,浏览器也单独做了一个智能体。在同一个用例下面,它会把用户体验作为核心目标,然后做一些模板。

不管你问什么问题,它总是用这样的模板去生成幻灯片,总是用这些工具去搜索信息,使得它变成一个相对标准化的工作流。它越来越不像一个通用智能体,而变成了一个偏人为选择的智能体。

但它的速度确实比Manus和ChatGPT快一些。原因就是它没有那么复杂的浏览器导航,同时它的虚拟机本身限制很多,在某一个Agent里面只有这么一点工具。

泓君

这样是不是也更节省token?

朱哲清

会相对节省一些token。它把大任务拆成了细分的垂直小任务。我猜它想做的是,随着应用场景一个一个完善,最后变成一个承载了很多小任务的大平台。

泓君

对,有点像微信小程序一样的一个平台。

朱哲清

Pokee可能最大的不一样,就是它可能是目前所有Agent里面最快的。我们现在还没有把深度研究智能体开放出来,但确实有一个深度研究智能体正在开发当中。最后我们会把自己的深度研究智能体和执行智能体放在一起,总体体验会有大幅提升。

但总体速度应该是市面上所有产品的4到10倍左右。之所以可以做到,是因为如果不再需要使用非常复杂的虚拟机,也不再需要非常复杂的tool calling,我们现在直接使用第三方集成的SDK和工具,通过自己的调用工具功能,整个速度会大幅提升。

也就是说,没有了MCP和现在市面上工具调用里巨长无比的上下文问题,所以每次调用工具的成本可能能够削减50%到60%。再加上我们自己的上下文工程,使得整个成本至少跟OpenAI的ChatGPT智能体、跟Manner相比,有一个数量级的区别;跟像Verticalize JSBox这样的产品相比,可能也有几倍的差距。

在token使用上,我们确实有劣势,特别是跟基于浏览器的智能体相比。我们并不是完全万能的,有一些任务,比如在个人账户上发布Facebook帖子,我们就只能在Facebook页面上发布;Instagram也必须是创作者账号或者企业账户,个人账户没有办法帮你发帖。

泓君

所以只有企业用户才能使用你们的智能体?

朱哲清

不是企业用户,是创作者或者企业账户。

比如说你在接Instagram和Facebook接口的时候,它们给到你的就是企业用户或者创作者才能操作的界面。它们不希望所有个人用户都用智能体去发帖,发完以后没人上Facebook和Instagram。

它们希望个人用户像普通用户一样,每天去Facebook和Instagram上看帖子、发帖子,这样才有参与感。企业用户和创作者用户则希望能够让他们创作更多,所以才把接口开放给他们。

每个平台都有自己的限制。我觉得这条路径其实相对比较符合商业逻辑。

如果你想象所有个人用户都通过一个智能体,想办法用浏览器去破解Facebook或者Instagram账户,或者破解某个平台,通过爬虫访问网页来完成任务,那对于平台来说就是一种损失,平台会把浏览器访问全部卡掉。

所以如果你一开始就是跟着平台的商业逻辑走,以前有人会通过很手动化的方式写代码完成产品上传,现在就会有人直接写一段文字,在网页上运行,然后把这个视频creative,也就是个性化内容,上传到这些社交媒体平台上。

其他平台也是一样,它们开放给你的权限,就是它们认为开发者、非个人用户或者非普通用户真正最需要使用的工具。如果你可以把这些工具放进智能体里,原来就会使用这些工具的人,就会转过来说:“我写一行提示词就行了”,不再需要写那么多代码。

泓君

所以我理解,Manus、Genspark,还有OpenAI的ChatGPT智能体,它们的商业模式其实是面向消费者的;而你的商业模式听起来,现在应该更偏向企业端。

朱哲清

现在这个时代,企业端和消费端的模糊性很高,但是我们一定是让专业用户及以上的人群来使用我们的产品。

专业用户以下的普通用户,其实使用一个非常省时间的AI智能体的概率不高。这也是为什么市面上很多AI智能体的留存率非常差,因为它没有重复性,很多工作流用一次就结束了。

而我们目前看到的很多用户,每周都会重复运行一模一样的工作流。所以这是我们发现它具有重复性的地方。

泓君

那这是不是也很取决于平台会给你们开放什么样的SDK工具和API接口?

假设我每天收到很多微信消息,想有一个智能体帮我管理所有信息,帮我回复一些比较基础的信息,前提还是微信要给这样的智能体开放接口。它们是不是愿意把这些接口开放给开发者?

朱哲清

在美国,开发者社区是很多大公司,特别是科技公司所崇尚的方向,所以大多数公司都有非常完善的接口和开发工具包。甚至有些公司给到你的只是一个非常简单的爬虫接口,也不会给你Python开发工具包之类的东西。

国内公司可能会相对差一些,很多接口并不开放给你。但像企业微信、创作者级别的微信,也会把接口开放出来,你可以自动回复,什么都可以做。

国内整个生态其实也在慢慢开放,特别是MCP这波出来以后,很多公司都开始被迫开放开发工具包和接口。比如高德地图就是一个例子,之前没有那么开放的高德地图,在MCP出来以后,首先把地图生态完全打开了。

所以其实有很多这样的例子。我们目前也有一些公司给我们开放平台API,有些接口是独家的,有些不是。

总体来说,这个商业模式一定是偏专业用户的商业模式,因为很多普通用户端的使用场景非常浏览器导向。比如你去浏览网页、买东西,其实旅行需求也有偏专业化和非专业化之分。

专业化的旅行需求,比如出差,每次都是标准化的:你每两周要去一趟湾区,每次都住同一个酒店,那就可以每两周帮你买一次机票。

但如果是普通用户出去旅行,他可能是“我要去这个地方玩”,酒店也想探索新的,航班也有很多变化,比如今天刚发了奖金,想要飞商务舱,里面有很多变数。

所以这种用例本身更适合基于浏览器的智能体,因为它就是有一台电脑在前面,可以打开浏览器去做事情。

泓君

在你跟大公司合作的过程中,它们开放API接口的动力是什么?包括你刚刚也提到,国内高德地图接入MCP,它们的动力又是什么呢?

朱哲清(Bill Zhu)

首先,整个智能体浪潮会在某种意义上取代正常的网页流量。

过去可能是一个人打开浏览器,在搜索引擎里输入一段搜索,得到搜索结果以后,点击一个网页再去做某件事情,这是一个常规流程。

但未来可能是,你打开ChatGPT;如果你是普通用户,就打开ChatGPT,如果你是专业用户,就打开Pokee,然后输入一段话:“今天早上我看到了Replit CEO的一个采访,你能不能直接把YouTube上的那个讲稿拉下来,帮我写一段报告,告诉我他的增长策略的核心观点?”

然后智能体就直接完成了整个流程,我从头到尾都没有打开YouTube。

未来购物可能也是一样。你可能从头到尾只打开ChatGPT,说:“我明天要去一个晚宴,需要一套正装。”它已经知道你的身材、身高,然后自动帮你找到最符合你的衣服,把衣服呈现在你身上,你看一眼觉得不错,它再告诉你现在有一个折扣,然后完成付款,可能就是这么一个流程。

这给我们的启示是,过去所谓的工作流已经改变了。它不再是通过浏览器开始整个工作流,去下单、获取信息,然后再进入另外一个网页进行操作。

无法避免的是,我认为在接下来1到2年,大多数门户网站,不管是电子商务、搜索、视频网站,还是其他各种类型的门户网站,它们的流量一定会非常快速地下降,而入口会变成各个方向的智能体。

这也是为什么Google要推出A to A(智能体通信开放标准)。每家公司都可能有自己的智能体,智能体之间可能会发生交互。如果一家公司能够占据这个协议,率先在Gemini里面完成部署,最后它就会成为整个生态里最大的赢家,因为它成为了智能体入口。

ChatGPT也是一样,Cloud也是一样。它们推出协议,也是想要战略性地占据智能体入口。这也是Pokee要推出协议的原因,我们也想占据专业化场景下的智能体入口。

泓君

你们为什么想自己推出协议,而不是直接接一个标准的MCP?这样大家都可以统一使用,你也能在更大、更广的生态里,直接接入很多已经接好的软件。

朱哲清(Bill Zhu)

其实MCP现在的可用性很差。现在市面上应该快有2万个MCP了,其中真正可用的不到200个,而且大多数MCP都没有人维护。

导致的结果就是,大多数公司不愿意花时间去做MCP。我们的目标是,公司不再需要做MCP,也不需要自己搭建一个MCP服务器,只要直接把开放API给到我们,剩下的由我们来管理。

所以对于服务商公司来说,它们什么都不用做,就可以获得一个额外的流量入口。

泓君

你刚刚在描述,接入智能体以后,互联网会发生什么样的变化。比如门户网站的流量会大幅下降,像听到Replit CEO的一段演讲,直接在ChatGPT或者Pokee上就完成对这段演讲的复述。

我在想一个问题,因为我的身份是创作者,跟你的身份是不一样的。你觉得未来这件事情对创作者会有什么影响?

假设我们上一期节目聊到腾讯算法广告大赛,那期节目里有一个口播广告。只有更多的人听这个播客,大家才会听到这段广告,它才能支撑播客的商业模式运转下去,大家才能持续赚钱,把这档节目运营下去。

但如果以后没有这个过程了,大家会说:“这期播客为什么没有开AI总结?”然后就不去听播客,直接看AI总结,那对广告来说其实就是流量的折损。

朱哲清(Bill Zhu)

我觉得广告这个行业会永远存在,但是它的发生形式会改变。现在市面上有很多专注于广告的AI公司,它们都在研究,语言模型时代或者智能体时代,广告要如何被插入。

我举个简单的例子。在播客里插播广告这件事情,未来可能会变成另一种形式。

现在的播客,大多数情况下,除了平台向你收费以外,播客提供者本身是不收费的。比如硅谷101录了一个播客,大家都是免费听的;如果你在YouTube上使用YouTube的广告,YouTube再通过广告跟你们分成。

未来可能是,我们需要获取你这个播客本身的知识产权权限,这个权限是有价值的。每一次通过调用,或者通过网页访问,找到你们播客的某个时间点,或者获取到你的信息,任何智能体都要向你付款。

你不再需要负责广告流量,广告由智能体来完成。智能体会说:“我得到了这个信息以后,怎么在整个工作流或者用户体验中插入广告?”

这个时候,智能体可能会问:“我们现在得到了这个对比,你想选择哪个智能体去尝试探索?”这件事情本身没有界限分明的答案,所以会出现一个排序机制。

智能体推荐哪个智能体让用户去尝试,就可以向那个智能体的公司收费。广告在这个时候发生,而支持每个API、每个第三方插件的产品本身,或者知识产权本身,都可以直接收费。

所以对于创作者生态以及SaaS生态来说,从某种意义上讲是变好了,而不是变差了。你不再需要在Google上投广告,也不再需要免费把内容发给YouTube,让它帮你投放,而是由智能体直接向你付费,通过它自己的广告机制支付自己的成本。

我不觉得你们会受到很大的冲击。

泓君

整体上我觉得,流量分成这样的模式会变得越来越弱。如果智能体调用了很多创作者的内容,怎么给创作者付费,可能是未来会讨论的一个问题。

我稍微有一点疑问的是基于流量的这套方式。比如你有推荐算法,一个页面可以显示10条播客内容,或者12条你想点击的视频信息。但一个智能体在回答问题的时候,我觉得现在还是比较聚焦于精准,它可能引用的范围就相对更小了。

朱哲清(Bill Zhu)

上个星期在ICML的时候,有一个专门做推荐系统的人,我们俩聊到了这件事情。聚会之后,有一个研究者上来问我:“你觉得推荐系统之后会是什么样的发展路径?”

我当时告诉他,我觉得推荐系统的大方向可能会受到巨大挤压。在智能体的整个框架下面,它仍然是一个推荐系统端到端、基于动机的决策过程,但它每一次给你的交互,其实只是给你一条信息,或者几条最相关的信息。

这个时候,它的决策链不再是按照排行第一、排行第二、排行第三这样的方式去决策了,而是以时间作为决策点。

一个人和智能体之间交互的总时长基本是固定的。就是说,这个智能体好,我就会跟它交互更久。它的目标可能是,在每一个时间点上,推荐的东西能够让你所花费的时间和它能够得到的回报成正比。

这个时候,原来的推荐系统算法可能就不那么成立了。原来的推荐系统算法是说,每一条内容被点击的概率,可能跟它的排名成正比。

而现在可能变成,我每一次给你推荐或者回复的信息,基本上都是你一定会去点击的东西,但你会不会进行第二轮交互?下一次你花时间跟我交互,我所占用你的时间成本,就要求我推荐的这一条信息必须是最精确的。

这样会使得你跟我有更多交互。所以它的目标就变成了:我不是在一个页面上给你呈现5条、10条内容,而是可能有5轮、10轮对话,每一轮的目标都是让你跟我进行下一轮交互。

这个时候,它跟传统推荐系统的算法就完全不一样了。所以当时我跟他说,我觉得整个推荐系统,特别是这种基于排行的推荐系统,长期发展的潜力可能会被极度压缩,因为它可能不再有排名。

它更多的是一个基于顺序、基于体验、基于探索的交互机制。你可能唯一的目标就是,每一条内容都给你最精确的结果,同时在不损失未来机会成本的情况下,在同等级别的内容里选择一个能够带来更多收入的内容。

当然,我也不是百分之百确定这一定是未来的方向。但从目前的智能体发展趋势来看,我个人感觉可能会是这样一个方向。

泓君

我觉得非常有意思。之后创作者生态会怎么演变,也是我们一直非常关注的一个话题。那下一期节目中,我们将重点聊聊强化学习与它人才分布的大本营,以及AGI的五个层次与我们现在的位置。欢迎大家继续收看我们下一期视频。

E201|从Manus到ChatGPT Agent:底层技术架构有何不同?(上) | BidClub