泓君
上一集节目我们刚刚复盘完AI智能体的投资逻辑,OpenAI就发布了它的第一款通用型智能体ChatGPT Agent。今天我们为你带来了一个重磅消息:我们将推出ChatGPT智能体。人们一直希望有一个统一的代理,它能够自主运行,使用自己的计算机去完成真正复杂的任务。今天我们邀请来了Pokee.ai的创始人朱哲清,他也是前Meta AI应用强化学习团队的负责人,本科与斯坦福博士阶段的研究方向都是强化学习。
很多网友问,怎么感觉这个有一点点像我们经常用到或者提到的Manus跟Genspark?这一期我们会聊聊,Manus、Genspark、ChatGPT Agent这些看上去很像的通用型AI智能体,它们在技术架构和设计逻辑上有什么不同;也会聊到全世界最顶尖的强化学习人才分布,以及AGI,也就是通用人工智能的5个层次。
从这两三年的AI发展来看,OpenAI定义的前3个层次的通用人工智能可能已经实现,或者部分实现了。而对于一些前沿研究者来说,我们现在正处在从第3层到第4层的跨越期,强化学习正是揭开谜底的钥匙。
另外,嘉宾的学习与工作语言都是英文,所以今天的播客中出现了很多中英夹杂的专业术语。对非技术听众来说,听起来可能会有一点不友好,但比起语言的问题,这依然是一期很高质量、极具前瞻性的对话。如果大家理解有困难,可以在B站或者YouTube上观看我们的字幕版。
欢迎Pokee.ai的创始人朱哲清,Bill Zhu。哈喽,Bill。我们今天录制的时间,正好是在OpenAI刚刚发布ChatGPT智能体的这个周末。它其实是周五上午发布的,我不知道在它发布以后,差不多过去一天半的时间,你有没有使用?
朱哲清
对,我们确实第一时间就使用了它。因为在它发布前一天,大家其实都已经看到了它们在Twitter上的一些预热,我们在当天下午三四点钟就开始试用它了。
感觉它的总体效果可能比我们想象中要差一些,速度也比我们想象中慢很多。核心原因应该是跟它原生的Deep Research和Operator本身的速度有关。因为深度研究相对于市面上所有的产品来说,还是相对比较慢的一个研究产品;再加上Operator本身,我们也知道它的基准测试上的速度也很慢,所以它把两者结合以后,整体速度就更慢了。
比如说,有一个比较简单、大家都在对比的用例,就是先做深度研究,然后再去创建一个切片。像这种用例,时间基本上在35分钟到1个小时之间,所以是一个非常慢的过程。
我觉得它的优势在于,它在浏览器上真的要做操作的时候,是相对有优势的。比如说它去定制衣服,或者预订旅程的时候,它在浏览器上的点击能力要超过市面上大多数基于浏览器的智能体。
所以非常取决于你的使用方向是什么。如果是偏运营相关的一些工作,可能不是很适用;但如果是偏消费者相关的,它可能会更适用一些。
泓君
你可不可以具体举一下例子?你具体用了它哪些方面?刚刚你提到,在挑衣服或者做旅行规划的时候,它看起来比其他基于浏览器的智能体更有优势。可不可以讲一下你的整个使用场景,包括我们对比它跟其他使用浏览器的智能体时,它的不一样是什么?
朱哲清
我可以简单举两个例子。一个就是我想去新加坡待3天,我就问它:“你能不能帮我把整个旅程定下来,然后去找对应的航班、酒店信息,并把它定下来?”
它确实花了很长的时间。一开始它先去做规划,这个规划所有的语言模型现在都可以做,所以没什么可让我赞叹的地方。之后它去搜往返的航班,以及对应的酒店,其实难度也没有很大,但是目前市面上大多数基于浏览器的智能体,在这方面做得都不是很好,ChatGPT相对会好一些。
因为它的vision,也就是视觉感知能力,相对更好。它有点像机器人的感知架构,里面有vision-language model,也就是视觉语言模型。它会根据视觉感知的结果,再进行反馈。
泓君
你的vision model,是指它在比如找航班的时候,能看到搜索页面的信息?它不一定要通过后台数据或者API接口调用的方式,指的是这个不同?
朱哲清
大多数基于浏览器的智能体里面,都有一些视觉感知的部分。也就是说,它要去看那个页面到底长什么样。
因为很多时候,如果靠基于浏览器的方式,它完全是靠后端想办法,把页面里面所有的HTML组件拉下来。拿到组件以后,再去判断每个组件是什么,然后选择要点哪个地方,再去执行。
很多时候,第一,你有可能在访问页面的时候就会被卡住,因为你等于是在爬虫爬人家的页面。第二,作为一个基于浏览器的智能体,你希望它能够看到整个视觉层的结构是什么样子,所以视觉感知能力就会有帮助。
当然,很多计算机使用智能体都带有视觉感知能力,所以也不算是一个很大的创新。但因为它的视觉感知能力相对强一些,所以导致它真的去执行的时候,要比我现在看到的市面上其他浏览器智能体好一些。
泓君
它帮你订机票、酒店,然后做旅行规划,整体花了多久?它最后完成支付环节了吗,还是只是把所有航班选好了?
朱哲清
我记得应该是二三十分钟。只是选好了,到了支付环节,都是人去接管操作的。
我觉得支付环节是所有智能体业务范围内最麻烦的一个点。因为正常的人类不会信任智能体去做支付,所以很多时候所有智能体一旦涉及支付,都会卡死在那里。
不是技术上卡死,而是产品上卡死,因为人和智能体之间的信任还没有达到那个标准。所以导致大多数智能体,像我们也一样,其实有很多跟支付相关的功能已经集成完了,但是一直没有开放。
因为我觉得不会有人那么轻易地信任Pokee去做这件事情。OpenAI也有一样的问题,到了支付环节,还是需要人类去接管,然后完成支付任务。
等于说它花了20多分钟,但当中你还是得花时间说“我要去付钱”。总体来说,我觉得实用性没有很大,我宁可自己花点时间,十几分钟全部搞定。
另外一个相对比较常用的用例,就是它们在电商方面也花了很多力气。比如说根据你的要求,再去找相对应的产品。
我个人还不是很喜欢这种产品方式,因为我感觉它整个帮你搜索产品、找相对应产品的过程,比如什么颜色、什么样的款式,其实是一个挺慢的过程。而人去选的话,也就是点几个键的事情。
我一直认为,电商这个方向的决策链路很短,导致智能体真正能够给你带来的优势很小。因为它真正需要人类决策的范畴,可能也就是3到4步,最多了。
它不像其他事情,比如你要做一个调研、写一个幻灯片、写一个电子表格,这些都很花时间,而购物可能没有那么花时间。我觉得购物最花时间的地方,其实不是你已经想好了要什么,到下单的这个过程,而是你在选择的那个过程。
泓君
刚刚你提到,用它订航班和酒店的时候,我特别想问,你最后自己订的那家酒店,跟它做旅行规划、帮你找到的那家酒店是一致的吗?你对它找的结果满意吗?
朱哲清
不一致。航班也不是,因为它有很多信息都不知道。
我举个例子,我一般出门都住Hyatt,飞航班的话,我一般都会尽可能在直飞里面找价格比较低的。但它在找的时候其实没有反馈机制,一开始只会在高层次上问你三四个问题,就是深度研究的那种问题。
它一轮完成以后,后面没有再跟你有反馈,它就一直自己执行。所以它定的相当于是一个笼统的解决方案,到最后我得全部推翻重来,因为它没有用任何我喜欢的品牌,也没有加入个性化的部分。
这是我认为目前市面上Agent产品,特别是To C、面向消费者的智能体产品,而且跟生产效率不相关的智能体产品的一个最大痛点。
OpenAI一直在强调它们的记忆能力,这确实很重要。但是它们从哪里去一开始收集这些记忆,就变成了一个没有办法解决的冷启动问题。
泓君
但其实只要你告诉它一次,你喜欢住凯悦酒店,它可能以后就记住了,跟一个人类助理一样,你越用才会越顺手。假设让你的秘书帮你订机票,你可能也得跟他沟通:“我要凯悦酒店,我在飞机上偏好什么时间段、什么价格、什么舱位。”
朱哲清
对,确实是这样的。但是,人类会不会愿意做这么一两轮沟通,说完以后它是不是能记住,这其实是个问题。
我目前用ChatGPT下来,它对于你的一些行文偏好是有一些记忆的,但是更复杂的偏好,它的记忆其实没有那么完整。ChatGPT刚出来的时候,我问过它跟旅行相关的问题,但这次再问它的时候,它仍然没有记住当时给它的一些反馈。
所以它并不能够很完整地把你所有的反馈都记下来。
泓君
我们知道,在OpenAI推出这一轮ChatGPT智能体以前,刚刚我们反复提到过,它有两个智能体:一个是Operator,处理跟电商购物相关的智能体调用;另一个是Deep Research,用来做深度研究。
我看它这次的整个发布,自己的感受是,它有一点像这两个智能体之间的结合体。因为你也在开发智能体相关的产品,你觉得OpenAI在这个中间的核心技术壁垒是什么?把这两个智能体放在一起,难度大吗?
朱哲清
其实没有很大。这次的产品甚至让我感觉,它们是因为看到市面上有很多通用智能体出现,想要占领市场而做的一个动作,而不是说它们真的已经准备好了。
像它们发布会上给出的产品演示,其实也并不是很成熟的状态。说句实话,它们做的很多任务,和市面上的通用智能体相比,效果可能更差一些,速度又更慢。
它为什么要把深度研究和Operator放在一起变成一个智能体?核心原因是,深度研究是帮你检索信息,也就是“我从哪里可以得到更完整的、面向用户需求的信息”;Operator则是基于这些信息,去执行任务。
过去这两个方向基本上是割裂开的。如果要了解更完善的信息,你只能直接用深度研究。用完以后,它可能给你一个巨大的报告,但这个报告也不足以让你去做什么事情,你可能只能把报告复制粘贴到某个文档里面。
Operator也是一样,你必须已经知道自己想要什么,然后基于想要的东西,再去找Operator,让它帮你操作网页来完成任务。
这两个方向在各自的领域里可能都做得比较好。它希望能够把从信息获取、信息检索到执行的端到端体验打通,通过这两个能力实现这一点,这是一个比较符合常理的决策。
但我目前看起来,它相当于是一个工程解决方案,也就是做一个判断:如果用户需要非常复杂的信息检索,那就去做深度研究;完成深度研究以后,拿着这些信息再去执行。如果不需要,那就直接执行。
当中还有一个偏编程和虚拟机的解决方案,这一点跟Manus很像。它确实有虚拟机,可以执行比如生成PPTX文件、用Python脚本写一些脚本,或者写一些Bash脚本,让虚拟机去执行任务。
所以它基本上就是一个从深度研究到浏览器,再到虚拟机的结合体。
泓君
你觉得它跟市面上的通用型AI智能体,主要区别是什么?或者说,市面上所有这些通用型AI智能体,如果我们把它们放在一个池子里,看各家各自的优劣势,分别是什么?因为我相信,它们在解决不同场景的问题时,还是会有一些区分度的。
朱哲清
目前的通用智能体,我把浏览器和非浏览器的全部列出来,可能包括这么几家:Perplexity、OpenAI。Anthropic其实没有推出自己的通用Agent,但它们有编程Agent。我们相对比较小一些,比较晚才出来,还有Manus、Genspark。浏览器方面可能有Yutori、Fellou,还有Flowith,Flowith可能更偏垂直领域一些。
首先,在浏览器能力和操作能力上最强的,目前应该还是OpenAI。特别是在把深度研究和浏览器操作放在一起以后,它们绝对是最强的。
如果你去看一些基准测试,比如像最新出来的browsing camp,它们能够达到50%多的基准测试分数,其他最高目前也只有20多分,而且是在开源环境下。
在浏览器的实际执行上,Operator做得还是相对比较好的。因为当年的Operator是跟很多有API、有虚拟机的环境去对比的,它只有一个浏览器。所以现在加上虚拟机能力以后,Operator加上OpenAI的虚拟机,应该会超过市面上一些浏览器加虚拟机的工具。
但是它唯一比较麻烦的一点,在于OpenAI的虚拟机装了太多东西,什么都想往浏览器里面塞,导致速度很慢。
浏览器方向包括OpenAI、Fellou以及Manus的一部分,因为Manus也使用浏览器。另一个方向是完全只有语言模型,再加上一些执行能力,可能也可以算虚拟机,但它是一个受限的虚拟机。
它并不是可以调用整个系统里的所有包,而是有一些预设的包,然后去完成任务。
当然,我们也不能忘记Perplexity。Perplexity在浏览器方面做了一个相对比较另类的产品:它的浏览器不是一个能够导航浏览器的智能体,而是在用户使用浏览器的时候,给你一个sidebar,也就是侧边栏,让你告诉它“我需要在这个页面上做些什么”,然后它去帮你执行。
泓君
Browser就是浏览器的意思,sandbox就是虚拟机。所以刚刚你提到了基于浏览器和基于虚拟机的两种搭建方式,可不可以整体跟听众科普一下,现在整个AI智能体的搭建,在底层架构上有哪几种?
朱哲清
现在的智能体有4种大的方向。
一个是基于浏览器的智能体;第二种是浏览器加虚拟机的智能体,在这种智能体里面,会有很多操作通过虚拟机里的代码以及命令行来完成;第三种是只有虚拟机,但是虚拟机内部有非常大的限制,主要通过语言模型生成代码,然后只能运行某一种类型的代码;最后一种,是可以横跨很多工具、进行很多集成的智能体。
我先讲一下浏览器和非浏览器。浏览器、虚拟机、纯语言模型,再加上Pokee这种方式,这4个方向之间都有可以互相借鉴的代码,而且也有互相重叠的地方。
浏览器的意义在于,我认为世界上所有的网页和互联网服务,都可以在某个网页上呈现。所以我只需要让智能体能够看到那个网页、操作那个网页,就可以完成任务。
基于浏览器的智能体,用户可以看到它在页面上点击哪些地方,它可以一页一页地去看,就像人在操作网页一样。
它的缺点是什么?就是很慢,而且token消耗特别高。原因在于,你去看一个网页,就等于要把HTML文件直接拉下来,里面可能还包括一些JavaScript脚本,然后把它们全部拉下来,从零开始全部读一遍,只为了操作一个网页。
但它确实是万能的。
第二个是虚拟机。虚拟机的意义是,我可以在线下写一些Python脚本、Bash脚本,或者JavaScript脚本,然后直接在虚拟机环境里运行这些脚本,来完成任务。
比如说你要做数据分析,完全可以告诉虚拟机智能体:“这是一个表格文件,它的表头是时间、每周销售、品类等。”拿到这个文件以后,你就直接告诉虚拟机:“你能不能照着这个文件,帮我做一个每周的数据分析?”然后它就给你写一个Python脚本,帮你运行,得到结果。
虚拟机环境的好处是,它可以运行很多线下的、开源的包。它的缺点是,很多情况下无法访问互联网,特别是那些需要完整授权和身份验证的产品。比如说你要登录自己的Facebook,这些事情它肯定做不到。
第三种是语言模型加虚拟机的Agent。它可能限定在一个大环境里,JSBox就是一个这样的例子。它不给你完整的虚拟机,这个例子里面甚至连浏览器都没有。
以JSBox为例,它有一个以语言模型为主体的推理过程,写代码也完全靠语言模型。它有一个虚拟机,让它运行一些代码、生成一些东西,然后再把结果转化成可视内容。
但那个环境甚至不能叫虚拟机,因为它是非常受限的。它只有三四个包,环境是完全被控制的,无法临时下载一个开源包。比如说我现在需要临时修改一张图片,如果这个任务在它原始设计的工具包里没有,它自己不会去下载一个包再完成这件事情。
所以这种设计是JSBox,比如幻灯片智能体、表格智能体,在设计的时候就把可用的包限制住,不让用户使用更多的包。这是一个相对封闭的工作流:在受限环境下,用语言模型作为主体写代码,同时用一个小型环境去执行。
最后一种,可能跟我们以及以前的Zapier、n8n、UiPath比较像,但工作流内部的每一个节点,是通过和第三方服务提供商直接集成来完成的。
这种方式的优势在于,可以保证每一个服务的交付都非常可靠,因为是第三方直接提供的。比如Facebook,它把权限给我们,就不会出错。
但与此同时,它也有局限,就是不可能把每件事情都实现。很有可能用户想要在个人Facebook账户上发图片,但我们做不到,因为Facebook只允许创作者和商业用户自动发布这类帖子。
所以这是我们和以前的UiPath、Zapier、n8n相近的一条路径。总的来说,就是这4种类型。
第二种和第三种之间的边界很模糊。唯一的区别在于,第二种的虚拟机是语言模型执行完以后,提供给用户使用的一个几乎开放的虚拟机,你可以自己选择下载新的包,再去执行任务。所以虚拟机本身的能力,是整个智能体能力的主体。
而第三种可能是语言模型在现有的包之下生成什么代码,这件事已经成为限制整个智能体能力的主体。
泓君
从用户的使用体验上说,如果我们把Pokee、Genspark、Manus和OpenAI的ChatGPT智能体放在一起,你觉得用户体验会有什么非常明显的不一样吗?
朱哲清
其实有很多地方都不一样。我们先讲Manus,因为它是第一家出来的。
Manus的体验是,尽可能用一个虚拟机加浏览器的环境,搭建一个几乎让人觉得万能的环境。它有一个语言模型作为规划主体,规划完以后进入Browser,由另外一个Agent完成浏览器导航。它得到的信息会被总结下来,再进入虚拟机执行,如果有必要的话,它确实可以做很多事情。
虽然它有很多时候会出现幻觉,因为它看到的上下文太长了,但理论上它确实可以涵盖市面上你所需要的所有功能。
但与此同时,它也被浏览器能力限制住了。比如说你要真的发一个帖子,它就做不到,因为它需要在页面上导航,选择那个小按钮,选择完以后再上传图片、生成视频,各种各样的操作都很难。
比如说你要建一个Google表格,或者把Google表格里的某个表格改成一种格式,也比较难,因为注意力空间太小了。浏览器就是它的主要限制。
第二点就是它很慢,这也是Manus和ChatGPT智能体的一个共同问题。因为用了浏览器,所以速度会非常慢。
泓君
三十多分钟做一个任务,我觉得还是快的。我最开始使用的时候,可能要一两个小时,不过那个时候还比较早。
朱哲清
对,现在肯定比以前快了,因为它们整个基础设施都已经搭起来了。但是它的瓶颈还在那里,甚至最后会变成network call,也就是网络请求。
下载一个网页本身可能就需要三四秒,这个时间是跳不过去的。
ChatGPT的优势在于,它们的深度研究做得好,能够做出很详尽的报告。如果你通过这个报告再去执行某些任务,结果会相对更详尽一些。
Manus的总体优势,可能在于它的虚拟机环境搭得比ChatGPT更好一些。但这个我还需要更详细地去查,因为我还不太清楚ChatGPT里面的虚拟机能做到什么程度。不过我猜,Manus已经在虚拟机上花了很多精力去部署,应该会有一个比较小的优势。
JSBox一开始有一个超级智能体,几乎是说“我可以做任何事情”。但后面它发现能够处理的工具数量还是有限,所以开始做模板。
比如幻灯片是一个智能体,AI电话是一个智能体,表格是一个智能体,浏览器也单独做了一个智能体。在同一个用例下面,它会把用户体验作为核心目标,然后做一些模板。
不管你问什么问题,它总是用这样的模板去生成幻灯片,总是用这些工具去搜索信息,使得它变成一个相对标准化的工作流。它越来越不像一个通用智能体,而变成了一个偏人为选择的智能体。
但它的速度确实比Manus和ChatGPT快一些。原因就是它没有那么复杂的浏览器导航,同时它的虚拟机本身限制很多,在某一个Agent里面只有这么一点工具。
泓君
这样是不是也更节省token?
朱哲清
会相对节省一些token。它把大任务拆成了细分的垂直小任务。我猜它想做的是,随着应用场景一个一个完善,最后变成一个承载了很多小任务的大平台。
泓君
对,有点像微信小程序一样的一个平台。
朱哲清
Pokee可能最大的不一样,就是它可能是目前所有Agent里面最快的。我们现在还没有把深度研究智能体开放出来,但确实有一个深度研究智能体正在开发当中。最后我们会把自己的深度研究智能体和执行智能体放在一起,总体体验会有大幅提升。
但总体速度应该是市面上所有产品的4到10倍左右。之所以可以做到,是因为如果不再需要使用非常复杂的虚拟机,也不再需要非常复杂的tool calling,我们现在直接使用第三方集成的SDK和工具,通过自己的调用工具功能,整个速度会大幅提升。
也就是说,没有了MCP和现在市面上工具调用里巨长无比的上下文问题,所以每次调用工具的成本可能能够削减50%到60%。再加上我们自己的上下文工程,使得整个成本至少跟OpenAI的ChatGPT智能体、跟Manner相比,有一个数量级的区别;跟像Verticalize JSBox这样的产品相比,可能也有几倍的差距。
在token使用上,我们确实有劣势,特别是跟基于浏览器的智能体相比。我们并不是完全万能的,有一些任务,比如在个人账户上发布Facebook帖子,我们就只能在Facebook页面上发布;Instagram也必须是创作者账号或者企业账户,个人账户没有办法帮你发帖。
泓君
所以只有企业用户才能使用你们的智能体?
朱哲清
不是企业用户,是创作者或者企业账户。
比如说你在接Instagram和Facebook接口的时候,它们给到你的就是企业用户或者创作者才能操作的界面。它们不希望所有个人用户都用智能体去发帖,发完以后没人上Facebook和Instagram。
它们希望个人用户像普通用户一样,每天去Facebook和Instagram上看帖子、发帖子,这样才有参与感。企业用户和创作者用户则希望能够让他们创作更多,所以才把接口开放给他们。
每个平台都有自己的限制。我觉得这条路径其实相对比较符合商业逻辑。
如果你想象所有个人用户都通过一个智能体,想办法用浏览器去破解Facebook或者Instagram账户,或者破解某个平台,通过爬虫访问网页来完成任务,那对于平台来说就是一种损失,平台会把浏览器访问全部卡掉。
所以如果你一开始就是跟着平台的商业逻辑走,以前有人会通过很手动化的方式写代码完成产品上传,现在就会有人直接写一段文字,在网页上运行,然后把这个视频creative,也就是个性化内容,上传到这些社交媒体平台上。
其他平台也是一样,它们开放给你的权限,就是它们认为开发者、非个人用户或者非普通用户真正最需要使用的工具。如果你可以把这些工具放进智能体里,原来就会使用这些工具的人,就会转过来说:“我写一行提示词就行了”,不再需要写那么多代码。
泓君
所以我理解,Manus、Genspark,还有OpenAI的ChatGPT智能体,它们的商业模式其实是面向消费者的;而你的商业模式听起来,现在应该更偏向企业端。
朱哲清
现在这个时代,企业端和消费端的模糊性很高,但是我们一定是让专业用户及以上的人群来使用我们的产品。
专业用户以下的普通用户,其实使用一个非常省时间的AI智能体的概率不高。这也是为什么市面上很多AI智能体的留存率非常差,因为它没有重复性,很多工作流用一次就结束了。
而我们目前看到的很多用户,每周都会重复运行一模一样的工作流。所以这是我们发现它具有重复性的地方。
泓君
那这是不是也很取决于平台会给你们开放什么样的SDK工具和API接口?
假设我每天收到很多微信消息,想有一个智能体帮我管理所有信息,帮我回复一些比较基础的信息,前提还是微信要给这样的智能体开放接口。它们是不是愿意把这些接口开放给开发者?
朱哲清
在美国,开发者社区是很多大公司,特别是科技公司所崇尚的方向,所以大多数公司都有非常完善的接口和开发工具包。甚至有些公司给到你的只是一个非常简单的爬虫接口,也不会给你Python开发工具包之类的东西。
国内公司可能会相对差一些,很多接口并不开放给你。但像企业微信、创作者级别的微信,也会把接口开放出来,你可以自动回复,什么都可以做。
国内整个生态其实也在慢慢开放,特别是MCP这波出来以后,很多公司都开始被迫开放开发工具包和接口。比如高德地图就是一个例子,之前没有那么开放的高德地图,在MCP出来以后,首先把地图生态完全打开了。
所以其实有很多这样的例子。我们目前也有一些公司给我们开放平台API,有些接口是独家的,有些不是。
总体来说,这个商业模式一定是偏专业用户的商业模式,因为很多普通用户端的使用场景非常浏览器导向。比如你去浏览网页、买东西,其实旅行需求也有偏专业化和非专业化之分。
专业化的旅行需求,比如出差,每次都是标准化的:你每两周要去一趟湾区,每次都住同一个酒店,那就可以每两周帮你买一次机票。
但如果是普通用户出去旅行,他可能是“我要去这个地方玩”,酒店也想探索新的,航班也有很多变化,比如今天刚发了奖金,想要飞商务舱,里面有很多变数。
所以这种用例本身更适合基于浏览器的智能体,因为它就是有一台电脑在前面,可以打开浏览器去做事情。
泓君
在你跟大公司合作的过程中,它们开放API接口的动力是什么?包括你刚刚也提到,国内高德地图接入MCP,它们的动力又是什么呢?
朱哲清(Bill Zhu)
首先,整个智能体浪潮会在某种意义上取代正常的网页流量。
过去可能是一个人打开浏览器,在搜索引擎里输入一段搜索,得到搜索结果以后,点击一个网页再去做某件事情,这是一个常规流程。
但未来可能是,你打开ChatGPT;如果你是普通用户,就打开ChatGPT,如果你是专业用户,就打开Pokee,然后输入一段话:“今天早上我看到了Replit CEO的一个采访,你能不能直接把YouTube上的那个讲稿拉下来,帮我写一段报告,告诉我他的增长策略的核心观点?”
然后智能体就直接完成了整个流程,我从头到尾都没有打开YouTube。
未来购物可能也是一样。你可能从头到尾只打开ChatGPT,说:“我明天要去一个晚宴,需要一套正装。”它已经知道你的身材、身高,然后自动帮你找到最符合你的衣服,把衣服呈现在你身上,你看一眼觉得不错,它再告诉你现在有一个折扣,然后完成付款,可能就是这么一个流程。
这给我们的启示是,过去所谓的工作流已经改变了。它不再是通过浏览器开始整个工作流,去下单、获取信息,然后再进入另外一个网页进行操作。
无法避免的是,我认为在接下来1到2年,大多数门户网站,不管是电子商务、搜索、视频网站,还是其他各种类型的门户网站,它们的流量一定会非常快速地下降,而入口会变成各个方向的智能体。
这也是为什么Google要推出A to A(智能体通信开放标准)。每家公司都可能有自己的智能体,智能体之间可能会发生交互。如果一家公司能够占据这个协议,率先在Gemini里面完成部署,最后它就会成为整个生态里最大的赢家,因为它成为了智能体入口。
ChatGPT也是一样,Cloud也是一样。它们推出协议,也是想要战略性地占据智能体入口。这也是Pokee要推出协议的原因,我们也想占据专业化场景下的智能体入口。
泓君
你们为什么想自己推出协议,而不是直接接一个标准的MCP?这样大家都可以统一使用,你也能在更大、更广的生态里,直接接入很多已经接好的软件。
朱哲清(Bill Zhu)
其实MCP现在的可用性很差。现在市面上应该快有2万个MCP了,其中真正可用的不到200个,而且大多数MCP都没有人维护。
导致的结果就是,大多数公司不愿意花时间去做MCP。我们的目标是,公司不再需要做MCP,也不需要自己搭建一个MCP服务器,只要直接把开放API给到我们,剩下的由我们来管理。
所以对于服务商公司来说,它们什么都不用做,就可以获得一个额外的流量入口。
泓君
你刚刚在描述,接入智能体以后,互联网会发生什么样的变化。比如门户网站的流量会大幅下降,像听到Replit CEO的一段演讲,直接在ChatGPT或者Pokee上就完成对这段演讲的复述。
我在想一个问题,因为我的身份是创作者,跟你的身份是不一样的。你觉得未来这件事情对创作者会有什么影响?
假设我们上一期节目聊到腾讯算法广告大赛,那期节目里有一个口播广告。只有更多的人听这个播客,大家才会听到这段广告,它才能支撑播客的商业模式运转下去,大家才能持续赚钱,把这档节目运营下去。
但如果以后没有这个过程了,大家会说:“这期播客为什么没有开AI总结?”然后就不去听播客,直接看AI总结,那对广告来说其实就是流量的折损。
朱哲清(Bill Zhu)
我觉得广告这个行业会永远存在,但是它的发生形式会改变。现在市面上有很多专注于广告的AI公司,它们都在研究,语言模型时代或者智能体时代,广告要如何被插入。
我举个简单的例子。在播客里插播广告这件事情,未来可能会变成另一种形式。
现在的播客,大多数情况下,除了平台向你收费以外,播客提供者本身是不收费的。比如硅谷101录了一个播客,大家都是免费听的;如果你在YouTube上使用YouTube的广告,YouTube再通过广告跟你们分成。
未来可能是,我们需要获取你这个播客本身的知识产权权限,这个权限是有价值的。每一次通过调用,或者通过网页访问,找到你们播客的某个时间点,或者获取到你的信息,任何智能体都要向你付款。
你不再需要负责广告流量,广告由智能体来完成。智能体会说:“我得到了这个信息以后,怎么在整个工作流或者用户体验中插入广告?”
这个时候,智能体可能会问:“我们现在得到了这个对比,你想选择哪个智能体去尝试探索?”这件事情本身没有界限分明的答案,所以会出现一个排序机制。
智能体推荐哪个智能体让用户去尝试,就可以向那个智能体的公司收费。广告在这个时候发生,而支持每个API、每个第三方插件的产品本身,或者知识产权本身,都可以直接收费。
所以对于创作者生态以及SaaS生态来说,从某种意义上讲是变好了,而不是变差了。你不再需要在Google上投广告,也不再需要免费把内容发给YouTube,让它帮你投放,而是由智能体直接向你付费,通过它自己的广告机制支付自己的成本。
我不觉得你们会受到很大的冲击。
泓君
整体上我觉得,流量分成这样的模式会变得越来越弱。如果智能体调用了很多创作者的内容,怎么给创作者付费,可能是未来会讨论的一个问题。
我稍微有一点疑问的是基于流量的这套方式。比如你有推荐算法,一个页面可以显示10条播客内容,或者12条你想点击的视频信息。但一个智能体在回答问题的时候,我觉得现在还是比较聚焦于精准,它可能引用的范围就相对更小了。
朱哲清(Bill Zhu)
上个星期在ICML的时候,有一个专门做推荐系统的人,我们俩聊到了这件事情。聚会之后,有一个研究者上来问我:“你觉得推荐系统之后会是什么样的发展路径?”
我当时告诉他,我觉得推荐系统的大方向可能会受到巨大挤压。在智能体的整个框架下面,它仍然是一个推荐系统端到端、基于动机的决策过程,但它每一次给你的交互,其实只是给你一条信息,或者几条最相关的信息。
这个时候,它的决策链不再是按照排行第一、排行第二、排行第三这样的方式去决策了,而是以时间作为决策点。
一个人和智能体之间交互的总时长基本是固定的。就是说,这个智能体好,我就会跟它交互更久。它的目标可能是,在每一个时间点上,推荐的东西能够让你所花费的时间和它能够得到的回报成正比。
这个时候,原来的推荐系统算法可能就不那么成立了。原来的推荐系统算法是说,每一条内容被点击的概率,可能跟它的排名成正比。
而现在可能变成,我每一次给你推荐或者回复的信息,基本上都是你一定会去点击的东西,但你会不会进行第二轮交互?下一次你花时间跟我交互,我所占用你的时间成本,就要求我推荐的这一条信息必须是最精确的。
这样会使得你跟我有更多交互。所以它的目标就变成了:我不是在一个页面上给你呈现5条、10条内容,而是可能有5轮、10轮对话,每一轮的目标都是让你跟我进行下一轮交互。
这个时候,它跟传统推荐系统的算法就完全不一样了。所以当时我跟他说,我觉得整个推荐系统,特别是这种基于排行的推荐系统,长期发展的潜力可能会被极度压缩,因为它可能不再有排名。
它更多的是一个基于顺序、基于体验、基于探索的交互机制。你可能唯一的目标就是,每一条内容都给你最精确的结果,同时在不损失未来机会成本的情况下,在同等级别的内容里选择一个能够带来更多收入的内容。
当然,我也不是百分之百确定这一定是未来的方向。但从目前的智能体发展趋势来看,我个人感觉可能会是这样一个方向。
泓君
我觉得非常有意思。之后创作者生态会怎么演变,也是我们一直非常关注的一个话题。那下一期节目中,我们将重点聊聊强化学习与它人才分布的大本营,以及AGI的五个层次与我们现在的位置。欢迎大家继续收看我们下一期视频。