庄明浩
好,感谢大家。大家看到现在这个标题,其实是一个非常简单的标题,叫“年终的 AI 共识”。因为整个 AI 行业过去两年半的发展非常快,我每年做整理的时候,回头去看自己在 2024 年底做的内容,都会感觉像上个时代的东西一样,很多东西已经过时了。所以,这次我只能把时间点截止到做这期内容的前一两天。
其实今天的内容是我在直播之前刚刚做完的,直播的时候还在不断修改 PPT。所以我起这个标题,是想总结截至 2025 年 6 月、也就是大概年中这个时间点,行业正在形成的一些共识。当然,阶段性的共识会有一个问题:如果我们有穿越的能力,穿越到几年以后再回头看,可能会发现现在形成的所谓行业共识是错误的。但在当下这个时间截面的数据来看,无论它对还是错,至少所有人似乎都已经开始接受这些共识。
我们正式开始。今天的内容其实比较简单,结构也非常清楚,跟我录制的 AI 课程结构是一模一样的。我当时录了 4 节课:第 1 节讲技术,第 2 节讲产品,第 3 节讲资本,第 4 节讲未来大概半年左右的展望和趋势。
今天的内容还是围绕 3 个主题关键词:技术、产品、资本。每个主题关键词下面,又分成 3 个小节,这 3 个小节的标题我也放在大纲那一页上。我们一张一张开始,先从技术讲起。
1. 推理模型持续升级
似乎今年有一个不需要再商讨的结论:2025 年是 Agent,也就是智能体的一年。所以今年技术讨论的中心肯定是 Agent。不过在 Agent 之前,我在上一期课程里可能也讲过,先出现的是 L2,也就是推理模型。推理模型的发展同样非常重要。
进入今年以后,伴随着推理模型的发展,尤其是以中国的 DeepSeek 为代表,包括阿里的通义千问,开源生态也发展得非常丰满。所以今天我们围绕推理、Agent 和开源这几个关键词展开。我们先看推理模型。
左边这张图,是我正式课程当中的一页,讲的是 OpenAI 定义的 L1 到 L5 的 AI 发展趋势。它认为,从 L1 到 L5,类似于自动驾驶的发展趋势。L1 是我们已经非常熟悉的聊天机器人,也就是 Chatbot 形态。
L2 是推理者,也就是推理模型。我们现在使用 DeepSeek 也好,豆包也好,它会向你展示非常长的推理过程,这类模型就叫推理者。L3 可能就是 2025 年以后业界讨论比较多的智能体、Agent 或者代理。
从时间维度来看,在 2025 年这个时间点,我们似乎正在从 L2 走向 L3。但这里面有一个问题:L2 推理模型,我们今天熟悉的所有大模型厂商,无论是美国的 OpenAI、xAI、Google、Meta,还是中国的 Kimi、豆包、智谱、DeepSeek、阿里的通义,推理模型本身已经是标配了。
但我的第 1 个观点是,标配并不代表结束。整个递进过程不是一个取代的过程,而是整体往上提升的过程。所以回头来看 2025 年上半年的发展,L2 推理模型的能力其实还在继续提升,甚至还在往前推进。
如果听过我之前的课程,就会知道推理模型是怎么得到的:我们通过一个基础模型,以强化学习的方式得到推理模型。那在推理模型继续发展的同时,之前的基础模型,也就是 Base Model 的能力,在 2025 年依然还在提升。
所以从 2022 年底 ChatGPT 发布到今天,技术持续进展、智能逐渐提升,这条最核心的主线似乎在 2025 年依然延续。今天所有头部大模型公司坚持最重的核心研发,也都在这里:智能本身依然是这个行业最主线的东西。
然后出现了一个小小的分支,或者说一个小小的场景。在 Agent 这个板块里,它总要干活,而它能干的活当中,编程,也就是 Coding,似乎是最简单的。因为 Coding 本质上是一个线上的虚拟世界,具有严格的逻辑标准。代码需要符合一定的逻辑框架和标准,对于计算机而言,理解 Coding、理解代码相对更容易。
所以 AI Coding,也就是 AI 编程,似乎成为了今天这个时间点所有头部 AI 模型厂商的兵家必争之地。所有公司都在做 AI Coding。这就是关于推理模型的第 1 个问题。
刚才我们讲过,推理模型之前是 Base Model,也就是非推理模型。我们当年使用的 GPT-3.5,以及早期的 Kimi、豆包、通义模型,都叫非推理模型,也就是 Base Model、基础模型。现在我们使用的 DeepSeek R1、Gemini 2.5 Pro、o4,以及 GPT 的 o 系列,本质上都叫推理模型。
可是对于头部厂商而言,基础模型和推理模型两边的技术研发进展都非常快,而且都抓得很紧,基本上属于“两手抓,两手都要硬”的状态。为什么会这样,后面会讲到。
先看美国的情况。今天美国 AI 大模型领域的主要厂商,大概有 4 到 5 家。最前面的当然是过去两年多引领行业发展的 OpenAI。第 2 名可能是它最大的竞争对手之一、初创公司 Anthropic,Anthropic 的核心团队原来也来自 OpenAI,它做的是 Claude 模型。
大公司里面,Google 刚刚开完今年的 I/O 大会,你会看到 Google 的 Gemini 系列模型能力提升也非常快。还有一家初创公司,是前 Twitter 和特斯拉老板埃隆·马斯克做的 xAI。除此之外,还有 Meta 做的开源模型 Llama。
所以在整个美国市场,大概就是这几家公司频繁更新自己的模型,不断提升模型能力。今天你发布了最新模型,你就是世界上最领先的模型;明天他发布了一个模型,可能他就成为世界上最领先的模型。美国过去一段时间的行业发展,基本符合这个逻辑。
今年最开始可能先发布的是 Gemini,然后是 o4,前两天 OpenAI 又发布了 o3-pro。你会发现,这个轮转大概就是这样:谁家发布了最新模型,谁就站在最前面的位置上。美国这边基本就是这样的情况。
中美竞争,其实是整个 AI 行业发展的另一条主线。2022 年底 ChatGPT 刚刚发布的时候,业界会认为中国模型厂商距离美国模型厂商的差距,大概在 1 年到 1 年半左右。经过两年多的发展,我们其实已经追得非常快了。
DeepSeek R1、千问 3,以及最近发布的豆包 1.6,在各种榜单上的评分都已经和世界上最优秀的美国模型相差无几。所以,如果看 AI 行业的竞争,基本还是围绕中美两国核心厂商的模型能力提升展开的。这件事情也可能会成为未来一段时间行业发展的主线,就是中美之间的竞争。
2. Agent任务不断变长
前面几页讲的是第 1 个小标题:推理模型。第 2 个小标题叫 Agent。这个关键词过去一段时间大家已经听过无数遍了。似乎没有争议的是,2025 年就是 Agent 年,这件事甚至不需要等到年底再定义。虽然今年才刚刚过去 5 个多月,还不到 6 个月,但你会在各种地方看到 Agent 的广告、Agent 公司的融资,以及各种各样的 Agent 产品发布,所以才会有“Agents everywhere”这样的梗图。
左边这张图,是 OpenAI 一位核心技术开发人员在 Twitter 上发布的内容,意思是 2025 年是 Agent 年。这个结论看上去已经没有任何悬念。年初的时候,大家可能还会讨论其他关键词,但到了 2025 年 6 月,我觉得这个结论似乎已经被确定了。
Agent 发生了什么,或者说出现了哪些问题?第 1 个问题是,我们到底应该如何衡量 Agent 的能力。大家都说,如果听过我的课程,就会知道 Agent 要从语言走向行为,要和人类合作,甚至帮助人类解决一些问题。那我们怎么衡量一个 Agent 能力的提升,或者它能力的范围?
业界最近有一种说法是,我们可以衡量 Agent 能够执行多长的任务。任务时长就是一个可衡量的标准:原来它可能只能执行几分钟的任务,现在可能可以执行十几分钟、二十几分钟,甚至更长;极限情况下,可能可以执行几个小时,再往上推,甚至可以执行几天的任务。
从业界统计来看,2019 年到 2025 年,也就是过去大概 6 年时间,在这个衡量指标上,AI 模型的进展是每 7 个月翻倍。每 7 个月翻倍,也就是一年将近翻两番。你要知道这是指数级增长,所以曲线会拉得特别快。
如果我们再细化一点,把 2024 年 9 月 OpenAI 发布 o 系列模型定义为推理模型开始,那么 AI 行业进入推理模型之后,你会发现 AI 执行任务的长度在急速增加。刚才我们把 2019 年到 2025 年拉在一起看,是每 7 个月增长 1 倍;但如果只看过去 1 年半左右,也就是 2024 年到 2025 年,这个数字已经缩短到每 4 个月增长 1 倍。
所以,如果把这条曲线拉出来,它会更高、更快。随着模型能力提升,一个 Agent 执行任务的时长,比如超过几个小时,应该很快就能看到。这种增长确实非常像传统 IT 行业的摩尔定律。
如果大家是 IT 从业者,应该都知道摩尔定律:每 18 个月,芯片的算力会提升 1 倍。提到摩尔定律,就不能不提另外一个定律,叫安迪—比尔定律。它的英文说法是:“Andy gives, Bill takes away。”Bill 就是比尔·盖茨,Andy 指的是英特尔的 CEO。
这个定律当时的意思是,安迪代表的英特尔每 18 个月把芯片能力提升 1 倍,但比尔·盖茨的微软会通过各种应用程序把这一倍的能力也消耗掉。软硬件相辅相成,共同把行业拉起来。如果你的硬件能力 18 个月提升了 1 倍,但软件消耗没有提升 1 倍,那么硬件更新似乎会变慢。
但从结果来看,基本上硬件更新多快,就会出现多大、或者说多需要消耗更强硬件的软件。就像今天我们使用手机一样,大家会发现手机性能无论怎么提升,用一段时间之后还是会卡。因为在性能提升的同时,软件的消耗能力也在提升。这就是安迪—比尔定律,它是在摩尔定律之上产生的另一个定律。
今天来看,AI 行业似乎也有类似的规律:算力提升、Token 消耗量提升、价格下降,但同时消耗算力的东西也变得越来越多。左边这张图可能展示了 GPT-4 相关能力增长了 100 倍,但成本已经下降了 100 倍。
更小的模型出现了,软件更新和路由方式提升了效率,硬件本身的效率也提升了,所以成本确实已经下降了 100 倍。但另一方面,我们研究的模型越来越大,参数量可能以 10 倍、100 倍的规模膨胀。
最早使用模型或者各种 Chatbot 的时候,我问一个问题,它很快就回答了。它可能思考 2 秒钟,然后用 5 秒钟把不多的文字打出来。现在有了推理模型,你输入一个问题之后,它首先要进行很长的推理,可能要思考 30 秒,然后再给你一大段更长的答案。
所以,单是思考和回答的时间,以及内容的长度,相比基础模型可能就提升了 5 到 10 倍。现在又有了 Agent,它要执行任务,可能要工作几个小时,甚至一天。相对于之前的几秒钟,这又是一个量级上的乘积。
虽然 Token 价格已经下降了 1 到 2 个量级,但这边可能又增加了 3 个量级。所以无论成本怎么下降,整个行业还是在往上走。如果 2025 年没有 Agent,也没有推理模型,我们还使用原来 Base Model 的商业形态,那么今天 Token 的成本似乎已经可以忽略不计,因为它消耗的 Token 没有那么多。
问题在于,软件这一侧还在继续向前走。所以无论硬件升级多少,或者成本下降多少,软件都会把这部分能力消耗掉。这和之前的安迪—比尔定律非常像。
上一个问题讲的是 Agent 的任务时长,或者说它消耗 Token 的问题。更麻烦的是,OpenAI 有一位研究员大概上个月发表了一篇文章,讲 AI 行业进入所谓的下半场。左边这张黑色的图,展示的是各个 AI 模型在各种测试榜单上的得分增长情况。
你会明显看到,之前的一些老榜单,比如黄色或者粉色的榜单,可能在 2021 年就已经出现了。随着模型能力不断提升,它们不断接近 100 分这个满分。同时也会有一些新榜单,可能到 2024 年才出现,但大模型很快就能把这些榜单打到 100 分,或者接近 100 分。
现在有一个很现实的问题:大模型的能力已经很强了。你可以拿人类的法律考试、高考,或者会计师考试的问题去测试模型。最近高考之后,也有很多人拿高考题去测模型。可如果模型回答任何题目都是 100 分,那它已经是 100 分了,我们接下来要怎么测它能力的提升?
我们怎么知道它变得更厉害了?似乎如何评价 Agent 能力的提升,也变成了一个问题。所以最近业界讨论非常多的,就是 Benchmark 的设计:题目要怎么出,已经变得越来越难。我们没有办法验证模型是不是变强了,那后面怎么评估、怎么演进、怎么进一步改进和提升它的能力呢?
最近还有一个很有意思的新闻,是在我们录制前一档节目之后发生的。红杉中国是一家风险投资基金,他们逼着投资人下场做了一个 Benchmark,叫 X-Bench。红杉中国内部有一些技术人员,他们做了一套题给 AI,通过测试这套题来评判 AI 的能力。
连投资人都要下场做题,因为大家确实没有办法了解模型的能力,所以只能逼着自己搞一套题,去考模型的能力。你会发现,关于评测的问题非常多,也在倒逼大家解决这些问题。
再看一些更有“科技与狠活”的东西。我在课程的技术章节里讲过,我们是怎么从上一代 AI 走到今天的 ChatGPT 通用大模型,又怎么从 ChatGPT 时代的基础模型走到了推理模型,现在又正在走向 Agent。
这一路走来,我们用了一些“科技与狠活”。第 1 个是预训练。最早的时候,我们给模型喂非常多的数据,把这个世界上的书籍、信息,以及互联网上的各种内容都拿来做预训练,相当于让模型预先学习一遍。
但在 2024 年 9 月,也就是去年 9 月,大家开始讨论 Scaling Law 可能失效。什么意思?就是再多的数据,看上去也没有太多意义了,甚至出现了一个问题:世界上似乎已经没有太多数据可以继续喂给大模型。
今天大模型的参数已经非常大了,它似乎什么都知道。人类现存的、能够知道的各种信息,它好像都知道了,所以边际效应一定会递减。那么到了现在这个时间点,也就是 2025 年 6 月,过了大概 3 个季度,这个结论还成立吗?
你会发现,刚才我们讲过,基础模型的能力其实还在提升。那它靠的是什么?现在还不能说已经形成了共识,只能说出现了一种尝试:如果人类历史上已经存在的东西,无法再进一步提升模型效率,那么模型本身产生的信息,能不能再喂回模型?
这就是合成数据的意义。我们回想一下 AlphaGo,AlphaGo 是通过人类棋谱学会下棋的,把人类所有棋谱的可能性都学习了一遍。但 AlphaGo 后面的版本叫 AlphaGo Zero,它没有依靠任何人类棋谱,而是自己生成棋谱。
这就是所谓“人类原来不存在的数据”。它是从哪里来的?是模型自己产生的,是模型自己学习、自己生成出来的。今天的大模型也是一样,它会写文章、写信息、生成图片和视频,也会形成对很多事情的理解。它产出的这些信息,统称为合成数据。
如果把模型生产出来的合成数据再喂回大模型,是否会提升大模型的能力?如果可以,那是不是就像武侠小说里的梯云纵一样,左脚踩右脚,再踩左脚,就能一直往上飞?
这是预训练。那后训练是什么?2024 年 9 月的时候,大家会说数据没法继续获得,前面的训练解决不了问题,那我们就往后走:先把结果生成出来,再从结果反过来训练模型。那个时候大家会说,在 L2 推理模型时代,后训练变得非常重要。
现在后训练还重要吗?前面我们讲过,L2 的推理模型其实还在继续向前走。它通过什么方式向前走?最后一个关键词就是强化学习。
什么叫强化学习?我在课程里已经讲过。你可以给大模型做题,先通过数据训练把模型做出来,然后让它做题。它做对了,就给它激励;做错了,就给它惩罚。它不断做题,不就会越来越厉害了吗?这就是强化学习。
但你一听这个逻辑就会发现,正确与否的评判,也就是激励系统,似乎只有一部分题比较容易判断。典型的就是数学和编程,因为它们有标准答案。为什么推理模型出现之后,整个 AI 领域的 Coding 能力,以及物理、化学等需要推理的能力,提升得特别快?因为它们有一套严格意义上的标准答案库。
对就是对,错就是错。代码写出来能运行就是能运行,不能运行就是不能运行,所以它的激励系统非常容易构建。但你要想,还有太多问题的激励系统很难构建。
比如让模型写一篇文章,什么是好,什么是不好,哪个词更合适,什么样的风格更好,这些东西怎么评判?早期也有人做这类工作。比如前面会讲到,Meta 投资了 143 亿美元、占股 49% 的 Scale AI,就是做数据标注的公司。
早年的数据标注,标注的是自动驾驶画面:这里是一棵树,这里是一辆车,这里是一个人。这样的工作原来可以由普通标注人员完成。但新的数据标注是什么?需要找法律、物理、金融、医学等领域的博士,给大模型生成的答案打分。因为只有至少达到博士水平的人,才有可能评判模型的答案。
但这还不够。很多问题可能连人类专家都不知道该怎么打分,那怎么办?这个领域又出现了另外一种趋势:能不能让大模型自己打分,用另一个模型来做裁判?
然后通过这种评判,反过来刺激原来的模型,让它知道什么是好、什么是不好。你听到这里,会发现这又是一次“梯云纵”:用一个模型的能力,去评判另一个模型做题的对错。
就像网上很多人让豆包和 ChatGPT 互相 PK、互相辩论一样。凡是形成类似这种梯云纵效果的事情,它就可能不断往上走。所以我们看到,这些“科技与狠活”在 2025 年出现了很多变化。
刚才这一套讲法比较虚,都是描述,没有具体案例。我们讲一个更现实的例子,比如大家都知道 DeepSeek 的故事。其实我之前的 PPT 里也讲过,DeepSeek 出圈是 DeepSeek R1,也就是中间那条绿色曲线,在今年春节期间出圈。
那 DeepSeek R1 是怎么来的?DeepSeek 原来有一个基础模型,叫 V3。R1 是推理模型,它是在 V3 的基础上,通过刚才讲的强化学习得到的:让它不断做题,做对了就给激励,做错了就惩罚。
但在这个过程中出现了一个中间状态,就是深绿色的 DeepSeek R1-Zero。它是完全依靠 V3 基础模型进行强化学习得到的。后来大家发现 R1-Zero 有一些瑕疵,于是又通过后训练等方式,做出了 R1,供大家使用。
5 月 28 日,R1 又发布了一个新版本,叫 R1-0528。这个版本的能力相比之前的 R1 有了非常大的提升,尤其是在数学和 Coding 上。听到这两个关键词,大家就知道它是通过强化学习来的。
反过来讲,它在其他领域也有提升,只是没有那么明显。那这些能力提升靠的是什么?就是我们刚才讲的,通过另外一个模型来给它打分,用模型来做奖励模型。这又是一次梯云纵。
你要知道,现在的 R1-0528,前面是 R1,再前面是 R1-Zero,再前面是 V3,所有起源都是 V3。可是 V3 的基础模型马上要发布新版本 V4,V4 一定比 V3 更厉害。那 V4 再走这样一条路,产生出来的 R2 应该会厉害到什么程度?
所以业界最近特别期待 R2 的推出。按照逻辑,R2 应该会非常厉害。今天 R1-0528 的最新版本已经很强,几乎追上了最头部的 OpenAI 和 Claude 模型。R1 的基础是去年年底的 V3,已经是 6 个月之前的基础模型了。
过了 6 个月,V3 升级到 V4,能力应该会提升。提升之后,再通过强化学习和后训练改进,训练出来的 R2 似乎应该更强。两次梯云纵踩出来的东西,当然会更强。
所以无论是中国还是美国,业界、科技圈、金融圈和券商都非常期待 R2 出来之后会达到什么程度。它一定会很强,但究竟强到什么程度,现在还不知道,我们可以期待一下。
不过,Agent 又出现了一个问题。刚才我们讲的这种能力提升,更多集中在基础模型和 L2 推理模型上。至于 L3,也就是执行任务这件事情,看上去我们可能会在这里停留很久。
因为前面讲的预训练、后训练、强化学习,本质上是在提升模型本身的能力。但今天模型要从语言能力走向行为能力,还需要很多其他工作和配套系统一起让它变得更强。这个事情就没有那么简单了,它没有办法像前面那样靠两脚踩着梯云纵直接往上走。
更现实、也更有意思的一个对比是,OpenAI 对 L1 到 L3 的类比,本身就是自动驾驶。自动驾驶行业在 L3 也停留了很久,因为 L4 基本上就不需要人了。历史似乎也是这样。
我还截了一张聊天截图。这个叫 Flow 的人,是 Kimi 的一位技术研发员工。年初业界有一篇关于如何复现推理模型的文章,就是他发在知乎上的。今年他又发了一篇文章,标题叫《论 Agent 的持久战》。
他说,要想实现 AGI,达到能够替代 80% 人类白领工作的 Agent,需要非常漫长的时间,可能是 5 到 10 年,甚至更久,除非出现全新的颠覆性技术。当然,这只是他一家之言,也有很多人并不认同。最近也有很多人统计大佬们对这个时间点的判断,有些比较乐观,认为可能只需要 2 年、3 年;有些比较悲观,认为时间会更长,甚至比 5 到 10 年还要长。
具体需要多久我们不知道,因为这件事情还在不断演进。
3. 开源生态强势崛起
最后一个小标题是开源。开源生态正在强势崛起,尤其以中国的两家公司为代表:DeepSeek 和阿里的通义。它们的能力提升非常快。
这两条曲线中,美国那条线不区分开源和闭源,任何模型都可以纳入;中国这条线只看开源模型的发展能力。所以,中国整体模型能力的发展,要非常感谢这两家公司在开源模型上的努力。
之前美国最好的开源大模型公司是 Meta 的 Llama,但现在 Llama 基本上已经掉队了。Meta 最近也在疯狂调整整个大模型团队和内部组织架构。反过来,中国这两家公司的开源模型发展很快,也刺激了其他公司,比如最近的小红书,以及之前的智谱、MiniMax、Kimi,都在发布自己的开源模型。
开源生态变得越来越兴盛。原来有一种观点认为,大模型需要那么多钱、那么多预训练资源,开源项目没有办法调用这么多资源和资金。但现在看上去,这件事未必如此。
从开源领域来看,开源也会分不同的组件和功能。刚才我们讲过整个行业的趋势,开源领域也有类似趋势。比如,哪些开源项目得到了更多关注?今年关注度增长超过 70% 的项目,最多是 Agent 架构和工作流;第 2 大类是 Coding;第 3 大类是 Inference,也就是和 Agent 相关的基础设施。除此之外,还有 API 管理、后训练、AI Search,以及 Agent Framework。
项目关注度是一个第三方指标,但也能看出非常明显的行业趋势:Agent、Coding、Inference,这些关键词在我的课程里也被反复提及。Post-training,也就是后训练,刚才我们同样讲过。所以从开源角度来看,行业发展也符合刚才讲的逻辑。
这是蚂蚁做的一张开源大模型图谱,蚂蚁开源公众号上应该可以找到,大家有兴趣可以翻一翻。整个开源领域在过去一年多的发展态势,确实非常快。
4. AI产品重塑交互
技术讲完了,接下来讲产品。产品又分成 3 个小标题:交互、运营和结果,也就是产品设计、产品运营和产品结果。
产品设计方面,在我上次录课程的时候,大概是两个月前。过去两个月不到的时间里,在中文互联网,不算美国,我们已经看到了不下 10 款新的 Agent 产品。比如字节的扣子空间、百度的心响、LiblibAI 做的 Lovart、号称第 1 款 AI 浏览器的 Fellou、昆仑万维的天工,以及 Flowith。
我没有完全列全,还有很多很多各种各样的 AI Agent 产品。特别是如果你关注一些公众号,可能每天都会看到新的产品上线。
更有意思的是,最近大家发现浏览器这种形态,已经是多么古老的互联网产品形态了。互联网出现比较早的时候就已经有浏览器了,但这么古老的东西,在 AI 时代似乎又变成了一个新的兵家必争之地。
你比如说在美国,Chrome 传说因为 Google 的反垄断问题,政府可能会逼迫它拆分出来。OpenAI 也报价过,各家公司都报价过,大家都想抢。Google 也会认为 Chrome 是它在 AI 战场上最核心的武器之一。
Safari,也就是苹果的浏览器,最近一段时间改了它内置的 AI 搜索引擎,也造成了股价调整。苹果还提到,Safari 的搜索量首次下降,因为大家都开始使用 AI 工具。你会发现,这件事和 AI 已经完全分不开了。
初创公司里,OpenAI 传说正在内部开发浏览器;Perplexity、Genspark 都在做浏览器,也已经发布了产品。原来的 Arc 也是专门做 AI 浏览器的。你会发现,大模型公司、AI 搜索公司、Agent 公司,以及纯粹的新一代 AI 浏览器公司,似乎都在疯狂做浏览器。
国内也一样。之前夸克发展得非常猛,前几天还发布了高考志愿填报相关的 AI 模型。夸克似乎已经成为阿里体系内 To C AI 的排头兵,战略地位被无限拉升。
这也从侧面刺激了竞争对手。QQ 浏览器最近也发布了 AI 功能。你要想,QQ 浏览器在腾讯内部,从产品团队的资源禀赋和优先级来看,肯定排在很多产品后面,不会排在微信前面,也不会排在 QQ 前面,更不会排在很多游戏产品前面。它原来的资源优先级不会那么高。
但这一波 AI 到来之后,大家发现浏览器这件事还是很重要,还是要做。所以你会发现它最近更新得非常频繁,也在疯狂加入 AI 功能。原本处于相对“躺平”状态的 QQ 浏览器,也得重新支棱起来。
浏览器为什么会成为 AI 的必争之地?刚才已经讲到了一个关键词:它需要一个载体。今天我们让 AI 帮我们做事,但它做事需要记忆,需要规划,需要使用各种工具,甚至还要执行各种动作。
它做所有事情的时候,需要一个稳定、可扩展,并且能够和世界上其他工具产生连接的环境。它得有个地方,不能飘在空中,否则什么都做不了。看上去,浏览器就是那个地方、那个载体、那个环境。
当然,在交互层面,这也是我在课程里讲过无数次的事情:看见、看见、看见,重要的事情说 3 遍。
把最近一段时间新发布的几个产品截图放在一起,你会发现它们几乎没有太大区别:左边是一个聊天框,右边看着它在操作,可能是在搜索,也可能是在推理,或者帮你做可视化展示。基本形态都是用户说完之后,就看着它开始做事。
“看见”的意义在于,这一波大模型有一个很麻烦的问题,叫幻觉。它会产生错误,或者说它出现问题,是经常发生的事情。但如果它让你看到自己一步一步怎么执行,那么哪怕最后结果不是特别理想,你也比较容易原谅它,或者说更容易产生信任,觉得它至少努力过。
反过来想,如果没有这些过程,它只给你一个结果,那你只能评判这个结果。就像小孩做题一样,老师如果只批改结果,可能只看对错;但如果你写得好一点,没准还能拿到一些过程分。
所以要让用户看见,用户才会信任你。只有信任你,他才愿意不断尝试,因为 Agent 本身也需要不断尝试。因此在交互层面,看见、看见、看见非常重要。
5. 邀请码成为增长公式
从运营角度来看,有些事情原来可能是无心插柳,现在变成了一种通用模式。比如我们看各种 AIGC 产品的宣传视频,无论中国还是美国,视频基本都是创始人坐在沙发上或者其他地方,以介绍产品的方式出镜,然后开始讲产品。宣传视频的风格非常统一。
大家也开始疯狂使用传统互联网产品都在使用的一个功能,叫邀请码。它当然有一个听起来很合理的理由:产品初期流量太大,成本会快速提升,所以需要控制进入人数,同时通过邀请机制做传播,形成病毒传播和社交传播。
邀请码大家都在用。每发布一个新产品,大家都会问谁有邀请码,能不能分享一下。邀请码的价格甚至都被炒高了。
我有朋友做了一个产品,他也是这一波的自媒体创业者,几个年轻人一起做了一个新的产品,叫“马都来”。它是什么?比如你有一个邀请码,就可以把邀请码上传到这个平台,由平台自动分发给其他有需要的人。你如果在寻找某个邀请码,也可以在这个平台上发布需求。
这个产品之所以会出现,也是因为这一波产品推广方式催生了这样的需求。我的朋友说,这件事似乎在这个时间点形成了一种 SOP,也就是当下产品发布的公式:
在某个限定领域里,因为通用领域已经被拿走,只要定语加得足够多就能做到第一,推出首个 AI Agent 产品;在某个 Benchmark 上拿到 SOTA,也就是最好的成绩;并且使用该产品需要邀请码。看上去,这已经变成了一套通用公式。
我还有另外一个朋友在下面评论说:“史称邀请码之乱。”最近一段时间,这件事确实讨论得非常多,也特别热,大家吐槽得也很多。
我们似乎还要重新定义另外一件事情,就是版本号。原来软件的版本号非常重要,大版本、小版本都会有明确的版本号。但这个行业发展得太快,导致很多东西很早就上线,功能其实并不完善,却已经做得非常大。
比如最近最火的 AI Coding 工具 Cursor,它的 ARR 已经达到 5 亿美元,也就是一年收入大约 5 亿美元,可能是有史以来增长到这个数字最快的公司之一。但它达到 5 亿美元 ARR 的时候,版本号刚刚更新到 1.0。之前大家使用的还是 0.7、0.8、0.9 这样的版本。
这意味着它还处于非常早期的阶段,但已经做得这么大。再比如前几天在极客圈很火的 Uman,它的创始人是阿里原来负责语雀的玉伯,后来离开阿里去了字节,在飞书做了一年之后出来创业。他也做了一个 Agent 产品,或者说知识库产品。
这个产品已经做了一年,现在刚刚更新到 0.3 版本。从体验角度来讲,很多产品给用户呈现的状态其实都非常早期。但这个时代允许大家以非常早期的方式先把产品交给用户,用户开始使用,产品方再在和用户、和整个 AI 磨合的过程中不断提升,慢慢变得稳定。
所以你看,Cursor 到今天已经做得这么大了,才刚刚发布 1.0 版本。我们可能真的要重新定义版本号。
6. Agent开始交付结果
最后一个产品关键词叫结果。这可能也是 AI,尤其是走到 Agent 之后,大家讨论非常多的一个问题。原来的软件交付的只是软件本身,它像一个工具。
所以大家会讨论为什么要做 Agent。Agent 相当于一个智能体,也可以把它理解成你的员工。你要求员工交付的是结果。理论上来说,结果的衡量应该非常明确。
从原来的技术趋势走到产品趋势,交付的也是结果。衡量结果,无非就是收入、毛利,以及过程中产生的数据飞轮。我们可以通过这样一套衡量体系,评判今天出现的各种 AI 工具和 AI 产品的结果。
它应该交付的是结果。结果的交付方式也很有意思。这张梗图我觉得非常贴切地形容了这一轮 AI 交付结果的过程。
最古老的生产方式,是传统生产线。比如我要交付一辆汽车,我先生产轮子,把轮子架起来,再生产底盘,然后生产车架,最后把所有东西组装在一起,把一台车卖给你。这是传统意义上的流程或流水线生产。
到了互联网时代,大家强调敏捷开发。什么叫敏捷开发?如果今天我要给你一辆汽车,我先做一个滑板,然后做成滑板车,再做一个自行车,再做一个摩托车,一步一步最后给你一辆汽车。
这就是敏捷开发强调的东西:先做一个小东西,先跑起来再说,然后不断往上加,不断迭代,最后交付一辆汽车。
今天 AI 是什么情况?因为 AI 大模型无所不能,所以它出来的时候,往往是一个功能多到无以复加的东西。但我们真正需要的不是这样一个什么都能做的东西,而是一个可以稳定完成具体任务的东西。
所以你要砍掉功能,限定边界,把不该交付的东西拿掉,并且保证稳定输出,最后才能交付一个稳定的结果。这可能就是这一波 AI 的交付方式。
你会发现,最近很多做垂直行业 Agent 的公司,或者其他 AI 公司,其实都在做同一件事:大模型确实无所不能,但不能直接拿来用,因为它不稳定,因为它有幻觉,也因为它不知道很多细节。
你需要砍掉一部分能力、限定边界、保证稳定输出,最后交付一个明确的结果。整个过程就是这样。
衡量结果最直接的方式当然是收入,也就是 ARR,年度经常性收入。所以你会看到各种关于 ARR 的榜单。美国这边,ChatGPT 当然还是最头部的,Claude、Midjourney、Cursor 也都在最前面。
中国这边,头部产品可能包括美图秀秀。美图最近的 PR 也比较多,它靠这一波 AI 发展得非常快。它交付的是一个明确结果:帮你生成证件照,或者帮你做美化效果,你可以直接看到结果。
我女儿前两天幼儿园报名,需要生成证件照。生成一次可能要 15.9 元;如果要换一个装束,可能还要加 4 元;如果要增加一个尺寸,可能又要加 3 元。但你着急使用,只能付钱。
这种方式确实很方便。你只要提供一张正常的正面照片,就可以生成证件照。所以你会发现,交付结果确实是衡量这一波 AI 产品最简单的标准,而结果的直接反馈就是收钱,因为你是为结果付费的。
7. AI资本疯狂加速
既然提到了 ARR,也聊到了钱,我们就正式进入第 3 章:资本。资本也有 3 个关键词:加速、并购和 Infra。其中最后一个关键词 Infra,在我的课程里已经讲了比较多,今天再讲一点。
先说疯狂的加速。起因当然是这些公司,尤其是最头部 AI 公司的 ARR 增长非常快。OpenAI 在 2023 年只有 10 亿美元收入,2024 年是 40 亿美元。2025 年初的时候,OpenAI 预计全年收入是 100 亿美元;上个月刚刚调整,现在预计今年收入达到 130 亿美元。
它的最大竞争对手 Anthropic,年初预计今年收入大概是 20 亿美元;上个月,也就是 5 月 31 日左右,相关消息已经更新到 30 亿美元。你要知道,它们在年初做计划时应该已经留出了余量,结果过了 5 个月,预期还被自己上调了。可想而知,增长有多快。
Cursor 就更不用说了。我去年年底做年度总结的时候,Cursor 的 ARR 还是 1 亿美元;现在已经涨到 5 亿美元。用了一年不到的时间,增长非常疯狂。
这一轮 AI 公司估值,主要是靠 ARR 来估。这个我在课程里也讲过:估值等于 ARR 乘以一个倍数。你会发现,这一轮 AI 头部公司的估值,相对于 ARR,也就是传统意义上股票估值里的 PS 指标,远高于传统非 AI 公司。
巅峰时,估值可以达到 ARR 的几百倍。最头部的公司通常可能达到几十倍。比如刚刚融资的 Cursor,ARR 是 5 亿美元,这一轮估值大概 100 亿美元,融资 9 亿美元。
最近刚刚确认的新闻,还有刚才提到的 Scale AI。Meta 投资了 148 亿美元,占 49% 的股份,对应的估值三百多亿美元,增长非常快。
这看上去又是一次梯云纵:收入增长很快,而估值又是基于收入计算的,所以估值也跟着快速增长。
8. 并购进入高峰
估值涨得太快,投不起怎么办?或者说,很多公司已经非常厉害了,进入了新的赛道。去年我写报告的时候,很多并购案其实属于“掏空式并购”,大家并不真正认可公司的产品和价值,只是把团队买走,所以那时候的并购不是真正意义上的并购。
但今年虽然刚刚过去不到 6 个月,已经宣布或者确认的并购交易非常多。甚至现在就可以给年底下一个结论:2025 年绝对是并购大年,尤其是在 AI 领域。
原来很多并购发生在上市公司并购初创公司,但今天很多未上市公司的估值也非常高。比如 OpenAI 的估值已经达到几千亿美元,它也在并购私人公司。所以私人公司和私人公司之间的并购也非常多。
从并购角度来看,今年一定是并购大年,美国的 VC 们又赚得盆满钵满。
再延伸一点,这一页和今天的话题没有那么相关,但我觉得可以讲到这里。昨天腾讯音乐收购了喜马拉雅,我昨天也在自己的博客里写了一期内容。我当时的观点是,中国的反垄断似乎已经翻篇了。
你会发现,包括 A 股的一些政策,也在鼓励 A 股上市公司做并购。所以我们中国这边似乎也可能成为并购大年,只不过并购标的不太一样。比如百度收购 YY、迅雷收购虎扑、TME 收购喜马拉雅,这些都是并购。
9. Agent基础设施浮现
那机会出现在哪里?这是红杉在 5 月底一次大会上的 PPT,逻辑其实非常简单,和我们前面讲的非常像。
既然这一轮从推理模型走到了 Agent,首先推理模型本身还会继续发展。推理模型刚才讲过,通过梯云纵不断提升,其中一种方式就是合成数据,所以合成数据也非常重要。
然后我们走到 Agent。Agent 需要调用工具,但它不能直接调用,需要脚手架来帮助它调用。这些都是机会。哪里出现问题,哪里就是机会。
纯粹从投资角度来看,尤其是早期投资,机会大概就出现在这些地方。甚至在 Agent 生态里,协议层也没有真正意义上的行业标准。今天大部分 Agent 调用工具时,使用的是 Anthropic 的 MCP 协议。
但未来如果世界上有非常多 Agent,Agent 之间似乎也需要一个协议。人和 Agent 之间的协作,看上去同样需要一个协议。就像互联网行业一样,HTTP、SMTP、FTP 等各种协议,共同构建了互联网运行的基础。
你要知道,所有这些协议,本质上都是为了人搭建的。我们还没有专门为 AI 搭建这些东西。如果未来 AI 真正运行起来,AI 的网络,以及 AI 和人、AI 和 AI 之间的连接,似乎也需要协议,所以这里都有机会。
更不用说真正意义上为这一轮 Agent 提供基础设施的公司了。
这张图最近一段时间好像是刘教授发的,讲的是 Infra,也就是如何给 AI Agent 做基础设施。首先,前面讲过,我们需要给 Agent 搭建一个环境。浏览器是环境,虚拟机也是环境。
如果要让它调用浏览器、访问浏览器,那它和浏览器之间似乎也需要一些功能和服务。它还需要长上下文记忆,需要执行能力、搜索能力,甚至可能还需要支付能力。
我们现在的在线支付,是为人设计的,不是为 AI 设计的。支付涉及资金和安全,还要考虑权限问题,比如数据库权限、人的访问 ID 权限。你会发现,所有这些事情都变成了问题。
所以在当下这个时间点,这些都会成为早期投资的重要标的方向,因为后期已经投不起了。刚才我们讲过,有的公司已经融了几亿美元。一个基金可能都没有几亿美元,它怎么投得起?所以我们只能在早期往前投。
而且现在基础设施还不完善,这个观点我在课程里面也讲过。
最后一页,是最近硅谷银行报告里的一张图。我在课程里从技术讲到产品的章节,也使用过一个类似的观点,叫 Gartner 技术成熟度曲线,也就是技术发展曲线。
所有技术的发展,似乎都要经历一个从默默无闻,到开始爆发,再迅速到达愚昧之巅,然后跌入绝望之谷,最后慢慢走向理性化和生产成熟的过程。所有技术似乎都需要经历这个过程。
在一个时间截面上,不同技术也会分布在曲线的不同位置。今天 AI 似乎也处于这样的状态。
这张图大家可能看不太清,我大概解释一下。比如云计算,Cloud 已经在曲线的后段,云和 AI 的结合已经成为非常明确的共识,进入了相对理性的阶段。纯生成式 AI,比如生成图片,也已经进入了比较成熟的阶段。
AI Coding 处在最疯狂的阶段,接近愚昧之巅,是现在最热的东西。还有一些没有那么热的,比如边缘 AI、消费级 AI,这些可能还在爬坡的过程中。AI Agent 也已经接近曲线顶点的位置。
所以你会发现,这和我们今天聊的状态非常相关:最热的东西,一定在最顶点;不太讨论的,或者已经进入成熟阶段的东西,已经跑到曲线后面去了。
从技术到产品再到资本,其实都可以用差不多这样一张图,把脉络比较清楚地梳理出来,做成一张地图或指向标,帮助大家理解这些内容。
我今天的分享大概就是这些。