潘乱
大家好,欢迎来到本期微博AI的访谈连麦节目 AI Talk 啊,我是主持人潘乱。今天我们要聊谷歌,尤其是半个月前的 Google I/O 大会。这场大会应该冲击了这个行业,大部分人都深受震撼,感觉 AI 行业的天花板又被顶高了一截,对吧?
对比前两年,我们看到的是什么?各种翻车。当年谷歌收购了 DeepMind,后来一批人创办了 OpenAI,但在这个对比里面,谷歌的风头远远不如 OpenAI。之前谷歌的发布会上可能还会翻车,包括产品名字也改了。
但是这一场 Google I/O 大会,算不算谷歌的逆风翻盘?所以今天我们请到三位嘉宾,跟大家一起聊一聊。三位先做一个简单的自我介绍。
庄明浩
大家好,我是庄明浩,《屠龙之术》的主播,一直在观察科技以及 TMT 相关行业。
朋克周讲AI
大家好,我是朋克周讲AI,我们主要做短视频,进行一些 AI 科技的科普。
挨踢牛魔王
大家好,我是挨踢牛魔王。我现在主要是在做一家 AI 创业公司。
1. 谷歌三年逆风翻盘
潘乱
我们这场是聊谷歌过去 3 年是怎么过来的,但还得先回头把这段历史拉出来。因为谷歌动不动就会被拿来跟 OpenAI 对比,并且挨骂。
大概 2 年、2 年半以前,谷歌也追随着 ChatGPT,推出了自己的 Bard。但一开始首秀就出现了一些常识性错误,谷歌的市值也一夜之间蒸发了七千亿。到了 2023 年 12 月,它做演示的时候又被扒出来,原来剪辑造假。
反正过去这 2 年就是黑料频出。它生成的内容可能会有各种槽点,比如种族歧视、劝用户吃毒蘑菇,甚至还有更夸张的剧情。
去年的 I/O 大会,它原本信心满满地要放一个大招,准备发布一个能看、能听、能实时对话的多模态 AI 助手 Project O。结果 OpenAI 在前一天截胡,发布了 GPT-4o。后来的故事大家也知道了,谷歌泯然众人。
这中间还有一系列事件。比如微软推出了 New Bing,Perplexity 这样的创业公司也起来了,还有浏览器领域的 Dia 等等。大家都觉得这些产品会对原本的巨头造成非常大的冲击,谷歌也被认为跟不上时代,大象不能转身,甚至出现了“英雄迟暮”这样的论调。
各种大公司病的标签,也都追着谷歌来了。但今年这个大会,真的有一点王者归来的意思。它自研 TPU 的单集群算力全球领先,Gemini 2.5 Pro 我也用了一下,的确很强,我们待会儿再聊。
反正这一年谷歌是全方位进步,不管是模型、AI 助手、核心搜索产品,还是浏览器本身,整个产品体系都在 AI 化。甚至连十多年前的 Google Glass,它也重新拉回来了。
2. 三大产品震撼登场
首先先聊第一部分:从业界笑柄到全面领先,谷歌这次 I/O 大会有哪些让人印象深刻的细节?从这次大会来看,哪一项发布让你觉得最惊艳?大家可以随便聊。
朋克周讲AI
我先说吧。我觉得这次发布的东西特别多,每次谷歌大会,不管是 I/O 还是 Cloud,都会推出一两百个更新,看得人都快晕掉了。
这里面给我直接冲击最大的,还是 Veo 3,就是它的视频模型。这有点超乎我的预料。我们之前一直在期待 Sora,但后来发现 Sora 不太行,中国很多模型反而追上来了,比如可灵、Vidu,还有即梦。
特别是可灵,不管是整体模型能力还是成本,都已经达到商业化水平了。我没想到谷歌还会推出 Veo 3。我们去体验了一下,确实非常强。
这里面还有一个小插曲。前几天我看到一个短视频,一个女士要带一只袋鼠上飞机,袋鼠嘴里还叼着一张机票。我以为是搞笑视频,还发给我女朋友说:“你看,外国人天天整活。”
我女朋友说:“这个做得挺真的,你看它的手。”我一下就愣住了。因为我没有把它当成 AI 视频,我以为那就是一个搞笑视频。像我这样看了两三年 AI 资讯的老韭菜,居然都没有发现它是 AI 生成的。
这两天我也跟很多朋友聊,发现这种级别的视频已经可以造成一定程度的混乱了。你完全分不清楚,不管是老人、小孩,还是专业人士,都很难判断它到底是不是真实的。
所以 Veo 3 现在确实非常强,但它特别贵。我们算了一下,如果用 Veo 3 API,一条视频大概需要 100 元人民币,很贵。不过它的原生性非常好,能够直接给你生成符合场景的声音和人物声音,包括眼神。
在我们看来,它的 AI 味已经非常非常少了,这一点特别惊艳。
庄明浩
我本来也想说 Veo 3。视频领域之前有一个很核心、一直没有解决的问题,但在 Veo 3 之后,它变成了一个不再是问题的问题。
原来生成的视频是没有声音的,视频就是视频,语音就是语音,是分开的状态。Veo 3 生成视频的时候直接带着声音,而且声音跟你要生成的内容是匹配的。
也就是说,它把原来视频和语音分开的状态,变成了一个整体。Veo 3 之后,所有 AI 视频生成工具的标准尺都变了:你生成的内容本身就要有声音。比如今天我想生成一段对话视频,或者一段沟通内容,就要保证视频图像和语音内容匹配,并且同时生成。
这件事在以前的 AI 视频生成里是不可能的,现在可能了。它把 AI 视频生成从无声直接拉到了有声,拉到了一个新的天花板。
另外一点,我觉得可能更重要,或者说这个挨踢牛魔王待会儿可能会讲得比较多。二级市场对于谷歌这一轮 AI 的讨论,更多担心的是它传统的搜索商业模式会受到巨大挑战。
但这一次 I/O 之后,你会发现,除了常规的模型和技术进展之外,谷歌在最核心的搜索框里,开始增加 AI Mode。当然目前只在美国上线。
我们可以设想,至少谷歌内部应该经历了很多组织层面的沟通之后,才下决心去动最核心的搜索框。对于一个体量这么大、在搜索领域具有强垄断地位的公司来说,能够做出这样的决定,本身就挺不容易。
所以在这一点上,我觉得谷歌的状态发生了比较大的变化。
挨踢牛魔王
最后我讲一下。这次 I/O 大会确实让人很惊艳。我觉得最基础的还是它的大语言模型 Gemini 2.5 Pro。
谷歌之前老翻车,对吧?而 OpenAI 其实每次都针对谷歌。每次谷歌准备发布什么东西,OpenAI 就故意卡在那个时间点,先搞一个事情,把谷歌的风头抢走。
OpenAI 当初成立的时候,目标之一就是认为人工智能不应该被大公司垄断,所以它每次都会针对谷歌。
但这一次,谷歌的 Gemini 2.5 Pro 非常强。它在写作、编码和推理这 3 个方面都很强。最新的版本应该是昨天发布的,6 月 5 日发布了一个版本,打榜已经冲到了最高分。
这是谷歌其他能力的基础。我认为这是这次最强的发布。
最惊艳的就是刚才几位老师也讲到的 Veo 3。它一上来,基本上就把整个视频生成领域颠覆了。它的技术其实来自 DeepMind,叫 V2A,也就是 video-to-audio。
它先提取视频里面的各种信息,再把这些信息传给 diffusion,也就是扩散模型,然后生成音乐和声音。这样做出来的效果就非常好。
尤其是人物的真实度,刚才大家也提到了,非常真实。它一下子就跃居第一梯队。视频生成领域现在可灵已经可以跟它打个来回,基本上可以说是并列世界第二。
但 Veo 3 加入声音处理之后,确实更先进了一些。我相信可灵后面也会慢慢朝这个方向发展。其他方面,比如生成和换衣服,可灵其实也不弱。
技术上最让我惊艳的另一点,是谷歌推出了 Gemini Diffusion。我们一直以为扩散模型更适合用在图片上,因为速度非常快,而且跟人的思考方式比较像。
扩散模型的过程有点像去噪:先有一个草稿,再把草稿细化,补充每个细节。大家写一篇文章,大致也是这个思路。
但以前采用的自回归模型,比如 ChatGPT 使用的模型,并不是这样的。这次谷歌提出了 Gemini Diffusion,虽然目前实用性还不是特别强,但谷歌往这个方向发展,本身就说明它的创新能力回来了。
这个模型的速度非常快,最快大概一秒钟能生成 1400 到 2000 个 token,基本上可以做到秒出。速度起来以后,对于未来的互联网应用会非常有用。
我们现在知道,智能模型有一个问题,就是速度比较慢。做搜索、互动和产品的时候,很多时候需要准实时功能。比如搜索的时候,你希望一点按钮答案立刻出来,而不是像打字一样慢慢输出,那样体验会差一些。
所以我觉得,这次谷歌大会最惊艳的就是这 3 点:Gemini 2.5 Pro、Veo 3,以及 Gemini Diffusion。
3. 谷歌全面接入 AI
潘乱
大家刚才都讲了自己印象最深刻的细节。如果再聊一个更综合性的感受呢?
刚才几位都提到,OpenAI 当时是为了对抗谷歌,包括在谷歌各个发布节点,OpenAI 也会对它发起冲击。如果再往前推,两三年前,微软把 ChatGPT 融合进 New Bing 的时候,大家其实都在等着看谷歌的笑话:你谷歌到底跟不跟?
在没有 AI 之前,谷歌在全世界范围内至少占搜索市场的 80%。但如果它跟进 AI,利润可能会大幅下降,这也是二级市场对它最大的担心。
如果它不跟进,前两年 Perplexity 这样的产品又会影响它的市场份额。市场份额受到影响,现金流肯定也会受影响,甚至可能无法阻止微软云业务的崛起。
但这次 I/O 大会给我印象最深的,是谷歌终于非常自洽了。大公司都面临一个问题:做 AI,到底是做一个新产品,还是把原有产品用 AI 变得更好?
我感觉谷歌选择了后者。它把所有产品都加上 AI,从 Chrome、Android、Gmail,到最核心的搜索,全部都加上 AI。
而且它把这些能力跟“整合全球信息”这个公司使命连接起来,也不觉得违和。几位是什么综合感受?
朋克周讲AI
我觉得这就是谷歌的优势。我们看到的除了它的模型、底层能力和视频模型非常强之外,还看到了它的一个思路:用自己的生态去打单品,用自己的会员体系去打别人的模型。
现在我们看到 GPT 也好,Claude 也好,很多还是一个单独的产品,是一个对话工具。但谷歌现在是把所有产品都接入了 AI。
比如 Gmail 里面也可以使用 AI。虽然现在用起来可能有点奇怪,改一段文字有时候甚至比自己写还慢,但这体现的是它的内部策略。
谷歌这些产品加起来可能有十几亿、几十亿用户。如果它重新做一堆产品,就会面临新的竞争。不如基于原有生态,让用户在谷歌体系里无缝连接。
举个最小的例子:你可以先用 Gemini 生成提示词,再用 Veo 3 生成视频,然后用 Flow 剪辑,最后一键发到 YouTube。这样的体验,对用户来说肯定比在不同 AI 产品之间来回切换更好。
它的 Android、云服务、浏览器,未来甚至都可以互相打通。比如它可以读取你的聊天记录,给你一个整合的方案。我觉得这就是谷歌的战略。
否则它要重新做一批产品,做一个新的搜索引擎,或者做一个新的入口,评估起来会非常难。
潘乱
另外两位有什么感受?
庄明浩
我的感觉是,你们拿着一根矛,想要来捅我,我直接把这根矛拿过来自己用了,有点这种感受。
挨踢牛魔王
潘老师刚才的洞见非常好。谷歌这样的大公司有一个问题,就跟原来的诺基亚一样。它为什么早期跟不上,闹出一堆笑话?
最核心的原因是,它的搜索业务实际上是一台印钞机。广告和搜索是联动、自动化的,它甚至可能有 80% 到 90% 的业务都来自搜索广告。
但如果它上 AI,不就变成自己打自己了吗?原来负责搜索的那批人,会认为你这样做威胁到了他们的生存。不管是内部还是外部,都很难动刀子。
谷歌其实很早就看到了 AI 的价值。比如辛顿教授做语音识别的时候,谷歌已经在进行很多创新。Transformer 架构也是谷歌最先做出来的,结果当时那 8 个人都跑了,也就是大家说的“谷歌八子”。
为什么会跑?就是因为谷歌不敢动自己。
刚才明浩讲到,这次谷歌把 AI 模型放到了核心产品里。这件事情本身就说明,它真的想动刀子、改革自己。
第二个洞见是,谷歌和微软采取的方式完全不同。微软打的是代理人战争:自己不练模型,扶持一个 OpenAI 去打,然后自己不用在内部动刀子,还可以通过股权去控制它。
谷歌不是这样。谷歌是直接在内部动刀子,把 AI 重新融合进自己的业务。
比如你搜索的时候,可以直接融合 Veo 3;生成之后可以一键发布;它走的是用 AI 把所有业务重新做一遍的思路。所以它下的决心非常大。
朋克周讲AI
这次 I/O 大会还有一种 88VIP 的感觉。它特别强调自己不是一家广告公司,还推出了大会员。
它也推出了眼镜。虽然现在还是概念片,但如果真的拥有那副眼镜,确实会非常爽。眼镜是入口,而眼镜背后的模型、数据,包括订餐等能力,都基于谷歌的生态。
没有生态,眼镜也无法维持。所以它有点像 88VIP,只不过谷歌这个 VIP 稍微有点贵。
它想给用户的感觉是:在别的地方,你只能问答、聊天、生成视频;但在谷歌这里,它可以解决你所有的生活和工作问题。
量大管饱。
4. 真正的转折来自组织
潘乱
我们再回头看。大家一开始担心大象不能跳舞,结果今天发现,这头大象甚至还能跳街舞,确实有点吓人。
这次不管是行业里的大公司还是创业公司,都给出了非常强烈的反馈。那可以认为,谷歌这次在 AI 赛道上翻身了吗?
把问题问得更具体一点:前两年谷歌一直被 OpenAI 拿来嘲笑。这次至少先不说反超,至少我们已经把谷歌当成同一个级别的对手了。不会再有人觉得谷歌不是这个星球上第一梯队的 AI 公司。
反正这次大会之后,不管谁是不是第一梯队,谷歌一定已经是了。我好奇的是,这个转折点到底在哪?是哪一刻、哪个产品,或者哪个瞬间?
庄明浩
我觉得还是组织问题。
去年我们去新加坡参加谷歌的活动,看了一部国内没有上映的纪录片,是关于 Demis Hassabis 的。他从小学国际象棋,后来喜欢上人工智能,创立了 DeepMind。
纪录片里有一个画面,他用手机跟一个 AI 对话,那个 AI 已经非常强了。我感觉谷歌内部 DeepMind 的 AI 能力其实一直都非常强,只是之前谷歌用的是 Google Brain 团队。
Google Brain 做了 BERT,但后来出了很多问题。所以我觉得真正的转折点,应该是谷歌内部达成了某种协议,决定让 Demis Hassabis 的团队成为整个谷歌 AI 业务的领导者。
谷歌原来可能有 3 到 4 个研究 AI 的部门,有 Google Brain、DeepMind,还有其他 AI Research 部门,组织非常多,也很混乱。
我觉得转折点应该是在 2023 年四五月份,把这些部门合并,让 DeepMind 来领导。这解决了很多问题。
Google Brain 团队非常擅长研究。Transformer、TensorFlow,以及很多神经网络成果,都是他们做出来的。但他们对于应用好像不太灵,写论文可以,做产品应用不太行。
集团内部把这些团队整合起来,让 DeepMind 来领导,我觉得是一个非常重要的转折点。
DeepMind 一直在研究多模态和扩散模型,这些方向在这一轮被行业高度认可。Bard 原来的模型路线,我感觉一直没有真正跑出来。
我还有一个感受:这就像淘宝为了应对拼多多,专门搞了一个特价版,因为它不想让自己的主产品和原有商业模式受到侵蚀。后来证明这个方向基本是行不通的,你不可能用自己的峰值去打别人一个非常有生命力的创业产品,最后只能是你自己承担变化。
这次发布会给我的整体感受是,谷歌不再强调搜索摇钱树这个概念,也不再首先考虑“这件事怎么赚钱”,而是把所有业务都往 AI 上转,真的用 AI 去重构。
对于大公司来说,我可以研究,放 10 个人,也可以放 1 万个人,但跟投入 10 万人完全不是同一个概念。谷歌现在是让所有业务都来回答 AI 这个命题。
潘乱
明浩和牛魔王,你们有什么观察?之前业界一直认为,哪怕拉长周期来看,谷歌是一家更擅长技术,但在产品应用端总会掉链子的公司。这么多年一直出现这种情况。
在这次 I/O 之前,其实也有这个趋势。Gemini 的表现从 2024 年开始,慢慢已经追上了最头部的模型。无论是 OpenAI 还是 Anthropic,从评分和榜单来看,谷歌每次发布 Gemini,成绩其实也都还可以。
但那个时间点,大家会认为谷歌还处在技术研发状态,技术对现有业务的影响和帮助并没有体现出来。
而 ChatGPT 出现的第一天,大家就知道它一定会奔着搜索去。所以从 2022 年底开始,一个巨大的问号就一直压在谷歌身上。
我们看所谓美股“七姐妹”:市值 3 万亿美元的 NVIDIA、苹果和微软,各自有自己的叙事;市值 2 万亿美元的谷歌和亚马逊,也有自己的策略;剩下市值 1 万亿美元的 Meta 和特斯拉,也都有各自的担心。
这次 I/O 之后,我们看到谷歌纯技术端的进展依然非常强,同时产品端也出现了融合和变化。无论是原来的主产品,还是新推出的 AI 产品,都出现了更明确的策略。
甚至 NotebookLM 这种产品,口碑也非常好。所以它对谷歌原来负面印象的扭转,产生了一定的边际增强。
我甚至觉得,这很像当年 Android 最火的那几年。那时候每年的谷歌 I/O 大会,大家都特别兴奋,看到各种更新会非常开心。今年的 I/O 确实也有那种氛围。
挨踢牛魔王
谷歌之前推出 NotebookLM 这样的产品,确实非常惊艳。
模型方面,它早期为了应对 OpenAI 的冲击,相当于把原来的一些东西拼凑起来,做了一个 Bard。别人像驱逐舰一样来了,它随便找几个东西拼了一个小船过去,立刻就被冲垮了。
后来它打通了部门墙,把 AI 组织理顺了。谢尔盖·布林原本已经处于半退休状态,但这个时候又亲自回公司上班、写代码,还号召大家每周至少工作 60 个小时。
谷歌现在是混合办公,很多人一周只有 3 天在公司。布林回来以后,对整个团队士气的鼓舞非常大。
组织理顺之后,我觉得真正的转折点是在 Gemini 2.0。它推出了 Flash 模型,还加入了图像编辑能力。
比如可以把一个人改成吉卜力风格,让他换衣服,或者把两件产品,比如球鞋,和一个人结合在一起。它当时是第一个推出这类功能的。
但 OpenAI 专门盯着谷歌。谷歌推出之后没几天,OpenAI 就发布了更强的 GPT-4o 图像模型,一下子把风头盖过去了。
不过那时候局势已经开始慢慢扭转。谷歌居然能够在这个领域抢发,说明它其实已经提前研发了很久。当 OpenAI 还在研发图像编辑和控制模型的时候,谷歌已经提前了一年在做。
虽然它上线之后,风头又被 OpenAI 抢走了,但从那次之后,转折就慢慢开始了。到了后面谷歌再开 I/O 大会时,OpenAI 明显有点压不住了,它当时只发布了一个编码模型 Codex。
所以我认为,Gemini 2.0 这次抢发,是一个比较大的转折点。
潘乱
还是非常感慨。谷歌敢在自己的核心业务上动刀,因为搜索真的是互联网上最好的商业模式,应该也是互联网有史以来利润最肥、最大的市场。
微软的 Bing 当年只占全球搜索市场 3% 的份额,但你别看只有 3 个百分点,每年也有 120 亿美元的营收。
所以当时大家觉得,AI 搜索只要跟 ChatGPT 一起抢到谷歌 1 到 2 个百分点的份额,就是非常大的生意。
我们也看 Perplexity 这类产品,单个用户每天的查询量可能是谷歌的好几倍。这确实让人惊讶,谷歌能做这么大的调整。
这个调整也跟刚才朋克周讲的事情有关。谷歌一开始用的是 Bard,后来不断翻车,出现品牌丑闻,才改名叫 Gemini。与此同时,Google Brain 和 DeepMind 两个团队也进行了重组,谷歌高层还承认,过去的 AI 战略出现了问题和偏差,需要重新调整。
朋克周,你再延伸讲一讲这次调整和 I/O 大会之间的关联。
朋克周讲AI
这次 I/O 大会其实就是前面调整之后的成果展示。
Bard 就不说了,真的没有办法用,特别离谱。中间还有一段时间,你问 Bard 自己是什么模型,它会说自己是文心一言。我不知道它是用了中文语料,还是接了文心一言的接口,也不知道是蒸馏还是什么,总之非常离谱。
刚才我们一直在说搜索。我觉得谷歌的搜索业务太重了,而它的搜索现在已经被 Perplexity 以及 GPT 相关产品影响了。
别说海外,我觉得国内也是这样。我们现在已经有习惯了,动不动就问豆包、元宝、DeepSeek。很多问题,我可能不会再打开搜索引擎去问。
这对谷歌的刺激非常大。正因为刺激大,它才下决心在一定程度上革自己的命。但它也不能让别人来革自己的命,所以这次 I/O 大会里,不管是搜索中加入 AI Mode,还是其他产品,都能看到类似的变化。
现在 AI Mode 还只能给美国用户使用,我们用不到。但从整个产品线来看,我感觉基本都是 DeepMind 团队的成果,当然其中也有 Google Brain 团队在技术上的支持,比如神经网络优化,以及刚才牛魔王提到的扩散模型。
据我了解,它在视频上使用的是一种改良的扩散模型。技术层面上,原来 Google Brain 团队的支持还在,但从整个产品线来看,多模态产品基本都是 DeepMind 团队的东西。
这次 I/O 大会展示的,其实是团队整合之后,各部门在技术和生态方面融合的结果。最后拿出来的产品非常完整,很多东西都已经打通了。
当然,它现在的问题是产品太多。
我们今天测试了谷歌的编程能力,速度非常快。用 Gemini 2.5 Pro,今天更新的版本,两分钟就能做出一个游戏。很恐怖,两分钟就能做出一个 UI 很好的、可以玩的游戏,甚至我们能玩半个小时。
我觉得这是团队融合之后的一个成果展示。
5. 中美模型继续突破
潘乱
如果放到中国和美国的视角来看呢?
春节的时候,GPT-4o 一出来,真的非常惊艳,给整个中国社会、创业市场和创投市场都注入了一针强心剂。
当时我们感觉,GPT-3.5 发布得并不顺利,好像西方的发展遇到了瓶颈。可过去这几个月,GPT-4o、Claude 4,以及谷歌 I/O 发布的 Gemini 2.5 Pro,怎么感觉都没有瓶颈?
原本 GPT-4o 出来的时候,我还会想,大模型是不是到了某些瓶颈,西方发展得不太顺利,接下来是不是要轮到我们了?但 GPT-4o 火了一个月之后,反而那边又不断有新产品登场,好戏连台。这是怎么回事?
挨踢牛魔王
这个过程大致是这样的。
OpenAI 做了一个很有意思的东西。以前我们讲模型,主要讲预训练。预训练就像一个人读了很多书,把书都读完了。但如果你希望这个人对各种问题做出反应,还要做题。做题就是强化学习,之后才能进入推理领域。
OpenAI 做的推理模型就是 o 系列。对 OpenAI 来说,o 系列是一个很大的进步。他们内部至少认为,这可以成为自己的护城河,虽然不一定永久,但挡住别人 1 年、2 年应该没有问题。
但这一次出现了 DeepSeek。其实中国有两个团队独立把这件事情搞清楚了,一个是 Kimi,一个是 DeepSeek。只不过 Kimi 没有开源,所以大家关注得不多。
DeepSeek 不仅把模型开源了,还把怎么做的细节全部写进论文并发布出来。它对整个行业的提升是巨大的,不只是对中国,对全世界,包括美国,都是巨大的提升。
它一下子把 OpenAI 原来的优势拉平了。
Kimi 是怎么发现的?OpenAI 发布演讲、论文和一些片段时,经常提到蒙特卡洛树。Kimi 的研究人员非常敏锐地发现,这个方向可能是错的。
不是说蒙特卡洛树绝对做不成,但在当前阶段比较难。他们找到了纯强化学习这条路。中国这两个团队不约而同地走到了这条路上,没有被 OpenAI 误导,也没有掉进那个坑里,最后把它做出来了。
所以这一次谷歌为什么这么强?除了团队整合成功之外,技术上很重要的一点,就是 DeepSeek 把 OpenAI 如何做推理模型的很多方法都公布出来了。
谷歌当然不一定完全照着 OpenAI 的路子走,但它肯定会吸收这些经验。整个行业在这件事上就像没有瓶颈一样继续向前推进。
而谷歌还有一个优势,就是数据非常多。比如 YouTube,以及搜索数据,这些都给它提供了很大的基础。技术上没有大的瓶颈,数据又足,它自然就往前走了一大步。
所以 DeepSeek 开源,对整个世界的贡献,不只是对中国的贡献。
庄明浩
我做一个更简单的整理。
OpenAI 之前定义了 L1 到 L5:L1 是聊天机器人,L2 是推理,L3 是今年讨论特别多的 Agent,L4 是创新,L5 是组织。
OpenAI 的 o 系列是推理模型的开始,去年 9 月之后,到今年年初这个阶段,全世界头部模型厂商的工作,基本上都是在复现 o1。
确实有一些厂商走了弯路,因为被 OpenAI 带着走了。他们尝试了其他方式,后来证明只需要强化学习,只需要后训练,就可以走到推理这一步。
DeepSeek 和 Kimi 很早就发现了这一点。到了 2025 年第一季度,头部模型厂商基本都把推理模型做成标配了。
这时候出现了一个循环。去年 9 月,伊利亚说预训练的天花板到了,大家开始强化后训练和强化学习。到了 2025 年第二季度,大家发现预训练依然有空间,强化学习也可以继续加入。
它有点像踢足球时连续踢两脚。大家原来以为前面的预训练结束了,就用后面的强化学习解决推理问题。推理模型都做出来之后,大家发现前面的预训练还可以继续加强。
一个更现实的例子是,5 月底 DeepSeek 发布了 R1 的更新版本 R1-0528。它在编程和文案上已经很强了。
大家为什么期待下一步?因为现在的 R1 还是基于 DeepSeek-V3 的基础模型做出来的。DeepSeek 肉眼可见会发布 V4,基础模型还是通过预训练训练出来的,然后再基于 V4 做 R2。
这就是连续踢两脚。V4 抬一脚,R2 再抬一脚,会抬到什么程度?大家当然非常乐观。
只要它继续抬高,就会把整个行业的平均水平拉上去。因为 DeepSeek 是开源的,训练方式也会公开,甚至它还会用自己的方式去训练 Llama、千问等模型。
它会迅速把行业曲线的天花板拉到更高。所以模型智能这条主线,技术趋势确实还会继续向上走。
6. NotebookLM 打开产品想象
潘乱
下面聊一些具体产品。我们刚才整体聊了 I/O 和中美情况,先从明浩刚才提到的 NotebookLM 开始。
你觉得它跟腾讯 ima、飞书知识问答有什么不一样?底层差不多都是知识管理,但 NotebookLM 出圈,是因为它第一次把播客做得特别好。
朋克周讲AI
从纯粹的体验来看,这个时间点,其实扣子空间以及一些独立产品,都已经开始具备类似功能了。你可以输入一个主题、一篇文章,或者一批材料,让它生成一段听起来非常有逻辑、像真实对话一样的播客。
这个功能现在已经算是偏标配了。但 NotebookLM 出圈的那一刻,它在功能体验上的强度非常高,所以一下子出圈。
纯从底层技术实现来看,还是要感谢 2025 年语音模型的发展。无论是对话、语调还是语气,我们自己也在做相关事情,能明显感觉到这个技术进展非常快。
但怎么封装成产品,做成什么功能,以及怎么让这个功能利于传播、让大家明确知道它的特点,最后能够爆掉,这件事对谷歌来说尤其难得。
谷歌历史上不是这样一家公司。它不是以这种产品特性见长的公司。这个东西如果出现在一家擅长产品的公司里,大家会觉得很正常;但它出现在谷歌,就更让这件事获得了一层加成。
所以我觉得 NotebookLM 应该会在这个行业里留下很重要的一笔,跟 Perplexity 类似。
潘乱
是不是因为它用了多模态上下文?其他产品更多还是图文上下文,NotebookLM 不只是能解读 PDF,还能解读音视频?
庄明浩
应该主要还是 PDF 等文档,但它的播客体验确实做得很好。
朋克周讲AI
我觉得就像明浩老师说的,技术上可能不是特别难,但一家像谷歌这么大的公司能够想到这个产品,我觉得很可能是内部创业的结果。
谷歌经常有这种传统,可能两三个人就做出了一个产品。这个产品非常惊艳,是因为它能够捕捉时代的变化。
现在有一个问题:很多东西不管是枯燥的论文,还是日常新闻,大家可能都听不进去一个人在那里念。但它把内容变成男女两个人对话,而且你可以随时插进去问。
比如你说:“这一点我没听懂。”播客里的角色就会开始解释:“你没听懂的是这个。”然后重新跟你说一遍。
这种体验以前没有出现过。它让人感觉有人陪着你去了解这个世界上很多困难的东西。对于谷歌这样的大公司来说,这个产品洞察非常厉害。
庄明浩
说到产品洞察,我想起昨天或者今天的一个消息。ChatGPT 也开始增强对用户录音的监控和捕捉能力。
我当时就在想,这不是豆包 PC 端研究了很久的事情吗?包括最近一些产品也在相互借鉴,总有一种大家互相学习的感觉。
录音产品我现在也在用一款,正在内测,正好可以录下我们这次对话的声音。大家可能已经意识到,要往硬件入口走了。
现在不管是大厂发眼镜,还是推出可以贴在手机背后、帮助录音和做 AI 助理的工具,都说明行业开始往全方位发展,不再只是模型。
模型可能只有几家大公司能够做。经过两三年观察,我发现身边有些公司已经放弃做模型了,不管是大语言模型还是语音模型,甚至都放弃了。他们可能会去做 AI 相关的其他产品。
还有一个趋势,就是潘老师刚才提到的代码。我觉得代码也是今年非常重要的一个层面。
我前几天在杭州和阿里的同学聊天。我说字节在推自己的 TRAE,阿里肯定也得有自己的产品,原来是通义灵码。结果没过几天,阿里就发布了自己的 IDE 产品。
我觉得只要是大厂,就一定会下场做这个。这个不做,可能比没有入口还严重。入口没有了,问题可能还没有那么大,但自己没有编程能力,严重得多。
7. AI 赛道开始分化
潘乱
现在真正被验证能赚钱的赛道,可能就是代码。最拥挤的方向之一是当年的 AIGC,也就是内容创作;现在所有创业公司都在涌入的,应该就是 Agent。
谷歌 I/O 也推出了换衣服之类的功能。是不是可以认为,现在主要就是这几个大赛道?
挨踢牛魔王
我觉得 Agent 确实有点尴尬。前两天 Claude 不是停了编程工具给它断供了吗?因为传说 OpenAI 要买它,但它用的是 Claude 的 API,所以有点尴尬。除非你能做到像 Manus,或者其他已经在市场上建立了认知的产品,比如第一个设计类 Agent、第一个影视类 Agent,已经获得了心智和市场,能够跟大厂进行战略合作。
否则 Agent 的能力最终还是会被模型覆盖掉。
入口和硬件可能是初创公司相对有机会的方向。这个问题明浩老师可能更专业。
庄明浩
反正今年的主线一定是 Agent。谷歌也说今年是 Agent 年,它确实可能是智能主线上的事情,是绝对意义上的主战场,大厂不可能放弃。
在周边战场,扣子已经很明显了。多模态今年的竞争也非常激烈。视频领域几乎天天在打,今天你第一,明天我第一。语音也是这样。
多模态是一块,硬件可能也是一块。至于 To C 的娱乐和社交板块,实话实说,从阶段性结果来看还不是特别理想。
过去两年半,我们更多讨论的是技术趋势。但到 2025 年,产品趋势越来越重要。无论是硬件还是软件,应用端的事情变得越来越重要,产品体验的边界也变得越来越重要,对大厂自己也是一样。
这也是为什么谷歌这次除了描述技术和模型本身之外,会花更多篇幅描述产品端。AI 这一波浪潮在 2025 年确实开始走向产品趋势。
所以在我们限定的大模型相关板块里,今年的主线可能就是 Agent,副线是 coding 和多模态,再小一点的方向可能是硬件、社交等。
挨踢牛魔王
我觉得它是分一波一波成熟的。
最开始要有正反馈,肯定得先赚钱。对于大公司来说,最开始赚钱的是卖卡。黄仁勋不管你搞什么模型,都得买 NVIDIA 的卡。它的卡虽然贵,但各方面确实领先。
卖卡的公司赚钱之后,下面就是做得比较好的模型公司。你无论做什么应用,都要使用模型,都要消耗 token,所以模型公司也能赚钱。
等模型成熟到一定程度,我觉得 2025 年是一个重要时间点。模型在上下文等方面已经没有太大问题之后,AI 编码就成了一个确定能赚钱的赛道,尤其对大公司来说,肯定要做。
编码是整个互联网和软件的底层。把编码能力抓住之后,再往前走,等 Agent 的行动能力提升,就会出现更多 Agent 产品。
所以赚钱是一波一波的。
为什么判断趋势很重要?AI 刚出现的时候,有些创业公司过早冲进去,认为 AI 应该能做到很多事情,但实际上根本做不到。
有些公司亏了几百万、几千万,还算好;有的投了上亿元,结果产品根本达不到要求,客户也不买单,最后就死掉了。
现在情况不一样。比如当初 Stable Diffusion 1.5 出来的时候,大家觉得换衣服很简单,模特换一套装,电商换装,做了这么久 AI 还搞不定吗?结果就是搞不定。
但到了现在,你看谷歌的换装功能,英文一般叫 Try On,还有可灵的换装,已经慢慢变得非常成熟。到了这个时间点切进去,才能获得比较好的结果。
时机非常重要。
潘乱
我下午刚跟一个做跨境业务的朋友聊,他也是国内排名靠前的创业公司。他说,用他们的企业服务,跟自己拿一个 C 端模型去做换装,成本能够节省 90%。
这说明原来的企业服务收费可能确实太高了。
换装属于商品营销领域。代码刚刚起步,那视频呢?刚才大家都说视频是这次大会最大的亮点。Veo 3 的视频生成,加上原声音频和图像能力,可以认为谷歌现在的多模态是最领先的吗?
朋克周讲AI
目前看,我觉得肯定是第一梯队。不管是图片生成、视频生成,还是声音,它都很强。
刚才明浩老师也说了,可灵当然非常强,但 Veo 3 加入原生声音之后,相当于把这个战场拉到了另一个维度。
综合来看,Veo 3 现在绝对是第一梯队,谷歌在多模态领域已经是头部了。
挨踢牛魔王
Veo 3 主要是把 DeepMind 原来的 V2A 技术放到了产品里。它先从视频中提取信息,再生成声音。
这个技术他们其实已经研究了很久,只是这次真正产品化了。
NotebookLM 也是一样。技术可能很多厂家都有,但谷歌这次的产品力确实很强。它洞察到人性:原来大家喜欢的是两个人对话、不断追问和补充细节,而不是一个人在那里念稿子。
Veo 3 的声音对于后期制作也非常有效。以前我们生成的 AI 影片都是无声的,之后还要做配音,比较费功夫。
现在它可以直接把背景音做好。比如你在森林里下雨,雨声直接生成出来。之后你再给人物配音,整体效果就不一样了。
现在广告、营销、宣传片都有很多项目。比如有人要做奥运会相关的创意短片,可以做跳马、跑步、体操、乒乓球等各种运动。
以前的工作方式是“抽卡”:一个镜头可能要抽几百次,再从里面挑出好的,绝大部分都要丢掉,之后还要剪辑和配音。
Veo 3 出来以后,即使是一个很小的公司,或者一个小广告的导演,也可以综合制作出非常专业的片子,后期费用会节省很多。
以前不是节省不节省的问题,而是你根本做不出来,因为没有设备,设备又很贵。
Veo 3 现在当然还很贵,因为算力成本高。但根据摩尔定律,算力成本一定会慢慢下降。对于做项目的创业公司和导演来说,这个东西的帮助实在太大了。
以前可能要熬夜很久抽卡,才能做出一个片子。现在已经可以用它做出很多质量不错的片子。
所以前不久它跟可灵基本上还可以说是并列第一,现在它可能已经比可灵领先半步,达到这样的水平。
8. 谷歌会员重塑商业模式
潘乱
Gemini 具备多模态能力,又在 Agent 化。它还有可能产生哪些新的商业模式?
我的印象非常深刻,谷歌 CEO 特别强调“我们不是一家广告公司”,然后推出大会员。我感觉有点像谷歌版 88VIP。
我今年可能在朋友圈分享过一个观点:2025 年可能是大厂生态 AI 之年。像 88VIP 这样的生态,只有淘宝能做;谷歌这样的事情,也只有谷歌能做。
关键在于,你手里面到底是 To C 资源,还是 To B 资源。
前几年大厂挣钱是卖卡、卖算力,接下来可能是卖云服务,把大模型和云绑定起来,这是大厂能做的事情。
未来我可能不只是充值 GPT 的会员,去体验 GPT 里的模型能力。我可能会选择充值谷歌会员,心态也不一样:我不是在充一个 AI 软件的会员,而是在充一个生活助理和工作助理的会员。
充了一个会员之后,我可以在谷歌里面做视频、看内容、使用眼镜、获得搜索增强、购物体验和邮件处理。这一定会打败原来单个模型的会员模式。
过去从来没有一家公司的会员,可以把我的整个工作和生活都管理起来。这肯定是一种新的商业模式。
再小一点,比如 AI 视频相关的业务。我现在还没用到 Flow,Flow 还是用不了。我通过两三个渠道可以用到 Veo 3,但 Flow 用不了。
过去 AI 视频不太可控。如果 Flow 能把 Veo 3 变得相对可控,收入会非常可观。它就不只是 AI 视频爱好者的充值产品了。
可灵现在的盈利已经很强,快手也已经把它变成独立一级部门。如果 Flow 能够跟 Veo 3 结合,用户就不只是爱好者,还可能包括影视级创作者、营销人员、拍电影和拍剧的人,以及后期制作人员。
这个市场可能非常巨大。
庄明浩
我前天专门去了一家围绕可灵做生态的短剧公司聊。他们觉得,有了这些模型之后,以前没法拍的东西现在可以拍了。
比如可灵现在在推《灵蛇》和《山海经》。以前这些东西很难拍,但现在可以用 AI 去做。
我们当时还头脑风暴,中国还有哪些小说特别适合用 AI 开发,尤其适合做机甲等不是由真人拍摄的内容。
比如燕垒生的《天行健》,里面有蛇人、鼠人,还有很多过去没有被改编过的内容,非常适合用这些工具来开发。
但一问成本,还是扛不住。现在拍短剧,一部作品的成本可能也就是 200 万到 300 万元封顶。如果要拍 100 分钟,当前技术还不够,需要继续进步。
不过这个场景确实在拓宽。我们原来觉得可灵适合做玄幻,是因为它生成机甲等内容比较好。但 Veo 3 反而更适合做生活类内容。
它做机甲、科幻不一定最好,我用它做类似《流浪地球 3》的东西,效果有点变形。但它做一个富人在家做饭的生活场景,真实感非常强。
这会打开大家对应用场景的想象。我们本来就是根据模型能做什么,再去想应用场景。随着视频模型能力变强,可能会诞生更多场景。
朋克周讲AI
前两天我看到汉卿的 AI Talk 做的音乐短视频,已经不只是 MV 了。如果不仔细看,大概率完全可以以假乱真。
9. AI 眼镜重新成为入口
潘乱
这种多模态能力,跟谷歌重新推出 Google Glass 有关系吗?加上多模态能力之后,它可能会对未来的人机交互带来什么变化?
大家都认为可能会出现新的入口。因为苹果的隐私政策让 Meta 的股价一天跌了几千亿,小扎去寻找新入口,先找 VR;现在行业可能有一个小共识,就是 Glass,也就是眼镜。
谷歌会说,这件事我很熟,十几年前我就做过。今天加上 AI,再来一遍。再加上它最强的多模态能力,可能会有什么不一样?
挨踢牛魔王
当然有作用。
以前的 Google Glass,说白了是因为乔布斯重新发明了手机。谷歌虽然也做了 Android,但它非常羡慕手机这个入口,也希望做下一代手机平台。
很多人都在讲下一代计算平台。对谷歌来说,它想来想去,眼镜可能是比较合适的入口,所以做了 Google Glass。
但第一代 Google Glass 大家认为比较失败,缺点非常多,也不够实用。
有了 AI 之后就不一样了。当前 AI 有几个方面已经比较成熟:第一个是感知,比如多模态识别图片;第二个是听,也就是语音识别。
以前语音识别不够准确,现在即使你有口音,连续说很多话,AI 也能识别出来。它还具备知识和推理能力。
举个例子,假设我戴着眼镜,看到前方有一棵树。我想知道这是什么树,可以用手在前方点一下,就像操作手机一样。
它知道我想点的是前方那棵真实存在的树,然后立刻告诉我这是什么树,或者告诉我这朵花是什么。
现在已经有一些应用可以识别花,但你还要拿手机去扫描。如果通过眼镜直接看,就有点 AR 的感觉。
再比如开会的时候,你戴着眼镜,看到视频和现场情景,听到别人说话。它可以把整个会议过程整理成一份完整的会议纪要,你只需要看一眼,就能得到结果。
有了这种感知能力,Google Glass 可能会出现很多好的应用场景,甚至包括游戏。
本质上,AI 对手势和感官的理解已经接近人,甚至比人更准确。比如人脸识别其实属于上一代 AI 产品,但它已经比人厉害。
你可能见过很多人,碰到他却不知道他是谁。别人认识你,你却没认出来,别人提醒一句你才想起来,这种场景很尴尬。
如果眼镜里记录过这个人,它就可以马上识别出对方是谁,你就不会那么尴尬。
同样,很多 AI 硬件,比如手表、手环、摄像头、智能家居和 AI 玩具,过去做不到的事情,有了 AI 之后都可能做到。
我看过一个 AI 玩具创业者做的小狗玩具。它可以跟人对话,可以互动,可以走来走去,整个过程非常流畅。
以前做不到,是因为语音识别比较差,也没有足够的智能,互动会很呆板。所以 Google Glass 还是可以抢救一下的。
潘乱
我顺着这个问题再问一下。因为谷歌有最强的多模态模型,所以大概率 Google Glass 也会是最好的眼镜之一,可以这样推吗?
如果这样推,以后 Gemini 是第一梯队的模型,那 Pixel 会不会就是比 iPhone 更好的手机,甚至成为世界上最好的手机?可以这样推吗?
朋克周讲AI
我觉得眼镜有可能代替手机,但电脑可能有点难。
而且我觉得 AI 不只是拯救了谷歌的眼镜,还拯救了一批原来做 VR、AR 眼镜的厂商。很多厂商原来做得非常痛苦,有了 AI 之后立刻起死回生。
挨踢牛魔王
确实,实用性会非常强。
谷歌还演示了一个会议场景。比如我们有 4 位老师,潘老师讲中文,明浩老师讲英文,朋克周讲西班牙语,我讲印地语。
通过 AI,这个场景完全可以实现。谷歌已经做出来了,只不过产品还需要继续打磨。
以前即使实现了同声传译,也只是把内容翻译成文本。现在不一样,它可以在大家说话的时候,把其他语言全部翻译成你听得懂的中文,而且保留对方的音色和声纹。
你听到的还是这个人的声音,看到他的手势,感受到他的语气和情绪,但他说的是你的母语。
这个场景非常有效。不只是直播,国际会议也可以让每个人都讲自己的母语,最后每个人听到的都是自己的母语,效果完全不一样。
Transformer 最早就是从翻译场景发展出来的。看来翻译这个场景,在 AI 时代会逐步被彻底解决。
对于 AI 硬件来说,这种感知能力会让很多产品起死回生。以前大家觉得做不下去了,现在一下子翻身,甚至开始盈利,销量还很好。
我们如果不去做 AI 调研,可能会觉得 AI 很遥远,但实际上它已经在各种场景中发挥很大的作用。
10. 模型应用正面相撞
潘乱
下面进入下一部分,聊这次大会衍生出来的另一个问题:巨头和创业者,或者模型和应用的问题。
AI 重塑了互联网的搜索模式,今天这些 AI 创业者靠什么拼得过搜索巨头?当然,今天的谷歌已经不只是搜索巨头了。
之前很多 AI 创业者的共同选择是做浏览器插件。浏览器像一根电线杆,上面贴满了各种插件小广告,这是最流行的创业方向。
但这是不是也说明,AI 时代浏览器依然是入口?如果 Chrome 也把 AI 能力集成进去,其他人不就很尴尬吗?
庄明浩
第一,浏览器又成为兵家必争之地了。
Perplexity 在做浏览器,OpenAI 传说也想做。国内也不用说了,已经有好几家公司把浏览器做成了 AI 项目,原来的浏览器大厂也都在做。
浏览器这个古典互联网产品,摇身一变,成为 AI 最重要的场景之一。
还有一个很现实的问题:在美国,Chrome 最近面临一个非常麻烦的反垄断问题,到今天依然悬而未决。它可能会在某些程度上影响谷歌,但也不可能突然一锤子买卖,说今天必须拆掉,这个过程会拉很长。
浏览器这个战场又回到了一个不应该被忽视的位置。
国内也是一样。夸克做得这么好,原来腾讯浏览器看上去已经躺了,结果没过多久腾讯浏览器又跳出来说也要做,也要致敬一下。
你想想,腾讯浏览器团队在腾讯内部原来是什么优先级?今天它在内部的话语权、资源支持,肯定都变了,至少会提升。
之前大模型厂商更多集中在技术叙事,所以给了很多中小团队机会。如果执行够快,效果更好,体验做得不错,阶段性是可以获得不错收益的。
已经有很多中国团队得到了这种阶段性结果。但今天我们从技术趋势走向产品趋势,就会开始讨论一个没有结论的问题:到底是模型还是应用,还是模型即应用?
当这个问题被频繁讨论时,就说明大家越来越关注应用。这个空间确实会受到挤压。
但有一句话是:模型即应用,应用却不仅仅只有模型这一种。应用还有很多其他可能性。
最近有媒体的头条大概是“AI 互换产品经理”,大家期待用十几年前熟悉的产品和应用思维,去构建 AI 时代新的创业方向。
这个事情在 2025 年可能是期待,也可能是一厢情愿。
潘乱
好的产品经理不只是 AI 时代稀缺,过去的产品经理也很稀缺。
电商产品已经这么卷了,但很多产品真的很难用。比如我之前吐槽过搜索:在拼多多、美团、京东、淘宝这些交易型产品里,你搜索一个地址,它会给你展示卖地图册的商品。
你都搜索地址了,肯定是想修改自己的地址,或者看看自己使用的是什么地址。
我两年前吐槽过,后来各家陆续改过来了。上周我又搜了另外一个词:发票。
我搜发票,你应该知道我想要什么吧?我在一个电商产品里面搜发票,代表我想开发票。结果它给我出来一堆莫名其妙的商品页,开发票的入口特别难找。
我真的觉得,这不只是 AI 时代缺产品经理,过去的产品基本功也不太行。
以后用户问发票,系统可能会进行深度思考:他可能是想开发票,也可能是想买发票,但根据历史行为,他大概率是想开发票,然后直接跳出开发票界面。
朋克周讲AI
我觉得 AI 时代会提升用户体验。
我们之前用很多不好用的软件,有时候确实是产品经理能力问题,但很多时候是技术做不到。
假设一个界面有几百个参数,用户完全搞不定。后来我们把它简化成两个参数,看起来好用了。
但另外几百个参数并没有凭空消失,而是被做成默认值。系统默认这个参数是这样,那个参数是那样,最后用户只需要填两个参数。
这样虽然简化了界面,但在很多边缘场景里就会出现不准确,因为系统取的是平均值。
AI 不一样。它可以从你输入的文字,甚至你所在的场景里,自动推理出你真正需要的东西。
假设原来有 300 个参数,297 个被系统默认,只有 3 个让你填写,这当然比直接填 300 个参数好。但凡遇到那 297 个默认参数不适合的情况,用户体验就会出问题。
AI 可以把这些参数关联起来,推理出用户真正想要的东西。它可能知道内部怎么做,但用户用起来会觉得非常顺手:我只要说一句话,它就能识别我的意图。
很多软件未来会因此变得更好用。用户输入的一段话里可能有很多隐藏信息,AI 可以把这些信息都推理出来。
这可能会带来交互方式的革新,也是智能体和传统软件的区别:它可以推理出你的意图,以及整个链条,而不是让你填写几百个参数,或者简单地把几百个参数设成默认值。
潘乱
你刚才讲到智能体。前一段时间比较流行的是 Manus,大家自己做服务、做多个 Agent。
今天谷歌也提供了类似服务。在 Chrome 里面使用非常顺手、非常丝滑。Perplexity 之前讲的是 AI 搜索,现在很多搜索结果上面都覆盖了 AI。
我不知道它用的是什么模型,也没用过,但它确实已经覆盖上去了。
以前搜索引擎是一个连接器,是导航,是做分发的。现在它直接提供结果,把过程省略了,或者把过程也提供给你,直接把结果给到你。
原来的路径被缩短了,直接给你结果。这会给市场带来什么变化?
庄明浩
前段时间 MCP 很火,大家会讨论:模型、搜索引擎,或者其他服务,直接给出结果之后,用户会不会不再使用订酒店、订机票等产品?
用户可能直接让 Agent 给出结果。这就可能出现一种面向 MCP、面向 Agent 进行编程和开发应用的趋势。
从创业者角度看,AI 时代跟互联网时代非常不一样。
我们最开始其实也想做 App,但发现这条水太深了。稍微一不小心,就会被智能这条主线碾压,根本看不清哪些在智能主线之外,哪些在主线之内。
所以我们选择了一个相对取巧的方式,先做媒体。门槛没有应用那么高,但也不低,先在岸边看着大家前赴后继。
不过我们其实一直也想做应用。
对于创业者来说,这可能是文学里说的“最好的时代,也是最坏的时代”。
最好的是,现在开发应用的门槛真的非常低。我们今天在办公室搞了一个小型黑客马拉松,用 Gemini 和 YouWare 开发游戏、程序,两分钟就能做出来。
我开发了一个小卡牌游戏,真的能玩,我玩了五六局。
但另一个问题是,你又非常依赖大模型。如果没有模型,你的应用可能就变成了一个无法维持的东西。这可能是所有应用都会面临的问题。
最近有两个比较火的应用,也许会给大家新的思路。
一个叫“独响”,看起来有点奇怪,但说不定会成为未来人的一种心理状态。你可以在上面写朋友圈和日记,但里面没有真人,全是 Agent,它们会给你回复、评论。
这有没有可能成为未来的一种产品?你发一个朋友圈,AI 给你回复,你既分享了内容,也得到了回应,又不用遭受别人不认可或者反对。
另一个是 YouWare。过去 YouTube 是大家分享视频,未来 AI 把编程和开发应用的门槛降得这么低,大家可能会分享自己做出来的应用。
这也是一个非常有意思的方向。
挨踢牛魔王
刚才朋克周讲得很好,明浩也提到了。
现在对于大模型公司、传统公司和创业公司,都存在一个问题:如果谷歌这样的大厂去做大模型,创业公司怎么办?
我曾经讲过一句话:不要站在大模型前进的方向上。如果你站在它的前方,一定会被它碾碎。
为什么?因为大模型会吞噬一切。
以前有些公司做换装,用了很多工作流,搞得非常复杂,加班几个月做出了一个还可以的换装功能。结果新模型一出来,别人只需要一个模型、一个提示词,就能跟你做同样的换装。
那你前面买的设备、投入的资金、房租和水电费,全部都可能打水漂。
所以这是一个很危险的过程。
但我觉得可以换一个思路:一方面是大模型,另一方面是你的应用,也就是 Agent。应用和大模型结合,中间可能通过 MCP 这样的协议连接。
怎么判断你的应用会不会被模型吞掉?可以看你有没有找到这个行业的 know-how 和规律。
如果你找到这个行业的规律,最好还能直接用代码把它描述出来,那么大模型就不会轻易吞噬你。
比如爱因斯坦的质能方程,E=mc²。你找到一个公式,用代码写出来,大模型无论如何都很难达到同样的精确度,因为它本质上是一个万能逼近函数,只能逼近,很难完全精确。
如果你找到行业里的规律和关键诀窍,大模型就很难搞定。
第二个是成本问题。如果我在 CPU 上运行一套代码,把行业规律描述出来,或者代码和模型结合起来解决关键问题,那么成本会比大模型低很多。
绝大多数东西甚至全部跑在 CPU 上,CPU 成本比 GPU 低很多,甚至可以认为接近免费。你的云服务器跑代码,跟大模型用 GPU 的成本完全不一样。
即使大模型也能做,它的成本也可能打不过你;如果精确度又不如你,那它就没有意义。
这个世界上很多东西并没有完全消失。诺基亚手机也好,其他产品也好,在很多场景里仍然存在,唯一原因就是它便宜。
只要它便宜,就会一直存在下去。
潘乱
我们先不谈不利于创业者找方向的事情。因为有些方向还没有验证成功,不能直接告诉大家哪些在射程内、哪些不在射程内。
我们先把已经做得很好的热门赛道过一遍。
浏览器肯定在智能主线上,对吧?
庄明浩
肯定在。账户体系、同步、响应速度、安全和隐私,这些事情根本不是创业公司能染指的。
还有一个角度:2024 年的很多并购,其实是“掏空式并购”,不是真正意义上的并购。比如某些 AI 公司被收购,本质上是挖团队。
但今年 AI 领域的并购开始变得非常多,尤其过去几个月,出现了真正意义上的并购,需要花很多钱。
大模型厂商可能因为人力、资源和优先级问题,选择通过并购解决问题。这件事在 2025 年已经非常明显。
比如 Cognition 收购 Windsurf,之前还去问过 Cursor,因为它是 Cursor 的天使投资人,但 Cursor 不卖,人家已经有 100 亿美元估值了。
即便在主航道上,初创公司也可能有机会被收购。这非常现实。
2022 年底这一轮爆发到今天,已经过去 2 年多。在很多主航道赛道上,已经有独立公司做得不错,它们肯定有自己的价值。
当然,如果方向选错,可能过一段时间就走下坡路,这是很常见的。但如果在这个阶段选对了,也许还能继续往上飞。
潘乱
我看你发了几个例子。现在好像 10 亿美元已经不是一个多么刺激的数字了。
庄明浩
完全不是。
今天头部 AI 公司覆盖了很多方向。到底是不是主航道,其实没有标准答案,每个观察者、投资人和创业者都有自己的判断。
但凡成规模的 AI 公司,大家都会看 ARR。今天如果超过 1 亿美元 ARR,就可以算是一个不错的垂类公司。
一般在某个垂类赛道做到第一名的公司,可能会有 30 到 50 倍 ARR 的估值。这样一来,公司在一级市场可能已经是 30 亿到 50 亿美元估值。
它融一轮,出让 10% 的股份,就是几亿美元进去了。
Cursor 这一轮确定融资 9 亿美元,按 99 亿美元估值融资。Cursor 现在已经有 5 亿美元的 ARR 了,版本到今天才是 1.0,之前都是 0.x,未来还有太多事情要做。
这个战场已经变了。100 亿美元估值,真的太夸张了。
潘乱
其实我想说,现在真的没有任何东西可以确定不在智能主线上。AI 这几年一直在颠覆我们。
刚才牛魔王讲 know-how,我一直对 know-how 很感兴趣。我想,也许我不会被 AI 替代,因为我在自媒体或者其他领域有一点自己的 know-how。
但如果我的 know-how 被知识库产品吸纳,上传到里面,未来知识库产品也可以收费,我的东西可以卖给别人呢?
这些知识库产品壮大之后,上面会汇聚所有人的各种 know-how,会不会进一步生成行业模型?我觉得都有可能。
你真的很难预料,某个东西完全不在智能主线上。知识库产品和模型、Agent 结合,说不定会产生很多意想不到的东西。
我有一个朋友,之后可能要跟一个 AI 编程团队聊。他把所有 AI 编程创业者的访谈和相关素材,都放进 NotebookLM 里,一共有 56 个专访。
他把链接开放给我的时候,里面还做了很多笔记。你顺着那个兔子洞点进去,会发现里面的人都很懂这个行业。
100 个创业者把自己最真诚的梦想汇聚到一起,再从里面提问,这件事情非常有意思。
而且刚才明浩提到,早期真正做出推理模型的只有 R1 和 Kimi,但他们并没有拿到什么完整论文或文献。谁告诉他们这个 know-how 的?
他们只是根据 OpenAI 发布会里的一些蛛丝马迹,发现原来强化学习可以搞定推理模型。
你想想,这有多恐怖。他们只是发现了一根线头,就能照着 OpenAI 的 o1 去做推理模型。
所以未来有了这么多知识,再和大模型结合,真的什么都可能做出来。
AI 编程也可能很快给我做出一个像《小丑牌》这样的游戏。我玩了快一年,今天用 Gemini 两分钟就做出了一个能玩的版本。
未来可能真的没有什么是 AI 不能做的。也许最后只有手工拉面会成为稀缺品。我们看《银翼杀手》时,手工面条、真实的羊,可能会成为稀缺,其他一切都不再稀缺。
庄明浩
这好像又聊回了上次跟明浩老师聊的“智能平权”之后,人的差异是什么。
潘乱
这个问题一定会回到那些地方。
不过我们还是把热门赛道过一遍,这场就差不多可以结束了。
编程已经有非常确定的盈利,所以前面跑着巨头,大家还能接受。
视频生成呢?
庄明浩
视频生成绝对是大厂的事情,也是一将功成万骨枯。
潘乱
AI 视频呢?参与的创业公司还是很多。比如海螺,也就是 MiniMax 的视频模型,口碑也不错。PixVerse 最近在国内发布了国内版。
竞争还在打,但确实非常激烈,同一时间可能有六七家、七八家在竞争,其中一半可能是大厂。
庄明浩
提到 MiniMax,它的声音我觉得是最强的。
我一直很疑惑,现在国内外好像没有一个能真正打的,它的声音是最强的。可能因为声音这个领域我们也在做,所以关注得比较多。
商业化最强的是 ElevenLabs,它的 ARR 大概也有 1 亿美元;现在打榜最强的可能是 MiniMax。
我们做的过程中发现一个问题:我们不是一家专门在技术上特别强的公司,所以更多考虑产品化、应用和商业化落地。
但你会经常担心,声音这个领域在古典互联网时代已经被证明,可能不足以独立成为一个完整战场。
也许最后它会归属于某个更大的产品,因为视频会把声音包含进去。
潘乱
但刚才提到的录音设备,别人就是纯硬件和现金流,也能做出很大的生意。
所以这就回到一个问题:纯技术本身是一个维度,但落到产品化、商业化和收入获取方式上,是另外一种选择。
庄明浩
我们会使用各种模型,包括 MiniMax,因为它的声音效果最好。我们把模型能力封装成服务,卖给客户的是结果,而不是 token。
token 这个东西没法卖,因为大家都差不多。但我们可以针对细分场景,为某一类客户提供明确的交付结果,按结果收费。
我们肯定不是语音模型技术最强的公司,但希望能够探索更多场景,增长更快,收入更快起来。
其实美图就是一个很好的例子。它的模型不管图片还是视频,肯定不是最强的,但它现在能赚钱,而且是为数不多真正赚钱的公司,赚得还不错。
它可以直接交付给客户。它懂电商,也懂各种产品和场景,用户到它那里就觉得好用。
回到十几年前,在 App Store 里,个人开发者最喜欢做的应用之一就是相机和滤镜。因为用户付费习惯非常好。
模型本身可能不赚钱,但滤镜做得特别好,用户愿意付费。
潘乱
但也有变化。前两年聊声音赛道,可能会聊很多像 HeyGen 这样的产品。明浩,你现在还关注吗?
庄明浩
还在关注,只是没有以前那么猛了,但在细分板块里仍然可以做。
它现在也不只是声音,还做营销类视频,实际上是我们刚才讲的营销类视频生成,数字人、嘴型和语音结合在一起。
它打的是一个非常明确的商业化场景。只要客户越来越多,在细分品类里的品牌效应越来越强,收入越来越多,它大概率还会有一段不错的发展周期。
但你不会再期待它成为声音模型或者通用模型的最头部公司。它的故事已经收敛了,不是 Instagram 的故事,而是一个相机 App、一个美图的故事。
挨踢牛魔王
卖服务、做体验,这方面创业公司确实有优势。
模型训练需要算力、数据和算法,创业公司根本没办法跟大厂比。以前做互联网,一个人搭个 Apache、架个网站,就能提供互联网服务;现在算力太贵了。
所以创业公司应该往服务和体验上做,就像美图一样。它的图像模型肯定不是最强,但它可以做证件照、美颜等场景,用户黏性非常好。
美图这次也是 all in AI。它之前还有一些加密货币业务,后来都卖了,全部去做 AI,因为它认为 AI 对自身业务的促进非常大。
声音也是一样。训练声音模型的门槛,相比训练大语言模型低一些,但在大厂面前仍然不够看。大厂是航母,创业公司可能只是小艇。
但如果你把模型技术和对声音场景的理解结合起来,找到其中的 know-how,大厂就很难吃掉你。
因为你做的场景数据,大厂不一定有。对大厂来说,这些数据放进大模型里,可能只是边边角角,很难识别出来。
所以创业公司仍然有机会。
潘乱
听下来,模型能力其实已经有点过剩了。创业者不要再想着在模型本身上继续卷,而是要做好工具,把能力产品化,做服务交付,像谷歌今天做的一样,直接给你结果,把中间过程省略掉。
创业公司还是应该聚焦一个具体的问题。
挨踢牛魔王
对。
比如 Claude 4,Anthropic 也做模型,但它的评分并不总是最高。Claude 3.5、Claude 3.7 的评分有时也不是最高,但所有用它编程的人都知道,它的编程效果非常好。
评分高,说明数据和算力强。但为什么 Claude 的编程效果好?因为它的 CEO 对编程有自己的品味,对数据配比也做得非常合适。
这也是一条可以借鉴的路:如果你非常懂某个领域,就可以做到这样。
但如果有一天 AGI 真的到来,像 AlphaGo 一样通过强化学习把整个围棋领域彻底打穿,那就没有办法了,真的会吞噬一切。
庄明浩
所以这个问题延伸出来很有意思:当模型发展到这个阶段,连模型本身的评估都出现了问题。
新的 benchmark 一出来,所有模型都跟上了,benchmark 也就考不出来了。现在连红杉中国都要自己发布 benchmark。
传统意义上的 IQ、考试和各种评价方式,已经很难判断模型谁好谁坏。模型能力已经超出了原来的评估体系。
未来怎么评判这些模型,在这个时间点都出现了问题。
11. 创业者寻找新护城河
潘乱
反正这一部分聊的是大厂和创业公司。
创业公司可能更多需要做的是用好 API。它的门槛低,所谓人人都是开发者,就跟早些年人人都是自媒体一样。
其实也没有真的人人都是自媒体。门槛低,就意味着超级卷,但它也会开放更多机会,让更多玩家进入市场。
很多赛道会被重新定义。古人说三百六十行,行行出状元。今天医疗、健康,以及很多具体行业,都会被重新改造。
互联网最初也是从媒体开始改变,后来进入金融、二手车、汽车后市场、房产等行业。AI 可能也是由浅入深,大家还是要从自己的行业出发,多想想怎么结合。
庄明浩
中国创业者是一种情况,美国今年还有另外一个趋势。
既然大家都走到了 Agent 这一步,环顾四周会发现整个基础设施还差得很远,连协议层都存在很多空间。
我们现在构建的互联网生态是给人用的,从来没有考虑过给 AI 使用。AI 来了之后,要访问网站、调用数据库、走 API、SDK,这些东西都要重新设计。
AI 的身份怎么处理?数据库安全怎么做?权限怎么管理?支付怎么完成?
这些东西看起来都可以重新做一遍。所以最近一段时间,美国很多非常早期的初创公司,都在做服务 Agent 的基础设施。
这又引发了一个讨论:去年我们谈中美 TMT 主线的区别,中国在 To C 移动互联网侧很强,美国在 To B、SaaS 和云这边很强。
但今天这两条线可能要交汇了。
我们要理解和学习美国过去十几年积累的 To B 经验,包括交付结果、企业付费和订阅模式。反过来,美国公司也要开始研究和学习中国过去十几年积累的产品运营能力。
两边可能会找到一个合适的结合点,往前走。这可能就是 AI 时代正在发生的事情:交错、融合,再继续探索。
潘乱
朋克周,你做个总结,咱们今天差不多了。
朋克周讲AI
我的总结是,大家都不要焦虑,因为这件事情没有人遇到过。它一次又一次颠覆我们的传统。
前几年我们还在聊 scaling law,觉得预训练已经到头了。后来发现,预训练依然有很大空间。我们一次又一次被打脸,所以我觉得还是放松心态。
如果很多人焦虑,可以像我一样做自媒体,先不要下水。
我看到身边第一批做套壳,后来做数字人的人,我觉得这些机会最终都会免费。特别是在中国这么卷的情况下,最后很可能全部免费。
所以我们还在岸边观察,但也非常敬佩那些已经下水、去做各种应用的人。
潘乱
其实就是想告诉大家,不要焦虑。没有人知道明天会怎么样。
谷歌不知道,微软也不知道。奥特曼天天讲 AGI,但我觉得他应该也不知道。SSI 的创始人也天天讲 AGI,可能也有营销的成分。
挨踢牛魔王
AI 这一波发展确实非常快。
以前一家创业公司做一个应用,可能两三年后别人才能做出来。但现在模型一提升,可能直接把创业公司做的东西全部吞掉,所有努力都没了。
所以很多东西确实没人看得清楚。
但至少可以有一个原则:模型越强,你做的东西也应该越强,而不是模型一更新,你的产品就没了。至少可以用这个原则做判断。
另外,随着智能水平提升,需求还是会爆发。
蒸汽机发明之前,人类使用煤的数量并没有那么多。蒸汽机出现之后,不是因为全世界只需要几台蒸汽机,所以煤用得更少,而是因为很多地方都开始使用蒸汽机,煤的需求反而更多了。
智能也是一样。随着智能水平提升,过去很多我们觉得不值得改造、不值得做应用的地方,可能都会被重新覆盖。
以前用人编程序、做一个应用,成本太高,不划算。但未来这些细分市场、垂直市场和长尾市场,也可能被 AI 覆盖。
这对创业公司来说,可能也是一种机会。
潘乱
反正大家都可以积极尝试、积极参与。
现在国内很多 AI 还是免费的,为什么不用?不用真是白不用。
今天很多要素都没有变,但我一直有一个感受:如果你不熟练使用这些 AI 工具,必然会被那些更熟练使用 AI 的人剥削。
他们会在新的分配体系里占据更好的位置。我们暂时还没有看到特别多增量,更多还是重新分配。
庄明浩
我补两句,很短。
第一,我们回头看 OpenAI 定义的 L1 到 L5。今天所有人都在讨论 L3,但很多人没有注意 L4 和 L5 的定义:L4 是创新,L5 是组织。
无数经济学、商学教授都在讲,过去几次工业革命和技术革命,技术出现的当下,并不会立刻带来真正意义上的生产效率提升。
只有出现组织创新和商业模式创新之后,才会发生真正意义上的革命性变化。
我们似乎正在经历这件事情。我们这一代人可能是幸运的,能够亲身经历这种变化。
第二,我昨天接到一个任务。我女儿 5 岁,今年幼儿园在父亲节邀请几位爸爸去做演讲。我被分配到任务后,问他们想讲什么,我说给小朋友讲 AI。
但给幼儿园小朋友讲 AI,确实不太容易。后来我想到一个现在抖音上很流行的方式:用生成图片的方式,把孩子们未来想成为的职业做出来。
除此之外,我还想讲一个关键词,叫 lucky,也就是幸运。
英国科幻作家道格拉斯·亚当斯总结过 3 条定律,很多人都听过。
第一条,任何在我出生时就已经存在的技术,都是稀松平常、属于世界秩序的一部分。对我女儿来说,现在的 AI 可能就是这样的东西。
第二条,任何在我 15 岁到 35 岁之间诞生的科技,都会成为改变世界的革命性产物。他们未来可能还会经历一次这样的变化。
第三条,任何在我 35 岁之后诞生的科技,都是违反自然规律、应该遭天谴的东西。
当然,他写这 3 条定律的时候比较早。对我们这一代人来说,很多人已经超过 35 岁,但面对这次工业革命和技术革命,我们并没有觉得它违反自然规律、应该遭天谴,反而非常幸运地开始拥抱它。
我觉得这是一件很好的事情。
潘乱
这个总结非常有价值。
我们今天聊了两个小时,感谢各位。