泓君
1. Google I/O三年回顾:从Bard失误到Gemini 2.5 Pro的翻身仗
大家早上好,欢迎来到 Google I/O。每年 5 月,谷歌都会在山景城总部举办 Google I/O,这是一个面向开发者的活动。每年,谷歌都会在这个活动上集中发布一批新产品。
2. Google的模型全家桶:从广度到深度的融合
疫情之后,基本上每年我都会去 Google I/O。我们先来回顾一下前两年的情况:2023 年,谷歌正式向 ChatGPT 发起挑战。当时谷歌发布了一款聊天机器人,叫作 Bard。它被问到詹姆斯·韦布太空望远镜的新发现,结果 AI 在回答中出现错误,导致谷歌的市值一夜之间蒸发了超过 1,000 亿美元。
2024 年,就在谷歌开会的前一天,OpenAI 上线了 GPT-4o 模型,效果震惊世界。甚至有很多外媒尖锐地评论说,这是 OpenAI 故意在狙击谷歌。度过了失意的两年,回到今年,谷歌可以说是破釜沉舟,打了一场漂亮的翻身仗。
3. AI Mode大幅提升上下文理解能力,但灰度测试体验弱于Open AI
在这次大会上,模型端的 Gemini 2.5 全面霸榜。这一集,我们就来深度揭秘谷歌大模型 Gemini 背后的灵魂人物,以及谷歌推出的 AI Mode 到底能否应对大模型对搜索的冲击,华尔街又会如何看待谷歌在美股“七巨头”中的位置。
今天跟我在一起的嘉宾,是 CambioML 的联合创始人 Kimi Kong。Kimi,你好。
Kimi Kong
Hello,你好。
泓君
你之前也是在 DeepMind。要不要跟听众简单介绍一下你自己?
首先,非常感谢今天的邀请,让我可以来到《硅谷 101》播客。我也是《硅谷 101》的忠实听众。
4. AI Agent创业模型选择:没有最好,只有最适合
我现在是 CambioML 的联合创始人兼 CTO。CambioML 是一家 YC S23 的创业公司,主要产品是 AI Agent——Energent.ai。我们的 AI Agent 可以帮你思考和行动。
在创立 CambioML 之前,我在 Google DeepMind 待了将近两年的时间,主要负责几个不同的模块。一方面是通过强化学习,帮 Google 增加广告收入。我主要做了两个项目:一个是整个大语言模型的评测;另一个是我们帮 Google 做的第一个用 AI Agent 来优化广告投放和搜索结果的项目。
完成这两个项目之后,我就离开 Google 创办了这家公司。去 Google 之前,我在 Amazon Web Services 待了 4 年,主要主导了几个不同的 Amazon 微服务架构项目。再之前,我是 Stanford 双硕士,有机械和计算机两个学位。
跟我们在一起的嘉宾还有一位,是 Shaun Wei。他是 HeyRevia 的创始人,之前在谷歌负责语音助手。Shaun,你好。
Shaun Wei
Hello,大家好。我是 Shaun Wei。我们是一家 AI contact center,也就是人工智能呼叫中心公司,主要深耕美国的医疗行业 call center,针对患者和医生之间的沟通,完全用语音实现自动化。
泓君
今年你有没有看 Google I/O 的直播?在这样一场发布会中,让你印象最深刻的一点是什么?
Kimi Kong
我觉得 Google I/O 给我印象最深刻的是,Google 对于整个模型和产品横向广度、纵向深度的整合。
5. 让AI教AI,Gemini 2.5霸榜秘诀
从广度而言,它包含了现在多模态模型所需要的所有不同 modality,也就是模态。从 Gemini 2.5 Pro 多模态模型,到 Imagen 图片生成模型,再到 Veo 视频生成模型,相当于给你提供了一个模型全家桶,可以让你完成各种不同的任务。
从纵向而言,它不只是一个云端的搜索服务,同时也可以在可穿戴的 Android XR 设备上,展示 Google 未来在不同纵向深度里的野心。所以对我而言,这让我感受到 Google 对未来的全面布局。
泓君
Shaun 呢?
6. 视频模型加入声音:Veo 3真正实现Text-to-Movie
Shaun Wei
对我印象最深刻的是它的 text-to-video,也就是文生视频。
大家在这个方向上已经尝试了很多,无论是之前 OpenAI 的 Sora,还是文生图、文生音频等各种各样的尝试。其实大家都想达到的目标就是:能不能把我大脑里想象的东西,变成一个电影画面?
我觉得终于在 Google 这次发布会上,看到了真正意义上可以从一个想法变成视频的产品。另一个让我印象很深的,是因为我之前做了很久的 Google Assistant。大家一直都很希望有一个真正意义上的 AI 陪伴着你。你有任何问题,无论是视频、文字,还是多模态的各种方式,这个 AI 都能够帮助你。
以前 Google Assistant 没有实现这个愿景,但是现在 Gemini 终于实现了它十年前的愿景。这一点让我印象非常深刻。
泓君
你刚才提到了 text-to-video,指的是 Veo 3 模型的发布,对不对?
Shaun Wei
是的,是 Veo 3。
泓君
我看它这次发布不仅有视频画面,还有声音。从整个多模态的角度来讲,加入声音会是一个门槛比较高的事情吗?你觉得它的发布,跟当时 Sora 那几次文生视频模型的发布有什么区别?
我能感觉到,它是从文字变成了电影,真正意义上变成了电影。
Sora 当时发布的其实也只是视频画面。它把文字变成视频之后,还要跟 ElevenLabs 或者其他公司合作,在后期加入声音。但 Veo 3 在多模态理解上,比如你看它很多视频里的语音、背景音效,还有嘴型,都能够对得上。
我觉得这个难度非常高。它考验的是整个模型对上下文的理解,以及对物理世界规律的理解。大家还记得当时的“威尔·史密斯吃面条”,这才两年时间,就已经从威尔·史密斯吃面条,发展到了可以做出动作电影的状态。
所以,加入音效还是很关键的一点。
没错。
我自己也对今年的 Google I/O 印象很深,因为我觉得今年谷歌有一个特别大的优势:它们特别骄傲的就是 Gemini 2.5 这个模型。
在发布会这个时间点的你追我赶中,这一轮终于是 Google 最领先了。去年这个时候,其实是 Google 在发布会之前被 OpenAI 狙击了。OpenAI 把 GPT-4o 推了出来,所以当时可以说,谷歌的发布会被 OpenAI 抢了风头。
今年模型最强,应用推广又很广,多模态也有新的进展。包括今年让我印象特别深刻的,是 Google 把搜索——也就是整个商业模式的基石、搜索的入口——给改了,改成了 AI Mode。
大家有关注 Google 新推出的 AI Mode 吗?简单理解,我觉得它可能是把搜索入口跟大模型结合起来。相当于在传统的搜索框里面,进去之后,左边有一个标签栏,加入了 AI Mode 标签。
当你问它一个问题时,大模型可以给你非常精准的回答,甚至还可以继续追问。它后面还有一个跟 Agent 相关的 demo:你想买一件衣服,它可以帮你完成从搜索到一键下单的闭环。当然,这个 demo 我们之后可以详细讨论。
首先,我们来聊一聊 Google 搜索的变化。你们会如何看待谷歌在搜索框里加入 AI Mode?你们觉得它会怎样影响谷歌的生态和商业模式?
Kimi Kong
我先说一下 AI Mode。很巧合的是,在它发布会之前,我其实就尝试了一下 AI Mode。当时我还把 AI Mode 和 Perplexity、OpenAI 的搜索稍微对比了一下。
从效果来讲,AI Mode 相比之前的搜索,已经大幅提升了上下文理解能力。对于上下文的理解,以及搜索相关信息的能力,它已经非常强大了。
但是站在搜索效果的角度来看,我当时测试的时候,OpenAI 的搜索其实比 Google AI Mode 的效果更好。我不知道这次正式发布时有没有进一步改善。
当然,你刚才说到的 Google AI Mode,其实是在革自己的命。我觉得这是真的。因为 Google 搜索的广告收入是最稳定的收入,从 AI Mode 的角度来说,它会完全改变传统的广告模式和营收模式。
Pichai 也说过,这是这十年来搜索领域最大规模的一次变化。我相信,从用户进入搜索的前端界面,到最后提供结果的方案,Google 内部都做了非常大的提升。
泓君
你提到之前灰度测试过 AI Mode,可以讲一下当时测试的是什么场景吗?为什么你会觉得 OpenAI 的搜索功能比谷歌更好?
Kimi Kong
我当时想搜索一架正在天空中飞行的飞机,以及它具体的落地信息,因为它晚点了。
这不是一个传统的搜索场景。正常情况下,我会去查一个航班时刻表,但当时我不太确定那个航班的航班号,只知道它大概的方向,是从 A 点飞到 B 点。我就搜了这样一条信息。
我让 OpenAI、Google AI Mode 和 Perplexity 同时进行搜索。我的提示词大概是:我知道有一架飞机从 A 点飞到 B 点,大概在几点钟出发,你能告诉我这个航班的详细信息吗?它现在大概在哪里、在空中的哪个位置,有没有准点出发,会不会晚点?
最后,AI Mode 和 Perplexity 都输给了 OpenAI。
泓君
我非常好奇。是因为它们搜不出来这个结果,还是搜索出来的结果不准确?
它们都没有搜索出来这个结果。它们没办法告诉我当下正在天空中飞行的航班号,结果只有 OpenAI 给了我正确的结果。
有意思。Kimi,你怎么看 AI 搜索?
我觉得,搜索有可能真的是全世界最赚钱的生意,而且是所有人都垂涎欲滴的生意。
7. 手握人才、模型、流量三大优势,意愿才是AI搜索之战的关键
很久以前,Satya Nadella 说过,他最后悔的是当年 Microsoft 没有把搜索这件事情做成,因为搜索太赚钱了。
说回谁有能力把这件事情做成,我觉得 Google 有可能是所有科技公司里最有能力把 AI 搜索做好的公司。但是,就像 Shaun 刚才说的,它有多愿意革自己的命?
对于所谓的创新困境,我只能说,Google 现在是“半革”了自己的命。因为现在 Google 的 AI 其实还是有两个产品:一个叫 AI Mode in Google.com,另一个是 Gemini.Google.com。
但根本上来说,Gemini、DeepMind AI Lab 和搜索,在 Google 内部是两个完全不同的业务单位。怎么把公司的流量入口整合起来,让用户觉得这是一个更加原生的 AI 搜索,而不是一家公司推出的两个产品?我觉得这不是能力问题,而是 Google 的意愿问题,是它有多愿意深度革自己的命。
革了之后,怎么用 AI 搜索产生新的营业收入?原来定向广告可能只是在搜索结果里显示最前面的几个推荐位,现在怎么把广告更加有效地嵌入 AI 模型的结果里?我觉得这是 Google 必须思考的问题。
但我觉得,Google 从根本上是有能力做成这件事的,更多是一个意愿问题。
我们说到第二点,它为什么有能力做这件事?如果一个大模型想把一个任务做好,模型是一方面,用户指令是另一方面。我完全不担心谷歌模型理解用户指令的能力。
除此之外,更重要的是工具调用。毫无疑问,Google 每年拥有超过 90% 的搜索入口流量,所以它的搜索工具一定是所有公司里最强的。
基于最好的模型和世界上最好的搜索工具,我完全不担心 Google 把 AI 搜索做到天花板的能力。只是因为 AI 搜索还很新,Google 内部也在进行大量自用测试。它们自己其实有好几个版本的搜索系统,甚至还在评估到底哪种搜索方式最适配 AI 模型。
我觉得这考验的是 Google 的整合能力:第一,它有多少意愿去整合;第二,整合的时候不要像之前那样出现翻车的情况。
你提到工具调用,是指哪些工具?你应该浏览哪些网站,应该搜索哪些特定的网站?
Kimi Kong
根本上来说,原来的搜索是直接把结果给你。现在相当于大语言模型要通过 Google 搜索这个工具,把各种信息整合成一个更好的结果交给你。
所以我觉得,短期来看,我完全可以理解为什么 OpenAI 能把这件事情做得更好。OpenAI 做 AI 搜索,有可能已经比 Google 领先了一段时间,包括产品层面。之前 GPT 模型对于工具的调用能力,有可能在 Gemini 2.5 之前也领先于谷歌。
现在 Google 拥有最好的模型,也拥有最强的搜索引擎工具。我觉得这是 Google 可以开始打翻身仗的阶段,对它而言应该是顺风局了。只是要看 Google 愿不愿意把产品做更深度的整合。
我希望看到的是一个统一的产品。ChatGPT 不只是聊天工具,还是一个整合式入口,是它们所有流量的入口。Google 现在的流量是分散的,对用户而言,其实还是一件非常令人困惑的事情。我觉得这是 Google 在产品层面必须做出的战略决策。
泓君
接下来,我们可以把 Google 的 AI Mode 和搜索具体展开,放在一个场景里面讨论。
比如我现在脑子里第一个想到的,就是 Google 在 I/O 上做的一个演示:一位女性要买一件衣服,她先对衣服进行大概的描述。描述完之后,谷歌开始搜索,搜到一堆销售这类衣服的网站。
接下来,它可以帮你比价,看哪个网站在打折,然后给你一个最低价格。中间还有一个环节:她把自己的照片上传上去,说想虚拟试穿一下,看看这件衣服穿起来是什么效果。
我当时印象很深刻的是,她是一个微胖的女生,而模特是非常瘦的模特。最后现场生成的效果里,这件衣服穿在她身上,依然是一个微胖女生穿起来的效果,所以现场一度响起了欢呼声。
之后她觉得这件衣服穿起来不错,于是决定下单。Google 直接一键完成了闭环,使用的是 Google Pay 的页面,也就是 Google 钱包。
整体上来看,以前我要搜索一件衣服,要去各个网站上比价,最终还要在每个网站注册、输入用户名和密码、选择尺码,然后下单,这是一个非常漫长的流程。现在通过 Google 搜索的 AI Mode,我一键就可以下单。
你们觉得这样的场景对谷歌来说可行吗?
Shaun Wei
我知道很多做 Agent 的人,考虑的第一个问题是:我是不是要把所有电商网站的密码都输入给 Google?它是不是必须拥有这些密码,才能帮我完成下单?
我觉得这次发布中有几个点让我印象很深刻。第一个,是传统广告模式可能会发生变化。比如展示型广告,用户看到一次,广告主就付一次费用;也可能是点击广告,用户点击进去之后才收费。
对于新的模式,用户说“我要买一个东西”,上面的展示型广告可能还是有,点击广告可能也还是有。但用户继续往下转化时,Google 要怎么从中收费?我觉得这会很有意思。
我相信运行 AI Mode 和搜索是非常耗钱的。因为搜索本身对大家来说是免费的,但每次搜索,谷歌其实都要承担机器成本。现在如果 AI Mode 面向所有人开放,成本就会非常高,因为它的计算逻辑不是你搜索一个问题就结束了,而是要经过 GPU 和上下文理解。
这个成本会非常高。那它会不会羊毛出在羊身上,最后通过某种方式把这笔钱从用户身上收回来?我不知道。
第二个变化,是搜索模式本身发生了改变。传统搜索基本上是文字描述加一些图片搜索,但 AI Mode 会加入更加个性化的图片搜索,也会结合你的偏好。我觉得搜索质量会进一步提升。
第三个变化,是结果的丰富度。以前的结果会展示一个完整网页和很多链接,你慢慢点进去;或者它在上面给你一个面板。但现在,它可能直接在同一个页面里告诉你一个结果,你不会离开这个页面去其他网站。
这也会对 SEO,也就是搜索引擎优化,产生非常大的影响。SEO 本身就是一个非常大的业务。对卖衣服的人来说,怎么保证自己的商品出现在 Google 的搜索结果里,会成为一个非常大的问题。
最后,就像你刚才说的,一旦我对某个东西感兴趣,怎么持续跟踪它?怎么保证它的价格稳定,直到价格达到我的理想区间?Google 过去一直在做购物,但做得不是很成功,一直落后于 Amazon。我相信这次就是它的一种更新方案:如何把购物闭环直接在 Google 搜索里面完成。
泓君
Kimi 怎么想?
Kimi Kong
我觉得 Google 实现的最大野心,是想做成一个 AI 助手。对于这个 AI 助手而言,购物其实是一件非常有挑战性的事情。
很久以前,Anthropic 有一个非常有意思的采访。它提到,如果一件事情对人来说就非常有挑战,那么对模型来说其实也会非常有挑战。
把模型当作一个人来看待,对我而言,什么事情既有高价值又非常有挑战?比如我想订一趟旅行,不仅要订酒店,还要订机票。对于购物来说,我要浏览很多网站来对比价格。
但我在不同网站比价时,可能并不是要登录自己的账号和密码。更多时候,我只是想知道有哪些网站可用:可以去 Amazon,也可以去 H&M,或者其他网站。模型要通过不同渠道搜集信息、对比价格,然后给你一个结果。
这种长逻辑链、需要多步骤完成的过程,我觉得现在已经可以做得非常好了。在不久的将来,Google 除了购物以外,在很多需要长逻辑链的任务上,也可以做到同样的效果。
所以我们有可能只看到了冰山一角。它现在只是完成了购物这样的长逻辑链任务,未来还会有更多长逻辑任务,可以很快由 AI Mode 帮你完成。
泓君
我整体上理解,谷歌做这件事情,就是从买衣服、下单到完成支付,实际上是一个 Agent,对吧?
Shaun Wei
是的。刚才大家其实已经提到了一些核心问题。比如以前一次搜索消耗的服务器成本,相比现在完成整个购物闭环所消耗的 token 和服务器成本,要小很多。现在这个成本突然高了很多。
我们知道谷歌的商业模式依赖于搜索竞价排名,商家也要做 SEO。改成这种模式以后,它的商业模式会怎样改变?它靠什么赚钱?
我觉得商业模式方面,Google 已经给出了一个方案。你如果看过 Google I/O,就会发现它有各种订阅服务:有便宜的版本,也有 Ultra 服务,还有不同级别的订阅。根据你使用 AI 的方式,比如更高的智能程度、更强的定制化能力,用户需要订阅和付费。
就像我说的,羊毛出在羊身上。
另一个方式,我相信广告也会跟着新一代 AI 改变。如果你用过 OpenAI 的搜索,或者做过一些开源项目,就会发现 OpenAI 本身会给外部网站导入很多流量,也会产生专门从大语言模型导出去的流量。
所以我相信,Google 内部也在思考:现在我已经能够给你提供更加定制化的个人回复,那么从这里导出去的流量,是不是也应该收取更多服务费用?
泓君
是对商家收费吗?
对商家收费。用户可以订阅服务,商家也一样可以付费。
你不做传统广告,但如果你想在我的 AI 结果里排名,我还是会要求你支付一定的费用。
不过我觉得 AI 的收费会更难设计。以前搜索可以提供给大家 10 页、100 页,甚至 1,000 页的结果。你只要保证自己出现在第一页,或者第一页的前 3 个位置,就可以了。
但 AI 实际上会推给用户一个相对固定的结果。它的优势就是不让用户选择。
对。
如果你了解传统广告,比如保险类广告、旅游类广告,每次点击或转化的收费都非常高,有可能每一单就是几十美元。
如果最终只推给用户 1 到 2 个结果,商家要支付的费用可能会更高,因为完成购买的概率也非常高。
理解。而且以后它的排名可能直接是在大模型里面。
对。
Kimi,你认同吗?
Kimi Kong
我完全认同。我觉得这件事永远是开源节流,可以从两个不同的方式来看。
先说开源。Google 可以用什么方式进一步增加收入?它可能不再像传统意义上那样,只是通过竞价给你做一个排名列表,再展示不同价格的广告。
因为现在是多模态模型,而且它知道你所有的历史记录和上下文,所以它提供定向广告的质量可以比原来更好。它可能不用给你推 10 个,只给你推 3 个。
作为人,做选择本身也是一种乐趣。现在 AI 产品给人的情绪价值,在于让你进行一个 HILT,也就是 human-in-the-loop、人工干预的过程。如果真的把人完全抹去,用户也未必希望完全自动化地完成一件事情。
以前可能给你 100 个广告,现在只给你 3 个,然后在语言模型里说:“这里有 3 个选项,你来做选择。”这样每个广告的单价就可以更高。
这是一部分从广告商品角度来看。Google 现在本身运行着一个巨大的搜索集群,可能是 CPU 搜索集群。Google 刚开始的时候,这也曾经是一个非常大的成本。
但传统意义上的搜索,CPU 成本在过去 20 年里可能已经下降了 1,000 倍、1 万倍,甚至 1 亿倍,具体数字我也不清楚。即使 ChatGPT 只出现了两年,到现在整个 GPU 推理成本也已经下降了 95%。
我觉得在不远的将来,推理成本一定会继续按指数级下降。未来如果你可以让广告主支付广告成本,让用户支付订阅费,同时继续降低 GPU 或 TPU 成本,Google 做得好的话,就有可能发展出一套更好的商业模式。
泓君
我们接着看。假设 OpenAI 或者 Anthropic 也来做这件事情,因为我觉得这件事对搜索的冲击还是很大,搜索入口也是大家都想抢占的一个位置。你觉得谷歌的优势是什么?
Shaun Wei
我觉得谷歌最大的优势,还是它拥有海量的数据。
无论是它索引的网页,还是它的 YouTube 视频,它的触达能力都非常强,拥有足够丰富的内容资源。而且大部分人都会有邮箱,其他信息也会存在 Google 里,所以它对用户进行个性化定制的能力非常强大。
尤其是我自己使用 OpenAI 的时候,它现在主要的用户黏性来自工作方面的信息。但 Google 拥有你的个人信息,这是其他生态不具备的。
泓君
这个很好。我想到自己现在经常使用 Chrome 浏览器,很多数据也存在这个浏览器里。在浏览器里完成一个入口,可能在一些购买行为上会更加便捷。
Kimi Kong
我觉得有几点。
一方面是搜索这个产品本身。Google 这家公司的使命,是整合全球信息。它基本上拥有世界上最好的知识图谱。
我们每个人在使用 Google 的过程中都会留下数据。比如我们使用 Google 5 到 10 年,浏览过程中的各种信息都会被记录下来。它相当于把世界信息和我们的个人信息整合在一起。
Google 有世界上最好的模型,也有世界上最好的搜索引擎,所以它的起点已经非常高了。它一定有能力做出最棒的产品,只是要看它以什么形式把产品部署给用户。
Shaun Wei
我觉得还可以补充一点,就是 Google 还有很强大的分发能力。
它有 Android,有 Chrome,拥有的分发系统估计也只有苹果能够与之抗衡。所以它的分发能力比所有其他公司都强大。
泓君
我最近也跟很多人聊过,大家觉得这一轮其实还是巨头的机会。在大模型竞争的这一轮,创业公司可能还真的是小而美的机会。
我们刚刚聊了很久的搜索,接下来可以聊一下 Gemini 2.5 模型的更新。
在谷歌这次的发布中,Gemini 2.5 Pro 现在在各项数据评分中都是所有大模型里最好的。Kimi,可不可以跟大家分析一下,它是如何做到的?
Kimi Kong
我已经离开 DeepMind 快一年的时间了,所以我也不知道同事们在这一年里又做了什么新的创新。
但我觉得,大语言模型训练的基础大概有 3 个步骤:预训练,也就是 pre-training;SFT,也就是 supervised fine-tuning、监督微调;以及最后的 alignment,也就是对齐。RLHF,也就是基于人类反馈的强化学习,也属于这个阶段。
大概从去年的 NeurIPS 开始,大家都在说网络数据已经被抓取完了,就像化石燃料已经耗尽了一样。我觉得过去一年,大家花了更多精力在对齐上,也就是强化学习,尤其是人类反馈和 AI 反馈。
比如数学和代码任务,因为这些任务有明确的目标,你可以完全知道一件事情做成了还是没有做成。
Google 基于 Gemini 1、1.5 和 2 的积累,尤其是在基座模型训练方面,再加上它开始更多地强调强化学习,不只是人类反馈的强化学习,而是让 AI 自己批判 AI,把这件事情做成。
比如当年 AlphaGo 为什么可以成功?关键就在于它能够下出像“第 37 手”那样超越人类常规理解的决策,也就是超出我们所有人的认知:这一步棋居然可以这样下。
我觉得未来的 AI,尤其是在强化学习中,如果让模型自己去判断什么是对的,那么在 Gemini 2.5 中,它们应该引入了更多强化学习的概念和用法。这导致 Gemini 2.5 在今天所有具有高度确定性的任务,比如编程和数学任务中,出现了令人惊艳的结果。
泓君
我记得去年大模型训练有一个比较集中的趋势:最开始大家都是预训练,后来在预训练之外加入后训练。比如 OpenAI 的 o1 系列,以及 DeepSeek 的 R1,都是推理模型做得比较好。
Anthropic 其实有很长一段时间没有推出自己的推理模型,但是 Sonet 3.5 和 3.7 在代码能力上有质的提升,这也带动了一批编程类 Agent,比如 Cursor 和 Windsurf 迅速崛起。
我好奇的是,为什么 Anthropic 生成的代码质量比其他家更好?我看这一次 Google 也在强调自己生成代码的质量比较好。代码质量能力的提升,主要靠的是什么?
Kimi Kong
我可以快速给出几个观点,Shaun 可以随时打断我。
模型训练永远就是那几个步骤:预训练,后面的监督微调,以及对齐,尤其是基于人类反馈的强化学习。
先说预训练。预训练永远有一个数据配比:要放多少代码,多少自然语言,多少中文,多少英文。现在这件事还是一团乱,没有人知道最优配比是什么。
我觉得对于 Anthropic 这家公司而言,代码可能是它们的最高优先级。它们在预训练时放入了更多高质量的代码信息,因此模型的基座能力首先就变强了。但基座能力变强之后,其他能力肯定也会有相应的下降。
基座模型完成之后,还要做大量的对齐。对齐时,很多大公司做的其实是我们开玩笑称为 YOLO run 的事情。
比如今天 Shaun 在 Google 的一个团队,我在 Google 的另一个团队,您在 Google 的另一个团队。每个人这周都有很多创新,我们把大家做的东西都集中起来,然后发起一次 YOLO run。两周之后,把所有人的东西整合在一起,看看最后做出了什么。
这意味着在对齐阶段,每个团队其实有不同的优先级。可能这个团队非常注重代码,那个团队非常看重写作能力,就像一个组织问题。
对于 Anthropic 而言,也许编程就是最高优先级。大家觉得,编程可能才是解决推理模型的钥匙,所以它们在预训练和后训练过程中,尤其是基于人类反馈的强化学习中,都加入了更多编程训练。
而编程本身也是非常容易量化的:一件事情做成了,或者没做成。结果就是 Anthropic 在编程能力上的表现非常好。
但也正因为它编程能力强,所以在其他能力方面,可能会存在一些缺陷。我最近学到了一个很有意思的故事。
作为初创公司的创始人,我现在不只是每天写代码,还要做很多市场营销和销售工作,也要写很多文案。我通常会把 Gemini、ChatGPT、Claude、Perplexity 都打开,把同一个提示词输入进去,让它们完成同一件事情。
有时候 OpenAI 的创意性写作做得非常好,写出来的东西很有调性,让我非常愿意把这样的市场营销文案发出去。但让 Claude 写的时候,就有可能像是在跟一个无聊的码农讨论怎么做市场,整个事情会非常枯燥。
我觉得这就是策略问题。大语言模型的训练就是“输入垃圾,输出垃圾”。如果你输入大量高质量代码,输出的代码质量也会更高,这只是比例问题。
我认为 Anthropic 在这方面下了更多功夫,主要还是看团队把哪一块放成重点。
泓君
你觉得 DeepMind 之前的重点在哪里?
Kimi Kong
好问题。我觉得其实是非常综合的能力。
以前我们会说,我们想要编程、数学、推理和写作能力,所以会设定一个通用的评估指标体系,覆盖多个不同的评估维度。
但我知道,我们之前有一些非常不擅长的东西,比如写代码。正因为不擅长,所以大家后来花了更多努力在这件事情上。这一波相当于追上了 Anthropic 的编程能力。
泓君
推理能力呢?也是重视程度的问题吗,还是说在整个后训练过程中,需要一些特别的技巧?
Kimi Kong
我还在 Google 的时候,Google 其实还没有启动推理模型。我离开 Google 的时候,刚好是 o1 开始出现的时候,所以当时推理能力可能还不在 Google 的优先级上。
我觉得那时它们更多是在尝试赶上 OpenAI 的写作能力,以及解决问题的能力。
目前来看,更多还是数据配比的问题。它们会加入更多对齐,不只是对齐人类偏好。
OpenAI 最开始推出模型时,重点是得到人类偏好的结果,所以 Google 做的第一件事,就是追上 OpenAI 做出的人类偏好结果。但很多时候,人类偏好是非常有限的。
如果要做“人类偏好”,什么事情更容易做?编程可能比较容易,Anthropic 把这件事做成了。于是 Google 会说,我现在不只想追上人类偏好,我还想写出非常好的代码。
当非常好的代码能力做出来之后,OpenAI 又做了推理模型。于是我想做的模型,不只是做出人类想要的东西,不只是写出好的代码,而且应该有非常缜密的逻辑,让大家知道怎么解决问题。
当 Google 把这件事情做成之后,我觉得现在它开始引领这个潮流了。它已经拥有最强的东西,接下来就要想怎么继续引领潮流,让别人变成追赶者。
数学问题是 Grok 做得比较好。Grok 是马斯克成立的一家模型公司的产品,因为我看它的创始团队成员里有非常顶尖的数学家,他们也一直在解决世界上很难的数学问题。
我觉得我的数学能力可能达不到顶尖数学家的水平。这是一个“先有鸡还是先有蛋”的问题:你需要有人拥有这个能力,才能评测模型到底好不好。
作为软件工程师出身,我可以非常直观地评价模型的代码能力。但这里还有两个不同的问题:这个模型只是能写出可以投入生产的代码,还是它只是擅长编程?这是两回事。
我觉得 Dario 曾经有一个非常有意思的说法:他希望自己的编程模型不是只会解决 LeetCode 难题,因为 LeetCode 题目其实没有直接的商业价值。他希望编程模型能够写出高质量代码,让 Shaun 或者我们的初创企业可以直接把代码投入生产。
我觉得这是 Anthropic 非常专注的一件事。
说回数学和编程的问题,我觉得也分为两方面:有多少人需要深入解决高深的奥数问题?这可能是展示模型肌肉的能力。
但除了高深奥数题之外,怎样把数学能力接入初创企业,或者接入不同公司,让它们产生直接的商业价值?我觉得这是更多商业公司需要思考的问题。
泓君
你觉得你在 DeepMind 的时候,谁是它的灵魂人物?比如 Demis?我看 Sergey Brin 最近也回来了。他应该准确来说是 2023 年就回来了,只是最近才开始高调亮相。
你觉得谷歌的模型更多体现了谁的价值观?
Kimi Kong
Gemini 之前是 Jeff Dean 和 Oriol Vinyals 共同领导的模型。我觉得之前就是这两位 Google 的灵魂人物。
Jeff Dean 有可能真的是计算机科学界的活化石。大家经常开玩笑说,如果你把 Jeff Dean 简历上“做过什么事情”删掉,只写“没有做过什么事情”,可能会比写“做过什么事情”更短。
因为 Jeff Dean 做的事情太多了,所以我们只写“Jeff Dean 没有做过什么事情”,这样就可以在一页纸上写完他整个人生的成就。
Jeff Dean 非常擅长预训练,因为预训练涉及数据和集群的大量调度。Oriol Vinyals 原来是 AlphaGo、AlphaStar、AlphaZero 和 MuZero 的灵魂人物,来自 DeepMind 的一批人对强化学习有更深入的理解。
所以,基于 Google 最擅长的预训练,再加上 DeepMind 最擅长的强化学习和对齐,Google 就可以快速追赶上竞争对手。
同时,Google 收购 Character.AI,又重新赢回了 Noam Shazeer。我觉得这有可能是我最尊敬的人之一,因为他在自然语言处理上的深耕非常久,从 Attention Is All You Need,到后来的 Grouped-Query Attention。
再加上 Noam Shazeer 的回归,我觉得他们三个人形成了三足鼎立的局面。他们不是分别负责预训练和对齐,而是把这些能力整合成一个有机的迭代流程,让模型能力不断提升。
所以对我而言,这三个人都非常值得尊敬,也正是他们让 Google 在这一轮非常快速地追赶上了竞争对手:Jeff Dean 负责整个 Google 的基础设施能力,Oriol Vinyals 负责对齐能力,Noam Shazeer 则对自然语言处理有非常深入的认知。
泓君
听下来非常有意思。但你觉得 Demis 在中间的作用是什么?DeepMind 和 Google 原本训练模型的团队之间,关系是什么样的?
Kimi Kong
在原来 Google Brain 和 DeepMind 还没有合并的时候,我觉得它们完全是两种不同的思路。
DeepMind 的强化学习非常强大,这也是 Google 收购它的原因。Google 本身擅长瞬间调度大量资源,规模化进行预训练和监督微调。我觉得 Google 的预训练能力还是非常强的。
最后其实是一个强强联合的过程:Google 擅长的事情和 DeepMind 擅长的事情,进行了非常强的整合。
后来,我觉得 Demis 扮演的更多是领导和管理的角色。原来我作为 IC,也就是个人贡献者时,可能只要写代码,就可以完成每天的工作。但当你运营一家公司的时候,我逐渐意识到,工作不仅仅是把任务完成,更重要的是如何激励一群最聪明的人,让他们朝着共同的方向把一件事情完成。
我觉得这是非常难的一件事。因为极其聪明的人,每个人都有自己的想法,也非常不愿意听从他人。
Demis 扮演了一个非常好的角色,把刚整合起来的两家公司变成一个有机的整体,给大家一个共同目标——实现 AGI。然后所有人都朝着这个目标,把自己最擅长的能力拿出来,把这件事情做成。
泓君
有意思。所以 Jeff Dean 和 Demis 的关系是怎样的?
Jeff Dean 现在应该是首席科学家,Demis 应该是 CEO。
相当于 Jeff Dean 向 Demis 汇报?
Kimi Kong
好像 Jeff Dean 不向 Demis 汇报,至少我离开时是这样。我不知道现在内部是什么情况。至少我离开时,Demis 和 Jeff Dean 都直接向 Sundar Pichai 汇报。
泓君
那你觉得 Sergey Brin,作为 Google 的创始人之一,回来之后会带来什么变化?
首先,我已经不在里面了,应该说不是“我们”。
对。你在的时候,他应该刚好开始抓这件事情。
Kimi Kong
我觉得 Sergey Brin 给 Google 带来的,更多是一种 Founder Mode,也就是创始人状态。
他带回了一种 Founder Mode,让大家知道应该以什么样的投入和方式来完成这项工作。如果创始人都回来做这件事了,创始人每周待 60 个小时,你作为 Google 员工,难道好意思只工作 40 个小时就回家吗?
泓君
所以真的是每周 60 个小时?
有些团队是这样的。我知道一些朋友原来在图像生成团队,他们说 Sergey Brin 回来之后,看到 Meta 又出了一个新模型,就问:“我们的模型什么时候可以出来?”
大家一听就知道了:周末加班去吧。
我觉得更多时候,这是一种 Founder Mode,是对大家士气非常大的鼓舞。我好像说得有点多了,可以让 Shaun 来阐明一下。
Shaun,你怎么看 Gemini 2.5 Pro?
Shaun Wei
我觉得 Kimi 已经讲得很好了,该讲的都讲了,不能讲的我觉得也讲得差不多了。
所以我就从一个外部的角度来说。因为我也在 Google 工作过,大家都知道,Google 的人才密度非常高。之前大部分人都处在一种比较躺平的状态,因为广告太赚钱了,大部分团队不需要特别拼命地做事情。
但这一波 AI 起来之后,尤其是去年 OpenAI 抢了 Google 很多风头,再加上 Sergey 回来、进入 Founder Mode,我知道整个 Gemini 团队的士气都非常高涨。
大家其实都憋着一口气:如果 AGI 要有人做出来,那是不是应该由 Google 做出来?Google 有最大的计算能力,有最优秀的人才,还有几乎无限的资源,再加上 Sergey 也冲回来了。
所以站在外部角度来看,Gemini 这一波崛起可能只花了一年时间。大家从去年的 I/O 被抢风头,到今年 Gemini 2.5 直接霸榜,几乎所有项目都到了第一名。连 OpenAI 今年可能都没办法再抢走这个风头了。
接下来还有一个问题。大家现在看到的是 Gemini 模型做得很好,但我知道很早以前,在 OpenAI 和 Anthropic 的 API 价格还很高时,Gemini 的 token 价格已经降到了当时 OpenAI 价格的 1/5 到 1/10。
当然,最新数据有没有反向促使另外两家降价,我没有去看。但整体来说,在开发者社区里大家都知道,Gemini 的 API 接入成本和 token 成本很低。我很好奇,它的价格是怎么降下来的?
我自己看,可能主要有 3 个方面。
第一,Google 应该从十年前就开始大量投入 GPU,当然它们叫 TPU。我觉得它们当时就想得很清楚:如果 Google Cloud 发展起来,就不能不停地向 Nvidia 或 AMD 购买 GPU。
所以 Google 从十年前就开始深耕 TPU 生态。它自己的 TPU 迭代速度,尤其是这两年明显变快了,因为需求非常大。拥有自己的 TPU,就避免了很多 Nvidia 税,不用单独等 Nvidia 推出新 GPU,也不用和别人抢。
第二,Google 本身拥有很强的基础设施。大家都知道 Google 的 Infra 非常强,它已经拥有几乎无限的资源,所以只需要想清楚如何动态调度这些机器。Google 动态调度机器的能力,远强于 OpenAI 和 Anthropic。
OpenAI 和 Anthropic 还没有自己的数据中心。Grok 现在很强,建成了世界上最大的 GPU 集群,但大部分公司其实没有能力调度这么大的集群,仍然依赖 Amazon 或 Microsoft 的云服务。
第三,因为 Google 能够定制自己的硬件、调用更大的集群,所以在优化模型时,软件和硬件可以一体化,模型也能在自己的硬件上发挥更强的能力。另外,它自己还拥有完整的开发者生态。
泓君
Kimi,有补充吗?
Kimi Kong
首先,我非常同意 Shaun 所说的。Google 的基础设施能力确实非常强。
很久以前,SemiAnalysis 出过一份很有意思的报告,给不同的 GPU 云服务打分排名。排名靠前的是 CoWeave,因为我知道 OpenAI 使用 CoWeave 来做 GPU 调度。
我当时还跟我的联合创始人开了个玩笑:其实在它上面还有一个,最强的应该是 Google 内部。Google 内部的基础设施能力真的非常强。
我再多说一点。虽然我们觉得 API 已经很便宜了,但没有人知道 API 的成本价到底是多少。
唯一能看到的线索,是当年 DeepSeek 发布论文时提到的内容。那篇论文的名字我有点记不清了,但 DeepSeek 说,它大概有 80% 的溢价空间,也就是说成本价只有当前收费价格的 20% 左右。
你看 DeepSeek 的模型规模,它用的还是 GPU,所以可以反过来估算 OpenAI 的情况,它们的利润可能非常高。
对于 Google 而言,它不需要通过 API 赚钱,因为搜索已经足够养活它了。它可以只收一个很低的价格,保证收支平衡就可以做这件事情。
但不要反驳我,我不是说它一定就是以收支平衡的白菜价在卖。我只是说,它有足够的资本,可以把价格降到接近成本价的状态来做这件事。
泓君
理解。现在信息量已经超级大了。
大家现在也都在做 AI Agent 相关的创业。你们在创业时,底层肯定要选择一个模型来搭建产品,你们会怎样选择模型?
Shaun Wei
站在我的角度来说,没有最好的模型,只有最适合你的模型。
很多做 Agent 的公司,最后都会把任务拆分成很多不同的类型。无论是分析文字、分析文件,还是分析图片,你需要判断当前哪个模型最适合你的任务。那个模型就是最适合你的模型。
当然,我们自己也会关注一些指标。因为我们现在做很多跟打电话相关的事情,对我们最敏感的就是延迟和稳定性。
如果出现明显的延迟,对方在电话里可能会感觉到 1 到 2 秒的停顿,体验就会非常糟糕。所以我们选择模型时,也会平衡这些因素。
对于特别敏感、特别需要实时性的任务,我是不是应该自己搭建模型,甚至完全不用外部的闭源模型?
如果有些任务对时间没那么敏感,但比较在意成本,而且可能需要接近 512K 的上下文窗口,这时候我可能会选择 Gemini Flash 或者 Pro。对智能程度要求高,就用 Pro;因为它相对便宜,所以会比较适合。
如果需要更强大的模型,或者已经习惯了 OpenAI 的模型,我觉得 OpenAI 对提示词和指令的理解、执行能力还是很有用的。我的很多数据设置也是基于 OpenAI,所以可能还会继续使用一些 OpenAI 的产品。
另外,Claude 这些模型的 agentic,也就是代理化能力非常强。如果是纯粹的代理化工作流,就会选择这些模型。
所以站在我的角度,没有最好的模型,只有在当前场景里最合适的模型。还要看哪个模型延迟低,因为延迟和模型大小有关,模型越小,延迟通常越低。
另外还取决于并发量,也就是当下同时处理多少个请求,这也会影响延迟。
如果是正常的云服务提供商,Gemini 2.5 Flash 现在的延迟还不是特别低,但 2.0 Flash 非常快。OpenAI 现在为了解决延迟问题,除了 GPT-4.1,还有 GPT-4.1 mini 和 GPT-4.1 nano,它们也都很快,但智能程度相对没有那么强。
所以这本身就是一个平衡,要看当前任务需要什么样的延迟。
泓君
理解。看起来也是处在一个你追我赶的状态中。你们会根据模型发布随时切换底层模型,还是说会采用一个“鸡尾酒”架构,大家一起使用?
会的。对于做 Agent 的公司来说,我的一个体验是,你其实不会对任何模型有忠诚度。谁的模型又快、又好、又便宜,我们就用谁的模型。
Kimi?
Kimi Kong
我补充两点。
第一,我完全同意 Shaun 的观点,这取决于你在做什么事情。但我想补充的是,你需要的不是人为选择最好的模型,而是一种可以被量化的选择方式。
比如我们做代理化工作流时,会把现在所有的模型都跑一遍,看哪一个模型在我们想做的任务上效果最好,然后就选择那个模型。
第二,正因为现在是百家争鸣的状态,所以才有初创公司的机会。
排行榜的排名,我们看一看就可以了。它在综合排名上表现好,确实有它的原因,但也可能有一些水分,没人知道。我不是说 Google 的模型有水分。
比如之前 Llama 4 在 LMSYS 排行榜上排名非常好。LMSYS 是一个人类投票的排行榜,反映的是人类喜欢什么。Llama 4 为这个排行榜提交的是一个特别优化过的模型,它的任务就是做人类喜欢的事情,而不是把基座模型或者普通的 Llama 模型上传上去。
所以这个排行榜看一下就可以了,它会有一定水分。但我不是说 Google Gemini 2.5 Pro 有水分。
正因为排行榜更多时候只是一个替代指标,所以你需要自己做评测。自己评测之后,就会知道不同模型擅长不同的事情。
这才给了初创企业机会:把不同模型整合在一起,做一个高度复杂的任务系统,切入一个垂直但极具深度的市场。
泓君
所以你们也是根据自己的需求来选择?
对。我们内部有一套非常完善的评测机制,跟我当年在 DeepMind 的时候一样。
当年我评测的是 DeepMind 的一个模型,现在我们评测的可能不是一个模型,而是一个系统。这个系统里可能包含很多个模型。
这次谷歌发布的内容中,还有一个让我印象非常深刻的点,就是实时语言翻译。
8. AI产品设计:模型决定下限,工程决定上限
比如 Google Meet 会上线英语实时翻译成西班牙语的功能,Gemini 2.5 Flash 可以根据文本生成 20 多种语言的声音。因为我自己做播客,其实是这些产品的深度使用者。
我在考虑一个问题:比如我的中文播客,如果能实时生成英文,只要内容做得好,是不是也可以进入英文市场,让大家收听?
Kimi Kong
但我使用这些模型时发现,核心不只是生成声音。生成声音可能很简单,但要让语音非常自然、流畅,让用户听不出 AI 感,还是有门槛的。
比如 ElevenLabs 的英文模型做得很好,但中文模型生成两个字还行,生成一句话时,语音就会有很明显的外国人口音。
所以你们觉得,这一类产品考验的核心到底是模型能力,还是工程能力?
我觉得现在我们使用的很多产品,尤其是直接面向 C 端的产品,更多还是纯粹考验模型能力。
未来,Sam Altman 说 GPT-5 不是一个模型,而是一个系统。我觉得未来大家会引入更多系统的概念。但现在作为 C 端终端用户,我们最直接接触到的,还是模型能力。
为什么 Gemini 在这些方面的体验可能没有 ElevenLabs 好?就像我之前说的,一个模型有很多团队共同负责。
可能有 20 个团队:这个团队说要增强编程能力,那个团队说要增强创意性写作能力;另一个团队说要增强实时 API 能力,还有团队说要在实时能力里增加中文、英文和西班牙语能力。
作为一家大公司,你不可避免地要做整合。在整合过程中,自然会有一些取舍。比如它的延迟非常低,同时就可能在某些表现上落后。
而 ElevenLabs 只需要做好一件事,不用考虑各种数据配比,只要把最好的音频数据加入进去,把这件事做好就行了。
你想做的是一个更横向、更浅层的任务,还是一个更垂直、更深入的问题?这相当于区分了它是初创公司的机会,还是大公司的机会。
泓君
所以核心其实是看团队内部重视什么?
我觉得是看优先级。不是说什么不重要,而是要排优先级。
在 Google 内部,对于初创公司来说,优先级第一的事情,可能只是 Google 排在第 30 位的重要事情。当然,如果这件事不在 Google 的路线图上,而你把它做成了,也可能获得一个非常大的市场。
这不是我说的话,是 Sarah Guo 在她参与的一些播客里说过的一件事。
你觉得考验的核心是工程能力还是模型能力?
Kimi Kong
我觉得都有。没有直接的模型,也没有直接的工程。
如果只给用户一个模型,体验其实还是会非常差。我只能说,模型决定下限,工程决定上限。
Shaun,你是做语音产品的,正好可以聊一下。
Shaun Wei
语音产品其实很有意思。比如文字输出,最后看好坏,可能只是每个人的偏好和喜好。但语音类产品不一样,所有人都能听出这个东西到底好不好。
就像你说的,如果模型生成的中文不好,甚至不用听两句话,听两三个词,我就知道生成效果不好。这是所有人都会有的共同感受。
我最早接触过 OpenAI 的 Realtime API,它可以实时完成语音到语音的端到端处理。后来我看了 Google Meet 的 demo,有几个点给我印象非常深刻。
第一,因为它是实时翻译,所以要保证信息准确。它是同声传译,语速和语调也要保持一致,而不是所有声音听上去都像机器。
第二,要保证速度足够快。最糟糕的体验就是对方说完一句话,5 秒之后你才翻译完。为了只解决两三百毫秒的延迟,工程上也要解决很多问题。
最后,很多翻译内容都和上下文有关。这个上下文应该怎样处理?是不是要把全部内容都放进模型里,同时还要保证速度足够快?这一点我也不是很清楚,但这些都是实时同声传译必须解决的难点。
泓君
它后来也在 AI 眼镜上展示了这个功能。我当时的想法是:这得多耗电啊?
其实还好。从技术角度来说,无非是怎样实现这个功能。
传统做法是打开一个简单的 WebSocket,或者通过服务器端进行流式传输。你可以把它理解成不停地发送请求,只是发送频率稍微高一点,但其实不会特别耗电。
而且如果是控制硬件设备,音频码率也不需要特别高,所以数据量没有想象中那么大。
9. 巨头一更新,创业公司倒一批
我记得谷歌还展示了一个 demo,就是 Project Astra。它会帮用户修自行车,包括发现零件有问题时,还可以让大模型打电话。
你觉得以后越来越多 Agent 加入模型,或者大公司可以直接为用户打电话、提供一些服务,会对你们的商业模式产生冲击吗?
我们现在主要是医疗领域的 B2B 模式,并不会直接面向 C 端。
你说的这个场景,对于很多 ToC 公司确实会有非常大的影响。随着大公司的模型能力越来越强,它们首先要做的,就是面向 C 端,扩大用户可以使用的能力。
所以对于 C 端公司来说,确实会有很强的冲击。
你刚才说到打电话的场景。很多 AI Agent 打电话时,只需要调用一个工具就能完成。如果你的垂直领域工具很少,或者整个商业流程和逻辑很简单,那么确实有可能被大公司直接取代。
所以有一种说法是,谷歌 I/O 发布会一开,感觉创业公司又要倒一批。你还记得去年还是 OpenAI 一开发布会,创业公司就要倒一批。
确实是这样。就拿你刚才说的虚拟试衣服来说,应该知道有很多公司在过去一年都在做这件事。
Google 一旦把这个功能做出来,这些公司可能就没有机会了。Google 做了,Amazon 肯定也会做。最大的几个购物网站都拥有这个功能之后,小公司就没什么机会了。
所以 ToC 是一件非常难的事情。
很有意思。关于试衣服这个场景,昨天我在谷歌现场还跟阿里的人聊到过。他们其实一直在尝试这个场景,但他们对这个功能的评价是:让用户试衣服这个点不重要,Google 如果能先把尺码搞对,就已经很不错了。
可能尺码是一个比“虚拟看一下自己穿起来好不好看”更痛的需求。
对。所以我觉得,现在的演示是直接上传一张照片。我不知道你有没有看过,苹果手机或者带有激光雷达传感器的设备,可以对人的身体进行简单扫描。
你只要拿着手机,围着自己转一圈,它就可以大概建立你的 3D 模型,把你的高矮胖瘦一次性输入进去。
现在 Google 只给了一张照片,但我觉得它要做这件事情也非常容易。
综合来看,你会怎么看谷歌在大模型这一轮竞争中的优劣势和生态位?
Shaun Wei
我觉得 Google 的优势有几个方面。
第一个是它拥有自己的硬件生态,不依赖 NVIDIA 提供硬件,所以在底层就已经比大部分公司有优势。基本上没有多少公司能做这件事情。
第二,它拥有非常大的服务器集群。因为有 Google Cloud 和自己的数据中心,它拥有近乎无限的算力。能够独立建设数据中心的公司非常少。
再往下是模型层。它拥有大量数据来训练模型。我觉得随着大家越来越接近 AGI,训练方法之间的差距已经没有那么大了。谁能获得最高质量的数据,谁的优势就会非常大。Google 恰好拥有非常庞大的数据。
最后是算法层。Google 拥有非常强的算法团队。所以 Google 通过这一年的努力,做到现在模型排名第一,我觉得一点都不奇怪。
泓君
你刚才提到硬件生态、服务器集群、模型层和算法层。总结来说,Google 还是一家技术公司,它的技术非常厉害。
这一点我非常认同。但同时,大家对 Google 的质疑是:它的产品基因不够强。
我们来看 Google 的明星产品,很多产品其实做得很好,但并没有一直维持运转下去。你会怎样看待 Google 把这些技术变成一个有穿透力的强产品?它在产品上的布局是怎样的?
我觉得 Google 的产品一直是它的弱项,它自己也很难做出特别好的产品。
所以我觉得 Google 这一波要做的,是围绕 Gemini 这个非常强的模型打造自己的生态。
你看它从 Gemini 手机应用,到 XR 眼镜,它不是只发布一个产品,而是一次性发布了可能 10 到 20 个产品。
我觉得站在 Google 的角度,它其实也不确定哪个产品能真正跑出来。你如果关注过 Google NotebookLM,就会知道,它原本也是一个非常小的项目。突然火了之后,Google 才开始向里面投入资源。
所以我觉得 Google 现在的趋势是:它不确定哪个产品会赢,但先把所有产品都摆到合适的位置。一旦发现哪个产品真正可能起飞,就开始不断往里面投入资源。
这就是我觉得 Google 现在在做的事情。
你现在还会用 NotebookLM 吗?NotebookLM 最开始是把所有研究资料输入进去,然后给你非常好的总结,可以按照几种模板来总结,同时你还可以根据总结去查看它引用的是哪一部分。
但它最厉害的是,产品经理在上面加了一个一键生成音频的功能。它一下就在整个播客圈火了:几十页的长文本,甚至一本书,都可以快速变成一个十分钟的播客,用音频总结出来。
我觉得这个产品刚发布时非常火,但现在声量小了很多。我不知道你现在还有没有持续使用和关注。
我获取信息的主要途径,后来大部分都是播客。这也是我做这件事的主要原因,所以我觉得播客会变成非常常见的信息获取渠道。
NotebookLM 非常聪明的一点是,任何信息放进去之后,它都能变成一种我可以接受的模式,变成一个属于我的个人播客。
我用过几次之后,如果以后要听,我会选择一些内容。因为现在长播客确实很多,我会挑几个自己想听的。
你会直接听长播客,还是先把长播客总结一下,然后把它变成短播客来听?
我其实也试过把自己的节目放进去,让它总结成一个短播客。我觉得它总结得还不错,但目前只能做英文版。
我自己会听两三个小时的长播客,因为我觉得那些播客可以让我不遗漏任何细节。只要是我想知道的知识点,听一遍播客就可以从头到尾覆盖到,而不会丢失中间的细节。