[BidClub_]
屠龙之术 · · 103 min

Vol.65 AI新时代,Google又行了?

庄明浩朋克周讲AI挨踢牛魔王潘乱

Podcast
TL;DR
  • Google 已重新站上 AI 第一梯队;本届 I/O 的关键不是某次榜单反超,而是它终于开始用 AI 重做搜索、Chrome、Gmail、Android 等既有业务。 节目对“真正拐点”仍有不同判断:庄明浩强调组织合并,挨踢牛魔王则强调 Gemini 2.0 的抢发;但本届大会显示,模型、产品与生态分发开始形成闭环,缓解了市场对 Google“技术强、应用掉链子”的长期折价。
  • Veo 3 把 AI 视频的行业标准从“画面生成”推进到音画原生同生,暂时领先可灵“半步”。 朋克周甚至把袋鼠叼机票登机的视频当成真人整活;按其测算,经 API 生成约需人民币 100 元一条,尚未普及,却已经能同时处理对白、环境音、眼神和场景匹配。“我这样看了两三年 AI 资讯的老韭菜,居然都没有发现它是 AI 生成的。”
  • Gemini 2.5 Pro 是整套 Google AI 产品的底座,写作、编码和推理都很强;Gemini Diffusion 则展示了每秒约 1,400—2,000 token 的低延迟方向。 挨踢牛魔王认为后者当前实用性仍弱,但若搜索和交互能从逐字输出变成“秒出”,产品边界会被重写;朋克周实测更新后的 2.5,两分钟即可生成一款 UI 完整、能连续玩多局的小游戏。
  • Google 最具投资含义的动作,是主动侵蚀搜索这台印钞机,而不是另做一个隔离的 AI 特价版。 节目以 Bing 为参照:全球搜索份额约 3% 时仍能贡献约 120 亿美元年收入,因此 Google 哪怕丢掉一两个点都不是小事。如今它在美国核心搜索中上线 AI Mode,兑现的是“我自己革,也不能让别人革”。
  • DeepSeek 与 Kimi 对推理训练路径的探索,令 OpenAI 原本可能维持一两年的 O 系列优势快速扩散,并间接抬高了 Google 等全行业的能力曲线。 庄明浩把 2025 年的进展概括成“连续踢两脚”:Q1 推理成为标配,Q2 又发现 pre-training 仍有空间,再叠加 post-training 和强化学习。市场因此期待基于 V3 的 R1-0528 之后,V4 与 R2 可能连续“各抬一脚”,但这仍是推演与期待。
  • 创业公司的安全区不是某个永远不会被模型覆盖的功能,而是模型越强、交付越好,且拥有可编码的行业 know-how、场景数据或显著成本优势。 挨踢牛魔王警告“不要站在大模型前进的前方”,因为一次升级就可能吞掉数月工作;庄明浩的补充是:“模型即应用,但应用不仅仅只有模型这一种。”美图、HeyGen 和垂直语音服务的共同路径,是卖具体结果而非通用 token。
  • 2025 年的主战场已从单纯拼模型转向 Agent、coding、多模态、浏览器和 AI 硬件,同时资本门槛正在急剧上升。 节目引用的市场口径是:垂类公司做到 1 亿美元 ARR 后可能获得 30—50 倍估值,Cursor 更传出约 5 亿美元 ARR、以 99 亿美元估值融资 9 亿美元。真正的长期变量则落在 OpenAI 所定义的 L4“创新”和 L5“组织”——技术只有与组织及商业模式重构结合,才会转化为生产率。
Digest · the substance, structured for research

1. Google 的回归首先是从“业界笑柄”恢复为确定的一线选手

  • 潘乱先把伤疤摆全:Bard 首秀答错常识问题,市值一夜蒸发约 7,000 亿;后续 demo 被质疑剪辑造假,生成内容又卷入种族偏差、毒蘑菇等争议。“反正过去这两年就是黑料频出。”

  • 更戏剧化的一幕是,Google 原计划展示能看、能听、能实时对话的 Project O,OpenAI 却在前一天发布 GPT-4o。再叠加 New Bing、Perplexity 和 Dia 等挑战者,“大象不能转身、英雄迟暮、大公司病”的叙事遂压在 Google 身上。

  • 本届 I/O 后,嘉宾并未断言 Google 已全面反超,但共识非常明确:“反超另说”,它已经不可能再被排除在全球第一梯队之外。自研 TPU、Gemini 2.5 Pro、Veo 3、搜索、Chrome 和眼镜形成了全栈展示。

2. Veo 3 已把“真假难辨”从营销口号变成现实风险

  • 朋克周印象最深的是一段女士带袋鼠登机的视频:袋鼠嘴里还叼着机票,他转给女友时以为是外国人的搞笑整活;女友提醒“你看它的手”,他才意识到可能是 AI。“我一下就愣住了。”

  • 这个误判的信号不只在画面质量,而在整段视频的原生感:场景声音、人声、眼神和动作都能连起来,AI 味已经很少。朋克周判断,不论老人、小孩还是专业人士,都可能难以稳定分辨,足以“造成一定程度的混乱”。

  • 成本仍是硬约束:按他们的试算,经 API 生成约人民币 100 元一条,离大规模低成本生产尚远。挨踢牛魔王因此认为,Veo 3 目前可能领先可灵“半步”,而非竞争已经结束。

3. 音画同生重置了所有视频模型的及格线

  • 庄明浩认为,Veo 3 解决了此前最核心的断裂:视频模型只出画面,声音还要另行生成、配音和对齐。它让“视频是视频、语音是语音”变成同时生成,往后所有竞品都要接受新的标准尺。

  • 挨踢牛魔王把技术路径概括为 DeepMind 长期研究的 V2A:先提取视频中的场景信息,再通过 diffusion 生成匹配的声音。森林、雨声、对白与动作不再完全依赖后期分别制作,而可能在生成时就彼此匹配。

  • 对制作端,这意味着节省的不只是配音费。过去一个镜头可能要“抽卡”几百次,再从中挑选、剪辑和配音;原生音画让小公司或独立导演有机会交付过去必须依赖昂贵设备和团队的专业片段。

4. Gemini 2.5 Pro 才是整套发布的基础资产

  • 挨踢牛魔王把 Gemini 2.5 Pro 选为最强发布:写作、编码、推理三个维度都很强,6 月 5 日发布的版本打榜已冲到最高分。Veo 3 更惊艳,但 Gemini 才是搜索、Agent 和各类应用共同依赖的底座。

  • 朋克周给出的体验证据比榜单更直观:用当天更新的 2.5 编程,两分钟生成一款 UI 不错、确实能玩的小游戏,团队甚至连续玩了近半小时。这让 I/O 不再只是研究能力展示,而开始触及可用产品的生产速度。

  • 庄明浩同时提醒,Google 的模型成绩其实从 2024 年起便逐步追上头部;此前市场不买账,是因为技术进展尚未转化成主产品体验。本届 I/O 的变化,是模型分数与产品落地终于同时出现。

5. Gemini Diffusion 押注的是“等待时间消失”的交互范式

  • 挨踢牛魔王认为 Gemini Diffusion 是技术上最有新意、但当前实用性未必最强的尝试。它把常用于图片的去噪思路带入语言生成,像先铺草稿、再整体细化,而非传统自回归模型逐 token 往后写。

  • 节目给出的速度约为每秒 1,400—2,000 token,接近“秒出”。真正的产品价值不在跑分,而在搜索、编程和实时互动不必再像打字一样缓慢展开,用户点击后即可获得接近即时的完整响应。

  • 这也被视为 Google 创新能力回归的信号:即使产品化还早,它至少重新愿意探索不同于主流自回归路线的模型形态,而非只把旧技术拼凑成仓促应战的 Bard。

6. Google 选择用生态打单品,而不是再造一套孤立产品

  • 朋克周概括得最锋利:“用我的生态去打你的单品,用我的会员去打你的模型。”ChatGPT、Claude 仍主要是独立对话产品,Google 却能把 AI 嵌进 Gmail、Android、Chrome、云、搜索和 YouTube 的既有用户网络。

  • 一个最小工作流已经说明差异:先用 Gemini 生成提示词,再用 Veo 3 出视频,由 Flow 剪辑,最后一键发到 YouTube。用户不必在多个 AI 产品间搬运素材,生态本身就成为体验与分发优势。

  • 这并不意味着每项整合都立即好用。朋克周直言,Gmail 里的 AI 有时“改起来比自己写还慢”;Google 产品又多到令人眩晕,Flow 当时也尚无法正常体验。优势是链路完整,不是每个节点都已打磨完成。

  • 潘乱用“88VIP”形容其商业模式,嘉宾补了一句“量大管饱”。未来用户购买的可能不再是单一模型会员,而是一位覆盖工作、内容、购物与生活的生态助理,只是目前价格仍偏贵。

7. 搜索 AI 化是一次真实的自我侵蚀

  • 潘乱给出的经济尺度是:AI 出现前,Google 在全球搜索市场至少约占八成;微软 Bing 只有约 3% 份额,也能做到约 120 亿美元年收入。对 Google 而言,丢掉一两个点都足以形成巨大生意。

  • 这正是过去两年二级市场的核心疑问:不跟进 AI,Perplexity 等会抢份额;跟进,则回答成本上升、广告点击路径缩短,最肥厚的利润池可能被自己侵蚀。搜索广告甚至被挨踢牛魔王估为 Google 约 80%—90% 业务来源,因而内部既得利益更难绕开。

  • 本届 I/O 的关键信号,是 Google 敢在美国搜索中上线 AI Mode,把 AI 放进最核心的搜索框。挨踢牛魔王的概括是:“我自己革,也不能让别人革。”

8. 搜索正从信息连接器变成结果交付者

  • 潘乱追问的变化不只是界面:传统搜索负责导航、连接和流量分发,如今 AI 直接给出答案,未来还可能完成选品、订酒店、订机票等操作,中间的网站与 App 是否仍能获得同样的访问和商业价值,已成为开放问题。

  • MCP 曾引发类似想象:应用或许要从“给人浏览”变成“给 Agent 调用”,开发者开始面向模型提供结构化服务。对创业公司而言,价值可能从争夺用户页面停留,转向成为答案或行动链路中的可靠执行节点。

  • 对 Google 来说,AI Mode 的意义也不只是防守 Perplexity。它把搜索、模型、广告与购物的关系重新摆上桌面,说明公司愿意用 AI 重做核心业务,而不是像“特价版”那样隔离创新、保护旧峰值。

9. 真正的转折点发生在组织合并,而非某个爆款 demo

  • 庄明浩把拐点放在 2023 年四五月前后:Google Brain、DeepMind 及其他 AI 团队被整合,由 Demis Hassabis 团队主导。Brain 擅长 Transformer、TensorFlow 和论文研究,但在他的评价里是“写论文可以,做产品应用不太行”。

  • DeepMind 长期积累多模态与 diffusion,整合后又得到原 Brain 团队在神经网络优化等方面的支持。本届 I/O 展示的并非临时赶工,而是部门墙打通后,技术、产品和生态逐步汇合的阶段性结果。

  • 挨踢牛魔王还提到,半退休状态的 Sergey Brin 回到公司写代码,并号召团队每周至少工作 60 小时。他认为这对整个团队士气的鼓舞很大。

10. Gemini 2.0 Flash 已提前暴露了反攻迹象

  • 挨踢牛魔王把更早的产品转折点放在 Gemini 2.0 Flash:它已能编辑图片、改变人物风格和服装,并把人物与商品组合。Google 居然能在图像编辑领域抢先发布,说明研发节奏已不同于 Bard 时期。

  • OpenAI 随后以 GPT-4o 图像模型更强的效果盖过风头,Google 看上去又“很丢脸”;但牛魔王认为局势恰恰从这里开始扭转——它第一次重新具备了抢发能力,而不只是等竞品定义方向后跟随。

  • 到这届 I/O,OpenAI 同期主要拿出 Codex,已不像过去那样能完全压住 Google 的发布。节目没有据此判定胜负,却把它视为双方从“单方面截胡”转向同级竞争的信号。

11. DeepSeek 与 Kimi 把推理模型的护城河迅速摊平

  • 挨踢牛魔王用“读书与做题”解释路径:pre-training 像读完大量书,强化学习则像做题,训练模型在具体任务上形成推理。OpenAI 的 O 系列本被认为可能挡住同行一到两年。

  • 他的判断是,Kimi 与 DeepSeek 两个中国团队独立找到了纯强化学习方向,没有落入蒙特卡洛树路线。Kimi 未开源,外界关注较少;DeepSeek 则公开论文和训练细节,因而把影响放大到全球。

  • 牛魔王把 OpenAI 对蒙特卡洛树的公开讨论理解为一种误导,这是他的推断,不是节目提供的内部证据。核心事实链仍是:两个团队从公开蛛丝马迹找到了不同路径,DeepSeek 的开放让其他厂商更快复现和改进。

12. 模型进步已变成 pre-training 与 post-training 的双踏板

  • 庄明浩以 OpenAI 的 L1—L5 框架梳理节奏:L1 是 Chatbot,L2 是推理,L3 是 Agent。自 2024 年 9 月 o1 出现后,到 2025 年 Q1,全球头部模型厂商的主要任务都是复现推理能力。

  • 行业一度接受“pre-training 天花板已到”的判断,转向 post-training 与强化学习;到了 2025 年 Q2,又发现 pre-training 仍有空间。庄明浩称其为“踢运动”:前训练抬一脚,后训练再抬一脚,能力交替上行。

  • 市场对 DeepSeek R2 的乐观也来自这条逻辑:R1-0528 仍基于 V3,若未来 V4 先提升基础模型,再在其上训练 R2,就可能连续跃升两次。庄明浩强调的是推演与期待,并非确定发布时间或结果。

  • 挨踢牛魔王因此认为 DeepSeek 对 Google 本届进展也“有一定贡献”:开放方法令整个业界少走弯路,Google 又拥有搜索、YouTube 等数据资产。但这是基于行业扩散作出的推断,不是双方直接合作。

13. NotebookLM 证明 Google 也能做出带传播力的产品洞察

  • NotebookLM 出圈并非因为知识库问答本身独一无二,而是它把枯燥论文或材料转换成自然的男女对话播客。用户还能中途插话说“这点我听不懂”,让主持角色停下来重新解释,形成被陪伴着学习的感觉。

  • 朋克周指出,如今扣子空间等产品也能把主题或文章做成播客,语音模型的语调、对话感也在快速进步。但 NotebookLM 最先把能力封装成一个可理解、可传播的明确功能,这对历史上“技术强、产品弱”的 Google 尤其难得。

  • 潘乱举了一个知识聚合的例子:朋友把 56 个 AI 编程创业者专访放入 NotebookLM,再开放笔记与问答链接;顺着材料不断追问,像钻进“兔子洞”,迅速获得接近业内人士的上下文。

14. 2025 年的主线已经从模型展示转向 Agent 与产品化

  • 庄明浩的版图是:Agent 为绝对主战场,coding 与多模态是副主线,硬件、社交属于更小的探索。阶段性看,To C 娱乐与社交的成绩“不太理想”。

  • 潘乱给出的商业化分类更直接:代码是目前最明确验证赚钱的赛道,AIGC 是参与者最集中的旧主线,Agent 是当下创业公司最拥挤的方向,商品营销与 Try On 则借模型成熟重新升温。

  • 朋克周观察到,身边不少公司已经放弃训练自己的大语言、语音甚至其他基础模型,转向应用和硬件。模型层越来越像少数大公司的资本密集型战场,产品体验则在 2025 年明显上升为独立变量。

15. AI coding 已成为巨头不敢缺席的底层入口

  • 朋克周认为,大厂没有浏览器入口尚可承受,没有自己的编程能力则更严重,因为代码是互联网与软件的底层。字节推进 Trae 后,阿里也强化通义灵码及 IDE 产品,竞争不再只是卖模型 API。

  • Agent 创业公司的脆弱性可从牛魔王提到的一则传闻看出:在 OpenAI 可能收购某公司的说法背景下,一个依赖 Claude API 的编程工具曾面临被断供的尴尬。节目没有确认这则传闻的全部细节,但它说明单一模型依赖足以改变一家应用公司的命运。

  • 朋克周判断,除非像 Manus 那样已经建立市场认知,或在设计、影视等垂类建立品牌,普通 Agent 能力最终很可能被基础模型覆盖。战略合作与分发因此不亚于功能本身。

  • 另一面是开发门槛断崖式下降:团队用 Gemini 和 YouWare 做小型黑客马拉松,两分钟即可生成能玩的程序。“最好时代”在于人人都能做,“最坏时代”则是所有人都依赖同一批模型,复制与竞争同样加速。

16. 商业化按“算力—模型—应用”逐层下沉,时机比想象力更重要

  • 挨踢牛魔王把赚钱顺序描述为一波一波:先是 NVIDIA 等卖卡者,再是按 token 收费的头部模型公司,随后才轮到 AI coding;当模型行动能力进一步成熟,Agent 才有更稳定的付费基础。

  • 过早进入并不等于领先。早期创业者曾拿 Stable Diffusion 1.5 做电商换衣,投入数百万、数千万甚至上亿元,却发现能力根本达不到客户要求;如今 Google 与可灵的 Try On 逐渐成熟,相同需求才开始具备交付条件。

  • 潘乱从跨境电商朋友处得到的口径是:用现成 C 端模型完成换装,相比某些企业服务方案可节省约 90% 成本。这可能说明能力成熟,也可能意味着早期服务商收费较高、利润会被通用模型压缩。

17. Flow 与 Veo 3 打开的不是更多特效,而是新的制作预算结构

  • 朋克周认为,若 Flow 能把 Veo 3 变得更可控,付费者就会从 AI 视频爱好者扩大到营销、影视和后期团队。可灵已被快手提升为独立一级部门并形成较强盈利,说明生成视频开始从 demo 走向业务。

  • 潘乱提到的短剧团队正在寻找真人难拍、AI 擅长的题材,如《灵蛇》《山海经》、机甲,乃至燕垒生《天行健》中的蛇人、鼠人。但一部约 100 分钟、总预算两三百万元的短剧仍承受不起当前技术条件,技术可行不等于经济可行。

  • 模型特性也会反向决定内容:可灵擅长玄幻和机甲,Veo 3 的优势反而是富人在家做饭等日常场景;朋克周用它做类似《流浪地球 3》的科幻画面时仍会变形。创作者是在根据模型能做什么,重新寻找题材。

18. AI 让 Google Glass 从失败入口变成可重新评估的计算平台

  • 挨踢牛魔王认为,旧 Google Glass 的问题是缺点多、实用性不足;多模态 AI 则补上感知、知识和推理。用户看向一棵树、在空中指一下,眼镜便可能理解所指对象并说明树种,而不必掏出手机扫描。

  • 更实用的场景包括自动整理会议纪要,以及在人际场合提醒“这个人是谁”。牛魔王举例:人脸识别早已可能比人的记忆稳定,眼镜若记录过这个人,就能减少“别人认识你、你却认不出他”的尴尬。

  • 朋克周的判断更宽:AI 不只抢救 Google Glass,也让一批原本痛苦的 VR、AR 厂商“起死回生”。语音识别、视觉理解和自然互动补上后,眼镜、手表、手环、摄像头、智能家居与 AI 玩具都能重新定义用途。

  • 潘乱进一步追问:既然 Gemini 多模态领先,Google 眼镜会不会最好,继而 Pixel 会不会超过 iPhone?嘉宾没有接受这条确定推论,只认为眼镜“有可能”替代手机,电脑则更难;好模型不自动等于最佳整机。

19. 实时翻译展示了多模态硬件最清晰的即时价值

  • 挨踢牛魔王设想四位嘉宾分别说中文、英文、西班牙语和印地语,每个人却都能听见自己的母语;系统还保留原说话者的音色、语气与感情,而不只是提供字幕或机械配音。

  • Google 已展示相近会议场景,但牛魔王承认产品仍需打磨。他的判断是,Transformer 最早从翻译场景发展出来,如今 AI 可能反过来把翻译“逐步全部解决掉”,国际会议与直播会首先受益。

20. 浏览器这个古典产品重新成为 AI 的兵家必争之地

  • 庄明浩列出的参与者包括 Perplexity、传闻中的 OpenAI,以及国内的夸克和重新加码的腾讯浏览器。一个几乎被视为基础设施的古典产品,因为能够承接账户体系、同步、响应速度、安全与隐私,再次获得内部资源和战略话语权。

  • Chrome 同时面临美国反垄断问题,结果仍悬而未决;庄明浩不认为它会突然“一锤子买卖”完成拆分,却承认长期不确定性可能影响 Google 在入口战中的打法。

  • 对插件创业者而言,Chrome 原生集成 AI 会直接压缩空间:账户同步、响应速度、安全和隐私都不是小团队容易复制的能力。但庄明浩保留了一道缝隙:“模型即应用,但应用不仅仅只有模型这一种。”

21. AI 的产品价值在于推断隐藏参数,而非给旧界面加聊天框

  • 潘乱用电商搜索揭示基本功缺口:在淘宝、京东、美团等产品里搜索地址,曾得到地图册商品;搜索“发票”,又出现一堆商品,而不是开发票入口。用户意图明显,传统产品却仍依赖僵硬关键词。

  • 朋克周解释,复杂软件背后可能有 300 个参数;产品只展示 3 个,其余 297 个并未消失,只是被设为平均化的默认值,边缘用户自然会觉得不好用。

  • AI 的潜力是结合搜索词、历史与当前场景,推断那 297 个隐藏参数,在不增加表单负担的前提下处理个体差异。交互因此可能从“用户学习软件”改为“软件理解用户要完成什么”。

  • 潘乱的反讽仍值得保留:未来系统也可能先“深度思考”用户究竟想开发票还是买发票,再终于弹出正确界面。AI 能补技术限制,但基础产品体验与意图设计仍然重要。

22. 创业者最危险的位置,是站在模型即将覆盖的正前方

  • 挨踢牛魔王的警告是:“不要站在大模型前进的前方,一定会被它碾碎。”创业团队可能用复杂 workflow 加班数月完成换装,下一版基础模型却用一个提示词直接实现,设备、房租和研发投入同时归零。

  • 他提出的防线是找到行业 know-how,最好能用代码或明确规律表达。以 E=mc² 作类比,通用模型是逼近规律的万能拟合器,而精确公式既更稳定,也可在 CPU 上运行,成本远低于持续调用 GPU 模型。

  • 潘乱随后追问,这种 know-how 是否也会被知识库和模型吸收。 他以 R1 与 Kimi 为例说,两者并没有拿到完整论文或文献,却从 OpenAI 发布会中的蛛丝马迹发现强化学习可以解决推理模型问题。由此看,知识库、模型与 Agent 结合后,原本的行业经验也可能被进一步聚合。

  • 因而牛魔王最后把判断原则收敛为:“模型越强,你做的东西越强”,而不是模型一升级、产品就消失。若 AGI 真像 AlphaGo 横扫围棋那样覆盖完整领域,他也承认现有防线可能仍会失效。

23. 新应用不会只是旧互联网产品加一层 AI

  • 庄明浩用“独响”展示一种极端产品假设:用户写朋友圈或日记,平台没有真人,只有 Agent 评论和回应;用户既获得被倾听的感觉,也不必承受真人反对与否定。这未被证明,却代表面向未来心理状态的设计。

  • YouWare 则押注另一种变化:YouTube 让人分享视频,AI 编程把制作应用的门槛降到足够低后,人们也可能分享自己的小游戏和程序。内容平台的最小单元,可能从帖子和视频扩展到可运行软件。

  • 潘乱据此认为,很难判断某个方向完全不在智能主线上。知识库、编程和 Agent 结合后,稀缺物或许只剩《银翼杀手》式的“手工面条”和“真实的羊”;但这是趋势想象,不是已经发生的市场结果。

24. 主航道并不排斥创业公司,但退出方式和资本尺度已改变

  • 庄明浩观察到,2024 年 AI 交易多是“掏空式并购”,本质上更接近挖团队;到 2025 年,真正支付高额对价、购买公司与产品的并购开始明显增加。

  • 即使处在大模型厂商必争的主航道,创业公司仍可能凭执行、产品和先发规模被收购。大厂自身有人力与优先级约束,未必会把每一层都从零做到最好;机会窗口可能短,却并非不存在。

  • 资本门槛已经脱离传统早期 VC:庄明浩的市场口径是,垂类公司做到 1 亿美元 ARR 后可能获得 30—50 倍估值;Cursor 更传出约 5 亿美元 ARR、以 99 亿美元估值融资 9 亿美元,而产品版本才到 1.0。

25. 多模态模型会集中,垂直产品仍可凭结果收费

  • 视频模型被潘乱形容为“一将功成万骨枯”:同一时间六七家、七八家竞争,其中一半可能是大厂;可灵、MiniMax 的海螺、PixVerse 等仍在追赶,但训练所需的算力、数据和算法已远非传统互联网创业成本。

  • 声音市场更微妙。庄明浩认为 ElevenLabs 的商业化最强,ARR 约 1 亿美元;打榜表现则以 MiniMax 最突出。但声音可能不足以长期成为独立战场,因为视频模型正把音频能力一并包入。

  • 他的团队会使用各种模型,包括 MiniMax,不向客户卖“哪家的 token”,而是为明确细分场景交付结果、按结果收钱。技术来源可以混合,客户购买的是完成度与稳定交付。

  • 美图是朋克周眼中的典型:图片和视频模型未必最强,却懂电商、美颜、证件照与付费习惯,已经实现不错收入。HeyGen 也收敛到营销视频、数字人、口型与语音组合,故事从“最强模型”变成明确场景、品牌与收入。

26. Agent 时代会重建一套给机器使用的互联网基础设施

  • 庄明浩观察到,美国近期不少早期项目并不再做一个终端 Agent,而是补 Agent 到来后的基础设施。现有网站与数据库是给人使用的,AI 的身份、权限、安全、支付,以及 API、SDK 调用方式都可能重做一遍。

  • 这也让中美过去十余年的优势开始交汇:中国长期在 To C 移动互联网、产品和运营上发展,美国则积累 To B SaaS、云、订阅和企业交付。AI 产品既要理解企业付费,也要学习消费产品体验,双方都不能只靠原有长板。

  • 挨踢牛魔王用蒸汽机解释总需求:蒸汽机出现后,人类并没有减少煤炭使用,反而让更多地方开始烧煤;智能成本下降后,同样会覆盖过去“不值得专门写程序”的细碎长尾市场,为创业公司创造新需求。

27. 最可靠的结论不是预测赢家,而是让自己进入这轮组织变革

  • 朋克周的“诚实非答案”是:“所有人都不知道明天会怎么样。”Google、微软未必知道,奥特曼和 SSI 创始人频繁谈 AGI 也可能带有营销成分;他选择先做媒体、在岸边观察,同时尊重已经下水做应用的人。

  • 潘乱的现实提醒是,国内大量 AI 工具仍免费,“不用真是白不用”。如果短期没有足够新增价值、更多只是重新分配,那么不熟练使用 AI 的人,很可能被更熟练的人取得效率与议价优势。

  • 庄明浩把长期变量落到 OpenAI 框架的 L4“创新”和 L5“组织”:历次工业革命中,技术出现当下并未自动带来生产率跃升,真正变化要等组织和商业模式适配。Google 本届 I/O 本身,就是组织重构先于产品爆发的样本。

  • 他借道格拉斯·亚当斯的三条技术定律收尾:出生时已有的技术是日常秩序,15—35 岁出现的是革命,35 岁后出现的往往被视为违反自然。嘉宾们虽已超过 35 岁,却仍愿意拥抱这次变化;“某种程度上,我们是幸运的。”

潘乱

大家好,欢迎来到本期微博AI的访谈连麦节目 AI Talk 啊,我是主持人潘乱。今天我们要聊谷歌,尤其是半个月前的 Google I/O 大会。这场大会应该冲击了这个行业,大部分人都深受震撼,感觉 AI 行业的天花板又被顶高了一截,对吧?

对比前两年,我们看到的是什么?各种翻车。当年谷歌收购了 DeepMind,后来一批人创办了 OpenAI,但在这个对比里面,谷歌的风头远远不如 OpenAI。之前谷歌的发布会上可能还会翻车,包括产品名字也改了。

但是这一场 Google I/O 大会,算不算谷歌的逆风翻盘?所以今天我们请到三位嘉宾,跟大家一起聊一聊。三位先做一个简单的自我介绍。

庄明浩

大家好,我是庄明浩,《屠龙之术》的主播,一直在观察科技以及 TMT 相关行业。

朋克周讲AI

大家好,我是朋克周讲AI,我们主要做短视频,进行一些 AI 科技的科普。

挨踢牛魔王

大家好,我是挨踢牛魔王。我现在主要是在做一家 AI 创业公司。

1. 谷歌三年逆风翻盘

潘乱

我们这场是聊谷歌过去 3 年是怎么过来的,但还得先回头把这段历史拉出来。因为谷歌动不动就会被拿来跟 OpenAI 对比,并且挨骂。

大概 2 年、2 年半以前,谷歌也追随着 ChatGPT,推出了自己的 Bard。但一开始首秀就出现了一些常识性错误,谷歌的市值也一夜之间蒸发了七千亿。到了 2023 年 12 月,它做演示的时候又被扒出来,原来剪辑造假。

反正过去这 2 年就是黑料频出。它生成的内容可能会有各种槽点,比如种族歧视、劝用户吃毒蘑菇,甚至还有更夸张的剧情。

去年的 I/O 大会,它原本信心满满地要放一个大招,准备发布一个能看、能听、能实时对话的多模态 AI 助手 Project O。结果 OpenAI 在前一天截胡,发布了 GPT-4o。后来的故事大家也知道了,谷歌泯然众人。

这中间还有一系列事件。比如微软推出了 New Bing,Perplexity 这样的创业公司也起来了,还有浏览器领域的 Dia 等等。大家都觉得这些产品会对原本的巨头造成非常大的冲击,谷歌也被认为跟不上时代,大象不能转身,甚至出现了“英雄迟暮”这样的论调。

各种大公司病的标签,也都追着谷歌来了。但今年这个大会,真的有一点王者归来的意思。它自研 TPU 的单集群算力全球领先,Gemini 2.5 Pro 我也用了一下,的确很强,我们待会儿再聊。

反正这一年谷歌是全方位进步,不管是模型、AI 助手、核心搜索产品,还是浏览器本身,整个产品体系都在 AI 化。甚至连十多年前的 Google Glass,它也重新拉回来了。

2. 三大产品震撼登场

首先先聊第一部分:从业界笑柄到全面领先,谷歌这次 I/O 大会有哪些让人印象深刻的细节?从这次大会来看,哪一项发布让你觉得最惊艳?大家可以随便聊。

朋克周讲AI

我先说吧。我觉得这次发布的东西特别多,每次谷歌大会,不管是 I/O 还是 Cloud,都会推出一两百个更新,看得人都快晕掉了。

这里面给我直接冲击最大的,还是 Veo 3,就是它的视频模型。这有点超乎我的预料。我们之前一直在期待 Sora,但后来发现 Sora 不太行,中国很多模型反而追上来了,比如可灵、Vidu,还有即梦。

特别是可灵,不管是整体模型能力还是成本,都已经达到商业化水平了。我没想到谷歌还会推出 Veo 3。我们去体验了一下,确实非常强。

这里面还有一个小插曲。前几天我看到一个短视频,一个女士要带一只袋鼠上飞机,袋鼠嘴里还叼着一张机票。我以为是搞笑视频,还发给我女朋友说:“你看,外国人天天整活。”

我女朋友说:“这个做得挺真的,你看它的手。”我一下就愣住了。因为我没有把它当成 AI 视频,我以为那就是一个搞笑视频。像我这样看了两三年 AI 资讯的老韭菜,居然都没有发现它是 AI 生成的。

这两天我也跟很多朋友聊,发现这种级别的视频已经可以造成一定程度的混乱了。你完全分不清楚,不管是老人、小孩,还是专业人士,都很难判断它到底是不是真实的。

所以 Veo 3 现在确实非常强,但它特别贵。我们算了一下,如果用 Veo 3 API,一条视频大概需要 100 元人民币,很贵。不过它的原生性非常好,能够直接给你生成符合场景的声音和人物声音,包括眼神。

在我们看来,它的 AI 味已经非常非常少了,这一点特别惊艳。

庄明浩

我本来也想说 Veo 3。视频领域之前有一个很核心、一直没有解决的问题,但在 Veo 3 之后,它变成了一个不再是问题的问题。

原来生成的视频是没有声音的,视频就是视频,语音就是语音,是分开的状态。Veo 3 生成视频的时候直接带着声音,而且声音跟你要生成的内容是匹配的。

也就是说,它把原来视频和语音分开的状态,变成了一个整体。Veo 3 之后,所有 AI 视频生成工具的标准尺都变了:你生成的内容本身就要有声音。比如今天我想生成一段对话视频,或者一段沟通内容,就要保证视频图像和语音内容匹配,并且同时生成。

这件事在以前的 AI 视频生成里是不可能的,现在可能了。它把 AI 视频生成从无声直接拉到了有声,拉到了一个新的天花板。

另外一点,我觉得可能更重要,或者说这个挨踢牛魔王待会儿可能会讲得比较多。二级市场对于谷歌这一轮 AI 的讨论,更多担心的是它传统的搜索商业模式会受到巨大挑战。

但这一次 I/O 之后,你会发现,除了常规的模型和技术进展之外,谷歌在最核心的搜索框里,开始增加 AI Mode。当然目前只在美国上线。

我们可以设想,至少谷歌内部应该经历了很多组织层面的沟通之后,才下决心去动最核心的搜索框。对于一个体量这么大、在搜索领域具有强垄断地位的公司来说,能够做出这样的决定,本身就挺不容易。

所以在这一点上,我觉得谷歌的状态发生了比较大的变化。

挨踢牛魔王

最后我讲一下。这次 I/O 大会确实让人很惊艳。我觉得最基础的还是它的大语言模型 Gemini 2.5 Pro。

谷歌之前老翻车,对吧?而 OpenAI 其实每次都针对谷歌。每次谷歌准备发布什么东西,OpenAI 就故意卡在那个时间点,先搞一个事情,把谷歌的风头抢走。

OpenAI 当初成立的时候,目标之一就是认为人工智能不应该被大公司垄断,所以它每次都会针对谷歌。

但这一次,谷歌的 Gemini 2.5 Pro 非常强。它在写作、编码和推理这 3 个方面都很强。最新的版本应该是昨天发布的,6 月 5 日发布了一个版本,打榜已经冲到了最高分。

这是谷歌其他能力的基础。我认为这是这次最强的发布。

最惊艳的就是刚才几位老师也讲到的 Veo 3。它一上来,基本上就把整个视频生成领域颠覆了。它的技术其实来自 DeepMind,叫 V2A,也就是 video-to-audio。

它先提取视频里面的各种信息,再把这些信息传给 diffusion,也就是扩散模型,然后生成音乐和声音。这样做出来的效果就非常好。

尤其是人物的真实度,刚才大家也提到了,非常真实。它一下子就跃居第一梯队。视频生成领域现在可灵已经可以跟它打个来回,基本上可以说是并列世界第二。

但 Veo 3 加入声音处理之后,确实更先进了一些。我相信可灵后面也会慢慢朝这个方向发展。其他方面,比如生成和换衣服,可灵其实也不弱。

技术上最让我惊艳的另一点,是谷歌推出了 Gemini Diffusion。我们一直以为扩散模型更适合用在图片上,因为速度非常快,而且跟人的思考方式比较像。

扩散模型的过程有点像去噪:先有一个草稿,再把草稿细化,补充每个细节。大家写一篇文章,大致也是这个思路。

但以前采用的自回归模型,比如 ChatGPT 使用的模型,并不是这样的。这次谷歌提出了 Gemini Diffusion,虽然目前实用性还不是特别强,但谷歌往这个方向发展,本身就说明它的创新能力回来了。

这个模型的速度非常快,最快大概一秒钟能生成 1400 到 2000 个 token,基本上可以做到秒出。速度起来以后,对于未来的互联网应用会非常有用。

我们现在知道,智能模型有一个问题,就是速度比较慢。做搜索、互动和产品的时候,很多时候需要准实时功能。比如搜索的时候,你希望一点按钮答案立刻出来,而不是像打字一样慢慢输出,那样体验会差一些。

所以我觉得,这次谷歌大会最惊艳的就是这 3 点:Gemini 2.5 Pro、Veo 3,以及 Gemini Diffusion。

3. 谷歌全面接入 AI

潘乱

大家刚才都讲了自己印象最深刻的细节。如果再聊一个更综合性的感受呢?

刚才几位都提到,OpenAI 当时是为了对抗谷歌,包括在谷歌各个发布节点,OpenAI 也会对它发起冲击。如果再往前推,两三年前,微软把 ChatGPT 融合进 New Bing 的时候,大家其实都在等着看谷歌的笑话:你谷歌到底跟不跟?

在没有 AI 之前,谷歌在全世界范围内至少占搜索市场的 80%。但如果它跟进 AI,利润可能会大幅下降,这也是二级市场对它最大的担心。

如果它不跟进,前两年 Perplexity 这样的产品又会影响它的市场份额。市场份额受到影响,现金流肯定也会受影响,甚至可能无法阻止微软云业务的崛起。

但这次 I/O 大会给我印象最深的,是谷歌终于非常自洽了。大公司都面临一个问题:做 AI,到底是做一个新产品,还是把原有产品用 AI 变得更好?

我感觉谷歌选择了后者。它把所有产品都加上 AI,从 Chrome、Android、Gmail,到最核心的搜索,全部都加上 AI。

而且它把这些能力跟“整合全球信息”这个公司使命连接起来,也不觉得违和。几位是什么综合感受?

朋克周讲AI

我觉得这就是谷歌的优势。我们看到的除了它的模型、底层能力和视频模型非常强之外,还看到了它的一个思路:用自己的生态去打单品,用自己的会员体系去打别人的模型。

现在我们看到 GPT 也好,Claude 也好,很多还是一个单独的产品,是一个对话工具。但谷歌现在是把所有产品都接入了 AI。

比如 Gmail 里面也可以使用 AI。虽然现在用起来可能有点奇怪,改一段文字有时候甚至比自己写还慢,但这体现的是它的内部策略。

谷歌这些产品加起来可能有十几亿、几十亿用户。如果它重新做一堆产品,就会面临新的竞争。不如基于原有生态,让用户在谷歌体系里无缝连接。

举个最小的例子:你可以先用 Gemini 生成提示词,再用 Veo 3 生成视频,然后用 Flow 剪辑,最后一键发到 YouTube。这样的体验,对用户来说肯定比在不同 AI 产品之间来回切换更好。

它的 Android、云服务、浏览器,未来甚至都可以互相打通。比如它可以读取你的聊天记录,给你一个整合的方案。我觉得这就是谷歌的战略。

否则它要重新做一批产品,做一个新的搜索引擎,或者做一个新的入口,评估起来会非常难。

潘乱

另外两位有什么感受?

庄明浩

我的感觉是,你们拿着一根矛,想要来捅我,我直接把这根矛拿过来自己用了,有点这种感受。

挨踢牛魔王

潘老师刚才的洞见非常好。谷歌这样的大公司有一个问题,就跟原来的诺基亚一样。它为什么早期跟不上,闹出一堆笑话?

最核心的原因是,它的搜索业务实际上是一台印钞机。广告和搜索是联动、自动化的,它甚至可能有 80% 到 90% 的业务都来自搜索广告。

但如果它上 AI,不就变成自己打自己了吗?原来负责搜索的那批人,会认为你这样做威胁到了他们的生存。不管是内部还是外部,都很难动刀子。

谷歌其实很早就看到了 AI 的价值。比如辛顿教授做语音识别的时候,谷歌已经在进行很多创新。Transformer 架构也是谷歌最先做出来的,结果当时那 8 个人都跑了,也就是大家说的“谷歌八子”。

为什么会跑?就是因为谷歌不敢动自己。

刚才明浩讲到,这次谷歌把 AI 模型放到了核心产品里。这件事情本身就说明,它真的想动刀子、改革自己。

第二个洞见是,谷歌和微软采取的方式完全不同。微软打的是代理人战争:自己不练模型,扶持一个 OpenAI 去打,然后自己不用在内部动刀子,还可以通过股权去控制它。

谷歌不是这样。谷歌是直接在内部动刀子,把 AI 重新融合进自己的业务。

比如你搜索的时候,可以直接融合 Veo 3;生成之后可以一键发布;它走的是用 AI 把所有业务重新做一遍的思路。所以它下的决心非常大。

朋克周讲AI

这次 I/O 大会还有一种 88VIP 的感觉。它特别强调自己不是一家广告公司,还推出了大会员。

它也推出了眼镜。虽然现在还是概念片,但如果真的拥有那副眼镜,确实会非常爽。眼镜是入口,而眼镜背后的模型、数据,包括订餐等能力,都基于谷歌的生态。

没有生态,眼镜也无法维持。所以它有点像 88VIP,只不过谷歌这个 VIP 稍微有点贵。

它想给用户的感觉是:在别的地方,你只能问答、聊天、生成视频;但在谷歌这里,它可以解决你所有的生活和工作问题。

量大管饱。

4. 真正的转折来自组织

潘乱

我们再回头看。大家一开始担心大象不能跳舞,结果今天发现,这头大象甚至还能跳街舞,确实有点吓人。

这次不管是行业里的大公司还是创业公司,都给出了非常强烈的反馈。那可以认为,谷歌这次在 AI 赛道上翻身了吗?

把问题问得更具体一点:前两年谷歌一直被 OpenAI 拿来嘲笑。这次至少先不说反超,至少我们已经把谷歌当成同一个级别的对手了。不会再有人觉得谷歌不是这个星球上第一梯队的 AI 公司。

反正这次大会之后,不管谁是不是第一梯队,谷歌一定已经是了。我好奇的是,这个转折点到底在哪?是哪一刻、哪个产品,或者哪个瞬间?

庄明浩

我觉得还是组织问题。

去年我们去新加坡参加谷歌的活动,看了一部国内没有上映的纪录片,是关于 Demis Hassabis 的。他从小学国际象棋,后来喜欢上人工智能,创立了 DeepMind。

纪录片里有一个画面,他用手机跟一个 AI 对话,那个 AI 已经非常强了。我感觉谷歌内部 DeepMind 的 AI 能力其实一直都非常强,只是之前谷歌用的是 Google Brain 团队。

Google Brain 做了 BERT,但后来出了很多问题。所以我觉得真正的转折点,应该是谷歌内部达成了某种协议,决定让 Demis Hassabis 的团队成为整个谷歌 AI 业务的领导者。

谷歌原来可能有 3 到 4 个研究 AI 的部门,有 Google Brain、DeepMind,还有其他 AI Research 部门,组织非常多,也很混乱。

我觉得转折点应该是在 2023 年四五月份,把这些部门合并,让 DeepMind 来领导。这解决了很多问题。

Google Brain 团队非常擅长研究。Transformer、TensorFlow,以及很多神经网络成果,都是他们做出来的。但他们对于应用好像不太灵,写论文可以,做产品应用不太行。

集团内部把这些团队整合起来,让 DeepMind 来领导,我觉得是一个非常重要的转折点。

DeepMind 一直在研究多模态和扩散模型,这些方向在这一轮被行业高度认可。Bard 原来的模型路线,我感觉一直没有真正跑出来。

我还有一个感受:这就像淘宝为了应对拼多多,专门搞了一个特价版,因为它不想让自己的主产品和原有商业模式受到侵蚀。后来证明这个方向基本是行不通的,你不可能用自己的峰值去打别人一个非常有生命力的创业产品,最后只能是你自己承担变化。

这次发布会给我的整体感受是,谷歌不再强调搜索摇钱树这个概念,也不再首先考虑“这件事怎么赚钱”,而是把所有业务都往 AI 上转,真的用 AI 去重构。

对于大公司来说,我可以研究,放 10 个人,也可以放 1 万个人,但跟投入 10 万人完全不是同一个概念。谷歌现在是让所有业务都来回答 AI 这个命题。

潘乱

明浩和牛魔王,你们有什么观察?之前业界一直认为,哪怕拉长周期来看,谷歌是一家更擅长技术,但在产品应用端总会掉链子的公司。这么多年一直出现这种情况。

在这次 I/O 之前,其实也有这个趋势。Gemini 的表现从 2024 年开始,慢慢已经追上了最头部的模型。无论是 OpenAI 还是 Anthropic,从评分和榜单来看,谷歌每次发布 Gemini,成绩其实也都还可以。

但那个时间点,大家会认为谷歌还处在技术研发状态,技术对现有业务的影响和帮助并没有体现出来。

而 ChatGPT 出现的第一天,大家就知道它一定会奔着搜索去。所以从 2022 年底开始,一个巨大的问号就一直压在谷歌身上。

我们看所谓美股“七姐妹”:市值 3 万亿美元的 NVIDIA、苹果和微软,各自有自己的叙事;市值 2 万亿美元的谷歌和亚马逊,也有自己的策略;剩下市值 1 万亿美元的 Meta 和特斯拉,也都有各自的担心。

这次 I/O 之后,我们看到谷歌纯技术端的进展依然非常强,同时产品端也出现了融合和变化。无论是原来的主产品,还是新推出的 AI 产品,都出现了更明确的策略。

甚至 NotebookLM 这种产品,口碑也非常好。所以它对谷歌原来负面印象的扭转,产生了一定的边际增强。

我甚至觉得,这很像当年 Android 最火的那几年。那时候每年的谷歌 I/O 大会,大家都特别兴奋,看到各种更新会非常开心。今年的 I/O 确实也有那种氛围。

挨踢牛魔王

谷歌之前推出 NotebookLM 这样的产品,确实非常惊艳。

模型方面,它早期为了应对 OpenAI 的冲击,相当于把原来的一些东西拼凑起来,做了一个 Bard。别人像驱逐舰一样来了,它随便找几个东西拼了一个小船过去,立刻就被冲垮了。

后来它打通了部门墙,把 AI 组织理顺了。谢尔盖·布林原本已经处于半退休状态,但这个时候又亲自回公司上班、写代码,还号召大家每周至少工作 60 个小时。

谷歌现在是混合办公,很多人一周只有 3 天在公司。布林回来以后,对整个团队士气的鼓舞非常大。

组织理顺之后,我觉得真正的转折点是在 Gemini 2.0。它推出了 Flash 模型,还加入了图像编辑能力。

比如可以把一个人改成吉卜力风格,让他换衣服,或者把两件产品,比如球鞋,和一个人结合在一起。它当时是第一个推出这类功能的。

但 OpenAI 专门盯着谷歌。谷歌推出之后没几天,OpenAI 就发布了更强的 GPT-4o 图像模型,一下子把风头盖过去了。

不过那时候局势已经开始慢慢扭转。谷歌居然能够在这个领域抢发,说明它其实已经提前研发了很久。当 OpenAI 还在研发图像编辑和控制模型的时候,谷歌已经提前了一年在做。

虽然它上线之后,风头又被 OpenAI 抢走了,但从那次之后,转折就慢慢开始了。到了后面谷歌再开 I/O 大会时,OpenAI 明显有点压不住了,它当时只发布了一个编码模型 Codex。

所以我认为,Gemini 2.0 这次抢发,是一个比较大的转折点。

潘乱

还是非常感慨。谷歌敢在自己的核心业务上动刀,因为搜索真的是互联网上最好的商业模式,应该也是互联网有史以来利润最肥、最大的市场。

微软的 Bing 当年只占全球搜索市场 3% 的份额,但你别看只有 3 个百分点,每年也有 120 亿美元的营收。

所以当时大家觉得,AI 搜索只要跟 ChatGPT 一起抢到谷歌 1 到 2 个百分点的份额,就是非常大的生意。

我们也看 Perplexity 这类产品,单个用户每天的查询量可能是谷歌的好几倍。这确实让人惊讶,谷歌能做这么大的调整。

这个调整也跟刚才朋克周讲的事情有关。谷歌一开始用的是 Bard,后来不断翻车,出现品牌丑闻,才改名叫 Gemini。与此同时,Google Brain 和 DeepMind 两个团队也进行了重组,谷歌高层还承认,过去的 AI 战略出现了问题和偏差,需要重新调整。

朋克周,你再延伸讲一讲这次调整和 I/O 大会之间的关联。

朋克周讲AI

这次 I/O 大会其实就是前面调整之后的成果展示。

Bard 就不说了,真的没有办法用,特别离谱。中间还有一段时间,你问 Bard 自己是什么模型,它会说自己是文心一言。我不知道它是用了中文语料,还是接了文心一言的接口,也不知道是蒸馏还是什么,总之非常离谱。

刚才我们一直在说搜索。我觉得谷歌的搜索业务太重了,而它的搜索现在已经被 Perplexity 以及 GPT 相关产品影响了。

别说海外,我觉得国内也是这样。我们现在已经有习惯了,动不动就问豆包、元宝、DeepSeek。很多问题,我可能不会再打开搜索引擎去问。

这对谷歌的刺激非常大。正因为刺激大,它才下决心在一定程度上革自己的命。但它也不能让别人来革自己的命,所以这次 I/O 大会里,不管是搜索中加入 AI Mode,还是其他产品,都能看到类似的变化。

现在 AI Mode 还只能给美国用户使用,我们用不到。但从整个产品线来看,我感觉基本都是 DeepMind 团队的成果,当然其中也有 Google Brain 团队在技术上的支持,比如神经网络优化,以及刚才牛魔王提到的扩散模型。

据我了解,它在视频上使用的是一种改良的扩散模型。技术层面上,原来 Google Brain 团队的支持还在,但从整个产品线来看,多模态产品基本都是 DeepMind 团队的东西。

这次 I/O 大会展示的,其实是团队整合之后,各部门在技术和生态方面融合的结果。最后拿出来的产品非常完整,很多东西都已经打通了。

当然,它现在的问题是产品太多。

我们今天测试了谷歌的编程能力,速度非常快。用 Gemini 2.5 Pro,今天更新的版本,两分钟就能做出一个游戏。很恐怖,两分钟就能做出一个 UI 很好的、可以玩的游戏,甚至我们能玩半个小时。

我觉得这是团队融合之后的一个成果展示。

5. 中美模型继续突破

潘乱

如果放到中国和美国的视角来看呢?

春节的时候,GPT-4o 一出来,真的非常惊艳,给整个中国社会、创业市场和创投市场都注入了一针强心剂。

当时我们感觉,GPT-3.5 发布得并不顺利,好像西方的发展遇到了瓶颈。可过去这几个月,GPT-4o、Claude 4,以及谷歌 I/O 发布的 Gemini 2.5 Pro,怎么感觉都没有瓶颈?

原本 GPT-4o 出来的时候,我还会想,大模型是不是到了某些瓶颈,西方发展得不太顺利,接下来是不是要轮到我们了?但 GPT-4o 火了一个月之后,反而那边又不断有新产品登场,好戏连台。这是怎么回事?

挨踢牛魔王

这个过程大致是这样的。

OpenAI 做了一个很有意思的东西。以前我们讲模型,主要讲预训练。预训练就像一个人读了很多书,把书都读完了。但如果你希望这个人对各种问题做出反应,还要做题。做题就是强化学习,之后才能进入推理领域。

OpenAI 做的推理模型就是 o 系列。对 OpenAI 来说,o 系列是一个很大的进步。他们内部至少认为,这可以成为自己的护城河,虽然不一定永久,但挡住别人 1 年、2 年应该没有问题。

但这一次出现了 DeepSeek。其实中国有两个团队独立把这件事情搞清楚了,一个是 Kimi,一个是 DeepSeek。只不过 Kimi 没有开源,所以大家关注得不多。

DeepSeek 不仅把模型开源了,还把怎么做的细节全部写进论文并发布出来。它对整个行业的提升是巨大的,不只是对中国,对全世界,包括美国,都是巨大的提升。

它一下子把 OpenAI 原来的优势拉平了。

Kimi 是怎么发现的?OpenAI 发布演讲、论文和一些片段时,经常提到蒙特卡洛树。Kimi 的研究人员非常敏锐地发现,这个方向可能是错的。

不是说蒙特卡洛树绝对做不成,但在当前阶段比较难。他们找到了纯强化学习这条路。中国这两个团队不约而同地走到了这条路上,没有被 OpenAI 误导,也没有掉进那个坑里,最后把它做出来了。

所以这一次谷歌为什么这么强?除了团队整合成功之外,技术上很重要的一点,就是 DeepSeek 把 OpenAI 如何做推理模型的很多方法都公布出来了。

谷歌当然不一定完全照着 OpenAI 的路子走,但它肯定会吸收这些经验。整个行业在这件事上就像没有瓶颈一样继续向前推进。

而谷歌还有一个优势,就是数据非常多。比如 YouTube,以及搜索数据,这些都给它提供了很大的基础。技术上没有大的瓶颈,数据又足,它自然就往前走了一大步。

所以 DeepSeek 开源,对整个世界的贡献,不只是对中国的贡献。

庄明浩

我做一个更简单的整理。

OpenAI 之前定义了 L1 到 L5:L1 是聊天机器人,L2 是推理,L3 是今年讨论特别多的 Agent,L4 是创新,L5 是组织。

OpenAI 的 o 系列是推理模型的开始,去年 9 月之后,到今年年初这个阶段,全世界头部模型厂商的工作,基本上都是在复现 o1。

确实有一些厂商走了弯路,因为被 OpenAI 带着走了。他们尝试了其他方式,后来证明只需要强化学习,只需要后训练,就可以走到推理这一步。

DeepSeek 和 Kimi 很早就发现了这一点。到了 2025 年第一季度,头部模型厂商基本都把推理模型做成标配了。

这时候出现了一个循环。去年 9 月,伊利亚说预训练的天花板到了,大家开始强化后训练和强化学习。到了 2025 年第二季度,大家发现预训练依然有空间,强化学习也可以继续加入。

它有点像踢足球时连续踢两脚。大家原来以为前面的预训练结束了,就用后面的强化学习解决推理问题。推理模型都做出来之后,大家发现前面的预训练还可以继续加强。

一个更现实的例子是,5 月底 DeepSeek 发布了 R1 的更新版本 R1-0528。它在编程和文案上已经很强了。

大家为什么期待下一步?因为现在的 R1 还是基于 DeepSeek-V3 的基础模型做出来的。DeepSeek 肉眼可见会发布 V4,基础模型还是通过预训练训练出来的,然后再基于 V4 做 R2。

这就是连续踢两脚。V4 抬一脚,R2 再抬一脚,会抬到什么程度?大家当然非常乐观。

只要它继续抬高,就会把整个行业的平均水平拉上去。因为 DeepSeek 是开源的,训练方式也会公开,甚至它还会用自己的方式去训练 Llama、千问等模型。

它会迅速把行业曲线的天花板拉到更高。所以模型智能这条主线,技术趋势确实还会继续向上走。

6. NotebookLM 打开产品想象

潘乱

下面聊一些具体产品。我们刚才整体聊了 I/O 和中美情况,先从明浩刚才提到的 NotebookLM 开始。

你觉得它跟腾讯 ima、飞书知识问答有什么不一样?底层差不多都是知识管理,但 NotebookLM 出圈,是因为它第一次把播客做得特别好。

朋克周讲AI

从纯粹的体验来看,这个时间点,其实扣子空间以及一些独立产品,都已经开始具备类似功能了。你可以输入一个主题、一篇文章,或者一批材料,让它生成一段听起来非常有逻辑、像真实对话一样的播客。

这个功能现在已经算是偏标配了。但 NotebookLM 出圈的那一刻,它在功能体验上的强度非常高,所以一下子出圈。

纯从底层技术实现来看,还是要感谢 2025 年语音模型的发展。无论是对话、语调还是语气,我们自己也在做相关事情,能明显感觉到这个技术进展非常快。

但怎么封装成产品,做成什么功能,以及怎么让这个功能利于传播、让大家明确知道它的特点,最后能够爆掉,这件事对谷歌来说尤其难得。

谷歌历史上不是这样一家公司。它不是以这种产品特性见长的公司。这个东西如果出现在一家擅长产品的公司里,大家会觉得很正常;但它出现在谷歌,就更让这件事获得了一层加成。

所以我觉得 NotebookLM 应该会在这个行业里留下很重要的一笔,跟 Perplexity 类似。

潘乱

是不是因为它用了多模态上下文?其他产品更多还是图文上下文,NotebookLM 不只是能解读 PDF,还能解读音视频?

庄明浩

应该主要还是 PDF 等文档,但它的播客体验确实做得很好。

朋克周讲AI

我觉得就像明浩老师说的,技术上可能不是特别难,但一家像谷歌这么大的公司能够想到这个产品,我觉得很可能是内部创业的结果。

谷歌经常有这种传统,可能两三个人就做出了一个产品。这个产品非常惊艳,是因为它能够捕捉时代的变化。

现在有一个问题:很多东西不管是枯燥的论文,还是日常新闻,大家可能都听不进去一个人在那里念。但它把内容变成男女两个人对话,而且你可以随时插进去问。

比如你说:“这一点我没听懂。”播客里的角色就会开始解释:“你没听懂的是这个。”然后重新跟你说一遍。

这种体验以前没有出现过。它让人感觉有人陪着你去了解这个世界上很多困难的东西。对于谷歌这样的大公司来说,这个产品洞察非常厉害。

庄明浩

说到产品洞察,我想起昨天或者今天的一个消息。ChatGPT 也开始增强对用户录音的监控和捕捉能力。

我当时就在想,这不是豆包 PC 端研究了很久的事情吗?包括最近一些产品也在相互借鉴,总有一种大家互相学习的感觉。

录音产品我现在也在用一款,正在内测,正好可以录下我们这次对话的声音。大家可能已经意识到,要往硬件入口走了。

现在不管是大厂发眼镜,还是推出可以贴在手机背后、帮助录音和做 AI 助理的工具,都说明行业开始往全方位发展,不再只是模型。

模型可能只有几家大公司能够做。经过两三年观察,我发现身边有些公司已经放弃做模型了,不管是大语言模型还是语音模型,甚至都放弃了。他们可能会去做 AI 相关的其他产品。

还有一个趋势,就是潘老师刚才提到的代码。我觉得代码也是今年非常重要的一个层面。

我前几天在杭州和阿里的同学聊天。我说字节在推自己的 TRAE,阿里肯定也得有自己的产品,原来是通义灵码。结果没过几天,阿里就发布了自己的 IDE 产品。

我觉得只要是大厂,就一定会下场做这个。这个不做,可能比没有入口还严重。入口没有了,问题可能还没有那么大,但自己没有编程能力,严重得多。

7. AI 赛道开始分化

潘乱

现在真正被验证能赚钱的赛道,可能就是代码。最拥挤的方向之一是当年的 AIGC,也就是内容创作;现在所有创业公司都在涌入的,应该就是 Agent。

谷歌 I/O 也推出了换衣服之类的功能。是不是可以认为,现在主要就是这几个大赛道?

挨踢牛魔王

我觉得 Agent 确实有点尴尬。前两天 Claude 不是停了编程工具给它断供了吗?因为传说 OpenAI 要买它,但它用的是 Claude 的 API,所以有点尴尬。除非你能做到像 Manus,或者其他已经在市场上建立了认知的产品,比如第一个设计类 Agent、第一个影视类 Agent,已经获得了心智和市场,能够跟大厂进行战略合作。

否则 Agent 的能力最终还是会被模型覆盖掉。

入口和硬件可能是初创公司相对有机会的方向。这个问题明浩老师可能更专业。

庄明浩

反正今年的主线一定是 Agent。谷歌也说今年是 Agent 年,它确实可能是智能主线上的事情,是绝对意义上的主战场,大厂不可能放弃。

在周边战场,扣子已经很明显了。多模态今年的竞争也非常激烈。视频领域几乎天天在打,今天你第一,明天我第一。语音也是这样。

多模态是一块,硬件可能也是一块。至于 To C 的娱乐和社交板块,实话实说,从阶段性结果来看还不是特别理想。

过去两年半,我们更多讨论的是技术趋势。但到 2025 年,产品趋势越来越重要。无论是硬件还是软件,应用端的事情变得越来越重要,产品体验的边界也变得越来越重要,对大厂自己也是一样。

这也是为什么谷歌这次除了描述技术和模型本身之外,会花更多篇幅描述产品端。AI 这一波浪潮在 2025 年确实开始走向产品趋势。

所以在我们限定的大模型相关板块里,今年的主线可能就是 Agent,副线是 coding 和多模态,再小一点的方向可能是硬件、社交等。

挨踢牛魔王

我觉得它是分一波一波成熟的。

最开始要有正反馈,肯定得先赚钱。对于大公司来说,最开始赚钱的是卖卡。黄仁勋不管你搞什么模型,都得买 NVIDIA 的卡。它的卡虽然贵,但各方面确实领先。

卖卡的公司赚钱之后,下面就是做得比较好的模型公司。你无论做什么应用,都要使用模型,都要消耗 token,所以模型公司也能赚钱。

等模型成熟到一定程度,我觉得 2025 年是一个重要时间点。模型在上下文等方面已经没有太大问题之后,AI 编码就成了一个确定能赚钱的赛道,尤其对大公司来说,肯定要做。

编码是整个互联网和软件的底层。把编码能力抓住之后,再往前走,等 Agent 的行动能力提升,就会出现更多 Agent 产品。

所以赚钱是一波一波的。

为什么判断趋势很重要?AI 刚出现的时候,有些创业公司过早冲进去,认为 AI 应该能做到很多事情,但实际上根本做不到。

有些公司亏了几百万、几千万,还算好;有的投了上亿元,结果产品根本达不到要求,客户也不买单,最后就死掉了。

现在情况不一样。比如当初 Stable Diffusion 1.5 出来的时候,大家觉得换衣服很简单,模特换一套装,电商换装,做了这么久 AI 还搞不定吗?结果就是搞不定。

但到了现在,你看谷歌的换装功能,英文一般叫 Try On,还有可灵的换装,已经慢慢变得非常成熟。到了这个时间点切进去,才能获得比较好的结果。

时机非常重要。

潘乱

我下午刚跟一个做跨境业务的朋友聊,他也是国内排名靠前的创业公司。他说,用他们的企业服务,跟自己拿一个 C 端模型去做换装,成本能够节省 90%。

这说明原来的企业服务收费可能确实太高了。

换装属于商品营销领域。代码刚刚起步,那视频呢?刚才大家都说视频是这次大会最大的亮点。Veo 3 的视频生成,加上原声音频和图像能力,可以认为谷歌现在的多模态是最领先的吗?

朋克周讲AI

目前看,我觉得肯定是第一梯队。不管是图片生成、视频生成,还是声音,它都很强。

刚才明浩老师也说了,可灵当然非常强,但 Veo 3 加入原生声音之后,相当于把这个战场拉到了另一个维度。

综合来看,Veo 3 现在绝对是第一梯队,谷歌在多模态领域已经是头部了。

挨踢牛魔王

Veo 3 主要是把 DeepMind 原来的 V2A 技术放到了产品里。它先从视频中提取信息,再生成声音。

这个技术他们其实已经研究了很久,只是这次真正产品化了。

NotebookLM 也是一样。技术可能很多厂家都有,但谷歌这次的产品力确实很强。它洞察到人性:原来大家喜欢的是两个人对话、不断追问和补充细节,而不是一个人在那里念稿子。

Veo 3 的声音对于后期制作也非常有效。以前我们生成的 AI 影片都是无声的,之后还要做配音,比较费功夫。

现在它可以直接把背景音做好。比如你在森林里下雨,雨声直接生成出来。之后你再给人物配音,整体效果就不一样了。

现在广告、营销、宣传片都有很多项目。比如有人要做奥运会相关的创意短片,可以做跳马、跑步、体操、乒乓球等各种运动。

以前的工作方式是“抽卡”:一个镜头可能要抽几百次,再从里面挑出好的,绝大部分都要丢掉,之后还要剪辑和配音。

Veo 3 出来以后,即使是一个很小的公司,或者一个小广告的导演,也可以综合制作出非常专业的片子,后期费用会节省很多。

以前不是节省不节省的问题,而是你根本做不出来,因为没有设备,设备又很贵。

Veo 3 现在当然还很贵,因为算力成本高。但根据摩尔定律,算力成本一定会慢慢下降。对于做项目的创业公司和导演来说,这个东西的帮助实在太大了。

以前可能要熬夜很久抽卡,才能做出一个片子。现在已经可以用它做出很多质量不错的片子。

所以前不久它跟可灵基本上还可以说是并列第一,现在它可能已经比可灵领先半步,达到这样的水平。

8. 谷歌会员重塑商业模式

潘乱

Gemini 具备多模态能力,又在 Agent 化。它还有可能产生哪些新的商业模式?

我的印象非常深刻,谷歌 CEO 特别强调“我们不是一家广告公司”,然后推出大会员。我感觉有点像谷歌版 88VIP。

我今年可能在朋友圈分享过一个观点:2025 年可能是大厂生态 AI 之年。像 88VIP 这样的生态,只有淘宝能做;谷歌这样的事情,也只有谷歌能做。

关键在于,你手里面到底是 To C 资源,还是 To B 资源。

前几年大厂挣钱是卖卡、卖算力,接下来可能是卖云服务,把大模型和云绑定起来,这是大厂能做的事情。

未来我可能不只是充值 GPT 的会员,去体验 GPT 里的模型能力。我可能会选择充值谷歌会员,心态也不一样:我不是在充一个 AI 软件的会员,而是在充一个生活助理和工作助理的会员。

充了一个会员之后,我可以在谷歌里面做视频、看内容、使用眼镜、获得搜索增强、购物体验和邮件处理。这一定会打败原来单个模型的会员模式。

过去从来没有一家公司的会员,可以把我的整个工作和生活都管理起来。这肯定是一种新的商业模式。

再小一点,比如 AI 视频相关的业务。我现在还没用到 Flow,Flow 还是用不了。我通过两三个渠道可以用到 Veo 3,但 Flow 用不了。

过去 AI 视频不太可控。如果 Flow 能把 Veo 3 变得相对可控,收入会非常可观。它就不只是 AI 视频爱好者的充值产品了。

可灵现在的盈利已经很强,快手也已经把它变成独立一级部门。如果 Flow 能够跟 Veo 3 结合,用户就不只是爱好者,还可能包括影视级创作者、营销人员、拍电影和拍剧的人,以及后期制作人员。

这个市场可能非常巨大。

庄明浩

我前天专门去了一家围绕可灵做生态的短剧公司聊。他们觉得,有了这些模型之后,以前没法拍的东西现在可以拍了。

比如可灵现在在推《灵蛇》和《山海经》。以前这些东西很难拍,但现在可以用 AI 去做。

我们当时还头脑风暴,中国还有哪些小说特别适合用 AI 开发,尤其适合做机甲等不是由真人拍摄的内容。

比如燕垒生的《天行健》,里面有蛇人、鼠人,还有很多过去没有被改编过的内容,非常适合用这些工具来开发。

但一问成本,还是扛不住。现在拍短剧,一部作品的成本可能也就是 200 万到 300 万元封顶。如果要拍 100 分钟,当前技术还不够,需要继续进步。

不过这个场景确实在拓宽。我们原来觉得可灵适合做玄幻,是因为它生成机甲等内容比较好。但 Veo 3 反而更适合做生活类内容。

它做机甲、科幻不一定最好,我用它做类似《流浪地球 3》的东西,效果有点变形。但它做一个富人在家做饭的生活场景,真实感非常强。

这会打开大家对应用场景的想象。我们本来就是根据模型能做什么,再去想应用场景。随着视频模型能力变强,可能会诞生更多场景。

朋克周讲AI

前两天我看到汉卿的 AI Talk 做的音乐短视频,已经不只是 MV 了。如果不仔细看,大概率完全可以以假乱真。

9. AI 眼镜重新成为入口

潘乱

这种多模态能力,跟谷歌重新推出 Google Glass 有关系吗?加上多模态能力之后,它可能会对未来的人机交互带来什么变化?

大家都认为可能会出现新的入口。因为苹果的隐私政策让 Meta 的股价一天跌了几千亿,小扎去寻找新入口,先找 VR;现在行业可能有一个小共识,就是 Glass,也就是眼镜。

谷歌会说,这件事我很熟,十几年前我就做过。今天加上 AI,再来一遍。再加上它最强的多模态能力,可能会有什么不一样?

挨踢牛魔王

当然有作用。

以前的 Google Glass,说白了是因为乔布斯重新发明了手机。谷歌虽然也做了 Android,但它非常羡慕手机这个入口,也希望做下一代手机平台。

很多人都在讲下一代计算平台。对谷歌来说,它想来想去,眼镜可能是比较合适的入口,所以做了 Google Glass。

但第一代 Google Glass 大家认为比较失败,缺点非常多,也不够实用。

有了 AI 之后就不一样了。当前 AI 有几个方面已经比较成熟:第一个是感知,比如多模态识别图片;第二个是听,也就是语音识别。

以前语音识别不够准确,现在即使你有口音,连续说很多话,AI 也能识别出来。它还具备知识和推理能力。

举个例子,假设我戴着眼镜,看到前方有一棵树。我想知道这是什么树,可以用手在前方点一下,就像操作手机一样。

它知道我想点的是前方那棵真实存在的树,然后立刻告诉我这是什么树,或者告诉我这朵花是什么。

现在已经有一些应用可以识别花,但你还要拿手机去扫描。如果通过眼镜直接看,就有点 AR 的感觉。

再比如开会的时候,你戴着眼镜,看到视频和现场情景,听到别人说话。它可以把整个会议过程整理成一份完整的会议纪要,你只需要看一眼,就能得到结果。

有了这种感知能力,Google Glass 可能会出现很多好的应用场景,甚至包括游戏。

本质上,AI 对手势和感官的理解已经接近人,甚至比人更准确。比如人脸识别其实属于上一代 AI 产品,但它已经比人厉害。

你可能见过很多人,碰到他却不知道他是谁。别人认识你,你却没认出来,别人提醒一句你才想起来,这种场景很尴尬。

如果眼镜里记录过这个人,它就可以马上识别出对方是谁,你就不会那么尴尬。

同样,很多 AI 硬件,比如手表、手环、摄像头、智能家居和 AI 玩具,过去做不到的事情,有了 AI 之后都可能做到。

我看过一个 AI 玩具创业者做的小狗玩具。它可以跟人对话,可以互动,可以走来走去,整个过程非常流畅。

以前做不到,是因为语音识别比较差,也没有足够的智能,互动会很呆板。所以 Google Glass 还是可以抢救一下的。

潘乱

我顺着这个问题再问一下。因为谷歌有最强的多模态模型,所以大概率 Google Glass 也会是最好的眼镜之一,可以这样推吗?

如果这样推,以后 Gemini 是第一梯队的模型,那 Pixel 会不会就是比 iPhone 更好的手机,甚至成为世界上最好的手机?可以这样推吗?

朋克周讲AI

我觉得眼镜有可能代替手机,但电脑可能有点难。

而且我觉得 AI 不只是拯救了谷歌的眼镜,还拯救了一批原来做 VR、AR 眼镜的厂商。很多厂商原来做得非常痛苦,有了 AI 之后立刻起死回生。

挨踢牛魔王

确实,实用性会非常强。

谷歌还演示了一个会议场景。比如我们有 4 位老师,潘老师讲中文,明浩老师讲英文,朋克周讲西班牙语,我讲印地语。

通过 AI,这个场景完全可以实现。谷歌已经做出来了,只不过产品还需要继续打磨。

以前即使实现了同声传译,也只是把内容翻译成文本。现在不一样,它可以在大家说话的时候,把其他语言全部翻译成你听得懂的中文,而且保留对方的音色和声纹。

你听到的还是这个人的声音,看到他的手势,感受到他的语气和情绪,但他说的是你的母语。

这个场景非常有效。不只是直播,国际会议也可以让每个人都讲自己的母语,最后每个人听到的都是自己的母语,效果完全不一样。

Transformer 最早就是从翻译场景发展出来的。看来翻译这个场景,在 AI 时代会逐步被彻底解决。

对于 AI 硬件来说,这种感知能力会让很多产品起死回生。以前大家觉得做不下去了,现在一下子翻身,甚至开始盈利,销量还很好。

我们如果不去做 AI 调研,可能会觉得 AI 很遥远,但实际上它已经在各种场景中发挥很大的作用。

10. 模型应用正面相撞

潘乱

下面进入下一部分,聊这次大会衍生出来的另一个问题:巨头和创业者,或者模型和应用的问题。

AI 重塑了互联网的搜索模式,今天这些 AI 创业者靠什么拼得过搜索巨头?当然,今天的谷歌已经不只是搜索巨头了。

之前很多 AI 创业者的共同选择是做浏览器插件。浏览器像一根电线杆,上面贴满了各种插件小广告,这是最流行的创业方向。

但这是不是也说明,AI 时代浏览器依然是入口?如果 Chrome 也把 AI 能力集成进去,其他人不就很尴尬吗?

庄明浩

第一,浏览器又成为兵家必争之地了。

Perplexity 在做浏览器,OpenAI 传说也想做。国内也不用说了,已经有好几家公司把浏览器做成了 AI 项目,原来的浏览器大厂也都在做。

浏览器这个古典互联网产品,摇身一变,成为 AI 最重要的场景之一。

还有一个很现实的问题:在美国,Chrome 最近面临一个非常麻烦的反垄断问题,到今天依然悬而未决。它可能会在某些程度上影响谷歌,但也不可能突然一锤子买卖,说今天必须拆掉,这个过程会拉很长。

浏览器这个战场又回到了一个不应该被忽视的位置。

国内也是一样。夸克做得这么好,原来腾讯浏览器看上去已经躺了,结果没过多久腾讯浏览器又跳出来说也要做,也要致敬一下。

你想想,腾讯浏览器团队在腾讯内部原来是什么优先级?今天它在内部的话语权、资源支持,肯定都变了,至少会提升。

之前大模型厂商更多集中在技术叙事,所以给了很多中小团队机会。如果执行够快,效果更好,体验做得不错,阶段性是可以获得不错收益的。

已经有很多中国团队得到了这种阶段性结果。但今天我们从技术趋势走向产品趋势,就会开始讨论一个没有结论的问题:到底是模型还是应用,还是模型即应用?

当这个问题被频繁讨论时,就说明大家越来越关注应用。这个空间确实会受到挤压。

但有一句话是:模型即应用,应用却不仅仅只有模型这一种。应用还有很多其他可能性。

最近有媒体的头条大概是“AI 互换产品经理”,大家期待用十几年前熟悉的产品和应用思维,去构建 AI 时代新的创业方向。

这个事情在 2025 年可能是期待,也可能是一厢情愿。

潘乱

好的产品经理不只是 AI 时代稀缺,过去的产品经理也很稀缺。

电商产品已经这么卷了,但很多产品真的很难用。比如我之前吐槽过搜索:在拼多多、美团、京东、淘宝这些交易型产品里,你搜索一个地址,它会给你展示卖地图册的商品。

你都搜索地址了,肯定是想修改自己的地址,或者看看自己使用的是什么地址。

我两年前吐槽过,后来各家陆续改过来了。上周我又搜了另外一个词:发票。

我搜发票,你应该知道我想要什么吧?我在一个电商产品里面搜发票,代表我想开发票。结果它给我出来一堆莫名其妙的商品页,开发票的入口特别难找。

我真的觉得,这不只是 AI 时代缺产品经理,过去的产品基本功也不太行。

以后用户问发票,系统可能会进行深度思考:他可能是想开发票,也可能是想买发票,但根据历史行为,他大概率是想开发票,然后直接跳出开发票界面。

朋克周讲AI

我觉得 AI 时代会提升用户体验。

我们之前用很多不好用的软件,有时候确实是产品经理能力问题,但很多时候是技术做不到。

假设一个界面有几百个参数,用户完全搞不定。后来我们把它简化成两个参数,看起来好用了。

但另外几百个参数并没有凭空消失,而是被做成默认值。系统默认这个参数是这样,那个参数是那样,最后用户只需要填两个参数。

这样虽然简化了界面,但在很多边缘场景里就会出现不准确,因为系统取的是平均值。

AI 不一样。它可以从你输入的文字,甚至你所在的场景里,自动推理出你真正需要的东西。

假设原来有 300 个参数,297 个被系统默认,只有 3 个让你填写,这当然比直接填 300 个参数好。但凡遇到那 297 个默认参数不适合的情况,用户体验就会出问题。

AI 可以把这些参数关联起来,推理出用户真正想要的东西。它可能知道内部怎么做,但用户用起来会觉得非常顺手:我只要说一句话,它就能识别我的意图。

很多软件未来会因此变得更好用。用户输入的一段话里可能有很多隐藏信息,AI 可以把这些信息都推理出来。

这可能会带来交互方式的革新,也是智能体和传统软件的区别:它可以推理出你的意图,以及整个链条,而不是让你填写几百个参数,或者简单地把几百个参数设成默认值。

潘乱

你刚才讲到智能体。前一段时间比较流行的是 Manus,大家自己做服务、做多个 Agent。

今天谷歌也提供了类似服务。在 Chrome 里面使用非常顺手、非常丝滑。Perplexity 之前讲的是 AI 搜索,现在很多搜索结果上面都覆盖了 AI。

我不知道它用的是什么模型,也没用过,但它确实已经覆盖上去了。

以前搜索引擎是一个连接器,是导航,是做分发的。现在它直接提供结果,把过程省略了,或者把过程也提供给你,直接把结果给到你。

原来的路径被缩短了,直接给你结果。这会给市场带来什么变化?

庄明浩

前段时间 MCP 很火,大家会讨论:模型、搜索引擎,或者其他服务,直接给出结果之后,用户会不会不再使用订酒店、订机票等产品?

用户可能直接让 Agent 给出结果。这就可能出现一种面向 MCP、面向 Agent 进行编程和开发应用的趋势。

从创业者角度看,AI 时代跟互联网时代非常不一样。

我们最开始其实也想做 App,但发现这条水太深了。稍微一不小心,就会被智能这条主线碾压,根本看不清哪些在智能主线之外,哪些在主线之内。

所以我们选择了一个相对取巧的方式,先做媒体。门槛没有应用那么高,但也不低,先在岸边看着大家前赴后继。

不过我们其实一直也想做应用。

对于创业者来说,这可能是文学里说的“最好的时代,也是最坏的时代”。

最好的是,现在开发应用的门槛真的非常低。我们今天在办公室搞了一个小型黑客马拉松,用 Gemini 和 YouWare 开发游戏、程序,两分钟就能做出来。

我开发了一个小卡牌游戏,真的能玩,我玩了五六局。

但另一个问题是,你又非常依赖大模型。如果没有模型,你的应用可能就变成了一个无法维持的东西。这可能是所有应用都会面临的问题。

最近有两个比较火的应用,也许会给大家新的思路。

一个叫“独响”,看起来有点奇怪,但说不定会成为未来人的一种心理状态。你可以在上面写朋友圈和日记,但里面没有真人,全是 Agent,它们会给你回复、评论。

这有没有可能成为未来的一种产品?你发一个朋友圈,AI 给你回复,你既分享了内容,也得到了回应,又不用遭受别人不认可或者反对。

另一个是 YouWare。过去 YouTube 是大家分享视频,未来 AI 把编程和开发应用的门槛降得这么低,大家可能会分享自己做出来的应用。

这也是一个非常有意思的方向。

挨踢牛魔王

刚才朋克周讲得很好,明浩也提到了。

现在对于大模型公司、传统公司和创业公司,都存在一个问题:如果谷歌这样的大厂去做大模型,创业公司怎么办?

我曾经讲过一句话:不要站在大模型前进的方向上。如果你站在它的前方,一定会被它碾碎。

为什么?因为大模型会吞噬一切。

以前有些公司做换装,用了很多工作流,搞得非常复杂,加班几个月做出了一个还可以的换装功能。结果新模型一出来,别人只需要一个模型、一个提示词,就能跟你做同样的换装。

那你前面买的设备、投入的资金、房租和水电费,全部都可能打水漂。

所以这是一个很危险的过程。

但我觉得可以换一个思路:一方面是大模型,另一方面是你的应用,也就是 Agent。应用和大模型结合,中间可能通过 MCP 这样的协议连接。

怎么判断你的应用会不会被模型吞掉?可以看你有没有找到这个行业的 know-how 和规律。

如果你找到这个行业的规律,最好还能直接用代码把它描述出来,那么大模型就不会轻易吞噬你。

比如爱因斯坦的质能方程,E=mc²。你找到一个公式,用代码写出来,大模型无论如何都很难达到同样的精确度,因为它本质上是一个万能逼近函数,只能逼近,很难完全精确。

如果你找到行业里的规律和关键诀窍,大模型就很难搞定。

第二个是成本问题。如果我在 CPU 上运行一套代码,把行业规律描述出来,或者代码和模型结合起来解决关键问题,那么成本会比大模型低很多。

绝大多数东西甚至全部跑在 CPU 上,CPU 成本比 GPU 低很多,甚至可以认为接近免费。你的云服务器跑代码,跟大模型用 GPU 的成本完全不一样。

即使大模型也能做,它的成本也可能打不过你;如果精确度又不如你,那它就没有意义。

这个世界上很多东西并没有完全消失。诺基亚手机也好,其他产品也好,在很多场景里仍然存在,唯一原因就是它便宜。

只要它便宜,就会一直存在下去。

潘乱

我们先不谈不利于创业者找方向的事情。因为有些方向还没有验证成功,不能直接告诉大家哪些在射程内、哪些不在射程内。

我们先把已经做得很好的热门赛道过一遍。

浏览器肯定在智能主线上,对吧?

庄明浩

肯定在。账户体系、同步、响应速度、安全和隐私,这些事情根本不是创业公司能染指的。

还有一个角度:2024 年的很多并购,其实是“掏空式并购”,不是真正意义上的并购。比如某些 AI 公司被收购,本质上是挖团队。

但今年 AI 领域的并购开始变得非常多,尤其过去几个月,出现了真正意义上的并购,需要花很多钱。

大模型厂商可能因为人力、资源和优先级问题,选择通过并购解决问题。这件事在 2025 年已经非常明显。

比如 Cognition 收购 Windsurf,之前还去问过 Cursor,因为它是 Cursor 的天使投资人,但 Cursor 不卖,人家已经有 100 亿美元估值了。

即便在主航道上,初创公司也可能有机会被收购。这非常现实。

2022 年底这一轮爆发到今天,已经过去 2 年多。在很多主航道赛道上,已经有独立公司做得不错,它们肯定有自己的价值。

当然,如果方向选错,可能过一段时间就走下坡路,这是很常见的。但如果在这个阶段选对了,也许还能继续往上飞。

潘乱

我看你发了几个例子。现在好像 10 亿美元已经不是一个多么刺激的数字了。

庄明浩

完全不是。

今天头部 AI 公司覆盖了很多方向。到底是不是主航道,其实没有标准答案,每个观察者、投资人和创业者都有自己的判断。

但凡成规模的 AI 公司,大家都会看 ARR。今天如果超过 1 亿美元 ARR,就可以算是一个不错的垂类公司。

一般在某个垂类赛道做到第一名的公司,可能会有 30 到 50 倍 ARR 的估值。这样一来,公司在一级市场可能已经是 30 亿到 50 亿美元估值。

它融一轮,出让 10% 的股份,就是几亿美元进去了。

Cursor 这一轮确定融资 9 亿美元,按 99 亿美元估值融资。Cursor 现在已经有 5 亿美元的 ARR 了,版本到今天才是 1.0,之前都是 0.x,未来还有太多事情要做。

这个战场已经变了。100 亿美元估值,真的太夸张了。

潘乱

其实我想说,现在真的没有任何东西可以确定不在智能主线上。AI 这几年一直在颠覆我们。

刚才牛魔王讲 know-how,我一直对 know-how 很感兴趣。我想,也许我不会被 AI 替代,因为我在自媒体或者其他领域有一点自己的 know-how。

但如果我的 know-how 被知识库产品吸纳,上传到里面,未来知识库产品也可以收费,我的东西可以卖给别人呢?

这些知识库产品壮大之后,上面会汇聚所有人的各种 know-how,会不会进一步生成行业模型?我觉得都有可能。

你真的很难预料,某个东西完全不在智能主线上。知识库产品和模型、Agent 结合,说不定会产生很多意想不到的东西。

我有一个朋友,之后可能要跟一个 AI 编程团队聊。他把所有 AI 编程创业者的访谈和相关素材,都放进 NotebookLM 里,一共有 56 个专访。

他把链接开放给我的时候,里面还做了很多笔记。你顺着那个兔子洞点进去,会发现里面的人都很懂这个行业。

100 个创业者把自己最真诚的梦想汇聚到一起,再从里面提问,这件事情非常有意思。

而且刚才明浩提到,早期真正做出推理模型的只有 R1 和 Kimi,但他们并没有拿到什么完整论文或文献。谁告诉他们这个 know-how 的?

他们只是根据 OpenAI 发布会里的一些蛛丝马迹,发现原来强化学习可以搞定推理模型。

你想想,这有多恐怖。他们只是发现了一根线头,就能照着 OpenAI 的 o1 去做推理模型。

所以未来有了这么多知识,再和大模型结合,真的什么都可能做出来。

AI 编程也可能很快给我做出一个像《小丑牌》这样的游戏。我玩了快一年,今天用 Gemini 两分钟就做出了一个能玩的版本。

未来可能真的没有什么是 AI 不能做的。也许最后只有手工拉面会成为稀缺品。我们看《银翼杀手》时,手工面条、真实的羊,可能会成为稀缺,其他一切都不再稀缺。

庄明浩

这好像又聊回了上次跟明浩老师聊的“智能平权”之后,人的差异是什么。

潘乱

这个问题一定会回到那些地方。

不过我们还是把热门赛道过一遍,这场就差不多可以结束了。

编程已经有非常确定的盈利,所以前面跑着巨头,大家还能接受。

视频生成呢?

庄明浩

视频生成绝对是大厂的事情,也是一将功成万骨枯。

潘乱

AI 视频呢?参与的创业公司还是很多。比如海螺,也就是 MiniMax 的视频模型,口碑也不错。PixVerse 最近在国内发布了国内版。

竞争还在打,但确实非常激烈,同一时间可能有六七家、七八家在竞争,其中一半可能是大厂。

庄明浩

提到 MiniMax,它的声音我觉得是最强的。

我一直很疑惑,现在国内外好像没有一个能真正打的,它的声音是最强的。可能因为声音这个领域我们也在做,所以关注得比较多。

商业化最强的是 ElevenLabs,它的 ARR 大概也有 1 亿美元;现在打榜最强的可能是 MiniMax。

我们做的过程中发现一个问题:我们不是一家专门在技术上特别强的公司,所以更多考虑产品化、应用和商业化落地。

但你会经常担心,声音这个领域在古典互联网时代已经被证明,可能不足以独立成为一个完整战场。

也许最后它会归属于某个更大的产品,因为视频会把声音包含进去。

潘乱

但刚才提到的录音设备,别人就是纯硬件和现金流,也能做出很大的生意。

所以这就回到一个问题:纯技术本身是一个维度,但落到产品化、商业化和收入获取方式上,是另外一种选择。

庄明浩

我们会使用各种模型,包括 MiniMax,因为它的声音效果最好。我们把模型能力封装成服务,卖给客户的是结果,而不是 token。

token 这个东西没法卖,因为大家都差不多。但我们可以针对细分场景,为某一类客户提供明确的交付结果,按结果收费。

我们肯定不是语音模型技术最强的公司,但希望能够探索更多场景,增长更快,收入更快起来。

其实美图就是一个很好的例子。它的模型不管图片还是视频,肯定不是最强的,但它现在能赚钱,而且是为数不多真正赚钱的公司,赚得还不错。

它可以直接交付给客户。它懂电商,也懂各种产品和场景,用户到它那里就觉得好用。

回到十几年前,在 App Store 里,个人开发者最喜欢做的应用之一就是相机和滤镜。因为用户付费习惯非常好。

模型本身可能不赚钱,但滤镜做得特别好,用户愿意付费。

潘乱

但也有变化。前两年聊声音赛道,可能会聊很多像 HeyGen 这样的产品。明浩,你现在还关注吗?

庄明浩

还在关注,只是没有以前那么猛了,但在细分板块里仍然可以做。

它现在也不只是声音,还做营销类视频,实际上是我们刚才讲的营销类视频生成,数字人、嘴型和语音结合在一起。

它打的是一个非常明确的商业化场景。只要客户越来越多,在细分品类里的品牌效应越来越强,收入越来越多,它大概率还会有一段不错的发展周期。

但你不会再期待它成为声音模型或者通用模型的最头部公司。它的故事已经收敛了,不是 Instagram 的故事,而是一个相机 App、一个美图的故事。

挨踢牛魔王

卖服务、做体验,这方面创业公司确实有优势。

模型训练需要算力、数据和算法,创业公司根本没办法跟大厂比。以前做互联网,一个人搭个 Apache、架个网站,就能提供互联网服务;现在算力太贵了。

所以创业公司应该往服务和体验上做,就像美图一样。它的图像模型肯定不是最强,但它可以做证件照、美颜等场景,用户黏性非常好。

美图这次也是 all in AI。它之前还有一些加密货币业务,后来都卖了,全部去做 AI,因为它认为 AI 对自身业务的促进非常大。

声音也是一样。训练声音模型的门槛,相比训练大语言模型低一些,但在大厂面前仍然不够看。大厂是航母,创业公司可能只是小艇。

但如果你把模型技术和对声音场景的理解结合起来,找到其中的 know-how,大厂就很难吃掉你。

因为你做的场景数据,大厂不一定有。对大厂来说,这些数据放进大模型里,可能只是边边角角,很难识别出来。

所以创业公司仍然有机会。

潘乱

听下来,模型能力其实已经有点过剩了。创业者不要再想着在模型本身上继续卷,而是要做好工具,把能力产品化,做服务交付,像谷歌今天做的一样,直接给你结果,把中间过程省略掉。

创业公司还是应该聚焦一个具体的问题。

挨踢牛魔王

对。

比如 Claude 4,Anthropic 也做模型,但它的评分并不总是最高。Claude 3.5、Claude 3.7 的评分有时也不是最高,但所有用它编程的人都知道,它的编程效果非常好。

评分高,说明数据和算力强。但为什么 Claude 的编程效果好?因为它的 CEO 对编程有自己的品味,对数据配比也做得非常合适。

这也是一条可以借鉴的路:如果你非常懂某个领域,就可以做到这样。

但如果有一天 AGI 真的到来,像 AlphaGo 一样通过强化学习把整个围棋领域彻底打穿,那就没有办法了,真的会吞噬一切。

庄明浩

所以这个问题延伸出来很有意思:当模型发展到这个阶段,连模型本身的评估都出现了问题。

新的 benchmark 一出来,所有模型都跟上了,benchmark 也就考不出来了。现在连红杉中国都要自己发布 benchmark。

传统意义上的 IQ、考试和各种评价方式,已经很难判断模型谁好谁坏。模型能力已经超出了原来的评估体系。

未来怎么评判这些模型,在这个时间点都出现了问题。

11. 创业者寻找新护城河

潘乱

反正这一部分聊的是大厂和创业公司。

创业公司可能更多需要做的是用好 API。它的门槛低,所谓人人都是开发者,就跟早些年人人都是自媒体一样。

其实也没有真的人人都是自媒体。门槛低,就意味着超级卷,但它也会开放更多机会,让更多玩家进入市场。

很多赛道会被重新定义。古人说三百六十行,行行出状元。今天医疗、健康,以及很多具体行业,都会被重新改造。

互联网最初也是从媒体开始改变,后来进入金融、二手车、汽车后市场、房产等行业。AI 可能也是由浅入深,大家还是要从自己的行业出发,多想想怎么结合。

庄明浩

中国创业者是一种情况,美国今年还有另外一个趋势。

既然大家都走到了 Agent 这一步,环顾四周会发现整个基础设施还差得很远,连协议层都存在很多空间。

我们现在构建的互联网生态是给人用的,从来没有考虑过给 AI 使用。AI 来了之后,要访问网站、调用数据库、走 API、SDK,这些东西都要重新设计。

AI 的身份怎么处理?数据库安全怎么做?权限怎么管理?支付怎么完成?

这些东西看起来都可以重新做一遍。所以最近一段时间,美国很多非常早期的初创公司,都在做服务 Agent 的基础设施。

这又引发了一个讨论:去年我们谈中美 TMT 主线的区别,中国在 To C 移动互联网侧很强,美国在 To B、SaaS 和云这边很强。

但今天这两条线可能要交汇了。

我们要理解和学习美国过去十几年积累的 To B 经验,包括交付结果、企业付费和订阅模式。反过来,美国公司也要开始研究和学习中国过去十几年积累的产品运营能力。

两边可能会找到一个合适的结合点,往前走。这可能就是 AI 时代正在发生的事情:交错、融合,再继续探索。

潘乱

朋克周,你做个总结,咱们今天差不多了。

朋克周讲AI

我的总结是,大家都不要焦虑,因为这件事情没有人遇到过。它一次又一次颠覆我们的传统。

前几年我们还在聊 scaling law,觉得预训练已经到头了。后来发现,预训练依然有很大空间。我们一次又一次被打脸,所以我觉得还是放松心态。

如果很多人焦虑,可以像我一样做自媒体,先不要下水。

我看到身边第一批做套壳,后来做数字人的人,我觉得这些机会最终都会免费。特别是在中国这么卷的情况下,最后很可能全部免费。

所以我们还在岸边观察,但也非常敬佩那些已经下水、去做各种应用的人。

潘乱

其实就是想告诉大家,不要焦虑。没有人知道明天会怎么样。

谷歌不知道,微软也不知道。奥特曼天天讲 AGI,但我觉得他应该也不知道。SSI 的创始人也天天讲 AGI,可能也有营销的成分。

挨踢牛魔王

AI 这一波发展确实非常快。

以前一家创业公司做一个应用,可能两三年后别人才能做出来。但现在模型一提升,可能直接把创业公司做的东西全部吞掉,所有努力都没了。

所以很多东西确实没人看得清楚。

但至少可以有一个原则:模型越强,你做的东西也应该越强,而不是模型一更新,你的产品就没了。至少可以用这个原则做判断。

另外,随着智能水平提升,需求还是会爆发。

蒸汽机发明之前,人类使用煤的数量并没有那么多。蒸汽机出现之后,不是因为全世界只需要几台蒸汽机,所以煤用得更少,而是因为很多地方都开始使用蒸汽机,煤的需求反而更多了。

智能也是一样。随着智能水平提升,过去很多我们觉得不值得改造、不值得做应用的地方,可能都会被重新覆盖。

以前用人编程序、做一个应用,成本太高,不划算。但未来这些细分市场、垂直市场和长尾市场,也可能被 AI 覆盖。

这对创业公司来说,可能也是一种机会。

潘乱

反正大家都可以积极尝试、积极参与。

现在国内很多 AI 还是免费的,为什么不用?不用真是白不用。

今天很多要素都没有变,但我一直有一个感受:如果你不熟练使用这些 AI 工具,必然会被那些更熟练使用 AI 的人剥削。

他们会在新的分配体系里占据更好的位置。我们暂时还没有看到特别多增量,更多还是重新分配。

庄明浩

我补两句,很短。

第一,我们回头看 OpenAI 定义的 L1 到 L5。今天所有人都在讨论 L3,但很多人没有注意 L4 和 L5 的定义:L4 是创新,L5 是组织。

无数经济学、商学教授都在讲,过去几次工业革命和技术革命,技术出现的当下,并不会立刻带来真正意义上的生产效率提升。

只有出现组织创新和商业模式创新之后,才会发生真正意义上的革命性变化。

我们似乎正在经历这件事情。我们这一代人可能是幸运的,能够亲身经历这种变化。

第二,我昨天接到一个任务。我女儿 5 岁,今年幼儿园在父亲节邀请几位爸爸去做演讲。我被分配到任务后,问他们想讲什么,我说给小朋友讲 AI。

但给幼儿园小朋友讲 AI,确实不太容易。后来我想到一个现在抖音上很流行的方式:用生成图片的方式,把孩子们未来想成为的职业做出来。

除此之外,我还想讲一个关键词,叫 lucky,也就是幸运。

英国科幻作家道格拉斯·亚当斯总结过 3 条定律,很多人都听过。

第一条,任何在我出生时就已经存在的技术,都是稀松平常、属于世界秩序的一部分。对我女儿来说,现在的 AI 可能就是这样的东西。

第二条,任何在我 15 岁到 35 岁之间诞生的科技,都会成为改变世界的革命性产物。他们未来可能还会经历一次这样的变化。

第三条,任何在我 35 岁之后诞生的科技,都是违反自然规律、应该遭天谴的东西。

当然,他写这 3 条定律的时候比较早。对我们这一代人来说,很多人已经超过 35 岁,但面对这次工业革命和技术革命,我们并没有觉得它违反自然规律、应该遭天谴,反而非常幸运地开始拥抱它。

我觉得这是一件很好的事情。

潘乱

这个总结非常有价值。

我们今天聊了两个小时,感谢各位。

Vol.65 AI新时代,Google又行了? | BidClub