[BidClub_]
苔藓之火 · · 64 min

53. 为什么不是谷歌做出了Muse?- Lewis|微软 / ex-Gemini

RaymondLewis

AI & SoftwareCompany BuildingTechnical
Podcast ↗
TL;DR
  • Muse 的领先首先是产品化胜利,而非底层技术突破:Claude Code 等工具早已能连接 Gmail,但 Muse 把“检查订阅、追医院邮件、处理退款”变成可点选的 idea,让普通用户第一次知道 Agent 能做什么。 Lewis 的概括是“它不是技术导向的,它是一个产品导向”;面对“Google 明明掌握 Gmail、Calendar 两条关键数据入口,为什么没先做”的问题,他直接回答:“Google 太慢了”,并认为 Google 长期较为 reactive,更多是在跟随市场做 countermeasure。

  • Google 在大模型战争初期把 OpenAI 当作主要对手,资源因而集中于 consumer、模型 benchmark 和“更 fancy 的 demo”,反而给了 Anthropic 从 core engineering 与 enterprise 切入的机会。 Lewis 认为 Anthropic 的下注是:“我们不搞你们这些花里胡哨的,我们就 bet core engineering、bet enterprise。”当这条路线被验证后,OpenAI 和 Google 又转向 coding 与企业相关产品,说明产品选择也会改变竞争位次。

  • 企业 Agent 真正难题不是聊天框,而是 memory、knowledge、permission 与 context graph 的组合。 微软的优势在于 SharePoint 沉淀了海量 PPT、文档和内部数据,但员工、双人对话、团队、公司拥有不同权限;如何把一次成功 trace 沉淀成 procedural memory,又只把安全内容从个人层“promote”到团队层,决定了 Agent 能否从个人玩具变成企业基础设施。

  • Personal Agent 的关键数据入口是 Gmail、Calendar 与长期行为数据,这也让隐私信任成为核心门槛。 Lewis 因 Instinct 条款允许使用其访问的数据而拒绝尝试,却愿意用 Muse;他同时提醒,用户不信 Zuckerberg,不等于就该相信一家刚成立的 startup。“基本上你是谁、你做什么,里面都有”,既是个性化价值,也是 Personal Agent 的风险。

  • 美国开放 API 给 startup 留出了 Muse 的窗口,中国的 walled garden 则让 Agent 机会更容易受限于超级 App。 Google 的原则更接近“数据是用户的”,所以第三方能调用 Gmail;微信、小红书等平台的数据彼此隔绝,导致用户像面对“十个人站在那里”,必须逐个询问。微信更有机会做通用型 Personal Agent,其他玩家则可能凭搜索、消费和兴趣数据做垂直 Agent,但中国的数据割裂使跨生活、工作与偏好的统一助手更难出现。

  • To C Agent 很难靠 200 美元入场费或一次性退款建立稳定 LTV,更合理的早期路径是 freemium 加 token 计费;To B 则能按可测量的生产率定价。 Lewis 的检验是:“那两百块钱是解决了问题来 charge,还是只不过让别人先付了这么多 token?”退订、price match、refund 单次很有用,却未必重复发生;企业 workflow 反复运行,可直接用节省工时和员工 hourly pay 算 ROI。

  • 隐私、安全、推理成本与芯片路线共同把 Personal Agent 推向本地:约 1.2 万美元的高配 Mac Studio,Apple 官方称其可运行 trillion-parameter 模型,网上也已有运行案例;千问 27B 已足够覆盖大量 day-to-day 任务。 Lewis 判断“Edge Compute 的时代已经到了”,并引用芯片从业者的路线判断:六七年后,今天不少云端模型可能跑进手机。真正未解的问题不是硬件能否承载,而是谁能把安装、权限和任务执行做成“一键可用”的软件体验。

  • Lewis 仍相信 Gemini 会赶上,但发布节奏已成为结构性负担:一个新模型至少要期待维持一周 SOTA,而竞争对手几乎每隔几天就刷新标杆。 Google 的科研底子、合规与不滥用用户数据是长期资产,也可能是短期速度劣势;DeepSeek 带来的冲击则显示,开源仍能贡献真实 innovation,但行业竞争窗口已从“六个月、三个月”压到可能“发一篇 paper 就只剩一周”。

Digest · the substance, structured for research

1. Lewis 从云计算早期一路走到大模型产品化前线

  • Lewis 大学学习 computer science,毕业后先做 software engineer,随后带团队参与 Oracle public cloud;他记得 2011—2012 年左右,AWS 的服务仍主要围绕 EC2 和 database,整个行业才刚开始接受“所有东西都要上云”。

  • 做了七年多基础设施后,他转入 Google 并改做产品经理,因为自己“对做什么比怎么做可能更感兴趣”。在大模型浪潮前,他连续参与三四个 AI 产品的零到一,随后成为 Google 最早一批把大模型产品化的人。

  • 2022 年八九月,Lewis 加入 PaLM 2 相关项目;团队与 Labs 合作,把只有 pre-training、几乎没有 post-training 的 research model 针对 use case fine-tune,再完成 API serving、定价和 developer community 建设。最初核心团队只有八九个人,启动时间比 ChatGPT 发布早约三个月。

2. 大模型最早解决的不是聊天,而是 Document AI 的泛化瓶颈

  • Lewis 用 Document AI 解释当时的产品动机:每个人、每家公司文档都不同,如果为了达到 99.9% precision 而“每一个文档 train 一个模型”,效率会很低。真正的问题是,能否训练一个模型去 generalize、处理所有文档。

  • 因而 Google 内部早已在寻找“更加泛化的智能”;ChatGPT 的突破不只是技术,而是把原本偏 To B 的能力带到 consumer,让普通用户通过问各种问题第一次感到“AI 的时代来临了”。

3. ChatGPT 暴露了 Google 从 research 到产品发布的断层

  • ChatGPT launch 后,Google 内部并非毫无准备:公司已有 Mina 之类的 chatbot,且做了很长时间,但因 legal、responsible AI 等原因没有公开。另一派也承认,OpenAI 的模型在很多场景里“更像一个跟人的对话”,实际体验优于 Google 当时的内部产品。

  • 危机感来自两层:模型技术是否达标,以及能否“把一个 research 的东西变成一个 API,然后用户来用”。Google Brain、DeepMind、Google Research 当时资源分散,随后为追赶 OpenAI 才进行资源集中。

  • Sergio 的介入是渐进式的:从偶尔参加季度会,逐渐到月会、周会和每天的 stand-up,也会在聊天群里追问技术细节和预报。Lewis 的形容很直白——创始人在群里 @ 你,已经是足够强的鞭策,“强度不能再大了”。

4. Gemini 2.5 Pro 的高点,反而成为 Lewis 离开的时点

  • Lewis 在 2025 年夏天、Google 发布 Gemini 2.5 Pro 后离开。原因之一是模型产品化的主要道路已经铺平:API、定价、use case 和 developer community 都相对成熟,接下来更多是“卷模型、卷 benchmark”。

  • Raymond 用水厂作比:智能是水,产品是水龙头;水龙头的形态、大小和颜色逐渐被定义后,竞争转向水质、价格和 model architecture。Lewis 认同这已更接近 research 的战场,自己则想进入一个仍未被定义的新问题。

  • 另一个原因是组织膨胀。Gemini 成为全公司 priority 后,参与者与管理层越来越多,中间层有时会“withhold information,这样的话他们的存在才有意义”,协作遂变成“传话的游戏”。

  • Lewis 没有直接创业,而是选择微软,因为微软在 enterprise 用户、内部数据和开发者生态上有独特位置;与其继续“卷水龙头”,他更想解决 Agent 怎样安全利用企业知识的问题。

5. 微软的 Agent 机会建立在企业知识,而非操作系统

  • Lewis 听到的内部量级判断是,SharePoint 中的数据“是整个互联网的很多很多倍”:大企业积累了大量 PPT、文档和内部记录,却通常没有 Google 级别的 search engine,许多数据存在但实际找不到。

  • 他在微软负责两块:Agent memory,以及为 Agent 提供 knowledge;后者进一步涉及 context graph,目标是让 Agent 更高效地访问海量企业数据。

  • 这些能力面向开发者,并不限定 Windows。无论最终产品运行在 Mac、Windows 还是 Web,都可以调用同一套后端,保存个人 preference、历史 memory 和可检索知识;微软提供的是一套后端能力,而不是单一终端应用。

6. Memory 的价值既是个性化,也是让 Agent 自我改进

  • 第一类 memory 让 Agent 知道“你是谁、做过什么、之前聊过什么”:它可以记住 Lewis 上次的对话,或主动提醒尚未追踪的 refund。这在 customer support 与长期助理场景里尤其直接。

  • 第二类是 procedural memory。Agent 执行任务时常常“试了一个东西 fail 了,再试另外一种”,大量 token 被浪费;系统若能读取历史 trace,识别过去的 failure 与成功路径,下次便可直接选择更有效的方法。

  • Lewis 认为 procedural memory 与 skill 差别不大:前者是要浓缩的解决问题经验,skill 是一种呈现形式。同一类经验既可以做成 procedural memory,也可以存成 skill。Agent 的 self-improvement 需要先把运行轨迹沉淀为可复用资产。

7. 企业 Memory 的核心难题是多层权限与知识晋升

  • C 端 memory startup 通常只区分用户 A 与用户 B;企业里则完全不同。CEO 的 memory、开发者排查 bug 时的上下文和普通员工的对话必须有严格 enforcement,开发者不能因排查 bug 就读到 CEO 的私人上下文。

  • Memory 同时存在个人、双人 chat、team 和 company 多个层级。Lewis 举例:两名员工讨论工作形成的知识,不应永远只属于两人;但哪些内容可以 consolidation 成团队资产,哪些必须留在原层级,是大量 corner case 的来源。

  • Raymond 用飞书举例:员工离职后,主管可以接管其文档,却无法真正继承聊天中更高价值的隐性上下文;即使拿到三个月、数百万字的聊天记录,也没有人能读完。Agent 的价值正是提炼,但提炼不等于自动获得传播权限。

  • Lewis 的当前原则是先由模型抓取候选信息,再询问当事人能否“promote 到下一个级别”。因为隐私边界难以自动判定,什么内容进入 team 或 company memory,应该由对话当事人决定。

8. 全透明协作降低权限复杂度,也会改变员工行为

  • Raymond 提到 Shopify 的做法:员工与同一个 Claude Agent 交互,相关窗口对组织开放。它的好处是知识天然共享,不必再解决复杂的 access control;代价是员工从一开始就知道内容会被其他人看到。

  • Lewis 的提醒是,一旦每个 chat 都像“有一个人看着你”,员工就不会再用它谈私人问题或随意闲聊,体验接近“老板站在你背后一直盯着你干活”。被监控感会把真正的交流赶到 WhatsApp、微信等第二窗口。

  • 对大多数企业,他判断私人聊天仍不能被无故读取;通常只有 harassment、unfair workplace 等正式 investigation 才可能触发访问。AI-native 的 30 人公司可以靠共享群聊运转,十万人公司却不可能照搬。

9. 模型部署位置决定隐私承诺是否真正可执行

  • Raymond 提出,Anthropic 等模型供应商可能逐行查看用户数据,追问更尊重员工隐私的微软是否会在竞争中吃亏。Lewis 的回应是,这首先取决于企业 policy:若公司明确要求查看员工数据,员工至少可以选择是否加入,但普通企业很难合法地任意读取私人 chat。

  • 对 hyperscaler 而言,OpenAI 或 Anthropic 模型可部署在企业自己的 cloud wall 内;Lewis 称这种情况下模型不会被 log 或记录。主持人把它戏称为“一万亿美金买回来的 privacy”。

  • Lewis 同时保留不确定性:各家公司都会在纸面上承诺不看、不记录用户数据,但是否严格执行,外部人“没有人能知道,除非是内部的人”。这正是 Personal Agent 信任无法只靠条款解决的地方。

10. Muse 胜在把已有能力变成用户看得见的任务

  • Lewis 的使用路径从 OpenClaw 开始;2.0 升级后频繁 break,migration 也失效,他便让同一 virtual machine 里的 Hermes 抓取全部旧数据,随后 all in Hermes。Hermes 虽强,却仍需用户自己维护环境。

  • Grok Bot 面向 pro 用户,却因 security 把 VM 封得过严:代码生成后,用户无法直接访问网站或虚拟机内容,只能在内置 browser 查看或下载 artifact。Lewis 的比喻是,“你以为买了个电脑,后来发现只买了一个屏幕”,没有鼠标键盘去操作。

  • Muse 则像普通 App,presentation 完整,尤其是 idea tab:它不仅列出 Agent 能做什么,还会根据用户 context 建议任务。对面对空白 chat window、不知道该输入什么的普通人,这个 discovery layer 本身就是产品价值。

  • Raymond 的亲身例子是,Muse 一获得 Gmail 权限,就发现他需要跟进医院,把十几人往返的长邮件线程整理出来。技术上 Claude Code 也能连接 Gmail,但过去用户得先在 YouTube 找教程、复制 prompt;Muse 把它变成一个“点一下退订”的明确选项。

11. Gmail 与 Calendar 既是数据入口,也是信任闸门

  • Raymond 说明,美国大量生活事务依赖 email:医院预约、儿童报名、insurance 追款、信用卡 chargeback、订阅取消都留下邮件轨迹。连接 Gmail 与 Calendar 后,Agent 基本能够了解“你是谁、你做什么,里面都有”。

  • Lewis 因 privacy 拒绝尝试 Instinct:按他读到的条款,平台有权使用所访问的数据,甚至可能拿 email 去训练模型或改进产品。Muse 有自有模型、Instinct 主要做 Agent 加 memory,但对 Lewis 而言,是否有模型不改变授权风险。

  • 在 The Information 的 conference 上,主持人询问多少人相信 Zuckerberg,现场表现出强烈不信任。Lewis 的反问更尖锐:用户不愿把邮箱给 Meta,为什么会自然相信一个刚出生、背后团队尚不熟悉的 startup?

12. Google 没先做出 Muse,是因为“太慢了”

  • 面对“数据都在 Google,为什么不是 Google 做”的问题,Lewis 的第一反应是:“Google 太慢了。”他认为外界看到的 Google 经常比较 reactive——市场出现某种产品,公司再做 countermeasure。

  • Gemini 时期,Google 把 OpenAI 当作最大敌人;OpenAI 强在 consumer,于是大量 energy 用来做更好的 Web application、更 fancy 的 demo 和更讨好用户的模型表现。这一聚焦使两家公司都忽视了另一条产品路线。

  • Lewis 对 Anthropic 的评价是一次成功 product bet:“我们不搞你们这些花里胡哨的”,而是押注 core engineering 与 enterprise。路线验证后,OpenAI 砍掉不少 To C 尝试、重新强化 coding,Google 也开始追赶。

  • Ubiquitous assistant 两年前已出现在 Google I/O 与 Gemini/Bard 的产品定义中,但迭代速度“不够看”。他听到 Google 内部已有类似产品、可能很快上线;问题从来不是没人想到,而是没有足够快地完成迭代和发布。

13. 大厂可以后发,但开放 API 不会轻易关上

  • Lewis 认为 xAI 的 Grok Bot 打响了第一枪,但 200 美元订阅且没有解决足够实际的问题,他很快放弃;相较之下,Meta 花了很长时间在内部 build 和打磨自己的产品,正式出手更有效,下载量也已超过 OpenAI,成为 App Store 第一名。

  • Raymond 担心 Google 会否为保护自身 Agent 而封锁 Gmail 与 Calendar。Lewis 判断“不太会”:Google 文化总体更开放,大量产品建立在其 API 之上,而公司对数据所有权的基本定义是“这个数据是用户的”。

  • 这也形成大公司的两难:Raymond 认为 Google 自己发布要面对 compliance、错误建议和 privacy liability,小公司则能更 aggressive 地跑;但若大厂通过封 API 消灭后来者,也会破坏其长期生态定位。

14. 中国的 Walled Garden 把通用 Agent 变成平台权力

  • Lewis 使用 Muse、Hermes 等 Agent 时,最想接入的是微信数据,但微信几乎完全不可访问;他登录的小红书网页版有时还能让 Agent 读取内容和账号 stats,Raymond 则表示自己会被强制登出,微信更是关闭了网页版入口。

  • Raymond 把中国移动互联网的遗产概括为 walled garden:每个平台内部体验完整,彼此却不互通。结果是前十几家互联网公司各自拥有知识库 Agent,用户面对的像“十个人站在那里”,只能分别去问,不能派一个总 Agent 横向调用。

  • Lewis 认为 Personal Agent 需要两类关键数据:用户的 context,以及由搜索、浏览等行为表现出来的 preference。小红书因此有机会从“吃什么、怎么玩、怎么娱乐”等兴趣和消费场景切入;但中国的数据割裂了生活、工作与偏好,startup 可能更适合先做某个垂直领域。

  • 这也解释了市场为何仍相信腾讯:即使模型进展慢,微信的关系链和小程序生态短期无法替代。腾讯甚至可以等美国 Personal Agent 打完一轮、产品形态收敛后再复制,因为核心入口不会因此消失。

15. Personal Agent 的商业模式不能只靠一次性省钱

  • Muse 采取免费使用加 weekly limit,超过后再付费;Lewis 认为这比 Grok Bot 的 200 美元入场费合理,因为用户尚不知道 Agent 能做什么,先收高价很可能带来极低留存。

  • 他进一步追问:“那两百块钱是解决了问题来 charge,还是只不过让别人先付了这么多 token?”如果产品主要是 OpenClaw-inspired、竞争者都能复制,预收 token 并不等于建立护城河。

  • Refund、退订、price match 和找到便宜商品都可按结果分成,但往往是 one-off:Agent 成功取消一次订阅后,下个月未必还有同类任务。“单一 task 上看起来有用”,不代表长期 LTV 能成立。

  • Muse 若通过购物 commission 免费,平台冲突也会立刻出现;Raymond 提到 Amazon 已屏蔽 Muse、Instinct 一类 Agent。商家希望真人进入自家页面消费,不愿第三方 Agent 控制流量、选择和抽成。

16. To C 应按使用量收费,To B 才能按 ROI 定价

  • Lewis 把两类市场拆开:To C 早期更适合 freemium 与 token-based pricing,使用更多才付更多,用户容易理解。Raymond 补充,若广告模式成熟,产品也可能依靠广告而不完全依赖 Freemium。

  • To B 的 workflow 更重复,也更容易衡量。企业可以用员工工资除以工时,计算 Agent 节省了多少小时,再按 productivity improvement 定价;这种可测 ROI 比“帮个人少操一点心”更容易支撑稳定预算。

  • 长期看,frontier model 的 price per intelligence 会继续下降,智能可能像水电一样 commodity 化。大量日常 reasoning 可在本地完成,只有癌症研究或复杂 coding 等 frontier task 才需要发送到云端。

17. 本地模型已经可行,欠缺的是一键可用的软件层

  • Raymond 将端侧模型与近期 Agent 安全事故联系起来:人们还不清楚 Agent 做了什么,因而希望通过本地运行获得更好的控制和隐私。Lewis 判断“Edge Compute 的时代已经到了”:最高配 Mac Studio 的官方商业广告称其可运行 trillion-parameter model,网上也已经有人跑出来;价格约 1.2 万美元。NVIDIA DGX Spark 也提供了本地算力设备。

  • 对日常任务,他最喜欢的例子是千问 27B:只要不是极复杂 coding,已经足以覆盖大量 day-to-day 需求。账单、发票和个人事务不需要 trillion 级模型,也不需要每次把隐私数据发到云端。

  • Lewis 从芯片行业得到的判断是,模型能力虽难预测六个月,硬件 roadmap 却能看到六年;六七年后,今天不少云端模型可能跑在手机上。正如手机从只能显示卡顿 GIF,发展到播放 4K、6K 视频,从贪吃蛇走到《原神》。

  • 苹果与 Google 都可能选择后发先制,但机会仍在软件体验:用户买回 Mac Studio 后,是模型自动运行,还是还得安装环境、配置 API、处理权限?OpenClaw 安装服务在闲鱼能卖到 500 元一次,说明“本地可跑”距离“普通人可用”仍有产品鸿沟。

18. Gemini 有底子追赶,却被 SOTA 时钟和保密竞争夹住

  • Lewis 对 Gemini 的结论仍是“会赶上的”,因为 Google 的 research 底子和人才储备依旧很强;短期压力在于 Google 五月时就说要发 Pro,到十月仍未推出,新版本至少必须追平届时的顶级模型。

  • 模型发布已变成节奏博弈:一家公司发正式版 Flash 或 Lite,可能同时有十家发布产品,每两天又出现一个新版本。Raymond 的说法是,任何头部模型都期待“至少 SOTA 一个星期”,否则可能选择继续训练,发布日期便不断后移。

  • DeepSeek 出现时,Lewis 说他们做模型的第一件事是读 paper、验证技术;他认为共识是“它是有料的”,并非完全依靠 distillation,其中有美国这边当时尚未采用的新 techniques。开源 paper 让行业得以“互相学习和成长”。

  • Lewis 只为自己在 Google 的时期作证:团队不 log 用户数据,也不拿别家模型数据训练。他无法替其他公司判断是否存在不同做法;但对 Google 而言,必须内部寻找新数据,过度守规矩也可能成为速度劣势。

  • 随着技术领先期从六个月、三个月压缩得更短,头部公司越来越少发 paper、blog,也更少允许员工参加非官方 podcast。Raymond 判断,某个瓶颈方向的人可能只有约 18 个月最关键窗口;秘密一旦公开,“本来能保六个月,发一篇 paper 可能就只剩一周”。

Full transcript
Raymond

今天很高兴邀请到 Lewis。他之前在 Google 是 Gemini 时代非常早期的 founding product manager,后来在 Google 处于最高峰的时候离开,去了 Microsoft。最近我在听他的播客《硅谷温差》时,又听到了很多他对于 personal agent 的看法,非常有意思。

他经历了从 Gemini 时期到 Microsoft,再到今天观察新的 personal agent,拥有非常丰富的 C 端和 B 端产品经验。今天我们想请他帮我们回答一个问题:在 personal agent 非常盛行的时代,为什么不是 Google 先做出 Muse 这样的产品?

欢迎 Lewis。要不要先简单介绍一下你之前的背景?比如你的教育经历、什么时候去了 Google,以及什么时候去了 Microsoft?

1. 从云工程走向大模型

Lewis

我大学学的是 computer science。毕业之后,我一直在湾区工作,最开始做 software engineer,后来带团队,做的是 Oracle 的 public cloud,也就是公有云。

那个时候整个行业还比较早,AWS 只有 EC2 和 database 这两个 service,所以从那时候开始,大家逐渐接触到所有东西都要上云。那应该是 2011 年、2012 年的样子,很早,很早期了。

Raymond

那时候云就只有两个服务,对吧?一个是 compute,一个是 storage,也就是云盘。

Lewis

对,那时候基本上就只有云盘。大概做了 7 年多之后,我去了 Google,也正好转做产品经理。可能我个人对“做什么”比“怎么做”更感兴趣一点。

去 Google 之后,我就一直开始做和 AI 相关的产品,基本上都是从 0 到 1。大概做了 3、4 个产品之后,大模型时代就来了,我突然转去做大模型。在 Google,我算是第一批把大模型产品化的人。

Raymond

我看到你之前的经历,应该是 2022 年加入 PaLM 2 这个组。PaLM 2 是一个项目吗?

Lewis

它是一个项目。最开始 Google 有一个组叫 Labs,实际上是两个组合作,去把 research 做出来的大模型产品化。

那个时候的大模型只做了 pre-training,post-training 什么都没有做。所以我们需要思考用什么 use case 去 fine-tune 这个模型。我们和 Labs 的两个 team 合作,把当时的 API build 出来,然后把模型 serve 到 API 上,做定价,以及思考怎么解决客户的问题。

Raymond

你说的这个时间不是在 GPT 出来之前,对吧?是在 GPT 出来之后?

Lewis

对,但是其实我们开始的时候是在 GPT 发布之前。GPT 发布前 3 个月,我们就已经开始做这个工作了。

Raymond

那个时候大家都在湾区,也听到了一些 rumor,说有些人在做大模型,Google 其实也有。所以你们马上就要 drop everything,然后 work on 大模型。

Lewis

对。我是在 8 月、9 月的时候开始做大模型的,然后 12 月 ChatGPT,也就是 GPT-3.5,launch 了。反正那就是新时代的开始。

我们 7 月、8 月开始的时候,只是希望在年底之前把这个模型跑起来,让全公司内部都可以用上,做 dogfooding。当时整个团队只有 8、9 个人,非常小。

Raymond

我很好奇这个部分。我们今天看大模型已经很容易理解了,现在全中国可能一半的人都在用豆包,美国的渗透率也非常高。现在我们使用模型,已经到了一个非常极端的场景,很多人在不同地方使用模型。

但在 2022 年 8 月到 12 月这段时间,其实还是大模型出现之前的史前时代。如果当时拉一个组、做一个项目,那个 leader 要怎么和员工沟通?要怎么告诉大家我们要做什么?那时候应该很难具象地描述吧,因为你已经是产品经理了。

2. 大模型的史前时代

Lewis

其实“大模型”这个东西本身,也是那个时候大家才定义下来的。但在此之前,我们内部已经有很多想法,想要做类似的事情。

举个简单的例子,在做大模型之前,我们有一个产品叫 Document AI。它主要是处理不同的文档,比如理解文档说了什么,提取里面的重要信息。

我们遇到的最大问题是,每个人的文档都不一样,每家公司的文档也都不一样。如果每一个文档都要 train 一个模型,就非常 inefficient。为了达到 99.9% 的 precision,你要针对每个文档训练一个模型。

那有没有可能做一个模型,让它能够 generalize,去处理所有的文档?其实我们当时想的就是更泛化的智能,或者说泛化智能。所以那个时候,我们内部已经开始做这些事情了。

只不过 ChatGPT 时代做的是 consumer。它从工业界、从 To B 的场景出来,让用户第一次感受到:“原来 AI 的时代来了。”大家开始问各种奇奇怪怪的问题,比如 Strawberry 里面有几个 R,然后就会觉得很好玩,开始传播起来。

Raymond

那时候是不是也正好是 Google Brain 和 DeepMind 合并的时候?

Lewis

具体时间我有点忘了,确实不是那个时候。那个时候还是 Google DeepMind、Google Research 和 Google Brain 三个组织,等于有三套资源分开在不同的地方。

第一代模型并不是 DeepMind train 出来的。后来大家觉得要追赶 ChatGPT、追赶 OpenAI,就进行了大的 rework,把资源集中起来了。

Raymond

最开始的 ChatGPT launch,大家都会觉得这个做得非常好。我们内部当时其实在一定程度上也有两派。一派是我们内部有一个东西叫 Mina,这个 Chatbot 在我们内部已经做了很长时间,但因为 legal、responsible AI 等各种原因,没有把它发布出来。另一派会觉得 OpenAI 的模型在很多场景下更像是和人的对话,比当时 Google 内部的产品要好一些,所以大多数做这一块的人还是有一种危机感。一方面是产品技术达不达标,另一方面是产品化能不能真正推到市场上,能不能把 research 的东西变成 API 让用户来用。

我这个播客的名字“苔藓之火”就是当时的 Bard 取的。Bard 应该是 2023 年的模型。我也不知道为什么是 Bard 取的,可能是因为当时用过 OpenAI、GPT 这些产品,只是刚好 Journey 取的名字比较好,当时比较喜欢,所以就取了这个名字。

所以当时的环境是 Google 在这件事情上落后了,Anthropic 还没有追上来,创始人非常焦虑,冲回来开始……那时候创始人还没有回来。

Lewis

那时候大家还是比较有信心的,觉得可以追赶过来。因为 Google 的科研背景底子很厚,所以有很多东西拿出来我觉得都可以做到。

Raymond

所以 Sergio 回来的时候是怎样的?

Lewis

他也不是一下就回来了,我觉得是间断性的。因为他不住在加州,有一些税的问题,所以可能只能回来一段时间。现在可能在这边的时间更多了。可能从一开始参加季度会,变成参加月会、周会,然后 stand-up meeting every day。多数时候他会出现在聊天群里,问一些细节的技术问题,也会问一些预报,所以可以逐渐看到重视的程度。

Raymond

就是 Google Brain,如果在群里面艾特你问问题,那已经足够鞭策了。

Lewis

对,不可能再有更大的强度了。

Raymond

合并应该是 2023 年的事情。也就是说,2022 年 8 月你进组开始做这件事,到 2023、2024 年,最后你是在 2025 年夏天离开的。中间你在这个组里待了 3 年左右。

Lewis

对,我是在 Google 发布 Gemini 2.5 Pro 之后离开的。

Raymond

也就是说,那时候是真正的最高峰?

Lewis

是的。

Raymond

你从高位离开,真的很厉害。方便问一下,为什么当时会做这个决定吗?

Lewis

我觉得有几个原因。

3. 离开 Google 的理由

第一个,对于一个产品经理来说,大多数路已经铺得差不多了。我们最终最关心的,无非是怎么产品化、怎么定价、做什么样的 use case,以及怎么建立 developer community。这些事情其实已经做得相对成熟了。

后面更多是卷模型、卷 benchmark。我会觉得,去做下一个更前沿、还没有被确定下来的东西,可能更有意思。所以后来我选择去 Microsoft 做 agent 和 knowledge。

Raymond

是不是可以这样理解:模型智能是水,你做的产品是水龙头。水龙头的形状、粗细、大小、颜色,这些可能已经被定义下来,或者最优解正在慢慢被探索出来了。

但水的价格、水的质量、纯净程度,还有很大的变化空间。所以现在可能是卷水、不卷水龙头的时候。这完全是另外一波人的事情,是在水厂里的事情。

Lewis

对,我觉得这很多是 research 自己的事情。他们要把模型迭代好,寻找新的 model architecture。

Raymond

我记得当时在你的博客上看到过一句话:你在 Google 工作的时候,发现指令上传下达出现了一些问题。

Gemini 到后期变成了整个公司的 priority,很多不同的人都会加入进来。这样一来,中间的 layer 就会很多,很多时候会变成传话游戏。中间的大领导可能会 withhold information,因为只有这样,他们的存在才有意义,这就导致很多事情变得不 efficient。

这让我想到很多公司的问题,比如阿里云的问题,也包括之前我的播客里提到的腾讯大模型和总办之间的关系,以及腾讯现在混元模型和微信模型之间的关系。很多大公司都会遇到内部内耗的问题。

公司变大之后,很多人都想创造价值,但反而可能把路堵死,让工作体验变差。这是不是你选择换一个新的地方的原因之一?

Lewis

对,这是其中一个原因。

Raymond

但为什么后来选择去 Microsoft?这件事其实很有意思。你参与了 Gemini 从 0 到 1 的 founding PM 过程,相信在这个过程中探索过非常多不同的产品形式,知道什么东西 work、什么东西不 work。

很多人可能会在这个时间点选择去创业,或者加入创业公司,把这些 know-how 产品化。为什么当时没有做这个,而是选择去 Microsoft?

Lewis

其实当时也犹豫过。去 Microsoft,我觉得它有一个独特的、做企业产品的护城河。

它大部分用户,在很大程度上还没有开始使用 agent 和模型。其次,对于企业用户来说,它的数据量非常大。

后来我了解到,Microsoft SharePoint 里的数据是整个互联网数据的很多很多倍。

Raymond

这是因为他们写了太多 PPT 吗?

Lewis

有很多 PPT,也有很多文档。你想,一个大企业会有很多内部数据,但不是每家公司都有一个像 Google 一样 efficient 的 search engine。很多数据其实都找不到。

那在新的时代,怎么让大模型、让 agent 利用这些数据,就是一个很难的问题。我觉得这件事本身非常有价值。

Raymond

所以你觉得,在未来的模型和场景里,上下文数据的沉淀,以及企业端的服务可能更重要,所以决定加入 Microsoft?

Lewis

对。

Raymond

可不可以跟听众简单说一下,你现在在 Microsoft 主要做什么?

Lewis

我在 Microsoft 主要负责两块。

一块是 agent 的 memory,另一部分是给 agent 提供 knowledge。在 knowledge 这边,我主要在看 context graph,以及用什么新的形式,让 agent 可以更有效率地访问海量企业数据。

Raymond

可以具体举个例子吗?比如 agent memory 大概是什么样的?我们的听众不一定实际用过 Microsoft 的产品,也不一定接触过 enterprise application,他们应该怎么想象这个产品?

Lewis

我做的东西主要面向开发者。开发者会再把 memory 和 knowledge build 成最终面向 C 端的产品。

我们提供的东西有几个很清楚的 use case。一个是怎么做到 agent 的个性化。

当你和一个 agent 聊天时,agent 会知道:“Lewis,你又来了。上次我们聊到什么什么什么。”或者它会说:“你还有一个 refund 没有 track,要不要我帮你?”它可以知道你是谁、做过什么、之前聊过什么。

这在 customer support 以及很多类似的 use case 里都会用到。

另一个方向是 agent 怎么 self-improve。现在大家可能都听说过 RSI,也就是 self-improvement。这里最重要的一步,就是怎么把 agent 运行过的东西学习、沉淀下来。

这个沉淀下来的东西,有些人叫 memory,有些人叫 knowledge。核心就是怎么做好这一层。

Raymond

我之前看过你讲 procedural memory。那是你刚才说的第二种吗?

Lewis

对。现在大家运行 agent 时,通常是告诉它:“我要做一件事情。”然后 agent 会尝试很多方法。它试了一个方法失败,就再试另外一种。

这里面会浪费很多 token。procedural memory 就是去看之前的 trace,看 agent 是怎么运行的,然后告诉它:“你遇到这种问题时,直接用这种方式就可以解决。”

Raymond

procedural memory 和我们平常说的 skill 有什么差别吗?

Lewis

差别不大。skill 是一种表现形式,procedural memory 是你想要浓缩的内容。

简单来说,比如刚才说的 identify failure,可以把它做成 procedural memory,也可以把它存成一个 skill,最后以 skill 的方式呈现出来。

Raymond

听起来,这些东西是不是在 Microsoft 的产品体系内部,由特定的框架和脚手架一起规定的?

我不太了解什么样的开发者会使用它。如果我今天开发一个 app,给 C 端或者 B 端使用,而我是一个 Mac 用户,不是 Windows 用户,那我很多时候就不太了解。它是不是主要面向原来 Windows 系统里的开发者,用来开发 enterprise 应用?

Lewis

不完全是,它和操作系统的关系并不是很大。Microsoft 也提供一个 ecosystem,里面有模型、agent harness,同时也提供 memory 的 feature,可以进行存储和调用。

不管你做的是 Mac app、Windows app,还是 web app,实际上都要调用同一套后端。我们现在只是给开发者提供这样一个后端,让你的个人 preference 和 memory 可以存下来。

Raymond

我刚好想岔开一个问题。上次我们聊过企业权限。

听起来,很多 agent memory 可能是全员都可以使用的,但有些 memory 可能不是。比如董事会如何选董事长,这种事情肯定不是全员都能使用的 memory。

企业在使用这些 memory 和 knowledge 的过程中,应该需要非常多的权限管理。你们内部是怎么想、怎么做这件事的?

Lewis

你问到了核心问题。

现在市场上有很多做 memory 的 startup,它们的 target use case 更多是 personalization,偏 C 端。你和我之间没有太大区别,和另外一个人的区别也差不多。

但企业内部完全不一样。比如你刚才说的,CEO 的 memory 和其他人的 permission 就不一样。

对于一个开发者来说,如果系统里有 bug,我要去解决它,不可能先去看 CEO 的 memory 里有什么。所以 permission 必须写得非常好,enforcement 也必须做得非常好。

其次,memory 在企业里不是 To C 产品,它会有很多层级。每个员工有自己的 memory;比如我们两个人有一个 chat,这个 chat 里会有一个属于我们两个人的 memory;我们可能还有一个 team,team 又有一个 memory。

所以 permission 和 access control 有层级关系。

另外,memory 本身还要做 consolidation。比如我们两个人聊的东西,能不能变成 team 的一个 asset?

如果我们聊的是工作内容,那么从中学习到的知识不应该只属于我们两个人,而应该让整个 team 都能享受到。什么聊天内容可以变成 team 共享的,什么内容不能,就会有很多 corner case。这也是企业需要解决的问题。

Raymond

举个实际工作中的例子。国内用得比较多的是飞书。假设我管理一个员工,他入职之后开始在飞书里创建各种文档,不断 build 这些文档。等他离职之后,作为他的主管,我可以把他的所有文档接手过来,他的记忆会被我拿走。

但这些记忆只能存在于他的文档里,他所有的聊天记录不会同步给我。

Lewis

而且就算同步给你,你也看不完。他可能只入职了 3 个月,但聊天记录有 300 万字。

Raymond

对,非常夸张。但在企业运营过程中,聊天上下文的 intrinsic value,可能比文档的 value 还大。

第二个例子是 Shopify 的 CEO 最近做了一件事:让全员使用一个 Claude agent。公司群聊不能有,私聊也不能有,要聊就让所有人都看到,所有人都必须和同一个 agent 聊天。

聊天窗口当然是大家分别和它聊,但所有人都能看到其他人的聊天窗口。

Lewis

按照你刚才的说法,只要两个员工在对话,他们产生的价值和知识就应该全公司共享。但这里有 gray area。

Raymond

比如两个同事吐槽老板,这些内容肯定不应该进入 memory。但为什么不行?谁来决定它能不能进入 memory?

Lewis

所以应该给用户 control。

如果我们两个人拥有这个对话,那么什么内容进入公司级别或者 team 级别的 memory,应该由我们两个人决定。

这不只是技术问题,还有 privacy law 的问题。严格来说,我们现在的私下对话不应该被 manager 或其他人看到,因为里面有很多个人隐私。

什么东西是隐私,什么东西不是隐私,很难界定。所以,应该由当事人自己决定什么内容可以被 promoted。

Raymond

对于 Shopify 的例子来说,大家都和同一个 bot 聊,前提是我知道自己写的所有内容大家都能看到。

但如果这是 implicit 的,也就是每个 chat 里其实都有一个人在看着你,那大家使用 chat 的方式就会完全改变。你不会用 chat 聊私人内容,也不会用 chat 闲聊。

Lewis

员工最后可能会开两个窗口:一个是在 Copilot 里聊天,明确知道会被记录;另一个是在微信或 WhatsApp 里聊天,不会被记录。

这就有点像老板或者一个人一直站在你背后盯着你工作。

Raymond

假设我们两个是 Microsoft 的员工,在聊天中讨论一个问题。我们都是研发人员,讨论了很长时间,这个讨论过程应该被记录下来,而且肯定有价值,甚至 OpenAI 也想买这样的数据。

那我们是需要点一下,标记这句话可以分享、那句话不能分享,还是怎样做权限限制?

Lewis

现在还没有完全定性,大家都在探索。

但可以有一步:让模型从聊天中抓取信息,然后询问用户:“这些信息是否安全,可以 promote 到下一个级别?”可以 promote 到 team,也可以 promote 到公司。

我觉得这还是要由当事人自己决定。

Raymond

但这样是不是会有一点慢?

我理解现在无论 Google 还是 Microsoft,都会很尊重员工的意愿,但 Anthropic 不一定。今天所有从这边调走的东西,可能 Anthropic 都会逐行查看。现在全中国、全美国好像都有一个共识,认为 Anthropic 会逐行查看。这种情况下,Microsoft 会不会陷入一个比较尴尬的状态?

你们内部更尊重员工的 privacy,但到了 Claude 那边可能就不尊重了。

Lewis

我觉得这属于公司自己的 policy 和定义。

如果 Anthropic 说:“如果你想成为我的员工,你的数据我都要看。”那员工可以选择加入或者不加入。但对于大多数企业来说,privacy 不允许你查看每个人的私人 chats。

除非有 investigation,比如 harassment 或者不公平的 workplace 问题,可能有传票或者其他理由,才可以调查。你不能无缘无故查看用户数据。我相信 99% 的企业目前都是这样。

Raymond

大部分公司应该都是这样。只是可能 Anthropic 面向用户时,因为很多人调用的是 Anthropic 的模型,包括 Microsoft 的用户调用的也可能是 Anthropic,所以这是另外一个层级的问题。

Lewis

这里有一个很有趣的地方。对于 OpenAI 和 Anthropic 来说,它们的模型很多时候是被我们内部调用的,运行在自己的环境里。其实 Google 也是一样,Google 调用 Anthropic 时,Anthropic 也是跑在 Google Cloud 下面。

当模型部署在自己公司的 wall 里面时,就不会被 log,也不会被记录。

Raymond

这也是因为 hyperscaler 已经花了 1 万亿美元,终于买回了一点 privacy。

Lewis

至少写在纸面上,这几家公司都会说不会查看用户数据,也不会 log 用户数据。但事实上是不是遵守,没有人知道,除非是内部的人。

我在这件事情上,通常会持有一个相对悲观的人性假设。

Raymond

那你觉得湾区哪些公司在 memory 的 access control 或设计上做得比较好?

Lewis

我觉得现在还没有,大家都在探索阶段。

你刚才说的 Shopify 的例子,在我看来就是因为没有很好的层级关系,所以最后变成:“不如大家都跟着同一个东西来 chat。”这样就不用管 access control 了,很简单,直接把大家的资源整合起来。

大公司和小公司也不太一样。有些小公司在 AI-native 时代可能全员只有 30 个人,30 个人群聊没有什么感觉。但如果是 10 万人的群聊,就太可怕了。

4. 个人 Agent 再度崛起

Raymond

我们刚才聊了很多有意思的事情,也和 AI 行业的变革、以及 Lewis 的职业发展有关。

你从最开始进入 PaLM 2 的组做模型产品,到经历 Gemini 的高光时刻,后来离开 Gemini 去做 Microsoft 的 enterprise 应用,很大程度上是因为大家发现,产品再往前走,个人产品相对容易做,企业产品更难做,但企业产品的价值更大,所以很多人开始往企业方向推进。

刚才我们提到的 privacy、context、knowledge graph,都是很核心的关键词。最近 Y Combinator 的一个 batch 里,上百家公司都围绕这些事情在做。

但最近又有一个变化。沿着 privacy 这个方向走,personal agent 又重新起来了。之前大家觉得没有人会为 personal agent 付钱,都应该做 enterprise,所以所有人都往 enterprise 走、往 privacy 走。

但现在,如果有一个 agent 能帮我订机票、买鸡蛋,这也是非常好的事情。最近出了 Muse、Tong、Grok Bot、Today AI、Instinct,一个月之内可能出现了好几个非常大的 personal AI。

这些 personal AI 做的第一件事,就是要你的所有权限。你怎么看?最近用过这几个 AI 吗?

Lewis

我用得比较多的是 Grok Bot 和 Muse。之前我也是 OpenClaw 和 Hermes Agent 的重度用户。

Raymond

所以现在主要是 Muse 加 Hermes?这个组合很奇怪,为什么是这两个?

Lewis

简单来说,我最开始用的是 OpenClaw,大概是今年 1 月、2 月。后来升级到 2.0 的时候经常出问题,升级之后东西不 work,migration 也不 work,2.0 的时候基本全部 break 了。

后来我发现,Hermes 在一些特定场景下做得比 OpenClaw 好,所以我就 all in Hermes 了。我想,算了,我也不 fix OpenClaw 了。

因为它们跑在同一个 virtual machine 里,我就问 Hermes:“你能不能把 OpenClaw 所有的数据抓过来?”Hermes 说可以,于是我就把所有东西 migrate 到 Hermes 了。

后来 Grok 出来,我就开始用 Grok。但对我来说,Grok 的 target 是 pro 用户,可它又做不到很多 pro 用户想做的事情。

比如我们经常做开发,或者说:“你帮我 build 一个 website。”如果用 Hermes 或者 OpenClaw,因为它们在我的 virtual machine 里,build 完以后,我可以直接访问这个网站,也可以直接访问 VM 里的内容。

但 Grok 为了保护 security,VM 跑到后台以后,你无法访问里面的东西。它会 set up 一个 artifact,运行一个网站,但你只能通过它的 browser 访问,或者把它 download 下来。

Raymond

你以为自己买了一台电脑,后来发现其实只是一个虚拟机。

Lewis

对,你只买了一个屏幕,没有鼠标和键盘,操作不了里面具体的东西。你不能碰它。

所以我当时觉得,如果它 target 的是 pro 用户,却无法提供 pro 用户需要的功能,那就不太行。后来我就弃用了。

Raymond

Grok 和 Muse 的发布时间也差不了太多,可能差一个月。那你后来为什么开始用 Muse?

Lewis

Muse 的用户体验做得非常好。

Hermes 还需要做一些 maintenance,但 Muse 相当于一个 app,presentation 做得非常好。我之前还发过一篇小红书,介绍它的一个功能叫 idea tab。

它会告诉你这个 agent 可以做哪些事情。我觉得这对很多用户来说非常重要。你拿到一个 agent,比如 Grok,它就是一个 chat window。你会想:“我能拿它做什么?”

你能 brainstorm 出来的东西其实很少。但 Muse 给了你很长的列表,而且里面很大一部分会根据你的 context 告诉你:“我可以帮助你做这些事情。”这样用户更容易知道这个 agent 到底可以做什么。

Raymond

我给听众补充一个细节。这几家都是美国比较流行的 personal agent,也就是个人助理。它们会读取你的 email,然后查看你的 calendar。

因为在美国的办公和生活环境里,email 是非常普遍的工作方式。比如去医院预约、挂号,小孩子报名参加什么课程,很多事情都通过 email 实现。国内可能通过小程序、服务号来完成,但美国很多事情都是 email。

我给 Muse 权限的一瞬间,idea tab 第一个就开始跟进我的医院预约,因为我本来就需要跟进医院。它会提醒我跟进医院,马上开始处理相关邮件。

医院的 email 通常特别长,可能十几个人来回发邮件。我一天没看,它就已经来回好几轮了。Muse 会帮我整理出来。

这类事情非常普遍。最近 Twitter 上有人统计 Muse 的核心 use case,也就是所谓的 killer use case。我相信其中一部分是 Muse 自己做 GTM 推出来的,但大部分都是帮你处理生活琐事。

比如退订服务、查信用卡账单、处理医院费用、申请信用卡 chargeback,以及追讨 insurance 理赔。这一系列事情,都以 email 为入口。

Lewis

我当然很 appreciate 有人帮我处理这些事情。之前 Claude Code 或者 Codex 可能也有类似功能,但我当时没有这么用过。

Raymond

其实也可以用。

Lewis

对,但我觉得这不是技术导向,而是产品导向。

Raymond

之前你用 Claude Code 直接连接 Gmail,也可以给它所有权限,也可以让它读邮件,只是大家当时不会这么用。

现在 Muse 一出来,大家就直接去读邮件了,因为 email 和 calendar 是两个核心的个人数据生产地。基本上,你是谁、你做什么,里面都有。

Lewis

对,所以产品导向在这个时代非常重要。为什么很多 startup 仍然有机会?因为像 Claude Code 很早就可以连接 Gmail,但 Muse 会直接告诉你:“看一下我所有的订阅,哪些订阅是我订了但不用的,可以取消。”

这是一个非常实际的 use case。但如果你用 Claude Code,就没有一个现成的入口告诉你可以运行这个任务。你得先去 YouTube 上看到别人说 Claude Code 可以这样用,再把 prompt 抄下来,自己实际操作。

Claude Code 从技术上都能做,只是太麻烦了。让普通用户自己实现非常难。

如果你在 Muse 里面点一个“退订”的选项,这就容易多了。

Raymond

你有用 Instinct 吗?

Lewis

没有,我不敢用。

Raymond

为什么?

Lewis

因为它刚出来时,条款里明确写了,我们访问的所有数据,它都有权使用。也就是说,它可以拿你的 email 去 train 它的模型,也可以拿你所有的 privacy 数据去提升产品。

Raymond

我不记得这个条款。但 Instinct 目前没有自己的模型,对吧?

Lewis

对,它主要是 agent 加 memory。Muse 是有模型的,后台是他们自己的模型。

Raymond

所以你是出于 privacy 和安全考虑,不用 Instinct,而选择 Muse?

Lewis

对。

上个礼拜我去了 The Information 的 conference。主持人一开头做了一个 survey,问大家使用什么产品。大家举手说用 Instinct、用 Muse。

然后主持人问了一个非常有诱导性的问题,大意是:“有多少人相信 Zuckerberg?”我其实觉得很多人不相信。那场会议给我的感觉是,有很多人极其不相信 Zuckerberg。

Raymond

这里面有很多历史原因,我们就不展开了。大家绝对不会把 privacy 数据交给 Zuckerberg,不会让他读取个人邮箱。

Lewis

但我当时就在想,那你们就这么相信 Instinct 吗?Instinct 是一个刚出生的小公司,我甚至不知道它背后是什么人,那我就更不会相信它。

Raymond

Instinct 好像是一个华裔创立的公司,创始人之前是 Sierra 的早期员工,现在由 Sierra 背后的最大 VC 支持。虽然成立时间不长,但现在确实很火。

我们把问题反过来问:你作为用户很 care privacy、很 care security,但你给出的核心数据是 Gmail 和 Calendar,而这两个都是 Google 的。为什么不是 Google 来做这件事?

Lewis

Google 太慢了。

5. Google 的反应迟缓

Raymond

我们绕了一大圈,最后又回到你在 Gemini 的 experience。

前面我们问过你为什么离开 Gemini。我更想借 personal agent 这个例子,理解 Gemini 的文化、Gemini 推产品的方式,以及 Gemini 如何看待竞争。

Lewis

我觉得可以从两方面说。

一方面,大家看到的可能是 Google 在一定程度上比较 reactive。市场上有什么,它就去做相应的 countermeasure。

我觉得最后 OpenAI 和 Google 都被弯道超车,多少有一点这个原因。我们当时做 Gemini 时,认为 OpenAI 是最大的敌人。

那时候 OpenAI 什么东西做得好?consumer 做得好。所以我们很多 energy 都用来把模型做成更 fancy 的 demo,做更好的 web application,更取悦用户。

但 Anthropic 在我看来是一个相对更好的 product bet。它的想法是:不搞这些花里胡哨的东西,去 bet 一些 core engineering 的东西,bet enterprise。

这个 bet 很明显是对的。然后它一下子追了上来。你看现在 OpenAI 也砍掉了很多 To C 产品,重新去做 coding、做企业相关的事情。Google 也是这样。

回到你刚才说的 personal assistant。Ubiquitous assistant 这个东西,其实在两年前的 Google I/O 就已经聊到了。Gemini、Bard 这个产品的定义,本来就是做这个。

但这么长时间下来,它的产品迭代速度和另外两家相比,实在不够看。当然现在街上已经有 rumor,说 Google 内部其实也有类似产品,可能很快会上线。

严格来说,从几家大厂来看,我个人觉得是 xAI 打响了第一枪,就是 Grok、Grok Bot。但我觉得花 200 美元订阅才能使用,而且它没有真正解决我的问题,所以我就弃掉了。

Meta 反而打磨得很好。如果你看新闻,它们很早就在内部 build 产品,花了很长时间迭代和打磨。我觉得它这一招打出来时非常有效。你看它的股价,还有下载量,现在已经超过 OpenAI,成为 App Store 第一名。

它确实花了一些时间打磨。我相信 Google 也还在打磨。

Raymond

根据你刚才的描述,Google 内部肯定有很多 compliance lawyer 在问:如果我们读取用户的 privacy,给了错误建议怎么办?还有其他类似的问题。

大公司和小公司毕竟不一样。Instinct 这种小公司可能跑得更快,也更 aggressive。大公司就会陷入尴尬:是自己做,还是收购?但收购之后也会遇到同样的法律问题。

这就像我们不用讨论 Nano Banana 为什么会落后于 Seedance,这些都是大公司的困境。

你觉得未来会不会出现一种情况:Google 不让任何人使用它的数据?因为现在你使用任何 personal agent,它第一个问题就是让你连接 Gmail 和 Google Calendar,别的东西好像都没有那么大的意义。

Lewis

我觉得不太会。这可能和公司的文化、定位有关。

第一,我觉得 Google 还是比较开放的。很多产品都是 build 在 Google 提供的 API 上,比如 Superhuman 也是这样。给别人提供机会,是这里的一种文化。

其次,我觉得这里的产品定义是:数据属于用户。用户就应该有权限访问自己的数据。

Google 在一定程度上没有建立护城河,也不想阻止用户调用这些数据。

6. 中国互联网的围墙花园

Raymond

这里面特别有意思。我在使用 Muse、Microsoft Agent、OpenClaw 时,会希望它们调用微信里的数据。

但它们完全访问不了,什么都看不到,整个系统就脱节了。反而国内的大公司已经形成了护城河,agent 好像只有它自己能建立,别人完全建不了,因为所有东西都在自己的 ecosystem 里。

Lewis

对。

Raymond

之前我看过一篇文章,忘了是哪个媒体写的,观点很有意思:说中国在移动互联网弯道超车的 10 年里建立的东西,可能会成为 AI 时代特别落后的 legacy。

移动互联网带来的是一个又一个 walled garden,一个有很高围墙的花园。你在自己的花园里可以很开心,但花园彼此不打通,所以从 agent 的角度来说,基本上完全无法访问。

我最近解锁了很多很好玩的 use case。比如我想搜索小红书上的内容,agent 找不到。我只能把 prompt 单独 copy 到小红书上。

小红书有一个 agent,叫点点。你可以在小红书上问它,它会把所有相关帖子挖出来,还会帮你分类,效果特别好。

但这样一来,你必须单独去那个地方使用它。最后,中国前 10 家、前 15 家互联网大厂,可能每一家都会有一个非常明确的知识库型 agent,而且彼此不能互相对话。

你可以理解成,10 个人站在那里,你要分别和每个人说话,不能让一个 agent 代替你去和所有人对话。

Lewis

小红书如果是在一个已经登录的版本里,agent 其实可以去看。我登录的是网页版,agent 可以读取小红书,也可以抓取我的一些 stats。

Raymond

我的不行。我一用虚拟机登录,通常就会被强制登出。

Lewis

可能是它做了一些特殊处理。我的现在还可以用。

Raymond

我会被强制登出,但微信更不行。微信直接把网页版关掉了。

Lewis

我觉得微信关闭网页版的一个原因,就是它不希望非人类,也就是 agent 去操作。

Raymond

我跟你学习一下,怎么用虚拟机登录小红书。我在国内环境里用虚拟机登录很多东西,也都会被强制登出。

Lewis

我觉得和国内环境没关系,主要是小红书的检查机制能不能发现你是人还是机器人。

Raymond

因为我马上就会被发现是机器人,然后它就不让我用了。

Lewis

微信更难搞。我之前还想做一些视频号的操作,微信基本完全不行。

Raymond

微信就是一个有活人感的社区。

Lewis

所以你刚才说的 walled garden 很有意思。现在不知道国内互联网最终会发展成什么状态,因为没有一个渠道让 agent 把所有信息集中起来。

Raymond

反过来说,这也是很多人对微信、对腾讯仍然有信心的核心原因。

腾讯可以很慢,在大模型上暂时没有建树也没关系。因为在可预见的未来里,微信这个东西很难被取代。它可以等到美国所有 personal agent 都打完一仗、死光了,只剩下一个完美的产品形态,然后照抄就可以了。

因为微信里的关系链是完全无法取代的。中国年龄大一点的人用微信,年轻一点的人可能用 QQ,这些都是腾讯的产品,基本躲不开。

Lewis

美国的生态更多是 distributed 的。你刚才说用 email,但做所有事情,最后还是要去各自的网站。

去医院要去医院的网站预约医生,交水电费要去水电公司的网站。但微信里很多事情已经集成到一起了,所有事情好像都可以通过小程序解决。

Raymond

这很有意思。美国很多生态通过网页执行,东西相对分散,所以 agent 去做事情、agent 要走的路径,可能就有商业化机会。

7. Personal agent 的收费逻辑

Zuckerberg 前两天说,Muse 不会收费,而是会收购物的提成。但他说完之后,Amazon 就把 Muse ban 掉了。Amazon 也把 Instinct ban 掉了。

也就是说,你不能通过 Amazon 让 agent 来消费。Amazon 希望真人到它那里消费。

你刚才也提到,Grok Bot 的订阅要 200 美元,你不愿意花。在这些 personal agent 里,你会怎么考虑它们的定价策略?什么样的定价更合适?

我记得你之前在 Japan 也提过一些定价策略的思考。那可能是 To C 和 To B 混合的状态,这里也是一样。它介于 personal use 和 productivity use 之间,到底应该怎么定价?是收多少钱,还是抽 commission?

Lewis

我分两个情况讨论。

第一个是入场费。像 Grok Bot 这样的 200 美元入场费,我觉得很难维持。因为在这个阶段,大家还不清楚它能做什么。你让用户直接付这个价格,我相信用户留存会非常低。

Muse 是让你免费使用,但它有一个 weekly limit。超过 limit 之后,应该就要付费,至少我现在还没有超过这个 limit。

从技术本身来看,要看它解决了什么问题。

Muse 和 Grok Bot 大部分都是 OpenClaw-inspired,基本都建立在这一套东西上,所以没有太多护城河。你可以做,别人也可以做,任何一家都可以做。

所以你要想清楚:如果定价 200 美元,这 200 美元是因为你解决了问题,还是它其实代表一定数量的 token?只是让用户先付这么多 token。这和 Claude Code 的定价策略其实是一样的。

对于 To C 产品来说,现在大家根本不知道这个东西可以做什么,所以肯定要用 Freemium 的方式入场。

另一类是它如果帮你完成了一些 tasks,比如帮你追讨 refund、做 price match,或者帮你买东西时找到折扣。前期也许可以考虑不同的定价策略。

但这些事情的护城河也很低。比如帮你申请一次 refund,refund 成功之后,下一次可能就没有 refund 的机会了。它不可能每天都帮你取消订单。帮你找到便宜的鸡蛋,很多时候也是 one-off 的事情。

可能做着做着,用户就不用了。它在单一 task 上看起来很有用,但从长期 LTV 的角度,很难说清楚它到底有多大价值。

所以我觉得 To B 和 To C 可能要分开定价。

To C 更多是 Freemium,再以 token-based 的方式定价。用得越多,付得越多,这对用户来说比较 intuitive。

但 To B 不一样。工作中有很多重复性的工作,运行 workflow 的 ROI 通常可以测量。最简单的计算方式就是:我的 hourly pay 是多少,我的工资除以小时数,agent 帮我节省了多长时间,然后根据节省的时间来收费,也就是增加 productivity。

但对 To C 用户来说,就非常难。

Raymond

所以 To B 更像是从生产力 output 的角度,按照产生的价值去收费,更像 Claude Code 的模式。To C 还是 Freemium,对吧?

Lewis

对。

Raymond

那我想追问一下 Freemium。

通常 Freemium 是一开始便宜、免费,免费使用一段时间,之后出现 paywall 或 tier pricing。

今天之所以不能完全免费,有两个问题。第一是广告还没有做起来。如果广告模式成熟,未必需要 Freemium,也可以靠广告。

第二是推理现在仍然是一个 meaningful cost。比如看今日头条的新闻,新闻带宽不是 meaningful cost,全世界的人都去看新闻也没关系,因为不贵。

但 inference 目前仍然比较贵。有没有可能未来成本降到极低,或者 Muse 使用自己的开源模型,因此成本非常低,可以跑成免费模式,或者更低价格的模式?

Lewis

我觉得现在大家已经看到 frontier model 的 pricing 在下降。

长期来看,模型的 intelligence price,或者说 price per intelligence,一定会下降,最终变成 commodity。到时候它就和电、水一样,不需要再收 premium。

当然不一定所有人都同意,但我觉得大多数人可能是这个观点。

如果趋势是这样,thinking、reasoning 这些能力最终都可以很便宜。很大一部分模型可能会变成 local,直接在 iPhone 上运行,只有非常 frontier 的 task 才会发到云上处理。

处理发票,找一个本地小模型就够了,可能会变成 Apple 的机会。研究如何治疗癌症,再打开 Claude Code。

Raymond

但这些问题又不是 To C 用户会做的。你不会让一个普通用户去解决 21 世纪数学问题,或者去解决 life science 问题。

这段对话大家可以转发给 Today AI 的齐俊元同学。齐同学现在的 base plan 非常贵,我其实也很好奇谁会用,因为这个门槛对 Today AI 来说非常难跨过去。

关于中国公司,你很了解中国市场。除了微信肯定很有机会做 personal agent,因为 everyone is living on WeChat,除了微信之外,你觉得还有哪些公司有机会做 personal agent?为什么?

Lewis

我觉得小红书也有机会。

做 personal agent 有两个东西很重要:一个是用户的 context,比如他说了什么、点了什么;另一个是 preference,也就是他喜欢什么。

小红书里的搜索和浏览内容,其实代表了用户的一部分喜好。

但在中国做这个稍微有点难,因为数据是割裂的。小红书上更多是休闲内容,微信里可能有工作和家庭信息,企业微信和个人微信又要分开。

你很难找到一个系统,把生活、工作和 preference 全部结合起来。

所以现在这些 personal assistant 可能更多只能做某一个领域。如果是 startup,可能更适合从某个垂直领域开始。

Raymond

你不讲的话,我绝对想不到小红书,但我觉得很有道理。

小红书可能是中国现在比较好的陌生人社交网络。我说的不是陌生人社交早期那种模式,而是比较 general、泛化的陌生人社交。

比如你今天想爬泰山,想找一个爬山搭子,会去小红书发帖找搭子。吃饭、找餐厅,也会去小红书。很多人找 career coach、spiritual coach,也会发小红书。

所以小红书在陌生人社交上做得很好,确实有很多其他可能性,而且它增加了其他维度的数据。

Lewis

对。比如对我个人来说,我和我老婆每天很大的一件事情,就是决定吃什么。这个问题很费脑力。

你不会在微信里问吃什么,更多会去小红书、Google Maps 这些平台。它可以很好地解决一部分“吃什么、怎么玩、怎么娱乐”的问题。

Raymond

理论上,美团或者阿里或多或少也有机会。如果它们能结合起来,创造更多差异化价值,可能也有机会和微信打一仗。

这个也可以发给微信总办的同学,听一听大家对微信的期待。

8. 端侧模型已经到来

刚才你提到端侧小模型。过去一两个月有两个关键词:一个是安全,一个是隐私。隐私我们已经聊了很多,就不再展开。

安全也是重大问题。从硅谷到华盛顿都在讨论,因为过去一段时间 agent 做了很多坏事,人类还没有发现,产生了很多安全事故。

我们对 agent 应该做什么、能做什么、已经做过什么,缺乏了解。所以很多人说,应该把模型放到端侧,这样可以有更好的控制,也可以更好地保护个人隐私和个人数据。

你觉得我们现在很着急要做这件事吗?从市场对产品的呼唤程度,以及技术进度来看,大概到了什么程度?

Lewis

这有点像 AGI。现在很多人说 AGI 已经到来了,我觉得 Edge Compute 也算到来了。

我认为这个时代已经到了。现在最高配的 Mac Studio,已经可以跑一个 trillion-parameter 的 model。Apple 官方商业广告里就是这么写的,网上也已经有人跑出来了。

Raymond

欢迎 Apple 的商务同学联系一下我们。如果你不联系,我就把这段全部删掉。

Lewis

Mac Studio 最高配可以跑 trillion-parameter 的模型,但一台 Mac Studio 要多少钱?好像要 12,000 美元,非常贵,不是所有人都能接受。

但这个东西已经存在了。如果你是一个个人用户,现在就可以买到。NVIDIA 还有一个叫 DGX Spark 的设备,也可以跑本地模型。

你可以说这个小机器目前对于终端用户来说还有点遥远,但 Mac Studio 不是。只要你有钱、愿意做这件事,就已经可以拥有这种模式。

Mac Studio 本身也不难做。假设端侧模型这个事情在 product-market fit 上成立,用户确实愿意为隐私付出这么高的价格,那么这类硬件很快就会在中国被做成白菜价,mass produce。

我最常用、最喜欢的例子是 Qwen 27B。它已经完全可以满足正常 day-to-day 的需求,只要你不是一定要用它做 coding,或者解决特别复杂的问题。

把这个模型下载下来,跑在 Mac Studio 里,我觉得已经完全 OK 了。

Raymond

那为什么 Apple 没有做 personal agent?

我们刚才讨论了隐私、安全、端侧小模型,这些不都是 Apple 也在 defend 的东西吗?为什么 Apple 没有做 personal agent?

是它相信自己可以后发先制吗?

Lewis

我相信 Apple 一定在做。它可能觉得自己可以后发先制。

Google 和 Apple 可能都有这种想法:先让创业公司打样,打完之后自己再做,甚至直接把它做掉。

大部分今天所谓 personal agent 要完成的任务其实非常简单,比如帮你处理账单。简单的 GPT-3.5 模型当时可能都能做,因为大部分都是普通的个人事务。

我个人比较看好本地模型。我知道有几家公司已经在做本地模型。

这里面一个问题是,你可以专门做一个 device,但对 Mac Studio 来说,下一代芯片就可能支持。PC 也可以加一个芯片,下一代 PC 都能跑模型。

这仍然存在很强的竞争关系,但我觉得很快就会到来。

最大的问题还是产品:硬件上可以做,但你能给用户提供什么样的软件体验?是用户买来 Mac Studio 之后,大模型就自动在里面运行,还是用户还要安装其他东西?

这件事还没有完全成熟,但这里可能仍然有机会。

Raymond

确实挺麻烦。OpenClaw 开始做的时候,很多人把 Mac mini 炒上天了。国内闲鱼上还有人收费 500 元帮你安装 OpenClaw。

因为对普通人来说,重装系统、配置 API,这一系列事情都很烦。最后如果能变成用户一键就能使用的东西,可能会好很多。

我记得上次你也提到过,对这种能够运行小模型的小硬件很有兴趣。为什么?

Lewis

我之前和一个做芯片的朋友聊过。

芯片行业现在股价涨得非常厉害,包括做 memory 的公司。但和大模型的 hype 比起来,芯片那边反而小很多。可我觉得芯片行业有更明确的 roadmap。

我们常说,6 个月之后大模型会变成什么样,很难预测。但从芯片角度,我们非常明确地知道 6 个月后芯片会怎么样,6 年后会怎么样。

按照他们的推测,现在很多跑在云端的大模型,可能 6 年、7 年之后都可以跑在手机上。

Raymond

那这么强大的模型都能跑在手机上,跑在 Mac Studio 里就更没有问题了。

Lewis

对,所以从大趋势来看,它一定会变成这样。

就像当年我们使用诺基亚那种老式手机时,不要说看视频,可能只能播放一个 GIF,而且还很卡。现在手机可以看 4K、6K 视频。

那时候我们只能玩贪吃蛇,现在可以玩《原神》。这其实也没有过去几年。

大模型也是一样。大家可能很难在今天就想到,6 年、7 年之后的硬件会是什么样。

Raymond

所以到那个时候,硬件本身迭代,加上模型技术不断 compact,把很大的模型压缩到很小的东西里,甚至放进戒指,都可能成为现实。

很多事情因此被解锁。我们现在说成本非常高,可能都只是现阶段的问题。

Lewis

对。

9. Google 仍有机会赶上

Raymond

最后再回到 Google。我知道你在 Google 待了很长时间,相信对 Google 也很有感情。

刚才我们讨论了,为什么 Google 没有做 Muse。因为 Muse 和 Instinct 打开时,onboarding 的第一步就是先打开 Google。这个事情确实有点荒谬。

Google 现在肯定面临很多挑战。大家会觉得,你原来是大模型领域的御三家之一,本来可能还是第三名。你离职的时候,Google 甚至是股价最高的时候。

但现在前两家已经拉开很多,Google 在美国可能是 Facebook 或 xAI,甚至第三名都不一定稳。在中国,大家可能会排 Kimi、DeepSeek、GLM,但 Google 到底排第几,感觉已经差得很远。

你怎么看?Gemini 还有机会赶上吗?

Lewis

会赶上,我还是比较有信心。

我也和一些朋友保持联系。从底子来说,Google 还是很强的。

唯一的问题是,Google 太长时间没有把 Pro 发出来了。5 月份的时候就说要发 Pro,现在已经 10 月了,还没有发出来。

对 Google 来说,压力一直在增加。它现在必须保证下一个版本至少和当前顶级模型一样强,也就是水涨船高。

Raymond

我们上周好像发布了好几个模型,现在太夸张了,我已经完全不看了,每天都有太多人在发布模型。

比如要发一个正式版 Flash、Lite,10 家公司同时发。每家隔两天发一个,SOTA 排行榜每天都在换。

现在任何一家发模型,至少都要保证或者期待自己 SOTA 一个星期。如果不能保证 SOTA 至少一周,都不敢发,会躲回去继续研发、继续训练。

期限就很难调整。

中国模型不一定要做到全世界 SOTA,但至少可以做到中国 SOTA,而且成本有优势,所以还能发布。

Gemini 就比较尴尬:成本上没有优势,技术上又不够领先,一直被卡了一年多。

我想把 Google 当作一面镜子,再问两个问题:当时你们在内部听到 DeepSeek 的时候是什么反应?还有 Manus,你们是什么反应?

Lewis

我们做模型时,第一件事就是先读它的 paper,看它到底有没有做出 unique 的东西。

我觉得大家公认 DeepSeek 还是有料的,不是完全 distill。当然,互相 distill 现在可能已经是公开的秘密了。

但 DeepSeek 确实有一些创新。

Raymond

你说的互相 distill,不包括 Google 吧?

Lewis

至少我在 Google 的时候没有。我只能代表那个时间点的 Google,不知道其他公司是不是有其他情况。

Raymond

你觉得 DeepSeek 出来之后,Google 会不会参考它的东西?Google 会不会因为 pride,不愿意去参考或者蒸馏 DeepSeek?

Lewis

Google 在这方面还是比较严格的。

昨天我和一个还在 Google 工作的朋友打网球,我们也聊到这件事。我们当年写模型时,会说不会 log 用户的 prompt,不会拿别人的数据做 training,大家确实就是这么做的。

所以我会觉得,Google 的 struggle 可能在一定程度上和这个有关。太按照规矩做事情,完全要在内部找新数据,就会比较难。

当然,我很难评论其他公司到底有没有这么做。我相信全世界所有公司都是合法合规的公司。

Raymond

我们再回到 DeepSeek。

除了读 technical report,我想问的是情感上的反应:当时是不是会觉得,怎么突然出现了这样一个东西?

Lewis

那时候大家看到一个开源模型做到这个程度,确实都很惊讶。而且它里面有一些新的 techniques,是美国这边当时还没有的。

所以当时大家会觉得,这是一个好的方式,我们也可以试一试。

从 engineering 和产品的角度来说,大家也愿意看到这样的事情。很多东西 open source,有 technical paper,大家可以互相学习、共同成长。

但这件事慢慢演变成现在这样:至少对于几家头部公司来说,现在很少看到 paper 了。

大家觉得,一项技术和知识可能只能保住 3 个月、6 个月。如果再发一篇 paper,可能只能领先一周,所以大家不再做这件事,不发 paper,不发 blog,也不允许员工上 podcast。

Raymond

现在几家头部公司的人都不能上非官方 podcast。官方的能不能上,我也不知道。反正御三家的人都不能上我的博客。

可能有两种可能:第一,是御三家在精准打击我的博客,专门挑我的博客;第二,是我的博客太小,很多人担心说错话。

他可能不小心透露一个细节,而这个细节刚好会对竞争产生影响。因为现在竞争极其激烈。

我上一期播客讲过,每个模型发展阶段的技术 bottleneck 都不一样。之前可能是 pre-training 难,后来可能是 post-training 难,也可能是数据难,或者 inference 难。

不同时间点的 bottleneck 不一样。某一部分人在公司里真正发光发热的时间可能只有 18 个月,所以一定要把秘密守住,坚持下去。

18 个月之后,竞品可能就赶上了,edge 只剩下一点点,其实非常残酷。

所以我完全理解为什么大家不上博客,但我还是希望能和大家多聊聊、交流这件事。大家看到的角度毕竟不一样。

你有看 Manus 吗?他们今天又发布了一个新产品,可能又是在虚拟机这一边增加了一员新的大将。

Lewis

这个我们可以下一期单独展开聊。

Raymond

好。今天非常感谢 Lewis 的时间,也感谢他为我们解密了过去两三年里,Google 是如何从 Transformer 的作者公司,变成御三家里的第三名,以及为什么后来又遇到了 Muse 这样的挑战,Google 会怎么反应。

我们也很感谢 Lewis 分享他在 Microsoft 的新探索,尤其是企业端的隐私、知识图谱和权限设计。

谢谢 Lewis。

Lewis

谢谢大家。

For nothing, you fill the void. I'm still missing pieces. Help me, tell me I'll be okay.How long 'til I'm out of this place?All I know is I can't carry this no more, so.