60.从进化论看算法的演进史:当大模型帮助算法「繁衍」,一种新范式的诞生
- 大模型让算法实现「自进化」正在成为一种新范式。 本月两周前,陶哲轩与多名数学家借助谷歌今年五月发布的 AlphaEvolve,在 AI 辅助下共同解答了尘封五十多年的 Erdős 1026;百度同方向的产品「伐谋」与其“大的思路挺像”——分叉在于谷歌押前沿数学科研、百度押产业落地,“这和中美两边的国情会有一些相关度”。
- 演化的本体是群体而非单个 Agent,这是伐谋与市面“自我迭代”智能体的分野。 单 Agent 试十次、第十一次更好“最多叫记忆、叫经验”;诗婕将伐谋的群体搜索比作 VC 逻辑,安南认为这特别适合高价值算法问题——“不在乎每一个 Agent 的死活,一百个 Agent 同时试,有一个实现了一百倍回报,整体系统就 work”。大模型负责算法间“繁衍生小孩”,人写评估器当指挥棒;实测“一千轮演化里面可能百分之八十还是在报 Bug,但只要有百分之十是在不断提升”就成立。
- 算法所在的是高价值、核心场景,这是 Robin 亲自讲伐谋的原因。 与聊天、客服、K12 解题不同,算法是 B 端关键的决策与预测问题,“有百分之一或百分之五的提升,对这家企业就是产值的飞跃”——港口岸桥调度优化可能带来上千万收益;Robin 原话:“今天我自己在讲伐谋这个产品,是因为我觉得它重要。”
- 在算法与研究场景,Gemini 比 Claude 更好用,转折点是三月的 Gemini 2.5 Pro 实验版。 李安南的解释:算法工程师吃“聪明劲”、开发工程师吃“老师傅”经验,Cursor 式长上下文是工程能力、算法不一定需要;外部验证类工作可以用 Gemini,客户工作因安全隐私使用中国模型,整体还会混用 DeepSeek R1、千问、百度自家模型等——“一模一样的 Prompt,一模一样的代码给到它们,生成出来的新东西也不一样”,每家模型都有自己的“算法格”。
- 商业模式全面未定,当前指标是“规模和生态”而非收入。 在试 RaaS 按效果付费(优化后节省五百万即按效果收费)、订阅制(算法优化天然持续)、Palantir 式 FDE 驻场三条路;归因难题真实——港口、制造算得清产值,金融风控和 AI for Science“收益是多少,确实不知道”;字节、华为、阿里等云大厂在此赛道尚无特别明确的商业化产品,海外 YC 系创业公司已起、国内暂未看到特别明确的。
- 相对不怕幻觉、可进入严肃生产场景:两端由人收敛,中间交给 AI。 人定义问题、写评估器、做终审,“审核人和审核 AI 的方式是一模一样的”;本地评估方案(生成代码在云、评测在本地)解数据不出域,也不需要准备那么多昆仑芯、英伟达或昇腾芯片。风险同样真实:港口案例中 AI 把滑轨理解成可以越过桥架的车,利用了未写全的评估约束,“指标看起来特别好,但实际上它做了一些奇奇怪怪的事”。
- 生产关系的变化比生产力提升更关键。 工程师可以从写代码变成“一个人指导十个 AI”;汽车客户“有一百个场景其实都想改造,以前就是没这么多人”。落地要打破“锁单三天”式肌肉记忆——那堵墙“不是承重墙,但它一直就在那儿”;企业内部需要关注哪些墙可以打掉的“效率先锋”角色。诗婕据此预想未来很多企业可能组建有保守派和激进派的“内阁制”,安南回应“很精彩”。
1. 陶哲轩解答 Erdős 1026,被国内忽略的是他手里的 AlphaEvolve
- 诗婕的引入:本月两周前,陶哲轩与多名数学家在 AI 辅助下共同解答尘封五十多年的 Erdős 1026,所用工具是谷歌今年五月推出的 AlphaEvolve——“一种基于大语言模型的进化算法编码智能体”,国内鲜少关注到工具本身。
- 安南:98 年生,2016—2023 年就读清华自动化,实习在 CV 方向(商汤、旷视“AI 四小龙”与无人驾驶的年代),22 年秋招恰逢 ChatGPT 发布,毕业后入百度做 To B 大模型相关工作,现为伐谋产品负责人。
2. 先补课:算法是分好坏的,这是它与普通代码的根本区别
- 安南的定义:算法本质是数学,承载形式是代码,“输入一堆信息,中间是黑盒,再输出一些信息”——从图灵机时代的加法器,到六七十年代的排序算法,再到七八十年代基于概率的搜索式算法(四个方向试探、朝更优处走一步的迭代逻辑)。
- 关键区分:“比较差的算法你可能要算一百次,一个好的算法可能五次就能算出来……”——“不是说我功能可行、没 Bug 就完事儿”。九十年代后进入数据驱动:SVM 到神经网络、深度学习、大模型、Agent;机器学习“不在乎中间的机理,纯靠数据学特征”。
3. 核心命题:用发展到一定程度的高级智能,去优化低级智能
- 在做的事:“输入是我的需求——帮我优化一段人脸关键点识别算法,输出的就是那个算法本身”,用 Agent 去优化从加法器、排序到机器学习的前代算法。
- 支撑判断是业界相对主流的观点:“对于可明确评估的问题,AI 大概率都会解决。”人脸关键点的评估极简单——眼睛、鼻子、嘴在哪里客观存在——但把算法写出来很难;评估易、生成难,正是 AlphaEvolve 与伐谋共同瞄准的区域。
4. AlphaEvolve 并非平地惊雷:Fan Search、EoH 与百度去年的调 Prompt
- 谱系:前身是 DeepMind 的 Fan Search,在大模型尚弱时优化具体的小算法片段;同期还有香港城市大学的 EoH。百度去年十二月已做“基于明确评估器自迭代”的 Agent 探索,当时代码能力不强,核心成果是自动把 Prompt 改得更好。
- 转折在今年:大模型代码能力显著提升后,“让它去自动改一个算法,这件事其实就非常呼之欲出了”。
5. 从 AGI 到 ASI:不是人想不到,是没有那么多时间
- 谷歌把 AlphaEvolve 用于内部业务(论文有披露),更核心的是与数学家合作发现新定理——“大家都关注在陶哲轩身上,而没有太关注到陶哲轩用的其实是 Google AlphaEvolve”。诗婕的引申是:若探索出人类尚未发现的成果,就可能到达 ASI;安南称“这个事儿非常 promising”。
- 陶哲轩他们给出的逻辑是:很多问题“不见得一定是人想不到,而是我没有那么多时间”,这个工具“能把陶哲轩的能力放大很多倍”。百度的分叉在于,产业界有些问题工程师“花一百年也能解、但不可能让他算一百年”,适合在算力 scaling up 下交给 AI——“这和中美两边的国情会有一些相关度”。
6. 在算法与研究场景,Gemini 比 Claude 更好
- 安南的判断限定在具体场景:“大家一提 coding 都会提到 Claude……但实际上,在我们偏研究或者算法的场景下,Gemini 才是更好的模型。”画像差异是解释:算法工程师吃“聪明劲”,年轻高学历、拼 Idea 和洞察;开发工程师“吃经历”,是见过复杂系统的“老师傅”——Cursor 引以为傲的超长上下文是工程能力,算法不一定需要。
- 转折点是三月 Gemini 2.5 Pro 实验版,“当时就测了,确实有挺大的提升”;原因只是洞察而非定论——两者都不开源,猜测是 DeepMind 以 research 为主,数据和后训练更偏这些方向。旁证是高校同学写算法、做 research 用 Gemini 更多,“就是确实更聪明”。
7. 客户场景用中国模型混搭,每家有自己的「算法格」
- 外部验证类、开源类工作可以基于 Gemini;客户工作因安全和隐私使用中国模型。整体上因不同模型的 Idea 和思路方向不同而混用 DeepSeek R1、百度自家模型、千问等。
- 混用的理由是:“一模一样的 Prompt、一模一样的代码给到它,它生成出来的新东西是不一样的”。诗婕将这种差异概括为每家都有自己的“算法格”。
8. Robin 为什么亲自讲伐谋:算法所在,即高价值场景
- 百度世界大会上 Robin 多是串场,唯独伐谋亲自发布:“今天我自己在讲伐谋这个产品,是因为我觉得它重要,而且我也很有激情想把它表达出来。”
- 安南的解释:过去 To B 落地多是聊天、角色扮演、K12 解题、电商质检——“重要,但价值不见得那么快体现”;算法是千行百业关键的决策与预测问题,“有一个百分之一或百分之五的提升,对这家企业来说可能就是一个产值的飞跃”。算法工程师贵,正因其能够创造相应价值。
- 消费者能懂的例子:滴滴的车辆调度就是一个大算法,“如果没有算法控制,就回到九十年代给师傅打电话,商业模式就不存在”;把滴滴替换成其他产业里的公司、把共享出行替换成千行百业,逻辑依然成立——“算法所在的,就是高价值场景”。
9. 演化是群体概念:从创业公司试错到 VC 逻辑
- 安南对“自我演进 Agent”的辨析:“我试了十次有一些经验了,第十一次能做得更好——这个东西最多叫记忆、最多叫经验,其实还不能叫自我演化。”进化必须是群体概念。
- 诗婕将伐谋比作 VC 逻辑:不在乎每个 Agent 的成败,让一百个 Agent 同时尝试不同方法;只要大盘概率正确,有一个 Agent 实现一百倍回报,整体系统就有效。安南认为这种机制特别适合算法问题,不在乎单个 Agent 的算力节省,可以上十六路并发、做更大规模搜索。
10. 进化算法×大模型:岛屿、繁衍、评估器与挖石油
- 进化算法即达尔文:五个岛屿各十个个体,表现好的有更多繁衍资格,经十代、百代、千代优胜劣汰,岛屿间再交叉,“慢慢可能实现全局最优”。以前两个算法硬拼在一起会报 Bug,现在“生孩子这个过程是大模型来做的”——基于 A 和 B 生成更好的 C;挑选由人写“评估器”,“有点像指挥棒”。
- 进化策略的比喻是挖石油:“什么时候应该把这口井再往下挖一挖,什么时候应该放弃,去另外一个地方打一口新井”——不能盯着一口井不断往下挖,以免陷入局部最优,这正是单体与群体的区别。
- 诗婕的类比获认可:微生物遇到不同环境,演化成猩猩、深海鱼、恐龙,有的存活、有的淘汰——安南:“谁活下来不重要,只要最后有一个擅长的东西就好了,我们把这个东西拿出来。”
11. 80% 在报 Bug 也 work:概率的胜负手与四步骤的 Agent 化
- 大模型的作用是概率:代码能力好,向下一代繁衍的成功概率大于 50%,“再乘以 1000 次,这个事儿就能奏效”;小于 50% 则越演化越差,一万轮也出不来。实际观察是:“一千轮演化里面可能百分之八十还是在报 Bug,但是只要有百分之十是在不断提升的,那伐谋这件事其实就是 work。”
- 千行百业算法工程师的工作可抽象为四步:选 baseline、看论文找新 Idea、基于 Idea 和基础算法生成新算法、跑验证集做 case review 再循环。四步都可以做 Agent 化;对人来说更关键的是定义问题、把评估器这根“指挥棒”设清楚。
12. 「上兵伐谋」:算法层的通用性 vs 垂类微调的局限
- 名字出自《孙子兵法》“上兵伐谋”:谋是策略,“伐”就是攻克;算法本质上也是策略。
- 反例来自清华电机系的一次分享:同学对电力调度模型做垂直训练,效果提升但“泛化性非常差”,换物流、港口调度就得重来一遍。伐谋写的是算法本身,调度问题跨行业更通用——“同一个更通用的 Agent 去服务 A、B、C、D 行业的调度场景,而不是每一个行业单独做很垂直的事”。
- 与去年华为云式“垂类场景微调落地”路线的对照:垂直大模型有价值,“但很难真正把千行百业全部服务一遍,过程非常慢,还有数据的问题”;伐谋希望以更通用的形式建立算法 Agent 生态。
13. 预测与决策两类算法,跑的是同一个四步循环
- 预测类:零售客户想知道“明天、后天、大后天销量大概多少”,有一大堆历史和竞品数据,以前可能靠拍脑袋;决策类:知道一百单需求后,何时补车、派什么车,SKU 多而车辆少时极其复杂——滴滴就是偏决策类。
- 两者本质框架一致,都回到四步循环,“这也是为啥它能 AI 化改造而且更通用”——中型企业也能用上原本只有算法团队才能完成的能力。
14. To B 落地实况:“以前 AI 干文科生的事,现在干理工科的事”
- 客户第一反应存疑:“AI 还能干这么难的事啊?”但试错成本低——算法是抽象好的小片段、不深度侵入业务流程,一个月甚至更短时间就能做出基础场景,换来客户的开心或惊喜。一家大型央国企的评价是:“感觉以前 AI 做的大部分还是文科生的事情,但现在突然发现,伐谋做的是理工科同学的事情。”
- 相对不怕幻觉的结构性原因:目标明确、评估器客观,“审核人和审核 AI 的方式是一模一样的”——目标定义和最终评估由人把关,中间是大模型的发挥空间。
- 更大的变化在可持续:以前算法工程师项目制,“上线提百分之五就终止了”,第二次出问题不可能再把专家拉回来;AI 只需重新启动一次——“它就不只是一个提效的逻辑了,更像是生产力或生产关系的一个变化”。政策也提到希望在千行百业中出现“自主、持续优化”的能力。
15. Agent infra:进化算子加分布式调度,把一周压到两三天
- 单 Agent 不太需要复杂 infra,“大模型的 infra 已经足够它用了”;伐谋的 infra 有两块:一是引导进化方向的核心算子(挖石油时的“工地指挥”),二是基础设施——串行 API 互相等待,千轮迭代要五天到一周,做分布式并行、拆分步骤并充分利用 GPU、CPU 空闲后,可拉回两到三天。
- 组织判断是“大公司的小团队”。要大公司,因为必须有生态(高校实验室、创业公司、垂直小巨头一起服务千行百业)和长期的云资源、调度能力积累;要小团队,因为模式还很早期,不能直接按某种模式铺开,得不断试错、跑通再复制。
- 创业团队更难取得客户信任:这件事太新、客户本就存疑,而百度的 AI 品牌心智能给客户“安全感和保底的感觉”。
16. 商业模式全面未定:RaaS、订阅制与 Palantir 式 FDE
- 三条路径:RaaS——“Result as a Service”,算法优化省了五百万就按效果收费,“在中国目前比较新,但可能会是 AI 时代的趋势”;订阅制——中国 SaaS 没真正跑通,但“算法优化本身就是一个持续的过程”,类似雇十个每年都要贡献价值的工程师;以及 Palantir 式前线工程师驻客户现场——“人拿着伐谋去解决这样的一个问题”。
- 诗婕点破的归因难题是客户价值提升有多少归功于算法很难界定。安南承认:“港口、制造很容易算清楚产值进账,但 AI for Science、金融风控我收益是多少呢?这个事儿确实是不知道”,所以模式仍在探索。
17. 伐谋也在 To C:大概率不收费的高校学生是五到十年后的变量
- 回应李开复 2023 年“中国 AI 走 To C、美国先走 To B”的判断:安南认为是时间问题——长线 To C 价值大但商业模式短期难验证,To B 选对高价值场景则付费意愿明确。
- 意外发现:平台上线后很多高校同学拿它做课程作业、毕业设计、论文——流体力学背景的同学要做仿真模型(一个 AI 问题),不必真正学会 AI 就能完成领域任务。“这部分同学我们大概率不会收费了,更像是培育”;这批人进入千行百业后,可能天然会认为算法问题应该用 AI 解决。
- 团队本身即此画像:98 年的安南带着 00 年前后出生的校招生和实习生,很多是运筹学、工业工程、Science 等领域背景而非 AI 背景。
18. 客户情绪曲线与本地评估:数据不出域是中国解法
- 与 2023 年的对照:当年“多快好省赶紧上,买卡、买 DeepSeek 模型、部署一大堆”,现在的痛苦是“怎么把这些东西用起来”——能把已部署的模型资产用在“非常 niche、非常有价值的场景”,客户特别高兴。2025 年推理时代加上代码能力提升让信心回升;发布金融风控、港口调度、中国能建路径规划案例后,“非常相似的客户也都找上来了”。
- 技术解法是本地评估方案:生成代码这个巨耗算力的环节放云上,评测在客户本地数据上跑、只回传最终结果,“数据不用出域,又不需要准备那么多昆仑芯、英伟达、昇腾”。这体现了产业场景与科研场景在数据和部署条件上的差异。
- 对“国央企反馈不真实”的老问题:客观存在、技术解决不了,但这件事够新且有政策引导,尝试可能超脱于客情关系等因素;中型民营垂直小巨头更在意效果,也更可能忠实反馈——“他会比我们焦虑,交流完马上就把测试的样例数据赶快给过来了”。
19. 智能原生:打墙、锁单与 Delta 算法
- “内化 AI”第一层是破除人为先验:订单分 P1 到 P4、做完 P1 再做 P2,“是因为人处理不过来全局优化”;AI 可以打散顺序,按毛利、收入、交期和弹性做全局搜索。安南的比喻是:“卧室和客厅中间有堵墙,这墙也不是承重墙,其实可以打掉的,但它一直就在那儿”——打墙有沟通甚至阵痛,如制造业“锁单三天”的行规,AI 足够快后可能缩短到一天。
- 第二层是持续寻找 Delta 算法:特别忙和特别闲两种工况应该使用算法 A 和算法 B,“一个算法通用性越好,它垂直的效果不见得就那么好”——伐谋随新数据流持续寻找各工况最优解。产品三特点由此总结为:通用性、产业级、可持续性。
20. 产品形态:不是 Chatbot,而是造物主看进化系谱图
- 三阶段:对话式提交任务(产品起初是 Web 端,也会适配 VS Code、Notebook 等不同使用习惯,把任务和评估器写清楚即可);监控阶段是进化系谱图——“有点像我们是那个造物主,去看下面这些具体的每个生物演化迭代到什么程度”,树状节点有的报 Bug、分数低而变灰淘汰,有的活跃变亮、获得更多向后反演机会;审计阶段做可解释性,讲清最优算法“怎么一步一步迭代过来的”。
- 为什么不能只是 Chatbot:“我带十个实习同学完成一个算法任务,很难跟十个同学每天都在对话”。人主要负责监控、审查和最终解释,而不是逐一与每个 Agent 对话。诗婕的收束是:用户撒一颗种子,大模型把它变成千百颗种子,在不同土地上培育,系统再进行监控和优胜劣汰。
21. 神与麻烦:因子挖掘的惊喜,和港口滑轨的 Hack
- 神的一面:金融风控场景中,AI 写出的特征提取器、因子挖掘“确实是之前我们人算法工程师没太想到的,看一看也挺有道理,给人确实也有启发”。
- 麻烦的一面:“长期来看还挺像科幻电影的”——红绿灯、电网、港口调度交给 AI 有风险,必须严格审计。真实案例是:AI 找到一个用很少机器完成大量任务的调度方案,细看却是评估器约束没写全——它把设备理解成能越过桥架的车,实际设备是有物理关系的滑轨,“指标看起来特别好,但实际上它做了一些奇奇怪怪的事”。
- 结论回到人:“有多少人工,就有多少智能”在大模型时代依然成立,且是好事:“如果不是,那其实才是危机论了……这个事绝对不可能是替代人的,大概率还是需要有个人把这个问题定义清楚以及审计、监控它。”
22. 生产关系比生产力更关键:一人指挥十个 AI,企业可能组「内阁」
- 生产关系的变化:算法工程师可以把写代码、测试和探索交给 AI,变成“一个人指导十个 AI”;不是简单砍掉九个人——一家汽车公司说“我有一百个场景其实我都想改造,以前就是我没这么多人”。新画像是“懂业务、再稍微懂一点算法”的同学,不必是业务专家加 AI 专家的二人组。
- 新角色“效率先锋”:企业内部专门发现“哪儿的墙能够被打掉”的人,类似 Palantir 的 FDE、但不一定是 AI 背景,更像一个会使用 AI 工具的创业者。这个角色“非常值得期待”,有助于在企业内部完成变化。
- 诗婕据此预想未来很多企业可能组建“内阁制”,有保守派也有激进派;安南回应“很精彩”。五到十年后,C 端可能只会感到“效率确实更高了”,B 端研发团队则可能更像业务 BP,主动与业务一起定义问题、驱动 AI。
23. 收官:指标是规模与生态,发布的是案例不是故事
- 当前优先级“不是商业化收入,太早期了”,而是伐谋的规模和生态。伐谋只是千帆企业级 Agent infra、AI infra 平台上的一个关键智能体,进化能力、逻辑、性能和调度能力可被其他自进化 Agent 复用;云智一体下,客户跑一百个并发带来的算力消耗(包括昆仑芯等国产芯片)可与云服务打包。
- 竞争扫描:字节目前更像公有云逻辑,做到如此垂直的地方相对少;华为走得快,但“核心逻辑还是靠人的算法工程师”,仍偏项目制;阿里也在做技术探索和相关配套。几家云大厂在此赛道上尚无特别明确的商业化产品,海外 YC 孵化的创业公司已起一波,国内暂未看到特别明确的。
- 四个重点方向是能源、金融、制造、消费,安南估计合计“占到咱国内 GDP 的百分之三十以上,甚至更多”。
- 收尾的产品哲学:伐谋起源于内部项目(帮助百度云、金融、交通等部门提效),世界大会“与其说发布的是一个产品,本质上还是发布了几个案例”——“不能一直讲未来故事……这个果子一定要尽快长出来”。Robin 那句“技术起决定性作用的项目,十次即便有九次失败也认”在内部有真实感知:百度选择了以技术驱动的难路,To B 虽然“酒很香”,但需要一个更深入的过程。
Full transcript
把算法 Agent 放在一个进化论的环境里面,有了大模型之后,可以让算法和算法之间去做一些繁衍的动作。最早这个世界上可能很多物种的源头都是一些小的微生物,有的会演化成猩猩,有的会演化成深海鱼,有的可能演化成恐龙。有一些会存活,有一些会被淘汰掉。
没错,是这样,我们是那个造物主,去看每个生物演化迭代到什么程度了。
在算力 scaling up 的形势下,有了这样一个工具以后,其实是能把陶哲轩的能力放大很多倍的。一千轮的演化里面可能 80% 还在报 Bug,但是只要有 10% 在不断提升,那之前伐谋这件事其实就不是问题。
其实这个事儿长期来看还挺像科幻电影的。
未来很多企业都面临着要组建内阁制,可能会有保守派,也会有激进派。
是,这就很精彩了。
哈喽,大家好,欢迎来到商业漫谈,我是诗杰,今天和大家聊聊算法进化智能体。算法悄悄定义和改造着我们的世界,而算法本质上是数学问题。就在本月两周前,华裔数学家陶哲轩在 AI 的辅助下,和多名数学家一起解答了尘封 50 多年的世界级数学难题——Erdős 问题 1026。但国内鲜少关注到,陶哲轩所应用的工具是 Google 在今年 5 月推出的 Google AlphaEvolve,一种基于大语言模型的进化算法编码智能体。
AlphaEvolve 背后,是大模型让算法实现自进化的一种新范式。而在中国,同样前沿的研究也正在进行,算法智能体正悄然在各个行业落地。本期嘉宾安南毕业于清华自动化专业,他将为我们梳理算法的演进史,以及在当下的大模型时代,算法的自我演进机制将会如何改造社会的生产力和生产关系。
这期的话题有一定的专业性,不过不用担心,我们将延续一贯的风格,把一项艰深的技术讲得通俗易懂和有趣,相信大家都能从中收获一些重要的新知。欢迎安南给大家打个招呼吧。
大家好,我是百度法务产品负责人李安南,九八零出身吧,2023 年从清华自动化专业毕业之后,加入百度做一些大模型相关的 To B 方向的事情。
1. 自动化走向大模型
之前在学校里面,自动化这个专业,尤其是清华自动化,基本上分两个大的方向。第一个方向偏 AI,基本上做一些计算机视觉这样的 AI 模型;另一个方向更传统一点,面向更多的工业场景,做一些偏控制类、调度类的事情。
清华自动化的 AI 方向主要是两个方向。你当时是在 CV,也就是计算机视觉,还是工业化应用的方向?
当时主要还是在 CV 这边,包括我自己实习的时候,基本上也都还是做计算机视觉。那时候计算机视觉是深度学习领域的显学,包括商汤、旷视,当时的 AI 四小龙,也包括无人驾驶,其实都是几年前那个时代的事情。那个时候大模型还不是显学。
那时候大模型还是一个实验室阶段吧。你是哪一年毕业的?
我是 2016 年入学,2023 年毕业,那就是大模型抬头的时候。
对,刚好 2022 年我们当时秋招找工作的时候,大方向刚好就是 ChatGPT 发布的那个时间点。学 CV 出身,转到大模型这个方向,探索得顺利吗?
其实我觉得还好,因为整体思路是很像的,本质上都是一些算法问题。当时 NLP 那边有一些新的工作出来以后,其实也能很快捡起来。2023 年那个时候,真正全国做 NLP 方向的可能也就是那几个高校实验室,尤其从产业界的角度来讲,还是有很多学习的机会。
这也是我当时在百度一两年里面最大的一个历练。我们真正关注到了 To B 非常垂直的生产力场景,然后去看怎么用大模型的一些技术把它解决。这是我们目前最大的收获。
2. 算法开始不断进化
今天请安南来,其实是想聊聊算法的演化,尤其是在大模型时代,算法会有什么样的变化趋势。我注意到,AI 算法智能体其实还是一件很新的事情。美国那边在 2025 年 5 月,Google 发布了一个叫 Google AlphaEvolve 的算法编码智能体,它是一种基于大语言模型的进化算法智能体。
我不知道应该怎么理解这个智能体,你也讲讲你对 AlphaEvolve 的观察。
我们因为对这件事情还有一点理解门槛,所以从头开始吧。先说什么叫算法。算法本质上可以理解为一种数学形态,但是它的承载形式是一段代码。
它就是一个黑盒。我们给它输入一、二、三几种数据,过一段时间之后,它再输出一段数据,这个东西就可以统称为一个算法。比如最简单的算法,一加一,一个加法器:我输入一、输入二,它是不是给我输出一个三?
加法器可能就是最简单的算法。我们之前可能都看过一部电影,叫《模仿游戏》,里面图灵机时代最基础的逻辑其实就是这样。时间发展到六七十年代,会有一些更复杂的算法出来,比如排序算法。我给它一大堆数字之后,它怎么能够更好地让这些数字排好序。
当然,算法会分好坏。比较差的算法,可能要算 100 次才能把排序算出来;好的算法,有可能只需要 5 次,或者更短的时间就能把它算出来。这可能就是算法的核心追求:它的效果是关键。
它相较于一段软件代码有一个比较大的区别,就是算法是分好坏的,不是说功能可行、没有 Bug 就完事儿。
时间再往后走,到七八十年代,大家又发现了一些新的、基于概率的算法。前面的排序算法更像是说,我只要按照时间去计算,它其实是完全数学可解的。但现实世界太复杂了,很多时候很难直接通过这样的逻辑去解决。
于是就有一些偏概率、偏搜索式的算法。比如说我们一直朝着某一个方向探索,左、右、前、后这 4 个解哪个更好。如果前面这个解更好,我就朝前走一步,然后再看左、右、前、后,再朝前走一步,再看看左边,用这种迭代式、偏搜索的逻辑,去完成刚刚说的一加二到底等于三、四还是五这样的操作。
前面这两类,都是我们大学本科基础课上会学到的。到了九十年代以后,机器学习出来了,可能更偏模型、数据驱动。当时最早可能是 SVM,也就是支持向量机,后面就是神经网络、深度学习。深度学习规模大到一定程度以后,就有了大模型。最近我们可能又有了 Agent,这可能就是一直到现在的发展历程。
我们现在想的是,当一个 Agent 或者一个大模型的能力发展到一定程度之后,这样的一个算法是不是可以去优化别的算法?这可能是我们在做的核心事情。
用这个 Agent 去优化前面提到的所有算法,包括最早的加法器、排序算法这样的动态规划类算法,再到后面的基于概率的搜索算法,甚至直接去优化一个机器学习算法。它有点像是用更高等、发展到一定程度的智能,去解决前面那些小的智能问题。
什么叫机器学习驱动下的算法?
机器学习的逻辑更像是数据驱动。比如一加一到底等于二还是等于三,我不知道,但是我有一大堆样本。我是不是可以从 1000 条这样的事例里面,学会一加一等于三、一加二等于三?
它不在乎中间的机理,我就是纯粹靠数据去学习里面的一些特征,这就是数据驱动的算法。
所以从机器学习到深度学习,算法有什么样的变化?
这部分从刚刚那个比较长的大趋势上看,它们俩的变化不算特别大。更像是神经网络结构越来越深。以前可能只有两层或者三层,能够描述一些简单的现象,比如一加二等于三。等到规模达到 13 层,甚至 70 多层的时候,可能才能更好地描述人脸关键点识别、情感分类这样更复杂的逻辑。
人脸识别也用的是算法,对吗?
也用到了算法。它本质上是输入一张图片,而图片在算法空间里会被抽象成一些数字,比如 RGB,也就是红、绿、蓝三原色的数值。这是一大堆输入,给它输出的可能是:你到底是男生还是女生;如果是关键点识别,输出的就是眼睛上的 10 个点应该在哪个位置。
本质上还是符合刚刚说的算法逻辑:输入一堆信息,中间是一个黑盒,再输出一些信息。
机器学习算法和深度学习算法的边界在哪里?
其实不是特别明晰,很多时候大家会混用。一般来讲,机器学习可能更传统一点,更像是一些小的模型,不局限于神经网络;但是深度学习一般来说大概率都是神经网络这样的逻辑。
那我们回到今年 5 月 Google 发布的 AlphaEvolve,怎么理解它的行为?
3. 大模型开始优化算法
我们刚刚其实讲过,如果大模型的能力已经提升到很高的水平,那我这个事情本身是不是就是一个算法?我输入的是需求,比如我希望你帮我优化一段人脸关键点识别算法,输出的是什么?输出就是那个算法本身。
这件事其实就是 AlphaEvolve,以及我们可能在关注的事情。但它也不见得是凭空出现的,因为它是有迹可循的。业界有一个相对主流的观点:对于可明确评估的问题,AI 大概率都会解决。
比如我们刚刚提到的人脸关键点识别算法,它的目标非常明确:眼睛在哪里、鼻子在哪里、嘴在哪里。这件事是客观存在的。它相较于讲故事、对话这类问题,有一个特点,就是评估非常简单。
但是,把这个算法写出来本身又非常难。这其实就是 AlphaEvolve,或者我们之前提到的伐谋会关注的一个重点。我们可以理解为,用大模型的能力来优化算法。
对。
没错,就是用一个高级智能去解决一个低级智能。
Google 推出 AlphaEvolve 之前,有什么准备吗?它在能力上有什么积淀?
AlphaEvolve 的前身,其实是 Google DeepMind 团队做的 Fan Search。这是上一代的工作,在大模型能力还没有那么强的时候,它能够优化的是一个具体的小算法片段,也确实取得了一定效果。
另外,同期也有一些实验室的工作,包括香港城市大学那边的一项工作,叫 EoH,核心逻辑也是一样的。只是随着大模型的代码能力提升之后,这件事就更大有可为了。
包括我们自己去年 12 月也在做一些类似的、基于明确评估器自迭代的 Agent 探索。那时候因为大模型的代码能力还没那么强,所以我们当时发现的核心问题,其实是在调 Prompt,通过自动迭代的形式,自己把一个 Prompt 修复、改写得更好。
到今年,大模型的代码能力又显著提升了之后,让它自动去改一个算法,这件事就非常呼之欲出了。
我查了一下网上的资料。有人说,Google 推出 AlphaEvolve 之后,先把自己当成小白鼠,在内部庞大的业务当中很多地方都有应用。但我看国内对于这件事的关注很少。
Google 当然在内部使用,它的论文也对外披露了。但感觉它更核心的还是科研,会和陶哲轩这样的数学家合作,去发现一些新的理论、定理,类似这样的科研工作。这部分含量还是挺大的,只不过大家可能都关注在陶哲轩身上,没有太关注陶哲轩使用的其实是 Google AlphaEvolve 这样的智能体。
这个很有意思。我的理解是,他们跟最顶尖的数学家合作的过程,其实有一点从 AGI 到 ASI 的意思。
目前为止,AGI 就是大模型 AI 的智能,可以是我们全人类智能的总和。但如果有一天,我们用大模型的能力探索出了人类现在还没有探索出的研究成果,那其实就到达 ASI 了,是这样吗?
没错,这件事非常 promising。尤其是陶哲轩他们给出的那个逻辑,很多时候那个事情倒不见得一定是人想不到,而是我没有那么多时间。有了这样一个工具以后,其实是能把陶哲轩的能力放大很多倍的。
百度伐谋相较于 Google 来说,可能更关注产业界。产业界有大量的问题。一个资深的算法工程师,你说他能不能解决这些问题?可能他花 100 年也能把事情解出来。但你不可能让一个工程师算 100 年。
如果这个问题足够重要,类似陶哲轩他们的证明题,或者产业界更高难度的调度类问题、预测类问题、机器学习类问题,这些其实特别适合让伐谋以及这样的 AI 智能体,在算力 scaling up 的形势下把它解决掉。
像数学、物理这些有明确客观解,并且可以被验证的问题,特别适合 AI 来做。
对。所以我们最近关注算法问题,本质上也是一样的。
你刚才提到,你现在在百度做的伐谋,其实和 AlphaEvolve 是同一件事,或者说是类似的事情,对不对?
大的思路是很像的,核心是一个大的逻辑。当然我们也有自己的一些区别。他们可能更多是在探索前沿的数学科研,而我们会更多应用在产业界。
这可能也和中美两边的国情有一些相关度。
你们是受到 AlphaEvolve 启发之后才做这件事的吗?
我理解大的方向应该还是一个趋势。去年 12 月我们已经在做一些类似的探索,只是当时大模型的代码能力还没有那么强。
之前我的节目也做过一期关于代码能力演进的内容,嘉宾提出,其实在 Claude Sonnet 3.7 之后,是代码能力的一次质的突破。我不知道这个时间点对你来说是不是成立,或者你认为转折点是什么,以及为什么这件事今年能做了?
这个还挺有意思。一般大家一提代码能力,都会提到 Claude,对吧?大家会认为 Claude 做得最好,是最好的代码模型。但实际上,在我们偏研究或者算法的场景下,Gemini 才是更好的模型。
一个算法工程师的画像,和一个开发工程师的画像,可能有一定区别。算法工程师更看重聪明劲儿,可能会招更多年轻、学历背景更好的同学,因为他的特点更像是:我需要想很多 Idea,这些洞察能够转化为一个好的算法。
但开发工程师更像是吃经历。我应对过复杂系统,见过各种各样的需求,所以老师傅的能力和经验在这件事上非常专业。
我们也会发现,一个好的算法工程师大概率比较年轻。最近有很多 AI 工程师也非常年轻,可能就能取得很好的成就。但是开发工程师一般来说还是得有更多经验。
算法工程师是偏后端的,是后端里面一个具体的小模块;开发工程师是后端加前端。并不是所有软件都一定需要算法,但一般来说,更高价值的场景,比如广告系统、搜索系统,里面最核心的其实就是策略算法。
开发工程师需要更多的是工程化能力?
对,没错。
你刚才的意思是,对于算法工程来说,你们认为 Gemini 更好用,在实操上是这样。那如果从开发工程的角度来讲,还是 Claude 更好用,是这样吗?
对。再举一个例子,大家一直会说 Cursor 好用。它有一个特点,就是一个工程特别复杂、上下文很长,可以看到很多前后的相关关系。这样我改动 A 的时候,不至于把 B 改坏,这可能是工程上非常重要的能力。
但算法上不见得一定需要这样的能力。
既然你觉得 Gemini 更好用,那 Gemini 2.5 Pro 是你们的转折点吗?
可以这样理解。它 3 月份发布实验版的时候,我们就测了,会发现这个东西确实有很大的提升。
为什么算法工程上 Gemini 的能力更好,而开发工程上 Claude Sonnet 更好?
因为这两者都不开源,所以我们很难给出确定答案,只能说是我们的一些观点。
我最近经常回学校,有时候和清华的同学一起上课,或者做一些分享,会发现高校同学用 Gemini 确实更多一点。不管是写算法,还是帮他们做研究,可能都更相通一些。
为什么?你采访过他们吗?
就是确实更聪明,大家觉得效果更好。
至于为什么,模型训练的数据可能也会有影响。比如 DeepMind 本身就是以研究为主的团队,相关数据可能更多,在后训练过程中也可能更强调这些事情。当然,我自己也在做一些探索,但这很难说是一个定论,只能说是一些洞察。
你们在伐谋的工作当中会用到 Gemini 吗?
如果是一些验证类、外部开源类的工作,确实会基于 Gemini。如果是客户类的工作,因为涉及安全和隐私,我们还是会使用中国的模型。
那你们现在是用多家的模型,还是只用百度自己的模型?
这个事情可能比较 tricky。我们发现,不同模型的 Idea 和思路方向不一样,所以大部分时候还是混用为主。
比如 DeepSeek R1、百度自己的模型,以及一些表现比较好的开源模型,包括通义千问等。这个事情还是挺有意思的:就算是一模一样的 Prompt、一模一样的代码给到它们,生成出来的新东西也不一样。
我们发现每家 AI 都有自己的人格。
AI 格,在算法上就是算法格呗。
今天百度世界大会我也在现场。我发现一个小细节,Robin 今年更多是一个串场的角色,但伐谋这个产品的发布是他亲自讲的,而且好像很有热情。
他的原话是:“今天我自己在讲伐谋这个产品,是因为我觉得它重要,而且我也很有激情想把它表达出来,让大家能够知道这是什么产品、什么技术。”为什么他会对这个产品这么重视?
4. 伐谋瞄准高价值场景
首先特别感谢 Robin 的支持。我们其实从上到下,对这件事都非常有热情。
为什么呢?因为这个场景选得特别 niche,特别好。去年我们做了很多所谓的场景建设和大模型商业化落地,在 To B 场景里,大部分还是聊天、角色扮演,或者 K12 数学解题,帮助学生更好地理解数学,或者做电商质检。
这些环节重要吗?重要。但是价值有多大,这件事不见得那么快就能体现出来。
而伐谋现在选择的场景,是一个算法问题。算法问题本身就是千行百业客户最关键的一些决策类或者预测类问题。如果能有 1% 或者 5% 的提升,对一家企业来说,可能就是产值的飞跃,或者生产力的变化,它的价值非常明确。
我们也可以理解,一般算法工程师都比较贵,是因为算法工程师能够为企业创造与之对应的价值。从这个角度讲,这可能是 AI 卷到的一个新地方:把 AI 用在高价值场景中,能够有更大的逻辑和价值体现。这可能也是 Robin 想亲自把这件事讲清楚的原因。
背后的逻辑是,但凡算法要应用的场景,一定是最核心、价值最大的场景,是这样吗?
一般是这样。否则也不值得把它抽象成一个数学问题。
举一个更贴近消费者的例子。我们今天都用滴滴,知道滴滴要运用算力去调度车辆,其实就是有一个大算法在控制。
没错。我们可以想象一下,如果这个场景没有算法来控制,可能就回到九十年代了,商业模式也不存在。我们给师傅打电话,他才过来,可能要等 5 分钟、半个小时,甚至他还不接电话。
滴滴的算法就是一个高价值场景、最核心的东西。如果这个东西提升 5%,大概率它的产值也会发生很大变化。我们把滴滴替换成其他产业里的公司,把共享出行替换成工业行业里的千行百业,其实都是成立的。算法所在的,就是高价值场景。
所以伐谋这个产品,我理解是让大模型的能力帮助算法进行自优化。你们官方有一个解释,说伐谋是一种算法自我演化机制的技术。我们来解释一下,算法自我演化机制到底是什么。
5. 算法需要群体进化
最近很多 Agent 都管自己叫自我迭代或者自我演进的 Agent。但在我们看来,演化或者进化应该是一个群体概念,不应该是一个单 Agent。
比如我试了 10 次,获得了一些经验,第 11 次能做得更好,这个东西最多叫记忆,最多叫经验,还不能叫自我演化。
我们想讲的是,把算法 Agent 放在一个真正的进化环境里面。这个环境里有不同的进化策略。在滴滴车辆调度的场景下,可能某一种进化策略是最好的;换到金融风控算法,可能就要用另外一种策略。
对伐谋来说,我们是在自适应、自动地寻找这些优化策略。
这个听起来还是有一点玄乎。我们可以这样理解:之前大部分自我迭代的智能体,更像是一家创业企业不断试错。我尝试 A 场景,发现找不到 PMF,就去找 B 场景。它还是一个单体概念。
但伐谋或者 AlphaEvolve 这一类工作,更关注的是 VC 的逻辑。它更像是:我现在不在乎每一个 Agent 的死活,而是让 100 个 Agent 同时尝试不同的方法。它更像是一个概率逻辑,只要大盘概率是对的,有一个 Agent 实现了 100 倍回报,把整体效果提升了 100 倍,那整个系统就是有效的。
这件事特别适合算法问题。因为算法问题价值高,我不在乎某一个单独 Agent 的算力节省。我可能真的会开 16 路并发,或者上更大规模的搜索。
在这个过程中,进化策略就非常关键。
你刚刚说,你们在用进化论的思路做 AI Agent 的演化机制和生态,是这样吗?
可以这样理解。进化算法本身是一个相对传统的算法,但它和大模型的结合还是非常有意思的。
你先解释一下什么叫进化算法。
进化算法可以参考达尔文的进化论。比如我有 5 个岛屿,每个岛屿上有 10 个物种或者 10 个个体。个体之间可以做繁衍,表现好的个体有更多资格和别人繁衍,表现不好的可能慢慢死掉。
经过 10 代、100 代、1000 代之后,优胜劣汰,岛屿上存活的可能就是各个岛屿最优秀的个体。如果我们再在岛屿之间做交叉,就像世界村一样,慢慢可能实现全局最优。
在我们的场景里,每个个体可能就是一个 Agent,或者一段算法。可以让算法和算法之间做繁衍,这就是最早提到的算法优化能力:怎么基于 A 和 B 生成一段更好的 C。
至于什么时候应该让 A 和 B 繁衍,什么时候应该让 C 和 D 繁衍,这就是进化策略。
还可以换一个比方。它比较像挖石油:什么时候应该把这口井再往下挖一挖,可能还能找到石油;什么时候应该放弃,去另外一个地方打一口新井?这个策略就是演化策略,或者迭代策略。
而不是盯着一口井不断往下挖,这样很容易陷入局部最优。这也是单体和群体的区别。
以前让一个算法和另一个算法繁衍,把两个算法拼在一起,可能就报 Bug 了。但有了大模型之后,可以把这两个算法交给大模型,让它生成第三个。简单来说,就是算法片段之间有了繁衍能力,算法 A 和算法 B 可以进行繁衍、生 100 个孩子,然后大模型从 100 个孩子里挑出最优的那个。
其实不对,正好是反过来。生孩子这个过程是大模型来做的,否则算法 A 和算法 B 怎么结合在一起?
但挑选它的话,大概率还是人来决定,对吗?
对。人会写一个评估器,有点像指挥棒。
你讲进化论,让我想到最早这个世界上很多物种的源头都是一些小的微生物。这个小微生物在遇到不同环境之后,有的会演化成猩猩,有的会演化成深海鱼,有的可能演化成恐龙,然后灭绝。
它遇到新的环境之后,自适应成一个新物种。这个新物种有一些会存活,有一些会被淘汰,是这么一个原理吗?
没错。在我们看来,谁活下来不重要,只要最后有一个擅长的东西就好了,我们把这个东西拿出来。
这件事能够运作,是因为大模型有规模化繁衍的能力,对吗?
大模型在这里的作用,是它的概率。大模型代码能力提升之后,它向下一代繁衍的概率就有了。如果这个概率大于 50%,再乘以 1000 次,这件事就能奏效。
如果概率小于 50%,越演化越差,大模型能力不够的时候,就算演化 1000 轮或者 1 万轮,也出不来一个好的结果。
这是大模型的能力,而我们对它做筛选、做育种,这就是百度伐谋 Agent 的能力。这两者是拆开的。
你之前讲过一句话,说千行百业的算法工程师工作其实比较类似,为什么?
6. 算法工程进入自动循环
因为大家基本上都可以抽象成 4 个步骤。
第一个步骤是选一个 baseline,也就是选一个基础算法。基础算法可能是之前别人写过的,也可能是同事写的,或者是我自己以前写的。
选中之后,针对一个新的情况,我们会思考有没有新的可能性,或者去外部看论文、看其他实现,这是第二步。
第三步是基于其他 Idea 加上基础算法,形成一个新的算法。
第四步是拿去测评,跑一下测试用例或者验证集,看看效果好不好。如果有不好的案例,就拿回来做 case review,看看到底哪里不好。然后再回到第一步,既然知道哪里不好,就基于这套算法再改一次。
基本上都是这 4 个步骤。
这 4 个步骤其实都可以做 Agent 化改造。比如大模型的分析、推理能力提升了,那么去外面参考论文、形成新的洞察,也就是第二步,就能完成。大模型的代码能力提升了,就是基于前面的 Idea 和算法生成新算法的能力。
第四步的评估,也可以写成一个客观存在的代码。这 4 步都能够被 AI 解决。
如果这 4 步都被 AI 解决,对人来说更关键的是怎么定义问题,以及怎么把刚刚提到的指挥棒设清楚。也就是第一步和最后一步:定义问题和评估效果。
把问题定义清楚,把评估写清楚,不断寻找新算法的过程交给 AI。
提到算法,像我们这一代人更熟悉的,其实是移动互联网崛起之后的推荐算法。过去那个时代,推荐算法的优化也是由人完成的;但在现在的大模型时代,推荐算法的优化有可能由 AI 大模型来完成。
对。大模型的介入,本质上还是利用它 scaling up 的威力,以更高效的方式计算出这个概率。应该说,它能提升算法从 A 到 B 的优化概率。
有了大模型,我把算法从 A 优化到 B 的概率提升了,但它不能保证每一次都有效。我们实际观察到,1000 轮演化里面可能 80% 还在报 Bug,但只要有 10% 在不断提升,那伐谋这件事就是有效的。
做一个简单的比喻,不知道对不对:从 A 点到 B 点,我们设立了 B 点的目标,其实就是要找一条最优路径。如果现有路径是这样,算法优化就是探索另外一条更高效到达 B 点的路径。
没错,我觉得这个比喻非常确切。大模型的 scaling up,就是可以同时计算很多条从 A 到 B 的路径,最后告诉你可能哪一条路径的概率更大。
但你还是要通过人为评估和确认,确定它算出来的新路径是不是更高效。
本质上,它还是给算法工程师提效的一个环境和产物。
可以理解为提效率和提效果二者并存。
提效果,是以前人很难探索和解决的一些问题,比如陶哲轩面对的问题,或者业界更高难度的场景。另一部分确实是提效率。
这个产品为什么取名叫伐谋?听起来还挺深奥的。
因为它来自《孙子兵法》里的“上兵伐谋”。“谋”其实是一个策略,而算法本质上就是一个策略。
前段时间我回清华做了一次分享,电机系电力方向的同学介绍了一个场景:他们用大模型做垂直训练,然后去做调度。在电力调度场景下,效果确实提升了。
但是做完之后,泛化性非常差。换成物流调度、车辆调度或者港口调度,就不行了,需要在物流领域再来一遍。
但回到伐谋的语境下,我们写的是一段算法。算法本身在 A、B、C、D 行业,如果都是调度问题,它的通用性就很强。它其实是一个策略问题。
如果算法能力确实有所提升,那是不是就可以同时用同一个更通用的 Agent,服务 A、B、C、D 行业的调度场景,而不是每个行业单独去做非常垂直的事情?
它更像是“上兵”的“谋”。“谋”是策略,那“伐”是什么意思?
“伐”就是攻克,解决更通用的策略问题,从而实现更多价值。
算法有两大类,一类是决策算法,一类是预测算法。现在这两类算法有什么区别?在大模型的工作环境中,它们的优化方式一样吗?
优化方式其实很像,基本是一致的。
预测算法可以想象一个真实客户的场景:他是一家卖零售消费品的公司,第一件事是想知道明天、后天、大后天的销量大概是多少。他有一大堆历史数据,甚至有一大堆竞品数据,以前可能只能靠拍脑袋。
那是不是可以有一个算法,基于历史数据预测明天、后天、大后天的销量?这就叫预测类算法,也是人类特别想获得的一种能力。
有了明天、后天、大后天的销量之后,第二步就是决策:我应该给每个地区怎么配置?
决策类算法也很复杂。比如滴滴,它是一个偏决策类的算法。我大概知道这个地方有 100 单需求,那我应该什么时候给它补车,或者派什么样的车去补车?
听起来好像简单,但如果 SKU 特别多,货车又尽量少,这件事就是决策类算法。
这两件事由人来解决当然可以,但很难大规模去做。如果由 AI 来解决,可能千行百业中很多细分的、甚至没有那么大型的中型企业,也能完成这样的工作。这可能就是伐谋擅长的事情。
为什么这两个算法的本质框架是一致的?因为它们都会回到刚刚提到的 4 个步骤:先准备数据,找一个 baseline;找完 baseline 后,思考有没有新的优化方向;有了优化方向后,写一个新算法;新算法再测试一下,看效果好不好。如果不好,就再来一遍。
这还是刚刚提到的 4 个步骤循环,也是它能够被 AI 化改造、并且更通用的逻辑。
我试图梳理一下大模型来了之后,产业里解决垂直场景问题的方式,经历了一个演变过程。
最早大模型开放 API 接口之后,一个垂类场景可以接入某个大模型,然后做 SFT 微调,把自己行业里的数据交给它,训练成一个垂直行业的专用模型。微调后的模型可能能够解决垂类场景里的问题,但正如你刚才说的,它不具有泛化性,放到 B 行业就不成立了。
而你们现在做的事情,并不是在垂类场景里一个个微调模型,而是希望把各个行业需要用到的抽象算法能力,用大模型的能力加持之后,做一个整体的通用算法能力提升。
对,建立一个算法 Agent 的生态,让它能够自我演化。
里面那些小 Agent,真的可以叫生态,对吗?
对,就是这个逻辑。
这让我想到,差不多也是去年这个时候,我采访了华为云当时的 CTO 张宇昕老师。他讲到,华为对于 AI 大模型的应用思路,也是走工业产业界。
中国拥有最完整的工业体系,工业场景里的价值巨大,这和你们刚才提到的是相通的。但去年他们的思路还是结合千行百业的垂直场景,做大模型的落地和微调。
对,当然有价值。特别重要的大型、超大型场景,比如电力大模型,当然有自己的价值。
但是它很难真正把千行百业全部服务一遍,这个过程非常慢,尤其还会遇到数据问题。所以我们一直在想,有没有可能通过更通用的形式,把千行百业的场景服务好。
尤其是一些不见得那么大的巨头。有些垂直赛道的公司,体量其实已经非常大了,但普通行业外的人根本没有听说过。他们在自己的垂直行业里可能是最强的。中国有特别多这样的垂直独角兽,或者垂直领域的小霸王。
但过去大家都会认为,To B 行业的落地非常难。
是非常难。主要还是时间,因为现在仍然是一个非常早期的市场。
我们接触的大部分客户都会存疑:AI 还能做这么难的事情吗?因为一般来说,这件事至少得招一个 985 以上的算法同学才能做。
但另一方面,他们也会说,那就试试吧。因为尝试成本相对比较低。算法问题一般是一个抽象程度还不错的小片段,不像有些系统需要深度侵入客户的业务流程,做实验相对简单。
我们可能花 1 个月,甚至更短时间,就把一个基础场景的算法做出来。这个时候客户会非常开心或者惊喜。
之前有一家大型央国企客户说,以前 AI 做的大部分还是文科生的事情,但现在突然发现,伐谋做的是理工科同学的事情,已经可以拿来做算法工程师的工作了。
这就是理科生的事情。
对。相对来说,它还有一个特点,就是不怕幻觉。
如果目标非常明确,评估效果很好,那么审核人和审核 AI 的方式是一模一样的。因为我们刚才讲了,第一步和最后一步仍然要由人来确定:由人确定目标,再由人评估最终结果。
两端是收敛的,中间怎么做是大模型的发挥空间,所以它不太怕幻觉问题。
基于这样的逻辑,看到一个小场景效果出来之后,客户还是很愿意做更深度的尝试。下一步一般会开放一个新的、更难的场景。如果这个场景也能做出效果,就进入真正线上生产级的测试。
另外,国家政策也提供了一些支持。最近“人工智能+”行动里的一些细分解释性文件,明确提到希望在千行百业的场景里,出现自主、持续优化的能力。
过去算法工程师的工作非常项目制。上线之后,如果提升了 5%,效果很好,这个事情就结束了。第二次出现效果不好的情况,你不太可能再把那个算法专家找回来,让他重新诊断一次。
但如果交给 AI,做完一次之后,第二次、第三次出现问题时,只要让 AI 重新启动一次就好了。这是一个真正巨大的变化,它不只是提效,更像是生产力或者生产关系的变化。
7. Agent需要产业级基础设施
要让这些 Agent 跑起来,下面需不需要一个新的基础设施结构,去承托这个生态?
没错。我们核心讲这件事,其实还是 Agent infra 的逻辑。
如果只是一个单 Agent,其实不太需要什么 infra,大模型的 infra 已经足够它使用了。它调用完之后迭代式运行,最多再加一些组件、AI 搜索之类的东西。
但我们这套体系更复杂。我们认为,它未来可能会大规模用在真正严肃的生产行业和生产环境中。
比如刚刚提到,这里面有一些非常核心的算子和策略。还是回到挖石油的例子:我向下挖了 3 次之后,下一次应该继续向下,还是应该换一口井再尝试?这些核心算子更像是在引导 Agent 的进化方向。
有些算子引导效果好,可以很快找到石油;有些算子可能不适配某个场景。这些事情需要持续积累,去引导 Agent 更好地解决难题。
第二部分更像是基础设施的逻辑。API 调用如果只是 A 等 B、B 等 C,一步一步串行调用,互相等待的时间就太长了。
如果要跑 1000 轮迭代,等待时间可能会拉到 5 天甚至 1 周。但如果做更好的分布式调度,并行执行,把步骤拆开,让空闲时间互相利用,把 GPU 和 CPU 资源更充分地使用,就可能把 5 到 7 天拉回 2 到 3 天。
这件事在小规模 Agent 串行迭代中可能看不出来,但在更大规模、更产业级的 Agent 调用上,Agent infra 的作用就非常明显了。
如果要做 Agent infra,从底层能力来看,需要哪些要素构成?
就我们自己的场景来说,可能有两大块。
第一大块是怎么更好地做寻优策略算子,就像挖石油时工地指挥的那个算子。这个算子非常关键,算子就是一段一段的核心代码。
第二大块,是要建立一个 Agent 生态。
这件事只能由大公司做,还是创业公司也能做?
我现在的理解是,它应该是大公司的小团队,把两者的优势发挥出来。
为什么需要大公司?因为这件事本质上要在千行百业的很多垂直场景中完成。如果只是一个小团队单独提供一个标准化产品,显然转不起来。它一定需要生态,需要很多相关方参与进来。
不管是老师的实验室,外部的创业公司,还是垂直领域刚刚提到的小巨头,都可能参与进来。大家一起把这样的能力服务到千行百业。这是第一个逻辑,一定需要生态。
第二,刚刚提到 Agent infra 的逻辑,不是单纯做一个简单策略、几个好的 Idea 就能实现。它需要夯实底层基础能力,尤其是云资源和调度能力。没有长期积累,很难做好。
为什么又是大公司的小团队?因为这件事还非常早期。算法优化本身大家的理解程度就已经很高了,但模式上还有很多新的探索。
比如我们最近希望攻克一个问题:有没有可能做 RaaS?什么叫 RaaS?就是我给你提供最终结果。比如算法优化提升了 5%,在线上可能节省了 500 万。那我能不能 Result as a Service,把这 500 万按照效果收费?
也就是按效果付费。
没错。这个模式在中国目前还比较新,但可能会是 AI 时代的趋势。
第二种逻辑是订阅制。中国一直很想做 SaaS,也想走订阅制,但这个事情一直没有真正跑通。核心可能是,用户需要持续使用,而不是买断。
为什么我们的能力需要持续?因为算法优化本身就是持续过程。我雇 10 个算法工程师,他们每年可能都要给公司贡献一些价值,持续让算法得到提升。这个订阅制有没有可能跑通,是一种探索。
另外还有一些模式,比如海外 Palantir 的逻辑:设置一个前线工程师,驻在客户现场,去解决客户最重要的问题,比如调度或者算法问题。
能不能以一个小创业团队的形式,驻在客户现场,帮客户把问题解决出来,再深入场景去聊后面的事情?
这里的前线工程师,指的是具体的人,对吗?
对,是人拿着伐谋去解决问题。
你刚才讲到 Palantir,它是一个小团队放到客户那边,但用的是 Palantir 自己的产品,还是人加 AI?
回过头来讲,伐谋这件事现在太新了,模式还没有完全确定。
如果是超级大公司,直接按照某一种模式去做,不见得一定有效。它更像是小团队不断试错,不断创新,跑通一些客户,再复制这样的过程。
那 Palantir 的商业模式是怎么收费的?
Palantir 更像是走一个规模更大、周期更长的逻辑。当然它不见得一定是纯 RaaS,还是项目制,只不过它项目制的成本相对比较低,尤其是人的成本。
所以这些模式还没有完全清楚。如果是大公司大团队直接铺开,不一定合适,更像是小团队不断试错、创新,先跑通客户,再复制。
对。
小团队可以理解,因为还要不停试错。那大公司的优势是什么?需要生态,需要很多行业的用户;创业公司理论上也能做,只是需要很长时间才能把这么多行业都跑遍、把生态伙伴找到。在云基础设施方面,创业公司可能也没有大厂的实力。这些是你讲的大公司的优势吗?
对,这是非常明确、客观的优势。
还有一个点,因为这件事太新了。刚刚提到 AI 能解决这么难的问题,大部分客户是存疑的。如果是创业团队,就更难说服客户完成这样的尝试。
为什么大厂更容易让客户拿产品试一试?
相较之下有品牌优势。百度在 AI 上的品牌心智还是可以的,客户会觉得有一种安全感和保底的感觉。
安全感。
8. To B打开产业价值
2023 年,李开复老师曾经给过一个非常重要的判断:他说中国 AI 的路径还是要走 To C,美国可能先走 To B。我觉得从 2025 年年底来看,这个判断在大模型创业公司身上已经被印证了。我们现在其实优先选择运用到产业嘛。
你怎么看当年李开复老师的判断?AI To B 还是 To C,这条路径应该怎么选?
我现在的理解,它可能还是一个时间问题。长线来看,To C 当然有非常大的价值可以挖掘;但短期来说,To C 的商业模式不算特别好验证。
To C 公司会发现,AI 功能确实不错,但如果换成订阅制,或者真正向 C 端收费,这件事就比较难跑通。
To B 的好处是,如果选对了高价值场景,付费意愿非常明确。
另外,从伐谋这件事来讲,To B 和 To C 其实不是绝对分开的。我们自己也是 To C。平台上线之后,会发现很多高校同学在使用它,完成课程作业、毕业设计,或者自己的论文。
对这些同学,尤其是计算机相关专业或者有领域背景的同学来说,本质上就是一个算法问题。他的作业可能就是解决一个算法优化问题。
比如一个 AI for Science 场景,他想完成一个流体力学仿真模型。这个模型是一个 AI 问题,但这个同学是流体力学背景,让他真正去学习 AI、把这件事做出来,不一定能跑通。
但他基于这样一套系统完成任务,更像是快速地和 AI 工具协作,完成自己领域任务的一种方式。
我们更像是一个和 AI 协作的新范式。以伐谋为代表的一系列 AI 工具,如果有很多年轻人,尤其是非 AI 背景的同学,把它们用起来,这件事对我们来说更有意义,也更长远。
这部分同学我们大概率不会收费,更像是从培育的角度出发,培养更多能够和 AI 协作的工程师。商业价值大概率还是来源于 To B。
这个角度很有意思,从娃娃抓起,从还没有踏出校门的学生开始。他们可能才是未来 5 到 10 年里会在行业中发挥巨大价值的一群人。
因为我们团队还是非常年轻,基本上都是工作 3 年以内的同学,也有很多校招生和实习生。
那就是 00 后?
对。我是 98 年的,团队基本上都是 00 年前后出生的同学。
我们会发现,尤其是一些实习同学,不见得是 AI 背景,有可能是领域背景。他们确实是领域背景。比如调度类问题,他们可能是运筹学、工业工程专业的学生。你说他真的很懂大模型吗?也不见得。
但他很懂自己的领域。如果是刚刚说的 AI for Science,那大概率是 Science 那帮同学。他不见得很懂 AI,可能只懂一点点,至少上过相关课程。
这部分同学特别适合和我们配合,完成科研或者客户现场的工作。
你们现在做的这个算法智能眼镜,在产业里面应用的市场空间有多大?有没有一个具体数字?
这个数字非常不好估计。因为算法其实插在核心业务系统里面,我们只能举几个例子。
比如港口。装卸货有岸桥吊机,是一个特别大的装置,它的调度本身是一个复杂算法。
如果让人拍脑袋去调度,可能就是这边传过来,我赶紧过去;那边传过来,我又赶紧过去。这显然是一个局部最优。大家都很忙,但最后可能发现,在这里等一等再过去,反而更好,因为它可以考虑更多全局信息。
如果把调度做好,可能就是上千万的收益。
再比如制造业。中国制造业非常发达,里面有很多中大型民营企业。对他们来说,市场竞争非常激烈。如果产值能够提升 5% 或者 20%,就可能让整体市场竞争地位发生很大变化。
尤其最近不管是出海还是内需,都有很多变化。
这是一个很好的愿景。更像是说,当产业都被伐谋这类智能体协作起来之后,可能会产生新的生产力和 GDP 变化。
但你刚才突然让我意识到,我们前面讨论商业模式时,其实有一个很 tricky 的问题。因为你们做的是算法,即便算法优化到了很好的状态,也很难界定客户最终产生的价值提升,有多少是来自你的算法。
所以刚才讲的 RaaS 模式,真正实行起来也挺难的。
是,很难精确说有多少价值来自算法。
有些行业很容易算清楚,比如刚刚说的制造业,产值提升了多少,进账是多少。但有些行业,比如 AI for Science、金融风控,风控做得更好之后,收益到底是多少,确实很难知道。
所以刚刚提到的模式探索,也是在探索这个问题吗?
我和大模型 To C 方向的嘉宾聊天时,也会发现这个问题:最终评估一个模型效果的金标准,可能还是商业化数字,有多少用户愿意用脚投票,自愿给你付费。
去年我和华为云聊的时候,他们提到一个让我印象很深的点。华为和工业界打交道很多年,但在这一轮大模型浪潮中,他们第一次发现,工业领域这些被认为比较传统的行业,从业者第一次有了前所未有的技术焦虑。
大家都担心,如果没有赶上这一轮技术浪潮,就会被落下,在竞争中处于劣势。所以大家拥抱 AI 的积极性是前所未有的。我不知道你们的观察是不是这样。
两个问题分开回答。
第一个问题,现阶段直接看商业指标,我觉得确实是这样。但回到推荐算法、搜索算法的研发过程,我们其实可以拆出中间指标。如果算法工程师只能看线上最终测试,那确实很难工作。
伐谋也是一样。如果能拆出中间指标,这件事就容易切进去,可以快速做优化。
第二个问题,关于 To B 工业领域的焦虑感,我们最近大半年发现,和 2023 年相比,情况有一些变化。
2023 年很多人的想法是,多快好省地赶紧上,买卡、买 DeepSeek 模型,部署一大堆。现在客户的痛苦反而是,怎么把这些东西用起来。
很多时候他们发现,东西确实用了,但价值在哪里并不明确。所以每次伐谋和客户交流时,客户很高兴的一个点就是:如果真的能把算力利用起来,把 DeepSeek 这样的模型资产用起来,而且用在一个非常 niche、非常有价值的场景上,这正是大家特别想关注的。
这个曲线很有意思。如果从 2023 年开始看,华为的余心总他讲的那种焦虑感是真实的。2024 年大家把模型部署、用起来之后,可能会有一个信心的小低谷。
一开始期待很高,最后发现它还没有办法一步到位,大家就会觉得,大模型也不过如此。慢慢地,这条曲线又往下走。
但 2025 年有几个本质变化。第一,AI 真正进入推理时代,能够解决很多问题。第二,刚才讲到的代码能力也发生了质的提升。
你觉得 2025 年工业界使用大模型或者 AI 能力的信心回升了吗?
肯定有。以伐谋为代表的生产级 Agent,基本上就是基于你刚刚提到的这两个大的能力。
千帆上也有一些其他产品。这些环节在真正和客户交流时,会比知识库问答、电话客服这类场景更进一步,更能切入核心环节。
如果产业继续不断进步,尤其到明年逐步展开,可能会迎来又一次高潮。
大会上我们发布了金融风控案例、港口调度案例,以及中国能建的路径规划案例。发布之后,确实有很多相似客户找上来。对他们来说,这可能正是最核心、最痛的问题。
如果他看到行业里的其他人竟然能用 AI 解决这样的事情,对他来说还是一个很大的激励和兴趣。
在大型企业的生产研发过程中,是不是存在很多高难度算法亟待优化?
是。但这里面有一个实操问题。
我之前和 To B 领域创业者聊,他们会说,尤其在国央企里,很多时候客户给 To B 企业的反馈不一定是真实反馈。复杂的客观条件,最终会导致一个看起来像这样的结果。
比如在大企业里,选择订阅或者合作某项服务,并不一定基于服务提供的实际能力,可能基于人情或者其他利益关系。这过去被认为是中国 To B 领域特别难办的问题。
这些问题肯定客观存在,也很难用技术解决。但好处有两个。
第一,这件事足够新,也有政策引导,所以大家尝试的概率很高,可能会超脱于客情关系等因素。
第二,如果事情真的能做出来,对客户来说会有更好的激励。
第三,我们会特别关注中型民营企业。普通人可能没听说过它们,但它们确实处在垂直赛道,而且非常在意产品效果,也会忠实地反馈。
如果真的能帮它提升 5% 的产能,那确实很有吸引力。
对,这类企业很多时候比我们更焦虑。交流结束之后,他们会马上把测试样例和数据发过来。
当然,这两类客户都很重要。
当我们讲要让大模型得以应用,必须具备算力、算法、数据这 3 个条件。在工业场景里面,这 3 者都具备吗?
算力是一个问题。数据方面,我们目前见到的大部分大型企业,在上一个阶段基本都完成了数字化,数据层面做得还可以,暂时没有太多担忧。
为什么呢?企业客户受中国国情和监管限制,很难把所有数据传到公有云上,这和 AI for Science 的科研场景不太一样。所以我们更关注产业级需求。
怎么办?我们最近发布了一个本地评估方案。
大模型生成代码这件事非常消耗算力,可以放在云上。但把算法拉到本地之后,在本地基于企业自己的数据评估算法效果,再把最终结果上传到云上。
这个方案对大部分中国企业的接受度会非常高,因为数据不用出域,同时也不需要准备那么多昆仑芯、英伟达或者昇腾芯片。
伐谋整体的大模型以及上面的框架都可以部署在云上,这样既能享受云上更好的效果和效率,又能满足数据不出域的要求。
过去有一张图流传很广,是中美 AI 价值层的对比。
我们常说美国现在是一个正金字塔,底层比如英伟达,为各行各业提供基础算力的公司,价值层最厚;越往上走,价值逐渐稀薄,所以形成一个正金字塔结构。
但很多专家也讲,一个健康的生态应该是倒金字塔,越往上走,应用层的价值越厚。我们今天还没有完成从正金字塔到倒金字塔的过渡,但其实正在进行。
今年 Robin 提到,AI 应用是最后一层价值。他希望百度用 AI 技术能力帮助各行各业释放价值,帮助千行百业内化 AI。
我想听听你们内部的视角。帮助千行百业内化 AI,你们是怎么思考的?
还是以伐谋为例。我们面对的确实是应用层价值非常厚的过程。
9. 产业走向智能原生
我们的愿景,是让千行百业的研发环节实现智能原生和持续价值创造。
什么叫内化,什么叫智能原生?人做调度场景时,有很多人为的先验假设和限制。
比如上游来了一大堆订单,我先做谁、后做谁?以前人来判断,会把订单分成 P1、P2、P3、P4,做完 P1 再做 P2,做完 P2 再做 P3。
为什么?因为人处理不过来全局优化,所以只能按照这个逻辑来。
但如果让伐谋做,所谓智能原生,就要把人为限制打破。我们可能真正应该关注的是毛利、收入或者客情关系。
如果能把这些数值化、明确好,就不需要按照第一个序列跑完再跑第二个序列。我可以先做 P2,再做 P3,再做 P1,因为订单交期和弹性是不一样的。这些事情适合让 AI 做全局搜索。
当这些阶段性的壁垒被破除之后,价值就能提升很多。这是第一点:真正实现智能原生,把以前人脑负载不了的决策问题开放给 AI。
第二点是持续优化。一个场景做完之后,以前算法工程师很难长期待在项目上,持续寻找新的 Delta 算法。
为什么叫 Delta 算法?因为数据不一样,工况也不一样。有时候特别忙,有时候特别闲,这两种情况就应该用算法 A 和算法 B 解决。
一个算法通用性越好,它在垂直场景里的效果可能越差;垂直效果越好,通用性一般就越差。
对伐谋来说,它可以根据新情况、新数据流入,不断寻找不同工况下的最优算法。
所以是两个逻辑。第一,破除阶段性的人为假设;第二,持续不断地优化。以前很难让人这样持续工作,但 AI 可以做这件事。
把 AI 内化到整体业务价值里之后,价值就能实现更大的飞跃。
能够听出来,像伐谋这样的 Agent,虽然也是 Agent,但和 Manus 不一样。
Manus 更像一个用户的个人 Agent,是一个个体,不停做迭代。但你们刚才已经讲了,不是一个 Agent,而是一群 Agent、一个完整的 Agent 生态。
所以它的用户界面和使用方式会是什么样?帮我们可视化一下这个场景。
一般分 3 步。
第一步是提交任务;第二步是任务过程中的监控;第三步是最后的审计。
提交任务还是 Chatbot 的形态,会有一个 Chatbot 界面。产品一开始本质上是一个 Web 端,但现在我们发现,不同场景的使用习惯不一样。
有些人喜欢用 VS Code。VS Code 是一个写代码的编辑器,里面可以做插件,比如 Copilot 之类的工具。也有一些 AI for Science 方向的老师,大部分使用 Notebook,这是另外一种工具。
所以在第一阶段提交任务时,我们会支持各种需求。核心逻辑是,不同人群、不同思路,都能更快地把任务提交上来。
提交任务本身是简单的,只要把任务写清楚,把评估器写清楚,就可以通过对话不断完善。
任务提交到伐谋集群之后,它更像是一种新的科研范式。它大概率不是 Chatbot,因为比如我带 10 个实习生完成一个算法任务,很难每天和 10 个人对话,告诉他们进展。
这 10 个实习生更像是自驱的,自己探索、形成思路。我们可能更像是开会或者审查,而不是持续对话。
所以中间的监控阶段,更像是一张进化系谱图。
有点像我们是造物主,去看下面每个生物演化迭代到什么程度。它更像一棵树,有很多枝叶,每个枝叶又不断向下细分。
我们可以看到每个节点。有些节点有 Bug、分数很低,长期就会变灰、被淘汰;有些节点特别活跃、很聪明,就会变亮。
甚至还会有更多向后反演的机会。界面可能就是这样的。
我们可以点击每一个节点,看它具体发生了什么,代码是什么样,有哪些关键特征,和谁演化出来的,一步一步怎么走过来的。
这个过程非常符合一种研发范式:我看到一堆 Agent 自主地不断寻找新的可能性。
第三个阶段更像是,我的 100 轮或者 1000 轮已经结束,拿到了一个最优算法。我要告诉用户,这个算法为什么好,为什么比最初给出的算法效果好,它是怎么一步一步迭代过来的。
这个过程需要做好可解释性,理解它的核心思想。大概就是这样的逻辑。
第一阶段是对话式提交任务,通过对话把业务需求说清楚。第二阶段,伐谋接到输入之后,更像一个进化过程,我们负责监控。第三阶段是回头看这个东西为什么有道理、为什么效果好,也就是可解释性。
感觉像是用户撒出一颗种子,但大模型可以把这颗种子变成成百上千颗种子,放在不同的土地上培育。系统监控所有种子的成长情况,再进行优胜劣汰。
这个过程一定不能是纯对话式的。如果有 1000 个动物不断生长,作为造物主,我很难逐个和动物对话,看它在做什么。我只能选择那些好的、感兴趣的去看。
这样听下来,我会觉得伐谋不是我们过去做移动互联网产品的方式——人不断定义产品,把产品设计出来。
更像是你们把 Agent 自我演进的技术种到产业里面,让它自己生长出来。每个产业会生长出最符合自己的产品。
没错。这个问题可以从产品和技术两个角度来讲。
产品上,刚刚已经提到,中国的产业有自己的特点,数据隐私非常重要。所以我们会持续研发本地评估方案。这个方案相对比较创新,因为在此之前,我们几乎没有看到类似方案。
另一部分是持续性。这个事情能不能不断创造价值,而不是过几个月效果慢慢下降,也是我们现在总结的重点。
目前有 3 个核心产品特点:通用性、产业级、可持续性。
你们这个产品最重要的衡量指标是什么?
伐谋的规模和生态。
不是商业化收入?
商业化收入还太早期。我们更关注和生态伙伴一起完成市场教育,或者把千行百业的标杆案例做出来。
真正让最终客户和中间层伙伴,能够基于伐谋这种新的 AI 研发范式尝到甜头,这可能是我们最关注的重点。
有了这些,才会有更持久的价值。商业化收入更像是一个短期指标。
10. AI仍需人类把关
今年我采访了道的创始人。他们内部有一个信仰,认为大模型是神,是一个超越人的能力的存在。
把这样一个拥有全知全能、超越个体能力的神放进组织内部,很可能会爆发很大的威力。但我更好奇的是,它会不会也带来复杂问题,制造新的麻烦?
你们现在正把这样一个神放进千行百业,我想听听你的想法。
前者确实很多。比如金融风控场景,我们会发现它写出了一些特征提取器、因子挖掘的东西,确实是以前算法工程师没有想到的。但仔细看又挺有道理,对人也有启发。
之前解决不了的问题,可能这就是神的一面:只要目标定义清楚,它可以自己探索。
另一块是麻烦的事情。这个事长期来看还挺像科幻电影,尤其是很多决策类任务。
比如如果真的把红绿灯调度、电网调度、港口调度交给 AI 大模型这种更高级的智能来做,还是有风险的。
在实际过程中,肯定要有非常严格的审计要求。比如我们会写一个评估器,写完之后必须在这个评估器上保证效果好;效果好之后,人还要看是否合理,是否和自己写的基本一致,是否可解释。可解释之后,才可能做线上测试。
这个过程中也会发现一些超出人类评估范围的情况。
还是以港口为例。有一次它找到一个特别好的调度方案,用很少的机器完成了大量任务。但后来我们发现,评估器写得不够好,有一些约束没有满足。
它可能把调度中的设备理解成一辆车,可以越过右边的桥架跑到更右边。但实际上那是一个滑轨模型,有物理关系:只有把右边的东西移走之后,才能向右移动。
它没有满足人的预设。怎么办?就要更新评估器。确实是我们之前没有把事情说清楚。
如果能把事情说清楚,在满足所有约束的条件下,它找出来的结果相对来说还是符合预期的。
但很多时候,人确实没有说清楚。如果没有说清楚,就很容易被 Hack:指标看起来特别好,但实际上做了一些奇奇怪怪的事情。
所以人的价值仍然非常明确。这个事情绝对不可能是替代人,大概率还是需要有人把问题定义清楚,并且审计、监控它。
有句话叫“有多少人工,就有多少智能”。一开始大家认为进入大模型时代之后,这句话不再成立,因为它可能更多描述的是上一个规则型 AI 算法时代。
但至少在今天、大模型还处于比较中早期的阶段,仍然有很多部分需要人工定义。人要永远做那根经线,做把控者。
其实我觉得这是好事。如果不是“有多少人工,就有多少智能”,那可能就超出我们讨论的危机论了。
对,就更像是超出控制了。
我觉得人做最开始的定义、给出指引和指令,以及最后的审计,是一个非常好的 AI 落点模式。
如果真的把这些都交给 AI,很多科幻电影里可怕的事情可能更容易出现。
当我们讲 AI 可能会重塑生产力和生产关系时,在你们的产品应用故事里是怎么体现的?
生产力就是我们刚刚一直讲的:比人做得更好。
另外一个更关键的逻辑是生产关系。算法工程师的工作发生了一些变化。他以前的大部分工作,是写代码、测试和探索。
现在可以把这些事情交给 AI。以前一个人能做的工作,可能变成一个人指导 10 个算法 Agent 来解决。
这不一定意味着原来有 10 个工程师,就会砍掉 9 个。我们大部分接触到的客户,更像是说:比如一家汽车公司有 100 个场景都想改造,以前没有那么多人,只能一个一个来。
如果生产关系真的发生变化,AI 可以应对 100 个场景,甚至把 100 个场景打通,解决一个更大、更全局、更难的问题,再加上持续优化,这就是一个巨大的变化。
但这对组织能力也有挑战。以前是两个人配合,一个懂业务,一个懂 AI。变化之后,大概率会变成一个懂业务、再稍微懂一点算法的人。他可能更好地和 AI 配合。
所以在大模型时代之前,算法更多是发现局部最优解;大模型时代之后,有机会做到全局最优解,是吗?
对。局部和全局本身是相对的概念。
你刚才讲到新状态下对原有组织的挑战更大。
这里也分两部分。
第一,怎么做到 AI 原生,让它去寻找全局最优。这件事说起来简单,做起来很难。我们怎么把之前人为设置的先验规定去掉?
这些规定不见得是死规定,可能只是过去 5 年形成的约定俗成。它有点像卧室和客厅之间有一堵墙,这堵墙不是承重墙,其实可以打掉,但它一直在那里。
所以不是老板说要打掉,马上就能打掉,过程中可能有沟通,甚至会有阵痛。
比如制造业有一个“锁单”逻辑。行业规定一般是 3 天锁单,也就是 3 天内要上产线的订单不能再调整。
为什么?因为以前人做调度很难,频繁变动会带来很大的思考负担,需要花时间消化。
但如果 AI 能很快解决问题,锁单时间也许可以缩短到 1 天。这可能会对公司内部机制,甚至行业约定俗成的潜规则,产生冲击。
当然这个冲击可能是好的,也可能是不好的。有些人类约定俗成的事情,不见得所有方向都愿意取消。
所以如果真的想实现智能原生、实现价值提升,可能就必须从上到下完成这个变化。
从生物角度讲,改变肌肉记忆是很难的。
对。但改变之后,才能更好地实现全局最优。
所以当我们讲,如何让 AI 从一个类似移植器官的东西,变成组织内生的原生部分,其实就是要打破肌肉记忆。这可能比技术落地更难。
是,可能要一步一步来。
在从移植到原生的组织进化过程中,什么样的人会特别被需要、特别被渴求?
我们现在特别高兴的是,线上看到了很多学生,包括在校的研究生、博士生、本科生,甚至本科生,都在拿伐谋尝试自己领域的问题。
刚刚提到,3 到 5 年或者 5 到 10 年之后,他们真正进入千行百业时,可能天然就会认为:这个算法问题就应该用 AI 解决。
这不是强迫现在的老师傅必须改变,时间可以解决这个问题。
第二,企业里一些比较年轻的工程师也很积极。他们不一定学 AI,但会非常细地问这个东西的原理是什么、为什么有效。这些同学也非常值得培养。
他们本质上是更懂业务的人,但主动性更强,更容易拥抱新的 AI 工具,或者新的 AI Copilot、Agent。
这和行业的大共识是一致的。未来更需要的,是懂业务但稍微懂一点 AI 的人,不一定非要是一个业务专家再加一个 AI 专家协作。
当然,也不是说前两类人就没有工作了。大家可能更重要的工作,是做审核和把控,去追求更难的问题。
之前你提到过“效率先锋”这样一个角色,它具体指什么?
这是一个新角色,也是我们最近的理解。
刚刚提到打破墙这件事很关键。我们告诉客户,这堵墙应该打掉,但客户不见得能立刻理解。
如果企业内部有这样一个人,专门关注哪些墙能够被打掉,这样的角色非常值得期待,也更有可能在企业内部完成这件事。
刚刚提到 Palantir,它有一种模式,有点像 FDE,也就是前线工程师。这个工程师不一定是 AI 背景,只是会使用 AI 工具,更像一个创业者。
他会去看实际业务需求和业务运转,发现哪些墙有可能打掉。用 AI 替代之后,能不能实现更大规模的提升。这对客户老板来说非常重要。
未来很多企业都面临着要组建内阁制,要开始思考怎么改革自己。可能会有保守派,也会有激进派。
是,所以很精彩。
当然这是一个长周期的事情,我们也不急,只是看到了这样的趋势和角色。
伐谋在服务客户的过程中,有哪些可以真正长出复利的能力?
11. 平台能力开始产生复利
最大的核心逻辑,还是 Agent 框架以及里面的进化算子。
类似的算法之间是有相似性的,这些东西可以沉淀下来。类似算法又可以服务不同的行业。从算法角度看,大概率是同一种算法,只是目标、数据形态和约束不一样。
这件事很有可能沉淀下来,成为整体 Agent 的核心价值和核心能力。随着我们看到的场景越来越多,它也会更好地沉淀。
产品上也有一些共性。比如客户都需要持续优化能力、数据不出域能力,这些都是大型企业非常关注的,我们会持续去做。
我之所以问,是因为当我们看到百度用大模型走向产业时,很容易有一个误区:是不是就是走 To B 方向?
但我更关注的是,它到底是在做 To B 的项目制服务,还是在构建一种通用、可泛化、能够产生复利的能力。
你们也有百度云,底下有更大的云业务承托产品。这个产品和云业务之间,能不能形成很好的联动?
我的观点是,我们本身还是一个平台。平台很难直接服务客户,可以做得更垂直,但如果要具体落地,一定需要生态伙伴。
我们的平台及平台上的能力,刚刚一直讲的是 Agent infra。伐谋本质上只是千帆企业级 Agent infra、AI infra 平台上的一个关键智能体。
我们的进化能力、逻辑、性能、调度能力,都可以被其他场景的自进化 Agent 快速使用起来。这可能是长期的价值。
另外还有算力。我们本质上是云智一体的逻辑,下面还有昆仑芯,以及更好的算力调度能力,这些可以打包成一个整体。
如果伐谋效果特别好,早期可能还是验证状态。以后如果要用伐谋同时跑 100 个模型、100 个并发,就会消耗更多算力,也会带来更多国产芯片的需求。这些都是客户会关注的。
对于云生态来说,你们构建的 Agent infra 或 Agent 系统,更像是一个销售的索引。先让客户感受到效果,带来更多计算需求之后,再和云服务打包销售。
没错,就是这个逻辑。
但本身因为场景有价值,这两层可以联动。百度云的进行时,是不是 AI infra 加 Agent infra 共同组成了 AI 时代新的云生态?
没错。这两者有很多经验可以沉淀。
从去年到今年,我们建设了很多千行百业的生产级场景。这些场景普通 C 端用户可能感知不到,但它们确实被内化在具体业务生产流程里。
这些东西可以更好地沉淀成平台能力,服务下一次类似场景。下一家客户遇到类似问题时,就可以更快、更高价值、更高效果地把事情做出来。
我们录制这期播客的时间点是在 2025 年年尾。我观察到一股趋势:拥有云业务的厂商,现在都开始走向企业,和企业一起共建企业级 Agent,释放企业生产力。
各家可能有各家的做法。你作为业内从业者,怎么看各家云生态和企业共建企业级 Agent 时,在风格、能力和生态上的差异?
这块我关注得不算特别多,因为我们目前核心还是一个比较小的切口。
我们可以分享一下具体垂域的关注点。我们更关注大型央企的重要场景,同时也关注一些中型制造业巨头,或者垂直领域的小霸王。
我们也会关注友商的动作。字节目前可能还没有太关注对应的事情,我理解它更像是公有云逻辑,先夯实自己的模型和平台,做到这么垂的地方可能相对少一点。
华为相对来说走得快一些,因为这个赛道过去就是他们非常重视的。
但它的核心逻辑还是靠人,靠算法工程师完成服务,仍然是项目制,可能会有一些技术探索。
阿里比较有意思,他们也是分两块:第一块是技术探索,也会关注相关配套。
我们目前能看到的是,几家云大厂在这个赛道上还没有特别明确的商业化产品出来,核心还是早期探索。但创业企业开始有一波起来了。
国内包括一些研究机构,海外也有一些 YC 孵化的新创业企业,可能都在探索如何用 AI 帮助解决算法问题、机器学习问题。海外还是走得更快。
海外有哪些创业公司?都是 YC 新孵化的吗?
名字我一时还不太能马上说出来,可以去看看 YC 相关项目。
那国内有吗?
国内目前还没看到特别明确的。
我看了一下你们的代表行业和案例,能源、金融、制造、消费这 4 大行业是重点。为什么是这几个行业?
首先还是因为价值大。这 4 个行业加起来,我估计占国内 GDP 的 30% 以上,甚至更多。
第二,场景非常多。这 4 个行业因为价值大,一般都有自己的一些算法,或者至少已经完成了数字化改造。不像其他行业,数字化改造可能还没有完成,也还没有形成细分领域的小巨头。
另外,它们也分两大类。能源和物流相对更聚集,制造和消费相对更分散。
更聚集的场景,更像是长期培养。如果一步一步走到最核心的场景,价值就不再是几百万,大概率是上千万,甚至上亿。
消费和 AI for Science 相对更分散,但速度更快,更像是马上能看到效果,快速切入验证价值。
所以核心关注的还是这 4 个方向,当然也包括制造业。
如果 AI 落地中国产业是一个进行时,我们能不能推演一下,5 到 10 年之后的中国社会是什么样?
在刚才讲到的这些重点行业里,会有什么本质不同?
我觉得 C 端不一定能感受得到本质变化,可能只是觉得效率更高了。物流更准确,浪费率更低,交通里的红绿灯和拥堵更智能。
但 C 端不一定理解它是怎么实现的。
对于 B 端内部来说,可能会有很大变化。比如研发团队可能会形成新的画像。
以前研发团队和业务团队通常是分拆的。以后会不会更像研发业务 BP?不一定需要独立存在,而是更外向型,更主动和业务同学一起定义问题,把高价值问题抽象出来。
研发同学不再是被驱动的一方,而是主动驱动 AI 的一方。这个角色可能更有价值,也更能实现更高的生产力和业务产值。
如果按照中国 AI 的进程线来看,从 2023 年初到现在已经 3 年了。百度作为中国 AI 的先发者,最近一两年一直在进行内部探索,但相对于 2023 年,我觉得你们这两年相对低调了一些。
今年百度世界大会,Robin 也说百度内部有一些思考正在演进。
最后想听听你作为百度一员,是怎么观察这家公司的变化?接下来在 AI 时代,它会扮演什么样的角色、处在什么样的位置?
这个问题我很难代表公司回答,只能代表我们自己的业务思考。
前面的逻辑是对的。去年我们在探索自演化、自动调 Prompt。本质上也是内部工具,因为以前帮助产业级客户完成更难的任务时,Prompt 撰写本身就是一件挺难的事情。
所以我们先在内部做,包括百度伐谋最开始也是一个内部项目。我们和内部云部门,以及一些偏金融、交通的部门合作,去看能不能快速帮助算法工程师,以更高效率、更高效果完成任务。
从自己的内生需求出发。
没错。我们发现确实有一定价值和效果提升之后,才说这件事是不是可以找一些关系比较好的、愿意尝试的客户做试点。
所以在大会发布时,与其说我们发布的是一个产品,本质上还是发布了几个案例。
因为产品脱离案例,或者 AI 脱离具体业务场景和应用,AI 的价值其实很难说清楚,更像是估值。
我们不能一直讲未来故事,还得真正落到地上,看到果实是什么,吃起来觉得确实可口,而不是一直告诉客户,这颗种子未来一定能长得很大,这棵树一定很大。
树大有什么用?不知道。这个果子一定要尽快长出来。这可能是我们对这个业务的思考。
之前看 Robin 的一次演讲,有一句话我很感兴趣。他说,未来百度启动新项目时,会更多关注技术在其中是不是起决定性作用。
如果是,即使 10 次里有 9 次失败也认了;如果不是,就算了,因为即使做成了,对公司意义也不大。
我想知道,这句话你在内部有感知吗?
我非常有感触。百度还是一家非常以 AI 为导向的公司。
做 To B 有很多成功方法,不同公司选择的路径不一样。但我们确实选了一条相对难的路:以技术驱动去改变一些东西。
它的好处是,如果真的做成了,这件事会非常 convincing;但坏处是确实更难。
因为 To B 的逻辑和 To C 不一样。To C 更像酒特别香,马上有很多人过来说我要喝;To B 也是酒,虽然很香,但需要一个更深入的过程。
不过这确实是新技术带来的新逻辑和新范式。
如果未来 5 到 10 年后,有大量的人用类似工具完成研发环节,那么我们这些先发优势和认知,可能就会带来更多积累和沉淀了。好了,这期节目就到这里,感谢你的收听。欢迎在评论区留下你的听后感,这期节目也已经在苹果 Podcasts、网易云音乐、微博、QQ 音乐、豆瓣等平台同步上传。哦对了,欢迎关注我的公众号、B 站账号和小红书,都与播客同名,我会在这些地方不时更新文字思考、视频访谈、采访随笔等等,我们下期再见。