E253|谁在给大模型出题、卖题、判卷?聊聊AI数据行业的野蛮生长
- AI数据赛道估值正在以远超基本面透明度的速度膨胀:三名20多岁创始人创办的AfterQuery今年4月A轮估值还是3亿美元,9月新一轮已推到32亿美元,不到半年涨了10倍,创下YC公司从启动到成为独角兽的最快纪录;Meta入股Scale AI给出超290亿美元估值,Mercor去年10月融资估值达100亿美元。节目后段,Yiwen指出数商估值空间通常不如能长期依靠既有用户和产品获利的传统平台;孙一铀也认为数商很难长期保持这种杠杆。
- 行业需求重心在从人工标注转向rubric(评分细则)和RL environment(强化学习环境)。Scale AI的何允中入职时rubric data还很新,"现在Rubric感觉已经过时了,大家都在讲RL environment";但他也强调pre-training仍然重要。核心逻辑是weak-to-strong supervision——让专家把打分规则写下来,弱模型"拿着教授写的打分规则"就能监督强模型,而今年主题转向coding和让agent"动手"的完整环境。
- 两位嘉宾在rubric是否到头上公开分歧,这是判断赛道存量的关键信号。允中认为比较容易获得的专家Rubric已经收得比较干净,尤其是静态、单轮或多轮文本输出的需求相对变小;伯克利的孙一铀反驳"Rubric这一块……其实还远远不够"——专家主观判断(游戏好不好玩、公司决策好坏)还没有成型的量化评测体系,而这可能是未来的需求。
- Benchmark与卖数据不能混为一谈。一铀称私下听说有数据公司把自己正在用于评测的数据拿去卖,并敲响警钟:不能让生意污染Benchmark的权威性;他的框架是"Benchmark面向的是未来,数据面向的是现在"。只要榜单贴近真实用户体验,"Bench-maxxing不一定是贬义词"。
- 在垂直领域,采购正成为重要卡点和创业机会。一个玩家只有几千人的MOBA游戏,源码要价能到两三百万元人民币一条;芯片设计要解决商业软件版权,有公司据称做了整套AWS模拟器;ALE V2用Nature子学科分类展开到第三级约3000个节点,发现现有生物类Benchmark覆盖率"可能10%、5%都不到"——医疗等敏感垂类"谁能拿到大量的病例数据,谁就会非常有优势"。
- 允中的"暴论":大模型实验室未必有最好的基因解决数据问题,数商的真正护城河是研发。如果一边把FDE派进企业、一边收集该企业数据,可能产生利益冲突,企业"不太放心把数据交给你";好数商应该像软件公司一样提前投入R&D、把行业问题研究清楚再卖给deadline很死的lab,最终"拼的还是一个研发能力",谁能把研发固化成flywheel谁赢。
- 数据造假比数据污染更难防,激励机制设计是尚未解决的巨大研究领域。公开数据污染相对容易检测,但专家编造的化学模拟"没有个几个月根本查不出来",验证专家本身也可能偷懒——"众包的Benchmark为什么难做,就是难做在这里,人性非常复杂";OpenAI今年2月停报SWE-bench Verified分数,何允中印象中该榜过去6个月只从74%涨到80%,剩余问题可能集中在题目或脚本缺陷上。
- 新玩法已延伸到私募股权:买下传统公司,用AI提效、裁员重组并提升公司价值之外,再把它的数据发掘出来卖钱。允中的极端推演(自称AI doomist view):若未来5—10年保持这个速度,把各行业数据都蒸馏出来,数据加大模型"可能就是世界上最大的两个行业"。
1. 估值狂飙:不到半年10倍的AfterQuery与百亿美元级数商
- 主持人Yiwen开场给出的坐标系:AfterQuery今年4月A轮估值3亿美元,9月新一轮已达32亿美元,"不到半年涨到了10倍之多",创下YC旗下公司从启动到独角兽的最快纪录;Meta入股Scale AI估值超290亿美元,Mercor去年10月融资估值100亿美元。
- 本期设问也是投资人最想问的:这些公司到底在卖什么,模型公司为什么愿意给那么多钱——从rubric(评分细则)到RL environment,再到榜单分数究竟代表什么能力。
- 两位嘉宾的身份互补:何允中在Scale AI负责post-training与evaluation research,自称"有一点像整个行业的一个外包数据research团队"(声明观点为个人);孙一铀是UC Berkeley博士后、Agents' Last Exam(ALE)项目研究者。ALE由Berkeley RDI与300多位行业专家共同领导,公开任务150多个、覆盖50多个细分行业,目标是在几个月内的V2中放出1000多个任务。
2. 数据公司图谱:招聘系、众包系、合成系与数据broker
- 允中按"基因"分类:招聘出身的Mercor(有自动AI面试产品,主打短时间找到足够量专家);Scale AI这种从众包网络出身的"传统数商";做合成数据的新公司;以及更偏research和engineering的新秀如BigCode、Snorkel AI,允中猜测它们可能主要生产代码或tool call这一类环境,抓住今年的风口;还有纯broker——"可能是好莱坞的一个人,他有特别多的版权数据,他知道怎么把这东西卖出去"。
- 有趣的边角:具身智能公司"暂时没赚到钱,但它花了大量精力投资、制作数据,就顺便做起了数据生意"。
- 每家数商都面临同一个取舍:全职培养的人能力强但灵活度和产能可能较低,众包网络灵活但"每个人的质量就比较难保障"——Scale AI的优势之一是既有数据质检经验,也有人力方面的质检经验。
3. 从预训练标注到RL:rubric的本质是weak-to-strong supervision
- 允中复盘转向:o系列模型出来后"发现这RL跑通了,一下子大家兴趣都在RL上"。RL需要可验证信号,数学、代码天然有标答;但医疗、金融、指令遵循的标答"比较不结构化"——"就好像我去答历史考题,历史考题是有标答的,但是每个人的写法可能都不太一样,我很难做这个pattern match"。
- Rubric的核心原理:让专家把脑海里的知识写成打分规则,"相当于我让一个TA拿着教授写的打分规则来给你打分……这个TA也不需要特别聪明"——这就是大模型数据中的weak-to-strong supervision,用弱模型监督强模型。
- 但今年趋势是"大家需要动手了":从验证聊天输出转向agent setting——工具、沙盒、检查环境变量是否执行、数据库是否写入,验证方式包括programmatic check、rubric、preference,"暂时还没有形成特别大的共识"。比如Terminal-Bench可能完全不要rubric,而是纯programmatic check;各家公司要的东西仍然不一样。
4. 分歧点:rubric到头了吗?ALE要从vibe coding推到vibe everything
- 孙一铀直接提出不同看法:"我跟允中的看法有一点相反……我觉得Rubric这一块,尤其是专家主观判断类的题目,其实还远远不够。"允中随后澄清:说到头的只是"静态的、单轮或者多轮聊天,输出一段文本,然后用Rubric检查它"的行业趋势;各领域训练"肯定是远远没有到头的"。
- ALE的初衷:vibe coding发展快是因为coding的Benchmark多且容易verify,"你去刷这个榜,但你只要刷的是有益的分、是有意义的题,那它模型带来的提升,对于人的日常工作来说,就是实打实的提升"——把这套机制推广到vibe everything,终局是"当你解决这个Benchmark的时候,基本上就能解决人类社会在某些领域真正有益的问题"。
- 工程产出的评测难点:输出不唯一。"你让它生成一个游戏,甚至有些数学解法它都不是唯一的",硬和ground truth比对会造成不一致——Rubric如何兼容多样输出,是构建Benchmark时仍要解决的问题。
5. 主观评判的前沿:左脚踩右脚,与"猫要可爱"的混合方案
- 允中的框架:"大家希望左脚踩右脚"——模型变强则验证器变强,验证器变强则Rubric可以写得越来越模糊,把更多知识交给验证器;但底线是"Rubric加上验证,这两块加起来的知识和能力,应该比我要训练的模型要多,不然就达不到训练模型的目的了"。
- 生图的例子最能说明混合方案:instruction following部分用Rubric——"图里要有一只猫、那只狗,甚至我跑一下OCR把那个字提出来";但"这个猫要是一只可爱的猫"极度主观,可能要专门训练一个掌握人类主观体验的reward model,与Rubric结合。
- Yiwen进一步举例说明,游戏"好不好玩"也许可以借助入门教材中的评判方式,例如奖励曲线是否平滑、是否符合大脑的多巴胺反馈机制来做一定量化;但市面上"还没有看到一个做得特别完整的、公开出来的评测体系",因为需要专家更深度地参与。
6. 人决策、agent执行:决策数据是最难蒸馏的东西
- 一铀的任务分类学:从Cursor时代人参与执行,演化到"人负责决策,agent负责执行"。任务说得越清楚、输出越唯一,确定性Rubric越好用;但如果决策本身也要被agent取代,问题就来了——"对于一个上市公司领导层的一个决策,你该如何去train一个reward?它每天的任务都在变,你很难收集到足够的数据"。
- 允中的呼应:在Meta这样的公司里,"猫可不可爱"可能还能通过用户行为反馈训练模型,"但是公司的决策我就很难收到这些数据了"。ALE让专家把以往做过的项目和决策交上来,是一种方案——"以后收数据可能是,大家怎么样找到好的激励方式,让大家把一些重要的东西交出来,尽量地能够回溯当时这些重要的决策"。
7. Benchmark与卖数据:红线、诱惑与"面向未来vs面向现在"
- 允中解释了生意为何产生:提升模型能力的数据和榜单评测方式息息相关,构造Benchmark的人对领域认识深,"自然会给他一定卖数据的权威性……这个生意就这么产生了"。
- 一铀则称生态"还比较野蛮地发展",有多少人在做科学研究、有多少人在做Bench-maxxing需要权衡,并敲响警钟:他"私下听到,是有一些数据公司,它踩了这个红线,就是它把自己在做评测的数据去卖……不能让你做的生意污染你这个Benchmark的权威性,不然的话你不仅毁了你的Benchmark,也毁了其他人的模型"。
- 他的定位框架是:Benchmark面向未来,数据面向现在。ALE年初做的时候曾担心太难失去意义——当时模型平均分只有10%到20%、大部分题拿零分——"但事实上没有必要担心,因为Benchmark本身就是要面向于未来的模型去做的"。只要榜单贴近真实用户体验,"Bench-maxxing不一定是一个贬义词"。
8. 好Benchmark的两个标准,与Artificial Analysis的分布之疑
- 允中的选榜逻辑:模型能力提升的最大ROI还是能力本身,"这些能力提升了,它应该是惠及各个Benchmark";如果"只涨这个,别的都不涨"就危险——在犄角旮旯解一个奇怪智力题不代表认知能力提升。第二类好Benchmark是贴合大家在意的场景(如personal assistant),它"甚至未必测的是模型本身,它可能还测了你的harness"。
- 一铀对Artificial Analysis的质疑:AA给各家Benchmark设置不同权重并综合成分数,但"它分布的这个权重是不是真的是大伙需要的权重……大家质疑的更多不是这个模型本身,而是质疑这个榜单本身"。所以Anthropic、OpenAI这类头部厂商倾向自建评测体系,第三方评测则能让它们对外发布时"更有说服力一些"。
- 理想分布的定义接近用户体验,类似LMArena的模式,但Agent时代"一个长程任务动辄几个小时",用户没有足够精力每次同时运行多个Agent并打分——现实中很难拿到真正的Ground truth;"但如果有哪家公司有某种方式解决了这个问题,那肯定很厉害"。
9. 榜单生态的随机性:SWE-Atlas被收录、ARC被特化、Claude Code的主观胜利
- 允中讲了SWE-Atlas的内幕故事:Scale做了三种风格的SWE-Test(代码仓库问答Q&A、代码重构、写Test),分三阶段推出,"不知怎么回事,Q&A先被Artificial Analysis收录了……突然间这一块需求就变大了"——Q&A其实是最简单的场景,复杂Benchmark反而还没来得及推出并合并;榜单上你看到什么、实验室使用什么,"其实是有一些随机因素,这个生态其实还比较深、比较复杂"。
- ARC Challenge类小游戏Benchmark的教训:初衷是测人类智力,"但是没想到这个智力其实也是可以做得特别特化,一个小模型也能把它搞出来"。
- 一铀用Claude Code与Codex对比说明用户评价的主观性:Claude Code在LMArena上分数一直遥遥领先,因为output format"更贴近于人们心目中想看到的";Codex"执行得更细致一点"但输出不易读、"稍微吃了点亏"——"我个人还更偏好于OpenAI那边一点,因为它做得更细致,犯的错误更少"。允中补充:线上A/B test和评测结果经常不一致,factual的内容和clickbait、说用户爱听的话,用户反馈可能完全不同。
10. 终局像搜推,但场景增长快过用户沉淀,Benchmark长期有需求
- 允中援引自己在Meta做多年搜索推荐的经验:产品成熟、用户体量到位后,"最后你其实关心的还是用户增长……看什么样的指标跟用户增长最相关,最后就朝着赚钱的方向走"。
- 但大模型不同于传统搜推:场景一直在冒新的。"现在大家都在关注新的方向,比如科学发现,我不可能有足够多的科学家给出显著的A/B test结果"——"场景增长的速度赶不上我在这个领域用户沉淀的速度",所以对Benchmark作为评价标准仍有大量需求;沉淀下来的领域才会走向线上评测和DAU相关性指标。
11. 采购是重要卡点:两三百万一条的游戏源码,与覆盖率不到10%的生物版图
- 允中把后训练数据拆成两个问题:采购(把原材料买回来)和加工(标注、通过Agent pipeline做成训练环境)——"在这个垂直领域问题上,其实采购变得越来越复杂"。今年小团队机会集中在coding,是因为软件行业"非常的open,有大量的公开资料",但往垂类走:芯片设计要解决商业软件版权,DevOps方向"我知道有个公司做了一整套AWS模拟器",谁解决采购谁有巨大优势。
- 一铀给出的价格锚点触目惊心:ALE V2也尝试收集Steam上的游戏库或游戏开发任务,其中一个"名不见经传的、大概几千人玩家的MOBA类游戏",源码"要价能要到两三百万人民币一条"——"我觉得哪家数据公司或者别人做Benchmark,都没有这个财力去做这个事情"。
- 缺口有多大:ALE V2按Nature出版物的子学科分类把生物领域展开到第三级,约3000个节点,统计现有life/bio Benchmark的覆盖率"大概是可能10%、5%都不到,甚至连一个成型、覆盖面完整的Benchmark市面上都没有"。允中点名医疗是数据敏感且稀缺的垂类;世界上还有很多外人不知道的行业——"我才知道做药物研发,大家还会交易这些分子,一个分子还能倒腾几套,这里面还要做DD"。
12. 允中的暴论:lab未必有做数据的基因,数商的护城河是研发
- 一铀的追问很尖锐:模型公司自造数据能力越来越强,门槛会不会对非头部数商越来越高?"数学这块领域,之前大家只需要去影印那些奥数课本就能批量造数据,但这些数据现在基本上是零价值。"允中承认:"如果只盯着我手上的工作,这个一定是越来越难做的……你的margin也会越来越低。"
- 但他的第一性原理判断是:"你要想这个世界上还有多少东西没被蒸馏干净,是巨大的机会。"而且"可能lab未必有最好的基因来解决数据的问题"——合成数据按理说是实验室后训练研究的一部分,今年这波增长却来自"懂行的人在外面把这个数据合了再卖回去";采购上lab甚至可能有conflict of interest:"一方面把你的FDE派到了人家企业里面,另一方面你有一拨人在搞这个企业数据,如果我是一个企业,我是不太放心把我的数据交给你的。"
- 数商真正该做的是研发:提前判断哪些行业重要、买回原料、自己先投入R&D把行业问题研究清楚、做成Benchmark或数据并证明有效性,再卖给"deadline都很死"的lab——"长期来说拼的还是一个研发能力",谁能把研发能力固化成flywheel、有一条持续发掘新东西的流水线,谁有最大优势。买断(花更多钱独占数据)是解决"同一份数据卖给多家"的常见方案。
13. 训练recipe、RSI与造假:奖励机制是最大的未解研究领域
- 数据交付后的用法有讲究:简单数据直接SFT,Rubric类走强化学习;今年的buzzword是RSI(recursive self-improvement),"AI自己研发自己"——跑一次可能需要几天到一个星期、并可能需要一张GPU让模型训练模型的任务,"训练方式其实就开始变得有一些模糊了……还没有太多的共识"。定制包括:模型厂商会把未发布的模型给数商筛难度("题太难了它啥也做不出来"),轨迹采集甚至设法让人类生成可解轨迹供SFT;防Reward hacking要用Agent做red team,Reward还要管budget——"我可能还关注它消耗了多少资源"。
- 污染问题:Yiwen介绍,OpenAI今年2月停止报告SWE-bench Verified分数,并指出测试缺陷与数据污染两类问题;一铀补充,该榜"过去6个月只从74%提升到了80%"。何允中认为剩余问题可能包括脚本太严苛、题目本身不可解或其他问题;如果剩余20%集中在这些问题上,Benchmark自身就可能失去比较意义。
- 比污染更可怕的是编造:ALE有人为了拿署名"调用Agent合成一堆乱七八糟的数据",还出现过法院证据这类不合规提交;"最难的是编造数据,比如让你去做一个化学模拟,它根本就没有跑过这个任务,自己编了一套似是而非的东西,你没有个几个月根本查不出来"——而请另一个专家验证成本极高(本身要一两周才能完成),且验证专家本身也可能偷懒。"众包的Benchmark为什么难做,就是难做在这里,人性非常复杂。"
- 允中认为出路在激励机制设计,这是"巨大的Research area":Proof of work——"要求你把做这个东西的一整段工作流程全部都录下来……老老实实待着做12个小时,每一步都给我交出来,那他可能就没有那么大的动机给你编假数据了"。附带的行业判断:在有足够MCP和API调用时,所谓"真实工作流数据"中"95%以上的任务都能够被划归到coding的问题上来",因为"代码就是Agent的手跟脚"。
14. PE新玩法、数商估值折价与ALE 2.0的激励经济学
- 允中透露的新趋势:Private equity的flip玩法多了一层——买公司、用AI提效、裁掉一部分人并提升公司价值,再卖掉之外,"我还能把它的数据发掘出来,它数据还能卖一些钱",数商和传统PE都在看。他的极端推演(自称AI doomist view):若5—10年保持这个速度,"把各个行业的东西都给拿出来,可能这个东西跟大模型本身就是世界上最大的两个行业"。
- 对估值的清醒判断(一铀):"数商的估值空间一般没有传统的公司来得大,就是因为它很难把这个杠杆保持住"——不像Facebook、Google积累用户后能"躺在那里吃老本挣钱","模型迭代速度太恐怖了",数商领导者必须持续思考下一步。
- ALE 2.0最难的地方反而印证了激励机制的重要性:学术项目较容易吸引这个级别的专家无偿提供数据,他们可能不是单纯为了钱,而是希望大家一起把事情做好,或看重作者署名;而按Mercor官网价格,制造业工程师约一两百美元一小时——"这种价格就限定了它不可能招到特别特别高级的工程师。奖励制度不一样,就导致你能吸引到的人不一样,你的上游是不一样的"。
Full transcript
节目开始之前,跟大家分享一个我们《硅谷101》即将在湾区举办的黑客松活动。今年硅谷101将在我们的年度活动Alignment 2026上举办STORY101 LAB AI视频创作挑战赛,让影视创作者和AI科学家们在现场一起探索AI到底能给讲故事带来哪些新的可能。无论你是已经在用AI拍片的专业团队,还是想要尝试的新手,都欢迎参加。比赛设有探索组和专业组,我们也会提供免费的workshop培训。优胜作品还有机会赢得丰厚的奖金,并在千人线下活动中展映。活动时间是10月10号到11号,地点在Sunnyvale的Plug and Play Tech Center。报名链接我们已经放在本期节目的Shownotes里面了。另外,我们Alignment 2026活动本身的报名也在持续进行当中。这次我们邀请了来自OpenAI、英伟达、Menlo Ventures、Cerebras等等公司和机构的嘉宾,期待在线下和大家对话。
Hello,大家好,欢迎回到《硅谷101》,我是Yiwen。
很多投资人在和我们聊天的时候,都提到了他们最近很关注的一个赛道,那就是数据。随着模型能力不断提升,模型公司对训练数据的需求也变得越来越复杂、越来越具体。硅谷因此出现了一批增长很快的数据公司,专门为模型公司提供服务。
比如,由3名20多岁的年轻人创办的AfterQuery,今年4月宣布A轮融资时,估值还是3亿美元;到了9月,新一轮融资已经把估值推到了32亿美元。不到半年涨了10倍,创下了YC旗下公司从启动到成为独角兽的最快纪录。我们更熟悉的几家大型数据公司,估值也已经达到了百亿美元级别:去年Meta入股Scale AI时,给出的估值超过290亿美元;Mercor去年10月这轮融资的估值,也达到了100亿美元。
但这些高估值背后的数据生意到底是怎么做的,外界其实很难看清。所以我也很好奇,这些公司究竟在卖什么?模型公司又为什么愿意给那么多钱?
过去提到数据标注,大家很容易想到给图片打标签、给模型的回答打分。现在,数据公司还需要请来各类行业专家,把他们的知识和工作经验转化成AI可以学习的任务。
1. 从 vibe coding 到 vibe everything:详解Agents’ Last Exam
其中一类重要的数据,是请专家写清楚一个回答、一份工作成果,到底满足哪些条件才算好。这套评分标准,也就是我们经常听到的Rubric(评分细则)。再往前一步,数据公司还要搭出让AI实际动手的环境,配上任务、工具和反馈机制,让它在里面操作软件、反复尝试,并且根据结果学习,这就是强化学习环境,也就是我们经常听到的RL environment(强化学习环境)。
与此同时,新的AI评测也层出不穷。从金融、法律等垂直领域,到让Agent完成一整套工作流程,模型要参加的考试越来越多。但榜单上的分数提高了,究竟代表哪些能力变强了?针对榜单做优化,什么时候会让模型更好用,什么时候又会变成单纯的刷分行为?
2. 从做评测到卖数据:benchmark的生意
这期播客,我们就想把这些问题聊清楚。我请来了两位非常适合聊数据这个话题的嘉宾,分别是在Scale AI负责后训练和评测研究的何允中,以及加州大学伯克利分校的博士后、Agents’ Last Exam(ALE,智能体终极测试基准)项目研究者孙一铀。
3. 没上热门榜单的评测,也可能带来真实的数据需求
大家好,我叫允中,现在在Scale AI负责post-training(后训练)和evaluation(评测)research。大部分人关注我们,可能是看我们发布的Benchmark(基准测试),还有一些RL data recipe的文章。
但实际上,我们也是在给整个大模型行业提供数据,以及一些方法论支持,有一点像整个行业的外包数据research团队。以上观点都是个人观点,不代表Scale AI,也与客户无关。
大家好,我是一铀,现在在UC Berkeley读博士后,关注的是Agent evaluation(智能体评测)这个方向。我们最近推出的工作就是Agents’ Last Exam,目标是构建迄今为止规模最大、覆盖面最广的智能体评测基准。
这个项目由Berkeley RDI和300多位行业专家共同领导,希望衡量智能体在有可验证结果的长期、具备经济价值的任务中的表现。目前公开的任务大概有150多个,覆盖50多个细分行业。我们的目标是在下一次发布中直接放出1000多个任务,并且在每个领域做得更深一些,可能几个月内就会发布V2版本。
允中,要不要给我们讲一下现在市面上的数据公司?因为现在有林林总总的数据公司,你觉得大致可以分成哪些类别?这里面有哪些大的玩家,还有哪些新秀?
在我看来,最有意思的是,这些公司的基因可能不太一样。有些是做招聘出身的,比如Mercor;有些是从众包网络出身的,比如Scale AI这种传统数商;也有一些新公司是做合成数据的,还有一些原本属于某个领域,后来转行做数据。
这里值得说一下具身智能。现在这个行业的状况是,有很多做模型的公司暂时还没赚到钱,但它们花了大量精力投资、制作数据,于是顺便做起了数据生意。很多各行各业的人也发现了自己数据的价值,然后转行来做数据公司。
大致来说,几家大的玩家,比如Mercor、Surge AI、Scale AI,基本上试图什么东西都覆盖。除此之外,也有一些新秀把某些领域做得比较好,比如BigCode或者Snorkel AI,它们可能更偏research(研究)和engineering(工程),我猜测它们主要生产代码或者tool call(工具调用)这一类环境,抓住了今年的风口。
另外还有一些小公司,可能解决的是垂直领域的问题,甚至不像我们这样做标注数据,而是做broker(数据经纪商)。比如好莱坞有人手里有特别多的版权数据,也知道怎么把这些东西卖出去。现在最新兴起的,可能就是做垂直领域,把一个领域做得特别好,由一些领域专家组成团队。
大概就是这么几个分类。我觉得机会还很多。大的数商有大的数商的优势,想进入一个领域时有更多资源,整个饼也在越来越大。
你刚才提到Mercor、Surge AI这样的公司。所谓招聘公司,具体是什么样的商业模式?
Surge AI应该不是,但Mercor是做招聘起家的。它有自己的自动AI面试产品,重点可能是能够在比较短的时间内找到足够数量的专家,建立一个专家网络。
Surge AI更多是把这件事in-house(内部来做)。这里面存在一些取舍。基本上每个数商可能都需要面对类似的问题:如果完全依靠自己全职培养的人,这些人的能力肯定更强,但灵活度不够,产能可能也会差一些。
如果更多依靠众包网络,灵活性会更大,但每个人的质量就比较难保障,这里面就涉及质检问题。比如Scale AI这类公司的优势,就是我们不仅有数据方面的质检经验,也有人力方面的质检经验。
允中,你是什么时候加入Scale AI的?从你加入到现在,整个市场对于数据的需求发生了什么变化?
这个故事还挺有意思。当时我是在Meta入股之前签的offer,结果我一到岗,人就走了。所以我经历了整个大模型行业开始疯狂扩张的过程,不管是人才争夺还是薪酬体系,都开始go crazy。
我加入之前,我的老板刘冰跟我说,有一项技术,各家实验室都在做,但每个人做得不太一样。他说,你赶紧进来,我可以跟你一起好好做些研究。后来我来了,当时做的是Rubric data(评分细则数据),那个时候还比较新,距今可能一年多。
现在Rubric感觉已经过时了,大家都在讲RL environment(强化学习环境)和各种各样的东西。这一年确实经历了非常多的变化。
我们关注这个话题,也是因为从2024年到现在,整个行业对数据的需求发生了很大变化。2024年之前,我们聊到数据时,大家想到的很多还是人工标注,也就是一些比较基础的数据。我们需要非常多的数据来做pre-training(预训练)、训练模型。
但从2024年开始,Mercor之前也提到过,Deep Search的兴起导致整个行业转向了所谓的Agentic data(智能体数据)。我们会需要你刚刚说的Rubric,包括RL环境,以及更多真实的工作流数据。
能不能先帮我们梳理一下这些概念?这个行业从Crowdsourcing data(众包数据),也就是人工标注数据,发展到Agentic data,中间经历了什么变化?
首先要说明,Pre-training(预训练)仍然很重要。不过从我身边人的兴趣来说,大家确实经历了一个转向。很多人觉得pre-training有点无聊了,继续scale、调整数据配比,做的事情比较重复。
后来o系列模型出来了,大家都在做reasoning(推理),发现强化学习跑通了,于是一下子都对RL感兴趣了。RL比较有意思的一个问题是,我需要一个可验证的信号。
可验证的信号,在代码或者数学领域尤其容易获得。最早的推理模型就是从数学做出来的:选择题答对还是答错很容易判断,或者最后算出一个数字,也可以直接验证。
但之后大家开始想,数学可以做RL,在其他领域呢?比如医疗、金融,或者更基础的指令遵循,在这些领域能不能做RL?这里的问题是,它们也存在某种客观标准答案,但不像早期阶段做RLHF(基于人类反馈的强化学习)时那样,只是用奖励模型学习大家的偏好。
这些任务其实有标准答案,只是答案比较不结构化。比如历史考试是有标准答案的,但每个人的写法可能都不一样,很难简单地做pattern match(模式匹配),判断A、B、C、D就能知道有没有答对。
这时候就可以用Rubric的方式,相当于让一个助教拿着教授写的评分规则来打分。因为评分规则是提前标好的,是教授写的,所以这个助教不需要特别聪明。
这就是整个大模型数据中的一个核心概念,叫Weak-to-strong supervision,也就是能不能用弱模型来监督强模型。它成立的条件是,有专家把脑海里的知识写下来,这样弱模型拿着这份规则改卷子就行了,这就是Rubric data。
4. 强化学习(RL)环境:从回答问题到动手干活
Rubric data火了很长一段时间。当然,它现在仍然很重要。但各个专家领域的Rubric,尤其是比较容易获得的那一批,已经被收集得比较干净了。Mercor或者Surge AI的崛起,其实也和这一块专家Rubric有关。
再往前走,大家就需要让模型动手。比如现在做代码模型,或者像一铀他们做的ALE,虽然ALE不是做代码,但它也需要让Agent“动手”解决各种各样的问题。
这时候就不再只是验证一个聊天输出,而是要把模型放在Agent的setting(环境)下,给它一些工具,以及更复杂的验证方式。验证的可能是环境里的变量是否执行、数据库是否写入或删除,甚至是生成的文档里有没有图表。
这些任务可能仍然需要Rubric,但还需要一个Agent来检查。于是数据就变得更加多样。现在大家追求的一个比较大方向,是环境。
它不只是一些标注好的评分规则,而是包含一整套任务:要做什么、在什么环境里做、需要哪些工具、需要执行什么样的沙盒,以及一套和任务相关的验证方式。
验证方式非常多样,包括programmatic check(程序化检查)、Rubric,以及preference(偏好),比如让人选择更喜欢哪一种输出。现在这方面还没有形成特别大的共识,我又看到了一点当年Rubric时代的感觉:每家公司要的东西都不一样。
比如Terminal-Bench可能完全不要Rubric,而是纯programmatic check。这里面有不同流派,挺有意思的。
这个很有意思。一铀,你能不能从ALE的具体例子出发,讲一下它需要哪些要素?
其实我和允中的看法有一点相反。允中认为现在Rubric差不多已经做到头了,但我的看法是,Rubric这一块,尤其是专家主观判断类的题目,其实还远远不够。
我可以先从ALE的初衷讲起。ALE最初建立的原因,和允中刚才说的一样,是想把Vibe coding快速发展的趋势推广到vibe everything。
当时Vibe coding为什么发展得那么快?因为有非常多的Benchmark都在coding领域,而且coding比较容易verify(验证),它有确定性的Rubric。大家为了刷榜,在coding领域发展得非常迅猛。
沿着同样的思路,如果我们能够在其他领域,尤其是工程领域、能够客观打分的领域,建立各种各样的评测体系,那么大家去刷分,只要刷的是有益的分、是有意义的题,模型能力的提升对于人的日常工作来说就是实实在在的提升。
这就是我们当时想建立ALE的初衷。当然,世界上的职业实在太多了,浩如烟海。所以我们第一个版本只是给出了一个覆盖面相对比较广的初步尝试,之后还会继续努力,希望把覆盖面做得更广。
我们希望有一天,它能真正成为Last Exam:当你解决这个Benchmark的时候,基本上就能解决人类社会在某些领域真正有益的问题。
我同意一铀的观点,各个领域的训练肯定远远没有到头,很多东西可能还没有被Rubric表征出来,所以这里面还有很大空间。
我刚才说Rubric到头了,更多说的是一个行业趋势:这种静态的、单轮或者多轮聊天,输出一段文本,然后用Rubric检查它的方式。它并不是说知识类任务已经到头了,毕竟不同实验室的水平都不一样。
只是今年的一个大趋势,是从coding逐渐转向Knowledge work,大家需要让模型动手。这个时候,纯文本Rubric的需求量可能小了一点,但仍然很大,还有很多问题没有解决。
允中刚才提到,对于很多文本式输出,比如文章写得好不好,可能有一些评分标准。但事实上,在工程领域的产出中,评测方式很多。
我们确实发现,除非把输入固定得特别死,否则输出会有非常多的可能性。比如让模型生成一个游戏,甚至有些数学解法都不是唯一的。
如果这时候给出一个确定性的评判,一定要和Ground truth(标准答案)比较,很多时候就会产生不一致。所以,怎么样定义Rubric,让它能够兼容多种多样的输出,也是我们在构建Benchmark时遇到的问题,是未来想继续思考和解决的方向。
我稍微抛砖引玉一下。未来的发展趋势可能是,人类对于“好玩”“好看”这些东西,无法把它们固化成可以量化的指标,比如游戏好不好玩。
但实际上,在一些游戏设计的入门教材里,有各种各样的评判方式。比如奖励曲线是否平滑,是否符合大脑多巴胺的反馈机制,这些都有一定的科学指标,可以量化“好玩”和“好看”。
但目前在公开Benchmark中,我还没有看到特别完整的评测体系。这件事难度确实非常高,因为需要专家更加深度地参与。
允中,你们在数据公司里有没有看到解决这类问题的趋势?
这个问题特别好,也是我们每天绞尽脑汁思考的问题。整个Rubric,或者说整个大模型的验证体系,我觉得总体上有一个思路:大家希望左脚踩右脚。
也就是说,当模型变强之后,验证器也变强;验证器变强之后,就可以允许更复杂的Rubric。如果验证器很弱,就只能写一些傻子都能看出来、知道对错的Rubric。
但随着模型能力提升,Rubric可以写得越来越模糊,把更多知识交给验证器解决。不过总体来说,Rubric加上验证器,这两部分加起来的知识和能力,应该比要训练的模型更多,不然就达不到训练模型的目的。
回到做电子游戏这类非常主观的东西,未来可能很难用显式条件,一条一条写清楚什么是好游戏。它可能存在多种多样的可能性,所以Rubric可能不得不写得更模糊。
当然,这不是我们希望的。通常我们还是建议Rubric写得越严谨越好。但在某些领域,可能必须写得比较模糊,这时候就需要验证模型自己做主观判断。
这个验证模型甚至可能是专门训练的Reward model(奖励模型)。我知道不少实验室可能都在做类似的事情,当然这不是客户透露给我们的,是我的个人经验。
比如生图有两个部分。一部分是Instruction following(指令遵循),也就是有没有遵循要求:图片里是否有猫、有狗,背景板上是否写了指定的文字。这部分可以写成Rubric:这里要有一只猫,那里要有一只狗,甚至可以跑OCR(光学字符识别)把文字提取出来,看看是不是指定的内容。
但还有一部分是,这些字写得好不好,这只猫是不是可爱。这些也可以写成Rubric,但非常主观。于是可能需要专门训练一个模型,让它掌握一些人类的主观体验。这个问题如果要解决,大概率会是Rubric和专门验证模型结合的混合方向。
我们刚才好像把Rubric和环境放在了对立面。但听起来,一方面它们是可以结合使用的;另一方面,是否有些任务更适合用Rubric,有些任务更适合用环境?
这两个东西肯定不能拆开来看。环境或者任务数据只是一个执行的基准,但Rubric才是最终用来打分、判断模型做得好不好,并且决定如何奖励模型的东西,所以它们一定是相辅相成、必须结合起来看的。
我个人更希望从任务分类的角度去看。另外,人和Agent这两个角色如何合作、分别承担什么角色,也很重要。
从历史上看,最早Vibe coding刚出现时,大家用Cursor,其实人类也参与了代码执行。Agent只负责执行很小的模块,写一部分代码。
后来Agent能力越来越强,变成只要给它一个非常模糊的指令,它就能完成一个很大的项目。这时人和Agent的角色又发生了变化。
现在大致可以分成两类:人负责决策,Agent负责执行。人把决策说得越清楚,Agent就能做得越好。
基于这两个角色分类,我们来看Rubric应该怎么设计。如果Agent只是负责执行,而任务描述得很清楚,输出基本固定、具有唯一性,那么Rubric就是确定性的Rubric。打分时完全可以基于自己做出来的成品进行评判,因为通常会有Ground truth。
如果讨论未来数据的需求,人的决策部分会不会逐渐被Agent取代,我觉得这就会回到允中刚才说的情况:大家现在反而没有太重视这些Rubric,因为决策往往非常模糊,很难量化。
允中说,对于一个具体领域,比如猫可不可爱,可以训练一个Verifier。但对于一家上市公司、一个领导层的决策,应该如何训练Reward?它每天面对的任务都在变化,很难收集足够多的数据,训练出一个Reward model来替人做这样的决策。
所以我认为,这一部分的模型发展还有很长的路要走,也可能会成为未来的一个发展趋势。
我特别同意。比如ALE的方案,我觉得就是面向未来的。
如果是猫可不可爱,在Meta这样的公司里,可能还能通过用户行为反馈来训练模型。但公司的决策很难收集到足够数据。像ALE这样,让大家把过去做过的项目和决策提交上来,其实就是一种方案。
未来收集数据,可能要看大家如何找到好的激励方式,让人们愿意把重要的东西交出来,并且尽量能够回溯当时的关键决策。
非常有意思。我想再追溯一下评测近几年的发展,以及它和卖数据之间的关系。
我和两位私下都聊过,卖Benchmark和卖数据这两件事不能混为一谈。Scale AI之前推出了Humanity’s Last Exam,也就是HLE这个评测。允中能不能给我们讲一下这个评测,以及你觉得它和数据之间是怎样联系的?
从原理上说,评测体现的是模型距离理想状态还有多大的差距。它更多是一项科学研究,是一个基准:我希望模型达到什么状态,它现在还没有达到什么状态。
但这件事和卖数据联系起来也很有意思,因为很多时候,提升模型能力的数据,和榜单的评测方式息息相关。这里比较难的是找到平衡。
5. 什么样的评测值得刷?核心能力与真实场景
如果我生产大量和榜单差不多的数据,就可能变成Bench-maxxing,也就是刷榜。但大模型训练仍然有各种维度。如果我想提升某一类能力,确实需要抓住某一个维度,所以数据和Benchmark肯定会有一定相关性,大家需要找到其中的平衡。
6. 模型公司如何权衡内部评测、公开榜单与用户反馈
大家对AGI的期待很高,希望模型能做到人能做的事情。于是我们可以在各种领域构造Benchmark,发现模型距离理想状态还有差距。
通常,构造Benchmark的人对某个领域认识比较深,这自然会给他一定的卖数据权威性,大家会更相信他手上的数据,于是这个生意就产生了。
一铀,我相信ALE现在做得很火,应该有不少人想问你卖不卖数据,或者可能有VC想找你投资,结果它逐渐变成了一门生意。
我觉得这件事有好有坏。这个生态目前还在比较野蛮地发展,有多少人在做科学研究,有多少人在做Bench-maxxing,确实需要仔细权衡。
但这里面有很多利益驱动,所以现在是一个挺繁荣的市场。
这里我也想给大家敲个警钟。允中提到,现在做Benchmark的人会收到各种诱惑,被鼓励把Benchmark数据卖掉。我甚至私下听说,有些数据公司踩过这条红线,把自己正在用于评测的数据拿去卖。
这条线千万不能碰。不能让你的生意污染Benchmark的权威性,否则不仅会毁掉自己的Benchmark,也会毁掉其他人的模型。
我个人认为,Benchmark和卖数据在生态系统中的角色、地位都不一样。Benchmark面向的是未来,数据面向的是现在。
Benchmark面向未来,是希望模型公司去解决目前还没有解决的问题。我们在今年1月、2月做ALE的时候,特别担心Benchmark做得太难,导致它失去意义。
当时模型的平均分很多只有10%到20%,大部分题目甚至只能拿到0分。我很担心这样的评测没有意义。但事实证明,这个担心没有必要,因为Benchmark本来就应该面向未来的模型。
数据更多是在解决Benchmark产生的需求,也就是现在大家如何把这些东西做好。Bench-maxxing有好有坏,只要它没有直接污染Benchmark,而且刷的是有意义的榜单,并且这个Benchmark和真实用户体验非常接近,我觉得Bench-maxxing不一定是贬义词。
Bench-maxxing这件事确实很有意思。一方面,我们需要评测基准;另一方面,又不希望模型公司为了刷评测而刷评测。
所以很自然会产生一个问题:什么样的评测才是有意义的评测?
现在我们每周都能看到很多新的Benchmark。从模型公司的角度来说,他们应该如何选择?哪些评测值得去刷,或者应该把哪些评测作为下一步提升模型能力的目标?从供应商和研究者的角度,你们怎么看?
我觉得,做模型能力提升,最大的ROI还是应该放在能力本身。能力提升之后,应该惠及各个Benchmark。
当然,有些人可能有不同观点。对一些模型厂商来说,应用也非常重要。如果一个Benchmark比较贴近应用场景,他们就有动力把这个场景做好,这对他们也是有益的。
最有意义的事情是,大家至少口头上仍然是奔着AGI去的。所以应该考虑哪些核心认知能力需要提高,它们应该体现在Benchmark上,并且能够体现泛化性。
如果我做了一项改进,只有一个Benchmark涨分,其他都不涨,可能就有问题。回到一开始的问题,未必存在某一个最好的Benchmark,而是不同Benchmark测试了不同的东西。
我们可能要关注的是,哪些共同能力能够让多个Benchmark一起提升,而不是只优化同一个Benchmark。
当然,Benchmark本身也可以贴近具体场景。如果这些场景是大家在意的,它确实反映了用户体验,这也是好的Benchmark。它未必特别通用,也未必朝着AGI,但确实体现了大家的实际体验。
从这个角度看,Benchmark肯定会千奇百怪。总会有一个场景是大家关心的。
我觉得这里有两个要素。第一,这个场景中的差距,是不是体现了一个非常具体的能力缺陷。如果只是因为模型不懂某个场景知识,而这个场景又不重要,只是在一个犄角旮旯里解了一道很奇怪的智力题,然后做成Benchmark,那么这个能力提升未必代表模型本身的认知能力提升了,这可能就不是一个好的Benchmark。
第二,即使它不反映核心能力,至少也要反映一个大家在意的场景。比如现在特别火的personal assistant(个人智能助理),这是一个非常具体的场景,大家都希望拥有这样的东西。
这种Benchmark甚至未必只测模型本身,也可能测你的harness。它的目的可能不是为模型训练提供数据,而是告诉你harness错在哪里,之后可以做工程优化。
所以,贴近用户需求场景的Benchmark也是好的Benchmark。在我看来,一类是反映核心认知能力,另一类是贴合具体场景,当然两者都有是最好的。
我觉得现在大模型公司很看重的一件事,是Benchmark的分布。大家可能都听说过Artificial Analysis,他们做的事情很简单:给各家Benchmark设置不同权重,然后综合成一个分数。
但问题是,它所采用的权重是不是真的是大家需要的?这个权重应该以什么方式迭代?这些事情都很主观。大家质疑的可能不是模型本身,而是质疑榜单本身。
我现在倾向于认为,Benchmark还不够好,还没有做到大家心目中理想的Distribution(分布),很难达到一个Ground truth。
所以现在很强的模型厂商,比如Anthropic或者OpenAI,都会倾向于自建评测体系,让它更接近自己心目中的分布。第三方评测则可以让它们对外发布时更有说服力。
当然,允中说的垂直领域Benchmark肯定非常重要,因为它面向的是一类具体群体,它的分布就是这个群体每天需要做的事情。
如果金融或者法律领域的Benchmark能够把律师每天做的事情测扎实,那么相关公司可能只需要看这一个Benchmark就够了。
另一个问题是,有些Benchmark并不能代表真实认知。比如之前有一些Benchmark是测Agent智力的,就是玩那种小游戏,ARC Challenge(抽象推理挑战)那种游戏,像ARC-2、ARC-3这种。
它们的初衷是认为,能够解决这些游戏体现了人类智力。但后来发现,这种能力也可以被高度特化,一个小模型也能把它做出来。
有没有什么特别niche的Benchmark,大众可能不太了解,但其实非常有用,能够测试模型能力?
我可以举几个我们的例子。我们有些Benchmark不太经常出现在大家的榜单上,比如前一阵子做的Drug Discovery(药物发现),还有和AI tutor(AI辅导)相关的Benchmark。
它们关注的是比较小的垂直领域,但我们和各个实验室负责相关领域的团队交流时,通常都会发现,他们会有专人关注市场上和自己领域相关的评测,并把这些评测收集起来。
另外,一个Benchmark最后能不能上榜、火不火,也有很多随机因素。比如Artificial Analysis用过我们做的一个榜单,叫SWE-Atlas。
我们当时做了几种不同风格的SWE-Test,包括代码仓库问答、代码重构和写Test,只是分3个阶段推出。Q&A先推出了,但另外两个还没来得及推出并合并进去。
不知怎么回事,Q&A先被Artificial Analysis收录了。Q&A上榜之后,大家就开始刷这个东西,突然间这一块需求变得很大。
我们当时很不理解,因为Q&A是最简单的场景。我们花了很多心血做了更复杂的Benchmark,结果可能只是因为时间关系,或者某个实验室碰巧在这个Benchmark上分数比较高,它就先火了。
所以榜单上的东西,大家在技术报告里看到的内容,本身存在一定随机性。Artificial Analysis搜索、收录哪些榜单,也有随机性。
最后,还有一些你看不到的东西,背后可能也有人在使用。这个生态其实还比较深、比较复杂。
一铀,我还想问一下,你刚才提到大家对Artificial Analysis这类榜单的质疑,认为它不接近理想中的分布。这个分布现在有没有共识?
我的理解是,每个模型公司对于分布的需求其实也不一样。在这种情况下,我们应该如何理解理想状态下的分布?它应该更接近真实世界的任务,还是另一种分布?
我觉得真实分布本质上就是用户体验。假设世界上存在一个Ground truth,真实分布的真实打分,其实有点类似LMArena的模式。
假设每天给Agent一个Prompt时,可以让多个模型同时执行,然后给它们打分,这可能是最真实的评价。
但现实中,要做到这样的榜单,有几个困难。LMArena早期做得比较好,是因为当时的问答很快,开销也低。给它一个问题,几秒钟就能得到答案,很快就能进行打分。
但现在到了Agent时代,一个长程任务动辄需要几个小时。用户也没有那么多精力,每次执行一个任务都同时开启几个Agent,更没有一个机制把反馈收集起来。
所以现在很多评价都带有主观性,很难拿到真正的Ground truth。如果有哪家公司或者某种方式能够解决这个问题,那肯定会非常厉害。
我相信大模型公司内部肯定有类似机制:让几个版本的模型给真实用户使用,然后根据真实使用情况测试。但我的意思是,假设存在这样一个Distribution,如果评测分数的分布接近它,那就是一个很好的Benchmark。
我也听到过一些比较有意思的情况:很多评测Benchmark和线上A/B test测出来的结果并不一样。用户反馈和评测结果有时并不一致,甚至很难说哪一个更好。
因为用户有时候也比较主观。比如在聊天场景里,给用户很多factual(事实保真)的内容,和给用户很多Clickbait(点击诱饵)、说一些他们爱听的话,最后得到的反馈可能完全不一样。
是的。比如Claude Code,我觉得它在LMArena上分数一直遥遥领先,是因为它有一个特点:尤其对中文用户或者英文用户来说,它给出的Output format(输出格式)更贴近人们想看到的内容,也很容易理解。
相反,Codex可能执行得更细致,但输出的东西不那么容易被人理解,所以相对吃了一点亏。但从我的个人体验来看,它们两个可能不相上下,甚至我个人还更偏好OpenAI那边一点,因为它做得更细致,犯的错误更少。
所以,如何定义好的Distribution,确实是一件很主观的事情。
在这种情况下,模型公司还会把Benchmark视为判断自身模型能力的标准吗?
它们肯定也在乎外部评价。不过不同模型公司的策略不一样。先说美国几家大的公司,它们肯定倾向于自建评测体系,因为自家的evaluation团队有能力建立这些体系。
但对于刚成立的、相对没有那么有名的frontier lab(前沿实验室),或者不是头部的frontier lab,它们肯定会非常依赖外部评测。因为内部评测团队可能没有那么有经验,体系也不够完善,或者它们更希望把人力投入模型训练和开发,而不是投入评测。
所以每家公司的策略都不一样。
我的个人判断是,当产品逐渐成熟,或者积累了一定规模的用户之后,最终关心的还是用户增长。我之前在Meta做了很多年搜索和推荐,后来逐渐变成类似搜索推荐的问题:你看什么指标,和用户增长最相关?最后就朝着赚钱的方向走。
现在真正能够评测这些能力的实验室还不多,需要一定的用户规模。在聊天场景里,这件事可能已经比较成熟了,但在Agent场景里,要做到同样程度就复杂得多。
大模型和传统搜索、推荐不太一样的地方,是它的场景很复杂。即使能在聊天场景里做好A/B test,甚至训练Reward model让模型朝着用户喜欢的方向发展,也总会有新的东西出现。
现在大家一直在关注新的方向,比如科学发现。但我不可能有足够多的科学家,给出显著的A/B test结果,还是必须依靠场景和Benchmark。
我会说,是因为大家对应用场景的期待太高了,而场景增长的速度赶不上用户在这些领域沉淀的速度。所以现在仍然有大量需求要依靠Benchmark来评价。
但在某些领域沉淀下来之后,大家会有更多线上评测体系,可能会像传统互联网增长那样,寻找哪些指标和DAU(日活跃用户)增长最相关。
能不能深入讲一下数据采购?这里有几个点非常有意思。
第一,你刚才提到很多小公司,这其实是现在的创业机会。这也是为什么我们看到,最近兴起的很多四五个人、甚至两三个人的数据创业公司,拿到了非常高的估值。
这是不是因为它们的目标,就是这些非常垂直领域的数据?
这里可能有几类问题。首先,最近兴起的RL environment公司,更多其实是在做合成。
整个数据行业已经从找人标注,慢慢过渡到交付一整套环境,而这个环境可能需要大量工程工作。很多小团队在合成技术栈上做得比较好,就可以在比较短的时间内交付大量合成环境。
这未必是不好的。合成数据有时候可以基于强模型,或者基于一些半成品artifact(产物),做出很好的东西。现在这是一块增长点。
再往下看,比较有意思的是,这件事之所以能够成立,是因为大家今年的主题在卷代码。软件行业很特殊,它非常开放,有大量公开资料,而且生产数据的公司同时也都懂代码,所以这件事比较容易解决。
这给小团队创造了很多机会,让它们可以自己造出大量数据。
但再往后,比如其他垂直领域,就会复杂得多。我看到有些公司可能在解决两个不同的问题。
以我们做后训练数据为例,我觉得它其实包含两个问题:第一是采购,也就是把原材料买回来;第二是加工,比如把它标注,或者通过Agent pipeline把它做成适合大模型训练的环境。
在垂直行业里,采购会变得越来越复杂。甚至在代码领域,如何采购私有代码仓库,谁能把这个问题解决好,谁就有巨大的优势。
再比如芯片设计,可能需要把整个芯片设计环境造出来,其中涉及商业软件。怎样取得这些商业软件的版权,并把它们包进环境里,就是一个问题。
又比如DevOps(开发运维),如果我是系统工程师,需要操作AWS之类的平台,我听说有公司做了一整套AWS模拟器。
每个垂直领域都有很深的东西。你可能需要采购,也可能需要定制软件。大家只要抓住一两个垂直领域,把它做好,其实就创造了很多新的机会。
我们刚才提到,在Drug Discovery、生物医药以及其他具体行业的评测里,可能没有足够多的场景,也没有足够好的评测。在这种情况下,我们有足够好的数据吗?
这里有一个难点。每个领域都需要有人把专业知识讲出来,但除此之外,还需要这个领域本身的资料。
比如药物发现,可能需要很多私有数据库。所以我觉得这是目前行业的一个大卡点:首先你得把这些东西买到,知道大家手上有什么,才能把它做成Benchmark。
ALE很大程度上就是在解决这个问题。我们希望通过众包的方式,让专家把自己以前做过的项目提交上来。
当然,其中有些不符合规范的内容我们会筛掉。有人甚至提交了非常离谱的东西,比如法院证据之类的,我们尽量都筛掉了。
我们在V2中也尝试收集一些数据,比如Steam上的游戏库,或者游戏开发任务。某个名不见经传、玩家大概只有几千人的MOBA(多人在线战术竞技)类游戏,它的源码要价能到两三百万元人民币一条。我觉得哪家数据公司或者别人做Benchmark,都没有这个财力去做这个事情,就是这个游戏公司会要价要到两三百万。
一条源码?
对,就这个游戏的源码。很多公司想要采集游戏视频,然后做标注,但游戏视频本身可能就是版权数据,这里有巨大的采购问题。
我觉得这就是一个商业机会。现在已经有不少创业公司在解决这些问题,大型数商自己也在投入采购工作。但总体来说,这里面还有巨大的问题没有解决。
现在有哪些比较热门、但数据非常少的垂直领域?
至少医疗算一个,只是医疗数据比较敏感。谁能拿到大量病例数据,谁就会非常有优势。
确实有很多新闻提到,在法律、金融等领域,可能有一些离职员工会分享他们过去的工作流。但工作流数据和医疗领域的病人数据,可能还是不太一样。
是的。各个领域之所以经常被提到金融、医疗,是因为它们和大家比较息息相关,大家多少还懂一点。
其实世界上还有很多行业是我们完全不了解的,真的要和从业者聊过才知道。比如我最近才知道,药物研发领域还会交易分子,一个分子甚至可以倒腾几轮,其中还要做DD(Due Diligence,尽职调查)。
可能只是因为大家不知道,所以还没有做。
我们在做ALE V2、希望把某一个领域做深时,会先梳理这个领域有哪些工作流,做出一棵树状结构。尤其在生物学领域,我们会参考Nature的分类和子学科分类。
把这棵树展开到第3级,大概有3000个节点。我们也统计了市面上已有的生命科学和生物学Benchmark覆盖了多少,大概只有10%,甚至不到5%。
也就是说,市场上可能连一个成型、覆盖面完整的Benchmark都没有,更不用说针对它去做相应的数据。
我们刚才提到的这些合成数据小公司,它们能赚钱的周期有多长?听起来,它们都是最近几年才出现的公司,那这些数据的生命周期有多长?
这是个好问题。至少现在需求还挺大,未来很难说。
比如这一波coding卷完了,大家需要新的品类。你能不能抓住下一个机会?而且下一个机会可能和你现在的运行模式不一样。
我自己觉得,采购能力会变得很重要。采购能力差的公司可能就比较难。或者像一铀他们一样,找到新的激励机制,让大家把东西交进来。
以前的激励机制可能是招聘平台,或者给你一个小时工。以后可能出现新的激励机制,谁能把这些东西玩转,谁就会继续有优势。
我想问一下允中的看法。随着模型能力越来越强,模型公司自己内部创造数据的能力也越来越强。
数据行业的饼确实在变大,但有没有可能出现这样的情况:面向非头部公司的机会,门槛反而越来越高,入场券越来越难拿?
比如数学领域,过去只需要影印奥数课本,就能批量造出大量数据。但这些数据现在基本已经没有价值了。你怎么看未来数据公司的发展方向?
从第一性原则来说,还有巨量的问题没有解决。这个世界上还有多少东西没有被蒸馏干净?机会仍然巨大。
但如果只看现在的运行方式,事情当然会越来越难,因为越来越多玩家进来了。如果大家只盯着手上的工作,这件事一定会越来越难做。
即使实验室不自己做,越来越多竞争对手进来之后,利润率也会越来越低。所以在我看来,一个好的数商最后解决的其实是研发问题。
这就像软件公司一样:我要提前投入研发未来大家需要的东西,赚到钱之后再投入下一个东西。
我有一个比较激进的观点:实验室未必具备解决数据问题的最好基因。
比如合成数据,按理说很多合成数据本来就是实验室研究工作的组成部分,尤其是做后训练的人,大部分时间都花在数据上:买数据、核数据、验证数据、清洗数据。
但为什么外部公司仍然有机会?因为今年这一波增长,来自一些懂行的人在外部把数据合成出来,再卖回给模型公司。
这件事之所以存在,一方面是因为大模型公司现在有太多钱,自己造和从外部买并不矛盾。但更长远地看,有些问题可能不是模型公司最适合解决的。
比如采购。如果我要把某个行业的东西先采购回来,再蒸馏出来,这时大型实验室未必有优势,甚至可能存在利益冲突。
假设一方面把FDE(前线部署工程师)派到企业里,另一方面又有一拨人在收集这个企业的数据,那企业可能就不太放心把数据交给你。
出于这些原因,有些事情可能不适合由实验室自己做,仍然需要第三方帮助采购,或者深入某些行业。
我觉得一个数商真正要做的事情,是做研发:研究未来哪些行业重要,哪些东西值得投入,把资料买回来,自己先投入R&D(研发),把这个行业的问题研究清楚,然后做成Benchmark或者数据,甚至证明它的有效性,最后再卖给实验室。
对实验室来说,Deadline都很紧。如果我是实验室的研究员,让我花半年时间解决一个行业,有时没有这样的自由度。但如果这时候有一家数商说,我已经把这个行业研究清楚了,你要不要,大家通常都会看一眼。
所以长期来说,拼的还是研发能力。
你觉得这个趋势对大模型公司来说会持续吗?现在模型公司内部也有自己的数据团队,但你觉得它们会更愿意从第三方收数据,而不是自己造环境、造数据吗?
这两件事并不矛盾。模型公司最高的优先级还是把东西做好。如果自己能生产高质量数据,可能会倾向于自己生产。
但从大方向来看,世界上还有太多工作流没有被研究清楚,所以对外部数商的依赖会长期存在。一个大模型实验室可能也不愿意投入那么多资源,把事情做得这么重,而是希望更加灵活。
缺点是,大家又希望更多能力是第一方的,不希望所有人都能从数商那里获得。所以从这个角度看,模型公司也有自己研发的动机。
比如现在很多实验室在做Expert matching(专家匹配),也就是把人派到实验室来。这也是一个趋势。
我自己也觉得,现在还有太多问题没有解决。不管是谁解决了这些问题,都有赚钱的机会。这个问题发生在哪里,其实不是特别重要。现在是机会很多、饼越来越大的阶段。
但数据行业一直有一个问题:如果第三方供应商把同样的数据卖给不同的模型公司,中间要怎么样区分?
通常有一个比较简单的解决方案,就是花更多钱把数据买断。
在数据供应商收到大量数据的情况下,模型公司会怎样使用这些数据?这个流程能不能讲一下?
这里通常有比较固定的训练方式,我们把它叫Training recipe(训练配方)。
比如比较简单的数据,可以直接做SFT(监督微调),把正确答案给模型就行。像Rubric这种数据,可能会用来做强化学习,因为需要模型不断尝试,再由另一个模型打分。
比较有意思的是现在的RL环境。比如最近大家在做特别长程的任务,今年的一个主题是RSI,也就是recursive self-improvement(递归自我改进)。它其实是一个buzzword(热词),意思是AI自己研发自己。
大家最近开始研究一些可能一次运行几天、甚至一个星期的任务,其中可能需要一张GPU,让模型在上面训练模型。
这种情况下,训练方式开始变得模糊。我们也在一起研究应该怎么做,现在还没有太多共识,所以仍然有很多有意思的空间。
对数商来说,有时也不只是简单地造一个模拟任务,还要考虑模型公司拿到之后准备怎么训练。针对它的训练方式,可能还需要进行定制。
这一点我也很好奇。如果只是为了Bench-maxxing,拿ALE的一些任务直接训练,做一批类似数据,怎么保证训练之后模型的能力和泛化能力能够提升,并迁移到其他任务上?
有没有比较系统、科学的方法,验证一批数据能给模型带来怎样的提升?又如何在不真正训练一个模型的情况下,判断这些数据能带来什么效果?
这里其实有一些技术。比如现在如果要造一个环境,大家最怕的就是Reward hacking(奖励作弊)。
也就是任务明明没有完成,模型却通过某些手段获得高分。这样训练出来的模型肯定会变成一个耍滑头的模型,这种情况当然不希望发生。
通常可以用Agent做red team(对抗性测试),再让一些比较强的模型试试看,能不能在任务里找到捷径。
下面有些是我的个人猜想,不代表Scale AI或者任何客户。训练这些东西时,很多Benchmark可能只关心最后有没有完成任务,验证器也是围绕这一点设计的。
但模型是怎样完成任务的,这件事在训练中可能也很关键。一个比较简单的例子是budget(预算)。
训练模型时,可能要关心它是不是消耗了过多token,或者用了过多步骤。拿ALE的任务数据训练时,最后的Reward肯定会很复杂,不是说把任务解出来就够了,还要关注它消耗了多少资源。
最后可能要从各种维度检查Reward,防止模型作弊。只有这些东西结合起来,才能完成一个训练recipe。
所以,训练数据要考虑的问题可能更多:这些数据能不能导出一个比较好的训练方式?
像RSI,或者刚才提到的很多新实验室,在这种情况下,它们训练所需要的数据有什么不一样?需要的定制又有什么不一样?
最常见的定制其实是难度。大家做Benchmark时,一般希望它不要太快饱和,似乎越难越好。
但也不一定。正如一铀说的,不能完全解不出来。Benchmark的难度,更多应该客观反映这个行业的难度。
但训练模型时,难度需要特化,必须适合这个模型。我们有时候会做这样的事情:模型厂商把还没有发布的模型给我们,然后我们帮它筛数据。
题目对模型来说不能太难,也不能太简单。现在做强化学习,是让模型自己不断尝试,答对了就能学到东西。如果题目太难,模型什么都做不出来,肯定不行。
所以首先要做难度适配。其次可能要做轨迹采集。如果模型厂商把模型轨迹给我们,我们可以把轨迹采集出来,帮它筛选,甚至想办法让人类生成能够解决这些问题的轨迹。
这样,模型厂商拿回去之后,不一定要做强化学习,也可以直接根据这些轨迹做SFT。针对训练需求,确实会有一些定制工作。
接下来还想聊一下数据污染。因为今年2月,OpenAI宣布停止报告它在SWE-bench Verified上的分数。
这是一套让AI修复真实开源软件项目问题,再通过测试判断它有没有修好的评测。当时OpenAI主要指出了两类问题。
一类是测试本身可能存在缺陷,比如有些功能的正确解法也会被判错。另一类是数据污染:在特定提示下,模型能够复现部分题目原本的人类修复代码,也就是说,模型可能在训练过程中已经接触过相关内容。
所以这个分数就变得有些难以解释。两位是怎么理解数据污染问题的?SWE-bench这一类数据,问题到底在哪里?
SWE-bench这类数据其实有一个问题,它甚至不一定是污染,也可能是任务本身做得不够好。
比如有时存在“假错误”:测试脚本要求太多,或者任务描述不清楚,都可能导致这种情况。
另一种污染是模型在预训练时已经把相关内容训练进去了。这里其实有一些技术可以检测。
一铀在ALE上应该也有类似经验。OpenAI停止采用的可能不只是SWE-bench,而是连SWE-bench Verified也不再采用。
我印象中,过去6个月里,它的分数只从74%提升到80%。剩下的问题可能是脚本写得太严苛,题目本身不可解,或者存在其他各种问题。
如果剩下的20%都集中在这些问题上,那这个Benchmark本身可能就失去了比较意义。
ALE也没有完全解决一个问题,这正好可以和允中讨论:当专家提交上来的材料本身是错的,应该如何预防?
这件事确实发生过。我们的专家背景非常多样,当然这样的人很少,但有人为了提交任务、获得作者署名而提交内容。
我们的奖励机制是,只要你提交的任务被接纳,就可以成为作者列表的一部分。确实有人为了提交而提交,甚至调用Agent合成一堆乱七八糟的数据。
有些数据提交上来,我一眼就能看出来是编的。这确实给我们的工作造成了很大困扰。
Scale AI总是可以靠人解决问题。但这里有一个特别有意思的问题:一铀提到,给作者署名权是一种奖励机制;在Scale AI,更原始的机制可能是给小时工。
无论是哪种方式,大家都可能找到偷懒、作弊的方法。所以我觉得,奖励机制是一个特别困难的问题。
长远来说,我们的目标是把人类知识尽可能蒸馏出来。怎样设计一个好的奖励机制,让大家的目标对齐,我觉得这里面有非常大的空间,也可能是一个巨大的Research area(研究领域)。
我自己心里有一些方案,比如Proof of work(工作量证明)。可以要求提交者把完成任务的整段工作流程都录下来,达到一定时长,或者完成规定数量的步骤。
不同形式的问题,需要不同形式的奖励和验证机制,这里面其实有很多玩法值得探索。
这里还涉及一个更大的问题:很多数据本来就是公开数据,比如网上的资料、公开代码。这些数据是不是注定会被污染?一般会怎样处理?
最简单的公开数据污染,其实直接问Agent就能找到。公开数据相对还好检测。
我觉得最难的是编造数据。比如让模型做一个化学模拟,但它根本没有真正跑过这个任务,只是自己编了一套似是而非的东西。
这种问题如果没有几个月时间,根本查不出来,因为它看上去非常真实。
什么时候能发现?可能要等到所有Agent的能力都远超这个问题本身,大家发现不同Agent做出来的答案都很相似,但和真实答案不一致,这时候才会发现问题。
但这个周期会非常长。再找一个专家验证,成本又非常高,因为这个问题本身可能就需要专家花一两周才能完成。
而且验证专家本身也可能为了某些东西偷懒,直接说这个东西是对的。
所以只要涉及专家评测,都会有这个问题吗?
都会有。众包Benchmark难做,难就难在这里。人性非常复杂。
我觉得验证机制可能只是其中一环。奖励机制也很重要。
比如,不只是让专家老老实实做12个小时,而是要求他把每一步都交出来。即使他想合成假数据,也必须完成规定数量的动作,这样他可能就没有那么强的动机去造假。
这些都是很值得研究的方向。
我本来想问真实工作流数据,但听下来,大家现在还是在卷coding数据,并不是在做真正的workflow,对吗?
因为我理解,像Mercor这样的公司已经在卖真实工作流数据,但听起来coding现在仍然是最卷的赛道。
这取决于你怎么定义真实工作流数据。真实工作流本质上都可以被归结为某种coding问题。
比如3D建模,FreeCAD之类的软件都提供了现成API,让你去完成任务。这不是传统意义上的coding,不是写一段代码去解决LeetCode题目,而是用coding解决真实workflow。
只要有足够的MCP和API调用,95%以上的任务其实都可以归结到coding问题上。
也可以根据task本身,看它需要完成什么、涉及哪些环节,再把它归结到不同领域的工作流。
但我同意允中的说法。现在让Agent做事情,代码就是它的手和脚,所以归根结底,coding肯定是其中一环。
在私有数据需求依然很大的情况下,未来数据公司会不会从卷采购本身,变成卷并购,也就是收购垂直领域的公司?
这件事不评论Scale AI。我听说现在有一块很大的Private equity business(PE业务)。
以前大家收购公司,常见的方式是把公司flip掉。现在有一种新的方式:买下一家公司,用AI让它提效、裁掉一部分人,把公司的价值做上去,再卖掉。
现在又多了一层:除了可以重组公司、用AI提效,还能把公司的数据挖掘出来,数据本身也可以卖钱。
于是,传统收购行业多了一种玩法。数商和传统做Private equity(私募股权)的公司,也都开始看数据如何变现,逐渐兴起了一个新的领域。
如果未来5年、10年,行业还以这样的速度发展,没有遇到瓶颈,把各个行业的数据都拿出来,可能会和大模型本身一起,成为世界上最大的两个行业。
当然,这是一个比较极端的AI doomist view(AI末日论观点),但确实可能推导出这样的世界。
听起来,数据行业本身也在非常快地变化。从Rubric data发展到RL环境,就是一个明显例子。
什么信号会让你觉得,某个领域或者某个赛道可以持续增长?
7. 训练数据不是越难越好:为不同模型匹配难度与解题轨迹
首先,还有很多问题没有解决,机会仍然很多。另一方面,越来越多玩家进来了,比如每年都有很多新的Neo Lab。
如果资本市场还按照现在的方式运作,整个饼会越来越大。但数据变化很快,它不像是一门可以躺在一个地方、一直吃老本的生意。
数商需要疯狂迭代自己,最后可能拼的是R&D能力,或者谁能把R&D能力本身固化,做成一个flywheel(飞轮)。
如果我有一条流水线,可以不断发掘新的东西,也许这就是未来最大的优势。
总体来说,现在是百花齐放的阶段,未来机会还很多。
我也听到过一些说法,数商的估值空间通常没有传统公司那么大,因为它很难保持杠杆,也很难让公司在积累一定用户之后,用比较轻的方式躺在那里赚钱。
不像Facebook、Google这样的公司,积累了大量用户之后,就可以依靠现有产品持续获得收入。数字生意的领导者必须不断思考下一步在哪里,持续迭代,因为模型迭代速度太快了。
一铀,你们现在做ALE 2.0时,最难的是什么?
我觉得学术上相对容易一些,商业上可能更难。Scale AI在商业上面对的困难,我可以想象得到。
他们给我们的数据,很多都是无偿提供的。但如果是一家数商,要把这些数据收上来,可能都是天文数字。那些原始项目和代码,不但价格非常高,而且很难找到一个好的奖励机制,让专家自愿提交。
我按照Mercor官网给专家的小时价格来算,制造业工程师大概是一两百美元一个小时。这个价格决定了,它不可能招到特别高级的工程师。
但学术界之所以更容易,是因为我们可以自然吸引一些这个级别的人来收集数据。他们不一定是为了钱,而是希望大家一起把事情做好,或者看重作者署名。
所以奖励制度不一样,能吸引到的人就不一样,上游也不一样。
好,我们就到这里结束吧。谢谢允中,谢谢一铀参加我们的节目。
谢谢Yiwen。
谢谢。
以上就是我们这期播客的全部内容了。国内的听众可以通过小宇宙、苹果播客、网易云音乐、喜马拉雅、QQ音乐、蜻蜓FM、荔枝FM来关注我们。海外的听众可以通过苹果播客和Spotify,或者在YouTube上搜索《硅谷101》播客来关注我们。我们部分的文字稿还会收录在《硅谷101》的微信公众号上。谢谢大家,我们下次再见。