# E253｜谁在给大模型出题、卖题、判卷？聊聊AI数据行业的野蛮生长

硅谷101 · 2026-09-27 · 58 min · https://www.youtube.com/watch?v=I-rLxiIGf-4

## 逐字稿

节目开始之前，跟大家分享一个我们《硅谷101》即将在湾区举办的黑客松活动。今年硅谷101将在我们的年度活动Alignment 2026上举办STORY101 LAB AI视频创作挑战赛，让影视创作者和AI科学家们在现场一起探索AI到底能给讲故事带来哪些新的可能。无论你是已经在用AI拍片的专业团队，还是想要尝试的新手，都欢迎参加。比赛设有探索组和专业组，我们也会提供免费的workshop培训。优胜作品还有机会赢得丰厚的奖金，并在千人线下活动中展映。活动时间是10月10号到11号，地点在Sunnyvale的Plug and Play Tech Center。报名链接我们已经放在本期节目的Shownotes里面了。另外，我们Alignment 2026活动本身的报名也在持续进行当中。这次我们邀请了来自OpenAI、英伟达、Menlo Ventures、Cerebras等等公司和机构的嘉宾，期待在线下和大家对话。

Yiwen

Hello，大家好，欢迎回到《硅谷101》，我是Yiwen。

很多投资人在和我们聊天的时候，都提到了他们最近很关注的一个赛道，那就是数据。随着模型能力不断提升，模型公司对训练数据的需求也变得越来越复杂、越来越具体。硅谷因此出现了一批增长很快的数据公司，专门为模型公司提供服务。

比如，由3名20多岁的年轻人创办的AfterQuery，今年4月宣布A轮融资时，估值还是3亿美元；到了9月，新一轮融资已经把估值推到了32亿美元。不到半年涨了10倍，创下了YC旗下公司从启动到成为独角兽的最快纪录。我们更熟悉的几家大型数据公司，估值也已经达到了百亿美元级别：去年Meta入股Scale AI时，给出的估值超过290亿美元；Mercor去年10月这轮融资的估值，也达到了100亿美元。

但这些高估值背后的数据生意到底是怎么做的，外界其实很难看清。所以我也很好奇，这些公司究竟在卖什么？模型公司又为什么愿意给那么多钱？

过去提到数据标注，大家很容易想到给图片打标签、给模型的回答打分。现在，数据公司还需要请来各类行业专家，把他们的知识和工作经验转化成AI可以学习的任务。

### 从 vibe coding 到 vibe everything：详解Agents’ Last Exam

其中一类重要的数据，是请专家写清楚一个回答、一份工作成果，到底满足哪些条件才算好。这套评分标准，也就是我们经常听到的Rubric（评分细则）。再往前一步，数据公司还要搭出让AI实际动手的环境，配上任务、工具和反馈机制，让它在里面操作软件、反复尝试，并且根据结果学习，这就是强化学习环境，也就是我们经常听到的RL environment（强化学习环境）。

与此同时，新的AI评测也层出不穷。从金融、法律等垂直领域，到让Agent完成一整套工作流程，模型要参加的考试越来越多。但榜单上的分数提高了，究竟代表哪些能力变强了？针对榜单做优化，什么时候会让模型更好用，什么时候又会变成单纯的刷分行为？

### 从做评测到卖数据：benchmark的生意

这期播客，我们就想把这些问题聊清楚。我请来了两位非常适合聊数据这个话题的嘉宾，分别是在Scale AI负责后训练和评测研究的何允中，以及加州大学伯克利分校的博士后、Agents’ Last Exam（ALE，智能体终极测试基准）项目研究者孙一铀。

何允中

### 没上热门榜单的评测，也可能带来真实的数据需求

大家好，我叫允中，现在在Scale AI负责post-training（后训练）和evaluation（评测）research。大部分人关注我们，可能是看我们发布的Benchmark（基准测试），还有一些RL data recipe的文章。

但实际上，我们也是在给整个大模型行业提供数据，以及一些方法论支持，有一点像整个行业的外包数据research团队。以上观点都是个人观点，不代表Scale AI，也与客户无关。

孙一铀

大家好，我是一铀，现在在UC Berkeley读博士后，关注的是Agent evaluation（智能体评测）这个方向。我们最近推出的工作就是Agents’ Last Exam，目标是构建迄今为止规模最大、覆盖面最广的智能体评测基准。

这个项目由Berkeley RDI和300多位行业专家共同领导，希望衡量智能体在有可验证结果的长期、具备经济价值的任务中的表现。目前公开的任务大概有150多个，覆盖50多个细分行业。我们的目标是在下一次发布中直接放出1000多个任务，并且在每个领域做得更深一些，可能几个月内就会发布V2版本。

Yiwen

允中，要不要给我们讲一下现在市面上的数据公司？因为现在有林林总总的数据公司，你觉得大致可以分成哪些类别？这里面有哪些大的玩家，还有哪些新秀？

何允中

在我看来，最有意思的是，这些公司的基因可能不太一样。有些是做招聘出身的，比如Mercor；有些是从众包网络出身的，比如Scale AI这种传统数商；也有一些新公司是做合成数据的，还有一些原本属于某个领域，后来转行做数据。

这里值得说一下具身智能。现在这个行业的状况是，有很多做模型的公司暂时还没赚到钱，但它们花了大量精力投资、制作数据，于是顺便做起了数据生意。很多各行各业的人也发现了自己数据的价值，然后转行来做数据公司。

大致来说，几家大的玩家，比如Mercor、Surge AI、Scale AI，基本上试图什么东西都覆盖。除此之外，也有一些新秀把某些领域做得比较好，比如BigCode或者Snorkel AI，它们可能更偏research（研究）和engineering（工程），我猜测它们主要生产代码或者tool call（工具调用）这一类环境，抓住了今年的风口。

另外还有一些小公司，可能解决的是垂直领域的问题，甚至不像我们这样做标注数据，而是做broker（数据经纪商）。比如好莱坞有人手里有特别多的版权数据，也知道怎么把这些东西卖出去。现在最新兴起的，可能就是做垂直领域，把一个领域做得特别好，由一些领域专家组成团队。

大概就是这么几个分类。我觉得机会还很多。大的数商有大的数商的优势，想进入一个领域时有更多资源，整个饼也在越来越大。

Yiwen

你刚才提到Mercor、Surge AI这样的公司。所谓招聘公司，具体是什么样的商业模式？

何允中

Surge AI应该不是，但Mercor是做招聘起家的。它有自己的自动AI面试产品，重点可能是能够在比较短的时间内找到足够数量的专家，建立一个专家网络。

Surge AI更多是把这件事in-house（内部来做）。这里面存在一些取舍。基本上每个数商可能都需要面对类似的问题：如果完全依靠自己全职培养的人，这些人的能力肯定更强，但灵活度不够，产能可能也会差一些。

如果更多依靠众包网络，灵活性会更大，但每个人的质量就比较难保障，这里面就涉及质检问题。比如Scale AI这类公司的优势，就是我们不仅有数据方面的质检经验，也有人力方面的质检经验。

Yiwen

允中，你是什么时候加入Scale AI的？从你加入到现在，整个市场对于数据的需求发生了什么变化？

何允中

这个故事还挺有意思。当时我是在Meta入股之前签的offer，结果我一到岗，人就走了。所以我经历了整个大模型行业开始疯狂扩张的过程，不管是人才争夺还是薪酬体系，都开始go crazy。

我加入之前，我的老板刘冰跟我说，有一项技术，各家实验室都在做，但每个人做得不太一样。他说，你赶紧进来，我可以跟你一起好好做些研究。后来我来了，当时做的是Rubric data（评分细则数据），那个时候还比较新，距今可能一年多。

现在Rubric感觉已经过时了，大家都在讲RL environment（强化学习环境）和各种各样的东西。这一年确实经历了非常多的变化。

Yiwen

我们关注这个话题，也是因为从2024年到现在，整个行业对数据的需求发生了很大变化。2024年之前，我们聊到数据时，大家想到的很多还是人工标注，也就是一些比较基础的数据。我们需要非常多的数据来做pre-training（预训练）、训练模型。

但从2024年开始，Mercor之前也提到过，Deep Search的兴起导致整个行业转向了所谓的Agentic data（智能体数据）。我们会需要你刚刚说的Rubric，包括RL环境，以及更多真实的工作流数据。

能不能先帮我们梳理一下这些概念？这个行业从Crowdsourcing data（众包数据），也就是人工标注数据，发展到Agentic data，中间经历了什么变化？

何允中

首先要说明，Pre-training（预训练）仍然很重要。不过从我身边人的兴趣来说，大家确实经历了一个转向。很多人觉得pre-training有点无聊了，继续scale、调整数据配比，做的事情比较重复。

后来o系列模型出来了，大家都在做reasoning（推理），发现强化学习跑通了，于是一下子都对RL感兴趣了。RL比较有意思的一个问题是，我需要一个可验证的信号。

可验证的信号，在代码或者数学领域尤其容易获得。最早的推理模型就是从数学做出来的：选择题答对还是答错很容易判断，或者最后算出一个数字，也可以直接验证。

但之后大家开始想，数学可以做RL，在其他领域呢？比如医疗、金融，或者更基础的指令遵循，在这些领域能不能做RL？这里的问题是，它们也存在某种客观标准答案，但不像早期阶段做RLHF（基于人类反馈的强化学习）时那样，只是用奖励模型学习大家的偏好。

这些任务其实有标准答案，只是答案比较不结构化。比如历史考试是有标准答案的，但每个人的写法可能都不一样，很难简单地做pattern match（模式匹配），判断A、B、C、D就能知道有没有答对。

这时候就可以用Rubric的方式，相当于让一个助教拿着教授写的评分规则来打分。因为评分规则是提前标好的，是教授写的，所以这个助教不需要特别聪明。

这就是整个大模型数据中的一个核心概念，叫Weak-to-strong supervision，也就是能不能用弱模型来监督强模型。它成立的条件是，有专家把脑海里的知识写下来，这样弱模型拿着这份规则改卷子就行了，这就是Rubric data。

### 强化学习（RL）环境：从回答问题到动手干活

Rubric data火了很长一段时间。当然，它现在仍然很重要。但各个专家领域的Rubric，尤其是比较容易获得的那一批，已经被收集得比较干净了。Mercor或者Surge AI的崛起，其实也和这一块专家Rubric有关。

再往前走，大家就需要让模型动手。比如现在做代码模型，或者像一铀他们做的ALE，虽然ALE不是做代码，但它也需要让Agent“动手”解决各种各样的问题。

这时候就不再只是验证一个聊天输出，而是要把模型放在Agent的setting（环境）下，给它一些工具，以及更复杂的验证方式。验证的可能是环境里的变量是否执行、数据库是否写入或删除，甚至是生成的文档里有没有图表。

这些任务可能仍然需要Rubric，但还需要一个Agent来检查。于是数据就变得更加多样。现在大家追求的一个比较大方向，是环境。

它不只是一些标注好的评分规则，而是包含一整套任务：要做什么、在什么环境里做、需要哪些工具、需要执行什么样的沙盒，以及一套和任务相关的验证方式。

验证方式非常多样，包括programmatic check（程序化检查）、Rubric，以及preference（偏好），比如让人选择更喜欢哪一种输出。现在这方面还没有形成特别大的共识，我又看到了一点当年Rubric时代的感觉：每家公司要的东西都不一样。

比如Terminal-Bench可能完全不要Rubric，而是纯programmatic check。这里面有不同流派，挺有意思的。

Yiwen

这个很有意思。一铀，你能不能从ALE的具体例子出发，讲一下它需要哪些要素？

孙一铀

其实我和允中的看法有一点相反。允中认为现在Rubric差不多已经做到头了，但我的看法是，Rubric这一块，尤其是专家主观判断类的题目，其实还远远不够。

我可以先从ALE的初衷讲起。ALE最初建立的原因，和允中刚才说的一样，是想把Vibe coding快速发展的趋势推广到vibe everything。

当时Vibe coding为什么发展得那么快？因为有非常多的Benchmark都在coding领域，而且coding比较容易verify（验证），它有确定性的Rubric。大家为了刷榜，在coding领域发展得非常迅猛。

沿着同样的思路，如果我们能够在其他领域，尤其是工程领域、能够客观打分的领域，建立各种各样的评测体系，那么大家去刷分，只要刷的是有益的分、是有意义的题，模型能力的提升对于人的日常工作来说就是实实在在的提升。

这就是我们当时想建立ALE的初衷。当然，世界上的职业实在太多了，浩如烟海。所以我们第一个版本只是给出了一个覆盖面相对比较广的初步尝试，之后还会继续努力，希望把覆盖面做得更广。

我们希望有一天，它能真正成为Last Exam：当你解决这个Benchmark的时候，基本上就能解决人类社会在某些领域真正有益的问题。

何允中

我同意一铀的观点，各个领域的训练肯定远远没有到头，很多东西可能还没有被Rubric表征出来，所以这里面还有很大空间。

我刚才说Rubric到头了，更多说的是一个行业趋势：这种静态的、单轮或者多轮聊天，输出一段文本，然后用Rubric检查它的方式。它并不是说知识类任务已经到头了，毕竟不同实验室的水平都不一样。

只是今年的一个大趋势，是从coding逐渐转向Knowledge work，大家需要让模型动手。这个时候，纯文本Rubric的需求量可能小了一点，但仍然很大，还有很多问题没有解决。

Yiwen

允中刚才提到，对于很多文本式输出，比如文章写得好不好，可能有一些评分标准。但事实上，在工程领域的产出中，评测方式很多。

我们确实发现，除非把输入固定得特别死，否则输出会有非常多的可能性。比如让模型生成一个游戏，甚至有些数学解法都不是唯一的。

如果这时候给出一个确定性的评判，一定要和Ground truth（标准答案）比较，很多时候就会产生不一致。所以，怎么样定义Rubric，让它能够兼容多种多样的输出，也是我们在构建Benchmark时遇到的问题，是未来想继续思考和解决的方向。

我稍微抛砖引玉一下。未来的发展趋势可能是，人类对于“好玩”“好看”这些东西，无法把它们固化成可以量化的指标，比如游戏好不好玩。

但实际上，在一些游戏设计的入门教材里，有各种各样的评判方式。比如奖励曲线是否平滑，是否符合大脑多巴胺的反馈机制，这些都有一定的科学指标，可以量化“好玩”和“好看”。

但目前在公开Benchmark中，我还没有看到特别完整的评测体系。这件事难度确实非常高，因为需要专家更加深度地参与。

允中，你们在数据公司里有没有看到解决这类问题的趋势？

何允中

这个问题特别好，也是我们每天绞尽脑汁思考的问题。整个Rubric，或者说整个大模型的验证体系，我觉得总体上有一个思路：大家希望左脚踩右脚。

也就是说，当模型变强之后，验证器也变强；验证器变强之后，就可以允许更复杂的Rubric。如果验证器很弱，就只能写一些傻子都能看出来、知道对错的Rubric。

但随着模型能力提升，Rubric可以写得越来越模糊，把更多知识交给验证器解决。不过总体来说，Rubric加上验证器，这两部分加起来的知识和能力，应该比要训练的模型更多，不然就达不到训练模型的目的。

回到做电子游戏这类非常主观的东西，未来可能很难用显式条件，一条一条写清楚什么是好游戏。它可能存在多种多样的可能性，所以Rubric可能不得不写得更模糊。

当然，这不是我们希望的。通常我们还是建议Rubric写得越严谨越好。但在某些领域，可能必须写得比较模糊，这时候就需要验证模型自己做主观判断。

这个验证模型甚至可能是专门训练的Reward model（奖励模型）。我知道不少实验室可能都在做类似的事情，当然这不是客户透露给我们的，是我的个人经验。

比如生图有两个部分。一部分是Instruction following（指令遵循），也就是有没有遵循要求：图片里是否有猫、有狗，背景板上是否写了指定的文字。这部分可以写成Rubric：这里要有一只猫，那里要有一只狗，甚至可以跑OCR（光学字符识别）把文字提取出来，看看是不是指定的内容。

但还有一部分是，这些字写得好不好，这只猫是不是可爱。这些也可以写成Rubric，但非常主观。于是可能需要专门训练一个模型，让它掌握一些人类的主观体验。这个问题如果要解决，大概率会是Rubric和专门验证模型结合的混合方向。

Yiwen

我们刚才好像把Rubric和环境放在了对立面。但听起来，一方面它们是可以结合使用的；另一方面，是否有些任务更适合用Rubric，有些任务更适合用环境？

孙一铀

这两个东西肯定不能拆开来看。环境或者任务数据只是一个执行的基准，但Rubric才是最终用来打分、判断模型做得好不好，并且决定如何奖励模型的东西，所以它们一定是相辅相成、必须结合起来看的。

我个人更希望从任务分类的角度去看。另外，人和Agent这两个角色如何合作、分别承担什么角色，也很重要。

从历史上看，最早Vibe coding刚出现时，大家用Cursor，其实人类也参与了代码执行。Agent只负责执行很小的模块，写一部分代码。

后来Agent能力越来越强，变成只要给它一个非常模糊的指令，它就能完成一个很大的项目。这时人和Agent的角色又发生了变化。

现在大致可以分成两类：人负责决策，Agent负责执行。人把决策说得越清楚，Agent就能做得越好。

基于这两个角色分类，我们来看Rubric应该怎么设计。如果Agent只是负责执行，而任务描述得很清楚，输出基本固定、具有唯一性，那么Rubric就是确定性的Rubric。打分时完全可以基于自己做出来的成品进行评判，因为通常会有Ground truth。

如果讨论未来数据的需求，人的决策部分会不会逐渐被Agent取代，我觉得这就会回到允中刚才说的情况：大家现在反而没有太重视这些Rubric，因为决策往往非常模糊，很难量化。

允中说，对于一个具体领域，比如猫可不可爱，可以训练一个Verifier。但对于一家上市公司、一个领导层的决策，应该如何训练Reward？它每天面对的任务都在变化，很难收集足够多的数据，训练出一个Reward model来替人做这样的决策。

所以我认为，这一部分的模型发展还有很长的路要走，也可能会成为未来的一个发展趋势。

何允中

我特别同意。比如ALE的方案，我觉得就是面向未来的。

如果是猫可不可爱，在Meta这样的公司里，可能还能通过用户行为反馈来训练模型。但公司的决策很难收集到足够数据。像ALE这样，让大家把过去做过的项目和决策提交上来，其实就是一种方案。

未来收集数据，可能要看大家如何找到好的激励方式，让人们愿意把重要的东西交出来，并且尽量能够回溯当时的关键决策。

Yiwen

非常有意思。我想再追溯一下评测近几年的发展，以及它和卖数据之间的关系。

我和两位私下都聊过，卖Benchmark和卖数据这两件事不能混为一谈。Scale AI之前推出了Humanity’s Last Exam，也就是HLE这个评测。允中能不能给我们讲一下这个评测，以及你觉得它和数据之间是怎样联系的？

何允中

从原理上说，评测体现的是模型距离理想状态还有多大的差距。它更多是一项科学研究，是一个基准：我希望模型达到什么状态，它现在还没有达到什么状态。

但这件事和卖数据联系起来也很有意思，因为很多时候，提升模型能力的数据，和榜单的评测方式息息相关。这里比较难的是找到平衡。

### 什么样的评测值得刷？核心能力与真实场景

如果我生产大量和榜单差不多的数据，就可能变成Bench-maxxing，也就是刷榜。但大模型训练仍然有各种维度。如果我想提升某一类能力，确实需要抓住某一个维度，所以数据和Benchmark肯定会有一定相关性，大家需要找到其中的平衡。

### 模型公司如何权衡内部评测、公开榜单与用户反馈

大家对AGI的期待很高，希望模型能做到人能做的事情。于是我们可以在各种领域构造Benchmark，发现模型距离理想状态还有差距。

通常，构造Benchmark的人对某个领域认识比较深，这自然会给他一定的卖数据权威性，大家会更相信他手上的数据，于是这个生意就产生了。

Yiwen

一铀，我相信ALE现在做得很火，应该有不少人想问你卖不卖数据，或者可能有VC想找你投资，结果它逐渐变成了一门生意。

孙一铀

我觉得这件事有好有坏。这个生态目前还在比较野蛮地发展，有多少人在做科学研究，有多少人在做Bench-maxxing，确实需要仔细权衡。

但这里面有很多利益驱动，所以现在是一个挺繁荣的市场。

这里我也想给大家敲个警钟。允中提到，现在做Benchmark的人会收到各种诱惑，被鼓励把Benchmark数据卖掉。我甚至私下听说，有些数据公司踩过这条红线，把自己正在用于评测的数据拿去卖。

这条线千万不能碰。不能让你的生意污染Benchmark的权威性，否则不仅会毁掉自己的Benchmark，也会毁掉其他人的模型。

我个人认为，Benchmark和卖数据在生态系统中的角色、地位都不一样。Benchmark面向的是未来，数据面向的是现在。

Benchmark面向未来，是希望模型公司去解决目前还没有解决的问题。我们在今年1月、2月做ALE的时候，特别担心Benchmark做得太难，导致它失去意义。

当时模型的平均分很多只有10%到20%，大部分题目甚至只能拿到0分。我很担心这样的评测没有意义。但事实证明，这个担心没有必要，因为Benchmark本来就应该面向未来的模型。

数据更多是在解决Benchmark产生的需求，也就是现在大家如何把这些东西做好。Bench-maxxing有好有坏，只要它没有直接污染Benchmark，而且刷的是有意义的榜单，并且这个Benchmark和真实用户体验非常接近，我觉得Bench-maxxing不一定是贬义词。

Yiwen

Bench-maxxing这件事确实很有意思。一方面，我们需要评测基准；另一方面，又不希望模型公司为了刷评测而刷评测。

所以很自然会产生一个问题：什么样的评测才是有意义的评测？

现在我们每周都能看到很多新的Benchmark。从模型公司的角度来说，他们应该如何选择？哪些评测值得去刷，或者应该把哪些评测作为下一步提升模型能力的目标？从供应商和研究者的角度，你们怎么看？

何允中

我觉得，做模型能力提升，最大的ROI还是应该放在能力本身。能力提升之后，应该惠及各个Benchmark。

当然，有些人可能有不同观点。对一些模型厂商来说，应用也非常重要。如果一个Benchmark比较贴近应用场景，他们就有动力把这个场景做好，这对他们也是有益的。

最有意义的事情是，大家至少口头上仍然是奔着AGI去的。所以应该考虑哪些核心认知能力需要提高，它们应该体现在Benchmark上，并且能够体现泛化性。

如果我做了一项改进，只有一个Benchmark涨分，其他都不涨，可能就有问题。回到一开始的问题，未必存在某一个最好的Benchmark，而是不同Benchmark测试了不同的东西。

我们可能要关注的是，哪些共同能力能够让多个Benchmark一起提升，而不是只优化同一个Benchmark。

当然，Benchmark本身也可以贴近具体场景。如果这些场景是大家在意的，它确实反映了用户体验，这也是好的Benchmark。它未必特别通用，也未必朝着AGI，但确实体现了大家的实际体验。

从这个角度看，Benchmark肯定会千奇百怪。总会有一个场景是大家关心的。

我觉得这里有两个要素。第一，这个场景中的差距，是不是体现了一个非常具体的能力缺陷。如果只是因为模型不懂某个场景知识，而这个场景又不重要，只是在一个犄角旮旯里解了一道很奇怪的智力题，然后做成Benchmark，那么这个能力提升未必代表模型本身的认知能力提升了，这可能就不是一个好的Benchmark。

第二，即使它不反映核心能力，至少也要反映一个大家在意的场景。比如现在特别火的personal assistant（个人智能助理），这是一个非常具体的场景，大家都希望拥有这样的东西。

这种Benchmark甚至未必只测模型本身，也可能测你的harness。它的目的可能不是为模型训练提供数据，而是告诉你harness错在哪里，之后可以做工程优化。

所以，贴近用户需求场景的Benchmark也是好的Benchmark。在我看来，一类是反映核心认知能力，另一类是贴合具体场景，当然两者都有是最好的。

孙一铀

我觉得现在大模型公司很看重的一件事，是Benchmark的分布。大家可能都听说过Artificial Analysis，他们做的事情很简单：给各家Benchmark设置不同权重，然后综合成一个分数。

但问题是，它所采用的权重是不是真的是大家需要的？这个权重应该以什么方式迭代？这些事情都很主观。大家质疑的可能不是模型本身，而是质疑榜单本身。

我现在倾向于认为，Benchmark还不够好，还没有做到大家心目中理想的Distribution（分布），很难达到一个Ground truth。

所以现在很强的模型厂商，比如Anthropic或者OpenAI，都会倾向于自建评测体系，让它更接近自己心目中的分布。第三方评测则可以让它们对外发布时更有说服力。

当然，允中说的垂直领域Benchmark肯定非常重要，因为它面向的是一类具体群体，它的分布就是这个群体每天需要做的事情。

如果金融或者法律领域的Benchmark能够把律师每天做的事情测扎实，那么相关公司可能只需要看这一个Benchmark就够了。

另一个问题是，有些Benchmark并不能代表真实认知。比如之前有一些Benchmark是测Agent智力的，就是玩那种小游戏，ARC Challenge（抽象推理挑战）那种游戏，像ARC-2、ARC-3这种。

它们的初衷是认为，能够解决这些游戏体现了人类智力。但后来发现，这种能力也可以被高度特化，一个小模型也能把它做出来。

Yiwen

有没有什么特别niche的Benchmark，大众可能不太了解，但其实非常有用，能够测试模型能力？

何允中

我可以举几个我们的例子。我们有些Benchmark不太经常出现在大家的榜单上，比如前一阵子做的Drug Discovery（药物发现），还有和AI tutor（AI辅导）相关的Benchmark。

它们关注的是比较小的垂直领域，但我们和各个实验室负责相关领域的团队交流时，通常都会发现，他们会有专人关注市场上和自己领域相关的评测，并把这些评测收集起来。

另外，一个Benchmark最后能不能上榜、火不火，也有很多随机因素。比如Artificial Analysis用过我们做的一个榜单，叫SWE-Atlas。

我们当时做了几种不同风格的SWE-Test，包括代码仓库问答、代码重构和写Test，只是分3个阶段推出。Q&A先推出了，但另外两个还没来得及推出并合并进去。

不知怎么回事，Q&A先被Artificial Analysis收录了。Q&A上榜之后，大家就开始刷这个东西，突然间这一块需求变得很大。

我们当时很不理解，因为Q&A是最简单的场景。我们花了很多心血做了更复杂的Benchmark，结果可能只是因为时间关系，或者某个实验室碰巧在这个Benchmark上分数比较高，它就先火了。

所以榜单上的东西，大家在技术报告里看到的内容，本身存在一定随机性。Artificial Analysis搜索、收录哪些榜单，也有随机性。

最后，还有一些你看不到的东西，背后可能也有人在使用。这个生态其实还比较深、比较复杂。

Yiwen

一铀，我还想问一下，你刚才提到大家对Artificial Analysis这类榜单的质疑，认为它不接近理想中的分布。这个分布现在有没有共识？

我的理解是，每个模型公司对于分布的需求其实也不一样。在这种情况下，我们应该如何理解理想状态下的分布？它应该更接近真实世界的任务，还是另一种分布？

孙一铀

我觉得真实分布本质上就是用户体验。假设世界上存在一个Ground truth，真实分布的真实打分，其实有点类似LMArena的模式。

假设每天给Agent一个Prompt时，可以让多个模型同时执行，然后给它们打分，这可能是最真实的评价。

但现实中，要做到这样的榜单，有几个困难。LMArena早期做得比较好，是因为当时的问答很快，开销也低。给它一个问题，几秒钟就能得到答案，很快就能进行打分。

但现在到了Agent时代，一个长程任务动辄需要几个小时。用户也没有那么多精力，每次执行一个任务都同时开启几个Agent，更没有一个机制把反馈收集起来。

所以现在很多评价都带有主观性，很难拿到真正的Ground truth。如果有哪家公司或者某种方式能够解决这个问题，那肯定会非常厉害。

我相信大模型公司内部肯定有类似机制：让几个版本的模型给真实用户使用，然后根据真实使用情况测试。但我的意思是，假设存在这样一个Distribution，如果评测分数的分布接近它，那就是一个很好的Benchmark。

何允中

我也听到过一些比较有意思的情况：很多评测Benchmark和线上A/B test测出来的结果并不一样。用户反馈和评测结果有时并不一致，甚至很难说哪一个更好。

因为用户有时候也比较主观。比如在聊天场景里，给用户很多factual（事实保真）的内容，和给用户很多Clickbait（点击诱饵）、说一些他们爱听的话，最后得到的反馈可能完全不一样。

孙一铀

是的。比如Claude Code，我觉得它在LMArena上分数一直遥遥领先，是因为它有一个特点：尤其对中文用户或者英文用户来说，它给出的Output format（输出格式）更贴近人们想看到的内容，也很容易理解。

相反，Codex可能执行得更细致，但输出的东西不那么容易被人理解，所以相对吃了一点亏。但从我的个人体验来看，它们两个可能不相上下，甚至我个人还更偏好OpenAI那边一点，因为它做得更细致，犯的错误更少。

所以，如何定义好的Distribution，确实是一件很主观的事情。

Yiwen

在这种情况下，模型公司还会把Benchmark视为判断自身模型能力的标准吗？

何允中

它们肯定也在乎外部评价。不过不同模型公司的策略不一样。先说美国几家大的公司，它们肯定倾向于自建评测体系，因为自家的evaluation团队有能力建立这些体系。

但对于刚成立的、相对没有那么有名的frontier lab（前沿实验室），或者不是头部的frontier lab，它们肯定会非常依赖外部评测。因为内部评测团队可能没有那么有经验，体系也不够完善，或者它们更希望把人力投入模型训练和开发，而不是投入评测。

所以每家公司的策略都不一样。

我的个人判断是，当产品逐渐成熟，或者积累了一定规模的用户之后，最终关心的还是用户增长。我之前在Meta做了很多年搜索和推荐，后来逐渐变成类似搜索推荐的问题：你看什么指标，和用户增长最相关？最后就朝着赚钱的方向走。

现在真正能够评测这些能力的实验室还不多，需要一定的用户规模。在聊天场景里，这件事可能已经比较成熟了，但在Agent场景里，要做到同样程度就复杂得多。

大模型和传统搜索、推荐不太一样的地方，是它的场景很复杂。即使能在聊天场景里做好A/B test，甚至训练Reward model让模型朝着用户喜欢的方向发展，也总会有新的东西出现。

现在大家一直在关注新的方向，比如科学发现。但我不可能有足够多的科学家，给出显著的A/B test结果，还是必须依靠场景和Benchmark。

我会说，是因为大家对应用场景的期待太高了，而场景增长的速度赶不上用户在这些领域沉淀的速度。所以现在仍然有大量需求要依靠Benchmark来评价。

但在某些领域沉淀下来之后，大家会有更多线上评测体系，可能会像传统互联网增长那样，寻找哪些指标和DAU（日活跃用户）增长最相关。

Yiwen

能不能深入讲一下数据采购？这里有几个点非常有意思。

第一，你刚才提到很多小公司，这其实是现在的创业机会。这也是为什么我们看到，最近兴起的很多四五个人、甚至两三个人的数据创业公司，拿到了非常高的估值。

这是不是因为它们的目标，就是这些非常垂直领域的数据？

何允中

这里可能有几类问题。首先，最近兴起的RL environment公司，更多其实是在做合成。

整个数据行业已经从找人标注，慢慢过渡到交付一整套环境，而这个环境可能需要大量工程工作。很多小团队在合成技术栈上做得比较好，就可以在比较短的时间内交付大量合成环境。

这未必是不好的。合成数据有时候可以基于强模型，或者基于一些半成品artifact（产物），做出很好的东西。现在这是一块增长点。

再往下看，比较有意思的是，这件事之所以能够成立，是因为大家今年的主题在卷代码。软件行业很特殊，它非常开放，有大量公开资料，而且生产数据的公司同时也都懂代码，所以这件事比较容易解决。

这给小团队创造了很多机会，让它们可以自己造出大量数据。

但再往后，比如其他垂直领域，就会复杂得多。我看到有些公司可能在解决两个不同的问题。

以我们做后训练数据为例，我觉得它其实包含两个问题：第一是采购，也就是把原材料买回来；第二是加工，比如把它标注，或者通过Agent pipeline把它做成适合大模型训练的环境。

在垂直行业里，采购会变得越来越复杂。甚至在代码领域，如何采购私有代码仓库，谁能把这个问题解决好，谁就有巨大的优势。

再比如芯片设计，可能需要把整个芯片设计环境造出来，其中涉及商业软件。怎样取得这些商业软件的版权，并把它们包进环境里，就是一个问题。

又比如DevOps（开发运维），如果我是系统工程师，需要操作AWS之类的平台，我听说有公司做了一整套AWS模拟器。

每个垂直领域都有很深的东西。你可能需要采购，也可能需要定制软件。大家只要抓住一两个垂直领域，把它做好，其实就创造了很多新的机会。

Yiwen

我们刚才提到，在Drug Discovery、生物医药以及其他具体行业的评测里，可能没有足够多的场景，也没有足够好的评测。在这种情况下，我们有足够好的数据吗？

何允中

这里有一个难点。每个领域都需要有人把专业知识讲出来，但除此之外，还需要这个领域本身的资料。

比如药物发现，可能需要很多私有数据库。所以我觉得这是目前行业的一个大卡点：首先你得把这些东西买到，知道大家手上有什么，才能把它做成Benchmark。

孙一铀

ALE很大程度上就是在解决这个问题。我们希望通过众包的方式，让专家把自己以前做过的项目提交上来。

当然，其中有些不符合规范的内容我们会筛掉。有人甚至提交了非常离谱的东西，比如法院证据之类的，我们尽量都筛掉了。

我们在V2中也尝试收集一些数据，比如Steam上的游戏库，或者游戏开发任务。某个名不见经传、玩家大概只有几千人的MOBA（多人在线战术竞技）类游戏，它的源码要价能到两三百万元人民币一条。我觉得哪家数据公司或者别人做Benchmark，都没有这个财力去做这个事情，就是这个游戏公司会要价要到两三百万。

Yiwen

一条源码？

孙一铀

对，就这个游戏的源码。很多公司想要采集游戏视频，然后做标注，但游戏视频本身可能就是版权数据，这里有巨大的采购问题。

我觉得这就是一个商业机会。现在已经有不少创业公司在解决这些问题，大型数商自己也在投入采购工作。但总体来说，这里面还有巨大的问题没有解决。

Yiwen

现在有哪些比较热门、但数据非常少的垂直领域？

何允中

至少医疗算一个，只是医疗数据比较敏感。谁能拿到大量病例数据，谁就会非常有优势。

Yiwen

确实有很多新闻提到，在法律、金融等领域，可能有一些离职员工会分享他们过去的工作流。但工作流数据和医疗领域的病人数据，可能还是不太一样。

何允中

是的。各个领域之所以经常被提到金融、医疗，是因为它们和大家比较息息相关，大家多少还懂一点。

其实世界上还有很多行业是我们完全不了解的，真的要和从业者聊过才知道。比如我最近才知道，药物研发领域还会交易分子，一个分子甚至可以倒腾几轮，其中还要做DD（Due Diligence，尽职调查）。

孙一铀

可能只是因为大家不知道，所以还没有做。

我们在做ALE V2、希望把某一个领域做深时，会先梳理这个领域有哪些工作流，做出一棵树状结构。尤其在生物学领域，我们会参考Nature的分类和子学科分类。

把这棵树展开到第3级，大概有3000个节点。我们也统计了市面上已有的生命科学和生物学Benchmark覆盖了多少，大概只有10%，甚至不到5%。

也就是说，市场上可能连一个成型、覆盖面完整的Benchmark都没有，更不用说针对它去做相应的数据。

Yiwen

我们刚才提到的这些合成数据小公司，它们能赚钱的周期有多长？听起来，它们都是最近几年才出现的公司，那这些数据的生命周期有多长？

何允中

这是个好问题。至少现在需求还挺大，未来很难说。

比如这一波coding卷完了，大家需要新的品类。你能不能抓住下一个机会？而且下一个机会可能和你现在的运行模式不一样。

我自己觉得，采购能力会变得很重要。采购能力差的公司可能就比较难。或者像一铀他们一样，找到新的激励机制，让大家把东西交进来。

以前的激励机制可能是招聘平台，或者给你一个小时工。以后可能出现新的激励机制，谁能把这些东西玩转，谁就会继续有优势。

Yiwen

我想问一下允中的看法。随着模型能力越来越强，模型公司自己内部创造数据的能力也越来越强。

数据行业的饼确实在变大，但有没有可能出现这样的情况：面向非头部公司的机会，门槛反而越来越高，入场券越来越难拿？

比如数学领域，过去只需要影印奥数课本，就能批量造出大量数据。但这些数据现在基本已经没有价值了。你怎么看未来数据公司的发展方向？

何允中

从第一性原则来说，还有巨量的问题没有解决。这个世界上还有多少东西没有被蒸馏干净？机会仍然巨大。

但如果只看现在的运行方式，事情当然会越来越难，因为越来越多玩家进来了。如果大家只盯着手上的工作，这件事一定会越来越难做。

即使实验室不自己做，越来越多竞争对手进来之后，利润率也会越来越低。所以在我看来，一个好的数商最后解决的其实是研发问题。

这就像软件公司一样：我要提前投入研发未来大家需要的东西，赚到钱之后再投入下一个东西。

我有一个比较激进的观点：实验室未必具备解决数据问题的最好基因。

比如合成数据，按理说很多合成数据本来就是实验室研究工作的组成部分，尤其是做后训练的人，大部分时间都花在数据上：买数据、核数据、验证数据、清洗数据。

但为什么外部公司仍然有机会？因为今年这一波增长，来自一些懂行的人在外部把数据合成出来，再卖回给模型公司。

这件事之所以存在，一方面是因为大模型公司现在有太多钱，自己造和从外部买并不矛盾。但更长远地看，有些问题可能不是模型公司最适合解决的。

比如采购。如果我要把某个行业的东西先采购回来，再蒸馏出来，这时大型实验室未必有优势，甚至可能存在利益冲突。

假设一方面把FDE（前线部署工程师）派到企业里，另一方面又有一拨人在收集这个企业的数据，那企业可能就不太放心把数据交给你。

出于这些原因，有些事情可能不适合由实验室自己做，仍然需要第三方帮助采购，或者深入某些行业。

我觉得一个数商真正要做的事情，是做研发：研究未来哪些行业重要，哪些东西值得投入，把资料买回来，自己先投入R&D（研发），把这个行业的问题研究清楚，然后做成Benchmark或者数据，甚至证明它的有效性，最后再卖给实验室。

对实验室来说，Deadline都很紧。如果我是实验室的研究员，让我花半年时间解决一个行业，有时没有这样的自由度。但如果这时候有一家数商说，我已经把这个行业研究清楚了，你要不要，大家通常都会看一眼。

所以长期来说，拼的还是研发能力。

Yiwen

你觉得这个趋势对大模型公司来说会持续吗？现在模型公司内部也有自己的数据团队，但你觉得它们会更愿意从第三方收数据，而不是自己造环境、造数据吗？

何允中

这两件事并不矛盾。模型公司最高的优先级还是把东西做好。如果自己能生产高质量数据，可能会倾向于自己生产。

但从大方向来看，世界上还有太多工作流没有被研究清楚，所以对外部数商的依赖会长期存在。一个大模型实验室可能也不愿意投入那么多资源，把事情做得这么重，而是希望更加灵活。

缺点是，大家又希望更多能力是第一方的，不希望所有人都能从数商那里获得。所以从这个角度看，模型公司也有自己研发的动机。

比如现在很多实验室在做Expert matching（专家匹配），也就是把人派到实验室来。这也是一个趋势。

我自己也觉得，现在还有太多问题没有解决。不管是谁解决了这些问题，都有赚钱的机会。这个问题发生在哪里，其实不是特别重要。现在是机会很多、饼越来越大的阶段。

Yiwen

但数据行业一直有一个问题：如果第三方供应商把同样的数据卖给不同的模型公司，中间要怎么样区分？

何允中

通常有一个比较简单的解决方案，就是花更多钱把数据买断。

Yiwen

在数据供应商收到大量数据的情况下，模型公司会怎样使用这些数据？这个流程能不能讲一下？

何允中

这里通常有比较固定的训练方式，我们把它叫Training recipe（训练配方）。

比如比较简单的数据，可以直接做SFT（监督微调），把正确答案给模型就行。像Rubric这种数据，可能会用来做强化学习，因为需要模型不断尝试，再由另一个模型打分。

比较有意思的是现在的RL环境。比如最近大家在做特别长程的任务，今年的一个主题是RSI，也就是recursive self-improvement（递归自我改进）。它其实是一个buzzword（热词），意思是AI自己研发自己。

大家最近开始研究一些可能一次运行几天、甚至一个星期的任务，其中可能需要一张GPU，让模型在上面训练模型。

这种情况下，训练方式开始变得模糊。我们也在一起研究应该怎么做，现在还没有太多共识，所以仍然有很多有意思的空间。

对数商来说，有时也不只是简单地造一个模拟任务，还要考虑模型公司拿到之后准备怎么训练。针对它的训练方式，可能还需要进行定制。

Yiwen

这一点我也很好奇。如果只是为了Bench-maxxing，拿ALE的一些任务直接训练，做一批类似数据，怎么保证训练之后模型的能力和泛化能力能够提升，并迁移到其他任务上？

有没有比较系统、科学的方法，验证一批数据能给模型带来怎样的提升？又如何在不真正训练一个模型的情况下，判断这些数据能带来什么效果？

何允中

这里其实有一些技术。比如现在如果要造一个环境，大家最怕的就是Reward hacking（奖励作弊）。

也就是任务明明没有完成，模型却通过某些手段获得高分。这样训练出来的模型肯定会变成一个耍滑头的模型，这种情况当然不希望发生。

通常可以用Agent做red team（对抗性测试），再让一些比较强的模型试试看，能不能在任务里找到捷径。

下面有些是我的个人猜想，不代表Scale AI或者任何客户。训练这些东西时，很多Benchmark可能只关心最后有没有完成任务，验证器也是围绕这一点设计的。

但模型是怎样完成任务的，这件事在训练中可能也很关键。一个比较简单的例子是budget（预算）。

训练模型时，可能要关心它是不是消耗了过多token，或者用了过多步骤。拿ALE的任务数据训练时，最后的Reward肯定会很复杂，不是说把任务解出来就够了，还要关注它消耗了多少资源。

最后可能要从各种维度检查Reward，防止模型作弊。只有这些东西结合起来，才能完成一个训练recipe。

所以，训练数据要考虑的问题可能更多：这些数据能不能导出一个比较好的训练方式？

Yiwen

像RSI，或者刚才提到的很多新实验室，在这种情况下，它们训练所需要的数据有什么不一样？需要的定制又有什么不一样？

何允中

最常见的定制其实是难度。大家做Benchmark时，一般希望它不要太快饱和，似乎越难越好。

但也不一定。正如一铀说的，不能完全解不出来。Benchmark的难度，更多应该客观反映这个行业的难度。

但训练模型时，难度需要特化，必须适合这个模型。我们有时候会做这样的事情：模型厂商把还没有发布的模型给我们，然后我们帮它筛数据。

题目对模型来说不能太难，也不能太简单。现在做强化学习，是让模型自己不断尝试，答对了就能学到东西。如果题目太难，模型什么都做不出来，肯定不行。

所以首先要做难度适配。其次可能要做轨迹采集。如果模型厂商把模型轨迹给我们，我们可以把轨迹采集出来，帮它筛选，甚至想办法让人类生成能够解决这些问题的轨迹。

这样，模型厂商拿回去之后，不一定要做强化学习，也可以直接根据这些轨迹做SFT。针对训练需求，确实会有一些定制工作。

Yiwen

接下来还想聊一下数据污染。因为今年2月，OpenAI宣布停止报告它在SWE-bench Verified上的分数。

这是一套让AI修复真实开源软件项目问题，再通过测试判断它有没有修好的评测。当时OpenAI主要指出了两类问题。

一类是测试本身可能存在缺陷，比如有些功能的正确解法也会被判错。另一类是数据污染：在特定提示下，模型能够复现部分题目原本的人类修复代码，也就是说，模型可能在训练过程中已经接触过相关内容。

所以这个分数就变得有些难以解释。两位是怎么理解数据污染问题的？SWE-bench这一类数据，问题到底在哪里？

何允中

SWE-bench这类数据其实有一个问题，它甚至不一定是污染，也可能是任务本身做得不够好。

比如有时存在“假错误”：测试脚本要求太多，或者任务描述不清楚，都可能导致这种情况。

另一种污染是模型在预训练时已经把相关内容训练进去了。这里其实有一些技术可以检测。

一铀在ALE上应该也有类似经验。OpenAI停止采用的可能不只是SWE-bench，而是连SWE-bench Verified也不再采用。

我印象中，过去6个月里，它的分数只从74%提升到80%。剩下的问题可能是脚本写得太严苛，题目本身不可解，或者存在其他各种问题。

如果剩下的20%都集中在这些问题上，那这个Benchmark本身可能就失去了比较意义。

孙一铀

ALE也没有完全解决一个问题，这正好可以和允中讨论：当专家提交上来的材料本身是错的，应该如何预防？

这件事确实发生过。我们的专家背景非常多样，当然这样的人很少，但有人为了提交任务、获得作者署名而提交内容。

我们的奖励机制是，只要你提交的任务被接纳，就可以成为作者列表的一部分。确实有人为了提交而提交，甚至调用Agent合成一堆乱七八糟的数据。

有些数据提交上来，我一眼就能看出来是编的。这确实给我们的工作造成了很大困扰。

何允中

Scale AI总是可以靠人解决问题。但这里有一个特别有意思的问题：一铀提到，给作者署名权是一种奖励机制；在Scale AI，更原始的机制可能是给小时工。

无论是哪种方式，大家都可能找到偷懒、作弊的方法。所以我觉得，奖励机制是一个特别困难的问题。

长远来说，我们的目标是把人类知识尽可能蒸馏出来。怎样设计一个好的奖励机制，让大家的目标对齐，我觉得这里面有非常大的空间，也可能是一个巨大的Research area（研究领域）。

我自己心里有一些方案，比如Proof of work（工作量证明）。可以要求提交者把完成任务的整段工作流程都录下来，达到一定时长，或者完成规定数量的步骤。

不同形式的问题，需要不同形式的奖励和验证机制，这里面其实有很多玩法值得探索。

Yiwen

这里还涉及一个更大的问题：很多数据本来就是公开数据，比如网上的资料、公开代码。这些数据是不是注定会被污染？一般会怎样处理？

何允中

最简单的公开数据污染，其实直接问Agent就能找到。公开数据相对还好检测。

我觉得最难的是编造数据。比如让模型做一个化学模拟，但它根本没有真正跑过这个任务，只是自己编了一套似是而非的东西。

这种问题如果没有几个月时间，根本查不出来，因为它看上去非常真实。

什么时候能发现？可能要等到所有Agent的能力都远超这个问题本身，大家发现不同Agent做出来的答案都很相似，但和真实答案不一致，这时候才会发现问题。

但这个周期会非常长。再找一个专家验证，成本又非常高，因为这个问题本身可能就需要专家花一两周才能完成。

孙一铀

而且验证专家本身也可能为了某些东西偷懒，直接说这个东西是对的。

Yiwen

所以只要涉及专家评测，都会有这个问题吗？

何允中

都会有。众包Benchmark难做，难就难在这里。人性非常复杂。

孙一铀

我觉得验证机制可能只是其中一环。奖励机制也很重要。

比如，不只是让专家老老实实做12个小时，而是要求他把每一步都交出来。即使他想合成假数据，也必须完成规定数量的动作，这样他可能就没有那么强的动机去造假。

这些都是很值得研究的方向。

Yiwen

我本来想问真实工作流数据，但听下来，大家现在还是在卷coding数据，并不是在做真正的workflow，对吗？

因为我理解，像Mercor这样的公司已经在卖真实工作流数据，但听起来coding现在仍然是最卷的赛道。

何允中

这取决于你怎么定义真实工作流数据。真实工作流本质上都可以被归结为某种coding问题。

比如3D建模，FreeCAD之类的软件都提供了现成API，让你去完成任务。这不是传统意义上的coding，不是写一段代码去解决LeetCode题目，而是用coding解决真实workflow。

只要有足够的MCP和API调用，95%以上的任务其实都可以归结到coding问题上。

孙一铀

也可以根据task本身，看它需要完成什么、涉及哪些环节，再把它归结到不同领域的工作流。

但我同意允中的说法。现在让Agent做事情，代码就是它的手和脚，所以归根结底，coding肯定是其中一环。

Yiwen

在私有数据需求依然很大的情况下，未来数据公司会不会从卷采购本身，变成卷并购，也就是收购垂直领域的公司？

何允中

这件事不评论Scale AI。我听说现在有一块很大的Private equity business（PE业务）。

以前大家收购公司，常见的方式是把公司flip掉。现在有一种新的方式：买下一家公司，用AI让它提效、裁掉一部分人，把公司的价值做上去，再卖掉。

现在又多了一层：除了可以重组公司、用AI提效，还能把公司的数据挖掘出来，数据本身也可以卖钱。

于是，传统收购行业多了一种玩法。数商和传统做Private equity（私募股权）的公司，也都开始看数据如何变现，逐渐兴起了一个新的领域。

如果未来5年、10年，行业还以这样的速度发展，没有遇到瓶颈，把各个行业的数据都拿出来，可能会和大模型本身一起，成为世界上最大的两个行业。

当然，这是一个比较极端的AI doomist view（AI末日论观点），但确实可能推导出这样的世界。

Yiwen

听起来，数据行业本身也在非常快地变化。从Rubric data发展到RL环境，就是一个明显例子。

什么信号会让你觉得，某个领域或者某个赛道可以持续增长？

何允中

### 训练数据不是越难越好：为不同模型匹配难度与解题轨迹

首先，还有很多问题没有解决，机会仍然很多。另一方面，越来越多玩家进来了，比如每年都有很多新的Neo Lab。

如果资本市场还按照现在的方式运作，整个饼会越来越大。但数据变化很快，它不像是一门可以躺在一个地方、一直吃老本的生意。

数商需要疯狂迭代自己，最后可能拼的是R&D能力，或者谁能把R&D能力本身固化，做成一个flywheel（飞轮）。

如果我有一条流水线，可以不断发掘新的东西，也许这就是未来最大的优势。

总体来说，现在是百花齐放的阶段，未来机会还很多。

Yiwen

我也听到过一些说法，数商的估值空间通常没有传统公司那么大，因为它很难保持杠杆，也很难让公司在积累一定用户之后，用比较轻的方式躺在那里赚钱。

不像Facebook、Google这样的公司，积累了大量用户之后，就可以依靠现有产品持续获得收入。数字生意的领导者必须不断思考下一步在哪里，持续迭代，因为模型迭代速度太快了。

一铀，你们现在做ALE 2.0时，最难的是什么？

孙一铀

我觉得学术上相对容易一些，商业上可能更难。Scale AI在商业上面对的困难，我可以想象得到。

他们给我们的数据，很多都是无偿提供的。但如果是一家数商，要把这些数据收上来，可能都是天文数字。那些原始项目和代码，不但价格非常高，而且很难找到一个好的奖励机制，让专家自愿提交。

我按照Mercor官网给专家的小时价格来算，制造业工程师大概是一两百美元一个小时。这个价格决定了，它不可能招到特别高级的工程师。

但学术界之所以更容易，是因为我们可以自然吸引一些这个级别的人来收集数据。他们不一定是为了钱，而是希望大家一起把事情做好，或者看重作者署名。

所以奖励制度不一样，能吸引到的人就不一样，上游也不一样。

Yiwen

好，我们就到这里结束吧。谢谢允中，谢谢一铀参加我们的节目。

何允中

谢谢Yiwen。

孙一铀

谢谢。

Yiwen

以上就是我们这期播客的全部内容了。国内的听众可以通过小宇宙、苹果播客、网易云音乐、喜马拉雅、QQ音乐、蜻蜓FM、荔枝FM来关注我们。海外的听众可以通过苹果播客和Spotify，或者在YouTube上搜索《硅谷101》播客来关注我们。我们部分的文字稿还会收录在《硅谷101》的微信公众号上。谢谢大家，我们下次再见。
