[BidClub_]
42章经 · · 47 min

一个人、两周、数百美元,如何训出登顶 Hugging Face 的模型 | 对谈研究员逯雨鑫

曲凯逯雨鑫

Podcast
TL;DR
  • 一张5090、总计几百美元、两三周,逯雨鑫把一个 Llama 4 2B 微调项目在 agentic 的 TAU-bench 上从约15分推到55-60分。 节目开场曲凯另称,逯此前做过一个基于 Gemma 和 Fable 微调的模型,曾登上 Hugging Face 开源模型排名第一。逯的配方是 QLoRA、200美元 Claude Max 订阅合成靶向数据、实训十几个小时;硬件成本“绝对不会超过一百美元”。V1五天、V2两三周,而他并非 PhD,“最基础的东西是我自学的”。
  • 95%的时间花在数据上,这才是他认为真正的难点。 合成数据“目前还是非常差”,主要用于靶向处理问题(如小模型“过度自信”、没完成却宣布完成);真实数据应占60%-70%,5000条数据可能要亲自审核500条,最终真实用到的是几千条量级。“真正的问题是对数据的洞察力。”
  • 对个人和很多应用公司,SFT是最实际的工业级路径;逯认为RL效果不如SFT。 他用几台8卡H200做过大量实验,称 on-policy distillation 最强,off-policy 和 RL 更多是锦上添花;好蒸馏的标准是锚点与目标一致,“benchmark只是一个考试”。另须警惕 capacity gap:Phi-4 的真实数据规模据他判断在3T以上,蒸馏到小模型时,老师太强、学生太弱,有些能力“你就学不到”。
  • 成本已低到中大型应用公司可以组建小团队自训模型:小模型几千到一万元人民币以内,大模型十几万到二十万元以内,一台H200几万元可支撑十几个员工使用。 训练正在商品化:海外已有一家叫 Ans Off 的一站式微调产品,Hugging Face Jobs也在做类似事情;逯预计显卡供应改善后,成本会像手机流量一样走向更便宜、甚至不限量。
  • 两人的反转叙事:应用公司可能成为 next new lab。 AI Lab往更高层的 research 和预训练发展(预训练可能需要128到264张B300、持续数月),后训练则可能让渡给拥有第一手数据的应用公司;曲凯自陈几周前对应用公司偏悲观,现在认为“模型的价值慢慢往应用公司让渡”,而 AI lab 买数据有点像字节早期买用户——“一开始反而是最低的时候”。
  • 最大尾部风险是开源断供:逯举例说 Qwen 3.7 没发布任何小模型,并担心如果继续不发布,应用公司可能只能自己做后训练,“直接把路堵死了”。 所以想做 AI“不如从现在就开始”。逯仍加入 AI Lab,理由是“肯定还是会有 AI Lab 是赢家的”;曲凯则认为只要有竞争,未来相当长一段时间应该仍会有开源。
  • Local AI是逯判断的“大趋势”,但现场也承认它目前并非人人需要。 驱动力包括拒答、成本与隐私:cybersecurity、生物 research 等领域的用户反馈称 Phi-4 经常拒答;逯自己 local AI 使用率“目前来说并不高”。他提到苹果可能在2027、2028年推出2T统一内存电脑,未来手机或电脑若能运行令人满意的本地模型,用户可能因隐私和成本选择 local AI;曲凯的 pushback 更冷静:“最后肯定还是豆包的用户更多”,隐私更可能由应用公司推动,而非用户主动选择。
Digest · the substance, structured for research

1. 非典型背景也能做微调:训模型的门槛被系统性高估

  • 逯雨鑫的路径:data engineer出身,因 GPT 在2022至2023年首次对外开放而开始使用,后来读 AI 方向研究生,靠个人项目走红后才加入 AI lab。“最基础的东西是我自学的……研究生更能提供的是一种方向,只要方向走对了,自学是完全可以的。”
  • 他的分层框架:AI分学术级与工业级,工业界常见的两条路是 SFT 与 RL;“只要把基础补好,每个人慢慢都可以做到”。从 MLP 学起这类基础知识,“对于大部分人来讲没有必要”。
  • 曲凯确认这不是大家已经普遍在做而只是外界不了解;逯的回答是,大家确实都没做,主要因为把事情想得过于复杂。

2. 项目账本:几百美元、两三周、TAU-bench从15分到55-60分

  • 节目开场曲凯称,逯此前做过一个基于 Gemma 和 Fable 微调的模型,曾在 Hugging Face 开源模型排名中排到第一。本期详细讲述的个人项目,则由逯明确说是 Llama 4 2B 微调。选型部分他又提到 Llama 4 在“12B模型”的情况下中文很差,因此不能把本期项目改写成12B模型。
  • 配置:一张5090加 QLoRA,200美元 Claude Max 订阅用于合成靶向数据;租用5090据他估计约一至两美元一小时,真实训练十几个小时,硬件成本“绝对不会超过一百美元”。V1用时五天,V2用时两三周;V2还吸收了 Hugging Face 粉丝或社区用户提供的 Phi-4 珍贵 real trace 数据。
  • 结果:在 agentic 领域对标 TAU-bench 时,原版约15分,提升到55-60分;但其他 benchmark 或多或少会下降,只能针对特定领域提升。曲凯将其概括为:用更强的 teacher 生成数据,再通过 SFT 蒸馏出特定领域的小模型,使其在该领域超过原模型,逯对此表示认可。

3. 全流程:明确目标、选底座、做数据、选方法、反复迭代

  • 逯的流程是先明确目标,围绕 business 而不是追逐热度;再选底座模型。关于 Llama 4,他称自己遇到的一个主要问题是中文能力差,尤其提到“12B模型”时大部分时间都在说粤语;中文方向可考虑 Qwen。
  • 数据管线可以自己扮演用户让 AI 生成,也可以用双模型合成,例如让 GPT-5.6 扮演用户、另一个模型作为实际使用的模型;也可以从 Hugging Face、ModelScope 等平台取得公开数据。
  • 工业界常见方法包括 SFT 与 RL。他的个人项目最后选择 SFT,认为 RL“被吹得很神”,但实际效果不如 SFT;OPD 等其他方法对个人和很多应用公司来说成本较高。
  • 训练脚本、公开数据和 benchmark 基本都有开源版本,可以下载后配合 agent 改成自己的版本。他的个人项目全部使用 Claude 完成;他不喜欢 Codex,认为 GPT 更适合执行和写代码,不太适合规划。

4. 95%的时间在做数据:合成数据只能“靶向治病”

  • 逯的核心经验是,自己95%的时间都花在数据上;真正的难点是“对数据的洞察力”,也是他认为当前 AI 各领域最大的卡点。V1约3天做数据、1天训练;V2两周中约12天做数据。
  • 合成数据质量目前并不好,主要适合靶向处理问题。Llama 4 2B 的一个问题是“过度自信”:跑 TAU-bench 时明明没有完成,却宣布“我完成了”。公开数据和普通真实使用不容易找到这种专门样本,只能通过合成数据做针对性处理。
  • 大部分数据最好来自真实使用,包括自己使用模型的过程,以及公开的 Phi-4 真实使用数据;真实数据约占60%-70%。
  • 人工审核不可省:5000条数据可能需要亲自审核500条。只告诉 AI“帮我做解决过度自信的数据”,生成结果可能“完全不对”,必须不断指出问题、确认目标、重新生成。最多可以做出接近1万条数据,但剔除后实际使用通常是几千条量级。

5. Capacity gap与“好蒸馏”的定义:锚点必须和目标一致

  • 仅看数据往往无法判断训练后的效果,必须一版一版测试。即使数据经过 AI 校对、自己也采样看过,训练后仍可能没有提升,这可能涉及 capacity gap——老师太强、学生太弱。
  • 逯举例说,Phi-4 的真实数据规模“应该是在3T以上”;将这些真实轨迹和作答蒸馏到12B小模型时,能力差距很大,有些内容学生学不到。
  • 他用几台8卡H200做过大量实验,明确表示 on-policy distillation 最强;off-policy 与 RL 更多是锦上添花,而不是用来真正解决问题。SFT以及靶向数据、公开优质数据等,则是他认为实用的蒸馏方式。
  • 好坏蒸馏的判据不在名目,而在锚点是否与目标一致:如果目标是安全边界,却把 benchmark 当锚点,就是坏蒸馏;只要真正把模型分布拉向目标,即使出现 bug 或掉分,也可以是好蒸馏。对很多应用公司来说,benchmark只是一次考试,真实使用比单纯锚定 benchmark 更重要。他的项目锚定 agentic 和 coding,因此获得了较多下载和使用。

6. 成本账与避坑:Qwen的坑最少

  • 逯估计,应用公司训练自己想要的小模型,成本可以控制在几千到一万元人民币以内;大模型可能需要十几万到二十万元以内。Serving 端另有 SGLang、vLLM 等架构问题;如果只是几路或十几路并发,一台几万元人民币的 H200 基本可以满足十几个员工使用。
  • 选型上,他认为 Qwen 的坑最少,训练、infra、脚本和部署都是小模型中较好的选择;Llama 4,以及一款他记得好像叫 Muse 的30B模型,架构不够主流,训练会更复杂。
  • 心态上最重要的是别放弃;不要过度相信 AI,及时查询资料,并参考真实成功案例。

7. 训模型正在商品化

  • 曲凯追问为什么还没有一整套 pipeline 的一站式服务。逯说,除 RSI 以外,几乎所有公司都在考虑这一方向;海外已有一家叫 Ans Off 的公司做出了选择模型、上传数据、直接微调的产品,在 Hugging Face 上也较知名,但价格较贵。
  • Hugging Face 还提供过 Hugging Face Jobs,专门做这类事情;国内外厂商也都在推进把训练变成商品,只是 infra、尤其 serving 端仍有难点。
  • 逯认为中大型公司组建三四人的小团队即可完成相关工作。当前显卡、内存和 RAM 价格较高且供应短缺;他预计供应上来后,成本可能像手机流量一样,从早期的30元人民币逐步走向更便宜、甚至不限量。

8. 反转叙事:应用公司可能成为 new lab,AI Lab往更高层走

  • 曲凯列举了主权 AI、数据标注公司 Mokao、Harvey、Fireworks 等迹象,并提到美国红杉关于 AI 应用公司成为 new lab 的文章。逯判断 AI lab 的数量或价值分工会变化:小型应用公司前期可以由 AI lab 承接,等应用达到几百万或几千万用户后再建立自己的 AI 团队。
  • 曲凯用推荐算法时代作类比:最终拥有应用、场景、商业闭环和用户数据的公司会产生更强的算法能力,而不是由一家第三方中立公司单独提供推荐算法。他自陈几周前对应用公司偏悲观,现在认为 AI lab 与应用公司价值会同步上升,未来模型价值可能逐渐向应用公司让渡。
  • 逯设想的反转是:真正存活的 AI lab 往 research、前沿开发和预训练发展,应用公司接管后训练并保有自己的模型,因为它们不愿分享自己的数据。预训练仍主要由 AI lab 负责,可能需要128到264张 B300、持续数月;在他看来,Kimi、智谱的最大价值就是预训练。

9. 数据像早期买量:他为何仍加入lab,以及开源断供风险

  • 曲凯认为 AI lab 花钱买数据,类似字节早期花钱买用户;逯认同真实使用轨迹很有价值:比如用户用 GPT-5.6 写播客稿或修改内容,AI真正解决问题的过程本身就是有价值的数据。
  • 有些公司提供模型免费使用时,逯认为它们可能需要部署很多 B300,租用或购买成本可能达到几十万、几百万元;免费服务既是宣传,也是在收集真实数据以迭代下一代模型。
  • 他仍选择加入 AI lab,是因为相信“肯定还是会有 AI Lab 是赢家的”,并希望加入一家有机会往 research、RSI、high research level 和预训练方向发展的公司。
  • 他最大的远虑是,如果 AI lab 不再开源,对应用公司可能是“比较毁灭性的打击”。他举例说 Qwen 3.7 没有发布任何小模型,并警告如果不发布,应用公司可能只能自己做后训练,“直接把路堵死了”,因此应用公司应从现在开始迭代自己的模型。曲凯则认为,至少未来相当长一段时间,只要存在竞争,应该仍会有开源。

10. Local AI之辩:拒答与成本是真驱动,隐私可能由公司推动

  • 逯判断 local AI“一定会”发展,并称 API 调用时数据可能被上游看到;他还批评部分中转站处在灰色地带、可能出售数据,并提到身边有黑客威胁数据泄露的案例。随着英伟达及国产芯片发展,他认为每个人最终都可能拥有自己的 local AI。
  • 他提到一则预测:苹果可能在2027或2028年推出2T统一内存电脑,2T内存或可运行当时的 GPT-5.2;未来若手机能够运行令人满意的27B模型,用户可能直接使用本地模型,不再调用上游 API。
  • 陈皮追问本地模型与 SOTA 的差距。逯承认自己 local AI 使用率“目前来说并不高”,但 cybersecurity 和生物 research 领域收到的反馈很多,因为 Phi-4 在这些领域经常拒答,只能考虑本地部署的中等水平模型。他还称,Hugging Face 被 OpenAI 攻击后,最终用中国国产模型并本地部署解决问题;这些均是逯在节目中的说法。
  • 小说辅助也是一个成本场景:写一版小说可能花费几千甚至几万元人民币,用 local AI 辅助后成本会低很多。曲凯则认为,用户未必主动关心隐私,最后可能还是豆包用户更多;local AI 更可能由苹果等应用公司推动,而不是用户个人主动选择。逯表示认同,并总结说只要方便、能解决问题即可。
Full transcript
曲凯

我们今天很开心请到了逯雨鑫。雨鑫之前一段时间最有名的一件事情,就是自己做了一个基于 Gemma 和 Fable 微调的模型,当时在 Hugging Face 的开源模型排名里排到了第一,超过了很多大家耳熟能详的模型。雨鑫,你先简单介绍一下自己。

逯雨鑫

我叫逯雨鑫。之前做过一阵子 data engineer,后来因为对 AI 方向比较感兴趣,读了一个 AI 方向的研究生,目前也在一家 AI lab 做 AI researcher。

曲凯

但我的了解是,你是做完自己的模型之后,才加入这家 AI lab 的,对吧?

逯雨鑫

是的。

曲凯

我觉得特别有意思的是,现在大多数人还是觉得训练模型是一件非常难的事情。大家不知道这里面有哪些步骤、该怎么做,而且大家印象中的训模型的人,一般都是各种 PhD、researcher 之类的。但你的背景听起来不像是一个典型的能训练模型的人:你之前没有在 AI lab 工作过,也没有参与过实际的模型训练。至少目前你的 title 还是 AI 方向的研究生,对吧?你也不是 PhD。

逯雨鑫

是的。

曲凯

所以我想问几个简单、快速的问题。第一,你为什么能做这件事情?

1. AI训练并不神秘

逯雨鑫

我一开始就是对 AI 很感兴趣。大概在 2022 年到 2023 年左右,GPT 第一次对外开放的时候,我开始使用它。使用之后,我确实发现了很多很有意思的事情。

后来我做 data engineer 的时候,也接触到了很多 AI 行业目前的领军人物。他们之前也是研究员或者研发者,我跟他们聊了很多,对自己以及这个行业都有了更多了解,所以最后选择了 AI 这条路线。

其实这条路线并没有大家想象中那么难,并不是必须得是很厉害的大牛、名校毕业,或者 PhD。AI 其实有很多不同的方向,一种是工业级的,一种是学术级的。学术研究是帮助工业界的人进一步拓展思路,包括新的方法、新的研究领域等。但真正能让大家训练出可以使用的模型的,主要还是工业界。

工业界比较出名的做法主要有两种,一个是 SFT,一个是 RL。所以只要把基础补好,每个人慢慢都可以做到,尤其现在还有这么多强大的 AI 工具可以帮助我们。

曲凯

所以你的这些东西完全是自学的?

逯雨鑫

可以这么理解。最基础的东西是我自学的,后来读研究生又帮我夯实了一下基础。我觉得研究生更能提供的是一种方向,只要方向走对了,自学是完全可以的。

曲凯

这个模型你能不能快速给大家讲一下?比如大概花了多少天、多少钱,或者用了多少张卡?

2. 低成本微调小模型

逯雨鑫

我个人做的这个项目,是 Llama 4 2B 模型的微调。第一代的时间成本大概是 5 天,第二代可能多一点,用了两三周。

金钱成本其实非常低。整个项目我只用了一张 5090,使用 QLoRA,再加上一个 200 美元的 Claude Max 订阅。Claude Max 主要用来合成一些我想做的领域里的靶向数据。

另外,尤其是在 V2 的时候,Hugging Face 上有很多关注我这个模型的粉丝,或者说社区用户,给我提供了很多关于 Phi-4 的珍贵 real trace 数据。这些数据质量非常好,也帮助我完成了 V2。

如果只是想在特定领域提升模型能力,花费可能非常少。现在无论在国内还是美国,租 5090 都很便宜,好像一两个美元一个小时。真实训练的时候,其实也就是十几个小时,可能迭代几版。我估计硬件成本绝对不会超过 100 美元。

曲凯

所以总的算起来,你花的也就是几百美元。

逯雨鑫

对。

曲凯

那训练出来的模型,最后效果大概怎么样?

逯雨鑫

目前在 agentic 领域,尤其是对标 TAU-bench 这个 benchmark,原版大概是 15 分,我提升到了 55 分到 60 分的水平。

但是目前对于很多个人开发者和应用公司来说,只能往特定领域提升。模型在其他 benchmark 上或多或少都会有一些下降。

曲凯

我能不能简单理解为:你是用一个更高级的模型作为 teacher,生成合成数据,然后做 SFT,蒸馏出一个特定领域的小模型。结果就是这个小模型在某些特定领域的表现,强于原来的模型。

逯雨鑫

是的。

曲凯

但这件事听你讲起来好像很简单,而且我们刚才一直在讲,你的背景也不完全是一个特别 fancy 的 AI research 背景。所以这件事情为什么现在还不是一个大众化的事情?

首先我确认一下,你觉得身边做这件事的人多不多?是我们有盲区,其实大家已经都在做了,还是确实不多?

逯雨鑫

我觉得你们的判断很对,实际上大家都没有做。大家没有做,最主要的原因是觉得这件事情非常复杂,但其实并没有那么复杂。

曲凯

所以你能不能给我们完整地讲一下:从你想做这个模型开始,到把它做出来,中间大概分哪几步?你是怎么做的,遇到了哪些问题,又是怎么解决的?

3. 训练模型的完整流程

逯雨鑫

首先,我觉得要明确自己想做什么。很多个人开发者一上来就想说:“我要拿热度,现在什么火就做什么。”但现在什么火,竞争对手也非常多。

所以我觉得首先要明确目标。比如你在一家应用公司,想做这个 business,那就围绕 business 想清楚自己想做什么。对这一点有了明确想法之后,就可以进入第二步,找一个底座模型。

找底座模型也有很多问题,比如架构之类的,都需要具体看一下哪个更适合你。比如 Llama 4 2B,我遇到的最大问题,也是现在还没有解决的问题,就是它的中文非常差,尤其是在 12B 模型的情况下,无论是哪种量化版本,大部分时间都在说粤语。

所以如果你是偏中文方向的,就要选择类似 Qwen 这样的模型。

选好底座模型之后,就可以专心考虑数据管线怎么做。数据管线目前有几种方法,第一种就是合成数据。你可以扮演用户,让 AI 帮你生成数据;也可以用两个模型,第一个模型比如 GPT-5.6,把它当作用户,另一个模型作为实际使用的模型,去合成数据。

当然也可以去网上找。现在开源社区非常友好,Hugging Face 上有很多好的数据,还有 ModelScope,我没记错的话,这是国内一个非常出名的、类似 Hugging Face 的平台。把这些好数据拿到,或者自己做好之后,就可以进入下一步,考虑想采用什么训练方式。

目前工业界非常流行的主要有两种做法,一个是 SFT。简单来说就是蒸馏:把你的 teacher model,比如 Phi-4,或者其他模型蒸下来,再把数据喂给你的小模型。这样会有一个非常明显的提升,但具体效果还要看数据质量。

另一种是 Reinforcement Learning,也就是 RL。RL 被吹得很神,但我觉得实际效果没有 SFT 好,所以最后只选择了 SFT。

当然期间还有很多其他方法,比如 OPD 之类的。但目前对很多应用公司和个人来说,只有 SFT 是比较实际的,因为其他方法的成本会非常高。

之后就是一版一版迭代。做完模型之后,要看效果好不好。如果有特殊的 benchmark,可以跑一下,看看效果如何。如果效果不好,就要分析到底为什么不好,从错题里找到问题,再继续迭代,最后发布。整个流程其实非常简单。

如果对这个流程比较了解,可能几天就能完成;如果不了解,我觉得也很快。之前我学到的很多基础知识,对大部分人来说其实没有必要,比如从 MLP 开始学,这些都没有必要。

真正的难点只有一个,就是整套流程里的数据端。很多人会觉得 AI 很难,觉得 infra 里有各种乱七八糟的问题。但这些问题自己多看看书、多做一些实践,其实很快就能解决。

我 95% 的时间都用在做数据上。所以真正的问题,我觉得是对数据的洞察力。这也是最难的一点,是目前 AI 所有领域遇到的最大卡点。

曲凯

你刚才提到的那些流程,是不是大多数都有第三方的开源工具、架构之类,可以直接使用?

逯雨鑫

对,整套流程都有。包括训练脚本、已经公开的优质数据、benchmark,这些全部都是公开开源的。你可以在各种网站上下载自己想要的代码,然后配合 agent,再自己学习一下,很快就能改成针对自己模型的版本。

曲凯

这个过程当中,你用的都是 Claude 或者 Codex 这种工具吗?

逯雨鑫

对,我这个个人项目全部都是用 Claude 完成的。Codex 的话,我其实不是很喜欢,因为 GPT 现在这个模型有点不太适合做规划,更适合执行和写代码。

曲凯

明白。大家经常在讲,训练模型其实挺重要的是要有环境、要有自己的 benchmark 之类的。但听起来,如果只是工业级使用,这些可能没有那么重要,直接用第三方的就可以了,对吧?

逯雨鑫

对,很多时候都有第三方帮你搞定。大部分人的环境也都可以在网上用很便宜的价格购买,比如 E2B 之类的。

曲凯

你刚才也提到,整个环节里最重要的还是数据,对吧?

逯雨鑫

对。

曲凯

但我的理解是,你的所有数据是不是都是蒸馏出来的,也就是合成数据?还是也加了一些别的数据?

4. 真实数据胜过合成数据

逯雨鑫

我觉得数据方面一个很大的经验是,合成数据其实并不是很好,它只能帮助你靶向处理一些问题。

举个例子,Llama 4 2B 这个小模型有一个问题,就是过度自信。简单来说,跑 benchmark 的时候,尤其是 TAU-bench,我发现很多题它最容易错的地方是:明明没有完成,它却宣布“我完成了”。

那怎么找到专门解决这个问题的数据?仅靠公开数据,或者靠自己真实使用,其实是找不到的。所以,这类数据可以通过合成的方式来做一些靶向处理。

但大部分数据,我觉得最好还是来自真实使用,包括你自己使用模型的过程,以及现在公开的一些 Phi-4 真实使用数据。

另外,这期间还涉及 thinking 和 no thinking,也就是带不带推理去做蒸馏的问题。个人觉得,对于个人项目、特定领域的提升来说,两种都可以。

大家也可以多关注公开数据。如果自己有一些好的数据,或者和 AI 交流产生了好的数据,也可以提供到 Hugging Face、ModelScope 这样的平台上,帮助更多人训练自己的小模型或大模型。

曲凯

所以在实际过程中,你觉得做数据具体有哪些难点和复杂的地方?你遇到了哪些问题,又是怎么解决的?

5. 人工审核决定数据质量

逯雨鑫

首先,我觉得最重要的问题是现在的模型还不够强。其实目前最流行的 RSI,也就是让模型自己合成数据、自我提升、自我迭代,但实际上现在的模型还做不到生成非常好的合成数据,经常会有各种问题,需要大量人工复核。

我之前做这个个人项目的时候,也在 Hugging Face 的首页上提到过,为什么 V2 花了很多时间,主要原因就在于审核数据。

比如我的数据量是 5,000 条,我可能自己就需要审核 500 条。因为 AI 目前生成的合成数据还是非常差,很多问题都在里面。比如我让它帮我做一些解决过度自信的数据,如果只是这样告诉 AI,它生成的数据其实完全不对。

真的需要自己去审核,并且一遍一遍地和 AI 确认目标。比如你觉得这一版有什么问题,就告诉它,然后让它重新做,一版一版地改。所以我觉得这是最耗费时间的一件事情。

曲凯

你第一版花了几天,第二版花了两周。这里面大概有多长时间是在做数据?

逯雨鑫

第一版大概有 3 天是在做数据,训练差不多 1 天。第二版如果是两周,我大概需要用 12 天做数据。

所以大部分时间都是在做数据。训练其实非常快,只要有好的显卡,尤其是像这种小模型,自己微调一下非常快,几个小时就能完成一轮。

曲凯

说到底,多少条数据比较合理、比较好?真实数据和合成数据的比例又是怎么样的?

逯雨鑫

真实数据大概占 60% 到 70%,剩下的是靶向数据,用来帮助模型解决一些错题。

数量上,我最多可以做出差不多接近 1 万条数据,包括整合数据、优质轨迹之类的。但实际上真正用到的时候,还要剔除很大一部分。我觉得真实使用下来,几千条数据的量级就可以了。

曲凯

刚才听你讲,中间有一个点很重要:要先真正训练一遍、测一下结果,再返回头去改数据。

我们之前交流的时候也提到过类似的问题,好像大家很难只靠看数据本身就知道结果。因为在训练出来之前,大家也不知道什么样的数据是好的,最后效果到底会怎么样。你的经验是怎么样的?

逯雨鑫

我觉得这一块没有什么特别大的经验,就是一版一版地测。训练之前,如果你看到数据本身有问题,就能明白这一版训练可能是错的。

但如果数据经过 AI 校对,你自己也亲自采样看过,觉得数据很好,训练出来之后仍然可能有问题。这就涉及一个非常重要的知识,叫 capacity gap,也就是老师太强、学生太弱。

比如 Phi-4 的真实数据规模,应该是在 3T 以上。结果你要把它真实的轨迹、真实的作答,蒸馏到一个 12B 的小模型里,中间会有非常大的能力差距,有些东西学生是学不到的。

所以真实情况就是要一版一版测试,看是否真的有明显提升。如果没有,就要判断是不是老师太强、模型太弱这一类的问题。

我觉得整个数据过程中最重要的就是一版一版迭代。不要觉得这一版做得没有自己想象中好,就说“我放弃了,我不适合”。其实并不是,最重要的是要有耐心。

曲凯

蒸馏这件事情,因为你实际做过,过去几年大家一直讨论软蒸、硬蒸,以及聪明的蒸、不聪明的蒸。你觉得你现在这种算是哪一种蒸馏?

6. On Policy蒸馏最强

逯雨鑫

蒸馏有很多种。一种是 OPD,也就是 on-policy;另一种是 off-policy。

关于 on-policy,我可以明确跟大家说,我用几台 H200 做过大量实验。每台是 8 卡,on-policy distillation 是最强的。其他方法,包括 off-policy 和 reinforcement learning,更多是锦上添花,而不是用来真正解决问题。

SFT,包括靶向数据、公开的优质数据等,我觉得算是一种好的蒸馏方式。

曲凯

这个“好”和“不好”到底应该怎么定义?是按照结果来定义吗?

我特别同意你强调的一点:大家今天讨论这个问题的时候,往往都是从 AI lab 的角度去考虑。但如果从工业级的角度考虑,就是怎么有效、怎么成本低,就怎么来,对吧?

逯雨鑫

对。最基础、最简单的所谓硬蒸,我不管其他那些东西,就是最好的方式。

我觉得你想讨论的问题可能是:好的蒸馏和不好的蒸馏,锚点是什么?如果它和你的目标不同,那就是不好的蒸馏。

比如我的锚点是 benchmark,于是我蒸馏了很多 benchmark 的衍生变体,但实际上我的目标只是想提升模型的安全边界,那这就是不好的蒸馏。

只有当你明确想做什么,并且真的把模型的分布往这个方向拉,我觉得才是好的蒸馏。不管它因此出现 bug、掉分,还是出现任何其他问题,只要和你的方向一致,我觉得就是好的蒸馏。数据也是一样,只要和你的方向一致,就是好数据。

曲凯

除了头部的几家 AI lab,其他人其实不承担 AGI 的责任,也不需要想着怎么训练出一个更高智商的模型。大家真正关心的就是:我用起来更好用,就可以了。

逯雨鑫

对,这也是我这个项目能够成功的原因。现在大家更多使用的是 agentic 和 coding,而我的个人项目锚定的就是这两个领域,所以自然而然会有很多下载量,也有很多人使用。

所以我觉得,关注大家真实的使用情况,比锚定 benchmark 更重要。当然,对于很多 AI 公司来说,benchmark 只是一次考试,他们的目标和大众、应用公司的目标其实完全不同。

曲凯

所以现在大家讨论应用公司,或者非 AI lab 自己研发模型的时候,核心的一点除了表现之外,最主要还是要从成本角度考虑。

最后测算下来,你自己做的模型,成本能降到多少?和其他表现相近的模型相比怎么样?

7. 训练成本进入万元以内

逯雨鑫

我觉得几千到 1 万元人民币以内,对于一家应用公司来说,应该就能训练出一个自己比较想要的模型。当然我说的是小模型。如果是大模型,所需的卡量还是要上去,应用公司可能需要花十几万到 20 万元以内。

曲凯

但如果考虑到后续用户真正调用、使用 token 的成本,这部分就很贵了。

逯雨鑫

那就是 serving 端了。Serving 端有更多坑,比如 SGLang 和 vLLM 的架构问题。

成本方面,要看应用公司部署的模型是什么、用户有多少。还需要具体核算。但如果是小模型,单纯几路并发或者十几路并发,需求量特别小的话,我觉得一台 H200,几万元人民币,基本就可以满足十几个员工的使用。

曲凯

在整个过程中,还有什么坑是大家需要注意的吗?

逯雨鑫

我觉得最重要的就是别放弃。每一个环节都会有很多坑在等着大家。

我自己也是这样。最早公开过一个微调模型,是做小说的。当时纯粹是为了满足自己的想法。比如我很喜欢武侠小说,除了金庸,好像还有几本特别好的,但除此之外就没有了。看完之后,如果再想找一本好小说可能就很难,所以我开始自己做小说模型。

这期间也踩过很多坑。但我想说,Qwen 的模型是坑最少的。包括后来的训练、infra、脚本、部署等,我觉得目前 Qwen 是小模型里最好的,大家可以重点研究 Qwen。

像 Llama 4,以及前一阵子出的、好像叫 Muse 的 30B 模型,架构都不是特别主流,所以训练起来会非常复杂、非常麻烦。

具体训练时遇到的各种问题,现在公开的教程已经很多了。只要不要太相信 AI,及时查询,再看一些真实成功案例,我觉得基本都可以解决。

曲凯

你觉得现在市场上,具备你这种能力、能够一个人 SFT 出类似模型的人,大概有多少?

逯雨鑫

我觉得现在其实还是挺多的,只是很多人把这件事情想得太复杂了。其实我觉得并不难。

我也希望通过这次播客,有更多人去尝试做这件事,我非常支持。因为只有更多人参与,社区才能更加健壮,也能让大家知道 AI 并没有那么难。

如果大家感兴趣,可以抽出课后时间或者业余时间,专门去玩一玩。成本也不贵,做一做,说不定就成功了。成功之后,真的可以按照自己的想法去部署、去做这件事情。

曲凯

你觉得未来训练模型会不会变成互联网、移动互联网时代每家公司的标配?比如每家公司都有一个几个人的小团队,训练自己的小模型,或者基于开源模型做一些事情?

逯雨鑫

我觉得可以,尤其是中型或者大型公司,直接组建一个三四人的小团队就完全可以了,不需要很大的开销。预算主要就是这几个人的工资,再加上部署、训练、显卡等费用。

而且目前显卡、内存和 RAM 都处在一个特别高的价格点。很多厂商也没有预测到 AI 会火成这样,所以现在有一个非常明显的短缺。但等供应上来之后,我觉得它会像当初我们购买手机流量一样。

最早可能是 30 美元,不是,人民币;现在在美国,包括我听很多国内朋友说,已经可以不限量使用了。未来我觉得也会往这个方向发展。只要显存价格降下来,中大型公司的成本很可能会大幅降低,所以肯定会有自己的模型团队。

小公司如果没有专门预算,也可以去找未来仍然存在的 AI lab 商谈。我估计到时候价格肯定会比现在低很多,因为 AI lab 的成本也会大幅降低。

曲凯

现在可能每个环节都有一些第三方和开源的解决方案。我好奇的是,为什么还没有人把这些东西整合起来,做一整套 pipeline,提供一个完整服务?

让每个人不需要自己学习每个环节,只要跟着这套流程走,最后就能训练出一个小模型。

逯雨鑫

这个想法目前除了 RSI 以外,几乎所有公司都在考虑。比如 AI lab 提供一个应用,你可以直接选择模型、选择自己的数据,然后进行微调。

海外已经有一家公司做出来了,叫 Ans Off,在 Hugging Face 上也比较出名,但价格其实挺贵的。

目前国内很多公司也打算做这个事情,只是这里面 infra 可能会有一些难点,包括 serving 端等。但我觉得未来这确实会成为一个趋势。

曲凯

听起来,之前几年大家讨论的是 AI lab 的模型会不会商品化。聊到现在,我感觉未来训练模型这件事,也会变成一个商品化的事情。

逯雨鑫

完全可以做到。Hugging Face 之前有一个平台叫 Hugging Face Jobs,就是专门做这件事的。但目前还有不少坑,因为现在 infra 还没有做好。

无论国内还是海外的厂商,都在做这件事:把训练变成一种商品,让每个人都能用更简单的方法完成模型训练。

8. 应用公司成为新实验室

曲凯

那你怎么看未来这些 AI lab 和应用公司之间的关系与发展?

最近我们也看到了很多文章,尤其是海外的。大家开始强调所谓的主权 AI,也就是用自己的数据训练自己的模型,而不是直接使用 AI lab 的模型。

我们还看到,美国一些做数据标注的公司也在自己训练模型,比如 Mokao;像 Harvey 这种自己做应用的公司也在训练模型;还有 Fireworks 这种做 inference 的公司,也在训练自己的模型。

未来是不是大家其实都是模型公司,或者已经不再有“模型公司”这个概念了?每个人都是模型公司,也不在乎自己是不是模型公司。

逯雨鑫

我觉得 AI lab 的确会减少。

曲凯

你说 AI lab 会减少,是指它们的价值会减少吗?

逯雨鑫

价值可能还是会有一些 AI lab 很高。为什么呢?因为还有一些小型应用公司,比如刚刚发布了第一个产品,做了一个简单的 App,研究健身打卡之类的功能。

如果这时候它们直接组建一个 AI 团队,公司的成本和收益比并不是很高。完成自己的主业才是重点,对不对?

对于这类公司,很多 AI lab 可以在前期承接相关工作。等应用彻底发展起来,可能已经有几百万、几千万用户了,这时候再发展自己的 AI 团队。

所以我觉得,未来确实会留下一些真正更强的公司,去做这类 service。

曲凯

但我感觉你还是按照今天的状态在讲。如果按照我们刚才的逻辑,未来会有一个非常成熟的平台化解决方案,不管是第三方公司还是开源方案,都可以把这些事情整合起来。

那应用公司做一家应用,可能只需要像今天配后端、前端一样,直接使用这套 AI 基础设施。AI 时代具体会怎么变化还不知道,但门槛可能会比你刚才讲的还要低。

我的感觉是,AI lab 现在非常明确的方向,是在追求更高 level 的事情,解决一些科学问题、诺贝尔奖级别的问题,或者更深层次的问题。

基础的模型能力,其实在当下的 benchmark 上已经卷得差不多了。开源模型可能已经足够解决日常生活中的很多问题。所以这些 AI lab 在探索更高的智能、解决 AGI 这件事情上,仍然有很高的价值。

或者说,它们的模型能力更强,也能解锁一些我们现在还没有想到的场景。但很多日常场景,以及应用公司今天在做的事情,未来可能真的只需要基于开源模型做一个内部模型,就可以解决了。

逯雨鑫

其实是的。现在很多中大型企业已经开始做这件事。未来 AI lab 很有可能主要做研究,也可能提供一些 serving 服务给小型公司。

比如提供一个平台,让应用公司自己上传训练脚本和数据,自己完成训练;或者直接做一个开源项目,把关于某个模型的整套 pipeline 全部整合起来。

但我觉得未来对小型公司来说,直接做 AI 可能还是不太友好。因为从我现在的观察来看,训练过程中数据仍然是最重要的一环,这可能需要 AI lab 来解决。至于中大型公司,它们有自己的团队,自然而然就没有问题。

曲凯

我最近看到美国红杉的一篇文章,说最新的 AI 应用公司未来反而可能会变成 new lab。

比如一些行业领先的公司,可能会继承大模型的能力,最后反而成为新的 new lab。就像我们当年看推荐算法时代一样,最终是自己先有了应用、场景、商业化闭环和用户数据,才有了更好的推荐算法。

你去看,没有一家所谓的第三方中立公司会说:“我就是做推荐算法的。”

逯雨鑫

我觉得之后的 lab 确实会更多地从这些应用公司里产生。很多新兴的小型公司可以直接拿它们的模型去做自己的事情,而不是由 AI lab 包揽所有领域。

曲凯

包括我们刚才跟你聊,以及和一些 researcher 聊,我觉得大家有一个共识:数据还是最重要的,数据决定模型表现。

最终真正和客户、用户接触的公司,拥有第一手、最真实、最好的数据。这些数据确实是最宝贵的资源。

我的体感是,最近至少在国内,比较流行的一种论调是“模型吃掉一切”,应用公司现在处在非常冷的时期。我们前几周还做了一期播客讨论这件事情,当时我整体有点偏悲观。

但这几周聊下来,我反而觉得,应用公司其实才是下一个 new lab。现在的 AI lab 和 new lab 在未来一段时间仍然会上升,应用公司的价值也在上升,这两者其实是同步上升的。

在未来某个时间点,也许会发生一个转变:模型的价值慢慢向应用公司让渡。

逯雨鑫

我觉得未来真正能存活下来的 AI lab,确实会像你说的那样,往 research 和更高的层面发展,包括做前沿开发、整体模型的预训练等。

后训练可能会交给很多应用公司,因为应用公司不想把自己的数据分享给别人,也更希望帮助自己在行业里站稳脚跟。

所以我觉得确实会发生一次反转。但这个反转是 AI lab 往上走,完全不再碰后训练;应用公司反而接管后训练,拥有自己的模型。

之后可能会有很多小型公司调用中大型应用公司的模型,或者购买它们的 API。中型应用公司可能也会有自己的 token plan。

曲凯

所以我反过来有点理解,为什么大家所谓的 AI lab 愿意花这么多钱去买数据。现在可能很多人还没有意识到数据的价值。

它有点像移动互联网早期,像字节那个时候,大家都觉得为什么要花那么多钱买用户,用户获取成本其实挺高。但后来大家发现,早期获取用户的成本反而是最低的,之后会越来越高。

我觉得数据可能也是一样。现在 AI 要花更多的钱,把能买的数据先都买回来。

逯雨鑫

对。比如你平时让 AI 做一些事情,用 GPT-5.6 帮你写一篇播客稿,或者调整一段内容。在这个过程中,你的数据其实非常宝贵。

你和 AI 聊天的过程,就是你真实使用它的体验;AI 真正帮你解决了问题,这整条数据就已经有价值了。

所以现在 AI lab 一直在做数据、购买数据,本质上是想知道 AI 真正帮你解决的问题是什么,以及它是怎么完成的。你的真实问题是什么,这些都对下一代 AI 的提升非常有用。

包括每次发布模型时,可能有一些公司会说:“现在可以免费使用这个模型。”但 AI 公司提供 serving 的成本其实很高,可能要部署很多 B300。B300 无论是租还是买,对它们来说都是很大的成本,可能达到几十万、几百万元。

它们为什么这么做?不仅是为了宣传自己的模型,让你真实体验一下,也是在收集好的数据,帮助自己迭代下一代模型。

曲凯

但聊到这里,我有一个很好奇的问题:你最终为什么还会选择加入一家 AI lab?

逯雨鑫

因为我觉得肯定还是会有 AI lab 成为赢家。真正去选择一家有希望往 research、RSI 方向发展的公司,未来可能直接做到 high research level,做预训练之类的事情,还是很有价值的。

我觉得目前 Kimi、智谱这些公司的最大价值就是预训练。应用公司无论如何都很难做到预训练。如果想预训练一个模型,我可以给大家估算一下成本:不是加一台 B300,而是可能需要 128 张卡,甚至 264 张卡,做几个月的预训练。

所以这部分肯定还是由 AI lab 占主导。

但我觉得未来还有一个非常大的问题:如果 AI lab 不再开源,对应用公司来说可能是毁灭性的打击。那时候就需要从之前开源的模型里找到真正好的模型,自己做后续训练、自己迭代。

所以现在很多中大型应用公司,如果有足够预算,想继续发展,就应该从现在开始自己迭代模型。

曲凯

但至少从今天看,未来相当长一段时间内,只要存在竞争,应该就会有开源。

逯雨鑫

对。

9. 每个人拥有本地模型

曲凯

最后我想问一个问题。之前大家有过一个类比:计算机刚出现的时候,是一种非常大的机器,一间房子都放不下。那时候大家可能会觉得,全球是不是只有那么几台机器,就像今天全球只有几家 AI lab。

后来它慢慢演变成每个人一台 PC 的时代,从 IBM 走向了微软、苹果这样的公司。AI 未来会不会也往这个方向走,从几家大的模型公司,变成未来人手一个模型,跑在自己的电脑、手机,或者其他端侧产品上?

逯雨鑫

一定会。现在已经在往这个方向发展了。

简单来说,当你调用 API 的时候,你的数据是可以被上游看到的。很多人使用中转站,觉得价格便宜,可能几十块钱一个月。但我为什么不支持中转站?因为很多中转站不仅处在比较灰色的地带,而且还会出售你的数据。

现在已经看到太多案例了。我身边的朋友,包括一些其他 AI lab,都遇到过同一个问题:被黑客威胁,对方说“你的数据泄露了”。

所以未来为了保护自己的数据,大家一定会更多地使用 local AI。而且随着英伟达以及国产知名芯片的发展,它们都会做大、做强、做得更好。

我觉得基本上每个人都会配备自己的 local AI。数据永远保存在自己的电脑上,不流经任何地方。所以这绝对是一个非常大的趋势,也正是 Qwen 一直发布小模型的原因。

随着电脑升级,可能就像我之前看到的报道,2027 年、2028 年苹果也要推出 2T RAM 的统一内存电脑。2T 内存基本上可以运行现在的 GPT-5.2,相当于每个人自己都有一个非常强大的 local model,再也不需要调用上游 API 了。

这绝对是一个非常好的趋势,也是未来每个人都希望拥有的一天。

曲凯

最后你还有什么想补充,或者想和大家分享的吗?

逯雨鑫

我觉得最重要的是,如果现在大家,包括应用公司,想要做 AI,就不如从现在开始。

因为之后开源可能会受到一些重创。比如 Qwen 在 3.7 模型的时候,就没有发布任何小模型。如果它不发布,大家怎么办?可能只能自己做后训练,直接把路堵死了。

而且很多人完全不会,只会说:“我就部署在自己的电脑上,用自己的显卡部署一个小模型。”这种情况下,我觉得会形成一个非常大的阻塞,未来也可能遇到类似问题。

所以很多应用公司现在就可以开始专门做这件事情。很多学习 CS 的人,也可以主动往 AI 方向靠一靠。这样未来,尤其是在闭源的情况下,可能会有更好的发展。

曲凯

明白。好,那谢谢。今天就——

Speaker 1

不好意思,我想再补一个问题。

曲凯

你说。

Speaker 1

Hello,Hello。我是陈皮,在42章经做内容。

现在有一部分人的说法是,用户最终对智能的需求可能还是要达到 SOTA level。假设 OpenAI、Anthropic 这样的公司一直发布最前沿的模型,那用户真的会愿意使用自己的本地模型吗?

因为本地模型可能和 SOTA 还有一些距离。哪怕这种差异对大家的日常生活和工作来说,已经没有那么重要了,大家还会愿意使用 local AI 吗?

逯雨鑫

我觉得这个问题非常好,也是很多人面临的问题。

我自己的 local AI 使用率目前来说并不高,因为它还是会有一些错误,可能没有这些 SOTA、最前沿的模型那么好。但很多人的工作对数据非常敏感。

这次我在 Hugging Face 发布模型之后,收到了很多反馈。很多人还是愿意使用 local AI,因为他们对数据非常敏感。我收到最多反馈的领域是 cybersecurity,还有生物领域。

在这些领域,Phi-4 全是拒答。遇到这种情况,你只能考虑 local AI 模型。

日常聊天的话,大家可能更愿意使用大模型,因为现阶段还无法在手机上部署一个非常令人满意的模型。但未来很可能会发展到可以在手机上部署一个自己比较满意的模型,比如 27B 的模型。

如果达到这种程度,很多人问简单问题时,就会直接使用自己的手机。因为这对大家来说是沉没成本:手机已经买了,使用里面的 AI 相当于免费;但如果调用 API,每个月可能还要花 20 美元、30 美元购买这些公司的服务,对个人来说就是一笔额外开销。

第二点就是安全性问题,大家可能也会更加关注。很多人写小说,我以前专门做过小说模型,所以非常了解写小说的情况。

写完一版小说,可能需要花几千甚至几万元人民币。但如果用 local AI 来辅助完成,自己再做一些调整,成本就会低很多。

所以我觉得未来还是会更偏向 local AI,因为大家希望保护隐私、节省成本,而且很多领域的大模型会拒答。在这些情况下,local AI 可能会更好。

曲凯

我想再追问两个小问题。

第一,local AI 成本更低、速度更快,这比较好理解。但隐私这部分,我不确定是不是真需求。我们当然都希望保护自己的隐私,但实际上现在用的很多 App,可能都在想办法获取我们的数据,我们用着用着也就无所谓了。

第二,你刚才提到了 cybersecurity。最近我们也看到一些公司在做这方面的事情。比如这类公司加上 SOTA 模型,是不是也能在一定程度上解决大家对隐私的顾虑,而不是最后每个人都要选择 local AI?

逯雨鑫

这里已经有一个非常好的案例了。Hugging Face 被 OpenAI 攻击了,最后它解决问题时,只用了中国的国产模型,并且采用本地部署。因为无论是 Claude 还是 GPT,都会拒答。

所以未来我觉得很多公司可能真的会偏向自己的模型。

隐私问题确实可能有很多人不在意,但也有很多人在意。就算现在很多 SOTA 模型厂商说已经把 cybersecurity 问题融合进去,遇到相关问题不回答,或者采取其他方式处理,仍然会有很多其他领域出现类似问题。

还有生物领域。很多人在做 research 的时候,Phi-4 一直拒答。这样你就无法使用 SOTA 模型,剩下可能还有几个其他选择,但都不是最先进的。那我可能就选择一个中等水平的模型自己部署,把数据保留下来,这是不是更好?

曲凯

另外补充一下,我觉得还有一个问题:所谓的 SOTA,到底多 SOTA 才算 SOTA?

也许慢慢大家会觉得,今天使用的模型已经够用了。更好的模型从性价比角度来看,总归会有一个点变得不太划算。就像很多人觉得 4G 已经够用了,没必要用 5G;或者觉得 5G 已经够用了,没必要再用 6G。

逯雨鑫

但我觉得刚才 Speaker 1 提到的点是对的:大家一直在追求最先进的模型,不管它有没有用。很多人其实是不管自己的需求,盲目追求最强。

曲凯

不,我是觉得,最后肯定还是豆包的用户更多。你们现在讲的,其实还是一个小众人群,只是这个小众人群在今天的 AI 领域里相对有更强的话语权。

大多数人其实不在意,也不会这么选择。大家最终还是看性价比。

至于你们说的隐私问题,我觉得未必是用户个人主动关心、主动选择,而是应用公司会自然推动这件事情。应用公司和模型公司天然有点竞争关系。

最终用户使用个人模型,可能是因为苹果在推动这件事,而不是因为用户个人主动做出了选择。

逯雨鑫

是的。我觉得未来差不多就是这样的情况。

就像豆包的用户最多,是因为它最方便,也不需要用户操心太多。只要能解决大家的问题就可以了。

曲凯

好,今天聊得很开心。我觉得这次提供了很多非共识,但也和我们最近看到的一些趋势很吻合。非常感谢雨鑫的时间。

逯雨鑫

好的,谢谢。