程曼祺
在中国的这些 AI 团队里面,什么公司的人被搜得最多?
高代恒
目前肯定是千问。
程曼祺
不是 DeepSeek 吗?
高代恒
现在不是。
程曼祺
你觉得钱对这些人意味着什么?比如 Meta 祭出这种天价挖人的策略,它到底是在打动谁?
高代恒
我说实在的,我不知道。因为人类历史上很难有一个时期,搞智力的人能拿这么多钱。
程曼祺
你会被这种反差和戏剧性所吸引?
高代恒
当然。我觉得比较有代表性的就是,大家可能知道,GPT 之父发布 GPT 的时候,只是一个二十多岁、来自波士顿近郊、毕业于富兰克林·W·奥林工程学院的本科生。
程曼祺
这种人很容易让你联想到文艺复兴时期的艺术创作者,或者艺术家?
高代恒
对。他完整地在做一个作品。
程曼祺
最典型的作品其实就是你的论文。
高代恒
是的。我觉得非常舒服的一点是,当你有了作品,就没有人会面试你写代码这种东西了,因为它不重要了。
程曼祺
欢迎收听晚点聊,我是曼琪。今天的节目分两次录制,嘉宾是高代恒 Sam,他在 AI 技术圈和开源社区非常活跃,曾是双飞土木老哥,后来因为对 AI 开源项目的贡献进入了阿里达摩院,现在自己创业做了一个找到 AI 人才的 agent 产品,Dink D I N Q。而本期我们聊的主要话题却是他的副业和消遣,挖掘 AI 人物故事,Sam 对此非常着迷,在达摩院时他就很喜欢搜集 AI 大牛的人生故事,那些非典型的充满反差的成长经历尤其吸引他。本期的第一部分我们聊了上周刚发生的阿里千问的人事变化,Sam 分享了他作为开源模型受益者和前达摩院成员的一些观察,这整个过程的更具体的情况大家也可以看晚点 Late Post 从上周到本周发布的三篇报道以及我们的上一期播客。本期第二部分是春节前的聊天,我们聊了 Sam 津津乐道的 AI 人物英雄传,在他的眼里这些不问出处、不拘一格的研究者就像文艺复兴时期的大师,他们有各自的性格、癖好、执念和技术浪漫,这对大型商业组织来说是陌生的,需要适应和理解的。我们也由此聊到了未来的研发型人才市场会如何变化。接下来你即将听到的第一部分是我们的最新讨论。呃,Sam,你可以先和我们的听友简单打个招呼。
高代恒
Hello,大家好,我是 Sam,高代恒。之前我在阿里达摩院和通义做算法工程师,后来自己在做 AI Agent 方向的创业,主要是人才招聘相关的方向。
程曼祺
因为我和 Sam 其实春节前已经聊过一次,这周想再补录一下,也是因为我们聊的话题——AI 人才,这群最聪明的研发者的故事和个性,以及现在这群人怎么推动新的技术和应用的发展——和上周发生的一个大新闻非常相关,就是阿里千问的人事震荡。
林俊旸作为千问的负责人突然提出离职,所以想补充就这个话题稍微展开聊一下。我比较好奇的是,你们的产品 DINQ 本身就是帮助公司、AI 研究项目和投资人寻找 AI 人才,以及有可能创业的高潜 AI 方向领袖。上周新的变动发生之后,你们在平台上看到的搜索量有什么变化?有更多人去找千问团队的候选人吗?
高代恒
1. 千问搜索量激增
从定量来看,搜索量翻了 3 倍,有差不多两三千条 query 在查千问相关的人,或者千问过去发表的论文中的作者信息。
主要的集中方向还是大语言模型、强化学习和 Agent RL,这些比较热门的方向。图像和语音会少一些。
程曼祺
搜索方是什么类型?能看出来吗?
高代恒
大概主要是 HR 和猎头。我们还看到 Meta 的 Executive Search,有一个叫 George Linda 的人也在搜千问的候选人。
程曼祺
所以也有国外的公司。之前我们聊到过,在没有发生这件事之前,海外很多公司或者研究机构来搜中国候选人的时候,最后匹配给他们最多的也是千问团队的人。
另一方面,千问的人总数并没有那么多。它在通义实验室这个大实验室里面,自己其实就一百多人。相当于有了新的变动之后,针对性地来找他们的人更多了。
高代恒
是因为有这个变化,大家就觉得可能有些人想看一看其他机会。
程曼祺
你一直在开源社区比较活跃,也认识很多机构和研究者。这次的事情,开源社区大概是什么样的反应?
高代恒
2. 千问主导开源生态
大家觉得挺奇怪的。从现实角度来讲,千问在商业上的情况我不是很了解,所以我就从影响力的角度说。千问是开源模型的第一梯队,在国外,和它比较类似的应该是法国团队做的公司 Mistral。
Mistral 是世界上第一个开源模型 Llama 背后团队的一些核心成员出来做的。千问在没有先发优势的情况下,现在模型的下载量在两个世界级的开源模型托管平台上都远超 Mistral。一个是 Hugging Face,中文有人叫它“抱抱脸”;另一个是魔搭社区,也就是阿里做的 ModelScope。
它事实上已经成为开源模型领域的霸主。因为它有非常多的模型系列,各种小模型、图像相关的、视频相关的、推理相关的模型,还有 embedding 模型。这样的模型让整个生态和学术界得到了很多益处。
很多在学校里做研究的同学,无论国外还是国内,其实都没有什么计算资源。所以你会看到一个现状:在 AI 领域,评估一个研究员有没有能力,有一个很重要的方向就是能不能在顶级学术会议上发表自己的论文。比如神经科学相关的 NeurIPS,以及计算机视觉领域的 CVPR。
你会越来越多地看到这些会议的论文引用千问的技术报告,或者用千问的模型作为 Agent 的大脑,或者作为其他链路里面的重要环节。千问被使用得越来越多,所以从这个角度来讲,千问推动了整个 AI 学术界和工业界比较重大的发展,它的价值和意义非常大。
至于商业上的情况,我个人确实不是特别了解。
程曼祺
你刚才在对比它在开源社区的影响力时,是和 Llama、Mistral 去对比的。对中国关注这个领域的人来说,大家可能更熟悉 DeepSeek,包括后来的 Kimi、MiniMax、阶跃星辰和智谱,也都做了很多开源模型。千问在开源领域的影响力,包括下载次数和开发者数量,和中国这些其他开源模型相比是什么情况?
高代恒
现实来看,千问模型的总下载数量,在刚才提到的两个开源模型托管平台上,比后面这些人加起来的总和还多。主要原因是它的尺寸非常多,有 0.6B、1B 这样的模型,能使用的资源范围很广,而且它的家族生态特别完善。
从 2023 年下半年开始,就已经有一些团队用千问模型写进自己的论文里。对学术界来说,它已经成为一种标准实践,也就是事实标准,de facto standard。这个心智非常重要,因为如果没有这个心智,你做营销和宣传的成本会非常高。
其实具身智能行业用千问也比较多。机器人对模型尺寸有要求,有些端侧设备需要延时比较小、算力消耗比较少的模型,所以也会用到千问的模型。
程曼祺
你刚才还提到魔搭社区和 Hugging Face。Hugging Face 是一个比较老的社区,2016 年开始做;ModelScope,也就是魔搭,应该是阿里从 2022 年底到 2023 年开始做的。你那会儿应该还在达摩院,所以魔搭作为阿里发起的生态,成长得很快,可能也和阿里整体的开源策略,以及千问后面一系列生态的完善有关。
高代恒
那时候 ModelScope,也就是魔搭社区,说实在的还不是特别流行。内部同学最开始还被要求在里面贡献自己的模型和数据集,后来没想到它现在的访问量和模型下载量越来越多了,也越来越好。
这可能也是一种证明:中国或者华人领域,在 AI 上的从业者和开发者越来越多。
程曼祺
像魔搭社区这样的东西,长期来说对阿里会有什么比较大的商业价值?
高代恒
这是个很大的问题,我只能从自己很狭小的视角去理解。
我认为,Hugging Face 或者魔搭社区,本质上是 AI 时代的 GitHub。这样的东西的价值在于,需要有一个地方、一个 Hub 去承载多种多样的模型、数据集和应用。应用可以放在 Hugging Face 或魔搭的 Spaces,也就是“空间”栏目里面。
这样的东西越多,大家就会越多地来到你的平台,使用平台上的内容,在平台上做贡献,留下评论。这些东西对于模型的发展和技术迭代有重要的指导意义:你可以知道这群开发者、研究员和 AI 领域最前沿的实践者关心什么。
他们关心的东西,调用量显然会高,点赞会多,也会有更多评论。什么东西是他们不关心的,也能反过来形成学习信号,指导我们今天应该把更多精力放在哪些项目上,应该把精力集中到什么事情上。
我认为这是一个很好的环境,不是每个公司和组织都有能力搭建这样一套环境。所以从这个角度来讲,它非常有用。
从 2025 年下半年开始,我们看到 AI 领域最挣钱的公司,其实就是卖强化学习环境的公司。
程曼祺
如果这个平台直接挣钱,其实有很多方式。比如 Hugging Face 可以把模型部署在平台上,有人调用时收取费用;也可以托管模型、提供推理服务。包括存储,如果你有一个几 B 的数据集,比如图像领域的 Line 5B 数据集,想托管在平台上,也需要支付存储费用。它相当于做了云服务。
高代恒
对,这是一种比较常规的收入方式。但我觉得对阿里来讲,ModelScope 的战略意义应该远大于今天它带来一千万人民币或者美元的收入。
程曼祺
作为一个前阿里员工、开源社区的贡献者和参与者,你怎么看这个变化接下来一段时间的影响?
高代恒
3. 人才争夺全面升级
第一,我能看到的情况是,这些人肯定会被 Meta、xAI、OpenAI 疯抢。尤其是在马斯克把自己的 12 个、13 个 co-founder 解雇到只剩下 1 个之后,他对这群人如饥似渴。
今年 SpaceX 和 xAI 合并,应该会在 2026 年进行。我不知道它会不会做出一个比 Anthropic 更大的 IPO,但它肯定会有很强的财富效应,对开发者和研究员产生很强的牵引和吸引。
第二,对于公司和市场来讲,我觉得会进入一个收敛状态。当大家发现大语言模型这条路线只要继续 scaling,就还能继续压榨出新的智能,大家就会不停地在这个方向上加注。
对于公司来讲,可能会减少开源方面的投入,更多地提升模型的智能表现,以及 Agent 领域的 tool-use 能力。这些东西会变得越来越重要。
现实情况是,公司会招更多在国外做 post-training、做 RL 经验的人,让他们来到公司,或者以顾问的方式参与,让千问模型在实战中有更强的表现能力。我觉得这是公司比较在意的事情。
今天很多公司说自己在各种 benchmark 上刷榜,但对绝大多数人来讲,他们可能没有那么在意 benchmark。这样一来,也会让一些新的行业诞生。
据我了解,无论是千问还是国内其他企业,之前对强化学习环境的重视程度都不够,大家更喜欢在公司内部做这件事。2026 年应该会看到更多第三方数据提供商或者强化学习提供商,为这些前沿实验室提供数据。这是一个比较明显的方向和趋势。
程曼祺
这次的事情也引发了很多讨论:特别前沿的核心研发团队,他们的目标和整个公司的大目标之间怎么对齐,双方怎么协调。
因为这些目标肯定不是完全一致的。最早大家卯足劲儿搞模型性能时,目标也许是一致的;但现在可以看到,AI 应用发展得非常快,商业化竞争和超级 App 的竞争也都很激烈。
你很了解这群人,他们都挺特立独行,非常自驱,也有很多自己的个性和追求。你觉得他们和大型商业组织之间应该怎么相处?长期来说会是什么关系?
高代恒
4. 研究员成为新艺术家
长期来看,我觉得它会很像文艺复兴时期的 workshop 和金主之间的关系。
今天大家进入一个 workshop 当学徒,目标是做自己的作品。什么意思?就是我要靠我的作品在这个世界上立足。他某种程度上很像艺术家。
我不是靠在你这里工作了几年然后出去闯,因为这件事越来越没有意义了。就像文艺复兴之前,艺术工匠本质上和木工、瓦工一样,没有什么区别。
但文艺复兴之后,大家对这个方向有巨大的投入和需求,于是这群人的社会地位和待遇都提升了一大截。典型的就是美第奇家族让达·芬奇和米开朗基罗可以上桌,可以和贵族一起吃饭,这在原来是无法想象的。
映射到今年和去年,就会发现扎克伯格挖明星研究员时,待遇竟然能开得比 NBA 球星和英超足球明星的工资还高。这个趋势一旦形成,我认为就不太可能逆转。
最终,谁能把算力发挥出最好的性能,谁的溢价当然就会非常高。
文艺复兴时期,大家最开始从画画开始,后来去教堂画顶端的壁画,最后开始做建筑设计,工程的体量越来越复杂。如果我把项目交给一个小白,我给他再少的钱,他把项目搞砸了,我也接受不了。
在这个过程里,我觉得会有几个阶段。第一个阶段,大家会在公司内部建设这些组织。但到了今年或者明年,我觉得会看到很多公司外部的组织。这些组织专门在大模型产业链上帮你完成其中一环。
比如你需要结合自己的场景做 Agent RL 训练,可能就会有一家服务商接受你的委托,完成这项服务。这样的角色会让智能更快地在各个行业生根,因为如果是公司内部的组织,它发挥作用的范围还是很有限。
再到最后,可能会出现完全独立的模型公司。我目前看到这样的公司在国外比较多,比如 Cohere。它是典型的 enterprise-level AI 公司,相当于帮助企业做服务,结合企业场景完成一些工作。
这类公司以前人会比较多,但随着产业链中各种工具的成熟,以及 Agent 的调度能力越来越强,未来这样的人也不会那么多。我觉得它们会像生态里的毛细血管。
程曼祺
像 Cohere 这样的公司,包括之前 Mira 做的 Thinking Machines Lab,也推出了 Tinker,专门帮助其他企业或者需求方做强化学习训练。这些公司能找到的所谓“金主”,类似美第奇家族的角色,我理解还是那些自己并不掌握核心 AI 技术的公司。
最大的科技公司和科技巨头,应该还是倾向于在内部做这件事吧?比如阿里、字节,以及 Meta、Google。
高代恒
我说一下整体的看法。
现实情况是,美国、中国,或者新加坡、日本、德国,AI 领域的 PhD 和教授大部分现在都是华人。这会带来什么?中国文化是比较排他的。说实在的,如果你招一个印度学生,除非他是 IIT 的超级天才,和一个厦门大学或者西电的学生特别卷,否则你肯定招后者,因为他更听话,你可以把他当成小龙虾来用。你每天通过微信或者 WhatsApp 给他发命令,他不就做完了吗?
这种情况下,这个人群的供给只会越来越多。他们有更好的环境去锻炼自己的技能,因为所有人进入这个环境,都把自己当成演艺圈的人。
这个圈子不像传统工程行业,是师傅带着徒弟一步一步做。无论创业还是自己做工作室,大家不是以进入千问、Kimi 为荣,那只是中间过渡的部分。我需要用顶会为自己建立门槛,进入这个环境之后还要做别的事情。
你越把进入千问或者 DeepSeek 当成终点,人生可能越悲剧。因为我完整经历过传统计算机视觉、深度学习,到大模型和 Stable Diffusion 的那套变化。
如果你在 2021 年做 GAN、VAE,到了 2022、2023 年却不拥抱扩散模型,就会被淘汰。谁会觉得自己在大厂有几年经验就有优势?现在你应该知道,微软、千问、DeepSeek、MiniMax,很多项目都是实习生在 carry,并不是全职员工都很厉害。
哪个行业会出现这种情况?所以它的规则本质上和其他行业不一样了。
程曼祺
如果把它类比成演艺圈或者艺术家,他们在追寻自己的代表作。这个事情长期的目标是什么?
高代恒
5. 作品驱动个人成长
长期目标是让自己有发展。自己要有发展,就得有作品。
程曼祺
有发展是为了什么?当然是为了更好的待遇。这个我能理解,但通常金钱到了一定程度之后,人的需求肯定会再上一层。对这些研究人员来说,那个东西是什么?
高代恒
比如我今天做一个模型、做一个开源项目,很多人点 Star,给我提反馈,我觉得这就是自我实现的过程。
而且这是一个无限游戏。你想玩,可以玩到一百岁,但很多人的精力、体力和心力不够,可能玩到三十多岁就累了,想去做一些轻松一点的事情。
程曼祺
我猜这个可能是多元的。有的人是为了在科学或技术史上留下自己的贡献;还有一部分特别有使命感的人,是想实现某种 AI 系统,或者某种更强的智能状态。
高代恒
我觉得那属于潜意识。直接的意识是:我需要一些作品,证明自己有能力。
因为算法时代奖励的是结果,奖励的是产出,而不是一些不成形的东西。从结果上也能看出来:DeepSeek-R1 这个模型本身性能很强,千问的强化学习技术也很厉害,奖励就是这些东西。
我接触的开源社区里,大家一看到一个项目有前途,就疯狂往上贡献。这是我看到的非常强的动力。你说他们直接就是为了挣钱,好像也不是。
他们可能想证明的是:我今天在一个很厉害的项目上,比如在千问的 technical report 上有我的名字,或者在一个小龙虾项目的 contributors 里排到前 100。这个东西能让我越来越有自信,形成正反馈,让我有更大的动力和信心,相信未来自己能胜任一些工作、创业,或者做别的事情。
程曼祺
感谢 Sam 的分享。下面是春节前我和 Sam 的聊天。当时 Open Crawl 刚刚火起来,Peter Steinberger 还没有加入 OpenAI,千问也没有发生现在的变动,所以我们聊的是当时的情况。
我可以先从你们最近在 DINQ 上有个小火的功能开始讲起。这个功能叫 Dink Roast,就是辣评大家感兴趣的研究员。你可以简单讲讲这是什么,以及用户有什么好玩的使用方法吗?
高代恒
6. Dink Roast评估研究员
这个东西其实特别简单。2025 年 3 月我有了这个想法,四五月份就开发了这个功能。
用户输入自己的 Google Scholar 链接,再输入 GitHub 账户名称,或者 LinkedIn 账号,系统就可以生成一份过往经历的分析和一段辣评。
有意思的一点是,当时整个市场充斥着比较疯魔的情绪。大家会问:为什么这个人能挣几千万美元年薪,那个人能挣几千万?于是大家就会问,我值多少钱,我到底是什么情况,特别喜欢玩这个小产品。
所以它和当时的市场环境很符合。最开始的版本里,价格其实是瞎估的。我们定了几个区间,让模型自己根据不同的人去定义。最高一档是 1,000 万美元以上的年薪,其他几档是 100 万美元以下、100 万到 300 万美元、300 万到 500 万美元。
程曼祺
那时候你们的想象力也比较有限,因为后来 Meta 天价挖人应该是 7 月份之后的事。人家直接能开出 1 亿美元。
高代恒
对,现在这件事已经变得很正常了。最近也听到一些做 AI Infra 的朋友说,如果他选择不创业,而是去 Meta 这样的实验室,能拿到几千万美元年薪。我觉得确实太夸张了。
相当于在 Meta 待 1 年,可能就和创业成功后一次小的退出收益差不多。
程曼祺
甚至可能比那个还多。因为我听说 Meta 和这些公司都是按月支付期权对价的。有些人的年薪可能只有 50 万美元,但期权可能是 2,000 万美元、分 4 年兑现。这代表他每个月通过股票或期权兑现的现金,可能比年薪还多。
程曼祺
那在这个功能里,用户测试谁测试得最多?
高代恒
去年 6、7 月份,大家测试 Ilya 比较多。那时候他好像也出来做超级智能。包括 OpenAI 的一些重要人物,比如做强化学习的 John Schulman、欧阳龙、翁嘉仪,也被测得比较多。
高代恒
后来大家更关心的是测试自己,或者测试身边的人。针对这一点,我们还做了一个 PK 功能。
我们把一些客观指标拿出来对比,比如论文总引用量、第一作者论文引用量,以及顶会论文数量。这些相对比较客观。当然也不完全公平,因为有些理论方向的论文引用量不高,但影响力也很大。不过这种事情没有两全的办法。
程曼祺
我印象很深的是,我做过林俊旸和周畅的学术 PK,发给你看。结果是什么?
高代恒
他们势均力敌。在去年的那个时间点,林俊旸和周畅的引用量应该都是两万多。
程曼祺
你发给他们之后,本人有什么反馈?
高代恒
直接觉得绷不住了。
程曼祺
Meta 抢人的时候,应该有几个人选是大家比较关注的吧?
高代恒
对,那时候确实有几个人很受关注。后来我发现,通过做这个小尝试,很多人其实有更了解自己的需求,否则他不会来测。
我们的后台当时看到很多来自国外的用户。这个我可能随便举几个例子:斯坦福、MIT 的一些教授,谢赛宁老师、斯坦福的杨迪老师,也包括做 MoE,也就是混合专家模型的 Albert Q. Jiang,还有月之暗面的联创周新宇。这些人都用过这个产品。
我就发现,大家某种程度上还是喜欢玩这种小工具。于是我就想,能不能做一些更能满足这群人需求的东西,所以才有了 DINQ 这个创业想法。
程曼祺
你怎么定义这群人?范围是什么?
高代恒
我的定义比较宽泛,就是有创造能力的人,直接对 AGI 有贡献的、AI 领域有创造力的各种人。
程曼祺
你觉得这群人的核心特质是什么?
高代恒
7. 作品定义研究员身价
我觉得他们的核心特质和这个大时代特别呼应。为什么今天研究员可以挣几千万美元甚至几个亿?我认为,他们和过去在公司上班的人最大的不同,是他们会完成一整套流程,像工匠一样。
我今天发现一个问题,觉得这个事情不好,就提出一个问题;然后在解决问题的过程中做很多实验,最后交付一个结果。他相当于一个能够闭环的人。
这种人很容易让我联想到文艺复兴时期的艺术创作者或者艺术家。他完整地在做一个作品。
程曼祺
这个作品,从过去十几年的深度学习浪潮来看,最典型的其实就是论文。
高代恒
对。有人做具体的算法技术,有人做底层训练框架,比如 PyTorch、TensorFlow;有人做数据处理,或者其他底层基础设施,这些都可以算作自己的作品。
今天前沿研究机构,无论 OpenAI、xAI 还是国内机构,其实都在根据作品找人。相当于你做了一个作品,它就是你的成果,定价很多时候也是根据作品来的。
过往学历和工作经历可能仍然重要,但我觉得它们贬值的速度非常快。从求职和创造的角度讲,已经有点“英雄不问出处”的感觉。
程曼祺
今天看 Sora 2 的一些关键研究员,很多甚至都没上过大学。这个趋势是怎样的?他们是高中时,或者大学没上完,就被 OpenAI 招募了吗?
高代恒
也不完全是。我印象比较深的是一对兄弟,一个叫 Eric Luman,另一个叫 Troy Luman。他们大概从 2020 年开始用扩散模型做一些比较简单的科研任务,但没有投稿到需要同行评审的学术会议,而是发到 arXiv,也就是康奈尔大学维护的公开论文平台。
他们不断做相关研究,OpenAI 可能发现了这些东西,于是把他们招走了。这种趋势还是很明显的。
程曼祺
这个在中国和美国都明显吗?
高代恒
都明显。中国公司也有很强大的找人团队,会在 GitHub 和顶会论文里寻找蛛丝马迹。
另一方面,这也导致这个群体本身要更多地在这些平台上传播自己。今天的一个数字是,2020 年已经暗暗埋下了很多线:扩散模型的基础技术,比如伯克利大学的 Jonathan Ho 提出的 DDPM;前一年,斯坦福的宋阳也提出了相关扩散模型技术。
这些基础技术,以及 Transformer 相关技术、跨文本和图像模态的 T5 等,在那个节点其实都已经准备好了。
那时候去看学术会议的论文投稿量,比如 ICLR,也就是国际表征学习会议,如果我没记错,2020 年大概是一两千篇。今年的投稿量好像已经超过 3 万篇,或者更多。
这才 5、6 年的时间。不只是 ICLR,各种和 AI 强相关的学术会议都在暴涨,弱相关或者交叉学科领域的论文就更多了。
除此之外,还有 GitHub、Hugging Face 这样的平台,可以承载大家的才华。今天大家都在说,Hugging Face 上的中国模型数量,从 2025 年下半年开始已经超过美国的开源模型。这代表中国 AI,或者说华人的力量非常强大。
我在 2022 年也因为过去一直做图像和视频,所以会关注那些重要技术的作者。这个领域重要的技术之一,是文生图中的跨模态对齐技术 CLIP,也是 OpenAI 的模型。如果没有它,Stable Diffusion 或者 OpenAI 的 DALL·E 都不可能诞生。
CLIP 的作者之一 Alec Radford 当时还不到 30 岁。中国人也做了很多重要技术,比如旋转位置编码,苏剑林在 2020 年做这个时也不到 30 岁;还有混合专家模型 Mixture of Experts,Mistral 的 Albert Q. Jiang 也不到 30 岁;Stable Diffusion 来自德国慕尼黑大学的 Robin Rombach,当时也不到 30 岁。
2022 年我正好 30 岁,就看到这些最重要的技术都是 30 岁以下的人做的。从数学期望的角度来说,我觉得自己很难通过在公司工作做出这么大影响力的事情,于是开始想,自己后面应该做点什么。
程曼祺
做研究是不是有一个最近很火的词,叫“斩杀线”?可能过了一定年龄,就和好作品无缘了。所以你转而想到,可以做社区或平台,让这些优秀的人更容易脱颖而出,也让需要他们的公司和团队找到他们。
高代恒
是的。因为对公司来讲,他们关心的是能产出重要技术的人,而重要技术根据我们的分析,大量都是年轻人做的。
即使是最近很火的 GRPO,以及千问使用的某些 GPU 优化技术,基本也是二十多岁的人做的。那就带来一个问题:既然这些东西是他做的,你从哪里找他?什么样的人有这个特质?
AI 是一场无限游戏。你需要永远在智力赛道上卡住位置,需要找到最优秀、最有想法的年轻人。他可能没有直接相关的经验,但这对很多机构来讲非常重要。
程曼祺
对这些年轻人来说,GitHub、Twitter 和 LinkedIn 这些已经存在很久的平台不够吗?
高岱恒
够,但问题是,很难把其中的有效信息筛选和整理出来,因为渠道太多元。
一个做 AI 研究的人,可能有 10 个社交媒体账号。我有一个朋友现在在西湖大学,我看他的主页,他有 Hugging Face、GitHub、Google Scholar、OpenReview、知乎、B 站、YouTube、X,甚至还有 Substack、Medium。
这些渠道都在产出信息,但怎么有效地把它们聚合起来,做成类似 LinkedIn 的东西?我认为这更有效。它解决的不是内容丰富度问题,而是分发问题。
这个人可能很厉害,尤其是年轻人,但因为来自一个大家不知道的地方,所以没有被发现。如果他不是来自清华、北大等最好的学校,发现机制就开始变得困难。
北美已经有一套比较完整的人才查询系统。有些公司的招聘人员会经常在顶会和开源项目中寻找值得他们付出千万年薪 offer 的候选人。
程曼祺
但这个人群的供给也在迅速扩增,因为大家都想成为那样的人。
高岱恒
对。过去 AI 的方向收敛到几个具体方向,但今天有非常多的细分方向:AI 和科学的结合、AI 基础设施、图像视频、语音模型、双工模型,都是新的方向。
你需要人来做,也需要有人去调配几百张甚至几千张卡。怎么找到适合的人,变得非常重要。
我们可以把这些人叫作造 F1 赛车的人。最近 小龙虾机器人爆火,你会发现,不但造高达、造 F1 赛车的人值钱,能做出有创造力作品的人也开始越来越受关注。
比如 2025 年 Claude Code 的作者 Boris Cherny,他在我的视野里就像 F1 的车手或者高达的驾驶员。
程曼祺
你说造 F1 赛车的人,是指做 AI 研究的人;驾驶的人,是指使用这些研究成果的模型能力,做应用和更具体产品的人?
高岱恒
对。因为他们对大众的影响力比研究员更高。
我自己做过一个调研,经常在 X 上看到研究员或教授宣传自己的作品。你会看到一条推文下面有几百个点赞,评论只有两三条,而且清一色是“恭喜你”,没有什么营养。
但像最近很火的 小龙虾作者 Peter Steinberg、原来在特斯拉的安德烈·卡帕西,以及 Claude 的作者 Boris,他们推文下面的点赞和评论比非常惊人,可以达到 1 比 4、1 比 5。一条评论对应 4、5 个点赞,几千个点赞对应大几百条评论。
程曼祺
从研究角度来讲,很多人会觉得,我要研究的东西到底有什么用,它可能不是立竿见影地看到直接收益,所以觉得离自己很远。
但当他看到一个具体任务,对人生效率产生巨大影响,比如整理邮件、联系别人、订外卖,他就会觉得这对生活产生了影响,想试一试。
所以从影响力角度来看,很多时代里都是车手本身比制造 F1 赛车的工程师影响力更大。
高岱恒
我也觉得这背后是 AI 阶段演进的变化:什么样的人在人才市场上更受关注,或者在舆论和社交媒体上的影响力更大。
前一段时间,大家看到 OpenAI 做出成果,更多公司开始投入。那时首先要对标和追赶这个能力,研究人员很重要。模型能力到了一个水平后,下一步自然就是做应用。
比如 Claude Code 的开发者,他其实是独立开发者,不在一家公司里。他已经财富自由,只是因为太闲了才自己做。
程曼祺
你最开始是怎么成为 AI 研究员的?怎么通过开源社区的贡献进入大模型领域?
高岱恒
8. 从开源贡献走进AI
我的路线确实不是规划出来的。当时我只是觉得,如果继续学原来的方向,未来可能连工作都找不到。
程曼祺
什么时候?
高岱恒
2017 年。那时市场上正好有一波 AI 课程和新闻。
程曼祺
那是上一波 AI 热潮,2016 年刚刚有 AlphaGo。
高岱恒
对。那时候最有代表性的就是吴恩达老师的 AI 课程。我上完他的课之后,具体技术已经忘光了,但有一句话印象很深:只要按部就班学完他的公开课,就会超过硅谷 95% 或者 99% 的工程师。
我估计很多人没信,但我那时候真的信了。毕业后我也在找相关工作,进了一家公司。工作过程中发现,大部分工作内容没有那么难,主要是图像检测、目标理解、行人重识别等任务。
这些任务对我来讲相当简单。于是我就想,能不能做点什么,让自己的经历增值。
那时候我看到 PyTorch 这个深度学习框架。2018 年我就明显感觉到,它的潜力比当时深度学习框架的巨头 TensorFlow 强很多。
最大的一点是,PyTorch 可以在编写神经网络的过程中随时断点调试。技术上叫动态图。TensorFlow 使用静态图,发现错误时可能已经浪费了很多时间。
于是我就想,能不能在 PyTorch 里贡献一些代码,也许他们会把代码合并进主仓库。
程曼祺
你去贡献 PyTorch 这个框架的社区?
高岱恒
对。当时想法特别简单:如果我贡献了代码,无论谁训练模型,背后的代码里至少有我写的东西,我可以出去吹牛。
那时候我密集地和 PyTorch 的一些核心贡献者发邮件,比如 Thinking Machines Lab 的 Soumith Chintala,还有现在负责 PyTorch 的 Edward Yang。他是台湾人,在纽约。
程曼祺
当时大家交流是什么氛围?
高岱恒
主要就是发邮件。我会说自己对这个方向感兴趣,问他们这样修改是不是对的。
那时候 PyTorch 的贡献者非常少。相比之下,Google 的 TensorFlow 在 GitHub 上已经有六七万颗星了,但 PyTorch 当时好像只有一两万颗星。
最开始我对 PyTorch 的底层代码可以说是十窍通了九窍,一窍不通,根本看不懂。那我怎么贡献?我用了一个比较抽象的方法:逐个文件去看,想着里面总会有语法错误,也就是 typos。
比如一个单词拼错了。我找到了几个,就改了,他们也把修改合并进了代码仓库。虽然没有任何技术含量,但当时给了我很强的正反馈,所以后面就一直做开源。
有了正反馈,很自然就会进入下一个阶段:不能一直做这种事情,要做真正有价值的东西。后来我开始做图像、视频方面的技术开源,大概就是这样。
程曼祺
你能进入达摩院,是因为 2017、2018 年那时候达摩院按照作品找人吗?
高岱恒
我觉得不是。包括现在,很多地方还是看学历来筛人。因为按学历筛人,最大的原因是大部分人没有代表作,也没有 signature paper。
程曼祺
那你自己是通过什么项目?
高岱恒
我自己是通过一个换脸项目,英文名叫 DeepFaceLab。
我一直不知道自己的定位是什么。我没有经历过一天所谓科班的科研训练,直到有一些东西做出来,有人主动联系我,说你可能适合 A 工作,适合 B 工作。
但在我的下意识里,我会想:这种工作不是应该清华、北大的人去做吗?它对我来说很神秘。
程曼祺
DeepFaceLab 是什么时候做的?发布之后有哪些出人意料的反馈?
高岱恒
我参与这个项目应该是在 2019 年,主要做算法部分。它一句话的介绍就是,让不懂技术的人可以在电脑上通过点击鼠标,合成影视级的高质量换脸效果,不需要懂任何代码。
那时候这个项目比较火,因为 2018 到 2020 年,AIGC 应用还没有特别出圈,除了 Deepfake。
做完之后,第一个机会应该是在 ICCV。2019 年 ICCV 在韩国首尔举办,当时的 Facebook,也就是现在的 Meta,举办了一个深度伪造人脸挑战赛。他们看到我在项目里贡献比较多,就来问我要不要聊一聊。
后来一些朋友也会说,你完全可以去字节这样的公司。让我觉得非常舒服的一点是,当你有了作品,就没有人会面试你写代码,因为那已经不重要了。
我没有特别严格的计算机基础,也没有人问学校和专业。技术负责人不会管这些,HR 可能会问,但那是公司最后决策层面的事情。
这让我觉得很爽。它的正外部性很强:你做完之后不需要再跟别人解释,因为你已经证明自己真的能干。
程曼祺
你后来开始对 AI 人物特别感兴趣。我知道你从 2023 年底开始写 AI 人物英雄传,那时大家还没有那么关注 AI 研究员。你对这群人的兴趣是怎么来的?
高岱恒
9. AI英雄的传奇来源
我最开始对这群人产生兴趣,有一个特别具体的原因。
2019 年我做换脸,所以一直研究最先进的生成技术。那年最先进的生成技术之一是风格生成对抗网络 StyleGAN,是英伟达做的。
当时它的代码只在 TensorFlow 上有,所以我想,能不能把它迁移到 PyTorch?于是我开始做迁移,也做出了 PyTorch 版本,大概有几百到一千颗星。
在这个过程中,我被代码质量深深折服。我想,这么好的代码是什么样的人做出来的?
我原来以为作者可能是英伟达湾区总部一个三四十岁的白人,结果发现他来自英伟达赫尔辛基研究院,是一个北欧人,而且甚至没有大学文凭。他叫 Tero Karras。
我觉得特别厉害。后来我又去了解更多,就发现对 StyleGAN 贡献最多的人,当时还在波兰华沙大学读大三,叫 Adam Paszke。他现在应该在 Google 做深度学习框架 JAX。
我就觉得这些人都很神,于是想了解他们更多的故事:这个人原来做什么,有什么信息可以挖。这是我工作之余的兴趣和消遣。
2019、2020 年,我也会和身边的人讲这些所谓的八卦,但很多人不感兴趣。有人可能是因为纯理工科思维,说听不懂。
所以这个事情变成我自己不停了解、自己和自己对话的过程。
程曼祺
所以从 2020 年开始,你就在陆续收集这些人的故事?
高岱恒
是的,也和其中一些人建立了直接联系。
比较有意思的是,我当时和 OpenAI 前技术联合创始人 Diederik Kingma 建立联系。他是荷兰人,现在在 Anthropic。
他也是从图像、视频方向做起来的,做过变分自编码器;深度学习里最重要的优化器之一 Adam,就是他参与的那篇论文提出的。这篇论文在 2015 到 2020 年间,是全世界所有学术论文里引用最多的论文。
当时他获得了一个学术会议的 Test of Time Award,我就发邮件祝贺他。因为他是荷兰人,我画了一张他的头像,配上荷兰风车,然后发邮件说很想认识他。
他觉得这件事特别好玩,于是开始和我通过邮件联系。
2024 年,我给他发过一封邮件,想听听他对未来的建议。那时候我也出来了,在想自己未来该做什么。他给的建议很明确:做 AI Agent。
程曼祺
那时候已经算比较早了。
高岱恒
对,差不多是 2023 年底到 2024 年初。他的逻辑很直接:如果做底层模型,问题不只是技术,而是基础设施。比如训练一次需要一千张卡,这不是一个算法工程师能解决的问题,需要进入有这种能力的公司。
但做 AI Agent 主要依靠创造力和个人能力。只要个人能力足够强,就能做出很好的东西,没有什么能拦住你。我很喜欢这一点,于是开始研究这个方向。
程曼祺
我发现你比较感兴趣的人物,都是背景和成长路径与想象中最典型的情况不太一样的人。
高岱恒
这种东西能让人有很深的记忆。如果一个人的成长路径一帆风顺,从小一路学霸,拿了各种计算机或数学金牌,就很难产生人物张力。大家会觉得这个人太厉害,和自己没什么关系。
你会被这种反差和戏剧性吸引,我觉得每个人在某种程度上都会被吸引。
比较有代表性的就是,大家可能知道 GPT 之父 Alec Radford。他发布 GPT 的时候,只是一个二十多岁、来自波士顿近郊、毕业于富兰克林·欧林工程学院的本科生。
程曼祺
你可以讲讲,不一定所有人都知道这个故事。
高岱恒
Alec Radford 当年进入 OpenAI 时,OpenAI 很多人都在做强化学习。那时候强化学习是主流方向,大家获得了非常多正反馈:机器人拧魔方,或者打 Dota 比赛,都取得了很好的成果。
但当时只有他一个人在做 next-token prediction,也就是下一个词预测。这个东西做得磕磕绊绊,不能说完全没有成果,但有被拒稿的经验,也有实验效果很差的经验。
在一个大家都取得成果的研究型实验室里,我觉得他可能承受了很大的压力。他是 GPT-1 和 GPT-2 的主要作者之一。
我印象很深的是,他把 GPT-1 投稿到 ICLR,被拒稿了。后来 GPT-2 以 OpenAI 博客的形式发布,他可能不想让自己再承受投稿被拒的痛苦。
直到 GPT-3,才正式在 NeurIPS 上发表。可能他用了几年时间,才化解被拒稿的伤痛。每个人都遇到过这种事。
程曼祺
为了接触研究员,你做过什么最神奇的事?
高岱恒
我印象最深的是 2025 年 2 月,我去 OpenAI 门口蹲点。
当时有几个人我还没有采访到,比如 Jason Wei。那段时间我住在旧金山市区,离 OpenAI 办公室不远,坐公交就去了。
程曼祺
你为什么想采访他们?是为了什么目的?
高岱恒
我了解到 Jason Wei 的深度思考,也就是思维链技术,和他冥想时的想法有关,所以我很好奇这个过程到底是怎么发生的,想看看有没有机会和他交流。
当然还有很多其他人,比如 GPT-4o 的一位印度籍研究员,我也很感兴趣。但最后没有采访到,只是把我的宣传贴纸放到了他们的公告板上。
程曼祺
你怎么进去的?
高岱恒
他们有两层保安,一层是外面的,一层是里面的。最后外面的保安让我进去,去和里面的保安聊。
那栋楼原来应该是 Uber 的办公室。2025 年 2 月我去的时候,很多 Uber 的痕迹还没有擦掉。
程曼祺
你是怎么用社会工程学进去的?
高岱恒
我主要对外面的保安做了社会工程学。他看到我拿着传单,以为我要卖东西。我就给他讲我的逻辑:我想做一个类似文艺复兴时期记录名人事迹的 Giorgio Vasari 的角色。
Vasari 的存在开启了西方艺术史的一个阶段。我告诉他,这件事对于未来理解这群人非常重要。我们还会像记录达·芬奇一样,记录这群 AI 研究者。
我又告诉他,我远道而来,花了很多钱,终于来到这里。这样就营造了历史感,有一个宏大的目标,同时也讲述了自己的不容易。
他听完之后就说,知道我的目的了,于是放我进去和里面的保安聊。我说想看看有没有机会见到 Jason Wei,他们就让我在公告板上放了几张传单。
程曼祺
你没有找到 Jason Wei?你本来准备怎么找?靠认脸吗?
高岱恒
没有找到。我之前约到了一些人,但这些没有约到的人,我就完全凭运气,看有没有可能偶遇。
对我来讲,这算额外的奖励,所以采取了一种比较鲁莽的方式。
程曼祺
你不担心万一碰到 Sam Altman,他会觉得公司的安保出了大问题吗?
高岱恒
那不是好事吗?他觉得公司安保出了问题也行。
程曼祺
还有什么比较有意思的事情可以分享?
高岱恒
太多了。我讲一个技术。这个技术这两年,尤其是 2025 年,已经没有那么多人提了,但前几年非常火,叫 RAG。
程曼祺
现在也不是没人提,只是热度被 Agent 带下来了。
高岱恒
对。前两年大家逢人必提 RAG,但现在热度低了。
我当时写它的故事时,觉得特别有意思。RAG 的作者 Patrick Lewis 在英国伦敦大学学院读完博士,最开始在一些小公司工作。大学毕业后,他去过越南,在欧洲旅居了很长时间,应该有半年到一年。
某种程度上,这可能代表他对教育体制感到疲惫,需要休息。他的运气很好。2017 年 1 月,他加入了一家叫 Blue Sperry 的医疗公司;同年七八月份,这家公司被 Meta 收购,于是他进入了 Meta。
2020 年,他做出了 RAG。现在他应该已经去了 Cohere,也在做相关工作。
程曼祺
这个故事有意思的地方是什么?
高岱恒
很多事情不是规划出来的,可能就是稀里糊涂地通过一次收购发生了变化。他之前的工作都不算特别好,但因为公司被收购,进入了 Meta。
他之前比较随性,去国外旅行,也在小公司随便做一做。可能正是这种状态,让他有机会在最新一节发现好的技术创新。我觉得这可能有关系。
程曼祺
一些创新有时候确实来自边缘地带。凯文·凯利也写过类似的东西。
高岱恒
对。创新有时需要一种状态:你一直在想着这件事,但又处于相对放松的状态。可能是散步,或者像他在越南一样处于旅居状态,也可能是冥想。
人在精神状态放松,但又在思考长期问题时,可能会产生创新。
程曼祺
牛顿当时的发现,不也是为了躲疫情,去乡下避难时写出了最重要的几篇论文吗?
高岱恒
对。当然他之前肯定已经思考了很长时间。首先是进入这个上下文,然后在相对合适的环境里沉浸下去,让生活和工作达到平衡。
如果进行优化,在复杂系统里,优化任何一个点都没有尽头,更何况要优化整个复杂系统,就更难了。
程曼祺
牛顿也是一个很有故事意识的人。关于苹果砸到他这件事,有很多历史证据证明,应该是他自己编的。
高岱恒
对,就是苹果砸到他,让他产生万有引力灵感的故事。欧洲人可能比较会给自己的经历添一笔传奇色彩。
还有一个有意思的事情是 Llama。Llama 的作者 Hugo Touvron 是法国人,29 岁时做出了这个模型。
为什么提 29 岁?因为他应该是 1994 年出生,2023 年正好 29 岁。你自然会想到法国大文豪雨果,以及巴尔扎克、福楼拜那个时期。
雨果在 29 岁时写出了人生最重要的作品《巴黎圣母院》,而他下一部很有名的作品《悲惨世界》,是在年纪大很多时写的。
你把这些联系起来,就会觉得像命运的联动,啪的一下开始触电了。如果讲得不好,它就是一个很平常的故事;但如果讲得足够好,就会变得很有意思。
程曼祺
你还挺能联想。
高岱恒
我确实挺能联想,也觉得这样很有意思,所以能记住。
程曼祺
你是理工科背景,为什么会对故事这么感兴趣?
高岱恒
我不知道,可能与生俱来。我就喜欢这些东西,看一遍就能记住。对很多细节的挖掘,对我来说是一种享受。
比如前一段时间,Thinking Machines Lab 有 3 个人离开,其中一个人叫 Luke Metz。为什么要单独提他?因为他是 GPT 之父 Alec Radford 的本科同学。
程曼祺
就是富兰克林·欧林工程学院?
高岱恒
对,富兰克林·欧林工程学院。这个学校好像 2000 年代才成立,很多人可能不太了解。
程曼祺
张一鸣应该很了解这个学校。他和欧林有什么渊源吗?
高岱恒
他应该和上海交通大学的老师一起,办了一个参考欧林工程学院模式的机构,也就是知春创新中心。
程曼祺
是和上海交大的于勇老师一起做的?李泽湘也经常提这个学校。
高岱恒
对。东莞松山湖机器人基地的创始人李泽湘老师,每年都会组织人去欧林考察,因为他觉得欧林是很好的新工科教育典范。
程曼祺
这个可能和 AI 的关系没有那么直接。
高岱恒
是的。但这个学校确实培养了很多计算机人才。在这个时代里,培养得最厉害的人肯定就是 Alec Radford。
Alec Radford 和 Luke Metz 是本科同学。他们毕业之后一直在波士顿创业,创业过程中认识了后来去 Thinking Machines Lab 做 CTO 的 Soumith Chintala。
他们当时一起做了一篇图像生成领域非常重要的论文,叫 DCGAN。
这项技术还引发了一点矛盾。2016 年 4 月的 GTC 大会上,黄仁勋把这项技术归功于 Meta,因为 Soumith 当时已经在 Meta,等于忽略了 Alec 和 Luke 的贡献。
他们当时可能想:我们再努力、做出再好的东西,别人也不相信 AI 技术会来自波士顿的人。所以他们必须去湾区。Alec 去了 OpenAI,Luke Metz 去了 Google。
后来他们又在 OpenAI 重逢了一段时间。再后来 Alec 开始退休。2025 年的新闻说,他去 Thinking Machines Lab 做顾问了。
程曼祺
那我随便说一个想了解的人,你会知道吗?如果你看过的细节都记得的话。
高岱恒
不一定,我真的不一定。
程曼祺
比如 Ilya 有什么有趣的故事?
高岱恒
Ilya 的故事被写得比较多了。Hinton 的故事也挺有意思,可以从他的祖先讲起,但讲他故事的人太多了,已经非常全面。
他确实算学术世家,家族很传奇。他的姑姑韩春好像还来支援过中国革命。
程曼祺
这种大家已经知道了。
你和这些人接触的过程中,有没有看到他们追求什么、害怕什么、讨厌什么?
高岱恒
10. 研究员如何面对挫折
这个问题特别好。我之前没有仔细思考过,现在凭直觉可以说几个观察。
第一个是抗挫折能力。什么意思?当你研究某个方向时,它可能很难出成果,不像同龄人做的其他方向,很快就能获得正反馈。
这种情况下,你要不要坚持,能不能继续做这个方向,是一个很大的战略定力问题,也就是能不能抵抗挫折,能不能坐冷板凳。
哪怕在今天,代码都可以用 AI 写,我觉得这个能力仍然非常重要。因为如果你选择一个热门方向,可能花了很长时间,做的也只是跟随性工作。
但对他们来讲,更关心的是自己做的东西有没有影响力,能不能真正影响尽可能多的人。也就是说,他们更关心能不能开辟新的方向,而不只是跟随。
探索过程中会有很多苦闷和痛苦。因为想开创新方向,所以他们普遍会遇到挫折,需要经历一个对抗挫折的过程。
程曼祺
你说的就是有引领性,不仅是跟随,而是开辟新的方向。
高岱恒
对。第二点是,他们不太关心商业名人或 CEO 这样的人。
外界可能会说,你真厉害,但他们好像不太追求这种东西。他们更关心的是,你对他的研究方向,或者过往发展路线,是否真的感兴趣。
如果你找一个人,和他讨论非常具体的未来发展方向,他们很愿意聊。
所以如果你要和他们建立联系,最好谈一个具体的事情。你说“你真的太厉害了,你影响了我们这一代人”,这种很宽泛的恭维,他们据我的观察不是很感兴趣。
程曼祺
这对需要联系这些人的人来说,是一个很好的提示。无论是公司的招聘团队,还是想招人的 CEO,都应该和他们聊具体的研究问题,而不是宽泛地恭维。
高岱恒
是的。我觉得每个领域比较顶尖的人都这样。
另外,他们可能普遍比较低调。真正做出成果的人,在社交媒体上往往是观察者,自己很少主动发东西,但其实非常活跃,会给别人点赞、评论,或者参与讨论。
当然也分人,现在越来越多研究员会主动发观点。
程曼祺
你说的那一波,是指 2020 年之前或者 2020 到 2023 年这一波吗?
高岱恒
对,热潮之前那一波。包括 Llama 的作者 Hugo Touvron,基本上也在社交媒体上销声匿迹。
但现在这些在公司工作的研究员非常活跃,因为竞争更激烈了。可能声音大一点,就能让扎克伯格看到自己,然后在 Twitter 上挖人。
程曼祺
你觉得钱对这些人意味着什么?比如 Meta 祭出天价挖人的策略,它到底是在打动谁?
高岱恒
我说实在的,我不知道。人类历史上很少有一个时期,搞智力的人能够拿这么多钱。
对大部分人来说,据我了解,他们其实比较发懵。第二个反应可能是:我拿这么多钱,赶紧悄悄干活,尽可能多挣几年,然后退休。
程曼祺
你是直接接触过一些拿到高薪 offer 的人吗?不用讲名字。我想知道他们是什么心态。可能偏向你说的这种,干几年就退休?
高岱恒
对,比较偏这种心态。
程曼祺
可是他们很年轻,三十几岁就退休了?
高岱恒
那时候就可以做自由研究,摆脱 KPI 驱动的研究。
今天的研究,某种程度上还是要在一些任务和基本测试上取得特别好的性能。而这些研究非常卷,会带来很大的心理压力。
压力不只来自模型或者调参,也来自今天你跑实验用了 4,000 张卡,生怕实验跑着跑着挂掉。这些压力会无形中侵占一个人的各方面时间,让人很难轻松。
所以这种高薪,某种程度上也是对这种压力的补偿。
程曼祺
从大型语言模型公司的角度,它最大的开支肯定是算力成本。如果找到足够优秀的研究员或研究团队,他们可以在技术判断和实验设计上做得更好,也许能大幅提高算力利用效率。
从公司的经济角度算,应该是合理的。只是这种超出想象力的薪资,可能会怎么改变这些人的心态?
高岱恒
我不知道。它有没有可能包含一部分对未来很多白领工作工资的替代,我也不知道这个东西会发展成什么样。
程曼祺
你觉得这些人的弱点是什么?
高岱恒
说实在的,我不知道,没想过这个问题。
程曼祺
你觉得现在什么样的人最能在这个领域有所建树、做出成绩?
高岱恒
最大的一个点就是,你得真喜欢,愿意坚持。有挫折、有不顺利,也觉得没问题,能够坚持下来。
不太适合那种遇到一点问题或挫折就说“算了,我不弄了”的人。因为这个领域本来就是实验科学,会有很多错误和不顺利。
有一颗平常心也很重要。有时候你对某个方向取得成果有特别强的执念,反而可能什么都拿不到。这是一个平衡。
一方面,你要对这个方向有长期信念,或者凭技术品味判断它值得做;另一方面,在每天的工作里,不要过于执着短期结果。
程曼祺
也就是说,对方向要有长期判断,但每天的工作不能过于执着短期结果。
高岱恒
对。今天训练的模型效果可能不行,可能是数据问题、集群问题、参数优化问题,也可能是 MoE 里的各种细节问题。
事情太多了。如果每个点都让自己精疲力竭,就会把自己累死。所以要有平常心,尽最大努力,享受这个过程,去尝试就好。
这还是一场无限游戏,为什么非要执着于明天拿到第一名?即使拿到,也只是短暂的第一名。
你也需要给自己营造一个小环境。你所在的团队、公司,以及同行的进展,都会影响你。最好和一些志同道合的人建立联系。
程曼祺
对个人来说,你要有一个分发渠道,或者个人品牌,别人才能更容易找到你、对你感兴趣。
你们现在做的 DINQ,我理解商业模式是帮助公司找人,或者做公司和人才之间的匹配。可以分别讲讲,在匹配过程中,各方分别看重什么吗?
高岱恒
11. DINQ连接人才与机会
从公司的角度看,大家都在追热点。比如现在 Personal AI Agent 比较火,他们希望找到在这个方向上有成果的人,无论是论文、代码、项目,甚至博客都可以。
我们提供的是一种多元、异构数据的聚合模式,让公司可以通过自然语言找到这样的人。这是平台的价值。
对个人来说,我们最大的价值是提供一个低成本的分发渠道。尤其是年轻人,如果他的水平比较高,或者潜力比较高,就更容易被 OpenAI、Anthropic 或 xAI 发现和接触。
你可以把它理解成一个更高效地连接机会的平台。
程曼祺
你们能观察到哪些团队和人匹配成功,已经开始合作了吗?
高岱恒
我们现在还没到那一步。目前产品只是信息聚合、展示和搜索,之后会一步一步做到匹配。
程曼祺
招人方使用是免费、订阅,还是按次付费?
高岱恒
找人这件事,本身把信息聚合起来,再提供给用户相似的用户画像,需要消耗很多 token。国外已经有一些公司在做类似事情,也有比较好的现金收入。
程曼祺
你可以分享一些数据洞察吗?刚才提到,招聘中有很多人在找 Personal Agent。更完整地说,还有哪些招聘趋势?另外,愿意来你们这里注册、展示自己信息的,是什么样的人?变化趋势又是怎样的?
高岱恒
国外普遍的做法是,CTO 或招聘经理拿着非常具体的论文来到平台上搜索。他会说,我给你这篇论文,你帮我找作者的联系方式,或者把相关方向的人找出来。
国内更倾向于说,我想找在某个学术会议或某个方向上,热门项目或模型里有贡献的华人。可能因为中国有年龄限制,有的人会说,我想找 1995 年以后出生的人。
我们就根据条件把人找出来。
对于个人,典型的是数据比较丰富的人。他有各种渠道,平台可以把这些渠道聚合起来。
英文里有一个词叫 linking well,意思是简历由各个渠道聚合而成。澳大利亚有一家叫 Linktree 的公司,就是为 KOL 聚合各种渠道信息。
现在做 AI 的很多人信息也非常多、非常杂。把这些信息聚合起来,形成有效展示,效果会很好。可以放视频、图像,也可以交错呈现。
程曼祺
目前平台上什么方向的人比较多?
高岱恒
现阶段还是我们说的造 F1 赛车的人比较多。
程曼祺
你刚才说,中国公司可能会根据一组条件找人,美国公司则会按照具体论文搜索。你觉得哪种效率更高?
高岱恒
肯定是前者效率高,因为本质上已经锁定了一批具体的人。
比如我今天就要找懂 AI Agent 工作流调度的人,或者做 Flow 的人。画像很明确,找到之后就知道他满足条件,可以直接联系。
比较泛的需求就会出现一个问题:第一次找出来的人不满意,需要多次和 Agent 迭代。可能第一次找出来的人差点意思,就再调整特征,增加一些条件,去掉一些条件。
但 Agent 的作用,就是无论用户输入什么样的问题,都通过对话理解用户想找的人,并帮助建立联系。这就是平台的价值。
程曼祺
在中国的这些 AI 团队里面,什么公司的人被搜得最多?
高岱恒
目前肯定是千问,千问的人被搜得最多。
程曼祺
不是 DeepSeek 吗?
高岱恒
现在不是。
程曼祺
你说的是美国公司会搜千问的人?
高岱恒
对。如果是美国公司搜索,主要是千问或者 Kimi 的人。
程曼祺
他们是直接把人从中国招到美国吗?
高岱恒
搜索出来的情况是这样的:他们不是直接搜索“某某团队的人”,而是搜索“我想找懂这个方向的人”,可能还要求他在某个研究机构工作过。
我们的 Agent 会理解为,可能来自千问、Kimi 或者某个团队的人更适合这个需求。
程曼祺
所以,被搜到的人很多是千问和 Kimi 的?
高岱恒
对,因为他们确实比较满足这种需求。
程曼祺
我觉得 DeepSeek 被搜得比较少,可能是因为 DeepSeek 的人在公开网上的信息相对少,尤其很少看到他们在 X 上发东西。
高岱恒
好像确实如此。DeepSeek 官方 Twitter 账号有很多关注,但内部特别活跃的研究员似乎比较少。反而 Kimi 和千问的人发得更多。
这可能也和每个团队 Leader 的风格有关。千问的林俊旸自己在社交媒体上比较活跃,梁文锋显然是非常隐身的人。
程曼祺
如果从关键词角度,直接搜索“想找哪个公司的人的话”,被搜得最多的团队是什么?
高岱恒
国内公司相对少,大部分还是国外公司。搜 Meta 的比较多。
最近视频和多模态理解开始变得热门,大家想了解 Veo 3,以及这个团队里有哪些人。还会搜 Runway,或者德国的 Black Forest Labs。
大家会关心某个模型背后的贡献者是谁。
大部分人搜得很具体。搜机构、组织的情况相对少。中国用户可能会这样搜:我想找一个斯坦福毕业、发过 3 篇论文、2000 年以后出生、又很有干劲、社交媒体活跃的人。
这时 AI 就会分析什么算顶会,最近一年有哪些 NeurIPS、ICLR、CVPR 论文,然后把人找出来。
程曼祺
中国人这么搜,反映了什么思维?
高岱恒
我不太知道,只能从用户查询里感觉到一点:中国人某种程度上还是看重学历。
虽然学历越来越弱化,但他们还是希望有一些锚定物,认为从好大学博士毕业的人很厉害,希望找这样的人让团队更上一层楼。
然后用一些具体指标,把不满足条件的人卡出去,可能体现了这种思维。
程曼祺
有时看初创团队的 BP,团队那一页经常会写创始团队来自斯坦福、CMU 等学校。
高岱恒
我觉得这可能是中国人的思想惯性:我怎么着也得把学历刷一下,往上顶一顶。
有时团队未必觉得这个事情很重要,但他们会认为投资人觉得重要。因为很多资源某种程度上掌握在好学校的老师手里。
如果你有机会跟着他读博士,或者本科期间进入他的研究组,确实是一个很大的优势。
现在 MIT、斯坦福都有 AI 专业。从 2025 年开始,加州一些公立学校,比如圣地亚哥分校,也开始开设 AI 专业,本科生人数越来越多。
我觉得看学历这件事,在概率上没有错。
程曼祺
你们的平台其实可以做定量分析:影响力靠前的人,成长路径和履历背景是什么样的?
高岱恒
这个时代确实有很多不拘一格降人才的故事。有的人没上过大学,有的人大学没读完,还有各种不同的成长路径。
但你要么是一个非常有能动性的人,不需要学历;要么就要在公开场合持续构建,也就是 building public。只要真的在做好的东西,一定有人会找你,这是必然。
不过这样的人可能还是少数。对大部分人来说,他们会没有安全感,会想:我今天做了这件事,明天能不能看到回报?
抱着这种心态,就需要选择一条稳定的路。稳定的路目前可能还是升学。升学可以认识比较好的人,获得相互支持和帮助,这是比较稳健的路线。
程曼祺
Building in public 的上限很高,但下限也可能很低。按照成熟的既定路线发展,至少大家觉得下限不会特别低。
高岱恒
但我们进入这个时代后,尤其程序员群体都意识到,AI 写代码的质量和综合能力已经比人强很多。
即使是 小龙虾的代码,据创始人说也完全是 web coding,也就是用 AI 写出来的。Cloud Co Work 也是类似的,Anthropic 说 Cloud Co Work 是 Cloud Code Web Coding 出来的,人主要负责架构设计、安全测试等工作。
这说明人类会更深地陷入存在主义危机。
程曼祺
你按照过去认为有安全感的路线发展,但职业市场的变化,很可能超过你的成长和适应速度。
高岱恒
当然。2025 年代码生成有很大进展,美国更明显,很多大公司出现大规模裁员。亚马逊一次裁了 1 万多人,前两天听说是 1.6 万人。
所以没有所谓的安全感。
我想起 Naval 在 2021 年发过的一句话:我们进入了全民创作者经济的时代。
这条路线可能有两种:第一是全民基本收入,Universal Basic Income,但到底能给多少钱没人知道。大家还是会问,我还能做什么,怎么让自己的生活有保障。
另一种是在蓝领工作,或者在白领工作里做一些需要创造力的事。创造力可能让自己获得注意力和收入。
现在程序员、开发者做 web coding,关键是能不能做出好玩、让人愿意使用的东西。
程曼祺
很多技术乐观主义者会把 AI 替代重复工作后,人类有更多时间投入创造性工作,描述成一个乐观的未来。
但王兴之前引用过一句话:“人为了逃避思考,可以做任何事情。”深度思考和创造力确实很难。
高岱恒
如果是一个小孩子,从小就在以创造力为目标的环境里成长,也许会有不同的体验。
但在现在的应试教育环境里,很多人的创造力在成长过程中被压抑,或者逐渐迷失。也许到了这个时代,这些东西会重新被激发。
程曼祺
新技术环境下,确实可能度过过渡期之后进入一个新的状态。但也许我错了,也许技术奇点到来之后,不存在过渡期,而是一路加速发展。
高岱恒
那也可能所有人都领低保,快乐地去公园散步。
程曼祺
或者发生更极端的事情。这个我们没办法预估,只能做好当下觉得重要、有乐趣的事情。
你研究了很多 AI 研究员和创造者,也就是造 F1 赛车或者开 F1 赛车的人。你觉得他们怎么看待自己正在做的事情,会对更广泛的社会和很多人的生活产生什么影响?
高岱恒
大部分人其实没有想太多。除了极少数像 Ilya 这样的人会想很多,大部分人想的是:怎么做到更高、更快、更强。
做视频的人会想,怎么一次生成几十分钟的视频,怎么实时生成,怎么让分辨率更高、画质更好、人物一致性更强。
做大语言模型的人会想,怎么降低推理成本,怎么让自己的模型拥有像 Anthropic Claude 4.5 一样的智力能力。
很多人关心的是这些。
程曼祺
你们做 DINQ 也是解决工作匹配和人才匹配的问题。AI 越来越强之后,这件事本身会怎么改变?
未来可能更多智力工作会被拆分。比如过去我要找一个人帮我分析业务,或者做微调、RL full training,肯定要雇一个人,给他很多钱。
但未来可能只需要雇一个人,用一周把事情搞定。那会造成什么样的组织形态和就业方式?会外包化、顾问化,还是别的形式?
高岱恒
也许以后不是人和公司匹配,而是人和一件事、一个任务匹配。
过去智力劳动最困难的点是需求不清楚。甲方自己也不知道要什么,所以需要招标,甲方和乙方不断磨合,把需求确定下来。然后乙方可能工作半年、9 个月或 1 年,最后交付。
今天,干活的 9 个月或半年可能压缩到几周,需求对齐在模型帮助下也会变得非常容易。
程曼祺
有没有可能出现智力劳动的外卖化或者滴滴化?
高岱恒
我不确定。
程曼祺
你们做 DINQ,广义上是招聘平台。你对未来招聘市场有什么推演?
高岱恒
我更倾向于刚才说的逻辑:招聘会变得越来越快、越来越零散。大家之间可能没有所谓的责任和忠诚度。
这个世界会变成 6 年前的世界。过去跳槽会看是不是“五年三跳”,现在已经没有人关心这个问题了。
尤其对程序员和 AI 人才来说,很多顶尖研究员本来就符合“五年三跳”的状态。
程曼祺
如果整个市场变得非常零工化、流动性很强,提供人才匹配服务的产品会怎么发展?
高岱恒
我认为它会收敛到一些非常具体的指标。
比如我们做了一个功能,看你的 Claude Code token 消耗量。这个指标可以说明,你可能经常做 web coding。因为 web coding 多了,就会和 AI 交互、获得反馈,也会得到奖励或者负面奖励。
以前 Cursor 也用过类似指标招人,招了一些早期产品的重度用户。
如果一个人经常在这里消耗 token,他一定有事情在做,肯定是相对有想法的人。
对大部分非头部工作来说,大家关心的不是你是谁,而是你到底能不能解决问题。
现在很多 AI 初创公司关心的是,你是不是 AI native;甚至会问 token 消耗量、用过多少产品、体验如何、做东西时有什么经验,或者个人任务自动化率是多少。
程曼祺
像你们这样的产品,什么时候会扩散到 AI 领域之外的更多工作?
高岱恒
我认为会很快。白领工作应该会比较快。
如果很多工作真的都零工化了,就需要接单、宣传和渠道。今天在抖音、TikTok、小红书上接单的人,本质上就是这群人。只是来到我们平台后,我们也会帮他们匹配机会。
程曼祺
你觉得你的同行是谁?广义上的同行。
高岱恒
内核比较接近的,我相信是摩客这个平台。
很多人会问,你们怎么好像在做两件事:一件是搜索人,一件是做匹配;而且你们还给 C 端做东西。
但我觉得它们的内核是一样的。C 端产品只是让匹配引擎效率更高,把 Agent 做得更好。今天它可以做需求和人的匹配,明天就可以做人和机会的匹配,这是一个可逆的东西。
程曼祺
你说内核是 C 端,是指那些有创造力、有工作能力的人,是你们第一服务对象?
高岱恒
对。未来要把他们匹配给各种东西。现在可能是一个公司、一个团队,以后可能是一份工作,或者一个短期的零工项目。
程曼祺
你们已经开始做匹配短期项目了吗?
高岱恒
还没开始,这是一个新功能,预计 2026 年四五月份上线。
程曼祺
最后,请你总结一下。对于现在做 AI 研究和 AI 开发的人,作为前 AI 研究员、现在的 AI 公司创始人,你有什么想说的?
高岱恒
在这个时代,更应该关心个人发展,也就是个人的通用性。
过去大家会想,我进入一家公司,升职加薪,爬所谓的梯子。但未来,如果是编程、研究员或者开发者,这些身份可能越来越不重要。
最头部的公司也没有特别明显的职级划分,统一叫 MTS,也就是 Member of Technical Staff。大家都叫工人,都是工人阶级这样。
这个阶段,更重要的是把自己的生活照顾好,让自己处于开心、健康的状态,然后享受每天和 AI 的碰撞。这样也许能做出一些好的想法、玩具或者产品。
程曼祺
这还挺激励人、安慰人的。虽然在这么残酷的竞争里,可能比较难,也需要很强的心态调整能力。
高岱恒
心态很重要。今天写代码,大部分人也写不过 AI,过去锤炼的很多价值,在细分领域已经被 AI 超越了。
人的价值会更多变成人独有的价值,比如和人沟通、在组织里做协调、进行判断。这些能力不是一天工作 16、17 个小时就能线性提升的。
就像 DeepMind 负责人 Demis Hassabis 说的,也许再过几年大家都没有工作,都领低保了。那身体不是更重要吗?
马斯克也有一个建议:保持健康,等待人类普遍长寿的阶段到来。把身体搞垮,其实没有太大意义。
程曼祺
OK,那今天非常感谢 Sam 做客晚点聊,分享了他自己从研究员到开始创业做 Dink 的经历,他对 AI 研究员还有 AI 开发者这个群体的痴迷,收集了很多的故事,以及和这些顶尖的研究人员是怎么建立联系的,和现在这个时点 AI 人才市场的一些变化。那今天节目就到这里,感谢大家的收听,拜拜。
高代恒
谢谢。
程曼祺
本期零点呈现推荐第一百三十四期,我和 Poki 的 AI 的创始人朱哲清聊 Meta 当时的 AI 人才和组织变化。朱哲清创业前在 Meta 工作了七年,那期也讨论了本期涉及的几个主题,一是最顶级的 AI 研究者在追求什么,朱哲清当时的答案是能成为促进 AGI 出现的那个时刻的一份子,而且是核心的一份子。换言之,如果将来有一篇被称作 AGI 的论文或一个被认定为 AGI 的模型,他们希望自己的名字出现在作者里。这和我们这期聊到的研究者其实有一些像文艺复兴时期的大师,他们在追求自己的代表作是有一点相似的,也和本期的嘉宾高代恒类似。朱哲清聊到了个人和小团队在 AI 前进中的重要作用。当时我们是在讨论,不论中美,绝大多数的资源和人才看起来都在投入优化大语言模型这个方向,少有人去开辟新的方向。后来伊利亚也在公开场合中说到,他说大语言模型和 skilling 抽走了房间里的所有空气。我当时就问朱哲清,这是不是和重大技术的更新本身隔一段时间才会出现有关,是有周期的?他说他不太认同周期,他认为很多时候一个创新如果往前溯源,就是因为某一个人或者某个小团队突然决定要挑战既有的方向,去提出或解决一个新问题,只是这件事的风险特别大。在现在的环境下,你可以选择加入大公司,用更多资源去快速的做实验和迭代,但这就不得不受限于公司想投入的方向。你也可以选择坐冷板凳,但确实有可能没有成果。后来我们也可以看到这种张力在持续显现,比如二六年年初,在 OpenAI 待了七年的元老 Jerry Toric 离职后就说 OpenAI 已经没有做高风险研究的空间了,因为所有主要的 AI 公司都面临多重压力,既要驱动用户增长,又要承担昂贵的 GPU 成本,还要拼模型的第一。一百三十四期还有一些有意思的讨论,比如工程性人才会决定公司未来两到三年的发展,科学家型人才会决定公司未来十年的发展。但是很多公司有可能活不过眼前的两到三年。我们也聊了一些不同公司的风格,比如 xAI 更偏工程驱动,Google 更偏科学驱动。后来也可以看到 xAI 近期也发生了很多人事变动,马斯克请走了许多早期的成员,他认为 xAI 到了更加规模化拓展的下一个阶段。本期节目就到这里,欢迎收听。如果你对今天聊的话题有观察、好奇或疑问,欢迎在评论区分享想法,这也会成为我们节目的一部分,让整个讨论更完整。你也可以把我们的节目分享给对这个话题感兴趣的朋友,欢迎推荐更多你想听的主题和嘉宾。你可以从小宇宙、苹果 Podcast 等渠道关注“晚点聊 Late Talk”,也欢迎关注我们的公众号“晚点 Late Post”,下期再见。