张小珺
Hello,大家好,我是小军。今天我们的嘉宾是尤凯超,他是创业公司 Infra 的联合创始人兼首席科学家。那这个公司很特殊,它是从伯克利一个校园开源项目 vLLM 演化而来。这个社区的核心维护者用了将近三年的时间把它从一篇算法论文变成了一个开源社区,又变成了一个公司的正常运营。这些维护者们放弃了大量的个人诱惑,坚持着他们所相信的开源精神。那今年初呢,Infra 也获得了一点五亿美元的种子轮融资。所以我们也讨论了当一个寄托着社区情怀的开源项目变成一个商业化的组织运营之后,它所面临的抉择、转变与思考。那另外一方面呢,我们也非常希望在 AI infra 的技术前沿上给大家带来一些新的思路,所以我也和尤凯超聊了聊,在 AI infra、模型结构,甚至连 harness engineering 都要联合设计的时代背景之下,那这个多方的联合设计应该怎么做?那接下来就是我对尤凯超的访谈,期待二零二六年我们和 AI 共同进步。最后我们是怎么说动他的呢?就是就是晓之以情,动之以理。就是最后跟他说,你如果不跟我们一起创业,你赚到了很多钱,但是十年之后,为我们项目失败了,你是开心还是还是不开心?那么比如说有的地方水流比较湍急,有。有的地方水流比较平缓,那你在这两个地方怎么样去设计你的发动机,使得你的发动机能够更好的利用这部分能量?嗯,啊,这个就是所谓的这个模型和 infra 的 code design。那我觉得 DeepSeek 的这个身后的 infra 功底可能是来自于就是他们之前做换方量化的时候对这个性能的一些极尖极致的这个压榨。嗯,因为大家把 token 和电做一个类比的时候,可能会觉得就是电它是比较通用的,啊,电它是可以调制的,但是 token 它是没有办法去做调制的,就是你没有办法说把一个 DeepSeek 模型的 token 转化为一个 Kimi 的 token,这个 token 它是带着模型的烙印的。
张小珺
Hello,凯超,先跟观众朋友们打个招呼。
游凯超
大家好,我是游凯超。本科和博士都毕业于清华大学,现在是 InfraRact 的联合创始人兼首席科学家。
我现在的主要任务,是维护以 vLLM 为核心的开源大模型推理引擎生态。我们的目标,是为 AGI 提供软件服务。
我也是小珺播客的忠实粉丝。之前看到很多行业前辈和朋友来小珺这里参加播客,像张祥宇老师、杨植麟学长,以及 Manus 的季逸超,我们都很熟。我也很荣幸有这次机会,来这里跟大家分享一些自己的经历和看法。
张小珺
说到 Manus 的季逸超,其实凯超这次来我们节目,也是他帮忙介绍的。
游凯超
对,那是去年 12 月的事情。那个时候 Manus 还没有被 Meta 收购,但那段时间我也在忙着成立公司,所以虽然答应了要来,没想到一拖就是半年。现在终于来兑现承诺了。
张小珺
在正式聊技术之前,我们还是非常好奇,想先探究一下你个人的经历。你是从什么时候开始接触计算机编程的?初高中时有参加过竞赛吗?
游凯超
1. From Physics to Python
我大概是从 2015 年开始接触编程的。初高中期间,我的主要任务是中考和高考,副业会学习一些数学、物理竞赛方面的内容,提高自己的知识水平,算是一个比较典型的理科生。
竞赛方面,我的成绩也不算亮眼。物理竞赛拿过一个省级一等奖,但用处不是很大,对高考也没有太多帮助,所以竞赛结束之后我就继续准备高考了。我没有参加过算法编程比赛。
不过,我对计算机编程最早的了解,来自学习数学、物理时接触的一些辅助计算软件。印象比较深的是一个叫“几何画板”的软件,可以用它观察各种函数图像,也可以做物理仿真和动画演示。虽然现在可能已经没什么人知道这些软件了,但当时它给我带来很大的震撼,让我看到计算机可以做很多事情。
另外,清华大学在 2013 年推出了学堂在线,基本上是对标国外 edX 的在线教育平台。2014 年、2015 年的时候,我在学习竞赛课程,学堂在线请了很多清华老师录制教学视频。我一开始在上面学习大学物理,因为中学物理竞赛本质上就是大学物理加一些微积分。
学完大学物理和微积分之后,学堂在线刚好推出了和 edX 联名的 Python 课程,我就跟着学习了 Python。这算是我第一次认真学习一门编程语言。
虽然初中、高中阶段,我的主要任务是中考和高考,但我不太喜欢无意义的重复劳动,不喜欢刷题,更喜欢学习新知识。所以很多备考时间都被我拿来学习各种课程。题目比较简单的时候,考试可能不会考到这些知识,但我觉得学习这些课程,能够学到新的东西,也有助于我深入理解一些难题。这部分内容是没有办法通过重复刷题获得的。
我个人觉得,学到知识是一件比较满足的事情。虽然我那一年高考比较简单,这些能力可能没有体现在高考分数上,没有太多用武之地,最后我的高考分数也只是勉强擦着清华的分数线进来的。但我觉得整个学习过程还是很快乐的,确实学到了很多有用的知识。
张小珺
你刚进清华的时候,好像还不属于成绩最好的那一波。你的高考分数比清华录取线高了两分。后来你是怎么在清华实现逆袭的?
游凯超
我觉得不太好说是逆袭。高考分数可能比分数线高两三分,但我觉得这不能很好地反映一个人在大学里的发展,也不能拿它去预测一个人的大学经历。
分数更多只是一个 admission,也就是让你进入清华。进了清华之后,应该把这个分数忘掉,接下来去做自己想做的事情。
张小珺
你当时有多卷?我看到一些记录,说你一入学就开始疯狂追赶,大一给老师发了一百多封邮件请教问题,看了一万多页的学习资料,论文精读笔记还在校史馆展出。最后,你有 36 门课程拿到了 4.0 的成绩。
游凯超
这些都是比较老的历史了,已经过去很多年。但我觉得这不算卷,更多是因为我享受学习,也确实觉得自己在大学里学到了很多知识。
比如你说发一百多封邮件请教老师,其实是十多门课,每门课每周给老师发一封邮件,很快就有一百多封了。所以我觉得这更多是一个坚持的过程。
学习各种东西、做笔记,也是因为我觉得在大学里学到了很多内容,想把它们记录下来。我并没有把笔记的数量或者字数当成一个目标去优化,更多是一个自然而然的学习结果。
张小珺
很多人认识你,是从 vLLM 开始的。但你在清华读书时,研究方向应该是迁移学习,这和后来做推理系统看起来完全是两个世界。你是怎么从一个算法研究者,过渡到今天这个深度参与系统工程的人?
游凯超
这里面主要有几个原因。
2. Leaving Academic Algorithms
第一个原因,是我觉得现在的学术圈已经处在一种“礼乐崩坏”的状态。我刚接触人工智能研究,大概是在 2018 年。当时一届学术会议一年可能有几百篇论文,学术社区相对健康。投稿之后,审稿人会给出比较有建设性的反馈,告诉你哪些地方做得好、哪些地方做得不好,以及应该如何改进。大家是真的在认真讨论,怎样把一个工作做得更好。
后来,学术会议规模扩张的速度远远超过了社区成长的速度。人工智能会议的投稿数每年都呈几何级数增长,审稿人的数量和质量却远远比不上投稿数量,审稿质量也随之急剧下降。
你的投稿就像抽彩票一样,中或者不中,可能已经和工作的质量本身没有太大关系了。我亲眼见证了这个过程,只能说比较痛心。但大厦将倾,不是我一个人能够改变的,所以我离开了人工智能算法研究,不再把发表论文作为自己的追求。
张小珺
这个变化是什么时候发生的?是你读研的哪一年?
游凯超
主要是在研究生期间。2018 年开始做研究,到了 2019 年、2020 年,我逐渐感受到这个趋势;2020 年之后,趋势变得越来越严重。
这不是某一天突然决定不投稿了,而是一个逐渐的过程。我不断感受到这个变化,慢慢对投稿论文不再有那么大的兴趣。
第二个原因,是我发现人工智能算法领域的成果,很多时候依赖机器学习系统。
我们做研究时,认为人工智能算法领域的天花板,至少是我个人心中的天花板,就是何恺明老师。他的 ResNet 一战封神。后来只要何恺明老师的主页有变动,或者他在 arXiv 上挂了一篇新论文,我们这些学生就像收到了新的神谕一样:原来又有一个新东西可以做了。然后我们就去拜读何老师的论文。
那时我们私下讨论,经常会有这样的疑问:看完何老师的论文后,会觉得他的想法实在太自然了,浑然天成,好像一开始就应该这样设计。但类似的想法,我们可能也早就想过;实验室组会几个月前讨论这个问题时,也可能说过“这样设计是不是就可以了”,甚至做过一些小实验验证它有没有效果。
那为什么最后成功的是何老师?除了他个人非常厉害之外,我分析出来的一个结论是,何老师做的事情不仅方法简洁有效,还做了大规模实验。
我们实验室里的“小虾米”,往往只是在玩具数据集上做实验,有点像“螺蛳壳里做道场”:在一个小数据集上玩出各种花样,却没有做规模化实验。当我尝试把手头上的实验规模扩大时,一个显而易见的事实是,支撑实验的机器学习系统和对应的数据,才是决定成败的关键,而不是调 cross entropy 的五种加权方法。
这让我更加关注机器学习系统的进展。
第三个原因,是一些工业界朋友提供的反馈。上学时我很喜欢参加活动、结交朋友,和大家聊工业界正在发生什么。
印象比较深的是 2022 年的 WACV 大会,这是国内机器学习和机器视觉领域的一个会议。我在那里做 poster,刚好遇到了张祥宇老师,就厚着脸皮拉着张老师聊了一个多小时。他也很有耐心,跟我聊了一个多小时。
张老师当时在旷视,应该是旷视的首席科学家。我很惊讶地发现,作为目标检测算法领域的大牛,他和我们聊的并不是“目标检测算法又发明了什么新的 loss,效果怎么样”,而更多是在谈复杂硬件给软件带来的挑战。
旷视也需要设计一些针对目标检测和计算机视觉算法的硬件。这些为特殊负载设计的硬件有多级缓存结构,需要手动控制数据在芯片多级缓存之间的流动。旷视的工程师每天最头疼的,不是参数怎么调,而是英伟达的 cuDNN 代码又有什么问题,需要适应硬件去写这个算子、那个算子。
这件事对我触动很大。可能还有其他各种原因,但这三个原因已经能回答很多问题,它们共同促使我从算法研究转向机器学习系统工程研究。
张小珺
你刚才讲的时候我在想,有没有可能何恺明老师所在的那个时代更适合算法研究?发展到今天,算法研究在某种程度上可能是在“雕花”,而今天更适合大规模系统研究。你觉得这和时代背景有关系吗?
游凯超
绝对有关系。何老师所在的时代属于算法研究的蓝海,那个时候还没有那么多人进入,所以算法领域能做的事情比较多。
后来,算法领域比较 low-hanging 的 fruit 都被摘完了,再往前走,很难再出现根本性的变化。还有一点是大家对 scaling law 的信仰:基本算法不需要怎么改变,只要不断增加算力和数据,效果就会自然变好。
张小珺
虽然你对算法失去了希望,也不再把发表论文作为追求,但本科阶段你还是发表了很多很好的论文,也做了很长时间算法研究。能不能讲讲你从本科到博士的整个研究过程,以及研究轨迹是怎么变化的?
游凯超
3. The Doctoral Pivot
刚才说的转变,其实是在博士期间。本科时我没有做很久研究,主要还是跟着算法研究的方向走。
我的研究方向,很多时候还是靠缘分和时代趋势。高中时我在学堂在线学习,大学之后又通过 edX 和其他名校公开课学习进一步的知识。那时比较有名的公开课包括吴恩达老师的机器学习课程、李飞飞老师的计算机视觉课程,以及 Christopher Manning 老师的自然语言处理课程。
学完这些课程之后,我尝试找实验室做研究。刚好我们学院有一位老师在做人工智能和深度学习方向的研究,所以我就从这个方向开始,后来也在这位老师手下继续读完了博士。
张小珺
你为什么当时没有考虑出国?
游凯超
其实考虑过,一开始也准备出国留学,但后来受到疫情影响比较大,刚好撞上疫情,也不想那么折腾,所以就留在学校了。
本科期间,我主要跟导师做数据稀缺场景下的高效学习,也就是提升机器学习算法的泛化能力。但后来发现,这部分研究比较锦上添花:别人已经做好了一个任务,只是效果还不够好,我再用一个通用方法,希望把准确率提升 1% 到 2%。
这件事很依赖别人,无法大规模应用。后来实验室在这方面的投入也逐渐减少。
2019 年暑假,我去加州大学伯克利分校,在 Michael Jordan 老师手下做了一段时间暑期研究,了解美国那边前沿的 AI 进展,也开阔了眼界。那时已经出现了一些大模型技术的苗头。
回来之后,也就是博士入学以后,我的研究方向逐渐向大模型靠近。我是 2020 年开始读博士的,那时大模型已经开始发展,应该也是 GPT-3 发布的时期。但我们实验室算力资源非常有限,没法做大规模预训练实验,所以我根据能支配的算力,研究了一些大模型微调方法。
做了一段时间之后,虽然有一些成果,但也遇到了类似的问题:我们花一年时间研究各种算法,可能在原有场景下提高 1% 到 2% 的效果;但一年之后,大家有了更好、更大的预训练模型,只要简单替换预训练模型,带来的收益就比我的算法更大。
加上前面提到的那些原因,我在博士后半段从人工智能算法研究转向了机器学习系统研究。2024 年,我申请去加州大学伯克利分校交流,接触了 vLLM,开始做大模型推理系统。
张小珺
在你博士开始之前的 2019 年,应该有两件对你很重要的事情:一件是去 Michael Jordan 老师那里交流,并遇到了现在的合伙人、vLLM 的发起人;另一件是获得清华特奖。这两件事的先后顺序是什么?
游凯超
先是 2019 年暑假的暑期研修,特奖是在 2019 年年底左右。
张小珺
在那次交流中,你第一次遇到现在的合伙人、vLLM 的发起人时,对他是什么印象?当时发生了什么故事?你之前也在知乎上分享过这段经历。
游凯超
2019 年暑假,我在 Michael Jordan 老师那里做暑研。Michael Jordan 老师当时隶属于一个叫 RISELab 的实验室,这是加州大学伯克利分校 EECS 系下面的一个实验室,专注于机器学习系统设计,包括机器学习和系统两部分。
Michael Jordan 老师负责机器学习算法方向。我在研修期间经常参加实验室的活动,也因此接触了更多机器学习系统方面的知识。
刚才说到的 vLLM 创始人之一、也是我们好朋友的李卓翰,当时是实验室里即将在 2019 年秋季入学的博士新生。他比我高一级:当时我是大三,他已经结束大四,申请完博士,准备去 Ion Stoica 老师那里读博。
他当时参加实验室的一些入学前交流活动,我对他分享的研究经历很感兴趣,就加了微信继续沟通。他的导师 Ion Stoica 老师,负责 RISELab 里的机器学习系统方向。
我觉得很幸运,那次暑研让我同时接触到了顶级的机器学习算法老师和系统老师。
暑研结束后,我回清华继续学习。巧的是,这两位老师刚好在那一年成为我们学院的访问教授。结束暑研回到学校后,他们也紧接着来到清华访问。
因为我暑研期间和他们交流过,所以负责了他们访问过程中的一些活动筹备。那时我心里已经有一些萌芽的想法:机器学习系统很有意思,我也想做一个有影响力的软件。
但我担心自己是无名小卒,做出来的东西没人使用。于是有一次交流活动中,我问 Ion Stoica 老师:“如果我想做一个机器学习系统,但可能没有人用,那我投入时间做这个系统,是不是会浪费?”
Ion Stoica 老师用他的人生经验告诉我:“只要你做的是一个好的软件,总会有人用。”
这对我转向机器学习系统产生了很大影响,是 Ion Stoica 老师给我的鼓励。
张小珺
这其实还是一个前奏,你还没有真正做出选择。
游凯超
对,这些只是一些线索,埋下了一些种子。
之后在学术研究期间,我也零星地做过一些开源软件。比如 2020 年,疫情期间没什么事情,只能待在宿舍里,我和本科同学翁嘉义一起做了一个开源强化学习系统,叫“天授”,当时主要用于训练玩 Atari 等视频游戏的机器人。
2022 年,我也把自己设计的一些机器学习算法贡献给主要开源社区,包括 OpenMMLab 的一些计算机视觉库,以及 PyTorch 等机器学习库。所以我在开源社区里也算积累了一些影响力。
2022 年年底,ChatGPT 发布了。我看到当时还在一起“玩泥巴”的朋友翁嘉义——知乎上叫他“青苹果”——已经成为 ChatGPT 的训练师。OpenAI 的每一篇博客几乎都有他的名字,他已经算是彪炳史册了。
那时我开始思考,未来要走向什么方向,也向他请教了一下。大模型相关研究大概有几个方向,其中数据和算法与公司绑定比较强,需要公司提供大量资源。
还有一部分是机器学习系统,这部分可以在实验室里做小规模研究,再比较容易地扩展到大规模场景。这也坚定了我转变研究方向的想法。
到了 2023 年,疫情基本结束,国际交流恢复。学院的访问教授再次来访。那时伯克利的 RISELab,经过几年已经改名为 SkyLab。
2023 年秋天,Ion Stoica 老师再次来清华访问。我当时已经比较坚定,想继续做机器学习系统,就问他能不能去那里交流。
我告诉他,4 年前我曾经问过同样的问题;这 4 年里,我一直在探索自己能做什么,以及如果做出有意思的东西,是否会有人使用。这个过程证明效果很好,所以我还在践行他 4 年前给我的建议。
他看到 4 年前的一个清纯少年,4 年之后还在坚持当年给出的建议,也很感动,同意了我的申请。于是 2024 年我在 SkyLab 交流,刚好赶上了 vLLM 项目的发展。
这里面有很多机缘巧合。如果没有 2019 年的暑研,我可能不会那么早加上李卓翰的微信,也可能更晚见到 Ion Stoica 老师。但我觉得整体方向不会改变:我依然会从算法研究转向机器学习系统。这次重大决定,其实已经酝酿了好几年。
张小珺
有一种冥冥之中的感觉,也有时代趋势。
你同时接触过算法和系统领域非常顶尖的学者——Michael Jordan 和 Ion Stoica 老师。你觉得他们的底层思维有什么不同?
游凯超
Michael Jordan 老师更偏学术和理论。他做的是机器学习理论,从来不把自己称为 AI 研究者,更多是在研究机器学习算法背后的理论,也会做博弈论、经济学分析等事情,所以可能更偏理论。
Ion Stoica 老师更偏系统。他的追求很简单,就是 real-world impact。因此他做了很多开源软件,很多软件后来孵化成重要项目,成为工业界的基础设施。
张小珺
你追求的是后一个。
游凯超
对,我追求后一个。他们两个人当然没有优劣之分,但我觉得在当下这个时代,后一个更值得追求,前一个比较难追求。
就像我和翁嘉义聊到的,前一种研究要做出 impact,世界上可能只有很少的位置能够实现。如果没有那个位置和对应资源,即使做出了算法,也很难发挥作用。
张小珺
翁嘉义和你的选择也比较相似,对吧?
游凯超
对,他也是做 AI Infra 的。我们当时一起做“天授”,也算是一个比较小的机器学习系统。
他当时也做过一些算法尝试,遇到过很多挫折:提出一个算法、投稿论文,对方说“不 novel”“没有用”。他最后可能觉得,与其这样,不如写一个系统,直接告诉大家这些东西训练出来就是有效的。
张小珺
所以你和翁嘉义在读书时有一点惺惺相惜?
游凯超
可能不算惺惺相惜,更多是志同道合。大家都觉得这件事有意思,所以一起做。
张小珺
你刚才说慢慢对论文丧失了兴趣,也不想做纯理论的东西。但本科阶段你还是发表了很多顶会论文,同时获得了清华特奖。这是怎么发生的?
游凯超
这是两条线。学术界也不是一开始就“礼乐崩坏”。我刚开始做研究的 2018 年、2019 年,还是有很多人在踏实做研究,算法研究也能被看见、被认可。
特奖评选是在 2019 年年底,依据的是 2019 年之前的成果。我刚好有一些成果,所以就参加了评选。
张小珺
获得清华特奖时,你应该很兴奋吧?我看到你当时写过一句话:“在清华不要做一个观众,要成为舞台中间的一个人。”
游凯超
获奖当然很开心,也有兴奋的因素。获奖之后,我的朋友圈变大了,可以接触到更多优秀的同辈,这是一个明显的好处。
但整体来说,我觉得特奖这件事正在被淡化,大家不再赋予它过多含义。清华有很多奖学金,特等奖学金只是其中之一。有些系的奖学金额度比特奖高很多,所以特奖只是奖学金之一。
我觉得特奖是特殊历史时期的产物。那时社交媒体发展很快,学校大力宣传特等奖学金评选,出现过马东涵和马东新这对双胞胎的“双料特奖”,以及陈立杰这样的理论计算机科学家,形成了一些现象级话题。
后来感觉有些变味了,每年评选都可能在社会上引起不小轰动,大家会说这是“一年一度的神仙打架”。但客观来说,很多特等奖学金获得者在获奖时还只是稚气未脱的少年,通常是在大四上学期评选,入学也就三年左右。
把一个本科生过度曝光在媒体聚光灯下,很容易干扰获奖者正常的学习和科研生活。我比较幸运的是,在我参选的那一年,学校已经意识到了这一点,取消了特等奖学金现场答辩的直播,之后也有意降低宣传力度。
所以后来特奖在社会上的讨论度越来越低,现在基本就是清华的普通奖学金,社会上已经没有那么多人议论了。我觉得这样才比较好。对获奖者本人来说,获得认可当然开心,但之前的讨论确实太多。
尤其是在讨论最热烈的时候,大家总说特奖是在评选“这一届清华学生里最厉害的 10 个本科生”。我觉得这个说法本身并不恰当。学校里的每个人都有自己的追求方向,很难用统一标准说谁是最厉害的 10 个人,谁比其他人更厉害。每个人都有自己的方向,不应该用统一标准衡量所有人。
张小珺
你今天还这么想吗?清华是一个舞台,但大家不要只做观众。
游凯超
当然可以继续这么想。只是我现在已经不在那个舞台上,已经退下来了。
如果要对新入学的同学说几句话,我觉得这句话仍然适用:来清华更多是追求自己的成长,而不是在清华里观察到了什么样的人。
张小珺
我看你的早期研究方向是迁移学习、域自适应,但你已经开始做 LogMe 这样的工具,后来又和翁嘉义一起做了“天授”,它也是一个标准化工具箱。你是不是很早就已经想做通用工具性的事情了?从更早期开始,你是不是就对现在做的事情更有热情?
游凯超
LogMe 那项工作应该是在 2021 年。那时我已经开始思考转方向的问题。
另一个趋势是,算法研究经常需要和别人争论自己的东西有多创新、novelty 有多高。但还有另一个方向,是告诉别人这个东西加速了多少倍,这件事更加客观,可以被验证,也可以分析背后的加速原理。
这让我觉得机器学习系统是一个更确定的领域。我可以明确知道自己的贡献是什么,也可以非常清楚地量化。你可以说我的东西不 novel,但不能说我的东西没有用。
张小珺
你对算法彻底丧失希望,有没有一个时刻,或者最后一根稻草?
游凯超
我觉得这是一个过程。机器学习系统这个领域,我投入更多时间、做更多优化,就能得到更多收获,所以逐渐不再把精力投入算法研究,没有一个关键事件。
我们的认知一直是:顶级算法研究当然有用,但真正发挥这种职能的位置很少,世界上可能只有有限的几个。如果不在那些位置上,没有对应资源,即使做出算法,也很难发挥作用。
就像我没有何恺明老师的资源,即使想到了他论文里的 idea,也没有用。
张小珺
做算法时,论文引用数可能是一个衡量指标。如果走系统研究、系统工程这条路,你的衡量标准是什么?更看重哪些数字?
游凯超
衡量标准就是做出来的东西有多少人使用,以及是否给大家带来了真正的收益。
比如 GitHub 项目有多少 star,有多少人发来感谢信,在 issue 里说用了你的东西,提高了多少效率。
张小珺
你就不会再用论文要求自己了,对吧?
游凯超
对。论文只是副产物。某些算法或者系统工程实现得很好,也已经有很多人在使用,这时我们再把它写成论文,把有价值的内容列出来。审稿人通常不会说什么,因为他们可能本来就是系统的用户,所以投稿过程也比较顺利。
张小珺
换一条路走,有过纠结吗?
游凯超
没有。我觉得这个过程很快乐,因为正反馈在不断累积。
你做一件事情,说这个东西给你加速了两倍,并且你知道为什么能加速两倍,就可以自信地告诉别人,使用它能加速两倍。这个过程中,别人的反馈会持续累积。
相比之下,一个算法研究者提出新算法,说在自己的场景下提升了 2% 到 3% 的准确率,别人尝试复现时,可能因为场景不同,发现算法反而降低了准确率。这个过程很难积累正反馈。
张小珺
2019 年,你认识了 Ion Stoica 老师和他实验室的学生,这是早期前奏。但 vLLM 到 2023 年才诞生。这中间几年你做了什么?和他们后来的缘分又是怎么继续下去的?
游凯超
这中间主要是在探索,前面说到的方向转变,也是逐渐积累起来的。疫情期间不能出国交换,只能做自己的探索。
欧美那边仍然热火朝天地做大模型。疫情结束、ChatGPT 发布之后,大家都有一种当头一棒的感觉:我们这几年在做什么,对方这几年在做什么?人家已经做出了这么 amazing 的东西。
张小珺
我们把话题切到 vLLM。最早项目诞生时,你还没有加入,是 2024 年才加入,对吗?
游凯超
4. How vLLM Found Its Moment
对。vLLM 应该是在 2023 年年中左右开源,大概是 6 月。这个工作肯定更早开始,我觉得 2022 年年底就已经在做了。
张小珺
当时的创始团队都是 Ion Stoica 老师的学生,包括李卓翰?
游凯超
对,主要是作为实验室的科研项目来开展。
张小珺
为什么 Ion Stoica 老师的实验室似乎萌发过很多开源项目?这有什么传统吗?
游凯超
我觉得这和一些历史传统一脉相承。我做 vLLM,也受到伯克利“重工业软件”传统的影响。
伯克利有很悠久的开源软件历史,包括操作系统领域的 BSD、芯片领域的 RISC-V、存储领域的 RAID,以及后来大数据、分布式和机器学习系统领域的 Spark、Ray。这些项目都来自伯克利。
伯克利历史上产生了很多著名开源软件,而且很多都是学生在读期间发起的,最初只是学生的 research project,最后由学生主要维护,把社区发展壮大,再成为工业界的基础设施。
计算机体系结构领域的大牛 David Patterson 在 2014 年写过一篇观点文章,叫《How to Build a Bad Research Center》。他根据几十年的经验认为,一个实验室或大型研究中心,做 5 年就够了,因为 5 年刚好是博士生毕业的周期。
在这 5 年里,充分利用优秀博士生的时间,让他们静下心来专注一个领域,可以极大促进这个领域的发展。于是,从 AMP Lab 的 Spark,到 RISELab 的 Ray,再到后来 SkyLab 的项目,伯克利这些实验室的发展是一脉相承的。
实验室 5 年的周期和工业界需求周期发生共振时,就会诞生重要项目。那时我觉得 vLLM 就是下一个项目。
我去伯克利之前,vLLM 已经开源并且发展迅速。我觉得历史机遇已经摆在面前,应该投入精力去维护,所以就尽己所能地帮助它。
张小珺
说服一个学生加入这样的开源项目,长期作为核心维护者,是一件困难的事情吗?
游凯超
显然非常困难,我原以为会很简单。
每个学生所处的博士阶段不同。刚入学的博士生可能急着发表论文支撑毕业,需要寻找新的 project,很难参与别人的项目。他可以通过参与别人的项目练手、学习如何做研究,但现在的博士生都很强,毕业前的成果可能已经足够毕业,接下来要做的是在博士前一两年做出新的成果,方便毕业。
所以低年级博士生希望做新方向,不愿意沿着旧路巩固现有知识。博士后期的同学则急着找工作,马上要毕业、进入工业界,也不太会花时间维护开源项目。
最适合参与开源项目的,应该是博士中后期、没有太大毕业论文压力、又对开源项目感兴趣的同学。
张小珺
你当时正好处在这个阶段。
游凯超
对。我之前的算法研究基本够毕业了,也想转变研究方向。转方向时,我不希望只在机器学习系统领域发表论文,更希望获得 hands-on experience,学习系统到底是怎么 build 的。
所以我完全可以接受纯工程问题,几个月都做工程实现也没问题。再加上我觉得 vLLM 面临很重要的历史机遇,所以全身心投入了。
张小珺
你当时算第几号成员?
游凯超
我算第四个比较主要的成员。
最开始主要是论文的两位作者李卓翰和 Woosuk Kwon,他们也是开源项目最初的主要维护者。接下来主要参与的是 Simon,他现在是我们公司的 CEO。
Simon 也是开源老兵,和我差不多大,可能比我还大一些。他本来准备读博士时 quit 了,去参与 Anyscale 的创业,创业几年后又回来读博士,所以有比较深厚的开源社区经验。他不太看重论文,更看重现实世界的 impact,也觉得 vLLM 很重要,所以是第三个全职投入的同学。
第四个就是我。我当时有时间,也愿意投入,而项目正好缺人。
项目论文有很多作者,但因为各种原因,其他同学后来都去做别的事情了。
张小珺
有人会觉得,开源项目必须是自己发起、自己创立的。你有过这种想法吗?
游凯超
我觉得不需要,关键是能在里面做什么贡献。
当时项目整体处于非常缺人的状态,所以只要投入热情、用真心就可以。
张小珺
你为什么对它如此真心?是怎么开始的?
2019 年你认识李卓翰,后来又去伯克利交流。那时你和李卓翰、Woosuk Kwon 聊得比较多吗?为什么觉得这个项目这么吸引你?
游凯超
首先是项目发展很快,也确实缺人。我当时判断,ChatGPT 已经很火,大家都在探索怎么训练模型,但模型训练出来之后显然还需要推理。vLLM 正好处在大模型推理这个位置上,而推理非常重要,也很有前途,值得投入。
我真正做 vLLM 是 2024 年,但 2023 年就已经关注它了。2023 年年底,我向 Ion Stoica 老师申请交流时,需要提出自己要做什么。当时我就提出大模型推理方向,也说可以在 vLLM 里面做一些事情。那时 vLLM 已经存在了。
张小珺
我们来讲讲 vLLM 的核心原理。假设观众对系统了解不多,能不能解释一下,为什么 vLLM 在当时应运而生?它处在什么样的市场环境里?
游凯超
5. Inside PagedAttention
这里需要区分两个概念:vLLM,以及它对应的论文《PagedAttention》。
vLLM 的起源是那篇论文,论文核心是 PagedAttention 算法。它借鉴操作系统虚拟内存管理机制,管理自回归生成过程中大模型推理产生的中间状态,也就是 KV Cache。
但时至今日,vLLM 早就不只是 PagedAttention 算法,而是一整套大模型推理系统,是大模型高效运行的底座。它解决的问题是:当模型和硬件都在飞速发展、彼此不断耦合时,如何提供高效的推理服务。
PagedAttention 的原理,则是管理自回归生成过程中的中间状态,也就是 KV Cache。
张小珺
放在当时的环境下,PagedAttention 算一个很大的创新吗?
游凯超
我觉得不能算很大的创新。任何认真分析大模型推理过程的机器学习研究者,都可能想到这个想法。从学术创新角度来说,PagedAttention 的创新性甚至偏低。
这篇论文投稿到 2023 年的 SOSP,也是非常顶级的系统会议。审稿人已经提出很多批评,说这个东西 too simple,想法太直接,没有 novelty。最后能够发表,完全是因为他们做得很早,并且做了非常丰富的实验,所以论文以低分过线的状态被会议接受。
vLLM 是 PagedAttention 论文被接收后,作者团队开源出来的推理引擎。所以不能只把 vLLM 理解成 PagedAttention,它还包括后续一系列工作。
vLLM 是一个推理引擎,也代表一个推理生态系统。PagedAttention 和 continuous batching 是大模型推理过程中的核心技术,当然还包括后来加入的很多其他推理优化技术,它们都在 vLLM 项目里。
张小珺
PagedAttention 论文被接收之后,李卓翰他们紧接着做了什么?谁起到了关键作用?
游凯超
系统论文通常有 artifact evaluation 要求,也就是系统需要被别人复现,论文中的数字要能被复现,证明确实有这些收益。
他们原本就有一个原型系统,后来把原型系统开源了。我觉得这和 Ion Stoica 老师的理念有关。Ion Stoica 老师很早就看到,开源推理引擎里蕴藏着巨大机会,因此推动论文作者把 vLLM 当作重要的开源项目来维护。
不是所有人都同意这个观点,而且每个人当时都有各自的客观情况。最后主要是 Woosuk Kwon 和李卓翰继续维护开源项目,后来有了 Simon,也有了我。
张小珺
说服你的过程难吗?
游凯超
应该很容易,因为我是主动过去的。
张小珺
Simon 呢?
游凯超
Simon 应该也是主动的。
张小珺
一个开源项目和公司这种组织很不一样。公司里人员来去很常态,但开源项目有人加入、有人离开,似乎会带有特别的情感。事后看,你觉得有开源精神和开源热情的人,是不是有一些共同特征?是什么让你们走到一起,又是什么让一些人离开?
游凯超
我觉得每个人追求的目标不一样。有的人追求金钱,比如今年赚多少钱;有的人追求权力,比如在公司里爬多高、处在什么领导位置。
我追求的是意义:做的事情是不是有意义。当时我觉得 vLLM 有很重要的历史意义,值得投入。
这个决策也受到 Michael Jordan 老师和 Ion Stoica 老师很大的影响。其他同学应该也类似,很多人加入,都是因为觉得这件事有意义。当然离开时可能也有各自的原因,这不能强求。
有句话叫“仓廪实而知礼节,衣食足而知荣辱”。我们这个时代在物质生活上已经有基本保障,能够让我们有更多时间和精力追求非物质的精神需求。
做计算机技术的人,基本生活需求其实很简单:有吃有住,有电脑、能上网就可以了。所以我觉得,这样相对简单的生活环境,为我们筛选出了一批志同道合的人。他们热爱开源、热爱技术,和我们一起同甘共苦,做了好几年 vLLM,后来很自然地成为公司最初的创业团队。
中学课本里的《送东阳马生序》有一句话:“以中有足乐者,不知口体之奉不若人也。”我觉得很适合形容我们这些同学。我们心里做着自己认为快乐的事情,所以不觉得吃喝穿戴和物质享受不如别人。
当然,现在我们有了资源,也会让同学们在实现精神追求的同时拥有更充足的物质资源,让生活没有后顾之忧。
张小珺
2024 年、2025 年,在你加入之后,有没有发生一些让你印象很深的事情?这是 vLLM 成为公司之前的两年。
游凯超
6. From Prototype to Production
2024 年的主旋律是重构。2023 年论文发布后,原型系统开源,但原型需要从实验系统走向生产级可用。
在这个过程中,我们调研了业内很多推理引擎的设计,最终在 2024 年年底推出了从 v0 到 v1 的重构计划。
2025 年的主旋律是大规模部署。硬件和模型变得越来越大,开源模型发展的重心也从欧美转移到了中国。
因为 2024 年交流结束后,我在 2025 年回国准备毕业。当时 vLLM 社区在国内还是一片空白,我刚好从伯克利回来,就从零开始搭建中国的 vLLM 社区,也支持了大量中国开源模型的发布。2025 年正好是中国开源模型爆发的一年。
DeepSeek-V3 在 2024 年年底发布,2025 年年初发布 DeepSeek-R1,春节期间 R1 开始爆火。之后,中国开源模型就像雨后春笋一样不断发布。
这两年确实经历了很多风风雨雨,尤其是人员不断变化。开源项目就是有人加入、有人离开,我们还要持续面对新模型发布,同时推动项目维护和升级,这是很大的挑战。
回头看,我不敢说我们做得非常好,只能说我们撑过来了。
张小珺
2024 年从 v0 到 v1 的重大重构,用户侧可能感觉变化不大。能不能从工程角度讲讲,为什么决定做这件事,重构过程中又有哪些挑战?
游凯超
这次重构主要是为了解决模型和硬件发展给推理引擎带来的新挑战。
我们经常把 token 比作电。推理引擎像电网,或者说电力系统;模型更像发电机,硬件则像风力、光伏等自然资源。推理系统要做的,是用发电机把自然资源转化成电,再传递到每个人手中。
所以这次重构,就像电力系统从火电过渡到新能源发电。用户侧的使用方式可能变化不大,都是电,把插头插上就能用。但从推理引擎视角看,背后的工作原理发生了巨大变化。
推理引擎对终端用户承担的一个重要责任,是屏蔽模型和硬件的复杂性。一个应用可能支持多个模型,用户只是从下拉菜单里选择模型,或者在请求参数里改一下,今天请求 DeepSeek,明天请求 Qwen。
但对推理引擎来说,不同模型的支持效率、适配硬件都千差万别。模型和硬件不断发展,对推理引擎的要求也在持续变化。
v0 和 v1 从名字上就能看出是很大的变化,但类似的小变化其实一直在发生,所以可以说 vLLM 一直处于重构过程中。
最困难的是保持用户兼容性。背后支持的模型和硬件不断变化,但要给终端用户相对统一的体验:使用 vLLM,就能保证各种模型在各种硬件上运行。
张小珺
2024 年你们主要支持的还是美国模型,比如 Meta 的模型?
游凯超
对,2024 年开源的重心还在欧美,比如 Meta、Mistral 等模型。
张小珺
在支持这些模型的过程中,有没有什么观察?
游凯超
当时支持还不算复杂,因为模型和硬件还没有那么强的耦合。只有一些 attention 算法设计得比较复杂时,对推理引擎影响比较大。总体来说,主要还是做推理优化,模型结构在那一年没有发生巨大变化。
张小珺
到了 2025 年,中国开源模型的爆发是不是出乎所有人意料,也出乎你们意料?
游凯超
确实出乎意料。
张小珺
你是几月份回中国的?
游凯超
2024 年 12 月结束交流。刚好在我结束交流时,DeepSeek-V3 发布了;我 1 月回来之后,R1 又发布了。
张小珺
支持 DeepSeek 时是不是非常措手不及?当时是什么状态?
游凯超
不能说措手不及,更多是没有预料到它会产生这么大的影响。
我们和 DeepSeek 的合作其实很早就开始了。2023 年、2024 年那段时间,DeepSeek 内部就使用 vLLM,并在此基础上加入了一些自己的优化变种。从 DeepSeek-MoE、DeepSeek-V2,到 DeepSeek-V3,我们一直保持联系和合作。
只是在 2024 年,DeepSeek 还只是社区中的一员,是一个泯然众人的模型厂商。
张小珺
R1 之后,你们支持 DeepSeek 的故事有什么值得分享的吗?
游凯超
DeepSeek 的 Infra 团队做了很多优化,给我们带来很大震撼。它的推理引擎虽然基于 vLLM,但已经比我们往前走了很多,所以我们当时一直在向他们学习。
之后,我们又支持了很多中国开源模型。DeepSeek 爆火后,中国开始了一轮开源浪潮。
尤其是 2025 年 7 月,我印象很深。事后回想,可能因为 WAIC 快开会了,很多公司都希望在这之前发布产品,于是一下子把已有模型都发了出来。
张小珺
今年又到了这个时间点。
游凯超
我们一直在支持新模型发布。今年已经有 DeepSeek-V4、MiniMax-M3 等比较大的发布。
张小珺
大家又赶着 WAIC 之前发布一波?
游凯超
不知道今年会不会再赶着 WAIC 发布一波,但今年已经有好几个规模比较大、复杂度比较高的发布。
张小珺
你刚才说,2025 年你花了一整年回中国组建 vLLM 社区。这看起来只是一句话,背后是什么工作量?社区是怎么一步步搭建起来的?
游凯超
这个项目诞生在美国,2024 年主要的开源阵地也在美国,所以整体沟通渠道偏美国。比如我们使用 Slack 沟通。
后来和国内用户沟通时发现,第一,国内同学更习惯说中文,而 Slack 里主要使用英文,会有语言障碍;第二,出于各种原因,国内同学使用国外软件也有不方便的地方。
为了解决这些问题,我们开始搭建 vLLM 中文社区,包括公众号、小红书、知乎等宣传平台,也和国内一些大公司建立沟通渠道。
DeepSeek、Kimi 都公开说过使用 vLLM,但此前我们和他们沟通很少,原因包括时区不同、没有机会见面。回国后,我走访了一遍这些公司,了解他们用 vLLM 做什么、遇到哪些问题和痛点。
因为我 2024 年做 vLLM 比较多,大家也认识我,所以我就把这些人和公司串联起来。
张小珺
2025 年还有一件事:PyTorch 基金会完成机构改革,你们也变成了基金会里的旗舰项目。这个变化是怎么发生的,对你们有什么影响?
游凯超
2024 年年底,我们已经开始讨论这件事。当时的背景是,我们在考虑项目的长期维护。
Ion Stoica 老师认为,这么大的项目应该有一家公司支持,否则最后会凉掉。但我们几个人还有些犹豫,因为项目能不能找到长期维护者都是问题。
所以 Ion Stoica 老师建议参考 Linux 等项目的经验,把项目捐给一个基金会,这样能保证长期开源和维护。我们和 PyTorch 合作紧密,vLLM 建立在 PyTorch 之上,所以捐给 PyTorch 基金会比较自然。
PyTorch 基金会本身更偏治理结构,并不参与技术治理,代码仍然由我们自己写。把项目捐给基金会,意味着它至少不会变成闭源项目,始终保持开源。
张小珺
但后来你们又成立公司了。
游凯超
对。公司负责项目商业化和技术运维,但项目依然是 PyTorch 基金会下面的项目。
PyTorch 基金会有很多顶级项目,PyTorch 是其中之一,vLLM 也是其中之一。PyTorch 项目本身由 Meta 主导。基金会可能负责活动举办,vLLM 和 PyTorch 的商标也属于基金会,更多是辅助性角色。
张小珺
所以基金会能够承诺,项目必须保持开源?
游凯超
对。比如 vLLM 的商标属于 PyTorch 基金会,不能把项目闭源之后再说自己支持 vLLM。
张小珺
为什么不能属于伯克利,为什么一定要属于基金会?
游凯超
伯克利是一所学校。如果说项目属于学校,还是需要学校里有具体的人来承担职责,但学校没有这样的机构。
Ion Stoica 老师的实验室也不行。前面提到 David Patterson 认为实验室只应该运行 5 年,之后就要关闭、重新成立新的实验室。实验室不是一个具有持续性的实体。
基金会是独立法人,可以注册商标,有自己的法律团队,可以接受捐赠,也可以为项目投入资源。
张小珺
捐给 PyTorch 基金会,意味着创始团队认为它应该作为开源项目持续下去。你们当时有没有考虑过另一种选择:把项目放进公司里一起运营?
游凯超
我们公司现在就是 vLLM 项目技术管理和日常运营的主要参与者。
把项目捐给 PyTorch 基金会,更多是从法律上明确它一直是开源项目,商标属于社区。但具体技术发展和商业化可以由公司来做。
当然也不只是我们公司,社区里的其他公司,比如 Red Hat、英伟达、AMD,也都在参与技术维护,也可以对项目进行商业化。
张小珺
如果项目属于你们公司,所有商业化都应该由公司完成。
游凯超
对。如果项目属于公司,商标也可能属于公司。任何人使用 vLLM 或者它的 logo,可能都需要向公司申请。
现在它是一个开源项目,商标和使用权属于公共领域。我们只是作为技术参与者和技术领导者,引领项目发展。
张小珺
在把项目捐给 PyTorch 基金会时,你们已经决定成立公司了吗?
游凯超
还没有,是先捐赠,后来才决定成立公司。
7. Why InfraRact Had to Exist
这也可以说到我们几个人成立公司的过程,其实相当艰难。
Ion Stoica 老师有非常坚定的信念:这么大的项目,如果没有公司支持,一定会凉。他举过很多例子:Linux 如果没有 Red Hat 的支持,不会发展到今天;Kubernetes 如果没有 Google 的支持,不会发展到今天;PyTorch 如果没有 Meta 的支持,也不会发展到今天;Spark 也需要 Databricks 的支持。
vLLM 的体量已经达到前面几个项目的规模,历史意义也很明显,但当时没有一家公司支持它。
Meta、英伟达、AMD 都在使用 vLLM,但更多是参与者,很难做出战略性决策。它们之间也可能存在利益冲突:Meta 是 AMD 和英伟达的客户,可能希望社区实现某些事情,但其他公司未必服从 Meta 的领导。
所以,vLLM 的长期发展需要一家公司的支持,这一点非常明确,我们也都认同。唯一需要明确的是,是否愿意由我们来创立这家公司。
创立公司的优点很明显,可以更好支持 vLLM 发展,也能成为公司的创始团队。但缺点是,需要承担很多原本不熟悉的非技术任务:学习融资、招聘、商业化。这些都构成了阻力。
张小珺
这条路线对你们来说好像并不难。
游凯超
要考虑到我们原本都是学生团队。我们最熟悉、最舒适的区域,是遇到一个技术问题,拆解它、解决它。
现在要做的是成立一家公司,把它抚养长大。所以这个选择困扰了我们两年。
Ion Stoica 老师从 2024 年就明确说,我们应该成立公司支持 vLLM。我觉得他可能 2023 年就开始说,只是那时我还不在。
我算是决定得比较早的。2024 年交流期间,已经有很多同学在硅谷创业,我近距离观察了创业者的状态,也和他们沟通创业中的问题,以及创业还是上班这个关键选择。
我还和一些投资人进行了初步交流。最后得出的结论是:即使创业失败,最坏的情况也不过是少拿几年工资;但如果不创业,vLLM 最终无法长期发展,那就会后悔。
所以 2024 年年底离开伯克利时,我已经下定决心参与 vLLM 创业。但其他人还没有决定,我不能一个人创业,于是接了 SkyLab 的博士后 offer,并且说我会为 vLLM 创业公司等两年,直到大家一起出来创业。
还有一个故事。交流快结束时,我也去和 Michael Jordan 老师聊了。我告诉他,vLLM 势头很好,但如果去找别的工作,可能有人愿意给很多钱;做博士后又很清贫,该怎么选择?
他从一个过来人的经验出发告诉我,长期来看,肯定应该继续支持 vLLM。因为我和他合作过很多,也觉得他的经验是饱经沧桑的历史经验,非常值得遵循。
所以我的心路历程是:我们最终还是要创业,只是时机未到,那就先等一等。
张小珺
你是第一个决定做这件事的人?
游凯超
不好说是不是第一个,但我是比较早决定的。我们的 CEO Simon 也很早决定创业,所以我不好说我们谁先,但我们都比较早确定了。
张小珺
你有想过做 CEO 吗?
游凯超
我觉得 Simon 更适合 CEO。在维护社区时,他已经展现出 CEO 相关的能力:管理整个社区,和大家沟通。
所以我不会一个人出来创业,是因为人还不够。Simon 有创业经验,也认同 Ion Stoica 老师的观点:必须有一家公司支持 vLLM,才能长远发展。
Simon 还在 Character.AI 待过一段时间,当时尝试借助 Character.AI 帮助 vLLM 项目发展,比如从 Character.AI 找人维护 vLLM,找机器资源支持 vLLM。
但最后还是发现不能依靠别的公司。公司有自己的事情,不可能无限制地把员工调来做 vLLM。你在公司里只能组建一个很小的团队,以“用爱发电”的方式支持,很难说服公司高层:这是一个正式业务,公司需要全力支持开源项目。
所以最后只能自己开公司。
最犹豫的是 CTO Woosuk Kwon。他可以选择的机会太多。2024 年初 xAI 创立时,马斯克曾邀请他参与 Infra 建设。如果他加入,就会负责 xAI 的基础设施。
尽管 xAI 后来失败、曲终人散,但如果当时加入,他之后可能获得的财富会是天文数字。
2025 年 Thinking Machines Lab 创立,创始人又邀请他负责基础设施。后来 Thinking Machines Lab 的估值一路上涨,所以他面前的机会太多、太好,他的犹豫也很正常。
张小珺
最后你们是怎么说动他的?
游凯超
就是晓之以情、动之以理。我们问他:“如果你不跟我们一起创业,赚到了很多钱,但 10 年之后,vLLM 项目失败了,你会开心还是不开心?”
我们问了这样一个问题,他想了很久,最后发现答案和我们一样:赚多少钱都不重要,如果 vLLM 项目失败,都会后悔一辈子。
于是我们把最坚定的三个人确定下来,也把他拉上了船。
还有很多信念坚定的合伙人,比如 Roger,也和我们一起做了很多年开源项目。公司成立时,他们作为 founding engineer 加入。
我觉得大家有共同愿景:聚集在公司里,做 AI 时代的推理引擎,为接下来的智能时代打好基础设施。
每个人都可以在市场上拿到很高的 offer,但最终选择创业,是希望把这件事做好。
类似的考验一直持续到公司成立前夕。我们准备注册公司时,某家顶级大厂的一号位知道我们要创业,直接打电话问能不能不要创立公司、加入他们。他们可以给我们 4 个创始人每人年薪 2,000 万美元,让我们负责基础设施和推理。
但我们当时已经很坚定,直接爽快回绝,没有一个人犹豫。这就是公司创立初期的故事。我们在创业之初,就已经经受住了巨大的考验和诱惑,也已经是并肩作战多年的老战友。
张小珺
Woosuk Kwon 虽然一直犹豫,但他没有去 xAI 或 Thinking Machines Lab。2024 年和 2025 年的两个选择,他虽然没有决定要不要加入现在的公司,但也没有去其他公司,是吗?
游凯超
他去过一段时间,包括在 Google DeepMind 做过一段时间,是以学生身份兼职的状态。后来我们把他从 Thinking Machines Lab 拉了回来。
张小珺
这很有意思。为什么作为 PagedAttention 的发明者、这个算法的作者,他却很犹豫?李卓翰为什么没有加入?
游凯超
李卓翰毕业比我们早,2024 年就毕业了。那时如果他创业,只有他一个人,其他人都是学生。
学生只要有吃有喝、有电脑和网络就能干活,未必需要立刻开公司。当时他也拉不动其他人,所以就去工作了,先后在 OpenAI 和 Meta 工作。
他已经有自己的工作,也工作了比较长时间,有自己的事情要做。把他拉过来,会影响他原来的团队,所以比较困难。
Woosuk Kwon 还没有陷入太深,我们觉得还有机会把他拉回来。
张小珺
你有这样的 offer 吗?除了创业临门一脚时那个天价 offer,之前有没有动摇、怀疑过?
游凯超
因为我决定得比较早,前面说过,我接了博士后 offer,所以没有认真看其他公司的 offer。
我和大家聊,更多是问他们怎么使用 vLLM、遇到了什么问题、怎么合作,而不是问“要不要我去你们公司工作,你给我多少钱”。
张小珺
你在脑子里推理过这种可能吗?
游凯超
推理过,但还是那句话:我们觉得 vLLM 项目很重要,都想把它做成。
我们 4 个人——李卓翰、Woosuk Kwon、Simon 和我——答案应该都一样:如果赚了很多钱,但 vLLM 失败了,一定会后悔一辈子。所以我们都很坚定,要把公司开出来。
张小珺
和李卓翰之后还会有什么合作吗?
游凯超
他现在在公司里有自己的事情,所以很难有深入合作,更多可能是一些 high-level 的技术沟通。
张小珺
从你们和 PyTorch 基金会的关系,到后来成立公司,一个开源项目的运作和外界想象很不一样。能不能讲讲,这样的开源项目和大家想象中最大的不同是什么?它作为一个组织,是怎么构成和运转的?
游凯超
8. Governing a Living Community
不同开源项目有自己的治理方式,我这里只讲 vLLM 的方式。
我们采用常见的分级管理,有几个“仁慈的独裁者”,可以最终拍板。
张小珺
是你们几个人?
游凯超
包括 Simon、Woosuk Kwon、我、李卓翰,以及 Red Hat 的一些同学。
平时我们和大家心平气和地沟通,但如果有重要决定需要拍板,或者有人有强烈坚持,就需要由这些人做最终决定。
此外,还有十多个日常核心维护者,负责项目非常重要的模块,参与日常关键设计。再往下有几十个 committer,主要负责日常代码开发,剩下的是社区贡献者。
vLLM 现在是 PyTorch 基金会旗下的顶级项目,也接受 PyTorch 的治理结构。这里主要涉及大公司的参与治理,比如英伟达、AMD 等芯片厂商,Red Hat 等软件厂商,以及亚马逊、Google 等云厂商。
这些公司会投入资源维护 vLLM。作为项目维护者,我们的职责之一,就是协调这些大公司之间的合作。现在我们有了公司,所以公司也是 vLLM 治理过程中不可替代的一员。
张小珺
在有公司之前,听过一种说法:开源项目更像社团而不是公司。你们日常有什么机制,比如例会?沟通怎么完成?
游凯超
我们有一些例会。比如几个做决策的同学每周碰一次,committer 不会这么频繁,更多是在 channel 里沟通。
张小珺
你刚才说你们是仁慈的独裁者。有没有做过非常强硬的决策?
游凯超
仁慈的独裁者,意味着有时必须对方向进行取舍,不能做老好人。
我做过一个比较强硬的选择,就是把 beam search 功能从引擎里删除。这个决定持续受到一些人抱怨,尤其是推荐系统的同学,他们认为 beam search 在自己的场景里很重要。
但从我们看到的情况来看,大模型推理是 AI 侧的主要 workload,已经不再适应 beam search 算法。如果继续维护 beam search,只会给模型和推理引擎的适配带来越来越多复杂性,最终不可维护,所以我把它删掉了。
张小珺
这是你做的一个独裁决策。
游凯超
对。其他决策更多体现在支持优先级上。
项目很大,最重要的事情是确定优先级:支持什么,不支持什么,不想支持什么。我们现在明显优先支持大集群上的大模型。
很多小模型不会被列为高优先级,比如几百兆的模型,推荐系统里有人使用。我们会告诉他们,可以使用 vLLM,但如果有针对这些模型的性能优化需求,我们不会接。
张小珺
现在有两千多名贡献者,管理这么大规模的开源社区,最大的挑战是什么?
游凯超
最大的挑战就是梳理事情的优先级,决定做什么,更重要的是决定不做什么。
项目有两千多名贡献者,尤其今年 coding agent 发展很快,提交代码变得非常简单。项目管理者最重要的工作,是屏蔽噪音,找到真正值得做的事情,引导社区往那个方向发展。
GitHub 有一个 2025 年的统计数据,按照贡献者活跃度排序,vLLM 是整个 GitHub 最活跃的项目。这让我们很荣幸,也带来一些“幸福的烦恼”。
比如今年 5 月,我们发现部分培训机构通过提交垃圾代码包装学员简历。学员提交一个没有用的 PR,合并到 vLLM 后,就可以在简历上说自己是 vLLM 贡献者,以此提高面试通过概率。
这对我们来说是很大的变化,彻底打破了“开源社区用户都是善意的”这一基本假设。
所以现在只能引入认证机制。我们会更加重视知名机构的贡献,忽略甚至拉黑看起来像机器人的账号。比如 10 分钟提交 20 个 PR,这一定是机器人,而且提交内容没有人力参与,全是 coding agent 生成的 AI slop,也就是完全没有营养的东西,可以直接 block。
随着 AI 和 coding agent 发展,未来开源社区的演进会更多掌握在机构和重要贡献者手里。个人贡献者能做的事情会减少。
整体来说,代码变得如此廉价,以至于维护者花时间看别人的 PR,还不如自己让 coding agent 重写一遍。维护者拥有更多 context,知道应该让 coding agent 怎么写。
未来开源社区可能会更加重视反馈,社区由维护者和用户组成。用户只需要提交 bug report 或 feature request,说明使用中遇到的问题,或者希望增加的功能,不需要再贡献代码,代码由维护者自己贡献。
张小珺
这是 vLLM 一个社区的演进方向,还是很多开源社区共同的方向?
游凯超
我觉得这是整个开源社区的演进方向。
coding agent 今年在写代码能力上的突破远超预期,给很多开源项目维护带来了类似问题。PyTorch 的核心维护者 Edward Yang 也写过类似博客,说他们已经没有精力看大家的 PR,与其花时间看别人的 PR,不如自己重写一遍。
张小珺
你们和 OpenClaw 联系多吗?他们现在的社区维护是什么状态?治理方式和你们类似吗?
游凯超
OpenClaw 感觉已经变成纯 AI 治理:AI 提交 PR,AI 审核,AI 合并,已经变成 AI 自治社区。
这个社区接下来是好是坏,很难说。
张小珺
你们为什么没有走这条路?
游凯超
我们这里还很难让 AI 完全自动化,需要很多参与者提供历史 insight。
我们做的很多事情,不是解决现有问题,而是在解决接下来会发生的问题。比如支持未来 3 个月要发布的新模型,维护代码时不仅要考虑现有模型,还要想接下来 3 个月的模型怎么支持,以及半年、一年后推出的新硬件怎么支持。
项目维护必须带着大量个人 context,目前还无法交给 AI。
张小珺
我听你讲的时候在想,开源社区发展得好不好,和创始团队是否在场有很大关系吗?
游凯超
对,创始团队需要在这里撑着。如果核心团队发生变化,项目肯定会经历阵痛期,需要转型和适应,所有合作伙伴也需要适应新的领导。
张小珺
有没有换过领导后仍然发展很好的开源社区?
游凯超
我觉得换过领导之后,项目基本上就很难发展得很好了。
张小珺
你怎么看 OpenClaw 未来的发展?
游凯超
coding agent 的发展给大家带来一个虚拟假象,好像所有软件都变得很容易写。但顶层系统设计和长期维护,仍然需要人来设计。
AI 可以帮我们走完 90% 的路,但还有 10% 关键的、画龙点睛的部分,需要人来提供支持,需要提前预判顶层设计。
张小珺
开源社区成功或失败,有哪些历史先例?什么原因可能导致社区分裂、萎缩或者失败?伯克利有很多相关经验,你们应该见过不少。
游凯超
第一重要的是,开源项目确实在解决大家关心的问题。如果解决的是没多少人关心的问题,项目就长不大,这是根基。
第二,有了重要需求之后,能不能撑起这样一个项目?这涉及是否有一家创业公司在背后运营和组织项目,这也是关键。
第三,创始团队是否持续推进项目,也非常重要。天时、地利、人和具备之后,还要把事情持续推进下去。
张小珺
你们为什么那么执着于把 Woosuk Kwon 拉进来?你和 Simon 两个人不行吗?
游凯超
他是我们几个人里比较偏技术的同学,很多历史上的技术决策都是他做的。他继续做,能保证比较好的延续性。
张小珺
所谓根正苗红,他可能就是那个根。
游凯超
对,他可能就是第一个人,也对社区号召力有比较大的影响。
张小珺
你见过很可惜的开源项目吗?根基很好,但因为后期维护出了问题,最后失败了。
游凯超
这样的例子很多,尤其是没有公司支持的开源社区。
很多历史上著名的项目,都是少数几个人艰难维护。比如 OpenSSH,这是大家都要使用的计算机基础设施,负责 SSH 的加解密,维护者其实只有几个人。
大概十多年前发生过一次事故,它的漏洞被破解,可能导致全世界都在裸奔,密码都能被看到。出了这件事之后,大家才成立基金会,投入一些钱支持维护。
所以开源社区基础设施建设一直是老生常谈的话题:它们都很重要,但在出问题之前,大家都觉得不需要投入。
张小珺
你们提前做了这件事。
游凯超
对。伯克利的历史经验表明,只有创业公司在背后支持项目,项目才能健康发展。
张小珺
一定得是创业公司吗?不能是大厂?
游凯超
我觉得最好是创业公司。大厂很容易带来原有的偏见和立场,很难融合社区,其他大厂也可能不服它。
创业公司本身就是项目的创业团队,和社区一起经历了很多风雨,号召力、中立性和公正性更容易得到认可,所以这样的项目更 promising。
张小珺
最终让你们觉得公司可以成立的节点是什么?是 Woosuk Kwon 答应加入的那一刻吗?
游凯超
我觉得是 Ion Stoica 老师告诉我们:“公司再不成立,项目就要完了。”
很难找出具体日期,但大概是在 2025 年。那一年我们的主要任务是大模型的大规模集群部署,这时遇到了很多问题。
第一是人力资源问题。以开源社区方式运作时,参与者不确定,人来人往,有人加入、有人离开,无法支撑长期开发一个重要 feature。
第二是法务问题。我们经常在新模型和新硬件发布前提供支持,需要签 NDA。但开源社区不是一个实体,不知道谁来签。
对方法务会问,背后有哪些人在做?这次是这些人,下次可能是另外一些人;其中有没有竞争对手,是否需要对他们做背景调查。这些都不是开源项目能解决的。
第三是机器资源问题。2024 年模型还比较小,一台单机、单卡就能做很多事情,有些公司也愿意捐机器。
到了 2025 年,规模上升,很多优化必须在集群级别完成。别人给一台机器已经是最大支持力度,要一个集群就非常困难。
为了做集群级优化,我们只能到处“乞讨”。可能先花一个月劝对方提供机器,拿到机器后还要赶紧规划今天做什么、明天做什么,因为机器可能一个月后就到期。
对方给机器也不是 promise。他们内部有紧急项目,可能一三五给我们用、二四六自己用,甚至临时通知我们一个小时后要收回机器。
这些事情给我们带来很大阻碍。说实话,2025 年我们做得不是特别好,但这些问题让我们明确看到:没有公司支持,项目已经无法继续发展。
张小珺
所以你们有点不得不成立公司,但你其实一直在等创业。
游凯超
对,整个项目的情况已经迫使我们需要一家创业公司。我一直等着公司成立,不断在内部说:“我们又遇到这个问题了,对方又要求签 NDA,我们签不了;如果有公司就好了。”
2025 年大家刚好都毕业了,所以最后决定:那就真的开个公司吧。
张小珺
Simon 怎么说?
游凯超
Simon 和我是一样的看法。
张小珺
Woosuk Kwon 呢?
游凯超
他还在犹豫。
张小珺
最后他是怎么下定决心的?这个时刻对公司成立有推波助澜的作用吗?
游凯超
有。我们相当于对他进行了一次“逼宫”:如果你不做,我们就自己做。你想一想,如果你不来,导致 vLLM 项目失败,虽然你赚到了很多钱,但你会不会快乐?
他想了几天,最后回来了。
张小珺
他当场没有回答?
游凯超
没有。我觉得这个问题问出来之后,双方都需要冷静一下。大概是在去年 7 月、8 月,或者 8 月、9 月,年底就开始成立公司。
劝他回来之后,我们还有各种流程,要找投资人聊融资。
张小珺
后面顺利吗?面对你们最不擅长的部分,现实是什么样?
游凯超
比想象中顺利。
硅谷 VC 对我们其实是期待已久。虽然我们决定成立公司是在 2025 年年底,但他们从 2023 年、2024 年就开始和我们接触,也已经给开源项目提供资金。
比如 2023 年,a16z 给 vLLM 项目提供过一笔资助,是单纯支持开源项目发展,不是投资公司。金额大概是几十万美元。
2024 年,红杉和真格也以开源社区的形式给我们捐赠了一笔钱。他们很早就注意到我们,也认可 vLLM 是重要项目,愿意投入早期资源支持。并且他们说,如果我们创业,一定会大力支持。
所以最终决定创业、成立公司后,再去找他们,他们都很爽快,说钱已经准备好了。
张小珺
他们一直在等你们。
游凯超
对,他们其实一直在等我们。
虽然我们种子轮融资金额比较大,但整体上仍然是投资人主动找我们的阶段。种子轮融完之后,到现在也不断有人说手里有很多钱,可以直接给我们几千万美元的 SAFE,希望下一轮融资时考虑他们。
但我们现在还是谨慎乐观。希望融资速度和公司成长速度匹配,不是为了融资而融资,不是现在有钱就一定要拿,而是看公司发展到什么阶段、需要用钱做什么,再考虑下一轮融资。
张小珺
你们应该是全球 AI Infra 领域种子轮融资最多的一家,是不是?
游凯超
没有做过横向历史对比,但应该确实是比较大的。
张小珺
投资人为什么这么看好你们?他们说过什么逻辑吗?
游凯超
核心还是我们在生态中的位置。
看开源模型生态,每一个模型发布背后都跟着 vLLM 的支持;每一个芯片厂商都会主动靠近 vLLM,希望得到支持。背后的市场是一个数百亿美元级别的市场。
所以相比于我们能产生的价值,给我们的投资并不算多。
张小珺
市场和客户都准备好了,只等你们做决定。
游凯超
对。虽然如果我们不做,可能也会有其他人做,但不一定有我们这么好的站位。
张小珺
公司成立后,你有没有想过“应该早点出来”?
游凯超
这可能是马后炮。往前看,我们当时也没有那么多时间,还要准备毕业。到了 2025 年 7 月我毕业,秋季学期 Woosuk Kwon 和 Simon 也快毕业,刚好到了这个时间点。
其实我一直在催促大家创业。
张小珺
你是为了创业才接博士后的吗?
游凯超
对,我就是为了等他们创业,才接了博士后 offer。我一直催促大家:应该创业了,再不创业又会出现一二三四五这么多问题。
张小珺
你们几个人现在怎么分工?Ion Stoica 老师扮演什么角色?
游凯超
Ion Stoica 老师是我们的创始人之一,现在主要是 advisor。重大决策我们都会问他。
他有很多创业经验,是 Databricks 的创始人,也做过 LMArena,对行业整体温度比较了解,会给我们 high-level 建议,比如公司现在该做什么、接下来该做什么。
我们 4 个主要创始人更多是有什么事情就做什么事情:有技术就做技术,有非技术工作就做非技术工作,关键是谁拥有更好的 context,谁就负责处理。
比如有些公司原来由我对接,对方再次联系时就由我出面;有些事情原来是 Woosuk Kwon 在做,现在需要继续推进,就由他负责。
我们 4 个人还是“四位一体”的状态,像共享一个大脑,需要谁时谁就出面。
张小珺
还是仁慈的独裁者?
游凯超
对,我们 4 个人一起,还是仁慈的独裁者。
因为我们负责的事情 overlap 不多,各自都有此前负责的领域。如果某个方向由你负责,而且你的意见很坚定,那就由你做,大家支持你。
张小珺
开源项目商业化之后,社区对 InfraRact 的态度会不会变化?会不会损失一些信任?
游凯超
我觉得不会,这对社区是好事。社区其实一直期盼我们开公司。
我们和很多合作伙伴合作时,对方想让我们签 NDA,没有公司就签不了;成立公司后可以签,法务也很开心。
还有算力问题。以前合作时,我们会问对方能不能提供算力支持。对方也很尴尬,因为公司算力一般只能在内部使用,很难给公司外部的人。即使有人提供资金,钱放在谁的口袋里也是问题,不能直接放在个人账户。
购买算力时,对方也可能要求资质证明,确认是不是合格公司。成立公司后,这些问题都大大缓解了。
现在我们有人力和硬件资源,可以把原来做不好的事情做好:招聘更多人支持项目,也有更多机器验证原来无法验证的事情。所以整体来说,对社区是很大的促进。
社区对项目的意见,不是看自己写了多少代码,或者在社区里说话有多少人听,而是看项目能不能带来收益:新模型发布时能不能支持,新硬件发布时能不能支持,新模型特性和推理引擎特性发布时能不能支持。
他们更多是从用户角度看问题。公司成立对 vLLM 发展、尤其是用户来说,是一件好事,项目更有保障,各方面也发展得越来越好,所以社区都支持我们。
张小珺
如果商业客户需求和社区需求发生冲突,你们会怎么选?
游凯超
我们不接这样的商业客户。
现在是供不应求的状态:我们能支撑的商业客户远少于希望合作的客户。所以可以很爽快地拒绝不想做的事情。目前做的事情都和社区发展一致。
张小珺
最终主要还是你们 4 个人决策?
游凯超
主要是我们 4 个人。
张小珺
PyTorch 基金会和公司的关系是什么?
游凯超
基金会不参与项目日常技术管理。我们可能每季度向基金会汇报项目做了什么,除此之外没有太多关系。
它更多是象征性和保障性的角色,保证项目作为持续的开源项目存在,不会闭源。具体技术工作由我们自己完成。
张小珺
你们在开源、闭源问题上没有过分歧或犹豫?
游凯超
没有。如果想做闭源,就可以自己找家公司做。我们认为开源推理引擎很重要,需要坚持下去。
张小珺
公司为什么叫 InfraRact?
游凯超
起名字非常困难,我们讨论了好几天。
InferAct 这个名字,是因为公司主要做 inference,名字里包含 inference 的意思;同时我们希望“Bring Inference Into Action”,把推理真正做到行动里,让它真正跑起来,所以最后取了 InfraRact 这个名字。
张小珺
你们认为公司 10 年后会怎么样?愿景和目标是什么?
游凯超
10 年是很长的时间,很难预测 AI 会发展到什么程度。
我们的预期是,希望把大模型推理这件事情做到基本解决的状态。大家想到推理,就会想到 vLLM 和 InfraRact。
张小珺
商业模式会是什么样?
游凯超
整体还是围绕大模型推理技术和 vLLM 生态,一边建设生态系统,一边做商业化。我们正在探索几种模式。
比如公司可以拥有机器和软件,提供 endpoint service,客户只需要直接从我们这里使用 token。
也可以探索 BYOC 模式:客户有机器,我们提供软件,产生的 token 在客户内部使用。
还可以和一些战略客户合作,探索如何把 vLLM 生态建立得更好,这也会产生商业合作机会。
整体来说,我们希望做到按量收费,不是技术外包,不是售卖工程师时间,而是根据为客户产生了多少 token、为客户机器节省了多少成本来衡量价值。
张小珺
现在公司有多少人?
游凯超
大概 30 多人,接近 40 人,还在持续招聘。
张小珺
从社团组织变成公司,你们有什么感受或者可以借鉴的 know-how?
游凯超
公司确实很不一样。
以前做开源社区,一个困难是没有办法从上到下强制推进事情,也无法完整规划。参与者都有自己的工作,不一定全职做项目,内部有紧急事情时可能无法参加。
那时只能 best efforts,或者说是许愿的状态:“求求大家这周把这个做完。”
现在有了公司,大家是全职员工,也有专门资源推进事情。我们可以做更多计划,比如这个季度完成什么,再分给小组,明确小组这一周要做什么。
张小珺
你们几位创始人的关系有没有变化?
游凯超
我们每天都会同步相关事情,关系应该更紧密了。
以前开源社区是松散组织,沟通没有那么紧密;现在大家为了共同目标奋斗,需要了解公司发生的事情,一起解决问题。
张小珺
InferAct 今年的规划是什么?
游凯超
目前还是聚焦开源大模型推理生态,包括接下来发布的新一代推理引擎、新一代模型和硬件,如何实现更好的推理。
针对下一代 workload,大家如何使用 token,也需要由开源 vLLM 给出一份满意答案。
张小珺
前面回溯了你的研究经历,以及公司从开源项目走向公司化的过程。今天还想聊一个你们非常擅长、也是很多模型公司关注的话题:模型与 Infra 的 co-design。
如果要向非技术背景的观众解释模型结构与 Infra 为什么需要一起设计,你会怎么比喻?
游凯超
9. Model Infra Co Design
我们现在经常把 token 比作电,可以从这个比喻开始。
硬件可以想象成自然资源:不同地方有不同风力、水力和太阳能。模型可以比作发电机,有风力发电机、光伏发电机,也有机械式水力发电机。
推理引擎可以比作电力系统,把模型运行在硬件上,最后把 token 发送给用户,分发到千家万户。
模型、硬件和推理引擎之间 co-design 的程度,决定了发电效率。比如有的地方水流湍急,有的地方水流平缓,在这两个地方,如何设计发动机,才能更好地利用各自的能量?这就是模型和 Infra 的 co-design。
在同样自然资源下,配上不同发电机,发电效率会不一样。
张小珺
直觉上推理效率可能是系统工程师的事情,它和模型算法有什么关系?
游凯超
要讲清楚这一点,需要讲一个概念:hardware lottery,也就是“硬件彩票”。
这个概念不是 David Patterson 提出的,而是另一位学者写的。几十年前,摩尔定律还有效时,软件和硬件基本各自发展。写软件的人不需要考虑太多硬件特性,因为硬件通用性能每两年翻一倍,软件性能自然跟着变快。
现在摩尔定律的黄金时代结束了,无法再通过制程获得通用性能提升。我们进入了专用时代。英伟达常说黄氏定律,算力可能每两年翻几倍,但这些算力是专用算力,不是通用算力。
如果算法没有利用这些专用算力,就没有抽中硬件彩票,吃不到这个时代的红利。
比如 Hinton 老师曾经大力推动 Capsule Network,从概念上看很有道理,但它对 GPU 不友好,因此没有得到广泛应用。如果想广泛应用,可能需要专用硬件。
所以模型结构决定了推理效率的上界。如果上界太低,系统工程师就无力回天。模型已经设计成这样,再怎么优化也只能到这个水平,必须把模型和系统放在一起看。
张小珺
Transformer 就是抽中了 GPU 的彩票。
游凯超
对,可以这么说,因为 Transformer 非常适合并行,内部有大量矩阵乘法。
张小珺
应该是算法引领硬件,还是硬件引领算法?
游凯超
理想情况下,两者应该协作。但现实是硬件已经造出来了,很多时候算法需要学习硬件的发展。
当然,硬件一旦走错,几年时间就可能走错,对硬件公司来说是巨大挑战,需要不断踩着时代脉搏,判断下一个有用的硬件长什么样。
但一般来说,算法和模型结构适配硬件的情况更多。
张小珺
能不能举一个具体例子,说明模型结构设计得好,如何提高 Infra 效率?
游凯超
一个著名例子是 RoPE,也就是旋转位置编码。
Transformer 出现后,位置编码至少有上百种实现,但很多实现需要修改核心 attention。位置编码变了,attention kernel 也需要重写。
比如 ALiBi,是 attention with linear biases,没有得到广泛应用。RoPE 流行起来的一个重要原因是,随着训练长度增加,大家需要位置编码;与此同时,FlashAttention 解决了训练长度问题,变成训练必需品。
大部分用户没有能力修改 FlashAttention,所以需要修改 attention 内部实现的位置编码,逐渐被淘汰。RoPE 的优势是,它具有绝对位置编码的性质,同时又表现出相对位置编码的性质;它可以独立注入 query 和 key,位于 attention kernel 之外,可以和 attention kernel 互补。
所以 RoPE 成了最佳搭档。模型结构设计得好,就能和 Infra 产生 co-design 的共鸣,互相提高,整体训练和推理效率都会提升。
张小珺
提到 Infra,大家会说这一代大模型公司里 DeepSeek 的 Infra 做得最好。它做得好,和模型结构、Infra 的 co-design 有关系吗?
游凯超
我觉得 DeepSeek 的 Infra 团队是全球顶级团队。是不是第一不好说,但绝对是顶级。
Infra 能力强,能够高效实现的模型结构就更多,算法研究员也能更快、更充分地探索各种选项。
DeepSeek 的算法同学也懂一部分 Infra。比如 2024 年初,DeepSeek 探索 MoE 时,是 DeepSeek 的算法同学写出了当时比较粗粒度的 MoE 的高效实现。
他们在 MoE 方面探索了很多 Infra,包括后来细粒度 MoE,也是他们首先在推理系统里做出来的。
所以 Infra 能力对算法探索起到非常重要的作用,同时算法同学也会学习 Infra 知识,让算法设计更 Infra-friendly。应该是算法主动靠近 Infra,Infra 也需要了解算法基础,两者要更紧密合作。
张小珺
需要让两者一起办公吗?有什么组织机制,或者招聘时就要求算法的人懂 Infra、Infra 的人懂算法?
游凯超
招聘时如果能找到既懂算法又懂 Infra 的同学,当然最好。
组织结构上,一起办公确实更好。大家日常讨论时,Infra 同学讨论什么,算法同学耳濡目染就会知道原来需要考虑这些问题;算法同学的讨论,Infra 同学也会受到潜移默化的影响。
但如果 Infra 团队过于主导,也可能忽略算法需求。比如 MoE 中,曾经有 Infra 同学为了 MoE 的均衡,选择了 Expert Choice。这个事情在算法上不能接受,但从 Infra 角度可以让它跑得很快,这是 Infra 过度倾斜的例子。
张小珺
两者谁的话语权应该更高?
游凯超
很多公司里算法话语权更高,Infra 常常是被动接收。
但理想情况下,两者应该 co-design。就像模型和硬件 co-design 一样,理想状态是一起设计;现实里硬件更强势,因为硬件已经设计出来了。
张小珺
DeepSeek 最近发布了 DeepSpark。你能不能从旁观者角度解读一下这个最新技术进展?
游凯超
DeepSpark 是一种新的投机解码方法。
自回归大模型推理分成预填充和解码两个阶段。预填充处理用户输入,解码处理模型自己的输出。因为模型是自回归的,解码阶段只能一个 token 一个 token 地生成,效率比较低。
投机解码的思路是,根据当前输入,一次猜测接下来要生成的几个 token,把解码变成一小段一小段的预填充,一次处理多个 token,提高效率。
在 DeepSpark 之前,业界已经研究了很多投机解码方法,比如 EAGLE,以及 DeepSeek 提出的 MTP。它们猜测长度比较短,一般是 3 到 5 个 token,但接受率比较高。
DeepSpark 属于 DFlash 系列。这个方向我们最近几个月一直在关注,所以 DeepSpark 不算非常新颖。DFlash 的特点是一次猜很多 token,比如 16 个。
我们和英伟达最近发布了一篇技术博客,介绍 vLLM 对 DFlash 的支持,对某些模型可以达到每秒上千 token。
DFlash 的缺点是猜得多,猜错的也多,模型验证时会浪费算力。DeepSpark 的改进是估计猜测的 token 里哪些准确、哪些不准确,大概率不准确的就不再验证。
比如模型猜测 16 个 token,统计模型最后输出的置信度后发现前 8 个准确,就只验证前 8 个。所以 DeepSpark 大概是沿着这个路线改进 DFlash。
对我们来说,DeepSpark 并不意外,因为我们已经做了几个月 DFlash 优化。接受率问题也是 DFlash 研究圈的共识。
在 DeepSpark 提出之前,腾讯混元团队已经发布了 D-Cut 工作,上海交通大学的同学也提出了 Domino,都是通过类似思路解决这个问题。所以 DeepSpark 在算法上不能算特别 novel。
我们和 DeepSeek、腾讯混元团队都有很多沟通,大家很快也会看到 vLLM 对这些算法的支持。
创新性是一回事,能不能把创新想法扎实做出来是另一回事。DeepSpark 继承了 DeepSeek 一如既往扎实的 Infra 基础,把推理优化压榨到极致,这也是我们向他们学习的地方。
这也是模型和 Infra co-design 的案例。有没有好的推理引擎实现,是决定投机解码算法能不能大规模使用的关键。DeepSeek 推理团队很强,为算法团队研究投机解码提供了更大的探索空间和更多反馈。
张小珺
大家会说一个很懂 Infra 的人,应该也能做出不错的 Infra。为什么有些团队还是没有做起来?他们应该懂 AI 吧?
游凯超
我觉得他们不懂 AI Infra。
团队里当然有懂 AI Infra 的同学,开出很高的价格也能招到一些人,但整体上不够懂。关键是一号位不太懂,就可能出现瞎指挥。即使下面有懂 Infra 的人,也发挥不出价值。
大家说他懂 Infra,可能是因为他要建设非常大的集群。但那叫 Infra 的 Infra:怎么搭建集群、点亮机器,再把机器交给 AI Infra 团队。
这件事不一定技术含量很高。建集群是很重的资本开销,更多取决于有多少钱、能找到多少地、多少电,所以他是一个拥有很多资源的人。
张小珺
为什么大家会说,好的 Infra 不是加出来的,而是设计出来的?模型团队和 Infra 团队各做各的,问题在哪里?
游凯超
可以回到发电的类比。
大模型训练出来,目的是用于推理。两年前,大模型生命周期里训练开销可能占主导,推理时间也比较短,对话较短,推理开销不大。
现在训练和推理开销可以达到 1∶1,甚至推理开销还在增长。
训练就像研究发电机结构,是前期技术投入;推理像拿做好的发电机去发电,效率非常重要。
可以设计通用发电机,研发成本较低,拿到哪里都能发电,但效率可能低。也可以提前设计一个针对特定地区的发电机,测量当地的水文和风力条件,再做针对性优化,提高发电效率。
一两年前模型比较小,推理负载低,用户也少,整体是算力多于需求,所以大家不追求极致效率。
随着 AI 发展,大模型推理需求爆发,进入供不应求状态,电力供应小于需求,而且是远小于需求。自然资源无法快速增长,一个地方水力、风力的上限是固定的。
要发出更多电,只能提高发电机效率,在设计时就考虑当地自然资源:水流湍急的地方怎么发电,炎热的地方怎么发电,昼夜温差大的地方怎么发电。
这就是为什么模型和 Infra 必须紧密结合。如果模型团队和 Infra 团队各自为战,这个团队就没有前途。
比如某个算法团队异想天开,想把 attention head size 开到 1,024,Infra 团队可能会晕过去,因为硬件上很难实现。
张小珺
你看过很多团队。从全球来看,模型团队的 Infra 和算法 co-design 做得最好的是哪几家?能不能排序、点评一下?
游凯超
做得最好的是 DeepSeek。主要是 DeepSeek Infra 团队全球顶级,算法同学也比较懂 Infra。
前面提到的 MoE 例子,算法同学都参与了设计;DeepSeek 提出的 DeepSpark,以及前面的 NSA,也有非常浓厚的 Infra 味道。
DeepSeek 深厚的 Infra 功底,可能来自他们之前做幻方量化时对性能极致的压榨。他们做量化、需要自建机房,所以会深度控制机器的每个细节,能够做全栈优化。
但排序不好排。DeepSeek 做得最好,不代表其他团队能轻易复制他们的成功。自建机房是一道坎,优点是控制力强、总成本可以降低,缺点是难以短期大规模扩张。
很多团队租云上的机器,可以快速扩充机器资源,但控制力弱、总成本高。这是不同公司的取舍,不能简单说谁的 Infra 一定比谁好。
DeepSeek 在自身条件下确实做得非常好,但其他人不一定能完美复制。
张小珺
其他人很难复制 DeepSeek,那有什么可以学习和借鉴?
游凯超
最值得学习的是,算法团队要懂 Infra。
张小珺
这怎么招?怎么找到这样的人?
游凯超
招聘确实是老大难。我们公司也希望招到既懂算法又懂 Infra 的同学,但一方面需要他们有耐心学习,另一方面也要看缘分。
我算是这种人。因为原来做算法研究,有算法背景;现在做推理系统,又有 Infra 背景,算是同时具备算法和 Infra 背景。
张小珺
这样的人多吗?
游凯超
比较少。熟悉这些背景需要时间,而且算法和 Infra 的思考方式不太一样。
算法同学更多思考东西在理论上是否 make sense,模型表达能力是否更强,关注下游指标:能不能解决新问题、精度能不能提高。
Infra 同学更关注拿到的硬件是什么样,能在上面做什么,如何极致发挥硬件性能,以及如何实现算法需求。
两者出发点不同。养成这种思维需要经年累月的熏陶。我刚好在算法侧熏陶了几年,又在 Infra 侧熏陶了几年。
张小珺
现在能做的,可能就是让两边团队坐在一起工作,互相熏陶。
游凯超
对,一起办公是互相熏陶的机会。坐在一起吃饭,总要聊点东西,可以互相了解对方关心什么,互相理解。
张小珺
你们也帮助不同模型进行部署,包括海外的 Llama、国内的 Qwen、GLM、DeepSeek 等。它们的模型结构有差异,在推理层面的挑战也不同。从 Infra 视角看,哪个模型设计对你们挑战最大,哪个最友好?
游凯超
全球主流开源模型我们都会支持。它们开源前会找我们提前支持。如果模型开源时没有推理引擎支持,基本就属于不可用状态。
它们和我们的合作对开源成功很重要。整体感受是,欧美模型更重视效果,中国模型更重视效率,这可能和算力供给有关:欧美算力资源相对充足,中国算力资源比较紧缺。
从 Infra 角度看,架构设计最大的挑战,是 attention 机制如何设计。
大模型是自然语言建模模型,也是自回归序列模型,需要处理当前状态和过去状态的关系,这就是 attention。vLLM 的核心是管理推理过程中的状态,不同 attention 机制决定状态大小和特性。
完整 attention 的特点是,每个 token 的状态比较小,状态只增加、不修改,对应一套 PagedAttention 管理机制。
最近兴起的 linear attention,每个 token 的状态比较大,而且会被修改,需要推理引擎提供其他支持。
除此之外,还有混合交叉 attention 等复杂机制,这种状态很难管理。好在现在还不流行,所以暂时不需要大量支持。
从 Infra 视角看,模型结构当然越简单越好,比如两年前的 Llama 结构。但不能完全从 Infra 角度决定模型,因为还要看模型效率。如果发电效率高,但发出来的是没用的电,也不行。
这里可以补充 token 和电的不同。电比较通用,也可以调制,电压和频率可以通过转换器转换。所有家电只需要符合国家标准,比如 220 伏,就可以接入。
token 没办法调制。你不能把 DeepSeek 模型的 token 转化成 Kimi 的 token。token 带有模型烙印。
好比有上百种发电机,每种型号发出的电压和频率都不同,不能调制,只能原样送过去。用户必须适应:今天是 90 伏,明天是 110 伏,后天是 120 伏。
所以有时还要看 harness 能不能适配模型 token,不同推理厂商生成的 token 也不同。模型本身也不同:有些模型聪明,有些模型比较笨;有些适合指挥,有些适合干活;有些适合 Claude Code,有些适合 OpenClaw。
token 比电复杂很多,具有异质性,不是拿来就能用的 commodity。
张小珺
你觉得这种差异会越来越同质化,还是越来越差异化?
游凯超
目前还是百花齐放。
尤其现在和 harness 有关:harness 怎么设计,模型训练时使用过哪些 harness、对哪些 harness 更熟悉,以及推理引擎设计,有时都会影响 token 质量。
所以现在仍然是百花齐放、比较混乱的状态。
张小珺
你们现在支持多少种模型结构?
游凯超
大概两三百种,相当多。我们最近正在做的一件事,就是删除不再使用的模型结构。
张小珺
每个 token 复杂度这么高,你们还支持这么多模型结构,会不会让复杂度失控?取舍是什么?
游凯超
这就是项目的价值:支撑住复杂度。当然也要不断删除不必要的复杂度。
我们会删除不再使用的模型、删除不必要的 feature,同时更加重视大家当前使用的主流模型。接下来重点是优化主流模型在主流硬件、主流 workload 上的性能。
张小珺
MoE 现在是最主流的架构之一。从推理 Infra 角度看,MoE 带来什么挑战?
游凯超
MoE 带来三大挑战。
第一是细粒度专家,这是 DeepSeek 提出的。DeepSeek-MoE 发现专家粒度越细越好,但细粒度专家会导致矩阵乘法维度较低,对 Infra 实现不友好,需要取舍。
第二,MoE 是动态选择的,这是 MoE 算法基础。路由模块决定每个 token 选择哪几个专家。数据依赖对 GPU 高效实现很难处理,因为 GPU 更擅长静态数据流,也就是提前知道哪部分数据和哪部分数据运算。
第三是专家并行系统。当大家发现细粒度专家有用后,很快把 MoE 扩展到万亿参数,但只激活其中几十分之一。这要求配合专家并行、数据并行策略,对系统设计和通信要求很高。
针对这三大挑战,DeepSeek 在 2025 年提出了一系列方案,包括用 DeepEP 处理专家并行通信,用 DeepGEMM 处理专家并行的计算和选择。可以说,MoE 这一波是 DeepSeek 引领了时代潮流。
张小珺
MoE 之后,潜在发展方向是什么?
游凯超
现在大家主要还在探索 attention 设计,包括 linear attention 和 sparse attention。到底哪一种更好,可能仍然没有定论,也可能两者都是有效方案,没有必要非此即彼。
张小珺
Test-time scaling,也就是测试时计算扩展,是一个新趋势。它对推理 Infra 提出什么要求?
游凯超
Test-time scaling 一直存在,只是表现形式不同。
早期机器学习系统里有 ensemble,也就是集成学习。同一个问题让不同模型回答,或者让同一个模型回答多次,再集成结果,通常能带来效果提升。这里 scale 的是模型尝试次数。
大模型时代,test-time scaling 通常指 OpenAI o1 里的方式:面对困难问题,让模型思考更长时间,提高成功率。这里 scale 的是模型单次输出 token 数量。
去年经常看到让模型长时间思考,输出几十万 token,解决国际数学竞赛等高难度问题,这确实是有效手段。
但今年以来,test-time scaling 更多体现在 coding agent 场景:让 agent 持续和环境交互。这里 scale 的是模型与环境交互的次数,或者模型完成任务所运行的时间。
每次交互的思考可能只有几百个 token,但模型可以不断了解任务环境,适应环境特点,更高效地完成任务。
集成学习比较早,和现在的大模型范式不完全匹配。这也是我之前删除 beam search 的原因。
让模型思考更久,和让模型与环境交互更多,对推理 Infra 的要求不同。前者是一个请求长期运行,对系统成本很高,目前主要服务科学家等特殊群体的前沿探索。
后者今年迎来爆发。Coding agent 通过与环境探索,能够适应各种环境,走进日常生活。年初“小龙虾”热潮就是一个例子。
在多轮交互下,prefix caching 非常重要。要尽量保留历史状态,让下一次请求快速进行。所以 test-time scaling 的不同阶段,对推理引擎有不同要求。
张小珺
Coding agent 会被调用很多次,有复杂上下文管理需求。现在的推理框架支持得够好吗?
游凯超
目前推理引擎对这类场景的基础支持比较好。Coding agent 主要需要保持前缀稳定,让推理引擎复用之前计算的结果。
当然,也有模型设计从一开始就不完全遵守前缀稳定。比如有些模型下一轮思考时会删除上一轮思考过程,这就需要和推理引擎联合优化。
目前主要问题是生态碎片化。不同 harness 框架带来不同 workload 特性,不同模型结构也带来不同推理优化需求,很难统一。
这和模型、Infra 的 co-design 是同一个问题,现在需要 harness 和 Infra 的 co-design。
去年,Manus 的纪超也写过一篇博客,讨论如何设计 Infra-friendly 的 harness 框架。最重要的是充分利用 prefix caching。
有些 harness 设计者可能比较自作聪明,认为把工具调用范围切得更精细,可以提高模型效率。但工具调用总是出现在请求前端,这样每次请求都无法复用之前的计算结果,会给推理系统带来巨大负载。
还有一些传统做法,比如 ChatGPT 以前把当前日期放进 system prompt,日期变化时前缀缓存会统一失效,这也不好。更好的做法是把日期作为工具提供给模型,需要时再查询,不要把经常变化的内容放在请求前端。
最极端的例子是,有些 harness 把当前时间精确到秒地嵌入请求,而且定时任务总设在整点。结果一到整点,推理系统就收到巨大流量。
Manus 的同学有个很形象的说法:一群小龙虾一到整点就集体出动攻打月球。
这些其实都可以简单优化。比如每小时一次的定时任务,如果不要求整点,可以在一小时内随机选择时间;时间戳也不要放进 system prompt。
这些是基础逻辑,但可能因为时代比较浮躁,知道这些基础的人并不多。
DeepSeek 最近完成了一轮大额融资,也在大量扩招。它招聘的首个方向就是 Agent 框架设计。我很期待 DeepSeek 能推出什么样的 Agent、harness 框架。
他们在模型和 Infra co-design 上可以说是一骑绝尘,我也相信他们的 harness 框架会达到同样高度,给社区上一课,告诉大家什么才是好的 Agent 框架。
张小珺
你说的是 Agent 框架、harness 和 Infra 之间的 co-design。也有人认为,未来 AI 系统里模型架构和芯片架构会越来越耦合,像苹果的 M 系列芯片和 iOS 一样。你同意吗?这对设计通用框架意味着什么?
游凯超
目前趋势确实是模型结构和芯片架构越来越耦合,但主要是模型往芯片靠,因为芯片已经设计成那个样子;如果模型不往芯片靠,效率就会大幅下降。
David Patterson 获得图灵奖时有过一个演讲,谈到计算机体系结构的看法。第一,摩尔定律已经无法延续,通用算力无法继续增长。想获得更高性能,唯一出路是设计领域专用芯片,为特定负载提供特殊结构。
这反过来限制了模型:硬件已经为特定负载设计好,如果模型不是这个样子,就享受不到芯片红利。
第二,矩阵乘法如此简单却有效。芯片针对特定负载优化时,自然要问这个负载是否重要、是否值得优化。英伟达的发展历史和过去 20 多年的工业探索表明,矩阵乘法就是非常有效的特殊负载,只要矩阵乘法算得快,很多问题都能解决。
这两点相辅相成,导致现在高性能计算芯片基本都特化为矩阵乘法计算单元,模型结构也必须尽可能靠近矩阵乘法。
一个具体例子是 FP8 量化格式。
2024 年到 2025 年,英伟达旗舰芯片从 A100 转向 H100,从 Ampere 架构升级到 Hopper 架构。Hopper 的一个巨大卖点是 FP8 算力,也就是 8 比特浮点运算,比 16 比特浮点运算快两倍。
但模型结构想用上这两倍算力并不容易。简单做法是把模型全局量化成 FP8,但容易损失精度。
DeepSeek 应该是第一个大规模跑通 FP8 训练的团队,核心是分块量化:权重做 block quantization,activation 做逐 channel quantization。这也符合下一代芯片的 MX 量化格式。
但纯分块量化不能完全解决问题,矩阵乘法存在精度问题,这是第二道关卡。DeepSeek 探索出矩阵乘法之后,再用向量单元累加的思路,利用芯片两部分计算单元可以同时执行的特点,在精度不损失的情况下实现计算效率领先。
因此他们领先竞争对手一个身位。这些内容都写在 DeepSeek 的技术报告里,只是不同人会从报告里读出不同重点。
张小珺
如果要给想做好 Infra 的模型团队提建议,可能的 secret sauce 是什么?有没有思维方式或方法论?
游凯超
核心是从第一性原理思考问题。
AI 行业很火,涌入了很多从业者。每个月可能都有 10 个新技术层出不穷,技术团队需要从第一性原理出发判断哪些技术有用,哪些只是花拳绣腿。
比如做推理引擎,有些同学连 continuous batching 的概念都不知道,只能在别人代码里修修补补、测一下速度,却不知道速度提升来自哪里。
有些同学做性能优化,连 GPU 性能测试基本概念都不了解,更不用说散热、功率、硬件频率对性能的影响。这样的人做优化,提升就像抽彩票,能有效可能只是运气。
再比如模型结构设计,有些同学不了解 attention 在不同 batching 条件下的计算过程,只知道课本公式,也不知道 FlashAttention 怎么写。面对旋转位置编码的上百种上下文扩展方式时,就无法判断哪一种值得投入。
所以靠谱团队的首要条件,是有足够多的人能够从第一性原理思考:要解决什么问题。
不同团队因为硬件环境和资源限制不同,做出不同选择都合理。只要从第一性原理出发,结果通常不会差。
我从算法研究转到机器学习系统,系统知识积累肯定不如行业里耕耘多年的同学。但学习 GPU kernel 编程时,我首先看 GPU 的编程模型提供了哪些设计空间。
理解这些第一性原理后,我很快找到一个困扰大家的问题:GPU 上的非法内存访问,也就是 illegal memory access。这是 GPU kernel 中很难调试的问题。
当我从第一性原理理解 GPU kernel 后,很快找到了一个叫 CUDA core dump 的技术。这个技术存在很久了,但 AI Infra 圈知道的人很少。
我觉得既然 GPU 编程模型存在,就应该有这样的工具;GPU 驱动应该支持。所以我带着这个问题不断问英伟达团队:“你们应该有方案,帮我找出来。”
最后他们确实找到了,方案早就存在,只是不为人知。后来我把它在社区推广,解决了很多疑难杂症。
在快速发展阶段,通过第一性原理看清时代主线,屏蔽噪音,持续在有用的方向投入,我觉得这是最重要的。
张小珺
基于模型结构和 Infra co-design,你觉得两条线分别会如何演进?能不能做一些技术预测?
游凯超
模型结构不是线性向前,更多是螺旋式上升,有时也会走弯路。而且模型结构和 Infra 也不是全部服务于技术本身,很多时候还服务于具体需求,所以很难做大的预测。
我讲一个 hot take:我觉得模型对上下文的需求,基本应该停留在百万上下文级别。个别领域,比如生物、化学等处理特殊数据的自然科学领域,可能需要千万甚至亿级上下文。
但和人打交道的模型,我觉得上下文不需要再大幅增加。模型执行长程任务,或者满足终身学习需求,可以通过外部工具实现,比如记忆模块、技能模块、sub-agent 模块。
如果这个预测成立,当前模型结构和 Infra 范式还可以延续很长一段时间。
张小珺
还有其他 hot take 吗?
游凯超
我先讲这一个。
张小珺
国内模型现在大量压榨现有硬件利用率,但也有人认为,模型朝 test-time scaling 发展,推理 token 数爆炸,再怎么压榨效率也追不上需求增长。如果极致效率优化和 scaling law 发生冲突,应该选哪个?
游凯超
它们应该不矛盾。
现在是夏天,是用电高峰期。不能因为大家用电量激增,发电厂就摆烂。发电厂反而要更加努力地产生更多电。
token 需求爆炸式增长,对推理效率的需求也更加迫切。地球资源有限,算力和电力供应有限,遇到困难就要一起想办法。
前面说的 harness 框架可以和推理引擎做 co-design。同样任务,合理的 harness 设计可以让推理引擎产生更多 token。
人也会灵活变通。token 不够用,就研究如何节省 token;钱不够,就研究如何用便宜模型做同样的事。
这是一个非常激动人心的时代,很多聪明头脑一起推动人工智能发展。我相信未来一定能达到 token 供需平衡,但需要供需两侧共同努力:供给侧优化、提高生产效率;需求侧规划、提高 token 使用效率。
效率和效果不冲突,必须共同进步。
张小珺
海外在效果上跑得更快,国内在效率上跑得更快,是这样吗?
游凯超
这是我的感受。
张小珺
中国公司的开源文化已经形成了。你觉得这一波中国开源生态,对全球模型格局产生了什么深远影响?
游凯超
10. Why Open Source Wins
中国开源对世界产生了非常深远的影响。美国走向闭源之后,中国基本扛起了开源大旗,所以非常重要,也做得很好。
张小珺
美国现在有很多像你们这样的开源社区吗?
游凯超
美国主要是开源推理技术社区,模型不太开源。也有一些公司做开源,比如 Mistral,还有一些大家不太熟悉的公司,但顶级的目前没有。
张小珺
这会让你们的业务重心转向中国吗?
游凯超
我们主要还是做北美业务。模型虽然在中国开源,但可以在北美使用。
张小珺
中美 AI 基础设施的竞争会怎么发展?能不能预测一下?
游凯超
我觉得不完全是竞争,更多是双方各有局限和掣肘。
中国显然高端算力紧缺,需要想办法利用各种可用算力,更重视国产卡适配。中国的优势是土地和电力供应比较充足,建设数据中心没有太大问题。
美国则相反,高端算力更多,芯片资源丰富,但土地和电力供应有问题,所以美国下一轮基础设施建设是增加电力供应。
张小珺
长期来看,中美模型格局会怎么走?
游凯超
各有优劣。
美国顶级模型目前走闭源路线,比如 OpenAI、Anthropic、Google Gemini。中国顶级模型仍然走开源路线。
我个人认为,最后开源模型会赢。
还是用电来比喻。token 和电有相似之处,也有不同之处。
如果有核电厂技术,把核电厂发出的电供给一个城市使用,这个城市用一辈子,也不会研究出核电技术。它只是用电,不会触及发电技术。
但大模型不同。每个 token 都带着模型烙印。模型训练出来是给人使用的,一旦给人使用很长时间,用户自己的数据就可以训练出模型。
所以模型不是能够长期隐藏的东西。训练模型的数据成本一定会越来越低,因为大家都能收集自己的数据。
尤其 coding agent 出现后,数据很快就能收集到。我觉得通常一个月左右,一个公司级机构就能收集到足够训练的数据,内部飞轮就会转起来,可以训练自己的模型。
张小珺
现在有哪些公司已经形成自己的飞轮?
游凯超
智谱做得很好。他们 GLM-4.5 的 coding 能力很强。具体怎么做我不清楚,但我觉得一定在数据收集方面有过人之处。
张小珺
这会带来领先者优势。
游凯超
会,但这个优势不会长期存在。模型能力优势很难长期守住,最后的护城河更多是快速迭代。
没有任何东西可以守一年,必须不断推陈出新。
张小珺
最后模型会成为 commodity 吗?
游凯超
我觉得会,因为开源模型最终会赢。模型开源之后,大家都可以使用。
张小珺
所以你 bet 中国?
游凯超
我 bet 开源模型。中国模型开源,我就支持中国模型;其他国家的模型开源,我也支持。
张小珺
这个观点是什么时候形成的?
游凯超
这是基于对 AI 的理解,从第一性原理出发。
模型不是能够长期藏住的东西。它不像核武器,研究出来后只需要展示一次,就可以藏起来用于威慑。
模型是民用技术,必须给大家大规模使用。一旦大规模使用,大家就能收集数据,模型也就必然能够被复制出来。
张小珺
如果开源模型最终会赢,对你们公司和 vLLM 有什么影响?
游凯超
对我们当然是好事。我们聚焦推理,相信模型这件事会有人帮我们解决。
张小珺
模型公司会自己做推理,为什么还需要 vLLM?
游凯超
他们都会做自己的推理,但内部推理引擎很难在外部部署。
比如 DeepSeek 的 Infra 很强,是建立在他们能够完整控制从集群到上层软件的基础上。但他们没有办法快速扩充:再给他 10 倍机器,能不能马上产生 10 倍 token?不一定。
我们做的开源推理是更通用的推理。可以在云上租机器,机器有各种限制,控制力没有那么强,但仍然能做出不错水平的推理引擎。
张小珺
你觉得你们会是下一个 Linux 吗?
游凯超
我们正在往这个方向发展。vLLM 的影响力已经可以说是 AI 推理领域的 Linux。
Linux 的一个重要维护公司是 Red Hat,它促进了 Linux 推广。Red Hat 也在投入 vLLM,因为它认为 vLLM 是下一个 Linux,已经把 vLLM 打包进很多 Linux 企业发行版。
未来部署时,不再只是一个操作系统,而是一个能够运行 AI 的 AI 操作系统。
张小珺
接下来还有融资计划吗?
游凯超
公司肯定会持续融资,但不是为了融资而融资。我们希望先做出值得融资的成果。
现在正在马不停蹄地做工程工作。下一个 milestone 可能比较内部:希望打通一些商业模式。当出现能够规模化扩展的商业模式时,就会进入下一次融资。
张小珺
我觉得你比我想象中有 passion,尤其对开源社区非常有感情。我感觉你一直喜欢打通底层、解决通用问题,做透明化系统。这种性格底色是怎么形成的?
游凯超
还是和成长的时代有关。
我上大学以来接触的技术,都处在大家比较 open 的开源环境里。不管做什么事情,第一反应都是先搜索有没有人做过,从开源项目开始。
这可能也是最近十几年才形成的风气。我在这样的环境下成长,自然觉得技术开源是一件很自然的事情。
张小珺
在美国实验室里,中国人或中国团队会比其他国家和地区的人更有开源热情吗?
游凯超
我觉得这和国家关系不大,是全球范围内的开源运动。
从几十年前操作系统开源开始,一直演变到现在。
张小珺
你从 2016 年开始写知乎,为什么喜欢写作?通过写作和世界交互,给你带来什么?
游凯超
我的很多写作都是技术创作,可以归入开源。开源不一定是算法,也包括技术心得分享,是和社区自由沟通的过程。
张小珺
你是通过写作来思考的人吗?
游凯超
对。我希望把事情写下来。如果不能清晰写下来,说明还不够了解。
有人通过写作思考,有人通过口头表达思考。有时通过写作思考的人,口头表达能力反而没那么强,但我觉得写作和口语对我来说是类似的,都是把想法清晰表达出来。
我也比较喜欢数学和物理,喜欢形式化。形式化的东西只有写下来才容易验证。需要大胆猜想,小心求证,所以要把语言落实到文字,再进行 polish。
张小珺
你们团队管理,会通过大量文本进行吗?
游凯超
文本比较多。我们在新加坡和美国有两个 base,大家没办法长时间待在一起,所以很多时候通过文字或在线会议沟通。
张小珺
会一起写长文档、共创长文档吗?
游凯超
长文档比较少,更多是直接在 Slack 里聊天。
张小珺
对现在想入行的年轻 AI researcher,有什么建议?
游凯超
现在确实不是一个特别容易入行的时代,行业竞争很激烈,也会让人心态浮躁,很难长期积累踏实的东西。
我只能说自己认同的一点:从第一性原理出发做事,做人也一样。想清楚自己想要什么,再去努力。
一般从这个角度出发,最后结果都不会太差。
张小珺
我看到你说过,后摩尔定律时代,AI 的上限取决于系统而不是算法。今天还认可吗?
游凯超
这不是我的判断,而是我反复提到的 David Patterson 老师的判断。我认同,而且近 10 年的发展一直在印证它。
比如《Attention Is All You Need》出来后,大家要扩展 attention 的上下文长度,出现了很多近似计算 softmax attention 的算法,试图解决长上下文计算效率问题。
但最后 FlashAttention 解决了这个问题:精确的 softmax attention 也可以高效实现。于是之前那些研究高效 softmax attention 的论文就没有用了。
再比如自回归 decoding,最初大家认为它很慢,只能一个 token 一个 token 计算,效率低,肯定没用。
但经过几年优化,大家看到自回归 decoding 也能高效运行。vLLM 的 continuous batching 加 PagedAttention,就是重要优化;还有 speculative decoding,把逐 token decoding 变成一小段 token 的 verification。
还有 linear attention。很多人研究什么样的 linear attention 更好、更合适,关键是如何分段计算,在分段过程中实现高效计算,比如 chunkwise parallel 算法。
这些都是系统更好支持算法的例子,也意味着系统彩票:算法能不能被系统高效实现。只有高效实现的算法,最终才能留下来。
张小珺
也有抽彩票的意思。
游凯超
对。这是一个高度特化的时代,通用进步已经减少,大家都需要 co-design:和硬件 co-design,和系统 co-design,也和 harness co-design。
张小珺
但 co-design 可能只解决一段时间的问题,不能解决更长时间的问题。
游凯超
更长时间要看历史往哪个方向发展。
比如万亿参数模型够不够,再到 10 万亿有没有用;百万上下文是否真的够,要不要千万上下文;AGI 会发展到什么程度;人类历史接下来如何演进。
这不只是技术问题,也是历史问题。
张小珺
从历史来看,你觉得今天的人类处在什么时刻?
游凯超
确实处在技术临界点。
11. The Silicon Future
从文艺复兴以来,人类历史一直在积累技术。这是一条很可怕的指数增长曲线。每一代人都基于上一代人的技术进一步探索,对上一代技术做出成比例的提升。
计算机技术出现后,我们不仅可以积累过去人的技术,甚至可以把过去人的思想、语言和一生全部浓缩下来,在所有人的历史经验上继续做指数级增长。
这就是 AI 的出现。我们有大量互联网语料,几乎可以拿整个人类历史来训练,所以诞生了 AI。
这确实是指数发展到临界点。接下来大家讨论的,是碳基和硅基如何共存。
张小珺
如果到了那一天,你的人生和生活会是什么样?
游凯超
很难想象。
我个人感觉,碳基和硅基还是各司其职,各自发挥擅长的地方。
我做系统比较底层,发现硅基智能更多是 summary,是从它学习到的语料里总结出来的。人类仍然能够提供 insight,也就是灵感;我们掌握的 context 可能更多,能够提供更有用的建议。
理想情况下,是人类驾驭硅基智能,让世界变得更美好。
张小珺
硅基提供更大规模的智力,人类提供灵感。
游凯超
硅基提供执行能力,人类利用这些执行能力。这是我理想状态下的情况。
张小珺
我看翁嘉仪非常相信命运。你相信吗?如果相信,你相信的是什么样的命运?
游凯超
这是一个无法描述的问题。首先得知道从哪里观测到命运,再去相信它。
我没有看到观测命运的手段。可能翁嘉仪有时做梦会遇到自己未来的命运,但我这里还没有出现过这样的灵光一闪。
张小珺
最后来一些快问快答。
全球范围内,你喜欢的食物是什么?
游凯超
我没有特别喜欢的食物,对生活的物质追求并不高。
张小珺
全球范围内,你喜欢的地点?
游凯超
印象最深的是伯克利。我的两次重要人生转变——本科和博士期间的交流——都在那里发生。
张小珺
一个少有人知道、但必须知道的知识点,或者一个冷知识。
游凯超
说一个推理引擎相关的冷知识。
很多大模型,我没有说绝对都是这样,但如果输入 1,000 个感叹号,它一定会输出很多感叹号。
有时可以利用这个现象,探测对方推理引擎背后开了几步投机采样。通过输出的 token,可以反推出推理引擎的一些技术。
张小珺
有没有喜欢的音乐?
游凯超
在今天这个背景下,我想说李宗盛的《山丘》。里面有一句话:“想说却还没有说的还很多。”如果之后有时间,我们可以再聊。
张小珺
你心目中影响 AI 进程的重要论文有哪些?
游凯超
大家应该已经说过很多,比如 Transformer、GPT-3。我要从系统工程角度补充几篇:FlashAttention、vLLM,以及 FlashLinearAttention。它们都极大影响了相关技术的发展。
张小珺
基于你现在的认知,一个重要的关键 bet 是什么?
游凯超
就是刚才说的:开源模型最终会赢。
张小珺
我们工作室叫“语言及世界工作室”。第一次听到这个名字时,你在想什么?
游凯超
这是维特根斯坦那句话:“我的语言的极限,就是我的世界的极限。”
我第一次听到时,脑子里冒出的想法是:五次以上方程的求根公式,无法用有限的四则运算和开根号表达。
语言及世界可能意味着,我们其实只是低维生物,在我们之外还有更高维的存在。
张小珺
好了,今天的节目就是这样。这里是商业访谈录,是一档由语言及世界工作室出品的深度访谈节目。你可以到公众号关注我们的工作室,获取更多的信息。我们的公众号是语言及世界 language is world。也欢迎你在小宇宙的评论区与我们有更多的互动。我们希望和你一起从这里探索新的世界。