张小珺
Hello,大家好,我是小珺。今天我们来到了美国硅谷,此刻正在扎克伯格最早的创业所在地 Facebook House。这是一栋外表为淡蓝色的可爱的小房子,而今天也将迎来商业访谈录最年轻的一位嘉宾,她是一位零零后的华人女孩,名字叫洪乐潼,她的探索方向是 AI for Math。她所创办的公司 Axiom 刚刚完成了估值为十六亿美元的 A 轮融资,而她引起了很多人的关注,则来自于这样一条新闻:五十七岁的美国终身教授突然辞职,去给二十四岁的华人女孩打工。那接下来就是我对洪乐潼的访谈。
乐潼,还是先给观众朋友们打个招呼,并且做一个简单的自我介绍。
洪乐潼
Hello,小珺,谢谢你邀请我。我是洪乐潼,Axiom 的创始人和 CEO。
张小珺
我想我们的聊天可以从一个故事开始。很多数学家在说自己被数学打动的那个时刻,都叫作“被数学击中的时刻”。比如高斯说,像闪电一样。你自己有过这样的时刻吗?
洪乐潼
1. 数学的创造与发现
我自己在解题的过程中,这种时刻稍微低频率一些,但是我经常在看别人解题的时候,有一种“这个东西怎么这么美”的感受。
我印象中特别深的一个例子,是第一次看到椭圆曲线模性定理。每一个模形式都对应着一条椭圆曲线,相当于是把一个比较代数性的表达式,和一个更几何性的几何物体联系起来。
我觉得数学中两个领域之间存在交集的这种例子,每一次都会让我觉得非常优美。还有概率、物理里面,也有很多让我觉得非常有意思的结果。
我自己解题的话,小时候可能见得不太多,只是觉得“数学还能这么玩”。当时从初等数论一直推到二次互反律,我是在美国的 Ross 数学夏令营。当时每天都会给你一套题集,你要把它全部做完,才能拿到第二天的题集,像游戏打怪一样。
如果做不完所有的题,他们就不给你下一套题集。你看着隔壁的同学已经比你多了三套题集,有更多有意思、可能是正确的东西,但是由于你的证明能力还没有跟上,你一直到不了。
到二次互反律的时候,他们给你呈现了很多种证明。我在这个过程中,一定是有被数学击中的时刻的:表达非常简洁的东西,后面的证明可以很深,也可以有很有创造力的解法。
张小珺
我有一个问题,可能会很好回答,也可能会很不好回答。有一天我跟 AI 谈论数学的时候,它提到数学是一种结构的语言。所以我想知道,从你的视角来定义,数学到底是什么?
洪乐潼
这个确实不太好回答。我觉得数学有一点像是,人类决定去创造一个文明体系。在这个文明体系里面,由于一些我们愿意接受、认为是正确的公理,我们往上搭建。
某种程度上,数学家有一个契约:哪些东西我们愿意接受为理所当然的?在这些东西上面继续往上搭建。至于是不是要用最少的公理,取决于你从哪个角度去看。
有些人会从 compression,也就是压缩的角度去看,希望使用最少的公理;有些人希望找到最有意思的,或者搭配最合理的一套公理系统,然后往上搭建。
我觉得,很多人认为数学就是解题:我有一道题,然后把它做出来。但往上搭理论的过程其实也很有意思。一般是先从一些数学例子出发,比如一个序列或者一个集合,然后发现一些规律。这个时候,你会觉得下面一个自然的问题应该是什么样,再去证明它。
这个过程有一点像艺术。我觉得数学是一个介于艺术与科学之间的存在。
张小珺
所以,数学到底是一个被发现的过程,还是一个被创造的过程?
洪乐潼
这是一个千古以来的辩论点。
张小珺
你是哪一派?
洪乐潼
如果一些数学家有相似的训练背景,或者在同一个领域里面阅读过同一批代表作,他们会有某种程度上的默契,觉得什么是自然而然的。
最有意思的例子,是拉马努金从印度来到英国,遇到了哈代和 Littlewood。他就像一个外星人一样,说:“这是我的草稿本,上面这些东西全都是对的。我从来没有接受过数学训练,不知道怎么去证明它。”
哈代和 Littlewood 会觉得,这些东西看起来很有意思、很新,但和他们之前做的东西又隐约让人觉得是对的,于是他们开始用证明去验证。
某种程度上,证明是一种影响力。我只要能够把一个东西严丝合缝地证明出来,这个数学发现就可以被接受。当然,被接受之后,还会有人讨论:这个证明美不美,自然不自然。
我们之前看到很多国际数论学家去看张益唐先生关于素数间隙的证明。他们觉得,这个证明和自己熟悉的学派非常不一样,但是对于这个非常著名的结果,他们认为它是正确的,于是接受了这件事情,也开始互相学习和整理证明方式。
比如 James Maynard 在 2022 年获得菲尔兹奖,他有自己的一套证明技巧。他的学生继承这些技巧,也可以和张益唐先生的证明进行比较、简化。这个过程是非常有意思的智力过程。
张小珺
你是哪一派?直觉派、天才派,还是证明派?
洪乐潼
2. 蛮力对抗天才
我一直非常希望自己能当直觉派、天才派。这其实是我小时候痛苦的一个根源:我一直发现自己没有特别大的数学天赋,是一个蛮力型选手。
我小时候参加数学奥赛时,记得他们说每张卷子的第一道题是几何题,欧式几何题是必拿的分。如果拿不到,连三等奖都拿不到。但我一直做不出来欧式几何题。
我可能能做代数不等式,大脑更偏向代数符号的表达,几何和拓扑实在比较差。所以我一般会把每一个点、每一条线都用复数法表示,大力出奇迹。
我不需要理解这道几何题背后的几何意义,只要照本宣科地套一个非常复杂的复数法,把它解决出来。我可能需要比别人多两到三倍的时间,导致其他题目的时间分配不均,但这是我做几何题的唯一方式。
最有意思的是,2021 年开始,Google DeepMind 秘密启动了 AlphaGeometry 项目。他们想,如果 AI 证明欧式几何题非常困难,能不能把几何图形变成符号表达。
这和我作为人类使用复数法的方式不一样,但背后的哲学是一样的:我把几何图形变成符号表达式。这样,他们就能够解决大约 81% 的历史 IMO 几何题。
这是一个很有意思的、关于我不是天赋型选手的解释。
我还有第二个解释:我在 MIT 的时候,身边所有人都是天赋型选手。你只要看看左边、看看右边,就知道自己不是天赋型选手。
但我不放弃。我是打不死的小强。你给我一道题,我 3 个月做不出来,我继续想。
我记得当时 Henry Cohn 教授给了我一道 sphere packing 的题,让我思考关于 28 维 sphere packing 的一些小问题。这当然不可能期待一个本科生完全解决。我 6 个月什么都没有想出来,但是每周都会去说:“这是我试过的办法,没有成功。我又试了一周,还是没有成功。”
这种蛮力型选手,某种程度上会和天赋型选手互补。他们可能有一些脏活、累活不愿意做,我可以把它做完。
张小珺
你的这个过程有点像 AI 的过程。AI 是蛮力型选手吗?AI 是直觉派吗?
洪乐潼
现在 AI 里面也分比较天赋型、聪明型的 AI,和比较蛮力型的 AI。
比如我们公司的 AI 系统,它是一个系统,中间有很多模型。有些模型能够很快认定,这道题大概应该用一、二、三、四、五、六步证明出来。还有一些偏形式化、见过很多 Lean 形式化语言的 AI,会说:“我就是一个 tactic 一个 tactic 地做。”
Tactic 是 Lean 里面的一个步骤,或者说一种策略。它能够把一个复杂的问题一步一步解决,更严丝合缝、小步小步地走,而不是刚才说的那种能够列提纲的 AI。
所以,AI 系统里面这两种类型的 AI 数学家也能够相辅相成。
最有意思的是,当看到一道题时,我们发现,最近公司在普特南大学生数学竞赛中,Axiom Prover 拿了满分。
在人类历史上,过去 98 年的普特南数学竞赛一共有 5 个满分。这是第 6 个满分,是一个 AI 拿到的。
我们看了这个 AI 的解法。有一道题我印象特别深刻。我们队伍中有一个同学叫 Evan Chen,他是美国 IMO 数学竞赛队的教练,是非常天赋型的选手。
他看到这道题,画了一个图。我们所有人在会议室里一看到这个图,就说:“你已经把它做出来了。”就是一个图的解法。
AI 果然没有找到这个图的解法。我们看到的是几千行 Lean 代码,它硬生生通过类似枚举、分类讨论的方式,一步一步核实,把题目做出来了。
这是一个大力出奇迹的 AI。即使是一道明显可以用创造力解决的题,它也可以通过自己擅长的方式,给出一个完全不一样的解法。
我觉得,比较人类与 AI 得到的证明解法背后的数学,是一个非常有意思的过程。
张小珺
所以数学不是人类的特权,对吗?现在自动定理证明这个领域发展得很好。
洪乐潼
其实这个领域不能简单叫作 AI 的胜利。在还没有 AI、没有深度神经网络的时候,就有一群计算机科学家希望基于规则的计算机系统帮助人类解决数学问题,这叫自动定理证明,也就是 ATP。
还有 ITP,交互式定理证明。毕竟有一些 ATP 无法解决的问题,过去会有数学家写 Lean 这样的特定编程语言,和电脑系统一起合作证明。
现在我们只是把 ITP 中的人类换成了 AI 而已。这个古老的学科,某种程度上是 ATP 与 AI 的交集。
张小珺
我相信很多人还是会对你很好奇。你虽然一直说自己不是天赋型选手,是蛮力型选手,但你的过往背景非常强。我们聊聊你自己吧。
你在广州长大。广州是一座非常有烟火气的城市,你小时候的成长环境是什么样的?
洪乐潼
3. 自由注意力与童年
广州是一个非常有烟火气的城市。我最深刻的童年记忆,确实是有很多好吃的。长大、留学以后,感觉食物上比较匮乏,尤其和家乡美食比起来。
我在广州出生、长大。爸爸妈妈住的地方离学校很近,我每天可以走路去上学。有时候上学的时候会想数学题,走着走着就不知道走到哪里去了。
张小珺
走路到学校要多远?
洪乐潼
10 分钟。有时候会开始游荡,因为脑子会想别的事情。我觉得这是一个非常快乐的状态。
最近创业以后,我有一个导师讲到一个概念,叫 bounded attention 和 free attention。
Bounded attention 的意思是被框架住的注意力,free attention 是自由注意力。比如每天早上起来,我们会看到很多邮件,也有很多必须执行的事情。如果不执行,可能会有期限,这时候大脑处在被框架住的注意力状态。
很多成功的企业家都非常有纪律,是执行者,每天日复一日地执行,让事情复利。这很好。所以我一开始创业的时候,也非常希望每天能做多少事情就做多少事情。
但自由注意力能够区分一个普通创业者,和一个很好、很有策略性和决策性的创业者。对数学家来说,自由注意力也可以拉开人与人之间的差距。
当你所有时间都自愿地、像军训一样,每天完成多少工作时,可能反而会让自由注意力欠缺,丧失很多机会成本。
所以我有时特别怀念小时候走路上学的时候,那时有很多自由注意力。爱因斯坦洗澡时思考的故事,其实也是在这个过程中,大脑可以到达一些很有意思的地方,灵感和直觉可能会来到你的大脑里。
但这不是线性的。不是说你投入多少自由注意力,就一定会想到什么。你也可能什么都没有想到,但后来在被迫做一些任务时,中间会有一个 callback,回到自由注意力在大脑里打下的基础。
可能大脑也不想做那些无聊的事情,它会说:“我想到了一个有创造性的想法。”
所以,自由注意力和 bounded attention、限制性注意力应该结合起来。
张小珺
它有配比吗?
洪乐潼
不知道。每个人的配比不一样。
有人说有 3 种创业者。第一种叫 visionary,是有前瞻性的野心家;第二种是 executor,是执行者。扎克伯格今天这个 Facebook House 特别有意思,他就是执行狂,是一个不断执行的人。
你可以看到,他每隔一段时间会用行动去弥补可能落后的前瞻性决策,所以他是非常典型的执行派企业家。
第三种是 sales,也就是销售派。销售派并不是负面词,指的是沟通能力非常好,能够和不同受众沟通、影响别人、引领别人,把一个队伍建立起来。
我一直不觉得自己是销售派,这肯定不是。我也不是一个很好的执行派。我可能也不能叫前瞻性,因为前瞻性意味着判断是对的。
我就是想做一些事情,想做的时候会极度乐观。极度乐观的情况下,就算往下跌一点,好像也还行,也达成了一个 KPI。
张小珺
所以你觉得自己是第一种,visionary?
洪乐潼
我觉得我是 visionary。我肯定不是 salesman 或者 executor。
张小珺
你刚才说扎克伯格属于第二类?
洪乐潼
对,他是第二类。
张小珺
你觉得美国其他知名企业家属于哪一类?
洪乐潼
马斯克是 visionary,这个绝对的。Sam Altman 是 salesman。
我觉得一定要互补。比如扎克伯格身边全是梦想家,他的 CTO 是梦想家,也有其他很好的执行者。
但光互补也不行,你要有一些和你相似的人,也要有一些互补的人。桑德伯格做了很长时间非常好的执行工作,稳健地把 Facebook 从 0 到 3000 人的文化都维持得很好。
我觉得 Facebook 非常强的一点是,每一个 Facebook 的人都 bleed purple,血液里流着紫色,就是 Facebook 的颜色。
张小珺
紫色代表什么?
洪乐潼
Facebook 的办公室有很多疯狂的颜色,其中一个很明显的是紫色。其实这是因为扎克伯格是色盲,有一些颜色光谱无法区分,所以办公室里用了非常大胆的颜色。
Facebook 园区像一个梦工厂,有 24 小时营业的冰淇淋店,也有地方让大家玩鼓、玩吉他、组乐队。
我们公司大部分人之前都在 Facebook,所以很了解这种文化。他们有一个非常强的 bottom-up culture,由下往上,而不是 top-down、上行下效。
Google 非常 top-down,Facebook 非常 bottom-up。我们公司某种程度上没有一个重新定义文化的机会,而是沿袭了大部分早期创始员工原来的文化。
张小珺
关于 Facebook,我们后面还会聊。先回到你在广州的成长经历。
洪乐潼
我小时候打数学竞赛,也看《百家讲坛》。我非常喜欢中国文学和历史,喜欢看历史故事。记得易中天讲三国,还有诸子百家,那是非常快乐的一段时间。
我特别喜欢文学。黄永玉有一本书叫《大雅宝胡同甲 2 号》,里面讲到中国文艺界的画家、作家、版画家、雕塑家,他们住在北京的胡同里。
我妈妈是北京人,所以我们家虽然住在广州,但某种程度上受到了很多京城文化的影响。
张小珺
所以我发现,你小时候自由注意力很旺盛。
洪乐潼
很旺盛。因为我并没有把所有时间都集中在数学上。我小时候也被数学教练批评,说我不是最刻苦的那一个。
但如果遇到一道题,我会和这道题死磕。如果你看我在那道题上花了多少时间,会说这个小孩很刻苦。只是在这个过程中像玩一样,不像 work。
我觉得,区分限制性注意力和自由注意力,其实是主体感知:你到底觉得自己是在玩,还是在工作。
我小时候大部分事情都感觉像在玩。学校作业一般课间就写完了,放学后所有时间都可以做其他事情。
大概初一的时候,我发现自己可以找更高等的数学书看。小时候我知道自己要参加数学竞赛,所以三年级做五年级的数学竞赛题集,一直做更高级的题。
但到了初中,我开始想:为什么不去学高等数学?于是开始看微积分,当然还有实分析、复分析,然后觉得非常有意思。
因为这不再是一个零和游戏。参加数学竞赛时,总觉得同学们要和你考同一场考试。在广东省奥数的训练环境里,比较痛苦的一点是,同学要和你竞争。对一个小孩来说,友谊和竞争的概念也比较复杂。
但如果看高等数学,它不是零和游戏,而是正和游戏。你可以自己走到想要的深度和广度,也可以找班里感兴趣的同学一起讨论,不需要某一天同时参加一场考试。
张小珺
但你还是要回来打这场零和游戏。
洪乐潼
对,我还是要打这个零和游戏,所以在零和游戏里就很吃亏。
有时候看到一张卷子,一共 4 道题,最后一道是数论。数论多美啊。你可能刚好在高等数学里学到更多数论的高级概念,于是会想先做最后一道题。
但如果理智告诉你,要在这个零和游戏中取得高分,应该先做第一道欧式几何题,再做第二道代数不等式。最后一道数论题,大概率做不出来,做出来就进省队了。
所以你不应该拿到卷子就先从最后一道开始。但我因为课外兴趣浓厚,又特别喜欢数论,长大以后也做数论,所以经常先做最后一道题。
一般来说,时间就开始流逝。在固定的比赛时长中,这不是最优策略。
张小珺
你是一个竞争欲很强的人吗?刚才也提到,比赛是一场零和游戏,也会影响友谊。
洪乐潼
我觉得自己是在拒绝被驯化成一个竞争力很强的人。
小学参加奥数学校时,四年级到六年级每个月考一次试。每学期之后,学校会把 1 班到 24 班全部重新排列。22、23、24 班是重点班,1 班在楼底,24 班在楼顶。
每学期之后,同学们会换教室。24 班的人可能下到 19 班,不再是重点班,连走的楼梯都往下,心情肯定不会特别好。
张小珺
1 班在哪里?
洪乐潼
1 班在楼底。我刚进去的时候是 4 班,记得就在洗手间旁边。这说明我入学考试考得真差,不是天赋型选手。
我当时卯足了劲儿想上 22、23、24 班的楼顶。听说楼顶风景也好。
一个四年级小朋友,肯定会有争强好胜心,会感受到压力。但后来我觉得不好玩了,不想玩这个游戏了。
张小珺
是什么时候?
洪乐潼
初一、初二吧。我开始看高等数学书以后,就不太想玩这个游戏了。
张小珺
那你做出了什么改变?不想玩这个游戏之后,客观上还是要考试、排名、竞赛。
洪乐潼
我没有那么在意了。一直到初三要参加初中数学联赛时,我才开始准备,最后好像考得还不错。
当时我特别惊讶,因为觉得自己肯定会考砸,但结果考得挺好。到了高中,更多时间花在学英语上,因为当时打算出国。
我觉得自己做出的改变,是发现了一个有意思的事情:如果一个群体有一个清晰定义的目标,每个人都朝着这个目标努力,而你有一套完全不一样的 mental model,你就会开始在群体里寻找一个 tribe,一个部落。
你会希望建立一个小部落,找和你一样、想读与考试无关的书的人,然后和他们成为好朋友。
我记得初中有一个游戏,到现在有时无聊还会玩。你有一个 n×n 的棋盘,比如 8×8,然后从任意格子开始走马步棋。每一步只能走“日”字形的马步,走到一个格子就标上 1、2、3、4。
目标是走遍每一个格子,不重复;或者如果走不满,就尽量走到更高的数字。比如 8×8 的棋盘,希望尽量接近 64,不要走到 50 就停,希望至少走到 59。
当时我和几个好朋友一起玩。一开始比谁的数字更大,后来希望证明:对于任意 n≥5 的棋盘,总有一种方式可以走遍整个棋盘。
我们猜测可以用数学归纳法证明。要用数学归纳法,就需要在 n 比较小的情况下构造有代表性的 base case。这是一个非常复杂的工程。
华附里所有对这个游戏感兴趣的同学,就开始一起构造。因为非常难,所以大家群策群力。
这让我想到我们等会儿要聊的形式化证明。比如陶哲轩老师、Alex Kontorovich 他们做素数定理的证明,也是把任务拆成很多项目,让全世界几百个数学家和 Lean 编程的同学一起搭起来。
数学经常强调一个人是天才,一个人证明了困扰其他人几百年的猜想,强调个体性。但软件工程师可能几百、几千个人一起做一个大项目,它是合作性的。
合作需要好的结构,也要把任务拆散成不同的小任务。这个过程非常有意思。
玩马步棋时,一个人肯定不可能找出所有例子,需要同学们这个小部落的帮助。
张小珺
这个小部落一般有多少人?
洪乐潼
3 到 5 个人。
张小珺
都是数学很好的人?
洪乐潼
我们当时是数学班,整个班数学都很好。上课就不听课,传纸条。纸条上画着棋盘,说:“你看,我又找到了 n=9 的一种情况。”
那段时间非常快乐。
张小珺
这么快乐的时候,你的成绩是什么样?
洪乐潼
我还行。反正大考也不太在意。最终目标是,初中时我们好像有 90 个人,要进一个 25 到 27 人的数学组。高中数学组有 25 到 27 个人,女同学可能有 3、4 个,我也进去了。
张小珺
但这很奇怪。你说自己不是天赋型,是蛮力型,可你实际上花的时间也没有那么多。
洪乐潼
这是一个有意思的点。我认为,学高等数学的时候,竞赛数学也在潜移默化地提升。
最近我们发现了一个 AI 相关的现象,我每天都在想:一个数学非常好的模型,编码能力也非常好。这里面有一个东西叫 transfer learning,也就是技能迁移。
我觉得肯定存在一定程度的迁移。当时从初中考高中的那场考试,我觉得自己肯定完了。爸爸妈妈说:“你应该没事,就去坐一坐,看结果怎么样。”
结果我好像拿了满分。那次我连几何题都做出来了。我在十几场大大小小的考试中,一次几何题都没做出来过,所以那次也可能是运气比较好。
张小珺
这很神奇。对你来说,学习上的突飞猛进,来自于你变得更发散,而不是更聚焦。你不是更努力地做题,而是兴趣爱好更广泛,更想玩着做这件事情。
洪乐潼
对,我当时是这么觉得的。但到了大学、在 MIT 的时候,我又觉得还是要学会聚焦。
我觉得数学好这件事没有公式。我一直也不是数学最好的那一批。每次别人说,你以前打数学竞赛,现在在计算机同学里面有一定数学背景,但在 MIT,我身边每个人都比我聪明。
我觉得自己是整个数学系里最愚蠢的。
张小珺
这是你自己这么觉得,但别人也觉得自己是最蠢的那个。
洪乐潼
我觉得他们应该意识到自己很聪明,意识到自己是天赋型选手。
当时我的同学,比如任秋宇、张盛桐、高济阳,每个人都是我小时候看着新闻长大的。我看着他们去了北大数院,又转学到 MIT,后来见到真人,每天都在顶礼膜拜这些大神。
这其实是一个非常有意思的点。甚至有一些其他小国的 IMO 选手,比如我的一个比利时朋友,来到 MIT,看到美国和中国的 IMO 选手,也知道大家的 IMO 分数,也会有心理落差。
但我没有落差。我的预期就是自己是最傻的一个,所以适应得很好。我每天都觉得很幸运,能和这些人一起说话、上课、做作业,觉得挺好的。
张小珺
所以你对自己的预期没有那么高?
洪乐潼
没有那么高。我当时觉得,来到 MIT 以后,可能会去做量化金融。你说数学博士为什么要我,而不要其他每一个人?其他人都是 IMO 金牌。我觉得自己肯定考不上数学博士。
所以我记得大一暑假本来要去桥水基金实习,因为我想着要做金融,秋天校招时就开始递简历。当时能去桥水挺高兴的。
后来疫情来了,桥水变成线上实习。同时又有另一个机会:我被 Ken Ono 教授录取到他的 REU 项目候补名单上。
REU 是 Research Experience for Undergraduates,也就是本科生暑期数学研究项目。在美国,这是一个专门名词。这些项目竞争非常激烈,由美国国家科学基金会赞助,名额有限。
我当时被 Ken Ono 教授放进候补名单。他给我发邮件,说我在候补名单上的名次比较靠前。我当时非常激动,因为身边刚才提到的那些大神都已经被录取了,同一天收到了录取函。
我看到邮件,发现自己居然能够进入候补名单,而且名次比较靠前,就觉得自己可能还是想做数学研究。
我想,如果这个暑假不去,下一个暑假可能就不要我了,连候补名单都进不去了。最后居然被捞上来了。可能因为疫情,很多同学不想参加线上的数学夏令营,拒绝的人比较多。
我被录取之后就没有去桥水,大学毕业后的那个暑假才去了桥水。
张小珺
你们家里有刻意引导你在数学上的发展吗?
洪乐潼
我觉得有。我妈妈有危机意识。她小时候数学特别不好。
张小珺
是吗?你们家大人有数学基因吗?
洪乐潼
没有,彻底没有。
我妈妈其他方面可能都很好,就是数学不好。她觉得我应该先学一学数学,因为以后数学可能会成为我比较落后的学科。她觉得我可以笨鸟先飞。
张小珺
你青少年时期获得了很多荣誉,名单很长,我们到时候可以打出来。小时候的事情,对吧?
洪乐潼
对,只是小时候的事情。
张小珺
这些对你来说是轻而易举获得的吗?刚才聊天里,似乎这些都不是你当时的目标,对不对?
洪乐潼
它可能只是在考试前两三个月成为我的目标。我还是比较喜欢做一些有创造性的事情。大部分时间确实花在了自己探索数学上。
张小珺
这些目标和数学探索也有很大关系。
洪乐潼
对,反正都是数学,只是类型不一样。
准备奥赛时,我也有过一段时间集中准备,好像很短时间里刷了 75 套卷子。当时是纸质杂志,一页一页地做,每天做一页,做完就撕掉。
75 套卷子做完之后,我却没有被选上去参加比赛。所以我对荣誉这件事的感受非常复杂。
我确实在每一个时期都觉得,自己是那个环境里最愚蠢的人,是无论怎么努力都看不到结果的人,最绝望的人。
这不是持续待在舒适区,而是持续处在舒适区之外。我觉得这是一个非常塑造人的体验。
失败是我的默认项。因为持续不在舒适区、对自己的要求比较高,你会觉得什么都是失败。
张小珺
但你又很乐观。
洪乐潼
对,我没有因为失败而特别痛苦。
张小珺
可能因为你很乐观,所以你经常失败。每一次你都很乐观地觉得自己能够到达、能够成就一件事。失败某种程度上是自我定义的,并不是客观定义的,客观看可能并不是失败。
你能描述一下失败的体验吗?它是外界什么事情触发了你的内在体验?
洪乐潼
4. MIT教会她如何失败
MIT 第一个学期有一个成绩保护。所有新生都可以上任何想上的课,不需要担心成绩不是 A,因为 GPA 会变得非常重要。
我身边有两类同学。当时我住在 MIT 很有特色的一个宿舍楼,叫东校区。如果走到东校区的庭院,会看到木头做的过山车,两个树之间有绳索,还有一群人在玩喷火。这是非常 MIT 精神、非常 nerdy 的黑客文化。
我住在西边楼的三楼,叫 3 West,也叫 4π。因为它在三楼,大家把它叫作 π 楼,也就是圆周率楼。
楼上住的全是 IMO、IPhO 物理竞赛或者 IOI 信息学竞赛选手。姚远住在那里,还有台湾的余鸿勋。我们整个楼里每个人都是我的偶像。
他们给了我一个建议:去上最难的课,去上可能没有预备知识的课。
我真的去上了。身边几个关系好的同学,也有乐观精神,可能从学长学姐那里听到一样的建议,于是几个大一小孩一起去上博士概率论。
我们想,概率论嘛,知道概率论是什么,就开始想一些复杂的概率问题。结果第一天开始就讲测度论,从 Lebesgue、Borel sigma algebra 开始讲,从测度论背后的代数开始讲。
我们面面相觑,完全不知道发生了什么。
这是一个很有意思的失败体验,因为它不是竞赛环境中一个人考砸了,而是好几个同学一起感叹课程很难,在解题小组里群策群力,一起做题集。
MIT 特别倡导合作。这个过程特别有意思。
张小珺
所以这次你的不舒适感,是来自于你选择了更难的东西?
洪乐潼
对。考试满分是 40 分,期中考试整个班的平均分,好像只有 9 分。里面还包括不知道多少像我们这样、吃了熊心豹子胆来上课的本科生。
我们这几个大一学生的分数都是个位数,5 分以下,肯定是拖平均分的主力军。
张小珺
那你的失败体验来自哪里?
洪乐潼
我从来没有在一张 40 分的考试里看到自己拿 4 分。
张小珺
但你知道,这是因为选择了更难的事情。它不应该触发你觉得自己失败的机制。
洪乐潼
对。我什么失败都不会触发自己觉得失败的机制。我把失败当作默认项。
所以我开始想:我分析课学不好的原因,是分析底子不好。于是我很认真地重新学习十四五岁时学过的 Rudin 实分析。
张小珺
你的自我奖励机制是什么?你在追求什么?
洪乐潼
这是一个很好的问题。我觉得有很多种机制。
年纪比较小的时候,奖励来自社区感,来自朋友、战友,大家一起做一件困难的事情。MIT 特别倡导攀登,像登山队一样,这会给我很大的奖励感。
我们期中考试完后,大家一起说,要么就一起 drop the class,把这门课退掉;要么就一起继续做。反正第一学期有成绩保护,大家决定继续上。
年纪比较小的时候,这种奖励感来自社区、小团队。
但近几年,它不再来自人,而是来自事情本身。可能是因为年纪小的时候,虽然经历了很多失败,已经有些麻木,没有特别强烈的失败感;近几年,可能真的对失败没有负面感受了。
所以,困难的事情本身会给我奖励感。我对 pain and suffering,也就是黄仁勋讲的苦难,有更多感受,甚至有点上瘾。
张小珺
为什么?
洪乐潼
我知道的大部分 founder,也就是创业公司的创始人,似乎都对苦难上瘾。
这不一定健康。但我听一些风险投资人说,他们找 founder,就要找对疼痛上瘾的 founder。
他们有一句话叫:“Chip on the shoulder, chips in the pocket。”意思是,我的肩膀上有一些重量,可能是过去的伤痕;这些 chip 能转化成口袋里的 chips,也就是钱。
某种程度上,对疼痛上瘾,可能会转化成一家小创业公司的成功。这是一个比较激进的理论,但某种程度上有一定正确性。
张小珺
从小团队的奖励机制,到事情本身的奖励机制,这个分界线应该画在哪里?
洪乐潼
MIT 疫情隔离之后,我就没有小团队了。
张小珺
你是 MIT 毕业以后才没有团队,还是大一就没有了?
洪乐潼
大一下学期疫情隔离,所有人都被赶走,不在学校,off campus,所以没有小团队了。
张小珺
但课还是要上。
洪乐潼
必须学会从困难本身里找到快乐。
MIT 对我的性格塑造很大。每一个我在 MIT 遇到的同学都特别能吃苦。他们会在雨天、暴风雪里晨跑。
前一段时间我去了波士顿,正好下雪,blizzard 暴雪风暴红色警报,他们还在跑步。
这是一个非常有毅力的学校。这种毅力很有感染力。它让我可能终身都无法达到 MIT 希望我们达到的毅力程度,但我会希望往那个方向努力。
什么难做就做什么,什么痛苦就做什么,什么长期主义就做什么。
刚才讲到小团体,它也训练了我:压力来临时,任何人际关系都会受到挑战,可能是一对一的人际关系,也可能是团队关系。
保持韧性、坚持内心,同时能够促进一个团队,是非常困难的技能。
我记得巴菲特和查理·芒格在一次访谈中说,如果看到这样的人,一定要把他招进组织。
张小珺
这样的人的标志是什么?
洪乐潼
自己内核很坚定、很技术派,同时又有领导力。
但领导力是一个很大的词。Leadership 在美国语境和中文语境中有一定区别。
我觉得,如果你想的是“领导”这两个字,就没有办法有领导力。真正的领导力一定是服务型、跟随型的。
最好的领导力可能是服务。团队登山时,你不是前面拿着喇叭的人,而是后面递水的人。
张小珺
你刚才说不想打零和游戏,那你觉得自己当时在打的是什么游戏?
洪乐潼
如果学高等数学,就会有一种感觉:有浩如烟海、还没有被自己知道的数学概念。
数学竞赛有一个 syllabus,有考试大纲,每年考点都差不多。但在高等数学里,只要引入一个新定义、新概念,就可以基于它和以前的概念,发散出新的定理和问题。
这个过程开始像搭积木。其实有一篇 AI for Math 的文章叫《Lego-Prover》,讲的就是像乐高积木一样,可以往上搭建自己的小宇宙。
这个过程非常快乐,也不受竞争限制。你可以站在历史上巨人的肩膀上,探索一些事情。
张小珺
为什么高中毕业去美国读本科,没有去清华、北大?
洪乐潼
我很确定自己希望出国,而且挺喜欢 MIT。我可能确实看了一些电影。
我在草稿纸上写 MIT,可能不一定是想出国,可能只是想来 MIT。
张小珺
为什么?
洪乐潼
这是段子,也是真的。我真的在草稿纸上写过。
如果想去哥伦比亚大学,Columbia 要写得比较长;MIT 多简单,就 3 个字母。
张小珺
是在数学草稿纸上写的?
洪乐潼
对。数学必须要一张白纸、一支铅笔,不然什么都做不出来。
有些数学家对纸和笔也很挑剔,我就是这样的人。你有一支非常好的铅笔和一张白纸,就开始想画画,也会画很多图形。
直到现在,Axiom 办公室的白板上如果有素描一样的立体几何图形,通常是我画的。我喜欢 doodle。Doodle 的时候会写 MIT,我对 MIT 的信念感特别强,非常想去那里。
我看过《心灵捕手》,里面有 MIT 标志性的拱廊,也就是 Infinite Corridor,无限走廊。对一个小孩来说,这里面有很多理想主义。
张小珺
这个字母是怎么种到你脑子里的?
洪乐潼
我怀疑就是看电影。MIT 可能在流行文化里已经成为一个符号。
当然还有很多数学家、物理学家是 MIT 的,尤其是很多宇航员也是 MIT 的。
张小珺
你为什么本科学数学和物理?
洪乐潼
双学位。我肯定知道自己要学数学。
后来在物理和计算机之间想了一下,选择了物理。某种程度上是因为当时对量子比较感兴趣,上了很多量子物理的课。
同时我做数学概率方向的研究,比如 Scott Sheffield 教授的随机曲面、几何概率研究,经常会讲某个东西在物理里有什么意义。
听得多了,就想学物理,了解这些东西在物理里面到底有什么意义。
我初高中时物理特别差,所以这是一个大胆的决定。
张小珺
你大学又拿了很多荣誉,这个是怎么做到的?你觉得自己是里面最蠢、最笨的一个,也不太想竞争,但结果上还是很突出。
洪乐潼
那时已经不是竞赛了。大学荣誉可能是教授提名,不需要参加考试,也不需要坐在那里多少分钟。教授可能觉得学校应该提名你去拿奖。
我觉得可能因为自己是一个比较高产的本科生,也有鼓励性意味。教授可能看我学数学学得比较辛苦,担心我不继续走数学,所以给我一些鼓励。
张小珺
真的吗?
洪乐潼
我觉得是。
MIT 的数学环境非常好。教授们都很友善,希望每个人都好,给每个人最好的建议和推荐。
不是说 MIT 的数学学生要竞争有限的名额。某种程度上,每个人都有自己喜欢的数学,和别人喜欢的数学不一样。
如果你喜欢某个领域,教授就会介绍你去相关的教授那里。世界很大,大学期间变成了无限游戏,没有那么多竞赛和竞争。
我的教授们都是非常好的人。疫情时中美之间停飞,没有航班。后来好不容易有航班,我需要写一些信,证明这个人可以回来。教授们对每一个 mentee,也就是辅导的学生,都非常照顾。
张小珺
北美数学本科生最高荣誉 Morgan Prize,你是怎么拿到的?
洪乐潼
Morgan Prize 是教授提名我的,另外一些教授,包括 Ken Ono 教授,写了推荐信。最后由评审委员会决定。
Morgan Prize 30 年历史中,每年通常有一个人拿到,也有两三个人获得亚军、季军。这些人和获奖者的数学水平没有差别,可能还有很多没有被 recognized 的同学也非常优秀。
在当时的圈子里,我并不觉得自己是数学最好的人。可能有一批本科生研究做得不错,谁拿到、谁没有拿到,这件事的随机性很大。
张小珺
本科期间,你在数学上有哪些新的探索?你感觉自己喜欢什么?
洪乐潼
我还是喜欢数论。当时有一个选择:做更代数的数论,还是做更解析的数论。
我做了很多模形式和椭圆曲线相关的工作,在 Ken Ono 教授那里完成的文章,有一半以上都是和 Ken Ono 教授以及他夏令营里的合作者一起写的。
张小珺
硕士去了牛津,为什么学了神经科学,没有继续沿着数学读下去?
洪乐潼
但我也经常往数学系跑。数学系离我们学院不远,走路大概 10 分钟。
当时发生了一些事情,我很想知道人脑是什么样的结构。家里有一些事情,我想对大脑有更深的理解。
到了那里发现,如果想深入理解人脑,需要做实验。我以前做过果蝇实验,比较简单,把头盖骨掀开,放一根管子进去,看它的 neural dynamics。
但到了牛津,要考一个 license 才能做很多动物实验。考这个证需要杀一只老鼠。
我做完那次实验后决定:我要走计算神经科学,不要做动物实验。
英国的计算神经科学和 AI 关系非常紧密。UCL 的 Gatsby Computational Neuroscience Unit,原来 DeepMind 的 Demis Hassabis 曾在那里做 postdoc。Geoffrey Hinton 是 AI 教父之一,也参与创立了 Gatsby Unit。
它叫计算神经科学中心,但实际上大部分都是 AI faculty。
我和 Andrew Saxe 教授,以及他的合作者、现在在斯坦福的 Sergey Levine,做过一些研究。还有 Tim Behrens、Will Dorrell、James Whittington 等非常杰出、同时懂数学、AI 和神经科学的研究者。
作为一个硕士生,我见到他们中的任何一个人都非常激动,觉得这个人好像可以带我做研究。这是一个非常好的机会。
张小珺
所以你是被 AI 点燃的,不是被神经科学点燃的?
洪乐潼
最后我的快乐来自 AI,不来自神经科学。
当时还要写硕士论文,这些研究员要一起协助我把论文写成更偏神经科学的毕业论文,但内容其实全是 AI。
张小珺
后来怎么写的?写了什么?
洪乐潼
有一篇是关于 continual learning,去看 neural dynamics。
另一篇是研究 one-layer linear transformer。理论机器学习能够做的事情非常有限,在这种情况下,可能没有办法得到 exact neural dynamics。
里面有大量线性代数和矩阵运算,也有很多常微分方程。这些都是比较基础的数学,应用在具有 AI 和认知科学背景的项目里。
张小珺
那你博士为什么又去斯坦福读数学和法学?
洪乐潼
数学博士是本科时 defer 的,本来就知道要回去读。原本可能本科毕业后直接读数学博士,没有牛津这一层。
张小珺
为什么去了牛津?
洪乐潼
因为罗德奖学金。我觉得那是一个非常好的机会。
另外,我从小喜欢辩论。牛津有 Oxford Union,有一些训练你成为更好辩手的活动。
后来去法学院做 litigation,也就是诉讼方向的暑期实习,不是并购方向,也和小时候开始的辩论热情有关。
张小珺
所以你整个发展非常综合,可以这么说吗?
洪乐潼
可以,但我差的地方也实在很多。综合一般意味着没有短板,而我有很多短板。
张小珺
你的短板是什么?
洪乐潼
很多事情都做得不太好。比如地理非常糟糕,到现在也没有方向感。
我觉得自己是一个比较 spiky 的人,也就是能力分布很不均匀;不会的东西也非常 spiky,是一个 high-variance 的人。
张小珺
经历了数学、物理、神经科学、AI、法学这些学科,站在交叉路口,你看到了什么?尤其是在读博士的时候。
洪乐潼
当时看到了几件事。
第一,我对宪法非常感兴趣。美国宪法有几种解释方式。
比如 originalism,原旨主义:认为应该根据建国者、国父们的原旨原意来解释宪法。
第二种叫 textualism,也就是宪法写下来的英文是什么,就按照它来读,不要去猜当时他们想的是什么,逐字解读定义。这特别像数学家可能会做的解释。
第三种叫 living constitutionalism,也叫 policy consideration。宪法会呼吸,会和时代一起成长。原来的宪法这样写,但要把它放到 21 世纪去理解。
我在法学院时对这些非常感兴趣。我是一个 textualist,按照文本本身是什么就是什么,这是我的司法哲学。
当时有人说,如果想理解这些概念,可以拿一个语言模型,给它数据,让它去理解宪法。数据可以包括建国文献,也可以包括当代政治和哲学著作。
我就产生了一个想法:如果已经到了可以用 AI 理解宪法的时代,为什么不能用 AI 做数学?
我当时在课上想,AI 应该可以做数学。
我最好的朋友之一叫 Kenny Lau。他是帝国理工学院的人,曾交换到 MIT,我们大一就认识,一起上了很多课。他还教会我下国际象棋,是国际象棋大师。
从 2020 年开始,他就告诉我自己在做 Lean 的形式化证明。
那时 Lean 里面几乎什么都没有,Mathlib 还是空空如也。他是最早在 Lean 里把本科代数、本科分析一行一行打出来、做基础建设的 5 到 7 个学生之一,也是 Kevin Buzzard 的学生。
我当时就在想,AI 如果能做法律,是去看结构化、规范化的东西,研究 specification,而不是让 AI 去判断一个人有没有杀人,那是普通的 trial court 案件。
宪法需要比较精确、严谨的定义。数学不是英语,而是更结构化的呈现。Lean 这种形式化语言把数学变成了代码,所以它可能能够帮助 AI 做数学。
当时我和舒博在 Palo Alto 的 Verve 咖啡店认识。墙上现在还有一张我们当时拍的拍立得照片。
他说买够 1000 杯咖啡,就可以照一张拍立得。我和舒博在那里应该买过 1000 杯咖啡,为咖啡店带来了很多营收。现在我们办公室几乎每个人每天都在那里喝咖啡。
当时我们也一直在聊这件事。陶哲轩老师有很多播客和博客都讲形式化证明;Kenny 对 Lean 非常狂热。他现在也在 Axiom。
很多好朋友慢慢聚到了一起,希望做这件事情。
我当时看到的一件事是:一切我们认为不可能的事情,都有可能。
对我个人来说,最大的意义是让 AI 帮助我进行数学证明。尤其是我不是天赋型选手,有时真的需要枚举很多可能性,花很多天验证一个 standard argument,也就是标准证明方式。
AI 能帮助最大的人,可能就是蛮力型数学家。
我记得 Ben Green 教授有一篇文章,叫《The Sharkovskii Theorem for Shifted Primes》。它讲的是,有一个集合,要保证其中任意两个元素 a、b 的差 a-b 不是 p+1 或 p-1,其中 p 是素数,然后研究从 1 到 n 中这样的集合能有多大。
我当时想,这一套数学工具能够解决多少问题。Ben Green 的 machinery 可以用于 function field,也可以用于其他结构。
我觉得 AI 应该能够熟练运用数论中的工具和技巧,达到一个很熟练的数论博士生的程度。
我当时认为这个事情一定能做,于是开始想怎么做:需要算力,需要多少张卡?
张小珺
这是哪一年?
洪乐潼
2024 年。
张小珺
也就是你和舒博频繁出入咖啡馆的那一年?
洪乐潼
对,2024 年。
准确说是 2023 年 9 月到 2024 年 12 月。那一年我还在读法学院。
我作为法学生时非常开心。以前每天的作业是读 30 页,这就是作业。我本科是工程学校,MIT 是理工科学校,没有接受过 liberal arts education,所以非常希望多读书,也想练习英文写作。
但科学和数学第一次不在生活里时,还是会想念。
想念的时候,我就坐校车去咖啡馆。当时没钱,打不起 Uber,从斯坦福坐 8、9 分钟校车,再走一段路,就到了 Verve 咖啡馆,在那里和舒博聊科技与科学。
张小珺
他当时已经在 Meta 上班了?
洪乐潼
他一直在 Meta,是 Facebook AI Research 的 director,算是 Meta 的元老。他和田渊栋差不多时间进去,可能还早一些。
张小珺
你们怎么成为朋友的?一开始你知道他是谁吗?
洪乐潼
我不知道他是谁,他也不知道我是谁。
我们是在咖啡馆的一张桌子旁认识的。我一开始去那里写作业,每堂课有 30 页阅读,抱着很厚的法律书坐校车,其实不是特别明智。
张小珺
你为什么一定要去那里做作业?
洪乐潼
法学院图书馆周一到周五待久了有点闷,地毯、密不透风。周末想换个环境、放松一下。
Verve 咖啡馆的庭院里有很多狗,而且只有周末有狗,因为狗主人工作日可能没时间带狗遛弯。
我最初去那里的动机是读书、喝抹茶、看狗。这就是我的快乐:读法律案例、做笔记、看狗、喝抹茶。
时间久了,我总看到一个很面熟的人,我们就聊起来了。
张小珺
是在里面还是外面?
洪乐潼
里面,一个 6 人长桌。那里只有一张 6 人桌,其他人也总在那里,所以大家都成了常客。
一开始没人打算聊天。他坐在窗边,阳光特别晒,我需要把窗帘拉起来,于是和他说上话。
我说:“谢谢你帮我拉窗帘。”他说:“我经常看到你。”我说:“我也经常看到你。”谈话就开始了。
张小珺
怎么聊到数学的?
洪乐潼
后来发现他学过数学,本科和硕士都是数学,后面好像还读了两个数学硕士,我记得不是特别清楚。
他很好奇我,因为看起来我是法学院学生,有法律书。我们就聊案件,我可能说某个案例非常离奇,后来就成了朋友。
我觉得 21 世纪很多事情都在互联网上,大家不太会在咖啡馆聊天了。
张小珺
你们聊了多久?
洪乐潼
我们认识了一两年,聊科学和历史,但一开始并不知道对方具体在哪里工作。
张小珺
他不知道你是学生吗?
洪乐潼
他知道我是斯坦福学生,可能知道我是法学院的,也知道我学数学,但不知道我有数学研究背景。
他可能听说过 Morgan Prize,因为很多 Morgan Prize 得主后来转入 AI,比如 Le Wang、Alpert,Anthropic 的 Greg Yang,xAI 的 co-founder 等。Morgan Prize 在 AI 圈子里算是一个东西。
但我不是一个什么人物,他不知道也没关系。关键是我真不知道他是一个这么厉害的 AI 人。
张小珺
你知道他在 Meta 吗?
洪乐潼
当时不知道,一直不知道。
张小珺
后来你们怎么决定创业的?你们已经漫无目的地认识、聊天了一年半。
洪乐潼
5. Axiom开始创业
2024 年秋天,我刚开始读数学博士,但很多时间在给 XTX 做一些工作。我暑假后半段在那里。
我在那里觉得,AI 太有意思了。XTX 有很多 GPU,所以能做的事情比在 Gatsby 做的多。
有一天我晨跑,跑完之后不知道为什么,突然觉得这件事真的要发生了。于是去找舒博,问如果想融资,要融多少钱。
我们拿一张餐巾纸算:需要多少张卡。后来觉得,这件事必须做成一家创业公司,不可能只在学界做。
那学期我大量往斯坦福计算机系跑。斯坦福计算机系我觉得最好的一门课,是 First Year PhD Seminar。
每个教授为了招新学生,会讲自己的 research highlights。每周三下午 3 点到 5 点,一学分。你能认识计算机系的同学。
我坐在后排听,虽然是数学系的。每周都觉得:“原来有这么多人做机器人、计算机视觉,他们在做这些事情。”这是一场 intellectual feast。
张小珺
你在哪一刻决定辍学创业?
洪乐潼
我开始融资时就知道,总有一天要辍学。
张小珺
是先开始融资,再辍学?
洪乐潼
对。因为我不能先辍学。辍学以后没有身份,要拿到工作签证才能辍学。
我拿到工作签证后就辍学了。投资人通常也期待你全职投入,有时辍学甚至是融资 closing 的条件。
张小珺
为什么不是舒博当 CEO,而是你?
洪乐潼
一开始舒博大部分时间还在 Meta。他当时也不知道这件事能不能得到投资人支持。
我从 9 月就决定创业,但直到 11 月还在劝自己不要做。
张小珺
为什么?
洪乐潼
我不太喜欢创业。中国语境下,创业是一种气质;但在美国语境下,整个 Valley 都是 founder。辍学创业在某种程度上显得浮躁。
如果我是本科生,我绝对不会辍学去 Y Combinator。我觉得自己是最不可能创业的创业者。我向往学界,希望做更多数学探索,也喜欢大学环境。
所以花了两个月劝退自己。但每天早上还是跑步,跑步时想得很清楚。后来确定了,但马上就是感恩节。
感恩节到圣诞节之间,投资人基本不工作。要么感恩节前 10 天完成融资,要么等到第二年。我当时选择了第二年。
张小珺
最后你是经过怎样的过程,才决定一定要做?
洪乐潼
我去读了科学史。创业期间真的读科学史,先从维基百科开始,后来找书读。
还有一个 AI for Math 的 GitHub repository,里面大概有几百篇文章。我把每篇文章的 abstract 都读过,有意思的就把全文读完。
我做了很多次费曼过程,在纸上想:如果把这个东西搭起来,技术上应该怎么做。
我不可能觉得这件事不会成功,却去骗别人的钱。所以我研究到一个程度后发现,它不一定是研究问题,而是工程问题,科技风险没有一开始看上去那么高。
在这种情况下,我觉得创业是负责任的。
张小珺
所以你是在自我验证?
洪乐潼
对。如果要吸引风险投资,自己一定要对这件事比较确定、比较了解。不然我觉得不负责任。
我质疑自己的地方,是不是在跟风、是不是浮躁,或者是不是因为它已经变火了。
张小珺
你为什么特别反对做一个 AI founder?
洪乐潼
我在 MIT 时有创业社。我的好朋友们一起参加 Jane Street 的量化金融 hackathon,他们是创业社社长,还叫我去参加活动,说有免费的寿司,我都不去。
我觉得创业不好,还是应该做教授,有点不务正业。
当时我觉得,产品导向的创业项目可能昙花一现。我希望做非常长期、非常困难的事情,所以觉得创业和风险投资的周期不一定吻合。
我知道自己不是浮躁跟风的那一批。
我还想过:有没有别的方式做 AI for Math?要不要加入别的 AI for Math 公司?Verve 咖啡馆里,我们现在的主要竞争对手公司 CEO Tudor 也是常客。
有一天我问他:“你们招人吗?”我当时是真的想做这件事,如果能和别人一起做,就不用自己从 0 到 1,感觉会简单很多。
所以我的质疑点不是感性上的“我是不是浮躁、是不是跟风”,而是我到底能不能做这件事情。
我开始研究 AI for Math,看论文。这个过程非常快乐,也很快学到很多主要的 idea。
比如 2018 年的《ATPBoost》,在没有 AI 的情况下做形式化定理证明,作者 Bartosz 在 Axiom。
还有一篇《PatternBoost》,从数据里找 pattern,构造新的图,为数学家找例子和反例,作者也在 Axiom。
还有一篇叫《IntoInt》,用一种翻译方法,把问题翻译成解法。如果见过很多例子,下次遇到问题时,能不能直接翻译成解法。这是数学发现而不是数学证明的方向,作者 Alberto 也在 Axiom。
所有这些美丽的过程,都是我作为学徒去看巨人的肩膀。后来这些作者慢慢聚在 Axiom,这是非常神奇、也是做创业者最开心的过程。
张小珺
你又形成了自己的小团体、community。
洪乐潼
对。
张小珺
你去问竞争对手能不能加入他们公司,他怎么说?
洪乐潼
他说:“你是什么专业的 PhD?”
我说:“数学 PhD。”
他说:“我们只招计算机 PhD。”
张小珺
为什么 AI for Math 反而不招数学 PhD?
洪乐潼
我不知道,他当时就是这么说的。
张小珺
但你们团队很多人都是数学背景。
洪乐潼
我们团队有 3 个部分。
第一部分是很多 AI 的人,做强化学习、agents 和 applied AI。
第二部分是代码生成、programming language 和 compiler 的人。LLM compiler 的主要团队在我们这里。他们很多人之前参与 Yann LeCun 的 Code World Model,那个 32B 模型。
第三部分是数学。数学里有纯数学家,比如 Ken Ono 教授、Evan Chen;也有做 Lean 的人。
Lean 里面有 Mathlib,类似 Python 里的 PyTorch;Mathlib 是数学库,Lean 是编程语言。我们有做 Mathlib 的人,比如 Kenny Lau 和他的朋友 Jujian Zhang。
还有做 metaprogramming 的人。Metaprogramming 是元编程,把 Lean 当作编程语言,创造更多工具和抽象层。
比如可以用 Python 写一个 autograd,我们有同学用 Lean 写了一个 autograd。
所以团队并不全是数学家。我们也招 ML 的同学,他们需要很强的工程能力。算上实习生,大概有 4、5 个 IMO 选手。
他们有很多数学 prior 和 context,理解数学过程,但我们要求非常强的 engineering。
张小珺
2024 年 9 月,你刚萌生想法,努力劝退自己;11 月决定创业,但要等圣诞假期后融资。圣诞假期你做了什么?
洪乐潼
和舒博一起读文章。
张小珺
为什么是你们两个一起?
洪乐潼
我们像一个 reading group。他当时在旅游,感恩节和圣诞节都不在一个地方,所以我们通过 Zoom 开会,讨论阅读心得。
我们发现,自己可以成为很好的联创团队,是因为我们都非常讨厌 Zoom。我无法和人开 Zoom 会议超过 1 小时,他无法超过 45 分钟,但我们 Zoom 了 4、5 个小时,每次都这样。
我们思考方式特别相似又互补,所以非常享受每次技术探索。
舒博有 20 年 GPU 经历、10 年 AI 经历,是很早的一批 GPU 开发者。
2014、2015、2016 年,他和吴恩达以及百度硅谷 AI 研究室的人一起工作。他们当时有一个小团队,后来被称作 Baidu Mafia,像 PayPal Mafia 一样,很多人后来做了重要工作。
他们做 Deep Speech、Deep Voice,把大量 speech 和 voice data 进行 scaling。
当时办公室有一个理念:绝对不招语言学家。
他们做 Deep Speech 和 Deep Voice,按道理需要语言学家,但他们不招。他们认为可以用 AI 进入一个领域,去改变这个领域。
这也是我们早期创始团队的 DNA:希望用 AI 给数学带来一些革命性的改变。
张小珺
他们说不招语言学家,是想用 AI 去革语言学的命。那你们是不是也不应该招数学家?
洪乐潼
我们当时就是这么想的。我们决定,在招到第 15 个人之前,不招数学家。
张小珺
为什么是 15 个?
洪乐潼
随便定了一个数。我们觉得种子轮看起来数额很多,但对要做的事情来说,普遍想法是我们 under-raised,种子轮不够。
当时认为人员数量会受限,到 20 个人可能就没法继续招人。所以决定以 15 比 1 的比例配置数学家。
张小珺
但“不需要语言学家”的逻辑是,语言学家的背景可能对团队是负分。
洪乐潼
现在我们的想法是,招数学家需要非常思想开放。
早期有一个 FrontierMath benchmark。相关同学希望和我们合作,也希望加入 Axiom。但我们发现,有些数学家对 scaling 有一定犹豫,或者说不喜欢 scaling 的哲学。
他们觉得数学是一门工艺,像日本师傅捏寿司,怎么能让他做 internet-scale dataset?
有同学接了 offer 后又不来了,说不想做 internet-scale dataset。
我们既要 scaling,也要更好的 sample efficiency。这里 sample efficiency 是一个含义很多的词,但借用 Percy Liang 教授的话,我们希望数学家和我们对着干,做 adversarial 的、对抗性的 benchmark 创造。
我希望你能找到系统哪里弱,然后把 benchmark 做得越来越难。
Ken Ono 加入后,基准集建设成为我们的第一号任务。
张小珺
我们继续捋时间线。刚才说到圣诞假期,你们有一个 reading group。1 月开始融资。
洪乐潼
对。
张小珺
那个阶段读了多少文章?
洪乐潼
读了很多。
圣诞节有一个“圣诞大礼包”,杨凯宇老师和 Gabriel Proulx 他们写了一篇文章,叫《Formal Theorem Proving: The Next Frontier of AI》,形式化定理证明:AI 的下一个前沿。
它不是一篇研究论文,而是一篇 Survey Paper,介绍这个领域所有研究论文的论文。
我记得它第五部分讨论:一个好的 AI 数学家应该具备什么能力,分成几个象限。
我们把它做成自己的表格,把文章中直接或间接提到的论文全部找出来。不管是引用中的,还是只提到的,我都对照已有的阅读笔记,看看还有哪些没读。
结果有一半没读过。AI for Math 的 GitHub 整理也不完整。
我原来知道的是一、二、三、四、五个很好的方法,但这篇文章把它们连成了一个面,让我理解了 big picture,理解有了很明显的深化。
张小珺
假期结束时,舒博决定加入你了吗?
洪乐潼
还没有,后来才决定加入。
张小珺
他是觉得和你讨论很有乐趣?
洪乐潼
对。他是 AI 的元老,我当时都不敢问他要不要加入。
硅谷文化就是,很多 AI 元老可以做你的天使投资人,也可以做 adviser。这种流动性很强。
学界、工业界、老师、同学、年长研究者、刚进入工业界的研究者,都能有很多互动。大家是谁不重要,做什么事情比较重要。
舒博指导过很多创业公司,比如 Pika。Demi 进入 Facebook 时,舒博还是面试官。
他也和 Mistral 的 founding team 有关系。Mistral 团队原来和他在同一个组织下面,只是隔壁 team。
我和舒博说,加入后第三个加入我们的人,也和他们关系很密切,大家是多年的朋友。
张小珺
你和舒博是 tutor 和学生的关系吗?
洪乐潼
不是。我们背景不同,看事情的角度也不同,所以聊了很多哲学性和研究层面的想法。
读得足够多后,我们开始想,有哪些新事情可以做;这些新事情又可能连接到 AI 其他领域的古老方法。
比如 James Zou 的 AI for Science 实验室,做过很多和 AI、数学相关的东西。
我们也想过怎么让 AI 提出好的 conjecture,也就是猜想。斯坦福计算机系有同学以 AI scientist 为愿景,研究如何让 AI 提出好的机器学习猜想。
这些东西混在一起。早期棋类 expert system、专家系统,也和现在的一些工作有关。
很有意思的是,没有人尝试把这些方法聚焦起来,在一个营利性工业公司里,在有足够资金和算力的情况下验证它们。
从 2022 年开始,AI for Math 有很多想法爆发,但没有人集中做这件事,我觉得很可惜。
张小珺
这有结构性原因吗?
洪乐潼
有。
2016 年,Christian Szegedy 和吴宇怀在 Google 开始做 HOL 等定理证明语言。Christian Szegedy 大概在 2018、2019 年不断修改自己写的白皮书,讨论未来可能是什么样。
2019、2020 年,OpenAI 的 Ilya Sutskever 带人做了 GPT-f、MiniF2F。当时 OpenAI 还有 Jesse Michael Han、Stanislav Polu 等人,他们后来都成为了其他公司的创业者。
2021 年,Google DeepMind 有一个实习生开始独立做 AlphaGeometry。后来他们发现效果很好,所有资源进入,scale up 成 AlphaProof。
从 2021 到 2024,经过 3 年积累,AlphaProof 在 2024 年 IMO 拿到 28 分,差 1 分达到金牌,是银牌。
对我来说,那是 AI 解决数学奥赛的时刻。两道组合题没有解决,但 DeepMind 真的做得很好,这是跨世纪的时刻。
我们在 2025 年 12 月拿到普特南满分,某种程度上只是他们开启的序章的尾声。
我们马上希望做研究数学,这就是 AI for Math 的发展历史。
张小珺
舒博作为你的第一个员工,或者说联创,是什么时候决定的?
洪乐潼
大概 2 月。
张小珺
那时融资融好了吗?
洪乐潼
当时已经有一个不错的 offer,事情能做起来了。
1 月初是数学家大会。我记得那一年在西雅图。2025 年美国数学会的主题居然是 AI for Math。
数学是一个相对保守的学科,这是一件让人雀跃的事情。很多人去了,也有计算机科学家。
我和 DeepMind 的 Adam Wagner 聊了很多,发现我们曾在英国同一个学院读过书。Albert 也在那里读过,很有意思。
回来后好像第三天就开始有 offer,不断有投资人拿着更高价格来竞争。
张小珺
怎么竞争?
洪乐潼
比如你给我一个 offer,一周后另一个人又给我一个 offer,他们会尝试超过上一家的价格。
张小珺
所以最后从第一个 offer 到最后一个 offer,价格翻了 3 倍?
洪乐潼
对。
张小珺
你怎么 pitch 这些 VC?融资的大门怎么打开?对你来说难吗?
洪乐潼
6. 融资打开公司大门
没有人喜欢融资。如果有一天有一家公司能替我融资,我愿意给它多少薪水、多少 percentage 都可以。
融资很难。它不是结果难,而是累。
你像一个复读机,一次次讲一样的事情,一次次接到一样的问题。我甚至可以把它录下来发给大家,因为大家的问题都一样。
但在大量无聊的过程中,会有一些让人激动的谈话,通常这些谈话发生在你最终选择的投资人身上。
比如我们最后的领投方 B Capital。我当时在赶一篇文章的 rebuttal deadline,和 Howard Morgan 在 Zoom 上对话。
我发现 Howard 比我更乐观,比我更相信这个商业模式有前景。他是 Renaissance Technologies 的联合创始人之一,和 Jim Simons 一起创办了这家公司,也是 First Round 的联合创始人。
他还是数学家,住在纽约,有时去纽约大学上课。
我当时很激动,因为在 MIT 本科时,Jim Simons 还在世,曾来 MIT 参加两个小时的对谈。我是本科数学社成员,和他聊过。
所以见到 Howard 时,我觉得很有意思。他还在硅谷的电视节目里出现过。
他后来还给我介绍了另一个人,那个人是 Jim Simons 的表亲,长得和 Howard 几乎一模一样。
这种谈话很有意思,你可以见到不同视角的人。
我不觉得自己是很厉害的 fundraiser。我一般事情是什么就讲什么,还会把风险全部讲出来。
张小珺
你当时讲了什么风险?
洪乐潼
种子轮时我就说,商业模式并不确定。我做过量化交易员,但不知道我们这个东西是不是量化交易。我觉得它可能不是。
一个数学比较好的 AI,大概率是有用的,但这只是一个例子,不一定是我们具体要做的第一个市场。
我们现在是种子轮,主要还是希望先把科技做出来。
我讲得非常保守,后来才知道,投资人通常见到的创业者都会讲得比较乐观。
他们心里会有一个 conversion rate。你说十分,他可能按八分理解。如果你说七分,他打折后可能就没了。
张小珺
他们都对你说 yes 吗?你被拒绝过吗?
洪乐潼
被拒绝过。
张小珺
拒绝多还是 yes 多?
洪乐潼
没有人想明确拒绝我们。他们不回复消息。
如果有别人要领投,他们不确定是否要拒绝。因为一旦拒绝,以后可能就不理他了,所以会拖着你,看别人给了什么条件,再决定“那我也给”。
张小珺
后来他们都跟了吗?
洪乐潼
挺多的,那一轮超额认购。
张小珺
所以核心是找到一个愿意 say yes 的领投方?
洪乐潼
对。当时有好几个领投方的 offer 在竞争。
张小珺
你怎么让他们竞争的?
洪乐潼
我没有让他们竞争。
张小珺
这是几月份?
洪乐潼
1 月到 3 月,差不多两个月。价格从一倍到两倍再到三倍。
我聊了大概几十个投资人。以前做数学形成了一个职业习惯,总希望得到一个 optimal outcome,希望把整个融资结构做得更好,但当时也不知道怎么融资。
后来学会了一些道理,后面的融资就顺利得多。
1 月有一个领投方说愿意,但他要带走 50% 的股份,我不可能让他带走 50%,所以拒绝了。
张小珺
但 1 月你已经确定这件事有戏,所以舒博答应加入了?
洪乐潼
2 月有一个更确定的 offer,舒博就是那时候加入的。
张小珺
但那还不是最终 offer,你还在继续聊。
洪乐潼
对。我当时 2 月想接受那个 offer,于是和其他人说:“我想跟他们走,你可以加入这一轮,但我可能不会再看其他 offer 了。”
张小珺
到 3 月为什么又变了?
洪乐潼
因为 Howard Morgan 的影响。我对 Renaissance 有很大的崇拜,而且价格确实不错。
张小珺
2 月你已经觉得有一个不错的 offer,但还在聊,到 3 月出现了 B Capital。
洪乐潼
对。他们的风格是每天给我打电话。
我当时在做 report,没有时间。整个过程拖得很长,是因为我还在上课、准备法学院考试、上数学课,也还在做 XTX,非常忙。
张小珺
但 2 月不是应该准备辍学了吗?
洪乐潼
那时有 offer,但我还没有注册公司。我去找律师成立公司。很多事情我完全不知道。
直到投资人说:“我要给你写 term sheet 了。”我说:“但我还没有公司,你给什么公司写?”
所以 3 月开始成立公司。
2 月到 3 月,我还在招团队。大量时间用来吸引非常想得到的 AI for Math 人才。
张小珺
舒博肯定是第一个。
洪乐潼
对。他是第一个,然后我们一起再找其他同学。
张小珺
你几月份辍学?
洪乐潼
夏天。3 月到 6 月,我等工作签证下来。
签了 term sheet 之后,要做很多法律 due diligence,投资人才能把钱汇过来。同时要找办公室、找人。
当时 AI 人才在流动,价格非常高。创业公司无法支付 1 亿美元级别的 package,所以我们花了很多时间和精力建团队。
张小珺
那一轮是 3 亿美元估值?
洪乐潼
对。
张小珺
融了多少钱?
洪乐潼
6400 万美元。
张小珺
比预期低还是高?
洪乐潼
预期是 5000 万美元,所以比预期高。
张小珺
作为华人女性,在硅谷好融资吗?这个身份给你带来加分或减分吗?
洪乐潼
我倒没觉得华人女性有什么影响。
我觉得首先是年轻。年轻做产品是加分,年轻做 deep tech 是减分。
我不像团队里其他人,没有带领技术团队的经历,也没有 track record,这肯定是减分。
华人女性本身,我没觉得是加分或减分。
年轻这个事情,我有时觉得,做产品型、consumer 类 startup,年轻一定是加分,比如 Facebook。
但作为创业者,你要长期重复地做高 stake、非常重要的决策,而每个决策给你的时间又很短。
如果没有很好的 world model、第一性原理体系,决策就容易不够最优。
所以如果再来一次,我希望自己能多几年,觉得当时太早、没准备好。
我听过扎克伯格 19 岁创业的故事。他和 Peter Thiel 聊,Peter Thiel 在餐馆里拿出一张 term sheet,说:“这是我的 term sheet。”
扎克伯格说:“好的,谢谢你。我什么时候给你答复?”
Peter Thiel 说:“这顿饭吃完之前,如果你不签,我就把它撕掉。”
这是一个 19 岁创业者面对的事情。他没有经历过大风大浪,去洗手间哭了一场,回来签了。上面肯定有他不喜欢的条款,他也放弃了其他竞价机会。
年轻创业者很多时候并不知道自己的决定是对是错。等一会儿可能会有更多信息,让你更有信心,但不一定让决定变得更正确。
等更多信息的过程,可能是高风险低收益,所以有时不如直接跳下去。
有一个投资人曾带一群女性创业者去森林里玩 zip-lining。你抓住绳索,从一棵树滑到另一棵树。
我人生第一次玩,不敢下去。但我是第一个,后面一群女性创业者都玩过,大家等得很急。我只能闭眼咬牙跳下去。
后来她们说,希望我形成这种肌肉记忆:每天都要重复这种麻木的 take the leap of faith。
所以如果再来一次,我希望自己在之前读更多书,可能多读 3 倍。学过的东西都不够用。
面对高压和快速决策,不管怎样,在那一刻必须跳。
张小珺
你有没有经历过像扎克伯格那样,和 Peter Thiel 谈完后去卫生间哭一场?
洪乐潼
我没有哭,但经历过很多艰难时刻。会感觉现在做的决定以后可能会后悔,但还是得做。
比如早期人才手里通常有 6 个 offer,你必须参与竞价。但我没有 leverage,没法像 Peter Thiel 那样。
张小珺
那你是决定出价还是不出价?
洪乐潼
肯定要出价。这个事情之所以痛苦,是因为你其实只有跳这一个选择。
每一次在执行与不执行、做与不做之间,选择那个乐观的选项,才可能有一天走到终点。
张小珺
这样的时刻有几次?
洪乐潼
很经常。
张小珺
除了人才,还有什么让你觉得艰难?
洪乐潼
我们又有一轮融资,这一轮也有很多故事。
很多时候需要让利、吃亏。每天让利、吃亏、让利、吃亏,才能做成一家伟大的公司。
张小珺
种子轮是 2025 年 1 月到 3 月,几月 close?
洪乐潼
夏天 close,大概 7 月。与此同时我辍学,但工作签证也等了一段时间。
张小珺
A 轮是 2025 年底开始的吗?
洪乐潼
原本没想融资。圣诞节时,一个投资人说要 preempt,也就是知道你不融资、没有 PPT、没有材料,直接给你一张 term sheet,希望你尽快签掉,省掉融资过程。
1 月 5 日,我被叫到外地一个城市,做了一次 pitch,当天晚上拿到 offer。接下来一周多又拿到另一个 offer,最终签了后一个。这就是我们的 A 轮。
时间大概是 7 月 15 日到 1 月 15 日,差不多 6 个月。
张小珺
为什么选第二个?
洪乐潼
主要是因为第一个投资人后来也投进来了,所以没有特别大的取舍。
我也能得到长期以来支持我们的投资人的支持和帮助。
张小珺
最终领投方是谁?
洪乐潼
Menlo Ventures。
张小珺
为什么你觉得它和你更契合?
洪乐潼
Menlo 的 partner Matt Canning 从种子轮开始就给我们很多帮助。他是电气工程 PhD、物理本科,非常 technical、有一点 nerdy,也很有意思。
他有 founder spirit。Menlo 又是 Anthropic 最大的机构投资人之一,我们是 Menlo Ventures 继 Anthropic 之后第二大的 AI 投资。
张小珺
他们为什么愿意投?
洪乐潼
他们种子轮可能就想投,但我们认识得比较晚,种子轮已经基本确定。
我觉得 6 个月里团队执行得快、准、狠,持续没有失误。
第一个月搭好基础设施,之后训练模型、搭系统,做确定性的 tooling,而不是一开始就用 Lean 写所有东西。这是一个非常 spectacularly executed 的工程项目。
4 个月时拿到普特南满分;6 个月时解决了一批研究问题,成为第一个没有人类干预、自动完成形式化证明的系统。
我们还发现,代码证明中存在神奇的 transfer learning。原来 AI 数学家在代码验证中也能有很好的表现。
在 Verina benchmark 上,旧版 DeepSeek Coder 达到 11%,我们达到 98.93%。
张小珺
所以是 Menlo 主动 pitch 你?
洪乐潼
我们经常定期见面。它原本是种子轮的投资人,现在作为领投,过程当然多了几步。
张小珺
这一轮估值 16 亿美元,达到独角兽标准。
洪乐潼
对。
张小珺
融了多少钱?
洪乐潼
至少 2 亿美元。
张小珺
团队很多人的经验都比你丰富,也有非常知名的数学家加入。为什么他们愿意让你做 CEO?你没有 tech lead 背景,他们为什么不顾虑?
洪乐潼
我也不知道,每天都在想这件事。可能他们没有意识到,我也没有意识到,反正大家一起执行。
现在的设定是,所有战略性的事情都会 route 到我和舒博这里。我们可以给研究者和工程师提供一个没有政治、没有人事纠纷的环境,让他们专注于最新技术和执行。
这是一个很好的 frontier lab 环境。
还有一个原因是,这个问题非常宏大,也非常困难,有很多明确的技术难点,但通过好的 engineering 可以解决。
大家其实是被这个问题、这个北极星吸引。
我只是递水的人。
张小珺
你们也算是现在的 new lab,对吗?
洪乐潼
我们在一些 new lab 名单上,确实是。
张小珺
你怎么理解在相近时间成立的这一波 new lab?
洪乐潼
我融资时还没有 new lab 这个概念。
第一轮融资时,大家可能觉得我疯了。2 月 DeepSeek 出来以后,大家对“模型”这个词很恐慌:模型不赚钱,不要投。
DeepSeek 把价格拉得非常低,commoditized 了模型,所以大家不想投模型。
但大家没有意识到,我们不是模型公司,是 deep tech 公司,有点像 SpaceX。
张小珺
为什么你们不是模型公司?
洪乐潼
我相当于是把一个数学家的大脑签下来,核心是 Lean。
Lean 有非常古老的背景,来自 program synthesis 和 program verification 等领域。
7. Lean把数学变成代码
Lean 作为形式化语言,公开网络上的 tokens 很少,是一个非常小的数据集,所以会遇到很多问题。
比如,怎么做 internet-scale 的数据扩充?如何让 Lean 的数据量达到类似 Python 的规模?
Lean 作为编程语言,又带有自我验证性能。它有点像既是 C 语言,又是 GCC compiler 和 C runtime 的结合。
它非常 finicky、脆弱,有很多限制。里面的 object 必须符合各种约束,所以 Lean 本身就带来挑战。
比如我假设公理是 n+n=n,证明 2+2=2。因为 2+2=4,这当然不是合法运算。
如果想要证明严丝合缝,Lean 社区原来用的 comparator 比我们的 proof verifier 慢 100 倍。刚开始时,我们必须自己造一个更快的东西,否则没法运行。
我们造了大概 12、13 个辅助 Lean 生成和验证的工具。
我们知道 AlphaProof 用的是 Monte Carlo Tree Search,但我们觉得太贵了。看了自己的预算后,发现做不了 MCTS,只能找别的办法。
最后系统设计和字节跳动豆包的 Seed Prover 有点相似。
张小珺
我没理解,为什么说你们更像 SpaceX?
洪乐潼
因为我们有很多技术壁垒。
如何训练模型,当然可以更高、更快、更强,也有很多 secret sauce。但我们的技术挑战可能持续时间更长。
种子轮时,我们觉得自己的 R&D cycle 会拖得很长。
主要竞争对手一开始是我们的 5 倍,融资是我们的 5 倍,估值也是我们的 5 倍,而且比我们早开始两年。
他们花了两年时间,才在 IMO 6 道题里做出 5 道。我们以为至少要花一年半,但没想到 4 个月就冲到普特南满分。
之后冲研究问题,很多是世界各地数学教授发给 Ken Ono 的。
比如以色列 Technion 的教授发邮件,提出 Falconer conjecture;Ken Ribet 和 Ken Ono 交流;还有波士顿的代数几何学家提出的问题。
我们在很大程度上压缩了时间,这也让我们产生了一些 inference debt,现在正在偿还这些债务。
张小珺
Ken Ono 对你们团队有什么标志性意义?
洪乐潼
他的性格像高中篮球队教练,会给所有人加油助威,让大家兴致勃勃、乐观地完成任务。
张小珺
是你找他,还是他找你?
洪乐潼
他给我发了一封邮件。
张小珺
几月份?
洪乐潼
11 月,融资已经公布以后。
张小珺
你当时邀请他了吗?
洪乐潼
没有,不敢。我也不敢问舒博。
我不太敢主动要钱。我的想法是:我没有办法说服你,你只能自己说服自己。如果你想做这件事,我也想做,我们可以一起做。
但我不希望一开始引导你,因为可能误导你。大家都是成年人,自己做有趣的选择,一起承担风险。
张小珺
所以你和舒博的过程是,你一直告诉他创业进展,等他自己说要来?
洪乐潼
对。我知道他是工业界元老,director 这个级别可能有很多项目,也可能有很长的交付周期。
张小珺
他后来所在的组织发生了什么?
洪乐潼
后来组织里很多人离开了。
张小珺
他是自己告诉你要来的?
洪乐潼
对。在 Verve 咖啡店,他说:“好多好的人都走了,感觉这里已经不像以前了。”
然后我问:“你要不要一起做?”
他说好。
张小珺
那时你已经融到资了?
洪乐潼
对,2 月已经有 offer。
张小珺
他跟你谈条件了吗?
洪乐潼
正常按照标准来。
张小珺
你当时什么心情?
洪乐潼
挺高兴的。一个人做这件事比较孤单。
张小珺
你之前预感到他会来吗?
洪乐潼
有。我当时想,如果他来,应该是一年以后。那时我们可能已经做出一些成绩,他可以来指点江山,带我们再往上走一步。
我现在对公司新加入的成员也有一种感觉:希望把事情做到最好,配得上他们的价值。
张小珺
那你的老师呢?
洪乐潼
Ken Ono 教授 11 月底给我发了一封很奇怪的邮件。他说自己要来湾区。
我说:“你要来湾区?”
他说,如果加入 OpenAI 或 DeepMind,希望我有心理准备。
我心想,既然要加入 OpenAI 或 DeepMind,为什么不来我这里?于是我说:“你也可以来我这里。”
张小珺
你之前没有和他说过这句话?
洪乐潼
没有。
张小珺
他是在暗示你吗?
洪乐潼
我觉得他可能真的需要一些建议。OpenAI 可能给了他 offer,他不希望我突然听到这个消息。
OpenAI 的 AI for Math division 可能和 Axiom 有战略竞争关系。他希望先告诉我,可能会选择去竞争对手那里工作,也希望我能理解。
我说:“那来 Axiom。”
结果谈得非常快,也非常好。
张小珺
是线上谈,还是他来湾区后谈?
洪乐潼
我们在 Zoom 上谈,2、3 天内就定了。因为另一边的 offer 快要爆掉了。
我当时到处飞,11 月底、12 月,从这里飞到拉斯维加斯参加 RE•WORK,再飞到 NeurIPS。我们在 NeurIPS 赞助 AI for Math workshop,还参加招聘活动。我人在圣迭戈,回来后又是一堆事情。
张小珺
你怎么说服他的?你对比 OpenAI 的优势是什么?
洪乐潼
我没有 sell 他。我只是说,我们很欢迎你来,但你可能还是应该去 OpenAI 看一看。如果有时间,也可以来我们这里看看。
结果他没有时间来公司,我觉得可能没机会了。他来了湾区,直接去了 OpenAI,然后就要飞走。
张小珺
结果他还是来了你们公司。
洪乐潼
他没有来公司,是在 Zoom 上定的。
张小珺
你截胡了 OpenAI。
洪乐潼
对。
张小珺
你觉得他被什么打动了?
洪乐潼
首先,他觉得我们的团队更数学。
我猜他去了 OpenAI 之后,可能觉得那边做数学的人不是特别多。来我们这里,数学氛围更强。
Axiom 的 DNA 和专注点就是数学,而不是 general AGI 中的一个数学部分,或者更偏营销的东西。
Ken Ono 被我认为是继承拉马努金精神的现代数学家之一。他之前说过,根本不相信 AI 会超过自己,后来认知发生了变化。这个可能是他联系我的契机。
张小珺
他有和你说过认知是怎么发生变化的吗?
洪乐潼
我们当时聊得很仓促,毕竟这是一次截胡。
一个重要原因是,2019 年,François Charton 和 Mistral 的 chief scientist、co-founder Guillaume Lample 一起写过一篇文章,讲 Transformer 在积分问题上能够比 Mathematica、MATLAB 这些计算机代数系统做得更好。
从那以后,François Charton 一篇又一篇地做重要工作,让 AI 解决各种 specialized 数学问题。
在 AI for Math 领域,Ken 和 François Charton 彼此应该很欣赏。François Charton 是我和舒博之后第三个加入团队的人,他们有很多共同语言。
现在 Ken 加入后,又有 Evan、Kenny、鞠建章,形成了一个 math club。大家有很多可以聊的东西。
他也给 Axiom Prover 的问题选择提供了很多建议。
张小珺
Ken Ono 是什么样的人?
洪乐潼
他就是我说的高中篮球教练,特别乐观。和他聊完,你会觉得自己本来就想做这件事,现在更想做了。
他给团队带来了很好的文化。
当然,他也是非常好的数论学家,在划分函数领域很年轻时就做出很好的成果,也是很好的研究导师。他带过很多文章,很多 REU 学生后来也成为了不错的数学学者。
张小珺
他是直觉派数学家吗?
洪乐潼
这个我不确定。我觉得他应该比我更直觉派。
我有一个合作者张盛桐,他肯定比我和 Ken 都更直觉。
Ken 的神奇能力在于,他是理论建造者。
数学家大概分两种:问题解决者和理论建造者。他能够把不同领域的东西连接起来,用全新视角看问题,也能发现好问题,交给更善于解题的人去做。
张小珺
他从学校放弃终身教职,加入学生创业的公司,会有奇怪的感觉吗?
洪乐潼
我没有觉得。他和我都是比较叛逆的人。
他是数学教授,同时也是美国数学奥林匹克队教练,会分析游泳数据;还拍好莱坞电影,拍过拉马努金的电影,现在要拍玛丽安·米尔扎哈尼的电影;有以拉马努金命名的慈善基金会,帮助世界各地年轻学生购买数学课本;还是美国数学学会前任副主席,也在白宫担任政策顾问。
他是一个非常全面的人。
张小珺
他作为数学家加入 AI for Math 公司,会担心 AI 数学家替代自己吗?
洪乐潼
他不觉得会替代自己。他思想非常开放。
有些数学家可能觉得 AI 替代自己不是好事,但 Ken、Andrew Granville 等数学家认为,随着 AI 进步,人类数学家会在更高的抽象层面上进行逻辑推理。
编程也是这样。以前计算机要用打孔卡片,后来有更低层的编译器语言,再到 Python,现在可以用自然语言进行 vibe coding。
数学家未来也会学习更高层的抽象思维。比如提出值得探索的问题,让 AI 去帮助探索。
我们希望 Axiom Prover 具备一定程度的猜想能力,让猜想和证明形成向上螺旋。
随着 Axiom Prover 能证明的东西越来越多,每天证明的内容都会进入第二天的应用中,可以作为 skill,也可以成为未来训练数据。
我希望它一定是 self-improving,或者叫 continual learning。
数学是一个有验证信号的领域,可以用来试验很多前沿 AI 方法,包括 sub-agents、skills、MCP。这些都可以在数学这个 playground 里测试。
张小珺
你们在普特南的故事,可以给大家讲一下吗?
洪乐潼
8. 普特南迎来AI满分
2025 年 12 月 6 日早上,我们收到了普特南大学生数学竞赛的当天考卷。
拿到考卷后,第一件事是把它变成形式化题目,让 Axiom Prover 去做。
上午 6 道题,下午 6 道题。如果是证明题,可以直接形式化;如果要求解,还需要先求解。
所有人都在办公室的庞加莱会议室,也就是 war room、战争室里。数学家有些人在解题。
我们能看到人类解法和 Axiom Prover 最终产生的思路完全不同。
下午大概 3 点 58 分,我们发现已经做出 8 道题,也就是 80 分。总分 120 分,前一年 80 分大概是世界前 5,往年可能是前 10 或前 20。
我们希望拿到 90 分。那时要做一个选择:是告诉世界我们做到了,还是再等一等。
最后我们确实把 12 道题全部做出来,拿到满分。
解题时 Ken Ono 教授有一些非常精彩的语录。我和舒博笑得前仰后合。
他说:“现在不是数学纯粹之美的时刻,不要精确地搞这些东西,现在是战争状态。”
大家在求解时,能怎么快捷地做,就怎么快捷地做。得到数字后,再喂给 Axiom Prover。
这和 IMO 的标准一样,需要求解的题,先把数字放进去,变成证明。
张小珺
Lean 只能做证明,不能求解。所以求解是人做的吗?
洪乐潼
原来是这样。Lean 只能证明,不能求解。
在 IMO 中,有些题要求最后给出一个数字,需要把数字一起放进证明。2024 年 AlphaProof 也采用了这个方法。
但后来我们发现,其实不需要人类求解。因为系统里也有 informal model,可以直接让它做出解法。
最后我们发现,普特南每一道题都不需要人类做求解那一步。只是我们一开始以为需要。
张小珺
Ken Ono 为什么说现在是战时状态?
洪乐潼
因为时间紧。
上午 6 道、下午 6 道,一共 12 道题,最多不超过 3 道需要求解,大部分是证明题。
上午试卷下来时,6 道题里有 4 道需要求解。当时真正能做动这些题的人,基本只有 Evan Chen。
Evan 一个人在那里一道又一道地做。研究型数学家和竞赛中短时间解题的数学家,特性很不一样。
其他同学把题目转成 Lean,但没有做出多少普特南题。
张小珺
你们公司为什么叫 Axiom?
洪乐潼
我觉得 axiom 是一个非常美的词。
我小时候有一本书叫《数学天书中的证明》,讲的是如果上帝有一本书,里面会有哪些数学题。
Axiom 给我的感觉是,首先和 Lean 这种形式化语言呼应:从有限的公理推导新的结果,像有地基后往上建高楼。
另外,axiom 这个词很美,很数学、很克制、很理性,又很 sharp。我非常喜欢这个词,它让我想到那本书。
公司里名字以 A 开头的人也很多,比如 Alex、Alberto、Aram。
张小珺
你觉得 AI 会把数学历史推向一个新阶段吗?
洪乐潼
我觉得会,非常令人激动。
过去,能够做顶尖数学思维的人很少。以后会从一个 math-poor 的社会变成 math-rich 的社会,从数学匮乏变成数学丰富,数学供给会爆炸。
所有没有解决的理论问题,所有应用科学家希望数学家帮忙解决的问题,都可能被解决。
我觉得会出现一个指数级数学发现增长的时代。
张小珺
那数学家会扮演什么角色?
洪乐潼
他们会提供最好的直觉,可能是 0.01% 的直觉,告诉我们哪些问题比哪些问题更值得集中算力解决。
很多不同领域的数学家,可能 30、40 个人,或者 10、20 个人,会聚在一起讨论未来希望解决的问题:问题的重要性、连接性,以及解决一个问题后是否能解决其他问题。
这可能会成为他们主要的数学工作。
如果算力有限,数学家就是资源分配者。他们的直觉告诉我们,应该把 200 张 H100 花在这道题上,把 8000 张 H100 花在另一道题上。
算力会和数学家对问题重要性的判断形成某种对应,这是资源分配问题。
如果算力无限,就像 AlphaFold 之后的故事。
在一部讲 Demis Hassabis 的纪录片里,AlphaFold 获奖后,科学家说:“我们做一个平台,让结构生物学家提交希望折叠的蛋白,我们折完后发回去。”
Demis 问:“有多少蛋白?”
对方说:“2 亿个。”
Demis 把笔扔在桌上,说:“结束会议,fold everything。刚才那个是个愚蠢的想法。”
如果有无限算力,就应该把人类能想到的、有好奇心的数学问题全部解决。
比如中国剩余定理现在被用来研究神经元能叠加多少,也就是 neural capacity。我们不会想到初等数论会和计算神经科学、理论神经科学产生关系。
还有法律和经济学。法律经济学研究刑法中有多少是为了防止社会犯罪,有多少是对个体的修正与惩罚。这些问题可以用微分方程描述。
数学可以从基础理论到代码,再到软件层面的验证,甚至到真实世界测试。数学和代码是孪生兄弟。
Math is code and code is math。Math is code,是因为有 Curry–Howard 对应:每个数学证明都可以变成一个计算机程序。
Code is math,是因为代码可以用数学方式验证。
为什么现在后端、分布式系统和 vibe coding 没有像做网站一样容易?因为里面有很多 backtracking、层级拆解的问题。数学可以提供这些能力。
数学、代码和现实世界实验,构成了一个有验证信号的系统。比如扔一个鸡蛋,重力让它落地、摔碎,这就是现实世界的 reward。
所以我们的 AGI world view 是数学、编程、现实世界的 reward testing,以及其他一切。
张小珺
你觉得 AI for Math 领域会诞生类似 ChatGPT 的时刻吗?
洪乐潼
我觉得会,而且不只涉及数学,还会有代码部分。
有人认为形式化证明对验证很重要,也有人认为它对超级智能、数学推理很重要。其实两者是合一的。
我们做的是 AI 数学家,同时通过形式化证明加入传统语言模型推理。我们的输出可能是几千行 Lean 代码,这些代码可以自我验证。
如果出现 ChatGPT 时刻,产品一定要加入。我们必须警醒自己:系统能力不断增强的同时,某一天一定要尽快推出产品、落地。
对我个人来说,AlphaGo 时刻有两个。
第一个是 Google DeepMind 在 2024 年 IMO 拿到 28 分银牌。
第二个是今年 1 月,Axiom Prover 证明了 Falconer conjecture、部分 Vandermonde conjecture 等研究问题。DeepMind 也有一个叫 Aletheia 的自然语言系统,证明了一些研究问题。
一个是奥赛数学,一个是研究数学。
张小珺
AI for Math 会沿用大语言模型的技术范式,还是会在上下层做新的创新?
洪乐潼
我觉得 AI for Math 是一个很好的实验环境。你可以在上面测试认为会成功的事情,而在其他不那么 clean 的领域可能不好做。
现在 AI for Math 大致有一套范式,来自 2022 年的《Draft, Sketch, and Prove》。
第一步,让 informal model 列一个提纲;第二步,把提纲变成 formal Lean;第三步,把中间的 sorry 全部填上。
Sorry 是 Lean 中的一个语法,意思是这一块暂时不证明,但先把它当作正确。
填 sorry 有很多方式:可以用 AI,也可以用神经网络,还可以用传统 ATP 的规则系统。
Lean 里有一个东西叫 hammer,顾名思义就是锤子,一锤下去,sorry 就消失了。
Hammer 的历史很有意思。早期 Isabelle 有 hammer,Coq,也就是后来改名为 Rocq 的系统,也有类似工具。Lean 很长时间没有 hammer,直到去年 6 月,CMU 有几个人做了 Lean hammer。
但 Lean hammer 的功能还不够覆盖其他 hammer。我们曾和 Lean 创始人 Leonardo de Moura 讨论,希望赞助社区做一个完全开源的 Lean hammer,但他们人力不够,这件事没有完成。
今年出现了一个新工具叫 Grind。它能解决很多数学问题。我见过一些 AI for Math 公司的 demo,题目用 Grind 直接就能做出来,里面没有 AI 成分。
我们希望 AI 和 formal verification 两股力量结合起来解决题目。能用 deterministic 系统解决的,就先用它解决;剩下的再上更大的语言模型系统。
最简单、最便宜的方式优先解决,这是一个很好的系统设计。
张小珺
有没有让你觉得非常“啊哈”的时刻?
洪乐潼
我们每天都是 aha moment。团队很快,有几个方向可能比较前沿。
第一,如果 Monte Carlo Tree Search 太贵、效率太低,怎么扩大 inference?一个方法是参考 Anthropic 最近讲的 sub-agents。
我们发现 sub-agents 用来做 AI for Math 效果很好。
David Silver 和 Richard Sutton 写过一篇关于 AI 后半场的文章,讲 learning from experience,从经历中学习。
在数学题里,什么是经历?就是一条 data trail,从开始到最终解决题目的整个过程,都可以作为 experience。
随着 sub-agents 能使用的 skills 变多,也就是 learning to use tools,学会使用工具,就可以做 scaling learning from experience。
比如一个 40 个节点的证明,可以转化成一个更大的数。我们已经从 40 个节点 scale 到 4000 个节点,证明变得更深、更广。
第二个 aha moment,是发现优秀的 AI theorem prover 能转化成很强的代码验证能力。
在 Verina benchmark 上,分数让我们非常惊讶。同时生成代码和证明也很有意思。
如果代码是 Python,证明是英语自然语言,强化学习相当于把模型指向两个方向:Python 做得好,还是自然语言做得好。
但如果把两个目标函数收拢,让代码和代码的证明都在 Lean 中,或者代码是 Rust,Rust 也是 strongly typed language,就可能让 verify generation,也就是一边验证一边生成,效果更好。
这是我觉得很美的时刻。
张小珺
为了更好地理解 AI for Math,能不能讲讲在你心目中,AI for Math 在整个 AI 大地图上应该画在哪里?
洪乐潼
现在大家做法差不多。
先拿一个开源、预训练好的模型,比如 Qwen,然后在上面做后训练。后训练方法不一样,有些直接做 RL,有些先做 SFT 再做 RL。
模型做好后,把它放进一个系统。系统里有各种模型,有些模型负责 specialized 任务。
整个系统会调用 tools,而这些 tools 很难做,需要大量 Lean metaprogramming。
我觉得大致有两派。一派和 Seed Prover、Houer Prover 的方法比较类似;另一派和早期的 AlphaProof、Aristotle 类似。
我们邀请加入的 AI 同学,过去主要做后训练、强化学习、reasoning,也有 agent、swarm of agents 的背景。整个系统需要非常 full-stack 的 engineering skill。
张小珺
我看了很多研究资料,会觉得如果 AI for Math 突破,它应该不会只解决数学问题,而是具有泛化性。这个观点对吗?
洪乐潼
这是一个很有意思的点。
大家讲 AI for Math,通常讲一个核心科技叫 proving,也就是证明。但我觉得 AI for Math 能做的东西是一整套系统。
你需要一个非常好的 prover,也需要一个非常好的 conjecture generator,能够提出数学问题。
能够证明的 AI,是提出猜想的 AI 的 reward。我可以用 prover 去给 conjecture 提供 reward signal。
有一篇文章叫《Self-Play Theorem Provers》,是董克凡和马腾宇在斯坦福做的。这是大家开始研究 conjecture model 的起点。
猜想模型的难点是,证明出来是 1,没证明出来是 0,但怎么判断猜想本身好不好?
除了用 prover 提供 grounding、给信号,还要判断猜想是否有数学意义。可能它猜出一个完全不重要的东西,不知道为什么要让 prover 去证明它。
所以需要 elegance filter,也就是判断是否优雅。
《Self-Play Theorem Provers》里,优雅是靠长度决定的:题目长度和证明长度相比是长还是短。
但这很粗糙。他们的数据集 Lean Workbook 主要是高中数学。如果做到本科或博士研究层面,就不能只靠长度判断优雅。
所以猜想目前是一个非常前沿的研究问题。
猜想家和证明家需要交流,通过 self-improvement 自我提升。
还有一个重要部分是知识库。尤其在形式化数学里,大部分已经存在于英文或中文里的数学,Lean 里都不存在,甚至定义都没有。
我需要知道哪些是已知、已经证明的,哪些还需要证明。甚至如果让我证明一个东西,可以先在已知知识里找到反例,直接证伪。
另一个问题,是把浩如烟海的数学转成形式化数据。这叫 autoformalization,不是证明,而是转化。
这个技术经常被忽略。证明普特南或 IMO 的题,发到 Twitter 上会得到很多赞;但如果只是把人类已经写好的数学转成形式化,赞美会少很多。
可是这个技术可能比证明更难,至少一样难。
如果输入是一篇 arXiv 数学文章,输出是其中所有定理和证明对应的 Lean 代码,需要很多步骤。
第一步,把文章拆分,区分定理和证明。有些文章结构很好拆,有些大证明里可以拆出很多部分。
拆得足够细的东西叫 blueprint,蓝图。陶哲轩、Kevin Buzzard、Alex Kontorovich 等数学家曾经手写 blueprint,在 Polymath 和大型形式化项目中,把任务分给全世界的本科生。
每个人领一个小任务,所有小任务加起来,星星之火可以燎原,整个数学就形式化完成了。
如果让计算机把一篇 PDF、arXiv 文章拆成细蓝图,比如把 20 页文章拆成 200 页、500 页的蓝图,再把每个细节转成 Lean,这是非常难的。
它需要很强的分解和推理能力。
所以 AI for Math 这座岛上,有证明家、猜想家、知识库,以及贯穿始终的形式化转换能力。
张小珺
这其实不就是翻译吗?把英语翻译成 Lean。
洪乐潼
事实上不是。
英语和法语的抽象程度、结构性、松散程度比较接近,但 Lean 更像 Python,是计算机代码语言。
而且 AI 见过的 Lean 很少,全世界 Lean 的 tokens 加起来都不多,所以非常困难。
反过来,从 Lean auto-informalization 到英语,反而简单一些,因为 AI 见过很多英语。但难点是如何确定转回来的数学完全正确。
通常会再转换一遍,看是否一致,这叫 cycle consistency。
张小珺
形式化语言和语言是什么关系?
洪乐潼
形式化语言像 Python。它有执行能力,可以运行。运行后看到一个勾,就表示证明正确;看到报错,就知道第几行有问题。
如果从哲学层面说,数学是英语的一个子集。数学词汇在英语中的分布和普通英语不一样。
比如代数几何里有一个词叫 germ,英语里是“细菌”。疫情期间学代数几何时,大家会拿 germ 开玩笑。
这个词在数学语境里的概率分布一定不同于普通英语。
所以如果希望 AI 在英语里做数学,英语不是全部。把数学转成代码,由于可验证性,我觉得更有道理。
Lean 里面的程序写法其实很有逻辑性,对逻辑推理处理得很好。
Lean 还有一些兄弟语言,比如 HOL、Rocq、Isabelle,以及更早的 SMT、SAT。这些都是基于逻辑的证明系统。
现在全世界芯片验证,基本要用 Cadence 的 Jasper。Jasper 是基于 SMT 的系统,也有很多局限。
可以头脑风暴一下:如果全世界 SMT 解决不了的问题都能被 Lean 替代,会是一个什么样的世界?
张小珺
Lean 和 Python 的关系是什么?
洪乐潼
Lean 可以用来验证 Python 程序,挺有意思。
张小珺
我听下来有一个问题。现在 coding 也很火,用数学作为手段,和用 coding 作为手段去执行任务,区别是什么?
洪乐潼
它们某种程度上互补。
Coding 可以计算出 output,数学可以验证一个性质、一个 property。
比如给你一个问题,我可以写一个程序解决它。但我还需要知道程序写得对不对、是否解决了你的问题,所以需要很多输入输出,也就是 test cases。
如果这些 test cases 不需要了,我在写程序时就可以直接验证它是否真正解决了问题,通过 Lean 来做,我觉得会是一个全新的世界。
难点是,你给我一个问题,我不确定能不能把它写成形式化语言中的严谨命题。
Software verification 可以这样理解:有一个 program,也就是计算机程序;乘以 specification,也就是目标;映射到 verification condition,也就是验证条件;再乘以 proof,也就是证明。
Axiom 做的是 proof 部分。Program 现在很多 AI 都能写,verification condition 由形式化语言提供,差的就是 specification。
所以梦想是:任何能定义的,都能执行。
数学里,任何能写成数学问题的问题都能被证明;coding 里,任何能定义的都能被执行。
张小珺
如果难点是 specification,应该怎么解决?
洪乐潼
这就是为什么 conjecture 很难。定义和猜想是难点。
比如 First Proof 挑战,给 AI 出 10 道题。OpenAI 做了 5 道,DeepMind 做了 6 道,可能都是自然语言完成的。
为什么 Axiom 不能参加?因为那 10 道题甚至不能转成 Lean。题目涉及很多定义,而这些定义不在 Mathlib 里。
如果没有定义,就无法把题目放进 Lean;无法放进去,就无法证明。这是第一个难点。
当然,命题本身也有难度。有些计算机程序任务非常难用 Lean 验证,比如 floating-point,但大家正在尝试让不能验证的情况越来越少。
张小珺
我问这个问题,是想知道 AI for Math 是更垂直的 AI,还是能够泛化成通用智能。
洪乐潼
它会泛化,但比你在垂直领域感受到的效果更慢,也更不戏剧化。
在垂直领域,可能出现 Cursor-like moment,能感受到“砰”的一下。
它和通用智能有关系,但某些情况下也在互相竞争。比如数学做得好的 AI,和人谈话听起来可能很傻,说明这些性能可能互相排斥。
但从数学到代码生成、芯片验证,转换很明显。
张小珺
你说的 Cursor-like moment,会是产品化的 moment 吗?
洪乐潼
数学更像一个概念。好的产品通常来自比较深的概念。
1980 年代,Donald Knuth 提出,希望计算机科学家可以像数学家一样,在自然语言中推理,让计算机直接执行。不只是现在的 vibe coding,也包括 code review 后直接部署、ship。
前端现在可以做到,但后端很难,尤其 control flow 很难 vibe code。
更早提出形式化证明的人是 Alan Turing。他希望编程时,背后的逻辑和想解决的问题完全契合,而不是依赖有限的输入输出测试。
有限输入输出其实有它的好处:它可以帮助 specification,帮助定义。
比如你让我写一个排序程序,如何把英语题目转成 Lean 中的题目?由于还没有证明 Lean 命题,我需要输入输出作为验证信号。
张小珺
因为 Cursor 的时刻,是让很多不会编程的人也能编程。你说的 AI for Math 的时刻,会不会让更多不会高等数学的人也能做数学?
洪乐潼
我们可以拿它做什么?
比如我们公司有一些同学以前做过芯片硬件,但大部分人没有。我们现在可以用 Lean 证明芯片的性质。
张小珺
所以还是专业人士做的事情?
洪乐潼
不是。我们公司的普通软件工程师,也可以用 Lean 知道一个芯片是正确的。
张小珺
但它还是一个有专业需求的事情。每个人可能都需要编程,但不是每个人都需要证明芯片性能。
洪乐潼
在芯片领域,过去可能做不到。以前基于 SMT 的方法解决不了。
在更 consumer、day-to-day 或 prosumer 市场,可以想象这样一个产品:一边编程,一边告诉你整个程序不需要 test case,已经完全解决了 coding 问题。
但目前芯片验证的痛点更大。
比如亚马逊有世界上最好的 automated reasoning 团队之一,是没有 AI 的纯形式化语言专家。他们花了 3 到 5 年,写了 26 万行定理证明代码,去验证一个用于优化 CPU 处理的 hypervisor 的 memory isolation component。
这完全没有改善工程师的生活,也没有改善那些必须手把手指导几千个 license 去验证芯片的人。
我觉得在这些领域,验证有更好的 pricing power 和定价空间。
但在每个人都需要 coding 的市场中,我们会意识到 verified generation 的重要性:你调用一个函数时,希望它是 100% 不需要验证的函数。
张小珺
这也是你们之后可能探索的商业模式。
洪乐潼
验证是我们最好的第一个市场。
张小珺
这个市场什么时候会打开?
洪乐潼
我们相信,顶尖科技人才应该继续把系统能力推向前,但同时也可以做小规模的商业探索。
有更多资源和人,能做的事情就越多。我们对商业模式也有好奇心,想知道它能证明哪些芯片和电路性质,不能证明哪些;能证明哪些程序,不能证明哪些。
我们更关注它不能做什么。
解决一个有意义的失败,比很多肤浅的成功更有价值。
张小珺
讨论大语言模型时,我们会说语言是模型的拐杖。数学也是吗?
洪乐潼
数学是。
以前大家把数学当作语言,用语言做拐杖,我觉得不对。真正把数学变成 Lean,它才能成为一个更重要的拐杖。
数学和语言某种程度上是平行关系。
系统里有些问题更适合语言解决,比如列出提纲就是很大一部分胜利;也有些问题适合在形式化空间里证明。两者相辅相成。
形式化做得好的模型,在芯片验证上可能比更偏语言的模型好;但在通用代码生成中,需要语言理解用户没有明确表达的需求。
把语言部分和 Lean 部分放在一起最有意思。
张小珺
你们是基于大语言模型的吗?
洪乐潼
系统里有不同模型,通常是经过大语言模型预训练后的后训练模型。
我们的目标以数学为主、以 Lean 为主,输出是 Lean 代码。Lean 自己带有程序语言的验证性质。
比如我完全不懂密码学。你写一篇密码学文章,里面有数学符号,打印出来给我,我看不懂,也不知道对不对。
但这篇文章可以通过 Axiom Prover 变成 Lean。我不需要看懂,只要运行,看到一个勾,就知道密码学文章是正确的。
这是一个很好的验证过程。
我们接受了一个事实:非常强大的 AI 会犯错误。但在某些领域,错误代价极高,所以我们希望做一个尽量 perfect 的 AI。
张小珺
它能解决幻觉问题吗?
洪乐潼
可以帮助解决。它要么说“太难了,做不到”,要么给你一个正确的东西。
张小珺
所以语言是突破边界,数学是把它往回收、约束它?
洪乐潼
某种程度上是。
好的直觉其实是一个配比:pattern matching 和幻觉之间的配比。
语言很适合做 conjecture,帮助突破边界;generation 和 verification 是一个往返过程。
但突破边界不一定非要靠语言模型。Fang Xie 和 Alberto Avelino 做数学发现时,会寻找有意思的数学 object、例子,获得直觉,再变成猜想。
比如给很多图,让系统做 local 和 global 的扰动,也可以找到直觉。
还可以做 embedding,利用语言相似性等方式。猜想和语言关系比较密切,但证明和两者都有关系。
张小珺
你们接下来想达到什么目标?
洪乐潼
我们正在阶梯式推进。
已经解决了一些交换代数、代数几何、代数数论、组合概率的问题。接下来希望去看 Lean 里定义较少的领域,比如动力系统、概率、随机曲面,以及缺少基础建设的领域。
我们想知道前沿到底在哪里。
大概两个月,我们就把高中 benchmark miniF2F 饱和了。它很古老,也被很多人在上面训练过。
接着饱和了普特南,再饱和了代码验证 benchmark。
研究层面的 benchmark 很缺,因为研究级题目不好找。我们只能在每个领域找两三个未解决问题试一试。
现在希望找一些完全看起来没有希望的领域,可能花的时间更长。
A 轮之后,希望更多转向工程和研究,解决一些光靠工程无法摘取的 low-hanging fruit。
张小珺
数学家的意义是不是在出题?
洪乐潼
很大程度上是。
尤其现在机器出题能力很差。刚才说的猜想家,目前表现非常糟糕,所以确实需要人出题。
但出题非常难。比如我们要找 800 道未解研究题,去哪里找?一个教授有一道题,是给 AI,还是给学生?这是复杂的过程。
我们希望通过数学家网络,看看有没有人愿意把题目给 AI 试一试。
张小珺
你们想把它往哪个方向引导?
洪乐潼
它要满足一个性质:robust to distribution shift,也就是不管来自哪个领域,都能做一点。
不能只做欧式几何,否则只是一个几何引擎。希望它能做更多领域,尤其是那些目前缺少基础定义的数学领域。
代数数论里的很多内容已经在 Mathlib 中定义好了,很容易写命题。但动力系统和高级组合中,连定义都没有,题目都写不出来。
这也是 First Proof 十道题的难点。
张小珺
能不能让 AI 去写定义?
洪乐潼
AI 写定义的能力,在社区里叫 library learning,也就是图书馆学习。
让机器搭一个图书馆,从定义开始,包括上面的定理和证明,再衍生新定理、增加定义。这是建筑理论的过程,很难。
难点之一是没有验证信号,无法判断一个定义是对还是错。
第二个是 faithful,也就是是否忠实于人类数学中已有的定义。
假设人类已经把所有定义都录进 Lean,系统做新的猜想和证明时,可能会引入新的定义,让生活更容易。
但如果这个定义是人类没有写过的,怎么保证它不和已有定义冲突?
我可以定义一个“好图”,过一会儿发现它导致悖论。这种情况很棘手。
张小珺
如果 AI for Math 实现 AGI,它的标准是什么?
洪乐潼
Demis Hassabis 有一个著名说法:把 AI 训练到 1910 或 1911 年,看它能不能发现广义相对论。
但我不太喜欢 AGI 这个词。我们可能做的是 ASI,specialized superintelligence。
数学不一定是 general 的,也不一定覆盖所有范围。
我和任秋宇聊过一个比喻:中间是一个点,代表 1+1=2、打印 Hello World 这些简单任务;外缘是证明黎曼猜想、找到治疗癌症的办法、写出莎士比亚或诺贝尔文学奖级别的作品。
OpenAI 的想法是把中间的圆环一点点撑大,最终接触所有边界。
我们不是这样。我们从中间向证明黎曼猜想的方向打,沿着数学这个代表超人类任务的方向打。打完后会发散成一个扇形,可能包括代码验证、物理等,但绝对不会覆盖诺贝尔文学奖。
这个扇形对 B2B 市场有意义。
人类智能、AGI、ASI,ASI 我认为是 specialized superintelligence。
张小珺
为什么听起来 ASI 应该在 AGI 之上?
洪乐潼
比如我数学还可以,但不会做饭洗衣服。人类智能也不一定多 general。
张小珺
有没有可能 AGI 做得非常好,把你不会做饭洗衣服这些事情都替代了?
洪乐潼
有可能。我觉得它会更快。
现在强化学习在 coding 上出现 takeoff。既然强化学习能做 coding,代码验证就是很重要的一环。
如果既有数学做算法的能力,又有猜想能力,就可能达到 recursive self-improvement。
我相信 AI scientist、AI engineer 会逐渐形成一个生态。Axiom 是其中一环,不是全部生态。
AI for Math 的哲学,是同时带来 smart 和 right:既有超人类表现,又能保证 100% 正确,提供 grounding。
数学是公司的 DNA,验证是第一个市场。未来可能进入 AI for Science,也可能进入 optimization。
很多工业问题并不是 diminishing return,而是前期沉没成本很高,最后一个 mile 会带来巨大收益。
比如覆盖所有 edge case 的搜索引擎 Google,赢得了搜索市场;优秀和非常优秀的文艺工作者之间,也可能有巨大差距。
验证边缘情况很耗费资源,优化也需要大量算力。
数学同时需要 medium 和 outlier,这就是数学提供的 DNA。
张小珺
你们有数学家的公司,和不招数学家的竞争对手,在 DNA 上有什么区别?
洪乐潼
我们既要数学家,也要他们不招的代码生成和编译器人才。
我们相信“多元产生智能”。我比较相信两句话:降维打击,多元智能。
AI for Math 探索推理中的难题。Lean 数据少,动不动就会遇到拦路虎,hit roadblock 的速度更快。
我们做更难的事情,希望垂直迁移到其他领域,形成降维打击。
比如 Axiom Prover 能生成 20 页数学证明,却可以很快验证芯片领域的复杂 puzzle。那些问题可能只需要高中或初中数学里的枚举法、分类讨论,而不需要高深的数论工具。
三个背景的人联合起来会有很多想法。
AI 和 compiler 背景的人可以做 synthetic data generation,用 AI 生成 Lean 数据,而不是靠人手打 Lean。
可以用 fuzzing、repair、failure categorization 等方式。
数学家也有很多方法,比如正向推理、反向推理、早期棋类 expert system 的方法,都可以组合起来。
我们是一个 idea-rich 的公司,有很多好想法,但人不够去执行。
Ken 加入时是第 15 个员工,现在已经 30 人了。
张小珺
竞争对手多少人?
洪乐潼
不知道,好像 50 到 75 人,比我们大。
张小珺
怎么理解数学是现实世界的沙盒?
洪乐潼
因为数学既有验证信号,又有规律性和结构性描述。
我们可以在生活里想一个猜想,再去证明;如果想猜想生物学问题,还要进实验室做动物实验。现实世界的验证过程复杂得多。
这也是我尊重 AI for Science 朋友的原因。
比如 Periodic Labs 的 Liam Fedus,原来叫 FutureHouse、现在叫 Edison 的 Sam Rodriques,他们都在做 AI scientist。
但如果希望快速验证,同时需要计算和逻辑,数学和代码是很好的选项。
张小珺
AI for Science 和 AI for Math 不是一个 overlap 的赛道,对吗?
洪乐潼
不太是。
AI for Science 很多时候比的是 iteration cycle 有多快。因为如果有 wet lab、实验室,前期投入非常大。
我身边有很多实验室。比如 Lila Sciences,Jeff 参与的公司,还有 George Church 带的公司,都有机器人实验室,听起来非常自动化,但前期投入很多。
Liam Fedus 最近又把实验室建立起来,还有其他团队也有大量实验室。
我们只停留在数字世界,不走到他们的现实世界。如果他们有理论问题希望解决,我们可以帮助,但不会进入他们的实验世界。
张小珺
但你们可以帮助 AI for Science。
洪乐潼
对,也可以帮助大语言模型。
我们是拐杖和工具。可以验证它们生成的代码,减少幻觉。
我希望未来每个物理学家都能找到自己的理论物理学家,每个做动物实验的神经科学家都能找到理论计算神经科学家。
过去数学家停留在自己的学术圈,很少和应用科学家合作。未来希望 Axiom 的 AI 数学家帮助 AI for Science 解决理论问题,然后他们在现实生活中验证。
张小珺
如果走形式化证明,就有验证;不走形式化证明,就没有验证。你们走形式化证明。如果不走形式化证明,通往哪里?
洪乐潼
可以尝试通用推理。
AI for Math 可能像天才数学家一样,提出好问题、有好直觉,成为创造者吗?这是最难的部分。
我们和竞争对手的区别可能就是,我们打算做这件事,他们不太打算。
张小珺
他们好像想直接落地。
洪乐潼
他们想直接做商业产品,可能觉得 IMO 金牌就是终局。
我们希望真的把猜想做出来。
我们也做过很多探索,碰了不少钉子。
有些想法做不出来,但当时证明家还不够好,分不清问题到底出在哪一块。
做猜想之前,我们希望先把第二个核心科技做好,也就是 autoformalization,把自然语言转换成 Lean。
做好它,既能获得更多数据,也能帮助证明。之后再全面做猜想。
现在可能已经在做一点,但没有完全 ramp up,不是整个公司都在做猜想。
张小珺
猜想是不是数学最有魅力的地方?
洪乐潼
猜想很难。
如果一个本科一年级学生参加 reading course,希望最后做一道题,我很难给他一道这样的题。提出好猜想需要很强的数学能力。
所以我们很高兴 Ken 加入。他是猜想家,是高产的猜想家。
张小珺
他和拉马努金有什么关系?
洪乐潼
我听说有两个故事。
第一个故事是,他的父亲是当年筹钱给拉马努金在印度修雕像的数学家之一。他父亲是非常著名的数论学家。
印度政府原本说要给拉马努金立雕像,但最终没有实现。拉马努金的遗孀给世界各地的数学家写信,于是他们一起完成了雕像。
雕像建成后,她还给这些数学家回了信。Ken 的办公室里现在还有一封他父亲留下的拉马努金的信。
第二个故事是,Ken 本科时好像在芝加哥大学,参加很多社团,课业没有占满时间,绩点并不高,甚至高中也没有毕业。
张小珺
是吗?
洪乐潼
他是一个非常叛逆的少年。他的父亲拿拉马努金的故事鼓励他:任何时候开始都不算晚,不需要像同学一样先修很多数学课,也可以自己追赶上来。
进入数学博士项目后,他非常努力,做出了很多很好的数论研究。
他的父亲也是前不久去世的数学泰斗。他来自数学世家,两个兄弟一个是著名提琴家,另一个曾是密歇根大学校长。
张小珺
他和拉马努金都被认为是直觉型数学家,对不对?
洪乐潼
拉马努金更像尖锐的直觉型、解题型天才。
Ken 的猜想方式是连接很多不同视角,是发散型思维。他不是突然说“这是一个公式,它一定是对的”,那更像拉马努金。
张小珺
如果 AI 做的是形式化数学、验证数学,训练出来的会是更能验证的人。像拉马努金这样的天才,能被 AI 训练出来吗?会不会是两种类型?
洪乐潼
这是很好的问题。
有人说拉马努金的直觉可能是预训练的产物。Attention Is All You Need 这篇 Transformer 论文的作者之一 Ashish 有一家叫 Essential AI 的公司,做预训练。他们曾经训练了一个模型,叫 Ramanujan。
拉马努金那种浑然天成的直觉,可能确实和预训练有关。
我们现在没有做预训练,主要做后训练,未来可能做中训练。但拉马努金不一定是靠后训练能诞生的数学家,他可能需要预训练。
拉马努金来到剑桥后接触到证明,学会如何写证明。他的直觉有了证明之后,影响力指数级爆发。
我们可以训练 AI 去证明,所以这仍然会对直觉有帮助。
张小珺
Ken Ono 是后训练、中训练还是预训练的产物?
洪乐潼
不知道。我肯定不是预训练的产物。
他的预训练可能不只是数学,但现在模型的预训练也是什么都有。
张小珺
你觉得预训练还可能做什么?
洪乐潼
有些方向可能涉及其他公司的秘密,不太能讲。
我们没有深入研究预训练。主要原因是太费钱,而且很多 Lean 能力可以通过后训练获得,甚至可以做一些 mid-training,有些人把中训练也算进预训练。
我们认同,一些基础能力需要通过预训练、中训练获得。
张小珺
你们是创业公司,要做 AI for Math。那些大厂,包括 OpenAI、DeepMind、DeepSeek、字节,为什么也要做 AI for Math?
洪乐潼
听说 Gemini 花了很多精力做预训练,甚至有公司希望购买 Lean 数据去预训练。
他们可能想做垂直专家,也可能是为了 AGI。AI for Math 只是 AGI 的一部分。
OpenAI 现在主要走 informal 路线,可能是 Kevin Weil 的科学雄心,希望做科学发现。
DeepMind 里好像有几个团队同时竞争 AI for Math,一个 formal,一个 informal。
xAI 我不太确定。Anthropic 可能有,但主要是帮助推理:先把数学题 informal 转成 formal,在 Lean 中验证,再回来提高推理分数,不把它作为专注点。
大厂不一定做我们现在做的事情。相同的高密度人才队伍,可以继续做代码生成或其他竞争激烈的领域,筑高护城河,再和我们合作。
比如 OpenAI 在搜索领域会调用 X 或 Parallel 这些搜索做得比较好的公司。
张小珺
所以你们这个行业目前是蓝海?
洪乐潼
不是蓝海,比较难,不太像蓝海。
类似机器人 foundation model,可能有几家公司。AI for Math 目前也就是我们和竞争对手两家,一个新一点,一个比我们早两年。
张小珺
对你来说,挑战是什么?
洪乐潼
执行速度和学习速度。
我执行越多,学习时间越少,这是一个很痛苦的过程。以前每天有时间阅读,现在少了,但又有很多事情要执行。
这也是很多科技人才的 research-engineering ratio trade-off。
我们希望执行速度快,也希望从技术和好奇心角度探索商业模式,但事情很多、很难,所以我最担心速度。
我们是一家成立 7 个月的公司。A 轮之后,外界期待也变大。
一方面怕执行不够快,另一方面怕为了快而焦虑,导致战略方向出错。
张小珺
对你来说,实现 AI for Math 的终点更重要,还是成为一家成功的商业公司更重要?
洪乐潼
作为 founder,你对员工和早期团队负有责任。这不是纯科学项目,必须成为一家能够长期存在的企业。
但公司的 DNA 是登月。我非常喜欢这个名字和理念。
如果过度追逐商业化,就会失去平衡。
竞争对手的起源,可能是 Robinhood 的 founder 和 CEO 希望做一个能带来激情的项目,早期更强调科学雄心。
我觉得理想的现实主义者、现实的理想主义者,都是不错的落点,但不能走得太远。
张小珺
如果有一天公司创业失败,可能是因为什么?
洪乐潼
这个结果一定是极好或极坏。公司没有中间状态,要么登月成功,要么登月失败。
这也是为什么像 SpaceX:火箭要么发射成功,要么坠毁,可能要坠毁几次才发射成功,每次都差一点。
马斯克早期是一个锐意进取、值得学习的企业家。他的公司可能只够救一个,但他坚持两者都要。
Ray Dalio 的 Principles 里也有类似想法。我认同公司有 binary outcome:可能失败,也可能非常成功。
张小珺
如果失败了,你去做什么?
洪乐潼
我有一些个人雄心。
可能去做数学家,也可能研究人脑。我那一年学神经科学的心得是,我们基本不理解人脑。
我可能做和神经科学相关的事情,不一定是人脑,也可能是动物脑。
脑机接口的 vision,目前 implementation 还不够,人机交互的选项不理想。
张小珺
你怎么看待硅谷这些模型公司的竞争,包括大型模型公司和 new lab?
洪乐潼
我前几天和 xAI 的朋友聊,为什么我最后不想做金融或量化交易员?
因为金融里输赢短期就能决定。Peter Thiel 讲过一个比较激进的观点:垄断导致创新,竞争导致平庸。
激烈竞争可能导致平庸,让一些有长远想法的人无法做,于是他们自己出来做 new lab。
new lab 的产生,是因为好奇心和创造力是人类基本需求。在大公司里无法满足 burning passion,就会出来。
可以假设,Axiom Prover 或竞争对手非常成功,给一个千禧年问题,AI 全部解决。
还会有数学家吗?一定会有。
给我一百万行 Lean 代码,我一定想看里面是怎么做出来的。不让我看,我也会看。这就是人类好奇心。
理解证明的数学家会有新的猜想和想法,形成发明与发现的循环。
AI 可能做出发现,让数学家更好地发明。好奇心和探索欲无法被压制。
即使是 1 亿美元的大包,也无法压制年轻研究者的好奇心。
我们会看到很多有意思的方向:更快更好的推理模型、AI for Materials Science、AI 和硬件相互提升。
这背后的基本作用力就是人类好奇心。
有人问现在是泡沫还是登月。我觉得有些公司会成功,真正登月;有些公司很努力但失败,那才是泡沫。
我希望有一个不怕失败的环境。MIT 有一门课叫 Learning to Fail,学习如何更好地失败。
每个登月项目失败,都会在资本市场掀起涟漪,从私有市场到公开市场产生连锁反应。
有人会问,为什么退休基金经过多层投资,最后进入私有市场,去满足研究者的好奇心?这是公平的问题。
但如果研究者不是被虚荣心、ego 驱动,而是被使命驱动,不是碎片化地做 8 个相同尝试,而是不同背景、技能、理想聚在一起,我觉得就是比较 legitimate、靠谱的尝试。
张小珺
这一波 new lab 都有不同信仰和 bets。等有一天需要和大 frontier lab 竞争,怎么应对?
洪乐潼
首先有结构性问题:早期创业公司中,单位创新所需要的资源更少,创新效率很高。
我们做的事情在别的环境里可能更难完成,这也是为什么很多人从 Facebook 来到我们这里。
第二,作为 underdog,除了效率,还有人才密度。但大公司有更多人才,我们没有资源和它们抗衡。
不过 OpenAI 曾经也是对着 Google 的 underdog。当 Google 要把 Ilya Sutskever 抢走时,OpenAI 也曾焦头烂额,甚至一度发不出工资。
历史的钟摆会摆动,大家螺旋上升,但有局部扰动。There is always a way。
我没有办法证明 there is always a way,但你得信。
张小珺
喜欢加入早期创业公司的,可能就是这样一批人。比如 Humane 最近融了很大一轮,他们的联合创始人是 Google 第 7 号员工,到了现在这个阶段仍然认为好奇心是最珍贵的东西,值得倾家荡产。
洪乐潼
我很理解。
有些人甚至是反硅谷的,反感剧烈红海竞争,觉得它阉割了研究员的创造性。
竞争的结果是能力快速上涨,好的且能快速验证的东西会被 scale up,但一些需要更长时间的东西可能不会实现,这就是机会成本。
所以竞争不能说不好,它让人类在很短时间内达到很高的 AI 进步速度。
张小珺
你刚才说自我奖励机制从团队转移到事情本身。现在的你是从事情中,还是从团队中获取能量?
洪乐潼
现在是从事情中。
但团队会给你安全感,让你觉得脚还在地上,grounded。
真正让你 break out 的冲动,可能是愤怒、悲伤,或者卯着一口劲儿,要让团队达到某个目标。
这种能量不是来自团队,而是来自事情本身。
张小珺
让你最 burning 的终点是什么?
洪乐潼
9. 成为终身学徒
莱布尼茨有一个想法,叫 universal representation theory。
我目前最期待的,是让顶尖推理能力成为默认状态,而且是可以自我验证的推理能力。
有些人一生解决一个困难问题,墓碑上写着这个问题。伽罗瓦 21 岁决斗去世,拉马努金因为营养不良和疾病,30 多岁就去世。
人类需要多少人才能出现一个伽罗瓦、一个拉马努金?
如果 AI 能复现这样的数学家,再和已有数学家互动,可能产生更多科学理论。
这就是 Jevons paradox:工具变得更便利、更普遍后,用处反而会更多。
比如我们公司最近第一次找了一个人帮我处理日常杂事。人来了以后,我们一起做的杂事反而更多了。
从算盘到会计师,从微积分到物理、热力学,再到工业革命;从 Babbage Engine 到计算机;从数学到密码学,纯数学最终可能产生巨大应用。
Hardy 写《一个数学家的辩白》时觉得数论没有实际价值,后来密码学出现了。
Victor Miller 是椭圆曲线密码学的泰斗,也是纯数学背景,后来在计算机科学里发现了理论的价值。
这就是终局吗?我不知道。
终局之后,钟摆可能又会摆动。AI for Math 还没有像模型那样被 scale up,我们希望先知道天花板在哪里,然后回到 research,钟摆来回摆动。
张小珺
我见过很多 70 后、80 后、90 后 CEO,你应该是第一个 00 后 CEO,而且是女性。你的公司和之前的公司有什么不同?
洪乐潼
我最快乐的状态绝对不是 CEO,而是 research scientist intern。
为什么是 intern?因为如果我说得比较愚蠢,大家会觉得正常。我是真的想做这件事。
如果有一个明显可以加入的地方,我会加入,而不会把事情单独做起来。这是我的舒适状态。
我不是因为想成为创业者才创业,而是因为事情本身。
我特别不想当创业者。
有一次我很想做一个博士级 benchmark,就把办公室里有数学背景的同学叫来,说:“我想做这样一个东西,也不知道优先级是否正确。你们都是数学家,要不要一起分一下?每人负责一个领域,找 20、30 道题。”
后来一个元老工程师说:“你让实习生和年轻工程师觉得这是非常重要的任务,但这和优先级冲突。”
我说:“为什么?这不是一个 side project、hobby project 吗?”
他说:“但你是 CEO。你讲的时候,他们会觉得这是正经任务,会把它当成前几件事情去做。”
从那以后,我更 hands-off 了。
我做 CEO 的一个好处,是这是一个 technocrat rule 的公司。技术人员是公司的主干、定向和锚点。
因为我没有很多 strongly held beliefs,所以很多 ideas 都可以从 bottom-up 产生。
当然我有坚信的方向,但很多低层次的东西由团队决定。这个文化有点像 Pixar 梦工厂。
如果梦工厂 CEO 是一个已经拍过很多电影的导演,梦工厂就可能变成“应该听他的”。反而是 bottom-up culture 更适合创新。
我很愿意给 Axiom 当 intern。
张小珺
你们的会议室好像用数学家命名,有什么特别的吗?
洪乐潼
会议室叫高斯、庞加莱、希尔伯特、Lovelace、图灵。
中间差点打起来,因为大家喜欢的数学家不一样。
有人说:“有图灵,怎么没有 Church?”“有 Lovelace,怎么没有 Emmy Noether?”
世界各地还发邮件问,为什么不把 Emmy Noether 作为会议室名。我们说,目前只有 5 个会议室。
一开始大家认为庞加莱、希尔伯特、高斯都是 polymath,在数学里不只做一个领域,而是做很多领域。
拉马努金就是因为只做数论而落选。
图灵是跨世纪人物。舒博甚至说,如果不给一个会议室叫图灵,他就走。我说,好,那就图灵。
我们还希望有一位女数学家,Lovelace 和 Babbage Engine 的关系也很好。
张小珺
其中有你的偶像吗?
洪乐潼
我的偶像是高斯。
他是解题天才,比如尺规作正十七边形。他在数论里的贡献也非常 fundamental,二次互反律等都是初等数论中最基本的内容。
我刚开始学数论时,初等数论里到处都是高斯,所以很喜欢他。
张小珺
如果穿越时空,和历史上任何一个数学家共进晚餐,你会选谁?想问他什么?
洪乐潼
和 Erdős 共进晚餐会很有意思。他讲的内容毕竟是组合学,在饭桌上还能听懂。
Erdős 是一个很 peculiar、古怪又有趣的人,和他吃饭应该很有意思。
另一个是 Grothendieck。但如果是别人和 Grothendieck 吃饭,意义会很大。我代数几何学得不好,可能会浪费这个机会。
张小珺
当你说这些数学家时,他们都是很有趣的人。如果 AI for Math 有一天做到所有数学家能做的事情,会不会变得很无聊?
洪乐潼
我想过这个问题。一开始觉得可能会很遗憾,因为数学家之间的友谊、合作和文化社区非常有意思。
比如一个数学家过生日,大家会办生日峰会,学生和合作者轮流讲这个人的数学贡献,或者讲和他合作的文章。
我读硕士时在牛津参加过 Roger Heath-Brown 的生日会议,Ben Green、James Maynard 都在那里。当时非常感动,这是很好的传统。
人的元素永远不会在数学中消失。
AI 可能帮助数学家快速解决证明,但猜想、直觉、构造仍然会给数学家带来很多乐趣。他们仍然是智力灯塔。
当然也可能有人担心,AI 解决所有问题会损害数学家珍贵的 legacy。
但数学家会有更多问题挑战 AI,就像他们现在做 benchmark 一样。他们永远会是智力上的挑战,人与人之间的互动也会很有意思。
张小珺
所以刚才说的拉马努金和验证型 AI,它还是偏验证,不是天才型选手。
洪乐潼
对。直觉太难做,我觉得可能还需要 5 到 10 年。
但我有一个激进想法:解析数论中有多少问题,是一遍遍在标准证明方法里抽取出来的?
比如看到 major arc、minor arc、Hardy–Littlewood circle method,就能解决一些上下界问题;看到 sieve theory,就使用筛法。
如果 AI 能熟练掌握这些标准方法,可能距离直觉没有想象中那么远。
张小珺
你曾经说,热爱数学就是看到了上帝的面容。为什么这么说?
洪乐潼
我小时候觉得,有一些基本真理存在。数学家和科学家的意义之一,就是发现和探索这些东西。
16 岁时我写过一篇文章,当时至少是这么想的。
后来林耀凯创立 Axiom 时,我早上跑步经过斯坦福的 Memorial Church 纪念教堂。平时我会绕着跑,因为很晒,但那天跑到了教堂下面。
阳光很好,教堂上有壁画、天使和十字架,有一点 spiritual 的感觉。
我想,如果一个人的墓碑上刻着他证明过的事情,作为智力遗产,那么如果能把这种能力乘以 1 亿,你会不会做?
当时产生了这个想法。
这当然也有 ego:希望自己的公司成为 AI for Math 的 unlock,希望登月,也希望登月的是我们。
但总体上,我希望这件事实现。即使我们失败,别人登月成功,也是好事。
张小珺
你现在还很年轻,问墓志铭好像不太合适,但还是想问:你希望墓志铭上写什么?你希望自己是数学家,还是……
洪乐潼
别写。
我是一个比较重视体验的人。我活过、体验过,就够了。有没有墓志铭不重要。
张小珺
你会希望自己是一个数学家吗?
洪乐潼
不重要。
我曾经觉得很重要。想到自己可能无法成为数学家时,有时还会哭。我比较 emotional。
后来觉得,我想当学徒。
我希望在尽可能多的智力领域里学尽可能多的东西。
比如数学、物理。因为初高中物理很差,所以想去学一下。神经科学里生物学得不怎么样,但计算神经科学很有意思。
AI 也很有意思,量化交易的前沿也很有意思。很感谢在 XTX 的经历。
后来又学法律。反垄断是一个像树状逻辑、非常像数学的学科;合同法也是。宪法和民事诉讼则更像讲故事。
我希望学习很多东西。
AI for Math 对我来说,人生最快乐的几个月,是找到那个 GitHub repository,把里面所有文章的 abstract 都读完。
那几个月舒博和我一起读。后来那些文章的作者陆续加入 Axiom。
前 30 篇 AI for Math 文章里,大部分作者现在都在 Axiom。每天和他们一起朝目标冲刺,感觉非常快乐。
这可能是一个不错的定义。
张小珺
你现在是什么的学徒?
洪乐潼
我现在是学习一家创业公司如何不死的学徒。
创业者这个词听起来太好了,但创业公司 99% 会死掉。所以我现在是“不要死”的学徒,是 Brian Johnson 说的 Don’t Die movement 的学徒。
张小珺
你的第一个自我奖励方式是从人获得,第二个是从事情获得。你说今天钟摆已经到了事情这一边,但人可以提供安全垫,让你 grounded。
有一天作为 CEO,当人和事情发生冲突时怎么办?
洪乐潼
冲突过。我们也开过实习生,也有类似冲突。
你要把乐观主义收起来,谨慎做决定,想很久,因为要对人负责。
但很多时候,人和事冲突,是因为你自己不够好。你觉得这个人可能离你很远,但由于自己的技能和能力问题,让事情走到冲突。
即使这个人是你不认识的员工,公司很大时,也一定是管理层的决策一步步 trickle down,最后造成问题。
我相信一个词叫 authorship,也就是作者。你是自己人生篇章的书写者和合作者。
不能觉得情境决定了你的决定,是你决定让情境决定你的决定。你也可以用其他方法,让情境不要那么糟。
张小珺
我们最后还有一些小问题。
每位嘉宾都会给观众推荐一本人生之书,要真的对你产生过重要影响,不能是数学书,当然也可以是数学书。你会推荐哪一本?
洪乐潼
如果是年龄比较小的观众,我推荐初等数论,里面对数论讲得很好。
其他数学书,我推荐 Davenport 的分析数论。
如果不是数学书,我很喜欢《红楼梦》。它确实对我有影响,小时候受到过震动。很多学者研究《红楼梦》,这件事也很有意思。
刚才讲到的《大雅宝胡同甲 2 号》,也对我影响很大。
还有一些企业家的故事,比如 Elon Musk 的前妻讲过,她晚上睡不着,翻来覆去,痛苦地嚎叫:“马斯克。”
还有黄仁勋讲 pain and suffering。
这些故事让我在艰难、像嚼玻璃的日子里觉得,这是正常的事情。
张小珺
你觉得现在训练 AI,和你当年训练自己,有什么不一样?
洪乐潼
这是一个很好的问题。
有时会觉得很像。比如模型表现刚刚好了一点,就马上给它更难的题,这就是 curriculum sampling。
看到它做 blueprint 时,也会想到自己当年学数学的感受。
目前我还没有特别想出不同点。看到相似的地方,大脑里的神经元会 fire。
张小珺
假设 Axiom 的 AI 未来证明了一个重大猜想,但过程中使用了一个新的公理。这个公理不属于现有数学,但看起来非常合理,你会接受这个证明吗?
洪乐潼
这会让所有数学家觉得像世界末日一样。
AI 已经尝试用各种奇怪公理作弊。DeepSeek-Prover(具体是哪一个 version 我忘了)曾经在 Panda Bench 上声称做出了 49 道题;Panda Bench 当时有 600 多道题,SOTA 还在个位数,但实际上只做出来 47 道,有两道题是 AI 在作弊。
如果一个公理大家觉得自然,大家就会接受它。
但如果数学领域没有被探索充分,就可能认为存在即合理,或者不存在即不合理。这个公理也许只是之前没有被明确提出。
比如代数几何和组合学结合,未来可能出现 probabilistic analytic 之类的混合领域。
数学可以在接受和不接受两个世界里分别运作。
当然,如果不断加入新公理,branching factor 会从 2 变成无限,最后一团混乱,可能需要回收、tighten。
数学是人类文明的构造。相比物理里增加一个定律,数学里引入公理可能更容易被接受。
张小珺
你怎么看中国 AI 的发展,包括 DeepSeek、字节、Kimi、MiniMax?未来 AI 宇宙里,中美是什么关系和角色?
洪乐潼
我很 respect 中国的 AI 玩家。
我很诚实地说,豆包、Seed 在 AI 方面做得非常好,执行力强,时间很短。我和他们一些同学聊过,比如袁征,都是非常好的团队。
他们可以选择发或不发论文。我觉得 ideas 能够流通,是很好的事情。
当然最核心的东西可能不写在文章里,也可能有人做 decipher。但如果要做纯粹科学和创新,希望少一点商业顾忌,多一点学术上的信任与纯真。
中美方面我也不知道。人才不分世界,有人愿意在中国生活,有人愿意在美国生活。
张小珺
2026 年,你对 AI 发展有哪些预期?
洪乐潼
我觉得大家很快会看到第一个 continual learning 的小模型。
很快会有非常好的 multimodal reasoning model,agent economy 会被 scale up。
我有一些个人预测:orchestrator 很值得做,sub-agents 也值得继续做。
Formal verification tooling 作为 RL reward,完全 under-explored,这和我们做的事情有关。
张小珺
你说的第一个和第二个,分别可能是谁做出来?
洪乐潼
第一个,continual learning,我知道有一些不错的团队,很快可能会做出来。
张小珺
小公司还是大公司?
洪乐潼
小公司,都是 new lab。
Multi-modal 也会很快问世。有一个做 stealth 的公司,是我的好朋友,也曾经希望他加入 Axiom,最后祝福他。
张小珺
快问快答。全球范围内你喜欢的食物?
洪乐潼
寿司,任何寿司。
张小珺
喜欢的地点?
洪乐潼
悉尼。
张小珺
为什么?
洪乐潼
小时候第一次出国就是去悉尼。
张小珺
一个少有人知道、但必须知道的知识点,或者冷知识。
洪乐潼
你可以自己搭 CPU。
张小珺
最近对生活有什么新的、鲜活的认知或体验?
洪乐潼
我最近过得不太鲜活,每天早上几点起来,一直工作到晚上。
比较鲜活的体验,是每次和希望加入 Axiom 的同学聊天,都会觉得未来无限好、无限有希望。
会感觉当初做这件事的初心,没有因为日复一日的执行被打磨掉,还是很快乐。
有点像两只鲸鱼找到彼此的聊天频率。这很好,所以招人是我非常快乐的事情。
有些鲸鱼的频率和其他鲸鱼不一样。你遇到一个人,彼此都学过数学,现在又对 AI for Math 有理解,还形成了新的理解,聊天会很有意思。
另一个鲜活的体验是,我们发现很多古老技巧对前沿研究仍然有指导价值。
《二十四诗品》里有一句“如将不尽,与古为新”,很有意思。
每次出现 callback,我都觉得很有意思,像世界是一个圆,又回到原点。
张小珺
你心目中影响 AI 进程的论文有哪些?
洪乐潼
第一篇是 Christian Szegedy 的白皮书。它不是论文,而是他对未来应该是什么样的思考。
第二篇是 Guillaume Lample 和 François Charton 的工作,让 Transformer 解决数学任务,后来又把这个方法用于其他构造。
第三篇是《Draft, Sketch, and Prove》。
第四篇是一组论文,包括 Kimina-Prover、DeepSeek-Prover、Goedel-Prover、Seed-Prover、Hunyuan-Prover。它们真正把这件事做起来了。
我们刚开始时,甚至没有一个真正基于 AI 的 formal prover。融资和法律流程让钱到账的过程中,Kimina-Prover 出现了。
张小珺
基于当下认知,你最关键的 bet 是什么?
洪乐潼
我 bet system,不 bet model。
我相信 system 里有很多事情可以做,包括 orchestrator。
另一个相关的 bet 是,我完全相信 recursive self-improvement 很快能够做出来。
张小珺
做出来之后呢?
洪乐潼
可能需要一些 forward deployment。这个方向还没有在 AI 时代得到革新。
我觉得传统 SaaS 会死。
张小珺
你们工作室叫“语言及世界”。第一次看到这个名字,你会想什么?
洪乐潼
我想到,数学家几百年、几千年来,都在用英语、中文,或者本国语言写代码。
他们进行的是逻辑推理,但在自然语言中进行。这是一件非常神奇的事。
现在计算机同学可以用自然语言写代码,但数学家已经做了几千年。
数学带来的结构和逻辑,为什么能帮助代码验证,就是因为它有这样的特性。
我还想到,如果把世界想象成一个 manifold,一个高维几何拓扑的流形,那么基于文本、next-token prediction 的 AI,在这个流形上探索了多少,又 flatten 了多少?
我曾经有一段时间一直在想这个问题,因为当时在思考怎么调整 loss function。
张小珺
好,今天的节目就到这里。