庄明浩
哈喽大家好,我是明浩,涂梦之书的主播。今天想聊一个我最近一直有疑问的话题:数据。
这一轮 AI 大模型发展到今天这个时间点,我回看了一下自己去年 11 月做的年度总结。当时我说,AI 大模型这一轮的公司在 2025 年解决的问题,更多是 3 个:激励模型的问题、记忆的问题,以及 benchmark 的问题。在这 3 个问题的基础上,我总结了一下,大部分问题可能都是数据层面的问题。
如果大家回头来看整个 AI 大模型领域的发展,很多人会说 2025 年是强化学习的一年。进入 2026 年初,也有很多业界观点认为,强化学习之后,大家期待的比较有共识的方向,可能是 continual learning,或者叫 online learning,也就是自主学习的过程。
关于这件事的概念和定义,似乎也有很多分歧。每个人对这个概念的定义都有各自的标准。当然,过去这 3、4 年 AI 的发展过程中,无数新名词出现时都是这样的:概念并不清楚,每个人都有自己的说法。
但追根溯源,或者从我自己作为一个观察者的角度来看,无论是强化学习的进一步演化,还是 online learning 真正出现的时候,在我们看待 AI 大模型发展的 3 个要素——数据、算法、算力——当中,数据的重要性可能会非常高。
过去几年大家一直在强调,这一轮 AI 的爆发或者发展,本质上代表的是工程能力,而不是纯研究能力。这个“工程”落地到真正意义上,比如这些公司到底在做什么、每天具体在做什么工作,似乎也和数据的关系越来越大。
所以,今天我想探讨的问题就是:这些事情到底在做什么、用什么方式在做,以及很多公司具体在做什么样的工作,这些工作对模型发展又有什么样的意义。
今天的播客可能和我之前的播客不太一样。我之前一般都是自己来讲,自己做一个 PPT,像上大学上课一样讲 100 多页。但今天这个问题我确实不太了解,所以请来了几位比较有意思的嘉宾。
今天第一位嘉宾是蚂蚁旗下开源数据库公司 OceanBase 的 CTO,日照老师。
日照
大家好。
庄明浩
另外,我知道 OceanBase 已经连续 5 年组织数据库比赛,面向在校生。今年是第 5 年。今天很荣幸请到了今年比赛,也就是昨天刚刚结束的比赛中冠军队伍和亚军队伍的负责人。两位年轻同学,和大家打个招呼吧。
杨同学
大家好,我是杨同学,来自华东师范大学。
庄明浩
你们的成绩是?
杨同学
我们的成绩是亚军。
吴洪涛
大家好,我是来自北京邮电大学编程高手团队的吴洪涛。
庄明浩
你们团队的名字叫什么?
吴洪涛
我们团队叫“抽空就干”。
庄明浩
“抽空就干”,为什么起这样一个名字?
吴洪涛
因为我们团队来自五湖四海,各自都有自己的事情,所以是抽空把这个活干了。
庄明浩
虽然叫“抽空就干”,但其实也可以叫“抽空了干”,或者“抽空干”,对吧?
吴洪涛
对,可以,可以。
庄明浩
那你们当时是怎么想到这个名字的?
吴洪涛
我们觉得我们的编程能力很强。
庄明浩
还行。
回到刚才的话题,大家会说这一轮 AI 模型主要是数据、算法、算力 3 件事情。第一个问题我想问日照老师。因为你们一直在一线做数据库系统,而且做了很多年的工程实施工作,有很多客户,也做了很多现实企业中的案例。
你是否认为,在今天这个时间点,AI 能力的提升正在从比较看重模型能力,逐渐转向看重数据能力?这种边际增强的趋势,是否可以作为我们在 2025 年底、2026 年初对这个时间点的一个判断?
日照
这个问题相当好。我们还是回到问题的本质:今天回到这个本质,还是先看数据,以及 AI 的应用。
从数据和应用的角度来看,AI 第一个阶段解决的问题,是对公共数据的应用,也就是用这些数据进行训练。比如 ChatGPT,或者 coding。Coding 本质上使用的数据,大部分企业用的代码也是 GitHub 上的代码,所以它比较容易做成 to C 的应用,把它通用化,也比较容易在不同企业中泛化应用。
到了 2025 年,也就是去年开始,包括今年,一个非常大的变化是,AI 的应用会从完全基于公共数据的应用,也就是增强模型能力,慢慢转向不同企业里的私有数据。
私有数据的特点是,它一定不会被训练到大模型里面去,它是每个企业最核心的资产。这个时候最大的挑战在于,怎么把这些私有数据真正管理起来,以及怎么把它和基于公共数据训练出来、具有很强推理能力的大模型结合在一起,让一家一家企业、一个一个行业真正把大模型用到业务流程里面。
到今天为止,大模型在 coding、聊天,以及一些依赖公共数据的场景,比如纹身图、纹身视频等方面,落地还是相当好的。但是在企业核心业务流程里面,目前还处在非常早期的阶段。
去年第三、第四季度,MIT 发了一份报告,说 95% 的企业投入到 AI 的预算,最后实施效果都不是特别理想。当时也出现了一轮关于 AI 泡沫的讨论。
你想,2022 年底 ChatGPT 出现,2023 年大家开始追大模型的技术能力,到了 2024 年、2025 年,才开始真正做实施、做部署、做企业应用。哪怕纯粹从实施角度来说,也需要一段时间,才能让这个东西真正融合好。
庄明浩
所以 2025 年似乎还不是一个特别适合下结论的时间点,因为从执行角度来说,确实还需要时间。
现实问题在于,公有数据——大家都在说,今天用于预训练、能够被公开挖掘的数据,可能已经出现了非常明显的边际效应递减。下一步,无论是模型能力本身的提升,还是把模型和 AI 能力真正应用到 To B 的企业和行业中,我们似乎都要在边际上选择更有效的板块。
无论是企业内部的数据,还是已有的业务数据,它们在这个过程中的位置似乎都被加强了。逻辑上是不是这样一个过程?
日照
是。首先,预训练数据,如果是在语言这个类别里,应该基本上已经用得差不多了。
但除了语言以外,比如 word model、embodied,以及其他计算智能相关的方向,数据其实还是相当有限的,这里可能需要更多方法。
同时,即使是面向语言的模型,虽然很多数据都已经被用到大语言模型的预训练里面,但怎么用好这些数据,可能就是你们所说的工作了。
庄明浩
对。
日照
但也不全是我们做的。大模型预训练本身,怎么把预训练数据的质量真正做好,解决其中很多数据上的问题,以及数据工程上的细节,这是大模型公司要做的事情。
现在这里可能还有很大的挖掘空间。前一段时间 Google Gemini 3 的效果非常好,核心做得比较好的地方可能就是预训练。
大家用的是类似的数据,为什么它就比别人好?因为它在工程细节上,把每一条数据都调得更好。这里面有很多细微、琐碎的技术工作,需要算法工程师去调这些数据,同时也需要很好的 infra 和底层架构,支持稳定地复现结果,并且能够快速迭代。
它是因为这些事情做得好,所以预训练效果比别人好。未来的 Google GM04,或者 5、6、7,可能还会有更多强化学习的东西。
庄明浩
所以这就像大家经常说的“踢运动”,左脚踩右脚,自己把自己踢上去。模型能力提升、数据训练、预训练、强化学习,甚至包括后面可能会聊到的从基础数据到合成数据,都可能处于这样一个相互促进的状态。
我们可以期待,AI 模型能力的提升能够通过这些方式来实现。
那问题就变成了:在今天,以工程化为代表的这一轮 AI,抛开纯学术研究,从业界正在使用的工程化 AI 能力提升的角度来看,数据,或者说泛数据系统的角色,是不是已经从原来辅助和边缘的服务角色,变成了一个非常重要的位置?
再直白一点,今天世界上最头部的 AI 公司,包括美国的公司、中国的公司,以及蚂蚁这样的公司,大家都在做自己的模型。为了提升模型能力,在未来一段时间,数据的位置是不是要被放到更加核心的位置上?
日照
数据对于互联网公司,或者真正一流的科技公司来说,一直都处在最核心的位置。
今天大语言模型带来的不同在于,它把原来用不了的数据也用起来了。原来我们主要使用的是结构化数据,但文本、视频、音频等数据,过去使用得比较有限。
今天大语言模型有泛化能力,可以用一种通用的方法,而不是针对每一种数据类型分别写一套算法,直接把这些数据利用起来。也就是说,今天能够使用的数据比以前多了很多。
庄明浩
所以我们有了 CPU,还需要有 GPU。
日照
以前结构化数据是中心。今天除了结构化数据,也有半结构化和非结构化数据。
庄明浩
这种变化对数据库软件提出了什么新的要求?原来的数据库软件更多是基于结构化数据构建的。到了今天,我觉得这个问题至少有两个方面。
第一,趋势是把更多半结构化、非结构化数据引入整个数据处理体系。数据处理体系最核心的两个组件,一个是数据库,一个是大模型。无论数据库还是大模型,都要处理多模态数据。
从数据库角度来说,第一方面是数据库自己要能够处理多模态、非结构化的数据类型,让用户使用起来更加方便,同时保留一定的控制能力,这是数据库的优势。
另一方面,数据库在做这件事情时,也需要和大模型结合,利用大模型更擅长的能力,反过来帮助数据库自己,或者帮助用户把事情做得更简单。
这又引发了一个我最近想得比较多的问题。原来大家会说,这一轮大模型的发展先是语言,也就是纯聊天,或者图文、文本结构的东西;然后是多模态,图片、视频、语音,甚至今天的 world model。Coding 也算是一个重要板块。
我经常打一个比方,就像打德州扑克一样,主桌看上去有 3 桌,或者两桌半:语言、多模态、coding。
但发展到今天,尤其是 GPT-3 之后,你会有一种感觉,它们其实是一桌。原来的文本可能还偏向于可以用结构化方式处理,就像你们比赛中面对的很多题目,都是偏文本结构的。Transformer 架构之后,它用的是另一种方式,然后发展到视频、world model、coding。
今天我们使用世界上最好的图片生成模型时,会发现它生成的图片本身带着逻辑和推理能力。它不是画完一张图就结束了,而是带着前因后果、搜索结果、逻辑、故事,以及所有这些东西。
如果未来继续往前推演,刚才您说结构化和非结构化最终要一起处理,那是不是应该是一桌?也就是说,它们其实是一个整体。您怎么看?
杨传辉
从用户视角来看,它肯定是一张大桌子。虽然受到技术限制,里面可能会有各种各样的做法,但用户看到的就是一个整体。
可能你使用这个功能时采用一种做法,另一个功能时采用另一种做法,但用户本质上并不关心这些,只是在等待什么时候能够出现一个真正泛化的方法。
包括你刚才说的图片和视频,它们内部也有不同流派。语言已经相对统一了,但其他模态还没有统一。
这轮大模型发展到今天,已经过去 3 年多,技术发展的分叉已经多得非常复杂。各个板块都出现了很多不同的方向,哪怕只是在数据这个问题上,也分出了很多角度。每家公司在做的事情其实也不太一样。
庄明浩
那我们聊点比赛的事情。大家都说数据是瓶颈,这个瓶颈具体卡在哪里?在你们日常工作过程中,有没有遇到过一些实际问题,通过 AI 模型能力和数据库能力的提升,解决了一部分阶段性瓶颈?
日照
我觉得这个瓶颈还是比较明显的。大模型这个东西,一般企业需要很高的技术能力才能用起来。
前一段时间 DeepSeek 把大模型的成本降了很多,所以每个企业都说:“我要用大模型。”但要用大模型的人其实都是 CEO,不是 CTO 或 CIO。CEO 说我要用大模型,其他人说我不知道怎么用。
这个时候,底层系统一定需要进步。以前我们把 IP 或者信息系统用起来,是因为有数据库;数据库之所以能发挥作用,是因为有标准化。
但到了企业使用大模型的时候,其实没有标准化。我们不知道什么是对的,因为没有一个标准化的评估体系。它是 case by case 的,也没有标准的语言、标准的构建方式和标准的解决方案。这些东西都需要随着时间发展慢慢摸索出来。
所以我们想做的,更多是把数据和模型结合、融合在一起,慢慢解决企业真正使用大模型时遇到的问题,让它用起来更简单。
当越来越多企业基于数据加模型的方案使用 AI 技术时,自然会逐渐形成一些行业解决方案,甚至形成标准。
庄明浩
你们看到的这个趋势和演进过程,包括这些实施工作,是否也在影响这 5 年比赛出题的变化?
日照
是。我们去年的题目是向量数据库,今年的题目更多是混合检索。
去年大模型能力还比较弱,所以我们更多是通过向量、embedding 和 RAG 的方式,增强向量数据库的能力。到了今天,业界肯定会从简单地通过向量和 embedding,演进成更多所谓上下文工程的解决方案。
上下文工程不只是用向量和 embedding,还可能包括向量、全文、图,以及未来更多标量、半结构化数据的索引和搜索方式,同时还要考虑怎么把数据能力和模型能力结合在一起。
所以我们也会有类似 AI Function 这样的方式,直接在数据库里调用 AI 能力。
今年的题目就是混合检索。我们认为,混合检索是数据和模型融合的初级阶段。最终一定要通过各种不同方式的混合,给用户提供工具,帮助用户基于这些工具构建好的解决方案,慢慢成为数据和模型混合的标准。
庄明浩
你们感受到今年的题目和去年的,或者和之前几年的状态相比,区别大吗?
杨同学
感觉今年混合检索的部分还是很新颖的,还增加了一道 React 的题目。这一块对我们来说很有意思,因为我本来是传统做数据库的,现在开始和 AI 结合了。
庄明浩
刚才聊天的时候,我感觉你已经在上班了,对吧?已经在做现实世界中的业务,而且也是偏数据的。按我的理解,原来可以说是一些银行业务,而银行业务和数据结合得非常紧密。
那么今天看到这个比赛题目时,你觉得它和你现在做的工作之间有什么区别,或者状态上有什么异同?
杨同学
感觉不会特别相关。我们这边是做底层数据库搭建,也就是数据库内核;比赛主要是数据库的使用。这两个方向的技术难度不太一样。
业务线这一块,需要理解产品怎么使用,以及怎样更好地传输数据,为用户提供更好的交互,主要考虑的是这个方向。
内核这一块,我们考虑得更多的是,如何让用户更好地拿到数据,让用户感觉不到底层的复杂性;一方面性能要快,另一方面数据要准确。
庄明浩
今年决赛的题目是混合搜索。从最后的结果和评分来看,是看谁的性能更好、跑分更高,以及结果更短,对吗?
杨同学
对。
庄明浩
你呢?
吴洪涛
我觉得混合检索加全文检索特别新颖。我们在做的时候也考虑到,如果大模型没有上下文,它生成的答案可能会非常模糊、不准确。
所以我们用到了大赛的混合检索能力。同时,从学生的角度出发,我们也参考了一些工业上比较粗糙的做法。比如对用户的问题进行重写,让语义更加清晰、显性化,更便于检索。
也就是说,我们在用户需求发出的这一层又做了一层处理,先把用户的问题重写,让它的意图更加显性,更便于检索。
检索到结果之后,我们又做了重排序,拿到语义更加准确的内容。
庄明浩
你们从接到题目到真正跑通,整个流程是怎么样的?
吴洪涛
我们先有一个整体思路和框架。等大家想得差不多之后,队员开了一个会,一起讨论。
庄明浩
你们有几位队员?
吴洪涛
我们有 3 位队员,都是同一个学校的。
庄明浩
你们原来就认识,还是后来组队的?
吴洪涛
我和队长原来就认识,另外一位队员是我们在学校论坛上认识的。
庄明浩
当时是怎么把框架定下来的?
吴洪涛
我们开了一个会,每个人分别想一部分,然后参考了一些业界的做法。我们实现得比较粗糙,没有工业实现那么细,但也达到了比较好的效果。
庄明浩
所以框架想完、初期跑完之后,你们对结果和最后的成绩有预期吗?
吴洪涛
有,我们觉得成绩应该还可以。
庄明浩
你们参考了谁?
吴洪涛
实际上参考的是 OceanBase。
庄明浩
可以。你们呢?你们当时是怎么组队的?因为你们来自不同的地方。
杨同学
我们组队的过程比较有意思。我最开始打算自己一个人参加,solo,因为实在找不到人。
后来我想了一下,之前参加过一个开源社区 MiniGo,就去问那边的老师能不能找几个人参加。我在上面发了帖子,当时有一个同学报名,我就觉得终于不是一个人打比赛了。
庄明浩
你当时写了对队友有什么要求吗?
杨同学
要求没有特别高,有足够的时间,最好有一点 C++ 基础,就可以了。
庄明浩
现在门槛已经这么低了吗?随着 AI 的发展,门槛已经这么低了?那我们这些文科生快要摸到这个领域了。
杨同学
也不能这么说。社区里的人都对开源有贡献,基础还是足够的。
庄明浩
你们组在一起之后,是远程在线沟通、确定方法,然后实施吗?
杨同学
对。我们基本没有固定的时间,做着做着想到什么,就发消息到群里。如果觉得需要聊一下,就拉一个会议。
庄明浩
比赛过程中有没有明确的时间点,比如要完成并提交,然后在那个时间点等待评判?
杨同学
有。
庄明浩
在做的过程中遇到过什么卡点、难题,或者争论吗?
杨同学
我们这边还是比较和谐的。不过当时确实遇到过一个难题。
最开始我们做出来只有 600 多分,觉得已经差不多到上限了。后来有一天晚上,两个同学去玩了一会儿游戏,回来一看,发现不对劲:有一个叫“不要有小情绪”的队伍,一下子冲到了 1,300 分还是 1,600 分。
我们就说,他们叫“不要有小情绪”,结果我们有小情绪了。
庄明浩
你们可以实时看到所有队伍的分数?
杨同学
对。那之后我们发现,按照正常的传统优化思路,最高大概就是 600、700 分,他们绝对不是通常的优化思路。
后来我们从执行流程上,把整个流程优化掉了。
庄明浩
你们后来跑到多少?
杨同学
7,700 分吧?好像是 7,100 分还是 7,200 分。
庄明浩
那你们呢?
吴洪涛
我们接近 7,100 分。
庄明浩
你们中间遇到过什么波折吗?
吴洪涛
有很长一段时间,我们的性能没有得到提升。后来队长想到一个方案,把性能提高了 10 倍,我们当时一下子就有兴趣了。
庄明浩
什么方案?逻辑上是怎么做的?
吴洪涛
做了索引层的交集操作,速度大概提高了 10 倍以上。
从那时候开始,我们就站住了,也更有信心继续往前冲。
庄明浩
解决这个卡点之后,后面是在继续优化吗?
吴洪涛
对。那是索引层,后面我们又优化了下面全文扫描那一层的能力,一层一层往下做。
庄明浩
最后整体方案大概做了几层?
吴洪涛
大概 3 到 4 层。
庄明浩
你们了解其他队伍的实现方式、架构和框架吗?
吴洪涛
我们在最终答辩时听了其他队伍的介绍,发现大家的做法和我们大相径庭,并不太相同。每个队伍都有自己的实现方式。
庄明浩
这是不是也是这一轮变化的体现?原来大家会认为数据库是一个严格结构化的东西,已经高度结构化了,甚至是一个高度趋同的状态。
但因为数据库、模型能力,以及各种信息形态的变化,数据库不再是一个被严丝合缝封闭在单一结构里的东西了。是不是也发生了这样的变化?
日照
我觉得数据库肯定会更加开放。
原先数据库主要用来做交易和分析,处理结构化数据。数据库经过这么多年的发展,很多理论和经验都已经比较成熟,所以在交易和分析场景里,往往要经过很长时间才会出现比较大的突破,或者方法上的变革。
到了今天,数据和 AI 结合在一起,很多时候变成了一个搜索问题:怎么从上下文里找到和大模型更匹配的东西。
它不是百分之百准确的,不是一加一等于二,而是有一定的非精确性。再加上这个方向还比较早期,很多方法还没有定型。
所以有时候我们会发现,包括在座两位选手,也包括现场其他选手,会想到一些我们没有想到的方法。我作为评委,在答辩时也不一定能想到他们的思路,这里面其实有一个互相学习的过程。
所以现在看,AI 很多时候是年轻人的天下。AI 数据库也更多依靠年轻人,已经不是我们这些“老登”的天下了,我们已经被拍在沙滩上了。
庄明浩
还想问一个问题。大家会说这一轮模型出现之后,暂时没有办法解决的是幻觉问题。很多人会把幻觉问题归因到数据层面,因为刚才说过,它没有办法做到百分之百精准,必然会出现一些问题。
当然,也有人说可以通过路由的方式,把不同问题分配给不同模型。最近 DeepSeek 的论文似乎也在解决类似的问题。
您怎么看幻觉?它能不能解决、应该用什么方式解决,或者说这件事情真的需要解决到那个程度吗?
日照
我觉得幻觉基本上是一个比较关键的问题。
要解决幻觉,其实就像我们的大脑一样。我们的大脑可能刚开始有了比较强的推理能力,但这还不够,因为我们还有类似海马体这样的东西。
DeepSeek 确实尝试把一些东西结合到模型底层。但它结合的底层也还是一加一这样的方式,并不是把东西写进参数里,而是在模型外面挂了一个组件。
它和外部数据库结合模型时所使用的一些方法和思路,本质上可能也是差不多的。
我们需要一套数据库能力,把一些固定的东西记下来,放在那里,需要的时候去取。这样第一是解决经济性问题,第二是解决成本和效率问题,因为不需要每次都重新跑一遍。
庄明浩
你们这次决赛题目就是混合搜索,所以不可避免会出现幻觉。你们第一次遇到这种情况时,怎么解决?
杨同学
我们先把用户层的问题重写,把语义相似的词进行替换,或者把缩写和全称进行替换。
庄明浩
我问一下,这次搜索的需求是固定的吗?也就是说,用户发出的搜索需求,在题目里是固定的?
杨同学
题目是固定的,但我们不知道具体内容,是盲盒。
庄明浩
明白。你继续。
杨同学
做完这一层之后,我们又对混合检索的输出进行了重排序。重排序可以大幅度增加语义相关性,减少模型幻觉。
庄明浩
但同时还要兼顾效率,对吗?不能让整个工作变得更复杂,也不能让整个路径变得非常庞大。
杨同学
对。
吴洪涛
我们最开始看到答案之后,觉得它的回答是对的,但相关文档和页码一直在变化。它有好几个来源,我们当时去问出题的人,对方说会增加一个视觉模型来解决这个问题。
但视觉模型加上之后,页码还是会飘。后来我们发现,是我们自己这边的问题:它说的内容可能是对的,但来源不对。
这在业界应该会是一个非常严重的隐患,因为你必须知道答案来自哪里,才能给出真正正确的答案,而不是让模型猜出一份答案。
所以我们先通过 chunk 对文档进行排序,选择最可能出现答案的文档;然后再通过文档里的页码,定位最可能出现答案的页面。也就是说,还是要做几层确定性的位置确认。
最后的结果还可以。不过数据量变大之后,我们考虑得不够周全,后面时间也不太充裕,所以在知识题上做得比较差。
庄明浩
总共几道题?
吴洪涛
两道。
庄明浩
另外一道呢?
吴洪涛
另外一道是内核的 QP,混合检索是其中一道。
庄明浩
这些题是谁出的?
日照
题目是我们团队的一些工程师出的。
庄明浩
我觉得这个题目的范围、角度、深度和可能性都很难。你们已经做了 5 年,每年都要根据行业变化、技术趋势,以及学生的能力,综合考虑怎么出题。
杨传辉
对。第一个是出题方向,整个团队会讨论今年要往哪个方向走,比如是不是加入 AI 类的内容。
第二个是题目难度,以及到底要考察什么。这个考察点很关键,因为题目一定要有区分度,同时考察点还要和数据库内核、当前应用场景结合起来。
这个比赛虽然今年加入了一个 AI 相关的业务场景,但到现在第 5 年,它一直专注于数据库内核。我们的目标是研究基于 AI 场景的内核如何优化,去支持这样的场景。
我们还是希望通过比赛,培养底层数据库内核和基础软件研发人才。
庄明浩
延续这个问题,您已经做了第 5 年。回头看这 5 年,您感觉参赛选手的画像有什么变化?
日照
今年和去年给我的印象比较深,我觉得有两个变化。
第一个变化是,今年有两个本科生团队进入前 10 名。整体来看,选手相对更年轻了。他们有的学计算机,也有的学网络安全,但本质上都和计算机相关。
第二个变化是,今年的选手在做题过程中,需要理解题目、理解源代码,甚至进行大量 coding,他们会比较多地采用 AI 相关技术。
庄明浩
延续这个问题,你们使用外部 coding 工具吗?抛开这次比赛,在日常工作、学习和做项目的过程中,过去这一年走过来,你们怎么看 AI coding?使用程度和认可程度怎么样?
杨同学
参加这场比赛之前,我比较偏向传统手敲代码的选手。我觉得自己写的东西会更牢靠,因为我本身是 ACM 出身,所以相对更古典一些,基础也会更扎实。
对我冲击最大的是一个队友,他是我当时通过社会招聘找来的,叫吴敬华。他在我们做 MiniOB 的时候就开始使用 AI 工具。
我一开始觉得这样做会不会理解得不清楚。但我们会通过提交 PR 来协作,所有人都能看到修改的地方。每个人都学习过对方写的代码,才会合并这份代码。
到了决赛之后,他的优势完全发挥出来了。他结合 GPT 把代码分析完,然后用 Claude 直接把代码做出来。我在那里看了很久,还没有搞明白这个东西的前因后果,他已经完成了一版功能发给我们看。
庄明浩
那你现在也开始用了?
杨同学
开始用了。被他打击之后,我就觉得他是 AI 使用的高手,一直跟着他学,也听他讲怎么使用。
他说,只要把问题和需求讲清楚,AI 就可以做得非常好。
吴洪涛
我其实比较早就开始用 AI 了,大概从 2020 年末、GPT-4 出来的时候就开始用了。
这几年使用下来,我感觉今年和以往最大的不同,是很多编程 IDE 工具出现了。它们可以直接读取整个代码源码的上下文,所以编程更加方便,不需要把每一段代码拆出来、摘出来,再粘贴到工具里。
这对开发者阅读源码和进行开发,带来了很大的便利。
庄明浩
那未来 coding 能力还会继续提升。对于原来的手艺人来说,怎么办?
杨同学
手艺人有手艺人的优势。AI 改完之后,肯定会有一些报错。如果完全让 AI 去改,它会消耗很多 token,费用也会比较高。
但有些简单的问题,我们扫一眼就能发现哪里写得不对,手动改完之后再告诉 AI 这部分已经修复了,这样也能提升一部分效率。
还有一点,如果完全依靠 AI 写代码,你可能不会真正了解这一部分代码。像我们自己写的代码,AI 写完之后,我们会很仔细地看完,了解它整体的执行流程。这也是我们后来能够反超的原因。
庄明浩
你们怎么看?纯手抠代码的人怎么办?
日照
我已经用了很长时间 AI,也算是完全拥抱 AI 了。
我觉得这是一种新的手艺,怎么把 AI 用好的手艺。这里面至少有两点。
第一,这种手艺有一些新的技能,需要与时俱进地学习。第二,AI 毕竟还处在比较早期,它能够帮助你,但怎么用好它,还是需要传统手艺的修炼。最后只有这样,才能把新的手艺用好。
日照
我们内部 AI coding 的使用率非常高。基本上,尤其是在写代码方面,我们大量采用 AI coding。
它在前端开发、生成实验性代码,以及做一些中间件时,效率极高。但如果是特别严谨的代码,现在仍然存在比较大的问题。
AI coding 生成的代码,最终还是需要比较好的人去 review。它直接做出来的东西里面有坑,需要人工检查。
所以第一是怎么用好 AI coding,第二是怎么基于 AI coding 建立更好的开发、测试和产品协同方式,这些都会发生变化。
到了今天,有了好的工具,我们肯定要适应这样的工具。
庄明浩
但这又引发了另外一个问题。Coding 对任何公司而言,毕竟都是非常核心、非常重要的数据资产。如果使用公开的 coding 工具,似乎会遇到安全、隐私,以及各种各样的问题。
你们本质上除了是一家开源数据库公司,也是一家拥有 1,000 多名员工、开展不少业务的公司。你们怎么看这个问题?
日照
我们最核心的代码都是完全开源的,所以对我们来讲,OceanBase 最核心的资产其实是员工,而不是员工写的那些代码。
最终还是要不断创新,才能在这个场景里保持竞争力。比如 OceanBase 这个团队形成的组织能力,使我们能够不断通过创新,更好地解决用户的问题。当用户遇到问题时,我们能够给他兜底。
这些东西不是纯粹靠代码就能解决的。
庄明浩
这个回答很合理。
我们再聊一个更热、更新的名词。进入 2026 年,至少硅谷的共识是,autonomous learning,也就是自主学习,肯定会成为一个趋势。
但就像我们刚才在台上说的,今天这个词本身的定义似乎还没有完全清楚。也有一种观点认为,如果真的要实现自主学习,更重要的可能还是数据问题。
您怎么看这个观点?
日照
今天确实有一个词比较热门,就是 learning。它可能会在两个层面实现。
第一个层面,是模型本身的内化,也就是直接让模型把能力内化进去。
第二个层面,是模型和数据库结合在一起,通过数据库来做持续学习。数据库本质上是一个能够实时读写、持续进化的东西,但它和模型的机制又不一样。
第一种直接在模型里实现的方式,到目前为止还没有很大的突破。大家都在尝试,可能有一些新的实验室也在做,比如 Thinking Machines Lab。
这里面确实有比较大的挑战。比如我们拿到一个模型进行微调,做几次 LoRA 之后,最终结果到底是什么,基本上不可预测,需要人工去看。所以很难找到一种自动化方式把这些事情做好。
究竟是理论上出现突破之后就能做到,还是这条路本身就不一定能做好,现在还不能确定。
我们采取的是比较实用的方式:先把数据和模型结合起来,把这件事情真正做明白。
庄明浩
其实基于数据工程,把数据和模型结合起来,已经是很前沿的事情了。
从传统数据库到向量数据库,再到向量、上下文以及更多能力,这是不是也在匹配这个趋势?
李钊
是。今天不管是 OceanBase 还是 seekdb,我们讲混合搜索,解决的其实就是通过持续迭代的上下文,让模型和数据结合在一起,不断进化。
这种方式虽然我们也还没有把整个事情完全做明白,但我认为它一定是一个正确的方向,而且无论对大企业还是小企业都非常有效。
小企业使用大模型时,第一件事情就是把数据管起来,才能把模型用好。你需要有好的工具,需要有不断变化的数据,随时迭代自己的能力。
这就是 OceanBase、seekdb 加上模型能力所要做的事情。
我们的所有东西,包括数据库、OceanBase,以及上面的一些探索性工具,比如 Power Lag、Power Memory,都是完全开源的,而且采用 Apache 2.0 许可证。
第一,我们认为这个方向是对的。第二,我们认为业界可能会基于我们这套东西,把它做得更好。
庄明浩
我记得蚂蚁开源每隔一段时间会发布一张 AI 领域开源趋势图。
在 2024 年、2025 年之前,业界对于开源领域的趋势变化,似乎和真正的产业之间没有那么紧密。技术研发和开源世界在做一套东西,业界又在做另一套东西。
但在 2025 年,我印象特别深,蚂蚁开源第一次发布相关报告时,agent 框架、infra、数据层的趋势变化,GitHub 上新的增长,以及研究热点,和业界已经完全匹配在一起了。
这似乎也代表了今天的状态。大家会说,开源并不等于公益,开源也不等于没有商业化。今天的开源,似乎史无前例地和真正的业界发展绑定在了一起。
日照
早期 AI 更多是在做创新,所以它和原有技术栈、原有系统之间存在一定 gap。
但今天的 AI,包括半年前开始,已经在讨论如何把传统应用智能化。它必须和原有技术栈结合,原有技术栈也自然要想办法拥抱 AI,因为这个趋势已经非常确定了。
庄明浩
很多人会说,2025 年整个业界的关键词是强化学习。如果换一个关键词来定义中国 AI 行业的发展,可能就是开源。
如果只拿一个关键词或标签来定义 2025 年中国 AI 行业的发展,很多人可能都会说开源。无论是模型层面的开源,还是整个生态的变化,都是这样。
我之前写 PPT 时说过,开源可能是结果,也可能是原因。它可能是引发这一轮中美 AI 竞争的结果,也可能是原因。您怎么看?为什么中国公司突然在开源生态上这么强、这么拥抱,而且看上去是“正确”的?
日照
我觉得有很多原因。
第一,这和中国今天的商业环境、中国技术在全球的影响力有关。很多 AI 相关的算法毕竟是美国人先发明出来的,而中国更强的地方在于工程能力,能够把工程做得更好。
你不是第一个做出来的,但你可以把它优化得更加极致。对这样的产品来说,最有效的方式就是面向全球市场开源,让生态帮助你继续发展。
庄明浩
OceanBase 一直在践行这件事,对吗?
日照
对。OceanBase 一直完全开源、开放。
庄明浩
OceanBase 之前应该是蚂蚁内部的一个项目,后来才公司化?
日照
OceanBase 从 2010 年就开始做,前 10 年都是蚂蚁内部的项目。2020 年之后,我们才正式公司化。公司化之后第二年,就马上开源了。
庄明浩
当时是谁做的决定?
日照
开源这件事在我们建立公司的时候就已经讨论好了,只是筹备了一段时间。
开源并不是把内部代码直接放出去就行了。比如 2020 年成立公司的时候,我们就确定了开源要做的几件事。
第一,要去掉对蚂蚁内部代码的依赖。第二,有些写得不好的代码要修改,还要补充文档。毕竟要对外了,要“见公婆”,很多工作都要做。
庄明浩
我更好奇的是,本质上原来是一个内部支撑的东西,今天要把它开放出去,甚至还要去找客户、找不同的客户。
对于一个原来偏内部支撑的团队来说,这个过程可能很难。因为角色、状态、位置和目标完全不一样了。
日照
我觉得首先还是要看产品的初心是什么,也就是这个产品从创建第一天起,为什么要创立。
OceanBase 创立的第一天,就是要做世界级的数据库。虽然当时是 2010 年,只服务于内部,但我们从第一天开始,所有设计都是朝着通用方向去做的。
庄明浩
第一天就决定了。
好,我们再聊一个话题。想问问两位同学,你们现在都是研二,对吧?你也已经在工作,可能马上要面临工作问题。
你们怎么看今天这个时间点的 AI?尤其你们是计算机,或者计算机相关专业的学生。AI 这一波浪潮,对你们学习的东西和未来要做的事情,会带来什么影响和变化?
杨同学
我感觉 AI 能大幅提高我们的学习速度。它能让我们接触到更新的东西,也能非常快地教会我们很多内容,让我们更快地前进。
庄明浩
这是积极的一面。那如果不努力、不积极,只想躺平,怎么办?
杨同学
如果不接受 AI,可能会在 AI 时代被淘汰。
庄明浩
你是学安全的,对吧?安全似乎离这个问题更近,也更处在前沿。
传统安全和传统数据库有点像,是基于确定性的、结构化的、相对固定套路的一套东西。但今天 AI 发展之后,安全的边界被无限扩大了,变得非常泛化。
杨同学
现在接触到的 AI 行业,已经不再是原来传统的安全行业了。它引出了大模型安全、多模态安全,以及很多其他安全问题。
安全的边界已经被拉得非常大。
庄明浩
以前有一个经常被提到的例子:某个美国汽车公司把 AI 客服放进自己的体系里,结果有用户通过攻击的方式,用 8 美元买走了一辆汽车。
大规模幻觉和交易环节结合在一起,理论上就可能实现一些原来不可能出现的事情。
AI 之前,这种问题尤其在安全领域是不太可能出现的。但今天我们在追求通用和泛化,企业内部的数据库、网络、交易系统,本质上又是一个相对封闭的体系。AI 打开的口子非常大,对安全的要求也会因此变得非常高。
今年大家讨论 AI 泛安全的内容也很多,无论是大模型本身带来的问题,还是模型和传统企业业务结合之后产生的新安全问题,这个议题都不小。
你未来想找什么方向?
杨同学
可能还是大模型安全之类的方向。
庄明浩
这个事情在国内目前大概是什么状态?
杨同学
我在学校接触到的很多科研成果都很新颖,主要是安全方向,包括大模型安全、语音模态安全,以及其他多模态安全。
现在这个问题还没有收敛到几件非常明确的事情上,还是一个很宽的、快速发展的阶段。
庄明浩
你一直是做编程的,而且现在已经在工作了。你所在的是一家银行,我觉得这算是比较保守的行业,但今天受到 AI 的冲击似乎也很大。
吴洪涛
我觉得我们那边还算是接受度比较高的公司,已经在内部使用 AI 编程了。
我本来是后端工程师,进去之后现在变成了 Java 也会、C++ 也会、React 也会,有点变成全栈了。确实,通过 AI,只需要描述相关需求,只要能把它运行起来,就能实现一个功能。
庄明浩
那你对未来有什么想法?或者想学一些新的东西吗?
吴洪涛
我对自己的未来其实非常模糊,没有固定方向,还在摸索。
庄明浩
我听说 OceanBase 的员工里,有很多原来参加过比赛的学生。这个是机缘巧合,还是本来就有这样的想法?
日照
我们的比赛题目很多涉及数据库内核开发。有些同学本来就做数据库内核研发,那么加入 OceanBase 对他来说可能就是很好的选择。
当然,我们举办比赛不完全是为了给自己招人。
2010 年刚开始做 OceanBase 时,国内根本没有多少能够写数据库的开发人员,所以当时招人很难。后来我们慢慢有了一个想法,通过比赛筛选和培养人才。
这有点像 NBA,先通过比赛看一批人,再考虑后续发展。
参加 OceanBase 比赛的同学,通常会比较喜欢 OceanBase,但也不是每个人都会来。大家最后会分散到整个行业里。
我们的比赛含金量比较高,大家也比较认可。只要能拿到好成绩,基本上大厂 offer 肯定没有问题,而且通常都是比较好的 offer。
庄明浩
刚才我们聊到,今天无论是向量数据库、多模态、online learning,还是 AI 模型能力提升,都可能改变数据库人才的画像。
其他不是专门做这件事的厂商,怎么看这个变化,或者怎么评判这个事情?
日照
我觉得数据库人才的画像有变,也有不变。
不变的是数据库的基本理论。真正要把 AI 用起来,需要把需求理解清楚、描述清楚。数据库基础理论和基础 coding 能力仍然很重要。
老手艺学会了,才能学新手艺。
在此基础上,研发数据库的同学也不能固步自封,要更加开放,以好奇心去接受新的东西。
庄明浩
问问你们两个。这个比赛参加过一届之后就不能再参加了,对吗?你们的师弟师妹以后可能会参加。
对于比你们小一点的、刚入学的学弟学妹,你们有什么建议?或者想提醒他们避免走一些弯路?
杨同学
如果学计算机,就要自己多探索。
庄明浩
现在很多人,或者很多家长会被教育说,在 AI 条件下,不应该让孩子学计算机了,尤其不应该学 coding。你怎么看?
杨同学
学不学 coding 是一回事,但还是要了解和接触新东西,肯定要跟时代接轨。不跟时代接轨是不行的。
庄明浩
你当时为什么选择安全专业?
杨同学
其实也没有特别的原因,就是刚好到了这个专业,就来了,没有想太多。
庄明浩
如果有师弟师妹想参加明年的比赛,你有什么建议?
杨同学
比赛周期大概有 2 个月,中间可能遇到各种挫折,可能会因为性能没有提升、效果不好而感到挫败。
但在这个过程中一定要坚持下去,坚持走到最后。无论结果怎么样,至少自己不会后悔。
吴洪涛
我想说一句,虽然现在可能不太合适:代码始终是人写的,只要用心去看,迟早都能看懂。
现在 AI 写的代码越来越多,但代码始终有逻辑可以寻找。
庄明浩
你之前一直参加 ACM 比赛?
吴洪涛
本科期间一直参加。
庄明浩
你本科是学什么的?
吴洪涛
本科是计算机,研究生是大数据。
日照
现在很多 AI 用得好的人,包括我们团队内部的一些人,都是原来写代码写得比较好的 leader。
并不是说一个人从来没写过代码,最后凭空就能把 AI 用好。
我觉得写代码这个过程,从培养能力的角度来说非常重要。即使 AI 能写代码,如果没有经过这个过程,学生也不会有相应的逻辑能力。
写代码是训练逻辑能力最好的方式之一,包括参加 ACM。怎么确保写出来的代码又快,又能保证正确,这不仅是一项技能,更是在锻炼能力。
庄明浩
所以这可能是偏积极的一面。你们有没有什么担心,或者在过程中遇到过觉得过不去的坎?无论是比赛,还是和 AI 结合的过程中。
杨同学
我感觉 AI 的能力越来越强大。现在你直接提一个需求,它可能已经做得很好了。对我们学生来说,这个变化非常明显。
庄明浩
北邮在整个互联网领域都算是非常前沿的学校。我不太觉得你们学校内部对 AI 的看法,或者对学生的要求、实施和建议,会没有变化。
吴洪涛
我们学校比较支持学生使用 AI。AI 确实能大幅提高效率。
庄明浩
那在日常教学中,有什么实际变化吗?
吴洪涛
因为我已经不在课堂上听课了,我是研二,所以这部分不太了解。
庄明浩
我听说有学校给学生发算力。
吴洪涛
我们学校有算力中心,可以使用学校的算力。
庄明浩
用的人多吗?
吴洪涛
应该挺多的。
庄明浩
北邮可能比较特殊。我之前还听过另一所高校的校长说,学校发了很多算力,但很少有人用。他很担心,因为那已经是中国最好的学校之一,但使用比例还是不够高。
不过北邮确实不太一样。
杨同学
我感觉现在 AI 真的很夸张。我们答辩的 PPT,甚至只是把我们的思路讲给 AI 听,让它生成一个文档,再把这个文档交给它生成 PPT。
它生成的那几张图,我觉得是我这辈子都画不出来的。
庄明浩
震惊了。
我常年觉得你们代码很强,是传统手艺人的代码手艺;我是传统手艺的 PPT 手抠手艺人。现在 PPT 能力也真的守不住了。
我会觉得,我们这些还在坚持手抠 PPT 的人,快要成为非遗了。这一轮 AI 出现之后,尤其是多模态能力发展起来,基本就是这样。
你刚才说的和我们最开始聊的是一模一样的:它不是简单地画一张图,也不是只帮你做一个页面,而是你把一个逻辑讲给它听,它帮你把这个逻辑可视化,而且符合你讲的逻辑。
PPT 很多时候本质上是排版工作,不是创作。我要做一二三、金字塔结构,或者其他框架,它其实是一个有逻辑、有框架,并且和内容匹配的可视化表达。
今天 AI 基于文本、多模态、可视化表达和逻辑框架,能够直接帮你做出来。你真的会觉得,自己可能一辈子都做不出那个样子。
我原来非常坚持手工做 PPT,每一页都要自己对齐、找字体、做编号、涂色、配色,全部一点点按出来。但现在我大概每两三个月做一次 PPT,最近这次已经出现了大量 AI 生成的配图,因为它真的又快、又好、又准。
这和代码的发展是一模一样。人类坚守的空间越来越小,不断被挤压。代码是一层,今天我发现 PPT 这个战场也守不住了。
我们聊到最后,稍微发散一点。对 2026 年有什么期待?作为一家开源数据公司,在 AI 模型发展到今天、数据被提升到史无前例高度的情况下,对 2026 年、对业界或者技术发展,有什么期待?
日照
我觉得 2026 年首先还是比较相信 AI agent 会进一步爆发。
基于 AI agent 的进一步爆发,AI 能力会真正进入企业业务流程。所以在这个趋势之下,无论是对 OceanBase 还是对整个业界,我们都希望能够探索出一条数据和模型结合的道路,并且通过产品化把它沉淀到产品和系统里,帮助企业真正把这件事情走通。
如果 2026 年能够走通,未来几年就可以进一步复制。
庄明浩
Agent 也是 2025 年的一个核心关键词。大家会说,agent 要经过规划、执行、使用数据,以及结果反馈这样一个过程。
从大语言模型到 agent 的行为,在这个跨越过程中,上一个阶段似乎只是模型公司的事情,但再往后就变得异常复杂了。它要和外部环境交互,要和数据打通,无论是企业私有数据,还是数据库权限,都会涉及各种问题。
这不可能是一件很快的事情。上一个阶段本质上是堆算力,理论上差不多就能解决;但到了 agent,大家会说 2025 年是 agent 元年,也有人说这个元年可能会元 5 次、10 次,每年都是元年。
您怎么看这个角度?
日照
我觉得可以分成两类。
一类 agent 或大模型一定会很快,因为它本质上是完全通用的技术带来的通用能力。通用 agent 现在不是经常说一年增长 10 倍吗?这是一类新的创新,所以它会很快。
另一类,是把 agent 和企业业务流程结合起来。这个过程一定是比较长周期的,需要底层数据系统、模型能力和整个应用体系结合在一起,让企业真正用起来,形成解决方案和标准。
它不会特别快,但也不会慢。这个有点像 To B 和 To C 的区别。
如果完全通用化,本质上是 To C 的逻辑;不能完全通用化,就是 To B 的逻辑。
有了 AI 之后,原来的 To B 增长速度如果是 20%,可能变成 30%、40%,但不会变成 200%。To B 的特点是,它可以让 20%、40% 连续增长 20 年;To C 可能两年就结束了。
庄明浩
以你们的经验,哪些行业的趋势看上去会更好?你们服务很多类型的客户。
日照
一个是场景,一个是行业。
场景上,泛搜索、风控、客服等场景,应该都处在大规模采用的前期。大家不一定已经能用好,但确实有迫切需求,而且需求很强烈。
行业上,肯定是一些相对大的行业,或者拥有高价值数据的行业,比如金融、医疗。
这些行业的数据价值比较高,而且有很多企业自己的数据。这些数据和业务结合得比较好,能够产生比较好的 ROI,所以一定会先爆发。
庄明浩
你对 2026 年有什么期待?对自己或者其他方面都可以。
杨同学
我可能想做一些有意思的事情,比如获得一份有意思的工作。
庄明浩
什么叫有意思的工作?加入 OceanBase?
杨同学
可以和李钊老板多聊聊。
我的情况比较复杂,是一个非全日制学生。我希望能够直接进入公司,而不是实习之后再进入。
庄明浩
你现在的工作是实习性质,还是正式工作?
杨同学
是正式工作。
我还有点想成为独立开发者,自己做一些有意思的小东西。
庄明浩
昨天我听到一个很有意思的东西:把手机放在那里,录制你一天的语音,然后它可以帮你安排一天的行程。
现在不是有国产厂商做了一个挂在胸前的摄像头吗?它不需要像普通眼镜那样由你主动去操作,而是可以记录你一天看到的所有东西。
当然,这里面会有隐私问题。它可以设置成所有数据都保存在本地,也就是手机和电脑里。然后它能帮你分析,比如你今天去吃饭、写代码、见了谁,最后生成一张小漫画。你还可以把漫画分享到社交媒体。
听起来好像没什么用,但它就是一个玩具,很新奇、很酷,卖得也还可以。
这确实是 AI 能力带来的变化。我一直有一个观点:技术能力提升之后,一定会打开很多原来无趣、没有用的场景。
一开始它们可能看上去还是无趣、没什么用,但慢慢就会变得有点意思。AI 这一波确实如此。
昨天我刚从杭州回来,杭州当时在办一个朋友组织的马拉松,叫黑熊马拉松。现场大概有 70 到 80 个队伍,规模很大,持续两天。
我开玩笑说,只有在技术爆发的时候才会有马拉松这种东西,只有在技术还没有稳定的时候,才会让大家用无限的想法,在很短时间内把一个发散的 idea 做成一个小东西。
移动互联网时代也有过类似的事情,但移动互联网稳定之后,这种机会就少了,因为最后都是正规军和流水线了。AI 这一波到来之后,类似的机会似乎又变多了。
吴洪涛
从学校角度来说,做科研的时候需要写论文,我期待的是 AI for Science。
AI 现在已经有能力帮我读论文了,但它写出来的内容可能还不够严谨。我希望新的一年里,AI 能在这方面进一步提升。
庄明浩
你是学密码学的。今天这个时间点,密码学最前沿的科研方向在研究什么?
吴洪涛
我接触到的密码学方向,是全同态加密,也就是在加密数据上进行运算,然后解密得到正确结果。
庄明浩
我都快听不懂了。
那最后我们硬拉一个高度。今天这个时间点,我更想问一个个人问题:2026 年,无论是在工作过程中,还是在你们做的事情里,有没有期待实现的里程碑?小的也可以。
日照
对 OceanBase 来说,2026 年最大的期待,也是我自己会亲自去做的一件事,就是把 OceanBase 的开源生态变成一个全球性的生态。
现在 OceanBase 在中国还算是主流产品,但距离全球知名还有很大差距。
庄明浩
这个领域全球最知名的是谁?
日照
数据库领域全球知名的,可能是 MySQL、PostgreSQL。它们都是开源的。
一般来说,数据库领域做得最好的,除了 Oracle 以外,大部分都是开源的。
庄明浩
Oracle 现在可能已经不太把心思放在这里了。
你们对 2026 年有什么期待,或者想完成什么事情?生活上的也可以,比如结婚、找女朋友。
杨同学
我可能还是随遇而安。
庄明浩
什么星座?
杨同学
天秤座。
庄明浩
MBTI 呢?
杨同学
没测过。
庄明浩
你呢?
吴洪涛
我可能想成为一个开源社区的 committer。
之前已经有一些积累,我们队长是 Apache 的 committer,我想向他学习,也希望成为一个比较重要的开源社区 committer。
庄明浩
看着年轻人的状态还是很让人羡慕的。我们这些中年人已经被拍在沙滩上了。
我也很有感触:数据库原来听起来是一个传统、古典的事情,但 AI 这一波到来之后,似乎让数据库往前走了很多步。
今天我们能拿到这一轮 AI 模型能力的巨大提升,很核心的原因之一,就是数据工作者的努力,让这件事情走到了一个全人类都能够面对技术浪潮的状态。所以,只能说,很感谢这个时代,也感谢今天所有听我播客的听众。今天播客到此结束,再次感谢几位,谢谢。