卫诗婕
今天要聊的话题,是从 2024 年火到当下的 AI coding,也就是自动化编程赛道。2024 年 4 月,主打 AI 程序员的创业公司 Devin 在还没有产品推出、只有宣传片的情况下,就以 20 亿美元的估值筹集了 1.75 亿美元。年年底 Cursor 爆火,4 个月内估值增长了 6.5 倍,9 个月做到 7000 万美元的 ARR,彻底将 AI coding 赛道点燃,而热度在 2025 年有增无减。
刚刚过去的 5 月,OpenAI 豪掷 30 亿美元收购 AI 编程工具初创公司 Windsurf,成为业内最大的新闻。可以看出,Anthropic、OpenAI、Google、微软等大厂已经纷纷摆好了自己的 coding 生态。为何世界大厂纷纷押注 AI coding?coding 领域新秀频出,如何看待 Lovable、Bolt.new 这类新产品?到底什么是 vibe coding,也就是氛围编程?AI 编程又将给软件行业带来怎样的革新?
本期嘉宾是 AIGC Code 创始人宿文。AIGC Code 刚刚发布内测的编程 agent 产品 AutoCoder,是全球首款能够实现前后端一体化的 AI coding 产品。宿文本人也是连续创业者,清华工业工程博士毕业。这期内容,他详细阐释了当前模型和代码所处的发展阶段,以及为什么他认为 AI coding 能够激发出 AGI 的能力。
宿文,欢迎你,先跟我们的听友打个招呼吧。
宿文
大家好,我是 AIGC Code 的创始人宿文。2008 年我在清华大学读本科,2012 年本科毕业。大四的时候就留在学校里读博士,一直读到 2017 年离开校园。第一份工作是去做 VC,一直到 2021 年 3 月离开投资圈,全职加入了一家工业软件公司。当时另外一个联合创始人也是我们学校的师兄。
到了 2024 年 1 月,我自己有了一些更多的想法。大模型来了之后,经过深思熟虑,就做了现在的 AIGC Code。
卫诗婕
你好像是个学霸。
宿文
其实没有,我对自己的定义是一个小镇做题家。我是从甘肃出来的,来自一个小县城会宁县,典型的小镇做题家。到了清华、进入清华之后,就一路被碾压。
卫诗婕
真的吗?
宿文
对对对。你会看到有很多优秀的人。
卫诗婕
可是我查到,你博士毕业是第一名的成绩。
宿文
那个时候可能就是自己努力了一下。
卫诗婕
你当时加入的那家公司,叫树根互联,对吧?
宿文
对。它是一家什么样的公司,其实跟我原来的本科加博士专业是紧密吻合的。工业工程其实就是做工厂管理,背后是一堆运筹学、随机过程、规划这样的东西。
卫诗婕
它是 To B 公司吗?
宿文
是 To B,是个大软件公司,客单价能够到百万级别。当时我们的想法是,底层有物联网,物联网会提供大量的数据;中间我们会结合自己的专业知识去做整个软件;上层有了原始数据和管理数据之后,可以去做算法优化。我们当时构想的是这样一个三层结构,觉得它是一个能够长出大软件的方向。
卫诗婕
我看你在那里的身份是 COO。那段创业经历给你带来了什么?
宿文
其实比较多。从团队搭建、团队组织这些层面的事情,到最开始不到 10 个人,最后接近 200 个人,我得往里面加入。
卫诗婕
2021 年有一波 SaaS 小高潮。
宿文
对,其实刚拿完钱,资本市场还是比较好的,但马上就骤冷了。
卫诗婕
过了一年,到 2022 年 4 月,你们当时遇到挑战了吗?
宿文
好处是,在寒冬来之前,基本上粮食储备还是比较充足的。但剩下更多的,还是整个商业化闭环怎么搭建的过程。我觉得那是最大的感触,最多的成长,还是商业本身这件事。
一直到去年 10 月,我们参加 AWS 的 AI 创业加速营,看到贝索斯的一句话,我觉得特别经典:零售是这个世界上最性感的商业模式。那一刻我觉得醍醐灌顶。怎么样能够让你今天做的所有事情,未来的杠杆效应变成像零售一样,能够快速规模化地起量?
卫诗婕
我们怎么理解“零售是最性感的商业模式”呢?
宿文
其实它会涉及你的交付,也就是用户最终拿到你的产品、拿到你的服务,这个过程是什么样的;或者你启动的过程,是不是一个能够加杠杆、能够快速成长的事情。
你会发现在做软件的过程中,不可避免地会有解决方案、直销、一轮一轮地谈,甚至还有投标和一堆类似的问题。这不是说这个商业模式有问题,只是它可能不是我擅长或者想做的事情。
卫诗婕
贝索斯的那句话能不能更展开讲一讲?他所谓的“零售是最性感的模式”,这句话怎么理解?
宿文
就是需求和供给的匹配。你给他一个供给,不能远超过需求的范围,也不能只满足需求的一部分,中间会有一个匹配的过程。你要尽可能让它吻合,明确知道自己供给的边界和需求的边界。如果能够对接得足够好,它的扩展会好很多。
卫诗婕
那你是怎么构思现在这个创业项目的?
1. AI Rewrites Code Supply
宿文
大模型来了之后,我一直在思考这样一个技术对未来有什么帮助。看到整个软件行业里面,很多环节的成本、效率,包括交付质量,其实问题都从代码供给层开始。用户不停增加需求,包括表达不清楚的需求,最终都会跟代码供给之间产生比较大的商业冲突。
举个具体的例子,用户不停提个性化需求,这种需求你仔细思考,其实是合理的。而且用户今天提出一个需求,等产品用起来之后发现需求发生了变化,你会发现这也合理。业务在成长的过程中,软件或者工具的供给肯定会慢于业务增长,所有迭代都会涉及代码层面怎么实现。
所以这里面可能有一个比较大的契机:AI 来了。我们会看到,在代码供给上可以有一个新的范式。以前我们关心的是成本,也就是人的成本,以及效率。以前人去写项目,一个功能从沟通、交流、迭代到反复修改,花几周、几个月都是很常见的。
卫诗婕
所以程序员的头发都白了吗?
宿文
对,而且这些都不好。但大模型来了之后,我们可以用 token 去写代码,效率就变成了分钟级甚至秒级。这对这个行业来说是一个很大的变革。
所以我觉得这件事值得去做,这是最初的出发点。但它底层从技术到商业还有很多整体构建的工作,不是一下子就能想明白的。
卫诗婕
我看你是 2024 年 1 月创立现在这家公司的,为什么发生在这个时间点?
宿文
那个时间点已经看了大模型很多。2023 年已经浩浩荡荡地发展起来了。
卫诗婕
对。
宿文
那个时间点我跟 CTO、跟团队去讨论。另外,你得看你本身的技术供给时间点对不对。大模型出来之后大家肯定会关注,可能到了 2023 年中的时候,会看到“这项技术可以做什么”,但这件事一直到今天还在讨论。
因为技术一直在迭代。你会看到很多应用截至今天还没有爆发式增长,没有出现那么多我们想象中的 agent。这个时候其实是积木的问题,不是商业化或者产品应用做得不行,可能是我们把问题定位错了。
到了那个时间点,这个结论更明显了。一直迭代到年底,我才想清楚第一个切入口。我们当时看到,除了 Devin 和 Cursor 之外,很多产品还不是特别成熟,但过了年之后就成熟了。我们要抓住的,可能只有 coding 赛道。
卫诗婕
2023 年本质上基础模型的能力是不达标的。刚才你也提到了,在基础模型能力不达标的情况下,你怎么确定自己能做的就是 coding?
2. Coding Becomes Infrastructure
宿文
这里面有一个点:在基础模型不达标的时候,大家尝试把它应用到更多行业,你就会发现其他行业离得更远。当工具不成熟时,你贸然用到其他行业,用户往往是各自领域的专家。他会说,媒体上不是说你们马上要替代什么吗?但你用起来怎么这么傻,完全没法用。
这些行业不会产生共振,不会产生数据和商业上的共振。相反,写代码的人、做算法的人,是同一类群体。他们会用自己的专业度去弥补工具目前的不成熟,让两个齿轮稍微咬合起来、转起来。转得好不好,还有摩擦等问题,可以慢慢磨合,但至少它有一个驱动力去做。
大家训练模型的时候就发现,代码是非常重要的语料,可能是第一梯队里最重要的语料。Anthropic 也好,DeepSeek 也好,在这方面花的功夫都很多。
另外一块是合成数据很重要。到 2024 年第四季度已经比较明显了:合成数据里,代码和视频最重要。但我们不碰多模态,所以对我们来说代码最重要。从技术上看,它也跟代码挨得很近,所以我们是从商业和技术两个层面判断的。
卫诗婕
你能从技术方面解读一下,为什么训练大模型时,合成数据和视频是最重要的语料?
宿文
因为代码本身是一类有逻辑的语料,它可能对语言模型能力的促进最强。很多实验都看到,它对各个领域知识的促进也很强。
卫诗婕
我之前有一个解读,不知道对不对。我一直觉得,用人类语言去训练大语言模型,其实是一种非常人本位的思想。但是用代码,代码是 AI、机器更熟悉的语言。用它的语言去训练它,是不是更高效?
宿文
这只是数据层面的思考,整体上还是要看网络结构。最开始是 Transformer,后面是 MoE,还有一代代网络结构上的迭代。
这会涉及网络结构本身,也有点像王朔评价于丹的那句话:月亮离远了看,你觉得特别美;往近了看,就一板砖。网络结构会迭代出什么能力,预训练时学到了什么知识,因为模型是个黑箱、没有可解释性,我们不能直接下结论。但我们会看到,代码很重要。
卫诗婕
所以你选择 coding,是因为你觉得它离基础模型的应用最近?
宿文
对。我们甚至有一个观点:coding 这件事没有成熟的时候,其他 agent 可能都不太好跑出来。如果说大模型衍生的一系列应用是一支军队,coding 一定是头阵兵。
或者说,coding 可能在 3 到 5 年内更像一个 infra。大家有时候会讨论,大模型时代的 OS 长什么样,它可能就是 OS 的一部分,服务于产品,也服务于 agent。
卫诗婕
2024 年开端,coding 整个赛道就大火了,尤其是先从海外传导到国内。如果用一句话总结 2024 年的 coding 赛道,会是什么样?
3. Copilot Ignites The Market
宿文
我们看到的是 Copilot 产品线出来了。Copilot 就是大模型来了之后,在原有的存量开发场景里,程序员用它来提升效率、写一部分代码。它肯定没法完全写完,而是帮助程序员做辅助驾驶,就像它的名字 Copilot。
卫诗婕
我不是技术出身,也不是程序员。我用一个普通人更容易理解的方式来类比:搜狗输入法出现之后,提升了我们所有人的打字能力。基本上你只要打一个首字母,它就给你补充整句话,所以每个人的打字都变快了。
我的理解是,Copilot coding 工具其实就是服务程序员,让他们写代码更快、更好,而且它补的内容会更多。以前为什么叫“码农”?因为程序员在码山码海里面默默耕耘,是体力加脑力劳动,所以才被称为码农。
但我比较好奇,虽然你是工程学一路读到博士,实际上你从来没有做过码农、没有做过程序员。
宿文
对,我大学之前学过,但走出校园之后就再也没用过了。
卫诗婕
这可能跟你产品的定位有关系。比如说 Devin、Cursor,其实还是非常想解决程序员在具体写代码过程中遇到的各种复杂场景。但我的理解是,你要做的是代码平权,把这些所谓的 no-code、无代码产品做到极致,让每个人都能用。假设我完全不懂编程,也能用你的工具写代码。我的理解对吗?
宿文
其实这件事跟我的背景没有关系,更多还是要考虑代码未来应该是什么样的。你会发现,跳到最后一步看,没有人会为代码付钱。我买 100 行代码干什么?我是为了那个软件和应用。
代码只是最终结果。用户是在为最终结果付费。当然,提供一段代码也是在离结果越来越近,但你会发现,这件事的生态、技术以及商业化,更适合大厂去做。
所以今天你看到跑到头部的一些产品,除了 Cursor 目前还没有明确站队之外,该收的收了,基本都是大厂的。我们认为,这些产品偏同质化。大厂已经各自养好自己的部队了,这件事我们第一天就想清楚了,很快就会变味。
Windsurf 其实也是一家很好的公司,后来被 OpenAI 以 30 亿美元收购。
卫诗婕
从你的视角还原一下 2024 年,你觉得那一年 coding 领域有哪些特别大的标志性事件?
宿文
因为 coding 首先跟大模型紧密相关,所以我们可能还是看基础模型层。基础模型层,我们认为 DeepSeek-V2 在 2023 年底的工程和强化学习方面有一些贡献。V2 在整个模型架构层面的贡献,可能是一个高点。我印象里,它贡献出来的技术已经被技术社区广泛 follow,大家都在重点研究,这是一个大事件。
年终的时候,Cursor 也比较明朗地冲出来,尤其伴随着 Claude 3.5 发布,带来的模型红利被它快速消化。Windsurf 也起来了,其他一些星星点点的产品也都出现了。
到了 10 月左右,我印象中 Bolt.new 出来了。其实在那个时间点,Claude 有一个类似的产品叫 Artifacts。我们之前也做过类似产品,已经在内部完成了,但我们觉得不太对。一是它不够厚,二是你会发现它很快就会陷入同质化竞争。
当时至少能数出 15 到 20 家可能赚到钱的公司,但真正的头部只有 3 到 4 家。写前端的工具也有一堆,如果持续围绕它做商业化,会耽误很多事情。它当时的架构也不符合我们对 AutoCoder 的想象,所以那个产品我们就没有继续迭代。
卫诗婕
我追问一下。你刚才讲了一个很关键的认知:你在 2023 年底就判断,接下来服务专业开发者的 coding 项目会是大厂的天下。你凭什么这么判断?
宿文
有两个点。一个是它离基础模型很近。
卫诗婕
你的意思是,因为基础模型本身就是这几家大厂在竞争?
4. Big Tech Owns The IDE
宿文
对。它做完基础模型,第一步就是要去建立这样的生态。这其实是对基础模型最短平快的翻译,顺手就做了。它在 prompt 的时候喂过代码样本,稍微改造一下就会有代码补全。
大家还会卷一点产品、卷一点类型和 workflow,但整体上你会发现,差异度不大。
另一个更底层的原因,是它的产品跟 IDE 生态绑定在一起。IDE 就是服务程序员和开发者的集成开发环境、集成系统。你必须围绕它的生态去做:要么做插件,要么做云 IDE,要么基于现在开源的、主要是 VS Code,去魔改一套。Cursor 是这么做的,Windsurf 也是这么做的。
这 3 个产品基本都是围绕微软这样的巨头在搞生态。短期来看,微软可能觉得你只是小打小闹,但你做大了,它就会比较难受。VS Code 毕竟是微软做的,也是服务开发者的编程工具,而且在这一轮 AI 之前,应该就是全球最流行的。
卫诗婕
所以你的判断是,这一类产品你只要做了,刚开始小打小闹没关系,但做大了一定会被微软这样的巨头收割?
宿文
它会产生一些冲突。你要真正优化产品,会发现很多事情不在自己手里。产品迭代的时候会产生冲突,渠道也是。软件是赢家通吃的生态。
你看 Cursor,和微软在大约一个月前就产生了一些冲突。Cursor 想修改 VS Code 的一些功能,但微软那边不开放,类似这样的事情都会发生。
卫诗婕
因为这类工具其实是基于 IDE 系统做的,对吗?
宿文
对,IDE 是人家的。你要在人家的土壤上做改造,就涉及授权问题,或者它的开源生态是否允许你这么做。最核心的东西不在自己手里。
就像今天整个中国还没有自己的 IDE,华为等公司在尝试解决,但距离全球头部还比较远。这是一个赢家通吃的生态型产品。微软的 VS Code 做了多少年,我们得查一下,但肯定很久。我上学的时候就用,已经非常悠久了。
卫诗婕
所以你 2023 年的判断是准确的,因为 2024 年大厂收购这类 coding 项目,真实发生了。
宿文
对。除了 Windsurf 之外,我印象中没有大的并购事件。Claude 有自己的产品,微软有 GitHub Copilot,都是自己做的。还有一些大初创公司没有站队、没有被收购,它们自己也在训练模型,比如 Poolside、Magic。国内在那个时间点也已经出来了,百度、阿里、华为,包括腾讯内部,都能看到类似的工具。
卫诗婕
我梳理了一下 2024 年行业里比较关键的事情。首先是 2024 年开年,4 月份的时候,Devin 在产品还没有推出的情况下,就已经以 20 亿美元的估值筹集到 1.75 亿美元。这让我觉得,在 2024 年开端,这个赛道是不是已经很热,热钱是不是已经很多了?
宿文
应该从 2023 年就有一堆了。Poolside、Magic 这些应该都是 2023 年,甚至是 2023 年上半年启动的,都拿了很多钱。
包括 Devin 这样的团队,从它用的模型、解决的问题,以及它打算怎么做这件事上,其实没有暴露太多让我们信服的点。当时它用的是 GPT-4。这个产品本身能不能做更多,它所谓的 AI multi-agent 之类的东西,其实不太对。最终从年底交付的效果上也能看到,后来他们也调整了方向,做了一个新的产品。
卫诗婕
从你的视角看,你最早是什么时候知道 Devin 这个团队的?我觉得它的创始人能筹到 1.75 亿美元也合理,因为从创始人的配置上来看,它应该是硅谷很爱投的那一类:非常年轻、天才,之前还拿过奥林匹克竞赛金牌,有很深的编程背景。
宿文
我们也是跟着他们的 PR 知道的。知道他们团队里有 10 枚奥赛金牌之后,我们当然会关注。但他们在所有信息里没有说自己到底要做什么、怎么做,只说自己是奥赛金牌团队,有很好的背景。
我当时想,奥赛金牌每年可能远不止 10 枚,所以还是要看他究竟做什么。
卫诗婕
后来 Devin 的发展符合你的预期吗?
宿文
明显不是。订阅费 500 美元,刚开始大家测试完,觉得它能做一些任务,但很快就没有太多正向反馈了。他们也在做调整。看起来是一个明星团队,但整体结果到今天还不理想。我们不知道他们后面会不会做出更让人信服的产品。
但很快 Cursor 就变成了最明星的项目。
卫诗婕
Cursor 在你这边评价会更高一些吗?
宿文
当然。我觉得它肯定是好产品。它有那么大的收入,你还要说它不是好产品,那就是自欺欺人。
但我们要不要做这件事,以及这个商业生态怎么演变,团队继续做这件事能不能得到收益,我认为不会。在代码补全,也就是 Copilot 这个赛道上,Cursor 毋庸置疑是一个非常好的产品。它应该是 9 个月做到 7000 万美元 ARR。
卫诗婕
2024 年算是 Copilot 的大年,用 AI 做代码补全,也跑出了 Cursor 这样的好产品。刚才我们讲到,做 coding 大概分两类。一类是早期的 Copilot,更像是面向专业开发者,用搜狗输入法来类比,就是帮助他们提效。
另一类也是现在竞争更激烈的 coding agent,面向专业开发者以外更广泛的人群,自动化能力更高。它对应的是从辅助驾驶到自动驾驶,出现了很多公司,大概是在去年 10 月左右起来的。
5. Claude Unleashes Coding Agents
宿文
这个底层能力的供给,还是 Claude 3.5 带来的技术红利。Lovable、Bolt.new、v0、Replit 的 agent 等等,有一堆产品,国内也在去年年底迅速跟上了。
卫诗婕
刚才提到,2024 年有两个大的基础模型标志性里程碑:一个是 DeepSeek-V2,另一个是 Claude 3.5,对吗?
宿文
对。但因为 Claude 是闭源的,大家觉得它效果很好,却没有办法深入了解技术细节,或者说在技术共享层面,它对行业发展就没那么直接。不过我们也能看到,它分享出来的一些内容确实很强。
卫诗婕
我好奇的是,这两个基础模型从技术层面上,怎么让后面涌现出那么多 coding 项目?
宿文
一个点是网络结构往前走了一些,比如 MoE。但这里面还有更大的贡献:大家在 pre-train,或者后续 post-train 的过程中,喂进去的代码语料越来越精良了。从模型到语料数据层面,大家都在发力。
卫诗婕
Cursor 用的是哪个基础模型?
宿文
你可以选。最开始我印象里 OpenAI 还投了他们,用的是 GPT-4。后来用户用脚投票,最终的结果应该是 Claude 用得更多。
卫诗婕
你之前评价过,说 Cursor 是想在大厂和 AGI 巨头的车轮前面抢钱的一家创业公司。这句话怎么理解?
宿文
就是它离巨头很近。你在它前面抢,就能抢到;等它碾压而过,后面跟上的就没了,或者难度会大很多。
它能够比巨头的时间点早准备一点点。不能太早,太早就等不到;但早准备一点点,然后顺着这个转动的势能,快速抓住代码补全赛道,这也是非常强的能力。
这个团队对产品、对整件事的认知很深。它需要的不是运气,而是预判,因为它相当于埋了一个时间点。它的预判可能也没有特别准,过程中做了很多调整,但整体上是对的,这本身就很强。
卫诗婕
它预判了 Claude 3.5 能到一个什么程度,然后提前把产品准备好了,所以抢跑一段,把离建模最近的 coding 做好,再迅速卷住用户,对吗?
宿文
我觉得它不一定是预判了会有 Claude 3.5 这么强的模型,但它基本判断出大模型会带来什么红利,代码就是其中一个。再结合它把 IDE 做得不错,能够让原来比较重的程序开发习惯发生转变,这些事情它都准备好了。
卫诗婕
所以你的意思是,它也不一定押中了 Claude 3.5,只要大家都有基础模型,总有一个能做到这个程度,然后它可以基于这样的基础模型把产品做到最好,对吧?
宿文
对。
卫诗婕
但我比较好奇,这种抢来的钱,怎么避免不被巨头收割?
宿文
那就跑得更快。你一直在前面,是可以的。
包括 Cognition,它从去年 10 月开始说自己在训练模型,到今天也没有交付出来。它肯定会围绕自己的产品做一部分工作,但短期内没法把 Claude 切掉。它的体量大到 Claude 在做 pre-train 的时候,可能还要跟它配合一下,中间会形成一种生态效应。
卫诗婕
这个过程中,跟大厂共舞,和大厂之间的竞合关系是不是很有难度?
宿文
如果你做 Cursor 这件事,要看在哪儿。我们觉得硅谷的生态可能更健康一些,在国内就比较难。
国内我们会遇到友商找你,说“你先做一个方案”。我问,为什么要这么做?很快方案就被拿走,一分钱都不给。这怎么可能?这不是一个健康的生态,所以肯定会很难。
卫诗婕
所以你的意思是,在硅谷 Cursor 可以存活;在中国,即使你做出了 Cursor,也很可能首先做不出来?
宿文
对,也不能说假设我要做就一定能做出来,那有点太高抬自己、太高傲了。
卫诗婕
那你是怎么判断,Cursor 这样的事情你做不了?
宿文
那个时间点,Cursor 已经发展了很长一段时间,有很多沉淀。另外,我们觉得围绕 IDE 生态去改变 IDE 生态、改变程序员的 IDE 使用习惯,这件事做不过大厂。
使用习惯是很难改变的,这不是我们应该去做的事情,也不是初创公司擅长的创新驱动型事情。
卫诗婕
你总结一下,为什么 AI for coding 会在 2024 年大爆发?除了刚才讲到的两个基础模型推动了整个行业,还有别的因素吗?
宿文
好像没有了。
卫诗婕
刚才我们主要讲的是硅谷的公司。国内的 AI for coding 在 2024 年是什么状态?
宿文
大家也都在努力,该 follow 的 follow,该转型的转型。
卫诗婕
你说的转型,是指之前就在 coding 赛道做相关事情的公司吗?
宿文
对。2023 年上半年,我记得奇绩创坛讲 agent 的时候,就已经有五六七八家在做 AI coding。到了 2023 年春节前,有一部分开始转型。
卫诗婕
从什么转为什么?
宿文
完全转到其他方向,比如转硬件,或者转到其他方向。
卫诗婕
也就是说放弃 AI coding,换方向。为什么?
宿文
具体原因他们也没告诉我。整体肯定还是因为没有熬到 Claude 出来,也没有熬到中国市场或者生态的 PMF 时间点,所以快速去尝试其他方向。
卫诗婕
你说底层原因是什么?
宿文
底层肯定还是对技术本身的认知。
卫诗婕
像 DeepSeek-V2 和 Claude 3.5 出来之前,中国这些做 AI for coding 的项目,他们用的积木是什么?
宿文
基本上大家都会调模型,国内、海外都一样。只有测过才知道能不能用。研发和 coding、模型这件事,不是一个特殊市场,大家都能使用全球最好的工具。用海外的积木做研发,并不受限。
卫诗婕
你的意思是,奇绩创坛那六七个项目,可能只是倒在黎明前放弃了。其他还在继续发展的,你没有关注?
宿文
我没有关注,只看到确实有人换了方向、做了调整。但其实我们创立的时候,这两个积木也没有出现。它们有没有出现,对我们干扰都不大,因为我们要做的是真正把一个程序员替代掉。
这属于业务转移型的产品:把一个软件从数据库、后端、前端,到测试、运维、部署全部完成。当时的模型、今天的模型、未来的模型,其实都还有比较大的卡点,能用,但未来的迭代需要自己手里有“大脑”去持续迭代。
卫诗婕
所以产品的迭代会发生在模型层,而这个模型得想办法自己处理,对吗?
宿文
对。
卫诗婕
我们昨天可能聊到,Claude 4 可能要发布。你要等 Claude 4 吗?
宿文
不等。它每一次模型的大变革,都会导致上层生态位的大变革,其实这不对。上层创业者一定要想清楚这件事。
举个例子,DeepSeek-V3 出来、DeepSeek-R1 出来,你会发现大家开始各种蹭,说我调整了什么、换了什么,因为它来了,所以我要做什么。这其实意味着他不知道技术边界在哪里,没有任何预判。
如果一个创业项目,半年或者几个月就因为底层模型或其他人的变动而大调整,那可能是有问题的。
卫诗婕
这句话其实挺反共识的。因为大家都会觉得,基础模型是最底层的,如果最底层有比较大的技术迭代,上层构建的所有东西都可能要快速迭代,甚至重来一遍。大家今天也都强调,组织一定要反应敏捷、快速调整。
宿文
共识和非共识没有对错之分。在山腰或者山底看到的,肯定不是山顶的景色。
还有一个点,既然我们把它作为一家商业公司,撬动了股权投资,投入了很多人力和算力,如果我没有判断清楚底下的地基不能建 100 层楼,却贸然开建,后来才发现它原来适合建别墅,或者适合搭跨江大桥,那就会浪费很多资源。
卫诗婕
那你判断模型的边界是什么?
6. Models Hit Their Translation Limits
宿文
没有边界,就是做翻译、做转译,也就是从 A 形式转换到 B 形式。它天然适合做扁平化的转换。你让它去做长逻辑链条的思考,今天还泛化不出来,这是 Transformer 架构的天花板。
未来还要持续提升,但在今天,或者很长一段时间能力还没有提升的时候怎么办?要结合你的场景持续迭代它,收敛它的边界,同时放大它擅长的点。
卫诗婕
你觉得它在 coding 领域擅长的点,怎么发挥?
宿文
其实就是业务翻译,各种各样的业务翻译。
卫诗婕
我们的听众可能很多是非技术人士,能不能用更通俗的方式解释一下什么是业务转译?
宿文
最早 Transformer 应该就是做英语到德语的翻译,这就是最直白的例子。
今天你会看到,语言模型做得比较成熟的事情,还是在利用这个能力。比如做文件抽取、整理,包括一些跟搜索相关的项目,整体上都在发挥这些能力。它明显很擅长,也很好地运用了今天模型的技术红利。
但如果我们指望它自己想清楚数据库怎么做、中间件怎么做、微服务怎么拆、前端怎么做、UI 怎么做、API 怎么处理,就有点为难这项技术。
卫诗婕
简单来说,如果把它拟人化,你说的转译可能就是一个常规码农能做的事情,更多是轻脑力加体力劳动,对吗?
宿文
对。它更多是在帮助人类协同得更好,发挥规模效应。所以以前我们会把工作拆得越细越好。
卫诗婕
但是大模型写软件也是这么考虑的吗?
宿文
对,但是拆得越细,错误率就越高。不会说在 3 到 5 年内就完全颠覆,也有可能新的架构或其他东西出现,那会涉及怎么驾驭模型。
有点像一个发动机,它到底是飞机的、火箭的、汽车的、高铁的,还是四驱车的,要看你怎么去驾驭它。
卫诗婕
那怎么驾驭它,大家凭借的是什么?
宿文
其实就是技术层。包括模型以前的发展经历,以及接下来全球真正还在做这件事的少数团队,大家会基于什么认知去尝试和迭代。
7. Autopilot Rewrites The Workflow
卫诗婕
我们刚才聊到辅助型 Copilot,以及它慢慢演变出来的另一种创业方向:Autopilot。你做的其实是 Autopilot。
我之前听 Lovable 的 CEO 说过一个形容,觉得很有趣。他说,这两者的区别,是从体力劳动被 AI 取代,到认知劳动被机器超越。你认同吗?这里说的是 Copilot 和 Autopilot,Copilot 更多还是帮你做体力劳动,Autopilot 可能在认知上有机会超越人类。
宿文
我觉得这更多是因为大家都是这一代大模型的产品。它们给用户提供的服务,本质上是在制造内容,而不是产生连接、做撮合、送外卖或者打车。它就是在给你创造内容。
卫诗婕
Agent 就要做撮合的事情了,甚至还要影响物理世界呢?
宿文
嗯,这个就让其他人去做,我目前还没有考虑这么多。我只是在 coding 市场上看到,最终沉淀下来的内容,可能比绝大部分人的能力更强。
它就是一种正常的内容供给。你能够把软件写出来,写得好、设计得好,大家能够复用、共享,就可以做商业化变现。
卫诗婕
所以从 Copilot 到 Autopilot,你觉得其实就是从辅助驾驶到自动驾驶的进程?
宿文
对,但现在自动驾驶也还没有达到,L4 还远着呢。这只是一个类比。自动驾驶涉及伦理和各方面的问题,不能犯错,但完全不犯错又不现实,会有很多卡点。
代码不一样。今天基本上可以验证这个事情,有 bug 没关系,改掉就行,不会死人,也不会产生恶性实验。
卫诗婕
我之前好像听 Devin 的创始人,也可能是另外一家公司的创始人,他也有这样的类比。但他说不能完全类比,因为自动驾驶可能需要 99.9% 的准确度,代码却不需要。
不过他还提到,今天 Autopilot 的自动化程度,可能远没有到当年微软出现时的状态。
宿文
现在没有出现,不代表未来不会出现。我们今天拿出内测产品,各方面其实已经有这个苗头了。产品做出来之后还要迭代,还有一些工作要做,但这个事情也快了。如果 6 月底顺利的话,大家就可以体验到这样的产品。
卫诗婕
所以你觉得 vibe coding 时刻已经来了?
宿文
差不多。截至今天,或者说上个月、最近两三周,红杉资本在美国开的那个会,技术层面对 coding 的讨论还局限在 FDE,也就是前端开发体验,没有提及整个全栈。
卫诗婕
你刚才提到,海外这些明星公司都还局限在做前端,但你们其实实现了前后端一体。这是你们公司的创新点吗?
宿文
对,这是最大的创新。软件工程里,前端可能只占很少一部分,80% 到 90% 的工作都围绕数据库和后端。
卫诗婕
为什么之前这些 coding 项目没有做后端,只做前端?
宿文
大家都尝试过。我们看到有些尝试失败了,只做后端的也不太顺。
卫诗婕
你的意思是,别人也想这么做,但现在是你们先做出来了?
宿文
对。为什么只能做前端?因为它们基本都用 Claude 3.5 和 Claude 3.7,基础模型给你的能力供给就是这些。
卫诗婕
为什么是你们做出来了?
宿文
我觉得主要有两件事情,涉及我们现在团队核心的产业能力。过去十几个月,我们到底做了什么?
一件事是模型。包括自研模型,也包括我们对很多模型的探讨、关注,以及对它边界的定义。这会涉及你怎么设计产品。
另一件事是软件架构。大家不能按照人的方式端到端地写软件,因为人的逻辑和大模型写软件的逻辑是不一样的。我们做了另外一件事,叫生成式软件架构。正是这两件事,让我们达到了现在的效果。
卫诗婕
我们一会儿再详细讲你在创业过程中具体在哪些方面发力,先回到行业。2025 年这把火感觉有增无减,你觉得是吗?
宿文
是。因为基础模型迭代得很快,能力也迭代得很快。主要还是全球有几款产品已经验证了这个方向,跑得比较快。当然,也不能说完全验证了,这件事还要继续发展。
大家看到的数据,不管是老板也好、投资人也好,还是一些做得好的团队,都已经把“大模型的出口就是代码”这件事摆到桌面上了,绝大部分人也接受了这个共识。
8. Vibe Coding Meets Reality
卫诗婕
2 月份的时候,OpenAI 联合创始人 Andrej Karpathy 提出了 vibe coding,中文翻译是“氛围编程”,这个词一下子就火了。但我一直不太理解,到底什么叫氛围编程。
宿文
我有一个视频,可以给你看一下吗?
卫诗婕
好啊。这个视频回头可以放到你们的 show notes 里。
宿文
没问题。不过有没有版权我不知道。视频很短。
卫诗婕
他们俩是都被蒙着眼睛吗?
宿文
对。
卫诗婕
这个很形象。给听友和观众解释一下这段视频的意思。
宿文
就是你不知道技术边界,也不知道怎么驾驭大模型,于是变成“有什么结果我就用什么结果,出了问题再说”。但出了问题又不能解决,最终这只是一个阶段性的事情。
卫诗婕
我最好奇的一点是,vibe coding 到底是一个带有一点贬义和审视的词,还是一个建设性的词?但我身边很多人讨论,尤其是懂技术、会编程的人,都说 vibe coding 可能带来很多垃圾代码。
宿文
我觉得这两个说法都有点极端。我们评估产品最重要的是看它做出来的东西。我们有 3 个指标,第一个是成熟度。成熟度意味着它真正能够进入生产环境、解决问题。
靠 vibe coding 去做一个建设性的未来,目前技术路线还不明朗。专业人士才会对它有一些调侃。但你说指望它写出一堆屎山代码,用户也不会用。它只是大家探索技术过程中的一个中间态,有点像汽车最早出现时,大家把它当成一个小玩具。你不能因此说汽车没有意义。
这是一个中性的概念。只是说,今天我们还是要得到一个更成熟、更严肃的产品。
卫诗婕
到底什么是氛围编程?
宿文
就是大模型给什么你接受什么,完全不可控。这是扭蛋机和真正零售的区别。我说的扭蛋机不是娱乐,而是你获得的东西具有不可控的不确定性,也就是盲盒。你扭出来的东西不一定是你现在需要的。
零售就像你刚才讲的,是需求和供给更加匹配。
卫诗婕
但现在不管是 Copilot 还是 Autopilot,假设你是一个专业程序员,你能把它用好吗?我听说有一种说法:这个东西你没用的时候可能瞧不上,用了之后可能就离不开;但再用一段时间,又会发现它怎么这么乱来。
宿文
这个描述符合现实。随着使用时间增加,幻觉等问题会导致质量大幅下降。
Cursor 这类代码补全产品,确实是严肃工具,给程序员带来了很大帮助。但有些程序员看不起它,因为它写出一堆 bug,把人搞得很崩溃,或者在没有告知的情况下覆盖之前写过的东西,出现各种各样的问题。
调侃它的人可能还在用 A4 纸一页一页写代码,但 Cursor 从用户量和收入来看,一定是有效果的。它也需要持续迭代,包括 OpenAI 和 Windsurf 结合自己的模型能力持续迭代,这肯定是一个发展过程,会越来越成熟。
卫诗婕
去年年底,技术圈有一些测试会看到,基本上写 1.5 到 2 个小时左右就会出现问题,但今天这个数据应该有所提升。为什么会有一个时间边界,超过这个时间效果就会下降?
宿文
今天看,还是跟它的大上下文有关。写着写着,信息可能会受到上下文容量的影响。
卫诗婕
所以现在他们也做了 workflow,方便在左边的文件夹里找 bug 之类的。
刚才你又提到 2025 年另外一个重要事情,就是 OpenAI 以 30 亿美元收购 Windsurf。怎么看待这个收购?
9. Windsurf Joins The Model Race
宿文
这是一个很自然的状态。现在初创公司做 AI coding,如果没有自己的模型,要么自己做模型,要么最终可能被收购。
大厂都会做这件事。如果海外大厂看到一个不错的产品,同时不考虑它是否 overpay,那么收购就是一种很好的协同。OpenAI 收购 Windsurf,可以理解为模型和工具的结合。
OpenAI 以前还有 Codex,也有代码补全工具。但 Windsurf 在工程时代积累了很多东西,尤其是在 IDE 上的积累,可以帮助 OpenAI 把这件事做得更大、更快。这个方向是对的。
卫诗婕
就像你说的,如果我做的是基于 IDE 的 coding 工具,要么接下来自己训练模型,要么被一个大厂或大金主收购。现在大金主都要做这件事,要么自己做,要么趁着我还不错把我收了。
宿文
是这样一个现象。但我们也不能预判,一家初创公司未来最后的归宿就是被收购。只是今天要做这件事,确实跟模型耦合得非常紧密。
卫诗婕
你现在做的 Autopilot,难道跟模型耦合得不紧密吗?
宿文
紧密。
卫诗婕
那大厂为什么不能顺手把这件事也做了?
宿文
它还得做软件架构这一部分。模型和软件架构基本上各占 50%。未来模型可能会反超一些,但今天模型占比还少一点,因为模型能力不够,需要用其他能力补齐。
你这个问题更底层是在问,大厂会不会做类似的产品。我觉得会,那就做呗。竞争的源头是,在行业早期,组织和人、认知、执行力,最终能不能让产品快速跑起来。只有快速迭代出来,才算数。
卫诗婕
所以你觉得,做 Autopilot 这件事有 50% 需要软件架构,比做 Copilot 更厚。大厂做 Copilot 更顺理成章、更轻松,做你这个事情更难。所以不是它未来不会做,只是短期内可能先不会做。
宿文
Copilot 也不容易。它有技术延续性,内部有几万甚至十几万程序员,还有外部 To B 生态的集成,以及整个战略跟随。头部有人先干了,大厂肯定会跟随,这种战略懒惰也证明了战略正确,它们就会去做。
但做 Copilot 能不能在技术上继续延展到 Autopilot,从目前来看不会。它得到的用户数据、场景数据,以及程序员画像,跟非编程人群使用场景下的产品设计思路是不一样的,连模型底层需要迭代的重点能力都不一样。
卫诗婕
在大模型出现之前,我经常听编程界讲低代码。现在又讲零代码、无代码。这两者到底有什么区别?在技术上是合作、覆盖,还是替代?
宿文
我在 2018、2019 年创业的时候,低代码和零代码可能更多一些。低代码就是你还需要写一部分,零代码则是通过拖拉拽去搭一个应用。那时候还有 RPA,结合 OCR 做识别。
但其实从人类有了规模化的信息技术产业,也就是 IT 产业开始,低代码和零代码就已经出现了。20 世纪八九十年代就有低代码和零代码,核心只有一个点:解决代码供给问题。
程序员成本高、效率低,但需求又很大,供给就卡在程序员那里,所以大家一直想解决这个卡点。只是过去没有完成这个历史使命。大模型出来之后,有了更好的工具,就能做这件事。
卫诗婕
我是不是可以理解为,把代码模块化?有些重复的、大家都需要的功能,就把它模块化提供出来。这样你就不用专门为了可复制的场景雇一个程序员。
宿文
对。你会看到,有些产品擅长金融行业,因为金融行业的 IT 预算最充足;有些产品可能海外生态更好,会做得更泛一些。它有点像代码预制菜。
卫诗婕
但你还得划分这是川菜,不能说什么菜都有。
宿文
对。
卫诗婕
所以现在的无代码,跟当时的无代码有本质区别吗?
宿文
有。本质上,它重点是利用模型带来的红利,泛化它的灵活性,背后的架构也完全不一样。
你可以把它理解成预制菜,但规模化的预制菜,跟自己家里早上炒好、等中午热一下,还是不一样的。
卫诗婕
长期来看,低代码和无代码会一直存在,并且在具体场景中应用。
宿文
我觉得都会存在。技术的出现,是通过增加供给的方式激发新需求。
卫诗婕
你一直在强调“增加供给”。那具体增加什么供给?比如你去见投资人的时候,怎么跟他讲?
宿文
我们会看到,有了滴滴才有网约车,有了美团才有外卖市场。我们做代码,不是说今天抢走原来程序员定制开发的场景。
有时候“替代程序员”这个表达会让大家误解。更多时候,原本我有一个软件需求,但去咨询软件公司、开发公司或者个人兼职,可能要花几万元,我就不做了。今天我只花几块钱,烧一点 token 就能做,这样就会有一堆新的需求出来。
卫诗婕
简单理解,假设我们今天是一个开发者,要做一个 demo,或者做一个 MCP。其实我需要配齐 A、B、C、D、E 这 5 个生产资料和生产条件。
但现在有些竞品只做前端,可能 5 个生产条件里只配备了 1 个,还差 4 个。你能把整个网站端到端做出来,相当于把全部生产要素配齐。你要做的就是这件事。
宿文
对。
卫诗婕
听上去确实会有很多需求。那你的融资顺利吗?
宿文
今天我会摆事实。我做这样的产品,大家已经能够看到,甚至我可以给投资人开放内测,让他们看到我是怎么实现的。接下来的演化是一个动态调整过程。有时候那个饼也不适合画得太大,会有很多因素影响你。
但 day one 融资肯定要有一个故事。最终还是要看事情,人的能力要映射到事情上。
卫诗婕
所以你 day one 讲的是什么故事?
宿文
我 day one 讲的就是做 AutoCoder,做一个端到端 coding 产品。这件事从第一天到现在一直没变,认识我的人都知道。
卫诗婕
第一笔钱好拿吗?
宿文
还行。包括到今天,我都能找出当时那份 PPT,日期没变,里面的内容也没变。剩下的是执行和调整,方向、具体要做的事情,以及大的关键节点,一个都没变。
我们觉得,瞅准一个方向,快速把它做出来。中间是脏活累活,最后往远了一看,哇,好漂亮的一轮月亮;但往近了一看,全是板砖,一块一块的板砖。其实就是这样一个过程。
今天这个时间点已经不是一个故事。4 月 30 日我们爬了一下 Lovable 的数据,哪怕它只是做前端,帮大家做软件原型或者建站,4 月份的访问量也有 2700 多万。
卫诗婕
这是什么概念?
宿文
就是说,跟维护了大概快 20 年的 GitHub 相比,只差一个数量级。
卫诗婕
这时候我们还需要质疑它吗?管它是谁呢?
宿文
对。未来的故事是什么样,其实是一个庞大需求已经存在的事情。有了供给,需求才会释放出来。今天其实已经很明朗了,这个量很大。
第二个阶段,它会变成生态型的事情:一个软件自身的 go-to-market,另外就是它对基础云、支付以及很多通用软件分发的影响。
卫诗婕
我来见你之前读了一些 AI coding 报告。当然,那些报告可能是写给行外人看的。报告里大体有一个判断:Copilot 领域目前同质化比较严重,大家更多是在卷 benchmark。
如果 benchmark 做得比较出色,就可以优先说服更多人来试用,进而看起来形成用户或者付费护城河。但整体来讲,这个行业现在缺少 deal breaker。你同意吗?
宿文
对,是这样的。刷榜单要看具体是什么榜单。有一些产品其实是奥赛金牌型的,专门刷这项能力,是通过强化方式做的纯刷榜工作,不能验证太多泛化能力。
这就像考前刷题。大学绩点高、成绩好,并不意味着踏上社会之后,能力也能很好地泛化。
对于代码补全产品,真正的程序员用户看重的是最终效果。
卫诗婕
根据你们的介绍,你们最直接的竞品也是海外现在最火的两款应用:Lovable 和 Bolt.new。刚才这两家你都提到了。
宿文
它们其实不是竞品,只做前端。从产品形态上,它们不是我们的竞品。
有时候我们会关注它们,是因为它们的用户画像是我们想找的:不一定是专业开发者,而是更广泛的创作者和开发者。Cursor 为什么不是?因为 Cursor 的用户到我这里来,我解决不了他的问题。我不会暴露代码。
相反,尝试 Bolt.new、Lovable、Replit 的用户,我们去看他们社区里的反馈,会发现用户重叠得很精准。但从产品层面还不算竞争对手,一部分用户可能倾向于喜欢我们的产品,一部分可能还是喜欢它们。
如果只是前端、只做 UI 层的工作,它们有先发优势,就让它们先跑。不要做同质化、在泥地里打滚的事情。
卫诗婕
我们可以稍微介绍一下 Lovable。它是今年上半年最火的 AI 新秀之一,来自瑞典。你很少看到非常有名的 AI 创业公司来自北欧,大家也会觉得北欧团队应该比较 work-life balance,结果这个团队非常卷。
据 CEO 口径,他们首月付费用户的留存高达 85%,但我们也不知道是不是真的,姑且当作是真的。这个表现非常好,3 个月 ARR 就到 1700 万美元了,单月收入应该也快到 400 万美元。
宿文
它首先验证了需求,因为它的定位就是帮助普通人写编程。哪怕用户只做出一个 prototype,这也是有价值的。
卫诗婕
所以它帮你验证了需求?
宿文
对,但也不是在等别人验证。其实我们自己心里对这件事已经有一些分析,只是最终数据是它先跑出来的。
卫诗婕
它这么火、数据表现这么好,在你的预料之中吗?
宿文
超出预料。
卫诗婕
你有没有研究过,它增长这么快、付费这么好,可能有哪些事情做对了?
宿文
它的运营能力很强。用户可能关注的一些点,看起来只是小功能,但它们迭代得很快,包括最早跟 Supabase 的集成,我们觉得都做得挺好,肯定有它的强项。
它整个工程班底或者起步时间,应该比 Bolt.new 晚两个月,但事实上 Lovable 这个团队在增长上很彪悍。
卫诗婕
它们在定位上有区别吗?
宿文
我没有深度体验,我觉得可能差不多,比较同质化。
卫诗婕
你为什么没有深度体验?
宿文
因为它解决不了我的需求。我需要的是直接可用的产品。但我们可能几乎每天都会收到它们赠送的 token,也会体验一下它们的能力有没有提升。
卫诗婕
按照你自己的定位,你们是全球首款前后端一体的 AI coding 产品,对吗?虽然有人在做这件事,但目前还没有做出来。
我理解 Bolt.new 也想做类似的结果,所以你没有太多比较,因为这个方向上的对手暂时还没有交付成果。目前没看到,包括你们其实也还没有投入市场。
所以你们暂时没办法比较这个赛道上其他对手做得怎么样。但你自己做出来之后,给自己打几分?
宿文
纯粹从产品来看,应该是 9 分。满分 10 分的话,基本上核心的事情都做完了。
卫诗婕
但剩下的 1 分很重要。你没有说那 1 分不重要,那一分可能正好是要命的一分。要命的是什么?
宿文
商业化和持续迭代。
卫诗婕
我不是程序员,坦率讲,也不太能熟练使用这些 coding 工具。但最近确实聊了、试了很多 AI 产品,无论是辅助创作者的,还是辅助普通人的工具。我发现现在 AI 产品的付费势头还挺好,至少在海外,还是有一批尝鲜用户,不管多少钱。
比如 Devin,一个月 500 美元都有人付费。但留存很重要。之前有创业者跟我说,留存数据很可能连投资人都看不到,因为投资人看到之后可能会两眼一黑:大家乐于尝鲜,也乐于付费,但这种付费可能只是瞬时的假象。
宿文
对。大家说的是 web revenue,或者说“氛围增长”。
卫诗婕
但一些真正对这件事感兴趣、也在密切关注的人,要尝试就要付出成本。很多 token 最终还没有流向真正的用户,还没到真正的 C 端用户这里。
宿文
这就是为什么我们说这件事还很不稳,还有很多不确定性。当然,它也有很多魅力。
卫诗婕
所以你们产品 day one 会收费吗?
宿文
我们当然会给每个账户开通之后一些免费 token。基本上可能能完成 1 到 3 个项目,具体要看项目情况。如果还想继续使用,就需要付费。
卫诗婕
现在基本上都是这样的模式。
宿文
对,基本上都这样。最终还是要看社区反馈。如果大家觉得我们送的 token 太少、天天投诉,我们就想办法增加一些。
因为自己的模型后面可以全部切换掉,成本也比较低。做模型的商业化竞争,极致一点,大不了打成本价格战。今天如果采购别人的模型,可能就比较困难;用投资人的钱打价格战,跟用自己的模型,情况不一样。
卫诗婕
坦率说,你的产品还没有发布。刚才虽然讲了很多溢美之词,但毕竟还没有 public,接受大家的试用和审视。
我采访过很多 AI 创业者,大家在 CEO 的口径里,对自己的产品评价都很高。有业内人士评价,现在大模型产品其实是在互相卷,但卷的是某一个维度。每家公司都是 360 度里最强的那一家,我总能找到一个自己最强的角度,因为我只卷这个角度,目标就是在这个领域比别人强。
通过这种可以理解为 PR 的方式吸引用户,你的产品一定也有这样的 PR 口径和思路,对吗?
宿文
做了什么,才能 PR 什么。没做的东西不会 PR。
卫诗婕
因为你们做的是前后端一体,所以重点就是这个,也是最大的优势。
我大概可以想见,你现在一定能够做到前后端一体,否则不敢这么说。但做出来,和真正效果好、真正满足用户需求,中间可能还差一个迭代过程,对不对?
宿文
对。
卫诗婕
你预期第一波产品发布之后,尝鲜者用你的 coding 能力来做一个前后端一体的项目,项目完成度也好、具体场景也好,会是什么样?
宿文
我们目前主要聚焦 4 个场景,但率先上线的可能是其中 2 个,而且这两个场景紧密绑定。
一个是前台,也就是 landing page、网页建站这样的需求。但如果带登录功能,就会复杂很多。比如社区、贴吧,或者天猫商城的网页版,都不是纯粹的官网,它们有相应的后台,更多可以理解成大型 SaaS 型产品。
它面向的是 B 端,对 UI、交互这些可能弱一点,但对逻辑和数据一致性的要求会更强一些,完成各种 B 端业务转译。这是前两大场景。
后面还会推出 App 和 Agent 两个场景。
卫诗婕
移动端的?
宿文
对。今天还是 PC 端产品。
卫诗婕
这个很有意思。我之前听一个非技术人士、也是我的朋友发朋友圈说,今天用 AI coding 产品,很像早期没有大模型的时候手搓网页。非专业人士也可以通过模块化、拖拉拽,自己形成一个网页。
今天的“搓网页”和过去做网页有什么区别?
宿文
还是要分场景。最早的 Discuz! 这类贴吧建站,都是基于同一套方式。中国最早的低代码或者零代码建站,今天在大模型时代肯定会被满足得更好,成本更低,效率更快。
以前还有一个很重要的问题,就是只管前端,后端不搭理,这里会有一些卡点。
卫诗婕
那你为什么一定要自建模型?
宿文
涉及一个迭代问题。一方面,你正向看一定要有一个更好的模型,否则我花那么多精力、算力和时间成本做什么?
另一方面,会回到一个更初心的状态:大模型时代,很多产品问题的优化都在模型层。如果模型不在自己手里,你创造出来的内容就没法优化。
卫诗婕
但行业基本都认为,卷基础模型这件事已经翻篇了,能够上桌的已经上桌了。那你怎么保证自己做基础模型能比别人好?
宿文
DeepSeek 出来之前,一堆人以为自己已经上桌;它出来之后,很多人就下桌了。今天一样,没有人永远在桌上,取决于你有没有能力在桌上抢到一个位置。
更务实的回答是,你能不能做出更好的模型。这不是在同一个平台上卷算力和数据,而是往第二个台阶走,等新的网络结构出现,卷的是这个层次。
卫诗婕
但你没有做过基础模型,怎么保证自己做的基础模型比别人好?
宿文
炼丹有一堆实验数据。不是说我今天早上起来决定做,6 个月后就有了。又是脏活累活,又是搬砖,每天搬一块砖,看它长什么样,最后能不能建成万里长城。所有研究都是一步一步做出来的,靠线上实验跑出来。
卫诗婕
所以你的基础模型,在 coding 项目里扮演什么角色?它提供什么能力?你训练的基础模型是什么样的?
宿文
还是沿着 MoE 往后迭代,后面有 MMoE、CGC、PLE,甚至还会有更新的结构。它带来的能力,是在模型架构层面更高效地学习知识,解决一些幻觉问题,包括把我们产品专用的样板训练进去,让模型更高效地学进去。
自己有模型的好处,是能形成数据飞轮。今天有一堆数据,靠微调,其实很多飞轮转不起来。如果这个飞轮能转起来,市场就不会只是今天这个状态。
卫诗婕
那你的模型给它喂的数据是什么?
宿文
训练模型整体大的配比和方向,大家都差不多,没有人有特别独特的配方。有些特殊数据我们不用,比如专门做安全的数据,我们可能不会涉及。
剩下的,我们会重点关注自己的产品代码,包括产品优化,以及未来跟其他软件生态、其他工具的打通。有些数据可能直接训练进去,也可能通过调用的方式接入。
卫诗婕
我的理解是,你肯定不只是做泛化能力,重心也不是做泛化,而是让你的基础模型在要做的事情上提供最好的通用能力,对吗?
宿文
对。好的模型是一强俱强,只是说今天要把泛化能力变成卖 token 的商业模式,我们不太想做,而且这个时间点可能也不对。
卫诗婕
你只训练自己用的?
宿文
对,我只往自己的方向优化。未来这个模型一定会是一个很强的模型,但今天不着急。
卫诗婕
你之前提到过一个观点,让模型写好代码这件事情,跟实现 AGI 的进程在某种程度上是相挂钩的,或者说它是 AGI 的一个小闭环,可能是率先能够造出来的。
宿文
对,逻辑是这样的:整个模型出口内容的承载,其实是代码。
AI coding 这件事,是让整个大模型形成一个完整闭环,它能够承接很多泛化场景。假设我们做通用 agent,每一次生成的结果,大部分最终可能都是网页。但网页还缺很多东西,闭环在哪里?
Agent 的闭环,至少要把代码端到端完成。
卫诗婕
我的理解是,让 AI 写好代码,应该是实现 AGI 沿途下的第一个蛋。
宿文
对。可能这是通往 AGI 比较高效的一条路。其实很多人都这么讲,但现在下结论还为时尚早,没必要着急。先提供一个能够解决问题的产品。
卫诗婕
你之前还讲过一个观点,说目前模型的发展和代码应用的进程有点异步,这怎么理解?
宿文
就是刚才讲的,基础模型没有提供匹配的供给,大家的频率对不上。相当于你要基于它构建产品和应用,但它跟你不匹配。
它是按照修高速公路的方式打地基,而你是按照修高楼大厦的方式做产品,所以就会出现问题。
卫诗婕
现在底层基础模型技术,确实每隔半年,甚至每个季度,就会出现一次特别大的迭代。不管它的发展方向是不是按照 coding 所需要的能力去发展,底层就是一直在飞跃。
那在上面建筑应用的 AI 创业者,该怎么思考?
宿文
这是大家共同面对的问题。首先,模型提升的是整体能力,最终只是使用过程会单向优化。不管你做 coding、聊天、搜索,还是其他事情,都会受到影响。
但如果完全依赖基础模型,寄希望于基础模型一代代提升,比如从 Claude 3.5 到 3.7,调整方向就会不一样。你会发现,有些产品 3.7 出来之后,为什么还主要调用 3.5?不只是成本问题,而是人家调出来的效果,用 3.7 反而丢失了一部分。
这就体现了,大厂自己的基础模型,和离基础模型最近的 AI 应用之间,会有协同效应。它可以有的放矢,选择从哪些维度更多地去卷基础模型能力。
卫诗婕
那对于这些创业公司来说,岂不是要看天吃饭?
宿文
商业生态里会有各种细分方向,人家的思路不是这么小家子气的。有的想做生态,有的想做基础设施,有的希望大家一起繁荣。健康的商业就应该是这样。
随着供给越来越多,也会出现很多方向,不会永远纠结于同质化竞争。这有时候是中国一些大厂的思路,但我觉得整个 global 市场不是这么思考问题的。
卫诗婕
今天聊下来,我还是对你们的目标付费用户有一点模糊。你刚才说了 4 大类,可能其中 2 大类场景会最先 target。那更具体一点,使用你们产品的会是创业者居多,还是独立开发者居多?
虽然你的产品理论上普通人也能用,但我暂时找不到普通人使用它、并且愿意付费的刚需。
宿文
其实它还真不是面向普通人。我们看到的这类用户,因为创业者和独立开发者有时候会重叠,但从用户画像来看,他们是软件真正的需求方。
他们在通用市场里没有找到,或者通用市场不能满足他们的需求,一定要开发这个软件;或者说,如果开发成本在可接受范围内,就会出现一大批这样的需求。
你想想,光建站这件事就承载了几家数百亿美元的公司,还有一堆小公司。包括 Lovable 已经暴露出来的很多场景,这只是很小、很窄的一个方向,却承载了几家大公司。
当然它们切入点不一样,沉淀了很多年,也各自有能力点。我们切进去,也会有自己的能力点,就是短平快的业务翻译。
卫诗婕
所以你不会指望有人在你的产品上生成一个抖音或微信,因为没有必要。
宿文
对。
卫诗婕
但为什么不能在你的产品上长出抖音?抖音在成为抖音之前,也只是一个小项目。
宿文
抖音的能力不在于有没有代码,而在于整体各方面的能力。如果用我们的产品,更多可能是做一个单点产品,也可能是早期产品。
未来可能有一个产品,最开始的 MVP,或者 PMF 之前跑的点,可以用我们的产品做出来。后面再支撑它持续迭代就好。
卫诗婕
所以现在对你来说,会迫切需要商业化吗?
宿文
需要验证。产品到了内测阶段,再去公测,肯定要有用户反馈进来。刚才那个 9 分,我们也可以打低一点,打到 7 分,剩下的 1 到 3 分怎么弥补,要让用户告诉我们。自己闭门造车,意义不大了。
卫诗婕
那你具体会怎么找用户?
宿文
首先我们肯定推全球市场。目前已经做了很多工作,核心就是两件事:一个是 inbound marketing,也就是内容;另一个是 SEO。
细分下去,工作量非常大,但看起来又是一块一块的搬砖。最开始每个渠道都已经被中国人和印度人刷坏了,比如 Product Hunt、Hacker News,还有二三十个类似的工具。我们会一个一个去做内容供给,包括已经触达一些 KOL 去带货,做社区,做很多 use case,进行内容引导,做全渠道营销。
卫诗婕
更深一步的问题是,AI coding,包括你现在做的事情,某种程度上也是一种技术平权。它带来的整个生产力重塑,会是什么样?
宿文
我们觉得现在还没有到生产力重塑的阶段,只是在增加供给、释放需求。但 3 到 5 年内,在我们切入的场景里,它会变成一个 infra。
大家会认为,代码这件事只要调算力就能完成。本质上,以前是人来写代码,今天变成 token 就可以。
卫诗婕
它具体在商业世界里,会带来什么样的生产力和生产关系?
宿文
以后大家不再受限于代码供给,也不再受限于程序员。
简单来说,如果是一家大公司,比如世界 500 强中的某个部门,自己没有配程序员,以前可能要求助于中台;以后自己就能搞定一些事情。
如果是独立开发者,就可以以更低成本、更高效率去做一个 MCP,或者做一个 demo。当然,也可以做成熟的商业化产品,再一步步迭代。
卫诗婕
你们现在是实现了编程零门槛,对吧?
宿文
技术上实现了。
卫诗婕
效果上呢?
宿文
效果上也实现了。剩下的确实会涉及产品打磨,比如交互可能还不够好。
卫诗婕
也不能说很烂,不然同事听了会不开心。
宿文
对,还需要优化。工程上还有很多点要完善,但这些都不是卡点,不是我迈不过去的事情,都是基于过去经验可以复刻的事情。
卫诗婕
这也是我刚才跟你们讲的,大部分创业者至少在 CEO 的口径里,对自己的产品都充满信心。但真正开放测试之后,可能还是会收到一系列吐槽。
我的理解是,今天 AI 创业者需要的就是先发效应,然后让用户反馈帮助自己快速迭代。这里面有一个假设:你这样做,用户反馈真的能帮助你迭代吗?
宿文
不能吗?有谁不能?你看今天有谁迭代出来了?你想想有没有真正迭代出来的?
刚才说的很多问题,源头其实是基础模型能力,或者你对模型的把控能力、对模型位置的摆放,这些都是大问题。
卫诗婕
那你怎么解决?你有信心一定能迭代出来?
宿文
首先我们自己训练模型,要能碰到它的 pre-train,从基础模型训练层面开始解决。这个闭环明显缺这一环,肯定感觉不对。
卫诗婕
如果别人的基础模型做得比你好怎么办?
宿文
那就比我好呗,很好。我也可以用它,用它的模型。我手里有每个节点的微调数据。
卫诗婕
产品上线之后,你最期待什么反馈?
宿文
真正的反馈不一定是用户口头表达出来的,而是埋点数据表达出来的。看跳出率等数据。有时候用户提出的需求不一定是真实需求,还要做很多分析。
卫诗婕
用户给你掏多少钱,才算帮助你完成第一轮闭环?
宿文
不太是钱的问题,而是它生成的软件要能够部署,说明内容真正达到了用户想要的结果。
卫诗婕
软件的出口是“玩”它吗?还是有单机版之类的?
宿文
我觉得出口还是使用它。也就是说,用户用我们的产品生成的软件,真正可以面向用户。
那个产品从我这里拿走之后要部署,放到服务器上,就像今天访问一个网站,网站是部署好的。
卫诗婕
那我问一个外行问题,你怎么观察到它部署了?
宿文
很简单,我们有一个 deploy 按钮,会把部署这件事跟云厂合作好,整个过程都是可追踪的。
卫诗婕
所以产品上已经埋好了这个追踪点?
宿文
对。用户点了部署,最后部署的每一个环节,我们跟云厂合作的那些节点都能看到。包括后续维护。大家使用软件,最主要的事情就是改需求、升级、增加一些功能,还会回来继续修改。
卫诗婕
明白了。就像你买了一部 iPhone,拆封之后不能直接用,还要激活;激活之后才真正可以使用。
因为你自己也是投资人,在融资过程中遇到的投资人,有没有什么他们没有问、但其实应该问的问题?
宿文
我觉得问题已经足够多了。但更多时候,大家今天面对的,还是对这件事的认知。
以前市场好的时候,没有这么多卡点,我们投资一个赛道,会去选全球最好的团队。大不了投全球最好的团队,大家都能交流。
但今天会发现,Cursor 这样的产品在硅谷、在海外先行时,大家失去了交流的机会,也失去了主动了解、体验它的机会。这是很难的一件事。
我觉得大家还是没有跟创业者、跟最好的团队保持同步。
卫诗婕
失去交流的机会,具体怎么理解?今天哪个投资人真正跟 OpenAI 的核心团队交流过?是因为现在逆全球化吗?过去可以吗?
宿文
过去基本上可以。军工等特别敏感的行业肯定不行。比如自动驾驶,我要投国内,但全球最好的团队基本都能交流到,包括特斯拉的核心工程师为什么选择这个方案,也都能交流到,以色列的团队也能交流。
卫诗婕
对。
宿文
但今天可能连飞机都没法降落,就会有这样一堆问题。
回到大模型,有谁真正跟 Anthropic 的老板或核心团队交流过深层次的问题?没有。甚至可能连他们在 blog 上或者访谈里发布的一手信息,大家都没有持续看。我们碰到的人,很多是在看记者转了很多道的信息。
卫诗婕
你觉得这是现在中美科技竞争的大环境,带来的最明显的改变吗?
宿文
对,很多层次都不太好展开讨论。
卫诗婕
那你个人有办法补足这些信息吗?
宿文
没办法。市场是什么样,我们就接受它、适应它。