李杨
一开始的时候,大家的普遍感受是:我要找 AI native 的机会,我要找 Super App 的机会。两年过去了,大家逐渐发现,可能这个变革没有那么快,那么一蹴而就。
卫诗婕
去年感觉没有听到快手在做大模型这件事情,今年突然爆发了。
李杨
可灵 AI 推理此刻也是一个很昂贵的业务。如果我们像传统互联网那样去探索,我们连回血的机会都没有,可能就被干废了。
樊家睿
互联网大厂有自己天然的一些流量优势,不过创业公司基于技术上的认知,对于产品最终形态的一个预判,未来在价值链上也会吃到很厚的一块。
李子玄
豆包确实太强了,这一点毋庸置疑。但是,人还有 J 人、P 人、F 人、T 人。可能豆包将来代表着我对于某一类最大体量用户的需求满足,但不代表其他的就没有市场空间了。
樊家睿
从多模态生成大模型开始,国产自研团队的技术演进历程不再是对标彼岸了,都是源于此岸而非彼岸了。2024 年的时候,围绕多模态有了认知和预判;2025 年,它可能会产生高效和通用,在未来内容交互、内容消费上,可能会出现像黑天鹅一样的机会。
卫诗婕
哈喽,大家好,欢迎来到商业漫谈,我是诗洁。这是 2025 年的第一期节目,内容还是有关大模型这股技术浪潮。生成式 AI 这项未来可能从根本上改变我们的生产、消费方式的技术,在 2024 年到底经历了怎样的探索和实践?2025 年又会有哪些发展趋势?
我相信,这个议题仍将会是 2025 年中国乃至全球科技商业领域里最重要的叙事之一。本期节目邀请到的3位嘉宾分别来自3家大模型领军企业:来自快手、做出了去年爆火的可灵 AI 的负责人李阳;全球范围内继 Sora 之后第一家发布长视频生成模型 Vidu 的生数科技投融资负责人樊家睿;以及来自智谱科技的战略总监李子玄。
本期节目录制于 2024 年 12 月 AI 产品榜大会现场。我是本场的主持人卫诗婕,今天这个场子非常热闹。我还有一位搭档主持张海庚老师,他有一个公众号叫“张无常”,长期关注 AI 前沿信息。
之所以今天会有两位主持人,主要是想让我们这个圆桌更有干货。我将从商业进程和行业的角度更多地去提问,海庚会更多地从产品的角度提问。接下来,就把时间交给台上的3位嘉宾,分别介绍一下自己所在的公司和自己的身份。先从智谱的李总开始。
李子玄
大家好,我是智谱 AI 的李子玄,现在负责智谱 To C 这边的产品战略和生态。其实在座的好多位都认识我,谢谢大家。
樊家睿
大家下午好,我是生数科技的投融资负责人樊家睿,今天代表生数科技。生数科技是全世界范围内多模态生成大模型起步最早、研究最深的团队,非常荣幸和大家共同探讨从模型到 AI 应用的讨论,谢谢。
李杨
大家好,我是来自快手大模型团队的李阳。目前我主要负责整体的可灵 AI 产品和运营,同时也负责快手大模型在快手内部的落地应用。
很高兴今天能在这个场合跟大家一起探讨可灵 AI 的一些落地经验,也包括大模型在快手内部应用的一些情况。
卫诗婕
今天在座的都是行业里面非常头部的从业者。我在 2023 年的时候是一家科技媒体的总编,所以当时和我的同事们用一整年的时间关注国内大模型创业的进程,可以说当时是非常热情高涨。
但是从 2023 年进入 2024 年,我自己也观察到了两个趋势。第一个,我感受到从 2023 年开始,大模型非常火热的这种热情逐渐进入了一个冷静期,而且从卷基础模型本身进入到了卷应用的趋势。第二个趋势也很明显,能够感受到在技术层面,多模态方面的探索成为一个比较主流的趋势和声音。
不知道在座各位怎么看?接下来我提出第一个问题:如果只用一个或者多个关键词来总结 2024 年,各位觉得会是什么?要不我们还是先从李总开始。
李子玄
我给一个稍微抽象一点的词,我觉得是“以终为始”。我也顺便分享一下我做产品的一些思路,因为一家公司做产品,最重要的还是怎么确定目标和指标。
当然也有一个定律:当你的目标成为指标的时候,可能这个目标本身就不重要了。所以无论做硬件还是软件,其实还是要明白怎么让团队为了一个方向去努力。包括卫老师说到我们在卷应用,那你往哪里卷?是哪一个数字让你往上冲?
我举一个例子,叫 Perplexity。它的目标就是我每天的搜索量到底有多大。在上个月的一次访谈里,它的增长负责人提到了它的指标体系,包括6个月的留存率是45%。它要向多邻国学习,因为多邻国6个月的留存率已经达到50%了。
第二个,它想让用户在第一次对话里的搜索次数尽可能多,这其实也体现了它对于用户心智或者体验感的刻画。所以我觉得“以终为始”的意思就是,我们现在的从业人员,可能从 2023 年大家去卷 benchmark、非常单一地去卷,到 2024 年甚至 2025 年,要去定一个更加偏落地、更加有方向感的卷法。这种目标,可能是今年比较大的变化。
卫诗婕
谢谢。樊总,你们是怎么看从 2023 年到 2024 年这个进程的?
樊家睿
我们认为最关键的一个词当然就是“多模态”了,而且在多模态基础之上衍生出了另外两个词,就是“认知”和“预判”。
为什么是这3个词?其实我们能很欣喜地观测到,从多模态生成大模型开始,所有国产自研团队的技术演进历程不再是对标彼岸了。不再是美国那边有什么技术突破,我们就要跟随,更多的是能够看到国产自研团队主动站出来,引领世界范围内多模态行业的发展进程。
从一致性到速度,从7月份的面部一致性到主体一致性,再到多主体一致性,再到现在全世界范围内最快的生成速度,都是源于此岸而非彼岸。这是非常欣喜的一个改变。
为什么是“认知”和“预判”?因为多模态大模型本身技术门槛更高,也更加复杂。能够在多模态大模型的发展之中,对行业的真实需求有精准的认知,并且能够对于技术的演进和发展方向有前瞻性的预判,成为现在国产自研视频生成团队能够屹立于世界之巅的一个基础。
卫诗婕
其实是我们国内的主体性增强了,对吧?我们慢慢找到自己的节奏了。
樊家睿
对,而且技术上也确实更为领先。
卫诗婕
好,那请李老师来说一说您的视角。
李杨
我刚刚想了一下,如果用一个关键词来总结 2024 年,我觉得我的关键词是“回归理性”。
我觉得有两个视角。第一个视角是从技术层面上看,其实从去年大家在卷 language model、卷 size,不断去探索 scaling law 的边界,大家去卷一些 benchmark。今年我们看到的两个趋势,一个就是大家说的多模态,包括我们本身视觉模型的一些迭代和演进。
我们发现,视觉生成方向的迭代和演进,和去年同期语言模型的迭代节奏相比,速度更快,发展也更快。为什么从 language model 到多模态?其实还是从真正的应用角度出发,去推动技术发展。我们也看到语言模型在往深度推理的方向迭代,这两个其实都是比较理性地去看待模型最终会为应用产生什么价值。
另外一个是在产品方面的回归理性。前年 ChatGPT 出来之后,一开始大家的普遍感受是:我要找 AI native 的机会,我要找 Super App 的机会。两年过去了,大家逐渐回归理性,发现可能这个变革没有那么快、那么大、那么一蹴而就地来到我们身边。
我们看到的一些友商也好、创业公司也好,在产品应用上其实也更加理性了。更理性地回归本身的用户价值和商业价值,不再一味地去卷所谓的新需求,更多的是开始聚焦到老需求里面去找新机会。我觉得这是一个很理性的信号。
卫诗婕
感觉 2023 年的时候,我们看到一座很高的山,想着如何从现在的起点一下子飞到那座高山。但是今天大家可能在探索,也许中间有几级台阶,我们可以一步一步先往那个方向走,就有这样一种感觉。
张海庚
刚刚我们从比较宏观的角度,用关键词概括了过去一年。接下来我想请问各位嘉宾,在过去一年,或者说最近,大家各自在应用端发现了什么样的场景?
李子玄
我现在主要负责的,一个是智谱清言,相当于比较巨无霸型的聊天机器人;另一个是 AutoGLM。我就各举一个例子。
比如智谱清言,我们最新上线的一个划时代功能就是视频通话。你能看到外面的景象,AI 可以把这个景象读出来,然后跟人互动。但是坦白讲,我认为这个场景其实还处于从 0 到 1 的阶段,我们并没有完全定义什么样的人一定会用,以及大模型究竟能解决他的什么需求。
比如做题或者练英语,我们发现用户确实存在这样的需求,但这个需求还没有被完全定义。所以我认为,我们现在做的很多事情,还是偏从 0 到 1 的场景探索。
以 AutoGLM 为例,它能够做的一件事情,而且是在宣传片里展示过的事情,就是点外卖。但是点外卖这种场景其实非常模糊:什么人点什么样的外卖?
可能有一个人每次只吃和合谷的宫保鸡丁,他觉得只要点到这个东西就可以。也有人可能需要30分钟的时间去逛,进一个奶茶店,发现还有零卡糖。如果 AutoGLM 没有帮我点到零卡糖,我可能会觉得你这个东西太不了解我了。
所以这些场景,我们可能只是从比较大的面上发现了它们,但还没有聚焦到真正能够解决用户痛点的场景。我们其实也做了一些尝试。
第一,内部团队必须要有足够的 sense。你必须把整个用户故事画出来,以及它的替代解决方案。你得保证,即使现在产品还不够好,它的终极解决方案也要比替代解决方案更好。
第二,我们也会走进用户,跟更多 KOL 交流。KOL 代表的不仅是他自己的观察,可能还代表更多人的观察。我们也会做一些更偏下沉的调研。
我们所在的环境离清华很近,但也要走出去看看:如果一个人不用苹果手机、不用 Mac,甚至不知道 Chrome 是什么,他们是怎么想这些东西的?我觉得这是我们现在正在做的一些观察。
张海庚
作为产品经理,我刚刚对那一段很有感触。其实任何一个技术,无论是大模型还是之前的移动互联网,最后都要走到用户的最后一公里,满足用户真正的需求,以及用合适的方式去满足。
这个过程并不像我们在技术浪潮早期想象的那么浪漫、那么美好,里面其实有大量的 dirty work,需要非常细地去做推敲。我也想听听生数科技这边的一些经验。
樊家睿
互联网的普及也是有一个过程的。最初可能是一小撮人去接触,包括触屏手机。大家的共性需求可能是一样的,比如加强信息交互、加强移动端的信息传输,但是它最后落成的产品形态,是之前的市场需求无法覆盖的。
我非常同意新的需求是从老场景里面来的。不过我们看到,现在行业里有3类新需求和老场景之间的关系。
第一类,是老场景下爆发的新需求远超我们的想象。它能够和 AI 技术更深入地结合,所诞生的想象力更大。比如大家在流量平台上能看到的一些已经把 AI 技术玩起来的用法,就是传统技术做不到的。
第二类,新的需求和老场景比较契合,但是两者未来的发展趋势会有所不同。比如特定风格和细节下的一些场景,假设是游戏、动漫,如果能够做到实时交互,以及一系列内容生成之后,它会和传统形态不太一样。不过现阶段的 AI 技术还不能完全覆盖这部分场景需求。
第三类,是现在新的需求可能还小于老场景。因为老场景对于真实性、可控性的要求更高,比如短剧、影视。但是这并不排除在未来一段时间内,随着基础模型技术迭代和演进,它能够创造出更大的新需求,超脱原来老场景的束缚。
这就是我们看到的3类场景。
张海庚
谢谢樊总的分享。去年我也和生数科技有过交流,发现你们在一些垂直细分领域,一直想深入解决现有场景中的问题,所以也期待生数科技在细分场景里擦出更多火花。待会儿我们再多聊一些。
接下来请李老师聊聊快手。快手也是大家特别关注的一家公司。
李杨
我其实很想跟大家分享一下快手做 AI 的一个整体思路。
从去年年初开始,我们明确了大模型战略,包括研发和应用战略。从那个时间开始,我们一直走的是一条比较务实的道路。这个务实可能给大家的感受是:去年感觉没有听到快手在做大模型,今年年终却突然爆发出了可灵 AI,吸引了很多国内、全球用户和媒体的关注。
其实从去年年初开始,我们就投入了多种模型的研发。除了语言模型,我们也做音频、图像,包括大家可能知道的文生图模型可图,以及 TTS 大模型能力。
我们给自己定的目标,一个是在训练上做 from scratch 的训练,不拿开源模型做二次训练。很多公司不太了解的时候会来问,快手是不是基于其他模型做了二次训练。实际上,第一个,我们是真正从零开始做训练。
第二个是在应用上,我们比较明确,会先聚焦快手内部的业务场景。我们给自己定的应用方向是“升级理解、做好互动、探索生成”。
这3个大的应用战略分别对应快手非常重要的几个场景。第一个是“升级理解”。快手作为全球头部的短视频和直播平台,有大量的视频、直播以及用户评论数据。这些数据如何被大模型更好地理解,并帮助推荐系统更好地覆盖这些信息、推荐给相应的用户,是我们这一段时间实践的重点。
我们已经拿到了很多收益,包括整个平台的治理,也包括推荐的精准性。
另外一个方向叫“做好互动”。互动对于社区来说很重要,但快手是内容社区和用户社区,我们会非常强调真实感。我们不会引入一个机器人,让大家天天和机器人互动,所以做得比较克制。
第一个尝试是在评论区引入 AI 小快。AI 小快更重要的定位,是帮助用户回答和拓展视频以外的信息。在这个定位之下,使用门槛其实挺高:用户需要在评论区 @AI 小快,问它问题,它才能回答。
在这样非常克制的做法下,我们也看到 AI 小快在快手站内非常受年轻用户喜爱。目前 MAU 已经达到千万级别。这其实是一个比较克制的状态,我们没有做特别丰富的功能拓展,还是要保持整个社区内部的健康度。
第三个方向是“探索生成”。这方面比较典型的代表案例,是在商业化广告素材场景上的落地。我们通过大语言模型加数字人直播能力,截至目前的最新数据,每天给快手的广告消耗带来3000万元,而且这是均值。
这也是我们想寻找比较聚焦的业务应用点,去撬动 AI 商业价值的方式。
另外,我想跟大家分享一下可灵 AI。可灵 AI 从今年年初发布,到6月6日快手正式发布,再到现在,大家的感受可能是:这是一个非常卷的团队和公司。我们基本上每周发布一个版本。
发布之前,客观来说,我们没有预想到会有这么大的影响力、这么多的用户和场景。但发布之后,我们有两个原则,一个是 learning from users,一个是 learning from acting。
第一个,是快速从用户反馈中学习我们要做什么能力、什么工具。第二个,是快速迭代。这个迭代不是无脑地每周发一个版本,而是通过和用户快速交流,了解用户想要什么能力,然后在版本中快速实验和验证,再不断反哺模型。
我们会借此明确哪个功能的优先级更高、应该怎样做、功能更适合哪个场景,以及这个场景的痛点是什么。
在这样的反复过程中,可灵 AI 从7月份到现在也就5个月的时间,已经迭代了近20次。这是一个很夸张的数字。我的感受是,国内大多数大模型公司可能都做不到这么快的迭代速度,所以我觉得我们是一个比较敏捷的 AI 产品。
卫诗婕
谢谢李老师。不过我不准备让你休息,因为我准备接着你的话问下一个问题。
最近一级市场有一个很热议的话题,或者说出现了一种新的声音。大模型浪潮来临之后,我们一直非常期待能有一个面向 C 端的 Super App。去年大家也开始思考,这样的机会最终会花落大厂,还是出现在新生代、原生于大模型的创业公司当中。
这件事情到现在还留有悬念。因为今天在场的圆桌上,只有快手一家可以代表大厂。那就请快手先来讲一讲:面对这样一个新的技术浪潮,作为一家大厂,你们是怎么思考的?有哪些优势和挑战?
李杨
这个问题问出来,好像大厂代表了相对饱和式的投入,但动作又没有那么快,可能在应用层面没有那么敏捷。
张海庚
我没有这么说。
李杨
但就我自己的感受,包括和友商交流下来,在这个阶段,大厂和创业公司在团队上不会有那么明确的组织分界线。
卫诗婕
我聚焦一个问题。因为我也在大厂、在字节跳动工作过,我想象当中可能会有组织和协作上的损耗,包括公司对于这件事情的决心,以及内部在这件事情上的优先级。这是不是一个决定性要素?
李杨
坦率来说,肯定是的。不管在大厂还是小公司,大厂确实在组织上跨部门协同和多角色协同的难度会更高,非常考验组织的韧性和聚焦能力。
在这方面,我们当时做了两件事情。第一,把目标聚焦在唯一性上。在一个阶段,我们明确 focus 什么事情、交付什么结果。
第二,在协同上如何把跨部门资源整合起来。不管是底层资源,还是公司其他横向团队,如何让大家目标更一致地配合,如何在更多场合和目标上对齐,这些都是我们在组织上做的工作。
这些问题在创业公司当中可能不太会出现,因为大家比较扁平,可以比较一致地推进事情。
卫诗婕
内部的决心有什么体现吗?
李杨
举个例子,就拿可灵 AI 来说。在 Sora 发布之前,我们从去年年底就开始投入做视频生成了。
Sora 给我们的一个启示,是快速切换到 DiT 架构上,快速拿到结果。坦率地说,从去年年底开始做这个项目时,大家的态度是中性偏悲观的。我们当时预计,真正做到视频生成可用,可能需要一年,而一年都是一个乐观的数字。
当时内部也做了很多讨论,但我们还是坚定地把这个方向作为聚焦方向。视频生成本身比较耗算力、耗数据,我们倾斜了资源去做这件事情,本身就体现了我们想在视觉模型和多模态模型上取得突破。
这背后有一个非常关键的点:我们本身做的是短视频和直播业务,对这个场景的数据、内容以及应用趋势,会有自己独特的判断。不管是对快手内部,还是对外部产品,这些判断都帮助我们更坚定地做这件事情。
张海庚
我问一个比较直接、但有一点尖锐的问题。在短视频时代,我所看到的快手在某些阶段可能有一些被动的状态。我很想知道,大模型来临之后,快手有没有重新找到这种士气和热情?
李杨
可灵 AI 出来之后,整个公司应该是沸腾了,包括投资人和市场上的反馈都比较好,大家也应该能够感受到。
坦率地说,短视频业务真的很卷。我们的竞争对手也在进行非常饱和式的投入,非常有经验,而且在这个领域的市占率也非常高,加上视频号增长得很快。客观来说,我们在业务上面临着很大的压力。
从公司的视角看,我们要回答的问题是,怎么样用好 AI。我们希望 AI 能够帮助公司的主要业务和主要场景弯道超车,可能在一些小场景、细分场景上做到行业最优。
另外一个方向,是帮助公司布局一些高价值的 AI 应用。可灵 AI 就是一个代表,我们也在孵化其他产品,只是目前在大家视野当中的,主要还是可灵 AI。
所以这方面我们是两条腿走路。一方面,把公司内部的业务价值做出来,聚焦在一些细分点上;另一方面,我们可能处于一边爬山、一边航海的阶段。在这个过程中,慢慢找到自己的目标,找到对外产品和创新产品的赛道。这两件事情都很重要。
张海庚
你最后提到“一边爬山、一边航海”,对我也挺有启发。我在刚开始关注生成式 AI 的时候,有一个观点:在 LLM 的大航海时代,旧的经验可能会变成包袱,需要用新的东西去考虑问题。
比如传统移动互联网 App 的思维,在新的技术浪潮下可能会局限很多思路。所以我一直觉得,一方面要利用过去的经验,另一方面又不能被这些经验局限,这是非常重要的一点。
你刚刚提到快手在可灵 AI 上的实践,我觉得这是去年的一个标志性事件。大家都熟知《创新者的窘境》这本书,会说大厂可能有各种各样的问题,大象没法跳舞。但我觉得可灵 AI 完美地展现了:快手作为一头大象,其实也是有可能跳舞的。
如果现在让你复盘,这头大象跳起舞来,最重要的一个点是什么?是刚刚提到的战略聚焦吗?如果这是一个集中的点,我还想继续追问:在产品、产品战略或者具体方向上,你觉得哪些点比较关键?
李杨
首先,我觉得战略一定是任何团队或者任何产品能够走进大家视野、获得阶段性收获和成功的关键点。这是一个非常重要的贡献。
另外我特别想说的是组织。我自己的直观感受是,我们这个团队的战斗力非常强。这种战斗力表现在刚才提到的一系列迭代数字上,而且我们也拿到了结果。
可灵 AI 前段时间公布财报时,我们的用户已经达到500万,同时首月营收流水就突破了1000万元。这给了我们很多正向激励。
至于产品上做对了什么,我觉得第一个点,还是明确产品在当前旧的产业链当中的定位。目前我们的工具比较聚焦于素材。以前做一个视频,可能要去实拍,或者去版权库购买素材;今天,可灵 AI 的生成能力能够帮你解决一部分问题。
此刻模型可能还不够完美,但我们已经找到了切入点。接下来就是技术不断提升,同时产品不断做好渗透和应用。
还有两个决策做得比较对。一个是快速商业化,我们从正式开放开始就进行商业化。身边很多朋友会问我,是不是太着急了,为什么一开始不免费让大家用一用,就开始收费?
当时我的判断有两个。第一,大模型的训练和推理,尤其是训练,大家大概都知道成本。即便是推理,此刻也是一个很昂贵的业务。如果我们像传统互联网那样去探索,连回血的机会都没有,可能就被干废了。
另外,这个场景有没有价值,是不是值得持续投入,商业化是验证 PMF 最好的方式。它可以很快帮助我们判断,这件事情应该怎么投入。
也正是基于这个判断,我做了第二个决策,就是出海。我们做海外产品,而事实也印证了,海外产品对于我们的目标和营收,都带来了非常正向的反馈。
张海庚
可灵 AI 在海外的口碑应该相当好。你刚刚说商业化是一个非常重要的决策,让我想到李总刚才提到的“以终为始”。
做产品要面向最终用户去做模型和产品,但如果从完整生命周期去看,可能还需要从最终商业闭环的角度来审视。这个角度也会对产品方案的设计提供很大指导。
接下来我想问创业公司的代表。最近我在一级市场听到一种比较悲观的声音:大家会觉得,Super App 或者生成式 AI 的机遇最终从哪里长出来,创业公司可能很难跟大厂匹敌。
这里面有几层因素。第一,从 2023 年到 2024 年,我们确实看到了一些大厂在这件事情上的坚决投入和决心,比如快手、字节和阿里。一方面,大厂在这件事情上的认真程度和投入决心超出了很多人的预期;另一方面,如果要做一个应用,今天去拉新、做增长,一定绕不开投流量。
但大厂手里掌握着流量,而流量成本现在也非常昂贵。第二,大厂的口袋非常深。虽然我们也看到国内很多大模型创业公司融到了惊人的金额,但按照过去的经验,大家确实会担心:也许新的内容、新的机遇从创业公司中生长出来了,却立刻被大厂收割。
所以接下来的时间留给樊总和李总,你们谁先来?
樊家睿
我先来。大厂天然的流量优势,以及它作为大模型市场上最有力的竞争者,这是毋庸置疑的。刚刚李总也提到,之前可能存在路线不收敛的问题。
创业公司,比如 Sora 所采用的底层多模态生成架构 Diffusion Transformer,是一种融合架构,在一定程度上推翻了 2023 年以来“Transformer 能够压缩一切”的说法和技术路线。
大家可能有所不知,Vidu 背后的团队早在 2022 年,甚至更早的时候,就一直坚持使用 Diffusion Transformer 这样的融合架构。2022 年 9 月,我们领先全世界首发了这一融合架构的论文,早于 Sora 团队的 DiT。
我们并不是因为市场上的声音觉得今天该做语言模型、明天该做视频生成、后天该做多模态,才选择做这件事情。就像刚才李总提到的“以终为始”,我们一直以来的目标,都是希望做一个简洁、高效、通用的多模态大模型底座。
基于这个目标,我们一直坚持自己的路线,并不会因为 Sora 或其他团队提出了不同的技术路线,就在战略上改变方向。
现在虽然是多模态爆发的一年,但我们认为多模态还处于初期阶段。因为现在我们去看所有的多模态,貌似都是模态的叠加:有了文本,在此基础之上做一个视频;有了视频,在此基础上做一个音频。它背后可能只是两套模型参数的简单融合,号称多模态,但并不是真正意义上的通用多模态。
文字作为降维,视觉作为升维,是最接近人类感受真实物理世界的方式。所以我们希望做到的通用多模态底座,不需要进行模态叠加,可以作为任意模态的输入和输出。
基于对技术的前瞻性认知和预判,加上我们和用户、和高优先级行业的紧密结合所产生的技术回流、价值回流,以及全公司围绕多模态技术演进路线展开的所有业务,我们认为,在这个过程中积累的用户群体、创作者群体,以及“模型边界决定产品边界”这样的理解,会让我们更加理解模型边界,并且走在最前面去突破模型边界。
总结来说,互联网大厂有自己天然的流量优势。不过,创业公司基于对技术的认知、对产品未来最终形态的预判,结合技术、用户和市场,以用户为先、以技术领先、以产品领跑,去深耕这个市场。未来我们在价值链上也会吃到很厚的一块。
张海庚
谢谢主持人。学到了,我也挺认同的。
李子玄
我先从产品形态,也就是 AI chatbot 说起,因为这肯定是国内目前市场渗透率最高的一种产品形态。
之前也可以从李帮主的图表看出来,首先豆包确实太强了,这一点毋庸置疑。但是我们的观察是,豆包的用户和 Kimi 的用户,在定位上已经有一些不同。
之所以大家一直在卷,留存率又很像,是因为今天的主题是“从模型到 AI 应用”,而大部分 AI 应用只是在调模型,并没有真正把个性化和差异化做出来。
包括我们自己去看智谱清言的时候,也会发现,实际上我们就是用智谱清言去搜索它,但搜索结果和用户真正想要的东西并不完全一样。
人还有 J 人、P 人、F 人、T 人。所以可能豆包将来代表着对某一类最大体量用户需求的满足,但不代表其他产品就没有市场空间。而且我们也能看到,豆包自己也有一些留存上的风险。现在大家都还处在探索阶段,当前的结果并不代表最终成败。
第二种产品形态,是更偏从 0 到 1 的 AutoGLM。我们实际上要面对手机厂商,以及高德地图、百度地图等大厂的竞争。
我们内部有几个共识。面对手机厂商的竞争,首先我们的劣势是没有他们那么丝滑,因为他们可以直接调用 API、直接获得权限。我们要做的事情,就是让能力更加泛化。
我们也和其他厂商聊过。像小米以及其他手机厂商做 RPA,维护成本非常高,因为他们需要满足多个机型的需求,保证每一个 API 调用都正确。一个 App 更新之后,他们还要判断按钮是不是多了或者少了。
但 AutoGLM 更多地采用视觉方式,就是为了增强泛化性。即使模型没有见过这个 App,也要会使用。这可能是我们在产品路径上的一个差异。
第二个是在商业模式上可能也会有差异。手机厂商推出 AI 能力,是为了卖新手机,不会给两三代以前的手机安装这些能力。那么,对于已有市场的渗透,也可能是 AutoGLM 的一个优势。
今天说这些可能都还算是假设。你说自己能泛化,手机厂商也可以泛化。所以之后我们还是要用更快的动作、更敏捷的开发,去验证这些判断。
比较值得庆幸的是,大家可以通过智谱的一些新闻感受到,手机厂商和我们并不是完全竞争的关系,双方其实已经有了合作。大家面对的是同一个蛋糕,需要想好你吃哪一块、我吃哪一块,各自找到适配特定用户场景的生态位。我觉得这是创业公司需要做到的事情。
张海庚
今天李帮主有三个预测之一是未来的应用会越来越少,今天也有嘉宾在分享里面表达了不同的意见。我想问问李总,比如在 AutoGLM 这种产品中,它可以完成原来可能多个 App 才可以完成的一些动作,或者可以跨 App 去完成一些行为的时候,你会怎么看这样的预测?
李杨
其实蒋老师和李帮主讲的并不太相同。可能李帮主说的是有更多 DAU 的大型 App,但蒋老师说的可能是,作为个人独立开发者,我能做出自己的插件、自己的小型应用,我觉得这两个趋势应该都是对的。
我们也可以看到,很多人问 AutoGLM 为什么能打得过高德地图或者百度地图。因为用户对于这些产品的粘性很强,它们有自己的权益体系。饿了么和美团,用户的喜好很难因为某个 App 上饿了么多了一个自动点餐功能,就放弃美团的权益;也很难放弃滴滴打车 V 多少的会员而迁移过去。
AutoGLM 更多是做串联工作,也不会非要去取代某个 App 的点餐功能。所以作为串联型 App,它势必是比较稀缺的,不会根本性地创造一大批像 AutoGLM 这样的 App 去做这件事情。
我插一句,回答刚才的问题。因为我最近和出海圈交流得比较多,很多大模型产品其实已经左手研发、右手出海了。
可能因为国内商业生态的关系,我们的用户也好、商业叙事也好,都非常习惯“大而全”的叙事。但海外用户其实不太喜欢大而全的产品,他们更希望在某个细分领域获得更细致、更细分化的服务。所以我也不太赞同未来的应用会越来越少。
张海庚
李老师今天被连续挑战了。
刚才大家也聊了很多。关于樊总这边,生数科技在技术储备和布局上其实远远领先于全世界。我之前也和生数科技的 CEO 唐总聊过,也和朱军教授聊过。
但我还有一个问题:技术领先的 AI Lab,包括很多大公司前几年成立的 AI Lab,都曾经技术领先过。但从技术领先到实际商业化,再到成为一家好的公司,中间其实有一条巨大的鸿沟,很多公司都没有跨过去。
你刚才也提到,除了技术之外,你们还有很多和产业、用户的结合。所以我想请你详细介绍一下,这一块具体有哪些实践经验。去年我和生数科技交流时,接触到的信息可能还主要是和游戏产业、营销产业、广告产业做结合,当时可能还处在比较早期的 prototype 阶段。一年过去了,这一块有没有新的进展或者经验?
樊家睿
我先梳理一下产品发展的脉络。从4月份推出全世界最早能够和 Sora 直接对标的中国第一个长视频大模型,到7月底产品面向全球上线,实际上由于我们的运营增长确实比较薄弱,纯靠自然增长的流量,已经达到了全球范围内用户体量最大的一个视频生成软件。
这是一个 C 端产品,也是服务 SaaS 端的产品。我们最开始锚定的是专业和半专业创作者,但在这个过程中发现,很多普通用户对于 AI 技术的拥抱远超想象,由此产生的付费意愿也远超想象。这是我们在 SaaS 端的一些观察。
在 B 端,刚才提到的3类客户中,第一类是新的需求已经超脱老场景。比较典型的是泛互联网娱乐领域,这里面孕育了一批出海产品。它们能够创作多个 IP 之间的交互互动,这是传统技术远远无法做到的。
第二类场景,是新的需求和老场景已经产生了不同的发展趋势,比如动漫和游戏。我们会和行业标杆客户合作,打造基于 AI 技术的全新工作流,试图改变原有的生产方式。
第三类场景,是现阶段 AI 技术可能还达不到正片要求的场景,比如短剧和影视。但我们看到,全球范围内第一例获得知名 IP 授权的电影 AIGC 生成短片,就是索尼中国和生数科技合作的《毒液:最后一舞》。
这是世界范围内首例,也是国内大模型和国际顶尖 IP 的首次商业合作。其中解决了很多行业之前没有解决过的问题,包括合规、法律、IP 等一系列问题。
所以,虽然在第三类高价值场景里,现阶段 AI 可能还覆盖不了正片,但我们还在继续探索。现在在宣发、材料和素材方面,已经有成熟的合作。
当然,这一切并不只是基于公司在技术上的迭代。可以看到,我们每一次技术上的突破,比如面部一致性,实际上都是锁定一个人的面部,用一张图片就能够做到。这可以赋能直播、广告等行业。
9月份,我们突破了主体一致性,不再局限于面部。比如我今天的整套 OOTD,都可以放到一张图片里,而且只需要一张图片,不需要单独微调。主体进一步从人物拓展到动物、商品、三折叠手机、特斯拉,以及虚拟角色、动画角色,这就是多主体的一致性。
我们最近在 11 月突破了多个主体的一致性,包括多个角度的一致性和多个场景之间的一致性。这并不是我们在象牙塔里设计出来的技术方向,而是真真实实能够赋能刚才提到的 C 端专业、半专业和普通用户,以及 B 端3类场景的不同行业需求。
这就是我们技术演进的主轴线,也是和能够扎实落地的行业场景深度结合的路线。
张海庚
非常精彩。刚才听到你和李老师提到的内容,有一个共通点:你们真正下到舞池里,和用户、产业共舞的过程中,发现了很多新的需求和新的机会,并且做出了快速反应。
我再追问一下。大家都对生数科技很感兴趣。我听说 Sora 出现之后,你们内部迅速调整了战略,把视频生成的战略优先级提升到了最高。我不知道这个传闻是不是真的,能不能讲讲背后的情况?
樊家睿
这个观点可能需要稍微纠正一下。刚才也提到,我们是最早探索 Diffusion Transformer 的团队之一。当时在 2023 年年末,基于 Diffusion Transformer 架构,我们已经有了视频生成的雏形,逐帧质量已经做到非常高,也已经能够生成4秒钟的视频。
只不过当时市场在一定程度上被“Transformer 压缩一切”的观点覆盖了,所以一直坚持自主创新融合架构的路线,客观上可能存在资源不足的问题。
Sora 发布之后,大家回过头来发现,原来我们一直在坚持做融合架构,于是更多资源可以聚集到我们这里。我们也确实没有辜负市场和世界的信任,在全世界范围内最早做出了能够对标 Sora 的产品。
像我刚刚提到的,很多东西从多模态大模型开始,原创和引领已经不再受制于彼岸,而是原生于此时、此地。
我们在4月份中关村论坛发布的视频大模型,加上7月份突破的面部一致性,后来大厂也推出了相关功能,通过微调等方式实现。随后我们进一步实现了9月份的主体一致性、11月份的多主体一致性。
我们是全世界范围内最早发现视觉模型具有智能涌现能力、具有上下文理解和关联能力的团队。所有这些技术突破都源自生数科技这个团队,源自中国,而不是美国出现了新的技术引领,我们再去跟随、学习和模仿。
根本上,是因为在这条架构路线上,我们无愧于世界上最了解底层技术路线的团队之一。朱军教授从最早回国开始,就一直在做扩散模型。OpenAI 最年轻的科学家陆晨、宋阳等人,以及鲁马的 CTO 宋家明,也都是朱军老师的学生。
可以说,在多模态领域,我们对于人才储备、技术认知和预判有信心,能够屹立于世界之巅。但还是要感谢 Sora 的及时发布,让我们能够聚集更多资源,也让市场及时看到我们。
张海庚
接下来想问一下智谱。智谱也是中国大模型创业公司中最早探索的梯队之一,也是最早开始服务 B 端的公司之一。
大模型出现之后,有一个很热议的问题:到底应该选择做 B 端,还是选择做 C 端?行业里也有领先从业者提过一个观点,说不相信左手做 B 端、右手做 C 端能够做成。
但我们看到,智谱现在一方面训练基础大模型,同时也开始探索 B、C 两端的应用。所以我想听听你对这方面的看法。作为产品战略总监,我们也很想知道,智谱是怎么决定做什么、不做什么,以及先做什么、后做什么。
李子玄
我觉得这个问题特别好。战略的重点是“略”,就是省略什么,也就是不做什么。
商业的本质是收入减去成本,而且要持续性盈利,甚至对盈利要有比较高的预期。我们目前在大模型上,其实没有看到太多人想要动成本这一块。
收入端可以拆成 P×Q。去年我们认为 P×Q 会一直往上涨,尤其对于 B 端来说,从 token 调用的角度看,Q 越来越多,P 可能不会怎么变,价格不会跌得太猛。
但一年之后大家发现,价格跌得太快,可能变成原来的百分之一、千分之一,甚至万分之一。你的 token 不可能以万倍的速度上涨。所以不是 B 端的钱不好挣了,而是大家还没有找到足够的方式去运用 token。
o1 可能是一个比较典型的例子。生成方式和原来不一样,可能要用更多 token 完成更高质量的任务。原来大家觉得生成1000字消耗1000个 token,现在可能要生成1万字。或者像 AutoGLM 生成一条操作路线,消耗更多资源,这有可能给 B 端注入新的活力。
单纯生成文本、生成简单回答,对于 B 端而言可能就不是一个很好的机会。所以我们也希望把更多精力放在能够制造网络效应、轻量级做增长的方向上,不一定非得区分 B 端和 C 端。
对于 B 端来说,还有开放平台。像可灵和 Vidu,大家都会关注我们能不能同时服务 C 端创作者,并通过 API 赋能合作伙伴。智谱和其他公司没有特别大的区别,只不过这一轮降价可能是大家之前没有想到的,我们需要应对这一现象,重新思考怎样做才能给自己带来最大的壁垒。
张海庚
一个比较直接的问题是,今年经历了 B 端大降价之后,C 端收入可能是行业里比较有信心的方向。我们已经从 C 端挣到钱了,但也有一种声音认为,如果 C 端收入要规模化,还遥遥无期,而大模型又真的很贵。
在这样的环境之下,智谱准备怎么熬过这段时期?很想听听你们的想法。
李子玄
我觉得最重要的事情还是用户体验和口碑。产品还没有 ready 的时候,不能赚太多的钱。
现在大家也可以发现,智谱其实有会员,但做会员比较谨慎。我们还是把接近第一梯队的模型免费提供给大家,把可能质量最高的模型以一定次数的方式提供给大家。
这个尝试主要是为了验证市场水温,保持产品状态,同时更好地对用户分层,找到谁真正有付费意愿,谁没有付费意愿。
但我觉得更重要的指标可能是留存。当留存达到一定程度,我们认为 PMF 已经接近了,就可以开始收费。
国内和海外也不太一样,消费习惯也不一样,所以我们会探索新的商业模式。比如 Perplexity 已经开始做电商、做商城。如果一个 App 的流量达到某个程度,它可以作为入口、作为渠道,去帮大家完成一些事情。
AutoGLM 也可以成为其他 App 的前置环节,和它们展开合作。目前商业模式肯定还没有形成闭环,但未来我提到的这些方式,都可以去验证和尝试。
张海庚
进入最后的展望之前,我还想加一个问题问问李总。你刚提到可灵 AI 在海外也有一些进展,而且可能超出原来的预期。
最近有一篇关于整个大模型行业的媒体报道,其中有一个观点很有意思:现在整个大模型市场,是“半熟的技术遇上半熟的市场”。技术本身还在不断迭代,没有达到 ready 状态;用户本身也在慢慢适应这个过程。
所以我们会发现,传统意义上的 PMF,现在也有行业领袖提出应该是 TPMF,也就是技术和模型需求之间的 PMF。除了这个,还有我们刚刚讨论的很多问题,包括大厂和创业公司的不同、技术领先的 AI Lab,以及商业化过程中需要补课的模式。
我想问问,快手对可灵 AI 在国内和海外的未来预期是怎么样的?你刚刚也提到,出海之后才发现海外市场和海外用户与国内有很大的不同。2025 年在这方面的预期和目标会是什么?
李杨
半熟的技术加上半熟的市场,是目前所有大模型公司都会遇到的问题。大家都面对同一道题,只是解题思路不同。
站在今天这个阶段,大家可能对模型有很高的预期,但落到技术层面,它能做到什么程度、在什么时间点达到相应水平,我觉得是很难预测的。
反过来,从产品视角看,首先要判断技术处于什么水平。如果想满足某个需求,产品上需要补什么样的工作,这件事情很重要。技术模型现在一定存在不适配的场景。
刚才樊总也提到,生成式模型,尤其是视觉模型,此刻应用在大荧幕上,说实话还离得很远。即便我们最近也在和国内9位知名导演合作,我们也看到,距离真正的荧幕级产业应用还有很远。
这说明什么?首先,这是一个更远的目标。我们还是希望从效果层面帮助模型更好地提升。但回到用户和商业层面,我们还是要找到自己的关键路径和关键用户。
大家都觉得我们是一个 C 端订阅、B 端的模式,但我自己不认为我们是一个 C 端产品。我稍微解释一下:我们的工具定位还是一个效率工具。这个效率工具所替代的,是部分摄像头拍摄的工作。
今天你不用出门去拍,也不用买设备。当然我说的是部分替代。比如我们已经看到很多用户用模型生成空镜,效果还不错;包括文旅类内容,也已经能够比较好地达到自媒体内容传播的状态。
另外,我们再看现在的用户群体,会发现这部分人还有很多机会可以服务得更好。他们要么是为了工作,要么是为了商单,要么是为了自己的创作,本身都有自己的价值属性。也就是说,他们首先要能够活得好,我们的产品才能活得好,所以我们会更长线地审视这条链路。
从商业化角度来说,我们一定要有一个切入点。如果未来大家都想做一个既能向上拔高到影视创作,又能向下兼容所有大众用户的产品,那切入点究竟是什么?
我们此刻选择的切入点,是全球各类场景中具有共性的创作者。这些创作者大部分是短视频平台和社交媒体平台上的自媒体用户。
而且这个情况在海外会更好一些。好在这部分用户不仅有技术尝鲜的前瞻性认知和主动性,对技术工具的使用也更加多元,会同时使用好几个工具。我觉得这是一个好的现象。
在这个过程中,我们也能够通过用户数据找到适合的场景。对我们来说比较重要的两件事,就是用户需求加上数据,帮助模型不断把场景打磨好。
对我自己来说,场景和用户一定要找准、聚焦。我们肯定不会在这个阶段去做大而全的产品。同时,我们现在面向平台用户和 B 端用户,认为两者存在底层需求共性,所以我们其实正在做同一件事情。
卫诗婕
今天聊了非常多干货,我自己也学到了很多。现在已经到了 2024 年即将结束的时候,但我相信,2025 年大模型的浪潮还会以一种热情而理性的方式继续向前,尤其是在头部梯队真正做实事的公司和产业推动之下。
接下来想请3位嘉宾为我们做一个 2025 年的预测。可以抛出一些关键词:你们觉得 2025 年整个产业发展的进程,以及竞争叙事,会有哪些最核心的关键词?
还是从李老师先开始。
李杨
这个问题还挺难回答,因为大家的预测,都是基于主观判断和当下看到的行业情况。我更多是抱着期待的态度。
从期待的角度看明年,我有两个点。第一个,我期待技术上出现一些黑天鹅事件的爆发。这未必是好是坏,我也不确定,但我很期待技术上出现这样的爆发。
另外,在应用上,我觉得明年真正有机会做到百花齐放。这个词从去年年底大家就一直在说,但站在今年这个相对更厚的土壤上来看,此刻的土地肥力有机会帮助我们真正把这些种子栽培好,把不同领域、不同垂直场景的应用做好。
今年我已经发现,很多创业公司和 AI 产品开始更加聚焦,而且在聚焦之后拿到了一些正向反馈。所以我觉得,明年的应用会非常繁荣。
卫诗婕
你提到土地的厚度增加了,这主要来源于基础能力提升、用户拥抱,还有什么其他要素吗?
李杨
这确实是个很好的问题。我的感受是,首先技术一定还在持续发展。我们今天看到技术并没有停滞,不管那堵墙在不在,大家都还在往前走。
另外,用户的接受和认知非常重要。今天豆包已经成长为一个虽然还不能和互联网产品相比、但已经足够具有规模的产品。用户认知很重要,用户使用习惯也很重要。
如果不再追求颠覆用户的某种体验,只专注于把某个需求解决得更好,我觉得未来这方面的应用会有更多机会。
张海庚
我再补充一点。刚刚听了一位老师关于开源的分享,我感觉开源的进步速度,以及技术普惠的程度,也是土壤增厚的一大关键要素。
我们请智谱的李总来预测一下 2025 年。
李子玄
我也不算预测,只提两点想法。
第一,企业或者从业者一定要构建自己的护城河和壁垒,要思考自己的核心竞争力是什么。我们经常说产品要好、技术要好,但产品只是一个结果,不是一种能力。
比如豆包的核心竞争力,第一是它在抖音上的投放渠道,这是不可替代、不可被模仿的。像 Minimax,我们可以看到它里面的人,对于海外市场、对于美国 Gen Z 和 Gen Alpha 那些人的理解,确实要更高一档。
但这可能还只是表象,因为你怎么保证这些人不会被挖走?这还涉及企业文化、企业理念和激励机制。
就像刚才樊总讲得很好,智谱的理念是要打造 AGI。所以在里面的人,可能会为了这个目标去追求,而不太在意其他诱惑和纷扰。
产品领先,或者发现了一个用户尚未被满足的需求,这只是起点。接下来怎么把这个点稳住,无论通过人、资源还是关系,都要想清楚自己的优势在哪里。
第二点相对小一些,但一定要考虑更广泛的替代解决方案。我原来从事法律行业,之前接触过一些四五线城市的律所,它们会招收付费实习生,大家可能也听说过这种情况。
对于这样的律师来说,为什么要降本增效?为什么要使用 AI?如果使用 AI,可能反而没有收入了;裁掉一个实习生,本来还能赚200元,现在可能就没钱了。
更多场景里都存在人性的复杂性。我们一定要考虑进去,不要以为对手只有科技公司或者产品。人的解决方案是什么,其他在我们思考之外的解决方案是什么,这些都应该考虑进去。
卫诗婕
谢谢李总。樊总,请你来预测一下。
樊家睿
我刚刚回顾 2024 年的时候,用了“多模态”,然后围绕多模态谈了认知和预判。
在我看来,2025 年的核心主题关键词还是多模态,但围绕多模态,可能会产生“高效”和“通用”这两个关键词。
这里的多模态当然不是现在的多模态。我刚才也提到,目前多模态还处于初期阶段。未来 2025 年,我们可以预见的是,更多模态真正融合,比如音视频或者 3D 场景视频,能够打开更长的上下文理解和上下文关联窗口。
在此基础之上,我们能够抽象出更多一致性,超脱物体本身,超脱人、物和多主体,可能变成偏风格性、偏抽象性的东西。在此基础上实现的真正多模态,会是简洁而通用的。
“高效”怎么理解?现在 Vidu 已经是全世界范围内生成速度最快的模型,生成4秒钟的视频只需要20秒左右。但我们觉得还远远不够极致。
对于生成时长这件事情,要结合生成速度去看。当生成速度能够做到小于等于生成时长,想象空间是无限大的。很多听起来很陌生的词汇,比如实时交互、永续生成,都有可能实现。
在这样的技术和产品积淀基础上,还会衍生出我们至今没有见过的产品形态。它可能是完全全新的品类和种类,在未来内容交互、内容消费上,都会成为一种新的可能,像刚才李老师说的黑天鹅一样。
卫诗婕
今天本场圆桌就到这里,再次感谢3位嘉宾。