卫诗婕
我们团队在二零一七年的时候就发表了全球第一篇文生视频的论文,那个论文里面的所有的作者都在我们公司。我们始终认为图片是入口,视频是过程,那终局可能就是世界模型了。还是要看谁多的数据在哪里。现在所谓的世界模型,包括巨神智能的模型,他们的模型体量大概只有几十B或者一两百B。一个像智象这样的公司,我们一年的数据都是一百PB,很恐怖的。你只有见过这么多的视频,通用性足够好的情况下,你才能够做更多的泛化。李飞飞是想复刻这个世界,雷困觉得不必复刻这个世界,你是哪一派?我希望能够从世界中学习,把世界进行重构,不是叫创造世界,而是mode这个世界,建模,建模,对,按照我们的想象去编辑这个世界。哈喽大家好,这里是漫谈来 the star,我是世杰。从语言大模型到多模态至全模态模型,再到走向世界模型,世界正在经历什么?本期节目我邀请了加拿大外籍院士、智向未来 HiDream 的创始人梅涛,还原视频生成模型的技术发展史。梅涛院士是全球首篇文生视频论文的作者,也是最早探索文生视频的人。今年五月二十号,谷歌 I/O 大会上,劈柴发布了 Gemini Omni,谷歌第一个原生 Any to Any 的全模态模型,文本、图像、视频、语音都在同一个 Transformer 里原生流动,不再是几个模型拼接,这和梅涛一直以来的主张不谋而合。与此同时,OpenAI 悄悄砍掉了 Sora 项目,更多聚焦 coding,硅谷正在做减法,但中国一侧的多模态战场却没有收敛,甚至大有赶超硅谷之势。从多模态、全模态到世界模型,多模的架构层面正在发生新一轮的分化,梅涛。梅涛作为最懂视频模型的人之一,正是选择从底层架构下场的创业者,他致力于打造视频界的 Anthropic。我们从他的中科大、微软亚研院岁月一路聊到这场世界模型的创业之旅。梅涛的模型世界观可以用一句话凝练,那就是:图片是入口,视频是过程,世界模型是终局。这也。这也解释了我们的标题为什么语言、视频、具身终将汇聚。这期的信息量极大,但技术门槛较高,不过其中穿插着大量生动比喻,跟随下来也能对当下的 AI 趋势进行一场深入的了解,推荐大家收听。
欢迎梅老师,跟我们的观众打个招呼吧。
梅涛
大家好,我是梅涛,是智象未来的创始人。
卫诗婕
这好像是你第一次出来接受完整的播客访谈。
梅涛
是的。
卫诗婕
在多模态和视觉领域,您的学术地位可以算是显赫,但是之前外界对您的关注其实不是特别充分,为什么?跟你自己的性格有关系吗?
1. 打造视频领域的 Anthropic
梅涛
我自己比较喜欢厚积薄发,坚持长期主义。当然,这也跟我们的创业经历有关系。我们团队目前做的是 To B 的多模态大模型和应用,所以一开始可能没有那么显眼。
就像今天的硅谷,Anthropic 一开始也没有 OpenAI 那么显赫,名声也没有那么大。随着时间推移,大家可以看到,企业服务这个赛道慢慢起来了。我们也像 Anthropic 一样,业务、产品和技术慢慢建立起了自己的声誉和声势。
卫诗婕
现在 AI 公司出来活跃的还是比较多的,你怎么让大家记住你?
梅涛
很简单,我们希望做视频领域的 Anthropic,做一家全球化的高科技、平台化公司。我们希望在中国做成一家拥有硅谷创新精神和文化的全球化企业。
卫诗婕
怎么理解“视频领域的 Anthropic”?你觉得 Anthropic 提供的最核心的价值是什么?
梅涛
我觉得 Anthropic 有几个特点特别值得中国创业公司学习。
第一个,它的团队一直比较稳定。你可以看到,他们的团队从一开始从 OpenAI 出来几个人,慢慢发展壮大。其实我们团队也是一样的。
我们团队在 2017 年就发表了全球第一篇文生视频论文。那篇论文里的所有作者,除了那位科大的老师还在科大以外,其他作者都在我们公司,而且这些人从来没有离开过。团队方面,我觉得我们很像 Anthropic。
另外,Anthropic 主要做企业服务,包括之前有一家比较有名的创业公司 Canva 也是一样的。它一开始做 To C 业务,后来发现企业服务反而比 To C 业务的天花板更高,复购率和客单价也越来越好。
所以我觉得,向 Anthropic 学习,就是坚定地走企业服务这条路。而且我认为,AI 领域最后的终局,就是给企业里的个人提供更好的服务。
卫诗婕
Anthropic 能够有今天的成绩,而且有这么大的社会价值,其实它选了 coding 作为那把刀。你觉得视频领域的那把刀会是什么?
梅涛
视频领域有一把刀,就是图片。我们始终认为,图片是通往多模态的一个入口。
为什么?因为图片是一个二维信号,跟语言信号完全不一样。语言信号是一维的、线性的;图片和视频则是二维、三维,甚至更高维的信号,是我们眼前视觉上的、对物理世界的一个 moment,一个静态的捕捉。
但是,这个静态图片里面有大量信息,包括人物的空间关系、逻辑关系,还有一些物理规律,都隐含在里面。图片再往时间轴上延伸,就是一段动画、一段视频。如果它在空间域上做扩充,可能就是类似物理世界动作的一个视频。
所以我们始终认为,图片是通往世界的一个入口,它可以延展出很多不同的模态。要做好视频,首先要把图片模型做好。
今天很多客户在我们平台上创作时,我发现他们有 50% 到 60% 的时间花在制作一张图上面。所以我们认为,图片首先是一个标志性的入口,一定要把图片模型做到世界最好。
其次,我们在图片模型的基础上,从二维信号向三维信号扩展。比如从图片模型扩展到视频模型,再从视频模型扩展到全模态模型,我们是沿着这条路走的。
卫诗婕
今天晚一些会聊到世界模型,那图片会是世界模型的入口吗?
梅涛
是的。我们做计算机视觉这个领域很多年了,一直有一个说法:人在获取世界信号的时候,80% 来自视觉,来自我们的眼睛。
所以视觉首先是一个很重要的入口。另外,不管是今天的视频模型,还是所谓的世界模型,它们底层的架构其实跟图片模型基本上没有区别。
今天做视频生成时,主流的方法论是 DiT,也就是 Diffusion Transformer。其实图片最早的模型也是基于 Diffusion Transformer 做的。所以如果能够把图片做到最好,视频也有可能做得很好。
包括今天 Google 的 Gemini、Veo 3,其实 Google 本身也有很好的图片模型。所以我认为,图片模型做得好,后面才有可能把视频模型做得更好。
卫诗婕
你是院士,而且好像是现在这些创业者当中,少数放弃教职头衔出来全职创业的人。
2. 全职创业者的成长路径
梅涛
其实我们这个团队非常稀缺,为什么?因为我本人是全职创业的,而且我一直在工业界。我最早在微软,也就是 Microsoft Research,后来去了京东。
虽然我的职业生涯有二十多年,但一直是在工业界全职工作。包括今天创立智象未来,我也是全职的,没有拿过第二份薪水。
我们的团队也是一样,一直在工业界里打磨,在这一路上摸爬滚打。所以在中国,目前像我这样有院士头衔、愿意躬身入局、愿意 all in 创业、每天 7×24 小时想着公司的团队,其实并不多。
卫诗婕
如何成为院士的?
梅涛
怎么说呢?我在中国念到博士毕业,后来去了微软。科大你也知道,它追求“红专并进、理实交融”,追求科学真理。
其实我很小的时候就想做一名科学家,心里面从小就有这样一颗种子。后来在科大读研究生,又来到微软实习,见到了很多业界顶尖的高手。
我记得当时来微软实习时,旁边一个 cubicle 里坐着颜水成、余凯,隔壁还坐着沈抖。这些人现在都是 AI 牌桌上做得比较好的人。
当时微软研究院全球有 1,000 个研究员,其中有 5 位图灵奖得主、300 多位 Fellow。那种氛围让我觉得,做科学研究是一件非常幸福的事情,自由,也很包容。
我就想一门心思把视觉和人工智能做到极致,看看自己能够走多远。身边有这么多有影响力的人、这么多高手,跟着他们一起学习,自然会成长得比较快。
卫诗婕
你刚才说从小就想做科学家,为什么?
梅涛
大概在小学三年级的时候,学校让我参加一个比赛,应该是奥数比赛。当时我们没有什么培训,但我参加比赛,拿了学校唯一的一个奖回来。
虽然在市里面,那个奖完全不值一提,但我们小学的校长在学校的一次大会上公开表扬我,说这个同学以后会成为科学家。
那时候我觉得很受鼓舞。科学家是什么,我心里没有明确的印象,但我觉得可以朝这个方向努力。从那时起,就有了一个萌芽、一颗种子。
后来我上了科大,科大的氛围又是一个培养科学家的氛围。大家都说科大“千生一院士”,一千个学生里面有一个院士。
在这样的环境熏陶下,我基本把所有时间都花在学习和实验室里。后来到了微软,又觉得打开了眼界:我们跟全球最好的一帮年轻人、跟全球最好的计算机科学家一起工作,从他们身上学到很多东西。
我是站在巨人的肩膀上一步一步往前爬的,所以我觉得成为一个 scientist,是一件非常自然的事情。
卫诗婕
为什么最后选了中科大这所高校?
梅涛
有一个偶然因素。现在是科大的党委副书记周书记,当时还是一位年轻老师,也是湖北人。有一次他回湖北招生,跑到我们学校,不知道为什么还找到了我们家。
他说:“我给你一张表,你填完这个表,只要分数够,就可以到科大来随便选专业。”
我当时就心动了。家里人也觉得挺好,不用冒险去考北京的学校,还可以去这么好的学校选专业。于是我就填了。
考完之后才知道,科大原来在合肥,不在北京。但我觉得还是挺有意思的。而且当年招我进科大的老师就是周校长。后来我们在合肥的职场开工时,他还过来庆祝。
我当时跟周校长说:“周校长,你当时把我招到科大来,现在我创业了,又在合肥,那你也得给我站台。”他说他很高兴。
卫诗婕
AI 界有很多中科大毕业的学生,也有很多你的校友。
梅涛
是的,很多师兄师弟。比如我原来在京东一起工作的周博文博士,他是我师兄,科大少年班的,现在在上海人工智能实验室。
还有芯片领域比较有名的寒武纪陈天石,是我们科大的师弟。上次你见到的戴若黎,若黎戴博,是我 97 级的师弟。
美国那边也有很多,比如你们经常报道的余嘉辉,他是科大少年班毕业的,后来去了 UIUC,又去了 Google,从 Google 去了 OpenAI,后来又去了 Meta。他就是那个转会费 1 亿美元、比 C 罗还贵的年轻人,也是我的师弟。
卫诗婕
之前跟戴博聊天,他说你在学校的时候非常风云,大家叫你“梅帅”。
梅涛
一开始没有。我还是比较喜欢默默无闻,因为我平时也不太喜欢露脸。
我姓梅,其实比较喜欢梅花的特点:梅花香自苦寒来,它一定经过风吹雨打。我喜欢厚积薄发,喜欢默默无闻地做自己喜欢的事情,一直做到成功的那一天。
后来去了微软,成长比较快。毕业的时候,我的学术成果还可以,所以他们可能觉得,在科大同辈里,我在某些方面比较突出。
卫诗婕
你说梅花香自苦寒来,但我研究了一下你的履历,好像没有找到苦寒的痕迹。
梅涛
那你可能没有看到平时我是怎么刻苦的。
卫诗婕
你的苦寒是什么?
梅涛
从小时候到现在,我一直比较努力。做事基本上会付出比自己认为更多的精力。一件事情我要付出 120% 的努力,从各个角度保证它成功,这是我跟很多人不太一样的地方。
我做事非常专注。为了达到目标,我会长期不断地做,直到它成功,一般不会轻易放弃。这是从小养成的一种性格。
各种艰辛和辛苦只有自己知道。特别是创业之后,作为一号位,后面没有人了,所有东西都得自己承担。
最极限的一次,大概 4 天去了 5 个城市,见投资人、见客户、参加活动,从北京到上海、杭州、广州、三亚,把中国从南到北、从北到南穿了一遍,然后又回到北京。
所以我为什么要跑半马,平时还要撸铁?就是为了保证身心健康,让精神饱满、情绪高昂。
卫诗婕
人生当中一直都是获得正反馈吗?有没有负反馈?你的人生感觉像很多人的模板人生。
梅涛
其实根本不是这样。很多人只看到别人光鲜的一面。我经常说,一个人要付出 99% 的努力,才能成为 1% 的那帮人。但很多人到了 50%、60% 的时候就满足了。
我自己也是这样。从微软研究院到京东,再从京东出来创业,我觉得每一次都是对过去自己的突破。如果你不突破自己,不突破自己的认知,就不会觉得自己还能再往前一步。
这个过程一开始非常难,但跨过困难阶段之后,你会进入另一种舒适区,觉得自己在这里成长得很快。
人性里懒惰是天性。为什么我会跑步,为什么会这么努力地创业和生活?只有反人性地突破自己,才能获得长期反馈。哪怕是负反馈,对我来说也是一种正反馈。
我记得职业生涯中一次比较重要的负反馈。在微软有一段时间我比较压抑,因为我觉得自己当时做得还不错,但 promotion 比较慢,或者比别人慢一点,所以有一段时间不太开心。
后来我的一位 mentor——现在仍然是我学术上的导师——跟我聊了一次。他问我:“你不高兴的原因是什么?”
他觉得有时候慢一点不一定是坏事。今天慢一点,后面跨过这个坎,可能很快就起来了,因为所有东西都在积累。
我听完之后回去继续做了半年。半年之后,我就变得非常顺利,而且进步非常快。那次对话对我来说很重要。
任何事情都要从两面看,而且要看长远。很多人忽略了自己的长期进步和长期价值,却放大了自己短期的价值。长期游戏,其实是由很多次突破边界、永不停止地突破边界开始的。
卫诗婕
我们可以追溯一下,中科大对你的影响是什么样的?
梅涛
冲击还是很大的。我大学一年级时成绩不是特别好,因为不知道怎么在大学里学习和生活。到了大学,没有人教你怎么上学,也没有人教你晚上要不要上自习。
我记得当时晚上从来不上自习。后来期末考试发现不行,成绩考得不好,才知道原来科大是另外一个黄冈中学。
大一大二时,很多人在刷《吉米多维奇》。那是俄罗斯的一套数学题集。很多人在考季考托福,我当时什么都不知道,也没有规划,困惑了一段时间。
后来我才知道,原来要尽早规划人生,要比高中时更加努力,才能跟这帮人在同一个维度里交流。所以在科大,它让我觉得自己站在了一个新的起点上,要不断努力、不断突破自己,在喜欢的领域里不断做到最好。这是第一个冲击。
第二个冲击,是我在科大读研究生时,导师把我送到微软研究院实习。那是 2003 年,当时还在非典时期。
到了微软之后,我发现身边的人都很厉害,有清华、北大的,也有从马里兰大学、UIUC 等学校来的年轻人。全球最好、最聪明的年轻人都在一个 lab 里,一开始压力很大。
我见到了世界上最聪明的大脑,见到了很多优秀的 mentor,也见到了很多有影响力、有潜力的研究方向。那时觉得自己不懂的东西太多了,如饥似渴,每天阅读大量论文、做大量实验,天天泡在实验室里。
那段时间对我来说,也是一个很好的成长机会。
卫诗婕
你刚才说,一开始以为中科大在北京,后来发现它在合肥。第一次到合肥的时候是什么感受?
梅涛
我相信很多科大校友跟我的感受一样。
当时一帮家长带着孩子去找科大西区的大门。那时候科大西区在黄山路上,路还没修好,还是石子路。科大校门很大,但校门前面也不是很干净。
家长就在西区门口问一位老师:“科大的西区大门在哪里?”那个老师很生气。后来我知道,他是西区的区长,叫黄继虎。
黄区长说:“他妈的,科大的西区大门就在这里。”
所以印象非常深刻。科大比较朴素,校风非常简朴。平时在学校里看不到人,因为学生都在教室、宿舍、图书馆或者实验室里,跟北京的学校氛围完全不一样。
我 2002、2003 年在北航时,微软研究院的实习生都住在北航宿舍里。我觉得北京的学生非常活跃,体育场永远有人打球,但科大的体育场基本是空的。
卫诗婕
到了北京之后,除了觉得人才更密集、身边的人更厉害,还有什么本质区别吗?
梅涛
本质区别是,对自己的激励更加明显了。
我去微软实习半年,回去之后感觉天翻地覆,特别是自己的研究能力,每 3 个月就会上一个台阶。跟今天的大模型一样,每 3 个月一次小迭代,每半年一次大迭代。
我每个学期回去时,都觉得自己不一样了。但我看科大的一些同学,他们过得比较 cozy、比较舒适,按部就班,可能成长率没有我那么高。
我印象最深的是到微软的第一天。张宏江老师是我的 mentor,他安排当时另外一位小 mentor 带我。第一天给我的任务,是做 multi-camera sports video analysis,也就是多角度体育视频分析。
他第一天就让我看 200 篇论文,把那段时间所有相关论文看一遍,一个月后做 presentation,总结这些论文。
我第一次给他汇报时,他的脚放在桌子上。
卫诗婕
脚放在桌子上?
梅涛
对,我也踩过他。他是比较 critical 的一个人,对学生和员工的要求很高。
准备汇报时,他让我翻 PPT。他不看第一页,而是从最后一页往前翻。我本来准备了半个小时的汇报,结果他 5 分钟就看完了,然后让我讲其中一两页。
这个印象对我冲击很大。我才知道,原来我的导师、我的 mentor 是这个领域的开山鼻祖,同时又会这么 detailed 地看问题,对这个领域了解得非常深。
我的压力很大。身边的同学每 3 个月写一篇小论文、每 6 个月写一篇大论文。对我来说,要追上他们需要很长时间,所以我花了大半年研究多视角体育视频分析。
但做了大半年,什么结果都没有,非常焦虑。当时美国那边,CMU 的教授 Takeo Kanade 做了一个 multi-camera 的系统,叫 EyeVision。应该是 60 个摄像头,放在纽约玫瑰碗,也就是 Super Bowl 的体育场里,捕捉橄榄球比赛的每个细节。
你可以从任意角度看运动员发生了什么,判断他是否越界、是否犯规。但中国没有这样的系统。我也是巧妇难为无米之炊。
可是这件事一直放在心里,一直觉得对不起张宏江老师,觉得没有把它做出来。
一直到 2019 年,我们在京东时,跟咪咕和另外一家公司合作,做了一套足球场上的多摄像头系统,大概有 16 个机位,把原始视频信号输入系统,模拟人类导演和导播的行为,做自动导播。
所以我觉得,2019 年我们真正把当年在微软没有做出来的系统做出来了,而且可能比当时 Takeo Kanade 他们做的 EyeVision 更先进。
那时我觉得,终于对张宏江老师当年交给我的 assignment 有了交代,心里也坦然了一些。那项工作在 2020 年拿到了 ACM Transactions 的年度最佳论文。
所以我觉得,算是对当年微软给我的第一个实习项目、那个没有做成的任务,有了一个交代。这件事在我心里放了很久。
卫诗婕
张宏江老师应该是微软亚洲研究院推动成立的关键人物,对吧?你现在回看,他当时为什么交给你的第一份工作是多视角分析体育赛事?
梅涛
他对我的期望很高。他觉得我是科大来的,我们导师说我是实验室里最好的、最聪明的学生,所以给我贴了标签。
张宏江老师给我设定了非常高的 expectation。后来确实没做出来,我也很愧疚。但张宏江老师也安慰我,说当时条件确实不成熟,以后有条件可以换一个方向。所以我后来换了方向。
卫诗婕
从技术角度来看,你觉得他安排这个任务,是希望你探索出什么?
梅涛
那个方向当时比较超前。那时大家还在研究 single-camera 的体育视频、家庭视频和监控视频,从多角度分析一个事件,还是很难的。
直到 2008 年北京奥运会,赛场上才出现多个摄像头追踪运动员,拍摄网球比赛的压线,以及冰上舞蹈各种不同视角的动作。
所以今天你会看到自由度很高的 camera,可以随便拉、随便拖拽。那个时候确实很难,因为那是 2003 年。
我觉得张宏江老师很有前瞻性。他定这个项目,也跟微软当时的战略有关。微软可能想做一整套视频系统,从单摄像头过渡到多摄像头。
2000 年代初,互联网还没有爆发,很多人买相机、买 camcorder,记录家里的生活、孩子和老人。当时一台相机扛着到处拍。但我们设想,以后每个人的相机会很便宜,每个人会有很多相机,就像今天一样。
卫诗婕
今天我们有 3 个机位,但可以有更多。
梅涛
对。我们当时想做的是:能不能在其他没有机位的地方虚构出一个场景,让没有机位的那个点也能够实现虚拟拍摄。
这样在后期制作时,camera 可以按照指令随意移动、切换机位。输出时不需要人工剪辑,它可以判断谁在讲话、谁有 highlight,谁有戏剧性,这是我们现在最想要的。
今天在智象,我们也做了一个类似产品,叫 HiClips。你把社媒信息发给我,比如今天访谈了 1 个小时或 2 个小时,只要 1 分钟或 2 分钟的短片,再把 prompt 给 HiClips,它就可以自动剪辑、自动生成,还能切成不同语言。
卫诗婕
张宏江老师给你的任务,本质上是用 AI 技术分析、理解视频和画面。
梅涛
是的。所以它其实也是后来多模态,甚至我们后面可能聊到的全模态、世界模型最早的开端。
卫诗婕
那个最初的任务,确实让你在计算机视觉这个方向上产生了兴趣吗?
梅涛
是的。
卫诗婕
应该在你那个年代,CV 就是最火热的方向。那时还不是 NLP。
梅涛
也不能这么说,应该是并驾齐驱。
当时在科大,放到全国来看,computer vision 还没有那么大。CVPR 一年大概只有几百人参会,多媒体会议也只有两三百人。Signal processing,也就是信号处理,包括 speech recognition,可能还更热门一点。后来才是 computer vision 和 NLP。
那时候各个方向比较均衡地发展,不像今天 everything is about generative AI。现在很多会议都没了,最后都 converge 到 AI 里面,比如 machine learning、computer vision 或 generative AI。
卫诗婕
你觉得多样性好,还是现在这样更好?
梅涛
很难讲,因为它都是时代的产物。大家可能会忽略,长期来看,很多领域之所以存在,是有它的道理的。
我经常说,如果当年没有人做 video compression、做 encoding,今天的大模型不可能成功。因为多模态里要处理几千亿张图片、几千万小时的视频。如果没有好的视频压缩算法,数据存不下来;没有好的算法,memory 也无法加载这么多数据。
所以很多领域其实为今天的 AI 做了铺垫,我们才能走到今天。但不能因为现在要做 AI 大模型,所有人都扑在这上面,忽略其他领域,比如 system 方面的工作,那肯定也不行。
我觉得它是一阵一阵的。现在可能比较热,跟风的人也比较多,可能因为工作或产业原因,很多人愿意进入这个领域。但过一段时间,其他领域也会起来,这是事物发展的规律。
卫诗婕
当时张宏江老师希望鼓励这种多元探索,他其实非常不像一个商业机构里的 lab。
梅涛
是的。我觉得微软研究院的成功非常有代表性。
我们在微软研究院写一篇论文,一定会成为当年业界的 hotspot。因为微软当时的产品线是 leading 的产品线,只要你在 search、office 里做一个东西,那肯定是很好的技术。只要你愿意发表,别人就会看,创业公司也会学习。
那个时候有很好的土壤,能够把 idea 变成好的 product,商业化也能够闭环。
当年微软是一个 To B 企业。为什么我们公司也做 To B?因为我觉得 To B 企业能够长青,能够基业长青。微软跟 Google 不一样,微软是 To B 企业,产品线一定非常稳定。
在微软,我做出一个好技术,发表论文、申请专利,再转成产品。比如一篇 paper 要变成技术,中间可能要乘以 10 的 effort:一个研究员要配 10 个工程师。10 个工程师把它做成 standalone 产品,又需要 100 个工程师配合。
所以它是一个循序渐进、逐段放大的过程。好的技术要转移到产品里、实现大规模应用,没有大半年的时间不可能,因为需要一轮一轮迭代和测试。
但今天不一样。现在很多公司,比如 OpenAI,R&D 是完全 merge 在一起的。今天公司的 researcher 很贵,是因为 researcher 和 engineer 绑在一起、一体化了,没有中间转换。
以前微软研究员做出一个东西,要告诉 engineer 怎么复现。我有一个初级代码,他会把它变成几万行 product-level 的工程化代码,再放到产品里不断调试。所以以前有一个 R to D 的过程。
今天 R&D 完全捆绑在一起,迭代更快了。
卫诗婕
为什么会完全捆绑在一起?
梅涛
因为今天做 AI,实际上是一种非常前沿的技术。以前没有这种技术,所以今天很多时候模型就是产品。
前两天萨提亚也说过,model is product。只要你不断在 model 里创新,idea 能够提升 model 本身的能力,这个 model 就是产品,不需要再转化。
你会发现,R&D 就融合在一起了。模型的提升来自 researcher 对领域的认知、判断,以及快速试错。所以今天 engineer 和 researcher 基本放在一起。
卫诗婕
很有意思。大量 AI 创业者应该都想做 To C,不喜欢做 To B。我记得 MiniMax 的闫俊杰当年在商汤也是做 To B,做得非常不喜欢,所以坚定地认为创业一定要做 To C。很多人都这么说。
你居然说要做 To B,因为它可以长青。
梅涛
不能说 To B 或 To C 哪个是错的。To C 和 To B 都能成功,取决于团队基因、团队判断和价值观。
我们团队一直在 To B 公司做了很多年,在这个领域有很多资源,也知道怎么跟大客户、KA 客户和重要部门客户对接,知道怎么做渠道,也知道怎么控制成本。
所以我们的第一选择是做 To B 业务。To B 业务上升曲线虽然慢一点,但天花板会很高,也会形成比较好的生态壁垒。
卫诗婕
但做 To B,大家过去经历过 SaaS 时代,总会觉得它在中国是一个很难的商业模式,而且很容易做重。做着做着,就变成客户的贴身服务者,变成项目制,这件事感觉不太性感。
梅涛
我们今天做 To B,跟过去的传统 To B 业务完全不一样。
我在京东待了 5 年,在京东科技既做 To B,又做 To C,还做 To G,所以很清楚每种业务不同的属性和特点。
今天在生成式人工智能领域,To B 业务和传统 To B 完全不一样。你看 Sweep,它现在估值涨得很厉害,已经涨到几百亿美元,团队规模却没有扩大,它是通过产品力触达很多客户。
我们服务 To B 有几种模式。一种是服务特别大的平台客户,比如跟 TikTok 合作,服务它平台上的很多商家;跟中国移动这样的运营商合作,服务它线下很多门店,也服务它平台上的个人用户。
所以今天 To B 商业化有两种模式:一种是服务平台客户,通过平台客户服务它的 SMB 和 C 端客户;另一种是中央部委客户。中央部委客户是长期陪伴的客户,我们会把有限精力放在中央部委客户和直客上,再通过直客培养渠道,帮助我们拓客。
我们做了很多 To B 业务尝试,但公司人数没有增加。现在公司只有两三百人。所以今天的 To B 业务跟以前完全不同,而且我们坚持不做定制化研发。有想象力的公司,都不愿意做定制化。
卫诗婕
无论 To B 还是 To C,如果能够推出通用型产品,都可以打开天花板,最后也不一定局限于 B 端或 C 端。
苹果当年先推出 C 端的杀伤力产品,后来包抄了 B 端。那是不是可以反推,如果今天在 B 端推出一个超级通用型产品,也有机会走向 C 端?
梅涛
你说得对。我们虽然主推 To B,但也在做 To C。不过我们的 To C 是 To 大 C,叫 professional C,最近流行的说法是 prosumer。
这些是专业用户,不是泛娱乐用户。我们的 C 跟以前的 C 不一样。移动互联网普通的 C 是免费消费者、免费用户;今天 AI 用户是 Pro C,他们付费、订阅 token,使用工具去消耗 token,创作自己的作品。
这些用户是专业用户,可能是超级个人,也可能是团队。所以今天 To B 和 To C 的概念已经稍微模糊了。
我们三块业务里有两块是 To B:一块是商业智能体,做短视频营销;一块是给短剧制作团队提供创作者工具。还有一块是社媒广告、海报设计等,这些用户不是我们特别大的 big bet。
To C 是 To B 业务的放大器。To C 产品实际上是模型能力的直出,模型能力强不强,C 端用户最先感知到。并且,有了很多 C 端用户,我们可以在社区里做 branding,推广产品,收集用户反馈,知道用户到底想要什么。
所以我们以 To B 为主,但也在做 professional C 的工具和产品。
卫诗婕
就像 Anthropic 的 B 端客户贡献了绝大部分收入,但全球也有非常多独立开发者在使用它的 coding。
梅涛
我们也很像。比如最近开源的 HiDream-I1,一个 8B 的图像生成模型,已经进入 Artificial Analysis 榜单前三,是全球顶尖的开源模型之一。
在开源模型,也就是 open weight 模型里,我们排名全球第一。我们还有一个闭源模型,也马上会加入冲榜过程。
去年我们发布了两款开源模型:一个做图像生成的 HiDream-I1,后来又发布了一个做图像编辑的模型。这两个模型在开源社区里都很受欢迎,下载量超过 200 万次,当时在 GitHub 上排名第一。
卫诗婕
现在 B 和 C 的界限没有以前那么分明,从 To B 的公司,比如你们,到 To C 的公司,比如 MiniMax、Kimi,这两条路径会有什么不同吗?
梅涛
如果做 To C,我觉得更多要关注用户痛点,保证模型能力足够好。否则就会变成一个转售 token 的业务。
比较要命的一点是,你要非常好地分析全球用户的需求,而且要非常擅长用户增长策略。
To B 业务则要看行业,看行业增长趋势,看这个行业有哪些普世痛点,客户怎么分布,头部客户、重要客户和尾部客户分别是谁,再用不同策略做商业化。
需要比较好的策略和方法论,但大的方法论没有太大区别,只是看你把精力放在哪里。
在国内创业,有几个关键词。第一个是全球化,一定要做全球化业务。这也是我当年创业的初心。如果只做一家国内公司,我可能就不出来,继续待在大公司里了。
第二个是出海。出海对今天的中国来说是很大的势能。因为我自己公司的产品也在出海,过程中遇到很多问题,需要很多产品来帮助我,但很多时候没有。
第三个是软硬件一体的服务。我觉得在中国做 AI 创业,大家还没有充分关注软硬件结合。我们已经做了一些尝试,有一个软硬件一体的广告屏,叫 HiFans,Q1 就卖了 1 万多台。
因为在中国创业,如果没有用到中国的供应链优势,就等于用自己的短板跟硅谷竞争。硅谷的长处是资金雄厚、算力更强、人才密度更高。纯软件当然不是不能做成,但相当有挑战。
我们的优势是大量工程师红利,以及完整的制造业和产业供应链。如果能用好供应链,就能在国内做一款软硬件一体的消费级或企业级硬件,通过硬件触达更多客户。
我们对线上零售和线下零售业态都有充分了解,所以做了 HiFans,一种类似 3D 全息的广告屏。
这个屏本身没有特别大的难点,难点是怎么把线下业态分析清楚。比如夫妻老婆店、奶茶店、理发店、餐饮店、酒店、网吧等。你能不能让店家买到一块屏的同时,很快自己上手制作店面广告?
我们现在做了覆盖整个线下业态 80% 以上场景的不同模板。买一块屏放在店门口,就可以每天自己动手做一条广告。以前找别人做广告,成本还是很高的。
卫诗婕
这很有意思。广告能力其实是一个通用需求,小到夫妻老婆店,大到全球体育赛事和超级连锁店,都可能需要自己的广告能力。
梅涛
是的,我们把广告设计能力交给店主自己。他有了 Agent,就可以随便创作。
卫诗婕
AI 时代为什么要软硬一体?
梅涛
因为线上流量入口现在已经很贵了,但还有很多其他入口。手机是终端入口,车载是终端入口,线下门店也是终端入口。
所以 AI 下半场,我认为大家应该从模型到 Agent,再从 Agent 到用户交互,也就是终端入口,一定会往这个方向走。我们要提前布局,找到适合团队、适合公司的终端入口。这是我们的战略选择。
卫诗婕
AI 上半场是模型能力的比拼?
梅涛
上半场是模型。我觉得 AI 像篮球比赛,不像足球比赛。足球有上半场、下半场、加时赛,最后可能还有点球;篮球有 4 节。
今天我觉得我们处于第一节快结束、进入第二节的阶段。
第一节是大模型的比拼,它会迅速收敛。第二节是 Agent,包括通用 Agent 和垂直领域 Agent。第三节可能是终端、流量入口、用户交互和软硬件。最后可能还有另一个阶段,我现在还没有想好是什么,但一定会有。
卫诗婕
你觉得这个四节的进程会非常快吗?会快于互联网吗?
梅涛
肯定比互联网快得多。大模型本身发展已经很快,模型参数超过万亿级,还是十万级、百万级 GPU 互联的巨大工程。即使这么复杂,基本上 3 个月、6 个月就是一次大迭代。
如果构建在上面的 Agentic AI、Agent,那么这个领域的迭代肯定远快于大模型。大模型半年迭代一次,Agent 可能 3 个月迭代一次。再往后,流量入口和软硬件一体的迭代可能会更快。
卫诗婕
我们接着 Sam Altman 的问题。你是理解他当时把整个 OpenAI 往商业化方向转的吗?
梅涛
对,需要不断烧钱,也要找到投资人。谁能给你一年投 100 亿美元?
卫诗婕
但有一个很有意思的问题。Sam Altman 提出以商业化为引擎,支撑公司的模型发展,这套逻辑是 make sense 的;但 Dario 没有留下,出去做了 Anthropic。今天 Anthropic 看起来大有赶超 OpenAI 的趋势,你怎么看这段历史?
梅涛
我对这段历史没有特别深入的研究,只能说一下自己的判断。
我觉得,对技术的使命感和执着一定要有,但很难保证所有人都正确。在某个时间点,每个人的选择我认为没有绝对的对错。
Dario 当时不是公司一号位,不知道公司的经营情况;Sam Altman 可能知道公司的经营情况,更多是从公司战略和可持续发展的角度考虑,怎样让公司两条腿走路:一条腿做研究,一条腿做商业化。
Dario 当时在研究团队里,看到一些技术突破点,认为往前走一步可能会走得更远,单点就能突破。所以他出来做 Anthropic,我觉得是比较合适的。
回头看,没有绝对的对错,只是在当前节点,基于公司的情况,做了适合公司的选择。
我再补充一点,Sam Altman 和 Dario 可能是两种不同的个人主义。Dario 可能是个人理想主义者。我看过他的一些表达,有人把 Dario 称为真神,把 Sam 称为伪神。
卫诗婕
是的。
梅涛
Dario 可能比较喜欢研究社会学和历史,很多想法里有哲学思想。但 Sam 不一样,他是投资人出身,可能更现实一点。
所以我觉得,这是两种不同的风格。今天看,可能某些人走得更接近我们的想象,但长期来看,两个人可能都是对的。没有绝对的对错,只是一时的选择不同。
卫诗婕
我有一个不同的观察。在 Dario 出走的节点,OpenAI 提出的也是一个非常宏大的叙事:一直追求通用 AGI,甚至 ASI。那是非常宏大的叙事。
Anthropic 出来后不久,很快做了一些战略上的放弃,核心聚焦在 coding。今天来看,coding 帮助 Anthropic 走到了现在的位置。您怎么看?
梅涛
这可能跟公司一号位对技术的认知有关。我最担心的一点就是认知问题。一个公司、一个人,永远只能挣认知范围里的钱;超出认知范围,基本就看不到。
Dario 和 Sam Altman 的选择,肯定也基于他们对技术的认知。
对 Sam Altman 来说,我猜他需要一个宏大叙事。这个叙事里要做 AGI,不仅包括语言模型,还包括图片、视频、3D,以及各种能力,包括 coding。
Dario 的判断可能是,coding 有严谨的逻辑能力,能够闭环。coding 做得好,可能语言模型才能做得好;coding 做得好,才能在上面叠加更强的 Agent 能力。
这是不同的判断,因为两人的身份和背景完全不同,所以两家公司做出了不同选择。
卫诗婕
你觉得自己更像哪种画像?
梅涛
目前来说,我更偏向 Sam Altman。
如果今天我在硅谷,肯定会更 prefer Dario 的做法,奔着一个执念去做,暂时的商业化也可以不管,因为只要做到那一天就能爆发。
但我们今天在中国,融资体量没有美国那么大。如果要做跟美国一样的事情,资源可能不够。而且中国投资人的环境也不一样,他们可能要求你不断沿途下单,不断证明商业化能力。
如果我告诉投资人,需要很长时间才能商业化、很长时间才能爆发,可能还没做到那一天就已经死掉了。
所以在不同国家、不同地区,叙事方式应该不一样。说实话,在中国创业比在硅谷难得多。
卫诗婕
你的意思是,更偏向像 Sam Altman 那样现实的叙事?
梅涛
现实的叙事,并不是说什么都做,而是综合判断公司的可持续能力。
如果国内融资环境更好,更支持长期研究,能够融到足够多的钱,有足够的算力和人力密度,那可以沿着一个方向走。但今天看来,Anthropic 的盈利能力更强,因为它的收入马上就要破万亿了。
卫诗婕
这也是一个短期现象。两家公司的曲线未来可能会不断交叉,因为模型能力会不停 PK。
梅涛
对,包括 Google 的 Gemini 也会冲进来,它已经冲进来了。
人工智能领域不能静止地看一个事情,也不要只看某个时刻,要看前后左右的跨度。今天的第一不代表明天的第一,榜单排名也会不断交织、向上变化。
卫诗婕
但 Anthropic 选择的道路还是挺聪明的,coding 的能力高于一切,coding 确实让很多普通人和程序员每天都能使用它,天花板很高。
所以你的意思是,在公司实现创新和商业化的模式上,希望对标 Anthropic;但在创始人画像上,希望学习 Sam Altman?
梅涛
是的。做一个足够长的叙事,吸引更多资源,跑一个长跑,这是我的判断。
卫诗婕
您是全球最早做出文生视频模型的人。这个项目叫 TGAN-C,怎么念?
梅涛
Temporal GAN。T 是 temporal,持续的意思;GAN 是生成对抗网络。后面的 C 是 caption。
卫诗婕
这个名字起得不太好,要解释半天。
梅涛
对,肯定不是一个好名字。
卫诗婕
刚才提到,最早做这篇论文的作者今天还在 HiDream,其中一些人后来跟你去了京东,再出来创业,是吗?
梅涛
是的,因为那是 2017 年的事情,几个核心人员一直在一起。
卫诗婕
你最早对 CV 的热爱,是从什么时候开始的?
3. 文生视频的四个阶段
梅涛
最早可能从大学开始。那时实验室很多师兄在做图像、视频压缩。实验室有个项目,跟一家医疗器械公司合作做医学影像处理和压缩。
医学影像很大,不像今天的普通图片。普通图片通常是 8 bit,医学影像可能是 16 bit、12 bit,甚至更高,因为它非常高清,一张医学影像很大。小的 3.5 英寸磁盘根本存不下,所以当时一定要做压缩。
我看到他们控制信号的 PSNR,也就是峰值信噪比,再控制压缩率,就能把图像大小放大或缩小,把几百 MB 的影像压缩到几 MB。我当时觉得很感兴趣。
我自己也对摄影和美术感兴趣,所以觉得影像、图像和视频是我的兴趣点,就入行了。
整个视频多模态的发展,大概有几个阶段。
最早是种子期,那时不叫 text,叫 caption。Caption 就是给一段视频或一张图片做描述。那时李飞飞和很多研究员都在做,大概从 2011 年、2015 年开始。那时我们叫多模态,也叫 cross-modal,跨模态。
做得比较多的是 video-to-language 或 image-to-language,本质上是视频分析,只是比过去分析得更快。
过去是 AI 1.0 时代的判别式 AI;后来叫生成式 AI,是因为不仅要判别,还要把判别出来的词组成完整的文字和故事,叫 vision-to-language。
到了 2017 年,我们想反过来做:能不能从文本生成图片,再生成视频?
但这很难。vision 到 language 是从高维信号到低维信号的转换,是多对一。图片是二维信号,视频是三维信号,从高维到低维比较容易;反过来从低维做到高维就很难,因为没有标准答案。
比如生成一个人牵着一只宠物狗,这个人有很多种可能,狗也有很多品种。所以它不是标准答案,验证可行性也很难。
卫诗婕
缺少评估。
梅涛
对,缺少评估。
所以我们做了实验。既然是 cross-modal,从一个模态到另一个模态,也可以反过来想,从这个模态到那个模态。
2016 年、2017 年,MIT 的教授已经开始做文生图。因为我们做的是视频,我当然觉得做图还不够,视频要做好几帧。
当时我们做了第一篇论文,基于生成对抗网络。那时只能生成大概 80 帧,也就是 3 秒、4 秒,48×48 像素的 GIF。
前两天 Open Day,我们还把那个视频给大家看了,非常模糊。只能生成阿拉伯数字飞来飞去,或者一个厨师在煲汤,汤糊到看不出是什么汤。
很多人当时质疑,生成这个有什么意义。但我觉得这是一个代表性工作,证明我们有一个 bold、brave 的 idea,想做这件事情,从 0 到 1。
你质疑也好、不屑一顾也好,我们至少往前走了一步。
当时那篇论文投了 ACM Multimedia,但不是 regular session,而是 Brave New Ideas。只要你有勇敢的 idea,就把它做出来。哪怕没有实验结果,哪怕实验结果很差,也可能被接受。
所以那时想做这件事情需要勇气,这就是种子期。
后来到了 2022 年,Stable Diffusion 出现,进入萌芽期。我们看到一种新技术:Diffusion 比 GAN 能够更好地实现图像生成。那时我就觉得,图片生成大有可为。
2022 年我们准备创业,2023 年创立公司。真正跨越一个 gap,是 2024 年 Sora 出现,进入发展期。那时发现,原来视频可以做得这么稳定,也让早期尝鲜者和专业用户能够使用。
又过了两年,到了 2026 年,Seedance 出现后,我觉得进入了爆发期。它相当于跨越了第二个 gap:从专业用户到普通消费者,或者半专业用户,也可以创作比较稳定的视频。
所以我认为,整体是从种子期到萌芽期,再到发展期和爆发期。
卫诗婕
我们逐个聊一下,每个阶段跨越背后的技术本质是什么。从 GAN 到 Stable Diffusion,背后的技术发生了什么变化?
4. 从 GAN 走向统一架构
梅涛
在种子期,GAN 本质上还是用 CNN,也就是卷积神经网络。GAN 有两个网络,一个负责生成,一个负责对抗,判断生成的东西是真是假,有点像左右互搏。
我们做 TGAN 时,模型大概只有几千万参数,非常小,网络架构也是卷积神经网络,参数量和网络能力都不够大。
到了萌芽期,出现了 Diffusion,使用 U-Net 架构。这个架构跟 GAN 完全不同,不是左右互搏,而是基于物理学、热力学的扩散原理。
它的本质是:拿一张图像不断加噪声,经过很多步,最后变成完全被噪声淹没的白噪声图像。去噪过程则是从白噪声开始,逐渐恢复成原来没有被污染的图像。
把每一步变成一个神经网络,从第 t 步到第 t+1 步,用神经网络模拟数据的加噪和去噪行为,这就是 Diffusion 模型。但其中的神经网络架构仍然是 CNN,是卷积神经网络。
到了 DiT 阶段,它仍然是 Diffusion 框架,还是加噪和去噪,但 backbone 从 convolutional network 换成 Transformer,scale-up 能力更强,上下文处理能力更好,对整个视觉世界的模拟也更好。
Sora 出现后,OpenAI 说 Sora 是对世界的模拟器,复刻能力很强。那时就进入了以 Transformer 为基础的 Diffusion,也就是 Diffusion Transformer。
到了爆发期,像 Seedance 也是基于 DiT 架构。现在我们又发表了 UiT,UiT 比 DiT 更进一步。
DiT 有一个问题:虽然复刻能力很强,但图片、视频、文字进来之后,都要经过单独的编码器。因为它是在隐空间里做 Diffusion。无论是文字、语音、图片还是视频,都是不同信号,有的是一维,有的是二维,有的是更高维,需要编码压缩到一个共同空间,才能做互操作、cross-attention,让不同模态对齐。
问题是,所有模态都经过压缩,压缩之后就会有损。最后重构时还要解码,从低维空间升到高维空间,这会带来幻觉,也可能变得不可控。
所以我们今天做了 UiT,也就是 Unified Transformer。它没有编码器,也没有解码器。文字信号和各种模态信号进来,都是 token,都是离散信号,没有问题。
我们直接在离散空间里做互操作和 cross-attention,没有编码,也没有解码。这样天花板更高,对多模态信号的像素级、token 级控制更好,也能支持更多下游任务。
UiT 模型是我们团队花了大半年时间训练出来的,非常不容易。
卫诗婕
这是独创的吗?
梅涛
UiT 是独创的架构。
卫诗婕
刚才提到 Seedance,它用的也是扩散模型,他们的架构是什么?
梅涛
大体上还是 Diffusion Transformer,还是 DiT。只不过它的数据做得更精细,规模做得更好,工程化做到极致。
卫诗婕
我理解,你们在架构上做了更新。
梅涛
对。我们觉得,创业公司如果跟大厂正面竞争算力和数据,不科学,也不值得,很容易被碾压。
创业公司只有两条路。第一条是在模型架构上创新。从原始创新角度来说,天花板可能比大厂更高。
第二条是,有了模型创新之后,用 1% 或 10% 的成本,再加上 10 倍的效率,去逼近甚至超过大厂的基础模型。
卫诗婕
架构创新也是我非常关心的问题。架构是最底层的东西,之所以有大语言模型,是先有 Transformer 这个架构。
今天讲多模态、全模态甚至世界模型,本质上模型要融入多维信号,需要一个更海纳百川、更大容量、更灵活的架构。大家其实都在探索架构创新,每家的创新也不一样。
今天大家有一个共识:在实时生成领域或者世界模型领域,架构还没有收敛,没有共识,每家都有自己的基因和特色。
梅涛
我们的目标是,让所有信号、所有模态都能够原生、无损地在模型里互操作和学习。这是最原始的想法。
有句话叫青梅竹马,两个孩子两小无猜,长大之后才有更好的信任和默契。所以我们希望信号在原生层面,不经过压缩和编码,就能进入 Transformer,形成原生的全模态 Transformer 架构。
我们没有颠覆 Transformer,因为 Transformer 是非常底层的 backbone。但我们希望在框架上做创新。比如有 GPT 框架、DiT 框架,我们今天做了 UiT 框架,这是框架性的创新。
卫诗婕
在 UiT 框架里没有编码和解码过程,会不会消耗更多算力?
梅涛
是的。这也是为什么训练花了大半年。首先框架本身是创新的,没有人走过这条路,所以一开始我们也不知道它能不能做成、能不能收敛、能不能达到预期。
我们只是有一个 guess,有一个判断,觉得应该这么做。这源于团队对技术的预判和认知。
卫诗婕
能讲讲这个技术直觉吗?为什么觉得需要一个更原生的架构,让这些信号从 day one 开始就融合?
梅涛
我始终觉得,世界上每个模态的编码如果要统一,是很难的。
现在做 DiT,比如文本压缩,会受到大语言模型的牵制,因为会利用现有大语言模型的编码。图像和视频也有各种 VAE 编码器,但没有统一编码。
不同编码始终有一个问题:它不够原生,你不知道信号在哪里,也会有很多损失。损失之后在隐空间里学习,你也不知道它到底学到了哪个层面。
每种模态的抽象程度不一样,文字可能抽象程度高一点,图像可能低一点,无法真正对齐。最后控制生成时,比如我拍了一张你的照片,希望把眼睛、鼻子修一下,大概可以做到,但要修到细节和像素级就比较难。
因为它是在隐空间里学习,不是在显式的 pixel 层面学习。所以不能支持很多下游任务,会产生幻觉,精度、颗粒度都不够细。这是以后一定要攻克的过程。
我们团队有很多博士生,我现在也还在带一些博士生。大家每天大量阅读 arXiv 论文,不断讨论:“像素级别是不是可以做了?”
像素级方法在学术界已经有一些端倪,也有小规模尝试。但如果只在学校尝试,无法在大规模上验证真伪。所以我们立刻捕捉到这一点,想把这个 idea 用在超大规模视频生成上,做了很多突破性尝试。
说实话,当时也觉得这条路有点危险。因为 DiT 已经被验证,沿着 DiT 堆数据、堆算力,就可以得到确定性结果。
但这样走不行,因为巨头会这样走。他们有无限量数据、标注和算力,本质是资源堆叠,在确定性方向上带来最大化的确定性结果。
卫诗婕
而且这种做法也没有解决用户痛点。用户希望确定性更高、可控性更强、产品更好用。
梅涛
所以创业公司要走另一条路,不能只堆数据、堆算力。必要的算力和数据当然要有,但架构一定要创新。
我必须用十分之一的人力物力逼近大厂效果,甚至超过它。
卫诗婕
架构创新是你找到的支点,才能加杠杆。
梅涛
对,架构创新加效率、降成本。
卫诗婕
你们最近在 Artificial Analysis 榜单上取得了一些成绩,看起来新架构确实有价值。但架构一旦出现,大厂抄起来是不是也很快?它们也可以随时切换架构。
5. 开源证明持续创新
梅涛
这个问题我一点都不避讳。架构或算法创新,只能让你保持大概 6 个月的优势。但我们一点也不担心,因为我们有持续创新的能力。
你看我们把它开源了。开源非常考验公司的创新力。
这是我们的第二个 bet。第一个 bet 是走架构创新;第二个 bet 是相信自己能够持续创新。
开源模型的国际排名非常严格,冲榜模型跟开源模型要一一对应,平台会严格验证,还会看你的架构是不是新的。
我们开源之后,相当于把自己掰开揉碎,敞开让别人看:到底只是堆数据、堆算力,还是确实有架构创新。整个 community 很快就会知道。
HiDream 在社区里声誉不错,因为大家觉得我们一直在做架构创新。很多人评论说 HiDream 很厉害,确实有底层创新,不是为了刷榜、冲榜而冲榜,而是因为有架构创新,才顺便去榜单上展示。
一个公司如果敢开源,就像 DeepSeek 一样,等于向别人证明自己的自信。中国公司在目前情况下开源,也是一种战略选择。
因为我们确实没有大洋彼岸那么多资源。资源是我们的 10 倍、100 倍,那我们就用开源、效率和成本去逼近、顶住它,直到有一天自身规模也变大,从初创公司成长为中型公司,再成为大厂,最终超过它。
卫诗婕
开源具体给创业公司带来什么?
梅涛
带来很多方面。
第一个是 branding。开源后,社区下载量几百万次,大家在 X 上讨论 HiDream,讨论开源模型,会形成对公司的品牌认可。好的技术人员也会愿意来公司,所以品牌最大的价值是带来人才。
第二,我们可以基于开源社区的反馈迭代下一个模型。别人会在开源模型上做各种尝试,我们可以 track,也可以跟这些人交流。
好的研究员一定会相互交流,我们会通过反馈研发下一个模型。
卫诗婕
他们一定会反馈吗?
梅涛
不一定,但有些人会找到我们,跟我们交流。
第三,因为开源模型生成成本比较低。我们开源的模型只有 8B,进一步蒸馏后可以做得更轻量。这样就能让更多用户在端上运行模型。
当很多人接入我们的网络、服务,token 消耗量就会起来,所以有很多好处。
但不管怎么说,开源意味着把自己暴露出来,血淋淋地躺在别人面前,让别人审视你是不是一家真正技术创新的公司。做技术的人第一眼就能看出来。
卫诗婕
Artificial Analysis 榜单是全球公信力和权威性最高的榜单之一,可能最能代表民意,也比较公平,因为是匿名上榜。它的开源榜和闭源榜意味着什么?
梅涛
上榜过程非常难。你提交一个模型和接口,组织者会让你的模型跟匿名模型 PK。比如先从第十名开始,打过第十名就是第九名,一步一步打,直到打不动为止,是一种打擂过程,所以客观、公平。
当然,如果是开放式问题还好;如果是有标准答案的问题,可能有人刷榜、冲榜拿第一。
但我要纠正一点:榜单第一不一定代表产品力第一,产品做得第一也不一定代表商业化第一。这是两个概念,但有一定关联。
Artificial Analysis 上,开源和闭源模型是放在一起评测的,没有所谓开源榜和闭源榜,但会有 open weight 和非 open weight 的选项。
如果选择 open weight,我们就是第一。我们还有一个非 open weight 模型,也在冲榜过程中,可能很快就会有结果。
卫诗婕
开源第一和闭源第一,在行业里有什么区别?
梅涛
开源第一对开源社区意义更大。就像 DeepSeek 拿到第一,对闭源模型的冲击很大。假如闭源模型做不到比开源模型更好的结果,那它就没有存在价值。
我们开源的目的,就是逼着闭源模型做得比我们好,而且要好一个 level。否则用户就会基于我们的模型做开发。
闭源第一意味着这家公司的研发产品能力排名靠前。闭源模型是所有公司把全部资源和精力投入进去的产品,最耗钱、最耗资源。
闭源第一也更意味着当前全球 SOTA,但它会不停刷新,排名交替变化。
所以中国公司首先要留在第一方阵,就像跑马拉松,前 5 个人一定是第一方阵,后面可能是第二方阵。我们一定要挤在第一方阵里,偶尔第一、第二、第五都没关系,只要留在第一方阵。
然后通过产品能力在产品上超越,通过商业化取得更领先的位置,这是我们的打法。
卫诗婕
我听过一种说法,中国媒体、自媒体网络经常说,中国大语言模型冲到 SOTA、进入世界第一梯队。但在硅谷看来,中国 LLM 始终处于第二梯队前沿,没有上第一梯队的牌桌,也没有达到 SOTA。你认同吗?
梅涛
客观来说,大语言模型里国内模型跟海外模型还是有差距,特别是闭源模型。
第一,国内公司做的时间没有海外公司长。发展历史比 OpenAI、Anthropic 短,Google 做的时间更长,连 Transformer 都是 Google 做出来的。
第二是算力,差距巨大。比如 xAI 有 20 万张卡,中国几乎没有哪家公司超过 10 万张卡。即使接近 10 万张,放在预训练上的也很少。
据我了解,中国大厂可能只有几万张卡做训练,而 OpenAI、Anthropic 是几十万张甚至 100 万张卡。
算力差距很大。虽然我们也有很多国产芯片,但追赶需要时间。算力差别有点像“贫穷限制了想象力”:本来可以上高中、考大学,现在只能上初中,因为没有那么多钱和时间。
卫诗婕
那在 MLLM、多模态、全模态领域也会这样吗?
梅涛
这方面不一样。国内公司,比如字节的 Seedance,可灵,也做得很好。
Sora 出来时很惊艳,但视频领域对算力的要求没有那么高,数据方面中国公司反而有优势。
之前我跟北大学者聊过,他有一个判断:直觉上觉得长视频越多、数据越多,多模态视频模型训练得越好;但他认为短视频更有利于视频模型训练。
比如 TikTok、抖音拥有世界上最海量的短视频数据,所以有理由做得更好。但后来字节的 PR 私下跟我说,他们没有拿用户数据训练。
卫诗婕
您怎么看这位北大学者的判断?
梅涛
基本上所有模型公司都在使用大量数据,数据来源我们不太清楚。但用得最多的,确实是网上 15 秒、30 秒或 1 分钟的短视频。
训练时,我们会把长视频切成短视频,基本单元是 5 秒、10 秒、15 秒。再长,比如 30 秒、1 分钟,训练算力就不够,因为它需要支撑更长上下文。
所以这位教授说的并不是短视频数据本身,而是训练视频模型时,一定要把视频切成短视频进行训练。
短期内,大家看到的可能是单镜头,或者两三个、三五个镜头、15 秒的视频,画面感和视觉效果更好。
Seedance 出来后,叙事感更强,故事性更强,因为它知道怎么分镜,怎么在镜头内切换。还有一个非常重要的变化,是它看上去符合物理规律,抽卡成功率更高。
但今天最好的视频模型,依然不能解决客户所有要求。很多客户仍然要抽卡,也就是不断试错,直到模型生成完全符合要求的结果。
卫诗婕
现在还不能一次性就对,要抽几次。
梅涛
对,要抽几次。
2023 年我们连图片都要抽 4 次。你还记得 Midjourney 一次出 4 张图,我们当时也是一次出 4 张,后来变成一次出 2 张,因为抽卡概率提高了。当然我们也不想提供 4 张免费的图片。
所以技术一直在演进。今天的第一不代表明天的第一,Google 的 Gemini 也会有新结果。
这个领域非常有意思。我们刚创业时,有人说:“梅博士,我看你们创业,投资人都很焦虑。今天这个第一,明天又换成那个第一。”
我说我们不焦虑,反而很兴奋。我们是技术背景出身,看到这些东西就是我们的战场,是我们的舒适区,所以会兴奋、亢奋,而不是焦虑。
焦虑的人,只是因为没有技术优越感,或者没有自信。战场要留给有准备的人。军人就是要上战场的。我们是科研和 researcher 出身,进入这样的战场,是我们的职责,也是唯一能让我们实现抱负的地方。
卫诗婕
你刚才说,在多模态和视频领域,中国虽然没有硅谷的算力,但有数据。为什么中国在视频数据方面会优于美国?
梅涛
并不是说中国的视频数据一定优于美国,而是我们基本也能 access 到对方能够 access 的数据。
另外,中国很多短视频数据规模确实很大,全球最好的视频平台基本都在中国。
架构还没有收敛,意味着大家可以在一定算力限制下做各种架构创新。如果今天多模态视频架构已经定下来,所有人沿着一条路走,就只能堆算力,比不过大厂。
做视频模型,几千张、几万张卡都可以做,还没有大到必须 100 万张卡才能做的程度,还没有进入语言模型那种完全规模化趋势。
卫诗婕
还没有进入军备竞赛。
梅涛
对。今天多模态还不走军备竞赛,我觉得还在 GPT-2、GPT-3 阶段,没有到 GPT-4、GPT-5。这个阶段还在上升期,有很多机会。
卫诗婕
回到你最早在 2017 年做的世界上最早的文生视频模型 TGAN。2017 年 6 月 Transformer 架构在 OpenAI 的论文中被提出,你当时有留意到 Transformer 吗?
梅涛
我们留意到了,但当时觉得隔行如隔山,认为那是自然语言处理领域的东西,还没有把它们连接起来。
我们论文应该是 2017 年 10 月发布,工作大概 7 月完成,或者 6 月完成。那时各个领域还没有像今天这样融合。
当时的发展趋势是先在文本上做,先在机器学习领域做出好的模型,比如 ICML、ICLR 这样的会议。第一波使用的是做文字的 NLP 研究者,他们用得好之后,再进入图像。
卫诗婕
为什么先文字再图像?
梅涛
因为文字信号比较容易做,是一维信号,应用领域也更广。
这个模式在微软时我们就反复看到:从机器学习模型,到文字,再到图像,再到视频。文字永远走在图像前面,图像永远走在视频前面,因为文字很容易做小规模实验,很容易证明到底行不行。
卫诗婕
但我觉得还有一个重要节点。2020 年 GPT-3 的出现,证明 Transformer 能够吃掉海量数据,也证明了 scaling law。据我所知,国内最早一批做大模型的学者,都是从 GPT-3 看到信号,因为这条路被跑通了。
那时你有没有意识到 scaling law 可以被跑通?
梅涛
我们在京东时就开始做大模型加小模型。当时还有一位同事,也是我的科大师弟,陶大成陶院长,我们一起在京东开始讨论大模型和小模型结合。
在实验室训练大模型没问题,可以刷榜、发论文。但到应用场景时,还是小模型。
当时我们有一个 battle,到底是小模型还是大模型。我们做了很多工业质检场景,在常州几个工厂做工业自动检测。它需要很高的准确率,大概 90% 以上。
这时会发现,大模型不行,没有那么好的通用性。你在大模型上训练出来的小模型,容错率和精确率反而比大模型高。
所以当时的想法是,一个大模型带几个小模型,最后落地的是小模型,大模型只是藏在后面的专家模型。
卫诗婕
从 GPT-3 开始,scaling law 被验证,一直跑到今天。语言模型的 scaling law 天花板应该还没有到。
但在视频领域,scaling law 一直没有出现,多模态领域也没有出现。为什么?
梅涛
语言信号和视觉信号完全不同。
语言信号中,每个单词都有确定含义,是人类历史沉淀下来的知识。经过几千年沉淀,每个字符都有特定语义,已经是高度凝练、结构化的知识,连接也有迹可循。
比如英文有 2 万个单词,2 万乘 2 万的连接是可数的。
视觉信号完全不一样。到现在都没有一个明确定义,什么叫 token,什么叫 visual token。一张图到底有多少 token,一段视频有多少 token?
近似计算,一张图片大概是 10 万个 token,15 秒视频大概是 100 万个 token,数量非常密集。
2010 年左右有人做过 visual vocabulary,通过聚类把图像 patch,也就是小碎片,聚成若干类别,每一类相当于一个单词,叫 visual word,也就是图像词典。
当时我们做过实验,视觉单词要达到 120 万以上的量级,才能取得比较好的结果。我还有两篇论文因为 visual words 拿到最佳论文奖。
英文单词大概 2 万到 3 万个,常用词大概 6,000 个;图片里已经有 100 多万个单词,视频里更多,可能再乘 100 倍。
如果有 100 多万个 unique 单词,训练大模型需要的算力会更大。视觉信号和文字信号差异太大。如果用文字方式做离散 token,首先需要的数据比文字大得多,算力资源也可能是 10 倍到 100 倍。
而且我们从互联网拿到的视频数据,跟物理世界中我们看到的全部数据相比,还是小得多。
所以无论从数据 scaling law、算法 scaling law,还是算力 scaling law 来看,多模态还远远没有到 GPT-3.5 或 GPT-4 阶段,还停留在 GPT-2 阶段。
卫诗婕
你觉得多模态会有 scaling law 吗?
梅涛
我觉得肯定会有。
在 DiT 框架下,数据越多、标注越好、越清晰、越高清,高质量数据越多,模型效果就越好,这是肉眼可见的。
但到下一个阶段,是否还是 DiT,不一定。
大语言模型可能在 2027 年、2028 年用完通用数据,但多模态领域消耗数据的速度,可能还赶不上数据产生的速度。
人类每天产生大量视觉数据,但机器训练数据的消耗速度,还赶不上人类每天产生的新数据量。
卫诗婕
文字本身是结构化的,也是人类几千年来统治世界的一种工具。所以我理解,大语言模型站在人类结构化知识的肩膀上,天然跑得更快。
图像到视频,视频可能也是结构化的,但物理世界并没有那么多结构化,它是非常原始的信号。
我听过一种说法:语言中的每个字都有统计意义,所以大语言模型是一个概率学问题;但像素点没有统计意义。
梅涛
像素没有统计意义,这一点我同意。
现在计算机理解的像素就是一个点。如果是普通信号,就是 RGB 三个通道;如果加上深度,就是 RGBD。
每个通道是 8 bit。比如 R 通道有 0 到 255 的取值。如果不做任何量化,RGB 的词表空间就是 256 的三次方,RGBD 就是 256 的四次方。
你算一下这是什么数量级。跟文本几万个单词相比,像素的空间特别恐怖。
而且像素之间关联较弱,有时是随机的。所以图像和视频里的词元 token,不以像素为单位,而以 patch 为单位。图片里可能是 3×3、5×5、7×7 的小方块;视频里可能是 3×3×3,是带时间维度的 cube。
即使这样定义,也还不是完全被认可的方式,因为太难了。视觉信号太原始,没有结构化,也没有高层语义,是完全不同的模态。
卫诗婕
我去年在硅谷跟 DeepMind 的科学家有过一次对话。他们判断,多模态的技术发展会比语言模型晚两年。
但非结构化、非统计意义的像素生成和推演,真的能够像大语言模型那样保持这么快的速度吗?它的 scaling law 真的会出现吗?
梅涛
Scaling law 一定会出现,但是不是两年,我现在不好判断。
现在 AI 领域很多事情后来都会被证明是错的。我不认为纯视觉领域本身就是智能。
大概两年前,我在香港参加论坛,现场几位顶尖教授认为,视觉模型或者 DiT 并不负责产生智能,做的是 replication,也就是复刻。
我们看到的世界,可以把它完全复刻出来,也可以不断组合,组合成新的事物。但你说其中到底有没有像大语言模型那样,隐藏着世界知识的智能,我认为很难。
目前模型只负责复刻和创造,很难产生新的智能。
但未来一旦出现全模态,它把语言知识放进去,通过视觉信号和语言文字对物理规律的描述,可能产生新的智能,或者产生真实的人跟世界交互的能力。
什么时候出现,我现在不敢判断,但我觉得不会特别久。
卫诗婕
之前李飞飞团队的谢赛宁说过,他认为 LLM 是自监督学习,CV 是强监督学习,这是最本质的不同之一。您认同吗?
梅涛
是的。我们的训练方式跟语言模型完全不同。
语言模型是 next-token prediction。它只要把当前的字掩盖住,用前面的字预测,就可以完成自监督学习。
卫诗婕
因为它有正确答案。
梅涛
对,它有正确答案。
视觉不一样。生成时需要一个 pair 来训练。拿一张图像训练不够,一定要再拿它的文字描述,而且要一一对应,描述越精确越好。
图片和视频也是一样。拿一段 15 秒或 30 秒的视频,一定要写出很长、很准确的描述,才能放在一起训练。这是一对东西来训练,不像文字那样。
因为架构不一样,我们用的是 DiT,也就是 Diffusion Transformer。知道噪声图像对应的语义,才能通过语义反向生成照片。如果没有这个信息,无法训练。
所以视觉训练机制确实是有监督训练。
卫诗婕
自监督和强监督,最终会带来什么大的区别?
梅涛
自监督的 scaling law 可能爬得更快,AI 自己转得更快。
为什么图片和视频生成训练现在比较受限?因为不仅需要高质量数据,还需要高质量监督和高质量标注。标注就是监督信息。
卫诗婕
所以可以理解为,视频和多模态领域需要人工加入的成分,比大语言模型多?
梅涛
是的,算力可能也更多。
比如具身智能,需要人工操作,记录人手关节的 x、y、z,还有 6 个自由度、7 个自由度,甚至力控信息,需要很多强监督。
视频需要的监督可能比具身智能少很多,但比文字要多很多。
卫诗婕
大语言模型出现之前,行业流行一句话:“有多少人工,就有多少智能。”人工参与决定了技术高度。
大语言模型出来之后,这句话不太被提了,因为模型可以自学习、自进化。但现在讲更多模态融合、更多维度的智能,这句话好像又要出现了。
梅涛
早期确实需要人工,因为人工要判断标注质量,能不能做出更好的标注。
但后面不一定。现在多模态其实做两件事情:生成和理解。如果理解和生成能够统一,就既能做标注,也能做生成,二者统一后就不需要那么多标注。
人工标注只是为了从 0 到 1 的突破,建立少量高标准、有人类辅助的标注信息。
一旦训练出初步模型,它就可以自己不断标注、不断学习,把生成和理解统一起来。
卫诗婕
您刚才说,视频模型更多是复刻逻辑。当下最热议的世界模型,有两个倡导者:一个是李飞飞,一个是杨立昆。
他们的底层 mindset 完全不同。李飞飞强调让模型看见世界,先看见再理解;看见的方式就是复刻世界。
LeCun 则强调先懂世界,不一定通过看世界,也不一定通过复刻世界,而是放弃花里胡哨的细节,抓住世界底层本质,进行智能建模。
我不知道理解得对不对。您怎么看这两条世界模型路线和他们背后的思想?
6. 世界模型走向分流
梅涛
现在世界模型还没有收敛。很多人误解,觉得世界模型是一个模型,整个世界只会有一个模型,其实不对。当然,可能很多年后会出现统一的世界模型。
目前通往世界模型有不同路径,每个流派有不同 belief,这很正常。
比如你刚才说的杨立昆,他们提出 JEPA,想预测世界的状态,通过状态理解人和世界如何交互,背后其实是想做具身智能模型。
李飞飞他们更偏向于 3D 世界,希望重建一个 3D 世界,人可以在 3D 世界里游走、观察它长什么样。会有很多重构,比如高斯泼溅,需要通过大量 3D 信息和 3D 数据,例如游戏数据,去重建世界。
其中人和世界的交互比较少。
我们现在还有另外一种路径,就是做视频生成的这批人。我们相信,从日常接触的视频、真实视频里,可能学到更多物理规律和通用智能。不只是做具身智能,也不只是做 3D,而是先把视频学好,从视频中学习足够多的规律。
目前视频模型本身体量较大,基座模型能力也强,对物理世界的刻画和模拟,可能比其他路径更好。
我们的目标不是只做具身智能视频,而是做更通用的视频,包括短剧、影视、广告和社媒。所以我们做得更底层、更通用。
我们是 data-driven 的 belief,认为只要有足够多的数据,即使里面有很多物理规律,也可以通过视频模拟这些规律,再从模拟视频里学习到一些东西。
卫诗婕
你有一个观点,觉得视频模型是世界模型的重要底座。
梅涛
是的。
卫诗婕
为什么它非得是重要底座?
梅涛
你看现在所谓的世界模型,包括具身智能这类模型,模型体量都很小,大概几十 B 或一两百 B。
如果希望做一个具备通用能力的具身智能模型,怎么可能这么小?不可能只有这么小。
视频模型已经做到一两百 B,做到两三百 B 也有可能。视频模型比较通用,数据也通用。
它既包含第三人称视频,比如摄像头、摄影师拍的对话、各种视频和广告;也包含大量第一人称视频,比如戴头盔、戴头显,拍摄自己完成工作的过程。
训练视频模型时,各种视频都用在里面,学习的是更底层、更通用的智能或知识。
所以我觉得,只有见过这么多视频,通用性足够好,才能做更多泛化。这是我们的 belief。
如果只拿真实机器人数据来做,首先数据没有那么多,可能只有百万小时,而且不一定有。再做仿真数据,也不会很多。
如果没有通用性强、基础扎实的视频模型,想在上面做通用性好的具身智能,会比较难,因为见到的东西太少。
卫诗婕
还是取材于真实世界。现在有多少数据?
梅涛
是的。
卫诗婕
刚才你讲到了强监督和人工干预,但 AI 领域还有一个重要信仰,就是 Sutton 提出的 The Bitter Lesson:越少人工干预,可能才是机器学习更好的范式。
梅涛
他说的并不是不要人工干预,而是认为算法足够简单、elegant,就能通过数据和算力 scaling up。
人工参与是为了把算法设计好。要有好的算法,初始时还要给算法喂好的数据,所以初始数据需要人工参与。
就像教一个 baby,如果一开始教他坏东西,他可能会走偏。开始时要给他干净、标注好的数据,把他喂好,最后他才能在正确路径上自己学习。
卫诗婕
在视频领域,什么样的算法叫 elegant?什么样的数据叫好数据?
梅涛
我认为 DiT、UiT 这样的架构,就是比较 elegant、比较简单的架构。
以前有些架构设计得比较复杂,有很多 trick、人工 trick。越复杂的东西越难 scale up。越简单,越美好,这就是 The Bitter Lesson。
用简单算法喂更多数据,它才能建立更多东西。只要能记住上下文,只要能复刻,就可以更好地 scale up。
如果人工加载太多 trick,层层下来就是层层衰减,会带来更大误差。
卫诗婕
所谓多模态和全模态,到底区别是什么?
梅涛
很多人说多模态,其实是除了文字或图片,还有其他模态,比如视频、语音、3D、具身智能。只要有一个模态加另一个模态,就叫多模态,两个加一个也叫多模态。
全模态是把所有模态放在一起训练,而且是原生的。原生就是不做任何编码,直接训练。
所以两个概念不一样。目前我觉得我们正从多模态走向全模态。接下来还需要一段时间,把架构和数据做好,再从全模态慢慢走向世界模型。
卫诗婕
5 月 20 日是 Google I/O 大会,Pichai 发布了他们的原生全模态模型 Gemini Omni,也在提全模态。你们也发布了全模态模型,为什么大家都从多模态走向全模态?
梅涛
背后就是更底层、更原生地融合各种模态信号。
这里有一个重要概念,我看 Pichai 也讲了,就是 any-to-any。如果有一个统一的、原生多模态模型,它支持任意模态输入,也能支持任意模态输出,那么只要训练一个模型,就能支持很多任务。
现在的多模态有一个问题:训练一个多模态模型,只能做图像生成、视频生成;做视频编辑、图像编辑时,还要接一个小模型。这就不叫原生多模态。
原生多模态是信号 any-to-any,信号原始地进来,也原始地出去。这里有很多输入和输出,可以任意选择一个输入点和输出点,实现 any-to-any。
一个模型就能解决很多任务,用一个模型吃掉所有应用,这就是原生全模态。
Google 发布 Imagen Omni,也佐证了我们的判断:一定要从多模态走向全模态,并且在多模态里做原生全模态,才能用同一个模型完成很多任务。
卫诗婕
从去年下半年开始,Google 多模态带领它登上了大模型王座。Google 对你有什么启示?
梅涛
对我们来说,我们希望找出自己在视频、图像专业赛道里的独特性,模型一定要有差异化优势。
我们的模型在这方面的能力,要跟 Google 处于同一个梯队。在我们的专长领域,比如短视频营销、AI 短剧和社媒设计工具,要做到行业前三、头部。
大公司做底层基础能力,我们要在基础能力上基于自研差异化模型,构建应用壁垒、数据壁垒和行业壁垒。这是我们的差异化竞争方向。
卫诗婕
所以你的模型差异化主要体现在行业壁垒?
梅涛
第一,我们希望图片模型做到至少中国最好,能够跟 Google 的 Imagen,还有 GPT 一米九二相提并论、抗衡。闭源模型希望做到全球前三,开源模型希望做到全球第一。
在视频领域,我们希望在短视频营销、人货场视频生成、短剧生成里,做到最好的行业级视频模型。
卫诗婕
视频模型不会跟大厂直面竞争某个底层能力?
梅涛
对,我们不会跟大厂直面竞争底层通用能力,而是在垂直领域把它做到最好,落地速度比它快。
模型里肯定有自己的特色。我们要把行业数据做更好的标注,灌入模型。
同时,在给用户提供产品时,既使用自己的模型,也使用别人的模型,因为要提供端到端方案。比如我们平台里既有自研模型能力,也接入 DeepSeek 的文字能力。
所以我们既要在模型上差异化,也要在商业闭环上形成数据和应用壁垒。
卫诗婕
虎哥和字节,你更怕哪个?
梅涛
我并不是怕。公司关注好自己就行。
很多中国访谈和投资讨论都喜欢问大厂竞争。这是任何时代、任何一天都会面对的问题。如果因为有大厂竞争就不做,那就不用创业,也不用创新。
任何时代、任何领域都有大厂。没有大厂,也有中厂。这个问题不应该决定你做不做。
关键是,在大厂存在的情况下,能不能找到一家新的公司。人工智能领域,特别是二级市场,不仅关注大厂,也期待中型厂商和创业公司走上资本市场。投资人也会往这个方向布局。
今天的大厂以前也是小厂。
卫诗婕
谷歌的技术基因和字节的技术基因肯定不同。你们也有自己的技术基因。底层团队风格和技术风格上,有哪些不一样?
梅涛
我们没有那么大规模,所以首先要有很强的技术认知和技术使命感;其次一定要用最少资源、最快效率迭代模型,这样才能保证模型能力和创新能力一直走在大公司前面。
我经常讲,我们有三条曲线:公司的发展曲线,行业的发展曲线,也就是 AI 行业曲线,还有个人认知曲线。
我希望公司认知和个人认知在行业前面,或者曲线比行业更陡,这才能保证我们对技术有前瞻性预判。
因为效率高、成本低、掉头快,看到好的技术路线,就可能比大厂更快;发现路线不好,掉头也更快。这就是创业公司的生存之道。
同时,我们要在大厂暂时不会做的领域里,迅速建立声量、壁垒和用户心智。当年大厂也是这样做起来的。
卫诗婕
谈创业公司和大厂竞争时,大家只看到物理资源投入,很少重视时间资源投入。
现在训练任何模型都需要周期。多模态可能半年一个周期。小公司船小好调头,但大公司是巨型组织,有汇报文化,往往在一条错路上走到底,直到模型发布、结果很差,最上层才发现。
某种程度上,时间资源才是最大的资源。
梅涛
时间成本也包含做对事情的成本和做错事情的成本,要加在一起。
大厂很多时候因为架构、层级和内部利益,决策不一定来自一线炮火,可能做出不符合技术发展规律的判断。
创业公司跟一级市场投资人一样,赚的是认知的钱。我们一定要对技术有足够敏捷的判断,行动也足够敏捷。
卫诗婕
先聊聊为什么创办智象未来。你在京东经历了好几次多模态和视频领域的关键发展节点,可以从这里讲起。
7. 创办智象未来的选择
梅涛
创业原因很简单。我曾经在一家现在市值万亿美元、之前千亿美元的公司做过技术,后来又在另一家千亿美元公司做过高管。
我的下一站,就是想自己创立一家千亿美元公司。想法很简单、很朴素。
卫诗婕
从微软到京东,再到 HiDream。
梅涛
我觉得在大公司里,即使再优秀,也很难完全按照自己的想法做事,因为你永远要服务公司,个人要服务组织,这完全没问题。
但我希望独立自主地做一件事情。我觉得 timing 也到了。
这个想法其实很早就有。2015、2016 年微软时期,AI 1.0 也很火,很多人找我出来创业。但我觉得那不是一个好的 timing,所以没有出来。
卫诗婕
那时候李开复出来了。
梅涛
对。那时人工智能能力还没那么强。小冰只能对话七八轮,之后就失控了。
另外,AI 1.0 时代有四小龙,但我觉得他们更多关注人脸识别,领域有点窄,没有遇到让我觉得技术 disruption 足够大的浪潮。
我当时直接出来创业,也觉得从 Microsoft Research researcher 到商业化之间有 gap,所以希望找一个地方学习,提高认知。
那时京东找到我们。我想选一家商业场景广、接地气、场景丰富、容忍度大的企业,所以进去待了 5 年。
我在京东学习公司战略、管理、信息化运营、如何做产品、如何见客户。花 5 年学习,我觉得收获很大。
到 2023 年,不管是创业条件还是个人心智,都比较成熟了,所以觉得时间到了。
如果早半年出来,可能又不一样。但没有回头路,只能继续往前走。
卫诗婕
你是 2023 年决定创业的。2020 年智源研究院包括唐杰教授在内,很多人就开始做大模型项目。到 2023 年,智源研究院快被挖空,所有机构都在抢中国少数做大模型的人。那时你在做什么?
梅涛
2023 年我们刚创立智象未来,已经开始融资。上半年一边研发视频和图像模型,一边招人。
当时一线机构投资了很多语言大模型公司,对多模态、图片、视频并不关心。我跟他们说自己做的不是图片模型,他们经常拿我们跟 Midjourney 对标。我说我们做的是视频模型,但那时他们不信,因为还没见过 Sora。
当时视频效果也一般,坦白说,投资人的钱都砸到语言大模型上去了。
直到 2024 年 Sora 出来,第二轮投资人才慢慢发现,视频可以做,想象空间也很大。2025 年大家开始想商业化,觉得视频模型可以赚钱。
投资人也有认知迭代周期。但我们不能等,一直往前做。行业规模起来时,该来的人和钱都会来。
卫诗婕
我那天跟戴若黎博士聊天,他说 HiDream 前 5 页融资 PPT 是在他办公室写的,是这样吗?
梅涛
也不能这么说。大的想法确实跟若黎讨论得很多。当时他在西红柿资本那边兼职,走得比我快一点,因为他帮忙融资,接触了很多机构,积累了一定行业 know-how。
那时我刚出来创业,还是个小白,容易被人影响。但我很认可他的很多观点,所以在他办公室聊了两次,基本知道应该怎么讲创业叙事。
创业首先要有 narrative,他们也叫 growth,但我觉得应该叫 grounding。
你既要顶天立地讲好叙事,也要做好底层建设,商业化、技术和产品都要做。
所以那时跟若黎在他的办公室,确实聊了很多。
卫诗婕
听说你早期有两个细分创业方向:一个是多模态视频,另一个是具身智能。你在京东也涉及过无人物流配送、机器人等技术支持。
梅涛
当时确实有两个储备项目,但后来没有选择机器人。
因为当时我们在京东物流里做了两台机械臂,只是做拣选。在京东做机器人应用场景很艰难。
第一个,你不能改变现有工作流。比如每天有很多包裹从站点到各个小站点,要分拣。不能因为放了机器人,把原来的工作流切断,导致站点无法运行。所以要跟现有工作流无缝衔接,不能耽误别人。
第二,机器人要做到 7×24 小时稳定、高效运行。
第三,要算得过账。物流仓库主管的 ROI 只能按 12 个月算,因为预算只有一年。你跟他算 12 个月、18 个月以后,他根本不谈。
但账要算清楚,前提是机器人必须大规模部署。一台机械臂替代一个人工,账算不过来,因为放一个机器人还要放一个人看着,机器人可能出错、故障。
如果一个人能看 10 台机器人,账才可能算清楚。
所以当时意识到,在工业场景让机器人进厂干活,路径有点长。
卫诗婕
因为今天具身智能讲的是通用性。
梅涛
但我仍然觉得,在工厂里做通用有点难。你看今天哪家机器人的机器人能在工厂 7×24 小时不间断工作?这是很难的。
前两天 Figure AI 在拣包裹,它只是在分拣,并没有把包裹拿出来放进某个框里,离真正业务场景还很远,但已经很了不起了。
所以我觉得这个赛道不太适合我们,就换到另一个赛道,回到老本行做 AIGC、视频生成。
2022 年 7、8 月 Stable Diffusion 出来后,有一张用 Midjourney 生成的图,我记得是“太空歌剧院”。那张图拿到了一个州立摄影比赛的冠军,引起很多轰动和争议。
那张照片给我触动很大。看上去不像 AI 做的,有人的人文情怀,综合了很多要素。所以我觉得 AIGC 的可能性越来越明确。
那时我就觉得应该回到初心,回到 2017 年那篇论文的初心,几个人一起出来做视频生成公司。
卫诗婕
两件事其实都很远,但你选择了一件更喜欢、也更能商业化落地、能够沿途下单的事情。
梅涛
对。视频生成有一个好处,既能做通用人工智能的模型底座,也能商业化。
当时 Midjourney 一年已经有 2 亿美元收入,团队只有 11 个人,对我触动很大。
另外还有 Canva,当时已经是巨型独角兽,估值超过 400 亿美元。这是我记得 2023 年最火的两家多模态公司。
卫诗婕
当时还没有视频,主要是图片设计和图片生成。
这个行业里所有人都会关注和敬佩 Midjourney。所谓抽卡盲选,真正专业的设计师永远能猜中哪张图是 Midjourney 生成的,因为它非常风格化。您怎么看这家公司?
梅涛
Midjourney 在 2023、2024 年优势很明显。当时市面上 AI 生成的图片,有相当一部分来自 Midjourney。
但它也有天花板。它追求图片的设计感和美术感,所以先服务金字塔尖的艺术家、设计师。
后来你会发现,中间层的广告、海报,或者真人照片,被 GPT 一米级和其他大模型公司吃掉了。
Midjourney 是小公司,没有特别强的模型能力,但有很强的数据和审美。它在全球招募摄影师、艺术家,让他们贡献照片,所以一路聚焦艺术图片,强化自己的优势。
但它不够通用,也没有大模型的优势,只能越来越垂直。
卫诗婕
Stable Diffusion 在 2022 年出现。2023 年大家第一次看到 AI 生成图片,并觉得非常惊艳。之后,文生图、文生视频是怎么发展的?
梅涛
现在理解模型和生成模型还没有统一。
比如从图片生成文字、从视频生成文字,是理解;从文字生成图片和视频,是生成。
理解模型基本跟大语言模型架构统一,采用 autoregressive、GPT 的方式,把图片和标注放进去,学习图片如何输出 next token。理解模型跟大语言模型基本统一。
卫诗婕
这个节点是不是 2023 年 10 月 OpenAI 发布 GPT-4V 的时候?
梅涛
对,后来是 GPT-4o。GPT-4V 出来后,基本把理解型多模态统一了,可以文字到文字、图片到文字、视频到文字。
但从文字到图片、视频,是另一条生成路径。生成架构目前是 Diffusion Transformer,早期叫 U-Net,现在叫 DiT。
这两条架构目前还是 separate。
理解架构处理离散 token,不能把离散 token 变成连续 token;图像和视频是连续信号。生成模型则是连续 token 进来、连续 token 出去。
所以传统 GPT、autoregressive 架构不适合做这种事情。我们也比较过,如果用大语言模型的 autoregressive 方式生成图片和视频,质量和细节还是赶不上 Diffusion。
所以现在基本分成两派:一派做理解,一派做生成。
卫诗婕
但不是说原生一体化架构要把它们融合吗?
梅涛
还没有真正有一家把它融合起来。
卫诗婕
Sora 的出现到底有什么突破意义?
梅涛
有几个意义。
第一,它证明用 Diffusion Transformer 可以做到更高的天花板,提供了一条比较好的训练路径,也启发很多中国公司沿着 DiT 走。
第二,它证明 Sora 是 Sora,GPT 是 GPT。视频生成和大语言模型还是两个 separate team、两种架构、两拨人在做。生成和理解到今天仍然没有统一,是两条不同路径。
字节的 Seedance 和它的大语言模型也是两条不同路径。
这也是我们的预判:短期内我们希望生成和理解统一,但还没有找到更好的框架。所以现在生成还是生成,理解还是理解。
卫诗婕
但你刚才讲 UiT,把所有模态信息作为统一信号处理,本质上不是在解决两套架构的问题吗?
梅涛
我们是想在这里解决,但现在还没有完全解决。目前更关注用 UiT 做生成。
再往前走一步,未来有可能真正做到 any-to-any。包括 Gemini Omni,它做生成时,底层可能还是不同模型。
很显然,它把 Veo 3 集成到了 Omni 这个大的模型 hub 里。还是把两条路加了一个连接,而不是真正变成一个原生统一的大模型。
卫诗婕
也就是说,还是把两条路集成起来,而不是变成一个大的原生架构。
梅涛
是的。它那个 Omni 实际上是集成。判别式的 GPT-4o 那套完全没问题,包括声音。但要把视频和图像放在一个模型里,现在还是有点难。
我相信视频一定是不同的模型。将来有没有一天能够统一,还要拭目以待。
卫诗婕
您看 Google I/O,最关注的点是什么?它的 Agent 能力做得怎么样?
梅涛
下一步基础模型公司的竞争有几个点。
第一个是基本能力,也就是模型在榜单上的位置,是否不断推升智能边界。
第二个是 Agent 能力,包括 coding 等通用 Agent 能力,能不能做到最好。
我们更关注 Agent 层面有没有理念差异和变革式创新。
卫诗婕
什么是 Agent 方面理念的不同?它做 Agent 时基于什么想法?是更聪明的架构,还是只是利用行业 know-how 做固定编排?
梅涛
这很重要。
卫诗婕
所以业内人士还是看底层,不只是看上面做了什么,而是看结果背后的原因,为什么能做到。
现在不是所有领先模型公司都会慷慨分享技术报告。如果没有开源、没有技术报告,怎么推断底层有没有创新?
梅涛
其实底层有没有创新,我们还是很清楚的。每家公司都有自己的秘密 prompt。
如果参加高考这样的公开考试,测不出模型边界。我们会用自己的方式测试不同模型的边界能力。
如果边界能力没有突破,只是榜单名次提高,并不代表底层突破。每家公司都有特定测试集。
卫诗婕
在 AI 时代,不要只讲 manager。manager 只是平台给的职位,关键是有没有 leadership 和 vision。
好的 leadership 是什么?
梅涛
好的 leadership 是有宏大目标、清晰路径,而且能够帮助别人,有很强的利他想法。
别人会觉得跟着你,首先想到的是团队,而不是个人。
另外,这些人跟我一样,也有很强的技术使命感。
举个例子,我们以前在微软、京东,看到一篇论文或一个技术,第一反应是:“怎么不是我做的?”会觉得很羞辱,会反问自己,为什么别人做出来了,我没有做出来。
下一个是不是我做出来?如果还不是,我会分析原因:是氛围不对、能力不够、组织形式不好,还是自由度不够。
所以你会有很强的技术使命感。很多人来我们公司,不是为了什么,而是想跟着梅老师、跟着团队,做出最牛的技术,成为“这是我做的”。
如果只是为了挣钱、挣短期收益,可以去大厂。大厂给的薪水和现金比我们高得多。
他们是想自主做一件自己想做的事情,而且这件事足够大,技术和个人利益都能最大化。
技术人员最在意的,通常不是官衔、level 或现金,而是能不能在行业里确定自己的江湖地位,有没有拿得出手的作品,跟艺术家一样。
我要给他们这样的机会和土壤,也要证明我能带他们成功,他们才会跟我们一起做。
卫诗婕
你在微软待了十几年,从应届生 researcher 成长为技术管理者。怎么从研究员成长为技术管理者?
梅涛
我很早就开始规划职业。身边有很多厉害的 mentor,比如洪江、韦英、雅琴、Harry。他们每个人都不一样,但共同点是都在某个领域做到足够卓越。
我觉得追求卓越是每个人都应该思考的事情。我当时觉得,一个人要做成 T 字型的人,也找了很多公司内外的 mentor,他们给了我很多建议。
第一个建议是,先把 T 的竖做到最深,做到做不动为止,成为行业顶级专家,然后再发展横向能力,包括组织力、协调力、领导力、战略能力等。
第二个建议是,中国和亚太地区未来有很大的发展机遇。我当时也想过要不要去美国或其他国家,但聊完之后觉得,未来应该在中国。
因为这里发展很快,delta 很大,势能很强。而且中国人在中国人的环境里,更容易取得成功。
我看过很多成功华人,他们大概率是因为身边有很多华人在帮助他成功。说华人靠其他族群帮助成功,当然也有,但概率比较小。
这两点建议对我影响很大。到现在,虽然创业 3 年多,我形容自己是:稳定输出,持续推进,没有意外,只有惊喜。
公司没有遇到重大危机,也没有招一堆人又解雇一堆人,整体比较稳定。投资人对进展也很满意,觉得我们的认知迭代很快,几个月不见,就觉得我和团队又不一样了。
卫诗婕
我上次采访听到一句话:“没有失败的成功是不可信的。”但感觉你好像没有失败过。
梅涛
我们也有很多失败。我们做过很多尝试,也有不成功的,但很快意识到错误,就把它下档了。
卫诗婕
可以说说吗?
梅涛
可以。
一开始做 To B 时,我们选择了电商,还是京东的思维,想做国内货架电商。后来发现货架电商产品很难做、很难推广。
第一,货架电商比较传统;第二,它对广告素材的需求和变化频率没有那么高。摸索了一年多,才转到内容电商,也就是 TikTok 这样的内容电商或兴趣电商。
它们对图片和视频需求巨大。
当时做货架电商,有很多好朋友支持我,一下子充几百万元过来,我们有一些收入,但没有变成真正的增长,没有消耗 token。投入 100 万、100 万进来,更多是人情。
后来我们把这项业务退出,因为没有 token 消耗。我们反思,这条路可能走错了。
还有一件事,当时想做线下门店打印店生意。因为有一个客户和投资人,他有一个网络,覆盖全国线下门店大概 60%。
我们想做一个产品,帮助线下门店升级,从单纯打印业务变成具备设计能力的门店。
后来做了一段时间发现,打印店是夕阳产业,它们认知迭代速度也慢,所以放弃了这个业务。
你看我们做了很多贴地气的尝试,但不影响前进速度。
卫诗婕
Day one 很容易走上歧途:按照手里有什么优势牌去打,但那可能是一条弯路。你没有从底层定义今天最应该做什么,所谓拿着锤子找钉子。
梅涛
这是必然经历的过程。没有经历过,就不会突破认知。
创业最大的问题和挑战,在于团队或领导团队的认知是不是正确。
小时候接受的教育是做规定性题目,有标准答案。但创业没有标准答案,是在迷雾里寻找航行方向。
如果你看得比别人远,当然可能成功。但很多时候只能靠自己的 ego 或 guess 判断,还有很多人制造噪音,告诉你应该做什么、不应该做什么。但那些人往往自己都没做过。
创业过程中会遇到各种噪声,但最后要回到初心:我到底想干什么,应该做什么?是目标导向,还是能力导向?这是很有意思的过程。
卫诗婕
我很好奇,你们公司从 day one 的叙事是什么?跟今天有没有变化?
梅涛
如果从使命愿景来说,没有变化。我们希望用智能服务人类,创造美好生活。
从第一天开始,我们就跟投资人说,我们是一家模型和应用双轮驱动的公司。不仅要做最好的模型,也要做很好的商业化应用。
到今天我仍然这么认为。
中国创业者面临的问题,是怎样平衡技术研发投入和商业化,这两个都有风险。今天投入,明天不一定做得出来。即使砸很多钱,如果技术路线不对、找的人不对,也不一定做得出来。
商业化也是一样。做 To C 或 To B,如果行业不对、找的人不对,也可能夭折。
大方向一定要两手抓,但细节里还有很多战术,需要 look into the detail。
卫诗婕
2023 年融资应该不太顺利,因为投资人注意力都在语言大模型,对吗?
梅涛
能融到钱,但不算特别顺利。
卫诗婕
我记得 2024 年 2 月 Sora 出现后,一级市场有一个主叙事:寻找中国 Sora。
梅涛
中国投资往往寻求共识,一旦共识形成,就基本没有非共识。
中国早期 VC 投资,相比美国,确实显得不够多样,也不够大胆。
2023、2024 年融资并不容易。你跟投资人讲视频,他跟你讲图片;你讲模型,他讲商业化;等你讲商业化,他又转到别的地方,始终不在一个频道。
改变投资人认知很难,但我们比较能打,用有限资金、高效率训练模型,做商业化,不断证明自己。
所以今天多模态领域的创业公司并不多。
卫诗婕
2024 到 2025 年,中国一级市场有“寻找中国版 Sora”的叙事,但没有看到大规模投资。2023、2024 年投资都很冷,一直到 2025 年下半年才回暖。
我做 2025 年年中 AI 复盘时发现,国内在寻找中国版 Sora,但没过几个月 Sora 项目被砍。资本市场又降温,大家发现文生视频技术跑出来,却好像没有特别好的商业模式。
同时市场开始讨论世界模型,Seedance 也出来了,大家觉得这可能没创业公司什么事,因为大厂做这件事太顺理成章。
我说的这个逻辑对吗?
梅涛
有一点。
中国投资往往只投共识,跟风扎堆,觉得人多安全感好,大家在一艘船上,船翻了就一起翻。很少有人投非共识。
我们有底线思维:如果大厂把所有模型能力都吃掉,我们怎么生存?如果没有底层自研模型,怎么做?
做战略必须考虑底层思维,所以我们做了很多部署和规划,今天不能讲,但未来会看到动作。
当然还有上限思维:有自己的模型,能扛住大厂进攻,在细分领域保持第一梯队,那生意可能更好做。之后该怎么扩张?
做战略要同时考虑上限和下限,不能总有幻想。如果相信自己的模型永远第一,那就是幻觉。没有一家公司,哪怕大厂,也不能保证模型一直第一。
大厂反而比创业公司更焦虑,因为一旦离开第一梯队,影响是指数级放大的。
卫诗婕
你可以看到,2023 年还在谈第一波语言大模型的公司,现在还有多少留在桌面上?当然 coding 起来后,也有一些公司想做中国版 Codex,想做中国版 Claude Code,拭目以待。
刚才我们聊到,多模态大模型最早是单向生成,后来把语言模型能力和多模态生成嫁接,提升所谓智能。现在大家攻克第三阶段,希望做到 any-to-any,处在第二阶段到第三阶段跨越。
梅涛
是的,从多模态真正进入全模态。
卫诗婕
从多模态到世界模型,是必然吗?
梅涛
应该是必然。
倒推一下,AGI 或超级 AI、ASI,中间一定要经过世界模型。
卫诗婕
你定义的世界模型是什么?我发现每个人定义都不一样。
梅涛
大家定义不同。世界模型可以加定语,也可以不加。
如果不加定语,世界模型一定是通用世界模型:人能够跟自然世界交互、反馈、推理、做因果推断,把人类物理世界的物理规律集成到一个大一统模型里。
这个模型短期内我看不到做成的希望,但通往世界模型的过程中有很多分支。
第一条是杨立昆的 JEPA,预测 next state。
第二条是李飞飞的路线,做 3D 渲染和 3D 模拟。
第三条是我们这条路线,以视频模型为出发点,原生多模态,通过世界上的各种数据,从数据里学习物理规律,是 data-driven 的方式。
大语言模型单独走向世界模型,已经被普遍认为不太可能,因为它没有交互,也没有告诉你怎么做,它更像一个大脑。
这三条路如何 convergence,还没有定论。
卫诗婕
你觉得它们会交汇吗?
梅涛
我觉得未来一定会交汇,但现在还没有看到这样的架构。
包括今天的 Transformer 很强,但明天会不会有更强、不是 Transformer 的架构,也不好说。
技术大概 10 年一个周期,Transformer 到现在快 10 年了。我相信很多新架构的种子已经萌芽,只是我们还没发现。
最前沿的 researcher 和创业者,都会关注下一个新架构是什么。
卫诗婕
你怎么确保新架构出现时,最好是在你们这里出现;即使不是,也能成为最早发现它的那批人?
梅涛
这也是为什么公司有大量实习生。我们把微软成功的实习生制度带到公司。
我自己有一些读 PhD 的学生,也有跟学校老师联合培养的学生。他们过来试错,每天看大量 arXiv 文章。我们自己的研究员也会看很多新文章,筛选哪些可能对我们有帮助。
我们每年在顶级学术会议发表大概 20、30 篇论文。让学生和博士生参与前沿学术环境,派他们参会、看论文、看新 idea,才能第一时间感受到原始创新。
HiDream 其实早就想做 pixel-level 的新架构了。我们在学术界看到几篇有端倪的论文,效果还可以,只是在学校无法 scale up。
我们把它的思想和一些 trick 拿过来,做自己的底层创新。
没有这样的触觉和感知,很难建立这种机制。如果不能感受到最好的研究结果,可能就 miss 掉这一代,在认知上错过几个月。对 AI 创业者来说,迭代周期非常重要。
卫诗婕
历史上大的架构创新,好像人们记忆里都来自硅谷。中国人有机会做出架构式创新吗?从人才画像看呢?
梅涛
这是一个灵魂拷问。
我在中国带过很多学生,也跟中国学校老师合作过,带过国外来的实习生,还跟科大校友、微软校友讨论过中美人才培养机制。
目前在中国做 0 到 1 的创新,有点难,有点挑战。
为什么?跟教育培养模式有关。我们的教育喜欢教学生确定性的东西、确定性答案。学生也习惯 follow 老师安排,如果做一段时间没有结果,就会焦虑。
中国人才培养体系还不完整。我们跟在硅谷的科大师弟聊过,他们在美国读 PhD,老师基本手把手教。我们以前在微软带学生也是这样,我的老师也是这样。
一篇论文要改十几遍,讨论每个技术细节、方法论。老师会教你研究方法、研究套路和思路,毕业后沉淀出自己的研究价值观和思路框架。
有了这个框架,才能不断积累行业经验。如果再有大厂大规模使用的经验,就能迅速 scale up 能力。
但在国内,一方面不太鼓励创新,另一方面大学生跟工业界距离比较远。据我了解,很多老师不太愿意把学生送到工业界体验,这跟中美有明显差异。
第三,国内实验室里,学生很难得到老师一线的手把手培养。有些老师研究思路很好、研究技巧强,但带的学生太多,不可能每个学生都手把手教。
所以研究思路没有沉淀下来,也没有教会学生。
总体来说,AI 领域很多领导力创新发生在硅谷,是有原因的。这也是我创立公司的原因。
我经历过美国五百强企业,也经历过中国五百强企业,文化差异很大,员工状态也不一样。
我希望在中国创立一家有硅谷创新精神和创业文化的公司,让年轻人在这里开心工作、发挥创意,做成一家全球化科技公司。这是我的创业目标。
卫诗婕
具体怎么实现,让 0 到 1 的创新发生在这里,而不是硅谷?
梅涛
这涉及公司的基因。
早期创业时,我跟很多想加入公司的员工说,我们跟一般公司不一样。很多公司把组织放在第一位,但我们不是。
我们首先希望你在这里取得个人成功。你要把自己放在第一位,照顾好自己,把自己的情绪安抚好。这样在公司才能创造更多价值。如果心情不好,不要来。
我希望每个员工回答:你是不是足够自驱,愿不愿意成为行业最好的人?
公司大部分人比较自驱。晚上 11 点、12 点、1 点、2 点还有人,因为产品没做完,希望产品一定要在这个时候上线。模型团队基本每天都工作到很晚,因为机器不能停。
他们有自驱力和使命感,这才是创业公司的氛围。我认为创业公司最重要的是氛围,氛围不对,公司垮得也快。
卫诗婕
怎么分辨氛围对不对?通过结果,还是其他方式?
梅涛
结果重要,但过程也重要。不能只看结果。
如果团队自驱力不够,是可以感觉到的。
卫诗婕
怎么感觉?
梅涛
追踪过程,问他怎么达到的。
公司永远以商业化目标驱动,设置很多目标。但我们以前犯过错误,做年度规划,后来发现这非常扯淡,因为 AI 初创企业很难做年度规划。
现在我们调整为按季度规划,每季度制定 KPI、OKR。现在让团队自己提,产品目标由产品团队自己提,技术团队目标由技术团队自己提。
他们根据自己的判断、团队规模和市场竞争情况制定 OKR,这样更合理。
我们也开日会、周会 review 进展,看哪里出了问题。通过高效沟通,可以感觉团队有没有自驱力。
卫诗婕
如果氛围出现问题,该怎么办?
梅涛
看组织有没有部门墙,是不是人不够。
我最焦虑的是自己的认知够不够。第二是团队是不是齐整,是不是有更好的人要进来。
其他东西我都不太焦虑,唯一焦虑的是团队够不够强,够不够适合发展。我周末也在面试人。
卫诗婕
老板做什么,你就做什么?
梅涛
老板是六边形战士。
我们要见投资人,可能见政府领导,寻求地方政府支持;还要见大客户、招团队、看内部治理、研发进展和产品化进展。
一号位必须做好最后兜底。
公司跟人不一样。人有长板,只要把长板做到最强,短板短一点无所谓,因为每个人都有短板。
公司像木桶,不能有特别短的板,否则水会漏。每块板都要足够长,差不多一样长,有一块长一点可以,但不能有一块短。
创始人的压力很大,也很孤独,因为没人像你一样看得多。很多决策必须自己做,还会有很多噪音。
所以我担心的是认知够不够,能不能从每天跟客户、投资人、合作伙伴的交流里,得到市场最前沿的认知。
好处是我自己懂技术,对技术有很强判断,不需要跟别人学,内部可以自己判断。
卫诗婕
你刚才讲中国投资人不喜欢非共识,而是追求共识。刚才聊天里你已经讲到一个非共识:不要做拼凑的多模态,要做底层原生的纯模态。
除此之外,你还有什么非共识?你们也在提出世界模型,视频模型作为底座的世界模型,这算非共识吗?
梅涛
目前来说有点非共识。
我看到国内一级市场很多投资都投到机器人,也就是具身智能上。2026 年最新的误解,是大家谈世界模型时,默认它就是具身智能。
卫诗婕
真正的世界模型有很多。具身智能是一种,自动驾驶公司也说自己做世界模型,做视频的是一种,做 3D 的也认为自己做世界模型。
梅涛
对,不同流派都可以投,每个流派都有自己的故事和商业化目标。
但机器人坦白说,我觉得有一点泡沫。有些公司一个月过去什么都没发生,估值涨了 3 倍、好几倍,我不知道发生了什么。
卫诗婕
你一直讲,希望从底层做架构创新,逐步完善世界模型。这个逐步完善的过程是什么?
梅涛
我们判断世界模型应该具备几个特点。
图像是入口,视频是过程。图像、视频数据可以学到很多物理规律。具身智能更偏向机器人领域,是虚实结合;李飞飞那套 3D 理论偏学术,应用场景更偏游戏。
第一,视频赛道足够大,是万亿美元市场,容得下很多玩家。
第二,视频模型架构还没有收敛,没有哪个模型已经成为终局,创业公司比较友好。
第三,实现视频或原生多模态模型,在目前阶段训练成本可能比语言模型低,这是我们觉得可做的原因。
卫诗婕
可以理解为,通过不同方式让 AI 更好地理解和交互现实世界,不断完善?
梅涛
我们有几个维度目标。
第一,生成质量一定要好。不管图片、视频,还是未来的声音,都要达到很高标准,做到像素级别,并且跟第一梯队保持在同一个维度。
OpenAI 做到什么,Google 做到什么,我们一定要在同一水平线上,包括视觉质量、物理性和逻辑推理。
第二,生成长度要足够长。现在只能生成 5 秒、10 秒、15 秒,我们已经能做到分钟级,1 分钟、3 分钟都可以。希望做到更长,因为更长意味着视频生成和推理能力更强,能够成片。
第三,做到实时。现在视频生成还是很慢,生成 15 秒视频,Sora 要等十几分钟,我们现在也要几分钟。
用户不一定愿意等,因为还可能要抽卡。等十几分钟发现错了,还要重新做,用户愿不愿意做?
所以一定要实现近乎实时的视频生成,哪怕只是 preview。用户看到大体结果觉得 OK,再返工。这样能做好用户体验,让用户实时交互。
长期来看,就按这几个维度不断探索。最难的是第一个维度,输出质量和视觉效果一定要好,叙事性也要好。
卫诗婕
你最开始说,图像是理解世界的入口。为什么图像对我们最重要?
我最近也采访了一些具身智能公司,他们认为具身智能依赖视频。但如果把眼睛蒙上,盲人也能做事、理解和交互。所以有人认为,视频不是最本质的。那他们认为本质是什么?
梅涛
大家还在探索。
抛开这些 corner case,我觉得给盲人、聋哑人做产品当然未来也会做,但现在讨论这些 corner case 没有意义。
还是要看数据最多的地方。目前数据量最大的一定在视频。
像智象这样的公司,一年数据大概 100 PB,非常恐怖,视频数据还在不断增长。
卫诗婕
PB 是什么?
梅涛
1 TB 是 1,000 GB,1,000 TB 是 1 PB,规模很大。
图片肯定是起点,但视频肯定是中间态,也很重要。
为什么说图片重要?因为现在做视频,还是要先从图片开始。无论首尾帧、第一帧,还是过程中的分镜,一定要把图片做好。
图片没做好,生成的视频可能有创意,但不能满足确定性要求。
从训练方式看,如果图片模型在低成本下验证成功,再迁移到视频,会更 feasible、更 reasonable。如果一开始就瞄准视频,资源消耗很大,也可能做错。
所以无论训练方式、制作流程还是工作流程,图片都是第一步。
卫诗婕
图片像练武术扎马步。
梅涛
这个比喻很准确。图片做得好,模型迁移到视频很简单,因为训练方法已经学会了。只要把视频数据准备好,就可以了。
卫诗婕
所以我发现,你不是在绝对维度上跟所有公司比快,而是从根本上理解这件事。你们文生图模型登顶,也代表基本功修炼到位。
梅涛
是的。
卫诗婕
今年春节时,Seedance 2.0 出现,对行业冲击很大。你当时什么心情?
梅涛
一开始意外,原来美国同行会走得比较靠前。我以为 Sora 可能会继续推进,或者 Veo 3 会继续推进。
后来发现 Seedance 做得这么好,确实惊讶,觉得字节走得很快。但后来又觉得没那么惊讶,因为字节人才密度高,数据规模也大。
对我们有冲击,但也还好。
投资人来问时,我觉得我们不会跟字节正面 PK。Sora 烧了 55 亿美元,Seedance 不知道投入多少,肯定是百亿元人民币级别。创业公司很难用同等规模竞争。
所以一开始就想清楚,我们做差异化模型。图片做到最好,视频在垂直领域做到足够好。跟它竞争底层基础能力,不太可能。
卫诗婕
从技术细节上,还看不到更多?
梅涛
Seedance 2.0 没有技术报告,但行业里比较相信它仍沿着 DiT 路线走。数据质量和规模有碾压性优势,大力出奇迹。
卫诗婕
我听过一种估算,国内 MiniMax、海螺、快手、可灵、字节 Seedance,一年在多模态投入大概 20 亿元人民币。
梅涛
不止,绝对不止。那个阶段绝对不止。
卫诗婕
你估算大家投入多少?
梅涛
不太好估计,百亿肯定有,几百亿我们可能有自己的推断。
卫诗婕
多模态试错成本很大。对于字节这样的绝对大厂,可能一把投入几百亿,赌一年的时间。创业公司怎么维系?
梅涛
我有很多朋友、学生在大厂,他们很友善地提醒我:不要躺在大厂车辙上。
大厂资源确实很多,但创业公司可能只有一梭子弹,打完就没有了。如果坐在它的车辙上,就是炮灰。
所以我们要坚持模型算法原始创新。有算法创新,才能在低成本下保持同步能力。
如果 day one 没有架构创新,就需要融很多钱跟它 PK,投资人也不一定投你。
创新带来的是用低成本抗衡,同时赢得时间。
卫诗婕
多模态领域这几年经历了怎样的竞争叙事?我听说从 2025 年开始进入深水区,中国团队已经开始赚钱,代表行业是短剧。
梅涛
你说的是商业化。2025、2026 年,特别是今年,有几个领域渗透率比较高。
8. 多模态进入商业化
第一个是短剧,通过短剧 token 出海。短剧规模效应明显,token 消耗量大。
卫诗婕
一年能有多大规模效应?
梅涛
光制作成本,我们觉得一年接近 100 亿元。
卫诗婕
短剧 token 费用是 100 亿元人民币?
梅涛
是整个 AI 短剧市场的规模,100 亿元人民币。如果几家公司瓜分,每家公司一年也可能有几十亿元收入。这只是今年,光卖 token 的费用;还不算发行收入和广告营销。
特别是跨境电商,token 消耗量也很大。
TikTok 上有 100 多万商家。普通商家每个月需要几千条短视频广告,头部客户一年需要几十万条,甚至几百万、上千万条视频广告,token 消耗量非常大。
我们现在紧紧抓住两个赛道:短期是 AI 短剧,长期是短视频营销。后者需求很大,是长期业务,还能做分佣。
短剧量很大,但我们的价值不在发行方,只是在制作端。我们给制作团队提供铲子和工具,跟发行没有关系。
广告有一个好处。做商业短视频营销、跨境电商,一方面可以卖铲子,另一方面可以卖结果,通过结果跟客户分佣。这个模式已经基本走通。
卫诗婕
这几个热门生意里,竞争对手多吗?
梅涛
肯定有,特别是短剧,竞争对手很多。市场目前比较分化,没有特别大的头部玩家。
文化和内容市场一直这样。大公司自己手搓,小公司用各种模板。
我们的定位很简单,做一个产品叫“真赞”,专门给专业团队做精品短剧。真赞就是每一帧都很赞。
主要面向中央部委客户,也有 SMB 客户。大的机构基本自己研发工作流,创业公司很难进入。
当然也可以用 MaaS 方式卖 API。
电商和短视频营销领域,我们还是有优势。软硬件一体的广告屏,Q1 卖了 1 万台,铺了 1 万个店;跨境电商有 4 万多个 SMB,还有几十个腰部客户。这一块已经有积累。
卫诗婕
有人认为大语言模型已经变成一个烂生意,堆卡、堆算力就有确定性结果,或者刷榜。但语言模型商业模式可能还不如语音。
梅涛
我认为多模态跟语言模型不同。多模态不太会出现一家独大的情况。
我们跟几家头部公司聊过,他们也认为多模态肯定有好几家公司,每家公司侧重点不一样。
有的在影视里效果好,有的在人货场零售领域好,有的在广告、动画领域好,不太会出现一家公司什么都好。
第二,Pichai 在 Google 发布会上说,现在已经不太看大语言模型排行榜,更关注 Agent 能力和 Agent 赚钱的能力。
模型好当然无可挑剔,但 Agent 核心能力在 harness,也就是底层编排和 skills,是否沉淀了足够多的行业 know-how。
所以大语言模型的趋势已经开始转变,coding 也是一种 Agent。
多模态商业化虽然不如大语言模型成熟,比如大语言模型做到 GPT-5、GPT-5.5,多模态可能撑死是 GPT-3 或 3.5,还没有智能涌现,但不妨碍它离商业化很近。
有个数字可能不太多人关注:2024 年全球 AIGC 产业收入大概 200 亿美元,其中 60% 左右是多模态,也就是图像和视频相关。
很早就能看到,图像和视频商业化已经很快。我们自己的平台每个月消耗 token 大概 3 万亿。这个数字今天可能不算特别大,但已经很大。
图像、视频 token 密集程度高,用户也愿意买单。大语言模型可能 100 万 token 只要 1 美元,甚至 0.1 美元。
目前多模态智能还没有涌现,但表现力已经涌现,稳定性也还可以。
现在 PGC 或 PUGC,也就是半专业用户,已经可以用各种模型创作稳定、有价值的内容。
卫诗婕
可用、能用,还没到好用。
梅涛
对,现在是可用、能用,距离好用还有一点。
卫诗婕
你刚才提到 harness,怎么理解?它本质上需要什么?
梅涛
Harness 可以理解为 Agent 底层的 OS,是一种智能化编排。它能够把 API、skills、模型基本能力和行业 know-how 结合起来。
卫诗婕
这不就是去年大家谈的 model orchestration,模型编排吗?
梅涛
可以说是升级版。
卫诗婕
升级在哪里?
梅涛
第一要保证边界,第二要控制成本。
OpenClaw 出来之后,如果没有 harness 这一层,没有围栏,成本控制不住,账单会爆,效果也无法控制。
所以 harness 是一套有安全栅栏、成本控制和高效率的自动化系统。
卫诗婕
它底层就是人的能力,人的能力沉淀在 skills 里?
梅涛
对。以后一些好的 OPC 会把自己的 skills 放进 harness 平台。这样自己可以用,别人也可以用,是一个共享平台。
我们也在做这样的平台,让 skills 变成商品、API 或基本能力单元。
卫诗婕
现在大家都在提 token 经济。做基模、烧了那么多钱的大厂,靠什么把钱赚回来?靠消耗 token、token 计费。
梅涛
是的。
现在多模态、视频、具身智能和 Agent,都是特别大的算力消耗方。
我认为商业化本质有三层价值链。
第一层是底层基础算力,比如 GPU、裸金属、AIDC,再往下可能是水电,这里先不管。
中间层是 token,token 本身是模型能力。但 token 价值未来会越来越薄,因为越来越公开,变成 commodity,成本价像水电一样透明。
再往上一层,是通过 Agent 给用户和客户创造价值。这层可以做薄,也可以做厚,取决于是否真正创造价值。这是未来非常丰富的区域。
卫诗婕
所以你瞄准的是这一层?
梅涛
对。卖 token 是大厂的生意。阿里云、腾讯云、Google、OpenAI、Anthropic 等公司,瞄准基础设施,在里面卖水电。
水流动起来后,有 3 毛钱一度、1 毛钱一度。创业公司想卖这个比较难。
创业公司要做的是把客户价值这一层做大,拿佣金,跟客户做价值共创。
卫诗婕
大语言模型现阶段已经进入军备竞赛,训练都是万卡、十万卡起步,好像不到十万卡都不好意思拿出来讲。但多模态目前训练还远未到这个级别,是千卡、万卡级别。
梅涛
接近万卡,但还在千卡级别。
大语言模型没有 10 万卡很难应对。多模态公司也在积极构建算力,今天可能是千卡,明天可能到万卡。
卫诗婕
目前多模态仍然是创业公司可以玩的游戏,处于千卡到万卡级别。
梅涛
是的。规模可控,算法还没收敛,离商业化又比较近,所以创业公司有很大机会。
卫诗婕
但它后面只会消耗比语言模型更多的算力,可能 10 万卡都挡不住。
梅涛
结构上会不一样。
训练模型目前还是千卡级别,没到万卡,但未来推理卡需求很大。跟大语言模型不太一样,训练成本低一点,但推理成本高。
卫诗婕
这里有一个行业知识:大语言模型发展太快,算力还没准备好,所以训练大语言模型时消耗了大量英伟达训练卡,其实性价比很低。现在芯片厂商都在做推理生意,看谁能推出更好用的推理卡。
乐观的是,等多模态发展到那个阶段,很可能会有更好用的推理卡出现。
梅涛
对,我们对推理要求很高,推理成本远高于大语言模型。5 分钟视频可能就要 100、200 元。
卫诗婕
照理说,如果一家多模态公司在模型和创新能力上走到世界前列,全球头部芯片厂商应该都围在你们周围收集需求。
梅涛
事实确实如此,但很遗憾,产能跟不上。
我们需要算力,但他们没有足够产能。最近几个月全世界 GPU 产能都不够。OpenAI 也说,有多少卡就买多少卡,它需要现在 100 倍的卡。
中国公司也一样,我们也是一样。
卫诗婕
接下来的模型竞争有什么确定性预见?如果卡都被硅谷大厂买走,中国模型公司怎么办?
梅涛
卡不太会被一家垄断。英伟达也要讲公平性,中国模型厂商也在跟进,所以这方面担忧不会特别大。
卫诗婕
谁在你们身边最勤奋地收集需求?
梅涛
国内几家上市公司都在收集很多情报,只是收集了还没有产能,希望他们尽快跟上。
我们跟几个云厂商保持合作,比如阿里云、火山云、百度智能云,也包括商汤,合作很多年。
现在一个痛点是,如果国内算力储备一直只有美国的十分之一,怎么跟上?确实是问题。
短期内,国产算力的性价比和性能还有差距,这两年比较难。怎么聪明地熬过去,也是问题。
卫诗婕
对中国模型创业者来说,这几年的压力非常大。
梅涛
所以我很佩服中国这群大模型创业者,压力很大:有大洋彼岸的压力、国内压力、融资压力、烧钱压力、商业化压力,还有招人压力,人才也在流动。
今天中国科技创业,对创始团队和公司要求很高。
如果不是某方面有明星光环,要么学术技术很强,要么商业化很强,要么架构很强,要么产品很强。总要有一个特别厉害的地方。
如果你是 nobody,草根创业还是很难。
卫诗婕
AI 这一波是强资源驱动。如果是 nobody,就意味着很难拿到资源。
梅涛
而且还要有资源整合能力。只有一方面资源也不行,不管是投资人资源、客户资源,还是做生意时跟别人 JV 的资源。
我刚跟几个朋友在香港聚会,都是大模型公司,他们也开始像 OpenAI、Anthropic 一样,跟大客户做 JV,把生意做大。JV 就是成立合资公司。
今天做大模型创业,对创始人和创业团队要求很高、很全面。
卫诗婕
你觉得多模态和世界模型会像大语言模型一样有船票吗?
梅涛
当然有。
卫诗婕
船票本质是什么?
梅涛
只要做大模型的公司都有船票。
船票本质是,首先能不能做出好的模型。这是一级和二级市场听到最多的共识:不管团队怎样,都要有比较好的自研模型,而且要上榜。否则就是 nobody。
你说商业化很强,那要看商业化到底能不能赚钱,要用时间证明。但即使今天能赚钱,也不代表明天能赚钱,因为模型会把你吃掉。
卫诗婕
现在共识是,模型能力越来越强,中间层 Agent 会越来越薄。
梅涛
肯定会越来越薄。Claude Code 出来后,美国 SaaS 化的人力公司价值跌得很低,SaaS 公司都在瑟瑟发抖。
模型能力越强,应用层越薄。但问题是,如何在薄的里面做应用层,还是在模型层也切一部分。
对我们来说,肯定要切模型层,同时在应用层做商业化壁垒。
卫诗婕
模型层竞赛本质是耐力赛。你们这个领域 scaling law 还没出现,即使出现,天花板也很高。但竞赛有时间,资本耐心有限,能不能在某个时间点留在牌桌上很重要。
这个时间点是什么?
梅涛
比如 IPO 是一个考验,也可能是完成交付、达到商业化目标。
现在多模态公司已经不多了,特别是视频创业公司。
大量公司可能在 2024、2025 年死掉。第一个是没有声量,模型能力没出来,投资人不会投。第二个是商业化目标没实现,只能做几百万元的生意,做不了几个亿,也会死掉。
留下来的是既有基模能力,又能做商业化的公司。
对我们这样的公司,最重要的是能不能融到足够多的钱,拿到足够聪明的人,拿到足够算力,留在牌桌上,同时把商业模式闭环。这件事需要时间。
卫诗婕
目前国内拿到多模态船票的公司,包括大厂在内也不多。创业公司应该只有三家。
梅涛
是的,其他公司已经新陈代谢掉了,优胜劣汰。
卫诗婕
你觉得留在桌上的三家多模态创业公司,都是因为商业化指数级增长吗?除了这个,模型能力肯定也不错。
梅涛
每家公司有自己的特点。
有的专门做 To C,增长率和收入都不错。我们更多偏 To B,也有 To C。To C 业务大概占三分之一,海外收入也占三分之一左右。
我们既有 To B,也有 To C,整体比较健康;模型能力也不错。
我觉得我们留在牌桌上,是因为很稳健,模型能力和商业化都超出了预期。
卫诗婕
我一开始想问,你履历非常厉害,模型表现也很好,全球学术定位也很好,但好像既不是估值最高,也不是最出名的。
梅涛
创始人要站出来检讨自己吗?
我们放出了 3 匹马、3 条产品线,都还不错。经过很多次捶打、摸索,也有失败经验和教训,对未来还是很有信心。
最近来了不少段位比较高的同学,他们来了之后我们更有信心。
卫诗婕
为什么他们会来?
梅涛
因为觉得公司发展不错。融资、商业化、市场化进度都在稳步推进,值得期待。
卫诗婕
没有你个人的原因吗?我做了一些了解,大家觉得你是一个特别的学者。相对其他研究者,你更有温度。今天聊天也能感受到,你比较松弛、有温度。
梅涛
很多时候,大客户是我去谈,搞不定的候选人也是我去谈,我的成功率还挺高。
我一个比较好的能力,是能很快跟客户和聊天对象建立直接的信任关系。他们相信我,因为我很真诚。
很多人想加入公司,一开始我反而会劝退。不是简单劝退,而是反问:“你为什么来找我聊?你有没有想清楚?”
创业九死一生。心理建设没有完成之前,不要来创业公司。你还是个 baby,我又不是 baby-sitter,没有精力呵护你。必须自己想清楚。
如果没有想清楚,来了就会犹豫。
我从微软去京东时,也是一样的真实经历。很多人不看好,微软以前一位 HR 同事跟我说:“梅老师,你去那里我很担心,担心你活不过 6 个月、12 个月。”
我说:“你先担心自己吧。”
我去了京东之后,非常努力地融入公司,做好自己,把所有能力释放出来,扎扎实实做业务,非常务实。所以在京东待了 5 年,口碑还可以。
卫诗婕
我看你履历时,觉得你是一个很有张力、很有弹性的人。微软亚研院和京东,在外行看来风格差异非常大:一个快、狼性,一个相对慢,更理想主义和有情怀,也更包容。
我以为前者的氛围更符合你的画像,但你在京东也非常 humble。
梅涛
有时候退一步,实际上是进一步。越谦卑、越随和,别人越尊重你。
不需要通过强势证明强大。真正强大的人,往往越来越谦虚,愿意共赢,站在别人角度考虑问题。别人会觉得你是利他的人。
我本身就是一个很利他的人,所以会通过建立信任,跟投资人、客户和候选人沟通。
一开始我会告诉候选人,公司很难,确实没有一家公司不难,包括巨头也很难,公司说倒也很快。
我会先讲很多困难和挑战。如果他仍然想来,我就把他当兄弟、当家人,帮助他。
我想知道他的个人规划跟公司规划是否匹配,能不能帮到他,来智象未来能不能让他成长。我会站在他的角度,帮他规划职业规划。
这样候选人会认同这样的老板,也会认同公司的掌舵人。
如果我帮不了他,我会建议他不要来,或者暂时不要来,也可能推荐他去别的地方。这样才能共情,有温度。
卫诗婕
你们应该拿到了深创投的投资。在中国科技领域,拿到深创投的钱不只是钱,也是背书。你们怎么拿到深创投投资的?
梅涛
我们应该是深创投决策链里最快的几家之一。
卫诗婕
听说戴若黎也拿到了深创投的钱,他说自己也很快。我没跟他求证过,到底你多快、他多快。
梅涛
我参加过深创投几次会。我觉得他们投我们的原因,是看好多模态赛道。他们不止投我们一家,还投了另外一家,名字就不说了,大家可以查到。
他明确跟我说,看好这个赛道,也看好我们团队,觉得团队很靠谱。
他投我们的原因,是不只想投 To C 公司,也想投 To B 公司,所以布局很清晰,To B、To C 都要投,而且还会不断重仓。
我觉得他们的判断值得思考。
卫诗婕
第一批大语言模型公司已经上市,典型代表是 MiniMax 和智谱。一家从 To C 开始,一家从 To B 开始。上市后,To B 的智谱表现很好,To C 的 MiniMax 股价波动比较大。
你怎么看二级市场 To B 和 To C 的大语言基模公司出现分化?
梅涛
以前我不太关注二级市场,因为不炒股,但会持有一些美国高科技公司股票。
我觉得两家公司表现都很好,只是有差异。
第一,基模能力。这是暂时的,过几个月排名可能又不一样。目前两家基础模型能力表现略有差别。
第二,对标逻辑。智谱可能有比较好的 coding Agent,对标 Anthropic,所以二级市场有时有很强的对标逻辑。
按理说,美国公司的估值和市值除以汇率,应该对应中国公司的估值,但现在还没到,所以还有空间。
目前一个是模型能力,一个是对标逻辑。
但 To B、To C 在二级市场已经没有那么大区分度,慢慢融合了。To 大 B、To 小 B、To 大 C、To Pro C,基本在同一个 category。
区别在于公司要不要做模型私有化、要不要做定制化研发,这是传统 To B 和新型 To B 的区别。
如果做模型私有化,我认为不是特别好的生意。我们从来不做模型私有化。
卫诗婕
在中国,一二级市场对 AI 的认知有什么分化?
梅涛
现在重要 AI 公司都是成长型公司,所以二级市场也到一级市场找标的,开始交融。
一级市场比二级市场稍微冷静一点。二级市场有时很分化,只看营业额、收入、利润,有时看模型排名,有时看对标,很难判断它到底看什么。
现在二级市场逻辑跟一级市场开始融合。至少一级市场 PE 阶段的投资人,和二级市场这些人,基本看法差不多。
卫诗婕
OpenAI 和 Anthropic 也马上提交 IPO。美国资本市场出现了情绪和审美转变,更认可 To B 的确定性。
所以 OpenAI 把 Sora 砍掉,把不重要的模型旁支砍掉,专心做 coding。
梅涛
对,他觉得这是不可逆的大势。如果不抢占这个市场,会很危险。
卫诗婕
你的创业也是从 To B 开始。这种审美会在国内发生吗?会利好你们吗?
梅涛
投资人分好几种。以前传统美元基金投资人,还是比较喜欢 C 端趋势;国内人民币基金反而还好,也很认可 To B。
但他们不希望你做定制化的大 KA 客户研发。我们不做私有化部署,也不做定制化开发。
现在我们看清一个现实:SaaS 化工具和 Pro C 的 SaaS 化工具,在海外推;国内则推技术加服务。
我们既做 SaaS 工具,也做交付。交付的是素材,以及素材带来的 GMV 分佣。
这种模式是“RaaS 的服务”,比较适合中国市场。
卫诗婕
我看你一直拿的是国资,没有选择美元。这是主动选择,还是找不到美元的钱?
梅涛
之前是被动的。
2023 年,中美关系影响下,美元基金不敢投中国大模型公司和中国 AI 公司。而且当时美元基金也在拆分。
所以那时没有拿美元,不是我们不想拿,而是他们确实在犹豫。
卫诗婕
再聊一下具身智能。我看到你们也有具身智能业务。
梅涛
这个业务跟戴博士有关。
具身智能有一个共同点,就是缺数据,缺高质量真人实采或仿真数据。需要的数据量可能是千万级到亿级小时,非常恐怖,而且数据很值钱。
诺亦腾机器人做真人佩戴 tracker 的数据、真人实操数据。这种数据很难 scale up,所以希望我们合作做数据增强和合成,生成它需要的真实数据。
卫诗婕
这能算真实数据吗?
梅涛
数据算不算真实不重要,重要的是生成数据对它们训练模型有没有帮助。
我们想设计一个闭环:它给我们真人遥操作数据,或者带夹爪的数据。数据是毫米级甚至亚毫米级,有 6、7 个自由度,每个关节都有精度。
我们做增强,把带遥操作、带夹爪或手套的数据,变成真人实操的第一人称数据。
它给我一份数据,我们通过生成变成 100 份、1 万份,再售卖多份。背景可以换,手的皮肤颜色可以换,因为需要模拟不同场景。
但要保证精度跟它在同一水平。它给我亚毫米精度,我就给它毫米级精度;如果它给我毫米级,我也要保持在两三毫米以内。
卫诗婕
这某种程度上不就是世界模型吗?
梅涛
但我们做的是高可控、高精度的第一人称数据合成。
我们还在设计另一个闭环。光做视频数据不够,还要验证对市面上比较好的 VLA 或 World Action Model 有没有帮助,才能形成闭环,否则无法定价,客户也不知道数据好不好用。
现在还在做最后一步。闭环完成后,今年可以交付大量数据。
卫诗婕
我理解,这个闭环有两种验证方式:观察客户复购,或者你们自己下场训练模型。所以你们现在在训练具身智能模型?
梅涛
我并不是要做端到端具身智能模型,还是要聚焦自己的赛道。
具身智能落地速度说实话不如我们。我们已经商业化、scale up,去年收入 1 亿元,今年肯定是几个亿;他们还比较早期。
所以我们做好数据供应方,这是确定性的事情。
我自己会做一个轻量级模型,验证数据闭环有没有用,把 delta 算出来,让客户知道价值。
不是要训练商业模型,因为数据本来也不是我的,拿这些训练数据没有版权,不能用训练出的模型做商业化。我只能用小模型验证数据好不好用。
卫诗婕
你是置身场外的高手,要做一个隐士高手,跟着诺亦腾把生意做起来。
梅涛
对,还是师兄弟。
卫诗婕
这会不会是一个很大的商机?现在具身智能行业钱很多,热钱也很多。
梅涛
商机还可以,但天花板多高不确定。
数据越来越多时,客户模型能力可能接近饱和。做到 89%、90% 后,再提高 1 个点可能都很难。那时可能会有新的范式变化。
但也不能保证我们永远不下场做模型。数据量足够大时,我也会考虑转型,因为这些数据和模型 know-how,反过来也能帮助我们调自己的 World Action Model、自己的世界模型。
我的世界模型未来会是这样:底层是一个新架构,现在不能说,但会在 UiT 架构上衍生。
上面有几个具体视频模型。第一个是目前做的视频生成,面向消费级视频生成;第二个是交互式视频生成;第三个是具身智能视频生成。
卫诗婕
什么叫交互式?
梅涛
有点像李飞飞那种。我们可以在视频里交互,调整角度、方向和镜头运动。
另外还有具身智能视频生成,也就是高精度、高可控的视频生成。
它像一个开关。上面的模型往左偏,是普通视频生成;中间是交互式视频;右边是具身智能视频。这是未来目标。
卫诗婕
今年春节 Seedance 2.0 出现时,我做了一期播客,问一位北大学者:这种符合物理规律的视频生成,能否用于具身智能训练?
梅涛
现在还不行。
卫诗婕
为什么?
梅涛
因为里面没有真正的物理规律,只是看上去符合物理规律。
我们跟诺亦腾机器人合作时就经历过。一开始第一版只保证视觉合理性:看上去手把东西捡起来、放进去,完成了一些操作。
但里面有问题。手指精度不够,跟物体交互有偏差。
还有一个问题,我们生成时手指是五指并拢去抓,但采集数据里,有时真人不是五指抓,而是三个手指抓。
这时就会有误差。两个手指没有抓东西,到底是错还是对?没有答案,因为三个手指能抓住就可以。
但生成视频时,我们一定按五指抓,因为没见过三个手指抓的场景。
所以里面还有很多问题要解决。还要验证视频模型在三维点云上,x、y、z、t 四维是否达到毫米精度,自由度是否满足客户要求,再用小模型验证是不是闭环。
Seedance 目前还做不到这一点,精度非常重要。
卫诗婕
今天桌面上真正训练大模型的公司很少。
梅涛
对,训练大模型的公司,底牌一般不给别人看。你问模型大小、参数量,很多公司都不敢告诉你,可能只有几十 B 或几 B。
卫诗婕
某种程度上,你觉得自己跟他们没有太大区别,也可以有自己的 recipe,验证数据有没有用。
梅涛
戴若黎有一句话,算是说服了我,不能叫 PUA。他说:“师兄,你有这么大规模的数据,有这么大参数量的模型,做他们的事情,就像用大刀砸一只小蚊子。”
他觉得我们能力足够做他们的事情。
比如群核上市时,他们的 3D 室内数字空间数据集,现在对具身智能和视频公司都很有用。
我们底座扎实,数据量足够多,理论上做具身智能模型也会做得不错,不能说最好,但肯定很不错。
只不过我现在不想站到那个赛道里跟大家竞争。我现在要做确定性赚钱的生意,把自己的模型做到全球最好,同时把商业化闭环。
他们还比较早期,还没有 scale up;我们已经开始 scale up。
我同意戴若黎的观点:我们可以做一些确定性收入,满足他们确定性的需求。
不管具身智能最后剩几家公司、商业模式如何闭环,至少所有具身智能公司都需要数据,这是确定性的。
卫诗婕
现在你们是卖铲子的人。
梅涛
对,卖铲子,也卖素材。
卫诗婕
刚才讲了三条路:从消费级生成,到交互式生成,再到影响物理世界的生成。它们都是大语言模型 AI 的下一站,对吗?
梅涛
都是下一条路。
卫诗婕
很多人会觉得,世界模型是一个模型。但你说不是。
梅涛
真要做到那样的世界模型、做到 AGI,我觉得还需要很多时间,可能 5 年或 10 年以后。
它需要的算力可能是今天的 100 倍。要把所有具身智能数据,包括 x、y、z、t、6 个自由度、触觉、温度、视频、图片和语言模型,放在一个模型里训练,算力可能是今天的 10 倍到 100 倍。
一个问题是没有人有这么多数据,第二没有这样的架构,第三没有这么多算力。
卫诗婕
你怎么看各种模态数据对 AI 智能的影响?现在大家说大模型不再只是大语言模型。
梅涛
这是一个 open question,每个人认知都不一样。
2025 年英国女王邀请 7 位 AI leader 颁奖,每个人观点都不同。有像杨立昆那样的冷静派、保守派,也有综合派和激进派。
我觉得今天对大模型认知不同,都是 reasonable。
对我来说,多模态模型不是为大脑服务的,不是为了产生智能,而是让人跟世界交互,模拟物理世界的状态。
大语言模型真正体现了人类知识的积累,我非常敬佩做大语言模型的人。
但我也跟很多人交流过。今天的大语言模型,可能更多是在压缩知识、存储知识,做简单连接。
它底层架构跟人脑认知有点像,建立神经元之间的连接。但它强在能够以远超人类学习速度的速度,消化和存储人类历史上所有数据,也不会忘记,还能简单搜索和重构。
后来有长上下文、长思考能力,像人一样思考,能力就提升了。它开始做推理、推演、反馈和纠正,出现一点智能的感觉。
这一块天花板还没到。以前更多花在预训练上,将来可能在推理上有更多体现,coding 也是一样。
我觉得它慢慢出现了一些超出想象的智能。
多模态更侧重人与物理世界交互,以及把物理世界规律沉淀进去。这两个领域完全不同。
目前很难把两者放在一起训练,因为训练方式和数据不一样:一个是无监督、自监督,一个是强监督。
但每种模型都有自己亟待发展的空间。
卫诗婕
这两个领域背后的人才也会泾渭分明吗?
比如 Pichai 说 any-to-any,虽然两个领域还没有完全统一,但最后通路要走向 any-to-any。两类人才会融合吗?
梅涛
底层训练模型的 infra、调度、工程化基本相通。但真正算法层面不一样。
怎么处理视觉数据、机器人 action 数据,跟怎么处理文本数据不同,也有不同的 trick。
越往上层,算法和 domain knowledge 越不一样。
你看 OpenAI 里,Sora 团队一直独立,ChatGPT 团队也独立,还没有融合。Google 里也是一样,Veo 3 团队独立。
所以在上层还是有 domain knowledge;下层和中间层可以相通,因为 infra 一样。
年轻人适应得很快。我们团队有几位核心人才,以前在大厂做底层研发和 system;还有一些博士生,本来在学校就是高手。
我们在 2010 年代招了一大批国内计算机学院 top one 的学生。Top one 不是 GPA 最高,而是全班同学都认为他是 top one,通过同行评价判断一个人是不是班里最好的学生。
这些学生来之后能力很强,编程和系统能力都很强,也非常 adaptive。年轻人确实很猛,只要愿意学,很快就能掌握。
卫诗婕
你们研发平均年龄是多少?
梅涛
研发平均年龄应该 30 岁左右。博士生比较多,博士毕业已经 27、28 岁,所以大概 30 岁,1995 年到 2000 年出生的人比较多。
卫诗婕
大家很少知道,HiDream 是立在合肥的,就在你母校中科大旁边。你们跟科大讯飞应该被称为合肥双子星,科大讯飞也是你们股东。
梅涛
对,我们有很多业务协同。
卫诗婕
这是一个冷知识:中国大模型的标志性发源地,居然还有一个在合肥。
梅涛
很多人不知道公司总部在合肥。合肥产投是投资型城市,一直说自己是科创高地,确实也是。
他们投资的企业很成功,比如长鑫存储、京东方。也希望复制这个模式,把智象未来投出来。
我们跟合肥是双向奔赴。
公司是多地布局。主体在合肥,北京有研发,上海有产品,在金华、香港也有分公司和子公司。
AI 公司很简单,哪里有人才就去哪里。
合肥的好处是能吸引中科大人才,包括交付人才。核心产品仍在北京,上海更偏电商。
他们也没有要求我们把人全部搬过去,这不可能。安徽省教育厅、省委组织部也给了很多人才激励,我们每年可以在科大招很多学生,具体数量不能说,否则会被很多公司嫉妒。
人才非常重要。
卫诗婕
你的师兄刘庆峰有没有给过你什么建议和忠告?
梅涛
忠告是迅速把企业做大。
AI timing 很重要。如果错过时机,就不能留在牌桌上。
卫诗婕
为什么叫智象未来?
梅涛
一开始我们只有英文名。我很喜欢 HiDream 这个英文名。
卫诗婕
为什么叫 HiDream?
梅涛
我们希望保持梦想,梦想越大、越高,越能吸引年轻人。
当时有几个候选名字,我发给几个在美国上学的年轻人,也让 native speaker 调研和发音。他们觉得 HiDream 比较好,两个音节,是开口音,名字很好。
有了 HiDream 后,我想中文名是什么。我们是人工智能,肯定要带一个“智”。
我们做生产力和创意,做视频和图像生成,跟数字创意相关。后来想到“象”不错:第一是想象,第二是中国古文化里的“一生二、二生三、三生万物”。
“象”也代表一种模态,有多模态的感觉。“智”代表人工智能和技术探索,“象”代表想象力。我们希望生成一个具有多模态想象力的世界。
卫诗婕
你刚才说全球化和出海特别重要,但我很惊讶你把两者分开。现在更多提全球化,不太提出海。
梅涛
全球化和出海在我的理解里有一点不同,当然这是比较狭义的理解。
全球化是客户就在全球各地,通过平台化方式服务全球用户。比如我们有一个产品 VivaGo、Hike Leap,用户在全球各地购买、生成,这是全球化业务。
出海是帮助中国企业做全球化业务,客户仍在中国,帮助他们做海外营销和服务。
卫诗婕
明白了,是业务模式不同。
HiDream 在全球化时,大家不太容易看出它是中国公司。很多中国公司做全球化,会把自己隐藏起来。
梅涛
我们也思考过。
有句话叫 picture is worth a thousand words。图片是 universal language,不会因为看到照片想到的是英文还是中文,理解基本一样。
所以我们的业务天然、natively 就是全球化业务。
卫诗婕
审美还是有东西方区别的。
梅涛
是的。我们现在业务做得比较好的地方,比如东南亚、印度、巴西,页面都不一样。
做全球化业务,不同国家要有不同模板、不同 looking。如果你来自巴西,看到的首页跟在美国看到的首页不同。
卫诗婕
但这只是交互和视觉长相。我想问的是模型生成,你们会做审美在地化吗?
梅涛
模型层面不会。模型层面追求通用,因为只要训练数据包含那个国家的数据,模型就有这个能力。
产品层面会做差异化。比如 PR、UX、特效、模板都会不同,审美也会针对不同人群。
以 Midjourney 为例,它的审美基本是艺术家顶层;GPT 一米级更现实,更贴近日常照片,比较写实。
它们服务的用户、用途和工作场景不同。
很难统一所有价值观和审美,只能基于数据和判断,做适合自己的审美。
卫诗婕
所以你不主动贴合用户审美,而是尽可能做通用,再筛选、吸引客户靠近?
梅涛
模型是这样,但产品里面会做差异化。
卫诗婕
你有没有 AI 信仰?你相信智能的未来最终是什么样?
梅涛
如果没有 AI 的执念和梦想,我不可能做这样的创业。
从接触学术研究开始,我们做的都是 AI 研究,每天生活都跟 AI 有关。说没有 AI 梦想是不可能的,只是不想经常说,因为讲出来比较虚。
我内心有坚定信念,相信 AI 能创造更好的生活,让人活得更好,让工作效率大幅提升。
超级人工智能一定会实现。通用人工智能很难定义,但超级人工智能已经在实现。
我这个人比较理智,情绪也非常稳定。在学术层面,我已经攀过一座高山,现在从山上下来,重新攀登另一座高山。
我愿意把身份清零,只谈未来要做的事情,不需要额外声望,也不需要额外财富。创业后,所有事情和精力都放在公司上。
在京东待了很多年,跟刘强东学到很多。我觉得公司一定要创造价值,才能成为商业化公司,才能永久持续。
再困难,技术一定要攻坚,商业化一定要做,不能放弃,一定要想办法闭环。
必须商业化闭环,因为如果有一天没人投资,公司要自己造血,需要利润。商业化闭环后才能 scale up,否则别人为什么继续投钱?
仅仅通过情怀和 AI 信念让别人相信你,在中国环境下比较难。
卫诗婕
你学术研究几十年以来一直在 CV 领域,牵引你好奇心的是什么?
梅涛
我一直希望机器能比人更懂这个世界。
我们好像总追求机器像人一样懂,但我觉得机器一定会比人更懂。
比如晚上开车,雨天或大雾天,会依赖自动驾驶或辅助驾驶,因为它看得比你多、眼睛比你多、看得比你远。
大雾天人只能看到 5 米、10 米以内,它可能看到 30 米。所以我相信机器一定看得更深远,比人更懂。
我希望机器帮助人类看懂世界,也帮助我们创造更好的世界,这是我做视觉的初心。
视觉是美好的呈现,能够呈现一个宏观的、梦想中的、五彩斑斓的世界。
图片是起点和入口,视频是过程,是商业化关键的一步,终极可能是创造一个更美好的世界模型。
卫诗婕
李飞飞想复刻这个世界,杨立昆觉得不必复刻这个世界,你是哪一派?
梅涛
这么说有点哲学意味。
我希望从世界中学习,把世界重构,进而超越现有世界。不是创造世界,而是 mold 这个世界,也就是构建、改造、修改和编辑世界。
按照我们的想象去编辑世界。我希望在构建世界的基础上,再创造一个新的、更好的世界。
卫诗婕
这不是每个创业者都想做的事情。
梅涛
这是一个非常通用、很朴素的梦想。
卫诗婕
最后再问几个轻松的问题。你的 MBTI 是什么?
梅涛
好像是 ENTJ。
卫诗婕
这是个 E 人。
梅涛
是 ENTJ 吧?我看应该是 ENTJ,待会儿揭晓一下谜底。
卫诗婕
能不能分享一本最爱的书?
梅涛
我最爱的书应该有两本。
一本比较理性,经常看的叫《创业维艰》。它讲了很多硅谷创业的故事,让我意识到,即使在硅谷这么好的条件下,创业也很艰难。
书后面还分享了很多 highly summarized 的要点,非常值得经常翻看,相当于操作手册。
还有一本完全不一样,说起来会暴露年龄。我比较喜欢村上春树的书,比如《1Q84》。
他对人的性格、细节和心理描写非常细,很难想象一个男性作家,能把人物心理和内心刻画得如此周密、细致,让人感动。
我觉得这也是 AI 现在做不到的地方。有时看他的书,两页纸没有讲别的,只写一个人的心理变化,细致入微。
如果 AI 创造的人物能够像他笔下的人物一样,我觉得非常难得。但目前很难超越他,看他的书会产生共情和温度。
卫诗婕
你可能是接受采访的企业家里,唯一一个会提村上春树的人,可能不一定是好的例子。
有最喜欢的电影吗?
梅涛
我在科大时放过 3 年电影,是学生活动中心的管理员,每周要放 3 场投影。
那时不叫电影,叫投影。我每周要审十几部片子,审完后播放。
卫诗婕
看片量可以。
梅涛
但非常遗憾,那么多片子我基本没完整看过一部。
因为每周要放 6 部片子,要审 10 部以上,但没有时间一帧一帧看。我当时更聚焦学习。
我放了两年半、3 年的片子,却没有完整看过一部。哪怕 Titanic 当年很火,每天坐在地上的人都满了,挤不进来,我也没完整看过 Titanic。
我这个人就是这样,每时每刻只能做一件事情,而且 120% 投入。做一件事情时,别人看不见我,我也看不见别人。
2014 年我看过一部电影,叫《Her》。它让我看到了人工智能未来的雏形,有点感动。
电影里的机器慢慢跟男主人公产生共情,让他觉得像在谈恋爱。回头看,《Her》里发生的事情,不就是今天大语言模型正在发生的事情吗?
只不过大语言模型还没有跟多模态产生共鸣、实现桥接。未来它既可以陪伴在手机里,也可能有一个温馨的 AI 人物陪伴人。
这部电影给我印象很深,因为我发现 AI 成长的速度,未来可能赶得上科幻小说家的想象。
卫诗婕
期待一种世界的增量。
梅涛
是的。
卫诗婕
好,谢谢梅老师,特别精彩,感谢。