Lily
本期节目我们想讨论的是近期的大热点:DeepSeek R1。这个春节可以说是“DeepSeek春节”,大家可能都在朋友圈、小红书、微博以及各个媒体上看到过关于DeepSeek的疯狂讨论。
但在国内狂欢的同时,我也看到这次爆火带来了一些全球性的挑战,包括监管方面的挑战,比如欧盟各国对DeepSeek展开的一些调查;也包括美国方面的质疑,比如有人认为DeepSeek使用的蒸馏技术可能涉及所谓的“窃取美国知识产权”。
所以整个状况众说纷纭,说它好的有,说它是骗子的也有。这期节目我们邀请了几位嘉宾,来讨论DeepSeek R1爆火的这件事情。
我们这次邀请了3位嘉宾。第一位是《屠龙之术》的主播庄明浩老师,庄老师一直是我们节目的老朋友。春节前,庄老师还做了一期132页PPT,解说2024年AI这一年的节目,那也是一部巨作,很多朋友可能都听过。所以这次我们也邀请庄老师,作为一线的AI行业观察者,来跟我们分享和讨论。
其次,我们邀请了Hi Cloud的张涛老师。张涛是Monica的产品合伙人,也在《42章经》和《十字路口》节目上被称为“AI顶级产品经理”。这次我们想请张涛从一线创业者和产品经理的角度,分享他的观察。
此外,我们还请到了张鹏老师。张鹏老师是公众号“东北亚桥研究院”的主理人和作者。“东北亚桥研究院”一直以来在中美关系、地缘政治,尤其是科技领域的相关议题上,都有非常深入的研究,也发表了很多专业文章。
包括之前我们节目聊到的美国对华投资禁令、中美数据脱钩相关法案,以及近期由TikTok引发的出口管制和中美人工智能能力脱钩法案等话题,张老师都有非常专业的研究。我们先请3位嘉宾跟我们打个招呼。
庄明浩
感谢Lily邀请。我是《屠龙之术》的主播庄明浩,一直在关注AI行业的进展。确实如Lily所说,春节期间看到DeepSeek,我有一个很大的感触:得亏我的报告是在12月份做的,如果1月份再做,感觉有很大的篇幅要推翻重写。
Lily
好了,张涛。
张涛
大家好。确实,就像Lily讲的,这个春节基本上属于DeepSeek。
我今年没有选择在老家过年,本来是在外面玩,但其实基本上没怎么玩。白天要跟国内的资讯,晚上要跟美国那边的讨论,所以整个春节基本上都交给DeepSeek了。
甚至我远程给我爸妈拜年的时候,给我妈说完拜年的话,就听到我爸在旁边问:“你问一下儿子,那个梁文锋到底是不是真的那么厉害?”我当时就特别绝望。DeepSeek已经到这种程度了。
Lily
好的,谢谢张涛。那张鹏老师呢?
张鹏
大家好,感谢Lily邀请,很高兴参加这次交流。
我是微信公众号“东北亚桥研究院”的主理人,自己也在做一些人工智能、地缘政治、法律和政策交叉领域的研究,也感谢大家关注我的公众号。
我现在人在英国,所以在英国这边其实也感受得比较强烈。虽然中美两边聊得很热闹,但英国以及欧盟这边也很关注这个事件。我儿子所在的小学里,同学和老师也都在聊,确实特别火。
Lily
谢谢3位嘉宾的介绍。
1. DeepSeek的全球出圈
第一个话题,我特别想从各位的视角,尤其是作为一线从业者的视角,来简单评价一下DeepSeek这次爆火的事件,聊聊大家对这次爆火的观察。
我自己的观察是这样的。因为我自己也在一线关注这个领域,最开始的时候,1月20日DeepSeek发布了R1模型,但当时其实并没有引起特别广泛的关注。虽然一些公众号可能会讨论,但说实话,国内很多公众号在报道新进展时确实有点过于激进,经常会取一些特别唬人的标题,所以那个时候我并没有特别注意到这个模型。
直到有一件事情引起了我的注意:和菜头发了一篇文章,专门写DeepSeek给他带来的震撼。
第二个带给我震撼的事情,是我大概在25日、26日春节回家的时候,我姐姐,一个快40岁的中年人,平时两耳不闻窗外事,也根本不懂AI,突然来问我:“好像现在网上都在讨论DeepSeek,那个到底是怎么回事?”
那个瞬间我就意识到,好像这次真的出圈了。后来我也在小红书上广泛看到这次爆火。不知道从各位的视角来看,观察到的情况是怎么样的?
张鹏
我的感受跟Lily差不多。我的观察是,实际上这件事情是在春节前后那两天突然在国内火起来的。所谓爆火,我理解有一点“出口转内销”的意思。
它实际上是在美国那边先有了很多关注和讨论,一两天之后,很多国外媒体的分析和评论文章被国内很多公众号,包括一些专家引用,突然就在国内也开始火起来。
我发现一个很奇怪的现象:DeepSeek先发布了V3。V3出来之后,实际上没有引起太多舆论反响,但事后很多人分析,从V3发布开始,这就是一个比较大的突破了。后面的R1实际上相当于V3的强化版。
当时我也很奇怪,还请教了很多美国方面的政策专家和观察者。我问他们,为什么V3发布之后,包括R1发布之后的大概几天时间里,美国主流媒体都没有什么反应?
大概几天之后,《纽约时报》发了一篇文章,后面才变得铺天盖地。美国朋友的解释是,DeepSeek这件事相对比较技术性,而美国媒体那几天因为其他事情,比如特朗普就任,包括科技界发生的一些事情,占据了版面和空间。
并不是说他们没有关注到,只是他们还在理解这件事情到底意味着什么,对美国AI产业具体带来什么冲击和影响,以及对中美人工智能竞争会产生什么影响。后来我觉得,他们慢慢发现这确实是件大事。
Lily
特别想听听庄老师的观点。作为一线观察者,我想你的观察肯定比我和张鹏老师更早。
庄明浩
这件事情其实很有意思。DeepSeek在V2版本的时候,大概是去年9月份,在整个开源社区和技术圈里的讨论就已经很多了,只不过那一波讨论还集中在核心圈层。
V3发布的时候,已经有一些更大范围的传播,但当时还是相对集中在科技、技术、产品以及互联网圈子。确实如张鹏老师所说,1月20日特朗普上任,那一周美国媒体的关注热点基本都在特朗普身上。所以这一次关于DeepSeek的讨论,第一步确实有一定“出口转内销”的状态。
很有意思的是,特朗普上任当天晚上,我跟潘乱做了一场直播,聊的是特朗普上任对中美科技行业的影响。我们两个完全不懂政治学的科技博主,去聊这个话题,是因为当天白宫现场来了几个科技巨头的CEO,所以我们就闲扯了一段时间。
第二天,百度直播的运营又找到我。因为当天特朗普和OpenAI、软银、Oracle发布了所谓的“星际之门”计划,也就是5000亿美元的AI基础设施投资计划。百度直播的运营问我:“庄老师,能不能针对这个问题再直播一次?”
于是我第二天晚上又直播了一场,讲“星际之门”计划、对AI行业的影响,以及可能采取的措施和计划细节。直播结束后的第二天,我把音频剪辑成了播客,第三天上传到小宇宙,第四天这期节目就上了小宇宙首页。
那期节目里有一小段涉及DeepSeek。因为当时R1已经发布了,在美国那边,关于V3和R1,尤其是成本端和架构端的创新,对于过去两三年基于AI基础设施投资建设的宏大叙事,已经有了很多讨论。
我在那期节目里说,这件事情之所以被讨论到这个程度,最基础的原因在于:无论中国还是美国,大家都在探讨过去两年、基于巨大资本投入所构建的,以美股“七巨头”为代表的AI浪潮,这个主趋势是否受到了巨大挑战。
但当时我没有想到,这件事情会被推到后来那个状态。
我的节目上了小宇宙首页后的第二天,我觉得有一个很核心的事件。2024年中国最火的创业者之一,是《黑神话:悟空》创始人、游戏科学创始人冯骥。
1月26日晚上,冯骥发了一篇微博,讲他怎么看DeepSeek,第一次提到了两个关键字:“国运”。他把DeepSeek推到了一个新的层级。
我没记错的话,1月26日当天晚上,英伟达大跌17%,这件事情彻底引爆了后面的所有讨论。
1月28日上午,一篇号称是英伟达CEO黄仁勋内部信的文章在朋友圈疯狂转发,但那封内部信是AI写的。当晚,一篇号称是梁文锋回应冯骥的知乎回答也被无数人转发,那篇回答同样是AI写的,账号也是虚假账号。
那个账号的举报是我点的。我跟知乎运营说:“这个人一定是假的,这篇文章一定是AI写的,赶紧把它禁掉。”
那天我记得应该是龙年的最后一天。我跟太太、儿子和女儿在外面的酒店过春节,看着无数人转发那两篇文章。很多人被AI欺骗,我在无数人的朋友圈评论:“这是AI写的,这是假的。”我叫醒了很多人。
但大年初一早上睁开眼睛,我发现很多人还在转发,于是又去跟很多人评论。我写了一条即刻:“虽然我叫醒了很多被AI欺骗的人,但我又想到,AI发展到今天这个样子,尤其是以R1为代表的推理模型发展到现在,已经越来越难分辨什么是人、什么是AI。”
当一个共识形成,哪怕它是假的,有很多人去相信它,那它还是假的吗?
从那天开始,事情就已经不可控制了。后面的事情可能大家都知道了。
Lily
你刚刚说到梁文锋回应的那篇文章,我也特别想分享一下。我当时看完,还在一个群里回复:“哇塞,他写得好感人啊。”结果紧接着就在朋友圈看到你说这是假的,我当时就震惊了。
那是我第一次真正感受到,这一次确实跟之前不一样。我没有从那篇文章里看到特别明显的AI痕迹,当然可能也是我水平有限。我反而觉得它写得挺动人的。
张鹏
现在不光是DeepSeek本身,包括与它相关的一些政策和法律问题,很多都会对市场预期产生比较大的影响,也有很多AI小作文、假消息和误导性文章出来。
比如前段时间政策圈一直在传的所谓“特朗普AI沙皇”David Sacks提出的、为了应对DeepSeek而对中国AI产业采取的“五步绝杀”。每一步听起来都很绝,但事后证明,那篇文章好像就是用DeepSeek AI代写的,而且确实看不出来。
很多人都转发了。后来我写了一篇文章,把David Sacks那次访谈的全文放上去,也是希望能够以正视听。
Lily提到的《中美人工智能能力脱钩法案》,我也看到很多文章突然冒出来,说这个法案会导致每个下载DeepSeek的人被罚1亿美元。我看到很多这样的自媒体标题,确实非常匪夷所思。
他们肯定连法案文本都没有看过,也没有充分理解,但这种标题非常耸人听闻,传播得也特别快。
Lily
是的。我觉得张涛在这件事情上也很有发言权,因为我看到你写过一篇相关的文章。
张涛
我们这边的观察可能会更靠前一点,原因是我们直接做C端产品。相比所谓的业界从业者,一些比较资深、特别深度的AI用户,对于AI以及AI能力进化的敏感性,有时候可能比我们从业者还要高。
我可以讲一个很有意思的事情。我印象中应该是在1月23日,我们的用户群里有一些社区KOL,或者说非常深度的用户,已经把日常很多工作流程和AI整合起来了。他们会积极尝试各种新的AI技术和模型,看能不能改进工作质量,因为这会显著增加他们的工作效率和产出。
所以在1月23日,不管是国内还是海外的用户,已经开始找到我们问:“你们有没有接入DeepSeek R1?”
我们其实在1月22日就接入了,但有一部分用户还不知道。说实话,之前无论是V3还是R1出来的时候,我都会跟我们公司的首席科学家Peak聊。因为我读论文时有很多不懂的东西,都是他教我的。
V3的创新点我了解,R1是做什么的我也了解,但对于模型的实际能力,我觉得我的第一手体验没有用户那么直接。
从1月23日开始,不断有用户反馈他们需要接入DeepSeek R1,然后向我讲他们在R1上实现了什么样的案例。那个时候我突然感受到,这次可能不同于以前所有其他开源模型的发布。
以前通常是开源模型发布之后,我们再投入精力去研究它。这一次用户是主动来告诉我们,他们已经在R1上做了什么。
我后来专门写了一篇公众号文章,解释外界谣传、也可能颇受攻击的“600万美元训练成本”到底是怎么回事。这个数字跟它早期的爆火也有很大关系。
我日常会在Twitter上关注一些AI圈KOL。印象中,春节前、真正大火之前,最早转发的都是AI圈的人,比如Hugging Face的AK,不是OpenAI的Andrej Karpathy,而是Hugging Face的那位AK。他经常转发各种论文和新模型,是只有像Hugging Face这样比较业内的平台用户才会关注的KOL。
那时候大家讨论的都是V3和R1的创新点、训练方法以及它们的意义。从我的视角看,美国那边第一次真正破圈,是Marc Andreessen入场。
大家知道,Marc Andreessen在传统意义上甚至有点反华,对中国有一些对抗情绪。但北京时间1月24日,他开始转发DeepSeek R1的消息,先是回复别人的推文,后来很快开始自己发主帖。
一开始他说:“这个东西确实很厉害,但我很坦白地告诉大家,我并不为它的厉害感到开心。”这跟他以前的立场比较一致。
但很快,他的主推就变成了:“DeepSeek R1是人类收到的最好的礼物。”他还说R1是AI的“斯普特尼克时刻”。
这些变化发生在1月24日到27日,也就是春节前夕。你能明显看到他的情绪变化。
Marc Andreessen在美国不管是科技界还是科技界之外,影响力都非常大。所以我会看到,1月24日之前更多是圈内讨论;从Marc Andreessen入场开始,美国那边就完成了破圈。
对我个人来说,从Marc Andreessen开始转发的时候,我不得不承认自己有点心潮澎湃。你看到中国的一项工作,获得了一个原本在立场上比较对抗中国的美国KOL认可。
到1月26日,我看到冯骥发的那篇文章,感觉就像形成了呼应:真的成了,真的厉害了。再加上我自己也是《黑神话:悟空》的忠实粉丝,所以那段时间发了不少帖子,觉得自己欣赏的两个作品居然产生了这样奇妙的连接,我自己也非常开心。
Lily
冯骥发那篇文章的时候,很多人在朋友圈说“双厨狂喜”。
Lily
对。然后我觉得张涛刚好把这个话题引入到我们接下来想讨论的方向。
2. R1的产品化突破
很多人,尤其是像我这样的普通大众,都非常好奇:DeepSeek R1到底有哪些核心突破,为什么会导致全球范围内如此高的讨论度?
这个问题要不先请张涛帮我们解释一下,毕竟你是专业人士。
如果先就模型本身而言,我觉得首先,刚才庄老师其实也提到过,V3本身的创新点非常强。
V3那篇论文里用了大量工程和算法结合的技术。我这里说“奇技淫巧”是绝对的褒义词。它有大量工程和算法结合的创新,使DeepSeek能够在算力受限的情况下,用论文里提到的2048张H800,也能训练出GPT-4o和Claude 3.5级别的基础模型。
这件事本身的创新点很多,但V3论文的技术细节可能不太适合在今天展开。即便如此,对于整个业界来说,它也可能只是“another GPT-4o”或者“another Claude”,我觉得不会带来如此显著的影响,更不会达到后来破圈的程度。
R1在这个基础上起到了推波助澜的作用。它第一次验证了,业界之前在复刻OpenAI o1时所走的PRM路线,也就是强化学习中的过程奖励模型路线,可能走弯了,应该用一种更直接的方法走ORM,也就是结果奖励模型路线。
这背后当然还有很多技术细节,但对于不做技术的朋友,最简单的结论是:这个方向以前很多人想过,但没有人真正把它做出来。
DeepSeek是第一个把ORM这种强化学习方法跑通,并且开放出来的厂商。当然,有人会说OpenAI可能才是第一个,但在学术和开源世界里,如果你不发论文、不放出模型权重,那就等于没有。
所以在真实的学术和开源世界里,DeepSeek是第一个把这套方法跑通并开放出来的。
但我个人觉得,即使是这两个点对产业内部影响非常大,也不足以解释后面一层层的破圈。我从1月22日开始接入R1的API,看Twitter上全球用户的反馈和截图,大家都会分享自己使用DeepSeek的过程,觉得特别好用,甚至觉得“为什么世界上有这么好的东西”,觉得它比ChatGPT好、比Claude好。
我们在Twitter上看全球用户的截图时,发现了一个特别有意思的点:DeepSeek R1效果很好的案例里,80%都打开了搜索。
这是大众舆论讨论时很容易忽略的地方。大家认为是R1本身很厉害,但事实上,我们认为这一次R1赶上了一个非常好的时间差。
在此之前,reasoning model,也就是有思维过程的模型,类似GPT的o1,在全世界范围内,即使是已经使用AI的用户,真正用过o1的人也只是少数。
因为o1相对比较贵,需要购买ChatGPT Plus或者Pro这样的高级会员,20美元或者200美元才能使用。因此,在DeepSeek R1把模型和产品同时发布之前,全世界真正用过reasoning model的人很少。
而这少部分用过o1的用户,还会遇到另一个问题:o1之前没有接入搜索。你在ChatGPT里使用o1时,它只能自己推理,没有办法通过搜索获得实时知识。
所以DeepSeek R1除了技术本身很厉害、开源以外,它破圈还有一个非常重要的原因:它在全世界范围内第一次提供了一个既有推理能力、又能通过搜索获取现实知识,并且不断结合和反思的产品。
注意,这是一个产品,不只是一个模型。在R1发布之前,“reasoning model调用search”的体验是不存在的。
于是大量“自来水”用户接触到一个此前完全没有体验过的高质量产品体验后,自己变成了自来水。
从Twitter舆论的发展来看,我觉得一个非常重要的点是,不能永远只说因为它开源、因为它用了什么技术。如果能形成这么广泛的破圈讨论,一定有很多自来水来自产品体验本身。
我们抓到的关键点,就是R1加搜索的组合。如果当时只发布R1,没有把搜索加上,后面未必能破圈得这么厉害。这是我们的一个观察。
庄明浩
我补充一下涛哥的说法。DeepSeek之前没有App,它的App应该是1月中旬才上线。上线初期,App底下有两个按钮,一个是R1,一个是联网搜索。
最开始两个按钮不能同时点:要么使用联网搜索,搜索反馈类似今天各种AI搜索和聊天产品的结果;要么使用R1,但R1不联网,它的信息数据源应该截止到2023年12月。
所以在那个时间点,它还没有达到让用户“哇”的准备条件。
但这波浪潮开始之后,可能也就是7、8天后,App里的两个按钮可以同时点了。我最开始DeepSeek发布App时就安装了,两个功能都试过,但当时确实没有达到让用户惊叹的状态。
当两个按钮可以同时使用时,事情就发生了变化。
Lily
我作为普通用户也特别有感受。不管是之前最头部的OpenAI Plus账户,还是一直以来写作能力最优秀的Claude,我其实都试过,但确实没有任何一个AI应用给过我最初使用DeepSeek时的那种体验。
尤其是刚开始DeepSeek还没有被海量用户冲垮、经常显示服务器繁忙的时候,使用非常流畅。我试用时得到的体验和答案,是以前任何AI应用都没有给过我的。
今天听了涛哥的解释,我终于理解为什么了:确实是推理模型和搜索结合所带来的体验。
我这几天也明显发现,问类似的问题时,它给我的答案没有最早使用时那么好。我自己发现的核心区别就是联网搜索不能用了,两个答案的质量确实有明显区别。
3. 六百万美元神话
我们要不再聊聊DeepSeek核心突破中其他有争议的观点,尤其是刚才涛哥提到的、极大节约成本的600万美元训练成本。这件事不管在国内,尤其是在美国,都有很多质疑。张涛怎么看?
张鹏
我先讲吧,因为我专门写过一篇文章。
我观察R1的时候,大概到春节、应该是除夕为止,有一个非常明显的感受:美国主流媒体和美国学界长期冷落,或者说刻意忽视中国AI。因此,一个东西突然火了以后,你会发现他们想了解中国时,英语世界的信息极度落后、滞后,甚至出现很多假消息。
比如我文章里提到,R1火了之后,国外KOL和主流媒体如果要写新闻,肯定会调查DeepSeek是一家什么样的公司。于是出现了3个比较著名的谣言,而且直到今天,在Twitter英文世界搜索DeepSeek,这3个谣言还在流传。
第一个是关于罗福莉。因为她是女性、年纪比较轻,也是V2模型时期的研究员,所以很多KOL都去传播她。但在中文世界搜索就会发现,她已经去了小米,不在DeepSeek了。可在英文世界,这个消息非常滞后,直到今天仍有很多人把罗福莉描绘成DeepSeek背后的秘密武器。
第二个谣言是,DeepSeek R1是中国某个量化基金的side project。他们特别强调side project,描述成中国有个量化基金,主业是做量化,结果一不小心把副业做到全球第一。
但只要是国内从事这个行业的人,我相信绝对不会觉得DeepSeek是side project。我们都知道,他们是非常认真地在做这家公司。但这种叙事能在英文世界流行,还是因为他们长期以来对中国AI的观察非常缺失。
第三个最经典的谣言,就是DeepSeek R1的训练成本只有600万美元。相比Meta动不动上亿美元,这个说法似乎直接打垮了英伟达的叙事。
我们先看攻击对象最原始的表达是什么。600万美元这个数字最初甚至不是来自R1,而是来自V3。
R1进行强化学习的基础模型是V3。V3技术报告里提到,他们总共用了大约278.8万H800 GPU小时。如果按照每小时2美元的租用成本计算,差不多就是500多万美元,我们可以粗略说成600万美元。
首先,DeepSeek在表格里非常清楚地告诉了大家,这500多万美元的构成是什么:预训练花了多少钱、上下文扩展花了多少钱、后训练花了多少钱。模型的参数规模和训练数据量,也都是清晰的数字。
如果是业内人士,根据模型规模、激活参数量和训练数据量,训练时长完全可以通过公式计算出来。这样的成本对行业来说没有什么疑问:如果采用这样的MoE架构、用这样的数据量训练,成本就是这个量级。
而且DeepSeek在技术报告里还非常清楚地说明,表格里的训练成本只指V3最后一轮训练成本。此前所有研究成本、实验成本、算法研究、结构研究、数据准备和清洗成本,都没有算进去。
作为第三方观察者,我觉得它给出的是一个数学上完全可以验证的成本,也没有刻意忽略其他成本,只是没有把它们列在这里。所以我不会责怪DeepSeek。
当时Twitter上的舆论发展,大概是这样的:在Marc Andreessen介入之前,还停留在Hugging Face的AK等人的讨论阶段,大家说DeepSeek用600万美元做出了Meta的Llama用几千万美元做出的东西。
这个对比完全正常,因为它比较的就是单次模型训练成本,600万美元对几千万美元。这个成本确实有优势,也确实节省了很多。
但我印象中,在Marc Andreessen介入之后,越来越多的KOL和传统媒体不太了解技术,很快忽略了600万美元所代表的单次训练成本,开始拿它去跟Meta在Llama上的整体投入比较,包括多次训练,甚至把整个团队的投入都算进去。
再后来,更多媒体介入,600万美元甚至不再跟训练模型相关,而是拿去跟Claude背后的公司融资规模,甚至估值规模比较。这时候它就完全变成了一个神话。
一旦变成神话,就会有人攻击它,说它是骗子。但我们想一想,这件事情最开始的时候,DeepSeek根本没有想过要骗人。中间编出来的这些发展过程,绝大部分都是英语世界里不懂行业的KOL和媒体制造出来的。
到最后,事情已经完全变成了一个跟技术无关的、纯粹关于地缘政治、企业管理思路和产业发展路线的争论,跟DeepSeek最初的表达已经毫无关系了。
庄明浩
我也认同张涛的说法:500多万、600万美元,仅仅是一次训练模型的成本,跟幻方或者DeepSeek在AI大模型上的整体投入完全不能相比。
但在美国主流AI叙事里,各家巨头包括OpenAI、Anthropic的投入,我的PPT里有一页非常明显。标题很简单,是我很喜欢的一位主播大猛说的一句话:“在成年人的世界里,钱是最简单的标准。”
以2024年的情况来看,AI相关公司大概可以分成3类。
第一类是科技巨头。科技巨头每年在AI上的投入,尤其是以资本性支出为主的投入,是以百亿美元为单位计算的。
正好这周几家巨头发布了财报,Meta、Google、微软、亚马逊都公布了明年AI基础设施投入,都是几百亿美元。没记错的话,微软是800亿美元,Meta是650亿美元,亚马逊是750亿美元,Google应该是700亿美元左右。
这就是科技巨头。主流媒体和美国KOL的认知里,AI相关的大公司每年在这件事情上投入几百亿美元。
第二类是AI的主要参与者,以OpenAI、Anthropic、Claude和xAI为代表,计量单位是十亿美元。OpenAI去年应该亏了50亿美元,Anthropic也是几十亿美元,xAI去年大概融了几十亿美元。
这些公司的AI相关投入,包括硬件、数据中心、人员和基础设施,都是几十亿美元。它们属于主要参与者。
第三类是挑战者,简单来说就是几亿美元,比如Midjourney、Character.AI这样的公司。
所以在主流媒体叙事里,AI公司的投入单位是亿美元、十亿美元和几百亿美元。甚至如果把科技巨头的资本性支出加起来,去年美国前6大科技巨头在AI基础设施上的投入大概是2300亿美元,今年可能会涨到3000亿甚至4000亿美元。如果再算上“星际之门”计划的1000亿美元,数字会更大。
我刚才讲的这些数字,最小是几亿美元,往上是十亿美元、百亿美元、千亿美元。这些数字每天都出现在媒体和讨论里。
突然有个人告诉你:“我只需要600万美元。”这种落差太大了。哪怕不懂行业的人,也知道这中间差了多少个零。
所以当事情被演绎成神话,大家不再讨论细节之后,就没有办法了。
过程中当然也有清醒的人。比如Anthropic的CEO在一次采访里提到,600万美元左右的一次训练成本确实很低,工程上有很多创新;但常规的2000万到3000万美元,也不是遥不可及的数量级差异。
只是故事被演化到这个程度以后,事情就不可控了,后来甚至导致英伟达大跌,大家开始讨论整个行业各种各样的问题。
张鹏
我基本同意前面两位老师的分析。这些数字有时候已经超越了事实,添加了很多情绪,尤其是双方的民族主义情绪,以及中美AI竞争、科技竞争的争论。
从技术社区之外普通人的角度看,他们对DeepSeek最直观的认知可能有两点:第一,它用很低的成本实现了几乎比肩OpenAI的模型性能;第二,它在更低端的硬件和GPU上实现了高级推理。
中美两边的民间都有动力去夸大DeepSeek怎么省钱,也会质疑美国的OpenAI等AI巨头为什么花了这么高的成本,却没有和中国模型拉开明显差距。
美国国内一直对OpenAI和领先AI巨头有一些质疑,认为政府对它们的支持非常多,不管是政策工具、出口管制,还是国内资本投入,支持都很大。
突然又出现一个被认为一直落后、被美国看不起的中国大模型,花这么少的钱实现了类似效果,肯定会加剧美国国内对这些公司的质疑。
对中国来说,这当然是一个非常重大的突破。所以我觉得双方都掺杂了很多情绪,这个时候事实反而不是特别重要。
这也是为什么我前段时间一直说,讨论需要适当降温,需要更多产业界和技术社区的人去澄清一些基本事实。
4. 算力需求不会消失
Lily
这次DeepSeek爆火之后,硅基流动和华为云联合合作,基于华为昇腾技术提供了DeepSeek R1服务。前面也提到,DeepSeek爆火后,英伟达股价暴跌17%。
R1和V3的很多创新,其实都是因为它们面临有限资源,所以做了大量工程和技术创新。这也揭示了一个问题:此前美国和国内一些AI行业人士都在讲“AI算力门槛论”,认为必须投入几十亿、上百亿美元,才有资格做大模型。
包括1月底李开复老师的零一万物退出训练大模型,也给这个问题提供了一个注脚。我特别想听听几位怎么看DeepSeek在资源匮乏情况下做出的创新,以及它对芯片、英伟达和上下游产业的冲击,包括它在国内昇腾芯片上的应用,以及它打破了哪些传统叙事。
庄明浩
我的感受是,这些都是细节。
第一个细节是,国内做推理基础设施的厂商和做聊天机器人的厂商,可能因为DeepSeek爆火,而DeepSeek本身没有那么强的应对大流量运营的能力,导致用户蜂拥寻找本地部署和云端部署方案,这对相关厂商的用户增长是一个巨大的促进作用。
这个促进作用是此前所有人都没有预期到的。
举个最简单的例子,硅基流动的CEO袁进辉老师之前在极客公园也写过,DeepSeek V3上线时,他和Monica的情况差不多:大家觉得这是一个技术能力不错的开源模型,没有想太多,也没有最快接入。
但事情火了之后,他们马上跟进。无数人注册硅基流动,开始使用它的API、调用和部署。
我看到好几个KOL都在使用硅基流动的邀请注册码。因为他们现在每邀请一个人成功注册,就有14元奖励,有些KOL晒出的奖励数字已经很庞大了。现在小红书评论区里全是邀请码,B站首页今天应该也有至少3个教大家如何在本地或云端部署DeepSeek的视频,每个视频都有1万人同时在线。
这一步对生态的促进和长远影响,今天还无法预估。
在此之前,这些厂商的知名度、影响力、业务以及能做什么、不能做什么,怎么跟上下游结合,对非行业资深人士来说都完全陌生。但这一波之后,很多人都知道了。
第二,当DeepSeek出现之后,结合我们前面讨论的成本问题,市场最直接的第一反应就是砸英伟达。但股票市场本身是一个多方博弈的过程,出现巨大下跌,一定有其他因素,不会是单一因素。
可能本来空头就比较多,积压的情绪已经到了需要一个时间点引爆的时候,而这件事把它点燃了。
我在年度报告里有一张图,展示英伟达过去一年的股价变化,旁边还有一张标普500公司单日涨跌幅排名。涨幅前10和跌幅前10这20个选项里,应该有16到17个都是AI相关公司。
为什么?因为我有个说法叫“盈亏同源”。英伟达既是这一轮AI大模型最大的受益者,又是七巨头之一,它的波动当然最大,关于它的争论也最多。
所以当天跌17%之后,更多反面讨论开始出现。大家会想,如果真的出现更低成本的方式,那是不是会促进未来应用层爆发、算力需求增长和个人使用门槛降低,从而带来整个生态更大的繁荣?
这个观点引发的讨论是:如果需求门槛更低,对芯片和上下游厂商的需求反而可能是长期更好的事情。
这两种观点在过去一两周疯狂对冲,谁也很难说服谁。它们在几家头部公司的股价上不断对抗。
很巧的是,这几家公司最近都在发财报。Google的财报应该是昨晚发布的,它非常激进地提高了明年AI基础设施投入,预期增幅可能是40%左右。但即便如此,即便Gemini最近表现很好,财报发布后Google还是跌了8%。
英伟达大跌那天,苹果没有跌,大家认为端侧模型可能会受益。前两天港股开盘之后联想涨得很好,逻辑就是端侧模型对终端厂商是好事,小米也是类似逻辑。
你会发现,同一个信息,在二级市场和股票市场里,对不同公司的解读完全不同,影响了这波短期操作。
Lily
张涛有什么补充吗?
张涛
我觉得算力的影响可以分成短期情绪和中长期看法。
春节期间,我和真格基金的雨生有过交流。他提到一个特别有趣的观点:他观察身边的朋友,美国西海岸的人都在买英伟达,东海岸的人都在卖英伟达。
西海岸主要是产业界,大家觉得像R1这样的开源社区技术突破和发布,一定会带来整个行业更加繁荣,未来不管是推理还是训练,需求都会大幅增长。
东海岸主要是华尔街和金融界,短期情绪会觉得这是重大利空,所以赶紧卖。
我觉得出现这个分叉点,很大一个原因是大家对未来的看法不同。股票市场和长期产业发展,并不一定在任何时间段都同趋势、同方向。
我不是专业金融人士,只是从业者。站在我的角度,我对未来算力需求非常乐观。不仅仅因为R1,还有很多其他原因。
我觉得可能不需要3到5年,甚至3年之内,整个推理算力需求就会比现在扩大100倍,不是10倍,是100倍。
但对英伟达来说,最大的变化在于:推理需求上涨了,但这些需求是不是都会由英伟达吃掉?我觉得这可能是未来趋势最大的变化。
最近大家也看到华为昇腾910C,硅基流动已经部署并开始用它推理R1。大家会想,华为可以,那其他厂商是不是也可以?
以前开源世界没有真正能和一线闭源模型抗衡的模型,所以大规模部署开源模型的动力没有那么强。这次第一次产生了一个真正能和闭源模型抗衡的时刻。
当大家有实际部署需求时,突然发现好像不用英伟达也可以。这是整个叙事的一个重大变化。
但从整体推理需求量来看,我非常看多算力需求。
5. 出口管制的反作用
Lily
这里我想引入下一个话题。有一些人认为,美国一直以来的芯片出口管制政策并没有真正限制中国AI技术的发展,反而导致了很多技术创新。
这方面想先听听张鹏老师的观点。你一直关注美国政府对DeepSeek爆火的反馈,尤其是美国政府方面的反应。
张鹏
美国对DeepSeek的一个非常重要的关注点,是与芯片相关的事实问题,比如它到底有没有最开始流传的5万块H100芯片。
这件事最早缘起于2024年11月。当时美国半导体和AI产业界一位很著名的观察家、运行着一些newsletter的Dylan Patel,发过一条推文,说DeepSeek拥有超过5万块Hopper GPU。
他没有说是H100,当时说的是Hopper GPU。H800当然也是Hopper,只是因为美国制裁,它的内存带宽受到更多限制,属于阉割版。后来这个阉割版也被美国进一步纳入出口管制。
在达沃斯论坛期间,Scale AI的首席执行官Alexandr Wang接受采访谈DeepSeek和算力供应时,直接说DeepSeek有5万块H100,并认为这违反了美国出口管制。因为DeepSeek不敢对外说,所以这件事情引起了美国商务部、白宫国家安全委员会等部门的关注。
H100是美国严格出口管制、禁止向中国大陆出口的芯片。那么这5万块到底怎么来的,是不是通过走私获得的?这是他们需要搞清楚的问题。
后来媒体披露,白宫国家安全委员会牵头成立了类似的调查机制。我理解这项调查现在仍在进行。
目前大家比较普遍的理解是,5万块H100可能是假消息,DeepSeek主要依赖的应该是H800。我们前面提到的DeepSeek创新点,也主要是围绕H800,克服内存带宽不足,把有限资源转化为更多计算能力。
我看过一些分析,说DeepSeek在每块H800的132个处理单元中,专门编程20个用于管理跨芯片通信。这在CUDA架构里很难做到,所以很多分析认为,DeepSeek工程师使用了另一种叫PTX的指令集,和CUDA并不完全一样。
也就是说,只有在使用H800的情况下,这种工程优化才有意义。但这件事毫无疑问激发了美国方面的密切关注。
对此有两派观点。一派认为,正是因为美国前期出口管制过于严格,对中国公司产生了倒逼效应,逼着它们把工程能力做到极致,才开发出DeepSeek R1和V3。这是美国出口管制导致的恶果,属于自食其果。
另一派认为,DeepSeek仍然依赖英伟达芯片,还是用H800做出来的,所以美国当初就不应该放行H800,应该连H800及其等效芯片一起管制。
前几天彭博社也报道,美国政府正在考虑进一步管制目前仍然合规的英伟达阉割版H20。我理解国内目前对H20还有一定依赖,如果管制,肯定会产生相应影响。目前来看,H20大概率会被管制。
Lily
这方面也想听听庄老师和涛哥的看法,尤其是DeepSeek芯片来源的问题。
庄老师,DeepSeek论文明确提到使用的是H800。我记得“暗涌”有一篇文章,梁文锋也明确说过,他们很多是老卡,而不是真正现在最先进的卡。
但我也记得一个新闻,那可能是DeepSeek第一次出圈的重要新闻:当时报道称,幻方是国内唯一拥有1万张A100或者H100芯片的公司。庄老师怎么看?
庄明浩
第一波关于AI基础设施投入和买卡的讨论中,大家就在讨论中国哪些巨头拥有的卡比较多。
幻方是做量化的。简单说,量化就是用机器炒股。它的运作方式是推理、计算、分析、总结和整理,整个过程听起来跟大模型非常像。
所以幻方做量化时就已经拥有很多卡。在美国还没有完全出台明确禁令之前,幻方集团就拥有不少芯片。当时有一波新闻说,中国除了字节和腾讯之外,那个时间点拥有万卡规模的可能只有幻方。
幻方当时使用万卡是为了做量化,但那时它已经开始并行进行大模型研发了。
后面管制限制出台后,至少从今天看到的V3和R1论文来看,使用的都是合规芯片。但你要知道,中国公司有很多方式使用受到管制的芯片,比如租用、通过海外公司实体,或者从新加坡等地转移,方式非常多。
Lily
涛哥怎么看?你作为一线AI创业者和产品经理,这个问题可能也很现实。
张涛
我觉得最现实的来源,可能还是SemiAnalysis上周发布的那篇报告。报告说他们有6万张卡:1万张A100、1万张H100、1万张H800,还有3万张H20。这个数字应该比较可信。
说实话,如果认真把V2和V3两篇论文从头读到尾——当然我也是在公司首席科学家的陪同下读的——你会不断问自己:如果他们手上真有Alexandr Wang所说的那么好的5万张卡,他们为什么要做这些事情?
读V2和V3论文时会感觉,他们为了克服芯片互联带宽问题、解决传输量和运算量问题,使用了很多偏hack的方式。如果他们不受芯片限制,我觉得根本不会去做这些事情。
所以认真读过V2、V3报告的人,可能都会产生同样的疑问,并得出同样的结论:他们确实没有那么多卡,尤其没有那么多满血H100。
如果真有5万张H100,他们就不会做V2、V3里提到的那些工程优化。
6. 蒸馏不是模型偷窃
Lily
另外我特别想讨论一个问题,这也是美国方面对DeepSeek R1非常主要的抨击:蒸馏问题。
有人认为DeepSeek R1使用了ChatGPT模型的一些技术进行蒸馏,因此可能侵犯美国领先的知识产权。这个问题想请涛哥先简单介绍一下,什么是蒸馏?
张涛
Distillation,也就是蒸馏,在机器学习领域早期是一个定义更明确的术语。
比如你训练出了一个大模型,70B模型。你给这个70B模型一些prompt,让它大量输出数据,然后把这个70B模型中间的某些层抽掉,只留下更少的层,比如原来有200层,抽掉之后剩下100层。
这样模型参数变小,层数变少,网络结构变简单。然后用前面那个70B完整模型的输出,去训练这个更小的模型,比如32B模型,让它尽可能表现得和teacher model,也就是70B模型一样,这叫distillation。
最严格的蒸馏定义,是同一个模型、同源模型,把一些层抽掉。后来这个概念被泛化了,不要求两个模型完全相同,而是用更大的模型输出去训练一个更小的student model。student model在架构上甚至可以和teacher model不同,但目标都是让student model的输出尽可能接近teacher model。
这里有一些限制。首先,蒸馏是大尺寸模型到小尺寸模型。其次,student model理论上不可能强过teacher model。
Lily
美国很多KOL都说DeepSeek使用蒸馏技术,是“偷了美国的领先技术”。但我也看到OpenAI的一位研究员承认,DeepSeek R1的一些发现可能是独立于OpenAI的。
蒸馏技术在AI行业是不是非常普遍?之前也有新闻说,美国限制中国企业使用ChatGPT模型,但字节仍然通过API使用的方式蒸馏ChatGPT模型。你怎么看?
张涛
蒸馏在行业里绝对普遍。每家都不会承认,但这件事情确实存在,中美都有。关起门来说大家都知道,公开场合就没人会承认。
其次,大家不要把蒸馏想得那么厉害。因为很多人不了解蒸馏原理,会觉得蒸馏就像做汤,把水分熬干、剩下精华,似乎是一个剽窃过程。
但如果真的去看V3以及R1的整个训练过程,即使蒸馏存在,它能影响的地方也非常小。
我们讨论任何事情,都要看这个说法最开始是怎么产生的。美国舆论中关于蒸馏的质疑,包括一些华人的质疑,很多都来自截图。
大家去问DeepSeek官方应用时,它有时会出现自我身份认知错误,说“I am ChatGPT”;或者在R1的reasoning token,也就是思考过程里,提到“作为OpenAI的ChatGPT,我不能怎么样”。大家就截屏传播,说它果然剽窃了OpenAI。
最夸张的说法是,DeepSeek就是OpenAI的套壳,这个就不值得回应了。更多人说它使用了蒸馏技术,但我觉得,拿这种案例判断的人,本质上并不了解现代模型训练过程和LLM的基本原理,只能通过最后输出的一句话做判断。
简单来说,任何语言模型都不知道自己是谁。
预训练模型时,我们使用全世界的语料,对数据进行处理。很多人对AI有一些玄学想象,觉得AI像一个人,有自我认知,所以问它时它就会说“I'm ChatGPT”。
但实际上,预训练通常不会专门训练这个内容,而是在后训练阶段进行对齐。对齐有很多方向,比如安全、有害性等,其中有一个方向叫self-cognition,也就是自我认知。
在这部分对齐中,会通过大量instruction数据训练模型,让模型知道自己是谁。也就是说,模型在训练过程中本身没有所谓的自我认知,它的自我认知是通过后期对齐实现的。
R1有一个比较tricky的地方是,行业里不少人认为,它通过减少对齐,实现了模型能力提升。
所有对齐,不管是安全对齐还是其他方向,从通俗意义上讲都会让模型“降智”,让它的能力有所降低。
比如仔细看R1论文,它提到最终一轮SFT中引入了Harmless数据集,也就是无害信息数据集。如果不加入这部分对齐过程,它在某个benchmark上还能提升7、8个点,但为了完成对齐,就牺牲了一些能力。
所以大家普遍认可,R1少做了很多OpenAI和Claude需要做的Alignment Tax,也就是“对齐税”。
商用模型为了符合各种法规、社会价值和公众要求,要做很多安全对齐,这个过程中会损失一些能力。Self-cognition也是后对齐的一部分,R1在这方面做得比较少,所以能力很强,但对自己的自我认知不够强。
现在互联网上充斥着大量语料,里面到处都有ChatGPT这样的内容。R1预训练时,数据集不小心混入这类语料,是非常正常的事情。
另外,大家对蒸馏的理解还有一个问题。假如真的要做蒸馏,应该怎么做?
首先,现在已经做不了最严格意义上的蒸馏。真正的蒸馏需要teacher model在预测每一个token时,不仅输出概率最高的那个,还要输出所有候选token的概率分布。
比如“Lily曾经是一个律师”,在预测某个token时,可能“律师”的概率是99%,另一个词“女生”的概率是0.5%。每次推理时,next token其实都是一个概率分布,有很多可能性。
真正做蒸馏时,每一次next-token prediction都要拿到完整的词语概率分布,student model才能学到真正的信息。但OpenAI一年多以前就已经在API里屏蔽了每一步推理时所有候选token及其概率值。
所以现在通过线上API做真正的蒸馏,学不到特别多东西。
其次,如果真的做蒸馏,大家想想会怎么构建prompt?难道你会让teacher model输出的每句话都以“I am ChatGPT”开头吗?
如果你真要让teacher model教你,肯定不会让它先输出“I am ChatGPT”。比如你问它“5加5等于几”,它直接输出“10”,API只会返回“10”,不会返回“I am ChatGPT”。
所以网上那些拿DeepSeek官方应用回答里的“I am ChatGPT”,或者“作为OpenAI的AI”来证明它偷窃技术的说法,在从业者看来都不是特别懂行。
Lily
张鹏老师也想听听你的看法。我记得你在这个问题上也写过文章。美国方面认为中国通过蒸馏窃取领先技术、侵犯知识产权,这件事情应该怎么理解?
张鹏
我理解,美国那边有一些情绪化表达。严格从法律上分析,首先要从知识产权法角度看。
如果说存在“偷窃模型”,什么情况才属于偷窃模型?我觉得无外乎几种情况。
一种是设法获取别人无意间公开或者共享的模型。可以是在物理意义上窃取存储模型的设备,也可以是破解他人在终端设备或模型接口上设置的安全保护,从而获得模型;或者通过网络入侵获得模型。
这些都属于没有争议的偷窃模型行为。除了可能违反相关协议、承担民事责任,还可能因为违反网络安全相关法律法规,承担行政甚至刑事责任。中美在这方面应该没有太大差异。
第二种是套壳。模型本身是合法获取的,但你没有引入新的数据或模型架构,也没有在训练代码、微调、对齐或推理生成上做实质性修改,却把别人研发或共享的模型说成自己研发的。
这在整体上也没有争议,属于一种偷窃行为,很可能构成知识产权法上的著作权侵害、欺诈以及违反开源协议。
第三种是模型虽然自己研发,但在关键环节,比如数据配比、架构设计或其他对性能提升非常重要的优化环节,使用了不是自己的参数,而是不知道通过什么渠道拿来的参数,这也可能有侵犯商业秘密的风险。
但模型蒸馏非常复杂。过去大家讨论AI知识产权和版权问题时,很少讨论蒸馏,所以它肯定是AI知识产权法律领域下一步需要研究的问题。
目前不能当然地说蒸馏就是违法,或者当然违反协议。很多应用场景,包括前面两位老师提到的,其实都有合法蒸馏的需求,行业里也普遍存在类似行为。
什么情况下蒸馏他人模型属于窃取?我理解这个要求应该非常严格,需要有非常明确的双方使用协议或其他合同规定。
而且在一般情况下,我觉得它不应当构成知识产权法上的侵权,更多可能是违反合同法、承担违约责任。
但从美国方面的表达来看,很多人简单把这件事定性为“偷窃模型”。我理解这说明它已经不只是一个法律问题。
比如David Sacks作为特朗普任命的AI沙皇,未来在AI监管和对华AI竞争方面应该有很大的话语权。我注意到,他已经连续3次提到模型蒸馏,并认为这是侵犯知识产权的行为。
这是一个非常值得警惕的信号。未来按照他的说法,美国OpenAI等闭源模型企业可能会采取更多措施,防止中国企业蒸馏它们的模型。
至于怎么防止、技术上能不能做到,我并不特别懂,也不知道他是否真的能做到,但至少他已经有这个意识。
还有人在讨论,美国未来是否会出台相关监管法规,比如要求托管闭源模型的美国云服务商,像银行业反洗钱那样履行“了解你的客户”规则,也就是Know Your Customers,监测中国企业蒸馏美国模型的行为,并采取报告或预防措施。
但技术上到底能不能做到,我觉得要打一个问号。
Lily
涛哥有补充吗?美国有没有什么办法防止这种蒸馏?
张涛
我觉得很难。如果只是大家现在讨论的蒸馏层面,只要模型开放出来让大家使用,就避免不了这件事情。
Lily
我也有一点自己的看法。我认为美国在这件事情上非常双标。
OpenAI和ChatGPT当年训练时扒遍全网数据。很多关注AI的人可能还记得,OpenAI当年的CTO接受主流媒体采访时,有人问他们是不是在未经授权的情况下下载YouTube视频进行训练,他也是装作茫然无知地回应。
AI大语言模型发展到今天,大家都知道数据一直是瓶颈,全网数据也快被耗光了。说得粗犷一点,互联网数据被侵犯的最大行为主体,我觉得就是OpenAI和ChatGPT。
但他们反过来指责我们使用行业通行的蒸馏技术,我觉得这件事情非常双标。张老师怎么看?
张鹏
我理解这其实是不同的问题。
你刚才说的训练数据,包括大量本身有版权的文本和图像,在没有获得版权人许可的情况下被用于模型训练,这是大模型知识产权争端中的主要问题之一。
比如训练数据爬取是否构成版权侵权、AI生成内容的版权归属、API滥用是否违反服务条款等,中国和美国法院的司法实践中都有一些著名案例。
但这和美国人所说的模型蒸馏、知识蒸馏,是不同的问题。
前面说的那些问题,涉及获取训练数据时的知识产权侵权,是输入端的问题。模型蒸馏则是使用美国前沿模型输出的数据,这是不同的问题。
美国人之所以敏感,是因为他们认为,大家虽然都在做知识蒸馏,包括OpenAI、Anthropic和Google,但中国企业蒸馏的是他们的模型,而这些模型是他们投入大量训练成本做出来的。针对他们的模型进行蒸馏,在某种程度上是搭便车,他们觉得这不公平。
但这是不是违反知识产权法,是另外一回事。
庄明浩
我基本没有补充。这个话题从蒸馏是什么,到大模型行业如何获取和处理数据,再到中美两国对数据敏感性和安全的考量,命题一步一步被放大到不可解释。
最前面的问题还可以解释,但到后面已经不是技术问题了。所以它之所以发展到现在这个样子,必然是后面那些更大的命题导致的。
既然已经不可解释,就让它存在吧。
7. 监管正在追赶技术
Lily
最近DeepSeek爆火后,也面临欧洲一些国家的监管挑战,包括意大利、爱尔兰、法国和比利时,以及美国方面的挑战。
我觉得这个议题本质上并不只是DeepSeek的问题,而是一个具有巨大潜力的技术发展,与既有规则体系之间的矛盾。
AI发展本身对知识产权就是一个巨大挑战。前面也提到,很多模型可能抓取了全网数据进行训练,这本质上就是一个核心矛盾。各国和产业界都在探索,还没有定论。
到今天这个时间点,欧盟、美国,包括我看到的澳大利亚,狭义上关注的可能是App本身,更多集中在数据安全和隐私。
实话实说,DeepSeek这家公司在产品、运营和安全方面的投入,肯定不如国内大厂,相关经验也没有那么丰富,所以一定存在一些瑕疵。
但我觉得它们的问题在于,DeepSeek是一家创业公司,成立可能才一年多。对创业公司来说,主要任务是开发最有创新性的技术,而这正是它目前做到的事情。
但现在所有人都在指责它监管合规方面没做好,明明这根本不是它的主要任务,甚至排不上次要任务。
与此同时,全世界各种网站和供应商在这方面都有巨大问题,但他们偏偏挑DeepSeek来讲,某种程度上就是枪打出头鸟。
Lily
这一点上我觉得还可以继续延展一下。这个事情可能跟TikTok的事件有些类似。App层面包括推荐算法、隐私数据,以及服务和技术在当地落地的问题,都可能引发新的讨论。
这两天Sam在亚洲,先去了日本,和软银成立合资公司,由软银负责OpenAI在日本的落地;之后又去了韩国,OpenAI和Kakao成立合资公司,由Kakao负责ChatGPT在韩国的落地。这些所谓的落地,本质上都涉及刚才提到的数据、安全和合规问题,也会让人想到云上贵州。今天这个世界的地缘政治环境下,任何高科技相关的头部应用、服务和技术在当地落地,都不是一件简单的事情。
刚刚庄老师提到的这一点上,我特别想聊一个问题。张鹏老师主要研究中美之间的地缘政治和科技竞争。之前的美国对外投资禁令、数据脱钩法案,以及现在正在讨论的中美人工智能能力脱钩法案等议题,也可以放在一起,印证特朗普2.0时代的中美科技战争。张老师能不能跟我们分享一下?
张鹏
这当然是一个比较大的问题。毫无疑问,AI现在是中美地缘政治竞争和中美科技竞争的核心议题。
拜登政府时期,对华科技竞争主要围绕AI展开,实际上从几个角度对中国进行限制。首先是算力方面,严格控制高端GPU,包括能够生产制造高端GPU的半导体制造设备,以及上游零部件和原材料的出口管制。这是贯穿其整个任期的一条主线。
数据方面,在任期末出台了切断美国敏感数据跨境向中国流动的法规。虽然为了照顾美国公司的商业利益,对敏感数据进行了定义,试图限缩在特定领域,但实践中仍然比较宽泛。这个由司法部发布的联邦法规应该下个月生效,我理解它会对中美双边数据跨境流动产生较大限制。
此外,在人工智能高度依赖的其他要素,比如资本和人才方面,也有相应限制。资本方面就是前面Lily提到的反向投资审查,框定了先进半导体、量子计算和先进AI三个领域,限制美国资本支持中国相关产业发展。
在AI方面,它设定了一些标准和参数,核心理念是美国的钱不能支持中国发展能够和美国AI公司竞争的前沿大模型。反向投资审查规则已经生效。当然,特朗普时期理论上仍然有足够工具修改甚至推翻它,但他这么做的理由是什么,可能还要放在贸易、关税以及中美双边关系其他敏感问题的大盘子里谈判和沟通,未来发展还很难说。
人才方面,特朗普政府可能出台限制措施,主要针对中国企业在美国招聘当地人才,以及持有中国护照的中国工程师在美国参与AI模型研发。我们也得到过一些消息,本届政府正在从签证和移民政策角度研究对中国的限制措施,核心是美国AI人才不能支持中国前沿AI产业发展。
背后的战略逻辑是,美国政府把AI模型,尤其是谁先实现通用人工智能,视为影响中美战略稳定、类似核武器的东西,要确保美国首先实现AGI,至少不能让中国先实现。因此它采取两步走:一是通过资金扶持和产业补贴拼命发展自己,包括前面提到的星际之门计划;二是拜登政府时期实施的措施,尽量拖慢中国AI发展,确保中国始终比美国落后一截,至少不能先实现AGI。
DeepSeek出现后对美国政府冲击很大,是因为前期限制措施和让美国公司跑得更快的措施,似乎没有起到应有的效果,中国模型公司还是很快追赶上来,甚至有潜在可能超越美国公司。所以他们内部现在也有些慌,肯定会通盘研判,考虑如何继续限制中国AI公司的发展、增强美国公司的竞争力。
特朗普上任后的头三个月、头一百天非常关键,是对华AI竞争政策顶层设计的过程。目前还没有看到太多公开信息,但美国商务部、国务院、财政部和白宫国家安全委员会肯定在密集研究,准备向特朗普提交包含下一步对华具体限制政策的报告。这三个月的政策讨论过程值得关注。
整体上,DeepSeek对美国对华AI竞争政策是负面的。美国前所未有地感受到中国在人工智能领域扑面而来的竞争压力,可能促使它出台更多激烈、过度的回应和反制措施。比如前段时间提到的美国国会参议院情报委员会主席Josh Hawley提出的《中美人工智能能力脱钩法案》,这个法案非常极端,基本上要在人工智能技术和知识产权、人工智能研发以及该领域资本流动三个方面实现完全脱钩,也代表了美国国内对这件事的情绪和反应。
Lily
对于做出海、尤其以北美市场为目标的中国创业企业来说,数据脱钩法案、人才流动限制和特朗普2.0时代的政策倾向,影响肯定非常大,对吧?
张鹏
这肯定影响非常大。一直以来,对中国科技企业在美国、乃至全球范围内出海来说,压力都是最大的。
欧洲也有一些不利动作,但我理解欧盟对中国科技企业的监管,本质上还是就事论事,关注具体数据和内容合规问题,还没有整体上升到国家安全和对华科技竞争的高度。所以我在欧洲的感觉是,整体比较理性和客观。它的强监管也有竞争性考虑,比如GDPR、数字市场法、数字服务法等,实际上有人认为是变相的监管税,通过高额合规要求和高额罚单达到收钱收税的目的。特朗普在达沃斯论坛期间也批评过欧盟的做法,说强监管是在变相收税。
美国则完全不同。美国认为中国科技企业在美国发展,整体构成对美国的国家安全威胁。从特朗普第一任期开始,就有意识地推动脱钩,先从社交媒体应用开始。信息通信技术和服务领域有商务部规则,财政部有投资和资本流动限制,司法部作为国家安全领域主要负责部门之一,近几年动作也非常频繁。
比较有标志性影响力的动作,是在双向数据流动领域卡住中美数据流动,变相希望把中国App和中国科技公司排除出美国市场。现在已经从硬件慢慢蔓延到软件应用程序。毫无疑问,像美国商店上架的DeepSeek这类AI应用,未来会成为重点打击目标,美国可能出台单独针对AI的监管法规。
从大模型和AI角度讨论国家安全风险,美国很多国会议员和政府官员会认为,AI带来的风险比社交媒体更大,因为它更底层,涉及中美人工智能竞争这条主线。
Lily
谢谢张鹏老师。张老师和涛哥,听了刚刚这段,你们有没有焦虑?
张涛
还行。对于做应用方向的来说,我们不是训练模型,Monica面向全球市场,绝大部分模型调用还是OpenAI和Claude,所以整体影响没有那么大。当然,如果对立程度到了那种程度,就另说。创业就是解决不确定性,有什么问题解决什么问题,现在焦虑也没用,还得看最后到底采取什么行动。
庄明浩
这个事情可能跟TikTok有点类似。
如果欧盟只是出台法规要求,那没有问题,我可以努力满足你的要求。OpenAI在欧盟也是这样做的,前段时间它被意大利罚了1500万美元,后续就采取了一些措施,满足欧盟监管规定。
但我最害怕的是TikTok那种情况:对方其实就是想搞你,你做再多合规动作可能都没有用。
TikTok这几年和美国政府长期交涉,已经做了很多合规措施。它在合规监管方面的人力、精力和经济成本都非常巨大,但现在仍然面临类似的问题。
所以我最担心的是,即使你尽了努力,最后仍然会面对一个不好的结果。这可能是我最担心的地方,略微有点悲观。我们可以先放在这里,且走且看。
8. 模型之外的护城河
Lily
我们进入节目的最后一部分。狂欢之后,我们特别想看看DeepSeek R1给行业带来的深远影响。
第一个部分,我想讨论这次R1出现后,对国内大模型公司的影响。很多人可能都会问,大模型公司的护城河到底在哪里?
比如豆包可能投放了一年多,才投出2000万日活;另一位当红产品Kimi从来没有达到过1000万日活。但DeepSeek R1在十几天内就超过了这个日活规模。
所以很多人认为,大模型公司的护城河很难判断。庄老师怎么看?
庄明浩
我觉得它其实验证了字节在去年年底的一个结论:Chatbot这种产品形态本身并不是特别理想的形态,可能只是一个中间态,或者是现阶段各方都能接受的次优解。
战略重心不应该放在这种产品形态上。
我觉得这个结论和今天看到的结果是匹配的。字节、Kimi以及其他几家,或多或少砸了很多钱做出来的数据,本身并不代表什么。
今天我看AI产品榜又发布了1月份数据,大家的留存时长仍然不是特别理想。所以这种产品形态可能确实不适合用DAU、MAU这样的方式衡量。
反过来讲,DeepSeek从来没有想过要做多大的DAU和MAU,我觉得他们内部没有这个KPI。
这又回到我们去年录制的那期播客:我们熟悉的移动互联网KPI和叙事结构,可能真的不太适合AI这一轮的叙事。
Lily
涛哥怎么看?作为一线从业者,你接触到更多用户信息和需求。
张涛
春节期间,美国那边的舆论已经发生了很大变化。不知道Lily有没有注意到,有人开始说,也许最后我们会发现,最大的护城河不是模型,而是套壳。
Lily
对,对,对。
张涛
以前虽然开源模型一直在进步,国内和美国都有各种开源模型,但不得不说,不管benchmark刷得多高,在用户实际体验上,相比Claude和GPT-4,差距还是比较明显。
这次可以理解成,开源世界不是超越,而是第一次真正赶上了闭源模型。
在这种情况下,应用端就有了无限想象力。
比如OpenAI前两天发布了自己的Deep Research产品,很快大家就用R1加一些开源Agent framework,复制出了Deep Research。
以前做这类功能,一定要依赖OpenAI最新模型,如果它不开放API,很多功能就没法做。现在很多事情变成了可能。
我觉得这件事在今年一年的中期影响会非常大,会有很多新的应用场景诞生。
我们刚才提到,R1之所以能出圈,一个很大的原因是R1加搜索,本质上构造了一种新的应用场景。但R1并不是只能加搜索,也可以加很多其他东西。
据我了解,现在不管国内还是美国,都在尝试R1加另一个东西,比如R1加RAG。RAG可以是搜索、文档,也可以是其他内容,它们都能实现不同场景。
所以我觉得今年这方面还会爆发一波,我比较乐观。
Lily
能不能简单分析一下DeepSeek R1爆火对国内AI“六小龙”,尤其是几家比较知名公司的影响?对它们来说整体是利好还是负面?庄老师来做这个分析可以吗?涛哥毕竟是从业者,可能不太方便讲。
庄明浩
从总体来看,对于所谓“六小龙”,也要分情况。
有几家公司之前已经做过选择,所以还好。比如零一万物和百川智能,零一万物已经把英伟达GPU和训练团队交给阿里,自己专心做方案实施,成为一家To B技术方案商;百川则去探索医疗方向。
这两家明星厂商受DeepSeek影响有限。
剩下4家里,我觉得智谱的影响可能最小。智谱在OpenAI之前,或者说差不多同一时期,就已经明确了内部技术路线和实施节奏。
阶跃星辰成立时间也比较短,大家对它还没有那么熟悉,在这件事情上我不太好评价。
Kimi和MiniMax值得多聊两句。
DeepSeek发布V3之后,Kimi也发布了一个类似的推理模型,效果其实很好,也保留了完整的推理过程,现在在Kimi产品里可以直接体验。
纯从体验端来说,我觉得Kimi和DeepSeek没有那么大的差距。但问题是Kimi是闭源的商业化产品,没有开源。
Kimi面临的考验是,如果继续沿着技术路线往下走,要不要跟进开源,或者采取其他策略?同时,商业化要怎么办?
MiniMax也面临同样的问题。但很巧的是,它的CEO前段时间接受《晚点》采访时,明显感觉MiniMax内部已经有了比较明确的结论,还是要继续走技术路线。
如果继续走技术路线,闫俊杰在采访中说,他可能在MiniMax最初就应该开源。他也是看到了DeepSeek这一轮的成功。
对这两家公司而言,过去两年很多战略实施,本质上可能浪费了时间、钱和人。未来竞争会更加激烈。
如果认定还要往技术高峰走,怎么和DeepSeek以及阿里通义竞争,怎么衡量开源、闭源和商业化,就会变成非常重要的问题。所以对这两家公司的CEO来说,挑战会非常大。
9. 开源模式如何赚钱
Lily
我想问一个特别小白的问题:做开源的话,商业化怎么办?他们怎么获得利益?
这几天DeepSeek官方服务经常宕机或者显示服务繁忙,但微软、AWS以及国内各个云服务商,都在自己的服务器上提供托管的DeepSeek模型。
我一直没有完全理解,DeepSeek这样把技术细节、模型参数都公开之后,怎么盈利?
包括Kimi和MiniMax,它们已经在大模型竞技场里存活了一段时间,也做了一些商业化尝试。如果再转向开源,又要怎么商业化?
庄明浩
这件事情又回到了讨论DeepSeek最初的节点。
DeepSeek没有外部投资人,母公司幻方有非常强的资金实力,支持这个类似科研机构的组织继续往下走,在这一点上它甚至比OpenAI更强。
OpenAI已经拿了融资,也绑定了很多商业关系,一定要考虑商业化。但DeepSeek可以任性地在可见的、至少两三年内,不太考虑商业化问题。
Lily
涛哥也想听听你的观点。开源生态通常怎么赚钱?如果完全开源,到底能获得什么利益?
张涛
要看具体情况,因为开源也分很多协议。
在大模型领域,有些开源模式是模型本身开源、权重开放,你有机器就可以部署和运行。但如果商业化使用,就必须找模型方购买许可证。
典型的例子是Stable Diffusion;千问全系列模型虽然大部分使用MIT协议,但也有一部分使用千问专有许可证,商业使用需要授权。
但DeepSeek不太适合这种模式,因为它使用的是完全的MIT协议。理论上,硅基流动部署DeepSeek并提供服务,也没有什么问题。
所以如果问DeepSeek长期怎么赚钱,我说实话,一时半会儿还真想不明白。
但作为行业创业者,我一直有一个观点:只要你一直在创造价值、做出真正有价值的工作,这个价值最终一定会以某种形式变现。
这里的“变现”要打引号,它可能有很多形式。
举个最极端的例子:如果DeepSeek是国内第一个真正实现AGI的组织,这个AGI可以帮助国家科研,也可以帮助国家治理,那么这个组织的价值变现方式,不一定非得是货币化,也可能有其他形式。
所以这取决于创始人的初心,以及组织结构到底是什么样。
我也想呼应一下庄老师刚才提到的观点。全世界范围内,最适合做这件事情的团队,反而可能是在中国。
Lily
我自己一个比较明显的感受是,技术才是第一生产力。像DeepSeek这样,在技术上某种程度比肩行业第一的模型出来之后,就迅速在全球风靡。
相比之下,豆包、Kimi以及其他产品,花费了大量资金和投放成本,却没有取得同样的成绩。
这带来的问题,正如庄老师刚刚提到的:你怎么向投资人交代?你如何说服投资人继续投入?
如果你没有做到头部水准,用户更换产品似乎没有替换成本,用户可能一夜之间就跑光。这可能是现在仍然坚持做大模型的公司需要面对的问题。
庄明浩
用一句有点“站着说话不腰疼”的评论来说,大模型投资本来就是高风险投资。你要玩这场赌局,就要承担风险。
只不过在今天这个时间点,牌桌上出现了一个异类。这个异类的打法、策略、出身、看重的东西和拥有的资源,都跟牌桌上其他选手完全不同。
在这个时间点看,它可能是最适合做技术投入的选手。这个结论对所有其他参与者都是最大的挑战。
你的策略要不要改,要不要跟,还是调整,或者继续坚持?即使现在看起来它最适合,最后是不是它成功,也没有人知道。
Lily
我想再呼应一下,也呼应我们前几期节目。
去年三四月份,业内曾发生过一次冲突。朱啸虎当时说,这些大模型公司一个都看不上、一个都不投,他要投资真正有商业化能力的公司。当时大家对他的观点仍然有很多质疑。
但到了今年1月,包括零一万物的变化、Kimi和MiniMax对商业化的讨论,以及豆包通过投放获得了其他产品没有达到的日活数据,越来越多人开始接受朱啸虎的观点,认为这是某种程度上的“朱啸虎胜利”。
但不到一个月,DeepSeek R1出现后,我又看到有人说朱啸虎自己发朋友圈:“这是技术理想主义者的胜利。”
我觉得这个口碑完成了三重反转,确实非常有意思。
10. 推理模型走向Agent
两位对于DeepSeek R1可能带来的其他应用和行业发展,还有没有补充?
张涛
我觉得reasoning model对于绝大部分用户和从业者来说,仍然是一个新东西。
虽然OpenAI的o1已经出来两个多月,但我相信即使是从业者,也有很多人没有深度使用过o系列模型。所以如何驾驭reasoning model、找到更适合它的应用场景,大家都还没有形成best practice。
从用户角度来说,怎么给reasoning model写prompt,也还在探索中。这个过程很像2022年底ChatGPT刚出现的头几个月,大家都很有热情地探索。
现在在R1上也有很多有意思的尝试,比如R1和Claude结合、R1和GPT结合,以及R1和各种工具、Cursor结合。
所以我觉得现在谈未来还太早,可能需要给用户和从业者一个季度的探索时间。
我对未来非常乐观,尤其是R1这次提出的思路。它只是做了一个示范,说明这个方向是可行的。
回过头看,每一次范式创新出现之后,大家都会沿着这个范式继续探索,做出各种各样的变化。reasoning model的训练方法,对基础模型能力的提升,远远没有到顶。
接下来半年,大家可能会在这方面做出很多新的能力,打破过去的一些限制,在应用上开拓更多可能性。
所以我们会保持积极乐观的态度,持续观察有什么新能力、新应用场景可以被解锁。
庄明浩
第一点是我们开头说的,它对基础设施厂商的促进,会影响很长时间。这种影响今天还没有完全体现出来,可能需要很长时间发酵。
第二点是,OpenAI发布过一个从聊天机器人到AGI的L1到L5路径,类似自动驾驶的分级。
L1是我们看到的ChatGPT这样的聊天机器人,L2是推理模型,OpenAI认为o1以及今天的R1已经达到推理阶段。L3是Agent。
OpenAI认为,现在行业领先公司正在从L2走向L3。反过来说,如果它定义的L5路径是正确的,那么今天R1的出现也符合这个路径。
L3是Agent,这也是为什么很多人认为2025年会是Agent之年。大模型先解决初始问答,然后拥有推理能力,接下来要做的就是真正解决任务。
OpenAI自己也发布了Agent相关产品,只是现在还处于比较早期。2025年,我们希望看到更多真正意义上的Agent落地到企业和个人开发者生态中。
当然,这段话可能有一定自圆其说或者自欺欺人的成分。但如果在2025年初这个时间点,一定要对今年的AI行业有期待,那么既然推理模型的样板已经打好了,我们应该继续往下走。
Lily
我最后还有一个小疑问。
在AI技术快速发展的情况下,尤其是DeepSeek R1这一波,我有一个很明显的感受:如果不是大模型或AI应用原生创业公司,而是实体产业、律师行业或者传统企业,到底什么时候投入比较好?
ChatGPT和Llama刚出来时,模型成本、参数规模都非常高,能力相比现在也有很大差距。但不到两年,技术还在超快速发展。
实体企业应该什么时候投入?我有很强的不确定感。
比如法律行业,ChatGPT出来时,很多企业都说自己训练了法律大模型。但从现在看,那些模型和DeepSeek R1这样的顶级开源模型相比,能力已经有巨大差距。这些投入可能很多都白花了。
涛哥先说说看。
张涛
不要去投预训练了。预训练长期来看会变成一种commodity,也就是上游商品,直接购买就可以。
你只需要使用各种后训练best practice做后训练。在绝大部分场景里,甚至连后训练都不需要做,只要把RAG问题解决好,可能就够了。
Lily
那如果考虑私有化部署呢?
张涛
R1也可以私有化部署。它使用MIT协议,拿来商用完全合规,当然也可以私有化部署。
Lily
庄老师有什么补充?
庄明浩
我们今年开年会时,老大说过一件事。他参加过几乎所有主流商学院的课程,比如混沌、蚂蚁和青藤等,和他同学的人来自各行各业。
大家讨论时当然会涉及AI。很多偏传统行业的CEO会觉得还看不清楚,想让子弹再飞一会儿,等一等再介入AI浪潮。
但我们老大会说,鉴于过去两年AI行业变化非常快,如果今天这个时间点还不亲身深度参与,可能就没有机会了。
AI就是这样一个状态:需要笃定地认可、坚定地看好这个方向,并且真正去实施、去做该做的事情,才有可能得到不错的正反馈。
11. 谣言仍在继续
Lily
我这边暂时没有其他问题了。看看两位还有没有补充,比如市面上比较多、但我们还没有聊到的谣言,或者特别想发表的观点。
庄明浩
DeepSeek被各种访问量冲击、服务不可用的时候,有一条谣言被很多人转发,说中国几大安全厂商给它提供了各种帮助。
这个事情完全是假的,就是一个巨大的谣言。我特别想笑。
张涛
我第一次看到是在小红书上,一个看起来不是官方的账号,写了很多企业,包括360、华为云、腾讯等。我当时觉得有点离谱,怎么可能。
后来我又看到一个名字好像是DeepSeek的账号,也发了类似的内容,所以我有一点点相信。录节目之前我还想问问这个问题,结果原来完全不存在。
庄明浩
一点都不存在。我做过一段时间安全,这完全是战狼和小粉红们引发的一场符合情绪的谣言。
某种程度上,它缓解了大家用不上DeepSeek的焦虑。因为服务经常不在线,我也会去小红书搜索,看到这个说法时还觉得“好像提供了一点合理解释”。
张涛
我最近一周也在很多群里反复解释一个伪概念:在本地设备上运行R1。
现在小红书、抖音上会刷到很多教程,甚至是收费教程,教你如何在电脑、手机上运行R1。
但认真看会发现,他们运行的其实是R1蒸馏版,比如蒸馏自千问的32B、7B,甚至是1.5B。
首先要说明,完整命名是“DeepSeek R1 Distill Qwen 32B”或者“DeepSeek R1 Distill Qwen 7B”之类。一个词组有中心语和定语,最后面的是中心语。
它再怎么处理,也是一个千问,或者一个Llama。前面的定语才是“DeepSeek R1 Distill”,意思是用R1作为teacher model去训练student model。
所以你在手机或电脑上运行的,不是真正的R1,而是一个千问或Llama。这首先就是一个非常不准确的概念。
其次,仔细看R1论文会发现,DeepSeek这次放出几个蒸馏版本,主要是为了证明他们的训练方法对其他模型也有效。
但它的蒸馏过程根本没有使用强化学习,只是用R1生成的SFT数据,对千问和Llama做了一次微调。
也就是说,如果你真的要体验R1,它离不开两个点:一个是强大的基础模型V3,另一个是强化学习训练过程。
而现在各种教程里所谓在设备上运行的R1蒸馏版,基础模型不是V3,也没有经过强化学习。这是一个不能更假的概念。
所以大家千万不要在这种教程上花钱。当然,如果你从来没有在电脑上部署、运行过大模型,借这个机会学习一下,我觉得没问题。
但不要期待它和全尺寸、满血版R1有同样效果,两者差得非常远。这是我最近一周反复辟谣的事情。
Lily
好的,我们这期节目就先聊到这里。再次感谢几位嘉宾,我们也会继续关注AI领域的发展,期待之后还能请两位来跟我们分享。
庄明浩
感谢,感谢Lily邀请。
张涛
感谢Lily邀请。
张鹏
感谢,感谢。
Lily
好,庄老师、张老师,谢谢大家交流。拜拜。
庄明浩
拜拜。
张涛
拜拜。
张鹏
拜拜。