程曼祺 Manqi Cheng
欢迎收听晚点聊,我是曼琪。今天的嘉宾应该是不少关注AI的听友都很熟悉的一位朋友,数字生命卡兹克。今天这期也是晚点聊想做的一个系列,I A I 的第一期。会探讨更多AI和人,和我,和你,也就是AI和我们的日常工作与生活的内容。从二零二三年二月开始,卡兹克在数字生命卡兹克这个公众号上发布了第一篇AI文章,此后快速吸引了很多想了解AI和把AI用起来的受众。之后卡兹克在二零二四年三月开始全职运营这个账号,也陆续做起了视频,建同名视频号。我本来是想和卡兹克聊他广泛使用和测评各种 AI 产品的实际感受,以及他对那些想更好使用 AI 的人的建议。不过当聊天真的开始,我们涉及了更多话题。这期前半部分,卡兹克分享了自己在二零二三年用 AI 来做产品的经历。其实在二四年全职做数字生命卡兹克之前,他在一家做公募基金数据分析平台的创业公司担任设计总监。在二二年底 ChatGPT 刚上线后,他们就开始在公司内全面使用 AI,甚至在。甚至在二三年九月第二批拿到了算法备案,也是金融领域的第一个。但当他们试图用 AI 赋能业务,做一款想卖给基金公司、券商等金融机构的 To B 产品后,进展却并不顺利。二四年三月,他们公司收束和调整业务后,卡兹克离开,变身干神卡兹克。我们从卡兹克怎么用 AI 来改造自己的工作流,聊到了现在各方向的一些 AI 产品,这对同样是做内容的我有很多启发。卡兹克能做到精准的挖掘选题和高频产出,当然和他干有关,但也和。但也和他利用了AI做了大量的自动化有关。比如他们会每天搜集全网的AI资讯,然后用AI模型帮助打分筛选,挑出最重要的十条发到三十多个社群里作为早报。他们也会用AI分析社群里的讨论焦点,帮助产生选题。一个很有意思的案例是,前不久卡斯克做了一次线下活动,有两千多人报名,但只能容纳两百人,要筛。要筛选报名者和分组,在以往组织线下活动时都是浩大的工程,而这一次AI帮了大忙。卡茨克说他现在想做的事是当AI殿堂的门童,让更多人看到AI原来能做这么多有意思的事儿,能帮我们解决一些实际问题。最后我在Show Notes里贴了二零二三年和二零二五年卡茨克分别发的两次AI产品推荐。我们。我们一起对比了这两组产品,有种恍若隔世的感觉。不过四十八个月的时间,不少赛道就已经完全洗牌。下面我们就正式进入本期节目吧。
所以今天非常荣幸,晚点聊可以成为数字生命卡兹克的播客首秀。我觉得关注 AI 的很多朋友肯定都知道卡兹克,而且大家平时关于 AI 的很多信息,以及使用 AI 产品的具体用法、Tips 和经验,都是从卡兹克这儿获得的。
我这次邀请卡兹克来做客晚点聊,其实就是因为我一直很想聊一个话题:人和 AI,也就是现在大家怎么来用 AI。你的账号从 2023 年 2 月开始更新的时候,就有大量内容跟这有关。
所以我们可以聊得不用那么商业。不,不商业,一点都不想聊太商业,咱们聊点好玩的、轻松的。
数字生命卡兹克
对,可以聊些实操的。
程曼祺 Manqi Cheng
在这之前,可以先讲讲你自己是怎么成为“数字生命”、怎么进入这个领域的吗?我觉得这也是现在很多关注 AI、但可能不是直接从业者的人比较关心的话题。
1. A Designer Enters Finance
数字生命卡兹克
我们可以从开头开始讲。我自己其实是 2017 年毕业的,但我真正的专业是用户体验设计师,一直在过往的互联网公司里面做 UI、交互和用户研究这一块。
这就是我的专业,但是从事的行业,这 10 年几乎都在金融领域里面。我虽然是 2017 年毕业,但是从 2014 年就开始工作了。因为我觉得学校教的东西,离真正的从业以及当时的移动互联网实在太遥远了,所以 2014 年我就出去工作,做这块的东西。差不多现在真的快 10 年了,10 年了。
程曼祺 Manqi Cheng
所以在 2023 年之前,你是在金融和互联网交叉的领域做 UI 设计、交互这些工作?
数字生命卡兹克
对。前半程还是偏用户体验,后半程其实就偏向于产品经理了。一直在做一些产品和体验相关的工作,其实它们两个本质上是相通的。
最开始是在金融领域。我最开始进行的是贷款业务,那家公司对我确实非常不错。
程曼祺 Manqi Cheng
所以你从那个时候就开始接触 AI 了,是吗?因为这个行业其实也和 AI 挺相关的。
数字生命卡兹克
对,但是那个时候更多的还不是纯粹的 AI,因为现在的 AI 跟那个年代的 AI 有非常非常大的差异。
那个时候应该是一些推荐、风控方面的 AI,包括一些决策式的 AI、决策树之类的。但是现在大家都叫生成式 AI,其实两个完全不搭界。那个时候接触过一点,但是不多。毕竟那个时候还是一个大头兵,只是去画图、做交互、做用户体验,跟算法偶尔会有一些接触。
比如说去做他们的一些产品时,可能会接触到算法,因为我得去做他们的一些交互和文案设计,那我可能得了解这个策略是什么东西,会去研究、学习一些,但确实接触得还比较少。
那个时候最开始我在金融业务线,之后就调到保险业务线了。因为公司在 2019 年刚刚成立了一个保险业务,进军保险。虽然这个事儿在我现在看来是一个很奇怪的行为,但我还是支持公司的决定,也去了。
那个时候是真正第一次从零开始,去想整个产品该怎么做,产品的形态应该是什么样的,可能它的商业模式是什么样的。虽然商业模式那时候跟我没关系,但是也会去想很多这样的东西。算是憋了两三年,然后把这个产品给做出来了。
但是那个时候保险其实已经在走很大的下坡路了,然后就一直做到了 2021 年底。
我自己是一个非常喜欢投资的人,特别喜欢投资。我买基金比较多,炒股、买基金,反正各种风格也都玩过。我自己非常喜欢这个行业。
当时我可以为了研究各种财务指标,晚上不睡觉看复盘。每天晚上下完班,10 点钟回来,我要复盘这一天股市是什么样的,哪个行业是涨的,哪个行业是跌的,每个行业里面的龙头票是什么,它们是因为什么样的逻辑开始起来的。然后每一个龙头、每一个大票、中军票,它们可能有哪些财务指标,可能谁又要发财报了,哪个基金经理又要更新他们的一些言论了,我都会看。
晚上 10 点钟可能一直看到凌晨 3 点,然后开始睡觉。第二天早上的 9 点钟开始看一些盘前消息,9 点 25 分开始做交易。
那个时候因为疫情,后来就在家办公了,所以每天除了把公司的事情做完之后,就是炒股、买基金。最开始其实一直在炒股,后面因为确实越来越忙了,开始研究基金,然后把所有的钱全部放到基金里。当然也是因为炒股赔了不少,基金还是能挣钱的。
我从 2021 年开始几乎是满仓在基金里面,到今年应该收益也快有 120、130 个点了。经历了这么一个大熊市以后,还可以。
程曼祺 Manqi Cheng
那看来周老师肯定比较懂理财。
2. The Fund Startup Bet
数字生命卡兹克
后面确实是因为我特别特别喜欢这个行业,所以 2022 年的时候我就出去了。我在融360里面待了将近 7 年的时间,然后出去跟朋友一起创业,做了一款公募基金数据分析平台,叫韭圈儿。
现在可能用户不多吧,日活只有 5 万多,总用户也就几百万。
程曼祺 Manqi Cheng
韭圈儿?
数字生命卡兹克
对,韭圈儿,韭菜的“韭”。我也不知道那个东西为什么要取这个名字。老板最开始的公众号叫“韭菜说社区”,所以我们后面做的产品叫韭圈儿。
当时做这个的原因,是因为在公募基金这个领域太乱了。所有基金公司想的都是怎么把基金卖出去,所有中间的平台也不会真正为基民考虑,给他们推一些很好的基金,而是什么基金这个时候涨得多,我给你推什么,因为这个东西最好卖,符合销售第一的策略。
我们当时觉得这个行情实在太乱了,就想做一些很客观的数据,让大家看到每一个基金的真实情况,于是做了这么一款产品。反馈其实还不错,当时影响力还是挺大的。
但是这个商业模式有非常大的问题。我们当时将近 50、60 个人的产品团队,10 个人的媒体团队,我就不说具体数了,这完全不成正比。因为我们整个产品不卖基金,也没有销售牌照,所以没有佣金这一说。
我们的商业模式就非常简单,只剩两种了:要么接广告,因为我们有社区,可以做一些推荐和广告;要么就是 To C 卖增值服务,比如说某些指标只有开了会员的人才能看到。
但 To C 本身在国内就不好做,同时还在大熊市里面。2022 年到 2024 年,跌了整整 3 年的超级大熊市,谁还看基金?买基金的人都已经在市场上经历这样的情况了。
包括品牌部的预算,从最开始的千万级别、百万级别,最后几乎明确地说:“我们今天没有预算,市场投放预算是 0。”这就没法做了。
一直到 2024 年 3 月份出来之前,我其实还是在创业。出来之前还是一个大熊市,我们已经撑不住了。虽然每年还是能拼了命勉强做到盈亏平衡,行情这么惨,我们也没有亏钱,但是已经看不到希望了。
那时候我们把公司的所有人几乎都裁掉了,只剩十几个人。正好在前面一年,我们就布局拿了私募牌照,但私募牌照其实也不是我想做的事儿,我还是想做产品,于是接着就出来了。
程曼祺 Manqi Cheng
你说的这个时间点是 2024 年 3 月,从那家公司正式退出是 2024 年 3 月。卡兹克这个公众号应该是 2023 年 2 月开始持续更新的。
数字生命卡兹克
对。
程曼祺 Manqi Cheng
所以你可以讲讲这个过程。你 2023 年 2 月为什么开始高强度地做这件事?因为那时候你还有本职工作。
3. ChatGPT Enters The Company
数字生命卡兹克
因为我是偏管理层的。公司的整个 SOP 搭完以后,只需要做一些决策性的工作就行了,日常中间确实比较闲,可以去看很多东西。
我本身也喜欢学一些新东西,看很多东西,对科技还是非常喜欢的。其实 2022 年 10 月 ChatGPT 出来的时候,第三天我们就看到了,第 7 天已经把它接到微信群里面去了,虽然第二天群就炸了,那个号也被封了。
程曼祺 Manqi Cheng
你是把 ChatGPT 接到你们的微信群里?这个是用技术手段做的吗?
数字生命卡兹克
对。相当于你们在微信群里放了一个 ChatGPT,它是一个聊天机器人,所有群里的人都可以跟它对话,可以 @ 它。
2022 年 10 月,上线过来大概一周左右,我们就已经把它接进去了。
但是很奇特的一点是,当我们看到这个东西的时候,我会觉得它跟我过去用的小爱同学、Siri 完全不一样。
语音交互、人机交互,包括我们在交互领域称为自然语言交互的事情,我自己从 2018 年就开始看了。我们当时也做过很多情感化设计,自然语言交互就是非常重的一环。我们把当时语音交互的所有东西都看了一遍。
程曼祺 Manqi Cheng
那会儿应该是在你第一个金融公司工作的时候,是为了做产品看的?
数字生命卡兹克
对。那个时候主要的课题叫情感化设计。我们希望让产品做得更有温度一些,它不应该是一个冷冰冰的东西。
我会在自己的框架里面把它拆成很多模块,其中当然有交互、文案,还有各种图形化表达。在输入层面,其实有几种方式:一种是点击,直接输入,我们称为直接输入。你点、点、点,或者按住拖动;另外一种就是自然语言交互。
当时我举过一个特别有意思的例子。比如我们在做 Photoshop,因为我们是 UI 设计师,可以对电脑说:“你把这个矩形的边框变成 3 像素,然后把它往右边移 10 像素。”
当时我就说,这个东西为什么 AI 很难做?首先,它都不知道你的“右边”是什么。你的右边是我的参考系、这个图形的参考系,还是什么样的参考系?
那时候的智能完全不支持这个东西。所以在我们看来,任何一个产品去做自然语言交互,其实都是一个很蠢的行为,因为它的交互效率实在过于低下了。
程曼祺 Manqi Cheng
你这么说,我突然想到,当年罗永浩是不是发过一个在鸟巢里面做的 TNT?
数字生命卡兹克
我先说,我是罗老师的粉丝,很喜欢他。我把罗老师的书全看过。
但是那个产品在鸟巢发布会上的时候,作为一个交互从业人员看到那个东西,我会非常疑惑。我会认为,在那个时候你用嘴去做 PPT、做 Excel,是一种效率非常低下的行为。它只是酷炫,但是没有任何效率可言。
程曼祺 Manqi Cheng
那现在回头看,他那个想法还挺超前的。
数字生命卡兹克
对,基于现在回头看,他的想法很超前。但是想法超前并没有用,你必须放在正确的时代、正确的时间里面,基于当时的技术条件做到。
我当时研究过这些东西。ChatGPT 出来的时候,其实就是自然语言交互。但是从我过去的经验来看,这个东西是一个完全不一样的、颠覆性的产品。
虽然我们很快就能看到它上线,但是依然觉得这个东西要在公司大力推广。所以基本上在 2023 年春节前,就已经开始让公司全部用起来了。
那时候主要还是 GPT-3.5,GPT-4 还没有出来。我们会让开发去用这个东西。但那时候用它,其实不是补全代码,因为补全代码我们技术总监看完觉得效果一般。
它做另一个东西很好用。我们确实是一个非常普通的小创业公司,并没有那么多开发。比如技术总监会说我们的搜索效率比较低,是因为语言的问题,所以我们想用 Go 语言重构一下搜索。具体的我不是那么懂,但我们当时招的人都是只写 Python 的,没有能写 Go 的。
程曼祺 Manqi Cheng
以前做区块链的人很多会写 Go。
数字生命卡兹克
对。我们就发现了 AI 的一个能力:它做代码翻译非常好用。
很多时候,他们会把过去用 Python 写的东西扔进去,翻译成 Go 语言,然后再去改。他们也还是懂一点,但是很难全部去做。这个时候 AI 帮他们进行编程语言翻译,就非常有用。
这是 2023 年 1 月就开始做的事情。
像设计这边,因为我本身是设计出身,只管设计团队。设计团队从那个时候开始,所有人必须用 Midjourney,全部去学 Stable Diffusion。
以前做一个运营海报,运营同学可能要用 4 天,从草图到最后确认成品。后来我就直接说,我只给你们一半的时间,因为必须用新手段给我去试。虽然有点压榨式管理,但是也很有效。
同时我也跟他们说,我给你们两天时间,这两天的排期在未来半年里面不会变化。也就是说,如果你真的 AI 用得非常好,半天就把东西做出来了,剩下 1.5 天的时间全部由你自由支配。我不会给你排任何新的活。
程曼祺 Manqi Cheng
大家还是蛮有动力的,一种激励大家学习的方式。
数字生命卡兹克
对。所以那个时候虽然有点压榨,但是大家非常开心。
那是我第一次见到这帮人非常有热情。所以我们推行了一个叫“摸鱼时间”的东西:你用 AI 加速效率,在固定排期里面剩下的全是你的摸鱼时间。你想怎么玩都行,上班的时候只要别公放看电影,我都不管你。你们戴着耳机看电影,我真的不管你,只要把活交了。
所以大家非常有动力。包括运营团队,在出方案之前都会强制性地用 AI 先出 10 个头脑风暴方案。你可以不用 AI 出,但我就要看到 10 个方案。
在固定时间内明确做不了这么多,那只能用 AI 辅助。用这种强制性的方式,能让我们公司在那时候对于 AI 的理解比较领先,而且是有实际手感的。所有人都在用,全部都在用。
4. Building And Killing Chat Fund
从 2023 年春节那一周开始,我们就想能不能做一些赋能业务。说实话,我对 AI 的理解当时非常非常差,差到什么程度?那时候我们不知道什么叫嵌入,不知道什么叫微调。现在大家听起来可能觉得天方夜谭,但我们就是这么外行,真的什么都不懂。
于是我们去找教程,但你也不知道该怎么找。因为我们做金融,金融有一个很大的痛点:你去问 ChatGPT 某个基金净值怎么样、涨幅多少,它全给你假数据。
我们想解决这个问题,但是不知道该怎么解决。甚至当时有一个非常蠢的想法,是我跟技术总监提的。我说,要不然我们每天微调一次?每天让人把新的东西输给它。
不是人工把模型微调一次吗?当时这就是一个非常蠢的想法。现在看来很可笑,也非常不专业,但确实是我当时提出的东西。
因为我们的基金数据每天更新。它不是实时的,我当时又知道什么叫微调,觉得微调就是把数据灌进去,让它知道我们的知识。那每天把我们的数据库灌进去一次,微调一次,不就行了吗?
算力、时间这些问题,我都不懂。当时就是纯外行。然后我们真的去微调了一次。我们的数据库量级非常恐怖,我就扔了 1,000 条数据集进去,花了我 70 美元。
我说这个事儿太荒唐了,我们研究一下别的方式吧。
于是我们继续看 OpenAI 的文档,看到了一个东西叫“嵌入”。我觉得这才是我们应该做的方式。后面我们就沿着这个思路走,知道该怎么做了,也可以做很多工程化的东西。
微调也没有完全放弃,微调的经验还是有用的。我们最开始做了一个“意图识别模型”,直接微调了一个。
我们发现在金融领域,用户很多问题用通用大模型解决得不是很好。比如用户问基金经理的投资理念,或者要对比两个基金的数据,或者让你帮他选基金:“你给我选一个能涨抗跌的基金”“你给我选一个年年正收益的基金。”
那时候 Agent 或者模型的智能能力并不是很好。GPT-4 最贵,我们也用不起,还是用 GPT-3.5。那时候我们甚至微调了很多小模型,最常用的是 GLM-6B。
我也调了好几个微调的意图识别模型,还有一个做分段的模型。最后做数据查询时,大家现在都知道有各种调用工具、Function Calling 之类的东西,那时候什么都没有,连函数调用都没有。
我们又做了一些转 JSON 的模型,把用户的问题转成能查数据库的 SQL 模型,最后做了一整套工具链。
我们会用 GPT-3.5。当时我们测了,全世界没有一个模型能达到 GPT-3.5 那种数据组装能力。
程曼祺 Manqi Cheng
那时候已经是 2023 年 4 月、5 月了?
数字生命卡兹克
对,2023 年 4 月、5 月。我们做这个东西,是希望能有一些新的商业机会。
这个东西做得非常快。我们把整套系统做出来了,那时候叫 Chat Fund。你可以在我们的产品上问基金的任何问题,它会像一个从业两三年的理财师一样回答你。
在我们看来,真正的护城河不是技术,而是我们对于基金领域的理解。我们的理解会比很多金融领域的理财师或者财经媒体更专业,因为我们就是做这个的,还有很多自己二次加工的数据。这才是我们真正的护城河。
然后我们就把这个东西做出来了,跟商汤、百度是同一批拿到算法备案的,应该是金融领域第一个算法备案。
程曼祺 Manqi Cheng
这个是你们拿到的?
数字生命卡兹克
对,是我拿到的。大概是 2023 年 4 月、5 月。
那时候印象非常深刻。佩洛西来中国第一天,他们发了一个 Meta六零,第三天是文心一言备案通过。我说备案通过了,那我们得等到几月份?结果一看,我们也过了,于是就可以正式对外开放了。
但是这个东西面向 C 端收费,还是会有同样的问题,很难。我们当时就想,能不能给基金公司做解决方案。
我把基金公司、银行、券商几乎都聊了个遍,发现大家手头预算都非常紧。这个东西当时只能卖 20 万,因为超过 20 万要过内审,审批级别非常高,很难搞。
程曼祺 Manqi Cheng
这倒是跟我想象中有些出入。因为我知道那个时候有一些金融机构在部署私有化大模型,其实很贵。
数字生命卡兹克
对,很贵。但坦诚地讲,我也知道智谱跟很多机构关系很好,也卖了工行、招行这些东西,我知道他们的价格可能是什么级别。
但是对于我们来说,你没有大模型,证明你这家公司没有技术含量,你都不能做私有化部署,跟我提什么价格呢?
不就是给我一套东西,我接进去对外服务吗?20 万最多了。在基金领域,跟你做一些程序、定制开发,软件也就是 20 万级别。你这个东西不就是套了个 AI 的壳吗?
程曼祺 Manqi Cheng
这确实是中国 To B 市场的一个问题。你们是标准化产品,又是一个套壳的东西,在两重叙事上都吃亏。
一方面,大客户不喜欢标准化产品,喜欢私有化部署,希望你能随时为他服务。另一方面,我觉得直到今天也有这个争论,包括最近 Manus 的一些争议。有人会觉得,你不就是套了个壳吗?
数字生命卡兹克
但是我们做了非常非常多自己的工程化,也有很多二次加工和微调的数据。整个 Prompt 也是基于我们对于金融领域的理解。
它生成的报告,在我们看来就是会比不懂金融领域的人写出来的东西更好,因为里面有我们的方法论。我们做了很多方法论,这些方法论也会拿去给一些基金公司讲课。
程曼祺 Manqi Cheng
但是你们试图用 AI 赋能自己的业务、拓展这个业务,并不太成功?
数字生命卡兹克
非常不成功。把这些聊完以后,我直接把这个业务砍掉了。2023 年 8 月,我就直接砍掉,不做了。
程曼祺 Manqi Cheng
你回头看,这个业务如果再坚持一下,会有希望吗?
数字生命卡兹克
没有希望。如果是 9 月以后,可能会有一些转机。但是在我们那个时间点回头往后看,再做下去也很难。
因为 To B 领域至少不接受标准化产品。比如基金公司推荐基金的时候,你只能推荐我家的基金,不能推荐别人的。你帮我家的基金跟别人对比,必须突出我的优点。
这些在我们看来非常难做。我们如果只能筛选他们家的基金,就要为他单独定数据库,还要做很多非标准化的 Prompt 和工程化工作。
程曼祺 Manqi Cheng
不过从客户角度,这倒也合理。
数字生命卡兹克
这非常合理。但是我们算完成本以后,要做这种东西,就得抽专人出来。每个客户甚至要投入两三个人力去驻场,因为他们还要做 UI 界面、进入他们自己的微信公众号和小程序,还要解决各种并发问题,这些都要我们来做,他们也不懂。Token 成本还得我们承担。
在我看来,这个做下去可能是亏本生意。价格又被 20 万卡死了,因为超过 20 万就要走内部审核,审批到很高的领导,他们不愿意干这种事儿。
20 万以内不需要那么高的审批,价格就卡死在这里,那我们怎么干?其实干不了。
即使在那个时候把客户粘住了,以这么小的成本把他们粘住,未来的 ROI 或者整个商业模式能做到多大?我觉得不靠谱。
所以我及时止损,把这个业务直接停掉了。本身还好,没什么成本,几乎就是我一个人,再加上半个技术总监,两个人把这个产品做出来了。
程曼祺 Manqi Cheng
开发不需要具体的人吗?
数字生命卡兹克
开发就是技术总监,再带上他的一个同事。最后网页上线的时候,用了一些开发资源,其他基本都是后端 API 的微调和工程化,我们两个人就干了。
微调很多也是我自己调的。我确实不懂后端,后端都是他做的,我们一个半人力就够了。其实没什么成本,但真的开始商业化以后,成本就算不过来了,所以我直接砍掉了。
5. The Creator Takes Off
后面我确实火过两次。一次是在 2023 年 8 月,做了一个《流浪地球 3》的预告片,那时候在影视圈爆了。也因为这个契机,算是我半只脚进入了影视圈,现在也在跟很多剧组合作。
程曼祺 Manqi Cheng
电影肯定是一个领域。我觉得电影是大家能直观看到、也非常受关注、能影响很多人的东西。
数字生命卡兹克
因为本质上我其实不只是想做一个自媒体,还想做一个能给社会带来更多价值的 IP。很多时候也是为了做一些影响力。
电影、影视领域本身是我喜欢的,同时又能给我带来影响力。跟他们合作,坦诚讲都没什么钱,也都不是为了钱去的。很多时候甚至是两年的长线布局,最后就是为了把这个东西做出来。我能参与到这个进程里面,就很开心。
程曼祺 Manqi Cheng
这期节目也许可以叫“水下的卡兹克”。因为我们现在讲了半天,还没有讲到公众号。
数字生命卡兹克
对,还没有讲到平时的内容,但是其实我做了很多跟 AI 相关的事情。
程曼祺 Manqi Cheng
所以 2023 年 8 月之后,你做了一些 AI 和影视结合的事情?
数字生命卡兹克
对。其实那个时候也太早了,AI 影像更多的是纯 PPT,大家就是图个新鲜,聊一聊就过去了。
郭帆那个事情是可以说的。我跟他 2023 年 9 月见了一面以后,真正开始做这些东西,是 2024 年 11 月,中间隔了一年多。
程曼祺 Manqi Cheng
我印象中,2023 年下半年或者 2024 年初,郭帆好像对这个事情还是挺上心的,有比较多的公开动作。他们工作室好像成立了一个联盟,商汤、Pika 这些都在里面。
数字生命卡兹克
但是后来有一段时间,他可能去搞剧本或者其他事情了,好像没有在 AI 方面有太多动作。
《流浪地球 3》的 AI 内容还是可以期待一下。打个广告,2027 年春节,《流浪地球 3》上映。
程曼祺 Manqi Cheng
2027 年春节?现在是 2025 年。
数字生命卡兹克
郭帆在 2023 年发布会的时候就直接宣布定档 2027 年上映,时间已经定死了。
程曼祺 Manqi Cheng
那 2023 年 8 月之后,还有哪些事情?
数字生命卡兹克
2023 年 11 月,Pika 在全球火了。我是国内唯一一个有 Pika 内测账号的人,因为跟他们那边的人比较熟,所以拿到了内测账号。
我写了一篇 Pika 的一手实测体验,那时候确实挺酷的,在金融圈火了,市场也火了。
我写完以后,第二天一天做了 13 个路演。我本身是金融圈的,很多基金经理和研究员也认识,就给他们实际展示 Pika。那时候算是小小出圈了一波。
但是最出圈的一次还是 2024 年 2 月。2 月 16 日那天,我到现在还印象深刻。99% 是运气,但 1% 归功于那天晚上没睡觉。
程曼祺 Manqi Cheng
你不是天天不睡觉吗?
数字生命卡兹克
那天晚上确实睡得比较晚,没睡觉,然后看到一个东西。
因为我自己在 AI 视频这一块一直在做,从 2023 年 8 月到 2024 年 2 月已经做了半年。那天晚上看到了 Sora,于是写了一篇我自己觉得“它为什么这么牛”的文章,副标题叫“现实不存在了”。
程曼祺 Manqi Cheng
那篇文章突破了 300 多万阅读?
数字生命卡兹克
对。那次算是最大的一次出圈。后面就不温不火,一点一点输出自己的内容,做一些我喜欢的东西。
我的 Slogan 很简单,就是“分享一些很新、很酷的 AI 干货”。我希望把自己体验到的一些好产品,以及觉得还不错的教程分享给大家,一直做到现在。
2024 年 3 月,公司确实也没有那么好,我自己也想出来,于是开始全职做这个媒体账号。否则也不可能做到一周更新四五次。
程曼祺 Manqi Cheng
这确实写不过来。
数字生命卡兹克
对。2023 年更新频率没那么高,我给自己的 KPI 是 3 天以内更新一篇。
程曼祺 Manqi Cheng
我觉得整个行业节奏也变快了。2023 年 3 天一更可能也够,因为那时候可能没有那么多事情。
数字生命卡兹克
最近事情特别多,本身事情就很多。
2023 年的时候,我对 AI 行业的划分一直是以模态为标准的:AI 文字、AI 绘图、AI 视频、AI 声音和 AI 3D,一直是这 5 个模态。
2023 年几乎只有 AI 文字和 AI 绘图这两个东西可以写。那时候 AI 视频基本没有。AI 声音当时大家玩得最多的是 SVC,就是让孙燕姿唱周杰伦的歌这种 AI 换声,也没有 Suno 这种 AI 音乐生成大模型。
AI 语音也还停留在“这个男人叫小帅,这个女人叫小美”的阶段,不像 2023 年 10 月国庆期间,ChatGPT 第一次出现语音功能时给人的震撼:原来 AI 可以停顿,可以说“呃”,这些语气词可以变得像人一样有情绪。
AI 3D 当时也很粗糙,几乎没有。Tripo 也是从 2023 年 10 月开始做得比较好,Tripo 1.0 是 VAST 做的,2023 年底上线。11 月我也写了首发,确实觉得 3D 领域开始有一些东西出来了。
所以 2023 年的节奏没那么快,因为只有两个模态在竞争。不像 2024 年,5 个模态全部齐发。
到了 2024 年 6 月以后,随着可灵上线,AI 视频又卷得飞起。多模态、GPT-4o,后来推理模型也出来了,东西越来越多。
程曼祺 Manqi Cheng
现在一天还有两更?我看你 3 月 6 日又发了 Manus,又发了 QwQ-32B,阿里的推理模型也得写。
数字生命卡兹克
这种东西我不写,就显得我不专业,因为这两个事情都挺重要。
我其实做过很多错事。自媒体有时候确实会因为自己的懒惰影响用户对你的信任。
比如 DeepSeek 我就没写。DeepSeek-V3 和 DeepSeek-R1 发布那天我都没写。原因很简单,DeepSeek 官方账号已经被转发那么多了,我觉得我写了也没流量,算了,不写了,因为我想睡觉,于是就没写。
程曼祺 Manqi Cheng
你现在一天到底睡几个小时?
数字生命卡兹克
我每天 3 点钟睡觉,9 点钟起床,睡 6 个小时,睡得还可以。
程曼祺 Manqi Cheng
3 点到 9 点是比较固定的作息?
数字生命卡兹克
对,现在比较固定。有时候加班,比如上周 OpenAI 半夜又发布了语音模型,那天晚上干到 5 点多,但还是 9 点钟起床。
9 点多起床是固定时间,不管多晚睡,9 点都要起。因为我的文章几乎会定时 9 点钟发出去。发完以后我反而睡不着,因为我很在乎用户评论,会习惯性地去看评论。
程曼祺 Manqi Cheng
那你做手术那几天也都是 9 点钟起?
数字生命卡兹克
几乎都是。太肝了,各个线上都有很多新的东西。
但是用户反而让现在的内容越来越难做。不是内容越来越难做,而是现在 AI 产品越来越难调动用户兴趣,阈值会越来越高。
普通用户已经见过很多东西,可能会跟着我们这些自媒体天天搞一些炸裂叙事。现在大家看过太多了。我也被人挂上过“吹牛头子”。
程曼祺 Manqi Cheng
你觉得自己是比较克制的吗?
数字生命卡兹克
也不那么克制,这确实是流量问题。你特别克制的时候,数据和传播都会有问题,这就是自媒体行业的问题。
现在很多用户的阈值被调得非常高,他们已经看过很牛的东西。这个时候你告诉他某个模型跑分提高了 3 个点、5 个点,他会说,9.11 难道不是比 9.8 大吗?这不行。
坦诚讲,AI 的进化,特别是文本大模型的进化,已经到了很多人无法评测、无法理解的地步,没有那么直观的感受了。
比如在分子设计领域,或者新材料加速领域,o1、o3 这种推理级别的模型,会对这些行业带来很大影响,会帮助他们。
过去你用 GPT-4o 或者任何传统预训练大模型,逻辑都有问题,也有很多幻觉,做法并不好,会出现很多错误。但推理模型出现以后,对数学等领域有非常积极的意义。
可是普通人、普通 C 端用户已经不太关心这些领域了。
程曼祺 Manqi Cheng
这个点我们之前在播客里也讨论过。比如我们之前跟戴雨森聊的那一期,他就讨论过 DeepSeek-R1、OpenAI o1,以及和 DeepSeek-R1 同期的 Kimi K1.5。
它们影响力的差别,来源之一就是推理模型。大家都说自己数学好、逻辑好,但真正拿它做数学或者编程的人,还是少数。
DeepSeek-R1 出圈的原因之一,是它的创意文本能力很强,大家都可以玩起来:让它写一首古诗、写一篇古文。但是 K1.5 可能没有在这方面特别优化,所以就没有 DeepSeek-R1 好。
数字生命卡兹克
不管是 K1.5、智谱的 Zero,还是其他模型,我把它们评价为“数学战神”“偏科战神”。
我把它们每一个都测过,确实在数学题场景里很强,但这个场景并不泛化。K1.5 可能是因为它自己独有的数据集,或者一些突破性问题,写出来的东西非常玄乎,同时幻觉率也很高。
让它做编程或者数学,坦诚讲没有那么好。但因为 DeepSeek 的整体出圈效应,在 DeepSeek 出圈之前,可能接触过 AI 或者用 AI 的人,在中国 14 亿人里面只有 1 亿人。这些产品过去都是在教育这 1 亿人的认知。
这次 DeepSeek 出圈,在所有背书和背后力量的推动下,达到了全民级别。可能凭空多出来了 8 亿用户。这 8 亿人从来没有接触过 ChatGPT,没有过去两年的历史,DeepSeek 就是他们接触的第一款 AI 应用。
程曼祺 Manqi Cheng
所以有人说,DeepSeek 是中国的 ChatGPT 时刻。
数字生命卡兹克
对。你会发现在 DeepSeek 火了之后,流量端不管是公众号还是视频,都会把 2023 年 ChatGPT 那一波叙事重新来一遍:教大家写 Prompt,教大家用 ChatGPT 或 DeepSeek 赚钱、写古诗,怎么跟剪映结合,怎么让它生成画图 Prompt。
这和 2023 年 ChatGPT-3.5 火的时候一模一样。
但是 DeepSeek 这一波有一个很不一样的效应,就是推理模型和思维链。
在过去没有思维链的预训练模型里,大部分人不相信 AI,或者会直观地认为人的尊严凌驾于 AI 之上,人的智力远远高于 AI。
当你问它一个问题,它给出一个不满意的回答,你可能就直接走了,鄙夷地一笑:“AI 也不过如此。”你会觉得 AI 就这样,你们吹得这么牛,看,连一道数学题或者小作文都写不出来。
但是这次 DeepSeek 不一样。o1 其实早就有推理能力,只是没有破圈,永远在 AI 和科技行业里面打转。DeepSeek 第一次让人看到,原来 AI 是有思维链的,原来你问一个问题,它会思考。
这次我能明显感觉到,不管是身边的朋友、家人,还是认识的人,大家第一次感觉到“我不如 AI 了”。
当你感受到自己不如 AI 的那一刻,就会把它分享给朋友,告诉别人原来 AI 已经这么厉害了。他会接受 AI 的存在,想着“原来这个任务做不好,是我自己有问题,是我的提问方式有问题”,然后去学习、去做功课。
这和当年他们对 GPT 的抗拒有一些微妙的变化。
程曼祺 Manqi Cheng
这也是 DeepSeek 产品上的一个特点。我不知道它是不是特别提前想到这一点:o1 的思维链没有完全展示,是隐藏的;DeepSeek 的思维链是完全展示的。
数字生命卡兹克
这还不一定是刻意想到的。OpenAI o1 出来之后,DeepSeek 开源过一个模型,叫 DeepSeek-R1-Lite-Preview,应该是 2024 年 11 月 20 日左右。
那个时候他们已经开源,思维链就已经存在了。可能是因为 OpenAI 在行业里的口碑实在太差,什么都不给别人看,所以他们直接开源放出来了。
但是那时候没有破圈,因为没有一个 C 端可以使用的网页端或 App。其实当时已经有网页端可以用了,只是效果很差,非常差。
因为那年 10 月我们正好通过一些渠道做了大量测试,测试的是文学和剧本。那时候 o1 Pro 确实是真神,实在太强了。
程曼祺 Manqi Cheng
你做剧本测试,是跟你和影视行业的合作有关,不是为了做测评内容?
数字生命卡兹克
不是,那是非常真实的生产环节。
程曼祺 Manqi Cheng
真实场景下的测试。
数字生命卡兹克
对。我们会发现,在文学性上 o1 Pro 实在太强了。DeepSeek-R1-Lite、Kimi K1.5,还有智谱的 Zero——当时还没上线,只是在内测——效果都很差。
程曼祺 Manqi Cheng
那后来的 DeepSeek 正式版会好一些吗?
数字生命卡兹克
后来没测。所以现在在这方面,还是 o1 Pro 更好。
6. DeepSeek Becomes A ChatGPT Moment
DeepSeek 这一波,更多是把 AI 从遥不可及的门槛上拉了下来。o1 那套东西不是谁都能用,首先需要一些手段,还需要付费。20 美元也不是谁都能掏得起,真的很贵。
程曼祺 Manqi Cheng
你说的手段,是指科学上网?
数字生命卡兹克
对。这个事情已经把 90% 的人拦在外面了,门槛非常高。
DeepSeek 这一波确实跟传统叙事不一样,它多出来了这么多用户。这些用户没有过去两年的历史,分布也更广,年龄、行业,以及过去使用科技产品的程度都不一样。
程曼祺 Manqi Cheng
所以才会看到元宝那一波推广,打的是“母猪护理问元宝”,好像还去乡村地区刷墙。
数字生命卡兹克
对,确实很有用。虽然大家也都在说,如果种地都要靠 AI,那就别种了,种地还要问 AI。但是它确实能解决一些问题,实现一些智能普惠。
程曼祺 Manqi Cheng
所以这就是你做 AI 内容的过程:从 2023 年兼职,到 2024 年 3 月之后全职。
数字生命卡兹克
对,一直在做。
我其实有两个目标。我一直在模仿或者致敬两个对象:长视频这块,还是想做影视飓风;公众号这边,差评和晚点是我非常希望做到的高度。
程曼祺 Manqi Cheng
你现在对自己的定位是什么?你对自己要做的事情,定位是什么?
数字生命卡兹克
我做的内容会偏资讯和教程。
程曼祺 Manqi Cheng
我不是说你的内容定位,我是说你整个想做的事情的定位。
数字生命卡兹克
整个想做的事情非常纯粹、非常简单:靠着我在 AI 领域的影响力挣到一些钱,同时让更多人看到 AI 的用法,把他们带入 AI 殿堂。
我过去一直把自己描述成 AI 领域的门童,或者 AI 殿堂门口的门童。我本身不是很懂技术,跟真正的大佬、算法专家,或者“六小龙”里面做产品的人,不是一个级别的专业度。我只是玩得多一些,知道什么东西可能能解决普通用户的问题。
我更希望去做一些分享,让很多普通人看到:原来 AI 能做这么多有意思的事情,可以帮我解决找 PPT 的问题、Excel 的问题。然后他们对 AI 产生兴趣,去到那个殿堂里玩一玩,进入这个新时代。
程曼祺 Manqi Cheng
这个想法和描述都挺好的。
数字生命卡兹克
我刚开始开公众号的时候,Slogan 不是“分享一些很新、很酷的 AI 干货”,那时候有一句比较装的:“以一灯传至诸灯,终至万灯皆明。”
现在不太敢用了,太装了,显得我是信仰领袖一样。但其实它只是一个非常纯粹的想法。2023 年的时候,这就是我想做的事,不是一个具体要达到的目标。
不是说我的估值明年要做到 3,000 亿,或者我要做到多少收入、规模多大、成为这个行业多么牛的存在。其实就是想分享一些东西。
我非常享受这种正反馈:我分享出去的东西,大家愿意转发、愿意看、愿意留言说“你不错”。我能获得很多正反馈。
同时,因为这件事可以让我接触到一些偶像和过去接触不到的人,比如郭帆、小米的王川、华策影视的赵依芳赵总,还能跟 CCTV-6、学习强国合作。这些都是以前不敢想的。
程曼祺 Manqi Cheng
你刚才说到内容上会对标,或者想做到晚点、差评这样的状态。我在想,你后面更底层的东西是什么?你刚刚说的“AI 殿堂的门童”,我觉得这个想法挺好、挺妙的。
具体到内容上,你觉得晚点的内容或者差评的内容,在你的内容里,你想要其中的什么部分?
数字生命卡兹克
差评我就不说了,因为我也挺好奇。我们也写一些 AI 内容,比如你可能会看里面的什么内容,觉得对你有价值,或者比较独特。
影视飓风跟晚点还是有点不一样,但坦率讲,影视飓风对我的影响更大。
我关注晚点很早,忘了是什么时候看到罗永浩对晚点的评价,好像是“还在坚守新闻主义的理想”之类的评论。
程曼祺 Manqi Cheng
你果然是罗永浩的粉丝。
数字生命卡兹克
对。这个应该有些年头了,具体时间我忘了。
但这其实就是我希望做到的东西:我非常强调内容的真实性,任何一点都不能出错。
这应该是我过去感受到的晚点的态度:真实性和专业性一定是最高的。
程曼祺 Manqi Cheng
那错别字是你故意写的,防止别人说你是 AI 写的吗?这已经成了你内容里的一个梗。
数字生命卡兹克
不是。这个是因为我用了微信输入法。
微信输入法很好用的一点,是可以跨端协同、不限设备。我在 iOS 上复制的东西,可以粘贴到 Windows 电脑上。但是它的输入法确实很难用,经常打错别字。
我一个人写,有时候写完一篇稿子,真的就像写完一篇作文一样,不太想从头再看一遍。
你们有时候发出去的文章也会有错别字。比如你写了一个东西,看了很多遍,最后校对的时候再看一遍,它还是可能有错。有时完整文章确实很长。
所以错别字这件事,2023 年最开始我还是想改的。直到有人回复别人的评论,我的一个粉丝说:“这是人类撰写声明。”
这跟我的理念是相似的。2023 年的时候我就觉得,未来 AI 内容一定会铺天盖地,席卷整个互联网。大家看腻了 AI 千篇一律的东西以后,什么内容会更加稀缺?一定是人为的内容更加稀缺。人的价值反而会比原来更重、更有意义。
所以这个东西我就没有刻意去改。
程曼祺 Manqi Cheng
“人类撰写声明”挺有意思的,能让大家感觉到,原来跟自己对话、写这篇文章的是一个活生生的人,不是 AI。
数字生命卡兹克
对。它也是对读者观点的尊重。
真实性是一部分,同时我也非常尊重这种对内容的态度:为了写一篇稿子,会花很多时间调研、查阅大量资料,保证每一个观点都正确,然后输出一篇高质量的内容给读者。
读者能感觉到你尊重他,不是纯粹翻译一篇文章,而是用了自己的时间和精力研究、加工,把去其糟粕、取其精华的深度内容给到他。
这其实是我很想做的事情。因为我不是新闻行业的,后来才知道有个东西叫“特稿”。特稿的价值是我非常尊敬、也很想做的,但确实专业度、精力什么都不够,所以做不了特稿,只能做一些非常平、非常快的体验稿。这是我擅长的东西。
程曼祺 Manqi Cheng
以前是不是写过类似的?好像尝试过。
数字生命卡兹克
尝试过。比如 AI 版权。
当时 AI 绘图第一案出来以后,还有出门问问和微软打过一次 AI 声音版权官司,以及我的好朋友行人一坤在打 AI 视频第一案。很多人会问我两个问题:AI 生成的东西有没有版权?用 AI 生成的东西会不会侵权?
我是真的想搞明白,所以那时候花了将近 1 个月,去红圈律所调研,请了几个参与国家政策制定的大律师,以及做数据安全、知识产权方面的律师。
我们做了四五次调研,找他们整理了大概七八万字的文字资料。在那个时间点,我写出了一篇我认为很正确的文章,给了大家一些答案。
但是数据确实不好,转发还不错,有 3,000 多次,阅读只有 1 万多,因为太深了,里面很多是法律内容。但确实是我花了很大精力、用 1 个月做出来的东西。
程曼祺 Manqi Cheng
我们之前好像讨论过这个。我也感觉到,如果你试图给读者一个全面、深、完整的背景,但选题角度没有选得特别好,或者不在一个传播杠杆上——最近没有一个明确事件跟它相关——就容易出现你花了很大精力,但传播一般的情况。
数字生命卡兹克
对。所以这就是为什么我很喜欢晚点的内容,同时影视飓风对我的影响也很大。
影视飓风当时提出了一个叫 HKR 理论的东西,确实很有用:做一个内容,需要符合 H、K、R,分别是有趣、干货和共鸣。
所以很多时候,我后面会用类似你刚才说的“传播杠杆”的方式切入。
比如我要给大家安利一个叫 F5-TTS 的声音克隆开源软件。如果只写这个软件,可能会落到一个非常不好传播的方向。但我会找一个节点。当时的节点是付航刚刚夺冠,我在他夺冠第二天发了这篇文章。
我用声音克隆复刻了付航的声音,让他讲了一段脱口秀,同时再把产品安利给大家。这样大家就会来看,数据确实很好。
后来我会找各种符合用户传播杠杆的点。
法律那边我也找过,因为我是刻意等到出门问问和微软那个声音版权案发生后,第二天就把文章发出来了。但是这个事件本身非常行业化,传播就没有那么好。
我还是很喜欢做这种东西。
程曼祺 Manqi Cheng
我刚才看了一下 HKR。H 是 Happiness,应该指有趣;K 是 Knowledge,知识;R 是 Resonance,共鸣。
所以你追求的是至少达到其中两个,最好三个都达到?
数字生命卡兹克
我尽量让三个都达到。
包括引入角度,可能更多用有趣的方式,让大家感觉这是好玩的。
当时我给海螺写了一篇文章,海螺 AI 刚刚上线,我帮他们写的那篇传播非常广,有 1.9 万转发,十几万阅读。
我在里面特意使用了一些案例,希望大家看到它跟传统 AI 视频不太一样的地方。海螺当时最强的是人物情绪表现。
程曼祺 Manqi Cheng
这篇我有印象。当时最火的其实是向佐,向佐的演技,摸鼻子什么的。
数字生命卡兹克
对。所以我想,为了传播、为了让用户更喜欢这篇文章,让他更直观地感受到 AI 视频的力量,我为什么不用海螺生成的视频,跟向佐做一个对比?
于是我用海螺做了几个案例,复刻向佐在那个特定片段中的演技。确实很爆,大家都爱看。
程曼祺 Manqi Cheng
AI 的情绪表达确实挺好,好像比向佐的演技强很多。
数字生命卡兹克
对。这可能是我的一个方法论。
HKR 里面最后一个干货就很简单,让大家感受到知识或教程。
最后是 R,也就是共鸣。这也是我现在被大家诟病比较多的一点。
如果前面只有有趣和知识,可能会让人觉得没有落点、没有价值。所以你看影视飓风做很多内容时,会在后面埋一些人文思考,让你感受到这个东西打中你了,或者让你悲伤、头皮发麻。
典型的例子是他们当时把卫星发射到太空,最后的落点是把用户收集的愿望发射上太空。作为影视飓风的粉丝,你会感觉到头皮发麻,感受到真诚和打动人的瞬间。
我也希望文章能用这种方式,但是可能对于家国叙事、中国崛起这些内容用得有点多。因为我确实很能感受到这种东西。
从《流浪地球》到六代机,再到《哪吒》、到《黑神话:悟空》,我就是跟着这一代一起崛起的。我能感受到这种国家情怀和自豪感,所以有时候会表达出来。
但是现在“共鸣”用得有点太多了。
程曼祺 Manqi Cheng
你说这件事被人诟病,是因为有些读者觉得你上价值太多?
数字生命卡兹克
对,吹国内吹得太多。
程曼祺 Manqi Cheng
但你是真诚这么想的?
数字生命卡兹克
对,确实这么想。
我 1995 年出生,90 后到 00 后这一段,真的看着国内很多东西从不太行变成现在这样。
小时候我还记得,吃肯德基、麦当劳,在我们那个小城市里是最贵、最奢华的店。
程曼祺 Manqi Cheng
你什么地方人?
数字生命卡兹克
安徽安庆。
程曼祺 Manqi Cheng
那你跟李冰是老乡。以及安庆这个地方,就是黄峥之前接受晚点采访的时候,里面有一句名句,大概意思就是说我做拼多多是想让安庆的人也有新鲜水果吃,引起了安庆人的抗议。
数字生命卡兹克
那倒也没有,我觉得他说得稍微有些夸张。
但小时候在那个城市生活,确实是我妈带我去吃肯德基、麦当劳,只有过生日或者拿到非常好的成绩,才能吃一次。
后来我跟着这一代一起成长,真的看到国货之光,看着新能源怎么大杀四方,也看着国内很多东西怎么在海外一点一点打出去。
AI 这一块让我感受最深。最开始 GPT-4.5 出来的时候,国内都一脸懵。
我到现在还认为可灵是国产之光,原因是它打破了很多垄断。所有人都在吹 Sora,但是 Sora 国外也没有人复刻出来。可灵在 6 月 6 日第一个把这个东西拿出来,从此中国的 AI 视频真的能在全世界大杀四方。
海螺现在已经是 AI 视频领域日活第一了。
程曼祺 Manqi Cheng
现在应该是海螺第一,可灵第二。它们应该都比之前大家讨论的美国公司,比如 Runway、Pika,更高。
数字生命卡兹克
Runway 最开始确实是我认为最棒的公司之一。它的工程化、电影底蕴非常强,但是到了后面,在模型层面已经被国内远远甩开了。
它的模型自从去年 7 月上了 Gen-3,后面更新了 Gen-3 Alpha 之后,一年时间再也没有更新。你再看国内海螺、可灵、即梦,这是什么样的更新速度,没法比。
程曼祺 Manqi Cheng
还有 PixVerse,也是国内的。前段时间它更新了 V4,效果非常棒。
数字生命卡兹克
对,他们刚更新了模型。
我眼睁睁看着国内的 AI 产品在海外大杀四方,确实会感到非常自豪,所以有时候会表达这种情绪,也会被很多人喷。
程曼祺 Manqi Cheng
我觉得自媒体或者个人表达有一个好处,就是观点更明确。但观点越明确,也会招来更多明确反对你的人,有共鸣,也有反向的共鸣。
数字生命卡兹克
这不是什么坏事。既然做了自媒体这个职业,就需要接受别人的指责,这是职业的一部分。你不可能让所有人喜欢你。
程曼祺 Manqi Cheng
你最近被喷得最多的一次,是 Manus 这个事情吗?
数字生命卡兹克
对,Manus。但它对我的影响还好。
程曼祺 Manqi Cheng
你觉得这背后是什么?是因为关注 AI 的人更多了,还是因为其他原因?为什么大家会对一个其实很多人都没有用到的产品有这么多表达?
数字生命卡兹克
我觉得他们自己的营销策略肯定有问题。
首先,他们只给了大 V 邀请码。我可以明确说,我们没有收钱,真的不是收钱。
程曼祺 Manqi Cheng
正好澄清一下。
数字生命卡兹克
对。那天晚上我看了别人发给我的视频,我不认识 Manus 团队的人。看到视频以后,我觉得这个东西很棒,想拿到第一手内测,于是去找 SevenJoy,SevenJoy 把他们的 CMO 推给我,我去找 CMO 要邀请码,当晚才拿到一个。
程曼祺 Manqi Cheng
你最开始是在一个群里看到的吗?
数字生命卡兹克
对,在群里看到的。我们加的群非常多,大概有 50 多个群,其中 30 多个是我自己的。
程曼祺 Manqi Cheng
你自己也做了一些 AI 社区。
数字生命卡兹克
对。大家有消息肯定都会往群里发,所以都是第一手看到。看完之后,我们就写了一篇评测。
如果要说背后的原因,我确实无法完全理解,但我就是这个漩涡里的人。我能感受到,他们邀请用户的策略确实有问题。
在算力明显不够的情况下,可以有更温和的内测申请策略,让大家排队,而不是邀请码。
因为邀请码一旦出现,就会从两个链路变成三个链路,中间一定涉及交易。账号交易当然也会有,但过去的内测账号交易不像邀请码这么严重,更多像演唱会黄牛卖票。
程曼祺 Manqi Cheng
邀请码后面的交易、高价挂邀请码,本身也带来争议。
数字生命卡兹克
对。那天喷得最多有两个点。
第一个是 Manus 套壳,这个其实还好,并不是致命问题。致命的是有人在闲鱼上挂了一个 5 万块钱的邀请码。大家直观地认为你是在割韭菜,虽然那个闲鱼账号谁都可以挂。
第二个是因为 Manus 的加密货币起飞了,但其实跟他们没有关系。
程曼祺 Manqi Cheng
我觉得可能是因为 DeepSeek 之后,想用 AI 的人变多了。这个策略的问题,是因为后来产生了如此大的影响力,超过了 Manus 团队原本的预期。
数字生命卡兹克
一定是。原来接触过这些产品的人,对于产品需要内测已经非常习惯了。
从最开始的 ChatGPT 不说,Midjourney、Wonder Studio、Runway,几乎所有产品最开始都是内测,连国内的文心一言也是内测。2023 年最开始可能会有人骂,后来大家就习惯了。
但这次涌入的是完全没有历史经验的人。他们一上来用的都是 DeepSeek。DeepSeek 再卡,至少还能用,问一条也能得到回答;Manus 完全不一样,有邀请码,连用都不能用。
很多人说,你至少让我进去用一次,让我上手体验,而不是把我关在外面。我觉得这个说法是对的。
程曼祺 Manqi Cheng
他们这个产品 Token 消耗比较大。
数字生命卡兹克
非常恐怖。我看这周张涛在硅谷有一个活动,现场照片里有人穿的 T 恤上写着:Manus 最开始上线的 14 天,烧掉了 104 万美元的云 Token 费用。
每次任务调用,我基本都觉得是百万级 Token 消耗。最简单的一次任务也可能是百万级,太恐怖了。
程曼祺 Manqi Cheng
但不是有消息说,平均一个任务是 2 美元吗?
数字生命卡兹克
可能还有本地部署和微调的优化方式。他们做了很多小模型,机器之心之前也拿千万复刻过推理模型,之后他们自己做了一套带思维链的推理模型,肯定有省钱策略,否则谁也扛不住。
现在他们跟通义合作了,如果阿里能承担一部分算力,可能会让国内版更快开放给大家。
程曼祺 Manqi Cheng
前面聊了你怎么开始做 AI 内容、怎么成为 AI KOL。接下来可以聊一些更实操的部分,也是你一贯在分享的。
你说想做一个 AI 殿堂的门童,让更多人进来玩一玩、用一用。我们可以聊聊,普通人——也就是各行各业对 AI 感兴趣、但不是开发者、没有技术背景的人——如果想用 AI,可以怎么用?
我们从你自己的工作流开始。你现在每天的日常工作里,哪些地方会用到 AI?用得最多的是什么?
7. Start With A Real Problem
数字生命卡兹克
很多人问过我这个问题,我第一句话一般都是反问他们:“你们有什么事情觉得很浪费时间、不想干?”
这是我一般反问的第一个问题。
我给一些公司做定制,或者在剧组里,剧组和我过去的互联网行业完全不一样。它的工业化复杂程度,特别是科幻电影的复杂程度,完全不是互联网 SOP 或产品开发工作流可以比的,是非常恐怖的工业化量级。
里面有很多东西我不懂。我们第一个要做的是用户调研,把所有痛点挖出来,再基于痛点用 AI 服务,告诉他们怎么解决。
这跟普通人怎么用是一模一样的。
如果你是程序员或者法律从业者,你在日常工作里对 AI 视频没有需求,除非以后要做自媒体,否则前几年和后几年都用不着 AI 视频。那我就会问:你学它干什么?你有什么实际使用场景吗?
现在的 AI 焦虑让很多普通人觉得“不学就掉队”,但他们不是为了解决生活里的问题,而是觉得“我要学,学什么无所谓,只要是 AI 就行”。这其实是一种变相的、懒惰式的应对 AI 焦虑。
程曼祺 Manqi Cheng
用战术上的勤奋,替代战略上的懒惰。
数字生命卡兹克
对。所以我一般会问这个问题,让他们先想自己有什么问题可以解决。
一旦他们抛出不想做的事情,具体问题就变得清晰了:你是不想做 PPT,不想建模,还是产品经理想做一个小 Demo 验证?那就有无数实际方法可以告诉你,你可以自己去学。
这就是我告诉普通人怎么学 AI 的一个重要方法:先找到自己的使用场景。
我自己的使用场景比较简单,因为现在的工作跟所有模态都会打交道,所以我都要玩。图片和影像本身就是设计师要碰的东西;代码方面,我以前做产品,现在也会手搓一些自己的需求;声音和音乐方面,做影像时可能需要配音。文字就不用说了,大家都要用。
我举个例子,比如找需求。很多选题其实来自粉丝群。它既是找需求,也是找选题。
程曼祺 Manqi Cheng
这个需求指的是社群里那些人的需求?
数字生命卡兹克
对。很多选题是为了解决粉丝的问题。粉丝提出一些问题,我觉得有价值,同时又能跟某个时事或热点搭上边,就会把它写出来,作为教程发布。
为了找用户的问题,我做了私域群,大概 30 多个群,1.5 万多人。
我们会用 AI 开发一个很小的工具。每天晚上 8 点,把聊天记录全部扒下来,然后用 AI 总结,挑出 10 个最有价值、最有意义的用户痛点或问题,作为选题储备。
程曼祺 Manqi Cheng
你们还挺数据驱动的。
数字生命卡兹克
因为每篇文章我都会复盘,看几个数据:赞阅比、分享量,以及用户评论。分享是我们最看重的数据。
每篇文章大概有一两百条评论,我会把评论全部抓出来,让 AI 分析用户对文章的正面和负面态度,看看哪些地方有问题。
程曼祺 Manqi Cheng
群里发掘需求和评论分析,都是你们团队自己做的工具?
数字生命卡兹克
群里的东西稍微麻烦一点,是我招了一个开发来做的。评论分析就很简单,只要爬数据,我自己用字节的编程工具写了一个油猴插件。
我们还会做低粉爆文的抓取,本质也是爬虫和找选题。我很少做洗稿之类的 AI 工作流,在我看来那没有意义。
更多是用数据去找粉丝量很低、但传播很好的一些文章。比如赞阅比大于 2% 或 1%,我们觉得可能有价值,就纳入选题库。
程曼祺 Manqi Cheng
你有 30 多个群、一万多人,每天聊的内容很多。你用哪个模型做分析?试过不同模型后,哪个效果比较好?
数字生命卡兹克
坦诚讲,还是 GPT。
真正要干大活,而不是玩一玩,我最常用两个模型:GPT 和 Claude,分别干不同的事。
Claude 很简单,偶尔写创意,或者做编程。
GPT 虽然我天天骂 OpenAI,大家也觉得 GPT 不行了,但在真正的幻觉控制和整体分析能力上,目前没有其他模型能比,特别是这两个功能。
我现在一直续费的是 200 美元的会员,唯一原因就是要用 o1 Pro 和 Deep Research。
程曼祺 Manqi Cheng
我看你最近分享了好多次 Deep Research,也在安利大家。
数字生命卡兹克
这个 200 美元档比较贵,用的人少。我之前一直不太想分享 Deep Research,因为大家会觉得我在炫耀,还会引起一些问题,比如“因为你有钱,所以能用更好的东西,产出比别人更好”。
其实 20 美元的 Plus 也可以用,只是每个月限制 10 次。
我举一个研究的例子。我从金融行业出来,有很多研究习惯。比如我想研究影视工业流,会称为“十字形分析结构”。
先看横向:竞品是什么样的?当前有哪些和你类似的公司、产品、做法?这些产品分别有什么优缺点?商业模式是什么?当前盈利状态是什么?
再看纵向:从公司创立到现在经历了什么变化?产品什么时候上线?为什么上线?战略是什么?经历了什么心路历程?
这就是一个十字形结构。
过去要做这种分析,非常浪费时间,需要看大量研报,也要看很多报道。比如要研究阿里,2020 年之前,甚至更早的阿里国际、Alibaba.com,网上资料非常少,找起来很费劲。
现在有了 Deep Research,它的研究能力很强。我只要把十字结构和框架列给它,可能 30 分钟就能产出一份 2 万字、非常深度的报告,大幅提高研究效率。
我跟很多金融行业的朋友对过,他们说这是三年左右研究员的水平。
程曼祺 Manqi Cheng
你现在是用在工作里,还是用在自己的投资上?
数字生命卡兹克
都会用。只要跟分析或研究有关,我都会用 Deep Research。
程曼祺 Manqi Cheng
你是 200 美元那一档,有 150 次。一个月够吗?
数字生命卡兹克
差不多。我也没有那么多需要研究的东西,一天大概用两三次。
有时候做一个大项目,对它反复不满意,框架不满意,要重新调整。每次对话都会生成一份新的报告,即使原来那份不满意,重新对话之后生成的也算新的一次,不是在同一个对话框里持续计算。所以目前够用,甚至用不完。
程曼祺 Manqi Cheng
150 次平均下来一天 5 次,已经蛮够了。
数字生命卡兹克
对,效率提升非常大。
很多内容背后需要历史参考,比如移动互联网时代发生了什么。我会用移动互联网时代、流量计费、3G 到 4G 时代的事情,跟现在做类比,让大家有直观感受。
3G、4G 时代我经历过,但很多细节确实不知道,需要大量查资料。AI 搜索,包括 Perplexity,时间深度都远远不够,Deep Research 是够的。
对我来说,一个月 1,400 元人民币,一个实习生都比它贵得多。它对效率的加持就是提出一个问题,然后去干别的事情、上个厕所,回来报告基本就完成了。
程曼祺 Manqi Cheng
你做内容的方式确实挺有意思。你自己称为“内容工业化”。
数字生命卡兹克
我认识很多博主。手工耿也因为找不到有趣选题而停更过,何同学他们也是。
我觉得想做内容的人,不一定要追求无数个爆款。爆款当然想要,但更多应该做一个下限,把内容维持在这个下限之上。
如果纯靠灵光一现,每天刷七八个小时 Twitter,这对人的消耗很大,会影响创作精力。所以我希望内容工业化。
但是又不能太工业化,因为内容本身是非标品。纯粹工业化就会变成垃圾。
我比较区分:前期选题希望工业化、自动化。因为选题本质上就是大量阅读、搜集、抽离信息,再提出问题。要先有信息,才能把它变成选题。
过去靠人力搜索,太蠢了,现在已经是 AI 时代,所以我们做了内容工业化。
我们内部每天有一个早报,早上 8 点推送到所有私域群。这是过去 24 小时搜集到的信息,背后抓了 20 多个数据源,自动抓取。
大概几百条、甚至 1,000 条新闻,先挑出来。我们有一个专门的通用大模型,不是自己训练的,只是用 Prompt 给这些内容打标,按跟 AI 的相关度和重要程度分成 A、B、C、S 级。
这些不会展示给用户,群里就是一份早报。然后挑出我们认为最相关、最重要的 10 条。人工会把前 50 条简单看一遍、排序,确定没问题后,把前 10 条发到群里。
晚上 8 点,我们内部还会发一个类似内参的东西。早上 8 点到晚上 8 点之间可能发生新的事件,再过一遍,发 20 条到工作群里,同时带上从小红书、抖音和公众号抓的低粉爆文。
低粉爆文就是一个账号关注度很低,但写出了一篇传播很好的文章。比如公众号某个人平时阅读量只有几百到 1,000,突然有一篇文章阅读量 5 万,这就是低粉爆文。
我不知道这 5 万是不是标题党,但至少他写出来了,说明可能有参考价值,所以先抓出来。我要先把所有东西搜集出来,再看赞阅比,判断是否有价值。
以前需要人肉做的事情,现在全部变成自动化流程,给我做信息输入。
每天晚上 8 点的内参会有低粉爆文、过去 12 小时的新闻,我会看明天有没有值得立刻发的选题。如果有,就从晚上 8 点开始写。
如果没有,就用之前储备的选题和文章。但选题还会跟最近两天的时事结合,基本都能挂上钩。
晚上 12 点再过一遍 Twitter,看有没有突然爆发的内容。如果没有,就发之前储备好的选题。
程曼祺 Manqi Cheng
所以你们团队的人每天晚上 8 点、晚上 12 点之后还有很多工作要做。
数字生命卡兹克
团队就我一个人。
程曼祺 Manqi Cheng
明白,其他人不写东西?
数字生命卡兹克
对。我有一个开发,他的角色是编辑。他是一个非常厉害的大三学生,全栈,前端、后端、模型微调都做,还学芯片和电子,能自己搓电路板,之前给我们做过硬件。
他会帮我做各种抓取系统、自动化推送,然后把结果发给我。
程曼祺 Manqi Cheng
这个流程固定下来以后,每天早上 8 点、晚上 8 点和晚上 12 点这三件事,要花多少时间?
数字生命卡兹克
现在每天选题阶段可能只需要 1 个小时,因为我还要过一遍,稍微补充一些信息。
在没有这套东西的时候,去年七八月份,我还有实习生专门帮我找选题、找案例。那时候我们每天每个人要在 Twitter、小红书、B 站、微博上刷五六个小时。
程曼祺 Manqi Cheng
这个流程从什么时候开始建立?花了多长时间才比较稳定?
数字生命卡兹克
实习生离职以后,我觉得必须这么干,否则一个人扛不住。
程曼祺 Manqi Cheng
实习生是因为扛不住才离职的?
数字生命卡兹克
他七八月来的,9 月赶走一个,10 月赶走一个。工作强度太大,信息密度也太大,对人来说确实扛不住。
所以要做这套东西。但这套东西主要是给我做决策的。之前还要求每个人每天提两个选题,现在已经没人提了。
以前每天到我这里可能有十几个选题,但真正有价值、能写的可能只有一两个。
这套流程不是去年九、十月份开始的,是去年 12 月开始做,1 月份差不多有一个 Demo,但中间经历了很多人事变动,直到 2 月份才开始使用,现在还在不断优化。
程曼祺 Manqi Cheng
用了这套流程,真的能帮你找到更好的选题吗?除了维持下限、提高下限之外,能提高你的上限吗?
数字生命卡兹克
不可能提高我的上限。它最大的作用,是让我现在可以出来聊天、打扑克,晚上回去还有时间写文章、干活。
按照传统流程,我几乎没有任何时间出来。我不可能第二天不发文章,出来跟别人聊天,那也不好。
程曼祺 Manqi Cheng
它解放了你跟人进行真实线下交流的时间,也解放了其他需要投入的时间。
数字生命卡兹克
对。比如跟公司的人交流、管理,都需要时间。
程曼祺 Manqi Cheng
最近你也做了一些不同尝试。你和李继刚那一次是访谈类报道,以前发得比较少。
数字生命卡兹克
以前没发过。那次之后我又发了一个涂静豪,之后就没怎么发了。
这个事情也挺累,同时我找不到太多值得这样做的人。涂静豪当年有 Clouds in Prompt,在我看来有流量价值,也有一些意义。李继刚本身也有价值和流量。
其他人我不知道该访谈谁。有流量的人,比如郭帆,他没时间,也不会接受我的访谈。大佬比如严俊杰,我也没有资源接触和访谈。
所以这块做得越来越少。特别是看了晚点的内容以后,感觉差距太大,做了干什么呢?
程曼祺 Manqi Cheng
刚刚讲的第一步是选题挖掘,还有评论分析和研究。你还有哪些工作流程可以通过 AI 节省时间、提升效率?
数字生命卡兹克
比如做海报。
现在做海报需求没那么多,但真要做很简单。有时不用 Midjourney,大项目可能还是要 Midjourney,因为要反复调。
有时候做中文海报,直接用即梦,即梦 2.1 可以直接生成中文字。平常做一些小表情包,回家想给我爸做点好玩的,就用 Picsart 的特效模板给他拍照片。
因为我的工作限制,我现在主要打交道的是文字和产品,所以用得最多的还是文字类产品和 AI 编程。
AI 编程纯粹是帮我做小工具。去网上找开源东西再自己调,还不如自己手搓,手搓一个还快得很。
程曼祺 Manqi Cheng
你长视频部分没有特别多使用 AI 生成来帮助制作,对吧?
数字生命卡兹克
视频号上的内容,首先我做得很差,其次用的 AI 确实不多。
脚本最核心的原则是,最后成片里面不要出现 AI 的东西。不要数字人,不要 AI 合成语音,绝对不要。
我要做的 IP 是有人味的东西,所以不能出现 AI。
程曼祺 Manqi Cheng
你试过把自己变成数字人吗?现在有些服务可以这样做。
数字生命卡兹克
试过。十几家都想给我定制,我也定制过一些,效果不好。
首先我要的不是纯粹流量。如果为了流量和赚钱,只要 ROI 算得过来,我当然可以批量做数字人。但我要做的是 IP,IP 和做流量的逻辑完全不一样。
IP 要的是大家的信任,这是信任经济。如果大家不信任你,觉得内容可能是 AI 做的,那吸引力和信任感都会大打折扣。
程曼祺 Manqi Cheng
为什么数字人不可能成为一个 IP?比如初音未来就是虚拟 IP。
数字生命卡兹克
初音未来是虚拟 IP,走的是另一套逻辑。我们刚才聊的是狭义的数字人,是给我做一个数字分身,而不是完全虚拟的另一个 IP。
如果做另一个虚拟 IP,就要做品牌隔离。这个是可以做起来的,特别是在金融和影视领域,因为没有塌房风险。
演员是高危行业,常年有人塌房。无忧传媒、华策都在做虚拟艺人,这种逻辑是可以的。
但回到短视频,我的要求就是尽量不要出现 AI,一定要有人感,这样用户才会信任你,也是对观众的尊重。
脚本可能会用一些 AI,比如查资料,但最后脚本还是自己写。剪辑的时候,动效几乎都是手 K,至少现在还没法用 AI 辅助。可能 MCP 来了以后,可以用嘴去 K 动效,但还不一定比人 K 得快。
我们现在不看自动化,纯看效率。
有些 B-roll 镜头,比如 A-roll 是我的口播,B-roll 需要一些画面,我们可能会用 AI 生成视频素材来填充。过去找素材很费劲,现在会用可灵、即梦、Pika、Vidu 生成一些。
程曼祺 Manqi Cheng
而且还可能有版权风险,又要付钱。
数字生命卡兹克
对。音乐和音效也是这样。
音效可能用一部分 AI,因为找音效挺麻烦。剪映的音效库非常全面,包括付费音效库也很全。除非是特殊音效,或者购买太贵,我们才会用 AI。
音乐基本都是有版权的音乐,很少用 AI 生成,除非做带故事、带情节的视频,才会生成一些。总体用得不多。
程曼祺 Manqi Cheng
你这个工作流里面,分析和整合信息的能力还是核心。现在交给 Deep Research 做的事情,就是这种工作?
数字生命卡兹克
对。内容行业里,选题占据了 80% 的精力。
我花时间最多的不是写稿。我写得还挺快,两个、三个小时,只要不算体验产品的时间,体验完、有了结论、素材整理完,写一篇稿子两三个小时就够了。
前期找选题、体验产品最费时间。体验这件事 AI 完全干不了。
拿到一个产品要评测,怎么可能让 AI 来评测?还是得人去跑,或者实习生去跑。
程曼祺 Manqi Cheng
就算 AI 能体验并输出东西,好像也不能替代你自己的体验。
数字生命卡兹克
对。那我为什么不用别人整合好的东西?为什么不用品牌方给我的 Brief?Brief 里面也有一些东西。
我需要亲身体验,只有实际操作了,认知才会深刻,才能写出自己的东西。这个很难由 AI 辅助。
但前面找选题、找资料,80% 我现在都扔给 AI 了。
程曼祺 Manqi Cheng
在使用 AI 的过程中,有什么坑和困难可以分享?或者说,现在市面上所有产品还有哪些不足?
数字生命卡兹克
最大的坑是对 AI 抱有不切实际的预期,没有摸清它的能力边界。
首先要承认,现在 AI 远远达不到 100% 准确率。不要期待它一上来就能跟 10 年老员工媲美,不可能。
Deep Research 可能能替代 3 年经验的人,但真正 10 年经验的老员工,还是有自己的经验。即使 Deep Research 已经很强,也有很多幻觉,需要自己识别。
前几天我还拿 Deep Research 写小说。
程曼祺 Manqi Cheng
我看你分享了。
数字生命卡兹克
写小说很难的地方不在文笔,而在逻辑。写故事跟写文章不一样。
写故事,特别是戏剧性内容,有个法则叫“契诃夫之枪”:如果第一幕出现一把枪,最后它不会开枪、没有任何作用,那第一幕就不要出现它。如果第一幕出现了一个物品,后面一定要用上。
这是写小说、写剧本的核心。
还有一些游戏点,比如游戏升级,需要不断翻番,这种翻番里有逻辑和创意。
过去大家说 DeepSeek 写小说还不错,其实它只是在文笔上看着能唬人,逻辑性和故事性不够。
程曼祺 Manqi Cheng
它的文笔好,但逻辑框架和世界观不好。
数字生命卡兹克
对,它根本不知道什么叫伏笔。你用大 Prompt 调出来的伏笔也是假的。第一幕出现的事情,不能让你感觉到它在后面有重要作用。
程曼祺 Manqi Cheng
你是用 DeepSeek-R1 写过很长的小说吗?
数字生命卡兹克
所有模型我都写过。因为这其实是写剧本的逻辑。
我们 2023 年就开始尝试写剧本,因为要做 AI 短片,这些都需要剧本,所以模型基本都试过,写小说也试过。
Deep Research 的一个很大特点,是它的底层模型是 o3。我的流程很简单:先让 Deep Research 生成一份非常详细的小说背景资料。
比如我要写一个 16 世纪炼金术士的故事,我会让它把非常详细的背景资料整理出来,像设定集一样,2 万到 3 万字。
然后再让它根据这份报告和我的要求,把小说写出来。
你会发现很多逻辑和伏笔是正确的。第一幕出现的老师,第五幕会摘下头纱跟你拼刺刀,他有一个反转。
第一幕出现的公爵,第四幕把你送上叛乱台。他最开始招你来,但中间经历了一系列循环,他对你的信任发生变化,第四幕亲手把你送进监狱。这些都是延续的。
第一幕翻书时看到一个道具,叫贤者之石。它贯穿全文,每一幕都会发挥作用,最后成为召唤克苏鲁古神的伏笔。第一幕只是在书里看到这个东西,但他们不知道它是什么,只说可能有用。
这是 3 万字的小说,逻辑伏笔非常正确。虽然结构没有特别让人意外,但它是非常标准的小说结构,大家能读下去。
程曼祺 Manqi Cheng
你把这个小说给朋友看了?
数字生命卡兹克
对。我把它给朋友,他是作家。他说我对它的预期太高了,做出来的东西好像不太行。
因为我想做《冰与火之歌》那样的东西。当时我沉默了一下,说:“那是《冰与火之歌》啊。你一上来就干这个,是不是对它预期太高了?”
程曼祺 Manqi Cheng
直接把乔治·马丁秒了。
数字生命卡兹克
对,你一上来就在干乔治·马丁的活,这怎么玩?
这就是我觉得最大的坑。我自己也犯过,很多朋友也犯过:在 AI 还不成熟时没有摸清能力边界,对 AI 有不切实际的预期,或者觉得 AI 达不到预期。
但 AI 是一个不断渐变的灰度,不能用 0 和 1 两个极端要求它。它当然达不到《冰与火之歌》的级别,但能不能达到 60% 网文小说的级别?能不能做短篇小说?能不能尝试做脱口秀?它也可以是辅助性的。
AI 视频也是这样。能力逐渐被抹平以后,大家一度觉得 AI 视频是垃圾,因为 Sora 被吹得太狠,大家以为可以一键生成电影。
后来发现,做不了电影、电视剧,但可以做短剧。AI 短剧是很火的范畴。前几天《兴安岭诡事》这部 AI 短剧爆了,是唯一一部在分账上能正向盈利的短剧。
程曼祺 Manqi Cheng
对制作方来说?
数字生命卡兹克
对,走分账逻辑能挣钱。之前全部是定制剧,定制剧不看分账,因为优爱腾把成本包掉了。这次走分账还能挣钱,说明市场认可。
最近一个月 AI 短剧行业炒得非常热。大家发现做不了电影,为什么不做 AI 短剧?
所以最大的坑,就是在这个阶段了解 AI 的能力边界,不要用极端方式认知和使用它,而是用渐变的心态陪伴它成长。
程曼祺 Manqi Cheng
不要因为用了一次 AI 没达到预期,就立刻失望、放弃。可以观察一下,它会随着使用和时间推移不断提升,也许能找到对你有用的地方。
数字生命卡兹克
对。不断往下试。100% 的工作它肯定解决不了,但 60% 的工作可能解决得了。这 60% 难道不是你的时间吗?那也是你的摸鱼时间。
不要太快放弃,还是自己多尝试。
程曼祺 Manqi Cheng
我本来还想单独聊一下 Agent。Agent 现在是大家讨论最多的一类产品。你刚才已经说了很多,Deep Research 我觉得就是一大类 Agent,帮你做分析的 Agent。
你应该也测了、用了很多 Agent。除了 Deep Research 是你用得最多、最能带来帮助的,还有哪些 Agent 产品是你能用到的,或者推荐别人使用的?
8. Agents Still Fail In Production
数字生命卡兹克
没有。不是完全用不到,而是现在还太偏玩具。
举个简单例子,MCP 可以理解成:比如 Claude 想调用 Blender。Blender 是建模产品,我可以让 Claude 像一个 Agent 一样操作 Blender,说“我要建一栋房子”,它就开始操作 Blender 建房子。
过去的做法,是把 Blender 所有 API 和文档灌给 Claude。现在有一套类似 MCP 的协议,有人把它包装成更上一层的接口,像当年的链路中间件,开源出来,所有人都可以使用。
这样你不用单独开发,Claude、千问都可以支持这套 MCP 协议,调用 Blender。
Agent 在我看来最重要的是 3 个能力。
第一个是规划能力。用户只问了一个问题,但实际上需要把它拆解成很多步骤,知道该怎么做。
第二个是执行。能使用的工具越多,就越强,这是纯粹的规模化效应。
第三个是记忆能力。它有超长上下文,能把所有记忆连在一起,最后整合成一个很好的东西。
Agent 整条链路很长。如果上下文或记忆存储不好,就可能丢掉一些东西,只剩最后的结论。
如果前面的结论和过程能保留下来,最后整合、总结和输出会更好,尤其是报告类产品。传给下一个环节时,也不需要传全量,只传结论,可以节省 Token。
但 Agent 现在非常偏玩具。
程曼祺 Manqi Cheng
你为什么喜欢把 Agent 念成“urgent”,而不是“agency”?
数字生命卡兹克
我不知道,我一直这么念,可能是因为我的英文实在太差。不要对我的英文抱有期待。
当时有一个论坛,我要上去分享,Agent 还没火,但我知道 Perplexity 这个词。这个词我当时不知道怎么念,现场查的。
我英文没过四级,但现在也能看一些 AI 论文,还是借助 AI 的能力,算是技术平权,让我这种学渣也能看一些前沿东西。
Agent 目前还是偏玩具,不能达到实际生产力。这跟我当年做产品有点像。
我爸做工业,是纺织厂的。所以很早以前我们聊 AI,他就跟我说工业里的一个概念叫成功率。
质量非常重要。如果良品率只有 80%,你就是一条纯粹的垃圾生产线。
我们花很多钱升级设备、做决策式模型、识别杂质并剔除,不就是为了提高良品率吗?每个环节的成功率尽可能达到 100%,最后才能保证产出。
现在的生成式 AI,尤其是 Agent,整条链路很长,每一环都无法保证 100%。90% 乘以 90% 乘以 90% 乘以 90%,最后约等于 0。
真正生产环境无法接受这样的容错率。
如果只是生成文案,或者做小红书转抖音这种 Agent,错了就错了,没人会在乎。前几天我还跟上海人工智能实验室做了 MedBench 的医疗评测基准发布。
在医疗行业,如果 Agent 中间有一步错了,那就是误诊,是要出大事的。
所以我觉得 Agent 现在还是偏玩具阶段,每个环节的成功率没法保证。
Manus 很强、很棒,但真正体验时,会发现很多任务最后无法成功。我当时凌晨 4 点前跑了 10 个任务,成功的只有 2 个。
4 点之后他们说服务器修了一下、算力加了一些。同时我对能力边界稍微了解了,不会再让它玩《狂扁小朋友》这种游戏了。2048 它还能玩一玩,《狂扁小朋友》明显玩不了。
当时我一边直播一边测,还有朋友给我出馊主意,让它玩在线版红警。我说你疯了吧,明显连网页都进不去。
后来我知道它大概的能力:10 个任务能成功 5 到 6 个,而且这是我对 AI 还算有比较深了解的情况下测出来的。
程曼祺 Manqi Cheng
为什么 Manus 在 GAIA 这个 Benchmark 上,每个层级都比 OpenAI Deep Research 高?
数字生命卡兹克
Deep Research 只干一件事,就是生成报告。Manus 里面还带虚拟机、编程和各种工具,任务多样性更高。
你让开发者测试,它能干编程吗?干不了。
叠加的东西越多,成功率越低。大家写编程会用 Manus 吗?不会,还是用 Cursor、Trae 这些产品做单一任务,成功率更高。
我不是说 Agent 未来不好,而是现在每一环成功率偏低,无法解决超长、超大批量的任务。
比如智谱的 AutoGLM。我测试过一个很搞笑的任务:我有一个群,里面有 100 个人,让它给前 5 个人的第一条朋友圈点赞,没问题。
但如果让它给前 50 个人点赞,到第 7、第 8 个人时就越来越卡,反应越来越慢,到第 10 个人已经懵了,不知道该点哪个。
任务步骤越长,成功率越低。现在很难解决这个问题。
什么时候能把它做完,什么时候才是一个超级强的自动化 RPA,能够干更多事情,真正达到生产级。
程曼祺 Manqi Cheng
所以目前真正帮到你生产的 Agent,还是 OpenAI 的 Deep Research,因为它在垂直任务里做得很好。
数字生命卡兹克
Cursor 其实也算小型 Agent。不要把 Agent 的定义放在通用 Agent 上,日常生活里已经有很多 Agent,只是大家没有意识到。
程曼祺 Manqi Cheng
像 Coze 和 Dify,我理解它们可以让你自己 DIY Agent,给它一个工作流。你用得多吗?
数字生命卡兹克
2023 年用,现在越来越少。
那时候没有现在这种 AI 产品控制台。我想搓东西,只能用 Dify,或者后来用 Coze 拖节点。每个小插件还是得自己写。
程曼祺 Manqi Cheng
Dify 不需要编程,有一些模块已经做好了?
数字生命卡兹克
对。最开始我们拿它做知识库和本地框架,可以接 AI 搜索、知识库等等,因为它是通用性的东西。
程曼祺 Manqi Cheng
你说的知识库,是韭圈儿那个公司的知识库?
数字生命卡兹克
韭圈儿在 2023 年会用得多。那时候最火的是 AI 客服机器人,Dify 是做这种东西很好的工具。
程曼祺 Manqi Cheng
所以你们当时给银行、券商、基金公司做的产品,可能用了 Dify?
数字生命卡兹克
没有。Dify 只是我们内部灌人事知识库之类的东西。那个产品太工程化,全部是自己开发,连 Coze 都没用。
因为我们要求的定制化太多,Coze 更偏组件化,真正做起来还是要自己定制。
程曼祺 Manqi Cheng
你现在用 Dify 和 Coze 变少,主要是因为 Cursor 这样的编程产品?
数字生命卡兹克
对。我很讨厌在流程里一个一个点、一个一个连线,太麻烦了。
本质上你得找到那个东西,把它拖进来,再连线,自己搭一套工作流。我为什么不直接手搓?我不应该是用嘴把需求扔进去,然后让它给我结果吗?
我跟影刀的人也聊过这个点。影刀是国内做 RPA 做得最好的一家公司之一,也是工作流的概念。
我现在更多是想要什么就直接手搓。除非是长链路工作流,比如从这里抓东西,改写成另一个东西,中间调用多个模型协同。现在更多会用飞书,飞书多维表格就能完成,而且更直观,还能跟企业里的数据打通。
飞书多维表格做长链路非常好。
程曼祺 Manqi Cheng
比如什么场景?
数字生命卡兹克
比如我爬了很多数据,导入以后,要给它们逐个打标签,比如好评、负评。
也可以把一张图扔进去,用豆包视觉模型描述头像,再用 DeepSeek-R1 根据描述猜这个人可能是什么性格。
做完以后再用豆包自己的模型,因为 DeepSeek-R1 对 Prompt 的遵循不是很好,把它转成可以用即梦生图的 Prompt,再把 Prompt 交给豆包绘图模型,画成一张图。
通过这套方式,用用户头像推测他可能是什么样的人。
程曼祺 Manqi Cheng
最后给即梦的指令,是一个更偏真实画风的人?
数字生命卡兹克
对。这是一套完整工作流。每一列处理一个任务,每一列就是一个节点。
程曼祺 Manqi Cheng
每一列写的是 Prompt 和输出结果?
数字生命卡兹克
对。前一列是后一列的输入,后一列是前一列的输出,同时又成为下一列的输入。
这是一套从前到后的标准工作流,而且很好用。
程曼祺 Manqi Cheng
我也用多维表格,但没用到这么高级。放进去以后,它可以自动跑吗?
数字生命卡兹克
全自动。模板固定以后,每加一列数据,后面的东西全自动,不用管。
飞书提供了官方接口,可以直接接豆包、即梦 2.1。里面有很多功能,可以理解为接口:DeepSeek-R1、豆包模型、智能标签、轻影视频生成等都能调用。
程曼祺 Manqi Cheng
如果本身是飞书付费用户,额外用这些功能不要钱吗?
数字生命卡兹克
不要钱,但 DeepSeek-R1 这类模型涉及 Token 消耗,需要绑定火山引擎开发者账号,从里面扣钱。
程曼祺 Manqi Cheng
免费用户也能用?
数字生命卡兹克
对,只要有飞书账号就能用。它会送你 100 万 Token,但用豆包模型也会计算 Token,不可能让你每天跑 1 万个任务白嫖。
我当时测试飞书多维表格,想出了很多好玩的场景,但实际生产里更多是把爬出来的数据打标签、转写、总结、翻译。
它的优势是能和自动化打通。
比如今年 3 月,我办了一场线下活动,报名 2,400 人,但只能选出 200 人。每个人填了很多信息,全部进入多维表格。
我在公司后面插了几列:第一列提取公司,第二列提取职位,第三列根据公司和职位打标签,判断是金融、媒体、影视、国企等。
这样可以直观看到报名者的构成。
程曼祺 Manqi Cheng
最后是按比例选,希望跨界、多元一些?
数字生命卡兹克
对。后面还有一句话描述,我用 DeepSeek 分析他想来的意愿,从 1 分到 10 分打分。
这样就能非常直观地提高筛选效率。以前自己筛 2,000 人,可能要筛两天,非常麻烦。这次一晚上就筛完了。
筛出 200 多个人后还要分组。因为活动里有共创环节,类似吃席,10 个人一组。
分组有很多规则:相同背景的人在一组,否则聊不起来;竞品不能在一组;有人明确说不想跟谁一组;国企领导要单独一组;某个群的群友必须在一组,比如我们的 21 群。
以前在 200 个人里执行这些规则很麻烦,多维表格做不了。
我用 o1 Pro 推理了大概 11 分钟,给我分出了一个特别厉害的表格。
程曼祺 Manqi Cheng
这是 o1 Pro 的 Deep Research 帮你做的?
数字生命卡兹克
不是,直接让它做。Deep Research 需要联网,o1 Pro 是不联网的场景。我分得很清楚。
分组这个事只有 o1 Pro 能做,o1 做不了,国内所有推理模型也做不了。
程曼祺 Manqi Cheng
这简直是《红楼梦》级别的难度,像贾府办宴席安排座位。
数字生命卡兹克
我给它的规则一共有 8 条。
这也取决于你是否熟悉工具,知道什么东西能解决什么问题。
我去年 5 月做这件事时,拉了很多朋友,11 个人干了两天才完成。
程曼祺 Manqi Cheng
从 11 个人做两天,变成一个模型做 11 分钟。
数字生命卡兹克
对。当然不是让他们全职做,大家摸鱼时帮我筛人、想分组。这个对比确实很可怕。
我这个人很懒,能不亲自干就不亲自干。任何事情如果让我重复 3 遍,我一定会把它 RPA 化或者 AI 化,绝对不自己干,太浪费时间、太低效。
程曼祺 Manqi Cheng
你有没有一些私藏的 AI 工具或产品?不是大家讨论最多的,但你实际用得很多。
数字生命卡兹克
比较少。我的习惯是几乎不藏东西,只要觉得好的、很厉害的,或者觉得选题可能会爆,就一定立刻写出来。
比如海螺的 AI 声音克隆。那时候大家都说声音克隆做得不好,没有一个能达到配音级别。海螺 AI 海外版的声音出来后,我看完立刻觉得很厉害,就推了一波。
他们声音克隆 2023 年就做得挺好,只是之前有一个产品没怎么推起来,叫海螺问问。
程曼祺 Manqi Cheng
海螺问问有一个功能就是克隆声音。
数字生命卡兹克
对。2023 年我帮他们推过一次。
当时有一个粉丝,她的丈夫去世了,想使用数字生命的方式跟丈夫语音对话。她有两个孩子,孩子们也希望能听到父亲的声音。
2023 年底,我跟海螺问问的 PR 比较熟,一直在寻找有没有语音方案能解决这个粉丝的问题。海螺问问的语音确实不错,PR 也觉得这是一个很有人文意义的事情,于是帮我做了。
我找粉丝要了 90 秒音频,效果出来以后,她原话是“七分像”。我不指望达到她丈夫 100% 的水平,但已经很不错,两个孩子也非常感谢。
程曼祺 Manqi Cheng
当时海螺的声音克隆,很多人试过。有些特别像,连语气、语速、停顿都很像,有些就没那么像,但总的来说已经很惊人了。
数字生命卡兹克
对。但当时海螺问问只能克隆本人的声音,因为需要录音。我帮粉丝做的那个,是走了内部特权,没有经过录音,直接进后台。
产品上如果开放录音,就会有隐私和版权问题,国内不能随便做。
去年我推海螺克隆,是因为海外版可以克隆任何人的声音。这对创作者非常有用,尤其是 AI 视频创作者,需要很好的配音产品。
传统 TTS 产品都达不到配音级别,但他们可以。
如果说私藏,确实没有多少。不过有一些很好玩的,比如 Viggle。
把你拍下来,拍一段跳舞的视频,我可以用特朗普的一张照片,把视频中间的人替换掉。
最近有一个“古人来骂你”的系列,也是用一个人的视频,替换成无数个古人。这其实就是 Viggle 做的。
程曼祺 Manqi Cheng
这是中国团队,还是海外团队?
数字生命卡兹克
中国团队,出海做的。但他们团队在国内还是海外,我不知道。我跟他们不认识,只觉得产品很好玩,一直在用。
现在视频平台上有很多基于它做的系列,比如“谁谁得了 MVP”,还有“为什么不找你自己的问题”。它的娱乐性很强,很容易出圈,但大家可能不知道背后是 Viggle。
它最开始没想做工业化的人物替代。
之前有一个产品叫 Wonder Studio,想做工业级影视替代。需要先上传模型,骨骼绑定也要按标准做,再替换视频里的人,效果不错,但太难。
Viggle 厉害在非常简单:一个视频、一张图,就可以替换。
程曼祺 Manqi Cheng
挺有意思。我估计你们现在接触的产品最多、也最新。
数字生命卡兹克
这个也不新。我在 2024 年 2 月推过一次,他们刚上线;2024 年 4 月 1 日发布 2.0,我又推过一次,因为觉得很好玩,那篇文章有 10 万加阅读。
9. The AI Tool Landscape Rewrites Itself
程曼祺 Manqi Cheng
我看了你最开始写 AI 的一些文章。2023 年你写过 AI 工具大全,我找出来看了一下,感觉恍若隔世。
当时分类是对话式 AI、图片 AI、视频 AI、音频 AI,为什么还单独分一个文章 AI?
数字生命卡兹克
那时候确实有这么个分类。
程曼祺 Manqi Cheng
比如 Bing,也就是微软的那个 Bing,现在已经没有什么人讨论了。
数字生命卡兹克
对,已经不行了。
程曼祺 Manqi Cheng
还有 Jasper。Jasper 倒闭了吗?
数字生命卡兹克
没倒闭,但我也没怎么关注了。它上一次引起较多讨论已经是 2023 年 9 月,因为当时估值从 15 亿美元降到 12 亿美元,还裁了一些人。
它后面的情况我不知道。本质上它甚至比我们当年的产品还套壳。
我当时做金融产品时研究过 Jasper 的商业模式。GPT-3 API 刚出来时非常难用,ChatGPT 还没出来,大家不知道怎么调 Prompt。
Jasper 做了一层包装,让大家能用 AI 做营销内容。那时候它对品牌营销文案理解得很好,生成质量比别人高,但其实没有太多工程化,更多就是一个个小模板让你选。
后面模型能力越来越强,品牌营销也不是一个垂直行业,而是嵌入不同的行业。它不像金融、医疗那样有专业知识护城河。
所以 Jasper 开始活得不错,后来大家直接用 GPT-4 或其他产品就能替代,为什么还要付费使用它?
程曼祺 Manqi Cheng
我看了一下,2024、2025 年还是有一些营销行业的人在用、在测评。
数字生命卡兹克
这个我确实有恍如隔世的感觉。Jasper 是我 2023 年做金融产品时一直研究的商业模式,跟我们很像,都是垂直领域套壳,只是我套金融,它套品牌营销。
程曼祺 Manqi Cheng
我们可以看看你当时写的这些产品,哪些现在还在用。
数字生命卡兹克
首先是对话式 AI。你看,我为什么要放文心一言?
程曼祺 Manqi Cheng
因为这是 2023 年 3 月 7 日,很早。那时国内没有别的产品。文心一言是 3 月 16 日首次发布,是国内第一个上线的 AI 对话产品。
数字生命卡兹克
对,这是中国唯一一个,所以我才写。那篇文章是 3 月 17 日发的。当时写的是“国内大语言模型的希望”。
程曼祺 Manqi Cheng
现在看确实很有意思。不到 48 个月,行业变化太快了。
数字生命卡兹克
ChatGPT 现在肯定还在用,全球最火,没问题。
Stable Diffusion 也还在用。
DALL·E 2 变成了 DALL·E 3,但是 DALL·E 3 自从 2023 年更新之后就再也没有迭代。它刚出来时非常火,最强的是语义理解,当时是全世界语义理解最好的模型。
但后来基本不行了,因为没有再迭代。我们还是很期待 DALL·E 4。DALL·E 3 的审美实在太差,2023 年勉强能看,到了 2025 年掉队得有点过分。
还有一个当时类似现在 LiblibAI、Civitai 的产品,当时是微调了一个 Stable Diffusion 模型。Stable Diffusion 当时谁都能调,因为开源,要求很低,所以出现了很多模型微调工具和产品,有国风、动漫、素描、CG 等风格。
但这些并不是很深的护城河,最后剩下的是两个社区型产品:Civitai 和 LiblibAI。
程曼祺 Manqi Cheng
LiblibAI 也有行业属性,营销、广告、设计的人用得比较多。
数字生命卡兹克
对。
文心一格就是最有恍若隔世感的产品。我现在完全不用,不知道别人还用不用。
视频生成 AI 也很有意思,因为当时写的全是数字人,那些主流的视频生成产品还没出来。
D-ID 我印象非常深。那时汉卿做了一个 AI Talk,用 D-ID 做的,左边是马斯克,右边是乔布斯,两个人在太空对谈。3 月份的时候超级爆。
那应该是 AI 行业的人都做过。它是全世界第一档所谓 AI 原生对话节目,两边都是数字人,聊一些有意思的话题。
程曼祺 Manqi Cheng
AI Talk 后来还有内容吗?
数字生命卡兹克
有,在视频号、B 站都有。前几天汉卿还做了一个音乐节目,是皮卡丘的音乐,做得非常好,也爆了。
程曼祺 Manqi Cheng
那个白色皮卡丘 MV?
数字生命卡兹克
对。它的对口型跟当年完全不是一个级别。
程曼祺 Manqi Cheng
这是数字人,表情也很真实。
数字生命卡兹克
这是即梦的对口型大师版。前段时间很火的 OmniHuman-1 模型,放在即梦上后,对口型基本上像秒杀全世界所有产品。
程曼祺 Manqi Cheng
以前黑镜火的时候,也是对口型吗?
数字生命卡兹克
有一段时间最开始火的是梅梅,说中文和英文切换,还有赵本山说英文。
程曼祺 Manqi Cheng
这些人物都是即梦生成的吗?
数字生命卡兹克
分很多步骤。人脸部分的底图全是 Midjourney 生成的,对口型部分全部用即梦对口型大师版。
程曼祺 Manqi Cheng
就是发挥不同视频生成模型的优点,再结合起来。
数字生命卡兹克
对。
D-ID 现在已经没人用了。当年他们做静态照片对口型,也就是照片说话,后来就彻底掉队。
后面很多人都做过,阿里也出过几个效果不错的,但他们上了通义千问之后好像就没再推。最开始的兵马俑说话,大概是 2023 年底、2024 年初,现在不知道是不是重心都放到其他地方了。
程曼祺 Manqi Cheng
这个产品也彻底没了。
数字生命卡兹克
对,我都没听过了,它甚至比 D-ID 没落得更快。
程曼祺 Manqi Cheng
音频 AI 还有哪些现在在用?
数字生命卡兹克
Murf、Fusion、Form,一个都没用了。音频领域已经彻底洗牌。
现在音频之王是 ElevenLabs。它当时还没在你的列表里,但 2023 年下半年已经比较主流了。我第一次写 ElevenLabs 是 2023 年 11 月。
海螺 AI 做得也不错,MiniMax 的音频也不错,后来豆包也起来了,语音克隆开始变得很厉害。
文章 AI 现在已经不应该单独分类了。我前段时间又发了一个 2025 年版本,可以对比看。
Notion 还在用,肯定还在。它本来就不是这一波才起来的,有点像夸克接入 AI,把 AI 放进去以后有些降维打击。
2025 年 AI 产品大全的分类已经不一样了:AI Chat、AI 搜索、AI 编程、AI 绘图、AI 声音、AI 音乐、AI 视频、AI 3D。
Chat 和搜索现在很多时候已经可以满足相同需求,但我还是会分开,因为产品形态不同。
2023 年初的版本里没有豆包和腾讯元宝。那时候百度起步最快,是跑得最快的中国大厂。豆包和元宝,尤其是春节之后,DeepSeek 加上高质量 AI 搜索,一下子起来了。
Perplexity 还在。
编程方面,是 Claude 3.5 更新以后才彻底崛起。那时候 Cursor 还没那么强,主要靠 Claude 3.5 API 接入,后来整个行业都起来了。
程曼祺 Manqi Cheng
你现在最喜欢用 Trae,Trae 已经超过 Cursor 了吗?
数字生命卡兹克
对。Trae 是我最爱用的。
道理很简单:Cursor 很专业,但它要钱。现在 Trae 可以白嫖 Claude 3.7,我当然爱用。而且它的原生界面是中文的,我英文很差。
Cursor 更偏传统 IDE,需要安装汉化插件,有些地方还没法汉化,所以我不太喜欢。
我得先说明,我不是专业开发者,用不到几千行的大项目,更多是搓小插件。Trae 对我来说更顺手。
绘图方面,即梦、可图做人物非常强。Midjourney 也是从 2023 年到 2025 年一直还在用,可能要发 7.0 了,但从 12 月就说要发,到今年 3 月还没发,太能吊胃口了。
LiblibAI 如果想在国内玩 Stable Diffusion,要么本地部署 ComfyUI,要么直接去 LiblibAI 在线跑,里面有最多的私有 LoRA 模型。
声音方面,第一个是海螺。海螺中文非常强。
程曼祺 Manqi Cheng
你最近测 OpenAI 的中文语音时,也觉得不如海螺。
数字生命卡兹克
对。所有海外产品说中文总有一种奇怪的外国人说中文的感觉。ElevenLabs 的这种感觉比 OpenAI 更明显,海螺说出来才是真正的中文。
音乐方面是 Suno,国内还有抖音的海绵。海绵和天工算是做得不错的。
视频方面,国内基本是全面领先:可灵、海螺、Vidu、PixVerse、混元,以及微软的一个开源模型。现在主流大家玩得最多的还是混元。
三维方面,腾讯的混元 3D 也挺好用,可能跟他们做游戏有关,有这方面的积累和需求。
程曼祺 Manqi Cheng
你发现没有,2025 年这个版本里面,好像每个门类都有字节的产品。
数字生命卡兹克
我之前没注意。
Chat 里有豆包,搜索里没有字节;编程是 Trae,绘图是即梦,声音没有,音乐是海绵,视频也没放。
程曼祺 Manqi Cheng
视频没放,是因为即梦的视频你觉得还不够强?
数字生命卡兹克
即梦的视频做得很早,但现在迭代有点慢,跟主流顶级产品还有一点差距,需要再迭代一个新版。他们新版已经有一段时间没更新了。
三维方面字节没做,所以没有。腾讯的混元 3D 可能更好用,因为和游戏业务有关。
现在也可以分开源、闭源,但实在分不动。开源、闭源还可以继续分很多。
程曼祺 Manqi Cheng
对比来看,差不多两年时间,行业就天翻地覆了。
数字生命卡兹克
而且我自己使用产品的方式也完全变了。
当年哪会想到 Deep Research、o1 Pro?在没有推理模型之前,o1 是 9 月发布的,我可能 7 月才知道有强化学习这条路线,才开始研究。
一般会用 RL 或 SFT,SFT 就是监督微调。
我就是那时候才知道这些东西,开始研究,发现原来非常厉害。
程曼祺 Manqi Cheng
你的信息还是非常发达的。
数字生命卡兹克
这个行业变化太快,很多东西都是现学。有时产品出来我都不知道它能干什么,就快速测试,甚至一边学习一边测,然后最快速度出解读。
程曼祺 Manqi Cheng
这也是我最后想跟你探讨的问题。AI 行业有这么多新东西,变化这么快,会让哪怕是你也感到焦虑吗?我觉得很多人肯定会有一点焦虑。
10. AI Needs A New Interface
数字生命卡兹克
我的焦虑不在 AI 进化太快。AI 进化快是快,但我一点都不焦虑。
原因很简单,只要不要抱着害怕和抵触的情绪,在工作中把 AI 用起来,就能跟上这个时代。
我更大的焦虑来自自媒体。AI 进化很快,但越来越精英化,越来越到了普通人无法理解的地步。
程曼祺 Manqi Cheng
这好像跟更多人用 AI 的趋势背离。你说的应该是 OpenAI 的重点,国内也一样。Kimi、智谱的 Zero,大家都在卷数学、编程、逻辑,越来越精英化。
但国内可能两种都有,普惠、让更多人使用 AI 的部分也有。
数字生命卡兹克
有,但在我看来不太像。
AI 本身跟大众天然有一定距离。大众真正需要的是生活场景和娱乐场景,这才是能进入很多人工作之外生活的东西。
工作场景当然是解决问题。可对很多普通人来说,下班已经很累了,谁回家还去做工作、写 PPT、做研究?更多是娱乐和生活。
所以你看超级 App,外卖、抖音、微信、哔哩哔哩,都是生活类或娱乐陪伴类,王者荣耀也是。
但现在 AI 越来越往科研、研究和精英化方向走,在娱乐领域没有出现特别大体量的东西。
我觉得有两个原因。
第一个,硬件设备没有变化,入口没有变化,到现在还是手机。硬件入口不变,大家的习惯就固定了,很难超出手机之外。
程曼祺 Manqi Cheng
上次和雨森聊,他也提到这个:微信可能是通信刚需,抖音、视频平台、游戏都是帮你杀时间。
但 AI 本质上是帮你节省时间。当终端还是手机时,新的应用要跟微信、抖音抢时间就很难,因为时间已经被占满了。
数字生命卡兹克
这也是我做了 10 年产品,却不太敢做 AI 产品的原因。
所以第一点是 AI 硬件还没有大的颠覆。
程曼祺 Manqi Cheng
AI 眼镜还没有到拐点?
数字生命卡兹克
太早了,远远没法替代。
我非常看好 AI 硬件。今年很多研究以及跟大厂接触的节奏,会越来越偏硬件。
我家里买了很多 AI 陪伴玩具,有些我觉得纯粹是智商税,花了几万块钱。
还有朋友为了买 3,000 块钱的陪伴机器人,专门买来调研,我让他们寄给我。
程曼祺 Manqi Cheng
3,000 块的陪伴机器人是哪一款?
数字生命卡兹克
卡西欧推的那款。
程曼祺 Manqi Cheng
这个 3,000 块的为什么让你印象这么深?
数字生命卡兹克
我让 AI Talk 的汉卿从日本给我带回来,花了 3,000 块钱。
买回家以后唯一的作用是摸它,它会哼唧哼唧,连话都不会说。
程曼祺 Manqi Cheng
3,000 块钱摸摸、哼唧哼唧。
数字生命卡兹克
我当时觉得可能是我的问题,我不需要情感陪伴。
有一次我去找新世相的张伟,刚好他买的卡西欧 AI 宠物到了。我们说话时,它会在旁边哼唧哼唧,也会动,但只是在原地蠕动。
程曼祺 Manqi Cheng
还是挺可爱的。
数字生命卡兹克
第一天觉得挺可爱。为了下载 App,我花了 4 个小时,那个 App 巨难下。它说有性格迭代,第二天、第三天没什么变化,第四天终于解锁了一个新的哼唧声。
我不知道它有什么用,可能我也在 PUA 自己。人家卖得那么好,可能我不是目标用户。
我本来想花 3,000 块买来做一个选题,最后也没发,因为我确实无法理解,写它干什么。
程曼祺 Manqi Cheng
如果能对话一下,可能还可以。但不对话就是它的特点。
数字生命卡兹克
对,这可能是它聪明的地方。
我很喜欢养小动物,养过 3 只猫、蛇、仓鼠,各种都养过。后来把猫送走,是因为有过敏性哮喘,对猫毛过敏。
我希望它能给我带来当年养猫的感觉,但我对它预期太高了。它现在只能达到猫的三分之一,主动交互也很弱。
宠物很重要的一点是主动触发交互,但它基本都是被动的。没人理它时偶尔哼唧一下,让你摸它。交互方式单一,蠕动方式也单一,还不会跑。
我还买过另一个桌面机器人,忘了是哪家公司。它至少能在桌面上跑,会变表情,还能跟你对话,交互范围更大。
程曼祺 Manqi Cheng
说回来,你觉得 AI 硬件还没有到位,主要是眼镜?
数字生命卡兹克
对,主要是眼镜。
我试过闪极、Rokid,Rokid 新的 AR 眼镜还没出来,之前的 AR Lite 我也试了。闪极试戴过朋友的。
雷鸟 V3 我预购了,朋友先收到,我拿来试了一天就退了,离预期还比较远。雷朋也是。
雷朋的刚需是拍第一人称视频的人,比如 SevenJoy。他们可以用眼镜拍视频。以前拍这个角度,要把相机叼在嘴上,或者竖在这里,很傻,而且不能说话。雷朋可以解决这个问题。
但我没有太多拍短视频的需求,所以不是刚需。
我未来可能更想看眼镜的显示功能,对屏幕的刚需比较大,比如光波导,至少能显示一些信息。拍摄有需求,但不是刚需。
现在显示做得也不好,续航也不行,跟 AI 的主动互动很弱。
程曼祺 Manqi Cheng
所以在没有新硬件的情况下,你还没有看到 AI 产品真正进入生活、产生很大进展。
数字生命卡兹克
对。DeepSeek-R1 扩大了人群,并没有在任务上突出什么。
普通用户需要的任务其实就那么多,很难再往下深入,大部分东西普通用户已经够用了。
这就是我担心 AI 越来越精英化的原因之一。
另一个原因是阈值越来越高。大众已经对这些东西不感冒了,AI 越来越精英化,而普通用户的交互用法没有增加,可能会越来越不关注;同时他们的阈值还会更高。
程曼祺 Manqi Cheng
前面聊了行业感受,我还想问一个问题:你为什么自己不创业?
你做过产品,又熟悉 AI 的技术边界和能力,我觉得你属于现在大家很喜欢的一类创始人或创始团队画像。
数字生命卡兹克
很简单,我出来干什么?
首先我没有技术背景,动不了模型层,没有护城河,做到后面又变成套壳。
程曼祺 Manqi Cheng
你可以找合伙人。你是完全没想过,还是想过?
数字生命卡兹克
想过。但还是刚才那句话:如果出来创业,我肯定不会做很小的东西。大家的梦想都是做大盘子,我好歹做过几百万用户的产品,肯定想在 AI 时代做一个大一点的东西。
但在手机和硬件都没有变化的情况下,我究竟做什么方向,才能不在大厂射程之内,保证有护城河和饭吃,不骗投资人的钱,把事情做下去?
我不喜欢烧钱,也不想烧投资人的钱。不能拿了 1,000 万,跟别人说我有把握,结果只是试一试。我希望自己有一定成功率,有信心以后才愿意出来。
坦诚讲,我看不到什么机会。
程曼祺 Manqi Cheng
你曾经在哪个阶段想过创业?
数字生命卡兹克
每个阶段都想过。
2023 年 7 月我想过。那时做了金融产品,后来出来,觉得这个不行,想做一个通用性的东西,类似当年的 AutoGPT,也是 Agent 方向。
但想了想,那个东西太娱乐化、太不生产了。
后来看到豆包一骑绝尘、Sora 火了,再往后我就没有信心出来了。
我觉得当一个 KOL 也挺好,做自己擅长的事情。没必要在明显不擅长的地方做,而且我没有学术背景,也没有资源,纯靠一张脸去化缘,拿到钱烧完以后失败,干什么呢?
我确实看不到好的机会。这个时代跟移动互联网不一样。我经历过移动互联网的后半程,但现在不是二八开,而是 99 比 1,成功概率越来越低。
AI 本质上是一个集中化的东西,甚至是巨头垄断更强的东西。
你有资源、钱、数据、算力和人才密度。字节为了挖人,实习生都能开出很高的价格。
程曼祺 Manqi Cheng
他们实习生一天的工资,比 ChatGPT Pro 版本一个月的订阅费还贵。
数字生命卡兹克
不止。我知道有实习生一个月能开到 1 万以上。
程曼祺 Manqi Cheng
我说的是一天。
数字生命卡兹克
对,最贵的实习生一天好像 2,000 块,非常恐怖。
这怎么比?大厂现在为了抢人,可以把初创团队的管理层都挖空,实际上相当于收购团队。
人才上比不过,靠信仰拼算力也没有,数据方面,无论垂直数据还是通用数据,都没有跟大厂竞争的资源,所以我非常悲观。
程曼祺 Manqi Cheng
你平时也接触很多创业团队。你的悲观和他们的乐观碰撞时,会发生什么?
数字生命卡兹克
我见过的很多创业者,至少私下跟我聊,都是“怎么办”。
创业很艰难,确实也有东西能跑出来,但跑出来以后大家还会想,明年的饭在哪里?如果大厂进来怎么办?
程曼祺 Manqi Cheng
现在融资环境比之前活跃。
数字生命卡兹克
比去年好一点,但跟移动互联网时代差距太大。
程曼祺 Manqi Cheng
最后问一个比较宏观的问题。
我和一些创始人、投资人、大厂高管聊天时,大家会讲 AGI、探索智能边界、AI 对产业的赋能。
从你的视角,怎么描述 AI 对你个人的意义、对卡兹克和数字生命这个小团队的意义,以及 AI 可能对更多人的影响?
11. AI Creates A Second Chance
数字生命卡兹克
大家还是会有理想,但我是一个非常普通的人,可能没有那么大抱负。
AI 行业现在最直接的情况是,就业环境非常差,非常差。
我见过很多行业,包括影视行业。大家觉得《哪吒》出来以后影视行业景气会好一点,但实际带来的是更惨淡的情况,非常惨。其他行业也不说了,都挺惨,大家手上没钱,也找不到好工作。
AI 的意义,是重新把这个世界、把国内的很多事情洗牌,让一部分人有机会继续生存。
这对普通人有非常强的意义。
程曼祺 Manqi Cheng
你们群里是不是有这样的例子?
数字生命卡兹克
很多。比如曾经做土木工程的、造船的;影视行业被卷得不想干的制片人;985、211 硕士毕业却找不到工作的年轻人。
如果他们不使用 AI、不学习 AI,继续走原来的路径,未来的生存和工作机会确实比较低。
现在全社会都在讲 AI,讲算力即国力,也讲新质生产力。至少大的层面在扶持这些东西,需求会变多,这是一块新的蛋糕。
AI 需要的是“行业加 AI”,不是“AI 加行业”。要知道行业 Know-how,再加上 AI 的运用。
这些人就有机会用 AI 赋能自己,获得弯道超车的机会,进入原本可能进不去的位置,至少得到很不错的工作机会。
我确实看到很多这样的人。他们看我的文章去学习,能帮助到这些人,我会非常开心。这是我很大的正反馈来源,让他们能更好地生活下去。
程曼祺 Manqi Cheng
这非常不宏观,是很具体的小人物,但我觉得挺好的,是很实际的事情。
你们群里最近比较关心什么?你不是每天都在收集趋势吗?
数字生命卡兹克
最近社群活跃度已经下降了一半,因为确实没有什么新的东西值得讨论。
DeepSeek 那段时间最火。很多群是两年前建的,有的群一年前建的,总共有 33 个群。
老群过去很多时候已经不活跃了。DeepSeek 来以后,这些人像被重新激活,直接跳过两年进入 DeepSeek 的叙事,产生很多讨论。但现在已经降低了。
现在聊得最多的是 AI 编程。Agent 没什么人讨论,因为我的用户群和私域群还是偏 C 端,不全是行业人,很多来自不同领域,甚至有农民在种果子,也有做教育的、法官。
AI 编程原来是很精英化的产品,普通人很难理解和使用。现在借助 AI 编程能力,一部分人终于能自己搓东西、解决需求。
门槛还是比较高,首先要理解编程思维、代码和 IDE。
最近有人在群里聊,但用得还比较简单。现在最多的是做可视化网页,大家做 PPT 做腻了,可能用 Claude 3.7 的免费阶段做一些小网页。
比如把 PDF 转成网页,做会务系统,或者做一个识别果子坏死率的网站,把图片传进去,就能标出哪些果子坏了。
这种小东西能让他们感受到编程的普惠和全民降维。
程曼祺 Manqi Cheng
你现在自己最大的成就感来自什么?
数字生命卡兹克
来自他们的反馈。
我是非常需要外界反馈的人。有人在评论里说,看了我两年,获得了很多帮助;有人告诉我,最近去 Kimi 实习了,因为一年前看了我的文章,对 AI 产生兴趣,研究了很多东西,拿去面试,很多是面试官都没听过的产品,最后因此去 Kimi 实习。
还有人因为学习这些东西找到新工作,或者在政府、传统单位里得到晋升和重任。原来的单位里可能只有他一个人懂 AI,现在宏大的 AI 叙事来了,国企和传统企业想尝试 AI,发现公司里没人懂。这个人因为一直看我的内容,跟我们交流,就得到了机会。
他们开心,我也非常开心。我觉得这就是一个正循环。
程曼祺 Manqi Cheng
负评会让你不舒服吗?
数字生命卡兹克
还好,我抗压能力很强。
负评一般不精选、不放出来,但也不会删除。要看是什么样的负评。
如果是 Manus 那种纯粹污蔑、人身攻击,我称为“污蔑式负评”,会让我不太开心。但我不会拉黑、不会删除,也不会回复,顶多放在那里不精选。
有的评论说得很对,比如“你怎么天天炸裂叙事,看到什么都吹”。这种我有时会回复,因为它不算恶评,只是建议和评价,是中立、客观的存在。
程曼祺 Manqi Cheng
好,今天非常感谢卡兹克做客晚点聊,分享他是如何成为数字生命的,也分享了自己在工作中使用 AI 产品的一些 Tips。
我们还回顾了他 2023 年初和 2025 年初分享的 AI 产品,能感慨这个行业发展得有多快。
数字生命卡兹克
谢谢大家,希望没有给晚点拉低质量。
程曼祺 Manqi Cheng
不会,我觉得很有启发。
这期节目有两个地方和之前的节目呼应。
第一个是“Attention Is Not All You Need”,这是和戴雨森聊 Agent 的那期播客标题。他讲的是 Agent 这种具有自主性、又能完成任务的工具,可以解放人的注意力,让每个人的工作和生产潜力大幅提升。雨森说,这是工作的 Scaling Law,进一步可能是资金转化为生产力的 Scaling Law。
卡兹克分享的这些实操案例,就是“Attention Is Not All You Need”的一个具体实现。他也提到,如果不是因为从去年底到今年逐渐完善的更多 AI 自动化流程,他可能很难找出这么长的时间来录播客。
第二个是模型和产品之间的关系。这也是我们在 Agent 那期,以及之前与 MiniMax 的严俊杰、百川的王小川的访谈中都聊到过的话题。
关于这个问题,一直有两派观点。
一派认为,模型能力上升会吞食掉一些产品。比如这一期聊到的 Jasper,它是 ChatGPT 之前就出现的明星 AI 产品,主要用于写营销邮件,使用的是 OpenAI 的模型。但在 GPT、Claude、Sonnet 等更强模型出现或升级后,Jasper 一度受到冲击。
和卡兹克录这期时,GPT-4o 还没有释放文生图功能。现在很多人也开始担心,过去学习 Midjourney 或 Stable Diffusion 的经验会不会变得没用。
另一派观点认为,基于其他模型做的产品仍然有价值,会因为对需求的洞察、独特的设计思路或工程优化具备竞争力。
比如戴雨森在 Agent 那期节目中提到,专注做应用至少有两个好处:一是一个应用可以混用多种模型,发挥各个模型的长处;二是在用户心智上,一些成功产品可能让目标客户产生依赖和黏性。Perplexity 和 Cursor 都是比较好的例子。
我自己的感受是,有模型能力的公司可能确实更有主动权,尤其是同时做大模型和产品的公司,OpenAI 和一众巨头就是典型。
比如这次 GPT-4o 释放文生图功能后,反馈非常火爆,但 OpenAI 没有第一时间对外释放 API,也没有在 ChatGPT 免费版里放这个功能,导致 ChatGPT 付费版成为市场上的独家供应。
从社交媒体上大量 GPT-4o 生图来看,这次拉新的效果应该很好,而且是实打实的付费用户。
也就是说,如果某个产品正好处于大模型公司提升模型能力的主方向或主航道上,就很可能面临更严酷的环境。
更好的文生图、更好的通用 Agent,应该都是各个模型公司的必争之地。那接下来还会有什么?本期节目就到这里,感谢收听。如果你对今天聊的话题有观察、好奇或疑问,欢迎在评论区分享想法,这也会成为我们节目的一部分,让整个讨论更完整。你也可以把我们的节目分享给对这个话题感兴趣的朋友,推荐更多你想听的主题和嘉宾。你可以从小宇宙、苹果 Podcast 等渠道关注晚点聊 Late Talk,也欢迎关注我们的公众号晚点 Late Post,下期再见。