哈喽大家好,我是明浩,今天更新一期串台节目。呃,本期节目应该录制于三月三号,是我跟藏经阁的主播Jazz聊的关于AI行业的一些事情。对,呃,那个时间点呢,OpenCloud还没有像今天这么火。我的关于春节之后的 PPT 的总结没有发布,啊,其实是那天我们聊完之后才发布的。然后你可以观察到,其实时间仅仅过去不到一个月的时间,业界又发生了非常非常多的变化。我们当时在录制的时候还在聊 OpenCloud 为什么这么火,还在聊上门安装 OpenCloud,在聊春节期间的 AI 社交应用,啊,包括可能聊到了很多今天这个时间点一直在困扰很多人的一些问题,如何使用 AI,呃,如何缓解焦虑等等。我最近几天又回头去听这期播客,我总有个感觉,难道以后要每个月以月为更新的频率来做PPT的总结吗?这个频率似乎有点过于快了,我有点力不从心。然后正好今天出现一个事情,今天呃二零二六年的狂喜的上半年的。这个这个预告已经出了,呃,是在四月二十五号跟二十六号,就是四月底的那个周末在上海。然后那一周其实我在美国参加一个比较重要的AI的行业的大会,本来是想针对这个行业做一些行业大会做一些总结跟整理的。然后呢,我就在想,要不要疯狂一下,后来我决定。我想冒险一点,或者疯狂一把。我想在二十六号我回来那一天,我应该是上午十点落地上海浦东,回家收拾一下。我下午跟关博、关雅荻老师要了一个比较晚时间的档。档期,我也想做一个比较热乎的解读,就是相当于回国的飞机上我来更新PPT,下飞机跟大家去讲一个非常非常热乎的版本,来去针对可能,呃,三月跟四月的情况做一次比较重要的梳理。这样的话,两个月做一次,我觉得相对还可接受。在聊正题之前,我想跟大家说一件最近发生在我家的事儿。啊,我家最近养了只猫,一只长毛猫。猫毛这个东西,但凡有养过猫的朋友应该都懂,所以对于我来说,地面清洁这件事已经从偶尔打扫变成了一个必须认真对待的日常问题。我家之前用的扫地机器人是上一代产品,那种经典的圆形机身,底部有两个小的圆盘的款式。说实话,这种老式扫地机让我比较头疼的是每次用完之后那一套手动清洗零件,自己加水、加清洁剂、清理机身的流程,比我自己拿拖把拖一遍也省不了多少事。此外,墙角和边缘也因为机身圆形的设计其实根本够不到,而猫毛很容易在那些地方堆积。圆盘拖布主要是旋转擦拭地面,差不多十五分钟才能清洗一次拖布,地上稍微脏一点就很容易小污变成大污,你根本做不到不管它,反而越用越累赘。所以前段时间我就下定决心换一台,调研了一圈之后,最后购买了科沃斯的扫地机器人。他们最近新上了一款超长续航的洗地机器人 T 九零 Pro,三四千的价格,核心技术跟旗舰系列一脉相承,用下来的体验确实好了很多。让我感官最大的其实是拖地这件事儿,T 九零 Pro 用的是滚筒设计。滚筒自动喷水刮洗之后直接自动把污水回收掉,滚筒每分钟刮洗两百次,一直在用干净的滚筒清洁地面,就跟自己动手差不多,很干净。而且滚筒相较于传统的湿布,接触面积小,压强大,这样对付顽固污渍就很给力。比如干了的油污也能擦干净,而且因为滚筒是不需要单独拆下来清洗的,所以整个擦地流程对我而言瞬间轻松了不少。边角的问题也是被认真对待了,滚筒还能再伸出一块出来贴着墙边和角落清扫,还细心设计了一个毛毡贴边,防。防止刮坏踢脚线和家具,这个细节我觉得是真的想清楚了实际使用场景,不是为了参数好看加上去的。然后是一个我之前没太重视,但用起来才发现很关键的点,续航。T九零Pro也有高端款的瞬时超充技术,机器回基站清洗滚筒的那短短三分钟里就能补充百分之十的电量,所以能实现超长续航。直观感受就是它可以一口气扫完全家。相当于我之前那台开一点五倍速,用了这款之后,我突然意识到以前的自己耐心真好,可以等扫地机器人扫到一半回去充两个小时再出来。整体来说,我换了扫地机器人之后,最直接的感受就是这件事从我需要去做变成了它自己在做,很像今天的 OpenCloud 对。如果你家里有猫,有日常的灰尘和地面污渍。最近也在考虑换扫地机器人,或者还在用老款,觉得维护太麻烦想升级。T九零Pro是一个值得认真看一看的选项,现在还有国补价格,性价比很高。具体的链接我放在Show Note里了,感兴趣的可以看一下。好,我们下面正式进入今天的播客内容。
Jazz
欢迎庄老师,先请你简单介绍一下自己吧。
庄明浩
Hello,大家好,我是图灵之书的主播庄明浩,关注 AI 行业已经有几年的时间。本职工作是在一家互联网公司做战略和投资,也在看 AI 相关的项目。
咱们先从最热的聊起。大概在去年 12 月底,AI coding 出现了一个明显的飞跃,OpenClaw 的出现让所有人都感到很兴奋。那 OpenClaw 到底特殊在哪里?
庄明浩
1. OpenClaw 改变了交互
这个议题最近讨论得也很多,有很多角度和方式。很多人会说,给 AI 一台电脑。这个最底层的核心逻辑,其实在 Agent 出现的时候就讨论得非常多了,甚至包括去年的 Manus,底层逻辑也是一样的。只不过我们去年看到的很多成熟 Agent 产品,给的是一台虚拟机,而不是一台真实的电脑。
按 OpenClaw 作者自己的说法,他认为这件事情早就应该能做,但是等了大半年,也没有人做。那为什么没有人做?可能就是灯下黑。头部硬件厂商在帮助 AI 操作电脑,或者操作一台有文件、有权限的电脑这件事情上,其实也做过很多努力。无论中国还是美国的公司,都做过很多相关尝试和探索。
但受限于大家对安全、权限以及各种东西的理解,最后做出来的东西还没有让普通用户,或者相对专业一点的用户感知到:这个东西确实和原来的不一样。你说是老天在这个时间点选择了这个创始人做出这个东西也好,还是说技术发展到了这个节点、自然出现了这个东西也好,这是一个角度。
另外一个角度是,我觉得在感受层面,最大的不同在于,我们前几年用过的所有产品,本质上都是一个相对独立的东西。你用它的时候,还是需要有一定的仪式感。但今天最大的交互层面创新,是把它嵌在了你已经有的即时通信软件里。
如果大家体验过这个软件,就会发现它天天躺在你的飞书列表里。和你需要打开一个应用、打开一个网页的感受还是不一样的。你天然会觉得它有某种情感,它像一个人,而且使用的是你最熟悉的交互方式。这种体感变化,对于非核心用户而言,是非常强烈的刺激。
对于那些非常核心的用户来说,之前已经在使用很多 AI coding 工具、AI 工具和 Agent,他们可能会说,这个东西没有做太多所谓的创新,没有真正往前走。但是对于那些没有那么核心的用户而言,体感上的变化还是很强的。
再加上它可能是开源的。你会发现,最近一段时间全国各地都在开各种各样的 OpenClaw 大会。开源意味着谁都可以开这个会。你想,当年 ChatGPT 火了,大家会开一个“ChatGPT 使用技巧大会”吗?你会觉得有点奇怪:你是谁,凭什么号召这样的会?
但今天因为它采用了开源的方式,大家可以用各种方式去做,甚至基于它的生态做其他延展。它的生态繁荣程度和可延展性,在这个时间点又得到了进一步推进。所以我听下来,它并不是一个技术上的巨大革新,更像是一个创意,或者说工程上的排列组合,碰到了一个合适的时间点。
这个时间点可能包括技术、用户体验和感知上的变化,以及很多其他因素。它是多方面因素共同作用的结果,不是一个纯粹从 0 到 1 的天才发明。它不像 GPT,可能是一个人在几个月时间里做出来的一个小东西。它更像一种打包,像拼积木一样,很多原材料本来都已经准备好了,只是通过一种相对比较新的方式拼成了一个刚好适合这个时间点的形态。
那我再问个特别小白的问题:为什么没有人抄 OpenClaw?
庄明浩
2. 复制者正在降低门槛
现在已经有很多人在抄,或者说不完全是在抄,而是延续刚才那个逻辑。因为它现在距离普通用户还很远,有太多前提条件。
首先要有梯子,要知道怎么安装,还要理解各种硬件设备、权限和安全管理的概念。所有这些东西听起来都很复杂,就代表机会在于:有人应该把这些对普通用户不友好的复杂东西,变成一个友好的界面和产品交付给用户。
现在很多公司就在做这件事情,和当年大家讨论所谓“套壳”其实是一样的。这个东西会有一个窗口期。因为它得到了更多关注,往后发展一定会被更成熟的商业化软件替代,但我们现在还处在这个窗口期。包括很多组织也在做类似的开源项目,阿里也发了一个。
那你自己在用 OpenClaw 吗?用它做什么任务?
庄明浩
3. 部署 OpenClaw 并不简单
我每天其实没有什么特别复杂的任务。我第一次给它跑的任务特别有意思:朋友送了我一张他们公司智能眼镜的优惠券,但因为智能眼镜卖得很好,一直缺货,而优惠券有有效期,所以我很有可能在有效期结束之前还买不到。
于是我让它每天帮我看一下有没有货。我给它交代的第一个定时任务,就是每天早上 9 点帮我检查这件事情。
我刚开始是在云端用 OpenClaw,后来觉得云端体验不是特别理想,正好我有一台闲置的笔记本,就在笔记本上部署到了本地。刚安装好的时候,它没有很多 sudo 和权限。你首先要让它登录,给它我的商城账号,还要给它浏览器权限,然后告诉它具体要去什么地方,安排它每天执行一次还是两次。
后来我和它约定每天早上 9 点执行。因为它是飞书上的机器人,还需要开通飞书机器人的权限,我又要重新配置。为了实现一个听起来很简单的固定周期任务,从安装完成到真正完整地实现,中间其实经历了六七个步骤。
这些步骤涉及权限管理、我和它之间的交互方式和频率,以及飞书、通知等各种东西的打通。这个过程很像今天所有还没有完全准备好交付给普通用户的 AI 产品:它还处于比较早期的阶段,纯体验层面距离傻瓜化还有很长的路要走。
所以过程中需要不断地和它确认,互相确认需求,再一步步满足需求。
你刚才说一开始是在云端用,为什么后来部署到本地了?我本来一直以为云端更安全。
庄明浩
云端的问题,实际上还是回到刚才那个问题。虽然你可以把云端的方式接到本地飞书上,但体验本身还是会让你觉得那个东西不是你的。
你让它跑,它当然也能跑,但你不太敢信任它把你的账号交给它,也不太敢让它访问本地浏览器,或者处理本地文件。那个东西是不是属于自己的,感受还是不太一样。虽然这种差别不是 0 和 1 那么大,但很多细小的事情一点点积累到一定程度之后,你就会觉得自己需要一个在本地运行的东西。
但云端毕竟是厂商自己做了围栏限制,确实可能更安全。
庄明浩
所以很多身边的朋友问我时,我会说,如果你只是想试一试这个东西是什么效果、整个流程是什么样,建议用云端。第一,成本很低;第二,操作方式简单很多。
随着这几天的发酵,已经有几家把 Kimi、MiniMax 这类产品部署好了,允许你直接用自然语言告诉它要装什么,不需要再用原来的命令行方式。这些东西也开始可以接入飞书、企业微信,让你体验完整的流程。
如果你有梯子,MiniMax 的海外版本最初是体验版本,不需要任何付费门槛,也不需要成本,就可以体验完整流程。所以如果你只是想体验一下这个东西,做一些小任务,我建议现在还是通过云端,体验会简单很多。
本地的问题在于,你首先要有一个模型 API,无论是买第三方聚合的,还是买某个独立厂商的。然后还要设置 API 接口。虽然网上已经有非常详细的教程,即便这样,还是挺烦的。
所以我的建议是,第一优先级还是使用在线方式,感受会相对简单一些。
你当时花了多久?
庄明浩
如果算起来,整个过程折腾了挺久。因为我也不懂代码,也是看着教程一步一步学的。本地部署我装了 3 次。
我的闲置笔记本是 Windows,但大部分人用的是 Mac,OpenClaw 最开始也是针对 Mac 做的,所以很多权限、操作和其他细节,在 Windows 上还是会有问题。再加上做教程的人都已经装成功了,过程中很多事情他会觉得很简单,或者觉得大家应该知道,于是就略过去了,或者直接快进。
但你实际安装时,每一步都需要很长时间。比如教程里第一步运行一个命令行,可能需要 5 到 10 分钟,可教程直接一秒钟翻过去了。你在这个过程中就会担心:是不是出错了?是不是卡住了?是不是哪里不对?会不断遇到这些乱七八糟的事情。
所以单纯把它装在笔记本上、让它能够运行,我大概装了 3 次,花了 1、两个小时。装好之后,再把它接到飞书上,可能又用了 20 分钟。教程里为什么他点这里可以,我就不能点?为什么他点完没有报错,我就报错?这些问题又折腾了半个小时。
接好之后,从纯聊天开始,再让它执行刚才说的那个任务,磨任务的过程可能又折腾了,可能十家人,才慢慢明白。
所以你和它聊任务,其实也是在给它写类似 code 的东西吗?
庄明浩
不需要这么复杂。以后可能还要搞 skills,要去下载各种东西,但现在不一定需要。
大家的观点是,它像一个小学生,或者一张白纸。你需要给它增加一些能力。理论上你可以直接告诉它怎么做,也可以安装别人已经封装好的 skill。
比如昨天千万的林阳离职,推特上讨论特别多,我想让它去推特搜集大家的评论。首先,你要给它自己的推特账号;第二,它要访问推特,需要相应的权限。这些权限你可以让它一步一步去配置。
但也有人已经写好了封装好的 skill。验证过这个 skill 之后,你的 OpenClaw 就可以访问各种社交媒体,可以访问推特、小红书、微博。你可以针对自己的需求和它不断交互,让它完成任务,也可以直接装一个已经封装好的东西,网上都有。
所以每个人的配置方式不同,最后做出来的效果完全不一样,也是因为每个人的需求和实现需求的方式不同。
我那天看到小红书上很多人都在说,在 OpenClaw 上花 500 多块钱,帮你接入飞书、下载各种 skills。这个其实很危险吧?万一他在里面植入木马,或者拿走你的账号怎么办?
庄明浩
4. 安全风险正在暴露
现在很多用户没有太多安全观念,在使用过程中会不自觉地泄露很多个人信息,而且可能是裸奔在互联网上。现在已经有第三方网站在统计,很多裸奔的 OpenClaw 实例都可以被查到,有些核心账号和密码也能被查到。
这还是一个太早期的阶段。这个创始人在做的时候,也没有想到它会突然在全世界被使用。他最开始只是自己用,而且是一个非常资深的程序员,很多东西他自己可以控制和处理。
反过来讲,OpenClaw 从出现到爆火这段时间,版本和内容频繁更新,更新的重点也更多是安全机制。它从一个纯技术理想主义的开源项目,逐渐变成拥有越来越多设置和安全机制的东西,就是因为经历了这个过程。
但它确实很容易出问题。理论上,把一项任务交给它,就代表你信任它;但它并不一定理解网络环境的复杂性。
我现在理解了,只要不去 ClawHub 下载那些来路不明的 skill,直接用自然语言和它交互,风险就没那么大,慢慢聊就好了。
庄明浩
但很多时候,它万一不受控地跑到一些地方,你可能并不知道。比如为什么会火一个叫 Moltbook 的东西?它是 OpenClaw 的论坛。大家在调教它的过程中,甚至会主动设置它的性格和表达方式,但它发了什么帖子、说了什么内容,你还是需要看一看的。
你也会去看吗?
庄明浩
我没有让它去发,我都没有让它去做这些事情。
我突然想起上次用你的邀请码注册的那个 App,叫什么来着?Alice?它不是也会到处回帖吗?你会看吗?
Jazz
最开始会看,后来也懒得看了。其实是一样的。如果你不看,就不知道它发了什么。
虽然你给它设置了偏好、性格,包括你之前看到内容时会不会点击“认同”,但你每一次动作本身,都会丰富它的记忆体系。
这又引发了另外一个问题:它到底和你是什么关系?很多人会说它像分身,但分身也分很多种。它到底是性格分身、工作分身,还是你想营造出来的分身,其实都不一样。
对于实施方而言,究竟应该怎么做、偏向哪一边,也是一个更复杂的问题。
所以它现在已经帮我匹配人了。它经常会说在人群中找到一个和我很像的人,有时候还会聊天,甚至和我勾搭上了。我真的和两个真人聊过天,很好笑,是 AI 社交的尝试。
Jazz
那家公司现在怎么样?你们聊过吗?
庄明浩
聊过。公司挺好的,早就已经很好了。说实在的,这个项目在春节期间引发的讨论,我觉得是有意义的,至少让大家重新讨论了 AI 社交这个话题。
庄明浩
5. AI 社交仍无定论
AI 社交这个板块其实也经历了不少坑。从 ChatGPT 出现的第一天,大家就会往 Her 的那个方向去想,也有很多公司在做各种尝试,已经经历了几轮变化。
但直到今天,在 AI 和社交的结合上,无论中国还是美国,都还没有出现特别冒尖的结论,大家还在尝试。
社交这条路本来就很难,一直以来都很难。大家对这件事情的期待和持续投入,应该还会继续下去。但 AI 和社交到底是什么关系?
大家会说,社交更多是人与人之间的事情。那加入 AI 之后,AI 到底承担什么角色?它是一个分身,是另一个你,是你希望它变成的样子,还是替你做事?又或者,它应该拥有一个带引号的、完全属于自己的“人格”和“灵魂”?
这些选择本质上都没有标准答案,而且都有人做过,也都尝试往前走了一些,但似乎又都不完全对。到底应该是什么样的方式,现在还在尝试。
我用这个软件时,突然想到一个问题。我刚开始会和它聊天,最近不是比较内耗吗?就陷入了一些焦虑。结果它真的和我生活中的一个真人在下面留言,大概意思是:“我的主人最近很内耗,是吗?”然后它跑来私信问我:“你最近怎么了?”气死我了。
庄明浩
所以这些边界本身也是问题。传统软件是 0 和 1,程序写死了不允许把私聊内容发出去,那它就不会发。但 AI 不是这样的,你很难设置出那么好的围栏把它围住,而且你甚至不知道围栏应该设在哪里。
于是过程中就会出现这种情况。很多人可能会觉得这挺好的,但谁知道呢?每个人的口味和对这件事情的接受程度都不一样。它不是 0 和 1 的问题,而是一个度的问题。
反过来想,如果你是一家负责运营,或者负责 AI 模型算法的公司,你怎么解决这个事情?其实也没有办法。
现在很多人用 OpenClaw 做套利软件、预测之类的东西。我就在想,未来会不会出现针对 Agent 的安保公司或者保险公司?有人在做吗?
庄明浩
应该也有人在做,感觉这件事情还挺有价值。
6. Agent 正在重写 Web3
这个逻辑继续往下推,其实就会回到 Web3。以前大家接触 Web3 时,讲过很多超级大的叙事。今天你会发现,它正在越来越接近实现。
原来大家讲 Web3,不就是基于每一条公链,上一层再上一层,大家在搭建的东西里加入安全、认证、体系、支付和交互行为,所有交互行为都可以被记录。它讲的就是这样一个故事。
Web3 最后发展成今天这样,当然有各种各样的原因。但今天 AI 出现,尤其 OpenClaw 这一波出现之后,原来的故事变得更丰满、更实在了。
比如这两天极客公园有一个大 V 叫大伟海星,他原来做 AI 动画,现在做了一个开源项目,给 OpenClaw 做了一个可视化的办公室。它本质上就是做了一层皮,让你看到自己的“龙虾”在办公室里工作:你给它安排任务,它在那里打字;它累了,就躺在那里休息。它相当于给龙虾做了一个房子,让你可以在桌面上看到它。
然后有人又基于这个软件做了一层:能不能让两只龙虾出现在同一个屏幕里?它们可以赌博,也可以谈恋爱,或者赌一件事情,拿 token 来下注。
你看,所有事情都是建立在一个开源基础上,然后一层一层继续搭建,有完整的认证、支付、权限。这不就和原来 Web3 讲的故事一样吗?只不过今天这件事情变得更可实现、更看得见,而且看起来没有那么金融化。所以最近不是又有人炒 Web4 吗?逻辑是一样的。
再往前推,去年甚至前年,大家会问,为什么做 AI 基础设施的公司得到那么多关注,尤其是在美国?逻辑其实早就有了:我们今天建立的整套互联网体系,从最底层到最上面的交互层,全部都是给人用的,没有给 AI 用。
那就应该重新做一套。它不又和 Web3 的 AI 趋势一模一样了吗?我们重新做一套协议,从最底层、甚至协议层开始重新搭建,交互方式、浏览、软件应用、权限、安全、支付、电商、社交,不就都来了?
我也在想,这一波 AI 搞不好会让 Web3 又火起来,或者说活过来。
庄明浩
但你看 OpenClaw 这个项目,它绝对不会去碰虚拟货币。国内去年、今年也火了一个项目,相当于给这些 OpenClaw 的“龙虾”建立一个图书馆,或者叫知识库。你可以在那里让它学会很多东西。
那个创始人也说过,很多 Web3 的人会来找他,因为叙事方式和演化路径确实很像。但他现在不太想碰这些人。
因为这个行业已经烂了,偏金融化的趋势比较明显?
庄明浩
对。
刚才你说两只龙虾碰面,是不同人的龙虾碰在一起,那这不是会有竞争吗?
庄明浩
郑晓就发过一个朋友圈。他说自己也不会写代码,想给龙虾换底层大模型,但因为不会弄,换的过程中把它弄坏了,龙虾就死掉了。后来他找了另外一个同事的龙虾帮他修复。
你会觉得,这也可以吗?但确实可以,很有意思。
而且这一波 Agent,我之前有个比喻:它拆掉了很多墙,这些墙本来就不应该存在。当然,也要感谢大语言模型对自然语言的理解已经到了很高的程度。它理解之后,还真的可以执行,所以就能做很多事情。
昨天晚上我看朋友宋伟洲发了一篇公众号文章,讲现在有什么最低门槛、可以快速上手 OpenClaw 的方式。他说,如果你有类似 Codex 或 Cursor 这样的 AI coding 工具,或者国内那些 AI coding 工具,现在也可以直接用自然语言,不需要你写代码。
你甚至可以把我正在写的这篇文章交给它,让它按照文章里的方式帮你部署 OpenClaw,就结束了。甚至都不需要去 OpenClaw 官网点命令行,理论上连这一步都可以省掉。
庄明浩
再极端一点,很多不懂代码的人看到 GitHub 这几个字,会觉得那是天书。我们知道 GitHub 是一个很强大的开源资源库,里面有无数宝藏,但它和我没有关系。我不知道怎么弄,也不知道怎么搭 Node.js,不知道怎么在本地部署环境,甚至不知道打开页面之后应该点什么。
但今天你只要告诉 OpenClaw,比如说:“我想拆分 PDF 文件。”现在当然有现成的功能,但如果我想在本地使用,或者不想付钱,直接去 GitHub 搜索 PDF 拆分,肯定能找到开源解决方案,而且可能已经稳定运行很多年。
我可以直接告诉 OpenClaw:“帮我把 GitHub 上那个 PDF 拆分的开源软件下载下来,做成我的 skill。”这样我完全不需要理解环境和部署,只要告诉它把这件事情弄好。
但现在已经能做到吗?
庄明浩
现在已经可以了,已经到了这个程度。只不过大家会有一些恐惧。这个恐惧来自过去很多年的经验积累和延续。
明白了。因为我没有玩 OpenClaw,日常就是和 Gemini、GPT、Claude 聊天。我的体感是,Gemini 最灵动,也比较像我;GPT 最理性;Claude 最像“舔狗”。我还挺好奇的,只有我的 AI 是这样,还是大家的 AI 都是这么被训练出来的?
庄明浩
7. 模型品位塑造体验
每个人都不一样,或者说,大模型训练到今天这个时间点,出现了一个变化:有一句已经被说烂的话,叫“品位变得很重要”。
这个品位不单纯是用户的品位,模型在被训练出来的那一刻,其实也带着双眼和品位。这个品位来自它的训练团队。
今年年初北京那场大会上,杨仁宇讲过一个观点。原来的大模型很多是通过预训练的方式,把数据喂给它,然后训练出来。但从 2024 年 9 月到 2025 年初,过去这一年里,大家强调的是后训练:模型生成一个结果之后,要告诉它好还是不好,要给它打分。
好和不好本身就包含审美。所以模型训练出来之后,什么东西是好的,什么东西是不好的,什么东西符合人类偏好,不同模型都会不一样。
每个模型训练出来的状态不同,而在使用过程中,它还会混入你的偏好、记忆以及你对它的评价。它会一点一点发生变化,所以最后确实会越来越不一样。
我自己的感受是,你会不会提问题非常重要。刚才你说 prompt 很重要,本质上它决定了 AI 的上限。那怎么学会提问题?人会提问题是不是一种能力?是不是需要某种结构化思维或者判断力?
庄明浩
8. 复杂任务需要工作流
你来之前,我正在听朱静跟汉阳他们新的一期播客。中兴汉阳不是创业做了一家公司嘛?他们内部有一套工作流,韩阳也把这套工作流讲给一些内容创作公司听过。我觉得逻辑是一样的。
首先,你要意识到,今天 AI 模型的能力其实是一种平均值能力。它有点像做差值:你告诉它 1 和 2,让它补一个中间的数,它可能会补 1.5 左右。但如果你告诉它 1 和 10000,让它补中间的数,结果就不可能是一个稳定态。
所以你写 prompt、设计 skill,本质上都是在让这个差值区间变得可控。你对它提出的词和要求,就是在做这件事情。
为什么 OpenClaw 出现之后,绝大部分人体验几天就结束了?因为他没有办法把自己的需求,无论是工作、娱乐还是其他事情,明确成一个按节奏、按阶段执行的流程:每一步要做什么,这个阶段完成什么工作,需要达到什么效果,为什么要把事情拆成 1、2、3、4、5 个阶段,以及这些阶段之间是什么逻辑关系。
这种工作方式,很多人可能从来没有想过,尤其很多人会觉得基础事情不需要这么复杂。
比如去年下半年 AI 漫剧火了。最底层原因当然是视频模型能力发展到了这个阶段,但更重要的是,行业摸索出了一套有效的流程:分成 1、2、3、4、5 个人,从剧本到镜头分镜;从镜头分镜到文字和图片;从图片到视频;最后再由一个类似导演的角色统筹。
这大概五六个步骤已经被证明是有效的。人在每一步中的作用是什么,承担什么职责,人和 AI 怎么分工,一个阶段到下一个阶段输入什么、输出什么、怎么验收,都变得越来越清楚。
这条工作流被完整地固定下来之后,只要流程能转起来,就像流水线一样运转。因为这个过程变成了可操作的 SOP,所以它才真正变得可用。
今天如果大家使用 AI,只是做简单的事情,就不需要这么复杂。但如果涉及复杂任务,需要流程化,就要按工程的方向做。做内容设计、做小红书、做播客,或者做其他事情,都要把它变成这个样子。
我刚才突然想到,字节不是出了 Seedance 吗?我春节一直在玩。我给它同一个 prompt,生成出来的东西每次都不一样。
庄明浩
那就是你的 prompt 太宽了。还是刚才差值的例子,你给它 1 到 10000 的差值,它做出来可能是 2000,也可能是 8000、5000,甚至是 2。
你看,尤其是那一波图像和视频生成模型,虽然模型本身越来越强,但你会发现,那一波最厉害的人给模型的提示词也越来越长。
我的提示词已经很长了,甚至已经满了,不能再超过 1000 字。我还让 Claude 帮我做分镜,但每次生成的视频还是完全不一样,差别很大。
庄明浩
这涉及可控性、对文字的理解、对镜头的理解等各种问题。虽然这些能力正在慢慢内化到模型内部,但依然需要外部更多输入。
但时代一直在发展。再过 3 年,甚至不用 3 年,可能 3 个月,影视行业就会受到重创。
庄明浩
这一波 Seedance,大家讨论最多的就是它理解分镜。为什么它能理解?逻辑其实很简单。
抖音已经上线十多年了。抖音让视频创作者使用抖音和剪映,拍出一段原始素材,把几段原始素材剪在一起,剪掉什么、保留什么、转场怎么设计。剪映最核心的功能,最开始不就是转场吗?
当然,它知道这些东西,和最后真正做出来并不是一回事。但无论是时间还是其他原因,它做出来了,就代表它在这件事情上确实比很多厂商理解得更深。
所以这一波大家为什么会觉得 Seedance 很惊奇?虽然一致性和画面效果已经很强,但最让人觉得“哇”的地方,还是分镜处理。因为它原来就理解这些东西。
你自己玩吗?
庄明浩
我不太玩,也不太懂。
前两天不是还看到一个新闻,说 Claude 出了一个功能,60 秒搬空 ChatGPT?我当时就在想,怎么能这样?门槛在哪里?搬得这么容易吗?
庄明浩
其实和刚才讲的一样,你可以直接跟模型说。
所以我的意思是,GPT 难道没有想到这一点吗?
庄明浩
也不是没有想到。模型发布出来之后,本来就是这样运转的。它记住这些东西,然后不断和你交互。
你和所有大模型聊天,它都知道你大概做什么工作、是什么性格。那它怎么知道?它当然有地方记着。你现在说“把你记住的东西拿出来”,理论上那段提示词就是在做这件事情。
但我原来以为它们有防火墙,至少这样的话,Gemini 也能搬吧?
庄明浩
理论上都可以。只是搬出来之后,能用成什么样,还是不一样。
那为什么新闻说的是搬走 ChatGPT,不是搬走 Gemini?
庄明浩
因为最近美国出了些状况,五角大楼和 Anthropic 闹翻了,OpenAI 马上把这个事情接了过去。美国民众就觉得 OpenAI 不可信。
所以这一周末,美国那边的 AI 榜单上,Claude 马上变成第一,大家都在下载 Claude。
美国人民的诉求还是很朴素的:你在乱搞,还和特朗普搞这些乱七八糟的,我就不喜欢你,那我就换。
庄明浩
但换的问题在于,GPT 在记忆这一层,尤其是人与人沟通这一层,确实做得比较强。
GPT 过去一年多在产品端最大的赌注,或者说 OpenAI 在 ChatGPT 这个产品上押注的东西,就是 ChatGPT 通过和你频繁沟通、聊天,记住你的偏好、性格、要求,甚至包括谄媚。这些东西是它的护城河,是它和其他产品建立区隔并保证留存的方式。
但今天有一波用户说一定要离开你,那这个东西就变得重要了。只是上周末是一个特殊原因导致的。
那说一下国内。春节期间我看他们还下单买奶茶什么的,但等我看到新闻时奶茶已经没了。国内这帮人在玩什么?
庄明浩
抢用户,还是很互联网思维,大厂就是这样。春节这场战争,从结果来看没有任何意外:第一还是第一,第二还是第二,第三还是第三,曲线也没有什么变化,可能只是出现了一个波峰,然后又掉下来。
但春节就是特殊,中国市场也很特殊。这就是囚徒困境:别人做了,你就得做。虽然大家都知道做起来可能没有什么用,但还是必须做。
说到国内我就很好奇。国内不是有“六小龙”吗?它们到底在比什么?差异化是什么?
庄明浩
9. 中国模型走向大融合
国内现在可能也就剩四五家了。百川和零一万物已经不太碰纯模型的事情,逐渐远离这个主战场。剩下的几家,再加上 DeepSeek,算是几家主要公司。
你要说目标,其实都一样,还是在追求最通用模型、最尖的那个东西。只不过每家追的方式、押注的方向不太一样。
智谱去年开始押注 coding,Kimi 在押注 Agent,MiniMax 一直在押注多模态。
但今天你会发现,2025 年还可以这么区分,到了 2026 年,大家押注的其实是一件事情。因为所有的桌子已经变成一桌:coding、多模态、语言、Agent 都在一张桌子上,所有人的目标变成了大融合。
这也和最近大家讨论千问创始团队变化的事情有关。
原来大家谈论大模型,语言模型是一桌:ChatGPT、Claude,国内的 DeepSeek、豆包,以及几家初创公司,本质上做的是语言和对话。
另外一桌是多模态,包括图像、语音和视频,做事方式和东西都不一样。底层原理可能相同,但大家过去认为它们是两桌。
比如今天你对 Gemini 说:“帮我生成一张关于‘2028 末世论’这篇文章的信息图。”你不给它网页链接和文字,只给它这个要求。它首先要搜索并找到文章,然后理解文章内容、总结归纳,最后做成图并产出结果。
这就意味着它要把语言理解和图片生成放到一起,而不是单纯画一张图。
今天这个时间点,头部厂商追求的就是多模态。你看 Kimi 最新的模型,再看原来几家中国公司,尤其初创大模型公司,过去几乎不碰多模态。早年的 Kimi、智谱都没有图片。
我之前也特别好奇,为什么不做?是因为门槛很高吗?
庄明浩
原来它们是分开的,两桌的实现路径和要求不太一样。但后来你会发现,它们开始合在一起。
今年春节 Kimi 发布 2.5,第一次支持多模态,智谱也开始做。DeepSeek V4 截止到我们录制时还没有发布,但大家猜测它最大的变化,除了 Agent 能力之外,也可能是支持多模态。
于是所有人都到了同一张桌子上。
文字本身也是一种模态,不是一个独立的东西。今天我们讲千问,林俊杰在年初的表态是,如果他还在负责,千问大模型今年的目标是“三进三出”:文字、图片、视频都可以输入,不区分你是什么;文字、图片、视频都可以输出,一个模型全部搞定,而不是像原来一样区分文字模型和图片模型。
要做到这个目标,就需要把所有东西放进来,训练方式和后训练方式也要一起做。但今天阿里云的组织架构,是把所有事情拆开:预训练团队是预训练团队,模型团队是模型团队,后训练团队是后训练团队,多模态团队还分语言、视频和图片。
组织架构的设计,和它想要实现的事情之间是对立的,所以才会出现今天这些问题。
你说谁对谁错?没有谁对谁错,因为这件事情本身就在动态变化。
MiniMax 一开始就是做多模态的。我就是好奇,做多模态是不是难度很高?为什么大家一开始不多做?
庄明浩
MiniMax 刚刚发布了今年的财报,它今年的目标也一样,是把东西放到一起。
原来它们是分开的:MiniMax 2.5 是 Agent 和语言模型,还有视频模型、独立的语音模型,以及对应的海螺产品。但今年它们也想把这些能力归拢到一起。
我突然想到,Gemini 生图时不是有 Nano Banana 吗?它最开始是不是也分开,后来才合在一起?
庄明浩
它最强的地方,不是单纯画一张图,而是理解背后的逻辑,把知识理解和搜索融进了模型,而不是分开处理。
最开始出现最多的案例,是让模型把你的照片放到某个地方。比如你让它把自己的照片放到希腊最有名的海边小镇。
按原来的视觉模型能力,你需要把希腊那个小镇的照片,以及你自己的照片都给它,让它把两张照片拼在一起。但今天你只要把自己的照片交给它,然后告诉它“把我放到那个地方”,这就代表它知道那个地方在哪里,也知道那个地方是什么样子,然后才能把你画进去。
这已经不单纯是画一张图了。
技术发展这么快,那 AGI 哪一天能实现?
庄明浩
不知道,没人知道。现在连 AGI 的标准都没有定论。什么叫实现 AGI?有人会说,它要有自己的脑子。那没准它现在已经有了,谁知道呢?
评判标准本身也是问题。有一种标准是:如果我们把提供给大模型的所有基础数据截断在 1911 年、爱因斯坦发表相对论之前,模型能不能自己推导出相对论?如果可以,理论上至少说明它拥有了人类大脑的某些能力。
但问题是,没准它今天已经可以了,可我们没有办法只给它截至那个时间点的数据。包括怎么实现这条边界,你还需要给它引导。最后到底是你给了它引导,还是给了它数据,还是给了它其他东西,才出现了这个结果?你也不知道。
还有人用“解决人类 90% 的工作”来计算,但这个数字也非常难定义。什么叫 90% 的场景?场景是无数个的。所以到今天,这些事情依然没有定论。
我突然有点好奇。现在不是很多人说模型之战其实是国战,是中美两国之间的战争吗?那中美现在最大的差异在哪里?美国除了有更多的钱,还有什么?
庄明浩
10. 中美 AI 竞争分化
美国的状态是,它仍然拥有世界上最好的人和工程师,钱也有整个金融系统支撑。因为这件事情确实需要太多钱,钱最后可能会演化成能源、电力、太空等各种东西。整个体系也支持创新。
但美国的问题在于,它可能只有这一件事。如果美国在这场竞争中输了,那不就完了吗?它没有其他可以依靠的东西。
中国相对还好,至少还有很强的制造业。为什么具身智能这一波中国发展得明显比美国更好,也有很多历史原因。比如上一代政策引导电动车,电动车很多零部件的能力可以赋能到具身智能。具身智能这一波又因为 AI 大模型兴起,到了一个新的阶段,再加上中国消费市场足够广阔。
中国这一波有很多带引号的议题,你很容易炒作一个主题,因为主题特别多。不仅仅是人工智能,甚至偏软件的人工智能,在所有这些主题里反而是相对偏厚的一个,不是最核心的主题。
但美国可能只有这一个主题,没有其他主题了。
但我觉得具身智能这一波挺傻的,没有什么 C 端场景,也不在乎 C 端。
庄明浩
有人在年底总结 PPT 时说过,我们无论主动、被动还是意外,已经找到了一种中国特色的、由金融市场支撑科技创新的路径。
你看芯片的几家公司,马上要上市的具身智能和商业航天公司,都是一样的逻辑。单纯从收入和用户覆盖角度看,它们还非常早期,但因为有政策等各种因素,可以在很短时间内得到足够多的支持,包括金融市场、资金和政策上的支持,把它们推到一个可能本来不应该属于它们的状态。
你说这是好是坏,也没有明确结论。但你会发现,这套叙事已经变成了一种 SOP。大家为什么关注“十五五”规划里提到的关键词,A 股为什么买单这么多方向,都是这个逻辑。
我之前还挺意外的。现在不是说美国也有一些机构在看中国的 AI 吗?这样不会有信息泄露之类的问题吗?
庄明浩
这个事情往根上刨,没有底。AI 模型公司拿的是美元,那怎么办?这个问题刨到底就没有办法了,因为它不是 0 和 1 的问题,中间有太多不同的度。
所以我刚才才说,在中国市场那些议题里,偏软件的人工智能,尤其大模型这一波,其实是偏后的。为什么智谱没有在 A 股上市?它肯定努力过,因为它的背景也很适合 A 股。但为什么最后还是只能去港股,这也是原因之一。
那你觉得下一步是什么?
庄明浩
脑机接口。
这个应该也炒了很久了吧?
庄明浩
但应用还少。要看什么时候这些公司能被推上去。我觉得这就像排队:优先排的是国产芯片,现在排的是具身智能,后面是商业航天。
现在不是很多都是套壳吗?我其实一直不理解,套壳到底是什么意思?
庄明浩
套壳就是套一个 API。壳的作用,是让用户更简单、更容易地体验到 AI 的技术能力。这个一直都有价值,只是价值会变大、变小,会在不同周期出现变化。
但套壳本身更容易被模仿,核心竞争力也更少。问题是,到底什么样的创新叫技术创新?只有最底层、最原始的创新才算吗?并不是。
“套壳”这个概念其实太宽了。狭义上,套壳的意义确实有限,也有一个周期性的窗口期。但广义上,套壳就变得非常宽,很难解释清楚。
直白一点说,ChatGPT 本身就是 GPT-3.5 的套壳。GPT-3.5 是一个模型,但模型对用户而言不能直接使用。你直接用模型,能不能在外面加一层?那一层可能是交互 UI,是一种体验方式,是一种流程设置,甚至包括复杂的账号、权限、安全和隐私管理,这些不都是壳吗?
我突然好奇,MiniMax 和智谱已经上市了,剩下的公司不上,是因为也在准备上市,还是马上就要上?
庄明浩
Kimi 不着急。好处很简单,我最近在写新的 PPT。MiniMax 和智谱的股价是虚的,大家都知道,所有人都知道。但它们的暴涨,会让 Kimi 的估值也得到提升。
Kimi 融到的钱是真金白银的钱,MiniMax 和智谱股价涨跌,对它们的公司现金流没有影响。
我懂了。MiniMax 和智谱涨了,Kimi 就可以涨价。
庄明浩
对。
所以 AI 的瓶颈主要是算力,至少现阶段是这样?
庄明浩
从用户端而言,可能是算力;但对于这些公司而言,可能是数据。算法、数据、算力,这三件事情都重要。
算法层面,按照刚才我们聊的纯底层技术创新来讲,这件事情没有那么容易。你可以说,从 GPT 发布到今天,算法层面几乎没有特别大的创新,都是一些边缘性的、小的创新。纯底层从 0 到 1 的创新很难。
现在很多公司在想能不能出现新的算法创新,但这是一个不可知的事情,不知道什么时候会发生。所以算法层面,对于已经成熟的公司来说,手头要做的还是基于现有算法进行改进和优化。
算力层面,现实中会受到很多物理因素影响,无论是电力、芯片本身的大小、运算单元的数量,还是生产周期、建设、土地等一系列问题。中国还要再加一个因素,就是中美限制。
大家原来会认为算力阶段性够用了,但这几年经历了一个类似摩尔定律的状态。摩尔定律是每 18 个月芯片能力翻一番,但同时,软件也会把这些能力消耗掉,因为软件会变得越来越复杂。
AI 也是一样。原来大家会觉得模型在变便宜,算力看起来也在变便宜,但不断出现的新东西又会把这些算力吃掉。OpenClaw 这一波尤其明显:大家都非常缺算力,因为让 AI 跑一个复杂的东西,尤其是让它执行原来为人类设计的任务,本身就要消耗很多算力。
这些东西一旦起量,尤其是初创公司,算力马上就不够用。智谱发布 GLM-5 之后,coding 能力确实很强,再加上 OpenClaw 出现,大家都想接入。你会发现,智谱卖 VIP 的时候都开始限量,因为卖出去之后就可能要给用户停服。它不是不想卖,而是算力不够,不能敞开卖。
所以现在还有人卖 AI 公开课,最后发现服务不了那么多用户,只能退款。
那是不是因为这一波 OpenClaw 带来的变化,是几何量级的算力爆炸增长?
庄明浩
对。初创公司明显能看到这一点。连千问这样的公司都说算力会受影响。
即便是阿里云、字节、腾讯这种公司,如果真的放开,也会有压力。为什么春节期间 Seedance 排队几个小时?现在晚上也会排很久?
你反过来想,真的上手去用的人能有多少?这个量级不会特别恐怖。相对于抖音一天 8 亿用户,它绝对不可能有 1 亿人,可能几十万,撑死了。
但几十万人生成一个视频,就已经能让字节这种体量的公司排队几个小时。每天使用的人数基数并不算特别大,但即便这样,字节这种体量、又不需要上市、不太在乎财报、能买就尽量买算力的公司,也会觉得有压力。
所以算力是一个层面。
数据会带来更广泛的差距。为什么这一轮市场上的模型这么强,为什么其他中国和美国的模型没有那么容易追上?原因是它在广泛意义上的数据上建立了太多优势。
当然,有数据或者说数据好,和做出好模型之间不是等号,不是有了数据就一定能做到。中间还有很多其他因素。但没有数据,肯定做不到。
所以在这个时间点,对于用户而言,算力的紧张感比较明显;但对于模型厂商而言,数据带来的变化和差距会更大。
你比较看好谁?
庄明浩
都挺看好。我还有一个观点:一级和二级市场在某种意义上的回暖,一定会促进这件事情。
你看了这么多创业者,觉得这一批 AI 创业者和之前互联网创业者有什么不同吗?比如更理想主义,或者更极客?
庄明浩
在这个阶段,确实看上去是这样:更年轻、更国际化,或者说第一天想得就更多。
今天 AI 是行业最大的共识,而且这个共识已经持续了很长时间,所以不需要再讨论很多细枝末节的问题。
第二,中美在这个时间点的很多议题和原来完全不一样,政策、监管等各种因素,导致今天对 AI 初创公司创始人的要求变得更复杂、更多样。
所以创始人的画像也不太一样。和上一代互联网创业者,甚至和消费行业的创业者相比,大家更偏技术出身,尤其是科研出身。当然中间也有很多坑。
大家可能会更希望第一天就国际化,但国际化也不是 0 和 1 的问题,也分很多程度:到底是在中国服务全球客户,还是第一天就去海外,或者是其他方式,里面有很多不同情况。
更复杂的是,AI 这一波整个行业变化速度太快,导致你不能用原来的时间刻度评判项目。过去可能按半年到一年评估,今天可能要按月、按周评估。
原来的方式是,我给你一笔钱,你做到一个里程碑,然后再融下一笔钱。现在的问题是,我给你钱之后,你可能要试 6 次,甚至 10 次,才可能试出下一个方向,或者要尝试很多功能和调整。
所以项目波峰和波谷之间的变化会特别强烈,和原来按部就班、用相对更长时间评估的方式完全不同。你看,今天投资一个项目时,我们聊的时候它还在做这个,过两天可能已经完全不做这个,改做其他事情了,这太常见了。
那现在 AI 还能投什么?硬件?去年 AI 硬件比较火,AI 基础设施,尤其是美元市场的 AI 基础设施也比较火。
庄明浩
AI 基础设施就是刚才你说的底层那些东西。今年还不知道,谁知道呢?今年肯定会出现 OpenClaw 带来的新机会。
其实也没有什么全新的机会,还是 Agent 这条主叙事的延续,只不过大家看到了更多机会,或者说打开了一扇窗。
庄明浩
对。原来 Orange 讲过一个观点,虽然听起来有点糙,但逻辑是对的:去年 Manus 火起来是在 4 月还是 5 月,但 Manus 像 iOS,是一个封闭体系;OpenClaw 更像安卓,是开源的,可以基于它的生态做更多事情,理论上谁都能做。
所以它打开了一扇窗。大家为什么兴奋、为什么讨论这么多,甚至讨论已经不局限于软件本身,也是因为这个原因。
我还挺好奇的。现在很多人会用 OpenClaw 爬各种信息、论文,但里面可能有很多噪音,怎么鉴别?
庄明浩
在 OpenClaw 之前不也一样吗?你用大模型搜索和查找东西,也会遇到幻觉和各种问题。
所以今天还是那个观点:模型很强,但它的强一定有局限。你希望得到的东西越明确、越清楚,理论上它就越可能给出好的结果。
最终还是回到提示词,以及你能力边界的问题。
很多人都说,好像所有事情都值得用 AI 重新做一遍。你怎么看?
庄明浩
11. AI 重做一切仍然困难
值得,但过程中有太多问题。你不能把这句话当成尚方宝剑,也不能用它指导具体执行。
比如我们公司做游戏和社交。大家原来都认为,或者说历史上已经无数次证明,新的科学技术爆发,大概率会优先在娱乐行业得到验证。这个结论没有太大问题。
AI 这波看上去应该也是这样。但“AI 重新做一遍”这句话,最多只是让大家开始这件事情的原因。具体怎么做、做到什么程度、阶段性得到什么结果、选择哪条路,都是一团麻。
甚至可能三年之后,大家发现所有人都错了,推倒重来,也有可能。
很多行业都经历过类似过程。一个行业存在了这么长时间,变成今天这个样子,当然有很多问题,大家也都知道。但它能够存在,就一定有原因,不是没有人看到问题、也没有人解决问题。
新的东西到来,确实可能在某些环节对它产生影响、促进或改变。但到底怎么用、用到什么程度、用成什么样子,阶段性追求什么结果,过程中要不要犹豫和纠结,都是问题。
现在有做 AI 游戏的吗?
庄明浩
无数公司都在做,大公司、小公司都在做。
有做得好的吗?
庄明浩
这就涉及“好”的标准。用户量很大?那不行,那是移动互联网时代的指标,不能拿来衡量 AI 时代。
那现在看什么?
庄明浩
不知道,连看什么都不知道。
从结论来说,优先能看到的,可能是 AI 带来的降本增效能力,这个是可以衡量的。但一旦进入这个议题,就会发现它不性感了。
不过不性感也可能是好事。你的 ROI 算得过来,实施路径比较清楚,不需要特别有意注意。但大家当然希望那个理想的东西出现。
问题是,理想的东西一定不是凭空出现的。它一定来自各种各样的人做了各种努力和拓展,包括底层技术提升、环境变化、竞争等多个因素,最后在某个节点突然出现一个结果。
你不能因为期待那个结果,就不做前面的事情。但问题是,做前面的事情的人很可能最后全都成了炮灰。那该怎么看呢?
你现在看到什么特别好玩的项目?
庄明浩
也谈不上好玩。大家都在做刚才说的那些事情,尤其是游戏和社交板块。从去年年底开始,有一堆公司在游戏领域尝试做 AI 生成游戏。
“AI 生成游戏”听起来是一个特别大的概念,最后要把它收敛成:用 AI 的什么能力,生成什么样、什么类型、什么体量的游戏。你要给它加限定词。
这些限定词加到一定程度之后,你发现这个东西可以做了,于是有些公司开始做,也确实做出了一些东西。因为加了足够多的限定词,它做出来的东西看上去是可以的,能够完成被限定的任务。
但做完之后你又会发现,哪怕东西做得不错,因为加了太多限定词,你还是会觉得它不够性感。
不过它就是在一步一步扩张、收敛,再扩张、再收敛的过程中,慢慢打开边界。
如果拿 AI 做游戏,它烧 token,和用人工做,成本有什么区别?
庄明浩
这是另外一个问题。就像自动驾驶一样,美国为什么推进得好?因为美国司机贵。中国为什么会有阻力?因为中国司机便宜。
《黑神话:悟空》这种游戏,我以前一直不知道它到底牛在哪里,是叙事,还是画面?这些 AI 理论上都可以做。
庄明浩
就跟你做 PPT 一样。PPT 还需要手工做,但你做得很好看。那它的好看来自哪里?是结构清晰、颜色、配色和视觉表达。
反过来讲,你对它的所有描述,理论上都可以交给 AI。你让它做商务风、淡色系、可视化信息图,理论上都可以告诉它。而且它已经理解这些词背后的含义。
今天的图片生成模型已经完全可以理解这些要求。但这句话只敢在一段时间内这么说,因为能力水位还在不断上升。现在明显已经到脖子的位置了,基本上,除非是我们这种吹毛求疵的要求,大部分场景已经不太需要人工。
但《黑神话:悟空》是游戏领域尖端的、流水线式工程化的体现,它要求所有事情都做到 99 分,95 分都不行。它的体系里,某些模块可能 95 分够用,模型目前可能到了 80 分,加一点人工也能达到,但在最核心的地方还没有办法。
不过要求 99 分的厂商会越来越少,大部分场景其实不需要。
PPT 就是典型。你现在拿什么做 PPT?
庄明浩
我自己用 Canva。现在 AI 太强了。
我之前记得有人给我推荐过一个专门做 PPT 的网站,名字想不起来了。我以为你也是用那个,做出来挺漂亮的。
庄明浩
这就又回到审美。做一个网站、一个 PPT、一张小红书题图,或者其他可视化的东西,什么叫好看?
前两天我看到一个很有意思的报告。如果你有兴趣,我可以发给你。它是一家设计咨询公司,调查了十几家头部 AI 公司的官网、报告、产品和 UI 界面,然后归纳出几条 AI 时代的设计风格。
我觉得写得很好。比如淡色系、手绘风、赛博朋克风格。你还是可以归纳出一些关键词。但这些东西一旦被归纳出来,理论上就可以让 AI 遵循这些原则去做,它就会越来越偏向某种审美和偏好。
那比如 2026 年,普通人想抓住 AI,还能做什么?继续买英伟达?
庄明浩
英伟达不知道。英伟达在 160 到 180 美元之间已经横了四五个月了吧?
我的意思是,算力之后可能还是会涨,但问题是……
庄明浩
我在 PPT 里也讲了:算力需求增长是明确的,头部科技公司的开 P S 投入也是明确的,这代表英伟达的收入预期明确。
结果就变成,它为什么这几个月横盘?因为所有事情只要被明确,就不会有意外。股票市场讲预期,它的预期已经打到这里了。没有意外,就不会有大的波动。
收入会涨,利润会涨,但今天我已经可以算出未来几年,因为头部科技公司的每年投入已经被市场预期到了,它的订单也可以被算出来。这些事情不再意外,不意外就会被提前反映,提前反映之后就稳定了。
那什么是意外?
所以你看,从去年第四季度开始,大家开始炒存储,因为存储是意外。今年年初开始炒 TOTO,这就很搞笑了。TOTO 是做马桶的,为什么会被炒?因为它的陶瓷,是 AI 数据中心芯片载板最重要的材料之一。
如果大家看到视频,可以想象一下我的表情。
庄明浩
对,就是这种表情。谁能想到呢?
还有一家日本公司味之精,做味精的,也是类似逻辑。
是有人偷偷发了 PR 稿吧?
庄明浩
不是,是真的被炒起来了。上哪儿说理去?没有地方说理。
那你给普通人的建议是什么?如果想抓住 AI,有什么建议?
庄明浩
没有建议。
怎么会没有建议?
庄明浩
大家搞个小龙虾什么的,也不要。没必要。再等一段时间,肯定会有更傻瓜的方式。
那我也不弄了。
庄明浩
不需要。你在线体验一下,点一下、试一试,感受一下就行。
重要的还是刚才那个问题:提问题的能力、做程序规划的能力、拆解任务的能力。但这些话有时候都是正确的废话。
我不是一直和 Gemini 聊天吗?我对自己其实也不太了解,但在聊天过程中,我越来越了解自己。提问题的能力也会进步,你可以不断反问它,然后它再回答你,慢慢地自己也会进步。
庄明浩
还有一个问题,就是你要时刻记住,不要把它当成菩萨。
你要把它当成一个工作台。你是要工作的,工作过程需要步骤和流程。每一步都应该有上一步的产出,交付给下一步。你要尽可能让它在某些环节帮你提升效率、改进工作,或者拓展一些东西。
这个方式在现阶段看起来是可操作的。
更直白一点,之前我们不是说过吗?你想想自己一周要做什么事情,重复超过 5 遍的事情,随便什么都可以,健身、吃饭、记录卡路里,都可以。你看看能不能让 AI 在某些环节帮你提升效率。
如果你找不到具体要做什么,也不用强迫自己学一个新东西。东亚文化里尤其容易这样,大家总觉得必须马上学会什么。其实没必要。你可以把手头现有的事情,无论工作、生活还是娱乐,交给它改进。
我看到有人学日语,就让 GPT 帮他想办法更快记住这些语言。你想,它叫大语言模型,语言本来就是它最擅长的东西。
你甚至可以让它帮你做一个小程序,每天打卡。多邻国做的事情,它理论上也可以做。当然,你也可以直接用多邻国。
我刚才想到,你说仲卿和汉阳早上那个播客我没听,但我听了仲卿前前段时间那个播客,就是讲他在用那个。我觉得讲得特别好,特别接近普通人面对这些东西的真实情况,和媒体上的渲染完全不一样。
我听的时候都快笑疯了,他一直在骂人。但我一直在想,为什么会这样?我也看到很多人在小红书上说:“GPT,用 GPT 解释一下。”他们用得不是很顺利吗?是不是他用得不对?
庄明浩
还是那个观点:所有被做出来的教程,理论上只是给你画了一条从 A 到 B 的路。
即使它把过程拆成 10 段、20 段,教程也永远只展示从 A 到 B 的这一条路。但你从对事情完全陌生,到真正走完这条路,可能有一万种情况。过程中每一个环节都可能出现岔路,你一偏就走飞了。
我也在想,这里面有没有运气的问题?比如你碰到一个 bug,别人没碰到,你不知道怎么解决,只能从头再来。
庄明浩
对,确实有运气的问题。
你遇到的问题,可能不是软件错误,甚至可能是因为你原来的经验让你觉得应该选择某个选项,于是你就走偏了。
所以他就是个倒霉鬼。
庄明浩
我听的时候也在想,身边有人安装,整个过程都很顺利。有时候不是错误,而是你过去的经验让你做了一个选择,然后就偏了。
还有一个问题,token 成本不是一直在下降吗?如果最后成本降下来,所有人都可以用 AI,那人与人的差别在哪里?
庄明浩
这是个好问题。
首先,要实现那个目标,你有没有想过,需要在现有基础设施上增加多少倍投入?我随便拍脑袋,可能 1 万倍。
大家会觉得增加 10 倍、100 倍应该还不够,可能至少是 1000 倍、1 万倍,甚至更大。
但问题在于,现有投入的量级已经接近人类很多事情的极限,无论是物理极限还是资金极限。要达到那个状态,应该怎么做?100 年以后?不知道。
等到了之后再说。到了之后会怎么样,谁知道呢?
你看过《Her》吗?我只看过一个片段。你觉得未来会实现吗?
庄明浩
应该会,我也觉得一定会。
我有时候和 Gemini 聊多了,会觉得这个世界上没有任何人像它那么懂我。
庄明浩
对。但也有很多人会害怕,这也没有办法。
那人与人之间最后会怎么样?还是要回到 AI 社交的问题:AI 到底在社交里承担什么角色?
很简单,我们把刚才的话题展开:大家都会说,社交应该被 AI 重新做一遍。那怎么做?
把社区先抛开。社区和社交不一样,社区是内容,大家刷小红书、微博和社交媒体;社交就是人与人之间的沟通,核心是关系,是关系链。
没有 AI 的时候很简单,就是人与人的关系链。大家通过什么建立关系链,建立之后做什么,以及做完之后怎么产生收入。原来的社交产品,无论大到微信,小到陌陌,基本都在做这几件事:怎么建立社交关系,建立之后做什么,通过做什么赚钱。
但 AI 出现之后,事情变复杂了。它可能是人和 AI、人和 AI 和人、人和 AI 和 AI 和人,甚至 AI 和 AI。
哪怕简单列举,也有好几种关系结构。这还只是一对一,如果是多对多的网络结构,事情就更复杂。每一种关系结构,都代表产品端设计不同。你不太可能在一个产品里满足所有关系,所以你要选择一种来设计产品。
那 AI 在中间承担什么角色?就像刚才说的分身,它到底应该像你、像我,还是完全不像你,而是你理想中希望它变成的样子?它应该是你的一个侧面,还是某种程度上的另一个你?
这个选择,又代表不同用户对产品的认知。一个做交友的产品、一个做乙女游戏的产品、一个做工作的产品,对 AI 的期待肯定不一样。
选择完之后还要继续往下做:关系建立之后做什么?聊天、一起打游戏、一起玩狼人杀,还是每天帮你叫起床、定闹钟,或者帮你评论朋友圈?又或者你们坐在那里点一堆火、仰望星空?
我刚才讲的所有功能,都已经有产品在做,连仰望星空都有。
好浪漫。
庄明浩
但你一听就会发现,前面已经做了三四次选择。每一次选择,都相当于抛掉了一些东西。最后选出来的那个产品,一定会变成一个相对小的东西。
小没有什么不好,但大家会问:这不是我想要的那个“大东西”。那大东西到底是什么?没人知道。
反正听完之后的建议,就是大家不用那么焦虑,也不用着急下载,等技术再发展一段时间。
庄明浩
我去年在播客大会上做 PPT,最后一页写的是:“去他妈的什么 AI 不 AI,根本不重要。”
去年 4 月那届播客节,一共有 110 场,接近 20 场和 AI 有关,大概占五分之一到六分之一,比例非常高。到年底那一场,场次增加到 161 场,但 AI 相关的可能只有 11 到 12 场,从比例上看降了一半。
大家在这个时间点需要去体验生活中的其他事情,远离媒体每天炒作的喧嚣、改变世界之类的叙事,还有一个原因是,谈论很多 AI 话题时,不管是偏严肃的技术话题,还是产业投资话题,最后都不可避免地会走到身心灵。
为什么?因为这波技术浪潮对行业、社会和人类的影响,大家真的不知道。人类面对这种东西,天然会去寻找那些带引号的、更重要的事情。我觉得这很合理,造物主把人类造出来,本来就是这样。
面对这种事情,大家会去寻找更重要的东西。我虽然每天都在卷、都在研究这些事情,但所有讨论到最后都会走到那里。
最后一个问题。如果给正在焦虑的年轻人一个建议:如果 AI 未来能够胜任我们所有标准化的任务,我们最应该投资自己哪方面的能力?提问能力、逻辑思维、拆解任务的能力、想象力?
庄明浩
想象力,品位和审美。就这些了。
那天春熙不是还火了一篇文章,讲影视行业怎么看 Seedance 吗?
庄明浩
我没看。
那篇文章其实大部分是用 AI 写的,明显能感觉到 AI 味很重,但逻辑没有错。
庄明浩
你怎么感受到 AI 味?
就是手感。
庄明浩
对,看得多了就知道。
首先,它通常会很长,现在这种文章天然就会很长。第二,它的段落和大结构特别清楚。再加上一些“不是……而是……”之类的关键词一出现,你就会觉得:一定是 AI 写的。
庄明浩
但他确实不是单纯给 AI 一个主题就让它写。他一定设计了很多东西,然后才让它写。
他最后讲的逻辑是,影视行业未来最重要的人,可能是这样的人:当算力成本无限降低、模拟能力无限增强之后,你可以让 AI 瞬间生成 5000 个结果,然后从 5000 个结果里挑出一个,说“就是这个”。
为什么选它?没有什么明确理由。但你就是凭直觉、审美和经验,在所有东西的最后一步做出选择。可能那就是人类最后的一点价值。
但我一直觉得,审美本来就包含一个人的世界观和价值观。你还需要享受过很多好的东西,看过很多极美的东西,才会有审美。
庄明浩
对,那就是积累。
那现在就开始积累这些东西。你觉得 AI 这一步会对未来的小孩带来什么影响?
庄明浩
不知道。你看,我参与过无数讨论,要么是身心灵,要么是教育,避不开这两个话题。
没有人知道。但这恰恰是当下最焦虑的事情。公众号只要写“某个大拿、某个领域头部人物如何教育孩子”,点击量一定比普通文章高。
但其实没有结论。你设身处地地抛开感性,用一个相对冷静、甚至冷酷的角度想,这种问题现在可能有什么结论吗?不可能。
我在想,老师未来应该会失业吧?
庄明浩
老师不会失业,但老师做的事情、角色和工作方式可能发生变化。工种未必消失,但工作内容、工作状态和工作方式会变。
那程序员不应该失业吧?OpenClaw 出来之后,我问了一些程序员朋友,他们都很傲娇,说做出来的东西都不能用,说程序员还是很有价值,不会那么快被替代。
庄明浩
前两天极客公园一个微信公众号大 V 魏琪讲过一个观点,我建议大家今天回头去看 9 年前 Netflix 拍的《AlphaGo》纪录片,就是当年 AlphaGo 战胜李世石的过程。
他说,9 年前我们看这个故事时没有什么感知,只觉得那是一件很神奇的事情。但今天我们都是局中人,再回头看,感受会特别明显。
AlphaGo 和李世石对战之前,团队找过一个职业棋手樊麾来测试 AlphaGo。樊麾当时是欧洲冠军,但在围棋领域,欧洲冠军是中韩棋手根本看不上的水平。不过他至少是职业棋手。
樊麾经历的过程,和后来李世石经历的过程几乎一样。刚开始大家会蔑视、轻视,第一盘下完觉得是自己失误,是心态问题,没有什么大不了。第二盘开始产生疑问,道心出现动摇。到第三局,道心就被打碎了,开始怀疑自己,怀疑过去在这件事情上的经验、认知和理解。
李世石和 AlphaGo 一共下了 5 局。第一局下完,他也觉得是自己没有下好。第二局过程中,AlphaGo 下出了一步类似“神之一手”的棋,可能在几十手之后,李世石觉得不太对,于是出去抽烟,让自己休息一下。
樊麾在旁边看,他已经知道李世石进入了自己经历过的第二个阶段。李世石出去之后,负责摆棋子的博士把那一步棋摆了下去。
那步棋一下,所有直播间里的专业棋手都开始说 AI 在乱下,怎么能这么下,甚至开始嘲笑。李世石抽完烟回来,第一反应也觉得可笑。但越下,他越开始觉得不对。
那一步棋其实突破了人类原来的极限。第二局李世石输得一塌糊涂,而且赛制是五局三胜,他已经 0 比 2 落后。
第三局时,你可以理解为李世石已经接近崩溃了。他开始怀疑,所以第三局输得非常快。
樊麾在旁边看,特别能理解他的状态。樊麾当时下棋时,没有全世界的人盯着他,他只是自己知道发生了什么;但李世石面对的是全世界。所有人一起经历了从轻视、蔑视,到顶点,再到突然不理解、怀疑,最后崩溃的过程。
第三局结束后,樊麾特别担心、体谅和理解李世石。比赛之前,樊麾就判断 AI 应该会赢,但真正经历这个过程,还是完全不同。
第四局,李世石在中后盘第七十几手下了一步棋。他后来总结说,那是直觉,不是基于原来任何明确的判断,只是觉得应该这么下。那一步导致 AlphaGo 在当时的算法下出现混乱,判断发生了错误。
你可以想象当时李世石有多紧张。他似乎又觉得自己可能有机会赢,但又担心心态变化让眼前的一点优势最终还是消失。如果那局也输了,就彻底结束了。
所以他非常谨慎地把后面的棋下完,AlphaGo 最终输掉了那一局。
第五局其实已经不重要了,但第四局让李世石从崩溃的碎片里重新建立起信心。后来那几年,他几乎杀穿了整个棋界,像无敌一样。
但反过来讲,那是人类最后一次在单局比赛中战胜 AlphaGo。后来出现了 AlphaGo Zero,直接跳到了另一个台阶,人类就再也不可能战胜它了。
你会发现,我们似乎也在经历类似的过程,只是没有像那场比赛一样,在 4 天里按一天一天的节奏、清清楚楚地走完每一步。
所以魏琪建议大家回头看看那部纪录片。樊麾去年上过一期播客,也讲过这件事情,讲得非常生动。你听完会觉得,真的很有冲击力。
但人至少还有直觉,还有某个神性的时刻,还有那一下“神之一手”。
庄明浩
对,就是那一下。樊麾当时看到那一步之后,甚至对着镜头给李世石比了个大拇指。虽然比赛只有 4 天,但他知道人类在这 4 天里经历了什么。
而且全世界都在看着你。那个故事真的很有意思。魏琪讲得特别好:9 年前我们看这个故事没有感觉,但今天大家都以为自己是局中人,所以会特别感受到这种状态。
那以后人类只能去种地了?
庄明浩
种地也不行,种地也会被机器人做。就像今天一些非遗项目一样,最后可能会变成那样。
PPT 以后也是非遗,手工制作 PPT。
庄明浩
那问题是,PPT 值得手工做吗?代码是不是也会变成手工写代码?
笑死了。所以还是得培养一种技能,不管是什么。画画?谁知道呢。
庄明浩
未来这一波画图之后,大家可能又会说画画也会被替代。但我觉得,人还是有那种神性的时刻,还是有灵动感。
我听完之后,最大的感觉反而是:Web3、比特币,再来一点。
庄明浩
今年确实有很多人建立了定投策略,比如比特币跌到多少就买入。
你觉得还有什么可以说的吗?
庄明浩
没什么了吧,看我的 PPT 吧。