[BidClub_]
硅谷101 · · 67 min

E223|应用爆发之年:聊聊模型技术进化与商业化

泓君亓鲁教授吕瀛杰徐栋

Podcast
TL;DR
  • 2025 年的应用爆发不是单一模型突破,而是 reasoning、指令遵循和 tool use 等能力共同进步,跨过了“够用”门槛。 徐栋把转折追溯到 2024 年下半年接近年底的 o1:模型从依赖固定 workflow,走向在充分 context 下自行平衡泛化与准确性;Claude Skills、MCP 等标准又把工具显性化,让 AI 从聊天框进入 SaaS、硬件与生产流程。
  • 视频生成是当前商业闭环最清晰的模态,单位经济已经足以支撑短剧、漫剧和批量广告。 徐栋判断其能力已从“GPT-3.5 到 GPT-4”,AI 短剧合理成本可压到 2 万元以下,15 秒广告生成成本可低于 10—15 元、市场交付价约 25—50 元;Qwen 与万相组成管线后,“五六个人、十个人”一天可生成约 6000 条广告。
  • 企业采购已从验证效果转向精细考核性能、并发和成本,这是模型进入严肃生产的信号。 客户开始分别规定 4K 与 10 万 input 的 TPS、首包延时,智能外呼甚至要求半小时完成 10 万通电话;重复任务和意图理解、抽取则转向小模型,“没必要去跑一个非常大的模型”。
  • 推理成本仍在快速下探,徐栋给出的体感是每半年接近下降一个量级。 稀疏结构、混合精度、MTP、模型与芯片协同,以及云端调度和夜间跑批共同贡献降本;Qwen3-Next 以 80B 参数、3B 激活展示高稀疏比,而端侧 Omni 4B 已让约七成通用交互、语音和视觉理解任务有可能本地完成。
  • 开源并未与商业化对立,Qwen 的路径是用社区覆盖拉动云,再以持续更新、并发和大模型能力出售 API。 “开出那一个刹那,它就是一个离线的版本了”,闭源服务仍可修正问题;Qwen3-Max 因部署成本未开源,而 DeepSeek 的发布反而活跃了开源生态,扩大了 Qwen 从 0.5B 到 235B 的采用面。
  • 应用层的可持续壁垒不是简单套壳,而是专有数据、模型与工作流整合和行业决策能力。 Insta360 用自研模型理解稀缺的 360 度素材,再接通用模型编排,但三分钟全景素材自动剪辑仍需十几元;语义科技的高端家电案例则在一年半后实现销量增长 23%、客单价提高 6% 多,并从单一事业部扩展至集团。
  • Token 量适合衡量当前使用热度,却不足以代表长期商业价值,收入最终可能来自 Agent as a Service。 最小与最大模型的成本、收入可能相差 1000 倍,多模态 token 口径也不统一;模型研发投入并未下降,下一阶段目标是让 agent “连续运行,比如说两个礼拜”,通过环境交互、工具和假设迭代交付完整结果。
Digest · the substance, structured for research

1. 模型能力“够用”后,讨论中心从缺陷转向商业闭环

  • 泓君回看两年前,行业仍在争论大模型为什么难以进入工作生活;如今手机里普遍已有一个或多个 AI 助手,传统企业也开始大规模接入,问题变成技术演进与商业化如何相互推动。

  • 徐栋把阿里的基模分成三条线:Qwen 挑战语言智能和生产工具调用;万相覆盖图片、视频及编辑,近期重点是 2.5 Preview 与 2.6;纯音频模型 Fun-Audio 则覆盖 ASR、TTS、声音克隆、多语言、方言和口音。

  • 他的客户体感也发生变化:制造业、实体品牌和互联网公司仍是主体,但过去一年出现大量 AI native 公司,在碎片化市场里做出了“非常不错的一些 ROI”。

2. 视频生成正在经历自己的“GPT-4 时刻”

  • 徐栋最鲜明的判断是,若类比语言模型从 GPT-3.5 到 GPT-4,视频生成“已经到 GPT-4 的状态”:它不再主要服务特效和娱乐,而开始进入漫剧、短剧与广告等生产环节。

  • 时长是第一条技术轴线:过去常见的 5 秒、10 秒正在进入 15 秒,下一步可能到一分钟;他期待最终从几张图或一句话直接生成三分钟短视频,从根本上改变产品设计体验。

  • 第二条轴线是镜头语言。模型已能在多个镜头间切换并改变光影,把过去需要导演、摄影和美术协作完成的能力,压缩为普通用户可通过提示词调用的“专业影视级”能力。

3. 角色一致性把视频创作从“抽卡”推向可控生产

  • 徐栋把 Sora 2 带来的启发称作角色一致性(character consistency)能力:用户先录一段约 5 秒的自拍视频,转头并说几句话,模型便可能保持人物形象与音色,在后续创作中持续复刻。

  • 泓君追问这是否意味着真人只需短暂出镜,后面便由 AI 运作;徐栋确认,核心改变正是生成内容的可控性提高,“原来我们可能还是依赖于抽卡”,现在可以在输入端加入更多参考。

  • 动漫制作已经从参考图转向参考视频,因为视频包含人物和物体、背景的形态和大小,以及人物音色等更多信息;徐栋相信,这类角色一致性最终会成为视频生成模型的标配。

4. 短剧与广告已经跑出可计算的单位经济

  • 按徐栋的观察,国内短剧市场已超过电影市场,内容生产正从真人拍摄和大量人工编辑,部分迁移至 AI;增长最快的漫剧先以图片微动的动态漫切入,连续叙事和商业化能力都较强。

  • 按 S、A、B 等品质分层,一部 AI 短剧的合理成本可能低于 2 万元,结合投流后有机会打平或实现不错的收入;若追求精品,则仍需追加后期资源,成本与成片品质同步提高。

  • 15 秒广告的 AI 生成成本可控制在 10 元以下或 15 元以下,而合格素材的市场价格约为 25—50 元。由 Qwen 与万相组成管线后,五至十人一天可能产出约 6000 条,再交付 agency、广告主或流量平台。

5. 语言模型的进步变得细碎,却直接决定速度与成本

  • 高质量数据日渐稀缺后,模型公司转向“精工细作”:从不同角度重组数据、调整前后顺序,提高知识学习效率。徐栋认为,corner case 上越来越惊艳的表现,主要来自这种数据工程。

  • 结构则继续稀疏化,并采用 MTP 等多 Token 预测技术。徐栋举例,首包延时未来可能从 2 秒降到 500 毫秒,但取决于上下文长度;TPS 从过去较好的 30—50,提高到 80—100 以上也“很有可能”。

  • 更高速度意味着机器吞吐提升和成本下降;与此同时,团队仍在长期打磨指令遵循、上下文长度、coding 与工具调用,难点不只是会用一个工具,而是“泛化地用工具”、连续调用多个工具并向深处执行。

6. 2025 年的 Agent 爆发由四项能力共同触发

  • 第一项是 reasoning。徐栋把根本转折追溯到 2024 年下半年接近年末的 o1:模型不再只是依赖所谓的概率,而开始表现出一定的逻辑偏好。

  • 第二项是规模增大后的可控性。过去必须用 workflow 固定关键节点、交叉验证模型偏差;如今复杂指令的理解和遵循增强,只要 context 足够准确,模型便可在泛化性与准确性之间自行寻找平衡。

  • 第三、第四项是 tool use 与开放标准。Claude Skills、MCP 等逐步被接受,工具由隐含能力变成可调用接口,模型于是“跳脱了原来的输入输出窗口”,进入 SaaS 流程、生产环节乃至硬件交互。

  • 泓君追问指令遵循是否来自某项独有技术;徐栋的回答更克制:主要仍与数据集和上下文理解有关,“模型训练其实今天已经没有特别多的秘密”,各家都在精耕细作。

7. AI 硬件真正的新意是完成 action,而非多一个识别功能

  • 徐栋指出,ASR、CV 与硬件结合已有十年;这一轮不同之处在于模型更拟人,能够听懂、看懂、回答并执行任务,而不只是识别摄像头、屏幕或麦克风采集的信号。

  • 他以 Qwen App 点咖啡为例:用户用自然语言选择品牌、口味、糖量和送达时间,并完成支付。系统可结合距离、偏好和历史记录推荐卡片;若迁移到眼镜,理想体验不应照搬 App 菜单,而应依赖 memory 主动缩短操作。

  • 泓君把输入理解为眼镜看到菜单或同事饮品、输出理解为语音;徐栋补充说,真正的输出是商业服务打通后的“action”。这也是 AI Phone、AI PC、智能座舱重新定义产品定位的原因。

8. 阿里的商业化分成企业生产力与产品体验两条主线

  • 与云计算由手游逐步扩散到金融、制造不同,徐栋认为大模型从一开始就覆盖全行业,只是渗透率不同;因此商业化不再先按行业划分,而是看模型与企业、模型与产品两种结合方式。

  • 企业内部的价值是围绕结果重做流程,覆盖设计、coding、research、sales 等角色;面向用户的 App、手机、汽车和消费电子,则借模型改变交互方式,进而改变整个产品定位。

  • 对手机与汽车,低延时、本地化和隐私需求推动端云结合。阿里的 Omni 4B 面向算力较强的设备,但仍需处理功耗与发热;徐栋说,这套架构经过约两三年打磨,正在进入“深水区”。

  • 他估计,通用交互以及基础语音、视觉理解“可能七成以上”可由端侧解决;企业还可通过百炼 MaaS 平台与设备和业务连接,并获得高并发、低延时、可观测与管控能力。

9. 客户已从“效果好不好”转向生产级性能采购

  • 最早客户大量构建垂直评测集,首先验证效果;最近半年到一年,关注点明显转向性能和成本。徐栋把这视为模型进入严肃生产环节、效果基本得到验证的标志。

  • 要求也变得极细:客户会分别给出 4K input 与 10 万 input 的 TPS 和首包目标。智能外呼因有效时段集中,可能要求半小时内完成 10 万通电话,模型并发能力因此直接影响业务可行性。

  • 最近三个月,小模型需求尤其突出。重复任务无需调用最大模型,chatbot 或 agent 的第一步意图理解、意图抽取也适合小模型;客户开始要求将闭源数据与基于闭源模型的数据结合,进行 post-training 或 fine-tuning。

10. 推理成本下降来自模型、芯片和云调度的共同作用

  • 徐栋给出的行业体感是,推理成本“基本上都是按照半年快接近一个量级这样一个下降”;这里的一个量级就是约十倍,但并非单靠模型算法实现。

  • 模型侧依赖稀疏结构、混合精度和 MTP,芯片侧依赖与模型的垂直协同;云端还要提高利用率,通过模型切换、按时段调度任务和夜间跑批,避免算力只有 30%—50% 利用率时抬高单位成本。

  • Qwen3-Next 是具体样本:80B 参数、3B 激活,相比此前的 30B-A3B 模型,稀疏比更高;徐栋称开发者已能观察到推理效率、效果和速度的明显变化。

  • 泓君以 Google TPU 的软硬协同作对照,认为阿里拥有云、模型和芯片,结构上形成“三位一体”;徐栋补充,垂直一体化不只是芯片与模型,调度红利同样来自云。

11. 开源是云商业化的获客层,不是免费替代品

  • 徐栋回忆,约在 2023 年 8 月,Qwen 7B 的社区反馈打开了全球格局。开源既吸引已经熟悉模型的顶尖研究者和学生,也让推理框架、推理引擎及端侧部署开发者尽早发现 bad case。

  • Qwen 从 0.5B 延伸至 235B,企业可按场景选择;1.5B、3B 以下模型适合小型部署,32B 是一个“甜点模型”,因为单张显卡即可运行。

  • 开源对阿里云形成正循环,但“开出那一个刹那,它就是一个离线的版本了”。API 可持续修正能力、提供更高并发和易用环境;部署成本很高的 Qwen3-Max 未开源,Qwen3-235B 无法满足的需求也会转向 Max 服务。

  • 泓君问 DeepSeek 是否造成冲击,徐栋的回答相反:它的论文推动技术进步,发布后还活跃了整个开源生态。Qwen 广泛的尺寸跨度及高频更新,使双方更像相互促进。

12. Token 能衡量热度,却不能替代收入与产品价值

  • 徐栋承认 token 是当下观察使用量的好指标,阶段性也可辅助创业估值;长期仍会回归收入,而且收入未必直接来自 token,也可能来自其上封装的 agent。

  • 量纲存在明显缺陷:最小与最大模型的成本和收入可能相差 1000 倍;语音、文本等多模态 token 也缺少统一定义,各家公司口径略有不同。

  • Model as a Service 关注模型更新、API 可用性、realtime 和跑批等能力,类似 Assistants API 向 Responses API 的演进;Agent as a Service 则调用多个模型,封装标准任务结果,Deep Research 就是徐栋给出的代表。

13. 模型研发投入没有退潮,只是突破不再那么显眼

  • 面对“行业是否更关心商业化”的问题,徐栋给出反共识判断:“模型的研发投入反而变大了。”每家公司和实验室都说自己“不够卷”,说明竞争结果仍能被定量衡量。

  • 不同在于,行业较少再出现 o1 推理或 Nano Banana 编辑那样一眼可见的范式变化,更多投入落在数据清洗、评测标准和工程细节上;连过去基于规则的清洗与评价,现在也可由模型执行。

  • 他期待的 agentic 能力,是让模型“连续运行,比如说两个礼拜”,持续与环境交互、自主思考、作判断和假设。tool use、长上下文、复杂指令与 reasoning 拼起来,才可能交付比单纯文本进出更好的研究或业务结果。

  • 泓君概括这是精耕细作、未必属于“智能”跃升;徐栋保留了定义空间:如果智能可以打分,那么这些工程改进同样会让智能分数持续提高。

14. Insta360 的剪辑难题不是拼片段,而是猜中创作意图

  • 齐鲁教授介绍,影石希望把用户一天乃至一年积累的素材,自动剪成愿意分享的成片;云端自动剪辑已经上线,是公司“更好地记录和分享生活”战略中的关键一步。

  • “真正的难点不是把用户的片段能够拼起来,而是能够去命中用户的一个剪辑意图。”有人要纪录片式连续故事,有人只要高光和爽快节奏,还有人更在意配乐情绪、镜头语言与转场风格。

  • 合作分成两层:Qwen 多模态模型负责感知、理解、人物事件判断与结构化编排,万相系列负责视频特效生成。比如筛出滑雪失败瞬间,模型既要理解指令,也要从素材里识别真正的失败动作。

  • 目前语义理解已能满足一定需求,更难的是意图可能根本不在素材中,用户也不知道如何表达。齐鲁教授认同泓君的类比:若必须让用户像“好甲方”一样精确定义从雪橇飞出的画面,体验本身就已经失败。

15. 360 度素材构成影石的专有模型壁垒,也抬高了成本

  • 全景相机坚持“先拍后剪”:拍摄时记录完整 360 度现场,剪辑时再选最佳视角、节奏与运镜;即使场景相对单一,也可加入运镜玩法让素材更生动。相较海量平面素材,通用模型对 360 度素材的理解能力较弱。

  • 影石自研全景多模态模型,先对全景素材进行高光提取,后接通用模型完成平面内容理解与编排;泓君把这部分能力类比为世界模型,齐鲁教授表示认同。

  • 世界模型开发仍依赖真实数据、持续扩展的训练方法及稳定云端算力。CES 展示的 VR 无人机也能产生全景数据,但齐鲁教授特别强调,只有获得用户许可并满足合规要求,数据才会进入模型开发。

  • 商业化瓶颈是成本:为用户处理约三分钟的 360 度素材,当前可能需要十几元。影石希望利用全景素材可压缩率较高的特性,先压缩模型输入和 token 数量,再降低自动剪辑成本。

16. 企业 AI 的终局从省五个人,走向找到可增长的需求

  • 吕英杰介绍,语义科技为雀巢、宝洁、泡泡玛特等消费品牌提供消费者洞察 SaaS。2023 年后流量红利见顶,品牌从单纯买流量转向“流量加消费者思维”,客服对话由此成为可分析的意图数据。

  • 客户直接用通用大模型给原始语料打标,准确率常低于 70%;团队从 2021、2022 年起训练垂直小模型,把信息分成消费者画像、产品与服务反馈,以及企业内部归因。某日化客户的退货判责由六人登记,降至一人复审。

  • 吕英杰不认为 AI 会完全替代客服:经知识库校准后,单点产品问答可以比人更准;但优惠券叠加地区补贴、A/B 凑单等连续复杂问题,准确率仍会下降。基模还要负责意图识别、RAG 检索,以及清洗和梳理包含详情页图片、Chain 工作流等复杂知识源。

  • 从 2024 年下半年起,客户重心由降本转向增效。某客单价 2 万元以上的高端家电品类,依据 AI VOC 画像重做卖点、主播及客服话术,一年半后销量增长 23%、客单价提高 6% 多,并于 2025 年扩展至集团各事业部。

  • 对“人人都有 AI 后红利是否消失”的追问,吕英杰认为“AI 未来的价值核心还是掌握在人手里的”:垂直数据飞轮和行业专家构成中间层壁垒,最终仍由人识别机会并决定产品、营销与执行。

  • 其收费由 SaaS license 加数据使用包组成,以处理 100 万通对话、语音或社媒帖子等单位估算 token 成本。AI 让客户接受“使用必然产生成本”,改善了中国 To B SaaS 的付费逻辑;语义科技上一年因此实现约 100% 增长。

泓君

我记得两年以前我们播客在聊大模型的时候,大家还总觉得模型有这样那样的问题,很难真实地应用到工作或者生活中。而今天,大家的手机里面是不是都有一个或者好几个 AI 助手类的工具了?我们看到,现在基础模型的能力在很多场景已经够用了,传统企业也开始大规模拥抱 AI。

所以我们今天的主题,是想聊聊大模型的商业化与应用。为了把这个主题聊清楚,我邀请了一位模型公司的朋友,来聊一聊模型技术能力的进化与商业化进化这两条线是如何交织发展的。节目的后半部分,我也邀请了两家企业,看看他们是怎么样找到 AI 与现有业务的结合点,以及在拥抱 AI 的过程中有哪些思考与痛点。

首先,跟我在一起聊天的嘉宾是阿里云千问大模型业务总经理徐栋。栋哥,你好。

徐栋

你好,泓君老师,大家好。

泓君

很开心你能来做客我们的播客。因为在 2025 年底到 2026 年初,大家讨论最多的,一个是 AI agent,还有一个就是 AI 应用。它们真的是开始走进大家的生活了。

今天也很开心你能跟大家聊一聊大模型在商业化方向的一些趋势。在此之前,你要不要先简单跟大家介绍一下你在阿里的工作,以及你主要负责什么?

徐栋

好的,谢谢泓君老师。阿里做大模型的时间还比较久,我们最早的模型可以追溯到 2021 年左右。

首先,有一个非常有名的、尤其在海外大家可能会比较关心的模型,叫千问,英文名叫 Qwen。因为在开源领域,它其实已经是一个非常大的体量,很多北美的公司也会用它做基模。它代表的是我们的语言模型,所以我们会用这个模型去挑战 AI 的智慧,看看它能不能用更多工具进入更多生产环节。这是我们非常主力的一个模型。

另外,我们还有第二个视觉生成类模型,叫万相。万相可以生成图片,也可以生成视频,还可以做图片和视频的编辑。同时,它也可能成为未来世界模型的一种范式。所以最近这 3 个月,我们重点发布了 2.5 Preview 版本和 2.6 版本,也得到了很多新的反馈,尤其是在视频创作这块。

第三个基础模型,是我们在去年的云栖大会发布的 Fun-Audio,一个纯音频模型。它的音频能力包括大家比较熟悉的 ASR、TTS,也包括声音克隆。我们在这个模型上追求的是更加拟真,包括多语言、不同方言、不同口音,以及它如何更好地理解和表达。

大家可以理解,我们今天的模型已经比较结构化了。在这几个基模的基础上,我们开始跟很多客户做交流和互动。有一些客户偏向制造业、实体企业和品牌商,更多的也包括很多互联网公司。但我的体感是,最近这一年有大量 AI native 公司通过模型获得了非常不错的成果,他们在很多碎片化市场里面都达到了很好的 ROI。这是我日常工作的一些方向和内容。

泓君

你刚刚讲到了几个大的模型。你觉得过去 2025 年,在模型技术上最重要的进化是在哪几个方向?

徐栋

1. 视频生成进入生产

最近这半年进化的内容特别多。我认为,视频生成模型以万相为代表,如果按照 GPT-3.5 到 GPT-4 的这个状态来类比,我认为它已经到了 GPT-4 的状态。

过去,视频生成模型更多应用在特效、娱乐等方面。但今天我们看到,视频生成模型可以进入一些生产化领域。比如最近很火的 AI 漫剧,增长速度就非常快。还有自动化生成广告视频。大家知道,很多视频里面会有 15 秒的切片广告,今天这些广告有很大趋势开始进入自动化生成的状态。

现在已经有相对完整的管线,可能 5 个人一天就可以生成 6,000 个左右的视频。这是一个非常明显的趋势。所以从我个人的体感来说,最近半年技术变化带来的影响,视频生成是最明显的。

我觉得模型还有几个特性很有意思。第一个,模型生成的时间越来越长了。过去视频生成模型可能生成 5 秒、10 秒的视频,现在已经开始进入 15 秒的时代。再往下,它有可能能够进入 1 分钟。这样的话,它生成内容的连贯性就会变得更好。

这是一个比较有技术挑战的地方,所以我们也特别期待,今天几张图片或者一句话,能够直接生成一个 3 分钟的短视频。那产品设计和用户体验就会发生根本性的变化。

第二个,今天我们看到,视频内容不再是很枯燥的常见镜头。模型可以进行不同镜头的多次切换,光影效果也可以做很好的变化。这有点像专业影视级的能力,只不过它把这种能力通过简单的提示词,让所有人都可以生成出来了。这也是过去很大的一个变化。

第三个变化,其实也是 Sora 2 给我们的很大启发,就是角色一致性,也就是 character consistency 的能力。我们关注到,如果要做角色扮演,每个人都是导演的话,他希望能够保留人物和物体、背景的形态和大小,以及人物的音色。这样在后续创作里面,就会有很好的延展空间。

简单来说,我们希望从 15 秒进一步延长。现在我们的模型应该已经做得非常不错了,已经是国内应该最长的一个视频生成模型了。镜头切换、光影变化,过去都需要专业导演配合摄像、美术等不同角色一起完成。现在这些能力通过模型,有可能变得门槛更低。

最后一个就是角色扮演,也就是刚才说的角色一致性能力。我相信,这个能力未来会成为所有视频创作生成模型的标配。

泓君

角色扮演是指什么?

徐栋

我讲一下这个场景。假设我们有一部手机,可以对着手机做一个自拍,拍一段 5 秒钟的视频。我们可以抬头,或者左右看一看,看完之后同时说几句话,有点像在正式录制之前简单试个镜。

模型输入这段视频之后,就可以对视频里面的人物形象和声音进行身份保持。也就是说,在真正创作的过程中,人物的形象和声音都可以被复刻出来,这是一个比较大的改变。

泓君

也就是说,以后可能不用真人出镜了,或者真人只需要出镜 5 秒,后面很多内容就可以让 AI 生成、模型化地运作了。

徐栋

对,也意味着我们对生成内容的可控性变得更高。原来我们可能还是依赖抽卡,但今天我们在输入端做更多参考,参考的维度也变多了。

这个领域在动漫创作里面其实已经有很多应用。原来大家讲参考图,现在开始讲参考视频,因为参考视频包含的信息维度会更多。

泓君

你刚刚也提到,现在 5 个人就可以生成 6,000 个视频。比如 AI 漫剧已经比较火了。我们这一期其实也在聊,AI 是怎么样走向应用以及商业化的。

基于模型能力的提升,你看到了哪些比较好的商业化案例或者应用?

徐栋

2. AI 视频走向商业化

大家都知道,国内短剧市场已经超过电影市场。所以在视频生成这块,我们很明显能感觉到,短剧从原来需要真人或者大量人工编辑的状态,开始有一定比重切换到 AI 模型里面去了。

最近最火的其实是漫剧。国内的漫剧最早发展的应该是动态漫,可能是以图片微动的效果做出来的,整个剧情会变得很连续、很连贯,而且商业化能力也非常强。所以漫剧已经成为一个和 AI 结合得非常紧密的领域。

泓君

刚刚我们提到短剧市场,包括用 AI 生成短剧、制作真人 IP character 的短剧,以及你后来提到的批量、结构化地生成 AI 广告。

大家最关心的一个问题是:用 AI 做的成本,跟用人做的成本分别是多少?现在这些厂商在考虑接入模型的时候,看重的是什么?成本比较又是什么样的?

徐栋

品质不一样,大概会分成 S 级、A 级、B 级。一部短剧,如果是一个合理的成本,AI 可能能够做到 2 万元以下。如果算上投流和 ROI,它有可能打平,或者实现不错的收入。

如果对精品的要求更高,就需要投入更多资源做后期制作。这样的话成本可能会更高,但剧的品质也有可能更高。

广告的话,现在我们看到 15 秒的视频,AI 成本能够控制在 10 元以下,或者 15 元以下。它其实就可以在市场上形成比较好的商业空间,因为一个合格的 15 秒广告,市场价格可能在 25 元到 50 元之间,所以就形成了比较好的商业循环。

泓君

这个成本确实挺低的,尤其是用 AI 做广告。阿里系有淘宝这样的大电商生态,所以这些电商卖家在选择用 AI 做广告的时候,这个结构还是有点复杂的。

徐栋

今天我们看到,每个流量平台都会给广告主或者代理公司一定的编辑能力,让他们更匹配自己的流量平台。

但广告主自己也会有大量素材。这些素材有可能是自己做的,也有可能由第三方 agency 来做。所以在整个广告生成领域,其实有多个参与方:有可能是 agency 来做,也有可能是 agency 分包给专门做 AI native 广告的创业公司来做。

我们看到,这部分 AI 创业公司越来越多。他们会越来越多地把 Wan 和 Qwen 结合起来,形成一条管线。这样就可能由 5、6 个人,或者 10 个人,一天生成 6,000 个广告,再把这些生成的广告交给 agency 或者流量平台的广告主。

泓君

我们刚刚聊的是 AI 视频生成模型。你们还有音频生成模型和 Qwen 这样的语言模型。你觉得另外两个模型在 2025 年的进步和突破分别是什么?

徐栋

3. 语言模型持续进化

我觉得语言模型目前仍然在持续、深刻地变化。虽然我们很难再看到一个巨大的范式改变,但我简单说一下我们正在做的事情,以及它可能带来的影响。

第一个,大家知道高质量数据集越来越少,或者说大家都已经在模型里面训练得比较充分了。但怎么样利用好高质量数据集,进行精工细作,把数据从不同角度、不同前后顺序进行调整,让模型对知识的学习效率变得更高,这是今天每个模型公司都会做的事情。

所以我们会发现,今天模型在一些 corner case 上的表现越来越好,其实都跟对高质量数据集的精耕细作有关。

第二个,模型的结构会越来越稀疏。同时,像 MTP,也就是多 Token 预测技术,我估计不同模型都在进行实践,所以模型的速度会变得更快,甚至可能成倍提升。

比如原来首包时间假设是 2 秒,未来大概率很多首包可以达到 500 毫秒,当然取决于上下文长度。过去我们讲 TPS,30 到 50 就算不错了,但如果基于模型的不断进化,达到 80 到 100 以上都是很有可能的。

在一些性能要求极高的场景下,这会变得非常好。大家也可以从机器吞吐的角度来理解:模型变得稀疏之后,成本一定会进一步下降,所以推理成本也有可能进一步下降一个量级。这会带来非常好的收益。

另外,模型还有很多事情需要日常不断迭代,而且是一个长期工作。比如指令遵循能力,我们希望它进一步提升。Agent 的能力,核心其实就是 tool use,也就是工具使用的能力在不断提升。关键是怎么泛化地使用工具。

过去可能一个工具用得不错,但今天要使用多个工具,或者把一个工具用深,这些都还有很多需要不断提升的地方。

再一个是上下文越来越长。因为今天如果工具调用的轮次变多,就需要更长的上下文,而且模型执行指令也要更精准。

在这些能力叠加 coding 能力提升之后,我们会看到一个很好的趋势:未来可能有非常多的 agent 自己连续不断地运行。它可能不是像今天的 ChatGPT 一样马上给我一个结果,而是一个非常简单的结果。它有可能会把我们闲时的计算资源都用掉,去做一个 AI for Science 的研究课题,或者生成一份非常有深度的 report。

这份报告背后一定会用到不同的检索引擎,甚至 CRM、ERP、房租软件都有可能。如果它能使用这么多工具做出一个结果,我们相信它的质量一定会比单纯文本输入、文本输出的结果好很多。

泓君

你刚刚讲到了很多基础模型在细节上的提升。我们去年一直在追踪大模型和 agent 的发展趋势,我注意到,2025 年是 AI 从模型走向应用非常关键的一年,整个 agent 处于大爆发状态,而且我观察到中国的应用创新尤其活跃。

为什么是去年的这个时间点?是因为模型基础能力提升了,还是有哪几个小的变化一下子让大家觉得“我可以去做应用了”?

徐栋

4. 推理能力引爆应用

我觉得第一个就是 reasoning 能力。Reasoning 能力是在 2024 年下半年、接近年底的时候,OpenAI 推出 o1 之后出现的一个很重要的变化。

今天所有模型都不再单纯依赖所谓的概率,它开始表现出一定的逻辑偏好。今天我觉得 reasoning 是非常根本性的一件事情。

第二个,模型的 size 变大了。原来有一个很大的挑战,就是模型变大之后可能训不动,但今天有各种预训练的改进。所以模型在变大的同时,可控性也变高了,我们看到它处理复杂指令的能力越来越强。

原来很多时候我们会依赖 workflow,因为 workflow 是确定性的。为什么需要确定性?因为模型有可能出现偏差,所以我们需要在关键节点进行控制,甚至让它交叉验证。

但今天模型的指令遵循能力和指令理解能力都变强了。只要给它足够准确的 context,它就会根据不同情况,在泛化性和准确性之间找到一个平衡点。所以我们认为,模型在指令遵循方面的进步也非常大。

刚刚还讲到工具怎么调用。当然,这也得益于整个环境的变化,包括 Claude Skills、MCP 等标准开始被大家逐渐接受,所以越来越多的工具被显性化了。

今天模型跳脱了原来的输入输出窗口,开始进入更多不同的生产环节。这个环节有可能不是一个框,它可能是一个标准的 SaaS 流程,也可能是一种硬件交互方式。这就是一个很大的改变。

泓君

你刚刚提到了推理能力、指令遵循,也提到了模型的可控性和工具调用。第一个和第三个我可以理解。指令遵循方面,有什么关键技术让它的可控性变得更好了吗?

徐栋

我觉得指令遵循跟数据集还是有关系的。可以泛泛地讲,所有事情都可以叫指令遵循。

比如今天我们要求一个小朋友把题目做好,这就是一个指令遵循。一个比较聪明,或者理解能力比较强的小朋友,就会比较精准地理解你说的所有问题,包括上下文,并且基于上下文自己做决策。

所以指令越复杂,就越挑战模型的遵循能力。

泓君

所以你觉得高质量数据是阿里独有的一部分吗?

徐栋

我觉得这是每个模型公司都在追求的方向。模型训练到今天,其实已经没有特别多秘密了,大家都在不断精耕细作,让模型在 corner case 里面回答出更加惊艳的结果。

而这种更惊艳的结果,其实来自它对上下文更加准确的理解。

泓君

我注意到,今年 1 月刚刚有一个 CES 展,我也去了。我发现现在整个 CES 上有一个趋势:几乎所有产品都想跟 AI 搭上关系。

比如耳机也希望有 AI 功能,智能眼镜更是一个非常热的趋势,包括剪辑和拍摄也都会加入 AI 功能。首先,今年有很多中国客户去 CES 参展,背后也有很多你们千问大模型的影子。

你能不能聊一下,在我们看到的这些 AI 硬件产品里面,大模型扮演了什么样的角色?

徐栋

5. 硬件成为行动入口

今天硬件强调的是交互。它有自己的摄像头、屏幕和麦克风,所以硬件和大模型结合之后,在交互上会得到很多改变。

其实模型和硬件结合已经不是新鲜事了。早在 10 年前,ASR 到 CV 的模型就都和硬件有关,只不过过去没有产生很大的商业价值。

这一次模型和硬件的结合,我觉得最重要的是它变得更加拟人,也可以执行更多任务。过去它只能识别,今天它能够听懂、看懂,并且回答出你想要的结果。

今天上午,千问 App 也做了发布。通过千问 App,可以直接订咖啡、订座位。如果是一副眼镜,它能够让你通过自然语言完成这些任务,这就跟过去有很大的区别。

这背后基本都离不开模型,包括语音模型、视觉理解模型和文本模型。

泓君

所以现在通过眼镜订咖啡,已经实现了吗?

徐栋

准确地说,早就实现了。千问 App 通过自然语言就可以点咖啡,或者完成其他商业闭环。

你可以选择咖啡口味、加不加糖、点哪一家的咖啡、多久送过来,包括完成支付,这些都可以实现,全部在一个基于大模型的架构里面完成。

泓君

我刚才试了一下,它会生成很多卡片,你可以不断切换卡片,当然也可以点开一个完整的菜单,因为它会根据你的偏好主动推荐。

徐栋

如果大模型的操作界面跟原来的 App 完全一样,可能也会有一些挑战,因为那样很麻烦。今天我戴着眼镜,可能更希望这个 AI 是懂我的,它有我的 memory。

我刚才看到的体验,是以卡片的形式推荐咖啡,并且考虑到了你的距离、偏好和过去的选择。它就可以给你推荐。

泓君

输入端相当于眼镜有摄像头,可能可以拍到菜单,或者看到同事在喝什么咖啡。输出端则是语音,形成一个闭环。

徐栋

输出可以直接是一个商业化结果。比如我今天需要一杯咖啡,你可以理解为一个 action,这个 action 就可以和商业服务打通、落地。

泓君

我们可以看一下未来这类应用的发展情况。因为今天整个主题也是想知道大模型是怎么商业化的,所以你能不能整体跟大家介绍一下,阿里千问是怎么商业化的?

徐栋

6. 千问打开企业市场

我觉得做大模型和做云的时代,最大的区别是:云的覆盖率比较慢,最早是手游,慢慢覆盖到金融和不同制造业。但大模型这一波的改变是全行业覆盖。

所以当听到这个问题时,我首先想到的是行业:好像每个行业都在用,只不过渗透率不一样。

我们现在换一种逻辑,可能有两个方向。

第一个方向是模型和企业结合,提升企业生产力。一个企业内部有大量流程,每个流程背后都是不同角色。怎么样基于结果导向提高流程效率,大模型可以做非常多事情。

不管是设计、coding,还是 research、sales,每个环节都有大量大模型可以做的事情。这是一个大的领域,也就是企业内部和大模型的结合,我们把它叫作生产力提升。

还有一块是产品和大模型结合。今天有大量互联网公司或者硬件产品,刚才也讲到消费电子硬件,它们天然就是和用户打交道的渠道。这些硬件和 App 经过大模型改造之后,交互体验会发生很大变化。

所以我们今天看到,绝大部分硬件产品都叫作 AI,比如 AI Phone、AI PC、智能座舱等等。因为有了大模型,体验发生了变化,整个产品定位也发生了根本性的改变。

我们会和这些公司有很多深入合作,而且这种合作已经越来越深入了。原来我们更多强调云上的合作,今天看到手机厂商和车厂有大量低延时、本地化的需求。

所以我们之前发布了一个模型,叫 Omni,是一个 4B 的模型。现在很多车厂和手机厂商都对类似这样的模型进入车企和手机非常感兴趣。

泓君

这类似于卖一个端侧模型,对吗?

徐栋

是。当然,这个场景可能更多局限于算力比较强的手机厂商和车厂。毕竟模型能不能跑起来,还涉及功耗和发热问题。

这也是经过大概两三年打磨之后,很多车厂和手机厂开始考虑端云结合的架构。端侧模型开始受到关注,是因为今天需求越来越旺盛,光靠云端模型可能还不够。

所以今天我们已经进入了深水区,也就是端云模型的结合开始成为大家关心的话题。

泓君

所以从普通消费者的视角来看,未来每一部手机、甚至每一辆车,可能都有和你智能交互的能力,都会变得很智能。一开始就会嵌入手机里面,对吗?

徐栋

对。大家知道,智能设备其实是每个人贴身的入口,所以这里面会涉及一些偏隐私、偏高时效性的任务。今天一些硬件厂商在规划产品时,就会考虑到这件事情。

泓君

你刚刚提到了端云结合的趋势。在端侧,我可以理解为把阿里的 Omni 模型放到手机或者车里。有些任务是在云上处理的,比如接入阿里云,还是接入企业自己的云?

徐栋

首先,今天绝大部分国内企业基本上都在阿里云上提供云服务。我们现在有一个推理平台,叫百炼。

今天大量企业通过百炼这样的 MaaS 平台,直接和设备做交互,包括刚才说的消费电子硬件设备。这个平台的核心要求是高并发、低延时和可观测。如果企业有一些特殊需求,还需要能够进行健全管控,所以这是一个相对完整的平台。

今天可以理解为,绝大部分企业已经通过这个平台和自己的业务发生连接了。

泓君

什么样的场景可以直接在端侧处理,什么样的场景要移到云上?客户在做这类合作的时候,端侧和云端大概会占到什么比例?

徐栋

这是一个动态变化的过程。今天端侧模型比两年前最大的模型效果都要好。我们当时可能需要一个 100B 以上的模型,现在只要一个 4B 的模型,效果可能就发生了翻倍的改变。

所以我觉得,通用类任务、基本交互任务,包括语音和视觉理解,基本都可以通过本地模型来完成识别和交互。可能 70% 以上的任务,端侧模型都可以比较好地解决。

泓君

客户在跟阿里合作的时候,大家最看重或者最关心的问题是什么?

徐栋

这是一个变化的过程。最早关心的是效果,因为当时模型效果可能还不是特别好,所以客户会提出大量垂直任务,也会构建评测集。

最近半年到一年,客户开始从效果转向性能和成本。因为今天模型的体量可能比过去增长了几十倍,客户开始进入严肃生产环节,也就是说,模型效果其实已经基本得到验证了。

我刚才提到过的 TPS、首包延时,现在客户都会提出非常精细化的要求。比如 4K input 和 100K input,分别有不同的 TPS 和首包要求。

还有一些业务可能是高并发。比如智能外呼,大家知道智能外呼一天只有几个小时最适合进行,不可能凌晨还去做外呼。所以它对并发的要求非常高。客户可能希望半个小时之内完成 10 万通电话的外呼,这对模型并发性能的要求就非常高。

最后就是成本。今天使用量比过去扩大几十倍、上百倍,成本势必会成为一个非常受关注的话题。

回到一开始说的视频生成模型,这个模型目前还是比较贵。如果真的要批量化、自动化生成广告,对成本的诉求也会进一步提高。

泓君

我听到你刚刚说,客户会关心性能和成本。从你接触的情况来看,整体上客户对这个行业的理解已经比较深了。他们大概知道什么场景可以用小模型解决,什么场景需要用大一点的模型。

我自己听下来,感觉整个行业的商业化应用已经不是刚刚开始了。大家已经开始挑选模型、提出需求,对行业垂直化、细分化和精细化程度有了更多考量。

徐栋

你刚才说到了一点,也给了我一个启发。最近这段时间,小模型的需求特别多。重复性任务其实小模型有可能有很不错的性价比,没必要跑一个非常大的模型。

第二个是意图理解和意图抽取。很多企业的 chatbot 或者 agent,第一步就是理解用户并做判断。在这一步,我们也看到对小模型的需求非常多。

所以今天客户也给我们提了很多 post-training 或者 fine-tuning 的需求。也就是说,平台能不能把闭源数据和基于闭源模型的数据结合起来,训练出适合企业自己的小模型?这个需求也是最近 3 个月开始越来越多的。

泓君

你觉得现在从阿里来看,推理成本降了多少?

徐栋

我觉得推理成本基本上每半年接近下降一个量级。大家可以理解为,一个量级就是 10 倍。

成本下降有多个因素影响。第一个是模型结构。模型会越来越稀疏化,也会用到混合精度、MTP 等技术,这些基本都会让模型侧的成本持续下降。

第二个是芯片。今天模型和芯片进行垂直一体化设计,也会带来大量新的潜在红利。

第三个是调度。过去我们讲模型推理成本,会考虑利用率。这其实是云的概念,因为过去讲云,会讲利用率和库存管理。利用率只有 50%,或者只有 30% 的时候,成本就会变得很高;利用率非常高,成本就会下降。

所以我们也会通过比较完整的调度,比如不同模型之间的切换、不同时间段针对不同任务进行切换,以及夜间跑批任务,来提升利用率。这些都会带来很大的改变。

刚才说的多个维度,会共同造成推理成本快速下降。

可以补充一个具体案例。我们在 2025 年底发布了一个模型,叫 Qwen3-Next。这个模型是一个 80B-A3B 的模型,是下一个版本的预研版本。

它的稀疏比很高。我们之前还有一个模型,是 30B-A3B,也就是 30B 参数、3B 激活;而这个模型是 80B 参数、3B 激活,稀疏比非常高。

在这样的模型下,我相信很多开发者已经试过它的推理效率和效果,速度都发生了非常大的改变。

泓君

你刚刚提到,除了模型结构和模型算法以外,很重要的是芯片设计以及软硬件垂直一体化设计。

我最近也做了一个 Google TPU 的选题,大家可能会在这期播客前后听到。这个选题讲的是,为什么谷歌的推理成本在早期就只有 OpenAI 甚至 Anthropic 的十分之一。细究下来也会发现,谷歌的 TPU 是根据模型算法专门设计的,这种软硬一体化对模型推理成本下降非常有帮助。

所以我们看整个阿里巴巴的科技板块还挺有意思。今天你们有自己的云、自己的模型,也会有自己的芯片投入,是三位一体,听上去可能和谷歌有点接近。

徐栋

垂直一体化的好处非常多,可能还不仅仅是芯片和模型,还涉及云。刚才说到的调度,其实都和云有关。

泓君

我注意到,千问也是全球最全面的开源大模型之一。为什么当时决定要开源?

徐栋

7. 开源扩大全球生态

我印象比较深的是,应该在 2023 年 8 月前后,我们的 7B 模型得到了非常大的市场反馈。基于这个模型,我们打开了非常大的全球格局。

大家知道,千问和万相的模型在海外社区里面活跃度非常高。开源有几个显而易见的好处。

第一个,对于人才的吸引力会大大增加。很多非常 top 的科研工作者或者学生,在学校里面就开始使用千问,所以他们对千问的很多特性都非常了解。

第二个,开源让我们得到社区的大量反馈,尤其是在早期非常明显。社区里面有很多做推理框架、推理引擎,甚至做端侧部署的开发者。他们很早就围绕我们的生态做了很多建设,也会提出很多数据集和 bad case 方面的问题,这对模型快速迭代的帮助非常大。

在开源这块,我们投入非常大。今天在国内外大量企业内部,绝大部分开发者都知道千问。企业内部或多或少都会用到千问的能力。

尤其是我们开源了很多小参数模型,比如 1.5B、3B 以下的模型。我们可能还有一个甜点模型,是 32B,因为 32B 可以用单张显卡跑起来。这些模型在企业里面都有大量应用。

泓君

开源和闭源怎么去做商业化平衡?因为我理解,客户拿到开源模型就可以免费使用,闭源模型则可以产生商业化收入。

徐栋

首先,阿里云是一家云公司。今天我们看到,开源对整个云的带动也非常明显。从另一个角度来说,阿里云的基座得到了快速发展,这是非常好的商业化正循环。

第二,开源模型也存在一个问题:开源的那一刻,它就是一个离线版本了。所以有很多问题需要在 API 版本,也就是闭源版本里面进行修正。

在这种情况下,闭源版本会有一些能力和特性的提升。今天也有很多开源生态用户希望有一个更简单易用、并发更高的环境,所以他们也非常愿意直接使用我们的 MaaS 服务。

另外,开源模型也会考虑开发者使用的便利性。我们过去开源的模型相对来说没有那么大。其实我们最大的模型 Qwen3-Max 没有开源,因为这个模型真正部署起来成本非常高。

如果 Qwen3-235B 不能满足一些需求,客户也会选择 Qwen3-Max 模型。

泓君

2025 年春节前后,行业里面最大的事情之一,是 DeepSeek 发布了开源模型,让整个中美市场都眼前一亮。你觉得它的开源模型发布会对阿里产生冲击吗,包括商业化上的冲击?

徐栋

我觉得今天市场还是处于中早期阶段。更多模型公司推动技术进步,这是最重要的事情。DeepSeek 的论文写得非常清晰,也很有参考意义。对于整个行业来说,我觉得都是很好的推动力。

坦白说,它开源之后反而带动了整个开源生态的活跃,让千问的开源也得到了进一步发展。为什么我们看到千问反而在全球范围内有更多人使用?因为千问从最小的 0.5B 版本到大的 235B 版本,跨度非常大,企业里面不同场景都可以用到,而且更新节奏很快。

我印象很深,基本上我们每个月都会发布不同的、可能 3 个小版本。过一段时间,3 个月到半年,可能会连续发布 5 个左右相对大的版本。所以我觉得这是一个相互促进的过程。

泓君

今年大家讨论比较多的是,怎么衡量一个应用火不火。行业内有一种大家比较公认的方法,就是用它使用了多少 token 来量化合作深度。你觉得未来应该怎么评价一个大客户,或者评价哪个应用比较火爆?Token 量是一个合理的评估指标吗?

徐栋

8. 商业价值超越 Token

阶段性来看,它有很好的参考意义。我们也看到很多公司用 token 来衡量创业估值。

但从长期来说,一定会回归到收入。不一定是 token 直接带来收入,也可能是基于 token 封装出的 agent 带来收入。

我们内部也会有两个讨论,一个叫 model as a service,一个叫 agent as a service。

Token 也有一些弊端。最小模型和最大模型的成本、收入都有可能差 1,000 倍,所以它们的商业价值其实非常不一样。

再比如多模态,包括语音模型,它和文本模型的 token 有时候也没有那么清晰。每家公司定义稍微也会有一些不同。

但不管怎么样,token 依然是当下比较好观察业务使用量的指标。所以今天我们对 token 也相对比较关注。

泓君

Agent as a service 和 model as a service 的区别是什么?

徐栋

Model as a service 强调的是模型的服务能力:你能不能持续推出最新模型,API 是不是足够好用。

我记得之前 OpenAI 的模型应该是 Assistants API,后来改成了 Responses API。包括今天很多公司在做的实时 API,这些都是基于 API 层面,或者说 model service,衍生出的很多产品用法。跑批任务也都和 model as a service 有关。

Agent as a service 可能会分成场景化,也可能会分成行业化,这两个方向都处于快速变化的过程中。

简单来说,agent as a service 可能会用到多个模型,最后封装出一个标准的任务结果,直接交付给客户使用。Deep Research 其实就是一种 agent as a service 能力。

泓君

你觉得现在整个模型进化以及大家在模型上的投入还多吗?因为我自己的感受是,大家依然关注模型和模型进化,但讨论热度好像不如商业化这么高了。

徐栋

你说的是模型研发吗?

泓君

对,基础大模型,也就是最前线、性能最高、把模型推向极限的研发。

徐栋

9. 模型研发进入精耕阶段

我觉得这可能是一个小的反共识,或者说一个误区。从我们做模型的角度来说,模型研发投入反而变大了。

如果大家看今天的市场,会发现每家公司都可能说自己“不够卷”,每个实验室也都说自己“不够卷”,这就意味着今天的工作结果可以被定量衡量。这是一个高度竞争的过程,只不过可能不像过去那么显性。

比如突然出了一个 o1 的模型,大家发现它有推理能力;突然出现一个 Nano Banana,它可以非常显性地进行编辑。

今天很多模型开始进入非常精耕细作的阶段,可能没有太多极端的范式改变,但有大量工程细节值得不断推敲。

为什么刚才说成本可以按一个量级往下降?因为今天可以做的事情太多了。比如数据清洗能力、评价标准,过去可能依靠规则,现在都可以用模型来做。这里面有大量细节工作可以不断改进。

泓君

你觉得现在模型研发主要表现在哪些方向?

刚刚我们重点讲了多模态可能是大家关注的重点。去年 agent 大爆发,比如 Coding Agent 方面,Anthropic 和硅谷几家大的模型厂商都在提升代码能力,加入更多数据配比,也在不断优化这个方向。

从你看到的行业趋势来看,大家现在在模型研发上主要拼哪些方向?

徐栋

笼统地讲,其实就是 agentic 能力。Agent 或者 agentic 这个词,每个人的定义都不一样。

如果从结果表现来说,我更期待的是,一个模型能够连续运行,比如连续运行 2 个星期,并且拿到非常好的结果。在这个过程中,它需要不断和环境交互,不断自己思考和判断,自己做假设。这样的模型所带来的结果一定非常好。

所以回到我一开始讲的语言模型投入方向,其实就是工具调用能力、上下文能力、复杂指令遵循能力和 reasoning 能力。这些能力不断提升、组合在一起,就会给实际业务落地带来很大的改变。

泓君

所以它主要是精耕细作,而不是模型智能本身发生了变化?

徐栋

这取决于我们对智能的定义是什么。如果智能可以打分,那这些精耕细作其实都是让智能的分数越来越高。

泓君

讲得特别好,谢谢栋哥。

徐栋

好的,谢谢泓君老师。

泓君

接下来我们也请到了两位在模型之上做应用的朋友来跟我们一起聊聊。一位是语义科技联合创始人兼 CEO 吕英杰。吕总,你好。

吕英杰

泓君老师,你好。

泓君

还有一位是影石 Insta360 研究院总监齐鲁教授。齐教授,你好。

齐鲁

你好,你好。

泓君

齐教授先来讲一下,影石 Insta360 的产品是怎么样跟 AI 结合的。

齐鲁

10. 影石让全景素材讲故事

我们是一家影像公司。公司的使命是让用户更好地记录和分享生活。

这次和阿里的合作中,比较典型的一个代表就是云端自动剪辑。我们希望用户可能拍了一天,也可能积累了一整年的素材之后,能够把这些零散片段智能地剪成一条拿得出手、也愿意分享的视频。这对于我们整个公司的战略来说是非常关键的一步。

泓君

齐教授,您可不可以详细讲一讲,你们是怎么样用 AI 工具做视频剪辑的?

影石是一家我非常喜欢的公司。你们的滑雪相机可以隐藏相机杆,我觉得这个功能特别棒。

齐鲁

先说一点,自动剪辑本身就是一件特别主观、玩法也很多的事情。真正的难点不是把用户的片段拼起来,而是命中用户的剪辑意图。

不同用户的喜好不一样。有的用户更在意故事的连续性,希望我们剪辑出来的视频像一部小型纪录片;有的用户更想要高光瞬间,这样影片节奏会更快、更爽。

也有用户特别注重氛围和表达,比如配乐的情绪、镜头语言,或者片段与片段之间的转场风格。

在这方面,我们和阿里的合作主要集中在两个方面:一个是千问的多模态理解模型,另一个是万相系列的视频生成模型。前者更偏重感知和理解,后者更偏向特效生成。

泓君

你刚刚提到,AI 工具在调用模型时有两块:一块是多模态理解,一块是视频生成。

假设我给 AI 工具输入一个指令:“剪辑我所有在雪上滑下来失败的瞬间。”它首先要理解我的语义,其次还要分析视频里面哪些是失败的瞬间。

齐鲁

我们的多模态理解能力,首先负责看懂用户的素材。它要理解每个片段里面发生了什么,进一步做一些高光提取,以及人物和事件的判断。

最后,我们希望把大量片段内容以结构化的方式编排起来,让素材不再是杂乱的片段,而是一个有逻辑、有主线的内容组合。

泓君

你觉得现在模型的能力能理解到哪一步,能剪辑到哪一步?

齐鲁

现在我们的多模态理解,如果从语义理解层面来说,已经能够满足一定需求。我觉得更大的问题是如何进行用户意图识别。

用户意图可能和素材没有直接关系,更多来自用户的行为和用户给出的指示词。但很多时候,用户自己也不知道该怎么表达想剪辑成什么样的视频。

所以一个比较大的难点就是,剪辑算法怎么理解用户到底想剪成什么样的东西。

泓君

这是不是有点像用户是不是一个好的甲方,他跟乙方的沟通能不能让乙方清楚理解他的意图?

“失败的瞬间”可能还不够,你可能得告诉它:“我从这个雪橇上飞出来的画面。”也就是给它一个更加清晰、客观的定义。你觉得难点就在这一步吗?

齐鲁

如果让用户给出一个非常清晰的定义,对于用户体验来说其实也很差。我们更希望用户只用一些模糊的语句,我们就能够理解他的意思。

但这件事情,在现在的模型层面上还是比较难。

泓君

你们在用 AI 做影片的时候,推出了哪些具体功能?它是怎么样用到多模态能力的?可不可以跟大家讲一讲?

齐鲁

影石最核心的产品是全景相机。全景相机一直秉承“先拍后剪”的理念:拍摄时用 360 度的全角度覆盖,把现场完整记录下来;剪辑时再从中挑选最好的视角和最合适的节奏,把内容真正讲成一个故事。

所以在我们的全景素材里面,和日常使用的广角相机不太一样。它相当于一张 360 度的全景图。

虽然现在通用大模型在预训练阶段也会使用一些 360 度素材,但相对于海量的平面素材来说,全景素材的数据量还是比较少。因此,模型对 360 度全景素材的理解会差一些。

这正是影石的核心技术壁垒:我们会先通过自研的全景理解模型,对全景素材进行高光提取,后面再接入通用大模型,帮助我们进行平面内容的编排。

影石这边会分成自研和直接调用 API 两部分。

泓君

哪一部分你们会自研,哪一部分会调用 API?

我补充一句,你前面说从全景相机中取出可用素材,这个需求实在太硬核了。因为全景素材里可能有三分之二、甚至一半没有用或者没有动静,但你还是有一个主方向,对吗?

齐鲁

对。如果是 360 度素材,即使场景相对单一,也可以加入各种运镜玩法,让素材变得更加生动。

我们自研的部分,更多是基于全景的多模态理解模型。后面则更倾向于使用通用大模型,帮助我们理解平面素材。

泓君

我理解,自研部分有一点类似世界模型,对吧?因为是 360 度全景。

但现在我们刚刚也提到,视频模型即使在不断进化,本质上也只是多模态模型,它处理的还是二维场景,所以调用二维模型会更方便。

而 360 度这种类似超广角、甚至可以用于 VR 的素材,就有一点类似世界模型的研发了。

齐鲁

对。

泓君

挺有意思的。那你们现在的应用成本呢?听起来会很高。

齐鲁

这也是我们和阿里合作的一部分。类似世界模型的研发,肯定离不开大量真实数据的收集。

当我们把数据规模和训练规模提升起来之后,就需要一套能够持续迭代的训练方法,以及稳定、可靠、可扩展的云端算力和工程体系,来支撑整个世界模型的开发。

泓君

所以你们现在和第三方合作的大模型,也可以应用到世界模型的研发中。

齐鲁

对。

泓君

我在 CES 上体验过你们发布的一款新产品,是 VR 无人机。它和大疆最大的不同,是拍到的也是全景照片,同时我可以戴着 VR 观看。

所以这些数据也可以成为你们做世界模型的一部分,对吗?

齐鲁

对。当然,我们也需要获得用户许可,肯定要在合规的前提下,才能把这部分数据用于模型开发。

泓君

你们让 AI 帮助用户做视频理解、生成,甚至剪辑,这些功能已经发布了,还是还在研发中?

齐鲁

我们的云端自动剪辑已经上线了。

泓君

这是二维视频还是三维视频的剪辑?也是 360 度视频剪辑,而且是用 AI 来剪,对吗?

齐鲁

对。

泓君

这可能涉及商业化。假设用户拍了一段 3 分钟左右的 360 度 VR 视频,你们要用 AI 把最有亮点的环节剪出来,大概会消耗什么样的成本?现在主要卡在哪里?你觉得成本下降的核心驱动力是什么?

齐鲁

用户剪一段这样的素材,可能需要十几块钱的成本。这个成本还是比较贵,所以我们也尽可能希望从技术上解决。

包括在模型输入上做更高的信息压缩。刚才也介绍了,我们的素材是 360 度全景,它的可压缩率比较高,所以我们希望结合全景的一些特性,通过技术手段把整体 token 数量压下来。

泓君

还挺有收获的。

接下来我们来聊第二个案例,语义科技是怎么样帮助很多大型零售公司用 AI 提升业务能力的。

吕总,我知道有很多大家耳熟能详的品牌,像雀巢、宝洁、泡泡玛特,都是你的客户。你可不可以先跟大家介绍一下,你们主要是做什么的?

吕英杰

11. 消费者意图驱动业务增长

我们是一家为国内消费品牌以及跨境消费品牌,提供全域消费者洞察分析的数据 insight 公司,也是一家 AI to B 的 SaaS 公司。

泓君

你们是怎么做 AI 的,又是怎么和客户合作的?

吕英杰

以前中国消费品电商企业的主要运营方式,是做一个产品、购买流量,直接把流量转化成客户,这其实非常依赖流量红利。

大家都知道,到了 2023 年以后,中国的流量红利已经比较见顶了。所以很多头部消费品企业逐渐意识到,可能要从流量思维进化成流量加消费者思维。

这就产生了对消费者调研和认知的需求。企业在电商领域有大量消费者进线、和客服沟通的数据。这部分数据,我们可以通过 AI 帮企业建立不同意图识别模型,帮助它了解消费者、不同用户画像和不同客户需求。

很多客户会通过大模型直接对原始数据进行意图理解和意图抽取,再变成标签化的过程。他们自己做的话,准确率甚至不到 70%。我们就是希望帮助他们解决这个问题。

我们公司从 2021 年、2022 年开始就使用 GPU 跑模型。我们只做一个非常垂直的方向,就是不同行业的消费者意图识别小模型。

客户告诉我们,他们希望对原始语料进行打标,明确消费者的意图方向,我们就帮他们搭建意图识别 agent。

我们发现,大部分客户会有几个需求。

第一个,是希望从原始数据中识别消费者不同的画像。这个画像和传统用来做投流的画像不一样。传统画像可能更偏年龄、白领等标签,但和消费者是否对你的产品感兴趣,并没有特别直接的关联。

以一个头部美妆品牌为例,它希望了解消费者的肤质情况,以及使用产品后的反馈,比如是否会引起过敏。

泓君

这些信息确实挺有用的,因为它可以帮助品牌把产品卖出去,也能给消费者推荐正确的东西。

我经常买护肤品或者化妆品,就觉得选择太复杂了,要把这些研究清楚也需要很久。

吕英杰

比如消费者来咨询时,我们会让客户改造接待话术。客户进线之后,客服可以主动说:“我是你的护肤美妆顾问。为了更好地帮你推荐产品,我希望了解一下你的肤质情况。”

做这样的卖点和话术改造之后,消费者提及这些信息的比例就会高很多。

泓君

所以你们相当于帮助企业训练 agent 里面的一个环节,主要是看整个流程怎么样才能收集到更有利的数据,再通过这些数据调整模型,让它帮助客户促进更多销售。这样理解对吗?

吕英杰

对,这是一个方向。

我们在处理数据的过程中,会发现有几类意图。

第一类是消费者画像。第二类是消费者意图,也就是消费者对产品、服务、物流和营销的反馈,不管是正面的还是负面的,我们都会帮助企业识别。

第三类比较有意思,可能每个企业都会不一样,我们称之为归因。

举个例子,有一个非常 top 的国内日化企业,原来有 6 个人负责消费者退货。他们要人工登记退货原因,对应到责任部门,再根据责任部门进行奖罚和绩效管理。

我们帮他们搭建了一套 agent 归因模型之后,现在只需要 1 个人进行复审。

泓君

这个确实会因企业而异。我觉得你刚刚讲到,你们和企业合作时,他们使用 AI 有好几层动力。

一开始我们讲到,用 AI 做客服中心,可以直接节省成本,也可以促进销售和转化;另外还有企业归因。我觉得可以一个一个来分析。

取代客服可能是大家能想到最常见的 AI 功能了。你觉得效果好吗?

吕英杰

我们倒不觉得这是一个完全替代客服的过程。客服工作可以分成两部分:第一部分是售前接待,第二部分是售后接待和处理。

售前接待环节里,传统意义上是客户问一个产品问题,然后客服进行解答。像这种单点问题,经过知识库训练和校准之后,大模型的回答准确率其实可能比人还要好,效果非常棒。

但在真实咨询场景里,客户会遇到比较复杂的问题。比如他问一张优惠券,大模型可能直接告诉他这张优惠券是多少。但客户接着问:“我们在浙江地区能不能参加国补?”

大模型还需要调取国补政策。如果客户继续问:“我现在买 A,帮我凑 B 的单,能够帮我减多少?”这样不断延展下去,准确率就没有那么好了。

泓君

在这种环节里,你们是怎么和基础模型合作的?以千问大模型为例,你们是怎么调用它的 AI 和 agent 的?它们提供的是哪一部分能力?

吕英杰

基模能够提供的,是识别消费者提出的问题代表什么意图,也就是意图识别。

其次,大家普遍都会做的是为客户搭建 AI 知识库。大模型识别出意图之后,就进入下一个工作流,通过 RAG 获取外挂知识库的内容。

除此之外,大模型也会帮助清洗知识库。因为企业内部的知识并不像大家想象的那样,都是非常标准化的文档。实际情况是,有很多复杂文档,有时是一张详情页图片,有时是一个 Chain 工作流。

比如优惠券问题,客户问第一个问题、第二个问题、第三个问题时分别应该怎么回答。面对这么多复杂的知识源,都需要通过大模型梳理进相应的知识库。这也是基模能力的一个重要体现。

泓君

所以你们选择模型时,最看重的是基模能力,还是调用接口?

吕英杰

我们的核心还是帮助品牌做消费者意图识别和理解,所以会非常看重基模在这方面的能力。

我们不仅测试国内客户,也有一些跨境客户,所以会涉及多语言数据。在多种测试中,我们确实发现,阿里千问在电商场域内对消费者意图的理解能力比较强。

泓君

我觉得你们的位置很有意思。你们的上游是基座模型,你们是中间一层,下游还连接着很多想把 AI 应用到企业中的客户。

这些客户在应用 AI 时,比如客服是为了节省成本;消费者意图识别,包括企业归因,可能又是在促进销售。客户使用 AI,到底是想节省成本,还是想增加销量?他们做的是存量市场还是增量市场?

吕英杰

这个问题很有意思,我觉得也是动态发展的。

从 2023 年开始,国内一直在探索怎么样用 AI 帮助企业。那个阶段大家非常关注的,其实就是如何降本。

但从去年下半年开始,我们发现市场变化比较大。很多企业发现,用 AI 做自动化、节省人工,这件事本身是有上限的。

就像我刚才分享的那个日化客户,原来有 6 个人做判责和复审,现在 AI 帮助他们只需要 1 个人复审,确实节省了 5 个人。但企业会发现,对于这么大体量的企业来说,节省 5 个人的成本也就是这么回事,并不会带来特别大的公司层面效益。

泓君

省掉 5 个人,但还要买模型、接接口、付 token 成本,这笔账能打平吗?

吕英杰

完全能打平。

从 2024 年下半年开始,越来越多企业会思考如何用 AI 增效。他们希望用 AI 帮助发现更深层的产品机会、消费者需求,或者原有产品的新场景和新卖点。

泓君

这些是模型带来的吗?

吕英杰

不能说全部是模型带来的。模型本质上是在做数据清洗、数据处理和加工,把数据变成标签,再提供给企业,或者做成 agent 的深度报告。

这部分是模型带来的。但产品线是否要做、怎么做、怎么营销,还是企业自己的 CEO、COO 要去判断的事情。

泓君

所以整体来说,是企业结合对市场的感知,以及模型深度搜索和分析的能力,做出企业决策。

吕英杰

对,是的。

泓君

有没有你们合作的品牌,通过和 AI 合作,在销量和转化数据上实现提升?

吕英杰

有一个国内非常 top 的家电品牌,它的一个品类事业部主打高端产品,客单价基本在 2 万元以上。

我们帮助它提供 AI VOC 消费者画像识别能力,以及不同高端客户对产品的细分反馈。它根据客户对产品功能的需求反馈,去设计整体营销卖点,包括主播话术和客服接线话术。

合作大概 1 年半之后,他们整体销量增长了 23%,高端线产品的客单价提高了 6% 多。

泓君

这个挺有意思的。相当于涨价了,销量还提升了。

吕英杰

对。他们发现,消费者进线之后会提出一些细分的功能需求,而这些需求可能是企业在设计卖点时没有关注到的,于是就可以把它们转化成营销卖点。

泓君

所以他们后来有追加 AI 这一块的预算吗?

吕英杰

有。这就和 AI 的收费逻辑有关。AI 本身是根据处理的数据量收取相应费用的,跑的 token 越多,费用就越高。

他们的销量变好之后,数据量本身也变大了,所以这方面的费用肯定会上涨。也正因为我们和他们一个事业部的合作效果很好,我们最早从 2024 年开始合作,到了 2025 年,他们把我们推到了整个集团,每个事业部都接入了 AI 识别模型能力,以及这套 SaaS 产品和 agent 能力。

泓君

你说的 AI 识别,是语音识别,还不涉及多模态识别能力,对吗?

吕英杰

对,还是语义识别。多模态能力是从 2025 年下半年才逐渐开始给客户探索、慢慢上线的。

其实在 2025 年全年,多模态意图识别能力相对于基模能力,加强了特别多。

泓君

像你们这样一端连接模型、一端连接客户的中间服务层,核心竞争力是什么?是对业务的理解深度,还是技术能力?

吕英杰

对我们自己来说,这两方面都有。

我们也会训练针对不同行业意图识别的模型,形成自己的数据飞轮。客户在显性层面看到的,可能只是一些意图识别标签和成品 agent,但对我们来说,会保留这些数据,逐步训练自己的垂直模型,让它在意图识别这个领域越来越准确,尤其是面对同类目客户时。

另外一个更重要的地方是,客户最终买单时,希望我们不仅是技术供应商,也希望我们能够以场外行业专家的身份,为他们提供更好的行业 know-how。

比如哪些头部企业在使用这些 AI 产品,怎么达到目标。客户初期的目标可能是降本,判断哪些重复性工作可以通过 AI 自动化;下一步则是增效,发现新的商机和机会,帮助老产品提高转化率、降低退货率等更实际的业务指标。

我们公司的客户成功团队,也就是 CSM 团队,会为不同行业配备相应的行业专家,给客户提供支持。

泓君

刚刚你的例子里,我能看到 AI 在意图识别之后,可以更精准地为消费者匹配商品,确实能带来销量和转化提升。

我们也看到越来越多行业,包括大型品牌,都把 AI 放进自己的工作流,甚至放进销售环节。那最终所有企业都开始使用 AI 之后,效果会不会慢慢变弱,甚至追平?只是说现在我们还处在红利期?

吕英杰

这个问题确实很有意思。大家都升级了军火库,原来用的是最传统的军火,等大家都升级之后,还有什么竞争空间?

我说一下自己的想法。我认为,AI 未来的价值核心还是掌握在人手里,关键是看人怎么使用它。

AI 可能做意图识别、方向匹配,也可能生成 Deep Research 报告。最后每个企业可能会发现,大方向上得到的结果比较一致。但最终做决策的人,如何看待这些数据,如何从 AI 处理后的数据里挖掘 insight,这可能就非常考验人的洞察能力。

做完这些事情之后,还是要由人来找到真正的机会点。

泓君

我觉得这个总结特别好。现在是在 AI 红利期,越往后归因,可能未来真正的好的产品才是最具竞争力的。

吕英杰

是的。所以我认为,好的产品经理、好的伙伴,永远都有机会。

我再说一个题外话。我觉得 AI 对 To B SaaS 行业的客户付费意识教育,起到了非常好的效果。

过去大家可能会认为,中国 To B 企业客户不太愿意付费,或者付费意愿和金额没有那么高。因为他们可能认为,谁都可以做这个软件,软件没有特别大的价值。

但 AI 这一波影响比较大。客户现在明确知道,AI 是按照 token 计费的:用了多少数据量,作为第三方基模之外的供应商,就会产生相应的成本。如果客户不付这笔钱,我们就没办法为他提供这样的服务。

这可能也是中国市场在向美国 To B 市场逐渐同步。

泓君

这个观察挺有意思。现在行业里的客户基本上也认可,用 AI 背后就会产生 token,也会产生成本,大家开始按照成本计价。

一般收费标准是什么样的?比如美国的 SaaS,一般是每个月固定订阅费,20 美元、30 美元都有。当然这可能是 To B,也可能是 To P,也就是 professional。

中国现在如果向 To B 企业营销,你们可能还是中间层,不是直接的工具提供商。现在大家的付费方式是什么样的?

吕英杰

我们会提供一个 SaaS 平台,处理完的数据都会储存在这个平台里,所以首先会提供一个 SaaS 版本给客户。客户需要根据 SaaS 版本支付 license 费用。

我们帮助客户做人群画像、意图识别和归因等不同 agent 的应用,这部分收费的逻辑是根据处理的数据量来计算。

因为没有办法直接和客户按照 token 收费,所以我们换了一个概念。比如一年帮客户处理 100 万通对话数据、100 万通语音数据,或者 100 万条社交媒体帖子数据。

我们根据这个数据量估算大模型的 token 成本,再换算成对应价格。

泓君

了解了,就是 license 费用加上数据使用量的费用。

吕英杰

对,是使用包的费用。

我们自己也很感谢 AI 带来的商业化机会,以及它对中国 To B SaaS 收费底层逻辑的改善。比如我们去年完成了 100% 的增长率,在行业内也属于比较高的增速。

泓君

特别棒。今天的分享特别全面。谢谢齐教授,谢谢吕总。好的,那这就是我们今天的节目。如果大家喜欢我们的节目,或者你对 AI 应用有什么样的想法,欢迎在我们的评论区写出你的留言。如果大家喜欢我们的节目,欢迎在苹果播客、Spotify 还有小宇宙上来收听关注我们。当然,如果你希望通过视频版来听播客,也可以在 B 站还有 YouTube 上搜索硅谷幺零幺播客来找到我们。我是红军,感谢大家的收听。

E223|应用爆发之年:聊聊模型技术进化与商业化 | BidClub