[BidClub_]
卫诗婕|漫谈 Light the Star · · 88 min

64.直击史上机器人浓度最高的春晚:与姜哲源、宁慕楠聊具身、Seedance2.0,行业幕后与未来|春节特别节目(上)

卫诗婕宁慕楠姜哲源

Podcast
TL;DR
  • 今年总台春晚机器人赞助战的内幕价码:据主持人披露,智元开到6000万,宇树开出更高价(传闻一亿、未经宇树核实),智元退出后自办“机器人奇妙夜”。 宁慕楠指出,奇妙夜露出时间更长、成本更低;节目约一小时、请来200多个机器人,大部分充当“观众”,智元宣称靠品牌露出收回了几百万成本。主持人还提到,一亿元成本可能够签好几个联合工厂项目;最终登台公司的名单在 transcript 前后有“四家/五家”的口径差异。
  • 宁慕楠认为2026是具身智能争夺的重要年份,参照新能源车剧本。 他的判断是:“比亚迪已经出现了,谁能成为具身智能的‘蔚小理’,大家就要拼2026年这一口气”;姜哲源则称2025年行业完成“从Demo走向量产的从零到一”,还没量产的公司“大概率会转型或失去上牌桌的机会”,头部企业账上应该不少于十亿元,中腰部和尾部也有至少一两亿元,行业“不会那么快死,但也不会过得太好”。
  • 春晚一线的关键实情:台上没有真正把“大脑”用起来。 主持人提出、姜哲源认同目前没有一家真正把所谓“大脑”搬到舞台上,大家主要还是以运控为主;台词全部预录、机器人由人操控,因为AI上台“没法保证绝对安全”。歌舞类出错时可切备播带,小品类节奏靠演员把握、压力更大;被问到预案时,姜哲源回答“说实话,这个预案没有做”。
  • Seedance 2.0对具身训练的价值,是本期最大的路线分歧。 宁慕楠认为,高物理一致性的视频生成模型可以是“某种世界模型”,成为“低成本、源源不断的训练数据生产厂”,并将Seedance比作“DeepSeek时刻”;姜哲源则认为Seedance渲染很真但“物理过程非常非常失准”,用这类数据训练机器人会产生偏差,对“多模态生成数据大大推进机器人训练”这一点表示“我觉得一定不会”,并承认行业尚无共识。
  • 宁慕楠指出视频模型与语言模型的商业结构不同:难以开源,蒸馏后也难以保持好效果,反而可能加深大厂垄断。 私有数据训练使开源成本很高,视频模型要达到高拟真效果仍需原生大模型和大型服务器;因此他预计“至少在2026年”会加深大厂的技术垄断优势。Diffusion固定输出帧长度,也让短视频数据更具优势。
  • 具身比AI更容易向投资人交代的理由是ROI可算,但行业也存在“本质上是To LP”的现象。 宁慕楠认可主持人提出的说法:部分订单与财务表现可能服务于融资,并存在关联交易,这是AI和机器人时代的共同现象;不过一台约40万元的机器人若顶替两三个岗位,对照工人年薪约7万元,可能两年回本。To Lab模式不长久,学校经费和两三年结项周期限制复购;To Lab订单增量“绝大部分来自中国”。
  • 姜哲源的差异化打法:场景战而非价格战,押注K-12与仿生人。 他认为“第二名没有意义,只有成为第一名、市占率达到80%左右,可能才会有很好的复利”;目前站稳的有宇树(运控)和云深处(巡检)。松延的9998元小布米是“史上第一个万元级高性能双足人形机器人”,降价是为了打开全新客群而非内卷切份额;仿生人则瞄准导游导览,姜哲源认为此前轮式导览机器人没有取得特别好的效果,核心问题是缺少关注度和话题度,并称松延在仿生人整体技术方向上处于全球领先水平。
  • 量产成为拉开差距的硬指标。 宇树2025年自己公布的数字是生产了5500多台人形机器人,松延产1000多台、去年年底单月产能500台、今年预计单月突破1000台;难点在本体与工艺设计,以及供应链“周期、成本、质量”三角,靠核心零部件库存抵抗交付波动。姜哲源同时承认宇树“还是当今全球机器人运控的第一名”,春晚彩排表现“远远超出预期”。
Digest · the substance, structured for research

1. 一亿元入场券:智元退出总台春晚,自办奇妙夜

  • 主持人卫诗婕披露的圈内戏称——“一亿元的入场券”:智元开到6000万,宇树开出更高价(传闻一亿,主持人称尚未与宇树核实),智元退出并放话“上总台春晚不如我自己办个春晚”。
  • 关于弃标的账,宁慕楠指出春晚露出时间短且不可控,花费很高但未必符合预期;主持人则提到,一亿元成本可能够签好几个联合工厂项目,或养一支几十人的核心技术团队。
  • 奇妙夜的成本安排:约一小时节目、号称请来两百多个机器人,但“大部分都是所谓的观众”,真正上台的可能只有十分之一;彩排更多依靠机器人表演公司,而非智元自家工程师。智元宣称靠品牌露出已收回几百万成本、实现收支平衡,还希望年年办成自己的“机器人春晚”。
  • 宁的观感不留情面:传播度小,多见于通稿,确实“不如真人春晚有吸引力”。主持人还将它与去年总台几十个机器人扭秧歌、转手绢的震撼效果作比较;宁则认为,若未来形成收视率,机器人自办春晚“未尝不是一个未来可以发扬光大的”形式。

2. 从运控秀肌肉到“大脑+小脑”:VLA是今年的看点

  • 宁的框架:今年多家提“大脑加小脑”——大脑即VLA(Vision-Language-Action),赋予机器人类似GPT、Gemini、DeepSeek的理解与对话能力;小脑是3D检测、机械臂控制等垂直小模型。VLA“算是今年的一个亮点”。
  • 两个落点:工厂里机器人与工人简单交互可“极大降低危险性或提升效率”;家用场景要的不是安静叠衣服的机器,而是“一个能够与你沟通、提供情绪价值的”机器人。
  • 一个反转判断:若总台春晚秀出交互能力,反而会让人回看奇妙夜、发现智元早已展示过——“所谓的一亿春晚可能还是有它的价值的”。

3. 双雄战争变四强争霸:2026拼的是“蔚小理”那口气

  • 主持人称各家公司从年中五六月开始角逐,最初是宇树与智元的双雄战争,随后变成四强争霸;她列举的最终登台公司为银河通用、宇树、魔法原子、松延动力和追觅。
  • 宁的时点逻辑:机器人已经烧了一年的钱,投资人要看成果,宁愿多烧钱买曝光;更关键的类比——“比亚迪已经出现了,谁能成为具身智能的‘蔚小理’,大家就要拼着2026年这一口气”,因为新能源从爆发到落地最关键“也就那么两年的时间”。

4. 三巨头路线图:宇树本体、银河仿真、智元联合工厂

  • 银河通用(王鹤)是仿真数据派:实采要一台最少二十来万的本体、操作员编程录制再打标,流程极重;他们用改良的Isaac Sim物理仿真模型,在虚拟环境中生成机械臂抓取、叠被子等类真实视频,降低对实采数据的依赖。
  • 智元的路是政企合作联合工厂:设备进厂、操作员戴采录设备,合同约定回采80%—90%的数据,工厂可在正常产出之外获得额外的数据输入;智元“一心要工业化落地”,最近又做了智慧码头。
  • 宇树做最酷炫的东西,本体全球领先;主持人认为其重要护城河还包括生态——去年蛇年春晚转手帕的技术出自与英伟达和CMU顶尖实验室的合作,“这个生态是国内其他具身公司很难追上的”。宁对主持人关于真实数据回采价值的判断表示“非常正确”。

5. 新面孔松延与魔法原子:技术不缺,缺的是商业标签

  • 宁看松延:背靠清华北大,似乎还有北京市政府支撑;工程师团队以95后、清华北大毕业生居多,小顽童在机器人马拉松上获得过亚军——技术“无需担忧”,但“还没有走出来自己特别有特色的商业化路径”,需要像前三家公司一样把应用场景绑定并宣传出来。
  • 主持人判断魔法原子可能是这几家公司中估值最低的,提到其几十亿元量级估值和相对有限的产品露出;宁没有直接核实这一判断,只强调这类公司要讲好商业故事、找好商业生态。关于其与追觅的关系,宁说“坊间似乎已经认定”,但未作确定确认。
  • 宁的底层判断:中国工程师供给之下,“各家在技术上的短板差距不会特别大”,行业偏同质化——谁做出差异化、品牌和技术长板,谁就能建立分水岭;“当它有了自己的特点之后”,有意向的投资人或用户会自发找到它。

6. 智元弃春晚的务实逻辑:工厂里天天都是春晚大考

  • 宁的翻转视角:春晚式的高压大考在工厂“时时刻刻都会存在”——VLA大模型无论Gemini、GPT还是Claude,都不可避免存在幻觉;对话里的幻觉可能只是引错文献,但在工厂“可能就会引起财产甚至生命的损失”,对品牌会造成巨大负面影响,宁以新能源车事故或起火造成的舆论危害作类比。
  • 结论:“一个公司要认清楚自己的产品服务谁”——宇树要炫最先进运控,上春晚是对的;智元要进工厂,把钱集中到工业合作上,宁认为“也是正确的”。

7. 退潮与洗牌:投资人会照着新能源剧本再走一遍

  • 对“2025年第一波机器人退潮已发生”的说法,宁的校准是:如果说完完全全退潮,可能还为时尚早;小公司此时进入“不是一个明智的选择”,对中大型品牌谈清退机制“还为时尚早”,只是这个时间“也没有想象的那么长”。他以哪吒、威马、高合等新能源品牌的事实退场作参照。
  • 有过新能源经验的投资人会沿路径找“最有可能复刻的”项目:有商业模式、有目标用户,最重要的是让目标用户知道“我想实现我的目标,我就得买你的”。
  • 创业者仍前赴后继的两个原因:市场理论上接近无限——每个家庭一台或每个工厂十台“都是无比广阔的市场”;且国内工程师与供应链很强,做出一个具体产品相对容易,再拿它获取投资——这是宁所说的“2025年的现状”,2026年、2027年是否仍会如此尚未知。

8. “本质上是To LP”:AI时代的泡泡与具身可算的ROI

  • 主持人抛出行业说法:不存在To B/To C,“本质上是To LP”,订单与财务收入很多来自融资项目,并存在关联交易。宁表示“我认为就是这样”,认为这是AI与机器人时代的共性——马斯克称如果没有AI这波狂欢,美国“可能马上就要破产”,OpenAI、甲骨文、英伟达互相融资、互相吹泡泡,“大环境如此,也不用过分苛责”。
  • 但宁认为中国具身智能的泡沫比美国AI“好一点”:ROI可算——假设工人年薪7万元、机器人40万元,回本要六七年;“但假如这一台机器人可以顶替两到三个岗位,可能两年就能回本”,看得见、摸得着,比AI更有商业场景。
  • 对照AI的付费模式至今没搞清楚:大厂为绑定用户把App端做成免费;宁提到腾讯请姚振宇过去、给两个亿招人才,纯靠元宝目前看很难收回。视频模型不开源,定价贵了用户不买账、便宜了又难以收回昂贵的数据和服务器成本。

9. 四种商业模式里,To Lab有天花板,租赁表演像大疆

  • 宁明确看空To Lab的持续性:学校经费不是无限的,一百万元项目买一两台就花得差不多,结项周期两三年内未必复购;特朗普上台后冻结许多教育经费,美国项目反而难申请,“To Lab订单的增量绝大部分来自中国”。中国本土又逃不开周期问题,除顶尖985高校外,年年都有几百万元大项目很难。
  • To B里的租赁和表演模式,宁认为“可能是一个比较好的模式”,参照大疆:几千架无人机集群卖到海外,给阿拉伯富豪提供情绪价值,为他们画头像。

10. 宁的2026三大预判:人类视角采数、跨场景ROI、RL自主进化

  • 数据采集通用化:操作员头上绑摄像头、手腕处戴手环或绑摄像头,学的是“动作逻辑”而非电机参数——电机参数换一台本体就难以继续使用,人类视角数据经模型映射后具有通用性,机器人迭代后也可以接着用这批数据训练。智元的联合工厂已经宣传过这套方式。
  • 跨场景是算清ROI的钥匙:过去码垛的只能码垛、搬运的只能搬运,工厂根本算不清回报;VLA加持下,一台机器人若能“像真人一样代替整条生产线上的工人”,采购意愿才可能真正起来。
  • AlphaGo式进化:2025年已有机器人陆续进厂,能否像AlphaGo靠强化学习越下越强——“人做一个岗位二十年一定是领域内的专家,机器人能不能也在一个岗位做二十年成为专家?”若部署后能自主寻优,进化速度可能比现在更快。

11. Seedance 2.0(正方):物理一致的视频生成就是某种世界模型

  • 宁的核心命题:能生成与现实物理一致视频的模型,“就可以认为它是某种世界模型”。他认为Seedance 2.0的突破在物理一致性:大幅度动作看不到明显穿模;他举的样本包括特朗普骑马时白衬衫下的小肚子随马一上一下地跳,以及动作大胆的打斗视频。
  • 对具身的诱惑:把奥特曼大战换成机械臂抓取、叠衣服,只要物理一致性保得住,它就是“低成本的、源源不断的训练数据生产厂”——省掉实采和打标签的高成本,足不出户即可持续生成数据。
  • 定性:“有点像二零二五年春节前的DeepSeek时刻”——从特定用户工具变成“什么东西都能做的玩具”。宁认为Seedance支持原生2K,物理一致性可直接对标Veo 3,当前时间段“已经实现了对国外的技术超越”。

12. 但视频模型难以开源、蒸馏后效果不好:2026反而加深大厂垄断

  • 与DeepSeek的关键不同:视频模型数据与运算成本极高、使用私有数据训练,“开源本来就是一件很亏的事情”;它也不像语言模型那样容易通过蒸馏保持效果,蒸馏后效果不好,用户可能不愿意使用,仍需原生大参数模型部署到大型服务器。
  • 由此推论:世界模型/视频模型的技术升级,宁预计至少在2026年仍会由互联网大厂主导,并“加深大厂的技术垄断优势”;厂商会打造封闭环境让用户付费。Sora曾宣称可以替代90%的CG及广告行业工作,但没有完全做到;宁对Seedance替代许多中低成本CG和广告生成工作仍“比较乐观”。
  • 私域数据解释了国内格局:语言模型训练很多使用公开公域数据,多模态模型更多依赖各家的私域视频——字节Seedance、快手可灵领先,正因为它们本身是短视频或视频类社交平台。

13. 为什么是短视频公司赢:固定输出帧长度的一堂技术课

  • 宁的类比讲解:语言模型预测下一个Token,可以一直往下生成;Transformer加Diffusion的视频模型则像“给你三十二张纸,你把这三十二张纸画满,OK,视频生成好了”——输出是固定帧长度,恰好落在短视频的优势区间。长视频训练会造成时序断裂、属性对不齐。
  • 超长生成靠接龙:用30秒最后一帧作为下一轮起点拼出60秒,代价是不可控的细微漂移,“到后面人可能都长得不一样,或者性格动作有很大偏差”。

14. 2026最热vs最重要:视频世界模型的诱惑,与具身的Scaling Up

  • 最热的方向是基于视频模型的世界模型:在符合物理规律的前提下所见即所得,能做短剧、CG、游戏创意,更能替工厂生成第一人称、第三人称和全厂视角的数据——机器人“上岗那个瞬间已经是有几百天工龄的老专家”,进厂调试可从六到八个月压到“六到八周,甚至六到八天”。
  • 最重要的方向是具身能否实现Scaling Up:现在的VLA“本质上吃的是大语言模型的老底”,以较好的基础模型为基础微调,还要人工精心打标;若能用一大批纯第一视角或纯机械臂数据从零训出“机器人的大脑模型”——像小孩接受几万乃至几百万小时视频后涌现智能——A工厂换到B工厂只需“干个半天”就熟悉环境,“那时候就是一个具身智能的新时代”。

15. 姜哲源春晚一线:全家族登台、《奶奶的最爱》与隐藏的名头

  • 松延不是单机上台而是全产品家族:小顽童N2上两台(奔跑、空翻、侧手翻),一米四的E1(拟人行走、变魔术、伸脖子比王天放还高的梗),9998元的小布米“戏份相对比较大”,外加仿生人产品线。
  • 节目是与蔡明、喜人奇妙夜冠军王天放合作的小品《奶奶的最爱》,如不出意外第三个播出、约八点半:孙子久未回家,被机器人蔡老师一直怼,并与几个小机器人争宠,最后合跳一支舞。
  • 仿生蔡明是节目最大的梗:一比一复刻、拥有超高自由度和仿生表情;后台明星路过打招呼“蔡老师好”,机器人不理,仔细看才发现是仿生的蔡老师。
  • 名头的玄机:四家公开名头各不相同——银河通用称“具身大模型机器人”,宇树称“春晚机器人合作伙伴”,魔法原子称“战略合作伙伴”,松延称“春晚人形机器人合作伙伴”。松延原定“春晚独家仿生机器人合作伙伴”,但一露出就会剧透节目,最终用“人形”盖住“仿生”。

16. 台上没有真正使用大脑:预录台词、人工遥控、没有预案

  • 主持人先提出“目前没有一家会真正把所谓的大脑搬到舞台上”的判断,姜哲源表示认同,并补充“大家主要还是以运控为主”。台上不能让这类AI真正运行,姜称“没法保证绝对的安全”,所以台词提前录好、机器人由人操控;被追问原因时,他只说这是“一个现实情况,不是我能解释原因的事情”。全自主奔跑要到今年四月的马拉松展示。
  • 风险结构决定了压力:歌舞类节奏严丝合缝,出错时可切备播带;小品类节奏靠演员把握,难度更高,“这是让我们压力最大的一点”。被问到预案,姜回答“说实话,这个预案没有做”——能做的是每次上台前熬夜,把每台机器整体检查一遍。
  • 姜所说的四家各有分工:宇树表演武术炫技,松延做语言类小品,魔法原子据说上歌舞类,银河通用与沈腾合作微短剧,体现一些大脑与上肢操作能力;姜也承认这类能力“在公众层面的展示度和关注度”不如舞蹈、双足。

17. 仿生人的商业逻辑:导游导览、“奇观属性”与相似度争论

  • Killer场景的答案是旅游导览:招不到导游“不是工资的事儿”——要背几万字讲稿、出错还可能被罚钱,令人望而却步;仿生机器人“完全可以很轻松地记住所有讲稿”。当前形态是轮式底盘加人头,已经实现梯控、自主规划和自主回充。
  • 主持人追问为什么非得像人,大白、机器狗是否也可以;姜认为猎户星空、小笨等纯轮式导览机器人没有起到特别好的效果,核心是“本身不具备关注度和话题度”——人们去景区、博物馆是为了看奇观,一个带人脸的导游会让人产生“天然被吸引的感觉”。
  • 主持人问太像真人会不会让人害怕;姜承认第一次见Hanson Robotics的Sophia时,想上去摸一下都觉得“是不是有点不尊重它”,但判断这种震撼“更多是积极的”。他也作了区分:真正进入家庭干活的机器人,“加一个仿生脸的意义可能不是百分之百的必要”。影视是另一个需求场景;姜称全世界仿生脸做得最好的公司是Disney。

18. 连杆驱动vs绳驱:一句“全球最领先”的技术底气

  • 姜把Sophia所采用的绳驱方案称为“可能算是上一代技术”:用电机拉线驱动面皮,钢丝绳随使用次数增加可能发生不可逆塑性形变——绳子可能越用越长,仿生控制就不精准;Disney的卡通仿生形象,如《疯狂动物城》的牛局长,自由度需求相对不高。据此他称松延在仿生人整体技术方向上处于全球领先,与大部分公司可能存在代差。
  • 松延独创的是连杆驱动面皮与仿生人脸皮结合的技术:连杆不能像绳子一样自由弯曲走线,设计难度高得多;脸皮本身也存在两难——太厚小电机拉不动,太软则会塌在骨骼上。松延使用铂金硅胶,已从进口材料换成国产材料。

19. 春晚三十多年未有人买走景片;宇树“远远超出预期”

  • 第一次进央视一号厅合练时,蔡明和王天放“演得非常好”,自家机器人走位“说白了都没有练好”。当晚半夜两点,姜把台上小品的景片搬回公司,一比一复刻整个春晚场景排练;据姜后来听说,春晚历史上三十多年没有人把主舞台景片买走过,松延“可能算是第一个真正意义上做这件事的人”。蔡明、王天放也多次来公司合练,导演组评价松延是四家里“最努力的”。
  • 对同行的姿态:外界以为竞争激烈,实际“处于不同的赛道”;“我们不太关心别人怎么样”,帮助演员团队和节目组演出好节目,是“最重要、也是唯一重要的一件事情”。
  • 姜对宇树的评价最为突出:“远远超出预期”——空翻、跳鞍马、飞檐走壁、醉拳都很精彩,“宇树还是当今全球机器人运控的第一名”。他读书时就买过宇树机器狗、加过王兴兴微信,也曾几次去杭州请教。

20. 小布米9998元:降价是开新市场,不是内卷

  • 小布米90多厘米,是“史上第一个万元级高性能双足人形机器人”(姜称此前应只有万元级机器狗),瞄准K-12编程教育、讲故事与陪伴,目标是“人形机器人里真正意义上第一款销量突破1万台的产品”。
  • 姜的定价哲学是这段访谈里最完整的推理:降价有两种可能——同场景切份额,“这个事情没有意义,总有人能比你降得更低,最后所有人都没有利润”;或打开全新客群——9998元“一下子打开了所有C端客群,尤其是有孩子、相对高净值的家庭”,是做巨大增量而非切存量,“不是为了卷而降价”。
  • 与宇树的差异化:人形机器人场景“呈现一个多而散的状态”,还没有特别巨大的Killer应用,两家重合度本就不高——宇树做科研、教育、表演,客单价更高;松延做K-12与陪伴,选择竞争相对少一些的场景和价格带。姜同时强调,松延产品与纯AI陪伴类产品存在区分,并不完全是同一类人群。

21. 量产的含金量:双重设计与供应链三角

  • 数字先行:宇树2025年自己公布的数字“应该是”生产了5500多台人形机器人;松延产1000多台,去年年底达到单月产能500台,今年预计单月突破1000台。姜也承认宇树“在本体设计到整个生产环节上确实有竞争优势,也有时间积累形成的壁垒”。
  • 量产到底难在哪(姜自问“多雇点工人不就解决了吗?”):一是设计——本体图纸之外,还有工艺工程师设计工装、检测工位和整条产线;二是供应链三角“周期、成本、质量”,最大痛点是交付周期,解法是资金够时为核心零部件建立库存、抵抗波动,并从成品库现货直发。
  • 2025年供应链生态变化明显:机器人大部分供应链与消费电子、汽车耦合,唯有关节是机器人特有的板块;供应商中出现定制开发、零售、KA大客户等不同服务形态。姜认为行业越来越成熟,对松延“肯定是好事”。

22. RL没有Scaling Law,世界模型炒不熟西红柿鸡蛋——Seedance的反方

  • 针对王兴兴“机器人RL的Scaling Law还没有出现”,学Deep RL出身的姜更进一步:“单纯Deep RL本身并不存在所谓的Scaling Law”——RL数据来自Replay Buffer和仿真Rollout,不是外部信息;“讲RL加Scaling Law这个事情有点怪”。他认为,真正可能谈Scaling Law的情况,是用大量人类动作数据训练全身操作的RL Agent,以及上肢的VLA。西湖大学、宇树在相关方向做得不错,松延也有初步成果,预计年后发布;训练范式则从2024全年至2025年上半年以手工调参为主,转向2025年Q2—Q4的人类动作数据驱动,“现在也是”。
  • 对世界模型派的釜底之问:世界模型=渲染器+物理引擎;“做西红柿炒鸡蛋——蛋液在不同温度下从液态变成固态的过程,这个事情能学出来吗?学不出来,它提供的信息就是有偏差的”。
  • 主持人转述宁的Seedance观点后,姜直言“我不是特别认同”:Seedance渲染很真,但“物理过程非常非常失准”——即使专为物理世界设计的Isaac Gym,精度也不算高,Sim-to-Real Gap仍然较大;他前一天在小红书刷到Seedance 2.0生成的玩具火车,出现乱飞乱蹦、经常突然消失等不符合物理规律的现象。
  • 结论毫不含糊:多模态生成数据会大大推进机器人训练速度吗?“我觉得一定不会。当然,如果我说错了,我就为我的错误买单——买单就是我错过的机会成本。”双方都承认这是行业尚无共识的路线之争,各自有各自相信的方向。

23. 洗牌快有定论,场景战开打:第二名没有意义

  • 姜给2025年的注脚:抛开技术,行业最大变化是“从Demo走向量产的从零到一”;还没规模化生产和销售的公司“大概率会考虑转型,或者失去上牌桌的机会”,卡点是资金体量与时间周期——“出来太晚的公司,这么短时间确实来不及做好一款能交付的产品”。
  • 资金面印证主持人的消息:姜认为头部具身企业账上“应该都不少于10亿元人民币”,中腰部和尾部也有几个亿现金,至少有1亿到2亿元——“这个行业不会那么快死,但说实话也不会过太好”。剩下的企业要么凋亡、要么转型或在细分领域做差异化,除非“新的技术黑天鹅出现”,牌面仍可能改变。
  • 价格战没开始,“场景战”开始了:“第二名没有意义,只有成为第一名,市场占有率达到80%左右,可能才会有很好的复利”。他认为站稳场景第一名的有宇树和云深处(巡检),松延要占的生态位是K-12教育。自评仍“在牌桌边缘上”——总台春晚之后,“站位会稍微稳一点”。
  • 松延自己的2025是补短板之年:2024年或2025年年初时“全是搞技术的”,甚至没有人力资源和销售;花一整年建组织,至少让公司像一个正规公司,而不是纯实验室。姜认为现在已经到了需要交出第一份小答卷的阶段,拼的就是量产和商业化。

Verification Notes

  • Transcript前段由主持人列举五家最终登台公司,后文主持人与姜哲源多次按“四家”讨论,未据此确定追觅是否属于同一口径的登台企业。
卫诗婕

你们现在应该是在春晚彩排的现场,对吧?

姜哲源

对的,Hello,大家好,我是松延动力的创始人姜哲源。

卫诗婕

这是你们第一次登上春晚吧?

姜哲源

对,没错。

卫诗婕

紧张吗?

姜哲源

我肯定是紧张的。

宁慕楠

目前没有一家会真正把所谓的“大脑”搬到舞台上,大家主要还是以运控为主。春晚一开始是宇树和智元之间的“双雄战争”,后来就变成了“四强争霸”。智元当时开到了6000万,但是宇树开了一个更高的价格,所以智元就退出了。

2026年,大家就要拼这一口气。比亚迪已经出现了,谁能成为具身智能的“蔚小理”呢?

卫诗婕

首先祝大家新春快乐。这是为马年春晚特别奉上的一期节目。起因是,这是机器人浓度最高的一届春晚,背后也是如火如荼的具身智能产业发展。希望这期内容能让大家更好地理解和观察,今年春晚的具身智能大战到底有哪些看头。

这期内容共有两场访谈,分别来自行业纯粹的第三方视角,以及来自春晚彩排一线的具身企业创始人视角。第一位嘉宾是具身行业从业者、北京大学在读博士生宁慕楠,宁老师是具身行业公司安努智能的世界模型科学家,曾在TPAMI、NeurIPS等顶会发表论文十余篇,目前主要聚焦于多模态领域的研究。

第二位嘉宾则是登上春晚的人形机器人合作伙伴——松延动力的创始人、1998年出生的创业者姜哲源。这次录制是线上连线,录制时哲源正在春晚的彩排现场。他透露的信息和观点,能很好地和宁老师的一些判断互为补充。

我们一起聊了聊本届春晚多家具身智能企业亮相背后的幕后细节、行业风向以及最新的前沿研究方向。有趣的是,针对Seedance 2.0这一现象对于具身行业会产生什么样的价值,两位嘉宾的观点截然不同,目前行业也没有取得共识,仅供大家参考。

欢迎宁老师先和大家打个招呼吧。

宁慕楠

大家好,我叫宁慕楠,来自北京大学。我之前在腾讯工作过,主要研究方向是多模态以及AI for Science,对世界模型也有一定研究。目前我在一家具身智能公司安努智能担任特聘科学家。

卫诗婕

非常不好意思,春节还拉着宁老师一起录播客。主要是因为你是产业里的从业者,而今年春晚几个机器人一起登上总台春晚的这种盛况,确实还有很多行业现象值得讨论,所以非常感谢你。

1. 春晚一亿元入场券

那我们就直入主题吧。先来聊一聊今年总台春晚机器人竞逐的内幕。我先说一下我了解到的一些情况,其实在业内,这场角逐被圈内人戏称为“一亿元的入场券”,主要还是指机器人赞助春晚这件事情的大战。尤其比较瞩目的是,最早智元机器人其实也想要上总台春晚,但最后临阵退出了,大家都很好奇这其中到底是怎么回事。

据我所知,智元当时开到了6000万,但是宇树开了一个更高的价格,达到1亿元,所以智元就退出了。智元退出之后,非常傲娇地说:“上总台春晚不如我自己办个春晚。”前几天,他们办了一个所谓的“机器人奇妙夜”,想用这种自办春晚的方式也蹭一下春晚的盛况,同时有效降低自己的成本。因为他们认为,花1亿元的成本,可能够签好几个联合工厂的项目。

宁慕楠

这个其实跟我听说的还蛮一致,但1亿元我还没有跟宇树核对过,我们先忽略这个数字吧。我听说的是,因为春晚的露出时间不可控,只是很短的一段时间,但是大家都知道赞助费其实很高,所以智元可能评估下来觉得,花这么多钱最后只是露出一小段,不是特别符合他们的期望。

所以他们前几天自己搞了一台单独的机器人直播,时间还蛮长的,好像有1个多小时。

卫诗婕

对吗?

宁慕楠

对,是大约1个小时的节目。他们请到了200多个机器人。当然,这200多个机器人其实是非常巧妙的,因为大部分都是所谓的观众,真正上台的可能也只有十分之一。

但它的优点是彩排成本很小,实际工作人员也相当于只有200多个机器人的十分之一。更多的是类似机器人表演公司的彩排,而不是自己的工程师,这样可以大大降低成本。

另外,据我所知,智元宣称“机器人奇妙夜”其实是收支平衡的。它有几百万的成本,通过合作品牌方的露出已经收回来了。他们还表示,希望把这个“机器人奇妙夜”在未来几年做成自己的机器人春晚,一年一年地做下去。

卫诗婕

这还挺有意思。以后机器人公司搞机器人春晚,会成为一种文化延续下去吗?因为我感觉,如果今年只有智元做,明年可能会有更多公司做。

宁慕楠

对,因为毕竟这是一个成本更低的方式。如果机器人春晚做出来了,也有了收视率,那么未尝不是一种未来可以发扬光大的形式。

卫诗婕

你看了那个机器人春晚吗?

宁慕楠

其实就今年来看,它流传的程度还比较小,大部分见于一些宣发稿,网上看到的也是一些片段,比如让机器人演一些小品。

目前来看,确实不如真人春晚有吸引力,这个差距还是非常明显的。

卫诗婕

你看了那个晚会吗?

宁慕楠

因为它的曝光度低,甚至在一些头部平台都没有。我只是专门去搜它的通稿,里面会有一些片段,比如让机器人模仿、表演一些相声小品之类的,然后仅限于此,也没有看完,因为确实吸引力不是特别高。

2. 机器人的大脑登场

卫诗婕

其实去年总台春晚也已经露出了机器人方阵。整体排下来的效果,比这次机器人奇妙夜好看很多:几十个机器人在总台的大舞台上扭秧歌,甚至转花手绢,震撼程度还是不一样的。

我有一个特别好奇的点。谈到去年蛇年春晚,宇树登上春晚舞台扭秧歌、转手帕,我理解那个更多是呈现机器人运控的技术秀肌肉,对吧?

今年我本身比较期待的,一是在运控层面又有哪些突破,另外就是机器人除了运控之外,现在还想体现它“大脑”的能力。我理解,智元那场机器人晚会里很多小品、相声类节目,其实是为了体现它的大脑反应能力,或者说大脑的表现。

宁慕楠

是这样的。今年好几个公司都提出了“大脑加小脑”。所谓大脑加小脑,其实就是一个大模型,或者说VLA模型,它能够理解语言。如果它有对应的发声模块,就可以实现语言交互。

小脑则是一些垂直的小模型,比如3D视觉检测,以及手臂、机械臂的控制等。大脑算是今年的一个亮点。VLA,也就是Vision-Language-Action,它赋予机器人一些类似于我们在桌面端使用GPT、Gemini或者DeepSeek时那样的能力,让机器人能够像人一样理解和说话。

我认为这是一个突破。VLA除了可以对动作进行统筹之外,它理解人的需求以及进行发声沟通的能力,我认为也是未来比较有前景的方向。

具身智能有两个典型应用场景。第一个是工厂。如果一台机器人能够与现场工人进行一些简单交互,就可以极大降低危险性或者提升效率。

另外一个是目前稍微有点远的家用场景。家用场景里,大家想要的不是一个安安静静待在那里、帮你叠衣服的机器人,而是一个能够与你沟通、提供情绪价值的机器人。那么这种大脑思维和对话的能力,可能就是未来一个比较重要的方向。

卫诗婕

智元那场晚会里的小品节目,为什么没有起到这样震撼的效果呢?既然它体现的是大脑能力,可能单纯就是曝光度不够。所以我们可以期待一下,总台春晚会不会秀出它的大脑能力。

宁慕楠

如果总台春晚今年不再局限于运动能力——其实今年的运动能力已经比去年又进了一个档次,在一些歌手的演唱会上已经使用机器人伴舞,可以完成非常夸张的大幅度动作——那么这也是今年机器人春晚可以看到的内容。

如果今年总台春晚能够看到机器人做出比较好的交互沟通,可能反而会让人们回头去看:原来智元在自己的“小春晚”里已经体现出了这个能力,进而引发更多讨论。这样大家就会明白,目前的具身智能或者机器人,不再只是一个呆板的、可以工作的东西,而是一个可以对话、提供情绪价值的对象。

所以,所谓“一亿元春晚”可能还是有它的价值的。它在上面展示出了话题度,因而能够得到全民认可。

3. 2026年的机器人竞逐

卫诗婕

这次春晚我了解到的情况是,各家公司应该从年中,大概五六月份,就已经开始角逐谁能登上春晚。我们看一下最终登上总台春晚的公司,其实是银河通用、宇树、魔法原子、松延动力,还有追觅这5家公司。

听说一开始是宇树和智元之间的双雄战争,后来就变成了四强争霸。您大概知道这个过程当中经历了什么吗?

宁慕楠

这也很合理。2026年其实是一个非常重要的年份。一方面,机器人已经烧了一年的钱,投资人想要看到更多成果,所以宁愿多烧一些钱上春晚,提供曝光度。

另一方面,现在有一点像之前新能源汽车的状态:比亚迪已经出现了,那么谁能成为具身智能的“蔚小理”,大家就要拼2026年的这一口气。因为新能源汽车从爆发到产业落地,最关键的也就那么两年的时间,所以我认为他们在2026年这个时间点进行争夺是非常合理的。

卫诗婕

宇树仍然应该是今天行业里毫无疑问的老大,对吧?

宁慕楠

对的。

卫诗婕

除了宇树之外,另外几家现在都是创业公司融资进行中的状态。比如松延动力成立才两年,但是也要花一个不小的经济代价去上春晚,这件事情过去在行业里面也不会特别常见。

宁慕楠

是的。具身智能这一块,投资人还是非常狂热的,因为它理论上是一个接近无限的市场,可以融入现在几乎所有行业。

理论上,计算智能可以替代工业中的很多工作;道路交通也可以把自动驾驶车辆理解为某种具身的四轮机器人;还有家政服务行业。大家都知道,不管是国内还是国外发达国家,养老的成本以及需求都会越来越大。

在这么大的投资兴趣下,最重要的就是让自己成为投资标的。成为投资标的有两种方式:一种是像追觅母公司,或者像DJI大疆这种,有成熟的商业模式,能够把自己的产品卖到全球几乎所有地方。大家会觉得“我的生活离不开你”,那么你就会成为一个非常健康的标的。

另一种就是在这个阶段,有点像新能源车的“蔚小理”,通过不停造势使自己进入公众视野。比如理想建了很多超充站,蔚来建了很多换电站。我认为,类似松延动力和银河通用这几家公司,也是为了让自己成为投资标的,获得更大的曝光度,在它们认为值得的时候做这件事。

4. 各家公司的技术护城河

卫诗婕

能不能从您业内的视角,给我们介绍一下这几家公司?我估计大家对宇树都比较熟悉,但对其他几家应该没有那么熟悉。

宁慕楠

我之前研究过银河通用,它确实也是现在融资最高的具身智能公司之一。王鹤教授也是国内具身智能方面的专家,更多代表仿真数据这一派。他认为使用仿真数据训练机器人是一条可行的路径,而且应该多多使用。

除了宇树这种To Lab的形式外,我们可以重点聊一下银河通用和智元,它们还是比较有特色的。

银河通用的特点就是,王鹤教授是一位非常厉害、学术成果非常好的教授。他认为可以通过构建仿真系统,利用物理引擎来构建数据,从而降低对真实采集数据的依赖,也就是真人在现实中实时采集数据。

卫诗婕

对。

宁慕楠

银河通用目前还有一些比较有意思的场景,好像还做了咖啡机器人,摆放得也挺多。

仿真数据的一个优点,就是非常有吸引力。因为如果你想采集机器人的数据,要准备一台机械臂或者一台机器人本体,最少也得20多万;然后还需要操作员对它进行编程和录制,录制完之后还需要打标,这是一个非常复杂的过程。

为了解决这个问题,银河通用利用他们改良过的Isaac Sim物理仿真模型,经过后期渲染,在虚拟世界里面对机械臂进行一系列抓取、堆叠的操作,比如抓物体、叠被子等,把它渲染成类似真实世界的视频,利用这些视频作为机器人的训练数据。

智元采用的是另外一条路,也就是利用政企合作的优势,建设了很多联合工厂。他们会找一些劳动密集型区域,联合建厂,并把自己的设备放进去。

他们的要求是,工厂里的人工操作员要戴上采录设备,同时他们承诺,除了正常产出之外,还会根据合同回采数据,比如回采80%或者90%的数据。对这些工厂来说,这种方式非常有吸引力,因为除了正常产出,还能获得额外的数据输入。

智元坚持一定要让机器人实现工业化落地,所以他们每次宣传都会说“我又做了什么”。比如最近又说去做了智慧码头,进行码垛整理之类的工作。

目前这几家公司都有自己非常明显的特点。宇树就是想做最新、最酷炫的东西,而且主要卖给实验室。

卫诗婕

稍微补充一下。据我所知,宇树现在也不只是卖给实验室,机器人商业化和To C市场也是他们瞄准的方向。

宁慕楠

对。宇树更想做的是:我的机器人就是最酷炫的,可以做到很好看、很酷炫,或者做一些非常有研究价值的事情。

银河通用认为,可以通过自己的技术手段和虚拟构建快速迭代。智元则是一心想做真正的工业应用,通过不停进行工厂合作,实现工业场景里的实打实迭代。

卫诗婕

我再补充一下我的理解。宇树一直坚持做运控,所以它是想把机器人本体做到全球最领先,事实上现在也是全球最领先的。因为它已经处于全球领先地位,所以能够拥有非常独特的生态伙伴资源。

比如去年的蛇年春晚,我们看到扭秧歌、抓手帕的那套技术,其实是他们和英伟达、CMU的顶尖实验室合作完成的。这个生态我理解是现在国内其他机器人公司很难追上的。能够和全球最顶尖的实验室合作,也是宇树这么多年来积累下来的护城河。

宁慕楠

是的。

卫诗婕

银河通用的重点,我理解还是在“大脑”。王鹤教授主要是数据仿真派,认为通过仿真数据可以实现非常好的训练效果,他们也在践行这一套。

至于智元,听众也可以到我的节目专题“Robots Coming”里了解具身智能。其中有一期是我陪伴智元机器人进工厂的内容,很好地体现了智元的战略。

我特别欣赏它坚持让机器人进工厂这一点。大家都知道,现在具身智能训练有一个非常大的瓶颈,就是数据不够。通过让机器人进工厂去工作,同时回采数据,能够不停扩充来自真实工业场景和使用场景的数据,补充机器人所需要的数据。

我不知道这个理解得对不对?

宁慕楠

非常正确。通过这种方式,确实可以不断扩充数据。

卫诗婕

刚才讲的这三家,其实也是中国具身智能目前所说的“三足鼎立”的3家估值最高的头部公司。其他两家就是魔法原子和松延动力,是这次春晚亮相的两个新面孔。您要不要也给大家介绍一下这两家公司有什么特点?

宁慕楠

松延动力在我们看来有一个特点,就是同时背靠清华和北大,似乎背后还有北京市政府的支撑,所以它有一个得天独厚的优势。

但是目前来看,它不像刚才说的那三家公司,还没有走出自己特别有特色的商业化路径,这可能是我们后续要关注的点。

卫诗婕

能够看出来,这家公司在资源上应该会有一些优势。同时,它的技术实力也很有优势。它的“小顽童”在去年的机器人马拉松上,如果没记错,应该是亚军。

宁慕楠

对,所以说明它在运控方面还是有很大优势的。而且它毕竟背靠清华和北大,工程师团队也很强。他们每次都会宣传自己的工程师团队非常年轻,都是95后,清华北大毕业生居多,说明技术实力无需担忧,支撑也还不错。

但目前来说,它似乎缺乏的是对未来方向的判断。如果想打出自己的特色,可能要像前面说的3家公司一样,牢牢绑定并宣传自己的应用场景或特色,让大家一听就知道:原来松延动力注重的是某一个领域。

类似的还有刚才主持人提到的魔法原子。尽管魔法原子极力撇清,但坊间似乎已经认定它就是追觅投资的。那么,追觅作为国内领先的家用智能场景企业,布局具身智能是非常合理的选择。

据我的判断,魔法原子也需要打出自己的商业品牌或者商业模式,让大家意识到,原来它在家用场景有自己得天独厚的优势。如果能把这个方向做起来,它也可以像新能源汽车里的“蔚小理”一样,拥有自己的生态位,在后续或许可以活得比较长远。

卫诗婕

这几家公司当中,目前估值最低的应该是魔法原子吧?几十亿元估值量级的公司去参与春晚,而且应该也没有太多产品露出。这个行为应该是为了抢生态位,把自己定位在第一梯队,对吗?

宁慕楠

对。对于这样的公司,我们会关注它能不能讲好自己的商业故事,找好自己的商业生态。

对于国内来说,有这么强大的工程师队伍,也有这么多毕业生,技术上应该不会有特别明显的落后。接下来就是看它如何找准自己的位置,让自己的用户群体知道:如果我要做这件事,就得买它。我觉得这是它需要做的。

卫诗婕

您刚才讲了一个很重要的点。您说中国有这么多具备工程能力的毕业生,如果他们参与到这个行业里来,其实各家在技术上的短板差距不会特别大,是这个意思吗?

宁慕楠

是的。

卫诗婕

也就是说,行业会偏同质化。这个时候,谁能做出差异化,做出自己的品牌和技术长板,谁就能建立分水岭。或者说,用现在投资领域常说的话,你要证明自己有护城河。

刚才聊到的智元、宇树、银河通用这3家公司,我们所讲的它们的特点,就是它们的护城河吗?

宁慕楠

我个人认为是这样的。当它有了自己的特点之后,对这方面有意向的投资人或者用户,就会自发地去找到它们。

5. 春晚验证工业可靠性

卫诗婕

您作为行业从业者,去年蛇年春晚看到宇树在春晚舞台上爆火之后,当时是什么样的感受?

宁慕楠

我们的第一反应就是:这个东西很厉害,做得不错。因为在春晚这样一个高压环境下,它能够做到没有出任何差错,完完全全跟着众多工作人员、舞台人员和演员一起,把整个流程完整地走下来,没有出差错,这是很了不起的。

但是话又说回来,春晚的高压大考,其实在工厂里面是时时刻刻都会存在的。可能这也是智元为什么最后决定不再花更多价钱去抢占这个机会,而是愿意把这些钱拿去多搞几个合作项目,或者养一支几十人的核心技术团队。

因为在工厂里面,大家都知道有很多不确定性以及危险性。现在具身智能这一块,大家普遍倾向于使用VLA这种大模型。大模型有一个问题,不管是Gemini、GPT还是Claude,大家都会发现它不可避免地存在幻觉现象。

如果只是对话,幻觉可能只是引用错了文献,或者计算错了数字。但如果是在工厂场景里,就可能引起财产甚至生命损失,而这种损失对品牌会造成非常大的负面效应。

比如今年极其有名的新能源汽车,它的一起车祸或者起火事故,都对几个风头正盛的品牌造成了很大的舆论危害。所以我认为,从工业或者务实的角度看,智元的思路可能是对的:一个公司要认清楚自己的产品服务谁。

像宇树,就是要炫最先进的运控,有最先进的运动能力,那么它上春晚是对的。像智元,它说自己就是要去工厂,那么它放弃春晚,把精力集中在自己的技术或者工业合作上,我认为也是正确的。

6. 具身智能的商业化考验

卫诗婕

好,那春晚我们就先聊到这里,接下来再聊一下行业的变化。

我听到一种说法,说2025年第一波机器人的退潮已经发生了。目前来看,它有一点像新能源汽车这个板块:一方面,由于新能源汽车产业链的成熟,导致具身智能的入场门槛似乎降低了;但另一方面,由于大家对产品的需求越来越高,真实用户想要的需求反而增加了。

宁慕楠

如果说完完全全退潮,可能还为时尚早。对于一些小公司来说,贸然进入或许不是一个明智的选择。但像我们前面提到的这几家已经有一定商业曝光度的公司,在这么多投资人的加持下,又处于整个社会看好的环境里,对中大型品牌来说,具体的护城河或者清退机制还为时尚早。

还没有到新能源汽车行业里像威马那样的小品牌完全退场的时候,但这个时间也没有想象中那么长。比如哪吒,虽然有“红衣教主”极力推动,但目前的现状已经很明显。像威马、高合等一些小品牌,也已经产生了事实上的退场。

在投资人已经有过一次经验的前提下,对机器人几十亿元规模的投资,也并不是说不眨眼就会继续往里面投。人总是会倾向于自己已经做过的事情。如果他投新能源车的那一批投资实现了,那么就会沿着这个路径,去找最有可能复刻成功的项目。

按照我的理解,最有可能复刻成功的项目,可能就跟前面说的一样:要有自己的商业模式,得有自己的目标用户,最重要的是让目标用户知道,如果我想实现自己的目标,就得买你的产品。我觉得,这是这些厂商未来除了技术进步之外,更需要做的事情。

卫诗婕

那为什么现在还不断有创业者跃入具身智能的浪潮?

宁慕楠

还是两个方面。虽然这个观点已经反复提过,一方面,无论是社会还是投资人,大家的认知里都认为具身智能或者机器人行业一定有非常广阔的前景。

举一个新能源汽车的例子。在2018年之前,大家想不到现在已经能够让小县城甚至小村镇里的每一家每一户,都开始购买新能源车了。如果中国有14亿人,假设有3亿个家庭,每个家庭都有一辆车,那就是一个无比广阔的市场。

同理,假如机器人进入每个家庭,或者每个工厂有10台机器人,那也会是一个非常广阔的市场。所以,投资人、政府和社会各界的共识,仍然是对这个行业有非常大的期望。

另一方面,国内的工程师以及供应链实在太强大了。现在的成本可能已经不像之前那么高。如果你不是想做最新的VLA,也不想研发基座大模型,只是想做一个产业里的具体子品牌,那么它仍然有一个不那么强的护城河。你想做出一个产品相对容易,然后拿着这个产品可以很好地拿到投资人的钱,这可能就是2025年的现状。2026年会不会这样,2027年会不会这样,暂时还未知。

卫诗婕

我听到行业里有一个说法:现在不存在To B或者To C,本质上是To LP。很多订单以及财务表现上看起来的收入,其实还是融资项目产生的,其中也有很多关联交易,是这样吗?

宁慕楠

我认为就是这样。这也是当今AI和机器人时代的一个共同现象。比如马斯克说,如果没有AI这一波狂欢,美国可能马上就要破产了。

最近OpenAI、甲骨文以及英伟达三方互相融资、互相吹泡泡,只能说大环境如此,也不用过分苛责。

卫诗婕

这是AI时代的特色产物吗?

宁慕楠

对。目前泡泡确实很好吹,这是AI时代特色的泡沫。

卫诗婕

但我一直在节目里强调,泡沫并不是一个绝对的贬义词,它其实是一个中性词。因为泡沫往往是繁荣共生、伴随繁荣产生的产物。只是说,这个泡沫是否在一个合理的范围内。

目前为止,您觉得它在合理范围内吗?

宁慕楠

比起美国来,我认为我们具身智能这一块还是会好一点。因为具身智能或者机器人的商业和付费模式已经被验证了。

很简单,一个实体工厂的厂长买一台机器人回去,就可以计算ROI。假如一个工人一年要发7万元工资,当然这个数字是我随便举的,然后买一台机器人需要40万元,那么回本周期可能就是6到7年。

但假如一台机器人可以顶替2到3个岗位,那么可能2年就能回本。这个ROI,也就是投资回报,是非常好算的。

从这个角度来说,具身智能比AI更有商业场景。首先,它是实打实的,你可以摸得到,它也可以反馈给你,能够做一些真实的人可以做的事情。

第二,我们可以聊一点AI。AI虽然很火,但是它的付费模式其实大家还是没有搞清楚。不论国内大厂还是国外大厂,为了实现技术领先和用户绑定,可能反而会把大部分App端口做成免费的。如果纯靠API付费用户,怎么收回成本呢?

据说今年腾讯请姚振宇过去,给了他2亿元用来招人才。这个钱纯靠元宝,目前看是很难收回的,对吧?

另外一个就是视频。比如前两天发布的Seedance,以及之前的OpenAI Sora或者谷歌Veo。视频模型的特点是不开源,所以用户想玩就必须使用它的工具。

但这里有一个尴尬的问题:如果定价贵了,用户就不买账,因为可以有更平价的替代品;如果定价便宜了,又如何收回昂贵的数据和服务器成本?这是一个问题。

从AI对比回来,再看具身智能。对投资人来说,具身智能更可靠,因为它有硬件,看得见、摸得着,而且还有一条可以参照的路径,就是新能源汽车。新能源汽车都说前期烧了很多钱,但是只要像比亚迪那样拓宽思路开始卖,大家就会觉得,好像这东西还真的能赚钱。

卫诗婕

我们来讲一下目前我看到的具身智能4种商业模式:一个是刚才讲过的To Lab,卖给高校实验室;一个是To Industry,比如智元走的路线,工业可能是To B的一个分支;To B还有其他领域的应用;以及To C。

这几种方向会永远共同存在,还是其中有一些只是阶段性产物?比如大家会认为,科研场景当中很多订单可能是泡沫,只是阶段性的产物。

宁慕楠

从我个人的角度看,To Lab确实不会那么长久。因为To Lab有一个很现实的问题:学校的经费不是无限的。可能一个100万元的项目买了你一两台机器人,钱就花得差不多了。

除非学校接下来每年都有新的项目,否则它要用两三年的时间完成结项,可能就不会再买新的机器人了。

倒是To B,据我所知,现在有一批租赁和表演的模式,我觉得这可能是一个比较好的模式,有点像大疆。现在大疆已经做出了几千架无人机的集群,甚至还卖到海外,给阿拉伯的富豪们提供情绪价值,用无人机画他们的头像,他们很喜欢,也很有意思。

卫诗婕

我认同您刚才说To Lab会有这样的问题。但如果是宇树,因为它有很多订单其实是卖给全球顶尖实验室的,那么对于那些全球顶尖实验室,您刚才说的科研周期、申请项目资金的问题,会不会好一些?

因为相对来讲,国外研究的氛围可能更长期、更宽松。

宁慕楠

这里可能有一个误区。其实这两年国内反而是项目比较多的。特朗普上台之后冻结了许多教育经费,现在美国反而很难申请项目。

所以,To Lab这些订单的增量,绝大部分来自中国。但中国本土又会有刚才所说的3年周期问题。你不可能今年申请一个项目,明年再申请一个,后年再申请一个,年年都有几百万元的大项目。除了顶尖的985高校,其他学校还是很难做到。

可能一些中游985高校的实验室买了两台机器人,就指望着这两台机器人出成果了。

7. 2026年具身智能路线

卫诗婕

能不能预判一下2026年具身智能的进展?您觉得会有哪些趋势?

宁慕楠

我们安努智能可能是从工厂这一块出发,所以我会从工厂或者工业的角度说一下未来进展。

首先是数据采集问题。数据是所有AI产业以及具身智能产业的根本。未来可能都会采用一种通用数据,也就是从人类视角采集的数据。

人类视角采集并不是什么玄乎的事情。你只需要在工厂操作员头上绑一个摄像头,在手腕处戴一个手环或者绑一个摄像头,就可以实现通用的数据采集,记录人是怎么干活的,学习动作逻辑。

这样采集出来的数据有什么好处?它不是具体的电机参数。电机参数换一台电机,换一个对应的本体或者机械臂,就没有办法继续使用。

但通过人类采集的数据,再经过模型学习和映射,就可以变成通用数据。即使机器人迭代成了新型号,也可以继续用这批数据训练。我觉得这是未来数据采集非常重要的方向。

实际上,智元的联合工厂也宣传过采用这套数据采集方式,从针对某一台机械臂的定点数据,变成通用的人类视角数据。我觉得只要技术实现了,大家一定都会想做。

因为人形机器人就是要学习人类。它学习人类的第一视角去干活,那么不管是哪一台机器人,都可以像人一样去工作。

第二点是跨场景以及成本优化。现在很多工厂即使买了机器人,也算不清楚这笔账,算不清楚回报率。过去很多机器人,码垛的只能码垛,搬运的只能搬运;把货搬到车上,还得找人开车,到了地方之后又要安排新的设备待命。

这一套下来,工厂该怎么算ROI呢?我认为通用场景非常重要,而且其实也可以实现。VLA的加持让机器人不再重复执行一些特定任务,而是能够像人一样思考,并对环境做出反馈。

它能够像真人一样,一个人去替代整条生产线上的工人。这样工厂就能算清楚ROI:如果它把整条线上的几个工作都做了,工厂可能就更愿意采购。

第三点,大家其实都知道AlphaGo。AlphaGo当初下围棋是怎么越来越强的?它使用了强化学习,先做出一个样本,然后不停地和人类棋手对弈,越下越强,后来强到人类九段也打不过它。

聂卫平老师说它可以达到20段水平,当然这是开玩笑。后来国内企业给它封了一个“九段阿尔法Go”的称号。它能够通过强化学习不断进化。

其实2025年已经有一些机器人陆陆续续部署到工厂里了。这些机器人能不能像AlphaGo一样自主进化?它能不能在一个岗位上不断工作、积累数据、寻找最优的优化方向?

毕竟人类如果在一个岗位上做20年,一定会成为这个领域的专家。机器人能不能通过强化学习,在一个岗位上工作20年,也成为这个岗位的专家?

过去,在机器人部署到实际岗位之前,大家还要求人类寻找数据、调参、教它怎么优化。如果未来机器人真正部署进去之后,可以自己优化,那么它的进化速度可能会比现在更快。

卫诗婕

您刚才讲了3个判断。第一个是数据采集层面,您觉得接下来2026年会越来越多地出现从人类视角采集数据的机器人训练方式,学的是动作逻辑,而不是具体参数。

第二个是,一台机器人可以干很多种工种,实现跨场景工作。这样带来的结果,就是它的ROI可能会更高,账也更算得过来。

第三个是,RL,也就是强化学习,能够让具身智能不断进化,从上岗慢慢变成专家,是这个意思吧?

宁慕楠

对的。

8. Seedance与世界模型之争

卫诗婕

我再问一个技术方面自己比较感兴趣的问题。最近我们都在关注Seedance 2.0的发布。我自己的观察是,它很像多模态领域的一个里程碑节点。我们可以看出,Seedance的视频生成能力有很大跃进。

如果未来我们可以用很低的成本、高效地生成各种环境视频和人物视频,会不会对具身智能训练的数据层面有所帮助?您怎么看Seedance 2.0?

宁慕楠

我从两个方向说。第一个,像Seedance这种具有高物理逻辑一致性的模型,视频生成模型是世界模型的基础。

如果视频生成模型能够生成与现实世界物理规律一致的视频,那么可以认为它就是某种世界模型。因为它生成的视频是按照真实世界的方式运作的。比如人撞到墙壁,就会有很明显的反馈。

这两天大家应该已经被Seedance刷屏了。它突破了以前一些模型的限制,不再只能做比较静态的画面。即使进行大幅度动作,也看不到明显的穿模,物理反馈也不会明显不一致。

假如把现在那些娱乐化的内容,比如奥特曼大战曼巴,换成机械臂抓取物体、机械臂叠衣服,如果它能够很好地保持物理一致性,那么它就可以作为低成本、源源不断的训练数据生产厂。

拿这批数据进行筛选,再配合真实采集的数据,我认为至少对工厂或者工业场景会有很大益处。大家都知道,真实采集还要打标签,采集和筛选成本很高。如果足不出户,就能让它源源不断地生成数据,价值会非常大。

另一个方面是Seedance本身。Seedance 2.0可能有点像2025年春节前的DeepSeek时刻:它从一个特定用户使用的工具,变成了一个“什么都能做”的厉害玩具。

它同时又隐含了去年DeepSeek实现中国对美国的技术超越。Seedance也实现了对美国的技术超越。

当然,视频生成模型和DeepSeek还是有一些不同。第一,视频模型的数据成本很高,运算成本也很高。厂商不像DeepSeek那样开源。目前可以看到,无论是Sora、Veo,还是之前即梦的一些模型,似乎都没有开源计划。

另外,它的使用成本也很高。大语言模型可以蒸馏到小模型上,比如一个223B的大模型可以蒸馏到一个32B的小模型,仍然能够跟你进行大差不差的简短对话。

但视频模型不一样。你想达到Sora那样非常好的拟真效果,一定要使用原生模型。参数量这么大,就一定要部署到大型服务器上。

所以,如果视频生成模型不开源,就会带来一个问题:视频生成模型或者世界模型的更新和技术升级,一定是由互联网大厂驱动的,而不像大语言模型那样,可以通过开源生态支持。

所以至少在2026年,我预计它反而会加深大厂的技术垄断优势。

卫诗婕

您刚才提到了两个点,我追问一下。

第一个,您觉得Seedance 2.0在技术上超越了国外模型,对吗?为什么会有这样的判断?

宁慕楠

它目前可以直接对标的是Veo 3,现在已经是Veo 3.1了。

Sora最开始只有视频。它相当于让一幅图动起来,有点像动图。Veo则实现了音画同时渲染,Veo 3.1当时发布的几个宣传片都展示了人物说话时音画同步、口型同步。

但是它没有敢做特别大幅度的物理交互。Seedance最大的优点,就是物理一致性非常高。

我之前看过一个小视频,是特朗普骑马。特朗普比较壮,他白衬衫下面的小肚子会随着马一上一下地跳。最近还有一些奥特曼打斗的内容,动作非常大胆,物理效果甚至比真人拍的还要好。

真人穿皮套,很多动作做不出来,但它可以实现很多人的幻想,也能完成一些动画片式的效果。所以我认为,至少在物理一致性和精细度上,Seedance 2.0支持原生2K,在目前这个时间段,应该已经实现了对国外的技术超越。

卫诗婕

明白。第二点,您刚才提到,视频模型和语言模型的一个很大区别是,您不认为视频模型会开源,而且也无法通过蒸馏获得很好的结果,是这样吗?

宁慕楠

是这样的。还是那句话,它的成本太高。首先大家都是用私有数据训练的,私有数据训练出来的模型,开源本来就是一件很亏的事情。

第二,蒸馏之后跑出来的效果也不好,用户也不愿意用。所以它应该打造一个封闭的环境,让用户愿意为它付费。如果用户真的愿意付费,那就成功了。

Sora刚出来的时候,宣称可以替代90%的CG以及广告行业工作。但大家也知道,它其实并没有做到完全替代。不过Seedance的结果还不太好说,我还是比较乐观的,它可以替代很多中低成本的CG和广告生成工作。

卫诗婕

我可不可以这样理解:过去语言模型的训练,很多使用的是公开的公域数据;但多模态模型的训练,更多依靠各家的私域数据?

宁慕楠

是这样的。

卫诗婕

这也就解释了,为什么从国内来看,目前字节的多模态模型,比如Seedance,以及快手的可灵,都做得比较好。因为它们本身就是短视频或者视频类社交内容平台,拥有非常丰富的私域数据。

宁慕楠

是的。关于短视频这里,还可以多说一点。大家可以想一下,为什么是短视频公司,而不是长视频公司?

以目前Transformer加Diffusion的生成模式来看,长视频对于训练视频生成模型其实用处没有那么大。因为场景一多、时间一长,就会造成训练混乱。

据我所知,Veo 3其实是固定帧长度的。比如一次生成只能生成固定数量的帧,对应下来就是固定时长,正好处在短视频的优势区间。

这可能就是它和语言模型的区别。语言模型可以一直往下生成,输入可以足够长,输出也可以足够长,因为它是在预测下一个Token。

视频模型为了保证效果,采用的是固定帧长度。这就是目前的情况,所以短视频具有独特优势。

卫诗婕

为什么一个六十秒是由两个三十秒加起来做到的?你是说现在多模态模型所用的Diffusion范式,本身最多只能输出三十秒的视频?不同的那个有差别吗?就是说它一定是一个固定长度的,为什么呢?是现在能力就到这儿?

宁慕楠

它的这种Diffusion输出长度是固定的。我再尝试简单地解释一下。字面意思是,大语言模型的输出模式是预测下一个Token。人在讲话时,讲到口干舌燥了,就会说“停,我不讲了”。这一段可能是10个词,也可能是30个词,也可能是肺活量特别好,说100个词。

但视频生成不一样。它从最开始生成图片时就是给你一张纸,让你把这张纸画满,任务就结束了。现在的视频就是给你32张纸,让你把这32张纸画满,视频就生成好了。

如果你觉得这个连环画不够看,就从最后一页继续往后写,是一个接龙游戏。

卫诗婕

所以,如果用长视频去训练,其实也没有办法直接训练。可能还是要切开,然后还会牵涉到属性不一致等问题,反而短视频更有优势。

如果一个长视频要投入训练多模态模型,比如一个小时的视频,是不是得切成60个1分钟的短视频去喂进去?

宁慕楠

对。但其实也没有什么意义,因为在这种较长视频上,很多时序信息会出现断裂或者对不齐。

如果让它连续生成60个片段,每次都用前面的最后一帧或者一些参考帧,到后面人物可能长得不一样,性格和动作也会出现很大偏差。

卫诗婕

明白了。

最后能不能再分享一下,您觉得2026年有哪些最火热的研究方向?关于多模态,最火热的和最重要的研究方向是不是一致?

宁慕楠

最火热的研究方向,就是刚才我们聊到的基于视频模型的世界模型。

为什么呢?因为这个东西还没有真正做出来,但一旦做出来,用户接受度会非常高。世界模型有很多种定义方式,比如李飞飞他们认定的是比较硬核的那种,但现在用户比较认可的,是基于视频模型的世界模型。

为什么认可?因为里面的世界所见即所得。你生成的这个三十秒的视频,只要这三十秒内符合真实世界的物理客观规律,就可以认为这是一个世界模型描绘的世界。

第二个优点是,基于视频模型的世界模型太好用、太有用了。它可以用来做短剧、做CG,甚至做游戏创意。

理想的世界模型是,用户输入一个指令,它就生成下一帧、下两帧,以及接下来会有什么反馈。相当于你在玩一个从来没有人做过的、通过世界模型源源不断输出内容的拟真游戏。

目前这种连续生成的未来形态,大家反而不是特别认可。大家认可的是,在这个三十秒的视频内,符合真实世界的一切规律。这样它就可以用于科教文卫和工业领域。

它甚至可以生成工厂里本来很难采集的数据,以第一人称视角、第三人称视角或者整个工厂视角,全部做出来。对于具身智能公司来说,这个诱惑非常大。

广告从业者,甚至像您这样的内容工作者,也可以把今天讨论的内容直接喂给它,让它生成一段视频:这个东西具体是什么样,可以让它360度旋转,或者配一段解说词展示出来。这样大家的付费意愿就会很强。

卫诗婕

是的。如果这时候马斯克在场,他可能会说:“非常fantasy,非常amazing。”所有人一看,就会发现这个东西每个人都能找到用处。我们中国人可能不像美国人那样表达得那么丰富,但至少对我们安努智能来说,我们是专门做工厂的。

我们一直苦于真实数据采集成本很高,还有一些规范问题。如果它能源源不断地生成数据,我们的模型训练就可以做得更好。

宁慕楠

刚才还提到不断智能迭代。之前我们说,机器人必须进场才能通过强化学习进化。

但现在假如通过世界模型构造出足够多的数据,机器人可能在上岗的瞬间,就已经是一个有几百小时工龄的老专家了。

卫诗婕

不对,不止几百小时,可能是几百天的老专家,那不是更好吗?

宁慕楠

对。这样机器人只需要做一些简单适配,就能做到开箱即用。以前机器人买到工厂里,可能需要6到8个月调试;现在可能只需要6到8周,甚至6到8天。

我认为,这对于机器人或者具身智能在工厂里的应用,是一个非常大的突破。

但最重要的研究方向,我认为还是能不能实现Scaling Up。现在的VLA模型,本质上吃的是大语言模型的老底。它可能是基于一个比较好的基础模型,再进行微调,用一个7B的小模型做Fine-tune。

能不能真的用一大批纯第一视角数据,或者纯机械臂数据,训练出一个模型?

大家都知道,大语言模型的智能涌现和Scaling Law,是当数据量和模型规模达到足够大时,把书本和互联网上能够找到的文本信息喂给它,它就可以不停自学,逐渐掌握世界运行规律。

但目前VLA还做不到。你需要人工精心打标,告诉它这个视频是什么意思,这段语言是什么意思,以及它们如何结合起来。

假如我们有足够多的数据和足够好的训练范式,真的能够从零开始实现Scaling Up,那么我认为这也是具身智能时代的一次飞跃。

到那时,可能已经不只是VLA模型了。我们可以玄幻一点,称它为“机器人的大脑模型”。它相当于一个小孩,通过接受足够长、可能几万小时甚至几百万小时的视频之后,突然理解这个世界,涌现出智能,那可能就是一个新的场景。

目前还是以工业为例。工业有一个泛化性问题:我在A工厂做出来的模型,放到B工厂,可能因为光照、产线都不一样,没法直接使用。

但如果是一个通过Scaling Up涌现出智能的“大脑”,它已经接受了足够多样本,就像一个人一样。你在A工厂做过,去B工厂可能只需要干半天,就能熟悉新的环境。

假如我们能够做出一个Scaling Up的机器人大脑,把它换到另一个工作场景,它也能很快适应。那时候就是具身智能的新时代。

卫诗婕

明白。谢谢您老师,辛苦了,还是学到了很多。

以上是我和宁慕楠的访谈,宁老师更多代表第三方中立视角。接下来是我和正在春晚彩排一线的姜哲源连线。

姜哲源所创立的松延动力,是2025年机器人马拉松大赛的亚军获得者。他们也是这次马年春晚的人形机器人合作伙伴,以及仿生人形机器人独家合作伙伴。没错,春晚节目中的机器人蔡明老师,就出自他们的手笔。

姜博,欢迎你。你们现在应该是在春晚彩排现场,对吧?

姜哲源

对的。Hello,大家好,我是松延动力的创始人姜哲源。我们现在在春晚现场。

9. 松延动力的春晚阵容

卫诗婕

你们这次是带着小顽童上春晚了吗?是N2还是E1?

姜哲源

我们这次上春晚,其实是我们的全产品家族一起登上春晚舞台。

我们的N2小顽童肯定要上,而且会上两台。我们还有中尺寸、1.4米高的E1,也上了春晚。我们最新发布的、售价9998元的小布米,也一起上了舞台,而且还是一个戏份相对比较大的主角。

另外,我们还做了一个仿生人,仿生人产品线也登上了春晚舞台。

卫诗婕

是在一个节目里面吗?

姜哲源

对,是在一个节目里面。

我们这次春晚其实是和蔡明老师合作的,还有一位《喜人奇妙夜》的冠军王天放。节目题目叫《奶奶的最爱》。

如果不出意外,目前看应该是第三个播出,大概在晚上8点半左右。这个节目主要讲的是,王天放很久没有回家看奶奶蔡老师,终于回来之后,被一个机器人蔡老师一直怼,但他不知道那是机器人蔡老师。

他还要跟其他几个小机器人争宠,因为其他几个小机器人也是蔡老师的孙子。王天放和几个小机器人在蔡老师那里争宠,最后大家一起跳了一支舞,是这样一个小品。

卫诗婕

你们整个机器人家族里,每一款不同机型展示的是什么能力?各自秀的是什么肌肉?

姜哲源

首先,小品类节目以温情为主,我先讲一下我们的表现形式。

N2机器人在里面主要表演奔跑、空翻和侧手翻。E1没有表现特别特殊的技能,主要是走路,展示比较拟人的行走方式。另外它还表演了一个魔术,并且可以伸长脖子。

节目里有一个梗:天放跟蔡老师说“他们没我高”,然后E1就把自己的脖子伸起来,伸得比天放还高。

小布米主要是在台上走路、跑步,最后Ending的时候跳一支舞。我们的仿生机器人主要展现超高自由度,同时做到绝对仿生的技术水平。我们做了一个1:1复刻的蔡老师。

当时仿生机器人在后台,有几个明星路过,看到之后就打招呼说:“蔡老师好。”但我们的仿生机器人没有理他们。他们转头仔细一看,才发现原来是一个仿生的蔡老师。

我们的表情做得很丰富,这次在台上有很多仿生机器人和演员们的对话。

卫诗婕

这是你们第一次登上春晚吧?

姜哲源

对,没错。去年我们上过北京春晚,但总台春晚这是第一次,真的是第一次。

卫诗婕

紧张吗?

姜哲源

我肯定是紧张的。

卫诗婕

我问一个大家都很好奇的问题:春晚节目上如果演砸了,或者出现失误怎么办?

姜哲源

原则上这件事不应该发生,但小品类节目确实可能有难度。

如果歌舞类节目出现问题,因为它每一拍都严丝合缝,所以随时可以切到之前录好的节目备播带,避免失误传播到公众那里。

但小品类没有严丝合缝的节奏,节奏都要靠演员自己把握,这就很难。所以这次也是让我们压力最大的一点。

卫诗婕

如果机器人要跟蔡老师搭戏,理论上应该是蔡老师每说一句话,它就要根据下一句台词做出反应,对吗?

姜哲源

对,没错。

卫诗婕

那它怎么保证节奏?是写好的程序,还是怎么样?现在有用到大脑吗?

姜哲源

没有。台上没有办法让这类AI真正上去,没法保证绝对安全,所以所有台词还是提前录好的。

机器人本身说话的戏份不多,主要还是做动作,以动作为主。

卫诗婕

这次春晚有没有体现机器人大脑能力的表现?

姜哲源

我们这个节目里没有真正用到大脑,但确实也把一些与大脑相关的东西通过节目展现出来了。也就是说,没有真正使用,但看起来像是有大脑。

卫诗婕

银河通用会做一些大脑方面的体现,对不对?

姜哲源

对,是的。

卫诗婕

我们可以理解为,这几家登上总台春晚的机器人公司各有分工,是吗?

姜哲源

对。每个节目,或者说每家公司的机器人,节目形式都不太一样。

我们是小品,也就是语言类节目;宇树完全是表演武术,展示最炫酷的技能;魔法原子据我所知是要登上歌舞类节目,但彩排的时候又好像没看到它上,我不确定具体是什么情况。

银河通用是一个微短剧,和沈腾老师合作,会有一些大脑能力的体现。

卫诗婕

这次有4家具身智能企业登上总台春晚,大家对这件事关注度很高。您有没有可以分享的内部视角?

姜哲源

我觉得,这4家登上春晚,每家的表现形式都不一样。刚才讲到的机器人浓度,我认为整个春晚舞台上的机器人浓度是比较适宜的。

中国机器人产业发展到今天,已经到了一个新的阶段。中国机器人企业这么多,其中很多优秀企业的技术水平在国际上都处于领先位置。能够有多家机器人企业出现在春晚舞台上,我觉得也是向全国乃至全球表明,中国机器人产业已经走到了世界前列。

卫诗婕

我留意到,这次4家公司的名头都不一样。银河通用是“具身大模型机器人”,宇树是“春晚机器人合作伙伴”,魔法原子是“战略合作伙伴”,你们则是“春晚人形机器人合作伙伴”。

这些不同的名头有什么来头吗?

姜哲源

其实我们还有一个名头没有公开。最开始我们跟春晚方面商量的名头,大概是“春晚独家仿生机器人合作伙伴”。

但是这个名头一旦露出来,可能就会暴露我们的节目。因为节目里会出现仿生蔡老师,如果把这个名头露出来,大家可能就会猜到是不是有仿生人要上台。我们希望给大家一个惊喜。

所以最后我们没有以“独家仿生机器人合作伙伴”这个名头露出,而是和春晚导演组商量,用“春晚人形机器人合作伙伴”这个名号。其实是用“人形”来盖住“仿生”的噱头,否则可能会提前暴露节目。

10. 仿生机器人寻找应用

卫诗婕

我看到你们官网上对仿生机器人的定位,是“提供情绪价值”。这也是我想问的。当时看到这个仿生机器人,我就在想,它到底应用在哪里?

姜哲源

是这样的。我们跟很多行业的人交流过。今天人形机器人,包括仿生机器人,很重要的一点就是找到自己的应用场景,找到一个Killer应用,然后实现规模化复制。

后来我们了解到,旅游导览、导游这个行业其实有一个很大的困境,就是现在招不到人。

招不到人并不是从成本端考虑,也不是人不愿意来,归根结底不是工资的问题,而是今天要招一个导游,对导游的要求很高。导游需要背下可能几万字的讲稿,每个点位都需要讲解,不能出错,一旦出错可能还要罚钱。

这让很多人望而却步,因为要背这么长的内容确实很麻烦。但对于仿生机器人来说,它可以比较完美地解决这个问题。仿生机器人里面的大模型本质上是计算机,完全可以很轻松地记住所有讲稿,让仿生机型完美实现导游导览功能。

卫诗婕

但我有一个好奇:为什么非得要一个跟人长得一模一样的机器人给我们做导览呢?

AI时代,我们也可以迎接一个像大白那样的机器人,或者像机器狗一样的机器人。我们可以迎接各种各样的AI生物来做导览。

姜哲源

当然没问题。行业里有很多企业,比如猎户星空、小笨,就做了一些纯轮式底盘的导游导览机器人。

但这些机器人为什么最终没有起到特别好的效果?我觉得核心在于,它们本身不具备关注度和话题度。

导游导览一般发生在景区、博物馆这样的地方。人们为什么来到这些地方?是为了看到一些奇观。之前那些轮式底盘的导游导览机器人,不具备奇观属性。

而一个仿生机器人,有一张人脸,作为导游给你讲解,会让人产生天然被吸引的感觉。

卫诗婕

轮式和双足应该也会有一些区别。轮式可能在一些场地行走不方便,但双足会方便很多。

姜哲源

我们目前主要还是以“轮式底盘加人头”的方式在场景中做导览。我们的轮式底盘能够上下电梯,有梯控,还能够自主规划和自主回充,这些都已经实现了。

卫诗婕

你是说,一个人头下面是轮式形态?

姜哲源

对。除了底下是轮子之外,整体长得就跟真人非常接近。

卫诗婕

那小品里蔡老师的孪生形象也是这样的吗?

姜哲源

蔡老师那个不是。蔡老师最后是坐在充电底座上出来的,能够让人一眼看出那是蔡老师。

如果不仔细看,可能不太容易看出来仿生蔡老师和真人蔡老师到底哪个是真的,看起来太像真人了。

卫诗婕

会不会反而让人有点害怕?

姜哲源

您说的也有一定道理。如果特别接近真人,心里确实会有一些感觉。

我们团队第一次看到仿生人的时候,其实觉得很震撼。当时看到的是香港Hanson Robotics做的Sophia,那台机器人做得挺像真人,我们当时甚至觉得,上去摸一下是不是有点不尊重它,所以没敢上去摸。

卫诗婕

既然您也认同这种现象存在,那你们怎么思考仿生人的产品设计?它一定要做得很像人吗?

姜哲源

我觉得,特别像人带来的震撼到底是积极还是消极,到底会让人被吸引,还是把人赶走,这是一个问题。

个人感觉,我觉得更多是积极的。它会让人们对它感兴趣,愿意靠近、了解它,反而可能是好事。

卫诗婕

因为目前机器人更多是在表演场景里使用。在表演场景里,它很像人的时候,反而更抓人眼球。

姜哲源

对,就是这个意思。

卫诗婕

如果让机器人进入真实生活,比如进入家庭、工厂,进入公共区域去做服务,它是不是还是应该和人有一些区分度?

姜哲源

对。如果真正进入家庭干活,我觉得加一个仿生脸,意义可能不是百分之百必要。

卫诗婕

我之前想象过,仿生脸的很多应用场景可能在影视行业。

姜哲源

影视行业确实有需求。全世界做仿生脸做得最好的公司,叫Disney,迪士尼是做仿生脸做得最好的。

我们看迪士尼乐园里一些动物的形象,还有其他各种各样的仿生人,其实已经广泛应用在他们的娱乐园区、游乐园和电影里。

卫诗婕

刚才您提到的Sophia和Disney的仿生技术,跟松延动力现在相比,我们的技术发展到什么程度了?

姜哲源

我认为,我们应该是全球最领先的仿生人公司。

Disney的仿生人,尤其是以卡通形象为主的那些仿生人,比如《疯狂动物城》里的牛局长,它们需要的自由度并不高,核心还是把妆容和整体外形做得真实。

我们的机器人既能够很像真人,又能够拥有很多自由度和非常丰富的表情。我觉得在技术上,整个行业大部分公司和我们可能存在代差。

Hanson Robotics的Sophia所采用的仿生人技术,我们认为可能算是上一代技术。他们采用的是拉绳、拉线方案,用电机驱动面皮,通过拉绳来实现表情,也就是绳驱方案。

绳驱方案的可靠性、稳定性以及表情的自然丰富程度,我认为都存在一些问题,而且他们整张脸也没有做到非常接近真人。

我们完全采用连杆驱动面皮。所以从仿生人的整体技术来说,我们可以比较负责任地说,我们处于全球领先水平。

卫诗婕

连杆驱动和绳驱的区别是什么?除了最终表现上可能你们的方案更自然,因为我在视频里也看到过,它可以有像人一样的微表情,但它具体是怎么做到的?

姜哲源

其实这是两个问题。第一个是连杆驱动和绳驱的差别,第二个是最终怎么实现这种效果。

先回答第一个问题。连杆驱动和绳驱主要是驱动形式不同。绳驱的意思是,在面皮的每个点位上拉出一根绳子,再由对应的电机控制,实现对表情的实时模拟。

连杆驱动则是在脸上设置一些关键点,关键点后面可能有特殊结构连接到连杆,再由电机驱动连杆,从而实现面部表情变化和传动。

这里的核心差别在于,绳驱的设计简单很多。绳子可以弯曲,所以在整个头部空间里可以自由走线;连杆驱动则不行,它需要非常精巧的设计,对设计要求高很多,没有绳驱那么简单。

绳驱带来的问题是,绳子本身会有一个我们所说的杨氏模量。尤其是这种钢丝绳,随着使用次数增加,可能发生不可逆的塑性形变。也就是说,绳子用得越多,变得越长,就会导致仿生控制不精准。

卫诗婕

之所以可以用连杆方案,是因为供应链或材料有什么区别,还是只是你们做了这样的技术?这个技术是独创的吗?

姜哲源

我们有一套把连杆和仿生人脸皮结合起来的技术,这是我们独创的。

但是仿生人整体供应链,包括仿真人脸皮以及生产加工这些方面,我们没有做特别多的改动和创新。

卫诗婕

仿真人脸皮对材料有很高的要求吗?

姜哲源

有要求。这个脸皮其实存在一个两难境地。

脸皮不能太厚,因为太厚的话,小电机拉不动;但也不能太薄或者太软。如果太软,就会显得很塌,整个脸皮会塌在里面的骨骼上,也不好。

所以我们需要找到合适的脸皮工艺和设计,让脸皮的厚度、软硬程度都适中,既要让电机拉得动,又不能让脸太塌。

我们使用的是铂金硅胶。之前用的是进口材料,后来换成了国产材料,是一种柔性比较好的特殊硅胶。

卫诗婕

明白了。所以可以理解为,这次你们上春晚最大的亮点就是仿生机器人,对吧?

姜哲源

我觉得可以这么理解,而且这应该也是整个小品里最大的一个梗。

卫诗婕

这次有4家公司一起上总台春晚,大众想象中的战争和讨论度都很高。大家会好奇,松延动力和魔法原子在这4家公司当中估值相对更低、也更早期,为什么也要上总台春晚?

因为上春晚的赞助费也不小,是想卡生态位,还是想通过春晚实现什么目标?

姜哲源

首先,对于我们而言,赞助费这件事目前只是传言,并没有得到证实。赞助费真的只是春晚里可能不太重要的一件事。

说实话,本质上能拿得起,即便存在赞助费,能够拿得起的企业也不少。初创公司今天的现金体量,可能也比大家想象中要好一些。这只是其中最次要的一方面。

这次我们上春晚的契机在于,本质上不是说我们公司要完成“上春晚”这个任务,而是我们要代表北京的人形机器人,成为北京的一张名片,也要让自己登上这个春晚舞台。

另外,我们希望通过春晚打开公司品牌的国民度。本质上,一个公司说自己好,认为自己好,这件事其实没有经过传播,没有让全国人民知道“有松延动力这么一家公司,这家公司还不错”,就没有经过广泛传播。

所以我们希望通过春晚这样一个舞台,把公司的品牌国民度和技术优势向全国人民传播。

卫诗婕

您提到代表北京的一张名片,这就很有意思了。据我了解,其实你们和银河通用都可以代表北京,成为北京的一张名片吧?

姜哲源

我们处于不同的赛道。银河通用的节目形式,包括他们使用的机器人形式,跟我们不太一样。

银河通用主要展示他们在大脑方面的能力,以及上肢操作能力。其实这一块在公众层面的展示度和关注度,没有舞蹈、双足这些能力高。

卫诗婕

我自己也很期待你们每一家的表现。我更关注的是,现在大脑技术进展到什么程度,能够秀到什么程度的肌肉。

姜哲源

对。因为大脑和本体,到目前为止还是过去所说的两大派,大家也各自有聚焦。

卫诗婕

你们其实是本体一派,对吗?

姜哲源

对。

卫诗婕

目前没有一家会真正把所谓的大脑搬到舞台上,对吗?

姜哲源

没有。大家主要还是以运控为主。

卫诗婕

为什么?

姜哲源

这可能是一个现实情况,但不是一个我能解释原因的问题。

卫诗婕

这次银河通用的节目我还没有看到,比较遗憾。当时我在参加活动,所以错过了彩排。

姜哲源

没关系,我们应该很快就可以看到了。

卫诗婕

你们几家公司私下应该都挺熟的吧?

姜哲源

还行,大家都认识。

卫诗婕

这次4家一起上春晚,大家的感受是什么?会不会偷偷观察一下其他家公司?

姜哲源

外界可能以为我们几家公司竞争会比较激烈,但实际上我认为不是。就像刚才说的,我们处于不同赛道,在春晚上也处于不同赛道。

有的是歌舞类,有的是武术类,有的是我们这样的语言类小品,还有微短剧,各自都有对应的节目。

从我自身来讲,我无数次跟团队讲过,我们不太关心别人怎么样。我们只希望帮助演员团队、导演组和节目组演出一个好的节目。对我们来讲,这是最重要、也是唯一重要的一件事情,并没有过多关注别人的情况。

卫诗婕

那这次彩排或者训练过程中,有什么比较有意思的部分吗?

姜哲源

整体都挺有意思。蔡明老师第一次见到仿生的自己时,也觉得挺惊艳。

我们第一次进台时,我第一次走进央视一号厅,也就是最终春晚节目演出的那个大厅,是下午4点。那天晚上半夜2点,我们就把台上的所有东西都搬回了公司。

我们把舞台上小品的所有场景景片,整体1:1复刻,在公司里搭建了一个小品场景。

卫诗婕

你们为什么要复刻整个舞台?

姜哲源

为了自己排练。

我第一次在一号厅和蔡老师团队合练时,蔡老师和天放演得非常好,几乎完美。但我们自己的机器人表现确实非常一般,走位各方面说白了都没有练好。

当时我就觉得,这件事肯定不能这样。最终我们希望机器人在台上的反应能够精准地切换到对应动作,这是我们应该做到的。

所以我说,为了让大家练得更精准、更娴熟,我们把整个场景复刻出来,让整个团队可以在公司里练习。

后来蔡老师和天放也多次来到我们公司,在1:1复刻的春晚场景里排练整个节目。

据我后来听说,春晚历史上,30多年没有人把主舞台上的景片买走过,我们可能算是第一个真正意义上做这件事的人。

卫诗婕

这很有意思。2025年我们看到了很多机器人比赛,其中最受瞩目的,也是你们出圈的那一次,就是机器人马拉松,你们拿了亚军。

姜哲源

对,没错。

卫诗婕

网上传播了很多片段,工程师们拿着遥控器追着机器人跑步比赛。实际上,当时是人在操控机器,对吧?

那这次春晚,是不是也会有人拿着遥控器,控制机器人什么时候该做什么、说什么?

姜哲源

没错。这次春晚还是让人来操控,并不是说完全自主做不到,而是春晚对整体可靠性的要求非常高。

一旦走错、跑错,就会成为大问题。所以我们还是要确保万无一失,还是需要人工操作。

但今年4月份的马拉松,我们会展示全自主奔跑的能力。

卫诗婕

你们有没有做预案,万一出现意外情况怎么办?

姜哲源

说实话,这个预案没有做。

我们能做的,就是尽可能把准备工作做到最好。每次导演组评价我们松延动力,都是整个春晚4家机器人里最努力的,没有谁像我们这么努力地准备,希望把节目演好。

每次上台之前、每次彩排之前,我们都会熬通宵,尽量把机器状态调到最好。每台机器都会整体检查一遍,我基本上都会跟大家一起熬到很晚,熬通宵来做这件事。

目前来看,每一次上台彩排,我们机器人的演出都比较完美,没有出现大的问题。最后的效果,我还是有一定信心的。

卫诗婕

这次机器人会穿衣服吗?

姜哲源

我们的小布米会戴一个小帽子,其他机器人主要都不穿衣服。

卫诗婕

小布米应该是最近才刚刚亮相的,对不对?要不要多讲讲它?

姜哲源

小布米是我们第一款真正做到万元级的机器人产品,首发售价是9998元。

这款机器人不只是价格便宜,性能也很好。就像这次在舞台上,我们演出了一段我认为相对有一定难度的舞蹈。

我们希望这款机器人最终能够走进家庭,进入C端,让小朋友用机器人学习编程、人工智能,也可以给小朋友讲故事。

我们希望它成为人形机器人里真正意义上第一款销量突破1万台的产品。

卫诗婕

你能描述一下小布米实际观感上有多大吗?

姜哲源

90多厘米,大概到膝盖再高一点,像家庭里一只小宠物的大小。

卫诗婕

这应该是史上第一个万元级的人形机器人,对吗?

姜哲源

对,史上第一个万元级的高性能双足人形机器人。之前应该有万元级的机器狗,但没有万元级的人形机器人。

卫诗婕

这次彩排的时候,别家的表演应该也有看到。有没有哪一家给你比较大的感受?

姜哲源

宇树的运控还是非常厉害。这次春晚宇树的表现非常震撼,所有武术动作都做得非常好。

有好几段都很精彩,比如最开始的各种空翻、高能动作,后面还有跳鞍马、飞檐走壁,以及醉拳,每一块都做得很不错。宇树给我的印象非常深刻。

卫诗婕

整体表现是超出预期,还是符合预期?

姜哲源

宇树远远超出预期,确实做得非常好。宇树仍然是当今全球机器人运控领域的第一名。

卫诗婕

你之前跟王兴兴认识吗?

姜哲源

认识。我读书的时候加过他的微信。

卫诗婕

因为我记得你读书的时候就买过他们的机器人,机器狗对吧?

姜哲源

没错。

卫诗婕

所以后来有交流过吗?

姜哲源

有。我之前去杭州见过王总几次,也跟他交流过,请教了一些机器人行业的问题。

我觉得王总很厉害,能把宇树做到今天这个样子,非常厉害。

卫诗婕

你们在后台有交流吗?关于这次春晚。

姜哲源

我们没有在后台交流过,只是在后台见面打个招呼。主要交流还是之前在线下、在杭州的时候。

卫诗婕

我跟很多行业里的投资人和从业者聊过,大家都会觉得,今天中国具身智能公司同质化比较严重,大家也需要找到自己的差异化。

你觉得松延动力和宇树的区别、差异化到底是什么?

姜哲源

我觉得我们跟宇树最大的差别,在于应用场景不一样。

我之前发表过一个观点:人形机器人的应用场景呈现出多而散的状态,能用的场景很多,但比较分散。目前还没有看到一个特别巨大、真正的Killer应用。

所以对于我们和宇树这样的企业来说,场景本身的重合度不会特别高。

我们今天主要面向K-12教育和陪伴类场景,这可能是我们跟宇树比较大的差别。

宇树可能更多面向科研、教育以及表演类场景。在表演类场景下,客单价可以做得高一些,可能有更好的营收规模。

我们做的则是相对竞争少一些、没有那么多人做的场景,以及相应的产品和价格带。

卫诗婕

我之前查资料时,也有一个观察。首先,你自己评价自己是一个产品型创始人,对吧?所以今天松延动力能够带着全家族一起登上春晚,也是因为在很多不同场景下都有很好的产品定义。我觉得这是你们公司的一个特点。

另外一点,你们应该也是想走价格带上的性价比和普惠路线。

姜哲源

我们倒不是为了便宜而便宜,也不是为了走量而便宜。真正给机器人定价时,我们应该看这个价格为什么要这么定,要把这个事情想清楚。

今天我的观点是,把价格做低有两种可能性。

第一种,是通过低价,在同一场景、同一客群内切更多份额,提高自己的占比。

第二种,是通过低价打开一个全新的市场和一批全新的人群,让之前不太可能买人形机器人的人,也能买得起、用得上人形机器人。

所以价格不是越低越好。对我们来讲,第一种通过降价去切更多市场份额,我觉得没有意义。我们不喜欢行业内卷,因为总有人能把价格降得更低,最后所有人都没有利润,这件事就没法做了。

我们每一次降价,其实都是为了拓宽客群规模。像这次降到9998元,一下子就打开了所有C端客群,尤其是有孩子、相对高净值的家庭,都能够比较轻松地买得起我们的机器人。

这不是在争夺存量,而是在做增量,做巨大的增量。这是我们希望通过降价实现的,而不是为了降价而降价、为了内卷而降价,那样意义不大。

卫诗婕

我很赞同。特别巧,上过我节目的其他创始人嘉宾,也在做C端家庭陪伴类机器人。据我所知,他们也上了北京春晚。

所以我想,这个新的市场可能是大家共同开拓的。当然,在细分赛道里肯定也会面临竞争,但可能不是大家想象中的松延动力和宇树这类企业之间的竞争,而是和其他新品类机器人的竞争。

姜哲源

对,没错。

首先,在家庭这个客群内确实有竞争,但这个竞争也不是那么直接。本质上,我们的机器人和纯AI陪伴类产品还是有一些区分的。

我们的产品有运动能力,也有编程教育这样的属性,所以还真不完全是同一类人群。

卫诗婕

你们过去这一年主要在做什么?

姜哲源

2025年,我觉得我们主要是在补短板。因为2024年或者2025年年初的时候,公司状态太差了。

当时公司只是一个纯技术、纯研发型公司,全是技术人员。除了行政和财务,我们连人力资源都没有,其他全是搞技术的,甚至连销售都没有,什么人都没有。

所以这一年,我们花了整整一年时间补短板,把团队和组织建设得更完善一些,让它至少像一个正规公司,而不是纯实验室式的组织形态。

11. 量产决定行业牌桌

卫诗婕

你之前说过,觉得2026年一定要拼量产和商业化,为什么?

姜哲源

我觉得已经到了这个阶段。今天很多机器人公司都出来了,出发更早的企业如何和后来的企业拉开差距,最终还是要看量产,以及规模化商业化。

今天人形机器人企业已经到了需要交出第一份小答卷的时间点,所以今年可能拼的就是量产和商业化。

卫诗婕

你把松延动力定义为出来比较早,还是比较晚的企业?

姜哲源

中间吧,算是中间。我们属于在牌桌边缘上的企业。

卫诗婕

这么谦虚,你们都已经上总台春晚了。

姜哲源

总台春晚这件事结束之后,我觉得我们在牌桌上的站位可能会稍微稳一点,但目前看,还是在边缘上。

卫诗婕

除了宇树的本体和运控算法能力,它的量产会不会也是一个很深的壁垒?量产的含金量是什么?你们做到量产能达到什么程度?

姜哲源

宇树2025年自己公布的数字,应该是生产了5500多台人形机器人,可能甚至更多。

我们去年也生产了1000多台人形机器人。去年年底,我们达到了单月产能500台的规模。今年预计会达到单月产能突破1000台的规模。

我们也在量产上不断下功夫。但我们非常认同,宇树在本体设计到整个生产环节上确实有竞争优势,也有时间积累形成的壁垒。

卫诗婕

量产能力的区别到底体现在哪里?我之前也想问你一模一样的问题:量产到底难在哪儿?理论上多雇点工人,不就能解决了吗?

姜哲源

其实这里面有很多困难。一个机型可能有几百个零部件,随时都有可能出现供应问题,比如预定的交期无法交货,这是最常见的问题。

包括生产机器人的过程中,可能发现某个零件没到,整个产线就停在那里了。生产过程中还可能遇到装错等问题。

我最后发现,生产问题本质上有两个方面。

第一个是设计问题。设计包含两部分:一是整个机器人本体设计,包括所有图纸和工程师设计的内容;二是工艺工程师需要设计生产工艺,比如什么地方使用工装,什么地方设置检测工位,以及整条产线如何设计。这是第一个可能出现问题的地方。

第二个是供应链。供应链最核心有3个要素:周期,也就是交货效率;成本,也就是拿货价格;还有质量,也就是来料质量。这3件事其实是一个三角形。

今天遇到比较大的问题,主要是交付周期。如果资金实力足够,我们可以引入库存概念,为核心零部件建立库存,通过库存抵抗供应链波动带来的风险,保证产线随时处于比较好的运转状态。

当客户有紧急需求时,我们就可以从成品库直接发货,实现现货供应。这些是我经过这几个月跑完整个量产流程之后,建立起来的一些认知。

卫诗婕

2025年整个具身行业大火。你观察到上游供应链生态有没有发生特别大的变化?这对你们是利好,还是会带来新的问题?

姜哲源

机器人大部分供应链可以和其他行业去耦合,比如消费电子、汽车。我们的芯片等零部件,和消费电子使用的供应链是一样的。

今天唯一的差别,可能是关节,这是机器人特有的供应链板块。

去年确实发生了比较大的变化。有些企业之前一直给别人做定制开发,有些专门做零售,还有些专门服务KA客户,也就是我们这样的机器人企业大客户。

对我们肯定有好的影响:行业越来越成熟,供应商能力越来越强,交付能力更好,也能更好地保障我们的生产,这对我们来说肯定是好事。

卫诗婕

王兴兴之前有个观点,他觉得机器人领域的RL还没有做得很好,Scaling Law也还没有出现。你是学Deep RL的,也一直在用深度学习训练机器人。对于这个问题,你是怎么思考的?

姜哲源

我自己觉得,单纯的Deep RL本身并不存在所谓的Scaling Law。

因为Deep RL的数据来自Replay Buffer或者Rollout。一般我们做RL的数据,如果不考虑人类动作模仿这类数据,其实基本都来自仿真环境里跑Rollout产生的数据。

这和Scaling Law没什么关系。Scaling Law来自外部信息数据,并不是来自仿真数据。

我觉得,真正能够谈到RL里Scaling Law的情况,可能是我们要做全身操作时,需要大量外部人体动作数据,来训练RL Agent。

这样才可能出现Scaling Law:数据足够多时,机器人可以做任意动作。

今天我们看到西湖大学、宇树在这方面做得不错,我们也有一些初步成果,大概年后可能会发布。

卫诗婕

所以,机器人RL领域的Scaling Law,正如您说的,还没有出现,对不对?

姜哲源

从我自身来看,我觉得这个事情无从谈起。讲“RL加Scaling Law”有点奇怪。

从我自己的学术视角看,我觉得这个说法有点怪。

卫诗婕

那你觉得机器人的Scaling Law要靠什么?

姜哲源

更多要靠上肢的VLA。这一块确实存在Scaling Law,我们需要等待它真正发挥作用的时刻。

但现在也有两派观点:一派是VLA派,另一派认为还是要做世界模型。

我们可能还需要区分世界模型到底怎么做。我不是最了解这一块,但如果希望在一个模型里模拟全世界所有的物理过程,我觉得存在很大困难,很难办到。

举一个简单例子,做西红柿炒鸡蛋时,世界模型能不能学到鸡蛋从蛋液,在不同温度下从液态变成固态的过程?如果学不出来,它提供的信息就会有偏差,我觉得这不是最好的方案。

卫诗婕

这两年机器人训练范式有什么根本性的改变吗?

姜哲源

可以算有。通俗地讲,2024年一整年到2025年上半年,大家主要以手工调参为主。

2025年可能从Q2、Q3、Q4开始,逐渐转向以人类动作数据驱动机器人本体运控的训练。

卫诗婕

现在也是这样吗?

姜哲源

现在也是。

卫诗婕

我最近留意到一个新趋势。前两天Seedance 2.0出现了,我跟一个多模态领域的学者聊,他说现在Seedance能够生成一些符合物理世界规律的视频。

他认为,符合物理规律的多模态生成模型,本身可能也是世界模型的一部分;这些生成的、符合物理规律的视频,也可以用作训练机器人的数据。

我不是特别认同这个观点。

姜哲源

其实我们讲所谓的世界模型、World Model,或者Simulation,它包含两部分。

第一部分是Render,也就是渲染器。渲染器的意思是,根据当前整个世界的物理状态,生成从特定角度看到的图像、点云,或者其他感知信息。这是渲染器,也就是把场景渲染出来。

第二部分是Physics Engine,也就是物理引擎。物理引擎讲的是,我当前做的动作会对自己或者整个环境的物理状态产生什么影响,以及环境如何演进、变化,每一时刻的物理状态是什么样。

今天Seedance能够生成很好的Rendering,看起来很真实,动态也不像假的,但里面的物理过程非常不准确。

举一个简单例子,我们以前使用的Isaac Gym,背后是专门针对物理世界设计的物理引擎。即使是那个物理引擎,精度也不算高,Sim-to-Real Gap仍然比较大。

Isaac Gym渲染出来的东西还是很真实,看起来很符合物理过程,但实际上并不是。像Seedance、Sora这些模型,物理过程建模得非常不精准。

这带来的问题是,如果机器人拿这种数据进行训练,就会产生偏差,它不是好的训练数据。

我昨天还在小红书上刷到一个视频,Seedance 2.0生成了一个玩具火车头,围着火车轨道跑,最后火车乱飞乱蹦,完全不符合物理规律,还经常突然消失。

所以我觉得,把现阶段这些模型称作世界模型,并不科学。我不认为现阶段的模型能力能够支撑这个说法。

卫诗婕

所以,所谓多模态生成数据,你也不觉得它会大大推进机器人训练速度?

姜哲源

我觉得一定不会。当然,如果我说错了,我就为我的错误买单。这个买单就是我错过的机会成本。

卫诗婕

现在大家还没有共识,各自有各自相信的方向。

姜哲源

对。我刚才讲的其实也是一派观点。本质上,我们到底使用更多真实数据,还是更多仿真数据,以及使用哪种仿真数据,大家可能都有各自的观点。

卫诗婕

那你觉得2025年最重要的行业变化是什么?如果不说技术,从商业角度看呢?

姜哲源

从商业上讲,可能就是从Demo走向量产。2025年算是完成了量产从0到1的突破。

卫诗婕

你是说对你们来说,还是对整个行业来说?

姜哲源

对整个行业。我觉得至少本体行业都是这样。

如果去年还没有规模化生产和销售机器人的公司,之后大概率会考虑转型,或者可能失去上牌桌的机会。

卫诗婕

你觉得其中的卡点是什么?为什么有人上了这一层台阶,有人没有?

姜哲源

我觉得资金体量和时间周期都会有影响,更多是时间周期。可能出来太晚的公司,在这么短的时间里,确实来不及做好一款能够交付的机器人产品。

这样差距就被拉开了。如果现在还没有量产,确实会很困难。

卫诗婕

这个行业太卷了。所以你觉得2025年其实一轮洗牌已经开始了,是吗?

姜哲源

我觉得是。牌桌上有哪些企业,基本上快要有定论了。

剩下的企业可能要么凋亡,要么转型,或者在其他细分领域做出差异化。也可能在有新的技术黑天鹅出现时,牌面还会发生变化。

目前头部具身智能企业账上应该都不少于10亿元人民币。

卫诗婕

对。

姜哲源

中腰部和尾部也会有几个亿现金,至少有1亿到2亿元现金在账上。所以这个行业不会那么快死,但说实话,也不会过得太好。

这些企业最后可能有两种思路:要么逐渐凋亡,要么转型,或者在其他细分领域做出差异化。出现新的技术黑天鹅时,也可能还有改变牌面的机会。

卫诗婕

你觉得机器人的价格战开始了吗?

姜哲源

我觉得还不算价格战开始。我认为更像是场景战:到底谁能成为哪个场景里的第一名。

本质上,第二名没有意义。只有成为第一名,市场占有率达到80%左右,可能才会有很好的复利效果。我觉得场景战是真正开始了。

卫诗婕

目前为止,哪些企业已经站稳了场景第一名?

姜哲源

肯定有宇树。除了宇树之外,我认为云深处也算是把巡检场景站得很稳。

这两家企业我觉得算是站稳了,但其他行业和其他场景,目前还没有特别确定。

卫诗婕

那你们想占据哪个生态位?

姜哲源

我们希望占据K-12教育这个生态位。

卫诗婕

好,那下次上我们节目,单独聊聊你们的产品定义。

姜哲源

好的,谢谢。

卫诗婕

预祝你们春晚成功。

姜哲源

好,谢谢。

卫诗婕

好了,本期节目就是这样。春节加班不易,希望大家能踊跃在评论区留下你的春晚观后感,或者是本期听后感。再次祝大家新春新年好!同时做一个小小预告,下一期还会有重磅的创神访谈登陆,欢迎关注漫谈 Light Star,我们下期再见。