[BidClub_]
卫诗婕|漫谈 Light the Star · · 179 min

77.有关智元、觅蜂的愿景与野心,和具身智能的竞速之旅|与姚卯青的对谈

卫诗婕姚卯青

Podcast
TL;DR
  • 姚卯青给具身智能的进度定位是“连GPT-1都没到”——今天全行业真机数据的量级,比真正基模所需差四到五个数量级。大部分惊艳Demo靠后训练即可做出、与基模无关;他判断真正的涌现需要一亿小时数据,“等到我们有一亿小时数据的时候,我认为这个前夜就来临了”。按路线图,十亿小时级别数据预计在2027—2028年达到;主持人判断明年达到一亿小时有希望。
  • 智元的营收曲线是“每次都是加两个零”:2023年只卖一台样机约30万,2024年6000万,2025年已超10亿。对应量产元年、商用元年、2026部署元年,支撑邓总“三五八战略”(三/五/八年对应十亿/百亿/千亿营收)。精灵系列被确认是现金奶牛、较快实现ROI的产品,但新品先发护城河只有“一年左右”。
  • 蜜蜂的剥离源于与红杉的一顿饭:对标Scale AI,但具身数据需要进入物理场景、管人、投设备,门槛和复杂度更高。2026年规划千万小时产能,等效约一万人按正常工作强度干一年;若达成,姚称其“绝对领先”。真机数据价格约500—1000元/小时,百万小时约10亿元人民币。
  • 数据军备竞赛的本质“不是谁拥有多少量,而是谁在多快的速度内拥有多少量”。年初AgiBot World的百万条、三千多小时数据已是最大规模真机数据集;到2025年底,Generalist称拥有20万小时数据,但姚判断应主要是无本体数据。英伟达GR00T N1的技术报告显示,其使用的真机数据中80%来自AgiBot World。他转述Generalist与Google DeepMind技术人员的共识:若数据是唯一决胜变量,中国公司现在就可以宣布自己一定是赢家。
  • 反共识判断:车不是“最简单的机器人”,把车归为具身智能“有点牵强”。车永远安全第一,高速场景下100—200毫秒级反应和大模型的推理速度、概率性错误都构成限制;机器人低速、可人工兜底,反而有机会部署VLA、世界模型等前沿模型。但要落地成功,“没有人比做过自动驾驶的人更有机会”:量产硬件、数据闭环、供应链和质量体系都是智驾从业者的优势。
  • 商业化认知的一年之变:机器人抢场景要“沉下心、撸起袖子,甚至跪得下来”,因为“工业不相信故事,也不相信眼泪,相信的就是ROI”。智元称已在龙旗南昌工厂3C主产线稳定运行一个月后进行全天直播,完成2300多次任务、100%成功、0失误;姚称特斯拉和Figure尚未做过类似活动。
  • 融资与竞争哲学:邓总说“我们想要钱随时都可以融,但没必要”,智元给投资人的股权可能还不到一半,强调克制稀释、把股权留给团队。姚引用余凯的护城河观:不是绝顶聪明的算法,而是工程问题日积月累形成完整体系;“聪明可能只占10%,剩下90%是完整体系的能力”,“大家可以去做聪明人,我们来做好老实人”。
  • 技术路线判断:VLA和世界模型“终局来看可能都不是最终形态”,未来更可能是上下游分层配合。语言高度压缩但有损,世界模型更能捕捉液体流动、玻璃破碎等物理规律;两三年后,机器人真实场景回流数据可能成为主要增量来源,推算依据是GPT-3时代的历史类比以及对scaling law普适性的判断。
Digest · the substance, structured for research

1. 开场定调:具身智能连GPT-1都没到,缺的是一亿小时燃料

  • 全片最尖锐的进度校准来自姚卯青对投资人期待的直接拆台:诗婕转述“投资人很关心,希望你们已经到二了,求求你们了,最好到三吧”,姚的回答是“其实一都没到呢,我认为一都没到”——他认为具身智能还没到GPT-1,真正的决定性时刻可能要到GPT-3。
  • 瓶颈不在算法:“我不认为算法会成为绝对瓶颈或限制条件,但数据一定是最大问题。”今天的具身“远未到涌现,所有的都是在做从视觉到动作的肌肉映射”,还没有“智能似乎有觉醒”的感觉。
  • 时间表:“前夜的前夜,等到我们有一亿小时数据的时候,我认为这个前夜就来临了”——这句被剪进片头,是整期的核心命题。这里的一亿小时是他认为涌现前夜可能到来的门槛;路线图中十亿小时级别数据则预计在2027—2028年达到。

2. 姚卯青自画像:“儒雅”之外要有狼性,本质是顺势而为的人间清醒

  • 被问性格,姚先解构了“儒雅”这个标签:作为创业公司的经营管理者,儒雅是一方面,同时还需要很多狼性的地方。
  • 自我定义是“人间清醒”:做规划、看技术与商业方向“不会盲目跟随热点,更多还是会去看其中的商业本质”;职业轨迹(Waymo→蔚来→智元)不是规划出来的——“伟大不可被规划”,是“顺着技术的浪潮去不断让自己成为浪潮的相关者”。

3. 清华电子系:具身创业的隐形母校与“明星天团”

  • 清华的烙印是校训“行胜于言”——务实低调、默默耕耘。姚认为清华电子系应该也差不多是入学门槛最高的专业;他高考成绩不错,但在清华属于第二梯队,第一梯队是保送生,奥赛金牌生很多。
  • 电子系课业重、涉猎广(模拟/数字电路、集成电路、编程、通信、信号处理、机器视觉、光学、微波),“锻炼的是一种系统能力”,也练出扛压能力——“魔鬼式的大三”。
  • 一场上海电子系专委会年会成了具身群英谱:陈一伦(智航)、王潜(自变量)、丁文博(清华深研院),未到场的还有王鹤(银河通用)、高继扬(星海图)、“雪花酒哥”、江哲源(松延动力)、申宇君等。校友关系好,但“处于一个竞争非常激烈的行业,公司和公司之间肯定也在充分竞争”,“赛场上见”。

4. USC与硅谷:学界必须和工业界链接

  • USC给他的最大冲击是实践导向——很多老师从工业界引入,而不是长期在学校教书;他提到包括李飞飞在内的观点:学校资源太有限,跟工业界没法比,AI时代又是拼算力、拼资源的时代。
  • 他也看到了美国学术生态和顶尖学者的号召力。南加大最有名的专业是电影学院,学校整体财力较强,在基础设施和师资上较靠前。
  • 毕业去硅谷是就业的自然选择;有趣的自嘲是“用现在的话说,我们这批人已经算‘中登’了”——2014年毕业时深度学习刚兴起,他博士读的还是偏半导体物理。

5. Google广告组:2017年Transformer诞生当年就上了广告业务

  • 在Google广告团队第一次接触AI应用:Display Ads的推送匹配用上了ResNet、GoogLeNet等当时刚出现的视觉算法。
  • 关键细节:Transformer于2017年在Google诞生,论文是《Attention Is All You Need》;同年他们就在广告语自动生成中用上了基于Transformer、当时仍被称为机器翻译的一套框架,做广告标题生成。大规模投放不可能靠人海天天写广告词。
  • 转向的动机很直接:只把技术用在广告上“好像还不够硬核”,他在内部寻找既使用前沿AI、又真正研究底层技术的团队。2017—2018年自动驾驶是最火的AI赛道,像今天的具身智能一样,TaaS(Transportation as a Service)带来了很大想象空间。

6. Waymo三年:全球最难进的团队,见证从Demo到rider-only

  • 进Waymo比进Google难得多:彼时Waymo已从Google X独立为Alphabet旗下、与Google平级的姊妹公司,“大概要经历七八轮面试”,一上来就是三轮现场LeetCode最难题,即使Google内部转岗也要严格筛选。
  • 清华的隐性优势:他想进的Perception感知团队里,几位主要负责人都是清华师姐,其中两位比他大四届、都是斯坦福博士。“校友和校友之间多了一层信任,也多了一层亲切感。”
  • 三年多见证了Waymo从技术Demo到rider-only商业化:前排没有安全员,车内只有乘客;但当时仅限于亚利桑那州菲尼克斯下属的钱德勒区域,类似于在上海的嘉定、青浦做运营。

7. 回国与转向L2:L4的重运营,连红绿灯都要人肉标注

  • 回国是家庭与时代叠加的选择:他和爱人都是江浙沪独生子女;2021年底到2022年初,国内新能源产业“如日中天”,自动驾驶是新能源车与燃油车、传统合资品牌做区分的硬核标签。
  • 他给L4之慢的最生动注脚是高精地图:每个红绿灯有几个灯泡、颜色、横竖方向、圆形还是左转/右转/掉头箭头,以及三维位置,都要精确标注。美国基础设施变化相对少,而中国随时可能修路、换灯,需要派人实时扫图,重资产车队和建图运营使L4拓城很慢。
  • 对比之下,L2“只要车卖出去了就可以拓展客户”,是更快进入商业化的产品形态——这是他从纯L4 Robotaxi转向乘用车L2/L3研发的核心逻辑。

8. 为什么是蔚来:一个平台全系标配,和李斌拍板的“额头”

  • 打动他的是产品定义的体系化:蔚来当时强调只做NT 2.0一个平台,激光雷达、4K摄像头、四颗Orin等硬件全系标配。“就像买iPhone”,不同尺寸不意味着系统和App被适配、阉割;对技术团队而言,多平台适配会让每个平台都难以做到极致。
  • 李斌为激光雷达“额头”造型拍板的话被他复述至今:“你们过去设计了那么多款车,真的有人记住过你们的设计吗?今天做成这样,也许流芳百世,也许遗臭万年,但肯定有人记住你了。”如今行业普遍开始采用车顶激光雷达,甚至有人给低配车粘假雷达——“你要去做第一个人,去做引领者。”

9. 在蔚来做成的事:BEV、通用障碍物检测、较早上车的端到端AEB

  • 蔚来是全球较早、姚称“第一个”把激光雷达量产上车的公司,采用图达通激光雷达;这延续了他在Waymo的激光雷达主导路线——L4对安全冗余要求高,纯视觉达不到要求。
  • 落地清单包括激光雷达感知系统、视觉与激光雷达融合、2021—2022年后流行的BEV算法,以及基于激光雷达和Occupancy Network的通用障碍物检测。基于端到端神经网络的AEB也是他们在2023年较早实现全行业上车应用的功能,上车后AEB体验提升了很多。
  • 量产带来的认知升级是数据飞轮的规模差:Waymo几百辆车已是当时最大的车队,但NT2.0、NT3.0平台保有量超过100万辆,车辆每天遇到的corner case“是原来Robotaxi车队无法想象的”。研发可向全量车辆下发触发器,遇到特定场景自动切片回传。

10. 量产的本质:交付导向、多分支版本管控,Google的trunk模式学不来

  • Robotaxi公司更偏研发导向,“通俗讲就是没有明确的deadline”;量产必须交付导向:需求收集、评审锁定、方案锁定、系统研发,再经过仿真、场地、公开道路和影子模式测试,节奏还必须跟整车软件发版,最多因安全Bug放宽一周或上线hotfix。
  • 多版本并线研发的分支管理是一套复杂体系:代码有主线和分支,多个版本并行时要处理共性功能、Bug修复及分支合并。
  • 对比Google“全公司十几万人只有一个版本、一个代码库”的trunk模式——那依赖强大的基础设施和测试门禁系统,背后有几万人做基础设施。实际落地节奏快的团队一定会面临多分支、多版本管理。
  • 迁移到机器人:机器人生命周期可能比车更长,OTA让它“越用越聪明”——数据飞轮回流后不断升级,这套全产品生命周期管理能力“还是蛮稀缺的”。

11. 自动驾驶派的优势:采购不是上淘宝买件

  • 机器人不像3C消费电子,更像车这一类强电系统:涉及传感器、动力、能源、智能化和控制,底层软硬件工程体系相通,供应链和生产制造体系也高度复用,很多机器人零部件来自新能源车供应链。
  • 主持人提到的美国同行名称在原文中带有“应该是Sunday”的不确定性。姚描述的教训是:有团队最初以为在淘宝或亚马逊买摄像头、电线就能组装量产,后来才发现“有一个概念叫采购”。采购要经历SOR提指标、审厂、质量与技术能力评估、多家比价,以及A供、B供、必要时C供保供。
  • 美国媒体所称的第一批车库机器人创业公司倒闭,姚归因于它们缺乏量产概念。“我们更多是day one就做好了打硬仗的准备”——过去几个月最难的就是拉供应链。

12. 反共识:车不是“最简单的机器人”,机器人有机会部署大模型

  • 姚的原话是:“自动驾驶和车厂的人会说车也是一种具身智能,我觉得这个有点牵强。”分野在场景要求:车安全永远第一,“任何万分之一的闪失都是无法挽回的生命之痛”;端侧大模型推理速度有限,深度学习算法又具有概率性,都会出现判断错误。因此,BEV、世界模型和各种自动驾驶大模型不可能代表车上完整运行的全部系统,底层仍需要规则、小模型和高速实时系统。
  • 机器人的容错空间不同:工厂任务失败造成经济损失,可以通过人工接管兜底;“但车不能说发生事故之后让时光倒流,然后人在那个时候踩刹车”。
  • 速度维度也不同:高速上一百多公里每小时,人的反应极限可能在100—200毫秒;机器人多在低速抓放场景,不会因一瞬间出错就造成不可挽回的后果。这支撑了机器人部署VLA、世界模型等前沿模型的可能性,但它们不能直接作为自动驾驶整车系统。
  • 对小米访谈中“车教机器人、机器人教车”的架构打通趋势,他态度保留:“没有那么深度的融合”。定位、导航、PNC等成熟技术可直接复用,但电子电气架构、操作系统、中间件和数据链路之上的具体算法仍很不一样:机器人今天以端到端模型为主,自动驾驶则一定不是纯端到端。

13. “基模”是伪概念:Demo靠后训练,真机数据差四到五个数量级

  • 他先拆穿行业话术:基模含金量高,投资人听到会兴奋,于是很多具身公司给自己贴“具身智能基模”标签。但“我的基模很好,所以今天我的Demo很好”是偷换概念;大部分Demo通过后训练即可做出,即使没有基模,从零为某个Demo采集数据、做后训练,也能做得很好。
  • 量级判断被诗婕追问校准:不是差四分之一,而是“差四到五个零”,即万分之一到十万分之一。类比是2017年Transformer刚出现、2018年BERT参数刚过亿时就谈基模,大家不会理解;等到万亿参数、百万亿规模训练语料时,基模概念才更成立,因为基模伴随涌现。
  • 数据问题也不只是量:连“一个成年人,甚至四岁小朋友在真实世界里的自主能力需要哪些信息”都没有完全确定。他反驳“视觉就够了”的看法:即使短暂失去听觉一天,很多事情也做不好,更不用说触觉、温度感知和力觉反馈。信息维度、数据量和场景种类,才是从肌肉映射走向智能觉醒的核心燃料。

14. 学术派与工程派:一个想终局,一个把Paper变成产品

  • 学术派的使命是做工业界还没有想到的事情。如果已有明确Benchmark可刷榜,学术界的价值就不在于用奇技淫巧争夺毫厘差异,而在于从0到1的原创和架构突破。
  • 他认为今天的架构还不能支撑机器人像人一样工作。人可能不止双系统或快慢系统,机器人也可能需要多层架构:底层是面向电机、最高达到1000Hz的通信控制;中间是10—20Hz的VLA系统,负责路径和轨迹规划;再往上是1—2Hz的世界模型或视觉动作模型,做阶段性目标规划;更上层还需要类似“OpenClaw”的大脑,进行长程、动态环境中的推理和规划。
  • 别小看进家庭:“保姆每天动脑子可能比动手更费力”。按下电梯按钮后判断哪部电梯会先来,本身就是复杂推理。
  • 工程派的价值是把想法做成产品级:性能指标、资源分配、功能安全,以及现实部署中的各种琐碎痛点和Bug,而不是发一篇Paper、做几个Demo、挂到GitHub上就结束。

15. 最稀缺的人才:修过Bug、跟人吵过架的人

  • 他引用OpenAI基础设施工程师温家怡的观点:“培养一个工程师做学术比较容易,但培养一个纯做研究的人做工程师,要经历的门槛和历练更多。”
  • 落到判断标准:真正稀缺的人才不是发了多少顶会论文、刷了多少Benchmark的人,而是把东西应用落地时自己上手过、修过很多Bug、跟团队吵过很多架的人。智元内部刷榜、发论文的工程师,也都经历过和硬件、软件及其他团队一起修完整链路的过程。
  • 他描述一些DeepMind、PI团队早期可能存在的假设:有最好的算法,再接上一台完美机器人,就能出现智能机器人。“其实不存在。”基础设施、硬件、软件、算法必须一起打磨,这也是他认为自动驾驶派机会较大的原因。

16. 加入智元:一段被中止的端到端创业,和红杉的牵线

  • 2023—2024年他曾尝试做端到端智驾创业,得到老东家、红杉等投资人的支持;但复盘时点很清醒:智驾从2016年前后发展到当时已七八年,什么商业模式能跑通、什么技术能落地,投资人已经看得七七八八,惨痛教训也很多,大家没有那么FOMO和兴奋。
  • 与此同时,具身第一批公司刚成立,很多投资人劝他去看看。红杉当时在为智元引进人才,直接联系到了他。
  • 打动他的是人与人之间的chemistry以及资源决断:邓总“非常想清楚要all in做AI”,把智元定位成AI公司,而不是单纯的人形机器人公司;人形机器人是把AI带进物理世界所需的载体。聊了没多久,邓总就果断给出了启动资源,姚认为这在2024年早期的具身行业已经是很大的投入。

17. 邓总画像:低调、克制融资、股权留给团队

  • 邓总的风格与行业惯例相反:很多AI创业者喜欢站在台前向媒体和投资人表达观点,邓总更低调,把精力放在公司内部规划和管理。
  • 智元很长时间没有公布新融资规模,是因为“融资不是创业的最终目的”,只是实现目标所需的里程碑或工具。姚称,给到投资人的股权可能还不到一半,这体现了克制的融资节奏,希望更多股权留给团队和员工。
  • 被问是否是华为风格,他回答“应该可能是”,并概括为全员分享价值创造。
  • 邓总在生态伙伴大会上的名场面是:“我们想要钱随时都可以融,但没必要。”姚补充,智元有时会委婉回避投资人的投资需求,避免在不必要的阶段过多稀释股份。

18. 资本热潮的另一面:全行业通货膨胀,硅谷房价的类比

  • 作为较早创业、跑得较快的公司,热潮反而带来挑战:人才、供应链、产品定价、客户和市场资源的溢价都上升,短期内大量玩家涌入。即使员工选择智元,也可能拿到其他公司的高额Offer,智元必须做出相应动作。
  • 他的类比是:硅谷房价、物价上涨,与美国股市泡沫和高薪人群集中有关;同理,机器人行业越火,人才和物料竞争越激烈,本质上形成行业通胀。
  • 全员股权激励的提前布局,成为抵御市场攻势、留住员工的因素。
  • 对百亿俱乐部扩容的评价较克制:这一波估值涨得特别快,并不是所有百亿公司都处于同一水平线;但他相信这些公司都是优秀团队,未来可以在细分赛道发展。

19. 怎么评估一家具身公司:投入、管理、供应链质量体系

  • 第一看硬核投入:“团队、算力、算法、数据,这几个是绕不过的。”如果融了很多钱却把钱放在账上理财,“就差点意思”。
  • 第二看管理成熟度:组织架构是否清晰,研发、产品和交付如何协同,目标设立、绩效管理和绩效牵引是否形成机制。
  • 第三看供应链、生产制造和质量体系。具身智能首先是复杂、高价值的硬件产品,必须安全、稳定并具备一致性;否则只能做几台实验室样机。
  • 姚提到,过去参与数据采集场、训练场建设时,很多客户反馈买了多家硬件,最后真正能用起来的只有智元一家,有些设备从开机就没调通,但原文只表述为部分客户反馈,并未概括成普遍现象。
  • 金句收束:“具身智能,首先得‘具身’。没有具身,智能只能存在于论文里。”

20. 具身不会重走自动驾驶十年:两三年压缩完,靠聚焦场景

  • 判断已经修正:过去他认为具身要像新能源和自动驾驶一样经历至少五六年、长则八九年;现在看,可能两三年就会走完那些行业经历的长周期。原因包括大模型带来的技术加速、跨行业老兵少走弯路、更大的产业空间,以及国家战略布局带来的资本和人才涌入。
  • 自动驾驶的教训是先在细分领域闭环,如物流配送小车、L2/L3辅助驾驶;全域L4不存在。机器人也不能没有明确ODD就喊长期很难实现的家庭等场景,否则很快会被证伪。
  • 工厂是循序渐进的起点:“你可以说进工厂不是最难的,但至少先得证明你能做出A,再从A点1、A点2、A点3慢慢走到B。”没有技术会突然从天外飞来,一夜之间把人带到另一个阶段。

21. 智元三大业务:干活、硅基明星、前沿探索,“情绪价值也是一种生产力”

  • 分工明确:姚的具身业务部主打轮式机器人,包括精灵G1、G2,以及将发布的G2 Air轻量款和G2 Max重载款,核心是“干活”、作业智能(manipulation);王闯的通用业务部做全尺寸双足人形机器人,刚发布A3,定位“硅基明星”,用于讲解、接待、文娱表演和商业代言;志辉负责灵犀系列和X Lab创新组织,X2以及韦伯斯特空翻属于运动智能。
  • 为什么需要台前工作?姚回答:“情绪价值也是一种生产力,这也是一个很大的市场。”
  • 三种智能——交互、运动、作业——目前分别发展,最终要达到人的智能程度,三者还会充分融合。创新不局限于单一部门,每个业务部和产品线内部也有面向下一代技术的团队。

22. 群英汇聚会打架吗:BU制、自造血与加权系数

  • 对“强人共存”的猜测,姚直接祛魅:大家喜欢八卦和脑补剧情,但只要分工和合作机制明确,每个人每天都忙不过来,就不会有想象中围绕利益的持续冲突。
  • 三人每周有很多会议,彼此也会互相支持;广州地铁的安检引导、巡逻和咨询机器人,就会使用其他部门的交互技术和产品。管理秘诀是抓开头:管理层定期战略研讨,员工有OKR,先把目标和路径想清楚。
  • 邓总推行BU制,每个BU都有产品、技术和商业化目标,预算按目标规模和挑战性分配,而不是只看收入。轮式机器人进入难度更高的工业场景,商业化成果会有加权系数。
  • 精细化管理应该在顺利时做,因为那时成本和代价更低;这只是姚转述的一个管理判断,原文没有将其归于特定人物。

23. 智元系孵化潮:不是内斗,是市场化竞合

  • 对“内部不和才独立”的传闻,姚回答“不至于”:智元资源不会成为瓶颈,只要目标清晰、事情有价值,就能获得相应资源。
  • 子公司独立,一是为了更好服务全行业,二才是成为单一领域龙头。蜜蜂对智元也会正常做生意;如果其他客户更早提出需求,产能排队时按先来后到的市场化方式运作。
  • 竞对会不会使用智元系服务?他的观察是,很多具身公司仍认可智元数据:有人参加比赛、使用开源数据,也会在数据服务推出后主动联系。原因一是行业关系尚可,二是各公司重复投入重资产采集过于吃力。
  • 行业远未到零和博弈,竞合普遍存在。姚预计一两年或两三年后,头部团队都会需要上千万、上亿小时数据,到时只要能稳定提供高质量数据,就会照单全收。

24. 从闭源到开源:行业不够快,先把聪明脑袋请进来

  • 诗婕提出矛盾:姚去年曾讲智元要走苹果式软硬件一体的闭源路线,如今却开源数据集、共建生态。姚解释:“资本很快,但技术和产品还不够快”,需要让更多聪明人加入,并提供好用的本体、数据和Benchmark。
  • 对技术竞争的态度近乎宣言:“如果一家公司害怕技术竞争,那就先投降算了。”他相信自己会成为关键技术变革的核心参与者。
  • 对“是不是因为别家也进百亿俱乐部、闭源不再work”的猜测,他否认:融资与企业真正成功没有必然关系,很多融资很多的公司也可能技术和产品迭代不匹配。
  • 配套动作包括投入几个亿做产业生态基金,发展高校、应用开发和交付伙伴;比赛提供Baseline、平台和数据,最终有很多参赛者超过Baseline,其中一些明显优于智元,这些人是智元希望结交的对象。

25. “微波炉模式”:两个月量产一款机器人的奇迹

  • 加入后很快进入“微波炉模式”、开始“红温”:2024年上半年,能把VLA真正部署到机器人并现场展示给投资人,行业内仍很少,智元用约一两个月做到了。
  • 精灵一代从8月底萌生想法,到9月方案设计、供应链和代工定点、产线搭建、试制和批量生产,“真的只有两个多月”;行业正常至少九个月。他也承认其中有运气。
  • 提速的两个抓手:选择成熟代工供应链,使人员可动态调配,并借用3C行业的质量、工艺、员工治理和信息安全体系;以及小团队的founder mode——二三十名软硬件、系统成员一起驻扎工厂,最终把第一批机器人做下线。
  • 这种方式只适合0到1阶段。精灵T2从定义到生产爬坡经历了近九个月,到了上万台规模,必须靠完整项目管理和质量体系。

26. 找灵猴代工:供应商不相信故事,只相信ROI

  • 2024年找供应商的现实是:投资人可以相信机器人长期故事,但供应商首先要解决订单和生存问题,不会因为“未来年产十万台”的大饼就提前投入。执行器、电机、减速器、电子件、相机、雷达和电池供应商都要看ROI。
  • 到2025年下半年及2026年,情况发生变化,汽车和新能源供应链开始主动联系。
  • 最终选定苏州灵猴机器人。姚提到其估值最近据说已达到50亿元;评估重点一是能力体系,二是是否真正相信智元会变得更好、愿意强力协作。灵猴在3C领域有服务头部客户的经验,质量、安全、信息和动态产能能力已有验证。
  • 机器人订单峰谷效应比车更强:在某些时刻会把代工厂“拉爆”,十一、五一等时期需要加班、加人、加产线。因为To B市场不像乘用车那样稳定可预测,找对场景和客户后,需求可能突然出现。

27. 供不应求的现状:没有任何安全库存

  • 当下状态是供应链仍受限制:“工厂生产完直接拉走,没有任何安全库存。”理想状态是月销一万台、保留两三千台库存应对动态需求,但目前做不到。
  • 上游被拉得很痛:质量管理、培训赋能和产能都承受压力,甚至有供应商做到一半因过于疲惫而放弃。

28. 精灵为何火:工业级标杆、用工痛点,与只有一年的护城河

  • 投资人对精灵系列评价很高,姚的解释是:它是行业里第一个工业级具身智能标杆作业平台,传感器、执行器和算力配置都达到较高水平。烦恼随之而来:友商开始做许多相似产品。
  • 护城河量化得很诚实:“一年左右。”智元全职员工加共创员工接近2000人,完整走完IPD流程仍需九个月;其他团队如果同样按严格标准做,没有一年很难完成。
  • 需求侧的底层逻辑是用工:中国招工越来越难,人口红利消退,年轻人不愿长期进入工厂。调研发现,许多工业岗位把人放在严格节拍和统一节奏中工作,像机器人一样运行;人口结构变化会让用工挑战继续加大。

29. 现金奶牛与价格战:B端定价逻辑与分级渠道体系

  • 精灵被主持人称为现金奶牛、最快实现ROI的产品,姚回答“可以这么说”。定价逻辑清晰,因为它主要面向B端:进入工厂后与等效人员的薪资成本比较,只要在全生命周期内覆盖这部分成本,就能形成相应售价。
  • 价格战方面,精灵基本没有参与,但其他细分赛道会局部受到影响,完全不受影响也不现实。
  • 智元设置终端客户目录价、MSRP市场指导价,以及精英渠道、VIP渠道等分级价格体系;没有价格体系,市场容易失序。

30. 三五八战略:每年加两个零的野心是怎么算出来的

  • 数字链条是:2023年只卖一台样机,可能30万元;2024年6000万元营收;2025年超过10亿元。量产元年对应几百台和几千万元,商用元年扩大到十亿级,2026年则定义为部署元年。姚概括为“每次都是加两个零”。
  • 对初创公司提出三年10亿元营收、10万台出货的激进目标,他承认“敢想”,但认为目标来自对连续增长的复盘。核心变量是打开真实应用市场、进入场景并为客户产生闭环价值。
  • 路径必须聚焦:在有限资源下,把资源ROI做到极致,瞄准与当前技术匹配、最愿意共创、最有规模化复制潜力的场景并打穿。
  • “智元是最有野心的公司吗?”姚回答“可以称得上”:“要做就做最好,要做开拓者,而不是跟随者。”他认为机器人可能成为继手机、汽车之后的海量工业终端,也是物理AI和生产力入口。

31. Demo满天飞的时代:怎么判断真假

  • 姚的自我告诫是:机器人是硬件,可以每天做Demo;但从业者要看清Demo是否解决了本质技术难点,还是仅为展示临时做出效果。
  • 对叙事的警惕很直接:“不能像投资人一样相信那么多故事。”叙事者讲出来的往往是希望听众听到的内容,例如宣称发现scaling law、已经出现涌现,再配合Demo制造似是而非的印象。
  • 可操作的检验法是“以终为始”:如果技术真的好到足以解决问题,一定有人愿意使用,甚至愿意付费。调研客户是否下单、效果离实用有多远,基本可以判断Demo的含金量。
  • 但从Demo到量产至少需要九到十二个月,最终验证可能要等一年。

32. 一年认知之变:“跪得下来”才能进真场景

  • 这一年最大的认知更新是:机器人要竞争场景,必须沉下心、撸起袖子,甚至“跪得下来”;工业不相信故事和眼泪,只相信ROI。这个比喻来自汽车行业供应商面对甲方时的高响应、压成本和严付款条件。
  • 公司转型最难的一跃,是从以产品为中心转向以客户为中心。以产品为中心,是拿钱做Demo再融资;真正实现商业闭环,必须解决客户需求、提供价值。
  • 客户并不特别在意你是人形、猴型还是狗型机器人,关心的是服务是否稳定、经济、可靠、快速。过去一些机器人“走进工厂拍了个片又走出来”,智元要解决的是“待在工厂别出来”,否则就会被退货。

33. 龙旗南昌24小时直播:主产线、全天、100%成功的三重含金量

  • 姚称,上周二智元在江西南昌龙旗工厂联合新华社做了人形机器人在主产线全天直播生产。第一重含金量是“主产线”:不是实验区,不能成为上下游卡点,而且3C主产线节拍很高。
  • 第二是“全天”:不是直播几分钟,而是此前已经稳定运行一个月,才敢进行全天直播。
  • 第三是“全球直播”:敢邀请新华社进行现场直播,体现了对稳定性的信心。姚称全天完成2300多次任务,100%成功、0失误。
  • 与去年8小时、相对可解耦的搬料箱上下料相比,这次进入最高节拍的3C主产线,要和工人协同并完成精密操作。姚称特斯拉、Figure等美国头部企业尚未做过类似活动,但没有断言他们一定做不到。

34. 场景争夺战:搬箱子正面PK,其余靠“双向奔赴”的共创

  • 搬料箱是泛工业广谱需求,大家相对都能做,竞争只能回到产品、价格和服务:谁又好又便宜、服务又好,谁胜出。
  • 姚称在个别客户现场,智元曾是唯一达到技术要求、完成动作节拍并达到成功率要求的团队;料箱变化后,还能在两小时内完成适配、重新上线,并保持100%成功,最终通过盖章验收。
  • 进入真实产线不能靠拍脑袋:要在现场待几天,观察工作流程和用工痛点,再集成工厂MES系统,完成通信、联调和验证。机器人目前还没有“插上电就能用”的通用性。
  • 早期愿意共创的客户,往往是能在产业变革初期看到未来价值的企业,会提前引入技术、先行先试。姚认为海外科技巨头也在积极探索将具身智能引入供应链和生产制造体系。

35. 智元的独特性:聪明人很多,我们做好老实人

  • 对“行业不缺你能做、我也能做的人,缺的是独特性”的判断,姚认同叙事正在趋同。智元的答案是:“现在不缺聪明人,大家可以去做聪明人,我们来做好老实人。”
  • 量化版本是:“聪明可能只占10%,剩下90%是完整体系的能力。”智元要先把这90%构建好,在技术打通和场景渗透阶段保持准备状态。
  • 他引用地平线创始人余凯的观点:真正的护城河不是“人无我有”的绝顶算法,而是每天解决琐碎工程问题,在体系里一点点积累,最终让每一块砖构成完整城墙。
  • 智元的体系完整包括公司治理、量产体系、人才梯队和技术布局。

36. VLA与世界模型:谱系、局限,与“都不是终局”的判断

  • 世界模型“像大姨妈一样,隔一段时间就会来”:自动驾驶火了会来,游戏火了会来,具身智能火了也会来。本质是对物理规律和状态转移规律进行数字化、神经网络化描述。
  • VLA是语言模型、多模态语言模型向具身领域的延伸。姚提到2023年上半年Google的PaLM-E:PaLM加Embodiment,把语言模型用于机器人动作后训练。
  • 世界模型最近一轮受到关注,来自2023年前后Wayve的GAIA-1、特斯拉等工作,以及视频生成技术的发展。世界模型可捕捉液体流动、玻璃破碎、软物体形变等时空连续的物理细节。
  • VLA的局限在于语言与动作之间存在表征鸿沟:语言高度抽象、信息密度高,一本小说几KB,拍成电影可能需要几十GB;语言是高度压缩但有损的表达。
  • 终局判断带有明确保留:VLA更多从语言发展而来,世界模型更多在2D视频、第三人称视角中发展,而机器人处在三维物理世界、第一人称视角,二者都不是最终完全形态,未来可能成为上下游分层配合的架构。
  • VLA仍然必须存在,因为机器人要理解开放指令,把指令映射成规划,再映射成移动、操作和交互行为,这需要语言体系中的逻辑推理空间。

37. GO-2、榜单第一,与已经自动化的数据闭环

  • 智元的价值观是“追求卓越,要做就做到行业领先”。姚称最近更新的GO-2模型引入动作思维链、异步执行等机制,在LIBERO-Plus、Genie Sim 3.0等榜单上达到第一名水平。
  • 自动驾驶影子模式的触发器已经部署到机器人:龙旗工厂精密上下料若长时间无法成功放置,规则和监控模型会自动触发数据回流,再分析是软硬件问题,还是产线位置、光线等变化导致算法鲁棒性和泛化性不足,补充数据训练后以新软件版本下发。
  • 研发迭代的抓手不是刷榜或Demo,而是围绕真实场景验证、打磨和迭代整套系统,让飞轮每一环都参与进来。具身业务部近500人覆盖硬件本体、质量测试、端上与云平台软件、算法和数据等工作。

38. 两三年质变的推算:GPT-3镜像与回流数据成为主流

  • 数据来源有阶段性:当前是启动阶段,仿真、真机、人类穿戴式和以人为中心的数据都尽量吸收;进入真实部署增量阶段后,机器人回流数据会成为主要增量来源。姚判断可能在两三年之后。
  • 推算逻辑是历史类比:如果今天相当于Transformer和BERT的早期阶段,发展到GPT-3大约需要三年。姚同时认为scaling law在其他AI范式下也应该适用。
  • 诗婕指出其中的差异:语言模型到GPT-3才让外界看到方向成立,而具身智能尚未到GPT-1,行业已经开始扎堆进入。

39. 蜜蜂缘起:一顿饭、Scale AI,和更高门槛的物理AI数据

  • 起点来自投资人红杉:饭局上对标Scale AI。姚称Scale AI最后一轮融资估值可能已达200多亿美元,后来被Meta变相收编,Alex Wang也加入Meta。
  • Scale AI主要做数字世界的数据标注:互联网视频、图片和自动驾驶数据较容易获得;标注员有电脑、经过一天培训即可开始工作,核心竞争力更多是人力运营。
  • 具身数据则要进入物理场景,先解决超市、酒店、工厂能否进入的问题;还要雇人、管人,投入机器人、摄像头、夹爪和穿戴式设备等固定资产,并承担大规模视频存储、处理和算力成本。因此姚认为,具身数据的复杂度和门槛应该催生一家价值更高的平台。
  • 底气来自存量:智元已经做了一年数据,AgiBot World在行业中有较强影响力。英伟达GR00T N1的Tech Report显示,其使用的真机数据中80%来自AgiBot World;发布时还只使用了其中一部分数据。论文通常会列出数据来源和占比,因此可以判断使用情况。

40. 中美数据市场对比:美国不卷,中国跑不出Scale AI

  • 姚描述的市场结构是:美国很多行业通常只有老大、老二,老三可能不存在;中国一个产业火起来就会涌入上百家。中国数据标注业务量大,却没有跑出Scale AI式头部企业,原因在于竞争容易落到价格:上海做、西部做,成年人做、在校生和中专生做,持续压成本。
  • 在技术门槛不高时,大家会认为“你能干,我为什么不能干”。具身数据所需的场景、人力、设备和算力门槛,可能改变这一格局。
  • Scale AI的闭环是:在数据业务中积累数据,训练自己的模型,再用模型做预标注和自动化标注,提高数据服务效率。姚认为这具有参考意义。
  • 对“明修栈道、暗度陈仓”的质疑,他承认这会带来竞争优势,但认为技术本身没有太多秘密,最终比拼的是数据管线、配比、质量以及全栈体系。行业最终可能需要公共性质的一站式数据服务平台,而不是每家公司重复投入。

41. 数据军备竞赛:比的是速度,不是存量

  • 竞赛已开打:年初AgiBot World发布时,百万条数据、三千多小时已是最大规模真机数据集;2025年底,Generalist称拥有20万小时数据,姚判断其应主要是无本体数据;Sunday也被主持人提到过其数据布局,但原文对名称带有不确定性。
  • 姚认为今年会进入数据军备竞赛年:大家会向百万、几百万、上千万小时开卷。不如亲自下场,否则可能落后。
  • 核心公式是:“不是一个谁拥有多少量的问题,而是谁在多快的速度内拥有多少量的问题。”如果花两三年构建别人两三年前的数据规模,数据即使属于自己,也可能已经落后两个数量级。
  • 客户的口径印证急迫性:“as many as possible, as soon as possible”。价格可能随着数据规模上升而下降,但对大厂而言,百万小时、约10亿元人民币的采购额仍不是特别大的数字。
  • 姚转述Generalist与Google DeepMind技术人员的共识:如果数据是唯一决定胜负的变量,中国公司现在就可以宣布一定是赢家,因为中国有工业场景、相对较低的人力成本和成熟产业链。

42. 好数据的定义:真实、多样,和失败数据的平方关系

  • 蜜蜂的优势有二:智元自己布局多种算法,清楚算法需要什么数据;同时具备数据运营体系,能让数据团队和研发、算法团队动态对齐需求,定制方案并验证数据有效性。
  • 质量维度包括链路稳定性(时间同步、传感器到执行器的标定)、数据分布多样性(同一抓放任务在位置、光照、背景等方面变化),以及随模型阶段动态调整,定向采集当前仍会失败的setup。
  • 对“脏数据”的澄清很关键:脏不等于低质量,而是包含多样性和失败样本。只见过成功案例会产生幸存者偏差;机器人也需要知道失败后如何回来。
  • 姚称,在模仿学习中,如果只有成功经验,执行偏差会逐步放大,失败概率与执行时间成平方关系;强化学习则像小孩学走路,要通过摸爬滚打和成功、失败共同探索,知道什么稳定、什么不稳定。
  • 底线仍是数据质量:“摄像头黑屏、轨迹差几厘米”不是需要的脏数据,仍属于低质量数据;“garbage in, garbage out”。

43. 仿真之辩:不执着流派,工厂只认四个九

  • 对王鹤代表的仿真路线,姚先给足空间:有些任务、环境和作业对象,仿真能完成大量前期开发和验证;Genie Sim等技术可以高保真重建环境、改变元素并做泛化。人也不只从现实接触学习,还会通过课堂、书本、录像和电影学习。
  • 但边界清楚:有些环境、任务和物体的物理交互规律非常精细,只有真实接触和交互才能获得贴合实际的数据分布,必须从真实世界获取。
  • 实用主义收尾:仿真甚至真机做到80%或90%成功率,学术上已经不错,但工厂至少要求四个9。此时只能想尽办法达到标准,而不是执着于属于哪种技术流派。

44. 蜜蜂的名字与生意模型:具身数据界的滴滴

  • 命名首先追求朗朗上口和亲和力,如滴滴、美团;其次是采蜜对应采集数据,蜜蜂也象征寻找和探索。
  • 更深一层是分布式愿景:“未来数据获取一定是分布式、集群式的”,无数机器人分布在社会各处,每天回流数据,形成蜂群式社会协同,使命是“让全世界的数据为AI所用”。
  • 与滴滴不同,具身数据不是To C市场,需求侧集中在KA和大B客户,需要先用To B方式占据客户心智,再发展上游产能。
  • 主持人提到发布会强调样机数据48小时内完成、客户反馈24小时响应,姚明确确认“24小时内响应”;原文没有由姚单独确认48小时为统一行业标准。原因是现阶段定制化程度高,需要与一线研发、算法团队持续沟通。
  • 2026年规划千万小时产能,姚称相当于一万人,或机器人按每天十几个小时的正常工作强度工作一年;若达成将“绝对领先”。当前机器人采集占比仍较多,但无本体、以人为中心的数据正在快速上量,预计人力规模会反超机器人。
  • 已发布两款Migo产品,后续还会研发五指穿戴和全身设备,按照市场需求定义产品。

45. 全球化与合规:day one出海,数据本地存储

  • 发布会有英语、日语、阿拉伯语和韩语同声传译,注册申请参会者超过5000人,到场人数原文表述为1000多人、实际可能2000多人,受场地容量限制;这些都体现了蜜蜂“day one就要全球化”的定位。
  • 蜜蜂生产源头不只在中国,在东南亚、美国、日韩和中东都已布局相应节点。Scale AI等存量公司也可能通过自营或合作,在东南亚等低成本地区布局产能。
  • 数据生产和标注主要是重运营业务,最终要回到成本和效率。
  • 合规仍在构建:国内数据出境未来会走正规、完整的体系;对有法律法规要求的地域,不把数据回流到国内等其他地区,而是在当地存储。

46. 数据孤岛与统一标准:末端执行器抽象,一年左右形成共识

  • 当前硬件规格和数据需求仍未完全统一,更多是一个个标杆案例。姚判断未来一年左右,大家会对FOV、帧率、分辨率、相机布局和其他模态形成基本共识。
  • 硬件不同不代表数据完全不可通用:不同机械臂、不同构型的人形机器人,动作空间可以用相同空间表示,最终可抽象为末端执行器,也就是手腕轨迹。
  • 世界模型本质上可以是predict next frame,帧是二维像素矩阵,因此能够从不同机器人、人的数据中学习;模型也可能从不同机器人的操作过程中提取通用物理规律。
  • 数据孤岛的切入点是盘活闲置产能:很多采集场、训练场没有被专业高效运营,加入蜜蜂体系后可以通过培训和需求分配提升效率。
  • 数据商城既接收紧密按照蜜蜂标准运营的数据,也欢迎第三方上传自己的货架数据。张江3000平方米采集中心是AgiBot World的产地,更像样板间和司令部:负责设计流程、试采集、打磨方案,再下发到外地采集场规模化执行。

47. 开源与闭源的光谱:一切围绕“让更多人把机器人用起来”

  • 取舍原则是让更多人把机器人用起来,并用于有价值的场景。开源数据是让更多团队体会高价值具身数据带来的模型能力。
  • 极地Studio、灵星平台、零创平台等面向开发者:零创平台可以把舞蹈视频转换成机器人舞蹈,灵星平台允许定制机器人的角色和音色。
  • 闭环设计依赖用户授权:在授权情况下,平台数据可以反哺底层模型,形成从商业成功到数据飞轮的链路,覆盖作业、运控和交互等模型基础。

48. 标准之争:G1—G5分级、政府牵头,与两三年后的准入门槛

  • 姚在2024年提出过仿照自动驾驶的具身G1到G5技术演进路线。主持人称其已纳入上海具身智能智能化发展分级指南;姚确认相关标准由上海市人工智能行业协会牵头、智元共同参与制定。智元也是工信部人形机器人标准化技术委员会副主任委员单位。
  • 蜜蜂希望推动两类行业共识:数据质量标准,以及价格、交易模式等商业化标准,避免质量参差不齐、早期就陷入价格战,把行业做坏。
  • 政府标准短期未必立即显现,但伴随大规模商用,会逐步形成应用门槛;姚判断大约两三年后发生。
  • 当前坐标是“G3到G4之间的中间态”:G3是在特定场景、特定任务下端到端自主执行,G4是跨场景、跨任务端到端执行。

49. 涌现的前夜的前夜:一亿小时与十亿小时路线图

  • 一亿小时这个门槛来自与很多用户头脑风暴后的共识,可能对应GPT-2、GPT-3当年使用语料的时长规模;一亿小时以上的需求,目前还无法准确预测,先用一亿小时验证现有想法。
  • 主持人概括“今年千万小时,明年全球到一亿小时有希望”;姚在被问到路线图中的十亿小时级别时,判断2027—2028年可以达到,仍是两三年。
  • 涌现发生在哪?姚回答:“一定是发生在实验室里面的。”先从工厂和其他场景收集足够数据,再在实验室催生技术。
  • 他最期待的画面是一个“啊哈”的moment:机器人似乎出现某种自主意识,能在复杂环境中自我规划、响应指令,而不是单纯从画面到执行的肌肉映射。
  • 被问职业生涯是否经历过类似时刻,他说科技史上可能只有近几年大模型诞生后带来这种感受,自己目前还没有经历过,非常期待。

50. 收尾的几笔:估值、传闻与自我定位

  • 蜜蜂当前被主持人提到约30亿元估值,姚回应最新一轮已经不止这个数字;按营收、利润和长期稀缺性判断,他不认为估值过高。
  • 对“各家公司未来都自己采集数据”的质疑,他判断供给规模的增长赶不上需求增长。未来需要上亿小时甚至更高规模的数据,需要大量设备和人员进入真实世界,蜜蜂及产业链各参与者都有较高增长空间。
  • 独立创业传闻,他明确否认:“这件事肯定不会发生。”他认为市场上真真假假的信息有时是烟雾弹,原文提到的是朋友和候选人在招聘过程中询问,并未特别提到猎头。
  • 自我定位上,他不完全接受“商业操盘手”,更愿意定义为“积极推动机器人技术和商业应用的开拓者”。
  • 对从零建立具身公司的建议是:从产品到量产、商用再到建生态,这些路必须走一遍。哪怕OpenAI、Anthropic,也需要靠代码模型、Token等方式盈利,不可能只凭“我是基模”就无限融资、长盛不衰。
  • 数据与算力类似,但可能比算力更难获得:算力是成熟、标准化产品,有钱即可快速获取;数据从需求规划到有人承接、运营和交付,是漫长而系统的过程。
卫诗婕

对于巨声的智能涌现来说,现在是几点前夜吗?前夜的前夜,等到我们有一小时数据的时候,我认为这个前夜就来临,二零二六年了。巨声智能到底到 G P 几了?投资人很很很关心啊,希望你们已经到二了,至少,求求你们了,最好到三吧,其实一都没到呢。今天巨声的真机数据的量级还不如当年搞机模的时候的。你讲机模其实是一个比较伪概念的事情。智源是这个行业最有野心的公司吗?可以称得上。二三年其实我们只卖了一台样机,卖了可能三十万。二四年我们六千万的营收,然后到去年已经超过十亿,它每次都是加两个零。我们要做就做最好,要做开拓者,而不是去做跟随者。所以我们讲的数据军备竞赛,它其实不是一个谁拥有多少量的问题,而是谁在多快的速度内拥有多少量的问题。上周的时候,Journalist 和 DeepMind 团队达成了一个共识,说如果数据是这场竞争中啊唯一决定胜负的变量的话,那么中国公司肯定已经现在就可以宣布他们一定是赢家。今天的巨声。远未到涌现,所有的都是在做从视觉到动作的肌肉映射。大家都认为车是最简单的机器人,我觉得这个有点牵强。我们说未来两到三年我们可能会迎来一系列质变啊,就你最期待看到的画面是什么样子?真正有那么一个啊哈的moment,你感觉哎,机器人好像确实有那么一点觉醒了。

2026年,具身智能成为聪明人扎堆、资本热潮近乎疯狂的行业。这条热门赛道中,智元机器人是最早的百亿俱乐部成员之一。在人形机器人出货量狂奔的路上,智元的野心并不止于具身本体的军备竞赛。今年,他们做出了一个让全行业瞩目的反哺举措:将旗下的核心数据资产彻底剥离,独立孵化了全球领先的一站式物理AI数据服务平台“蜜蜂”。

本期嘉宾姚卯青不仅是智元合伙人、具身业务部总裁,也兼任蜜蜂董事长兼CEO。这期播客在5月蜜蜂发布会后录制,或许是有关智元战略最深入、最完整的一次访谈。从Waymo到蔚来,再到智元,姚院亲历过自动驾驶从概念到量产的全过程。他说,今天的具身智能连GPT-1都没到,而机器人离真正涌现智能还差1亿小时的数据。

欢迎姚院长,跟大家打个招呼吧。

姚卯青

观众朋友们大家好,我是智元机器人、蜜蜂科技的姚卯青。

卫诗婕

我听大家都叫您“姚院”,觉得您性格非常儒雅。您觉得自己的性格色彩是什么样的?

姚卯青

“儒雅”这个词,大部分人听起来肯定是褒义词。我曾经也这么觉得,但作为一家创业公司的经营管理者,儒雅是一方面,同时还需要很多狼性的地方。

我觉得我是一个比较顺势而为的人。有些人觉得我是一个“人间清醒”的人。

卫诗婕

怎么叫“人间清醒”?

姚卯青

很多时候,包括我怎么样去和团队构画规划、做事情,以及看技术方向或商业方向,我们不会盲目跟随热点,更多还是会去看其中的商业本质。

1. 职业道路顺势而为

卫诗婕

我们先从您的职业经历讲起。您的职业经历很有连贯性:您从世界顶尖的学府毕业,在硅谷巨头担任过核心技术岗位,再到国内车企的一线管理,然后加入具身智能的创业大潮。这个职业轨迹是您预期当中的吗?

姚卯青

说实话,肯定不能完全预期。大家都说过,伟大不可被规划。回过头看,10年前、15年前,没有人能预料到今天技术会发展成什么样,行业能发展成什么样。

我觉得更多还是我前面提到的,我是一个顺势而为的人,顺着技术的浪潮去不断让自己成为浪潮的相关者。

卫诗婕

您是清华本科、USC博士。我想知道,这两所学校给您带来了什么样的烙印?

姚卯青

清华本科是一个非常重要的人生阶段。清华确实教会了我很多道理,更重要的是让我认识了非常多牛人。他们做事的理念,和我们的校训是息息相关的。

清华的校训叫“行胜于言”。可以发现,清华人还是比较务实、比较低调的,可能不同于其他一些学校,它们的理想主义色彩或者行为模式会更加奔放一些。清华人还是普遍默默地耕耘在各个领域、各个方向。

卫诗婕

智元创业里面有非常多清华毕业的人。

姚卯青

对,尤其是在我们这个专业。因为我原来是清华电子工程系的,你会发现电子工程系又可能占了清华的一半。

3周前,清华校友会在上海有一个电子系专委会,举办了年会。因为今年具身智能非常火,所以专门举办了一个圆桌论坛。请到的几位圆桌嘉宾,包括我在内,都是电子系毕业的。

当时去的有陈一伦,他是智航的创始人;有王潜,是自变量的创始人;还有无界智行的发起人、现在清华深研院的丁文博老师。还有很多没有来的,大家可能都听说过,比如银河通用的王鹤、星海图的高继扬,还有“雪花酒哥”,都是明星天团。还有松延动力的江哲源,他也上过您的节目。包括蚂蚁宁波的申宇君,他们也都是电子系的。

卫诗婕

见到同行又是校友,你们关系好吗?

姚卯青

有一些人之前也是认识的,但是现在大家都太忙了,平时很少有机会近距离接触。反而是通过这样的圆桌,大家偶尔才能见一见。

关系上来讲,清华校友之间关系都还是挺好的。但是在一个竞争非常激烈的行业里,公司和公司之间肯定也是在充分竞争的。赛场上见。

卫诗婕

清华电子工程系是不是意味着有很强的学术底层能力?这件事情跟智元机器人有关系吗?

姚卯青

有关系。清华电子系现在应该也差不多是入学门槛最高的专业。虽然我当时高考成绩还不错,但在清华来讲,高考的已经是第二梯队了,第一梯队是保送进来的。

你会看到有非常多电子系的人,是拿了奥赛金牌保送进来的。我们也在自身领域看到了那么多学霸。电子系的课业也是最重的,因为它是一个非常综合的学科,所以锻炼的是一种系统能力。

底层有很多电路,模拟电路、数字电路、集成电路,再到上面的计算机编程、很多算法、通信、信号处理、图像。当年虽然还没有深度学习一说,但已经有很多机器视觉、图像类的算法。再到光学、微波,其实是一个非常庞大的学科,涉猎很广。

这也导致电子系的学生过去科研压力非常重,尤其是在大三,基本上就是一个魔鬼式的大三。

卫诗婕

这意味着也比较能扛压。

姚卯青

扛压能力还是挺强的。这是清华的影响。

卫诗婕

那USC呢?

姚卯青

在出国之前,我确实不知道中国以外的教育体系是什么样的。到了USC之后,我第一次感受到了国外的教育理念和教育氛围。

比如说,我觉得他们一个非常好的地方在于很注重实践。国外以前有一个机制,我觉得做得不错:很多老师会从工业界引进,而不是常年一直在学校里教书的老师。我觉得在今天这个时代,这一点更重要了。

因为人工智能,包括斯坦福的李飞飞老师等人,也都在说,现在学校资源太有限了,跟工业界没法比。AI时代又是一个拼算力、拼资源的时代。

去到国外以后,我发现大家很重视学校和工业界的连接。包括你所有做的作业,都是一些工业界现在一线正在做的、很实战的东西。

另外,我也确实看到了美国学术的号召力和学术生态还是非常繁荣的。美国有非常顶尖、在国际上知名的领军学者,他们也确实很纯粹、很潜心地做学术。很多图灵奖、诺贝尔奖获得者,平时都非常纯粹、单纯。

卫诗婕

南加大有什么特点吗?

姚卯青

南加大最有名的专业其实是电影学院。对,斯皮尔伯格就是在那里毕业的。因为坐落在洛杉矶,所以很多明星、导演都是从南加大出来的。

另外,南加大是一所非常好的私立学校,整个财力还不错,所以在各个学科,包括基础设施和师资力量上,我觉得一直走在比较靠前的位置。

卫诗婕

后来为什么选择去硅谷?

姚卯青

这肯定跟就业相关。最顶尖的科技公司还是聚集在硅谷,所以像USC、UCLA、Caltech,大家毕业以后都会纷纷去硅谷寻找更好的机会。

2. Waymo开启自动驾驶生涯

卫诗婕

为什么毕业之后去了自动驾驶行业?

姚卯青

用现在的话说,我们这批人已经算“中登”了。我们毕业的时候才是2014年,是深度学习刚刚兴起的时候。

我读博士时学得更多是偏半导体物理,属于电子工程系。毕业之后我也不是马上进入自动驾驶,因为自动驾驶真正开始火起来,差不多是2017年以后,Waymo从Google独立出来之后。

在那之前,我在Google还工作了一段时间。那段时间算是开始接触人工智能的一些最新技术,而且是一些应用。我们当时在Google的广告团队,广告其实要用到很多现在不能叫大模型、只能说小模型的深度学习算法,去做推荐。

比较印象深刻的是,那时候刚刚出现了一些现在看来很经典的计算机视觉算法,比如ResNet。Google内部还有一个叫GoogLeNet的模型。当时我们做的是Display Ads,现在的人不一定清楚。那时候如果你用安卓手机,或者经常用PC浏览器浏览网页,会弹出一些小广告,往往是图片形式。Display Ads的推送和匹配,会用到当时出现的那些计算机视觉算法。

除了计算机视觉算法之外,当时语言类的模型、NLP以及Transformer,我们在Google内部也是第一时间开始应用到业务上的。

Transformer其实是2017年在Google诞生的,论文叫《Attention Is All You Need》。同年,我们就已经在广告语自动生成中用上了基于Transformer的、当时还叫机器翻译的一套框架,去做创意生成,也就是广告标题的生成。

大量投放时,既要保证多元化,也要保证投放量。你不可能招一堆人天天写广告词,所以这里面就用到了早期的自然语言处理技术。

后来我觉得这个事情非常有意思,只用在广告上好像还不够硬核。所以那段时间我就在Google内部寻找:有哪些业务和团队不仅在使用这些前沿的AI技术,同时还真正研究、开发这些底层技术?

那时候是2017、2018年,自动驾驶是最火热的人工智能赛道,给大家无限的畅想,就像今天的具身智能一样。大家看到了一个想象力非常广阔的前景。

日常生活里的衣食住行,吃穿可能跟AI还没有那么直接相关,居住也相对复杂,但出行是可以被变革的。它是一个非常大的市场,在美国叫Transportation as a Service,简称TaaS。这里面最核心的,其实就是AI算法。

所以我就在那个时间点,在Google内部接触并加入了Waymo团队。

卫诗婕

所以是您自己的主动选择?

姚卯青

是我自己的主动选择。其实那时候要加入Waymo并不容易,因为Waymo已经从Google独立出来了。

那个时间点,Google做了一轮集团重组,整个集团叫Alphabet,Google只是Alphabet下面的一家公司。Waymo原来是Google X实验室里面的一个孵化项目,后来成为Alphabet旗下独立的公司,跟Google是姊妹关系。

要进入Waymo,大概要经历7、8轮面试,而且面试难度远超Google。现在的小伙伴可能知道,要考一些算法题,比如LeetCode。Waymo一上来就是3轮现场LeetCode,而且是LeetCode最难的题,再加上几轮线上面试和交流。

整个Waymo当时是全球最难进的团队和公司之一。太多人想进Waymo,即使是在Google内部转过去,也会严格筛选。

卫诗婕

但对于清华学霸来说……

姚卯青

我觉得确实也是因为热爱。当时准备得比较充足。不过这个时候我又要说一下,清华还是有优势的。

我当时想加入的是Waymo里面最核心的计算机视觉团队,也就是感知团队,英文叫Perception。Perception里面最主要的几位负责人,全都是清华师姐。有两位尤其是,都是比我大4届的清华师姐。

其中一位是我的直系师姐,也是电子系的;另一位后来成为我的直属领导,她是自动化系的。她们都是学霸,都是斯坦福博士。校友和校友之间,确实可能多了一层信任,也多了一层亲切感。

卫诗婕

所以您在Waymo待了多少年?

姚卯青

3年多。3年多的时间,也见证了Waymo从一个技术Demo进入真正商业化的关键阶段。

那时候Waymo刚独立出来没多久,后来实现了我们叫“rider-only”的阶段。什么意思呢?就是前排没有安全员了,车里只有乘客,商业化运营走完了这样一段旅程。

当时的rider-only还局限在亚利桑那州菲尼克斯下面一个叫钱德勒的区域,还不是菲尼克斯主城区。就像在上海,可能是在嘉定、青浦这样的郊区做了rider-only。后来它的运营边界和地域不断扩展,在湾区、旧金山,包括南湾都已经开始商业化运营了。

3. 从Waymo走向蔚来

卫诗婕

从Waymo离开,是因为李斌找了您吗?

姚卯青

其实有很多原因,有家庭原因,也有个人职业选择的原因。

那会儿是2021年底到2022年初这段时间决定回来。我和我爱人都是独生子女,也都是江浙沪一带的独生子女。恰好那个时间点,国内新能源产业如日中天,从资本、人才、技术到产品,都是信心爆棚的时代。

尤其是蔚来这样的龙头企业,在新能源里面调性最高、投入最大的企业之一,全面开发全栈自研。自动驾驶又是新能源车给自己贴的一个最重要的标签,要和燃油车、传统合资品牌做区分,智能化一定是里面最硬核的元素。

所以自动驾驶毫无疑问是要重点做、全栈自研的。那时候我也接触到了蔚来。蔚来不是最早接触的公司,但在接触过程中,最终最打动我。

因为做技术的人,更多还是希望真的把东西做成,让用户真正使用。想象一下,如果每天有100万用户在使用你的产品,而且体验非常好,这对做技术、做产品的人来说是非常欣慰的事情。

这也关联到我为什么要回国。因为当时我们在美国做的自动驾驶是L4,Level 4的Robotaxi商业化相对比较慢。它涉及整个运营和拓展,成本很重,要做高精地图、重资产车队运营,所以不是今天想拓展10个城市、20个城市,瞬间就能拓展的。

当时每一个红绿灯都要有精确信息标注。比如有几个灯泡,颜色是什么,横着还是竖着,每个灯泡是圆形、左转箭头、右转箭头还是掉头标志,甚至它在空间中的三维位置,都要标注得非常准确。

美国的基础设施变化可能没有那么频繁,但在中国,随时可能修路、换灯。那就得派人实时出去扫地图,这是一个很重运营的事情,也导致L4当年的拓展相对较慢。

L2显而易见,只要车卖出去了,就可以拓展客户。所以很多人认为,自动驾驶的L2、L3是更快能够进入商业化的一种产品形态。这也是我从纯L4 Robotaxi加入新能源乘用车L2、L3研发的原因。

卫诗婕

为什么最终选择蔚来?您说它打动了您。

姚卯青

最打动我的一点,是它的产品设计和定义规划非常体系化。

我记得很清楚,蔚来当时给我做了一个比喻:我们不会做五花八门的各种车型、各种平台,我们就有一个平台,叫NT 2.0平台,也就是第二代车的平台。现在市面上还在流通的ES6、ET5、EC6、ET5T等畅销车型,都是二代平台。

只会有一个平台,在这个平台上所有东西都是标配:激光雷达、4K摄像头,以及4颗Orin这样的顶配硬件。对做技术的人来讲,满配硬件当然是最吸引人的。

他们给我做了一个比喻:这就像买了一台iPhone。无论你买的是大屏还是小屏,里面的系统和App都不会因为型号不同而做各种适配和阉割。只要你买我的产品,这些东西都是标配。

这对我非常有吸引力。自动驾驶工程落地很复杂,如果适配的车型和平台太多,团队很难把每个平台都做到极致。这可能是很多自动驾驶解决方案供应商面临的挑战:客户很多,每个客户又有很多车型,要做适配和部署,就很难把所有精力集中起来,把一款产品打磨到极致。

卫诗婕

能简单描述一下您在蔚来做的工作吗?

姚卯青

在蔚来,延续了我在Waymo做的那一块,主要还是自动驾驶感知技术。

蔚来另外一个吸引我的点,是它成为全球第一个把激光雷达量产上车的公司。我在Waymo的时候,L4 Robotaxi的感知方案以激光雷达为主。因为L4对安全冗余要求非常高,纯视觉达不到那个水平,所以必须用多个激光雷达。

蔚来当时也非常有前瞻性,直接把激光雷达装上车。特斯拉一直比较坚持纯视觉能解决一切,虽然出了很多事故,也一直在坚持。但蔚来还是比较清醒的,把图达通的激光雷达装上车,包括车顶那个“额头”。

我当时非常欢迎这个设计。虽然早期很多人觉得它很丑,现在可能也有人觉得不美观,但早期大部分人觉得它非常非主流、很“杀马特”。可是当时我觉得很酷。

有一句话打动了我,应该是李斌亲自拍板、说服设计团队为这件事情做妥协。他说过类似这样的话:你们过去设计了那么多款车,真的有人记住过你们的设计吗?今天我们把它做成这样,也许流芳百世,也许遗臭万年,但肯定有人记住你了。

我觉得这很重要。一个企业能够在关键决策上由一把手果断拍板,而不是思前顾后。到今天果不其然,大家都把激光雷达装在车顶上了。

甚至有些公司的车分高中低配,低配不带激光雷达,很多人还去淘宝买假的激光雷达,粘在自己的车上。所以很多事情就是这样,你要做第一个人,去做引领者。

我在蔚来做的事情也跟这个相关。我做激光雷达感知、多模态融合已经很多年了,在蔚来继续把这块技术在量产车上落地。

包括最早的激光雷达感知系统,再到视觉和激光雷达融合,还有2021、2022年之后很流行的BEV算法。我们不再把视觉做成2D平面,而是把它像激光雷达一样投影到俯瞰图里,并和激光雷达有效融合。

另外还有很多基于激光雷达的安全功能。对L2自动驾驶或者辅助驾驶来说,帮你开车是一方面,帮你避险也是很重要的一方面。像AEB紧急制动、障碍物判断,都是我们当时较早做出来的。

其中有一个功能叫通用障碍物检测,英文是General Obstacle Detection。我们基于激光雷达以及Occupancy Network,也就是占据网络等技术,较早将它部署到车上。基于端到端神经网络的AEB,也是我们在2023年较早在全行业上车应用的功能。

上车以后,基于端到端神经网络和整套数据驱动链路,AEB的体验也提升了非常多。

卫诗婕

我知道您一直擅长多模态融合感知技术。多激光雷达上车之后,能够让车拥有更多通感能力。您加入以后,应该既要帮他们解决技术问题,也要完成量产。

姚卯青

是的。

卫诗婕

您加入的时机也很有趣,是2022年。那时候NT 2.0平台即将首发,蔚来已经度过最难熬的时间,也是最激进的一段时间。您在量产最激进的阶段获得了什么?

姚卯青

我看到了大规模乘用车、车规级智能化产品量产需要达到什么标准,也看到了需要怎样的组织和团队去支撑背后的量产体系。

过去做Robotaxi虽然也是车,但很多东西都不是车规级的。比如Velodyne的机械式旋转激光雷达,就不是车规级产品。Waymo车上的算力也不是车规级的,就是显卡、大算力。车规级产品要满足温度、震动、湿度等标准,包括安全等级,这些原来都没有。

真正做了乘用车车规级产品之后,我们才发现这些非常重要。你要搭建完整的评测和QA体系,还要利用乘用车大规模相对于Robotaxi大规模的特点,更有效地把数据飞轮转起来。

现在NT 2.0、NT 3.0平台的保有量基本超过了100万辆。它们每天获取的数据量、数据分布,以及遇到的各种corner case,是原来Robotaxi车队无法想象的。

Waymo已经是当时最大的车队,有几百辆车,每天在菲尼克斯、加州转来转去。但跟几百万辆车每天在全国各地、全球各种道路上运行相比,采集数据的效率完全不一样。

我们把这套数据闭环体系打造得非常高效。每辆车上都可以下发很多触发器。当研发需要获取某种数据时,我们可以给所有车主下发触发器。车辆遇到某些场景,就会自动将数据切片并回传到服务器。

这是做量产非常有意思的一点。

卫诗婕

所以关键词有几个:第一个是量产爆发;第二个是海量规模的数据飞轮;第三个是背后的组织。这些都和您今天做的事情非常相关,我们一会儿详细聊。

所谓量产爆发背后有哪些特性?

姚卯青

其中一个很重要的特性,必须是交付导向型。

过去Robotaxi公司多多少少还是研发导向型,通俗讲就是没有明确的deadline。如果某个时间点没有做出来,大家还可以继续延长研发周期。但量产不一样,必须有每一个版本明确的计划,到里程碑时必须完成相关动作。

一个版本要从需求收集,到需求评审和锁定,再到初步研发方案锁定,再到早期系统研发,然后进行一系列仿真、实际场地、公开道路,以及用户车辆影子模式下的测试。它有非常明确的节奏,而且必须跟上整车软件的发布节奏。

不会因为某一个产品,无论是座舱还是智驾,打乱整车软件的发布节奏。当然,过程中肯定会有一些事件,比如必须修复安全性很强的bug,整车可能会为你放宽1周,或者正式版本发布之后上线一个hotfix。但整体节奏是非常明确的。

这里面既需要从项目到研发,再到QA、评测体系的协同,也需要在多个版本并线研发的过程中,做到非常有力的版本管控。

软件代码有主线,也有分支。一个版本会拉出一个分支。比如机器人2.2.0拉了一个分支,过几天2.3.0又从主线拉出一个分支。在这个过程中,可能有一些共性的新功能,也可能发现一些bug。怎么样把它们重新合回主线,如何在多个分支之间同步,其实是一套非常复杂的量产体系。

这是量产最关键的地方。

在Google的时候就简单很多。全公司只有一个版本,十几万人只有一个版本、一个代码库,我们叫trunk模式。所有人开发完代码,直接往主干里合并。这是因为Google的基础设施做得非常好,所有人的代码都有一套完整的测试流程,保证合入的时候没有问题。

这么重的门禁系统,不一定能在所有敏捷开发的产品团队里实现。毕竟Google有几万人专门做基础设施。实际做智驾、落地节奏很快的团队,一定会面临多分支、多版本管理,所以这是一个很复杂的组织协同问题。

卫诗婕

未来,全产品管理周期会不会也是一种非常稀缺的能力?

姚卯青

还是蛮稀缺的,而且机器人的生命周期可能比车更长。

在车里面,大家开始出现了一个概念叫OTA,通俗讲就是通过网络把新的软件版本下发给用户,让用户不断体验最新功能。对机器人来说也很重要,它一定是越用越聪明的。

通过数据飞轮,以及机器人真实部署以后把数据获取回来,我们不断让它变得更聪明、更智能、更好用、更安全,然后不断给用户升级。

卫诗婕

在您的讲述中,我听到了非常复杂的管理。不管是技术团队,还是产品生命周期的管理,我理解这和我们一会儿要聊的蜜蜂也特别相关。

但在此之前,还是想接着聊聊智能驾驶的问题。在具身智能创业中,现在大致分成3大派,其中一派就是自动驾驶流入的一派,我觉得您可以归到这个派别里面。您怎么看具身智能中的自动驾驶派?

姚卯青

具身智能需要有这样经验的人进入这个行业,加速整个产业落地和应用。

我在之前的一些采访里也提到过,机器人也是一个硬件系统,和车很像。它可能不像3C电子这样的消费电子产品,而是更像车,是一个强电系统,涉及传感器、动力系统、电源和能源系统,再到智能化、控制等一系列领域,跟车基本一致。

抽象来看,底层的软硬件工程体系应该非常相通,整套供应链管理和生产制造体系也高度复用。这也是为什么今天看到的很多机器人零部件,都来自以前新能源车的供应链。

但是,如果没有做过智驾这一类事情,就不清楚怎么样管理供应链。DRE要做什么,SQE要做什么,质量管理怎么做,怎么样跟供应商签质量协议,要提哪些技术指标、质量指标,出现事故以后怎么处理、怎么制定罚则,这些都非常现实。

供应链管理不性感,但其实是最重要的事情。否则无法支撑供应链保质、保量,支撑产品动态且快速上量。

过去几个月最难的就是拉供应链,但现在看起来做得很好,因为量产出现了爆发。

卫诗婕

所以回到刚才那个问题,有智驾背景的人,对整套workflow怎么运转会有非常清晰的认知,而不是像我记得应该是Sunday那样,后来通过自己摸爬滚打,才体验到这件事情的重要性。

姚卯青

对。我们更多是day one就做好了打硬仗的准备。

我记得有些团队很有意思,最早认为做一台机器人,只要能在京东或者淘宝上买到摄像头、电线,就能组装机器人并量产。但后来发现不是这样,有一个概念叫采购,采购和在网上买东西完全不一样。

如果原来做过车,大家很清楚,采购定点是一个非常长的过程。首先要提SOR,提出指标;然后供应商要做审厂,判断其质量管理、生产体系和技术实力;再在多家供应商之间比价,进行多维度打分;最终确定A供、B供,有时候还要C供来保供。

不是今天去淘宝、亚马逊买几个电子件,大家攒一攒就能做出来。

美国媒体最近也经常说,美国第一批搞机器人的车库创业公司已经倒闭了,就是因为他们根本没有量产概念。

卫诗婕

这是自动驾驶派的优势。我之前也采访过一个投资人,他评价说自动驾驶派特别有见识。但会不会也有一些需要补的地方?

姚卯青

肯定有。

我先说一个比较非共识的观点。自动驾驶和车厂的人现在会说,车也是一种具身智能。我觉得这个有点牵强。

大家都认为车是最简单的机器人。虽然现在都是部署在硬件上的智能化系统,但它要实现的功能和背后的算法还是很不一样。

卫诗婕

车跟机器人真的是同一种生物吗?

姚卯青

其实不然。这没有谁对谁错的问题,因为它们面对的场景和要求截然不同。

车的要求里,安全永远是第一位的。不管你把故事讲得多么天花乱坠,它一定要安全,100%的安全。任何万分之一的闪失,都是无法挽回的生命之痛,这是它的底线。

这导致很多酷炫的技术、很多概念,都必须为安全妥协和让步。比如最近几年大家铺天盖地宣传的BEV、世界模型,以及各种自动驾驶大模型,它们一定不是自动驾驶真正运行在车上的全部。

大模型在端侧能够支撑的推理速度,以及大模型背后必然存在的所谓“幻觉”,都是问题。所谓幻觉是人为赋予的概念,但任何深度学习算法都是概率性的,总会失效、判断错误。

这对作为完整系统的智驾来说是不能接受的。所以智驾今天真正运行的底层系统,一定还是一套具备规则、小模型和高速实时系统的东西,而不是纯靠性感的VLA大模型或世界模型就能完美实现。

机器人不一样。机器人很重要的一点,是可以寻找一些对安全要求不像车那么高的应用场景。比如在工厂干活,失败可能造成经济损失,但不会造成生命损失。

卫诗婕

经济损失工厂也接受不了。

姚卯青

经济损失可以通过一些手段来挽回,可以做兜底。比如它做一个任务失败了,这时候人去接管一下,把任务完成,对工厂来说可能是无感的。

但车不一样。你不能说发生事故之后,让时光倒流,然后人在那个时候踩刹车,这不成立。

从这个角度讲,机器人的很多应用场景有更大的容错空间。

车还是一个超高速系统。你在高速上使用自动驾驶,车速可能是每小时100多公里。人的反应时间极限可能就在100到200毫秒,你要在这段时间里完成所有判断,再到肌肉反应、踩刹车、减速,这对今天的大模型来说非常困难。

机器人有很多场景是在低速环境下完成的,比如抓取、放置一个东西,慢慢做也没有问题。不会因为每小时100多公里时一眨眼出错,就万劫不复。

所以机器人有机会部署今天很多前沿大模型,VLA模型、世界模型、世界动作模型,都至少有机会。但车没有机会让它们作为整个系统。

卫诗婕

所以自动驾驶派来到具身创业团队之后,可能会过于简单地把车归为一种简单的机器人,把过去的经验沿用下来。但实际上两者有很多不同,机器人也有更多机会。可以这么理解吗?

姚卯青

对。

从算法层面来讲,机器人很重要的一点就是后训练。在今天这个阶段,我觉得后训练甚至更重要。

我也表达一个有点反共识的观点。今天很多具身公司会给自己打造一种理念:我是做基模的、基础模型的。

从大语言模型的发展来看,最终最有价值的公司确实是做基模的。在最困难的时候放弃做基模的公司,可能就没有熬到今年,掉队了。所以大家更认可“基模”这两个字的含金量。

卫诗婕

船票属于基模。

姚卯青

对,基模非常有含金量,投资人听到会非常兴奋。所以很多公司很聪明,就给自己打上“具身智能基模”的标签。

但这里面有时候会偷换概念:我的基模很好,所以今天我的Demo很好。这两件事没有关系。大部分Demo都是通过后训练做出来的。即使没有基模,从零开始,为了这个Demo采集数据、做后训练,也可以做得很好。

在蜜蜂发布会上我也说了,当我们的数据量级和真正的基模还差4到5个数量级时,讲基模其实是一个比较伪的概念。

卫诗婕

您指的是,今天具身智能的真机数据量级,还不如当年做基模时的四分之一?

姚卯青

不是四分之一,是差4到5个零,也就是1万分之一、10万分之一。你说基模这个东西,很难支撑。

好比2017年Transformer刚出来,2018年BERT刚刚做到参数过亿,你就讲基模概念,所有人都会觉得这是什么,根本不会理解。

真的要到万亿参数、训练语料达到百万亿规模时,讲这个概念我觉得才成立。因为基模一定伴随着涌现出现。

今天的具身智能还远未到涌现。现在做的都是从视觉到动作的肌肉映射,没有“智能”这两个字自己觉醒的感觉,还没有到那个阶段。

卫诗婕

所以您觉得,现在的具身领域像大模型在2017年、BERT刚出现的时候?

姚卯青

对。

卫诗婕

很多人希望从您这里得到一个说法:今天已经是2026年了,具身智能到底到GPT几了?投资人很关心,希望你们已经到GPT-2了,至少到2,最好到3。

我之所以问,是因为我觉得决定性时刻是GPT-3。

姚卯青

但其实现在GPT-1都没到。我认为GPT-1都没到,因为数据量的问题。

我不认为算法会成为绝对瓶颈或限制条件,但数据一定是最大问题。这个数据不单单是量的问题,其实大家还没有完全确定,一个成年人,甚至不说成年人,4岁小朋友在真实世界里能够达到的自主能力,需要哪些信息。

比如现在还有人在争论,视觉是不是就够了,视觉是不是包含世界上所有的信息。其实不是。即使一个人短暂失去听觉1天,我觉得很多事情都做不好,更不用说我们全身遍布的触觉,哪怕是对温度的感应、力觉的反馈,对我们成功完成很多事情都必不可少。

信息的维度、种类,再到数据的量、场景的种类,才是真正限制具身智能从今天的肌肉映射走到真正智能觉醒的核心燃料。

卫诗婕

我理解您从最早Waymo时期的研究开始,就一直在多模态融合感知领域。

我们上一期嘉宾是小米VLA负责人陈龙,那个访谈里有两个特别有意思的点。第一,小米这次发布了基座模型,把VLA换成了XLA。从V到X,正如您刚才说的,是加入各种模态的融合,这是不是一个趋势?

第二,他们试图打通车和机器人两个世界,让车教会机器人一些事情,比如高速判断、严格的安全决策,再反过来让机器人教会车一些事情。这好像也是业内的一种趋势,把两套融合在一起、打通一个架构。

您怎么看这两个趋势?

姚卯青

第一个趋势,多模态肯定是认同的。从第一性原理、从人反思自己做事的角度来讲,我们一定需要各种各样的外界输入。

至于第二个,我觉得没有那么深度的融合。就像刚才强调的,车的应用场景、功能和技术要求,跟机器人还是有比较大的差异。

当然,今天很多车上的成熟技术可以应用到机器人上。比如在特定环境下,机器人的运动、导航、定位,这些都可以直接复用自动驾驶里非常成熟的技术。

前几天北京马拉松,今年很大的一个进步是,很多参赛队伍不再遥控,而是自主运行。自主运行涉及定位、导航、PNC,这些完全可以从自动驾驶里拿过来用。

至于机器人和汽车之间的交互,我们之前确实没有想过。可能对车企来讲,他们有这样一些探索和诉求。

卫诗婕

自动驾驶和具身智能,在架构和系统上是不是真正相似?

姚卯青

从电子电气架构,到操作系统、中间件,再到运行数据链路的框架,应该是可以复用的。都是拿到传感器输入,最终输出对各种电机的控制,这个层面是一样的。

但再往上的具体算法,还是很不一样。机器人今天以端到端模型为主,很多VLA、世界模型,都是端到端模型。但自动驾驶一定不是以端到端模型为主。

很多已经上市、对外宣传端到端的自动驾驶系统,你仔细调查一下,会发现它虽然有端到端,也有非端到端的部分,很多东西协同在一起,才能保证安全性。

卫诗婕

所以车的经验不可以直接系统性迁移到机器人?

姚卯青

不可以。如果能够完全系统性迁移,今天也不需要这么多公司、这么多学术团队继续探索,怎么样把机器人真正做到有用,进入工厂、进入家庭。

卫诗婕

您有没有试图把车的经验应用到机器人身上,后来发现“不work”的时候?

姚卯青

我们没有完全照搬车的东西,算是去粗取精,把能用的东西都复用过来了。

卫诗婕

我们看到那么多自动驾驶的人跑过来做具身创业。车的经验真的会是机器人最好的经验吗?到底是降维打击,还是某种路径依赖?

姚卯青

可以换一个角度思考:如果一定要把这件事情做成功,没有人比做过自动驾驶的人更有机会。这是一个相对的概念。

要把这套东西做成功,首先必须有一套量产的硬件本体,以及一套非常稳定的底层软硬件系统作为支撑,先不说上层算法。你首先要达到一个非常扎实的底座,保证最基础的东西稳定。

比如相机是否稳定,能不能以30Hz甚至60Hz保持帧率不掉帧。全身十几路相机,在端侧有限算力的SoC上能不能稳定运行,在复杂电磁环境下能不能扛住。所有这些,包括ISP,都要跑得起来。

机器人同时要跑这么多软件:定位、导航、控制、数据收集、影子模式,还可能有好几个算法。有限的CPU怎么样分配资源?怎么样绑核,把CPU的核固定给特定功能,保证整体性能稳定?这些都是自动驾驶从业者的拿手好戏。

但纯粹从学校出来的人,可能一点概念都没有。所以我觉得这是最重要的地方。

前一阵子有一个很有名的播客,采访了OpenAI做基础设施的华人温家怡。我记得你们讲过一句话,我觉得这是原来可能不能说的秘密,但现在已经是一个大实话:培养一个工程师做学术比较容易,但培养一个纯做研究的人做工程师,他要经历的门槛和历练更多。

不是说不能,但要经历的惨痛教训更多。真正稀缺的人才,不管是大模型还是机器人领域,都不是发了多少顶会论文、刷了多少benchmark的人,而是把东西应用落地时,自己上手过、修过很多bug、跟团队吵过很多架的人。

即使在我们公司,那些刷榜、发论文的工程师,也都是摸爬滚打,自己撸起袖子跟硬件、跟软件干仗,跟其他团队一起把软件链路和各种bug修一遍的人,才真正能够落地。

在美国也一样。DeepMind、PI等团队早期可能会有一种假设:我是做算法的,我有最好的算法,给我一台完美的机器人,两个东西一接,我就有一个智能机器人出现了。

其实不存在。一定是像温家怡说的,做过最底层基础设施、修过最多bug的人,才最有机会把这件事情做成。这也是为什么我说自动驾驶派的机会最大。

卫诗婕

我刚才讲了3大派,除了自动驾驶派,还有工程派和学术派。学术派就是您刚才讲的高校背景创业者。

但我觉得这可能也是一种刻板印象,本质上3种能力最好都具备。

姚卯青

对,最好都有。这个行业的人才也在不停融合。

卫诗婕

如果客观评价另外两派,工程派能够修bug、摸爬滚打,具备工程能力;学院派、学术派有什么可取之处?

姚卯青

学术非常重要。机器人现在并不是已经把所有终局问题完全解决的状态,我们一定要有一批学术前沿的领军人物,在前面潜心思考那些跳出框架、最创新的idea。

前阵子我参加了一个学术论坛,跟一些老师交流。他们说了一句话,我很认同:学术界一定要做工业界还没有想到的事情。这是他们的使命,也是他们的机会。

如果已经有benchmark可以刷榜,学术界就没有太多参与的必要了,因为那已经是一个被明确定义的问题,有明确路径,大家用各种奇技淫巧去比拼最后的效率、毫厘之差,而不是从0到1的原创、降维打击或划时代的东西。

今天的算法和系统架构,真的已经能够支撑机器人像人一样吗?我觉得还没有。很多人会follow双系统、快慢系统等观点,但这些都不够。人仔细想,可能根本不止双系统,可能有4、5层。

机器人也是这样。以现在的电子电气架构来看,它有4、5层。最底层是面向电机、频率最高、达到1000Hz的通信控制;往上有VLA模型这样的10到20Hz系统,做路径规划、轨迹规划;再往上可能有1到2Hz的系统,做世界模型或视觉动作模型的阶段性目标规划。

我觉得更上层肯定还需要一个像“OpenClaw”一样的大脑,帮助你完成长程、动态环境中的推理和规划。

上次蜜蜂论坛时,智元研究院的姚国才老师做了一个比喻:人按完电梯之后,会下意识判断到底哪部电梯会先来接自己,这其实是一种复杂推理,可能需要像今天的Agent大脑才能实现。

不要认为进家庭、当机器人保姆是一件简单的事情。保姆每天动脑子可能比动手更费力,有很多事情要判断、思考、规避和合理规划。

卫诗婕

这是学院派、学术派。

姚卯青

对。我觉得学术派非常重要,一定要帮助我们想清楚终局架构是什么,需要什么传感器、什么模态,以及如何把这些东西有效融合起来。

卫诗婕

那工程派呢?

姚卯青

工程派就是要把刚才说的那些东西真正落地到机器人本体上,也可以借助云端算力,让整个系统稳定运行起来。

从各种性能指标、资源分配,到功能安全,都要把它做成一个产品级的东西,能够部署到现实,而不是发一篇论文、做几个Demo、挂到GitHub上就结束。

要真正每天使用起来,把很多鸡毛蒜皮、琐碎的痛点和bug都优化、修复掉。

卫诗婕

今年比去年的具身资本潮更热烈,甚至有些疯狂。我所知道的是,这个领域的人才竞争也非常激烈,头部公司挤满了来自各处、属于3大派的新兴人才。

当3大派真正融合在一起的时候,会不会打架?在管理上有什么挑战吗?

姚卯青

有些公司我们确实看到,大家在理念或者资源上存在冲突。

卫诗婕

那智元有面对这样的问题吗?

姚卯青

智元还好。因为从人才引进,到做事情的整体规划,前期大家还是能够先达成比较强的共识。

管理层有定期的战略研讨会,再到员工,我们都有OKR机制。我知道现在很多百亿俱乐部公司没有绩效、没有OKR,但我们还是很体系化地规划要做什么、怎么做成。

不会出现大家各自开干,干到一半才发现想法完全不一样,然后再付出很大代价去弥合中间的gap。这种情况比较少。

卫诗婕

所以你们抓开头。

姚卯青

对。磨刀不误砍柴工,先把前面想清楚。

4. 姚卯青选择智元

卫诗婕

我们来聊聊您怎么加入智元的。我研究您的履历,发现一个很有意思的点:不管是加入Waymo、蔚来还是智元,都是在当时资本市场非常火热的风口,而且那家公司在您加入时都处于非常激进的状态。智元也是如此,它被认为是整个具身智能行业最有野心的公司。这是巧合吗?

姚卯青

这就回到了我最初说的,我还是一个比较顺势而为的人。

我想参与这个时代最激动人心的事情。自动驾驶在2023年左右,已经能够满足今天我们所有NOP、NOA功能的体验。再往前做,即使有新的概念、VLA、世界模型,可能在体验和功能上也不是质变。

但机器人这个课题更重要,需要我们这样一批做过智驾、踩过坑的人投身进来,让这个行业更快向落地、工程化、产品化的方向发展。我觉得这就是我们这些人在行业间流动带来的最大价值。

卫诗婕

您的意思是,追风口、追热点,背后其实是在寻找挑战密度和浓度更高的地方。

姚卯青

对。

2023年我明显感觉到,智驾已经做得非常好了,各家的智驾都已经做得非常好了。但具身智能还处于非常早期的阶段,就像Transformer刚出来的时候,所以让我看到了很多兴奋的点。

卫诗婕

所以您是怎么加入智元的?

姚卯青

从智驾离开时,我其实有一段时间想继续做一些新的智驾技术。2023、2024年,端到端自动驾驶这个概念刚刚出来,很多朋友,尤其是投资圈的朋友,知道我当时也试图创业,做新的智驾技术。

当时确实得到了一些投资人的支持,包括我的老东家、红杉等,都支持过创业。但那个时间点比较尴尬。回头看来,我也非常感恩当时做了这样的决定。

智驾从商业模式到大技术,整体上已经处于相对成熟期。自动驾驶从最早2016年左右出来的一批创业公司,到那个时间点已经发展了7、8年。什么样的商业模式能跑通,什么样的技术能真正落地,投资人也看得七七八八了,也有很多惨痛教训。

所以大家对这件事没有那么FOMO和兴奋。

恰好那个时间点,是这一波具身智能最早一批公司、包括智元刚刚成立的时候。很多投资人都在劝我,要不要去看看具身智能。

也就是在这个时间点,我跟智元接触上了。后来有朋友告诉我,可能也是因为红杉当时在帮智元大量引进人才,所以直接联系到了我。

跟邓总和公司接触几次之后,我认为这很像当年我要做自动驾驶、加入Waymo和蔚来时的兴奋感。我认为这是一个好的平台,是真的想把事情做成的平台,有体系化的规划和构思,而不是先拿了钱,再想干什么,或者说一套做一套。

卫诗婕

什么细节支撑您有这样的判断?

姚卯青

很多东西很有意思。人与人之间所谓的化学反应,chemistry,你很难说清背后的严格逻辑,但第一次接触之后,大概就能判断出一个人的格局、理念,跟你是不是志同道合。

给我印象比较深的是,跟邓总接触几次之后,我认为他非常想清楚要all in做AI这件事情。他把智元定位成一家AI公司,而不是单纯的人形机器人公司。

人形机器人是为了实现把AI带进物理世界、带进日常生活,所必需的物理载体。我不可能没有这个载体,也不可能把这个载体寄托在其他公司身上,因为这是一个软硬件必须深度融合的事情。

但追根到底,我认为邓总那时候已经非常清晰地规划好了:智元要成为全球具身智能AI领域的龙头和领军者。

他也愿意以非常all in的姿态投入资源。那时候聊了没多久,邓总就初步给出了我加入之后启动所需要的资源,非常果断。

在2024年早期,这样的资源和预算,在具身智能行业里面已经是非常大的投入了。

卫诗婕

今天我们看到很多百亿估值的公司,新进俱乐部的成员每年研发投入相对还很克制。今年随着融资额增加,投入可能也会增加,但过去每年1亿甚至不到1亿都很常见。

姚卯青

但智元不是。智元认为,融到的资金作为龙头企业就要用在刀刃上,做那些如果我们不做,就没有人会做的事情。

卫诗婕

具体金额方便说吗?

姚卯青

不太方便。但绝对是在大家初次见面、交流不多的情况下,给到非常坚决的投入。

卫诗婕

邓总非常神秘,也是智元实际幕后的当家。他是一个什么样的人?

姚卯青

邓总是一位非常务实、低调的公司创始人。

今天做AI相关行业,大家还是很喜欢创始人站在台前,对媒体和投资人表达观点、传输理念,这很常见。但邓总比较低调,他更多时间和精力花在公司内部的规划和管理上。

大家可以看到,虽然具身智能现在一级市场融资很火热,很多公司估值达到100亿、200亿,但智元已经很长时间没有在资本市场公布又融了多少亿。

这是因为我们认为,融资不是创业的最终目的。融资只是为了达成目标、实现路径而必须经过的一些里程碑,或者说是一种工具。我们绝不是以融资、宣传融资或估值为创业目的。

在钱够用的情况下,邓总希望把公司的股权尽可能多地分享给团队和员工。这是一个非常好的理念。到现在,给到投资人的股权可能还不到一半,这其实是非常克制的融资节奏。

很多上市前的公司,最后可能只有20%多的股权留在管理团队和员工手里。

卫诗婕

这是华为的风格吗?

姚卯青

应该可能是。我觉得就是全员分享价值创造。

卫诗婕

今年具身智能的资本热潮比去年更甚。智元在其中是什么心情?

姚卯青

我们作为最早创业、跑得比较快的公司,反而遇到了一些挑战。

比如大家都融了很多钱,人才、供应链、产品定价、客户和市场的资源溢价一下子都上来了,短期内出现了大量玩家涌入。

刚才提到,我们有覆盖全员的股权激励,这保证了我们在如今这种局面下,还能比较好地抵御市场猛烈的攻势,留住员工。这和我们前期的布局有关。

更重要的是,很多同事在智元这几年看得非常清楚,知道什么是短期疯狂,什么是长期主义。如果真想在一家公司把技术和产品做成,需要什么样的平台、认可什么样的规划和价值观,他们会和智元长期绑定。

卫诗婕

既然大家都看到了非常火热的资本热潮,为什么智元不继续激进融资?

姚卯青

因为融资意味着股权稀释,不管怎么样都要稀释股权。我们要避免无谓地稀释股权,更多把股权留给团队成员。

卫诗婕

现在百亿俱乐部突然又多了好几家公司。智能驾驶最热的时候,似乎也没有出现过这样的情况,头部几家可能估值到100亿、200亿元人民币已经很少见了。现在动不动就是100亿,您怎么看?

姚卯青

可能是因为这一波估值涨得特别快。很多团队和产品还在快速构建过程中,并不是今天所有百亿公司都已经处于同一个水平线。

当然,我相信这些百亿公司都是非常优秀的团队,未来都可以在一些细分赛道长期发展。

卫诗婕

现阶段评估一家具身公司的含金量,您会拆分成哪几个维度?

姚卯青

首先,我会看这家公司在最硬核相关技术上的投入,包括团队、算力、算法和数据。这几个是绕不过的。你要支撑自己的故事和愿景,就必须坚决投入、all in去做。

如果一家公司不管估值多少、融了多少钱,却把钱躺在账上做理财,我觉得就差点意思。

其次,看这家公司的管理是否成熟。在组织架构设置上,能不能做好清晰规划:有研发、产品和交付,大家通过什么协同机制,从目标设立到绩效管理,再到绩效牵引,是否有成熟机制。

还要看它是否构建了完整的供应链、生产制造和质量体系。说到底,做具身智能、人形机器人,就是在做一个复杂、高价值的硬件产品。这个东西要提供给客户,必须足够安全、稳定,具备足够强的一致性。

如果没有完整的供应链、生产制造和质量体系,借鉴汽车行业的标准,其实是不可能的,只能做几台实验室样机。

过去我们也参与过很多数据采集场、训练场的建设。很多客户反馈,买了很多家的硬件,最终能用起来的只有我们一家。有些甚至从开机开始就没有调通。

没有好的硬件,也不足以支撑具身智能。具身智能首先得“具身”,没有具身,智能只能存在于论文里。

卫诗婕

您刚才提到,具身智能现在的估值状态跟当年自动驾驶时期完全不一样,甚至更加疯狂。这也是我想问的:自动驾驶后来走过了10年的路,具身智能会走同样的10年吗,还是会有不同?

姚卯青

如果是像我这样从自动驾驶过来的人,可能会少走一些弯路。

自动驾驶最终会发现,一些特殊细分领域能够率先商业化闭环,比如去年开始爆发的物流配送小车,再到L2、L3乘用车辅助驾驶。

具身智能一定要更快想清楚应用场景,而不是漫无目的地喊“我要进家庭”。这跟当年L4的故事一样:我要做全国都能跑的L4。这样的事情存在吗?不存在。

车路协同、全域L4都不存在,未来也一定只会在有限区域做L4,再结合运营手段实现。

机器人也一样,不能没有明确的ODD定义,就去喊一些长期很难实现的应用场景,还认为很快就能实现。这种事情支撑不了多久,很快就会被证伪。

这也是为什么我们先让机器人进工厂。你可以说工厂不是最难的场景,但至少先要让机器人动起来、能做事,先证明能做A,然后再循序渐进,从A点1、A点2、A点3,慢慢走到B。

过去很多行业的发展都遵循这样的过程。没有任何技术会突然从天外飞来,一夜之间产生一个发明创造,把你带到另一个外太空。Transformer诞生之前,相关领域的人也已经试错了很多方案,最后才慢慢收敛到这个东西。

卫诗婕

刚才我们聊到3大派,智元其实已经汇聚了3大派。你们几个主要业务牵头人,包括您、王闯和志辉,都是不同派别的代表。

志辉是学术出身的学术明星;王闯原来是大疆自动驾驶负责人,有工程和量产经验;您是自动驾驶领域非常重要的人物。像这样群英汇聚的状态下,大家是怎么合作的?

姚卯青

我们的合作和分工还是非常明确的。公司内部有业务部和产品线的划分。

我主要负责具身业务部,王闯负责通用业务部,志辉负责灵犀以及X Lab等创新组织。大家都有各自的产品和主攻技术方向。

卫诗婕

具身业务部和通用业务部在组织里承担的使命有什么不同?

姚卯青

首先主打产品不一样。

具身业务部主打轮式机器人,比如精灵G1、G2,以及今年即将发布的G2 Air轻量款和G2 Max重载款,更多面向“干活”这个核心场景。

通用业务部更多是全尺寸双足人形机器人,目标是做到全球领先。刚刚发布的A3,就是王闯带领的通用业务部推出的产品。

应用场景也有区分。通用业务部更多做“硅基明星”,承担讲解、接待、文娱表演、商业代言等台前工作。

卫诗婕

为什么需要台前的工作?

姚卯青

因为我们认为情绪价值也是一种生产力,这也是一个很大的市场。

卫诗婕

我知道志辉负责的灵犀系列融合了很多学术成果,做一些比较前沿的探索。

姚卯青

志辉另外负责的X Lab,会做很多新idea的探索和验证。它是一个创新组织。

但在我们公司,创新并不局限于某一个部门。每个业务部、产品线内部,也都有面向下一代技术的团队。

卫诗婕

大家各自带领不同业务和职责部门,平时会有很多交流吗?

姚卯青

有。战略要对齐,经营层面也要对齐,还有很多可以相互支持的地方,避免重复造轮子。公司内部能够复用的技术,一定会充分复用。

卫诗婕

在技术路线决策上,大家有过碰撞吗?

姚卯青

相对来讲比较统一。

卫诗婕

所以智元押注的技术路线是什么?

姚卯青

智元押注的是“3种智能”:交互智能、运动智能和作业智能。这3种智能分别独立向前发展,最终我们认为,要达到像人的智能程度,3者还会充分融合。

各位业务负责人对这3种智能都有覆盖,只是有所侧重。

我们主打轮式机器人,核心是干活,也就是作业智能,英文叫manipulation。情绪价值产品更注重交互体验,包括角色、音色、交互时延、内容准确度,以及自主讲解、导航等。

运动智能则面向文娱表演等场景,更多涉及locomotion control。

去年可以看到,志辉负责的X Lab和灵犀推出了X2产品,也发布了第一个韦伯斯特空翻,这一块就属于运动智能覆盖的范畴。

卫诗婕

你们3个人的关系怎么样?

姚卯青

关系非常好。我们基本上每周都会有很多一起开会的时间,相互之间也有很多需要对方支持的地方。

比如轮式机器人不只是干活,也有很多交互场景。在广州地铁,我们已经部署了一批机器人,做地铁安检引导员、场内巡逻和咨询工作。这些工作有很多人机交互部分,我们会委托或者直接使用其他部门的成熟技术和产品。

卫诗婕

外界对你们有很多揣测。像我讲的,智元群英汇聚,都是非常强的人。很多强的人在一家公司能不能合作好,也会引发很多猜想。

姚卯青

大家都喜欢八卦,也喜欢脑补各种精彩剧情,这可能是大家最乐见的。

作为亲历者,我的回应是:只要团队里有明确的分工和合作机制,每个人都有自己忙不过来的事情,其实不会有大家想象的、每天围绕工作目标和利益产生的冲突或纷争。

大家每天干好自己的活,精力都已经非常有限了。

卫诗婕

我还知道,邓总在公司内部推行“大家自力更生、自己造血”,给每一条业务都压了比较重的营收指标,让大家自己造血。这会不会倒逼每条业务生长出更完整、更闭环的能力?

姚卯青

确实是这样。我们内部推行BU制,每个BU都有自己的目标,既有产品和技术目标,也有商业化目标。

根据目标的规模和挑战性分配预算,也不是纯粹看收入,因为那太单一了。我们会从技术、产品和商业化多个维度设定整体目标,再根据目标体量和挑战性分配预算。

比如轮式机器人要干活、进入最难的工业场景,这需要投入相应的研发和测试资源,产品规格标准也非常高。所以在这些场景下取得的商业化成果,会有加权系数。我们以类似方式制定每年投入的预算。

这就是前面提到的,判断一家公司是否靠谱,关键看经营管理规划是否体系化。

很多公司前面可能粗放式增长,顺风时什么都能做。顺风过去、开始过苦日子之后,才意识到要做精细化管理,可能就会比较被动。

有人讲过,这些事情应该在最顺利的时候做,因为那时候做的成本和代价反而最低。

卫诗婕

市场上出现了很多智元系公司,从智元独立出来,或者由智元孵化后独立融资。大家对此有很多揣测,比如智元内部不和,或者强人才之间互相冲突、得不到资源。

姚卯青

不至于。

首先,智元的资源绝对不会成为瓶颈。只要目标足够清晰,做的事情有意义、有价值,一定可以获取相应资源。

智元本身有足够的资金储备。即使需要更多资金,邓总也说过,随时要融都能融,不会在资源上做限制。

卫诗婕

他去年在合作生态伙伴大会上说的这句话很引起轰动,口气很大:我们想要钱随时都可以融,但没必要。

姚卯青

这不仅是邓总的想法,也是我最近一段时间的感受。很多时候,我们甚至会比较委婉地回避投资人的投资需求。

融资节奏要跟公司整体发展匹配。不能因为某一轮大家都想投,就照单全收、开放很多额度。公司没有必要在不必要的阶段稀释过多股份。

我们孵化子公司,确实也是希望这些子公司在各自领域能够更好地服务全行业,其次才是让它们成为单一领域内的龙头企业。

卫诗婕

为什么独立出来会比留在智元体系内更好?

姚卯青

独立出来之后,首先不用只服务智元。

比如我们现在做蜜蜂,蜜蜂就是打开门做生意、服务全行业的定位。智元现在所有的数据需求,也会向蜜蜂正常采购。智元是蜜蜂的客户之一。

如果别人比智元更早提出需求,而在产能和资源需要排队时,就要按先来后到的市场化方式运作。

后面的灵巧手、其他零部件等,也都会按照市场化方式运作。

卫诗婕

但面向全行业提供服务当然很有吸引力。现实中,跟您有竞争关系的公司,大概率不会使用您作为供应商。

姚卯青

其实不一定。尤其是数据,我们发现很多具身公司还是非常认可我们的数据。

我们举办的很多比赛,他们也积极参加;我们发布的数据,他们也大量使用。这次开始做数据服务之后,他们也积极联系我们。

一方面,无论公私,大家都是朋友圈,关系还可以。另一方面,数据这件事如果每家公司都重复投入,做重资产运营,对很多公司来讲太吃力,也不符合价值和利益最大化。

在这个行业远未到零和博弈、抢占市场的状态下,竞合关系是普遍存在的。

即使是蜜蜂,我认为将来也只会占据整个数据市场的一部分,不可能做完所有数据。未来大家一定会越来越发现,数据是供不应求的。

我觉得很快,1、2年或者2、3年后,头部有实力的团队,无论是大模型公司还是具身公司,都会需要上千万、上亿小时的数据。那时候不会再想竞合关系,谁能提供高质量、稳定的供应,我肯定照单全收。

卫诗婕

所以你们现在要写下的是一个合作叙事。

姚卯青

是的,这也是一个非常大的转向。

我们一直以来有一个贯穿智元发展的理念:现在具身智能很热,但它一定还处于整个曲线的第一波。怎么样让短期的行业热度持续下去,让它变得越来越好,是每一个身处这个行业的创业公司都要居安思危的事情。

不是现在很热,大家就拿一堆钱相互竞争,把市场搞得一塌糊涂,等潮水退去之后一地鸡毛。这肯定不是大家愿意看到的。

应该趁着现在政策、产业各方面对我们的支持和关注,把真正要干成的事情抓紧干成。

而在这个过程中,一定不是一家企业能够完成的。无论是上游供应链,还是下游应用,都需要很多企业、很多公司一起做。

这是智元一直秉持的理念。所以今年我们还宣布了“原生计划”,以及产业生态基金,投入几个亿去发展生态,包括高校伙伴、应用开发和交付伙伴。

我们现在服务的一些数据需求厂商,也有很强的算法和应用开发能力。我们想得很清楚,这些人将来一定是迫切需要的合作伙伴。

智元不可能靠一个团队开发出各行各业的应用场景,并把它们部署、服务好。一定需要这些伙伴帮助我们拓展商业版图。

卫诗婕

我在做资料时还发现一个有趣的变化。您去年曾经公开说,智元要走闭源路线,像苹果一样软硬件一体。后来你们又开源了数据集,也像您说的,把很多场景开发留给企业和开发者,大家一起共建市场。这明显也是一种开源生态。为什么会出现这样的转变?

姚卯青

因为归根到底,行业发展得还不够快。资本很快,但技术和产品还不够快,远没有达到大家画出的那些饼。

一定要快速让更多聪明人、聪明的脑袋加入这个行业,让他们有好用的本体、好用的数据、好用的benchmark,快速把想法变成现实、变成落地。这是当务之急。

不用担心技术竞争。如果一家公司害怕技术竞争,那就先投降算了,我觉得不可能最终成为赢家。

一定要足够自信,相信在每一个技术关键转折点、关键变革点出现时,你都是核心参与者。

卫诗婕

我做一个不负责任的猜测。不知道这是不是转变的因素之一:如果往去年以前看,整个具身赛道头部融资特别巨额的公司还很有限,智元是其中的翘楚,你们手上有比别人多很多的钱,所以走闭源也是可行的。

但现在百亿俱乐部多了很多新成员,大家手上都有不少钱,游戏规则改变了。这是一个因素吗?

姚卯青

不是。我们从来不觉得融资跟企业真正成功之间有必然关系。

一定会出现很多融了很多钱,但技术和产品迭代不匹配的事情。我们更多关注的是,产业整体一定要加速。

这次我们办比赛,昨天刚刚结束提交服务器,也给大家提供了baseline模型成绩、比赛平台和数据。我们很欣喜地看到,最后超过baseline模型的人很多,而且有不少比我们好非常多。

这些人是我们非常关注、以后也希望交朋友的人。

卫诗婕

这还是服务于你们一个巨大的故事和野心:共建生态。我们一会儿来聊生态。

把时间回到2023、2024年,您当时对这个行业的判断是什么?今天的判断改变了吗?

姚卯青

改变了。

当时觉得具身智能可能要像新能源汽车和自动驾驶一样,经历至少5、6年,长则8、9年的发展周期。现在来看,好像不是这样。2、3年走完了自动驾驶和新能源经历的那么长周期。

一个原因是技术变革在加速。大模型出现之后,新技术日新月异,几天不上网就感觉跟不上时代了,底层是技术发展太快。

另一个原因是过去各个产业发展的经历和踩过的坑。像我们这样从其他行业过来的人,确实可以少走很多弯路。

再加上机器人本身是一个更大的产业、更大的空间,以及国家战略坚定布局和支持,让资本市场、人才市场迅速涌入,加速了过去2、3年的迅猛发展。

卫诗婕

您觉得自己能够为这个行业带来什么?

姚卯青

首先,智元一定能够为行业走通很多路径。包括怎么样造出量产、可靠的机器人,怎么样在这么多潜在场景里找到几个现在可以落地的场景,真正按照工业级标准部署起来。

不是大家做个Demo、拍个片就结束,而是真正能够7×24小时在工厂里干活,打平客户ROI,保证工业产线需要的稳定性和质量。

这些最难的问题、一些坑和一些路,我们先趟出来。我觉得这是智元为大家做的事情。

我在其中核心承载的,是从想法到落地的过程。这也呼应前面说的,我过去在智驾领域,无论是技术、算法、体系搭建,还是商业化构思,经历过正面和负面的教训,可以带到机器人这个新产业里。

避免机器人重复走当年走过的很多路,发散地发展、不聚焦地发展,最后想法很多但很难落地。这是我能够为行业带来的一些贡献。

卫诗婕

具身智能现在发散吗?

姚卯青

很发散。比如还在讲进入家庭的故事。家庭意味着无数个场景,因为每个家庭都不一样,每个家庭主人对机器人管家的预期和标准也不一样,需要它做的事情也不一样。

这可能是终极形态,但今天你就说已经在做AGI,还是太远了。饭要一口一口吃。

卫诗婕

您觉得在GPT-1还没有出现的时候去讲AGI,实在太远了。

回到您加入智元之初,有没有什么印象最深的事情?

姚卯青

有。加入之后基本上马上就是“微波炉模式”,马上开始“红温”、加入战斗。

当时是在智元2024年的发布会上,展示了一些VLA模型的现场Demo能力。现在大家对VLA已经很熟悉了,但在2024年上半年,能够真正把VLA模型部署到一台机器人上,并且给投资人真实看的,其实非常少。

那时候我们做到了,只用了大概1、2个月的时间。然后马上又去做了一款精灵产品,这件事让我印象很深。

从萌生想法,到做出产品,再到最终量产,时间非常短,大概只有2个月。现在回想起来,我们也发现里面有很多运气。

从8月底有这个想法,9月开始做各种方案设计,包括供应链定点、代工定点,再到产线搭建、试制和批量生产,真的只有2个多月。

卫诗婕

为什么?行业正常做这样一款机器人需要多久?

姚卯青

正常至少需要9个月。

卫诗婕

那怎么能在2个月内完成?

姚卯青

包括我们做精灵T2,其实大概经历了快9个月。第一代产品能够这么快,很多决策比较敏捷。

比如制造这件事,我们决定寻找有成熟制造经验的供应链帮助代工。基于两个判断。

第一,当时出货量还没有到手机、汽车那种规模,不可能完全做自有化生产。未来我认为智元肯定会在内部布局,包括很多新能源车企也是从代工开始,最终自己拿牌照,这是正常过程。

但当时机器人的出货量非常少,不可能保证稳定生产节奏,把人效拉满。一旦有闲时,员工还是要固定发工资。所以要找成熟供应链,他们因为有各行各业的产品出货量,可以动态调配人员。

第二,他们过去在一些标准严苛的产业里,比如3C,已经具备成熟体系。无论质量标准、工艺标准、员工治理、效率、信息安全等,都可以快速借用。

我们就寻访、评估了一批这样的伙伴,最终选择其中一家。当时可能只有20、30个人,软件、硬件、系统等团队一起驻扎在工厂。

现在大家喜欢说“创始人模式”,founder mode,同吃同住,睡在工厂里,把第一批机器人下线。

当然,第一代机器人相比精灵T2,在设计上更精简。到了精灵T2,我们对产品做了重大升级,无论复杂度,还是各种工业级规格,都要拿很多认证。

比如力控、更加广泛的传感器布局、多线激光雷达、交互体验等,把整个系统复杂度提升了很多。这才让我们经历了第二代产品从定义到生产爬坡的漫长过程。

卫诗婕

所以把9个月压缩到2个月,关键在于选择了对的供应商?

姚卯青

供应商很重要。第二,团队小的时候,很多事情的效率不可避免会更高。大家面对面、所有人都在一起,很多问题能快速闭环和沟通。

当然,这只能适用于特定阶段。0到1阶段可以这样做。真正到了1万台规模,还是必须有完整的项目管理和质量体系,才能有条不紊地管理。

卫诗婕

成熟的供应商在行业里好找吗?我们经常看到,早期行业的头部供应商,往往是竞争对手自己培养起来的供应商。

姚卯青

当时不好找。人形机器人在2024年还是非常新的概念。你可以把故事讲得很大,投资人可以相信,因为投资人在某种程度上赌的是长期。

但供应商不一样。供应商要解决的是你能给他多少订单,商业模式能不能让他吃饭。你不可能给他画个大饼,说将来年产10万台,今年你先辛苦一点跟我干,不是这样的。

很多供应商没有看到量,不会轻易下场。2024年这个问题很严重。我们接触了很多供应商,更多还是被动的。

无论是执行器、电机、减速器,还是电子件、相机、雷达、电池,大家都认为机器人比车小得多,很难为了你下场。产品定制还伴随着生产工艺和整条产线的投入,工业最终还是要看ROI,不相信故事。

到了2025年下半年和今年,情况已经完全不一样了。汽车和新能源供应链都主动联系我们。

卫诗婕

当时是怎么找到优质供应商的?

姚卯青

我们的代工厂找的是苏州灵猴机器人。今年他们发展得也很快,最近听说已经有50亿元估值。

我们评估之后主要看几个点。第一是供应商自身的能力体系;第二是它是否真的相信你能变得更好,愿意给你强有力的配合和协作。

这点是灵猴当时非常打动我们的地方。他们在2024年已经非常看好智元,认为智元未来能够和他们一起成长,带来可观的商业模式,所以在很多早期配合上提供了非常多支持。

他们过去在3C领域做得很好,有充分的track record,服务过头部客户,经历过严苛的质量、安全、信息等方面要求,也一直按时、按量交付,能够动态响应。

制造业里很常见峰谷效应,不是工厂每年都以均匀节奏生产。短期可能接到很大的脉冲式需求,需要调动产能和人员。这些能力,他们过去已经充分验证过。

后来也印证了,机器人业务的峰谷更加明显。我们经常在某些时刻把他们拉爆。过去像十一、五一,他们为了应对突发的大批订单,会加班加点、加人、加产线。

卫诗婕

为什么会有突发的大批订单爆发?

姚卯青

因为这个产业还不是一个成熟、大规模、稳定的客户群体。不像乘用车,C端用户每年在中国就有2000多万辆车会卖,每个月基本平均,产品推出之后需求比较可预测。

机器人现在还是以To B为主。你可能找对了一个场景、一个客户,需求就来了,它有这样的效应。

卫诗婕

所以对供应链弹性的要求很大。

姚卯青

非常大。

卫诗婕

现在行业里会有供给过剩的问题吗?

姚卯青

供应链还没有供给过剩。这两个月还是受到比较大的供应链限制,没有达到安全库存,简单说就是供不应求。

理想状态是有一定安全库存。比如一个月卖1万台,至少留2000到3000台库存,常年放在仓库里,这样动态需求来了还能调拨。

但我们现在基本是工厂生产完直接拉走,没有任何安全库存。上游很多零部件的供给远远没有达到需求。供应商也被我们拉得很痛苦,从质量管理、培训、赋能到产能,都很痛。

甚至有供应商跟我们干着干着,实在太累,干不动了,就放弃了,这种情况是有的。

卫诗婕

我来之前跟行业投资人打听过,他们对精灵系列评价非常高,说这款机器人在行业里很火。您觉得它火在哪里?

姚卯青

我觉得它是行业里第一个工业级具身智能标杆作业平台,真正做到了工业级成熟度。

从传感器、执行器到算力配置,各方面都是顶级的。但这也带来了烦恼:确实有一些友商在向我们的产品致敬,做了很多雷同、类似的产品。

卫诗婕

做一款好的创新产品,在资本超级密集的时代,能有多久的先发护城河?优势能维持多久?

姚卯青

1年左右。

我们现在全职员工加共创员工——共创员工类似外包——接近2000人。我们做一款产品,完整走完IPD流程,尚且需要9个月。

其他规模相对小的团队,除非没有这么严格的标准,直接把我们认为还处于早期阶段的样机推向市场。否则如果像我们一样严格走完整个IPD流程再推向市场,没有1年也做不到。

卫诗婕

你们出货速度非常快。到去年年底,你们已经成为人形机器人出货量最高的企业,量产速度也非常快。

姚卯青

我们确实解决了很多客户的用工痛点。中国现在招工没有那么容易,不是大家想象中的制造业大国、人口红利,还有用不完的产业工人。

人口红利在消退,而且工业是相对辛苦的岗位。像我们这一辈人,尤其比较年轻的一代,手机是离不开的日常伴侣,但进工厂第一件事就是交出手机,很多人受不了。

年轻人不愿意进工厂,或者进去了也待不了多久。通过调研、走访很多工业应用场景,我们发现,很多场景里人就是被当机器人在用:严格的节拍、明确的任务,所有人统一节奏工作、统一节奏休息,再统一回来,像机器人一样精密运作。

原来我们不理解,为什么一些代工厂经常发生各种事件。后来发现,那个环境确实很压抑。再加上中国人口结构、年龄结构发生变化,往后用工会是越来越大的挑战。

卫诗婕

精灵现在是现金奶牛系列吗?

姚卯青

是的。

卫诗婕

听说它是智元最快实现ROI的产品。

姚卯青

可以这么说。

卫诗婕

这不就非常符合邓总当初要求各业务自己造血的标准吗?

姚卯青

这可能跟产品定位有关。

首先,这款产品目前在市场上仍然具备较高竞争力,还没有完全进入价格战阶段,不是大家产品差不多之后,直接把价格卷到几万元。

其次,它面向的不是纯C端客户,而是偏B端,比如进入工厂。这有一个比较明确的定价逻辑,只要达到B端客户的ROI测算逻辑,就可以按这个价格销售。

进工厂无非是和等效人员的薪资成本做比较。在机器人的全生命周期内,如果能覆盖掉这部分成本,售价就可以达到相应水平。

卫诗婕

现在机器人行业价格战很严重,你们参与吗?

姚卯青

精灵基本没有参与,但其他细分赛道也会局部受到影响。完全不参与也不行。

卫诗婕

过去新能源行业也一样。最终能全身而退,还是要回到价格。那你们在价格上做了什么努力?

姚卯青

我们有规范的价格体系,有终端客户目录价,也有MSRP市场指导价,同时还有分级渠道价格,包括精英渠道和VIP渠道。

如果没有价格体系,整个市场肯定会乱。

卫诗婕

过去1年,我觉得智元完成了身份蜕变:从一个行业头部、估值明星企业,转型为真正验证了自己地位、做出很多举措、公布很多战略的关键企业。

要理解您在这里做的事情,得先理解智元。我想问,您觉得智元是具身领域最激进的公司吗?

姚卯青

不能用“激进”完全概括。激进有时候也可能是不好的地方,激进错了,跑得越快,错得越远。

我觉得智元是相对把“以终为始”想得比较明白,并且朝既定目标一步一步践行的公司。

这家公司的既定目标,是做具身领域最头部的AI公司。我们有愿景,也有使命,叫“以智能机器创造无限生产力”。

以生产力这个终极目标,提升整个社会价值创造的速度。使命就是希望给这个世界带来什么。

从愿景来讲,我们希望成为智能机器人领域的全球领军企业。这也是实现使命必然要做到的战略定位。

过去2年,我们一直围绕这个目标向前,没有受到市场起伏太多干扰。我们不会盲目融资,当然钱不够时肯定要融。但资金有一定保障时,盲目融资带来的可能只有市场宣传和无谓的股权稀释,并不能让该做的事情走得更快。

过去2年,我们更多精力都在做产品、迭代技术,严格按照量产标准和IPD流程,把产品推向市场和用户。

技术上,我们也想清楚了行业最缺的是数据。在模型上,我们全面布局预训练和后训练,在VLA、世界模型、强化学习等关键技术上,都处于较为领先的位置。

卫诗婕

我之所以用“激进”这个词,是因为你们很多打法确实符合这个风格。

比如邓总曾经公布过“三五八战略”:成立3年、5年、8年,分别对应不同量级营收,从10亿到100亿再到1000亿营收。

全球人形机器人公司里,几乎没有人在初创阶段就提出3年达到10亿营收、10万台出货目标,但智元喊出来了。这难道不激进吗?

姚卯青

这个目标确实敢想。敢想来自过去对自己的复盘,所以才敢制定这样的战略目标。

从2023年到2024、2025年,我们产品出货和营收规模确实每年都有2个数量级提升。

2023年我们只卖了1台样机,可能卖了30万元;2024年有6000万元营收;到去年已经超过10亿元。

1个是几十万,1个是千万,1个是10亿,每次都是增加2个零,也就是2个数量级增长。所以我们还是基于比较客观的预测制定目标。

卫诗婕

智元是2023年才成立的。2023年几十万元营收、卖出1台,第二年要翻2个零到千万,这件事怎么推测?从千万再到10亿级别,又怎么推测?您说复盘过去,但好像也没有太多过去可以复盘。

姚卯青

我们是这样定义的:2024年叫“量产元年”。

为什么能有几千万元营收?因为量产了几百台。卖出几百台机器人,就有几千万元收入,一台机器人可能几十万元。

2024年是量产元年,2025年是商用元年,2026年是部署元年。每个阶段对应不同的潜在市场规模。

核心是打开机器人真正的应用市场,进入真实场景部署,为客户产生闭环价值。只要这一步走通,机器人的商业化前景非常广阔。

卫诗婕

打开场景靠的是聚焦吗?

姚卯青

一定要聚焦,逐个突破。

毕竟还是一个成立3年的初创公司,不可能365行每一行都饱和投入。一定是在有限资源下,把资源ROI做到极致:瞄准和当前技术匹配的场景,瞄准最愿意与你共创的客户,以及最有规模化部署和复制潜力的场景,把它打穿、打通。

卫诗婕

智元是这个行业最有野心的公司吗?

姚卯青

最有野心,我觉得可以称得上。

从愿景来讲,我们要做就做最好,要做开拓者,而不是跟随者。

大家知道,机器人是继手机、汽车之后,全球第三大海量工业终端。如果用机器人铺开各种场景,其实就是拿到了物理AI的终端入口,也是生产力入口,这是一个非常海量的市场。

我比较同意马斯克说的,未来日常生活中,一个人可能需要几台机器人。你去职场,可能需要一台辅助机器人;你去外面消费,可能有服务你的机器人;回到家,可能有陪伴和服务你的机器人。

卫诗婕

在一家很有野心、风格和打法都比较激进的公司做管理者,是什么体验?

姚卯青

既有压力,又很兴奋。

倒不是说老板定了指标,你不知道最终用什么方式、什么节奏做成,而是技术和商业模式上每天都在未知中前行、每天创新。

兴奋的地方在于,第一,这是自己没干过的事情;第二,可能是我们自己发明、创新出来的东西,别人也很难复刻。这种感觉很不一样。

卫诗婕

如果失败了怎么办?智元有这样的规定吗?

姚卯青

在智元,失败不可怕。创新过程中肯定会失败,划时代突破的背后一定有很多先烈。

公司允许大家多路径探索,只要做的事情足够有意义,目标清晰,和整体战略相符,我觉得没有问题。

但在价值观牵引上,我们也会明确一些不能接受的事情。面对一个机会,如果收益和路径都相对明确,却没有主动拥抱,而是作为观察者、旁观者,我认为这是不应该的。

卫诗婕

如果发生了会怎么样?

姚卯青

肯定会有相应的管理动作。

卫诗婕

所以不允许这样的人存在?

姚卯青

更多还是价值观问题。大家一定要积极地去做引领者。

卫诗婕

这是您刚才开头讲的狼性的一面吗?

姚卯青

可以算是。

卫诗婕

这也是您的舒适区吗?

姚卯青

我现在更多是经营管理者,非常认同这一点。我希望团队有这样的血性和亮剑精神。

卫诗婕

您过往职业生涯中有这样狼性的一面吗?

姚卯青

过去没有特别被开发出来。过往确实没有达到现在这么激烈的状态。

卫诗婕

因为行业潜力太大?

姚卯青

一个是钱太多,二是聪明人都在这个行业里。大家每天都在快速推动这件事情向前发展。

过去像Google、Waymo,虽然也是传统意义上的大厂,但不会在单点事情上如此激进,更多会稳扎稳打,慢慢把事情做好。

卫诗婕

聪明人扎堆,您在Google和Waymo都经历过,但很少有聪明人扎堆,同时大家又非常急迫地面向同一个目标。

姚卯青

对,也带来高饱和竞争。

卫诗婕

这个过程中您怎么调试自己的心态?

姚卯青

保持心情很重要,不要被很多噪声打乱节奏、扰乱心智。

竞争激烈对机器人行业有一个重要影响:机器人是硬件,可以做Demo,所以大家每天都想办法做各种Demo。

但作为行业从业者,一定要看清楚Demo到底意味着什么,背后的技术是什么,是否解决了本质技术难点,还是只是为了Demo临时做出一些效果。

卫诗婕

您的意思是,当对手拿出一个可能不够solid的Demo时,不要因为Demo漂亮就打乱自己的节奏。

姚卯青

对。我们不能像投资人一样相信那么多故事。

无论美国还是中国,很多人容易被叙事带入。讲故事的人告诉你的,往往是他想让你听见的事情。比如他觉得自己发现了scaling law,觉得已经出现了涌现,再配合Demo,造成一种似是而非的印象。

但真正做底层技术和产品研发的人,要理性判断他说的是否成立。

卫诗婕

当我们看到行业里到处都是Demo,有些非常炫酷,到底怎么判断Demo的真实性和可靠性?

姚卯青

从我们的角度,会以终为始看这个事情。

如果技术和产品真的好到不行,效果真的非常好,一定有人愿意使用,甚至愿意买单。我们可以看它到底有没有在某些场景里应用起来。

如果没有,不管是还没有达到用户标准,还是营造出来的,归根结底都还没法走入市场。

卫诗婕

靠行业调研吗?打听一圈,看这个Demo到底有没有客户下单?

姚卯青

对,这个可以调研出来。

但从Demo到量产,至少有9到12个月周期,可能要等1年之后,才能发现它到底有没有量产。不过基本可以打听到效果距离实用有多远。

卫诗婕

如果看过去1年整个行业的发展和智元自己的发展,这条双线进程是什么样的?

姚卯青

一方面,智元肯定受益于行业整体关注和发展。资本、人才大量涌入,很多优秀人才认可智元品牌。真正想把事情做成的人,从其他行业转身进入具身智能时,智元确实是他们的第一选择。

另一方面,我们也会受到行业过度火热的挑战。比如市场定价、供应链产能分配,人才竞争都很激烈。

即使选择智元,人才也能在市场上拿到非常丰厚的其他公司offer,我们必须做出对应动作。整个行业很多方面的成本,都会随着融资总体规模上涨而上涨,本质上就是通货膨胀。

为什么这些年硅谷房价、物价通胀这么严重?因为美国股市的泡沫都在硅谷。美国比中国更两头不平衡,整个股市市值集中在几家公司手里,而这些公司又都在硅谷。动不动就是年薪百万、千万美元的人在那里生活,物价不可能不贵。

同样,现在行业这么火,人才和物料竞争都会变得更加激烈。

卫诗婕

过去1年,您对行业的认知有什么改变?

姚卯青

机器人要竞争场景,不是嘴上说说,而是要沉下心、撸起袖子,甚至“跪得下来”,才能进入真实场景。

工业不相信故事,也不相信眼泪,相信的就是ROI和效益这些简单事实。

卫诗婕

什么叫“跪得下来”?

姚卯青

这是一个通俗比喻。过去做汽车行业的人都有深刻体会。

虽然我过去在主机厂,是甲方,但面对大量供应商时,供应商都非常灵活。你给他们提技术、产品、节奏等各种需求,他们都要高效动态响应,包括成本压得很厉害,付款条件也比较严苛。

现在我们既是主机厂、也是人机实验的甲方,同时又面向下一个客户做乙方,也要有这种精神,以客户为中心。

我觉得公司发展、转型最难的阶段,就是从以产品为中心转换到以客户为中心。

以产品为中心,是大部分创业公司的阶段:我拿很多钱,不管东西将来能不能用,先发Demo,再去融资。

但真正走到商业成功、商业闭环,必须以客户为中心,解决客户需求、为客户提供价值,才有生存空间。

至于你是人形机器人、猴型机器人还是狗型机器人,客户其实没有那么关心。你解决他的问题,提供足够稳定、经济、可靠、快速、优质的服务响应,才能真正部署。

我开玩笑说,过去1、2年大家都在说机器人走进工厂。确实,很多机器人走进去,拍了个片又走出来,就叫走进工厂。

但我们要解决的是,待在工厂里别出来。出来就被客户退货了,你得给我待在里面。

卫诗婕

这个月我看到你们又进工厂了。

姚卯青

上周二,我们在江西南昌龙旗工厂,联合新华社举行了全球、可以说是人类历史上第一次机器人在主产线全天直播生产。

这里有几个关键词。第一个是“主产线”,不是画一片实验区,也不是在自己公司的实验室。主产线意味着有上下游,不能成为卡点,不能停,这是最严格的标准。而且我们进入的是3C主产线,3C是节拍最高的场景,手机每年生产量非常大。

第二个关键词是“全天”,不是直播5分钟、拍个Demo就结束,然后撤走,而是全天运行。它的背后是我们已经稳定运行了1个月,才敢做全天直播。

第三个是“全球直播”,敢拉着新华社、董扬梅为全球现场直播,也说明稳定性各方面达到了较高水平。

全天直播中,我们完成了2300多次任务,做到100%成功、0失误。

卫诗婕

这个我熟。去年我也陪伴你们的远征机器人进过工厂,当时是8小时直播,现在升级到24小时了。

姚卯青

当时还是一个相对可解耦的单一场景,搬料箱、上下料。现在这次不一样,进入的是最高节拍的主产线,上下游要和工人协同,而且是精密操作,这是一个很大的突破。

我觉得我们敢自信地说这是全球首个。无论特斯拉还是Figure这样的美国头部企业,我不确定他们能不能做到,但他们还没有做过类似活动。

卫诗婕

上个月我主持了一场具身智能圆桌,汇聚了很多头部企业,还把他们拉进小黑屋录了一期播客。

有一个很有意思的话题:市场上还有很多待被发掘和攻克的场景,各种细分场景。但共识是,好做的场景大家扎堆做,竞争激烈;难做的场景可能受限于技术,或者需要较长时间突破。

怎么选择场景?会不会遇到同一个场景有很多竞争者?你们的解法是把竞争者全部PK掉、做到最好,还是有一套找场景的方法论?

姚卯青

其实都有。

我们也遇到过大家都看中的场景。

卫诗婕

大家都看中的场景是什么?

姚卯青

搬箱子。它比较广谱,只要是泛工业,大家相对都能做。不管哪个行业的工厂,总要运东西、搬东西,总要有料箱。搬料箱是一个前景非常广阔的市场。

在这种场景里,大家只能正面竞争:谁能做到又好又便宜、服务又好,谁就胜出。

我们确实经历过,在个别客户现场,我们是唯一一个达到所有技术要求、完成整套动作节拍周期,并达到成功率要求的团队。

客户还有柔性适配需求,比如料箱换了,能不能2小时内适配好、重新上线,同样100%成功、按照节拍工作。我们是当时唯一通过盖章验收的。

我们也会广泛寻找伙伴共建场景。像龙旗以及其他场景,我们发现机器人进入真实产线、真实环境,绝对不是我们自己拍脑袋就能进去的。

现场要充分待几天,观察他们每天到底在做什么,痛点在哪里。从用工方角度,痛点到底是什么。进入他们的体系之后,技术上要做很多集成工作。

工厂有自己的MES系统,怎么样把机器人像自动化设备一样集成进去,跟他们通信配合?其他应用场景也有自己的数字化系统,怎么打通?

这需要双方深度配合、协调、集成和联调验证。无论是场景需求,还是整体系统集成的know-how,都必须找到愿意跟你共创的人。

传统思维是:我要进工厂,我是设备供应商,你只要达到100%成功,插上电就开始用。但现在人形机器人还没有这种通用性,基本不用想。

一定要找到愿意双向奔赴、互相往前迈的共创伙伴。

卫诗婕

这种优质共创伙伴,为什么愿意在这么早期跟你们贴身合作?

姚卯青

这些企业往往过去发展得非常好,能够在每次产业变革初期,清晰看到未来价值。

比如他们能看到用工挑战未来会越来越严重,所以提前引入技术、先行先试。这不是普遍现象,但在先进的头部公司身上确实能发现这样的诉求。

包括海外科技巨头,也非常积极地想把人形机器人、具身智能引入供应链和生产制造体系。

所以我觉得伟大的公司肯定是有一定道理的。

卫诗婕

我觉得洗牌会很复杂。可能一家拿到客户大单,一下子实现大成;但在无声的角落里,另一家凭借很好的技术和产品拿到另一个大单,也成为强有力的竞争者。

姚卯青

这一定会发生。

从悲观角度,我们也想得很清楚,不可能智元一家独大,把所有细分赛道和市场全部覆盖、通吃,这绝对不可能。

卫诗婕

所以不是做行业的通吃王者,而是开始建生态。

姚卯青

对。

卫诗婕

我主持圆桌时听到一句话:大家看到很多玩家觉得“这个事情我也能做”,所以就来做。但这个行业不缺“你能做、我也能做”的人,缺的是找到自己独特性的玩家。

现在找到独特性的玩家很少,您认同吗?

姚卯青

认同。现在很多叙事都有些雷同。

卫诗婕

那智元的独特性是什么?

姚卯青

这个事情我和智元想得都比较清楚,可能也跟我的产业经历稍微丰富一点有关。

现在不缺聪明人,聪明人很多。大家可以去做聪明人,我们来做好老实人。

最终把事情落地,还是要老老实实去干。

智元的独特性在于,当别人宣称自己是聪明人的时候,我们已经先想清楚:除了聪明之外,聪明可能只占10%,剩下90%是完整体系的能力。

我们要先把这90%构建好,等真正进入技术打通、场景渗透的阶段时,能够be ready,这非常重要。

我很认同地平线创始人余凯博士说过的话:真正的护城河绝不是什么人无我有、绝顶聪明的算法,而是每天解决鸡毛蒜皮的工程问题,在体系里一点点积累能力。

不是一大块一大块解决,而是一点点、日积月累,把方方面面做好,才能构成完整的城墙。每一个方面都是其中的一块砖。

卫诗婕

所以智元的独特性是体系完整。

姚卯青

对。体系完整包括公司架构治理、量产体系、人才梯队和技术布局。我觉得智元想得非常清楚。

卫诗婕

我的理解是,在智元宏大又激进的战略下面,您负责的是整条最激进技术路线的落地,包括全栈自研、基模、真机数据飞轮构建。

现在这3个方向都有对应产品,而且都是您在管理吗?

姚卯青

对。这些都是我从2024年加入以后从零开始构建的。

从那时开始,我们组建自己的AI研发体系,布局模仿学习、VLA预训练、世界模型——既作为动作策略模型,也作为数字仿真器——再到强化学习相关的后训练技术,以适应真正的落地部署。

这些技术,我们在2024年就开始完整布局了。

卫诗婕

现在VLA和世界模型概念很火,业界前沿玩家其实两年前就开始关注。我想听听您的意见:VLA和世界模型是两种方式、两种范式,还是同一种范式下的不同应用?

姚卯青

VLA和世界模型在具身智能之前就已经出现了。

尤其是世界模型,多年前就提出过,只是在具身智能领域再次复活。业内有个很有意思的说法:世界模型就像大姨妈,隔一段时间就会来。自动驾驶火了会来,游戏火了会来,具身智能火了也会来。

它更多是一种通用框架,是对世界物理规律、状态转移规律进行数字化、神经网络化的描述。

VLA更多是从语言模型、多模态语言模型向具身领域的延伸。

VLA典型工作进入大家视野,应该是在2023年上半年。ChatGPT作为语言模型横空出世、产品化之后,大概半年以内,很多大厂就开始想办法把大模型的涌现能力迁移到物理世界。

Google肯定是最早做这件事的,因为它本来就有机器人团队,大模型又全球领先。2023年上半年,他们推出了PaLM-E。PaLM是当时Google内部的大语言模型,E就是Embodiment。他们用PaLM做机器人的动作控制后训练,让它产生动作。

所以从根源上讲,VLA和世界模型还是很不一样的。

世界模型最近一次受到关注,可能更多来自自动驾驶。大约在2023年前后,Wayve、特斯拉等公司提出了World Model理念。

那时候视频生成技术逐渐成熟,Google的Imagen、OpenAI的视频生成技术都进入大家视野。Wayve提出第一代GAIA,也就是GAIA-1,可以在一个起始图片状态下,生成汽车前进过程中将会看到的视角和环境变化。

特斯拉也做了类似工作,在同年的CVPR以及其他学术会议上报告、讨论。

但世界模型和VLA到底谁更好,一直是争论较大的问题。

我个人认为,从最终终局看,可能都不是最终形态。一个是从语言模型发展而来,更多围绕语言;一个是从视频发展而来,更多在2D视频象限里发展。

最终机器人处在三维物理世界里,要像人一样接收外界各种信息。它的视角跟很多世界模型也不一样,是第一人称。

很多世界模型,比如Sora,更多以第三人称镜头渲染世界画面,其实不一样。所以如果一定要讲终局,我认为它们都不会是最终形态,还会经历更多架构升级和融合。

现阶段世界模型确实提供了更大的想象空间。因为VLA过去已经暴露出一些局限,语言和动作之间存在较大表征空间鸿沟。

语言是高度抽象、信息密度很高的逻辑思维体系。人有语言,其他生物没有语言。人可以用非常精简的语言描述一个场景或一件事情。

一本小说可能只有几KB,但拍成电影,几十GB都不一定装得下。这说明语言是一种高度压缩、但确实有损的表达。

世界模型从视频生成发展出来,天然更完整地捕捉了时间和空间连续环境下的变化,包括液体会流动、玻璃会碎、软的东西会形变等物理细节。

这些正是机器人在操作过程中需要学习和掌握的规律。所以从这个角度讲,世界模型是更讲得通的模式,能够帮助机器人学习物理世界状态、物理规律和动力学规律。

卫诗婕

那VLA对于机器人来说是必须的吗?

姚卯青

也是必须的。

一个完整的、能够达到人类智商和自主能力的机器人,不能只是四肢健全、能做精细动作。那样它可能还是一个非常专用的东西。

它一定要像人一样能思考,在面对模糊、开放的指令和开放环境时,能够理解指令、映射成规划,再把规划映射成环境中的移动、操作和交互行为。

这种层层分解的过程,需要在类似语言体系的逻辑思维空间里完成推理。所以我们认为,它们未来会成为上下游分层的架构配合关系。

卫诗婕

现在很多人在做VLA和世界模型,市场上有各种选择。智元当然有实力自己做,但首先要做到全行业最好。如果不是全行业最好,所谓完整体系的价值体现在哪里?

姚卯青

首先要做,就要做到最好。这是智元人非常重要的价值观,叫追求卓越。做技术也好,做其他方向也好,都要做到行业领先。

我们在世界模型上确实已经做到较好水平。最近更新发布的GO-2模型,通过引入动作思维链、异步执行等机制,在一些主流榜单上取得了不错成绩。

在LIBERO-Plus、Genie Sim 3.0等广泛使用、认可的榜单上,目前我们都做到了第一名水平。

卫诗婕

您怎么样带领团队做到这些?

姚卯青

给他们足够清晰的目标,提供对应资源,吸引优秀团队成员。剩下的,就让他们充分发挥。

5. 模型与本体数据形成闭环

卫诗婕

我理解,你们也试图打造一个非常强的支撑大脑,指挥机器人进入真实世界。机器人本体采集的数据,也就是本体数据,是构建智能很重要的一环。

您觉得未来智能涌现,有多大贡献会来自机器人本体采集的数据?

姚卯青

它也会有阶段和过程。

现在属于起步、启动阶段,需要各种各样的数据,不挑类型,能获得的数据尽量吸收。不管是仿真、真机,还是人类穿戴式采集、人类中心数据,都要充分吸收。

但进入机器人真正部署的增量阶段后,越来越多机器在现实世界里部署、作业、交互并得到反馈。那个时候,机器人回流的数据会成为主要增量来源。

卫诗婕

您判断会在几年之后?

姚卯青

我认为可能2、3年之后,机器人真实场景的回流数据会成为主流。

卫诗婕

也就是机器人真正出现在生活里,产生一次爆发。

姚卯青

对。

卫诗婕

这个时间线跟王兴兴一致,他也觉得2、3年内机器人会实现爆发。您是怎么推算出2、3年的?

姚卯青

这里面有很多感觉。

第一是技术,包括算法和硬件。

算法上,如果现在类比Transformer、BERT的洪荒时代,那么发展到GPT-3,回头看也就是3年左右的时间。以AI历史为镜像,如果一定要刻舟求剑的话,可能就是这个时间。

卫诗婕

但可怕的是,据我所知,AI领域是在GPT-3时才看到大语言模型方向成立,而今天在具身智能的GPT-1时代,大家似乎已经看到了方向并且扎堆进来。

姚卯青

因为至少现在我们都认为,scaling law在其他AI范式下也应该适用。Scaling law这些规律具有普适性。

卫诗婕

您的团队全权负责打通整个链条,从感知融合、世界模型、真机强化学习,再到数据闭环。大概有多大的团队支持这条完整链路?

姚卯青

整个具身业务部,成员接近500人。

里面有不同分工:硬件本体、质量测试、软件、系统、算法、数据等。软件还包括端上软件和云平台软件。

但所有人都是为了同一件事情,或多或少都在参与和贡献。

卫诗婕

刚才讲的完整链路,怎么保证环环相扣?

姚卯青

很重要的一点是,任何研发迭代最好都有一个清晰抓手。

这个抓手不是虚的词,而是找到几个场景,围绕场景验证、打磨和迭代整套系统,而不是以刷榜或Demo为目的。

只要在个别方面投入足够多,确实也能做出Demo。但真正要把机器人在某些客户场景里用起来,好用、稳定,并且不断进化,就需要飞轮体系中的每一环都参与进来。

卫诗婕

你们训练世界模型和机器人大脑,再把它用到本体上,把本体送到客户那里产生数据,数据再回流模型。整个闭环需要多长周期?需要多少人服务?

姚卯青

现阶段这条链路基本已经自动化。

比如龙旗南昌工厂部署的机器人,并不是第一天就能达到现在直播时100%成功。前期会有很多需要优化的地方,有系统稳定性问题,也有算法需要进一步训练的问题。

现在机器人身体里已经布设了类似自动驾驶影子模式中的数据回流触发器。在失效或出现异常时,它会自动把数据回流给我们。

这套流程现在是自动的,不需要很多人肉参与整个闭环。

卫诗婕

所以您刚才讲的自动驾驶触发器,现在已经部署到机器人身上了。

姚卯青

对。我想要什么样的数据,可以给它发出指令;它出现什么异常,数据也会自动回流。

比如平板测试上下料时,有一个环节是精密操作。早期算法还不成熟时,它会反复尝试,直到成功为止,可能卡在那里一会儿,放不进去。

这种数据我们会设置触发器。规则和监控模型会发现,如果长时间没有成功放置,一定是出了问题,就把数据录回来。

然后分析到底是系统软硬件故障,还是算法鲁棒性、泛化性不够。

如果是产线设备或机器人相对位置,与训练时差异较大,或者现场光线、分布存在差异,我们就把对应数据补充进去,让模型重新学习,掌握原来不会的情况,再以新的软件版本下发给现场机器人。

卫诗婕

行业里经常讲,具身智能早期进展缓慢是因为缺数据。您刚才讲的整套自动化链路,意味着数据补齐会加速。

姚卯青

是的。

卫诗婕

您现在身兼智元合伙人、具身业务部总裁,又多了一个身份:蜜蜂董事长兼CEO。怎么兼顾这些角色?

姚卯青

这几个角色不是割裂的,不是我要分散精力去分别管理。它们本身是有机一体的一个大板块。

数据原来在智元内部,主要服务自己的团队。现在把它孵化出来,是希望服务全行业,也通过服务全行业,加速数据资产构建、数据采集算法和技术方案的精进。

核心是围绕最终要干好的一件事,给大家设定好季度目标。

每个板块都有技术和管理经验丰富、成熟的管理层,他们会承接、拆解我制定的各板块目标。大家定期对齐、复盘,以这样的形式协同。

卫诗婕

市场非常关心一个问题。蜜蜂已经是独立创业公司,您也兼任董事长。姚卯青会出来独立创业,彻底剥离智元吗?

很多跟您关系比较近的朋友,甚至候选人在招聘过程中都会问:您是不是准备独立创业?

姚卯青

这种说法确实很多。市场上大家喜欢真真假假地传播信息,有些是为了放烟雾弹、扰乱市场。

但这件事肯定不会发生。

卫诗婕

总结一下,智元过去3年走的路,是从产品到量产、到商用、再到建生态。今天如果从0到1建立一家公司,就必须把这些路走一遍。

姚卯青

必须走一遍。

我相信去年、今年出来创业的很多优秀团队,背景都非常好,前几轮融资也没有问题。但一旦到了几十亿、100亿规模,他们也会面临一样的挑战和压力。

技术上是否有真正绝对领先的东西?商业化是否已经有清晰思路,是否有初步应用场景开始落地?这些问题都绕不开。

哪怕今天强如OpenAI、Anthropic,也必须靠代码模型、靠token盈利,才能支撑持续向前。

不可能说我做大语言模型、我是基模,只靠这两个字就无限融资、长盛不衰。每个行业真正能够持续壮大、不断发展、吸引人才和资本的头部企业,一定是在每个阶段找到最适合自己的应用场景。

卫诗婕

您觉得智元现在已经转起飞轮效应了吗?

姚卯青

我觉得已经开始转起来了。

卫诗婕

是什么样的飞轮效应?

姚卯青

最重要的是部署打通之后的数据飞轮。

不是在实验室自己做样机,而是真正把机器部署到客户现场,在部署过程中收集更高价值的数据,收集那些超出机器人当前能力边界的数据,再拿回来拓展能力边界。

6. 蜜蜂开启物理AI服务

卫诗婕

说到数据,就要讲到蜜蜂,也要聊聊您的新身份——蜜蜂董事长兼CEO。

我理解,蜜蜂是服务未来整个具身产业的数据平台。这个平台上可以有被交易的数据,也可以有被分享的数据。

这些数据包括真机部署到客户现场产生的数据,也包括人类穿戴式采集的数据,还包括仿真数据吗?

姚卯青

包括。所有数据都在这个平台上。

卫诗婕

蜜蜂这家公司是怎么横空出现的?

姚卯青

简单说,既简单也有意思。

我们和投资人一起吃饭时,是投资人先萌生了这个想法。当时他们看到上一轮AI时代有一家大家都听说过的公司,叫Scale AI。Scale AI发展很好,最后一次融资可能已经达到200多亿美元估值,后来被Meta变相收编,Alex Wang也加入了Meta。

我们发现,具身智能所需数据的规模,以及全链路生产、后处理和交易的门槛、复杂度都更高,所以应该催生出一家比Scale AI更有价值的公司。

为什么这么说?Scale AI做的还是上一代数字世界AI模型的数据标注,包括计算机视觉里的检测框、分割mask,以及语言模型的文本标注。

这些数据源本身很多,互联网视频、图片,自动驾驶采集的视频都可以直接获取。标注门槛也没有那么高,标注员只要有一台电脑,经过1天培训,有鼠标键盘就可以开工。

最终拼的还是人力运营。Scale AI包装得很高大上,但背后也是人力运营,只是某些环节自动标注做得不错。

美国是一个相对没有那么卷的市场,很多时候各行各业通常只有老大、老二,老三可能不存在或活不下去。不像中国,一个产业火了就来100多家。

Scale AI没有那么多挑战者。中国数据标注业务量其实更大,但没有跑出Scale AI这样的头部企业,大家都很分散。

为什么?因为中国卷,最后卷价格。你在上海做,我去西部做;你找成年人,我找在校生、中专生,大家压成本。

并没有一家真正通知——应该说统筹——来做这个事情。中国人太聪明了,不会有一件事情在技术门槛不高的情况下让一家独占。你能干,我为什么不能干,大家都有这种不服的心态。

但具身智能不一样,难度比Scale AI大很多。

首先,数据采集需要物理世界的场景,不是互联网发下来的。超市能不能让你进去采数据,酒店、工厂能不能让你进去,这首先就是一道门槛。

其次,需要人去采数据。你要雇人、管人,这些人要管理好,可能就像美团、滴滴一样,未来会有一堆采集员。

还有设备。不管是真机采集还是无本体采集,都需要设备:机器人、摄像头、夹爪、穿戴式设备,都需要固定资产投入。

再到数据本身,视频存储量很大,处理的算力要求很高,需要全链条的资源非常多,不是一家企业招几个人、配几台电脑就能干的。

投资人红杉当时就觉得,智元是不是可以考虑单独孵化一个业务。

因为我们那时已经做了1年数据,AgiBot World在整个行业的影响力和号召力也很大,催生了很多高质量工作。海内外一些重要模型都使用了AgiBot World数据集训练和评测。

在技术和运营能力上,我们已经有一定积累,于是萌生了这个想法。

卫诗婕

我追问一个细节。AgiBot World是你们开源的数据集,发布会上您也讲了,很多优秀团队训练模型都用到了你们的真机数据集。

但开源出去之后,对方用不用,您怎么知道?除非对方告诉您。

姚卯青

他们会在论文里通过图表展示使用了什么数据、占比多少,通常会有详尽列表,所以我们可以看到。

比如英伟达的GR00T团队发表的第一代基座模型GR00T N1,Tech Report里就能看到,它使用的真机数据中,80%是AgiBot World。

当时AgiBot World刚发布,他们还没来得及下载全部数据。在GTC发布时,只使用了部分AgiBot World数据,就已经占到他们数据使用量的80%。

卫诗婕

这比开源模型好。模型开源给别人,别人不一定会告诉你,但使用数据集时,发表论文可能必须写上。

姚卯青

对。

卫诗婕

红杉提出这个想法后,你们迅速响应了吗?

姚卯青

也没有。大概是2025年下半年有这个想法,真正决定做是在2026年1月。

卫诗婕

这么快,3个月?

姚卯青

差不多2、3个月。

这也跟市场节奏有关。我们看到2025年底,很多海外团队宣布在数据上快速、激进的布局。

比如Generalist在去年下半年说他们有20万小时数据,后来我们看应该是无本体数据。还有Sunday也说会把核心竞争力放在数据上。

从这个角度,我们已经预判到今年会进入数据军备竞赛年。

我们很早就做这个行业,知道模型其实没什么好拼的。在这个阶段你没有数据,讲自己做基模、预训练、后训练,都没有太多可说的。

资本市场是另一个事情,但对真正的行业从业者来说,数据问题都没解决,讲这些就是空中楼阁。一定会进入军备竞赛。

这个速度比我们想象的还快。年初我们发布AgiBot World时,百万条数据、3000多小时已经是最大规模数据集。到年底,美国用无本体方式做到20万小时。

我们相信今年大家会直接朝百万、几百万、上千万规模开卷。

卫诗婕

所以不如亲自下场,不跟上就可能落后。

姚卯青

对。智元做事情一是很狼性,二是要做就做最好,不会允许有优势的事情最后变得不相干。

卫诗婕

你们在做数据这件事上有什么优势?

姚卯青

两方面。

一方面,智元自己有算法,各种类型都有布局,所以很清楚算法需要什么样的数据,什么是好数据。

其次,我们非常清楚数据运营体系和管理。这不是简单的人员管理、纪律管理和流程管理,而是数据运营、数据服务团队怎么样与研发、算法团队动态对齐需求,定制方案、验证数据有效性。

这非常重要。

卫诗婕

这也是我们刚才聊您职业生涯时埋下的线:您有规模化管理经验。

姚卯青

当然,原来的规模可能只有几十个人,但来到智元之后,随着团队一起成长,自己也成长得很快。

7. 高质量数据决定模型上限

卫诗婕

您说清楚算法需要什么样的数据,那算法需要的数据是什么样的?

姚卯青

有很多维度的质量要求。

第一,整个数据链路的稳定性要求很高。基础要求包括时间同步、标定,从传感器到执行器的标定,都要达到很高标准。

其次是数据分布要多样化。从任务维度、场景维度,再到细节,都要有变化。

比如同样是抓放某个东西,不能反复采集完全重复的片段,至少要在位置、光照、背景等方面做出调整。

另外,在数据不同阶段、模型研发不同阶段,还要响应动态调整。

最早做预训练时,自己采集就可以;但模型达到一定能力后,一定会定向要求采集某些当前仍然失败的setup下的数据,需要动态调整。

卫诗婕

这是不是千寻创始人高阳说的:具身行业现在不需要那么多所谓专家做出来的优质数据,而需要更多脏数据?

我理解脏数据就是各种场景下随意的、出现错误或失败的数据。

姚卯青

其实你刚才讲的多样化,就是脏数据。失败之后重新规划并成功,这种数据非常重要。

通俗讲,一个人也一样。如果只见过成功案例,其实很危险,会有幸存者偏差。

经常读鸡汤会发现,好像只要这样做就能成功。但很多时候那只是幸存者,你照着这个方向做,可能99%的概率会失败。

机器人也一样。如果只看过成功示范,它不知道失败会怎么样,失败之后应该怎么办。

这在模仿学习里有理论基础。如果只有成功经验,整个执行过程中失败概率会和执行时间成平方关系。越到后面,越容易失败。

一开始动作或环境可能偏离一点点,偏离训练数据之后,它已经不知道怎么做,只能随机产生决策,让自己偏得更远,越偏越远,最后完全失控。

这就是模仿学习的特点:只会做见过的事情,没见过的事情就会产生意想不到的行为。

所以要采集失败数据,这样它真正失败时,还知道怎么回来。

强化学习就像小孩学走路。我不能只看大人怎么走,更多要靠自己摸爬滚打、摔出来,知道什么稳定、什么不稳定。通过好与坏共同探索,才能完整知道最优路径。

卫诗婕

所以为什么叫“蜜蜂”?

姚卯青

这个名字很有意思。

首先,它符合品牌命名理念:朗朗上口,大家可以用一种有亲和力的方式记住。

比如打车平台叫滴滴,很形象;团购平台叫美团,也很直观。

蜜蜂是采蜜、采数据。小蜜蜂首先很可爱、很萌,有亲和力。

其次跟我们做的事情相关:采集数据。采数据有两个方面,一是采集,蜜蜂就是做采集;二是寻找、探索。

未来数据获取一定是分布式、集群式的。无数机器人分布在社会各个角落,每天给我们回流数据。这就是蜜蜂社会化、协同化的象征。

只有这样,我们认为才能实现蜜蜂的使命:让全世界的数据为AI所用。

卫诗婕

必须让蜜蜂像蜜蜂一样,有蜂群,分散开。

姚卯青

对。

卫诗婕

所以机器人会像毛细血管一样,渗透到社会每个角落、每个工作场景。

姚卯青

对,这就是生产力入口。

卫诗婕

我理解,这个“寻觅”是寻找好的场景和高质量数据。

姚卯青

对。

卫诗婕

您怎么定义高质量数据?

姚卯青

高质量数据首先要真实,分布足够丰富。

我们希望它能够覆盖独特、新鲜的场景,把每天真实发生的事情都让机器人学习到,这是高质量的第一面。

第二,采集过程要有充分规范。设备之间的软件、硬件,以及刚才说的基础参数,比如相机曝光、画质、设备同步、轨迹重建精度,都要保证。

每一个数据采集员,无论是众包人员还是经过培训的专业人员,都要遵守操作规范,让机器人不要学偏,不要学到人类不应该让它学到的奇怪行为。

卫诗婕

为什么一定要统一高标准,让人类采集数据?

姚卯青

因为跟现在AI的学习范式有关。AI还是基于数据驱动,在大样本中基于统计形成一种模仿式学习。

在这种设定下,数据质量完全决定模型质量。一旦是质量很差的数据,学出来的模型就会直接学废。

卫诗婕

但刚才不是也说需要脏数据吗?

姚卯青

需要,但“脏”的概念不是质量脏,而是多样化。

它可以是失败,失败以后再学习怎么成功,而不是摄像头突然黑屏、轨迹差几厘米这种质量很差的数据。

所谓garbage in, garbage out。

卫诗婕

您对高质量数据的第一个定义是要真实,也就是来自真实场景。这听起来仿佛否定了仿真数据的含金量。

姚卯青

不一定。

我们说真实,是指它见到的环境和任务种类足够多,是真实生活中会接触到的,而不是偏离实际的东西。

从这个角度看,真实环境和仿真环境都可以营造这样的环境。现在的仿真技术,比如Genie Sim,可以支持高保真重建环境。

在数字孪生重建出来的世界里也可以采集数据。仿真还有很多便捷性,可以快速改变重建世界中的元素,做泛化和变化,让机器人看到多元化数据。

卫诗婕

只要仿真出的物理特性足够逼真、高保真,它其实也是真实数据。

姚卯青

从第一性原理讲,人所有知识也不是真的只从现实社会中学来。人有课堂、有书本,也会看录像、看电影。纪实文学也是现实世界的折射,也可以是一种学习方式。

卫诗婕

行业里比较熟悉的仿真派,是银河通用创始人王贺。他认为大量仿真数据可以带来很多智能可能性,在真机数据昂贵的情况下,超高比例仿真也能训练出很好效果。

您怎么看?

姚卯青

都要放到特定语境里看。

首先看你要做什么任务,环境是什么,作业对象是什么。

有些任务和操作对象,仿真确实可以完成很多前期开发和验证。但也有一些环境、任务和物体,物理交互规律非常精细,可能只有真实接触和交互才能获得最贴合实际的数据分布,这就必须通过真实世界获取。

另外,真正的应用过程中,很多场景对成功率要求非常高。仿真甚至真机可能做到80%、90%成功率,从学术角度已经不错,但工厂完全无法接受,至少要求4个9。

这个时候只能想尽一切办法达到标准,而不是执着于自己属于什么技术流派。

卫诗婕

在蜜蜂平台上,是不是应用尽用,只要能用的数据都会收录?

姚卯青

对。而且希望通过蜜蜂与数据用户、市场充分接触,更及时、更一线地洞察模型和数据需求的发展趋势与特征。

卫诗婕

做久了之后,就会知道哪类数据更被需要、含金量更高。

姚卯青

对,也能看到大家如何使用这些数据,把它转换成模型能力。

卫诗婕

行业里有一种看法:智元出来做数据平台,开放能力和数据集,看起来是反哺行业、贡献行业,但也可能是“明修栈道,暗度陈仓”,你们在更宏观、更底层的视角观察行业,也会给自己带来竞争优势。

首先,您认同这是一个客观事实吗?

姚卯青

我认为是。

技术本来就没有太多秘密。今天不管是语言模型、具身智能还是自动驾驶,想靠保密掌握独门绝技,基本不存在。

即使几家大厂做闭源模型,大家也基本能猜出它们怎么做。未来比拼的不是谁技术保密性好,而是全栈体系能力建设。

像大模型,数据管线、数据配比、数据质量决定了模型上限。现在很多团队和资源,都在数据获取和治理上投入很大。

具身数据获取难度和复杂度很高,是一项社会化、系统性的工程。最终一定会收敛到,不需要每家公司重复造轮子、重投入去做这件事,而是催生公共性质的服务平台,提供一站式、最完整的数据。

至于别人怎么使用数据,我们不会知道太多细节,但可以看到什么样的数据被需要。即使不是蜜蜂,大家也能通过论文、公司宣传看到趋势。

卫诗婕

既然蜜蜂最初的idea来自Scale AI,你们有没有研究过,为什么做数据的公司不止一家,但最终Scale AI跑出来了?

姚卯青

一方面,Scale AI在美国把运营做得比较好,运营规范、效率、质量和成本都能平衡得不错。

第二,Scale AI在做数据过程中获取了大量数据,可以训练自己的模型。这个模型又反哺标注业务,做预标注和自动化标注,进一步提高标注效率。

我们认为这是一个有点像阳谋的事情。

卫诗婕

别人花钱给你数据,你提升自己的模型,模型又回来标注这些数据,完成闭环。

姚卯青

对。很有参考意义。

卫诗婕

具身行业一个很大的痛点是真机数据非常贵。我调查过,国内真机数据价格大概在每小时500到1000元。蜜蜂现在的价格是多少?

姚卯青

基本也在这个区间。我们没有刻意做价格上的竞争。

市场远没有到供大于求、大家通过价格厮杀来抢市场的阶段。现在数据是稀缺的,大家加起来都只是最终需求的一小部分。

卫诗婕

还是高价值数据。

姚卯青

对。即使按每小时500到1000元计算,如果按1000元,一百万小时就是10亿元人民币,差不多是这个规模。

100万小时对今天来说已经很多,但10亿元对很多头部AI公司来说不算特别大的数字。大厂每年对AI的投入,已经是数百亿美元以上的规模。

卫诗婕

我听说你们今年已经拿到了很多大单,包括模型公司、互联网大厂以及全球机器人公司,而且数目可观。今年会完成很高营收,是这样吗?

姚卯青

是的。

卫诗婕

我也看了你们前几天的发布会。您强调服务质量,比如样机数据48小时内完成,客户反馈24小时内响应。

姚卯青

对,24小时内响应。

卫诗婕

这是你们现在定义的行业标准?

姚卯青

因为数据服务不一样。它不是卖标准产品、IT设备,可以提供标准解决方案。现阶段定制化程度较高,需要和真实一线使用数据的研发团队、算法模型团队深入沟通。

过程中虽然不太友好,但确实会不断出现新的动态需求。

卫诗婕

我理解,找人标注、采集数据,本质上是劳动力产业。但真正的含金量,在于团队里有没有真正懂模型算法的专家,能够清晰定义需求,并知道去哪儿、怎么采集数据。

姚卯青

对。

卫诗婕

这正是智元的强项。

姚卯青

对。我们过去围绕从数据到模型、算法,再到落地,经历了几轮飞轮迭代。

卫诗婕

简单来说,只有足够头部、真正做过扎实模型的公司,才有机会瞄准这块蛋糕。

姚卯青

对。如果只是从数据采集过程中的某一个设备、装备切入,对这块的理解会浅一些。

卫诗婕

您把蜜蜂比喻为具身数据界的滴滴。

姚卯青

对。我们给自己定位为全球领先的一站式物理AI数据服务平台。

卫诗婕

滴滴做的是匹配需求和运营。你们也会是这样吗?

姚卯青

滴滴最终掌握了流量,在需求侧占据主导地位,形成生态。过程中两头发力:一方面占据司机端渗透率,另一方面通过司机和运营车辆的覆盖、调度便利性,掌握需求侧入口。

具身数据可能不完全一样。它不是To C市场,需求侧是比较集中的KA、大B客户。更多要用To B模式服务好他们,先占据客户心智,再发展上游产能。

卫诗婕

你们定了很高的产能目标,2026年实现1000万小时数据产能。

姚卯青

对,今年有这样的规划。

卫诗婕

如果达成,会成为全球最大的物理AI数据供给方吗?

姚卯青

1000万小时应该绝对领先。

卫诗婕

千万小时级别产能需要多少人力?

姚卯青

基本可以等效为1万人,或者机器人每天工作十几个小时的强度,按照正常上班族强度工作1年。

现在人和机器人采集数据的配比,现阶段机器人会多一些。但最近人的无本体、以人为中心的采集方式正在快速上量,所以从这个月、下个月开始,人的规模应该会反超机器人。

卫诗婕

也就是说,无本体数据会成为主流形式。

姚卯青

从数据量来看,是的。因为它铺设容易,采集效率、有效数据采集效率都会比真机更高。

卫诗婕

但真机也有大量用途。让真人代替机器人去现实世界刷经验,可以这么理解吗?

姚卯青

对,是真人采集数据。

卫诗婕

发布会上你们发布了真人采集硬件设备:一个类似夹爪、像用筷子一样操作的设备;还有戴在头上的摄像头和腕带,能够获取多视角视觉传感器数据,最终融合。

我看你们还在用夹爪式采集设备,但现在行业里好像有两指构型、像穿戴手套一样的设备。不是使用一个设备,而是戴上手套,直接用自己的手,手和设备融为一体。这种两指式设备看起来更先进,为什么智元没有选择最先进的设备?

姚卯青

你说的是两指式,但手更贴近机械假指。

卫诗婕

对。

姚卯青

除了这次发布的两款Migo产品,后续还有很多硬件在研发,包括五指穿戴设备、全身设备。

这块会根据市场需求来定义产品。

卫诗婕

蜜蜂做的事情肯定是行业需要的。短期内大家会需要你们,因为市场上还没有集大成的数据平台服务者。

长期看,每家公司是不是都会逐渐具备自己采集数据的能力?有一定实力的公司,可能更希望拥有独有数据、自己做这件事,而不是和智元系公司合作。

姚卯青

不一定。

支付宝原来是淘宝的,但今天可以成为各种电子支付场景下的国民级默认平台。

最终还是由产品体验和产品力说话。尤其对数据来说,更重要的不是数据属于谁,而是能不能用最短时间获取海量数据。

行业变化和竞争太激烈。如果你重复走别人的路,花2、3年构建别人2、3年前已经有的数据规模,也许数据确实是自己的,但那又怎么样?别人可能已经翻了2个数量级。

如果最终是为了服务模型、算法和应用落地,应该在当下获得全球最多的数据,不管是自己生产的,还是别人已经有的。

所以我们讲的数据军备竞赛,不是谁拥有多少量,而是谁在多快的速度内拥有多少量。

卫诗婕

谁能最快速度拥有数据。

姚卯青

对。现在很多客户经常对我们说一句话:“as many as possible, as soon as possible。”他们都会这么回答,因为这是急需求,大家也愿意支付更高溢价。

卫诗婕

价格会因此更高吗?

姚卯青

价格可能会随着数据量上升慢慢下降。生产方、运营方都有成本优化空间。

但从使用方角度,刚才讲的100万小时其实也还好。10亿元人民币,或者1亿多美元,对大厂来说不算特别大的数字。

卫诗婕

现在有一个共识,具身智能看中国。中国在这方面走得比较领先。全球模型厂商、具身公司和互联网大厂,也会好奇中国具身公司手里掌握什么数据,他们也是愿意付费的客户。

姚卯青

对,他们一定愿意。

上周,Generalist和Google DeepMind团队的一些技术人员有过讨论,双方达成了一个共识:如果数据是这场竞争中唯一决定胜负的变量,那么中国公司现在就可以宣布自己一定是赢家。

卫诗婕

因为中国生产和获取数据的速度、成本优势太明显了。中国又是工业大国,有丰富场景,人力成本相对较低,还有成熟的全产业链。

如果放眼海外,做同样事情的强有力竞争者是谁?

姚卯青

数据方面,美国可能还是Scale AI这样的存量公司,它们也会积极转型。

听说它们现在通过自营或者和上游合作,在东南亚等低成本地区布局产能。

卫诗婕

大家现在习惯把数据采集放到成本洼地,某种程度上又回到了全球化2.0、3.0时代。

姚卯青

对。数据生产和标注主要是重运营,最终一定回归成本和效率。

卫诗婕

我留意到你们发布会现场有4种语言同声传译:英语、日语、阿拉伯语、韩语,能看出你们面向全球合作伙伴。

姚卯青

对,蜜蜂day one就要全球化。

8. 蜜蜂建立全球数据生态

卫诗婕

投资人很关心:既然要做全球化业务,又是数据生意,数据合规和合法怎么做到?

姚卯青

首先,我们也是全球布局。蜜蜂生产源头不只在中国,在东南亚、美国、日韩、中东,都已经有相应生产节点。

其次,国内数据出境,未来会走正规、完整的体系,通过正规途径服务境外数据。

卫诗婕

合规这一块,智元过去已经做过,还是正在快速补齐?

姚卯青

已经在构建过程中。

卫诗婕

海量真机数据反哺模型迭代,会不会涉及境内外数据跨境?

姚卯青

会。

对于有相关法律法规规定的地域,我们不会把数据回流到国内等其他地区,而是在本地存储。

卫诗婕

你们怎么构建统一标准的数据集?

姚卯青

严格意义上,现在还不能完全统一。每个数据使用方的需求,仍然有差异化和定制化。

所以现在是一个个标杆性案例。

卫诗婕

长远来看,会统一吗?

姚卯青

一定会。

好的数据在一定阶段会开始收敛。比如多少FOV、多少帧率、多少分辨率、什么样的相机布局、什么样的其他模态,才足以支撑机器人学习智能。

我觉得未来1年左右,大家会形成基本共识。

卫诗婕

机器人领域硬件规格还没有统一,整个行业也没有标准。在硬件不统一的情况下,数据怎么可能统一?这台机器人采集的数据和另一台机器人不同,本身就有差异。

姚卯青

首先,很多东西可以用通用形式表达。

不同机械臂、不同构型的人形机器人,动作空间都可以用相同空间表示。专业术语里叫末端执行器,简单理解就是手腕。不管机器人长什么样,最后都可以控制手腕轨迹。

其次,海量数据会广泛用于预训练、多模态模型和大模型。包括世界模型在内,都可以从原理上消化不同类型的数据。即使来自人类的数据,也可以学习和利用。

比如世界模型本质上是predict next frame,预测下一帧。帧就是一个二维像素矩阵画面,不管数据来自机器人、人,还是哪种机器人,都可以学习。

学习不同机器人的操作过程时,模型也能提取通用物理规律。

卫诗婕

您那天说,1亿小时真机数据有可能实现具身智能涌现时刻。这1亿条怎么算出来的?

姚卯青

这是和很多用户头脑风暴后,大概达成的共识。

1亿小时可能对应GPT-2、GPT-3当年使用语料的时长规模。1亿小时再往上,目前大家也无法准确预测。先拿1亿这个门槛,验证很多现有想法。

卫诗婕

1亿小时?

姚卯青

对,按时长算。

卫诗婕

智元自建了一个3000平方米的数据采集中心,就是我们今天拍摄的场地。你们的AgiBot World千万条数据集,是从这个采集中心出来的吗?

姚卯青

是的,AgiBot World就在这里。

卫诗婕

未来会建多少这样的采集中心?

姚卯青

张江这个采集中心更多是样板间,用来打造标准化流程和方案。

比如接到新需求,先由这里的团队设计采集流程、搭建场景,试采集、打磨,形成稳定方案,再下发、部署到外地大规模采集场。

这里更像司令部。规模化产能采集,主要在外地采集场完成。

卫诗婕

我看你们发布会和生态伙伴合作大会是连在一起的,邀请了几千人。

姚卯青

注册申请参会的人超过5000人,最后到现场应该有1000多人,实际可能2000多人,受限于场地承载规模。

卫诗婕

这个会在行业里很轰动。你们邀请大家成为合作伙伴,提出要打通数据孤岛。数据孤岛真的能被打通吗?怎么打通?

姚卯青

我觉得可以。

尤其是现在很多数据采集场、训练场,并没有被专业、高效地运营起来,具备一些闲置产能。

如果它们加入蜜蜂体系,在我们的赋能培训和需求分配下,应该能更加专业、高效地运转。

卫诗婕

在打通数据孤岛的过程中,你们扮演什么角色,提供什么价值?

姚卯青

更多是链接供需双方,作为平台提供价值连接。

卫诗婕

但应该有海量参与者,平台价值才能体现。

姚卯青

对。

卫诗婕

我发现你们的价值方式是,大家可以拿自己的数据来交易。

姚卯青

对。未来可以把数据上传到数据商城。

有些运营方和我们紧耦合,完全按照我们的标准和设备运营数据;也有一些第三方没有那么紧耦合,我们也欢迎他们把数据上传到数据商城。

卫诗婕

所以既包含定制数据采集,也包含大家拿自己的二手数据、货架数据来交易,有点像以前粮食紧俏时大家交换粮食。

姚卯青

对。

卫诗婕

也像闲鱼和转转。

最后聊聊开源和闭源。智元现在显然是开源生态。从闭源到开源的光谱里,智元从底层到数据平台,怎么决定什么能力要开源,什么能力要闭源?

姚卯青

我们围绕一个共同目标做这些事情:希望越来越多的人把机器人用起来,并且用在有价值的场景。

所有事情都围绕这个共同目标驱动。

我们开源数据,是希望大家使用并体会高价值具身数据能够催生的模型能量。有了更好的模型,才会有更多应用。

第二,像极地Studio、灵星平台、零创平台,都是面向开发者的。希望大家使用平台去创造作业类、运动类应用。

比如零创平台,大家拍摄舞蹈视频上传,平台就能把它转换成机器人对应的舞蹈;还有灵星平台,允许大家定制机器人的角色、音色等。

我们希望通过这种方式,让更多开发者和二次开发团队把机器人用起来、用好,进入更多场景。

在这个过程中,在用户授权的情况下,我们也可以把数据反哺回来,形成更好的底层模型能力。无论是作业平台基础、运控模型基础,还是交互模型基础,都是一个从商业成功到数据飞轮的完整故事。

卫诗婕

你们发布会里反复提到“定行业标准”。怎么定,跟谁定?

姚卯青

这次我们也邀请了一些伙伴,比如赛迪研究院、上电科等。

我们更多想制定数据质量标准,以及价格、交易模式等商业化标准,让大家形成共识,使数据生态和市场在发展早期更健康地运行。

而不是质量参差不齐,大家在市场上打价格战,最后在早期就把整个行业做没了。

卫诗婕

2024年您曾经提出过具身智能从G1到G5的技术演进路线,我理解是仿照自动驾驶。这个标准也被上海政府采纳,纳入具身智能智能化发展分级指南。

现在制定标准,应该也是和政府一起定,对吗?

姚卯青

对。这是上海市人工智能行业协会牵头、我们共同参与制定的标准。

卫诗婕

工信部也在制定相关标准。

姚卯青

对。智元也是工信部人形机器人标准化技术委员会副主任委员单位。

卫诗婕

政府牵头制定高标准后,行业玩法和规则会发生什么改变?

姚卯青

现阶段可能不会立刻显现,但逐步会对很多应用场景产生门槛。只有符合相应标准、规范和安全门槛,才能被使用。

过去电子产品、汽车等行业都有这个过程,满足标准后才能准入市场。

卫诗婕

这件事情会在多久之内发生?

姚卯青

我觉得2、3年。一旦机器人开始大规模商用,一定会催生标准和门槛,否则没有有效管理,可能出现乱象,甚至发生质量事故。

卫诗婕

所以也是2、3年。

姚卯青

对,伴随大规模部署和商用节奏发生。

卫诗婕

按照您对G1到G5的定义,我们现在处于G几?

姚卯青

现在可能处于G3到G4之间的中间态。

卫诗婕

从端到端顺序驱动,到通用操作大模型。

姚卯青

对。G3可能是在特定场景、特定任务下端到端自主执行;G4是在跨场景、跨任务下端到端执行。

我觉得我们现在应该在G3到G4之间的过程。

9. 具身智能仍在涌现前夜

卫诗婕

对于具身智能涌现来说,现在是几点前夜?

姚卯青

真正像语言模型一样出现涌现能力,突然达到人类原来根本不具备的专家级水平,我认为还需要时间。

卫诗婕

前夜的前夜?

姚卯青

前夜的前夜。等到我们有1亿小时数据时,我认为前夜就来临了。

因为我相信,等到有这么多高质量语料,这个行业还是我刚才的观点:不缺聪明人。大家有了相应生产资料之后,一定会很快实现具身智能的涌现时刻。

卫诗婕

按照你们那天发布的路线图,实现十亿小时级别数据要花多少年?

姚卯青

我们认为2027到2028年可以达到这个规模,也是2、3年。

卫诗婕

今年是千万小时,明年全球达到1亿小时很有希望。

姚卯青

对。

卫诗婕

所以每个环节扣住,都是2、3年之后迎来质变。

姚卯青

对。

卫诗婕

大家认为您在智元担任的是商业操盘手,最务实的角色。这个形容准确吗?

姚卯青

不能说商业操盘手。我觉得更多是积极推动机器人技术和商业应用的开拓者。

卫诗婕

您希望怎么定义自己在行业里的角色?

姚卯青

也是开拓者。我希望是开拓者。

卫诗婕

未来2、3年可能迎来一系列质变。您最期待看到的画面是什么?

姚卯青

最希望看到的就是刚才聊到的涌现时刻,真正有那么一个“啊哈”的moment。

你感觉机器人好像确实有那么一点觉醒,似乎真的有一些自主意识。它能够自我规划,在复杂环境里响应你给出的指令,而不是纯粹从画面到执行的肌肉映射。

卫诗婕

这个涌现时刻更有可能发生在实验室、工厂,还是其他地方?

姚卯青

一定发生在实验室。

等到我们从工厂、从其他场景收集到足够多数据,再在实验室里催生出这样的技术。

卫诗婕

您职业生涯中,在实验室或其他地方经历过这样的“啊哈”时刻吗?

姚卯青

说实话,整个科技发展史里,也只有近几年大模型诞生之后,可能给大家带来这样的感受。

其他行业更多还是在线性、可预期的轨迹上发展。真正的“啊哈”,一定是让你感觉它具备拟人、类人的思维能力。我觉得这是大模型之后才出现的。

卫诗婕

也就是说,您人生到目前为止还没有经历过。

姚卯青

还没有,非常期待。

卫诗婕

补充一个问题。蜜蜂现在估值30亿元,这是一个很夸张的数字。

姚卯青

最新一轮已经不止这个数字了。

卫诗婕

这是一个过高的估值吗?

姚卯青

按照营收来看,我认为在现在这个市场里不算。

无论是营收、利润,还是长期来看具身智能最稀缺、最具竞争力、最重要的东西,我都不认为这是一个过高估值。

卫诗婕

但刚才我们讲到,未来数据利润可能回落,订单也可能分散,因为每家公司都具备了采集数据能力,市场可能会改变。

姚卯青

我们是这样看这个格局的:供给量、供给规模的上升,应该赶不上需求量的上升。

刚才提到,未来需要上亿小时甚至更高规模的数据,需要很多设备和人员到真实世界获取。所以我们认为,每家公司,包括蜜蜂和每一个参与产业链的公司,都会有比较高的增长。

卫诗婕

我理解,数据是这一轮智能化转型的关键基础设施资产,也是生产力资产。

姚卯青

对,就像算力一样。

但数据可能比算力更难获取。算力是成熟、标准化产品,有钱就可以快速获取。但数据从规划需求,到真正有人承接、运营、交付,是一个漫长、系统的过程。好了,这期节目就是这样。如果你是机器人行业从业者或者感兴趣的听友,非常期待你在评论区的留言,与我们分享行业现象与见解。如果你喜欢我们的节目,也请多多留言、转发、分享给身边的朋友,这将是对我们最大的支持。这里。这里是漫谈来的 Star,一档追求深度、生动与信息质量的科技商业访谈。我们争取在每一个技术、商业时代的关键变化节点,提供负责可靠的一手信息。感谢你的收听,我们下期再见。