[BidClub_]
张小珺Jùn|商业访谈录 · · 185 min

132. 对星海图创始人高继扬的3小时访谈:鲶鱼、曾国藩、Waymo与Momenta的两面、一只狼与许华哲的离开

张小珺高继扬

YouTube
TL;DR
  • 星海图刚close新一轮融资:估值100亿人民币,两年涨约30倍(2024年1月首轮融后约3亿)。本轮由CFO天琪主导,产业方含吉利、北汽及多家PE与一二级crossover,六家老股东pro rata、三到四家超额跟投;高继扬自评估值排名"保守说一个第五",前面是智源、银河、宇树。
  • 公司战略是特斯拉式垂直整合:整机+真实数据闭环+端到端模型。"具身智能长期壁垒建立在物理世界的数据闭环之上",整机既是数据载体也是商品形态(整机+智能);而算法的传播周期只有2-3个月,整机供应链12-18个月,数据体系再加6-12个月——算法壁垒相对较小,"它在创新上投入非常大,但防止被抄袭的壁垒很小"。
  • 真实数据的成本账是全场最硬的数字:自运营下来1小时真实数据全成本200-250元(3-4小时人工+整机按10万元/1000小时折旧),十万小时——约等于一个人18岁前与物理世界交互总量——只需2500万元;且数据获取与训练成本比为1:5到1:10,低质仿真数据的浪费发生在训练端。数据配比(data recipe)没人知道,"AI归根结底是实验科学,得试出来"。
  • 商业化路径:从开发者市场走向生产力市场(对标《跨越鸿沟》、Macintosh、拓竹、宇树),已有150多个全球开发者客户;2026年主线转向场景应用,看好bin picking、厂内物流SPS等"pick anything, place to somewhere"场景;他的人生bet:"在生产力场景做出万台出货量"。
  • 许华哲离职在去年8月已内部settle:赵航统管基础模型团队后拿出开箱即用的新机型,星海图将投资华哲to C家庭方向的首轮创业。高的定性直白——"对星海图长期来看是绝对利好",背后是"实事求是的战功文化";但他否认这意味着算法不重要:"算法创新不能独立于整个公司的基础设施存在。"
  • Waymo与Momenta是他职业生涯的两面教材:Waymo是"工程师的天堂"但"没有founder"、自上而下的力量缺失,"错不怕,怕的是力量不集中、不统一";Momenta绝对结果导向、核心算法团队到十二点、一周六天打底。他离开M创业时放弃约1000万美金期权,"一点都不心疼"。
  • 大厂的真正威胁是业务协同,而具身智能恰恰不存在业务协同——供给全是新供给(汽车零部件一个也用不上),需求千行万业谈不上协同;大厂最缺数据,而买数据有悖论:"必须得有懂基础模型的公司定义数据体系"——这是有整机能力的创业公司的结构性窗口。
  • 为什么具身智能里没有梁文锋式的技术浪漫主义者?"很有可能是机器人这件事本身就不浪漫"——链条极长、周期极长,"我们天然的就要去土里边做很多东西,没法浪漫";"这个行业不允许这样的人存在,如果有,可能会有很大的suffer。"视频里的机器人比现实好得多,"大家还是要给他更多的耐心,但这件事会发生"。
Digest · the substance, structured for research

1. 开场命题:中国具身智能为什么没有技术浪漫主义者

  • 张小珺的开场设问贯穿全片:为什么具身智能产业里没有出现梁文锋、杨志林那样"带着浓重技术浪漫主义色彩的人"?她把高继扬定义为这种浪漫主义的反面——"极致的效率、工程拆解与实用主义"。
  • 录制时点本身是信号:联合创始人许华哲即将离职。高继扬给出的先导句成为全片题眼:"机器人行业就是一个链条极长的行业,有时候你就是要把你的头伸到土里去。"

2. 石家庄少年:勤奋是一个可以随时打开的开关

  • 石家庄裕东小学、二十七中,成绩"班级前五或前十"的正常小孩;六年级暑假为初中分班考第一次用功,考了年级第三——"我考试生涯当中第一次还不错"。
  • 他对自己的精准画像:"当我发现我需要勤奋的时候,我是非常勤奋的。当不需要的时候,我也不是很勤奋。"主持人总结他的人生是"一段一段突击的",他承认至少大学之前如此;大学毕业后"就变了一个状态,一直保持勤奋",原因是"目标感更强了"。

3. 物理竞赛保送清华:靠归纳总结,不靠天赋

  • 石家庄二中省理科实验班学物理竞赛,自认"我见过真正有天赋的人,跟他们比我主要靠勤奋"——别人刷一遍题我刷两遍,别人刷两遍我刷四遍,把题型映射到考点做归纳总结,这套方法论贯穿他此后所有考试与工程。
  • 全国二等奖恰好够清华调专业:2010年11月厦门赛场,招生老师往宾馆房间打电话叫人排队,"问你俩问题:要不要上清华?先选个专业。"他选了电子系,理由朴素——"觉得做芯片这个事是有前途的,但当时也没有特别好的思考"。语文英语很差(一卷二卷加起来约100分,别人一卷就90多),"没有物理竞赛,我高考能上个四川大学、厦门大学就挺开心的了"。

4. 清华的大神教育:杨志林是"高不可攀的大神"

  • 被问及同届的杨志林:"这是高不可攀的大神,真的,他一直都很厉害,接近特奖,本科就已经做了特别棒的工作。"厉害来自什么?"我觉得是天才吧。"
  • 自己在电子系"top百分之三四十",同班还有韩衍隽——"我看他写的作业想学习一下,我都看不太懂,得换一个人的作业参考"。清华教给他的是"要谦虚、要低调,天外有天人外有人"。大二白头也是那时落下的,"不是染的,自然白的"。

5. 大学就定了创业,但移动互联网"跟我没关系"

  • 大二大三想好要创业。2011-2015正是移动互联网最火——校内网、打车、外卖,"隐约感觉到这是大机会,但跟我没关系"。原因说得很干净:"一代人有一代人的机会。人家积累了很多东西,轮到他了。我就是个大学生,啥也不懂啥也不会,我想干也不可能赢。"
  • 于是问题变成"创业到底做什么、我要为它做什么准备"——这个倒推式思考成为他后来所有职业选择的模板。

6. 申博受挫与曾国藩:从儒家清流到事功

  • 大三暑假斯坦福UGVR实习后,老师没写强推,想上的学校全落空,最后只有没让他写推荐信的USC、UCSD等给了offer——"一个小打击,低谷期"。他的应对方式是看书反思,"看历史、看传记,通过别人的困难给自己来点灵感"。
  • 记住的是曾国藩:从二十多岁的儒家清流到四十岁特别有事功的人。书里的顿悟被他原样搬进人生:"当你要做一件事的时候,你到底能拉动多少资源、多少人愿意跟你一块做,并且最后把事做成——这件事是最重要的。"映射到自己:"儒家清流做不了了(去不了最好的学校),那我要从底层思考我未来到底要做什么,把什么当成目标,而不是把表面的东西当成目标。"

7. 商汤实习:骑着自行车顿悟神经网络

  • 大四经汤晓鸥小范围交流获得实习机会,2014年底进商汤训第一个神经网络(做pose estimation,跟着李成、鲁书)。他至今感谢商汤"给从来没接触过的人一个学习机会"。
  • 顿悟时刻保留原景:从清华科技园创业大厦骑车出来,"突然想到,这个计算机可以从数据当中自己提炼规律——我们编程序是人提炼规律写成if else,现在神经网络自己从数据提炼规律,把if else变成参数,全自动。这事太牛了,我以后得做这个。"他当时判断"人未来应该很少会用编程了"。

8. 三年半博士毕业:发顶会也有三种套路

  • 目标先行:"读博是为了完成某些训练,训练完成的时间越快越好"——定四年毕业,倒推需要4-5篇顶会,倒排到博一结束就要投CVPR。发现自己"idea比实际干活带宽多",就把idea分享给实验室同学共同署名,"把大家没有充分发挥的时间发挥出来,大家都好"。
  • 发paper的归纳总结:"几乎所有paper都能套进三类:一是挖坑型——提出新问题、做数据集、建benchmark,最厉害的人干这个;二是提性能;三是性能接近但成本或监督数据更少。"再加上"别人一届投一篇,我投两篇,提高概率"。三年攒够,70多岁的印度导师"特别nice"地放行,2018年底毕业。

9. 选行业的标准:AI必须是这个行业的"绝对变量"

  • 他用找工作的方式调研行业,筛选标准:"这个行业一定以AI作为最底层的变量——没AI这行业没有,有AI这个行业才成立,且行业足够大。"商汤式泛AI+被pass:"会不会干成外包?很难形成产品,交付侧每次成本都很高。"广告被pass:"搜索和广告没有AI也成立,AI不是绝对变量。"云被pass:"把模型包装成API,不本质。"
  • 结论是"物理世界的AI",自动驾驶是它的第一形态。为什么不去传统Robotics?"控制优化、SLAM这些技术,机器人里面更偏机器而不是更偏人,很难从底层让机器人真的像人一样工作。你想让它变成人,还得用AI的方法。"还是回到那句话:"AI的魔力在于能够代替人总结规律。"

10. 十年自动驾驶复盘:2018年的架构和2008年没区别

  • 入职Waymo前他把DARPA Challenge以来的paper"大部分看了一遍",入职后最爱读Waymo的codebase含历史版本。核心发现:"一八年的自动驾驶技术架构和零八年没区别——感知、定位、离线建图、规控,大pipeline零八年的paper里已经说清楚了",只是模块内逐渐换成了神经网络(激光雷达从点云聚类变成网络推理)。
  • 但这套架构的底层逻辑是Robotics而非AI:"Robotics做系统拆分、关注corner case,所以要拆成可解释的模块去解case。AI的方法论是数据驱动、端到端——不擅长解一两个具体case,擅长把benchmark从80干到90再到95,不排除部分case变差。"同期Waymo的感知有"真的是几十个模型":detection、tracking、各类classifier、scene understanding层层叠加;而特斯拉从2018-2020开始AI native地重新设计,一个模型统一感知——"演化到今天的BEV、端到端、VLA,这一套已经成了主流"。

11. Waymo的病灶:不是大公司病,是"没有founder"

  • 他入职时Waymo约1000人、离开时近2000,"还没做出价值就过早进入大公司状态",职级、工程体系、文化全对齐Google。但他强调大公司病只是表象:"本质是Waymo没有founder——它的founder是Google的founder,又没时间管,自上而下的力量缺失。不像特斯拉,马斯克说干啥,哪怕是错的也能开始干。"
  • 这句是他组织观的原点:"这种行业里创业,错不怕,有错快速迭代快速调整都OK;怕的是力量不集中、不统一。"如果Waymo有强势founder该做什么?"2018年就该另起一个team,用一套infra、一套评测体系,AI native地重新设计整个架构——这跟是不是车企没关系。"

12. 四种商业模式与Waymo/Tesla之辨:差别只在对待AI的态度

  • 他给自动驾驶分四种商业模式:Waymo式robotaxi自营车队按单收费;车企卖车+软件订阅;Momenta式供应商NRE+License;华为算第四种——"本质赚整车利润,用顶级智驾+座舱体验重新定义车,叠加品牌渠道"。
  • 对Waymo他先纠正主持人的"科学驱动"标签:"Waymo的工程基因和特斯拉一样强,来自Google,我的工程师训练就是在那完成的。两者的区别在对待AI的态度,以及面向AI重新设计系统的调整速度和力度。"去年11月他专程去LA体验:"比大部分Uber要好得多,商业模式已经接近走通的边缘——它是一个AI时代的Uber。"对Waymo的敬意也保留了:"长期战略一旦选择,执行很坚定,里边还是有对的人,只是调整速度慢了一些。"

13. VectorNet:第一次与赵航合作,以及读codebase的癖好

  • 在Waymo做预测时的创新:此前用CNN处理渲染成图片的地图,"卷积是局部视野,地图很长,信息处理不好";他们改用向量表达地图+图神经网络,算子用轻量self-attention(参考Transformer但架构很轻,"给我们的算力也很小"),效果很好——这就是VectorNet,后来被很多公司采用,"我比较满意的工作"。
  • 赵航记得的细节:设计方案时赵航想读paper,高说"周末我把我们的代码全看一遍就知道了"。高自述:"我不仅喜欢看现在的代码,喜欢从过去看到现在——你能看到一个工程体系的迭代,这里边有逻辑的。"两人的互补他说得很准:"赵航更愿意从原理层面想清楚,我更从问题的角度看最有效的解法——一个供给侧思考,一个需求侧思考。"赵航"情绪超稳定",而自己"不及预期时会强力push"。

14. 工程师思维=拆解+测量;离开Waymo的两个决定

  • Waymo两年他自评"学到的比贡献的多":一是物理世界AI系统端云怎么work及历史沿革;二是工程师思维定型——"拆解加测量:复杂问题拆成子问题再拆解,拆到最后是一行行代码;测量到最后是一个个单元测试,再一层层看回顶层指标。"与物理竞赛的差别:"竞赛是解题游戏,不是系统化工程,但两者都把逻辑思维练到很高。"
  • 2020下半年他判断"在这边的成长效率收敛了",且意识到"我离产品太远、离公司怎么经营太远"。于是两个决定:做量产不做robotaxi("太慢")、回国、去自动驾驶/AI能力更强的地方。候选是华为(聊了陈一伦、苏青)与Momenta;没去蔚小理,"小鹏已经做得还行了,我是喜欢去不行的地方,然后把一个东西做好的"。他对产品的定义也不设to C门槛:"直接给某些用户创造价值、让他用起来,to B也是产品。"

15. 选Momenta:组织必须有人能纠错;量产飞轮的推导

  • 选M的理由:"没大公司病,够强势。一个组织要成功,可以犯错,但得有一个人说我们错了、然后我们改——不能没有人站出来纠错。"曹旭东"懂技术、AI的信仰者、长期目标坚定"。
  • 他把M的量产路线还原成一条数据推导:"AI一定需要数据。自己养车队,一千台车已经很多,覆盖一个城市都困难,而自动驾驶要解决的是哪都能开。那就很自然推导到量产车——把软件装上量产车,先提供辅助驾驶、泊车的价值,形成数据和商业价值的循环,数据获取就变成商业驱动的行为。"在2018年提出这一点,"大家还在讲直接搞robotaxi的年代,很有vision,很有魄力,而且一直坚定"。

16. 做鲶鱼:轮岗多个模块,练出可迁移的能力

  • 被问"你是当时引入的一条鲶鱼吗"——"我应该算是吧。"2020年底入职正逢M拿下上汽智己首个量产定点,他被"灵活使用":感知→定位与泊车→其他工作→规控(把规控和定位从rule base改成deep learning)→最后做高速高架NV量产交付上汽。
  • 这段最重要的收获不是解决了哪个模块:"而是我可以很快速进入一个不熟悉的领域,用一套固定方法论理解、拆解,然后人事匹配——匹配不是第一天就对的,要监控、测量,反馈好扩大、不好收缩再调整。"面对挑战他"压倒性的是兴奋",来源明确:"如果我连这事都做不好,我创业不可能做得好。"

17. 两个第一次:不打仗,没法洗礼组织

  • M当时面对"两个第一次"叠加:第一次把demo级的东西变成产品级,第一次向B端大客户交付完成服务。组织必然不ready——"架构不是面向量产设计的,同学的能力也没匹配到那种强度",于是频繁调整、主动被动淘汰、人员流动很大。
  • 他的定性毫不含糊:"这都是好事。你不通过打仗这样的形式,是没法洗礼锻炼这个团队的。"更早之前少卿(口称"绍卿/绍兴")、王凡离开的那次调整,在他理解里"就是旭东在改变公司文化——从research lab转向真正做产品的公司,组织不变连定点都拿不到"。

18. 天堂与战场:Waymo与Momenta的两面

  • Waymo是"工程师的天堂":最好的infra、最好的同事、宽厚温暖的领导,"目标有,但不是迫使的",四五点下班接孩子的也有——而他自己"自动加班,正常工作做完就看Google所有的doc加codebase"。
  • M则是"绝对结果导向,结果好往上走,不好就调整,压力是随时的";总监以上都直接面对客户,国内车企文化tough,"说骂就骂了。你被骂过没?——那就是很平常的,我不是很在意,骂就骂了","你做不好我们马上淘汰你""你把旭东叫来解释"这类话都有。他的结论有两层:"单纯从工程师自我感受说,M和中国智驾环境都不是好的;但从成长性说,中国智驾环境对工程师综合能力的训练更好——它让你看到这个世界真实的状态。我比较喜欢面对真实,哪怕真相是残酷的。"

19. 曹旭东的两面:把真相说出来,压力大到一定程度会成伤害

  • 对旭东的最高评价给了战略:"旭东最强的点一直没变,是战略能力——那么早判断要做量产,过程有波折也不动摇,这是M从这么多自动驾驶企业里脱颖而出的最核心能力。"对比地平线凯哥:"都是战略超强、执行超强,芯片是三年前的决定,晚一年都没有今天。"
  • 另一面他也直说:"旭东比较push、比较aggressive——其实不是aggressive,是把真相说出来,用非常直接的方式表达,这种压力大到一定程度就会成伤害,很多同事因此离开,后来他会选择性地不把这一面展现给更多人了。"你是这种风格吗?"我是有这一面的。"

20. 放弃约一千万美金:无论如何都留不住

  • 从M出来创业他放弃全部期权,"当时那个时间点一千万美金可能是有的,现在这个时间点可能更多"。心疼吗?"一点都没有。我最care的还是我想去做的那件事,跟它比其他东西价值不大。钱这个东西日常我也花不了多少。"
  • M能留住他吗?"finally是留不住的,无论如何都不行,因为这是我人生的使命。"至于M留不住其他人,他先揽责再开脱:"在真正顶级人才的保有和持续培养上可以做得更好;但也不怪旭东——这个行业就是这样,核心算法团队到十二点、一周六天打底,拼是为所有人负责的一种选择。M的加班强度到今天都比我们(具身智能)更厉害。"

21. 2022年底的三个信号:该开搞了

  • 时机判断三要素齐备:一是GPT-3与InstructGPT——"让世界再一次相信AI了。只有我们做AI的相信不重要,得有更多人相信,资金才会进来";二是量产智驾把端侧智能变得可能——"机器人用的端侧算力和传感器,跟智驾这套大差不差";三是特斯拉正式宣布做人形机器人。
  • 2022年12月他正好30岁(射手座),"这一系列事交织在一块,我就想好肯定要开始干了"。但他还是把手上的事收尾:2023年三四月NV量产交付上汽、把国内所有带NV功能的车试驾一遍确认"做得还可以",5月才提离职——有始有终本身也是他的方法论。

22. Momenta教会他的底层一课:什么叫以客户为中心

  • 回国两年最大的变化:"我学会了什么叫以客户为中心——不是生硬地客户说做什么就做什么,而是真的站在客户角度看需求,甚至帮他挖掘需求、提出更好的方案。也不只是对外的:公司内所有上游面对下游都是以客户为中心,支持团队面向业务团队、平台团队面向交付团队。"
  • 对立面点名点得很狠:"与它相对的,是以自我成长为中心、以所谓技术领先性为中心——至少在做一家企业来讲,这些都是错误的。"这句话是理解后面许华哲一节的钥匙。

23. 创业起步:不堪入目的BP与很快被否掉的配送

  • 离职后先去西藏自驾,8月开始整BP融资——"现在回看当年的BP简直不堪入目"。但两件事从一开始就想清楚了:做具身智能必须整机加智能,不能只做智能(长期壁垒在物理世界数据闭环);不做纯科研,要落地产生价值。
  • 最早的方向是末端配送机器人(自动驾驶复制到配送+一点操作能力),"很快就否定了"——2024年二三月他自己复盘:"这玩意儿不能玩了,太早了,整机不成熟、供应链没有、智能不ready、客户不成熟、市场不在,没法搞。"于是切到轮式双臂聚焦操作、切入开发者市场,"当时没有今天说的这么清楚,也有点运气成分,做对了"。

24. 天使轮往事:三千万、两亿估值、朱老板退出

  • 首轮共3000万人民币,估值约2亿人民币:IDG领投(同学李一康引荐,推到邵辉,再见肖军),百度风投跟投,金沙江投得最少(经手人是后来去Kimi的雨桐学姐,其退出后"朱老板就退了,投得也不多,退就退了,我也比较无所谓")。IDG投完还补了一句:"你们想做的这个事应该不work,再琢磨琢磨——这就是天使,他接受你的错误和不完美。"
  • 对比今天"随便讲一讲两亿美金起步",他拒绝"便宜了"的说法:"那时候天使和VC的环境比今天冷得多,2023年机器人还不是共识,'具身智能'这词大家还不清楚是什么意思——人家敢出手,我已经特别感谢。"紧接着清华电子系汪老师基金+姚颂做了近2000万加轮,投后三四亿。

25. 为什么第一件事是整机:不做整机,算法是空中楼阁

  • 主持人的追问很本质:你们是自动驾驶AI团队,为什么第一件事是最陌生的整机?他的回答是双重倒推:"长期壁垒建立在物理世界数据闭环之上,我必须有数据的载体;中短期我们的商品大概率不是一个算法、不是所谓大脑,而是整机加智能形成的物理实体。两件事都倒推回来:必须把整机和供应链做好。"
  • 2024年很多投资人问同样的问题,他的回答不变:"如果直接去做算法,这些算法都是空中楼阁,没法变成产品价值、商业价值。"起步再难也要开始:"不怕慢就怕站,日拱一卒。"

26. 具身vs汽车:幸与不幸是同一枚硬币

  • 自动驾驶的幸与不幸:汽车业已存在一百年,"幸运是客户和商业化路径极其明确——全球二十来个车企;不幸也在这,隔了一道车企,数据闭环不通畅,你对车没有把控力,交付给客户的体验可能打折扣"。
  • 具身智能矛盾对偶:"不幸是没载体,你得自己做载体,克服不舒适去学去搞;幸运也在这——当你把这一步真正做完,下游千行万业都可以做,是更广阔的市场。相当于汽车产业退回一百多年前,且还有智能技术,两件事得同时做。"所以星海图的组织天然双轨:人才密度型的智能团队+流程体系型的整机供应链团队。

27. 起点极低:淘宝以图搜图找供应商,与97年的天才杨泽义

  • 补课的窘态如实保留:买别人的产品回来拆,"第一次看到关节模组";拆出一个不认识的零件,拍照淘宝以图搜图找到供应商;连怎么拆都不会,后来的结构负责人来看"觉得我们太可怜了",送了一个装着改锥锤子镊子的工具箱。
  • 转折是五源一位投资人(五源没投)介绍的杨泽义——97年、南科大、自己创业做机器人教培。"聊到泽一我感觉,第一次有人给我讲明白了整机系统是怎么回事,很有框架性、很有洞察力。在陌生领域有这种感觉,大概率是对的。"聊了几次、去深圳两趟,2024年1月入伙,成为机电首席工程师——"后边我们所有产品大的框架设计都是他把关的,动手能力非常强,就是天才"。股份"基本按原始股的百分点去给"。

28. 合伙人机制:中等六边形+更大面积六边形

  • 他的组队理论:"我要求我自己做一个中等面积六边形,我希望合伙人团队做更大面积,组成一个更大面积的六边形,团队就会很强、很均衡地强。"
  • 机制是持续开放的:"从我、天威、赵航三人创办之后就一直有——泽一、华哲、商业化负责人于磊、几个月前加入的CFO天琪,都是这样进来的。我比较舍得分。如果希望公司五年翻十倍二十倍,那每一个阶段都是创业,底层就需要这个机制持续吸纳好的人。这是我们能从一堆公司里稍稍脱颖而出的原因之一。"

29. 构型:不是折中方案,是"智能定义本体"

  • 对"轮式+双臂是折中"的说法他直接反对:"我不会把它称为折中方案。我们的理念是智能定义本体——从智能的需求出发看本体怎么做。切入点是操作,双臂是重点;双足反而给智能演进带来困难,双足运控+双臂操作同时解决(loco-manipulation)这个问题到今天也没解决,而很多真实场景不需要过坎,轮式够了。"(主持人补的"数据定义本体",他部分接受:"智能是目的,数据是手段。")
  • 2024年3月左右定下轮式+躯干,做出R1,发现学术界确实有需求——由此进入他所谓的"开发者市场"。

30. 开发者市场不是高校市场,是《跨越鸿沟》的必经之路

  • 商业战略一句话:"从开发者市场走向生产力市场",对应科技产品从innovator到early majority的规律。他给了两个例子:Macintosh从极客到设计师到文员;拓竹3D打印机从少数极客玩具到企业必备再到家庭购买甚至打印工厂。"宇树其实就是这个模式——高校、二开公司,逐渐走向娱乐市场。这里边是有背后规律的。"
  • 开发者市场本身分层的金字塔:塔尖是学术型开发者(李飞飞、美国顶级大学的PhD们);其次企业内研究型开发者(Physical Intelligence,以及"我们帮蚂蚁做的灵波TBLA"这类);再往下生产力型开发者(面向落地二开);未来产品更成熟后,集成商会成为新的开发者,最后才是终端用户。

31. 整机的learning:AI拼人才密度,整机拼流程严密性

  • 相同点:"本质还是工程化问题,一样的方法论——拆解、测量,把复杂问题拆成子问题,做好组织。"
  • 不同点是全片少有的制造业干货:"AI强调人才密度、ten x engineer;机电整机强调整个研发流程的严密性——构型设计错了后边全错,然后结构、线束、嵌入式、整机软件平台,EVT验证功能,过程中发现线束磨损、结构强度不够、某供应商来料质量总有问题,用严密流程排除,走到DVT做一致性、老化测试,再到生产。做机器人、做消费电子,这套都是类似的。"

32. 分年主线:主要矛盾是动态变化的

  • 他先认同主持人"具身智能竞争是六边形"的判断,并给出与大模型的对照:"语言模型的竞争主要发生在模型本身——数据九成是外部的、渠道终端是现成的;具身智能的价值链条里,供应链几乎没有、数据是荒漠、算法work不work不确定、渠道全在线下、终端就是机器人本身——算法和模型只是一小部分,大量东西全是空缺,还叠加持续获取政府与资本资源的能力。"
  • 于是节奏是步步为营:"2024融资+整机供应链;2025融资+数据和智能体系(8月做了全国第一个公司层面的开源:自采500小时高质量遥操作数据+G0基础模型,同年150多个客户);2026融资不停,业务重心来到场景和应用。"数据和智能满意吗?"不可能满意,但框架搭起来了,赵航带智能团队氛围很好、结果不错,我花的时间就可以少一些。"

33. 真实数据的成本账:一小时200-250元,十万小时2500万

  • 为什么坚持真实数据?底层原理是domain gap:"要解决的问题在哪个domain,训练数据最好也在那个domain。domain transfer曾是热门topic,后来大家不做了——还是用那个domain里的数据解决问题更有效。自动驾驶里99.9%的问题是路测数据解决的;graphics based仿真的sim-to-real gap我们认为还是很大。"
  • 算账环节他反客为主让主持人盲猜一小时真实数据成本(答一千元),然后给出实测数:"采一小时投入3-4小时人工,加整机折旧——按10万元、保守1000小时寿命(最终寿命限制在齿轮,崩齿或精度下降),折旧每小时100元——全成本200到250元。一万小时250万,十万小时2500万——一个人从出生到18岁和物理世界交互的总时长就是十万小时量级。"对王赫"一万台采集机器人要十个亿"的算法他直接拆招:"为什么要买一万台?这问题没回答。我关注的是每小时成本,先定计量单位。"另一笔账同样关键:"数据获取成本与训练成本约1:5到1:10——数据质量低,等于把钱浪费在训练那一步。"

34. 数据金字塔谁说非得长那样:data recipe是试出来的

  • 对"金字塔尖真实数据+底层仿真与第一视角数据"的流行说法,他的反驳保留原味:"数据金字塔的定义应当来自智能的需求。金字塔是对的,但谁说的非得长成这样、非得是这么个比例?没人说。"
  • 他列全了数据类型:robot centric(真机遥操作);human centric(乌米、外骨骼、采集手套夹爪、POV头戴视角);第三视角互联网视频;仿真(又分graphics based与真正世界模型生成)。配比是行业最大秘密:"这叫data recipe,大语言模型公司今天最大的秘密就在这。是一万小时真机遥操作、五万小时乌米、还是二十万小时POV?这事得试出来——AI归根结底还是实验科学。"星海图要保证的是"各类数据的获取上都畅通无阻",此刻在训的recipe"坦率说我也不是特别清楚,大体是真机遥操+乌米+POV的混合"。

35. 反驳阴谋论,以及真实数据怎么scale

  • 主持人转述一种诛心的说法:bet真实数据是因为商业模式要卖机器人给实验室采数据。他断然否认:"绝对不是。具身智能是完完全全技术驱动的创业——技术的改变带来产品的改变,带来商业模式的改变。不是因为商业模式定了所以技术定了,这逻辑是错的。"
  • 真实数据scalable的两个要素:"第一,一定要进入真实场景,不应该在所谓的素材场里采——我们去年开始做、应该是全国第一个真实场景数据采集;第二,用众包的方式把采集设备分发出去,政府支持+我们投入+好的商业模式支撑,今年会做实践。"这也是他紧盯北美的原因:"我觉得北美比国内更早进入无本体的数据采集——UMI、采集手套夹爪这个方向很重要。"

36. 供给三指标:速度、精度、泛化性,用它筛需求

  • 供给侧顶层指标:"速度——基于模仿学习大概率超不过人,八九成人类速度就不错;精度——先解决厘米级,毫米级是下一步;泛化性——多少条新增数据解决一个新问题,看边际成本。抓取我们已做到零样本泛化(万物抓取);叠衣服(fold)毛巾T恤衬衫可以,其他衣服还要重新学。"
  • 需求侧的筛子由此而来:速度要求不能太高;AI还会犯错,失效成本不能高,不能一错就是无法挽回的损失;好场景要有爆发力("做完一个很快到一万台")——必须是全球化市场("只在欠发达地区有的不是第一步的好市场,欧美付费能力高"),且全球场景要类似统一("不同国家的酒店、零售长得不一样,商业服务很多不符合")。

37. 五类动作与bin picking:传统方案为什么失效

  • 动作大类五个:carry搬、pick拿、pack包、fold叠、operate操作设备。"现实中很多劳动者岗位就是这五类的组合,且每个岗位涉及的动作组合就二三十、四十个,不会有人一天做几百种动作。"
  • 具体场景首推仓储物流的bin picking:"上万个SKU一盒放一类,人拿着订单去哪捡去哪捡——数量太多,传统物流方案没法有效解决。"以及智能制造的厂内物流(车厂SPS集中分装:AGV转一圈、每三五个货架一个人取件上车)。对"十年前机器人公司也能做"的质疑,他答两层:"Kiva、夹抱式机器人解决的是另一大类;SKU特别多、订单从中挑几个,传统方案无解——协作臂能码垛,但解决不了泛化性。第二,这不是定制:问题归结为pick anything, place to somewhere,从AI范式看是高度统一的问题——今天你来办公室,兜里随便掏个口罩、耳机、口香糖,它都能准确抓起来,这是真实数据驱动的VLA解决的。"

38. 双系统VLM+VLA:不是学术偏好,是端侧算力的现实

  • 架构定义先正名:"大脑这词模糊,回到基础模型:一个是动作基础模型VLA,输入vision和language、产生action;一个是做指令拆解与逻辑思考的多模态语言模型VLM。双系统就是这两个的组合。"
  • 为什么不做单一端到端?理由全是落地约束:"几十B甚至上百B的推理模型不可能放端侧,放云上则延时解决不好——执行动作的模型一定在端侧。而且很多工商业场景就二三十个动作,直接调VLA的语言接口就够了;真正需要VLM的是家庭这类更通用、更泛化的场景。还是围绕真正产生商业价值去考虑。"肢体和脑子哪个重要?"一定是模型更重要,但为了做好模型,整机一定也要好——这是它们的逻辑关系。"

39. 第一梯队的底气:开源与demo的四个阶段

  • "你们是第一梯队吗?""如果看国内,我觉得我们是——从真实的智能水平,我们肯定是。"证据链:2025年8月全国公司层面第一个开源(500小时自采数据+G0基础模型),"后来友商九月、十二月、今年一月陆续跟进";今年1月发布开箱即用的G5 Plus(口中亦称"G五Plus")与整机R E Lite整合,"国内首创"。
  • 他给行业发明了一把尺子:"demo in the video→demo in the office→demo in the wild→application。我们的万物抓取是demo in the wild——在新加坡、韩国、美国客户那边、投资人年会现场都部署过,观众兜里掏出来的东西都能解决。demo in the wild解决了之后才是application。"

40. 大厂的真正威胁是业务协同——而具身智能没有;数据悖论与特斯拉路线

  • 他把问题反转:"应该问大公司相比我们有什么优势。"框架:做好VLA需要数据(真实世界操作数据,非互联网数据)、算法(一部分承接Transformer/Diffusion是大家都有的,尚待创新的部分是大家都没有的)、算力/资金、人才。"大厂基础设施算力人才都好,最缺的是数据——美国公司跟谭杰(Google DeepMind)交流,就是很着急,没数据。搞数据这件事,中国公司系统性比美国公司有优势,中国创业公司因为整机亲力亲为,比大厂速度更快。"买数据的悖论是关键一击:"你不懂模型,就没法定义好的数据体系,采完全是垃圾数据。必须由懂基础模型的公司定义数据体系和治理体系,再交给运营团队采集验收——供应商优质的前提是他自己懂模型,矛盾就来了。"
  • 大厂论的另一半:"大厂做新业务最大的优势不是人才资金,是已经存在的业务协同——字节做语言模型有飞书抖音流量,车厂自研智驾直接掌握数据和用户。具身智能没有这件事:需求侧千行万业谈不上协同,供给侧全是新供给——汽车零部件一个也用不到机器人上,道路数据对操作用处也不大。剩下的就是人才组织和资金资源的竞争,大家各有优势。"至于路线:"整车+数据采集+端到端智能,如果这条路选了,那我们是(特斯拉路线)。不同的是——汽车本身能卖出去,机器人本身卖不出去,这个是挑战。"

41. 许华哲的离开:实事求是的战功文化

  • 他先给足肯定:"华哲是非常有影响力的科学家,很多前沿问题理解很到位。"对"research文化vs量产文化的价值观分歧"的定性,他先修正主持人用词:"不是量产文化,是为客户创造价值这件事到底有多重要——不把客户第一作为公司存在最重要原因的文化缺失,会导致很多问题。不然技术出身的创业团队很容易变成大型实验室、大型研究院,那就背离了做公司的初衷。"再淡化分歧:"谈不上特别多的分歧,是务实创新、build客户价值一步一步来,和更多做超前创新之间要有balance。"
  • 事实经过:去年8月内部已settle down——赵航统一管理基础模型团队("也正是之后我们取得很多进展,今年1月的开箱即用是赵航带队拿出的结果"),赵航带领华哲探索to C家庭应用的可能性;最终决定支持华哲创业,星海图会投资其第一轮。"这在当下对大家都是更好的选择。"取舍难吗?"任何时候都不容易。"

42. 与少卿离开Momenta类比?以及"算法不重要"的反驳

  • 主持人的对照题很尖锐:华哲离开星海图之于你,和少卿离开Momenta之于曹旭东,一样吗?他不替旭东作答,只给自己的判断:"对星海图来说,长期来看这绝对是利好的一件事。价值观的底层是两个问题:面对取舍时选什么不选什么;面对利益分配时分给谁不分给谁。在这些问题上我们绝对坚持价值观和长期战略,不会被短期的利益让步。"
  • "华哲主要做算法,是不是意味着现阶段算法创新不重要?""不是。我们公司算法创新能力非常强,赵航有目共睹。但算法的创新不能独立于整个公司的基础设施去存在——要看整个价值链条。"

43. 传播周期论:算法两三个月就被学会,壁垒在哪一目了然

  • 全片最可交易的框架,用"传播周期"(友商完全学会你的东西需要多久)衡量各要素壁垒:"整机和供应链12-18个月(一个新品研发就这么长);客户渠道6个月起步,大客户更长;数据体系在整机之上再加6-12个月;而对第一梯队有好工程师团队的公司,算法的传播周期是2-3个月——现在都讲开源,论文都有。"主持人接得准:"它投入大但壁垒小。""对,创新上投入非常大,但防止被抄袭的壁垒很小。"
  • 那创业公司只要follow大厂就好?他不接受这个引申:"要学会用更聪明、更有ROI的方式做创新。我们的价值观叫务实创新——不是不创新,前面先要务实。理想主义是对的,我也是理想主义的人,但理想主义不能变成空想,实现的基础是每天都要算ROI:一件事对长期战略的价值贡献加短期收益贡献,就是总体return。"

44. 技术vision:像培训一个员工一样培训机器人

  • 被主持人逼问"听起来都很现实,你的技术vision是什么",他给出每次融资PPT第一页的那句话:"让培训机器人像培训一个员工一样——通过几次示范、再通过几次自我演练,机器人就可以在那个场景里稳定自主地完成任务。"
  • 支撑这个体验的产品组合是三件套:"基础模型+后训练工具+整机",让客户用机器人员工像用人类员工一样。而"星海图带来的不同"他答得克制:已服务150多个全球开发者客户在用整机、数据与模型产品;"今年往后,希望产品进入真正的使用者、进入生产力场景,提升生产力、带来幸福感。"

45. 机器人不浪漫,公司最接近的动物是狼

  • 回到开场命题,他的回答是结构性的:"很有可能是机器人这件事本身就不浪漫。链条非常长、周期很长——做大语言模型或AI应用,不用操心供应链、不用操心数据、不用跟线下客户打交道,安心做模型加社媒病毒传播就好,天然有浪漫的可能性;我们天然的就要去土里边做很多东西,没法浪漫,就要务实。这个行业不允许这样的人存在,如果有,可能会有很大的suffer。这件事会把人塑造到不一样的状态——既要有理想主义,又要每天很务实地算收益和付出、平衡好很多方关系的状态。"
  • 动物类比他挣扎了一下才落在狼:"可能是狼,但又不准确——现在具身智能前面的这些公司都非常狼性,没有哪个公司不狼性。"狼性时刻:G0 Plus发布前,赵航带的智能团队加整机团队配合,"连续工作了大概一个月,周末不休息。这种一定要达成目标的韧劲,我是很感动的,也很自豪"。

46. 画饼、百亿估值与组织的真问题

  • 怎么识别机器人公司在画饼?"无法在一个瞬间识别,要拿他一两年前说的、这一年做的、一年后做到的去对比。"你们画饼吗?答得坦荡:"必要的画饼肯定是要做的——这个世界是靠相信去驱动的,员工、投资人、供应商、客户相信我们能做到。如果把描述未来定义成画饼,那我们天天画饼;但我们要非常非常努力地把每一个对未来的描述都变成现实,那就不是那个意义上的画饼。"
  • 本轮融资已close:天琪主导("他融资能力比我强多了,我现在主要是画皮"),过程有波折——"跟华哲的这些问题肯定造成一些理解不理解,需要解释,但客观结果非常好":吉利、北汽等产业方,大PE与crossover(口称"正新股、金鼎"等),六家老股东pro rata,三到四家super(凯辉、基石资本、香河等)。估值100亿人民币,较2024年1月约3亿涨约30倍。组织问题他归因精确:"不是因为估值上涨,是组织本身变复杂变庞大了——除非创始人因估值自我膨胀,那会引发很本质的问题,我们没有,今天比两年前清醒得多。"团队从十几人到200多人扩大约20倍,"每三到五个月做局部调整";两个真挑战:已有同学(包括我)能不能跟上难度和scope的急速扩张、能不能及时引进更牛的人;以及整机供应链(流程纪律)与智能(人才密度、创新)两个domain天然的组织张力——"不敢说调和得很好;华哲离职跟这个关系倒不大,我们智能团队今天很强很好。"方法论:"对人正直诚信,精益经营,该省的省该花的花。"他还说账上有二十亿、几十亿资金,需要花好、管好。

47. 向同行学习:宇树的供应链、PI的智能、智源的经营

  • 点名三家:"一直学习宇树做整机和供应链——深入垂直整合,自己设计齿轮、壳体、电磁仿真、电机;PI(Physical Intelligence)是整个行业在智能领域的领头羊,毫无疑问,人才密度资金密度保证他们能持续做,但我觉得我们比他做得更有效率;智源我不评论存在争议的做法,我看到一个成熟管理团队的经营动作——连知识产权都做得特别好,组织好、实事求是、调整快,我比较respect初然,很早跟邓总聊过一次,那时就是很成熟的企业家状态。"
  • 创业老师?"还真没有一个——能学的我就学,没那个运气遇到一个能教方方面面的老师。"

48. 快问快答:期待的正反馈还没来

  • 最大的正反馈?"我期待的那个正反馈还没有来临"——指出货量。"融资对我没啥正反馈,每次融资成功我感受到的都是肩上的责任:二十亿、几十亿在账上要花好管好,同学要有好前程,客户给的机会不能辜负。"负反馈也没多少:"我很早就形成了一种状态,不特别在意别人对我的评价——假设我内心认为我们是正确的、实事求是的,大家不理解、不认可、甚至瞧不上,我都OK。so far没有因为负反馈动摇过。"产品被骂怎么办?"第一时间去客户现场,我是第一责任人,通过一个问题解决一类问题,身先士卒给团队做表率,也要求我的合伙人们这样做。"
  • 收尾的杂拌保留几味:人生bet——"创业做具身智能就是我人生的bet,我这一辈子就干这件事;当下最重要的事是生产力场景做出万台出货量";推荐吕思勉讲三国的书——"真实的历史有它的逻辑性,没有哪个人是草包,也没有绝对意义上的理想主义英雄,都是在现实中挣扎、取舍、步步为营;好在今天不是你死我活,每个公司都可以很好";印象最深的播客是李一帆那期——"看到今天这么成功的公司早期也是一点一点做过来的";行业内部人才知道的秘密:"视频呈现出的机器人状态比现实当中要好得多,大家要给它更多耐心,但这件事会发生。"
张小珺

就是讲曾国藩从二十多岁时一个儒家清流,怎么到四十岁变成一个特别有事功的人?杨志林也是你们同学,他是一个什么样的人?

高继扬

高不可攀的大神,真的。他一直都很厉害。

张小珺

你是当时引入的一条鲶鱼吗?

高继扬

我应该算是吧。我从 Momenta 出来创业,放弃了所有的期权。

张小珺

是多少?

高继扬

按照当时那个时间点,一千万美元可能是有的。

张小珺

最近许华哲要离职。

高继扬

是的。

张小珺

因为华哲主要是做算法,这是不是意味着现阶段对于机器人公司来说,算法创新并不重要?你刚才也提到,在 Momenta,少卿离开之后对曹旭东的影响,你觉得华哲离开星尘智能对你的影响,这两者是一样的吗?

为什么中国具身智能产业里没有出现一个像梁文锋、杨植麟这样带着浓重技术浪漫主义色彩的人?这让我有时候有点失落。直到我认识了高继扬,他似乎是这种极致浪漫主义的反面,代表了一种极致的效率、工程拆解与实用主义。

这次访谈录制的时候,正好是星海图的一位联合创始人许华哲即将离职。这也许是某种信号。高继扬告诉我,做机器人行业就是一个链条极长的行业,有时候你就是要把你的头伸到土里去。

高继扬,你的实际年龄好像比你看起来要年轻很多。我一直默认你是 80 后,直到我们见面之前看你的资料,才发现你是 92 年的。你是经历了什么同龄人没有经历过的事情吗?

高继扬

你说的实际年龄,是指看上去比实际生理年龄要老一些吗?

张小珺

对,看上去比实际生理年龄要老一些。

高继扬

我觉得这可能也跟创业有关系。创业确实需要一个人更早进入到一个成熟的状态,而且是各个方面的成熟。每天可能会跟不同类型的人打交道,需要这个人整体来说处在一个比较合适的状态。

我觉得可能跟创业有关系,再加上我的面相也偏老一些。

张小珺

1. 工程师成长从勤奋开始

你是一个什么样的小孩?从小你是怎么长大的?

高继扬

小时候我觉得比较正常。小学的时候学习成绩还可以,可能在前五名,但也不是最好的。我们小学也不是那种特别好的小学,就是正常、比较好的小学,在石家庄。

我小时候正常上学,也学过一段时间奥赛,数学奥林匹克。但其实学得也不是特别好,所以我的小学过得比较轻松,后来也就不学那些了,正常上课。

到了六年级,突然发现还是得考虑初中的问题。当时父母也开始关注这件事,所以那段时间努力了一阵子。尤其是六年级那个暑假,应该是我第一次用功。

张小珺

六年级的暑假不是已经毕业了吗?

高继扬

对,因为我要准备初一的分班考试,想上重点班,而不是普通班。我觉得那是我考试生涯中第一次考得还不错,当时考了年级第三名。

后来初一、初二又比较正常、比较普通,成绩也还行,大概是年级几十名。到了初三又开始好好学习。

张小珺

你在石家庄哪个学校?

高继扬

初中是 27 中,小学是裕东小学。高中是石家庄二中,省理科实验班。正是因为考上这个班,后面才有机会学竞赛。我学的是物理竞赛。

张小珺

你是高中才开始参加竞赛的?

高继扬

对,高中开始学物理竞赛。我也尝试学了一下其他几门,发现物理竞赛相对更容易学明白一些,所以高一、高二就在学物理竞赛。

正常的文化课可以少上一些。我后来没有参加高考,而是通过物理竞赛保送上了清华。

张小珺

你的竞赛能力很强,是有天赋吗?

高继扬

我觉得不是。我见过真正有天赋的人,跟真正有天赋的人比,我主要还是靠勤奋、靠努力。

我也不笨,但有时候解题时,有些同学能够想到某个解法,我可能就想不到。我的办法就是从那时候开始练习归纳总结,把不同的题型映射到什么考点,开始进行归纳,靠勤奋。

最后我觉得自己运气也不错。物理竞赛如果拿到省一等奖,就有保送资格,但还要参加保送生考试。保送生考试还要把数学、英语、语文这些科目全部考一遍。

我比较幸运,正好进了省队。进省队之后参加全国赛,成绩也不是特别好,不是全国一等奖,正好是全国二等奖。

那一年清华允许全国二等奖调专业,所以当时我们在厦门。那是 2010 年 11 月,考了两三天。考试最后一天,我现在还记得清华招生的老师。大家住在同一个宾馆里,他直接给宾馆房间打电话,通知哪个房间里的谁谁谁去哪个房间。

当时我被通知到了,过去之后,大概有几十个人在那里排队。排队是去问你两个问题:现在有这个机会,要不要上清华?如果要上清华,先选一个专业。

我当时就选了电子工程系。

张小珺

为什么当时选这个专业?你对它有什么认知吗?

高继扬

当时觉得做芯片是一个有前途的事情,所以去了电子系。电子系是做芯片、做集成电路的,我就往这个方向走。

其实当时没有特别深入地思考,只是知道这个方向应该有前途,方向没问题。电子系也是清华很好的系,清华第一大系,对人的要求也更高一些。电子系、计算机系都很不错。

张小珺

你当时属于很勤奋的人吗?你是有多勤奋,显著比其他人更勤奋吗?

高继扬

当我发现自己需要勤奋的时候,我是非常勤奋的。但当不需要的时候,我也不是很勤奋。

张小珺

所以我感觉你的人生好像是一段一段的:你意识到某个时间段对你很重要,就会突击一下;意识到这一段轻松一点也没事,就会放松。

高继扬

至少上大学之前是这样的。上大学之后也有过这种情况,但大学毕业之后,我觉得自己变了一个状态,一直保持比较勤奋的状态。

张小珺

为什么?

高继扬

目标感更强了。

刚上大学就开始想未来要做什么。我忘了是大二还是大三,反正想好了以后还是要创业。

张小珺

那时候就确定要创业了?

高继扬

对,那时候就想好了要创业。

张小珺

那时候怎么看当时的创业环境?你有试水过什么东西吗?

高继扬

没有。当时参加过一些学校里的科创比赛,比如挑战杯之类的。就是有一个好的想法,然后把它实现出来,属于科创类竞赛,但没有做事实上创业的动作。

我上大学是 2011 年到 2015 年。那时候最火的是移动互联网。2015 年左右是外卖,之前可能是校内网,中间有打车,后来到 2016、2017 年是共享单车。

当时也觉得这些事情很厉害,但感觉跟我没什么关系。

张小珺

为什么跟你没关系?

高继扬

我太年轻了,什么都不懂,也什么都不会。当时做这些事情的人,都是二十多岁、三十来岁的人,是那一波创业者的主力。

那时候最红的 90 后创业者是戴威,已经是 2016、2017 年了。更早一些,我读本科的时候,主要是王兴、程维这些人。我就觉得,这应该不是我的机会。

张小珺

你觉得不一样在哪里?

高继扬

我觉得一代人肯定有一代人的机会。别人之前积累过、学过很多东西,也做过很多事情,所以机会出现的时候,轮到他了。

但那时候我只是一个大学生,什么都不懂,什么也不会。就算想干,也没法干,也不可能赢,不可能抓住那个机会。

所以当时就开始想,创业到底做什么。

大四的时候,其实大三选专业时,我选了微纳电子,还是秉承着想做集成电路的初心。选完之后发现,天天学很多物理、材料、固体物理之类的东西,感觉学得不是很带劲儿,而且死记硬背的东西特别多。

同时我也觉得,那时候拿芯片创业还看不到路径。那一波国产替代还没有起来,所以拿芯片创业看不到路径。

张小珺

但那时候你还是想创业的?

高继扬

对,还是想创业。

2. 失败促成AI转向

也很巧,大四那会儿正好有一个机会。当时汤晓鸥老师在学校有一个小范围交流,我有机会去跟汤老师交流了一下。

那是我第一次真正认识深度学习。之前只是听说过 deep learning,但那是我第一次好好认识这个概念。汤老师人特别好,给了我一个实习机会。

那时候我什么也不会,从来没有接触过神经网络。大四应该是 2014 年年底、2015 年年初,我去商汤开始实习,训练第一个神经网络,算是开始接触 AI。

张小珺

当时吸引你的是什么?既然你都没有接触过,为什么汤老师一说你就去了?

高继扬

这之前还有一件事。大三暑假的时候,我有机会参加斯坦福的一个暑期实习项目,叫 UGVR。我去那里实习,但当时做的还不是 AI 方向,做了一些图像、医疗之类的东西,比较杂。

做完之后,不知道为什么,那位老师没有给我写强推荐信。结果我想申请的学校,凡是他给我写推荐信的,基本都没有录取。最后反而是几个我没有让他写推荐信的学校给了我 offer,包括 USC、UCSD,还有一两个学校。

那段时间算是一个小打击、一个低谷期。我开始反思自己到底哪里做错了,也看了很多书。我一直比较喜欢看书,尤其喜欢看历史。

那段时间看了很多东西,但现在还记得的是曾国藩。书里讲曾国藩二十多岁时是一个儒家清流,怎么到四十岁变成一个特别有事功的人。他特别会在现实世界中带领一个大的团队,而且当时面临的困难也很多。

他一个汉人在清朝末年抵抗太平天国,建立军队。一个文人出身的人,怎么去训练军队?他怎么从一个儒家清流变成这样一个人?

书里对他的描述是,他有一次顿悟,发现最重要的是:当你要做一件事情时,到底能够调动多少资源,有多少人愿意跟你一起做,并且最后把事情做成。他发现这是最重要的。

张小珺

你当时是申请学校不如意,为什么会去看怎么管理、怎么调度军队?

高继扬

我从小就有一个习惯。遇到一些不顺利的事情,我就会反思。但反思需要思考的来源和养料,所以我会看书,看传记、看历史,乱七八糟地看,通过别人在困难中的经历,给自己找一点灵感。

那时候正好看到曾国藩,就发现这件事值得参考。他发现儒家清流这条路走不下去之后,还是能够建立另外一条轨迹,真正到现实世界里去做事、拿到结果。这件事很重要。

我觉得这跟我的想法其实是一样的。我本来就想创业,只不过可能在学校这条路上,确实去不了最好的学校。相当于儒家清流做不了了,那我能干什么?

我就觉得要从底层思考,我未来到底要做什么,以及我要为这件事做什么准备。所以当时系统性地看各种各样的方向。后来遇到汤老师给我这个机会,我觉得这件事应该是有前途的,就去尝试了一下。

一去训练神经网络,我就发现这件事太有魔力了。计算机可以从数据当中自己提炼规律。我们编程序,很多时候是人先提炼规律,再把规律写成一些规则语句,比如 if-else。现在不用人了,机器学习、神经网络自己从数据里提炼规律,把这些规律里的 if-else 变成神经网络里的参数,整个过程都是自动的。

我觉得这件事太强、太牛了,我得做这个。我当时还觉得,人未来可能不太会再用编程了。

我现在还记得那个场景。有一天我从实习的地方出来,那里是清华科技园的创业大厦。我骑着自行车,想起训练完神经网络的感受,突然想到:以后神经网络可以代替人在数据当中发现规律,这件事太牛了,我以后就做这个。

所以那时候我就想好了,一定要做 AI。

我到现在都特别感谢商汤的这种文化。它给了一个从来没有接触过、在学校里也没接触过这些东西的人一个机会,让你去学习。

张小珺

你在商汤多久?

高继扬

小半年,四五个月。

张小珺

汤老师同时给了几个人这样的机会?

高继扬

当时汤老师大概跟十几个人说过,比较开放,想来都可以来。我比较主动,就去了。

当时我是跟着李成、鲁书去做的。我记得做的是 pose estimation,预测人的肩膀、胳膊肘这些关节点。

后来回头看,这份工作本身我没有做出什么成果,但它是我开始做 AI 的起点。

张小珺

复盘你从小到大的成长轨迹,第一个重要节点是六年级到初中的时候。你第一次发现自己可能在考试上有天赋,因为通过很短的时间拿到了年级前三的结果。

第二个重要节点,是大学申请博士学校不够理想,让你觉得学术这条路可能不适合自己,转向一条更现实的路。是这样吗?

高继扬

我觉得上清华也很重要。当时保送上清华,对我来说是一个很重要的事情。

我高中时从来没想过自己能上清华,从来没想过。它根本不是一个目标,因为我觉得自己很难上。高考肯定不可能,我的语文和英语都不太好。

张小珺

有多不好?

高继扬

做不好。

我记得有一次考试,语文有一卷、二卷。一卷是阅读理解之类的,二卷是作文。一卷、二卷加起来,可能跟别人考得比较好的一卷分数差不多。

满分 150 分,我两个加起来一百来分,别人一卷可能就 90 多分。

所以物理竞赛对我很重要。我当时想,如果物理竞赛考不上、上不了清华,那就参加高考,能上个四川大学、厦门大学,我都已经很开心了。

所以我觉得上清华挺重要的。虽然没有这个目标,但我确实很勤奋。别人刷一遍题,我刷两遍;别人刷两遍,我刷四遍。然后总结归纳。

我过去应付考试的主要方法论就是归纳、总结和勤奋。

上大学之后那次小打击,让我有机会从更底层去想:我应该怎么选方向,怎么推进想做的事情,应该把什么当成目标,而不是把一些表面的东西当成目标。

张小珺

当时在清华,杨志林是不是你们同学?他是一个什么样的人?

高继扬

他是高不可攀的大神,真的。他一直都很厉害,应该也是接近特等奖的水平。

我觉得清华里边也很普通,电子系的大神很多。我大概是年级前 30% 到 40% 的成绩,谈不上 top。

志林本科的时候就已经做出了特别棒的工作。

张小珺

他的厉害来自什么?是天赋吗?

高继扬

我觉得是天才。上了清华之后,更让我见识到什么叫真正的天赋。

学物理竞赛时已经见识过了。我们学校有几个人最后拿了全国一等奖,我觉得那真的是天赋,人家做一遍就会了,我反正就搞不明白。

上了清华之后更是这样。我们那一届、我们系、我们班有一个“韩神”,可能叫韩衍隽。他更神。我看他写的作业,想学习一下,很多时候都看不太懂,得换一个人的作业来参考。

我当时确实感觉到,清华里边大神太多了。所以在清华里学到的一点就是要谦虚、低调。天外有天,人外有人。

像志林、韩衍隽,都是我觉得那一届最杰出的学生。

张小珺

志林跟你是一届吗?

高继扬

是一届。

张小珺

你大二头发白了是为什么?

高继扬

这个也不知道。可能当时我比较喜欢搞科创,参加挑战杯,学校里拿了一个一等奖。弄完挑战杯之后,有一天我发现这里有几根白头发。

我也没管,后来就越来越多了。很多人觉得我是不是染的,其实不是,自然白的。

张小珺

你后来就没有管过?

高继扬

没管。

张小珺

我发现杨志林跟你的轨迹有过交错。你在商汤实习的时候,严骏杰当时在吗?

高继扬

我跟他不是很熟。当时我的直接 mentor 是鲁书,后来认识了曹旭东,这也是后来我去问他的原因之一。

张小珺

他们当时在商汤是什么状态?

高继扬

旭东当时应该已经是核心技术 leader 之一,主要做人脸这一块。

我只是一个小实习生,跟他没有特别多直接交流,但能感觉到当时那一拨人都很强。他们不仅在学术上有自己的造诣,在工程和产品化上也很强,带团队、组织管理也很强,不是纯学术型的人。

我当时就有这个认知,所以后来回国时选择了他。

张小珺

后来回美国,你做自动驾驶,曹旭东也做自动驾驶,所以你们更熟了?

高继扬

对,后来我去了美国,他做自动驾驶,我在 Waymo 也做自动驾驶,有了更多共同语言。

张小珺

你博士为什么选择计算机视觉这个方向?

高继扬

在商汤实习时就做计算机视觉。当时我想好了,如果去 USC,就做这个方向。如果找不到合适的实验室或者老师带我,我就不读了。

很幸运,到那边之前我开始联系学长。当时联系了孙晨、陈哥,他是清华七子班的,现在在布朗大学做教授。后来通过他进了实验室,开始做这件事。

张小珺

你为什么三年半毕业?

高继扬

还是归纳总结。

首先我给自己定了一个目标。既然我已经想好未来要创业、要进入产业界,那读博士只是一个阶段,是为了完成某些训练。训练完成得越快越好,所以我想能不能四年毕业。

美国正常读博士可能五年,甚至六年。我给自己定了四年毕业的目标。但四年毕业又不想水水地毕业,老师也不会让你水水地毕业,所以要在四年内做到一个还不错的水平。

当时我算了一下,大概需要四到五篇顶会论文。我们领域的顶会是 CVPR、ICCV 这样的会议。要四年发四到五篇顶会,就得排时间表。第一年就要开始做,博士一年级结束时要投出去。CVPR 每年年底截稿,所以要提前安排。

我先选好方向,然后按照这个 schedule 去发论文。后来发现我的 idea 可能比自己实际能干活的带宽多,所以尝试跟实验室其他同学一起发。我会把一些 idea 分享出来,大家共同做。不是说大家一起干所有活,而是我会提出一些 idea,让大家把没有充分发挥的时间发挥出来。这样大家都好。

到第三年的时候,我发现已经攒得差不多了。正好有几个师兄要毕业,我就跟老板一起提了毕业的事情。我们老板是一个 70 多岁的印度老头,特别好、特别 nice。他知道我的志向,也知道我在实验室里做得还行,给他做了一些贡献,所以很 nice 地同意了我 2018 年年底毕业的请求。

张小珺

一般发不发顶会是高度不确定的事情,很难控制。你怎么提高确定性?

高继扬

发论文这件事,我觉得也是有规律可循的。

发顶会论文基本上有三种套路。第一种是最厉害的人做的“挖坑型”工作:以前没人研究这个问题,我做一个数据集,提出一个问题,建立一个 benchmark。这种很难做。

第二种是已经有一个问题,我在这个问题上把性能做得比前人好,提升性能。

第三种是在性能接近的情况下,我的成本更低,或者使用的监督、数据比别人少。

几乎所有论文都可以套到这三类里。我就在这三类里面做选择,有的做第一类,有的做第二类,有的做第三类。

第二个方法就是多发。别人一届投一篇,我投两篇,提高概率。

张小珺

你博士毕业的时候,想清楚了什么?没有想清楚什么?

高继扬

3. 他选择物理世界AI

博士毕业时找工作,我是通过找工作来了解行业。因为很早就想好要做产业,但我感觉 AI 本身还是一个偏技术的东西,它不是一个真正的产业。产业还是围绕需求的。

所以我通过面试去学习、了解不同的行业。当时看了自动驾驶、广告,也看了 AI 加广告、云,还有所谓的泛 AI。商汤也属于泛 AI。

看完之后,我给自己定了几个筛选行业的标准:这个行业一定要以 AI 作为最底层的变量。没有 AI,这个行业就不成立;有了 AI,这个行业才成立。同时行业本身要足够大。

最后我觉得,未来应该去做物理世界的 AI。自动驾驶是物理世界 AI 的第一个形态,也是当时不多的已经形成产业的方向,所以就想好做自动驾驶。

张小珺

商汤被你 pass 的原因是什么?你有想过回国加入商汤吗?

高继扬

我觉得商汤这种 AI 加行业的模式,在商业上可能会有一些问题。当时理解得也不深,就是觉得会不会变成外包。

我觉得它很难形成自己的产品。没有产品,在交付侧每一次的成本都很高,因为是工程师去交付。我就觉得这可能有问题。

张小珺

广告被 pass 的原因呢?

高继扬

广告被 pass 是因为没有 Google 这样的公司。

Google 里面有 Google Research,也有搜索、广告和 AI 的结合。我觉得搜索、广告有 AI 当然更好,但没有 AI,这些事情也成立。在 AI、神经网络出现之前,可能有别的机器学习技术;在机器学习出现之前,也可能有其他技术解决搜索和广告问题。

这意味着 AI 不是这个行业的绝对变量。我还是想找一个绝对变量,只有这样才是进入一个崭新的世界。在这个崭新的世界里,年轻人可能才有更多成长机会。

张小珺

神经网络对于广告来说可能只是优化。

高继扬

对,所以 pass。

云也 pass。当时是把一些模型包装成 API 去做,我觉得这也不是本质。

张小珺

当时只剩自动驾驶。

高继扬

对。然后我又把自动驾驶延展了一下,觉得这是物理世界 AI,也就是 AI 加机器人。

张小珺

你当时真的这么想吗?AI 加机器人?

高继扬

真的这么想。我觉得这件事特别牛。

张小珺

你为什么不去做机器人?当时也有很多研究方向和公司。

高继扬

没错,也有这些公司。但我读博士时接触过传统机器人相关的方向。我觉得传统机器人还是控制、优化、SLAM 这些技术。

这些技术很难从底层让机器人像人一样工作,因为它跟人的工作方法不一样。传统机器人更偏机器,而不是更偏人。

你想让它变成人,还是得用 AI 的方法。虽然那时候 AI、神经网络还没有今天这么好,但我觉得这是一个大方向。

我又回到 AI 的魔力:它能够代替人总结规律。我发现 AI 做这件事做得很好,所以我觉得它有机会真正解决这个问题。

AI 加机器人也是从底层变革人类生产力的超大型行业,值得投身。

张小珺

你的第一站选择了 Waymo。

在聊第一段工作之前,你能不能从你的视角复盘一下过去十年自动驾驶产业的变革?

高继扬

4. 机器人与AI分歧

我加入 Waymo 开始做自动驾驶之前,自动驾驶其实已经发展十年了,从 2008、2009 年的 DARPA Challenge 开始。

所以在那个时间点,我回头把当年的论文大部分都看了一遍。去了 Waymo 之后,我最喜欢做的事情是读 Waymo 的 codebase,把历史代码也都看了一遍。

你可以看到一个很明确的点:2018 年那会儿整体自动驾驶的技术架构,和 2008 年的技术架构其实没区别。

2008 年的论文已经把事情讲清楚了:感知、定位,离线做好地图,然后感知、定位之后在地图里做规划和控制。感知做得好一些,规划控制就可以做出更好的避让和判断。规划控制里先是决策,再是规划,然后是控制。大的 pipeline,2008 年就是这个样子。

后来随着 AI 技术成熟,尤其是计算机视觉领域成熟,很多感知模块被 AI 算法替代。最早的激光雷达是 clustering,也就是聚类:发现有一堆点云,就把它聚到一块儿,通过这种方式判断这里有没有障碍物。

后来逐渐变成用神经网络做推理。整体来看,2018 年和 2008 年的技术架构没有区别,但这一套架构的底层逻辑不是 AI,而是 robotics。

我的观察和认知不一定对:它是做系统拆分,然后关注 corner case。正因为关注 corner case,所以要把系统分成一个个可解释的模块,在可解释的模块里解决这些 case。

AI 的方法论不是这样。AI 方法论追求数据驱动和端到端。AI 不太擅长解决一两个具体的 case,但特别擅长从整体上提升 benchmark 的性能。比如之前是 80,我一波优化做到 90,再一波优化做到 95。90 到 95 之间肯定有很多 case 变好了,但也不排除部分 case 变差。

所以当时我看到的 robotics-driven 技术架构,是感知、规划控制、定位、离线建图,整个系统拆成模块。但 AI 的底层逻辑不是这个,AI 的底层逻辑是端到端。

与此同时,2018、2019、2020 年左右,特斯拉开始用 AI 的方式推动端到端。最早做端到端,是先把感知统一起来,一个模型解决所有感知问题。

同期 Waymo 怎么做?感知里可能有几十个模型。detection 可能有一两个,detection 完了做 tracking,tracking 里有一些小的 classifier 做类别判断,形成 track 之后再做 classification。每一类 classification,比如 pedestrian、vehicle,都有自己的 classifier。做完之后,在 scene level,也就是 scene understanding 层面,再做一些分类器。

整个感知就有几十个模型,然后再做规划。规划当时还是传统算法,但也在逐渐替换。这种方法论跟 AI 不一样,AI 方法论还是尽可能追求端到端。

我进 Waymo、学习这段历史时发现,Waymo 过去很长时间都是 robotics 的人主导,所以形成了这样一套东西。特斯拉做这件事时,马斯克相信数据驱动和 AI,所以他们完全以 AI-native 的方式设计自动驾驶框架。

张小珺

这里面的人也不一样,对吧?

高继扬

人也不一样。我觉得至少在 leader 层面不一样。

工程师层面,Waymo 当时的人才密度非常高,不缺有判断力和技术能力的工程师,都是很好的工程师。但我觉得自上而下的一些东西缺失了。

如果回顾过去这段时间,我觉得从 2008 年到 2016、2017、2018 年,都是 robotics 主导,模块拆分。AI 兴起之后,先是做模块内部的算法替代,在 robotics 框架里把小模块替换成 AI。

但从 2017、2018、2019 年开始,出现了另一条路线:AI-native 地重新设计整个框架。演化到今天,就是 BEV、端到端、VLA 这一套。到今天,这套已经成为主流。

张小珺

所以你 2018 年进入 Waymo 后,就意识到它是错的吗?

高继扬

那时候不敢说它是错的,只是觉得不太对。

张小珺

你的直观感觉是什么?

高继扬

我对 Waymo 的感受有两个小问题。首先 Waymo 大部分地方还是很好的,我们只说问题。

第一个小问题是,Waymo 太有大公司病了。它本身还没有做出价值,仍然应该是创业状态,但人已经很多了。我当时去的时候有一千人,离开时可能快两千人了。

我刚开始跟的 leader 手下可能十几个人,走的时候感知团队已经七八十人了,在很快扩充。为什么扩充?因为那时候想开始用 AI 的方法系统性改变感知,之前还有很多 rule-based 的东西。

Waymo 也不缺钱,所以我感觉它过早进入了一个大公司的状态。所有东西都跟 Google 对齐:职级体系对齐,工程体系对齐,文化也很像。

我觉得那时候的硅谷还是比较 peace and love,大家民主、平等。现在可能已经不是那个状态了,现在大家都进入 founder mode,比较卷。

张小珺

你们当时早起还是晚起?

高继扬

我很勤奋,一般是自动加班。但如果没人管,正常也有人四五点下班去接孩子,有人六七点走。

我一般都会留下来,因为觉得要好好干、好好学。正常工作做完之后,我就开始看 Google 里的 doc、代码和 codebase。

张小珺

这是你意识到的第一个问题,大公司病。第二个呢?

高继扬

我觉得大公司病背后只是表象,不是本质。本质是 Waymo 没有 founder。

它的 founder 其实是 Google 的 founder,但 Google 的 founder 没有时间直接管这件事,所以组织里自上而下的力量是缺失的。

不像特斯拉,马斯克说干什么,哪怕是错的,也能马上开始干。在这种行业创业,错不怕,错了可以快速迭代、快速调整。怕的是力量不集中、不统一,我觉得这很危险。

张小珺

假设 Waymo 有一个更强势的 founder,2018 年那个时间点,他应该做什么?

高继扬

我觉得应该系统性地改变整个架构,另起一个 team,从头做一套 AI-native 的架构,用一套 infra、一套评测体系,重新设计整个系统。

张小珺

但它从第一天就跟特斯拉是两类公司。一个像是做技术大脑的公司,另一个是有肢体、有车、能让很多车在路上跑的公司。两者基因如此不同,Waymo 在那个时刻能做什么调整?它也不能马上变成车企。

高继扬

倒不是说变成车企,而是在做自动驾驶系统这件事上,我们用什么方法论、什么底层逻辑去指导系统设计:是 robotics-driven,还是 AI-native?

这跟是不是车企、是不是自动驾驶企业没有关系。事实上,很多国内只做大脑的自动驾驶公司,也可以用特斯拉的方式,坚定地走 data-driven,把 rule-based 的东西越做越少。

张小珺

那现在 Waymo 完成转变了吗?

高继扬

现在肯定比以前好得多,但具体情况我也不是很清楚。这个转换过程比较慢。

我觉得 Waymo 本来可以做得更快,但今天 Waymo 的结果又很好,所以我也很佩服。为什么?我觉得是因为它对于长期战略一旦选择之后,执行非常坚定。里面还是有对的人,只是调整速度慢了一些,但确实在调整。

张小珺

你怎么看 Waymo 的商业模式?

高继扬

自动驾驶这个概念下,大概有几种商业模式。

第一种是 Waymo 代表的 robotaxi。自己运营车队,用自动驾驶技术运营车队,通过提供服务赚每一单的费用。

第二种是车企。卖车,把自动驾驶作为软件订阅向用户收费。

第三种是 Momenta 这样的供应商,以 NRE 加 license 的方式,向车企提供自动驾驶解决方案。

我觉得还有第四种,华为可能算是第四种,介于车企和供应商之间。本质上还是在车企层面,赚整车的利润。它通过更好的自动驾驶体验和顶级座舱体验重新定义汽车,再加上自己的品牌和渠道影响力,所以营收和利润建立在整车层面。

张小珺

你觉得 Waymo 的商业模式能走通吗?

高继扬

我觉得商业模式本身没问题,只是在走通的过程中,需要克服的困难和阻力很多,周期非常长。

直到今天,我觉得已经看到走通的曙光了。

张小珺

Waymo 和特斯拉现在有胜负手吗?一个更像科学驱动,另一个更像工程驱动,一天有很多车在路上跑,收集很多数据。今天能说哪一条路线正确,哪一条错误吗?

高继扬

首先我觉得 Waymo 不算科学驱动,Waymo 的工程基因非常强。Waymo 的工程化基因和 Tesla 一样强,因为它的工程基因来自 Google。我自己的工程师训练,也是 Google、Waymo 这个体系完成的。

我不觉得 Waymo 是一家科学公司,Waymo 非常工程化。它们两个的区别,主要还是在对待 AI 的态度上,以及面向 AI 驱动的整体系统设计,调整速度和力度不一样。

张小珺

你能预判一下 Waymo 的未来吗?

高继扬

去年 11 月我回了一趟美国,特意去了洛杉矶,因为 Waymo 在洛杉矶开通了服务。我去体验了一下,感觉特别好,已经做到了比大部分 Uber 好得多的体验。

所以我觉得它的商业模式已经接近走通的边缘了。

张小珺

它是 AI 时代的 Uber。

高继扬

应该是的。它运营范围很广,从洛杉矶 Downtown 到好莱坞,再到 Santa Monica,一大片区域都在运营。

张小珺

你在 Waymo 期间主要做了哪些工作?学到了什么?

高继扬

我主要做预测和感知。

先做的是预测。传统自动驾驶的预测,是预测周围的行人和车辆下一步会做什么。我得预判它要干什么,才能决定我自己要干什么。本质上也是一个交互和博弈过程。

刚进 Waymo 时,leader 说有这么一个机会,我觉得挺好,就开始做。我们尝试用 AI 的方式做预测。

之前也有人尝试用 AI 做预测,但方法不太对。它先把地图渲染成一张图片,然后用卷积神经网络处理这张图片。问题是卷积神经网络是局部视野,而地图很长,所以对信息的处理不够好。

我们的一个创新是,用图神经网络把地图变成向量来表达,而不是渲染成图片。把地图变成向量之后,放进图神经网络里处理。

当时用的基础算子是 self-attention,参考了 Transformer 里的 self-attention 设计,但没有用那么重的架构,而是做了一个很轻的架构,因为给我们的算力很小。

后来发现效果很好。这项工作是我跟赵航一起做的。

张小珺

你们第一次合作?

高继扬

对,第一次合作。我们一起把这项工作发了出来。

我觉得这对我来说也挺好,因为这份工作我觉得做得还不错,解决了一个之前没有解决的问题。后来也有很多公司使用我们的方法,所以我比较满意。

张小珺

VectorNet。

高继扬

对,VectorNet。

张小珺

赵航回忆这件事时,说让他印象很深的是,你们当时在想怎么设计规划,他传统的思考方式是先把论文读一遍,但你说周末我去看代码库,把代码全部看一遍就知道了。

高继扬

我确实喜欢看代码,而且不只看现在的代码,也喜欢看过去的代码。从过去看到最近,再看到现在,这个过程能看到一个工程体系的迭代,其中是有逻辑的。

我比较喜欢做这些事情。

张小珺

你当时有意识到自己和赵航有什么不同吗?

高继扬

技术上来说,我觉得赵航更愿意从原理层面把事情想清楚,想清楚这件事到底是怎么回事。

我更愿意从问题角度去看,解决这个问题最有效的方法是什么。

如果从创业者角度说,一个可能更多是供给侧思考,一个更多是需求侧思考。我觉得这是一个不一样的地方,也是一种互补。

张小珺

他是一个什么样的人?

高继扬

他很 nice。

张小珺

“很 nice”是一个很好的评价吗?

高继扬

我觉得是很好的评价。

我有时候脾气会比较急,事情不及预期时,会强力 push、推动。但赵航永远特别稳定,情绪非常稳定。他内心也着急,但外在表现比我好。

张小珺

你在 Waymo 的时候也会这样,非常 push 吗?

高继扬

Waymo 有时候轮不到我 push。我那时只是一个小工程师,先管好自己就行。后来逐渐带团队,有了 tech lead。

但 Waymo 的环境不鼓励这种做法,所以我只能在那个框架下做事。

张小珺

你对 Waymo 的工作满意吗?

高继扬

两年我挺满意的。我特别感谢 Waymo 给我这个环境去学习。我觉得 Waymo 让我学到的东西,比我对 Waymo 的贡献要多。

最重要的学习有两个层面。知识层面,我了解了自动驾驶整套系统怎么运作,不仅是端侧,还有云侧,以及整个系统的历史沿革。整个系统在我脑子里有了概念。

技能层面,它让我得到很好的训练,逐渐形成了工程师思维。

张小珺

什么叫工程师思维?

高继扬

工程师思维就是拆解加测量。

把一个复杂问题拆解成若干个不那么复杂的子问题,再继续拆。写代码或者解决软件工程问题,拆到最后就是一行一行代码。测量到最后就是一个个单元测试。

然后再一层层回去,看顶层指标、中间层指标和最底层指标,看整个系统怎么运转起来。

张小珺

这跟物理竞赛一样吗?

高继扬

有一点不一样。物理竞赛更像一个解题游戏,不是系统化的工程。更多是这道题映射到哪个知识点、哪个考点,然后用一套方法去解决。

但物理竞赛、读博士、做工程师,都要求很强的逻辑思维能力。我觉得通过这些事情,训练了我的逻辑思考能力。

张小珺

你是 ENTJ,对吧?

高继扬

应该是,做过一些测试,应该是。

张小珺

你是在什么情况下决定离开 Waymo 的?

高继扬

当时是 2020 年下半年。我 2019 年 1 月加入 Waymo,到 2020 年下半年,觉得自动驾驶系统学得差不多了。

我想做的一些自己比较满意的工作也做了。工程师训练也差不多了,代码写了很多,怎么 review 代码、怎么做整体设计,也都训练过了。当时也开始带一个小团队,做系统设计、带团队拿结果。

所以我觉得在 Waymo 的成长效率逐渐收敛了,需要想下一步。

同时我意识到,我在 Waymo 更多还是做技术、做工程师,离产品太远,离公司怎么经营也太远。我一直想创业,所以得进一步为创业做准备。

我当时想了两件事:第一,继续做自动驾驶,但不做 robotaxi,做量产;第二,回国。

我也确实看好量产这条路线能够更快产生产品价值、给用户创造价值。robotaxi 太慢。

符合条件的国内公司有华为、Momenta,也可以去车企,比如“蔚小理”。

张小珺

但如果你特别想做产品,大部分人可能会渴望做一个 To C 产品。你去 Momenta,意味着做的是 To B 产品。

高继扬

我对产品的定义不是只有 To C 才叫产品。我想做的是能够直接给某些用户创造价值、让用户用起来的东西。在我的定义里,To B 也可以是产品。

我想创造现实世界的实际价值。

张小珺

当时华为和 Momenta 都聊过?

高继扬

对。华为当时跟陈一伦师兄、苏箐老板聊过。Momenta 是跟孙刚、曹旭东聊。

后来还是觉得 Momenta 比较好。

张小珺

为什么?

高继扬

5. Momenta训练塑造方法论

首先我确认 Momenta 应该没有大公司病,驱动力足够强、足够坚定。

我觉得一个组织要成功,可以犯错,但得有一个人站出来说我们错了,然后改。不能没有人站出来说我们错了,得有人纠错。

旭东很懂技术,是 AI 的信仰者,长期目标也非常坚定。整个团队里还有一些我以前在商汤认识的人,比如思博、晋伟,所以聊得比较好,就决定去了。

张小珺

Momenta 是一种什么样的文化?

高继扬

绝对是我很适应、也很喜欢的文化。结果导向、战功文化。

张小珺

它做过什么比较极致的事情?

高继扬

从结果来看,Momenta 2018 年就明确提出要做量产自动驾驶,然后通过量产自动驾驶形成飞轮,走向 robotaxi。

这在 2018 年很有 vision。当时大家都说直接搞 robotaxi,包括 Waymo,国内类似的公司有 Pony.ai、文远知行、百度,都是 Waymo 的故事路径。

但徐东敢提出通过量产走这条路。在那个时间点做这样的判断,很有 vision,也很有魄力,而且一直坚定地做。

Momenta 也经历过很多次组织迭代,从偏科研、偏 research,转向面向产品和交付。在这个过程中把工程体系打磨出来,再把一次成功交付复制到几十次。现在可能已经有一两百个车型交付。

它每一步都在迭代自己。只要能够不停迭代、永不满足,其实都是追求极致的表现。

张小珺

他为什么想走量产这条路,再走到 robotaxi?背后的逻辑是什么?

高继扬

大家都是 AI believer。AI 怎么发展?要 data-driven。

AI 一定需要数据。第一个问题就是数据从哪里来。

如果自己养一个车队,100 台、1,000 台,1,000 台已经很多了,要覆盖一个城市都很困难,更不要说全国那么多城市。但最终自动驾驶要做到哪里都能开、哪里都能跑,首先就要解决怎么获得所有地方的数据。

最自然的方式就是利用现成的量产车,把自动驾驶软件装到量产车上,通过这种方式给客户提供价值。这个价值一开始可能不是完全端到端的自动驾驶,可以是辅助驾驶、泊车,至少让大家用起来。

有了价值,就形成数据和商业价值的循环,数据获取就变成商业驱动的行为。数据有了,AI 算法和能力自然会有。

张小珺

你加入 Momenta 时,它处于什么阶段?

高继扬

刚开始做第一个量产交付。2020 年年底,Momenta 拿下了上汽智己的项目,2021 年要做交付。

我觉得这个时间点特别好,一来就做我想做的量产和交付。

我也很幸运,拿到很多机会,各种事情都做了一遍。

张小珺

当时困难是什么?

高继扬

第一次做量产自动驾驶,而且是向 B 端客户交付,两个第一次叠在一起。

第一个第一次,是把 demo 级的东西变成产品级的东西。第二个第一次,是把产品向一个大客户、B 端客户交付,完成服务。

张小珺

当时内部真实的挑战是什么?从 research 文化变成交付、量产文化,文化会发生很大变化吗?

高继扬

我觉得 Momenta 的文化变化可能更早就开始了。之前也发生过少卿离开、王凡那件事。在我的理解里,那也是旭东改变公司文化的一个动作。

我不能替他说,这是我的理解:他要逐渐把公司从 research lab 变成真正做产品的公司。

在这个过程中组织一定会变化。组织变化在定点项目之前就已经发生了,如果没有发生,可能连定点项目都拿不到。

正式开始做定点交付,是考验真正开始的阶段。组织肯定还没有 ready。组织架构可能不是面向量产设计的,团队成员的能力也没有匹配到那种强度。

所以当时组织调整比较频繁,有主动淘汰,也有被动淘汰,人员流动很大。

但我觉得这些都是好事。不通过打仗这样的形式,没法洗礼和锻炼团队。通过这个过程,Momenta 把组织变强了。

包括我和另外几个很不错的 leader,在那个阶段成长都特别大,逐渐把事情做起来。

张小珺

你是当时引入的一条鲶鱼吗?

高继扬

我应该算是吧。

旭东和孙刚对我的使用比较灵活,我也接受这种灵活的使用。我开始做感知,后来做定位和泊车系统,然后做研发,之后做规划控制。

为什么让我去做规划控制和定位?因为我们想把这两部分从传统 rule-based 变成 deep learning、变成神经网络。

我在 Momenta 做的最后一件事,是 NV 的量产,也就是高速、高架系统的量产。把产品做完,交付给上汽,大概就是我在 Momenta 的过程。

张小珺

你能做到多极致,做一条鲶鱼?

高继扬

面对挑战时,我比较兴奋。当然,任何人面对未知,多少都会有忐忑、胆怯、恐惧,这很正常,我也有。但压倒性的还是:这是我想做的事,我得去干。

在这个过程中,我收获了一个很重要的能力。不是我能解决规划控制问题,或者能解决某个产品问题,而是我可以很快进入一个不熟悉的领域,用一套固定的方法论理解这件事怎么回事。

先拆解,然后把事情和人匹配起来,什么人做什么事。人事匹配也不是第一天就能做好,要在过程中监控、测量,看反馈。反馈好就扩大,反馈不好就收缩、调整。

这套方法是在转战多个模块和产品线的过程中练出来的。

张小珺

你面对挑战时兴奋的来源,压倒性的兴奋来自哪里?

高继扬

如果我能把事情做成,就离我最终想做的事情、最终想达到的目标更近一步。

张小珺

那一刻还是创业?

高继扬

对,创业。

如果连这件事都做不好,创业不可能做得好。创业肯定涉及公司方方面面的事情,不只是研发,还包括各种各样的问题。核心要锻炼出来的是解决问题的能力。

解决问题的能力背后,肯定有底层的思考方式和方法论支撑。所以我得把这些东西打磨好。

我兴奋,是因为这件事本身我感兴趣,也觉得有价值,同时觉得自己可以离真正想做的事情更进一步。

张小珺

你觉得 Momenta 的不足是什么?

高继扬

Momenta 历史上有很多特别好的人才。为什么没有把我留住,为什么我出来创业?

我从 Momenta 出来创业,放弃了所有期权,按照当时那个时间点,可能有一千万美元。

我觉得在顶级人才的保有和持续培养上,Momenta 可以做得更好。

张小珺

它为什么没有把你留住?

高继扬

更多可能是我的问题,因为我想创业。

什么时候创业,其实有很多因素要平衡。但在这个问题上,可能我自己的诉求更多。

2022 年年底,我看到了一些变化。第一是 GPT。当时还没有 ChatGPT,GPT-1、GPT-2 到 GPT-3,InstructGPT 也出来了。我觉得这让世界再一次相信 AI,这很重要。

做 AI 的人相信还不够,还得有更多人相信,资金才会进来。所以我觉得整个社会开始再一次相信 AI,是第一个变化。

第二个变化是自动驾驶量产,让端侧智能逐渐变得可能。无论机器人还是自动驾驶,最终都有核心智能算法模型要跑到端侧,这需要传感器和端侧算力。

机器人用的端侧算力、端侧传感器,跟智能驾驶这套其实大差不差。那时我看到了这一波产业链能不能起来。

机器人躯体的底层工程能力,历史上一直具备,只是需要围绕产品重新设计。再加上特斯拉正式宣布做人形机器人,我觉得这些要素都 ready 了,我得开始做。

张小珺

这是你为什么创业。刚才问的是 Momenta 怎么留住你,那个问题你划过去了。Momenta 怎么才能留住你?

高继扬

我觉得最终是留不住的,无论如何都不行。

张小珺

因为这是你的人生使命?

高继扬

对。

张小珺

那其他人呢?它能留住其他人吗?

高继扬

我觉得这也不全是 Momenta 的问题。自动驾驶行业在那个时间点,包括到今天,都非常卷,比今天做具身智能还卷。

到今天,Momenta 的加班强度可能都比我们厉害。核心算法团队肯定到晚上 12 点,一周 6 天是打底的。

极致地卷。但这不怪旭东,也不怪 Momenta 的管理团队,行业就是这样。他们想赢,要为企业谋求发展,抓住客户机会,不这么拼没有办法。

所以我觉得拼,是为所有人负责的一种选择。

张小珺

所以你在 Momenta 老得比在 Waymo 快?

高继扬

我觉得创业之后可能更快一些。

张小珺

你这两段工作很有意思,一个两年在 Waymo,一个两年在 Momenta,而且是两种极致对立的文化。你能总结一下,分别学到了什么?

高继扬

文化层面,Waymo 真的是工程师的天堂。你可以有最好的 infra、最好的同事,领导对你的支持也非常温暖、宽厚。

目标是有的,但不是强迫式的。待遇也不错,当然当时跟今天 OpenAI 这样的待遇没法比,但也还不错。Google 的园区、食堂,都是这样的一种状态。

Momenta 不能怪它,这就是国情和行业的问题。首先是绝对的结果导向,结果好就往上走,结果不好就调整,所以压力随时存在。

在 Waymo,大概率不用面对客户,因为客户是乘客。如果产品不够好,可以先不推给乘客。

但 Momenta 是 To B,大量一定级别以上的工程师都要直接面对客户,跟客户交流、汇报。国内车企的文化比较 tough,说骂就骂,说不开心就会说两句。

张小珺

你被骂过吗?

高继扬

那是很平常的事情,骂就骂了,我不是很在意。

但客户会给你很强的心理压力,说你做得不好,可能就没有机会了,做不好马上淘汰。如果下次还做成什么样,就把徐东叫来,让徐东解释,这些肯定都有。

所以单纯从工程师自我感受来说,Momenta 以及整个中国汽车行业环境都不是好的。但从成长性来说,中国的行业环境对工程师综合能力的训练更好,它能让你看到这个世界真实的状态。

张小珺

你很喜欢说真实世界、现实世界。

高继扬

因为如果生活在被别人或某些信息包裹起来的环境里,我觉得那不是本质。

我比较喜欢面对真实,哪怕真实很多时候是残酷的,也要面对它。

张小珺

在这个过程中,你觉得曹旭东发生过变化吗?

高继扬

我觉得旭东最强的点一直没变,就是战略能力特别好。

他很早就判断出我们要做这件事,然后一直坚定地推动,过程中有波折也不动摇。这是他带领 Momenta 从这么多自动驾驶企业里脱颖而出的核心能力。

当然,他和我都有一个问题,就是比较 push、比较 aggressive,所以跟他工作压力肯定比较大,也会导致一些同事离开。

后来我发现,他可能会选择性地不把这一面展现给更多人。我说的不是单纯 aggressive,而是把真相、现状直接说出来。有时候用非常直接的方式表达,会让很多人感受到压力,压力大到一定程度就会造成伤害。

张小珺

你是这种风格吗?

高继扬

我有这一面,会把 aggressive 直接表达出来。

张小珺

你对比一下 Momenta 和地平线。

高继扬

这两个公司都太厉害了,我觉得自己没有资格评价。

旭东很早就布局做芯片,今天芯片也马上要出来了,定点也拿得很好。其实这是他三年前的决定,两年多前正式启动、招人,把事情做起来,到今天拿到结果。

如果这个决定晚做一年、晚行动一年,可能就没有今天的结果。所以我觉得两家公司的战略能力都很强,执行能力也很强,面对客户的迭代调整能力也很强。

凯哥可能也是从一个科学家逐渐转向企业家,旭东也从比较偏科学范儿的状态走向企业家。我觉得他们的迭代能力都特别强。

很多时候我是在向他们学习,也确实把他们当作榜样。

张小珺

看起来在 Waymo 和 Momenta 中间,你更相信 Momenta 的量产路线,对后面创业影响很大。

你从想到创业,到做决定并且行动,中间有多久?

高继扬

我行动还是比较立即的。

2022 年年底正好是我 30 岁生日。我是 1992 年年底出生,12 月,射手座。

当时一系列事情交织在一起,我看到了变化,也觉得自己该练的都练得差不多了。同时我在 Momenta 做的事情,到 2023 年三四月份,NV 产品也能量产,所以到了这个节点,我就想好肯定要开始干。

但我还是把这件事做完了,把高速、高架 NOA 量产并交付给上汽,整体体验和表现都还不错。那段时间我几乎把国内所有带 NV 功能的车都试驾了一遍,觉得做得还可以。

所以我 2023 年 5 月提了离职。

张小珺

放弃一千万美元的薪酬?

高继扬

我记不清是不是这个数,大概在这个数左右。

其实我没什么心疼的,一点都没有。因为我最在意的还是想去做的那件事,不是钱。跟那件事比,其他东西价值不大。

而且钱这个东西,日常也花不了多少,正常吃饭、生活够用就行,多一点少一点没什么区别。

张小珺

从你离开 Momenta 到进入 Momenta,你自己的变化是什么?

高继扬

底层变化是学会了什么叫以客户为中心。

这是 Momenta 文化价值观的第一条。我是在实践过程中体会到什么是以客户为中心。

以客户为中心不是客户说让我们做什么,我们就做什么,而是真正站在客户角度看需求是什么,甚至帮助他挖掘需求,提出更好的方案,帮他解决问题。

以客户为中心也不是公司对外,而是所有上游面对下游。公司内部也有以客户为中心:支持团队面对业务团队,上游平台团队面对下游交付团队,都是以客户为中心的思考方式。

与以客户为中心相对的,可能是以自我成长为中心、以技术领先为中心。我觉得这些至少对于做一家企业来说都是错误的。

张小珺

你决定创业后,第一件事是什么?

高继扬

第一件事是离职。

张小珺

离职前什么都没做?

高继扬

几乎没做什么,只是大概想了想要做什么。后来发现最初想的事情也不太对。

我跟赵航、天威聊了聊。赵航也回国了,他当时在清华。最早公司就是我们 3 个。天威当时也在 Momenta,跟我一起离职。

离职之后我先出去玩了一段时间,去了西藏,自驾。大概 2023 年 7 月出去,8 月回来,之后开始整 BP、融资。

现在回头看,当年的 BP 简直不堪入目。

张小珺

当时 BP 写了什么?

高继扬

6. 他决定做全栈机器人

当时先想清楚了几件事。

第一,我们做具身智能,必须是整机加智能,不能只做智能。长期来看,我们的壁垒建立在物理世界的数据闭环之上,所以必须做整机、做硬件。

第二,我不想做科研,不想做纯研究,我想落地产生价值。但价值要考虑商业化问题。当时我没有答案。

所以那时候想直接做一个落地的事情,做末端配送。后来很快否定了这个方向。

张小珺

你们最早想做的是配送机器人?

高继扬

对,想把自动驾驶复制到配送行业,再加一点操作能力。末端配送需要进电梯、开关门、拿东西、放东西。

但在这一波 AI 之前,已经有公司做了很长时间。

张小珺

你们靠这个故事融了两轮?

高继扬

大概两轮。主要不是靠故事,还是靠团队。

后来我理解了什么叫天使投资人:他觉得你现在什么都不行,但有潜力,所以扶你一把,给你一些钱。

张小珺

哪两位天使?

高继扬

最早是 IDG 和百度风投。金沙江也在最早那一轮,当时是雨桐学姐,后来她去了 Kimi,不在金沙江了,金沙江后来也退出了。

中间朱老板退出了。但我跟朱老板没有直接聊过,他当时投得也不多,退出就退出了。

第一轮投得最多的是 IDG,百度风投投了一部分,金沙江最少。

张小珺

IDG 投你们的逻辑是什么?是李骁骏自己看的吗?

高继扬

当时我有一个本科同学李一康,在 IDG 做投资人。他帮我引荐,也是在内部推动,推给邵辉。邵辉之前投自动驾驶比较多,对自动驾驶有信仰,对从自动驾驶出来的人也比较信任。

后来跟肖军见了一面,他觉得我、赵航和天威看上去还行,就投了。

但他们当时也说,你们想做的事情可能不 work,再琢磨琢磨。所以这就是天使投资人,接受你的错误和不完美。

第一轮一共是 3,000 万人民币,IDG、百度风投和金沙江一起投。估值我忘了是投前 2 亿还是投后 2 亿人民币,大概就是这个规模。

后来紧接着做了一个加轮,是清华电子系汪老师做的基金,还有姚颂他们。姚颂也是我们这一届的杰出代表。

加轮大概投了一两千万,可能 2,000 万左右,不到 2,000 万,投后估值可能三四亿。

张小珺

2023 年你们还做了什么?融资是很大的事情。当时融资还挺顺利?

高继扬

从那个时间点看,跟同行比,前两轮算比较顺利。但拉到今天看,已经算比较困难了。

现在可能随便讲一讲,投资人觉得团队不错,就是一两亿美元起步。

张小珺

所以你觉得当时便宜了?

高继扬

我倒不觉得便宜。我觉得当时是投资人有勇气。那时候早期投资环境比今天冷得多,他们敢出手,我已经特别感谢了。

而且 2023 年机器人还没有成为共识。大家聊的是人形机器人,“具身智能”这个词大家还不清楚。我们的切入行业又很窄,idea 也看起来不靠谱。

那时我们主要研究怎么做整机和供应链。早期起点非常低,什么都不懂。

我们就买别人的产品回来拆,看它们怎么做,第一次看到电机、关节模组。也不知道供应商从哪里找。最早找供应商不会找,也没有人脉。

有一次拆出一个东西,不知道是什么,就把照片拍下来放到淘宝以图搜图,找到卖这种产品的供应商。

连怎么拆东西都不会。后来公司负责结构的同学来看我们,觉得太可怜了,送了我一个工具箱,里面有改锥、锤子、镊子、斧子之类拆机工具。

那时候确实从来没碰过硬件,怎么接触、怎么进入这个领域完全不懂。

直到遇到杨泽一,他也是今天公司的合伙人、机电首席工程师。他是一个投资人介绍给我的,来自五源资本。五源当时没有投我们,但确实很好地介绍了泽一。

泽一很年轻,1997 年出生,但我觉得他是天才。当时我们对结构、机械一窍不通,应该先跟行业里的人聊、学习。

聊到泽一时,我第一次感觉有人把机器人系统、整机系统有框架地讲清楚。他已经做过的一些事情也很有洞察力。虽然我不懂具体知识,但一个人在陌生领域能给我这种感觉,我就觉得大概率是对的。

我就邀请他一起干。

张小珺

你们聊了多久?

高继扬

一共聊了几次。我去深圳找过他两次,他是南科大的。第二次我就决定邀请他来公司。2023 年年底说好,稍微准备了一下,2024 年 1 月来公司。

张小珺

他当时在学校做什么?

高继扬

他已经毕业了,自己创业。他很能折腾,技术能力也好,思考问题很本质。

张小珺

你把他的公司收了吗?

高继扬

没有。他后来慢慢就不做了。当时做的是机器人培训,给初中生、高中生做机器人教培。

张小珺

难怪能讲清楚。那他的动手能力怎么样?讲清楚和做出来是两回事。

高继扬

他的动手能力非常强。后来公司所有产品,几乎大的框架设计都是他把关、设计和推动。

我觉得泽一对公司的贡献很大,当然他对外露出比较少,大家不知道他是合伙人。

张小珺

这种合伙人给多少股份?

高继扬

我们大概是按照百分点给,按原始股的百分点给。天眼查上如果有心人想查,也能查到。

我希望构建的团队,是我自己做一个中等面积的六边形,合伙人团队做更大面积的六边形,组成一个更大、更均衡的六边形。

泽一在机电系统、产品甚至产品思维上都特别好,而且还很年轻,我觉得就是天才。

公司其他几个合伙人也是这样。比如 CFO 天琪,去年加入。公司一直有一个机制,就是持续引入好的人,也比较舍得分配股份。

如果希望公司在未来 5 年翻 10 倍、20 倍,那每个阶段其实都是创业,需要有一个机制把好的人吸纳进来。

所以我们的合伙人机制,从我、天威、赵航 3 个人创办公司时就有。泽一、华哲,后来负责商业化的于磊,以及几个月前加入的天琪,都是以这样的形式加入。

我觉得这是公司能够在过去这段时间从一堆公司里稍微脱颖而出的原因之一。

张小珺

为什么你创业第一件事最在乎的是整机?当时也可以做一个大脑,有很多选择,为什么第一件事是整机,而且是一个你们很陌生的领域?你可以从软件开始做。

高继扬

小珺这个问题特别本质。

我最早就想清楚了一件事:我们要做具身智能,长期壁垒建立在物理世界的数据闭环之上。只有把这个东西构建起来,才有别人进不来、能够长治久安的壁垒。

要构建物理世界数据闭环,必须有数据载体。这个数据载体就是整机、硬件,这是长期的事情。

第二,中短期我们的商品是什么?我们要提供给世界的商品,大概率不是一个算法,也不是一个所谓的大脑,而是整机加智能,形成一个在物理世界里有执行能力的实体。

中短期需要软硬结合的商品,长期需要硬件作为构建数据闭环的核心媒介。两件事倒推回来,就是必须把整机和供应链做好。

虽然一开始不太会做,但不怕慢,就怕站。我们就开始做,日拱一卒地往前推进。

所以 2024 年很多投资人问我,为什么天天搞整机,不是自动驾驶 AI 团队吗,不应该做 AI 吗?我的解释就是,为了更长期的目标,今天必须做整机。不然直接做算法,算法就变成空中楼阁,做完之后没法转化成产品价值、商业价值,意义不大。

张小珺

在汽车产业里,你希望做的是车企,不希望做 Momenta 这样的生态位。

高继扬

首先,具身智能和汽车行业还是有区别的。

汽车加自动驾驶开始发展时,汽车产业已经存在 100 年了。作为自动驾驶切入赛道,没有机会自己造车,只有新能源车企可以切入造车。

所以对自动驾驶公司来说,已经有一个存在 100 年的汽车产业,这是幸运也是不幸。

幸运是客户和商业化路径极其明确:客户是全球二十多个车企,商业化路径是把产品做成方案,卖给车企。

不幸也在这里。中间隔着一道车企,车企才直接跟终端使用者打交道,所以你的数据闭环不是那么通畅,至少早期不通畅。

因为做的是软件和系统层,对车本身没有把控力。软件和车最终体验整合在一起,所以交付给客户的体验可能会打折扣。

回到具身智能,幸运和不幸也都在这里。不幸是没有载体,想把事情做好,就得自己做载体,去学习、去做。

幸运是,当真正把这一步做完,机会特别多。下游有那么多行业,千行万业都可以做,这是一个更广阔的市场和空间。

对我们来说没有别的选择,必须把整机做好。相当于汽车产业回到 100 多年前,而且还要同时加入智能技术,所以两件事都要做。

今天我们的团队和组织,一边是人才密度高的智能团队,一边是流程体系和要求更强的整机、供应链团队。

张小珺

到 2023 年年底,你们做到什么程度?

高继扬

还是“什么都没有”的状态。2023 年年底,我们刚把第一轮融资做完。第二轮,也就是加轮,是 2024 年年初,春节之前。

所以整机和供应链基本都是 2024 年这一年做完的。

张小珺

2024 年的主题是整机和供应链。

高继扬

对,这是补课。第二,也是为 2025 年进入开发者市场建立优势、做准备。

张小珺

为什么不做人形机器人?你们在构型上是怎么想的?

高继扬

我不会把它称为折中方案。

我们最早提出一个理念:做具身智能,切入点是操作,做操作智能。做操作智能,就要想这种智能需要什么样的本体。

当时的想法叫“智能定义本体”,从智能需求出发看本体应该怎么做。也可以说是数据定义本体:怎么收集数据。

但智能是最终目的,数据是手段,所以还是智能定义本体。

为了做操作,双臂肯定是重点。双臂是重点之后,下肢如果是双足,反而会给智能演进和算法研发带来困难。

到今天为止,双足运动控制和双臂智能操作同时解决,也就是 loco-manipulation,仍然没有解决。

所以我们想先解决上肢操作。事实上很多真实场景也不需要双足过坎、走路的能力,轮式其实就够了。

所以当时定义了轮式加躯干。

张小珺

这是什么时候定的?

高继扬

具体时间记不清,应该是 2024 年 3 月左右。之后开始做 R1,第一代产品,也是现在产品系列的延续。

产品做出来后发现学术界确实有需求。今天我们把这个市场叫开发者市场,主要是卖给实验室。

开发者市场的内涵更丰富,有点像《跨越鸿沟》里描述的早期采用者。最早使用者叫 innovator,也就是开发者,他们喜欢、热爱这个事情,想探索、发明东西;之后是 early adopter、early majority。

我们今天的商业战略,是从开发者市场走向生产力市场。科技产品从 innovator 走向 early majority,历史上有很多产品都走过这个过程。

比如苹果 Macintosh,最早是极客使用,后来设计师、企业设计部门使用,再后来办公室文员使用。

最近的例子是拓竹的 3D 打印机。最早是极客玩具,而且是少数极客的玩具,后来变成很多企业的必备设备,现在可能很多家庭也想买一两台,甚至有人做 3D 打印工厂。

科技产品从创新走向大量采用,基本都是这个过程。我们也是从开发者市场走向应用市场,主要是生产力市场。

我也不是第一个在机器人领域用这个模式的人。宇树其实就是这个模式:先做面向开发者、高校的产品,慢慢到二次开发的公司,做出一些好玩的东西,再逐渐走向娱乐市场。

开发者市场本身也分层。塔尖是学术型开发者,比如李飞飞、美国顶尖大学的研究员、老师和博士生。

往下是企业内部的研究型开发者。大厂里总有一批人做最前沿的东西,比如 Physical Intelligence,以及我们最近和蚂蚁一起做的 LingBot-VLA,他们都是面向未来、面向研究的企业内部开发者。

再往下是生产力型开发者,面向企业应用和落地,做开发、二次开发。

金字塔再往下,未来产品更成熟、更整体化,就会面向集成商,集成商会成为新的开发者。再往后,可能就是终端用户。

所以开发者不是狭义的高校科研市场,而是一个金字塔,是科技产品从早期 innovator 走向大众的必要过程。

张小珺

在整机这里面,你有什么 learning?拆解一下。

高继扬

做整机的 learning 太多了。

首先,做整机和做 AI,本质上还是工程化问题,可以用同样的方法论看:拆解、测量。把复杂问题拆成子问题,做好组织、团队。

不同点是,AI 更强调人才密度,必须有顶尖开发者、研究者做出好的算法。以前大家强调 10x engineer,这类人对组织很重要。

但对于机电系统、整机来说,更强调研发流程的严密性。

从早期构型设计开始,如果构型设计失败,后面全都是错的。然后逐渐到结构设计、线束、嵌入式系统、整机软件平台,再开始做 EVT 验证,验证功能是否正常。

过程中会发现线束可能有问题、长期磨损,结构强度不够,供应商来料质量有问题。要用严密流程排除这些问题,走到 DVT 阶段,做一致性和老化测试,最后走向生产。

无论是机器人、消费电子还是其他产品,都有类似的流程。

张小珺

到了 2024 年,你们的战略变化了吗?还是想做配送市场?

高继扬

7. 战略转向轮式双臂

很快就变了,应该是 2024 年 3 月,刚开始做整机时就调整了。

我们发现这件事太早了:整机不成熟,供应链没有,智能也没 ready,客户不成熟,市场也不在,没法做。

所以马上调整战略,做轮式双臂,聚焦操作,切入开发者市场。

当时没有今天说得这么清楚,只是想先卖给高校。后来发现不只是高校,而是开发者市场。开发者市场是走向未来的关键市场,这里面也有运气成分。

张小珺

当时对于智能是怎么思考的?

高继扬

8. 真实数据驱动智能

从 day one,我们确定了几个基本原则,但具体方法没有。

最早确定的是一定要端到端、一定要数据驱动。这是我们做自动驾驶的 lesson learned:不要再做模块化、分层设计,因为这不 work;一定要用真实数据解决问题。

自动驾驶也曾经尝试用仿真解决问题,但并不太 work,所以我们坚持端到端和真实数据。

具体做 VLA 是 2025 年的事情。最早没有走 VLA,π0 之前还没有特别成熟的 VLA 范式,更多是做 diffusion policy 这样的 vision-action 小模型。

尝试一段时间后发现泛化性不足。π0 出来后,觉得这个范式确实 work,就马上调整去做 VLA。

张小珺

所以 2024 年智能不是主线,整机是主线;2025 年主线至少是数据和模型?

高继扬

2024 年我自己的重心绝对是整机和融资。2025 年重心开始转向数据,再到模型,同时还有融资和商业化,因为开始做开发者市场。

这一年我们有 150 多个客户。团队付出了很多,有些大客户、关键客户我也亲自跑一线做下来。

张小珺

2024、2025 年有新的融资吗?

高继扬

一直都有。战略调整之后,故事重新讲了,融资还算比较顺利。

张小珺

机器人竞争链路很长,既有整机,又有数据、模型、算法。你的优先级是什么?

高继扬

我特别同意机器人、具身智能的竞争是多面的,是一个六边形。

大语言模型的竞争更多发生在模型本身,因为数据可能 90% 是外部数据,渠道和终端也都是现成的,模型本身决定很多产品体验,也不用担心分发。

但到了具身智能,你会发现供应链几乎没有,数据也没有。没有整机、没有好整机,就没有数据。

算法有一些 reference,但因为没有好数据,算法到底 work 不 work 也不确定。模型更不用说。

渠道全部是线下的。卖机器人不可能线上买,还是要在线下建立分销体系。终端就是机器人本身。

整个价值链里,算法和模型只是一小部分,大量东西都是空缺。

同时还有资源方面的要求。具身智能受到国家和全世界重视,需要政府支持、资本支持,持续获取资源的能力也很重要。

所以要把这些东西拼起来,公司要成为一个六边形。不同阶段,优先级不一样,我的关注重点也不一样。

2024 年,我先持续融资,把供应链搞好。2025 年持续融资,把数据和智能体系搭起来。

2025 年 8 月,我们做了全球、也是全国第一个数据开源,开源的是自己采集的 500 小时高质量遥操作数据。后来我们又做了技术模型开源,也有一些友商陆续开源。

到了 2026 年,重心又变化了。融资不能停,但业务发展重点转向场景和应用。

整机 ready 了,数据和智能体系也上了正轨,就要开始关注场景和应用,从开发者市场走向生产力市场。

张小珺

数据和智能做到什么阶段了?你满意吗?

高继扬

很难说满意,不可能满意,但我觉得搭起了一个框架。

团队逐渐完善,基础设施建立起来,基本模型也有了,整个团队动能很好,持续向前推进。

赵航现在带领智能团队,团队氛围很好,干劲足,结果也不错。所以相对来说,我在这部分花的时间和精力少一些。

张小珺

所以智能和数据主要是赵航在做?

高继扬

对。

张小珺

你们坚持用真实数据,但机器人行业跟自动驾驶最大的区别在于,汽车本来就会卖,商业模式成立的同时还能收集大量数据。机器人数据很少,为什么一定要收集真实数据?

高继扬

这涉及一个常讨论的问题:现在没有数据,那是仿真数据还是真实数据?

我们从 day one 就坚持真实数据,很大程度上确实是从自动驾驶里学到的。

AI 有一个底层原理:我要解决的问题在某个 domain 里,那么训练模型的数据最好也在这个 domain 里,否则就涉及 domain transfer。

Domain transfer 曾经是 AI 里很热门的 topic,我读博士时很火。后来大家做得少了,因为发现还是用那个 domain 的数据解决问题更有效。

到了自动驾驶,我们发现 99.9% 的问题,还是靠真实路测数据解决。仿真不是不用,但“仿真”是一个 overloaded 的词,在自动驾驶里有很多含义。

真正解决问题的还是实测、实采的真实数据。

到了具身智能,传统 graphics-based、基于图形学渲染器的仿真体系,sim-to-real gap 仍然很大,会产生很难克服的 domain gap。

做仿真的人会说仿真数据容易获取,真实数据要到现实世界采集,成本高。但贵和便宜要综合算账。

要关注智能总成本。总成本包括数据获取成本、训练成本和工程师团队成本。工程师团队先放一边,数据获取成本和数据使用,也就是训练成本,大体是一比五到一比十。

也就是说,花 1 块钱获取的数据,要花 5 到 10 块钱才能训练明白。如果数据质量低,就会在训练环节浪费很多钱。

所以从成本角度,也要想办法提高数据质量,节约训练成本。贵和便宜要整体来看。

第二,要算真实数据获取到底有多贵。小珺,你觉得获取一个小时物理世界的真实数据,成本是多少?

张小珺

这里面有运维成本,也有人员成本。

高继扬

把所有成本加在一起,真实采集一个小时,你盲猜是 10 块、100 块还是 1,000 块?

张小珺

我想想,1,000 块。

高继扬

实际数字是,我们自己运营下来,采集真实世界一个小时,实际投入的人力可能是 3 到 4 个小时。把 3 到 4 个小时的人工算上,再加机器人折旧,大概是 200 到 250 元。

这是中国的成本。北京、上海、苏州这些较贵地区可能高一些,西部地区可能更便宜。

意味着获取 1 万小时数据,250 元乘以 1 万,是 250 万元。获取 10 万小时,就是 2,500 万元。

10 万小时是什么概念?一个人从出生到 18 岁和物理世界交互的总时长,就是这个量级。

机器人有使用寿命。假设使用寿命是几千小时,使用完就报废,价值归零。成本要折算到每小时。

张小珺

王赫算过一笔账:人形机器人一台至少 10 万元,1 万台用于数据采集就是 10 亿元。每台两班倒,两人遥操作,4 个人需要一个月小几万元;再加标注和质检,每个月维护 1 万台机器人的成本在数亿到 10 亿元。

高继扬

我关注的是每小时成本。首先要定计量单位,为什么要买 1 万台,这个问题还没有回答。

获取一小时真实数据,大概需要 3 到 4 个小时人工,因为机器人需要复位、setup。机器人折旧怎么计算?我们姑且按 10 万元算,再假设运行 1,000 小时就报废。

10 万除以 1,000,是 100 元。再加上 3 到 4 个小时人工,就是每小时 200 到 250 元。

这还是比较粗放的运营,还没有特别精细化。整机成本事实上比这个低,整机寿命也比这个高。

张小珺

现在大家也讲一个数据金字塔。塔尖是真实数据,这毫无疑问,因为真实数据没有 sim-to-real gap。下面是仿真数据和以人为第一视角的数据。在承认真实数据有效的情况下,增加下面的数据量有什么问题?

高继扬

首先,数据金字塔的定义应该来自智能需求,而不是凭空定义:上面是真实数据,下面是什么,最后是仿真数据。谁规定数据金字塔必须长这样?比例必须是这样?没人规定。

要看智能需要什么样的数据比例,才能让最终智能产出效率最高。

我们现在是以真实数据为主。真实数据又分几种。

第一种是 robot-centric data,以机器人为中心,人来操作机器人。

第二种是 human-centric data,比如 UMI、美国一些公司做的采集,还有外骨骼采集设备。这些都是 human-centric data。

还有 POV 数据,人戴眼镜、头戴摄像头,手上什么也不戴,采集人的第一视角数据。这也属于 human-centric data。

此外还有第三视角数据、互联网视频数据,以及仿真数据。

仿真数据也不一样,要看仿真器是 graphics-based、基于图形学渲染,还是基于真正世界模型生成。

这些都是可能的数据,但没人知道比例应该是什么。这叫 data recipe。很多大语言模型公司今天最大的秘密就在这里,对具身智能公司也是如此。

我们要保证的是,各类型数据的获取都畅通无阻。具体是一万小时真机操作数据,还是五万小时 UMI 数据、20 万小时 POV 数据,要试出来。

张小珺

所以你并不是说一定只要真实数据。

高继扬

不是,我确定是以真实数据为主。但到底是一万小时真机操作,还是更多 UMI、POV 数据,需要实验。

AI 归根结底是实验科学,得试出来。

张小珺

你们现在的数据抓取是什么样的?

高继扬

坦率来说,此时此刻训练模型的 recipe,我也不是特别清楚。

大体还是刚才说的真实数据:真机操作、UMI,再加 POV 数据的混合。

张小珺

我听过一种说法,为什么有的公司把仿真数据放在前面,有的公司把真实数据放在前面,是因为把真实数据放在前面的公司,商业模式是把机器人卖给开发者,也就是实验室,让实验室去采集真实数据,再训练自己的模型。所以你们的商业模式决定了你们一定要说真实数据最有效。

高继扬

这绝对不是。

我们的起点是,具身智能是一个完全技术驱动的创业。技术改变了产品,产品改变了商业模式。不是因为我定了这个商业模式,所以技术选择这个方向,逻辑不是这样的。

我们最早就想清楚,要以真实数据、真机数据为主,做端到端。又因为技术产生的产品还不成熟,不能直接在生产力场景产生价值,所以先做开发者市场,逐渐过渡。

逻辑不是因为商业所以技术,而是因为技术所以形成这样的模式。

张小珺

真实数据怎么 scalable?

高继扬

真实数据 scalable 有两个条件。

第一,一定要进入真实场景。它应该是场景化的,而不是在所谓素材场里完成数据采集。真实场景本身 non-scalable,所以要构建场景。

第二,一定要用众包方式采集数据。把采集设备以某种方式分发出去,让大家都参与进来。这里面可能需要政府支持,我们也要投入,还要有商业模式支撑。

今年我们也会实践这种方式。把事情分发出去,进入真实场景,就能快速 scalable。

这也是为什么我们关注北美进展。北美比国内更早进入无本体的数据采集,也就是 UMI,包括 3D 采集手套、采集夹爪。我觉得这个方向很重要。

张小珺

你说今年对你来说很重要的是应用和场景,准备怎么定义场景?

高继扬

具身智能最终落地,一定是供给侧和需求侧碰出来的。

需求侧非常大,几乎现在劳动者做的所有工作,理论上都是具身智能未来要解决的问题。但不是所有需求都是好需求,也不是所有需求都适合在当前阶段解决。

先看供给侧。基础模型的供给特点,我定义了 3 个顶层指标:速度、精度、泛化性。

速度,就是基础模型驱动下的操作速度。基于模仿学习,大概率超不过人,能达到人类速度的 80% 到 90% 就不错。

精度是厘米级操作精度,毫米级可能是下一步,先解决厘米级。

泛化性是需要多少条新增数据才能解决一个新问题。比如抓取,我们已经做到“万物抓取”,在抓取上实现零样本泛化。

叠衣服可能有一部分少样本泛化。毛巾、T 恤、衬衫可以做,但其他衣服还需要重新学习。有的零样本,有的少样本,有的还待解决。

泛化性看的就是边际成本:多少新增数据能解决一个新问题。

再看需求侧,有几个限制。

第一,速度不能要求太高,当前技术做不到。

第二,AI 仍然会犯错,失效成本不能太高,不能一次错误就造成不可挽回的损失。

在此基础上,好的商业化场景还要有爆发力:做完一个之后,能够很快做到一万台。

最好是全球化市场。只在中国或欠发达地区有的市场,可能不是第一步的好市场,最好欧美也有,因为付费能力高。

同时全球不同市场的场景要相对类似、统一。不同国家的酒店可能不一样,零售也可能不一样,这些不一定适合第一步。

我们定义了几个动作大类:carry、pick、pack、fold、operate。

Carry 是搬,pick 是拿,pack 是包,fold 是叠,operate 是操作设备。现实世界很多劳动岗位,都是这几类动作的组合。一个岗位涉及的动作数量不会特别高,可能 20、30、40 个,基本可以覆盖很多岗位。

这类岗位,就是具身智能率先铺量、落地的好场景。

张小珺

现在有哪些具体场景?

高继扬

仓储物流里的 bin picking 是很好的场景。

它要解决的问题很简单:一个仓库里有很多 SKU,可能 1 万、几万种,存储方式是一个个 bin,一个斜口盒子里放一类东西。

人要根据订单去拣选。因为 SKU 太多,传统物流方案没法有效解决,所以这个场景不错。

智能制造里也有大量物流环节,厂内物流一是物流,二是装配组装。

组装需要毫米级操作,而且很多时候是柔性操作,复杂度一下上去了,可能要放一放。但厂内各种物流,单手拿、双手搬的,都可以做。

张小珺

我有一个很大的疑惑。10 年前也有很多机器人公司成立,也可以做这些场景。为什么需要这一代 AI 来做?

高继扬

不太一样。我分两个问题讲。

第一,为什么传统方案没法解决。物流一直是机器人公司持续解决的问题。早期有 Kiva 这样的机器人,后来有夹抱式机器人,夹抱药箱送到某个地方。它们基本解决一大类问题。

但今天大量仓库里,还是有人拿订单到一个个斜口盒里拣货。因为 SKU 数量特别多,而订单只从这些 SKU 中挑几个。很多场景都会发生这种事,传统方案无法解决。

车厂里也类似,一般叫 SPS 集中分装。车辆上总装线之前,一辆 AGV 去一个小仓库区,转一圈,三五个货架旁各有一个人,从货架拿对应零部件,放到 AGV 车上。

本质上都是从一个区域拿一个东西,单手拿或双手搬,放到指定空间里:pick anything,place to somewhere。

传统的夹抱机器人、移动机器人解决不了;传统协作臂、机械臂解决不了泛化性。它们可以解决一托盘货物、叉车搬运,或者码垛,但物体成千上万、类型和形状不同的时候,传统方案就失效了。

第二,为什么它不是高度定制的东西。刚才的问题其实可以归结为 pick anything、place to somewhere。

这在 AI 范式里是高度统一的问题,不是定制化问题。今天小珺来我们办公室,就可以体验第一部分:随便从兜里掏一个口罩、耳机、口香糖,放在桌上,它都能准确抓起来。

这是用真实数据驱动的 VLA 解决的问题。接下来再解决 place to anywhere,它在 AI 范式里也是高度统一的。

张小珺

我理解这一波机器人公司估值很高,很大原因是讲了一个通用大脑的故事。大脑怎么做?做到什么阶段?你们和字节、小米等大公司做大脑,未来是什么关系?海外可能还有 NVIDIA、Physical Intelligence、Google。

高继扬

先定义一下“大脑”。这个词有时比较模糊,我们回到基础模型。

对于具身智能,至少有两个重要的基础模型。

第一是动作基础模型,也就是 VLA。它最终要产生 action,驱动本体执行任务,输入是 vision 和 language。

第二是做上层指令拆解、逻辑思考能力的多模态语言模型,也就是 VLM。

今天所谓大脑,其实是这两个模型的组合,我们叫双系统。

VLM 把模糊指令拆解成若干可执行任务,再进入 VLA,完成任务执行。这两部分都叫基础模型,但功能不一样。

这是我们现在的架构,也是我们相信能够支撑很长时间的技术架构。

张小珺

你们是第一梯队吗?

高继扬

如果看国内,我觉得是第一梯队。当然要看从哪个维度定义梯队,比如估值、融资额、技术发布和商业化能力。

但如果看真实智能水平,我觉得我们肯定是第一梯队。

从去年下半年开始,国内有一波开源。我们是国内这波公司里第一个做公司层面技术模型和数据集开源的,2025 年 8 月开源了数据集和 G0 的基础模型。后来友商也陆续开源。

今年 1 月,我们又做了一件事,在开源基础上提供开箱即用的体验。

我刚才说今年重点是场景和应用。在真正做 application 之前,可以分几个阶段。

最早是 demo in the video,视频里的 demo,很多。

第二是 demo in the office,在公司办公室现场展示。

第三是 demo in the wild,可以在各种地方部署。我们在新加坡、韩国、美国的客户那里,在办公室、投资人年会现场,都展示过 demo,现场从观众兜里拿出东西,机器人可以 pick up anything。

demo in the wild 之后才是 application。

今年年初发布 G1 Plus [?] 机型时,我们把基础模型和 R E Lite 整机做了整合,这也是国内首创。

为什么做这件事?第一要看场景应用;第二,我们相信商品的主要形态是整机加智能。

张小珺

为什么选择 VLM 和 VLA 的双系统?为什么不直接做端到端?同行也有人做端到端。

高继扬

我们必须考虑端侧算力有限。

不可能把几十 B 甚至上百 B 的推理模型放在端侧,一定在服务器上。端侧需要的是完成动作的模型。

如果把完成动作的 VLA 也放到云上,最大问题是延时,大概率解决不好。所以执行动作的模型一定要在端侧。

很多时候,工商业场景只有二三十个动作,直接调用 VLA 的语言接口就够了。真正进入更通用、更泛化的任务,比如家庭场景,VLM 才是不可或缺的组成部分。

所以我们拆开,还是围绕真正产生价值、产生商业价值来考虑。

张小珺

对星海图来说,肢体更重要,也就是硬件整机更重要,还是脑子更重要?

高继扬

一定是大脑,模型更重要。但为了做好模型,整机也一定要好,这是两者之间的逻辑关系。

张小珺

整机能用,才能形成数据闭环,为智能服务。

高继扬

对。

张小珺

相对于大公司,做机器人大脑的创业公司优势是什么?

高继扬

应该反过来想:大公司相比于我们有什么优势。

为了把事情做成,先要盘点成功要素。我们的目标是把 VLA 模型做好,让机器人在物理空间真正解决问题、做各种操作。

要做好 VLA,需要数据。不是互联网数据,而是真实世界里机器人或人操作物体的数据。

第二,需要好的算法。今天有一部分承接自 VLM,包括 Transformer、Diffusion 架构;还有一部分尚待创新、尚待研究,这部分大家都没有。

第三是算力。算力背后是基础设施能力和资金。

第四是人才。

大厂的基础设施、算力、人才肯定都很好,但最缺的是数据。美国很多公司跟我们交流时也很着急,没数据,赶紧搞数据。

在获取数据这件事上,中国公司系统性地比美国公司更有优势。中国创业公司亲自做整机和硬件,相比大厂速度更快。

大厂获取数据,要么买,要么自己采。但买来的数据通常有这样那样的问题,除非供应商特别优质。

而供应商优质的前提是懂模型,才能定义出好的数据。一个不懂模型的供应商,只是在那里乱采,采完都是垃圾数据。

必须有懂基础模型的公司定义数据体系和治理体系,再交给一个或多个运营团队完成采集和质量验收,然后进入训练。

数据还必须跟整机有结合性,因为后训练要基于整机数据。所以有整机、硬件和基础模型 know-how,是做好数据体系的重要前提。

这是有整机能力的创业公司相对于没有整机能力的公司的优势。

张小珺

你们是不是也想卖数据给他们?

高继扬

数据不是我们的业务,但我们乐于分享。

去年 8 月我们开源数据后,很多客户来问能不能从我们这里获得数据。很多时候我们无偿提供,或者收一点很小的费用,交付给他们使用。

张小珺

能不能理解为,你们想走特斯拉路线?如果对标自动驾驶,就是整车加数据采集加端到端模型。

高继扬

如果说的是整机、数据采集和端到端模型这条路,那我们是的。

我们自己做整机,完成数据采集和数据体系,再基于这套东西做好基础模型。

不同的是,特斯拉做的是汽车,汽车本身有明确行业,也有需求,本身能卖出去。机器人本身还卖不出去,这是挑战。

张小珺

你看好理想、小鹏这样的车企来做机器人吗?

高继扬

他们有他们的优势,我们有我们的优势。

企业竞争无非是几个要素:人才或组织,资金和资源,以及业务协同。

大厂或有优势业务的企业做新业务时,相对于完全初创公司,最大的优势往往不来自人才和资金,而来自已有业务的协同。

比如做语言模型,字节有飞书、抖音的流量,需求侧直接有协同,这是降维打击。

自动驾驶软件供应商会面对车企自己做自动驾驶的竞争。车企直接掌握数据、把握用户需求,只要投入足够资金、建立好人才队伍,优势也很大。

所以创业公司面对大公司,真正的压力是业务协同。

但具身智能没有这件事。需求侧是千行万业,大家都能找到客户;供给侧全是新供给,汽车零部件基本不能直接用到机器人上,大家都要从零研发。

自动驾驶的道路数据,对解决操作问题帮助也不大。所以这里不存在业务协同,回到了人才、组织和资金资源的竞争,各自有各自的优势。

张小珺

你把 Momenta 的量产文化怎么贯彻到星尘智能?

高继扬

我想做一个修正。我觉得不只是量产文化,而是为客户创造价值到底有多重要。

很多公司不把为客户创造价值、以客户为中心、客户第一作为公司存在的最重要原因,这种文化和价值观的缺失,会导致很多问题。

量产这个定义可能有点狭义,我想把它定义为用技术为客户创造价值的文化。

我们从 day one 就致力于做这件事。发现直接做生产力场景不太可能时,及时调整做开发者市场。

给开发者客户提供价值也是价值。只要需求真实、付费正常,单位经济模型正常,在这种供需关系驱动下,对组织就特别好,可以培养围绕客户价值进行务实创新的文化。

否则技术出身的创业团队很容易进入大型实验室、大型研究院的状态,背离做公司的初衷。

张小珺

最近许华哲要离职。

高继扬

是的。

张小珺

他跟 research 驱动文化和实践、量产驱动文化之间的分歧有关吗?

高继扬

首先我想肯定华哲。华哲是一个非常有影响力的科学家,对很多前沿问题、算法问题的理解都很到位。

但确实存在一个选择:我们到底是务实创新、build 客户价值、一步一步来,还是更多做超前创新?这里面需要 balance。

最后我们支持华哲创业,星尘智能也会投资他的第一轮融资。

更多是因为华哲想探索 To C、家庭应用。未来我们不排除也会做,但现在愿意用一种新的方式支持他把事情做好。我觉得这对大家都是更好的选择。

张小珺

你们所相信的东西,在当下这一刻的分歧是什么?

高继扬

谈不上特别多的分歧。

公司从我、天威、赵航 3 个人创办以来,一直有合伙人机制,到现在引入了多位合伙人。公司在不同发展阶段,需要不同类型的人持续创造价值。

我们愿意分享公司价值,构建一个好的团队。本质上还是战功文化、实事求是的战功文化。

我们鼓励有结果的同学用更多公司资源做更大的事,也会实事求是地做调整。

所以以新的方式支持华哲创业,是过去这段时间大家根据结果、共同做出的选择。

张小珺

因为华哲主要做算法,这是不是意味着现阶段机器人公司算法创新不重要?

高继扬

不是。我们公司的算法创新能力很强,赵航在这方面的能力有目共睹。

但我们想强调,算法创新不能独立于公司的基础设施存在。要看整个具身智能价值链:整机、供应链、数据、AI infra、算法、模型、分销、终端和客户价值。

在这个链条里,关键可以看各个要素的传播周期。

整机和供应链的传播周期是 12 到 18 个月,新产品研发需要这么长时间。终端和渠道传播周期更长,因为需要在线下建立客户关系。大客户可能更久。

数据体系建立在整机基础上,还要再加 6 到 12 个月,因为要基于整机构建数据闭环。

而算法传播周期相对短。现在大家都讲开源,论文也都有。对于第一梯队、算法和工程师团队很强的公司来说,算法传播周期大概是两到三个月。

所以算法竞争壁垒最少。投入大,但防止被抄袭的壁垒小。

张小珺

所以创业公司只要发论文、大厂跟进就好了。

高继扬

我们要学会用更聪明、更有 ROI 的方式做创新。

我们公司有一个价值观叫务实创新。不是不创新,前面先要务实。创业公司要先活下来。

理想主义是对的,我也觉得自己是理想主义者,但理想主义不能变成空想。理想主义能够实现的基础,是每天计算 ROI,计算一件事对长期战略和短期收益的贡献。

张小珺

你刚才提到在 Momenta,少卿离开之后对曹旭东的影响。你觉得华哲离开星尘智能对你的影响,和那两者一样吗?

高继扬

我不好谈旭东当时真实的感受和判断。但至少对星海图来说,长期来看绝对是利好。

我在公司里特别强调价值观。价值观是指导组织成长发展的内核。

价值观的底层,一是面对取舍时怎么选择,选什么、不选什么;二是面对利益分配时,把利益分给谁、不分给谁。

在这些问题上,要坚持价值观和长期战略,不能向短期利益让步。

张小珺

这是一个艰难的取舍吗?

高继扬

任何时候都不容易。

张小珺

你想了多久?

高继扬

这件事 settle down 其实已经很久了。2025 年 8 月,内部基本完成调整,赵航统一管理基础模型团队。

也正是在赵航统一管理之后,我们取得了很多进展。今年 1 月,全球首个开箱即用的 G1 Plus [?],就是赵航带领团队拿出的结果。

2025 年 8 月,我们基本达成一致:基础模型由赵航带领,华哲探索 To C 和家庭应用方向,公司愿意支持他的探索,并在合适时机投资他创业。

张小珺

我们刚才说了很多,包括大脑、算法、整机、数据。你的技术 vision 是什么?最终希望星尘智能变成一家什么样的公司?

你有很多路径、方法、拆解和 ROI,听起来都很现实,但技术 vision 是什么?

高继扬

9. 机器人应像员工

如果单说技术 vision,这是我每次跟投资人讲时第一页 PPT 的内容。

我们希望给世界带来的核心体验是:让培训机器人像培训一个员工、培训一个人一样,通过几次示范,再通过几次自我演练,机器人就能在某个场景里稳定、自主地完成任务。

这是最终要实现的体验和愿景。

为了支撑这个体验,我们的产品是三部分组合:基础模型、后训练工具和整机。

给客户带来的体验,是使用机器人员工像使用人类员工一样。未来机器人的生产力会显著增加,提升整个人类社会的幸福感。

张小珺

这个世界会因为有星海图而有什么不同?你们和另外一家机器人公司有什么不同?

高继扬

未来还有很多可能性,但到目前为止,我们已经带来了一些不同。

我们已经服务了至少 150 个全球开发者客户,他们使用我们的整机、数据和技术模型产品,做生产力场景应用。

我希望产品不只是进入开发者,而是进入真正的使用者,进入生产力场景,提升大家的生产力,带来更多幸福感。

张小珺

为什么我觉得机器人行业里好像没有特别有技术浪漫主义的人?

高继扬

很有可能是机器人这件事本身就不浪漫。

张小珺

为什么?这是我的疑惑。

高继扬

机器人产业链非常长,周期也很长。

跟语言模型、AI 应用创业相比,一个很大的不同是链路长度。如果做 AI 应用或者大语言模型,不用操心供应链,不用操心数据,也不用跟特别多线下客户打交道。可以安安心心做好模型研发,再做社交媒体上的传播。

这些事情本身会让团队有更多浪漫的可能性。

而机器人天然需要进入土里,做很多具体的事情。我们要把头伸进土里,所以没法浪漫,只能务实。

张小珺

你在公司做过非常激进、非常务实或者特别极端的事情吗?

高继扬

我可能没有什么极端选择,更多是步步为营。

我对长期战略非常坚持:做整机、预训练模型、后训练工具,提供完整体验;从底层构建供应链体系,这些都很坚持。

但不会在一个时间段内把所有事情同步展开,因为那样拿不到好结果。策略还是步步为营。

所以 2024 年重心是整机和供应链,2025 年是数据和智能,2026 年开始做场景应用。

张小珺

怎么识别一个机器人公司在画饼?

高继扬

无法在一个瞬间完成识别,需要一个周期。

要看这个团队一年前、两年前说的事情,跟这一年做的事情,以及一年之后做到的事情,对比起来怎么样。

张小珺

现在有谁看起来在画饼?

高继扬

我觉得投资人还是很会观察和选择的一个群体。经过投资人选择的公司,基本都是经过时间验证、至少在某一方面拿到结果的公司。

张小珺

你们在画饼吗?

高继扬

必要的时候肯定要画饼。

这个世界很多时候是靠相信驱动的。不是我已经拿到结果,而是员工、投资人、供应商、客户相信我们能做到。

要让别人相信,就必须讲未来要做什么。如果把描述未来定义成画饼,那我们肯定天天画饼。

但我们要非常努力,把每一个对未来的描述都变成现实。这就不是通常意义上的画饼。

张小珺

你们最近一轮融资已经 close 了吗?

高继扬

已经 close 了。

张小珺

讲一下这一轮融资的过程和资金来源。

高继扬

这轮融资我参与度是历史上所有轮次最低的,主要靠天琪。他比我的融资能力强多了。我现在主要负责“画皮”,需要我讲的时候去讲一下。

融资过程有一些波折。我们坦然面对和华哲相关的问题,大家可能理解,也可能不理解,所以需要解释。

但客观结果非常好。这一轮有很好的产业背景,包括吉利、北汽,还有很多 PE 阶段和一二级 crossover 资金,包括正新股、金鼎等。

更关键的是有 6 家老股东继续跟投,而且可能有 3 家或 4 家超额认购,包括凯辉、基石资本、香河等。

大家的选择,说明对公司过去取得的成果和未来展望有充分认可。

张小珺

估值相比两年前增长了多少?

高继扬

两年前是 2024 年 1 月,刚融完第一轮,估值大概 3 亿元。

现在是 100 亿元,增长大概 30 倍。

张小珺

估值两年内迅速膨胀这么多,组织会遇到问题吗?

高继扬

组织出问题不是因为估值上涨,而是因为组织本身变复杂、变庞大。

除非创始人团队因为估值上涨而自我膨胀,那肯定会引发本质问题。但我觉得我们没有。今天比两年前清醒得多、更务实、更清楚未来做什么。

组织规模也扩大了大概 20 倍。那时候十几个人,现在有 200 多人。

在扩大过程中,我们对组织调整的速度还比较快。不同阶段的阵型怎么展开,基本每 3 到 5 个月都会做一些局部调整。

张小珺

你遇到过什么现实挑战?

高继扬

最大的挑战,是公司要做的事情难度、复杂度和 scope 广度迅速扩张。

第一,公司已有的同学,包括我和其他创始人、合伙人,能不能跟上成长速度;第二,能不能及时引入更厉害、更有经验、更有 know-how 的人补充进来。

第二个问题是,具身智能天然是两个 domain 的混合。

一个是整机、供应链,强调流程体系和纪律性;另一个是智能,虽然也有工程属性,但更多强调人才密度和创新。

一个强调纪律、流程,一个强调创新和人才密度,天然会有组织难度。这是我们看到的两个挑战。

张小珺

你现在怎么调和?

高继扬

我们还不能说已经调和得很好,仍然有很多问题。

华哲离职跟这个关系不大,不是组织层面整机和智能的矛盾。我们的智能团队今天很强、很好。

基本方法还是对人正直、诚信,做正确的事,真诚对待公司每一个同学。同时强调精益经营,该省的省,该花的花。

在这种情况下,大家取得了比较好的谅解和平衡。

张小珺

你们现在按照交易金额估值,是排名第几的中国具身智能公司?

高继扬

我不清楚其他公司的准确估值,现在变化很快。

前五可能是第五。我不知道有哪些正在交易的公司估值比我们高。最高的可能是智源、银河、宇树这几家。

我保守说第五,前五。

张小珺

你能从同行身上学到什么?

高继扬

我一直学习宇树的整机和供应链。他们做得很深入、垂直整合,自己设计齿轮、壳体,做电磁仿真和电机。这是我们一直学习的地方,深入供应链,整合上下游。

跟 Physical Intelligence 也学到很多。他们是具身智能在智能领域的领头羊,人才密度和资金密度保证他们持续做这件事。前沿算法、基础模型方向,我们学习很多。

但我觉得我们比他们做得更有效率。

第三个是智源。它有很多做法,我不评论存在争议的部分,只看一个成熟管理团队做具身智能时的经营动作。

他们很多方面都做得很好,甚至知识产权也做得特别好。这可能是大家不关注的事情,但我注意到了。他们知识产权做得很好,组织也很好,管理团队实事求是,调整速度很快。

我比较 respect 初然,也向他们学习很多。很早创业时有幸跟他聊过一次,那时就感觉他已经是一个很成熟的企业家。

张小珺

你的创业老师是谁?

高继扬

可能还真没有一个。我能学什么就学什么,没有一个人能教我方方面面。可能没有这个运气,遇到一个特别好的老师。

张小珺

如果把星海图比作商业社会里的一个动物,你觉得是什么?

高继扬

第一反应是狼。

但狼也不完全准确。好像要突出狼性,可我觉得大家都很狼性,没有哪个公司不狼性。现在具身智能前面的公司都很狼性、很卷。

如果非要类比,可能最接近的是狼。

张小珺

能不能说一个特别能体现你或者公司狼性的时刻?

高继扬

在很多客户交付问题、时间节点面前,或者我们自己定了一个发布节点时,公司整体体现出的进取心和韧性非常强。

比如 G1 Plus 发布之前,赵航带领的整个智能团队,包括整机团队,都连续工作了大概一个月,周末不休息。

这种韧性、进取心,以及面对目标一定要达成的劲头,我觉得特别好。我很感动,也很自豪有这样的团队。

张小珺

你喜欢什么样的音乐、电影和小说?

高继扬

我很喜欢看电影。大学时几乎把豆瓣高分电影全看完了,以至于现在没有好电影可看,丧失了一个很好的娱乐方式。

所以很多时候会重复看老电影。我喜欢的类型很广,能够让我暂时脱离这个世界、进入另外一个空间的电影,我都喜欢。

故事片、科幻、动作、悬疑、爱情,我都喜欢。看电影一方面是放松,另一方面也想看看还有什么故事的可能性。

音乐方面不算很高雅,主要听流行音乐。我是 90 后,周杰伦、五月天,都是很普通的选择,普通青年,没有什么文艺气质。

小说看得不多,但很喜欢看书,历史类的书看得很多。

张小珺

我们希望每位嘉宾给观众和听众推荐一本人生之书,一本真的对你有很大启迪和改变的书。你能推荐一本吗?这次不能说曾国藩。

高继扬

我刚好就想说曾国藩。

那我推荐一本最近在看的,是吕思勉写的讲三国的书,具体名字我忘了,就是吕思勉讲三国的那一本。

我觉得三国历史呈现出的状态,某种程度上跟星海图今天的状态很像,有很多可以参考、获得启发的地方。

真实历史没有那么戏剧性,而是有自己的逻辑。回到那个时间节点,会发现没有哪个人是草包,也没有谁是绝对意义上的理想主义英雄。大家都是在现实中挣扎、取舍,凭借一些运气取得胜利,步步为营,最后取得成果。

好在今天不是你死我活的时代,不是只有一个人能取得结果。今天每个人、每家公司都可以做好。

更多还是要围绕客户把价值做出来,用技术和产品创造价值。

张小珺

创业之后,你在现实世界获得的最大正反馈和最大负反馈分别是什么?

高继扬

我期待的最大正反馈还没有来临。

张小珺

是出货量吗?

高继扬

对,出货量是我追求的正反馈。

融资对我来说没有什么正反馈。每次融资成功,我感受到的都是肩上的责任。账上有二十亿、几十亿资金,我要把钱花好、管好;这么多同学投入公司,我要为他们负责,给他们一个好的前程。

政府领导给我们关怀,我要交付一个好的产品和结果。很多客户给我们机会,我不能辜负。

所以更多的是责任感。

负反馈坦率说也没有特别多。刚开始有些投资人不理解,但我也不觉得这是负反馈。

我很早就形成了一种状态,不太在意别人对我的评价。我更愿意想我们的目标是什么,要给世界带来什么价值,现在有没有在做正确的事情。

如果我内心认为我们做的是正确的、实事求是的,别人不理解、不认可,甚至看不上,我都可以接受。

到目前为止,我没有因为外界评价而动摇过。

张小珺

如果有人评价你们产品不好,你怎么想?

高继扬

我会第一时间解决。

创业过程中,产品有问题是常态。我的办法是,第一,我作为第一责任人去客户现场解决;第二,建设体系,持续解决问题,通过解决一个问题解决一类问题。

很多时候身先士卒,给大家做表率。我也要求合伙人这样做,到一线获取一手信息、解决客户问题,给团队树立榜样。

张小珺

快问快答。一个全球范围内你喜欢的食物。

高继扬

我平常对食物研究不多。读博士时在洛杉矶,那里美食很多,有一家我特别喜欢的店,叫 BCD Tofu House,吃韩国豆腐锅。我特别喜欢。

张小珺

一个全球范围内你喜欢的地点。

高继扬

如果有一天退休了,不创业了,我觉得洛杉矶挺好。

张小珺

基于当下的认知,一个关键的重要 bet 是什么?

高继扬

回到创业这件事,我去做具身智能,就是我人生的 bet。我这一辈子可能就干这件事。

在当下这个时间点,我们要在生产力场景做出 1 万台出货量,把它作为接下来最重要的事情。这就是我的 bet。

张小珺

你听过我的播客吗?

高继扬

听过。

张小珺

听过谁的?印象最深刻的是哪一期?

高继扬

印象最深刻的是李一帆那一期。

张小珺

为什么?

高继扬

他做自动驾驶相关,做激光雷达。我记得你采访他时,他谈到早年 2014、2015、2016 年那种混沌摸索的状态,我很受启发。

今天他的公司这么成功、这么好,但早期也是一点一点做过来的,并不是一帆风顺。

我想到我们最早的时候,混沌期可能更短一些,反而觉得自己挺幸运,很快就进入了一个还不错的轨道。

他谈到很多对客户、技术和产品的理解、判断,我一方面有共鸣,一方面受到启发,所以那一期印象很深。

张小珺

我们工作室叫语言及世界工作室。你第一次听到这个名字时,在想什么?

高继扬

我觉得这个名字特别贴切。

这个世界,我们每个人看到的世界,都是在主观认知之下抽象出来的世界。主观认知的过程就是语言的过程。

这有一点唯心主义,但我觉得这是普遍常态。很多时候,我们通过一个个主观认知,尝试还原一个客观世界。

张小珺

刚才我们走过来路上问你,有没有什么机器人行业里你们都知道、但我们不知道的事情?讲讲秘密。

高继扬

大家对机器人的理解,更多来自视频。视频里的形态塑造了大家对机器人的认知。

但视频里呈现出的机器人状态,通常比现实中的好得多。现实里的机器人,大家还是要给它更多耐心。

但这件事会发生。

张小珺

所以我刚才的感受是对的?我觉得机器人行业里好像没有特别技术浪漫主义的人,至少我没有见过。

高继扬

我觉得这个行业不允许这样的人存在。如果有这样的人存在,可能会 suffer 得很厉害。

选择 AI 产业,和选择具身智能产业,可能会塑造出不一样的人。

这个行业会把人塑造成一种狼的状态:既要有理想主义,又要每天务实地思考今天做什么、明天做什么,每件事的收益和付出是什么,还要平衡很多方面的关系。

是一种理想主义和现实主义并存的状态。

132. 对星海图创始人高继扬的3小时访谈:鲶鱼、曾国藩、Waymo与Momenta的两面、一只狼与许华哲的离开 | BidClub