程曼祺
你们最多的时候是不是有十几个 IOI 的金牌?
唐文斌
我们 NOI 的金牌更多。
程曼祺
当时范浩强作为高中生,是怎么跑到你们这儿上班的呢?
唐文斌
反正这也是个有趣的故事。以前研究院有一句挺逗的话,大家叫“这不本质”。大家都想去解决那个本质的问题,但实际上,当你真正变成一个商业化的产品时,所有对客户有影响的东西都是本质的,对吧?它不是最后最难的那个事情才叫本质。
所以还是回到刚才那个问题:今天到底有多少机器人是真正在被持续使用的?有多少具身机器人是在被持续使用的?
唐文斌
以前研究院有一句挺逗的话,大家叫“这不本质”。大家都想去解决那个本质的问题,但实际上,当你真正变成一个商业化的产品时,所有对客户有影响的东西都是本质的,对吧?它不是最后最难的那个事情才叫本质。
程曼祺
欢迎收听晚点聊,我是曼琪。本期嘉宾是原力灵机的联合创始人和 CEO 唐文斌。2011 年,他和两位清华同学印奇、杨沐一起创立旷视,这是中国最早的 AI 创业公司。2025 年初,唐文斌成立原力灵机,开始具身智能的新创业。在本科到研究生期间,他做过 7 年中国信奥赛国家队的总教练,认识了大量奥赛小天才,其中不少人之后加入旷视,现在又在原力灵机和文斌一起创业。这期我们聊旷视的创业复盘和原力灵机的这一年。这是一家不做人形机器人的具身智能公司,也是一家会直接参与多模态基模预训练的公司。这两件事都是少数派选择,原力灵机会给中国具身智能市场带来哪些不同呢?我们正式进入本期节目吧。
今天非常高兴可以邀请到唐文斌,原力灵机的创始人,做客晚点聊。你可以和我们的听友简单打一个招呼吗?
唐文斌
OK,晚点好,大家好。我是原力灵机联合创始人兼 CEO 唐文斌。灵机是一家希望打造智能的、有用的、可信赖的机器人的公司,这是我们的使命。我们希望通过具身智能、通过 AI 的能力,以机器人作为形态,赋能更多场景,创造更多价值。
程曼祺
文斌也是一位非常资深的 AI 创业者。2011 年的时候,你和印奇、杨沐一起创立了旷视;2025 年初,原力灵机成立。中间有十几年的过程,包括你从初中的时候就开始做编程。我也想从这段经历聊起:最开始你是怎么接触上编程的,然后怎么开始参加竞赛的?
唐文斌
1. 编程竞赛塑造工程师
我老家是绍兴下面的一个县城,叫新昌。我们那个地方原来没有接触过这种竞赛,非常巧合的是,我上初二的时候,我们的初中——新昌县城关中学——刚开始搞这个竞赛。当时学校从每个班里挑了两个数学最好的同学,去学习竞赛。
反正也是阴差阳错,我遇到了编程竞赛,也就是 NOI 这件事。我们当时有很多小伙伴去机房,老师也给了我们机房的钥匙。很多小伙伴去了机房更愿意打游戏,但我们有两三个人觉得,编程其实比打游戏更好玩。
我觉得这也跟兴趣有关。从那时候开始接触竞赛,运气也比较好,后来拿到了一些成绩。
程曼祺
对十几岁的你来说,编程的乐趣如果描述一下,是什么?
唐文斌
我觉得是一种解决问题的成就感。一个问题在那里,你通过构思一个方法、一个算法,把它编程实现,然后通过了所有测试,确实解决了这个问题。这个代码如果又写得很优美,那你其实会有一种工程师解决问题的快感。
我认为这是一种非常强的正向激励。
程曼祺
像信息学竞赛,因为它可能涉及实际去编程,和数学、物理竞赛有什么不一样的地方吗?
唐文斌
我原来其实也参加过数学竞赛和物理竞赛,数学题和物理题很多时候相当于这道题有一种解法,解出来会有一种解题的快乐。但编程很多时候解法不唯一,它有很多种不同的解法。
而且我们并不是去求得那个答案,而是在设计一种方法去求得这个答案,享受的是寻找方法的过程。很多编程题目也很有意思,它其实没有最优解。比如我们要找到一条最短路,或者求一个解,使得一个问题的优化方案达到一个比较优的状态,它可能并不存在唯一的最优解。
所以你可以发挥自己的想象,发挥自己的可能性,去找到一个较优解。这跟今天做 AI 或者做优化问题,其实很多事情是一样的。
整个过程就是不断思考、寻找解法、获得反馈,而且反馈很多时候非常及时。你的程序提交上去之后,马上就会得到一个 “Wrong Answer” 或者 “Accepted”。
所以我们当时除了做竞赛题,也写了很多不同的程序。我们做过网站,也写过一些东西;我们也玩游戏,写过游戏外挂。你会觉得自己逐渐变成了一个可以制作很多工具的人,所以整个计算机科学是非常有意思的。
程曼祺
那你们当时保送的时候,在清华是可以选专业的。你是 2006 年上的本科,对吧?
唐文斌
对。但那个时候,绝大部分同学都没怎么想,大家默认就应该去计算机系,所以我们所有人都去了计算机系。
程曼祺
我之前和印奇聊的时候,他说他在清华读本科时,不是成绩最好的那种学霸。他走的是文艺路线,会跳拉丁舞,是清华国标队的队员。你在大学的时候也继续参加了很多竞赛,对吧?
唐文斌
对,像 Topcoder、ACM 等等。
程曼祺
高中时很多人参加竞赛,可能有一个比较实用的目的,比如保送。大学继续做这件事,应该确实是特别喜欢吧?
唐文斌
对,我觉得就是好玩。
程曼祺
你说的那种刺激和正反馈,能不能讲一些具体的比赛?哪些比赛会给你这种感觉?
唐文斌
很多比赛其实都会。参加编程竞赛,我们都是想赢的。
Topcoder 里面还有一个很有意思的环节,叫 Challenge。比赛是 1 个半小时,大家把程序提交之后,可以在同一个房间里看别人的程序。你有 5 分钟时间去看别人提交的程序,如果你认为他的程序是错的,就可以提交一组数据,让它输出错误答案。这样你就可以把他的成绩变成 0 分,同时给自己加 50 分。
我特别喜欢那个环节。它很有挑战性,需要观察力和速度。每个人的程序只能被 Challenge 1 次。如果我把你的程序 Challenge 掉了,其他人就不能再来把你的程序 Challenge 掉了,所以它还得比手速、比观察力。
这是一种在很大压力下,同时需要思考并形成结果的方式。大家都非常享受这个过程,而且对抗性很强。
程曼祺
你记得自己最爽的一次吗?比如抢到了多少分,干掉了多少队?
唐文斌
我们当时一个房间一般是 20 个人。有一次 Topcoder 比赛有 3 道题,其中一道题,20 个人全部提交了,而且我认为他们都有一个很小的 bug,或者说一个很小的 trick 没有发现。
我把那 19 个人全部 Challenge 掉了。那次印象非常深,我靠 Challenge 拿了 950 分,就是 19 乘以 50。
程曼祺
这些分数会放到累计的分数榜单里,对吧?Topcoder 一直是一个累计、持续的排行榜。
唐文斌
对。每次比赛都会给你的 rating,可能提升一点,也可能降低一点。今天很多 AI benchmark 里面有一个叫 Codeforces 的 benchmark,大家其实也是在评测类似的东西。
程曼祺
楼天成也很喜欢打这个比赛,是不是?你们是老乡,他也是浙江人。
唐文斌
对。我第一次参加信息学竞赛就是跟楼天成一起。当时他高二,我初三,我们俩都是浙江队的。
那个时候全国赛不分初中、高中,都是一样的题。所以我们那一届是同一年浙江队的。
程曼祺
当时你还认识哪些竞赛的同学,觉得挺好玩,或者现在还保持交流?
唐文斌
其实挺多的。今天很多圈子里的人以前都搞过竞赛。比如阿里的蒋凡,我们很多年前就在论坛上一起灌水。楼天成也是。我们公司里面当然还有很多人。
Kimi 里的周星宇,原来也是搞竞赛的。王小川很早年也搞过竞赛,而且还当过国家队教练。
程曼祺
因为后来你自己也去当过国家队教练。你是在本科期间开始做的,对吧?
唐文斌
对。这个其实是学生的义务劳动。中国计算机学会需要一些学生工作人员,因为整个比赛是由计算机学会组织的,中间有一些命题相关的工作,大部分由学生委员来做。
所以我从大二开始,和另外一位同学胡伟栋一起牵头做命题工作。胡伟栋比我大一级,也是 IOI 金牌。我们做了很多年,从 2007 年到 2013 年。2013 年之后,就交给另外一位同学来整体组织这件事。
程曼祺
相当于你创业两年之后,还做了两年的教练?
唐文斌
对。
程曼祺
是因为你特别热爱吗?创业应该挺忙了。
唐文斌
对,就是很好玩,我们也很享受这个过程。
程曼祺
这和你自己打比赛有什么区别?出题和做题有什么区别?
唐文斌
2. 从选手到裁判
出题比做题难得多。一个好的题目,并不是说它有多难或者多简单,核心是要有区分度。我们要把参加比赛的 200 个同学的分数拉开。
所以整个题目要考虑,如何找到一个好的设置,考察的点足够有趣,和以往的题不太一样,还要有新意。出一道题非常费力,我们做题可能只需要 1、2 个小时,但出一道题可能要用 1 周时间。
我觉得这有点像现在做 AI 里的 benchmark,做 evaluation 的过程。定 evaluation 是一件非常难的事情,包括今天具身智能的 evaluation 也是一样。什么是一个好的 benchmark?如何让这个 benchmark 有区分度,能够评测出不同维度的能力,需要非常认真地思考和体系化的设计。
程曼祺
这里面有什么窍门或者方法吗?
唐文斌
很多时候还是要靠经验判断。你自己得是一个好的 player,才能成为一个好的 judge。如果你自己不是一个 player,就做不了好的 judge,因为你对这个东西没有体感。
今天 AI 里面很多 benchmark,最早的模型相关 benchmark 是 OpenAI 定的。今天具身智能的 benchmark,我们也是最早一批跳出来做的。我觉得逻辑是类似的:你得是一个好的选手,才有可能成为一个好的裁判。
程曼祺
回到上学的时候,你本科时就和印奇认识了。当时对他的印象是什么?
唐文斌
3. 创业伙伴开始成形
我跟印奇本科一开始其实没有那么熟。我们班很神奇,是一个没有女生的班,一共 27 个男生,在清华是一个非常神奇的班。
我们那一届是从大一到大二,在清华里面重新考了一次试。他原来是自动化系的,我是计算机系的,所以大二时大家重新来到一个新的班级。那一年清华宿舍不够用,我们甚至还不住在同一栋楼。
后来熟起来有两个原因。第一个是我们都去了微软亚洲研究院实习。他当时跟着孙健做人脸相关的工作。
程曼祺
那是哪一年?
唐文斌
应该是 2008 年、2009 年,也就是大三、大四的时候。他在四楼,我在三楼。我在另外一个组,跟着张磊和蔡瑞。蔡瑞现在在小米。当时我做的是图像搜索。
所以我们在微软亚洲研究院经常碰面,聊聊他那边在做什么、我这边在做什么。因为都和图像有关,交流还挺多,我觉得这是我们熟起来的一个契机。
第二个原因是大四的时候,清华有一个学生节,大家去表演节目、热闹一下。我们那一年班里排了一个剧,27 个人排一个剧,全部都是男生。
程曼祺
演什么了?
唐文斌
演了一个小品。印奇是导演,他还从国标队请了一个女生来客串。
我对那次印象特别深,因为导演这个工作其实很难。他希望所有同学都参与进去,所以做了一个非常复杂的剧本。我们的剧既温馨又搞笑。在这个过程中,我觉得他非常厉害,很有组织力。
程曼祺
你们 27 个同学都参加表演了?
唐文斌
基本都参加了。我应该属于路人角色之一。
我觉得这两件事情拉近了大家的距离:第一,我们在科研工作上有很多讨论和交流;第二,班剧这件事也让大家更熟悉。后来毕业前,我们就约着说,有机会要一起创业。
程曼祺
你说的毕业前,是本科毕业前吗?
唐文斌
对。2009 年,我们后来想创业,其实也是几个机缘巧合。因为他在做图像,我也在做图像。
那时候我们还不太讲 AI 这个词,讲的是 machine learning、计算机视觉。我们觉得计算机视觉一定是很有用的东西,未来机器人都需要眼睛,都需要看到这个世界。视觉就是让机器人看懂世界的一种方式。
所以我们觉得未来有机会可以一起创业,但具体创什么,其实也不知道。我们当时还想过,先去国外读两年书,或者去 Google 之类的公司工作一段时间,有机会再一起创业。
我当时在清华还读了一个 master,是唐杰老师的学生。
程曼祺
上次我们聊过,你说你是他的第一个学生。
唐文斌
对,我是唐杰老师的第一个学生。我之所以成为他的第一个学生,是因为当时唐杰老师刚升副教授,刚刚有招生资格。每年只能招一个人,所以第一个人就是我。
程曼祺
你为什么当时想选唐老师?
唐文斌
唐老师还是很厉害的。我们当时上了几门不同的课,觉得唐杰老师非常 sharp,对很多问题都有很深的洞见。
程曼祺
唐老师当时也在 KAC 实验室吗?
唐文斌
对,他那会儿就在那边,应该是做图计算相关的。
程曼祺
他后来怎么又和计算机视觉、图像结合起来了?
唐文斌
他其实没做视觉。我在实验室里做的还是 data mining,也就是数据挖掘。本科期间和研究生期间,我发表的一些文章主要都和数据挖掘相关,跟唐老师一起做了很多社交网络上的数据挖掘工作。
后来有一段时间,唐老师学术休假,去国外待了几个月。他说,你要不去微软亚洲研究院待一阵子?我就去了。
我去的那个组叫 Web Search and Mining,原来是做文本的。结果我去了之后第一天,mentor 就跟我说:“我们组改名字了,现在叫 Social Media Search。我们原来做 text mining,现在开始做 image search。你还干不干?”
我说,来都来了,再换一个组也很麻烦。结果就机缘巧合地开始做 vision。
我在微软亚洲研究院做的那篇工作,是用图片里的上下文信息去增强图像搜索能力。后来这个能力应该也被 port 到 Bing 里,做了以图搜图。
程曼祺
按照你们本来的计划,当时印奇在美国哥伦比亚大学读博士,你在清华唐老师这边读硕士,可能还想工作一段时间之后再创业。但实际上你们很快就开始创业了。后来是怎么回事?
唐文斌
4. 旷视从游戏起步
当时有一个机缘巧合。那时候 Kinect 非常火,我不知道你记不记得,大概是 2011 年前后,体感交互游戏机非常火,就是 Xbox 360 加上体感交互设备。
你可以拿着它做切西瓜的动作,不用手柄,直接用人体操控。手去切西瓜,或者做类似的动作。那时候体感交互游戏很火,这是第一个背景。
第二个背景是,我阿姨在那一年送了我一部 iPhone 4。我觉得 iPhone 4 是一个非常伟大的产品。那应该是 2010 年下半年,已经快到 2011 年了。
为什么 iPhone 4 很厉害?因为它是历史上手机第一次出现前置摄像头。当时我们就想,能不能把 Kinect 的游戏体验搬到手机上?
我们手持手机时,前置摄像头可以看到我们自己。既可以看到脸,也可以看到手在什么位置,可以做一些动作。所以我们觉得,通过计算机视觉的能力,可以做出体感交互产品。
第三个 trigger 是,当时有很多独立开发者挣到了不少钱,比如墨迹天气,还有很多独立开发者的 app 赚了很多钱。我们就说,自己一起做个游戏,挣点钱。
最早是我和印奇两个人。我们俩各投资一台 MacBook,以前用的都是 Windows 电脑,然后开始做游戏。后来发现两个人的马力不够,就把杨沐拉了进来,三个人开始做这个游戏。
这个游戏叫《乌鸦来了》(Crows Coming)。当时下载量还挺大,没有什么推广,一度到了苹果 App Store 免费榜前三。
程曼祺
但实际上,这和旷视之后的业务差别挺大的。
唐文斌
旷视刚成立时,其实也没太想明白要做什么。我们发布游戏之后虽然没挣到钱,但挣了一波名声,因为很多人下载,还拿了一些行业奖项。
这个游戏在独立开发者游戏里被认为是比较有趣的一个,因为我们用类似摇头的方式控制游戏,是行业上第一个在手机上的体感交互游戏之一。
后来很多投资人找上门来。我们想,见一个投资人,肯定也不应该只见一个,不如多见几个。我们觉得未来有机会一起创业,那在战场上学习也是一种很好的学习方式,不如就开始。
当时联想之星和联想创投投了我们,我们拿到了第一笔钱。
程曼祺
当时你们怎么理解创业这件事?听起来像是被很多外部因素推着做出的决定。
唐文斌
这是一个很真实的版本:当时我们有一个模糊的方向,觉得未来会走上创业的道路,但今天怎么走,其实并不知道。那就先走走看,我觉得这是一种模糊的方向感。
在这种模糊的方向感下,我们愿意一边前进,一边成长。创业还是一种手段,我们希望做的技术和产品能够给更多场景带来价值。工程师很多成就感的来源,就是看到问题在那里,先把它解决掉。
所以它是工程师解决问题的成就感的一种延伸,只不过是一种更极致的方式:你们自己做主,自己决定要解决什么场景、什么问题。
程曼祺
你们最开始做的《乌鸦来了》,是移动端手机游戏。当时移动互联网也是一个很大的方向,但旷视 2011 年成立之后,后来没有继续做 To C 和移动互联网相关的事情。
唐文斌
我们其实还做了一小段时间。旷视成立之后,我们希望把计算机视觉应用在不同场景里,其中一个重要方向就是游戏。
我们当时跟投资人讲,体感交互游戏可以成为一个很重要的品类,而我们在这个品类里做得还不错。第一款游戏是《乌鸦来了》,是一款 2D 游戏。第二款做的是 3D 游戏,叫《街头速滑》,是一款轮滑游戏。
它有几种操作方式。我们加入了摄像头和体感交互,比如跳跃:拿着手机做一个这样的动作,就可以跳。还会有飞弹飞过来,需要通过人脸动作躲避。它是一种多维度的交互式游戏。
那款游戏也卖了一些钱。当时 4399 和触控——也就是做《捕鱼达人》的公司——愿意帮我们做发行。那个游戏做得还挺精致。
后来我们还想过做一个体感交互版的《愤怒的小鸟》。拿手机当弹弓,拉弓、发射,所有这些都依靠视觉识别。比如拉得多远,对应不同的力度。
当时我们有很多好玩的创意,但做了一段时间之后,发现有一个很大的问题:我们自己其实不玩这类游戏。我们偶尔也玩游戏,但玩的通常是几个 GB 的游戏,比如《星际争霸》,或者 SLG 这类游戏。
我们会发现,做这些小游戏带来的成就感并不强。游戏策划、收费点怎么设计、数值怎么设计,这些事情我们在过程中体会不到成就感。
后来我们觉得,这条路可能有点走偏了。我们想把技术应用到不同场景,游戏只是其中一个场景。我们的目的不是成为一家游戏公司,而是想做技术本身。
程曼祺
你觉得张一鸣会看《内涵段子》和今日头条吗?
唐文斌
我觉得他也不看。
5. 从游戏转向人脸
所以还是要 follow 自己内心的想法。我们这帮人的想法,其实是工程师的想法,希望用技术去改变一些事情、实现一些事情。
那时候我们也没想明白该做什么。人脸技术还很早期,很多场景并不 ready,所以我们想,先做一个开放平台吧。于是我们做了 Face++,把所有 API 都开放出来,一起探索这项技术到底在哪些场景有用。
2012 年年终,我们停掉了所有游戏开发。
程曼祺
旷视一直是非常技术驱动的思维。你们很认定计算机视觉这个技术方向有潜力,然后去寻找各种应用场景。
回头看的话,你们当时的创始团队组合,有可能去做更偏产品或者用户驱动的创业吗?
唐文斌
我觉得从基因上可能很难。因为我们对用户和需求的观察非常肤浅。
不管是 To C 还是 To B,To B 的产品需要理解场景;To C 的产品需要有很强的感知力,能够切换到用户视角。但我们这帮人的喜好非常诡异或者独特,并不是大众审美。
我们内心觉得有趣的事情,未必是大部分人觉得有趣的事情。这个 mindset 还是拿着锤子找钉子:我们有 vision 相关的技术,有人脸技术,有图像搜索技术,那什么产品能做这个事情?
我们尝试了很多场景,比如通过图片搜索衣服。当时美丽说、蘑菇街也很火,我们就想,能不能做服饰推荐、基于视觉的服饰搜索。但我们最后发现,自己真正热爱的和擅长的事情,其实并不在那里。
程曼祺
从 Face++ 之后,旷视后来真正找到主要业务,是什么时候?
唐文斌
Face++ 作为一个平台,当时给很多公司提供技术。我们和美图秀秀、美图手机做了很多合作,提供人脸关键点检测,帮你把脸拍瘦、把眼睛放大等。
这些 SDK 业务做了一段时间,但真正第一个起规模的业务,是和支付宝的合作。
当时支付宝和浙江网商银行非常需要解决开户问题,也就是证明“你就是你本人”。用户不用去线下网点,可以直接在线上开户。这需要非常高准确度、金融级别的人脸识别技术。
支付宝应该在市面上所有提供人脸识别技术的公司里,最后发现我们的效果最好。
程曼祺
你们当时精度到多少?
唐文斌
当时有一个 benchmark 叫 LFW,是做人脸识别评测的数据集。大家的水平大概都在 99.1% 左右,我们是第一个把效果从 90%、91% 直接拉到 98%、99% 的团队,实现了跳跃式的发展。
程曼祺
当时用什么技术实现的?AlexNet 是 2012 年出来的,你们跟得很紧。那会儿 AlexNet 也算是全球范围内的标志性成果。
唐文斌
我们那时候其实也不太信,还是将信将疑。公司里第一个做深度学习的人,其实是范浩强。
我们派了一个高中生去探一探这个方向,最后发现效果非常好。当时是赵尔静和范浩强两个人组成了一个团队,我们内部叫“强静组合”。他们把整个人脸识别里的关键点检测和最后的识别等问题,都做得非常好。
程曼祺
赵尔静当时是本科生吗?
唐文斌
当时应该也是实习生,是本科生。
我觉得这也是今天 AI 公司可以借鉴的一种人才使用方式。当时很多东西还在摸索,深度学习也很新,没有太多经验可以借鉴。所以这个时候,一帮动手足够快、足够聪明的人其实更重要。
我们拉了很多搞竞赛的人进来。
程曼祺
当时范浩强作为高中生,是怎么跑到你们这儿上班的?
唐文斌
这是一个有趣的故事。小强是初三升高一的那一年进了国家集训队,高一到高二时参加了 IOI,那一年他应该拿了 IOI 第二名。
程曼祺
当时你是教练。
唐文斌
对。我是教练。
那一年出台了一个新规定:如果参加国际赛,也就是 IOI,并且拿到金牌,就不要再参加了,把机会让给更多人。
程曼祺
相当于他高一就保送了?
唐文斌
对。他其实初三就保送了,所以就没事干了。他就问我:“那我没事干了怎么办?”
我说:“我们刚开始创业,你要不来这儿吧?”所以他高二就加入了我们。
程曼祺
你们当时开始愿意尝试深度学习,是你们让他们去试,还是招了很多聪明的年轻人之后,他们自己去看、自己想试?
唐文斌
我觉得是在很开放的讨论过程中发生的。我们当时也看到,神经网络其实并不是一个很新的东西,只是把它做深了。但它到底能带来多大效果,大家还是将信将疑。
所以我们说,小强去试一试。小强也觉得这个方向很有意思,就试了试,结果效果出乎意料地好。
有很多新技术,我觉得要抱有足够开放的态度去看待。
程曼祺
你们当时技术做得很强,但另一方面也能看到,上一轮 AI 创业中,很多技术优势并没有转化成商业上的成果。
唐文斌
我认为这句话不完全对,还是要看场景。
如果只是纯技术层面的差别,那它的壁垒似乎只是时间差:今天你做出来,另外一个人可能过几天也能做出来。那真正的护城河或者门槛在哪里?
其实是数据飞轮。如果更多人的使用积累了更多数据,而这些数据又能帮助算法或者产品变得更好,这件事就变成了正向循环。
我们给支付宝做身份认证之后,后来就会发现,其他互联网金融平台也有类似需求。我们给几乎所有互联网金融场景提供服务,后来也服务了滴滴、Uber。
比如打车时,大家会担心拼车时旁边的人是不是本人,会不会有危险。很多线下 O2O 场景都有身份认证需求,它是信任的基础。
因为有更多人在我们平台上做认证,我们见过更多人,系统也变得更准确,最终达到金融级别的水准。今天在身份认证这件事上,我们依然占有大概 70% 到 80% 的市场份额。
这就是数据飞轮在发挥作用。
但卖 SDK 可能不是这样。今天大家对技术精度的要求没那么高,慢慢地大家也都能做。在没有数据飞轮的情况下,门槛确实只是时间差。
程曼祺
身份认证如果是特别大的公司,是不是也会自己做?如果它整个生态里有很多这种需求。
唐文斌
也会,但很多时候要看值不值得。还是要看清楚目的和手段。
所有东西当然都可以自研,但如果它只占你业务里的一个小环节,你投入很大力气研发,和我研发之后服务很多客户相比,我均摊下来的成本肯定更低。
比如今天滴滴依然是我们的一个大客户,滴滴的人脸身份认证量很大。它能不能自己做?可以,但我觉得没必要。
程曼祺
旷视找到的第一个起量业务,是偏软件的人脸识别技术方案,服务各种互联网应用和互联网场景。但外界对旷视的很多印象,还是来自后来更重、更 To B 的业务,比如安防。那是一个更难做的生意,为什么要转向那个方向?
唐文斌
6. 软件业务走向机器人
旷视过去几年做了很多加法,因为我们一直在寻找两个轴的平衡点:技术可达性和市场规模。
我们当时的人脸识别业务做得很好,但它的天花板并不高。一个人每天刷脸的次数其实有限,所以我们需要找到空间更大、需求更大的问题。它可能更难,但我们通过这种方式逐渐发展出新的业务,走向更大的需求和市场。
程曼祺
如果总结一下,AI To B 有什么经验和教训?
唐文斌
第一,你的价值能不能被量化计算。很多 To B 客户是非常理性的角色,他要看使用 AI 工具或者产品之后,到底解决了什么问题,降本也好、增效也好,能不能量化。
程曼祺
什么是可以被量化计算的,什么是不太好被量化计算的?能不能举个正反例?
唐文斌
我们有时会帮客户计算 ROI。但有很多 trick,可以让表面上的 ROI 看起来很好。如果这个 ROI 是自己骗自己、在 PPT 上给客户做了一个假的 ROI,也许可以搞定一些客户,但长期不能 scale。
客户续约会有问题,复购也会有问题。
第二,我觉得最好不要在客户成本构成里占太大。比较好的场景,是需求广泛,但你在每个客户的成本构成里占比不要太大。
如果你占比太大,他很有可能 replace 你。
程曼祺
你刚才说很多大厂可能会自己做。那怎么看宁德时代和英伟达?它们也占客户成本很大,但大家又好像离不开它们。这不是一种最理想的状态吗?
唐文斌
那它们厉害的地方就在于,强大到不可被 replace。
但宁德时代也一样,很多车企在自己建电池工厂。只是宁德时代的保有量在那里,客户也很认可,所以大家依然用了很多它的产品。
宁德时代和英伟达肯定都面临这种趋势。包括 Meta,海外和中国的所有大厂,Google 也都在做自己的芯片。只是目前这个阶段,它们仍然不可替代。
第三,我觉得要非常当心项目陷阱。做 To B 很容易陷入一个个项目,因为 B 端客户需求多样化。我们需要想清楚,产品标准化到什么程度,什么是配置化,什么是定制化。
如果每个项目都要给客户定制,业务的 scale 会有很大问题。
所以我们总结下来,希望找到的业务是:给客户的价值清晰、可计算;产品有足够的标准化程度,能够做成一家产品公司,而不是项目公司。
程曼祺
可以以旷视当时你负责、和现在做具身智能比较相关的物流机器人业务为例展开讲讲。你当时是整个业务的负责人,商业化也负责,对吧?
唐文斌
对,都是我负责。
以物流业务为例,我们现在的收入构成大概是一半一半:一半来自项目收入,一半来自产品收入。
项目收入的意思是,我们给仓库提供搬运机器人。它很像装修,因为每个房子长什么样、业务流程长什么样都不一样,所以大概率要定制化去 fit 这个仓库,非常非标。
前几年每个项目做得都不一样时,非常痛苦,scalability 有很大问题。
后来我们觉得一定要在里面寻找标准化。我们把仓库分解成很多环节,比如入库、托盘存储区、箱式存储区、发货区。每个环节里用标准化的解决方案和产品解决。
相当于把一个定制化的事情,变成更加配置化的事情。
同时,我们还有大约 50% 的收入来自产品化业务。前面还有一个集成商,他拿着我们的标准 component,搭建成完整解决方案。我们提供积木块,让他搭建成完整的系统。
程曼祺
旷视开始布局机器人业务,应该是在 2016 年左右。当时是看到了什么机会?计算机视觉当然用到了,但还有很多别的技术,这中间有一点 gap。你们怎么想到做这个事情?
唐文斌
我觉得在印奇和我心中,一直都有一颗想做机器人的梦,我们从 day one 就开始想。
程曼祺
你刚才说,最开始也觉得以后机器人都需要眼睛,所以认为计算机视觉是很有前景的技术。
唐文斌
对。旷视当时叫 MegV,Mega Vision,就是让机器人先能看懂世界。
我们有一次一起去了天津一个天猫超市仓库,看到里面有很多人拉着小车拣货,把天猫超市的订单发往北京、天津周边。
仓库非常冷,因为很高,没有暖气。我们去的时候是零下 10 摄氏度。每个拣货员每天要走差不多 40 公里,每天都在零下 10 摄氏度的环境里跑一个马拉松,非常夸张。
他们让我们猜人员流失率。我说 60%,他说我缺乏想象力。他们一年人员流失率是 200%,因为这个工作实在太辛苦了。
所以我们本来就想做机器人。先让机器人看懂世界,再让它拥有手和腿,对物理世界形成输出。仓库确实有很大的需求,我们当时也投资了一家公司,后来把它收了进来,逐渐形成了物流机器人业务。
这不完全是人力替代,它其实是帮助仓库客户省人、省地、省钱、省心。人员管理本身就很复杂,而且物流发生在消费周边。消费周边的人力一定更贵,经济条件也不差,年轻人确实不愿意去仓库里做零下 10 摄氏度、每天走一个马拉松的工作。
所以这不仅是经济账的问题。在国外这个问题更严重,比如韩国、日本、欧洲和北美,更没有人愿意做这种工作。
程曼祺
最开始像 Kiva 这种方案,亚马逊在用,后来也把这家公司收购了。你们当时做物流机器人,和那一轮创业潮有关吗?当时也有很多物流机器人新公司成立。
唐文斌
当时极智嘉、快仓,差不多都是那个时间成立的,但和他们没有什么关系。
我们自己一直想做机器人,也觉得这和刚才的问题有关:要找一个相对标准的场景。机器人的很多场景非常发散,过去工业机器人最大的应用场景就是汽车和 3C,以汽车为主。其他场景里的机械臂、机器人,量都没有起来。
仓库有可能在一定程度上标准化,因为它处理的对象要么是托盘,要么是箱子,要么是一件一件的商品。它形成了一定程度的标准化,更可能让机器人用起来。
所以我们觉得仓库是很好的场景,可以作为机器人的起点。
但我们真正想做的,并不是物流场景的方案提供商。物流可以作为起点,让机器人先用起来,eventually 走出这个盒子,走到园区、更开放的场景,变成更 general 的机器人。
程曼祺
可以说你们当时就想做通用机器人,只不过那时还没有“具身智能”这个说法。
唐文斌
对。当时技术还不够,很多事情需要等待技术变化。那时做通用机器人肯定不现实,很多机械臂的应用也做得非常不好。
程曼祺
当时新的技术是什么?
唐文斌
很大程度上是调度,偏运筹和强化学习的方法。一个仓库里有很多像 Kiva 一样的机器人,真正决定效率的是调度系统:如何让更多机器人协同工作,货放在哪里,订单谁优先处理,小车采用什么交通方式,以及多车怎么调度。
这件事和我们当年搞竞赛很像,正是我们擅长的事情,是一个优化问题。
程曼祺
2012 年开始的深度学习热潮,从 2012 年到 2016 年也有一波 AI 热。当时 AI 技术外溢到机器人领域了吗?哪些地方可以帮助机器人?
唐文斌
当时有一些,但不多。差不多 2015 年是 AlphaGo 和 AlphaGo Zero 的时代。机器人的调度问题,其实也可以被认为是一个下棋问题。
所以强化学习方法可以用到机器人的调度和调度优化里,技术上也在发生变化。
程曼祺
在没有后来的新技术变革时,你们用当时的机器人和 AI 技术,做到了哪些应用和商业结果?
唐文斌
我们服务了很多世界 500 强公司,比如可口可乐、雀巢、优衣库,在海外也服务了很多客户。
优衣库是一个很有意思的客户。2019 年,我们参与了上海优衣库的投标。那个仓库每年发出的货值非常夸张,发货量也很大。优衣库希望把仓库打造成自动化程度非常高的仓库,所以方案无比复杂。
优衣库在国内几乎把所有物流机器人和自动化公司都叫了过去,像《超级女声》选秀一样,一轮一轮筛选。
程曼祺
你们是所有人一起去,还是一波一波、单独见每家公司?
唐文斌
他是一轮一轮评选。第一轮所有人先去提案,提案完之后说哪些不行,下次就不用来了。然后第二轮、第三轮,一共做了 5 轮。
这个项目用了上千台机器人,复杂性非常高。我们依靠比较强的调度能力,客户最后选择了我们。
我们跟客户讲了两点:这么复杂的项目,最后决定效率的是什么?是软件和算法。
我们不是最有经验的方案提供商,但我们绝对是算法和调度最强的。客户也非常认同这一点。
程曼祺
这个项目价值多大?像这种项目最后拍板,需要到优衣库创始人级别吗?
唐文斌
基本上接近创始人这个级别。
程曼祺
你们最后是不是和创始人见面了?我记得印奇说过,你去日本见了他。
唐文斌
对,我去见了柳井正。
这个项目非常复杂,有很多家公司一起投标。这里面有一个 To B 的陋习:大家做了很多 overpromise。一家供应商说他能做,但我们认为技术上做不到,他却说能做到。
客户就问我们:“他说他能,你能不能?”这时是不是只能硬着头皮说我也能?
所以我们承诺了很多实际上技术风险非常高的事情。整个项目充满风险,很多东西我们都不知道最后能不能搞定,但还是硬着头皮说能搞定。
最后差点搞砸。仓库全部弄完之后,如果目标效率是 100%,我们其实只达到了 40%,有巨大的 gap。
当时我们觉得已经完蛋了,客户也觉得这个仓库根本没法用。时间表又非常紧,技术方案上也有一些问题。
我们痛定思痛,跟客户解释,希望再给我们一些机会。我们已经踩过一遍坑,也知道问题在哪里,有决心和信心解决。所以最后让客户给我们延期了半年。
我们把所有 code 推倒重来一遍,最后把项目搞定了。
后来去见柳井正,是因为他们也觉得这个方案太复杂、太难了,没想到我们最后真的能搞定。他们觉得这种锲而不舍的精神很好,后来也把一些其他项目交给了我们。
程曼祺
所以你们转危为安,把这个项目重新做好之后,你去见了创始人。
唐文斌
对。做 To B,你刚才问有什么经验教训,我现在也不知道答案是什么。
在竞争过程中,我认为会有很多 overpromise。因为我要拿下这个单子,竞争对手在客户那里吹牛,但如果我非常真诚、实在地讲,很容易就拿不到这个 case。
程曼祺
你们有没有试过很真诚、很实在地说“我做不到”?
唐文斌
当然有,于是很多 case 就丢了。
我认为这和你当时的地位有关。当客户认为你就是权威、就是专家时,你告诉他做不到,他会信任你。但如果你还没有在那个位置上,你说做不到,客户只会认为你弱。另一个人说他行,那就很尴尬。
这会导致一种畸形状态:大家的 overpromise 提高了客户对事情的期待,把期待拉到不切实际的状态,最后很多事情的结果不好,也摧毁了客户信任。这是今天 To B 市场里的一个问题。
程曼祺
你们有没有遇到过竞争对手跟客户说能做到,实际上也做不到,最后做了一段时间之后项目又流出来,客户再找别的供应商?
唐文斌
其实不是这么简单。首先,反馈周期可能以年为单位。他说能做,项目先给了他,可能半年之后才搞砸。半年之后客户发现项目失败,可能已经丧失信心,也不想再搞这个事情了。
而且大家通常羞于谈失败项目。不管是供应商还是客户,都不想谈,所以市场上其实听不到太多失败 case。
这种情况现在依然存在。但当我们和客户建立了很好的信任之后,会告诉他什么事情有风险,问题可能在哪里,然后一起想办法:能不能先做小规模实验,验证这个东西。
当双方有很高的信赖程度时,就可以很真诚地探讨解决方案。但如果是竞争式的状态,很多时候就会变成 overpromise。
程曼祺
你在具身智能行业观察到了哪些过度承诺的现象?
唐文斌
7. 具身智能必须真实落地
现在整个具身智能行业里,除了文娱和科研,到底有多少机器人在持续运行和被使用,其实也不太知道。
首先,一个机器人要怎么样才算有用?第一,你得真正把客户的场景闭环,真正完成他需要的功能,而不是在某种情况下可以,换一个情况就不 work。
第二,客户的账要能算明白。满足这两点,客户才会批量、持续地使用它。
但今天很多场景更像 POC,更像 PR。大家做了很多摆拍,但它是不是被持续用起来,我觉得要打一个问号。
从客户角度看,很多厂商在拉高大家的预期,技术实际上可能没有达到那个状态,但大家说“我这也能做、那也能做”。最后结果可能不会很好,大概率达不到原来的预期。
所以真正落地,还是要务实、有效地推进机器人在场景中的使用。
程曼祺
那你们会怎么选择?是不是也要参与一点过度承诺,因为技术本身在发展?
唐文斌
我们今天和几年前不太一样。现在有很多已经建立信赖感的客户。因为我们的物流机器人公司和很多客户建立了技术信任,他们知道我们这帮人的风格。
当我们说 no 的时候,我们是认真在讲,同时也在寻找 how to yes,寻找解决问题的方法。所以在这种信赖感下,不需要对客户 overpromise。
第二,我们会告诉客户,现在机器人和模型的水平是什么样。比如在 robot 圈,桌面任务能做到 100% 吗?其实做不到。
做不到 100% 怎么办?我们不假想着机器人能做到 100%,而是告诉你,机器人现在就是做不到 100%。但我们需要设计一套完整工作流,使得机器人 failed 之后,依然有办法兜住底,让整个工作流是完整的。
我提供给客户的是一套系统,而不是一台单独的机器人。同时要把账算明白。这才是更有效、更务实的方式。
程曼祺
如果总结一下,在成立原力灵机之前,旷视的机器人业务在技术和商业上做到了什么状态?
唐文斌
旷视的机器人业务现在叫原力聚合机器人,是一家单独的公司,品牌叫 Atomics,意思是原子的聚合。
我觉得现在业务进入了平稳增长期。搬运机器人的产品,不管是托盘类还是箱式,都已经有比较成型的产品形态。客户、销售、渠道体系,也都有相对成熟的体系。
增长还比较快,海外收入占比也在快速提升。
程曼祺
大概能做到什么样的市场规模或者收入规模?
唐文斌
现在是几个亿的规模。我们手上还有很多订单,只是还没有确认收入。
程曼祺
2025 年重新成立一家专门做具身智能的公司,当时是怎么考虑的?在旷视是怎么提议的?
唐文斌
8. 原力灵机重新出发
首先还是看到了很多技术变化。很早的时候,小强、蒋竞天他们就已经在做实验,探索用大模型驱动几个机器人,也就是做 VLA。
程曼祺
你说的很早是哪一年?
唐文斌
2024 年。我们 2024 年就开始做相关实验。
程曼祺
原力灵机正式开始运营,我理解应该是 2025 年春天。中间几个月是在准备什么?
唐文斌
我们在做重组。旷视还在北京,里面有一些退出的股东,也有新的基金承接他们的股份。
这个过程是一个比较复杂的交易过程。当时中介团队、印奇和我,都花了很多时间在这件事上。
程曼祺
原力聚合机器人拆出来之后,原力灵机、旷视和之前股东之间是什么关系?
唐文斌
原来的老股东在原力灵机这边持有一部分股份,这是拆分时的设置。
程曼祺
又赶上具身智能创业非常火热,像范浩强这些人为什么没有走?为什么大家还在一起创业?中间会不会有人找他们创业或者挖他们?
唐文斌
肯定有。小强、蒋竞天这些人其实都不缺机会,很多人都想拉他们。
大家之所以还在一起,第一,是相信我们这一群人在一起,能增加把事情做成的概率。大家这么多年的配合、信赖和能力上的相互信任,加上业务积累,包括物流机器人那边的客户和场景,我们都认为一起干,成功概率更高。
这是大家今天没有走的一个原因。
另外,兄弟感情也很重要。
程曼祺
范浩强和赵尔静,你在他们十几岁时就认识了,应该认识十几年了。
唐文斌
我跟小强认识,是他初一的时候;跟尔静认识,可能也是他初二的时候。
程曼祺
尔静也是因为参加竞赛,所以你在他中学时就认识他了。
唐文斌
对。印奇和我还是同一个高中,他是老乡,所以我们认识得更早。
小强是因为我上大学之后,去人大附中讲课。当时有个小孩子特别厉害,每天坐在第一排。人大附中很多孩子都很聪明,但大部分不一定认真。他是一个又聪明又认真的孩子,所以我印象特别深。
后来果然,他初三就进了国家集训队,高一进了国家队,参加 IOI 还拿了第二名,确实很厉害。
程曼祺
旷视这群人,确实是我比较好奇的话题。大家在一起的时间非常久,包括张祥宇、贾乐,他们以前也在旷视研究院。
唐文斌
对,大家一直处在一个大的体系里。我觉得团队之间还是有一种互相吸引的力量。
强的人会喜欢和更强的人在一起,彼此认可非常重要。旷视研究院早年人才密度很高,每个人都很强。大家可能有时意见不一样,但都觉得对方是很有想法、很强的人,这会吸引更多强的人加入。
大家会觉得,这帮人凑在一起,可以做出很多不一样的东西。
程曼祺
你们最多的时候是不是有十几个 IOI 金牌?
唐文斌
对,我们 NOI 的金牌更多。
程曼祺
现在很多 AI 公司,包括大厂,也强调很高的人才密度。但人才密度并不能直接转化成商业成功。
唐文斌
我觉得人才密度能够转化成生产力,转化成更高效的配合。一群足够强的人在一起,很多事情不需要那么流程化、机制化,很多化学反应可以天然形成,整个迭代效率和节奏会更高。
但从商业和落地角度,我们还需要对客户有洞察,对问题有理解。不只是把最难的那一部分解决好,也要把那些很脏的活都解决好。
这时候可能需要另外一群同学一起配合。强的人有时更愿意解决最本质的问题。
以前研究院有一句挺逗的话,叫“这不本质”。大家都想解决本质问题,对于不本质的问题,兴趣会急剧下降。这是研究院研究员高频使用的一句话。
这句话可能从印奇到我,我们有时也会说,自己也有这样的坏习惯。但当你真正做成商业化产品时,所有对客户有影响的东西都是本质的。它不是最后最难的事情才是本质。
所以还是需要团队搭配。
程曼祺
你觉得最强的人怎么看财务回报?旷视创业了很多年,字节可能也和你们差不多时间成立,比你们晚几个月。
唐文斌
财务回报对大家来说肯定非常重要。这也是印奇和我觉得有愧的地方:带大家创业这么多年,还没有让大家挣到钱。
但我觉得大家在财务回报之上,还有更高的追求,比如把事情做成、对社会产生影响的价值感。这个层面大家可能有更高追求,但财务回报依然很重要。
程曼祺
原力灵机是一家新公司,有一些旷视之前的股东,也有很多旷视资深的元老。你们吸引新的、和现在事情匹配的人才时,能给什么激励?比如期权,和一家崭新的创业公司相比有什么区别?
唐文斌
我觉得没有区别。我们现在就是一家崭新的公司,所有激励方式都按照新公司来做。期权池也和新公司差不多,我们留了 30% 的期权池。
程曼祺
你们现在有算过,多少是以前旷视的同事,多少是后来引进的新人才吗?
唐文斌
现在大概 40% 是原来的同事,60% 是新的同事。公司大概 100 人左右。
程曼祺
2025 年正式运营之后,当时看到具身智能行业是什么情况?你判断这个领域面临的主要问题,或者要解决的任务是什么?
唐文斌
当时资本市场开始变火,但不像今天这么火,已经有苗头了。我们看到的更多是技术变化这个变量。
我以前跟印奇说过,历史上每一次技术变化,我们都低估了它的变化速度。
最早深度学习出现时,我们也没有那么相信,觉得它能比 SVM 之类的方法好多少。但最后发现,它发展得非常快。
后来 Transformer 出来,翔宇还发过一篇文章,叫《Make CNN Great Again》。因为当时 Transformer 在 performance 上已经比 CNN 好,但我们认为在数学形式上有很多等价之处,所以觉得 CNN 也可以达到类似效果。
但后来发现 Transformer 的发展非常快。
包括自动驾驶,我们最开始也有很多人在怀疑到底能不能做成。今天大家看到,自动驾驶已经上街了。
现在机器人也是一个技术变量:端到端控制机器人到底能不能行?今天的 performance 可能还只有 50% 到 60% 的成功率,比如 Robot Challenge 上的桌面任务成功率都可能只有一半。但它处在一个非常陡的进步梯度上。
我们不断提高自己的阈值,觉得它会越来越快,但它依然每次都比我们想象中更快。因为有更多资金、人才和注意力涌入,所以发展变得更快。这是一件非常令人兴奋的事。
对于机器人来说,问题就在那里。机器人是 AI 作用于物理世界的终极形态想象。如何在物理世界里形成生产力输出,机器人可能就是一种形态。
所以我们觉得,今天的技术变量可能带来很大机会,而需求显然就在那里。
程曼祺
具体来说,几个最核心的瓶颈或者要先解决的事情是什么?
唐文斌
我觉得今天最核心的问题,是模型和大脑的问题。
原力灵机的同事讨论我们的使命,最后用了非常朴素的一句话:打造智能的、有用的、可信赖的机器人。
为什么是这三个词?“智能”,是因为技术变化是我们成立这家公司的原因,所以智能是核心。“有用”,本质就是能够完整解决问题;能解决问题,账还要能算明白,才叫有用。“可信赖”,当然包括安全性和可靠性,但智商低其实才是最大的不可靠。
机械臂、摄像头其实很多都已经 OK,问题是它不够智能,不能很好地完成任务。
所以今天核心瓶颈是,机器人是否有用,卡在智商上;可信赖也是问题,但智商低是最大的不可靠。归根结底,模型和算法能让机器人变得多智能,是最重要的事情。
程曼祺
2 月 10 日你们有一个技术发布会,也讲到比较相信的一种方法,叫具身原生。什么叫具身原生?
唐文斌
9. 具身模型必须原生训练
现在大家的技术框架基本都在使用 VLA。当然 World Model 和 VLA 之间也有很多互补的地方。
现在很多公司的训练方式是:下载一个开源 VLM,在后面加一个 Action 模块,然后开始训练 VLA。大部分公司都是这么做的。
这个问题有点像一个刚结束九年制义务教育、初中毕业的学生,你把他拉到体校,开始狂练体育。练完之后会发现两个问题。
第一个,他没有从小开始练体育,根骨不健壮,所以 VLA 的能力有上限。第二个,狂练体育的 3 年里,他可能把原来的语文、数学等文化课水平拉下来了。
所以今天很多 VLA 里的 VLM 能力,效果反而不是特别好。
程曼祺
你的意思是,在 VLM 上加一个 Action 模块训练之后,反而会影响多模态模型本身的能力?
唐文斌
对,会有很大下降。
这很简单,就像你把一个人拉去上体校,他不再上语文课、数学课。练完 3 年体育,文化课水平自然下降。所以他既要上体育课,也要上文化课,必须一起 co-train。
有两种方式解决。第一,他从小就开始练体育,最好在 VLM 初期就让它看到机器人数据,而不是 VLM 已经训练完之后,才让它看机器人数据。
程曼祺
你说的是预训练 VLM 的阶段,而不是 VLA 预训练阶段?
唐文斌
对,是 VLM 的预训练阶段。
第二,在 VLA 训练时,不只是训练 Action,同时也训练 grounding、VQA 等 VLM 的能力,做 co-train,这样文化课能力也能保留。
所以现在 VLM 训练有原生训练和嫁接训练两种方式。一种是先训练语言模型,之后再加视频数据,再做 alignment;另一种是 from scratch,从头训练多模态模型。
原生多模态可能成本更高,但效果应该更好。Gemini 系列一直是原生多模态,今天具身也是一样。问题是,我们能不能做到原生的 VLA,把机器人的数据在 day one 就加入进去,让模型从一开始就在 VLM 阶段看到机器人数据。
现在整个物理世界大致有三类数据。第一类是多模态互联网数据,视频数据也属于这类,大模型公司收集了很多。第二类是智驾数据,相当于开放环境最大的描述。第三类是机器人的操作数据。
我们认为,这三类数据应该在 day one 就联合送进一个模型,训练出物理世界原生的 VLM,再交给 VLA。
程曼祺
这个阶段需要给机器人加入开放世界的自动驾驶数据吗?
唐文斌
取决于你怎么定义机器人。
VLA 里的 A,不只是手的动作,腿的动作也是 Action。腿的动作和手的动作没有本质区别。Visual Language Navigation 和 VLA,本质上是一件事。
加入这类数据,会增加机器人对更多环境的理解能力。让它做导航,它的能力一定会增强。
如果你把机器人限制在纯桌面任务上,帮助确实可能不大。但如果我们想象的机器人不是只能在 table top 上工作,而是希望它在开放环境、室内和室外环境中,具备更强泛化能力,那这些数据就有价值。
程曼祺
所以你们的 DM0 模型就是这样做的?
唐文斌
D-M0 是我们和阶跃一起训练的 VLM,也就是说我们参与了预训练过程。
整个训练分成 3 个部分。第一部分是 VLM 预训练。我们把一些数据混合在一起:阶跃有多模态数据,我们有机器人数据,同时加入一些智驾数据,一起训练原生的多模态 VLM。
第二部分是基于这个 VLM,原力灵机继续训练 VLA。这一部分相当于双方合作、联合训练。第三部分是继续训练 VLA,再做 VLA 的 post-training。
通过这套 pipeline,形成一个更原生的技术:数据层面更原生,训练方法也更原生。
程曼祺
最近印奇也官宣担任阶跃的董事长,同时还是千里的董事长。阶跃、千里、原力灵机,这些公司都是 AI 技术公司,但技术类型和应用场景不同。它们之间是什么关系?
唐文斌
公司之间是兄弟公司关系,互相有一些业务合作。
比如机器人数据我们这边很多,阶跃没有;智驾数据在千里那边,大家可以合作,让模型能力汇聚到一起。这样一个模型可以 benefit 所有人,对所有人都有帮助。
程曼祺
你们之前的数据从哪里来?怎么采集?
唐文斌
跟大家一样,我们也在做采集。
数据有几种类型。今天大家会讨论,到底是以机器人为中心的数据,还是以人为中心的数据。
以机器人为中心的数据,可以通过遥操作、手扶、外骨骼,或者无本体的方式采集。第二类是 human-centric 数据,比如通过穿戴式设备形成的数据。
最后是一个配方:如何把这些数据混合好。
程曼祺
合成数据在这个配方里有位置吗?
唐文斌
我们现在用得比较少,以真机数据为主。
首先要定义什么是合成数据。现在只要是采集的数据,其实都可以说是在物理世界里合成的数据,它并不是真实世界本身。
程曼祺
我指的可能是仿真数据和生成数据。
唐文斌
仿真数据我们现在用得比较少。对于 contact-rich 的操作任务,我们觉得仿真数据现在帮助不是很大,而且很难仿真得真实。
刚体相对容易处理,但如果是非刚体,现在渲染出来的结果很难足够真实。多模态信息,比如力、触觉,也很难仿真得足够真实。
另外,仿真数据有很大的 sim-to-real gap,所以目前对算法的帮助比较有限。
但有两个环境里仿真非常有用。第一是 locomotion,比如机器人跳舞、跳跃。它和世界的接触主要是地面,只要保持重心稳定,和物理世界没有太多交互,这部分仿真很有用。
第二是更 high-level 的理解,比如任务分解和任务规划。它不需要真实操作,只要理解在一个环境里如何完成任务,比如找到水杯、把水倒掉等。任务理解层面,仿真数据可能很有用。
程曼祺
李飞飞、苏浩、黄仁勋都提到,接下来合成数据和世界模型生成的合成数据,可能对机器人非常有用。你怎么看?
唐文斌
我们也抱着开放态度看。大家没有疑义的一点是,数据一定要 scale。
仿真是一种 scale 的方式,视频数据也是一种 scale 的方式,human-centric data 是一种 scale 的方式,让机器人真实使用后形成数据飞轮,也是一种 scale 的方式。
关键是成本不能太高,量要大。
仿真和世界模型的问题在于,生成质量到底能不能帮助现在的模型学习,这是一个 big if。
互联网数据里也包含很多物理世界信息。比如视频里的信息,能不能帮助机器人的操作,也很有可能。但这条路现在还没有完全走通。
所以我们保持开放态度,但在目前情况下,还是以真机数据为主。
程曼祺
在你觉得对具身智能最重要的模型问题上,有两种观点。一种强调具身模型的独特性和独立性,另一种觉得它和大语言模型是一脉相承的。
你们和大模型结合,包括基于混合多模态再训练 VLA,哪些部分是一脉相承的,哪些是具身模型需要单独解决的问题?
唐文斌
首先是架构层面。现在很多公司在提双系统。System 2 解决慢思考、推理、任务分解和理解,这部分显然是大模型很擅长的。
第二部分是操作能力。今天可能是一个 VLA,上面的大模型大概率跑在云端,是更低频的交互。机器人操作的 VLA 可能是 10 赫兹,是中频交互。
但 10 赫兹的模型驱动机器人可能还不够。很多操作,比如拿起一个东西之后调整、旋转,10 赫兹不可能做出这种动作。
所以 System 1 下面可能还有一个系统,也就是 System 0,需要把力、触觉等信息处理得更好,运行在 100 赫兹以上。
可能会有 3 个模型。三个模型之间的 interface 到底是什么,现在还是开放问题。
回到大模型和具身智能的关系,我认为 System 2 层面一定有很强的关联,而且现在已经做得很好。具身智能公司更多是在 System 1 和 System 0,也就是更精细、更动作层面的问题上努力。
System 1 也包括让机器人逐渐理解问题、理解任务、执行操作。但今天 VLA 还处于非常早期的阶段。
程曼祺
做大模型的核心 AI Lab,比如 Google、OpenAI,国内像字节,也都在做机器人、做具身智能。长期来说,会不会被它们覆盖?毕竟它们有很强的大模型。
唐文斌
还是不太一样。以前有个比方:你看梅西踢足球,能不能学会踢足球?可能还是很难。你看视频,学不会自己踢足球。
今天机器人这件事,大概率和硬件有很强关联。大模型公司在 System 2 层面有很强能力,但在 System 1 和 System 0 上,同样需要很强的模型能力,而且需要和硬件形成关联。
第二,大家都说数据是很大的问题,那数据最终来自哪里?我觉得最终还是来自数据飞轮。
但这里有一个鸡和蛋的问题:机器人不成熟,不能被用起来;不能被用起来,就没有机器人使用过程中产生的失败数据和接管数据。
所以一定要找到一种方式,让批量化机器人先被使用起来。这个过程中产生的数据才最有用。
这意味着数据不是靠采集就能解决的,而是需要把应用闭环,才能建立真正的数据飞轮和壁垒。这不是一家模型公司就能单独搞定的事情。
程曼祺
但大厂也可以投入很大力气去做。
唐文斌
当然可以。没有什么事情是只有你能做、别人不能做的。但任何公司的精力都有限,没办法同时做那么多事情。
程曼祺
你现在觉得这个行业最重要的问题,是模型性能提升吗?大概什么时候能慢慢解决这个鸡和蛋的问题,让机器人先在一些场景里用起来?
唐文斌
我觉得今年就有希望。
这里有两个部分:模型能力提升和场景选择。
10. 机器人必须真正有用
先说模型能力。接下来模型能力提升的一个重要方向,是多任务模型。
我们在 RoboChallenge 上做了一些评测,现在分成两个 track。一个叫 specialist,假设你有一个 VLA 基模,完成任务时还给你这个任务的很多数据,你可以在这个任务上做后训练,再进行评测。也就是说,这个模型在基模之上被微调成只处理一个任务。
第二种是 multi-task 或 generalist。假设有 20 个任务,20 个任务的样本都给你,但只能训练一个模型。这个模型要通过提示词完成 20 个任务,对模型泛化能力的要求更高。
第三种是 zero-shot。模型完全没见过这些 task,也不给训练数据。机器人或模型来了之后,直接通过提示词驱动它完成任务。
我认为今年很重要的一点,是从 specialist 走向 generalist。现在大家更多还在做 specialist。
Zero-shot 今年可能还做不到。现在 generalist 我们也只能做到 30% 多,水平还很低。要先把 generalist 提升上去,才能谈 zero-shot。
所以今年模型会在 generalist 上有很大提升,解锁更多场景。
第二是场景选择。我们认为场景有几个特性。
第一,要是错误容忍的场景。今天做不到 100%,要允许犯错,或者有办法在犯错之后兜住。
第二,要是时间容忍的场景,不能有太强的节拍要求。因为可能做错,端到端方式也不能保证每 6 秒一定完成一次。
第三,要是有适度泛化的场景。如果场景特别 specific,非标自动化方案可能更好。
第四,要是长时间作业的场景,否则投资回报算不明白。
这四个条件是必要但不充分的条件。我们需要找到对时间和错误有容忍度、具有泛化性、又能长时间作业的场景,这些才是具身智能更适合落地的场景。
程曼祺
有什么这样的场景吗?
唐文斌
物流就是一个很好的场景。
物流的容错方式是,如果我们能做调度,机器人没干完、失败了,就让调度系统把任务送到人工那里,让人工接着干。
我们通过一套系统来支撑,不提供单机,而是提供一整套系统,让任务闭环。
这有点像滴滴或者 Uber 的网络:里面既有自动驾驶车辆,也有人和司机。机器人落地时,一定不完全是纯机器人的方式,而是一套系统。
机器人先干,没干完之后可以由远程人员接管,也可以从机器人工作站搬运到人工工作站,由人工接着干。通过各种方式,创造一个让机器人能够持续使用的环境,这个“温室”非常重要。
程曼祺
你说的这种方式,确实要设计整个系统,让客户觉得,即使让机器人试,也有可能试不出来,但对客户没有那么大的损失。
唐文斌
对。首先,兜底方案解决的不是 ROI 问题,而是闭环问题。
不能基线做到一半,机器人突然搞不定,变成异常行为,最后还得人处理。这样整个系统就不能连续、顺畅运行,只能做 POC,不是真正可被使用的产品。
第二个问题是把账算明白。要把整个系统的 total cost 算在一起,依然让客户的经济账成立。
程曼祺
你们现在已经开始做这样的实践了吗?
唐文斌
我们在做。应该会在今年年底拿出一些很有意思的东西给大家看。
程曼祺
现在竞争环境很激烈,很多公司在融资、PR,发布各种落地信息。你们到年底才放东西出来,会不会觉得节奏太慢?
唐文斌
我们的做事方法可能不太一样。我们的风格是技术信仰、价值务实。
一方面,我们也会放一些展示性的东西,让大家看到进展。但从真正落地的层面,我们要解决场景里的所有问题,而且账能够算明白。
这不是一个展示性产品,也不是一个 POC。但它的难度,比做一个可以展示的东西完全不在一个量级上。
所以还是回到刚才的问题:今天到底有多少具身机器人在被持续使用?
程曼祺
你怎么定义“被持续使用”?
唐文斌
就是一直在那里干活。每天开机 10 个小时以上,连续两个月都开着机,在真实场景里,并且有一定数量。
程曼祺
多少算有量?
唐文斌
就 100 台吧,随便拍一个数字。今天有多少个场景达到这种状态?
我认为可能几乎没有。
所以今天场景不在于广。场景落地和算法突破这两件事有一个夹角,不平行,但也不正交,有相关性,却不是完全对齐。
我们需要以最大的投入和坚定的步伐推动算法演进,通过算法和模型解锁一些场景。但解锁之后,不需要做得很广,不需要搞很多场景。
我们能不能找到两三个场景,在这两三个场景里真正做闭环?比如一个场景有 100 台或者 1,000 台机器人,持续为客户使用。我认为这才是真正商业上的落地。
程曼祺
你们最开始切入的场景,应该还是有积累的物流场景,是首选吗?
唐文斌
是。
程曼祺
硬件形态怎么考虑?会做人形机器人,还是服务于场景的其他形态?
唐文斌
我们当然也会做一些标准化形态,但最终进入场景时,完全标准化的形态很多时候并不适合。
它很容易走到两个状态:underkill 或 overkill。
比如到一个具体场景,标准化形态可能解决不了问题。相机安装位置或者末端伸进去时被卡住,就会出现这种情况。
另一种情况是,刚好这个构型能解决问题,但可能过度设计,导致成本偏高。
所以我觉得,完全标准化的硬件可能不是最好的方式。我们会有不同模块,进行组合。
我们内部的理念是:模型解锁场景,场景定义硬件。
程曼祺
我觉得这比“模型定义硬件”多了一个环节。有些公司,比如星海图,会说模型定义硬件,一脑多机。
唐文斌
模型其实定义不了硬件,因为很多时候硬件决定机器人的能力上限。
假设一个场景能不能用机器人解决,我们先看遥操作能不能搞定。如果遥操作都搞不定,算法再强也搞不定。
硬件决定机器人形态在这个问题上能够解决的上限。
程曼祺
遥操作其实已经体现了人的智力水平。如果人都搞不定,可能就是硬件本身的精度、负载或者其他问题导致的。
唐文斌
对。相当于用人的脑子加上机器人的硬件形态,决定这个问题可不可以被解决。剩下的事情再交给模型。
另外,进入具体场景时,经常要考虑 ROI,需要做很多冗余设计。但有些场景可能根本不需要。
比如有些场景,真的需要轮式双臂或者人形机器人吗?有时机器人甚至不需要移动。
现在的人形机器人也好、轮式双臂也好,重心都很高,不支持快速移动。可能开到 0.8 米每秒、1 米每秒就到顶了,因为一急刹车很容易倾覆。
但如果用一个小 AGV 把它送过来,AGV 可以贴地高速移动,开到 4 米每秒。那这个时候机器人站在那里就好了,不需要移动。因为重心太高,移动能力反而是冗余的。
所以看 ROI 时,需要根据场景选择硬件。但我们肯定不希望变成项目化,每个项目都定制硬件。
核心是把硬件做成模块化、拼接式的方式,能够快速组合成适合场景的形态。
程曼祺
相当于先抽象出几种基础模块,像乐高积木一样,再快速拼成不同东西。
唐文斌
对。
程曼祺
原力灵机比较特别的一点,是你们对外讲了很多行业基础设施的工作。比如之前发布的 RoboChallenge 测评,还有叫 DexBotic 的开发框架,以及 DeepFlow 工作流,而且都开放出来了。
一家创业公司为什么要做这些工作?
唐文斌
11. 开放基础设施加速行业
首先,开放出来本身对我们自己很有用。
模型公司或者具身智能公司最大的竞争力是什么?是今天模型效果好,还是别的东西?
所有模型都在交替向前、不断迭代,所以很重要的是迭代效率,而不是模型当前的状态。当前状态只是五十步笑百步,并不重要。
如何快速迭代,需要一系列基础设施,包括数据、训练、推理、硬件和评测基础设施。整个基础设施非常重要,这才是真正的核心竞争力。
我们发布的几个基础设施产品,比如 DexBotic,最初是因为我们内部要复现很多算法、比较算法、做大量实验。如何让这些实验有效进行,其实非常麻烦。
所以我们内部开发了一套框架,让所有人都可以在同一套框架上进行实验和比较,形成一种面向实验的 research 工具。
最开始它只服务内部,但我们觉得这类东西对所有 research 人员都有用,所以选择开源。希望更多人使用,也能反哺框架,让它更好,帮助我们自己跑得更快。
今天具身智能公司有很多家,我认为核心不是谁行、谁不行,而是这个行业多久能够整体变得可用。
最重要的是大家齐心协力,推动整个具身智能的发展,让算法和技术能力达到真正应用的水平和标准。这是今天这个行业能成立的最大 big if。
只要这件事能形成,就可以容纳很多家公司。但如果做不到,除了科研和文娱,就没有然后了,所有公司就都是泡沫。
所以我们开放很多东西,既是利他,也是利己。
RoboChallenge 也有几个目的。首先,它是对内的评测服务。我们做算法研发,需要很多评测,因为不知道哪个方向是对的。由于 sim-to-real gap 很大,需要基于真机的大规模测试,给算法提供信号,告诉我们该往哪个方向发展。
评测服务本身就是科研基础设施。如果没有 benchmark,怎么衡量进步?行业进步不了,我们自己也进步不了。
所以我们把它开放出来,用 benchmark 牵引大家一起提升算法 performance,衡量大家的 performance。
RoboChallenge 和 DexBotic 都是利他和利己的方式。
程曼祺
逻辑上确实如你所说,现在行业里都是创业公司,大家要一起把行业往前推。
但另一方面,创业公司之间融资和人才竞争也很激烈。大家可能不想用你们开发的东西。RoboChallenge 最近你们自己发布模型之后,在两个榜单上都是第一,也有同行觉得这样不公平。
唐文斌
我们内部也纠结过,但后来觉得没什么。
所有测试都是公开的。大家想复现我们的分数非常简单:下载 DexBotic 框架,下载 D-M0 的 code,然后提交 RoboChallenge,就能拿到那个分数。
我们公开了每个 task 上 fine-tune 的细节,包括 generalist 版本的细节,全部公开,可以直接复现。
所以我们觉得自己交不交,其实也不本质。后来和一些同行聊,大家也认为,既然都公开、都可以复现,这件事就不本质。
RoboChallenge 的初衷,并不是形成一个榜单让大家 PK,而是建立好的 benchmarking,衡量当前技术阶段和状态,在牵引下共同进步。
今天我们可能是第一,但很可能两周之后,某家公司提交一个模型,比我们更好,这完全有可能。
程曼祺
旷视之前也开发过 MegEngine,天元框架。但相比 PyTorch、TensorFlow 这样的框架,天元生态没有那么活跃,比较小众。
MegEngine 实际上达到了你们说的利他、利己吗?利己可能比较明确,利他的目的达到了吗?现在重新做这件事,是怎么想的?
唐文斌
MegEngine 是当年做 CNN 框架。我们最早只有 Caffe 和 MXNet,TensorFlow 也还没出来,所以没有一个好的框架。旷视刚开始做深度学习时,就觉得要自己做框架。
我们 2013 年就做了这一套框架,那个时候还没有 PaddlePaddle、PyTorch、TensorFlow。
但当时我们没有理解开源的方式。我们觉得自己做了一个很好的引擎,自己用就好了。等到想开源时已经是 2018 年,那个时候其实已经没有什么意义了。
基础设施要变得有影响力,被更多人使用,并通过开源力量一起建设,核心是要早。
程曼祺
所以现在开源 DexBotic,是因为当时 MegEngine 开源得太晚了?
唐文斌
对。今天没有太多人在做这件事,我们正好做了一个自己觉得很好用的东西,也愿意开放出来。大家不一定非要用,愿意用就拿去用。
程曼祺
具身模型的开发和实验,具体有哪些区别,导致 PyTorch、TensorFlow 不太支持或者不太好用?
唐文斌
DexBotic 其实是在 PyTorch 之上的一层,不是 replace PyTorch,而是提供更多面向具身智能的工具。
我们一开始不叫它框架,叫 toolbox。里面内置了一些功能。比如模型定义可以通过配置化方式完成,可以选择不同的 VLM 基模、vision encoder、Action 模块,也可以选择 diffusion 等不同方式。
这样做实验更方便。
第二,我们统一数据格式、部署方式。本地训练、云端训练都可以比较容易。它是一套工具,让很多事情变得更方便。
现在 DexBotic 更面向 VLA 和模仿学习。我们原来还想加入强化学习相关知识,但后来发现 RLinf 已经把强化框架做得很好了。清华的汪宇老师、吴文昕等人做的 RLinf,本来是面向通用强化学习,现在也在面向具身强化学习。
后来小强和汪宇老师、于超老师等人交流,觉得大家可以一起做。我们偏模仿学习,他们偏强化学习,两边现在已经打通了一些接口,未来有可能合并成一个更大的 project。
我们开源,也是希望更多人使用。如果觉得好用,可以在使用过程中 contribute 回来,让它变得更好,对我们自己也有利。
程曼祺
你们是 2 月刚开源的,现在社区活跃度和参与度怎么样?
唐文斌
我们在 10 月开源了 1.0 版本。现在应该有 1,000 多个开发者,外部开发者有 1,000 多个,也有不少高校在用。
程曼祺
吸引到什么同行了吗?知道有什么公司在用吗?
唐文斌
千问在用。我们之前也和林俊阳沟通过,他过来交流过,他们那边应该也安排了同学使用 DexBotic 做开发。
程曼祺
这又回到刚才的问题:很多大厂也在做 VLA、具身模型,林俊阳的团队也在探索这个方向。
唐文斌
但目的不太一样。阿里也是我们的股东,我认为它不是要自己跳进去成为一个 player,而是希望做好基础设施,做更好的 VLM,support 更多人做 VLA。这是它的战略定位。
而且它做也没关系。这个行业足够大,容得下很多玩家。
程曼祺
历史上有没有创业公司,早期就做面向行业的基础设施,后来取得比较好成果,或者形成了比较活跃的生态?
唐文斌
挺多的。比如 Databricks,Hugging Face 也算。Android 曾经也算是创业公司做的,当然比较早就被 Google 收购了。
Red Hat、Linux 系列,还有很多数据库,比如 MongoDB,以及很多消息队列,都是在整个开源体系下成长起来的。
程曼祺
DexBotic 的 code 量其实没有那么大,你们没有花太多精力吗?
唐文斌
我们还是花了挺多精力。
开源是大家增加信任感的一种方式。我把 code 都给你了,你可以自己改;不想合并到主线也没关系,拿去用就好了。
程曼祺
具身智能领域,包括测评和开发框架,大公司没有推出相关东西吗?相比于你们自己开发、开放给全行业,另一种选择可能是直接使用大公司的生态,比如英伟达也经常这么做。
唐文斌
我觉得现在还没有特别好的。
也许有公司会想做,但大公司愿不愿意投入力量还不确定。RoboChallenge 和 DexBotic 的工作量都很大,不是一朝一夕的事情,需要一帮很强的人认真做,而且要有足够好的分享精神。
程曼祺
长远来说,具身智能行业会是什么样的格局?规模有多大,集中度和产业链分工大概怎么样?
唐文斌
我觉得它会是一个逐渐演进的过程。在一段时间内会有比较多的公司,因为细分场景非常多。
在模型还不能统一的情况下,会有很多公司存在,做很多 vertical,这是第一阶段。
第二阶段,随着 AI 1.0 公司和大模型公司的能力逐渐集中,模型能力变强,小模型的能力被大模型吃掉,做 vertical 的公司会慢慢变得困难。
然后进入集聚阶段,出现平台型公司:可以以模型为平台,以本体为平台,自己做一些 vertical 场景;也可以把本体和模型以合适方式提供给更多应用公司去做场景落地。
最后可能个位数家公司就够了。
程曼祺
个位数是全球,还是中国?
唐文斌
我认为大部分公司可能会在中国,因为这件事和硬件强相关。具身智能比大模型更有中国优势,也更应该由中国公司来做。
程曼祺
硅谷获得大额融资的具身智能公司也不少。
唐文斌
但它们硬件迭代效率很低。模型可能做得好,但硬件迭代效率低,所以有可能成为以模型为核心的公司。比如 Pi 可能想做这种事情,也有可能被收购。
回到未来判断,当模型能力不断提升,变得更加通用和泛化时,整个事情会变成全栈。我们需要一个硬件载体提供产品形态,那时可能不需要那么多公司。
程曼祺
怎么样才能成为最后剩下的不到 10 家公司之一?
唐文斌
核心还是两点。
第一,模型能力领先是一切的根基。就像造车,最终是产业链整合,不需要自己开发每一个轮胎、每一个车架,产业链会有很多供应商协同研发。
但谁能让机器人更有灵魂,让它有一个好的大脑,成为智能、有用、可信赖的机器人,在场景中真正解决问题,并把商业模式跑通、把数据飞轮转起来,这是最关键的。
所以第一是模型能力和模型智商。
第二是在场景中形成更多人的使用,让机器人长期被使用,形成数据飞轮,再用数据飞轮反哺模型能力提升,形成竞争力。
程曼祺
大概到什么量,才算数据飞轮转起来?
唐文斌
如果量化描述,我觉得一个场景 1,000 台。
首先要有量,还要逐渐拓展到更多样化场景和任务。但在机器人能够做 100 件事之前,能不能先让它做成 1 件事,并且在这件事上批量应用、持续使用,我认为非常重要。
所以 1,000 台可能是一个门槛,针对能够持续使用的机器人。
程曼祺
之前我们和竹间智能创始人张威聊,他觉得如果现在就让机器人落地,可能先这样增长,最后到一个上限。因为花了很多精力优化场景,没有把更多精力放在模型性能提升上。等它变聪明之后,可能一下子解开一大片场景。
唐文斌
我认同。
落地和模型是夹角关系,目标并不完全对齐。模型要追求泛化性和通用能力,大模型最后一定会吃掉小模型,而不是针对场景 customize 一个模型。
但做落地时,应该用现在这个奔着通用能力去的模型,而不是针对场景 customize 一个、overfit 到场景的模型。否则就回到了做项目的逻辑。
程曼祺
你是通过这种方式平衡:用现阶段、奔着通用能力的模型去做落地,再靠其他方式补能力。
唐文斌
对。我们需要找容错场景,也需要其他工程能力去补。
具身智能公司要警惕变成“小老头公司”。就是最后变成一家做项目的公司,每个项目都 customize,原来是非标自动化公司。
程曼祺
为什么叫“小老头公司”?
唐文斌
因为长不大,但存在时间很久,也比较难倒闭。
我们成立原力灵机,核心就是追求通用化机器人的状态。我们会从一些场景开始,但不是只解决单一场景,而是希望走向通用机器人,在更泛化的场景和任务下,具备更通用的能力。
这个机会是存在的。所以算法和模型能力是第一要务,第二要务才是阶段性商业化。
阶段性商业化同时实现数据飞轮,要把两件事变成正相关。
程曼祺
阶段性落地后,才能获得数据,提升模型能力。
唐文斌
对。
程曼祺
现在整个具身智能行业非常火热。作为身处其中的人,你觉得有什么值得大家提前未雨绸缪、给行业一些提醒的地方?
唐文斌
现在大家的预期被拉得很高,我觉得这是好事。
程曼祺
你说的大家,指的是投资人和资本市场?
唐文斌
对。资本市场把投资人的预期拉得很高,但投资人也知道这里面有很多泡沫。
这是好事,因为它吸引更多优秀的人进来解决问题,让技术发展得更快。
技术上的很多事情可能需要时间。我觉得既不能短期太乐观,也不能长期太悲观。自动驾驶、早期深度学习、大模型,都经历过 Gartner 曲线。
现在大家的预期还在上涨。最后大家会问,落地真的被用起来了吗?所有投资人都很聪明,也知道现在还没有真正被大量使用,但他们仍然在投资,因为相信这件事。
这是一种模糊的正确:他们认为长期方向可以落地。经过这个过程后,真正务实、把数据飞轮跑起来、能够落地,同时坚持推动技术发展的公司,会走到最上方。
程曼祺
你觉得具身智能什么时候可能经历类似自动驾驶在 2018 年到 2019 年的沉寂期和低谷期?
唐文斌
不知道,这取决于很多事情。
自动驾驶在 2018、2019 年的状态,是因为当时技术上似乎没有变化,Waymo 那条路线没有像大家想象中演进得那么快。那个时候 Transformer 还没有开始,所以本质上是信心问题。
今天大模型给了我们很多惊喜,让我们在信心上有了很强的建立。
第二,机器人的商业化比自动驾驶更容易。当然,如果要 scale,可能更难,但取得阶段性的商业化成果更容易。
这两件事情叠加起来,也许机器人会更平滑一些,总会有阶段性成果释放出来。
但从业者要知道自己处在哪个阶段。模型到底是什么水平?大家发布了很多视频,这个 demo 是从 30 次失败里挑出的 1 次成功,还是当前真实水平?
我们要看以什么速度更快迭代,走向心中想达到的状态。阶段性商业化是否真的被使用,是否形成数据飞轮?
今天很多收入可能来自数据采集,大家卖出去的东西都是做数据采集,并不是真正落地,也不是真正有效的价值转化。我们还是要清醒地看待这些问题。
程曼祺
如果具身模型性能进展速度不如预期,可能是什么原因?
唐文斌
可能是数据原因,也可能是模型结构需要新的结构。
但我相信,有这么多资金和人才涌入,这个领域的发展还是会比较好。
程曼祺
如果信心进入相对低谷期,你们有什么提前准备?有什么 Plan B?
唐文斌
第一,准备好足够多的干粮。很多具身公司今天都在做这件事,头部公司融到很多钱,要先把弹药储备充足。
第二,要 bet 在自己真正相信的事情上。即使弹药多,也经不起分散式开枪,还是要专注在真正 believe、真正想 bet 的地方。
第三,如果技术上需要一段摸索期,就和行业一起摸索。在有粮食、有业务的情况下,我认为可以度过这段周期。
但我现在非常相信,这一波技术变革能够走向通用机器人。
程曼祺
你之前也经历过创业过程中的起伏和行业低谷。进入低谷时,心理状态和团队氛围是什么样?
唐文斌
我们团队心理上没有太大变化,因为内心相信的事情是一致的。我们没有跟着市场情绪,一会儿很兴奋,一会儿很低落。
主要是资本市场上的感受:低谷时融资很难。旷视历史上有几次融资都发生在低谷期,融资过程比较挣扎。
这也是一个教训:如何在情绪好、时间合适的时候储备足够弹药,同时专注地把弹药打在真正相信的事情上,而不是开散弹枪。
从团队角度,如果内心真正相信、坚定,我认为没有太大变化。我们做的事情还是那些事情。
程曼祺
成立原力灵机之后,你们曾经对什么事情 say no?拒绝做什么事情?
唐文斌
挺多的。
比如表演类的东西,我们会 say no。有人找过我们,很多合作伙伴和客户也有需求。但这和我们想打造有用的机器人不太一样。
情绪价值也是有用的,我并不是在抨击这个方向,只是和我们选择的方向不一样。我们真正想追求的是让机器人作为生产力,能够解决真实问题。我认为这是最大的需求和市场。
程曼祺
有几家公司花了几千万到 1 亿元上春晚参加表演,其中有些也不是主打表演方向。你觉得这算分散开枪吗?你们当时讨论过要不要上春晚吗?
唐文斌
我们不会。我们走的不是表演路线,春晚上的机器人大部分还是表演型。
程曼祺
还有别的吗?
唐文斌
还有和汽车相关、和汽车产线相关的场景。
我们有很多汽车产业链上的朋友,包括千里本身也有汽车厂。但我认为汽车场景非常不适合,因为它是高度错误不容忍、高度有节拍要求的场景,这两个问题都非常难。
大家觉得汽车厂可能是最好的场景,特斯拉在讲这个故事,Figure 也在讲和宝马合作。但我认为汽车厂不是好场景。
程曼祺
这是因为你们以前做物流机器人时,也服务过一些汽车工厂吗?
唐文斌
对。我们服务过,也觉得很多判断还是要去现场看。
想象中可能是一个 pick and place,从这头拿起来放到那头。但到了现场,你会发现包装形态、商品形态、辅材、位置限制、容器限制等,最后可能和想象完全不一样。
所以要有现场感,才能判断这个东西。
程曼祺
你刚才总结提前应对低谷的两个点,一个是足够弹药,第二是不要分心,把资源投到相信的事情上。这个和旷视的经验教训有关吗?
唐文斌
有关。旷视原来做了挺多事情,我觉得不够专注。虽然人才密度很高,但依然被稀释了,因为做了太多事情。
有些是主观原因,大家想 battle 的方向不一样;也有客观原因,比如做了盈利性比较好的业务,但市场规模有限。
所以形成了加法模式。但商业上,A 加 B 加 C,基本上约等于 max(A、B、C),也就是取最大值。
创业还是要 battle 在真正相信的事情上,把事情 make it happen。我认为这是最重要的。
如果再来一次,我们应该不会开那么多方向,应该让更多人集中力量做一两件事情。
程曼祺
上一轮 AI 热潮里,真正值得集中力量做的一两件事情是什么?
唐文斌
我觉得每一件事情可能都值得做,只是我们每一件都做得不够深。
当时有视觉、自动驾驶、安防、机器人,也有手机相关场景。每个场景深入下去,可能都是一个很大的公司。
但我们把它们做成了加法。虽然也有一定规模,也做得还可以,但还是分散了太多方向。
程曼祺
你觉得具身智能行业现在有什么被忽视的真问题吗?
唐文斌
我想想。今天真问题很多,我觉得模型和场景都是。
模型方面,大家的水平还没有达到接近可用的状态。比如大家看到 Figure 的视频,看起来很酷,感觉机器人已经可以进家庭做保姆。
程曼祺
3D Robotics 的视频也很震撼。
唐文斌
但我不认为现在的机器人已经达到可以进家庭做保姆的状态。它可能只是很多次失败中的一次成功。
所以我们需要更客观地看待现在的技术水平,更坚定地一步一步推动技术发展。
第二是落地。根据我们过去的经验,POC 和真实场景、真正落地之间,至少还差 80%。因为 POC 只需要验证成功时是什么样,失败时会怎么样,很多问题不需要解决。
真正落地需要机制,让机器人变成一种自动化机制。所以大家对落地也有巨大的 gap。
这不一定是被忽视,而是一个大家不太愿意暴露的问题。
程曼祺
我记得我和一位具身智能公司的 CEO 聊过,他说:“我特别想给这个行业泼点冷水,但又怕泼得太狠,把火泼灭了。”
唐文斌
我跟他说,客观地看待这件事,确实现在大家的预期被拉得过高,但很多进展的斜率依然非常陡。
所以预期虽然被拉高了,但事实也在快速追赶预期。
程曼祺
从 2026 年到 2027 年,你希望原力灵机达到什么状态?
唐文斌
今年技术层面的目标是,在泛化性上下功夫。算法目标会放在 multi-task 和 generalist 模型的成功率上。
现在只有 30% 多,我们今年的目标非常激进,但也看到了很多 signal,觉得有巨大的提升空间。
第二个目标是把场景上的数据飞轮转起来。我们定的目标是,一个场景,1,000 台机器人。
程曼祺
2026 年实现?
唐文斌
对。
程曼祺
你们现在其实没有展示过硬件,我印象中是这样。
唐文斌
我们有硬件,只是不展示。也没有必要展示。
我们现在关注两件事:第一,模型能力提升;第二,在真实场景中持续被使用,而不是做 POC,要有规模化的持续使用。
程曼祺
按照你之前的定义,1,000 台至少每天开机 10 小时以上,在真实生产或服务场景里使用。
唐文斌
对。
程曼祺
有哪些问题你现在还没有答案,但觉得很重要?
唐文斌
太多了,我有很多问题都没有答案。
比如现在大家讲 System 2 和 System 1,也就是大脑和小脑。大脑的输出如何作为小脑输入,真正提升 VLA performance?中间应该用什么表示,输入什么信息,现在不知道。
第二,数据到底怎么 scale?靠视频数据、egocentric 的人类第一视角数据,还是仿真数据?哪条路最能带来 scale 的效果,也不知道。
有很多未解之谜。但每个方向上都有同行在努力,我们也有自己的技术 bet。
程曼祺
从 2016 年之后你开始做机器人,到现在独立做一个业务,你发现自己有什么不一样的特质?
唐文斌
过去做产品和场景时,需要一种能力,叫 AI 技术产品经理。
以前做深度学习,算法往往不能 100% 满足场景。业务人员对技术有两种期待:一种觉得技术无所不能,另一种觉得技术什么也做不了。
但实际上,技术既不是无所不能,也不是一无是处。中间需要一些 workaround,让技术恰好被用起来。
程曼祺
现在大模型领域也很流行,从最开始的 RAG,到后来的 context engineering、environment engineering。
唐文斌
对。所以需要一个桥梁型的人,既懂技术,又懂场景。
不管在旷视还是今天,我们依然需要很多人,既知道技术能力的边界,又能在场景里思考客户价值。
旷视历史上培养出了一些很好的 AI 技术型产品经理。
程曼祺
你觉得你也是这样的人?
唐文斌
我也是充当这个角色。我认为自己是一个大的 AI 技术产品经理。
最后这会变成一个大工程。基础设施之所以重要,就是要把应用侧的数据飞轮带回来,连接到整个 research pipeline,让大家更快迭代算法,再通过评测挑选好的模型,应用到整个场景。
这最终也是一个巨大的基础设施工程。整个系统如何设计,可能需要我来做。
程曼祺
到现在你整整创业 15 年了。如果相对感性地形容,这一路是什么感受?
唐文斌
我非常感谢这个时代。
我们经历了一波又一波技术变化的浪潮,看到很多原来认为不可能的事情,今天在技术上变得可能。
最早我们说人脸识别能够抓坏人,绝大部分人都投了反对票,觉得这件事不可能实现。但今天这已经是非常容易的事情。
再到自动驾驶、机器人、具身智能、大模型,我很感谢自己遇到了这样的技术浪潮,也在这个过程中不断兴奋,想参与进去,实现一些内心的人生目标。
我感谢这个时代,也感谢这些技术变化。
程曼祺
相当于创业 15 年中间,已经有三四波让你很想投入、很兴奋的技术变化。
你有没有一个特别长期、想实现的技术理想?
唐文斌
我跟你分享过,印奇当时说他为什么选自动化系。他觉得“自动化”这个名字,是最接近 AI、最接近机器人的专业。
我们从旷视开始,就希望让机器人看懂世界。后来做物流机器人,我自己内心一直非常希望做机器人。
不知道你有没有来过旷视办公室。
程曼祺
我知道。你刚才说这段,我就想到了旷视办公室门口的那个机器人。
唐文斌
我们第二次搬办公室时,让行政买了一个机器人放在前台。这个机器人到现在还在旷视前台。
因为我们内心真的想把机器人打造出来。我觉得今天具身智能是一件值得投入 lifetime、投入所有时间去做的事情。
程曼祺
好,今天非常感谢文斌做客晚点聊,分享了从旷视到现在整个 15 年的创业经历,尤其是原力灵机这一次成立看到了具身智能怎么样的机会,以及团队已经做了哪些事情,在模型性能、场景落地上有些什么样的思考和实践。
唐文斌
嗯,谢谢。
程曼祺
本期连点呈现分享和往期节目中的两个呼应。第一,在 4 月初发布的第 157 期具身智能 2026 年 Q1 季报中,我和 Peter 聊到了 Sharp 在 2026 年初 CES 上提出的三层结构具身智能系统,这和唐文斌这一期提到的三层结构构想非常相似。我们当时讨论这个话题,是在聊 OpenAI、Google、字节这样的基础大模型公司不能做,而只有具身智能公司才能做的独特问题和领域。
唐文斌说,在 System 2,也就是负责宏观任务规划的这一层系统上,大语言模型非常擅长。现在大部分具身系统也有赖于大语言模型和多模态基模的能力;而涉及更精细动作的 System 1 和 System 0,则是软件和硬件更紧密结合的地方,是具身智能创业公司可以努力的空间。
这个想法也类似于第 155 期中智简动力创始人贾鹏所说的 physical agent,也就是物理 agent。他认为,本质上来说具身智能就是一个物理 agent。在这个大的 agent 系统里,基础模型是底层,而如何把基模的能力用好,是具身智能公司可以做的工作。其中重要的一种方式,就是获得真实使用场景下的反馈和数据,然后反哺整个具身系统的提升,这也是具身智能公司可以建立竞争力的地方。
第二个想分享的是场景选择上的对比。在第 155 期中,贾鹏说他觉得当前适合具身智能机器人的场景,是端到端的场景和任务,也就是任务从头到尾都可以由机器人完成。他当时举的例子,是在工厂里做比较灵活、柔性的搬运或者上下料工作。
而这一期里,唐文斌有一些相反的想法。他认为要找那些人可以兜底的场景,通过系统层的设计,让机器人干不了的活、机器人干错的活,人可以接着去干。物流就是这样一个例子。在庞大的物流调度系统里,既可以接入已经存在的各种自动化设备和人,也可以接入更加智能的新具身智能机器人。
在单机智能尚未达到极强通用性和泛化性的现在,落地仍然可以进行,因为机器出错时,可以通过系统调度和优化,让其他设备或人来接管,同时通过系统和工程工作,让整个体系的效率和投资回报率保持在对客户来说比较合理的空间内。
两个人对场景的描述也有共性,就是都希望找节拍没有那么快的任务。之前第 154 期节目中,千寻创始人韩风涛也提到,现在适合机器人去做的任务,对节奏和速度的要求不能太快。
这些对于先去什么场景落地的不同思考和选择,会逐渐成为具身智能公司之间的差异来源之一。本期节目就到这里,欢迎收听。如果你对今天聊的话题有观察、好奇或疑问,欢迎在评论区分享想法,这也会成为我们节目的一部分,让整个讨论更完整。你也可以把我们的节目分享给对这个话题感兴趣的朋友,欢迎推荐更多你想听的主题和嘉宾。你可以从小宇宙、苹果 Podcast 等渠道关注《晚点聊 Late Talk》,也欢迎关注我们的公众号《晚点 Late Post》,下期再见。