卫诗婕
我最早知道你,大概是在今年年初的时候,是我一个投资人朋友特别推荐的。他当时的原话是:“有一个特别厉害的人,主导了华为自动驾驶的量产,然后他现在搞具身智能了,非常火,投不进去,项目很贵。”
现在半年之内批量出现了这么多具身创业公司,是不是意味着具身创业的门槛其实不高,好像人人都可以做?
黄青虬
我们成立了半年,但是我们花在算力上的投入,可能至少能排到行业前5名。从这个现象你就可以看到,大家在算法上的投入,其实没有跟这个行业的热度形成匹配。
卫诗婕
2023年、2024年已经出现了各种各样估值非常高、看起来非常成建制的团队,为什么2025年、2026年还在不停出现具身创业团队?
别人已经宣称量产了,已经部署到真实场景当中,也有7×24小时作业了。你这个时候交付原型机,你不焦虑吗?
黄青虬
过分的 overclaim 其实没有太大的意义。如果一个东西不能一致、可靠地运行7×24小时,不能生产1万台,而且每一台之间都是一致的,那在我看来,它就是原型机。
卫诗婕
哈喽大家好,我是诗洁。今天的访谈是具身领域一个水下明星项目的初亮相。从去年年底开始,这个项目是具身领域投资人们纷纷约见和抢注的对象,成立仅半年完成十亿元天使融资,背后站着一众明星机构,创始人是华为天才少年,曾主导华为自动驾驶从零到一并经历完整四代迭代的主导人黄青虬。这是一期非常精彩的访谈,他能解答一个问题:为什么在2026年,具身浪潮已经狂飙三年,赛道林立着上百家初创公司之后,这个行业仍然有属于新人的机会?欢迎青虬,嗯,你是哪一年出生的?
黄青虬
我是1994年1月份。
1. 华为天才少年扎堆创业
卫诗婕
我采访过的几个嘉宾,后来发现都是和你同期的华为“天才少年”。有行云的创始人纪宇,还有零次方的联创陈元培。
我后来发现,20级华为“天才少年”是一个非常神奇的存在,里面有好几位都加入了具身创业的大军,而且都是非常明星的企业,比如智元的彭志辉、踏实的丁文超。
所以你们在华为的时候有交集吗?
黄青虬
跟彭志辉没有交集,但是跟丁文超有一些交集。我们俩几乎是前后脚进的华为,还特别有缘分。当时座位不太够,我们俩就在同一个会议室办公。
卫诗婕
你对他有什么评价?
黄青虬
我觉得丁文超是一个非常聪明的人,我也从他身上学到了很多东西。之前我可能更多是偏做感知的背景,他更多是偏做规划控制的背景。从理解整个系统的角度,我觉得还是从他身上学到了很多不一样的东西。
卫诗婕
你们俩组合起来,就构成了一个机器人的反应和决策。
黄青虬
基本上正好把机器人里面最重要的两块拼起来了。
卫诗婕
这几个华为“天才少年”下场做具身的消息,你最早是什么时候知道的?
黄青虬
大家其实也是陆续出来的,但都是在新闻上看到的。不过目前为止,我应该确实是最晚的。
卫诗婕
你为什么是最晚的?
2. 他为何等到2025年创业
黄青虬
主要是我在华为可能还有一些未尽的使命。当时我们在做整个智驾的端到端,从大家陆续下场、最火的那一年,也就是2023年,我们开始做一些端到端的研究,到最后2025年真正把它做成商用量产,其实经历了整整1年半的时间。
为什么我会留下来做这个事情?大家都会说,2022年、2023年的时候,ChatGPT 出来了。但在我看来,GPT 解决的是一个虚拟世界的问题,大模型跟具身智能本身还是有一些本质区别的。
举两个例子。第一个,大模型其实是轮次式的对话,晚几秒回答也没有问题,但是具身智能或者汽车其实是一个实时系统,你必须每一刻、每一分、每一秒都在做决策。
第二个本质区别,就是具身智能或者汽车是一个闭环系统。你的每一个决策都会影响环境,比如你开得快,旁边的车可能就都不敢进来;你开得慢,别人就会加塞你。但是大模型回答问题的时候,周围的环境是保持不变的,等你回答完之后,下一轮交互发生,环境才会变化。
这些区别导致我觉得,可能光有 GPT 还不足以支撑具身智能这件事做成。还需要有一个 AI 真正搞定闭环系统,去驱动底层控制系统。这样一条链路真正得到验证之后,具身智能这件事才有可能发生。
我觉得我正好就在干这个事情,所以应该留下来把它做完,把它推到商用量产。可能那个时间点,我觉得是更合适的点。
卫诗婕
2023年彭志辉出来做智元的时候,你当时应该是在新闻上知道的。你当时心里面有没有想过,要不要出来创业?
黄青虬
我当时完全没有想。第一个是,我完全沉浸在自己的项目里面。第二个就是,那个时间点就像我刚才讲的,我觉得可能还不是特别好的时候。
我会发现,这些底层技术还没有到 ready 的状态,或者说前置技术还没有得到验证。具身智能技术爆发的时间点,可能还差那么一口气,所以我觉得可能需要再缓一缓。
卫诗婕
你什么时候看到具身智能的爆发节点已经到了?
黄青虬
有两个点。第一个,其实是大模型从 GPT 出来之后,又一路发展到 coding,再发展到 agent。
第二个,就是真正在智驾里面把一段式端到端做出来:输入一个图像,输出一个控制信号。你会发现,用 AI 去做这件事是 work 的,而且是可泛化、可大规模商用的。
那个时候我发现,这两个技术一结合,高层的语义理解和低层的控制系统,其实都可以用一个 AI 系统去驱动。我觉得这个时候,可能是做具身智能更好的时间点。
卫诗婕
这个时间点发生在2025年?
黄青虬
2025年。
卫诗婕
2025年的什么时候?
黄青虬
年中、下半年。
卫诗婕
然后你就出来创业了?
黄青虬
是的。
3. 墨甲智能正式成立
卫诗婕
给大家介绍一下你的创业公司。是2025年底成立的吗?
黄青虬
对,我们是2025年底成立的。成立到现在大概半年多一点的时间。我们叫墨甲智能。“墨”取自墨子,墨子是我们所说的制造机器人的祖先,我觉得它是具身智能的一个起点。
“甲”取自起点和爆发,也就是宇宙大爆炸。我们希望这家公司能从最原始的原点走到爆发的起点,所以取了这么一个名字。
卫诗婕
这是个冷知识。最早的机器人是墨子?
黄青虬
墨子生活在战国时代,制造过各种工程器械,也制造过很多用于打仗的装备,以及运输粮食的装备,用到了很多战场上。
卫诗婕
这个名字是你自己想的吗?
黄青虬
是我想的。
卫诗婕
所以你的文科怎么样?
黄青虬
我的文科一直还算不错。我爸爸是一名语文老师,从小就会教我背古诗,包括我的名字。
“青虬”来自一首古诗《长安古意》里的“青虬紫燕坐春风”,是我爸爸因为喜欢这首诗,给我起了这么一个名字。从小我确实比较喜欢这些文学知识。
卫诗婕
所以“青虬”有什么寓意吗?
黄青虬
第一个寓意当然是龙。“虬”其实是龙的意思。龙生九子,最小的那个儿子叫虬。我爸爸希望“望子成龙”,但希望是最小的那个,不要太张扬,所以取了这么一个名字。
“青”是青出于蓝的意思。
4. 具身创业成功门槛很高
卫诗婕
很有意思。但是你刚才提到,觉得2025年是一个比较成熟的具身创业时间点。我们也看到,从去年开始,成批量的具身创业公司出现。
我很好奇,源源不断地批量出现这些具身创业公司,是不是意味着具身创业的门槛其实不高?好像人人都可以做。
黄青虬
我觉得创业在现在这个时代,创业的门槛是不高的,但是创业成功的门槛很高。
我自己会认为,具身智能是一个非常复杂的系统,既涉及硬件,又涉及软件,整个垂直整合的能力需要非常强的人,才能把这件事做成。
卫诗婕
我看到一批美元基金投资人,非常喜欢投自动驾驶体系出来的创业人才。因为他们觉得,自动驾驶的系统工程能力、商业化运作能力和节奏把控能力,能够让这些人在具身智能的浪潮当中有比较好的表现。
黄青虬
我自己也比较认可这个观点。做了这半年之后,你会发现整个具身智能的技术栈,或者说系统架构,其实跟自动驾驶特别特别像。
当然,除了自动驾驶,从硬件再往上,怎么构建一个低延时、高动态、软硬一体的系统,这是最底层的,这跟智驾是一样的。
再往上一层,你的算法输入都是图像,输出都是动作,这样一个映射本身也比较像。再往上一层,你怎么构建一套数据闭环系统,从数据收集、清洗,到自动化标注,再到训练和评测,这一套云端算法其实也很像。
所以我觉得这两个领域有很多可以借鉴的方法论。
卫诗婕
我最早知道你,大概是在今年年初,是一个投资人朋友特别推荐的。他当时的原话是:“有一个特别厉害的人,主导了华为自动驾驶的量产,然后他现在搞具身智能了,非常火,投不进去,项目很贵。”
黄青虬
我们出来之后确实受到了大家很多关注,包括当时我离职的消息被曝光之后,微信都被加爆了,很多投资圈的朋友找过来。
我觉得确实是一个比较好的时代,有这么多人的支持,让我们能有足够的资源去完成自己想做的事情。
卫诗婕
听说你们半年内完成了超过10亿元的天使融资。
在投资市场上这么火爆、这么被认可,这在你的意料之中吗?
黄青虬
完全出乎我的意料。我没有想到大家会这么热情。
卫诗婕
这是你人生中第一次受到如此热烈的追捧吗?最早可以追溯到什么时候?第一次有很多人关注你,可能是华为“天才少年”之前的高考?
黄青虬
高考。当年我的分数考得比较好,算是市里的状元。
卫诗婕
哪个市的状元?
黄青虬
汕头市。这可能是第一次。第二次可能就是华为“天才少年”,这个 title、这个标签也比较吸引人。第三次可能就是出来创业,被这么多投资人追捧。
卫诗婕
被这么多投资人追捧,有压力吗?
黄青虬
我觉得整体还好。所有事情都是有两面的,有更多人关注你,意味着你可以有更多资源。当然确实也会有压力,大家都盯着你。如果做得不好,负面反馈也会来得更严重。
卫诗婕
如果给这次创业的信心打一个分数,你觉得会是多少分?
黄青虬
我还是非常有信心的,至少有90分。
卫诗婕
投资人问过你类似的问题吗?
黄青虬
投资人好像没问过。他们可能默认觉得我能做成。
卫诗婕
最新一轮的投资机构非常豪华,包括阿里、腾讯、蓝驰、君联、高榕、中科创星、源码,基本上组合了互联网大厂、一线财务 VC,以及专注硬科技的机构。
这样的组合是你刻意挑选的吗?
黄青虬
我们跟投资圈的朋友也算是双向选择,做了很多筛选。首先,我们觉得这是一个比较长期的赛道,也是一个超大市场、超长赛道,所以需要有更大的耐心。这可能是我们筛选的首要标准,希望这些投资机构对这个行业也有比较深的理解。
卫诗婕
所以你是可以挑机构的?
黄青虬
至少目前为止可以。
卫诗婕
你们跟星尘智能、银河通用、踏实这一类公司很像,可能不是最早创业的,但是因为有非常优秀的创始团队履历和很高的背书,所以有很多钱可以选择。于是先组钱、组团队,然后慢慢打磨技术,是这么一套模式吗?
黄青虬
我觉得整体基本上是这个模式。要把一件事情做成,无非是两个最重要的资源:第一个是资金,第二个是人才。背景履历比较好的团队,应该都会以这条路径去走。
卫诗婕
含着金汤匙的团队,就真的能够发展得很好吗?而且这样的组合好像在行业里面非常多。
黄青虬
首先回答你第二个问题,这一定能成功吗?肯定未必。所谓的“金汤匙”,其实只是你的起点。
刚才我也讲了,我觉得具身智能这个赛道其实是一场马拉松。在跑马拉松的时候,起点相差几个身位并不是很重要。百米冲刺才需要把起跑线严格对齐。
更多决定你能不能做成的,还是后期团队能不能长远发展,能不能持续构建一个有凝聚力的组织文化。每次技术范式转变的时候,你能不能有判断力,有足够的审美去跟上,这些都是非常至关重要的因素。
但为什么会出现你刚才说的现象?我觉得核心还是因为这个赛道确实太卷了。你会明显看到,可能在6、7年前,并不是这样的组合。
比如宇树,可能在3、5年前,大家要求确实有一些商业化背景,有一些科学背景,但可能不要求有产业化背景。3、4年前有一波公司是这样的,但到今天再出来,大家可能觉得除了商业化背景、技术背景,还需要有工程化、产业化、产品化背景。
所以大家的要求越来越多,整个团队画像就会趋同,最后变成一个水桶型的组合团队,也就是没有短板。
卫诗婕
我特别喜欢你这个比喻。你说这像是一场马拉松,而不是百米冲刺。从这个角度,就回答了我最初想问的问题:2023年、2024年已经出现了各种各样估值非常高、看起来非常成建制的团队,为什么2025年、2026年还在不停出现具身创业团队?
如果这是一场足够长的比赛,其实起点线在哪里,差距并没有那么大。
黄青虬
更重要的还有一点,大家觉得技术范式其实没有收敛。以数据采集为例,可能1年前或者2年前大家都在做有本体的数据,现在大家在做无本体的数据。
这种采集范式的转变,会让数据综合获取效率提升10倍以上。这意味着过去大家积累了3年的东西,你可能3个月就能赶上。
所以这种范式转变也让大家看到了很多机会:这个行业还没有形成固定格局,也没有形成很高的进入门槛和壁垒。
5. 团队文化决定长跑
卫诗婕
你刚才还说,如果这是一场马拉松,最终决定能否跑完、能否胜出的是团队的凝聚力和持久性。你能不能讲一讲,你看到一些团队已经存在的问题?我们可以不点名。
黄青虬
这个行业最明显的一个问题,就是人人都觉得可以创业、可以做。门槛低,导致我觉得人才整体有点分散。很多头部公司做一段时间之后,甚至会分裂成2个、3个公司。
在这种热度的鼓动下,每个人都想参与热点,每个人的 ego 都会特别大,觉得自己可以独当一面,自己就可以把这件事情做成。
卫诗婕
为什么每个人的 ego 都会特别大?
黄青虬
我觉得是这个行业的热度给了大家一种幻想:随便一个人可能都会想,“他跟我差不多,他也能拿到融资,那我是不是也可以?”
用好的词来说,叫大家都乐观、敢想、敢于冒险;用不好的词来说,可能就是大家过于浮躁。
但我自己觉得,这件事要做成,其实需要建立一个人才密度足够高的团队。
卫诗婕
所谓人才密度非常高的团队,也有联创出走、自己去创业的现象。
这可以避免吗?
黄青虬
我觉得可以从一定程度上避免。最重要的还是要寻找跟你文化气质相同的人。
比如我们团队找人,我总结了一下,希望大家有这样的气质:除了技术水平很高以外,我们希望他是谦虚但自信的人,也希望他是温柔但坚定的人。
卫诗婕
怎么理解?
黄青虬
谦虚且自信,就是他对于自己的技术判断是自信的,但是同时是谦虚的,能听进去这个行业不同的声音。当大家的想法发生碰撞时,他能够求同存异,我觉得这样才有可能长久合作。
第二个点叫温柔而坚定。他要能坚持自己觉得靠谱的观点,但是同时我们不希望这个团队有非常剧烈的摩擦。能够用一种温柔的方式去解决观点冲突的人,我们会更愿意吸收这样的同事。
卫诗婕
你是这样的人吗?
黄青虬
我觉得我算是这样一个人。
卫诗婕
怎么成为这样一个人?
黄青虬
这个问题可能比较难回答,我想想。
我觉得有一个要素可能是从小当班长。从小学到初中、高中都是班长,大学是团支书,从小就在组织大家、团结大家去做成一些事情。在这个过程中,可能慢慢就锻炼出了这种亲和力。
卫诗婕
没有人挑战班长的权威吗?
黄青虬
调皮的小孩会挑战,但是当他要抄作业的时候,就会屈服了。
卫诗婕
你会生气吗?我今天也是第一次见你,走进来的时候就感觉你很快乐。
黄青虬
我觉得我一直是一个比较开心的人,基本上没怎么生气过,性格还蛮温润的。
卫诗婕
我非常认同你说的这些品质,但你怎么识别出这样的人?
黄青虬
这样的人肯定是有的。更关键的是,自己要先是这种人。我觉得同样气质的人,大家会相互吸引。
第二个就是需要有足够的耐心。时间拉得足够长,介绍的人足够多,自然就能筛选出这样的人。
卫诗婕
你还是得回答一个最根本的问题。我们可能不在乎起跑线差了1年或者2年,但是最早那波公司已经做了2年,甚至像你刚才提到的宇树,已经做了更久。那你有什么弯道超车的机会吗?
黄青虬
我觉得这个赛道其实不需要弯道超车。终点在100公里以外,只要我持续不断地往前跑,每跑一步比它多1厘米,跑着跑着,过半年、1年、5年,慢慢就可以跑到前面去。
我跟团队讲的也是,大家更多是把一些脏活、累活、笨功夫做好,把基础打扎实。
什么是基础?比如硬件,会去抠每个细节,把硬件可靠性做好。算法和数据方面,我们会去抠整套算法里的每一个小模块,把每个小模块都精准验证到它的精度、效率没有问题。
只有把基础、地基打牢了,未来才肯定可以进步得很快。
卫诗婕
你对这个行业里其他的具身公司了解吗?可能一些比较知名的公司?
黄青虬
多多少少看过一些新闻,也有一些接触。
6. 具身智能先走 B 端
卫诗婕
具身智能有很多路线,有走 B 端的,有走 C 端的;有做全栈的,也有不做全栈的。那在这两个最关键的问题上,你是怎么思考的?
先说第一个问题,C 端还是 B 端?
黄青虬
我觉得具身智能最终的终极市场肯定还是在 C 端。任何一个通用品类,最终一定要走到 C 端,才有足够大的市场,以及足够大的利润,让团队有足够的资金去做基础模型、通用模型。
还有一个原因是,这一波我们说的通用人形机器人,本质是“通用”。最通用的场景,我觉得就是家庭场景。如果家庭场景做不下来,那它可能就不能称之为通用。
所以从这两点,我会觉得 C 端是最终的终点。但是站在今天这个时间点,C 端还没有达到真正进入的节点,连叠衣服都叠得不够整齐。
在产品不成熟的阶段,如果贸然进入 C 端市场,对品牌或者整个行业可能都会有一些负面伤害。第二个就是,C 端对安全和隐私的要求很高。
比如下棋、逗宠物这样一些轻量级的功能,或许可以先进去,但是因为隐私问题,数据很难回流。我们知道 AI 肯定需要数据,只有数据回流,才能持续推动模型迭代。数据回流不了,现在进入 C 端的意义可能也不是特别大。
所以从这个角度来讲,我的观点是要以 B 端作为跳板,但最终还是要走入 C 端。
我们在 B 端也看了各个行业,包括工业、物流,以及服务行业。看完之后,我们的判断是这样的。
第一个出发点,是这个场景要有泛化性。你选择什么场景,就意味着你会在什么场景采集数据;你采集什么数据,就意味着你能训练出什么样的基础模型。
如果去做一个很专用的工作,其实很难在这些数据上训练出一个具有通用智能的基础模型。所以从这个角度,我们找了一个跟家庭比较像的场景。可能第一站会去酒店、商住公寓做房间清洁。
在这个场景里,你会接触到类家庭场景,足够多样、足够复杂。我们觉得在上面回流的数据,是高价值数据。这是我们选择的第一个出发点。
第二个出发点,是这个场景要具备阶段性进入的可能。我要做的场景,即便做不到100%,哪怕完成30%、50%,也可以先进去。
这一点也很关键。任何一个功能,哪怕再简单,如果要做到100%才能进去,那要花的时间肯定非常长。
比如酒店房间清洁,其实是160多个子任务的集合。哪怕我只能把地上的垃圾捡走,把冰箱里的矿泉水换上去,完成这样单个的子任务,也可以先进去,帮阿姨完成一部分动作。
这样我就能进入真实场景,回流数据,发现真实问题。基于这两个原因,我们选择了 to B 的服务行业。
7. 数据质量胜过数据数量
卫诗婕
我观察到,此时此刻是2026年,关于数据的战争已经开始了。现在各家具身公司的目标,都是要成为最快采到最多高质量数据的公司。
黄青虬
是这样,我甚至觉得大家已经到了不惜代价的程度。
卫诗婕
你听过我之前采访智元杨宝清的那一期。他们搞了一家数据平台公司,叫蜜蜂,有非常多订单来自一些大公司、大厂和模型公司。
现在这些公司是不惜一切代价去买数据,对吧?
黄青虬
我们看到了这个趋势。包括像蜜蜂这样类型的公司,其实这一两年非常多。这些公司刚成立,就开始采数据,然后大家喊出的口号可能是1,000万小时、1亿小时。
但是对这件事,我的观点可能跟大家不太一样。我觉得数据质量会远远重要于数据数量。
至少在今天,我们接触到的这些具身数据,质量是不够高的。
卫诗婕
你们今天接触到的数据来源分为哪几种?
黄青虬
各种各样,我们也都在内部尝试。包括刚才说的遥操作数据、UMI 的数据、Ego 数据。市面上能对外提供数据的供应商,我们可能都会去拿它的样例数据,或者找它采购一小部分数据。
我们自己也会做数据采集设备,然后自己做采集。
但是现在看来,整个行业的数据质量非常参差。大家并没有一个统一标准,说数据按照这样做就一定行,一定能训练出一个不错的模型。
卫诗婕
所以你现在对于什么样的数据更好,有一个区别于行业共识的认知吗?
黄青虬
现在行业都在做无本体采集。之所以叫无本体,是因为之前有本体,叫遥操作。
有本体遥操作,其实就是我有一台机器人,再拿一个遥控设备,一般是 VR 设备,通过 VR 设备的运动,让机器人跟着我同步运动。人在旁边动,机器人跟着这个动作动,然后完成数据采集。
这种采集方式有几个劣势。第一个是效率低,第二个是成本高,因为需要一台机器人。第三个是因为需要机器人,所以很多时候大家都在室内做摆拍,反复摆拍,多样性其实比较低。
为了解决这些痛点,大家就把有本体扩展到无本体。无本体里面也有很多种,前些日子比较火的是 UMI,本质上就是手上的夹爪。这个夹爪跟机器人长得一样,但是不需要机器人在场,只需要人穿戴夹爪。
后来大家又觉得,这种方式还是会影响工作效率。人手上戴个夹爪,做事情不方便,于是又把它改成手套。这是一种方案,变成偏动捕的方式,戴一个动捕手套,或者戴一个基于 EMG 的数据采集手套。
但这个方案的问题在于,现在很多基线可能用的还是夹爪。夹爪有一个重映射的问题,所以也有一些缺陷。
同时,戴上手套,大家还是觉得效率太低,阿姨戴着不舒服,工人戴着也不舒服。于是又演进到连手套都不要,只在头上戴一个头环,头环上面有一个相机,把人正常干活的数据拍下来,通过摄像头捕捉图像和影像。
也就是通过第一人称视角的影像,让模型去学习。所以无本体里面又细分了很多种,但整体想解决的就是采集效率和采集场景泛化性的问题。
整体来讲,我肯定更倾向于无本体数据。刚才讲的这些都属于无本体数据,未来它们之间可能也需要配合。
前面说为什么需要无本体,核心还是采集效率。我觉得这是第一位的。整个 AI 的发展,大家肯定都要遵循 scaling law,前提是数据能够 scale up,才有 scaling law。这是第一要素。
基于这一点,我觉得无本体肯定是一个大的趋势。但是除了无本体以外,我觉得还有3个原则是我一直比较坚信的:必须是真实的人,在真实的场景,干真实的活。
卫诗婕
什么意思?
黄青虬
现在有一些人虽然拿的是无本体数据,但还是在素材场里面操作,也就是一个假设的场景、摆拍的场景。他雇的人可能是专业的数据采集员,并不是真正干这个工作的工人或服务员。
采集员的目标是做出一个动作并拿到回报,而不是为了把桌子擦干净去擦桌子,而是为了做出擦桌子的动作去擦桌子。所以很多轨迹会有一定变形。
我们叫 in the wild 采集。我坚信一定要让真实的服务员或工人带着我们的设备,进入真实场景,就在他日常干活的时间里把数据采集上来。我觉得这种才是高质量数据。
卫诗婕
为什么你会这么相信?
黄青虬
我觉得今天很多 AI,其实就是从数据里面总结规律、学习智能。数据质量决定了它能学到什么样的智能。
如果所有数据都是摆拍的轨迹,它自然就会学出摆拍的轨迹。如果数据里面都是摆拍的场景,面对真实场景时,它可能就做不出这个动作。
所以如果要解决的是一个真实问题,让机器人去真实场景解决真实问题,就应该用真实场景、真实人的轨迹来训练它。
8. 具身智能的 Scaling Law 更难
卫诗婕
我们都在期待具身智能产生 scaling law,但它现在还没有产生。你为什么相信具身智能一定会产生 scaling law?而且这个领域的 scaling law,跟我们过去几年在大语言模型里看到的 scaling law 有什么区别?
黄青虬
首先,具身智能也是遵循 AI 训练范式的。我有一个输入、一个输出,中间的所有东西交给模型。在这种范式下,AI 1.0 时代大家在 CV 技术上验证过,AI 2.0 时代大家在大模型上验证过,自动驾驶其实也得到了验证。
基于这些推理,在相同范式下,我觉得具身智能肯定也能够遵循这个定律。
第二个就是,你刚才问它的 scaling law 跟大模型会有什么区别。其实我一直觉得,具身智能的 scaling law 会更难。
第一个原因,是因为具身智能是运行在端侧的系统。运行在端侧,就意味着算力比较受限。算力受限,就意味着模型参数量不可能太大,不可能像大语言模型一样做几百 B,甚至几千 B 的模型。
但同时,具身智能吸收的数据量又比大语言模型更大。大语言模型主要是文字,最多再加上图片;但具身智能、汽车这类系统,实时接受高清的视频流,还有语音、文字以及各种多模态信息,而且必须实时做操作。
它每一帧吸收的数据量,其实比大语言模型更大。参数量更小,但要吸收的信息量更大,这就意味着模型算法结构的设计会面临更大挑战。
所以我觉得,它的 scaling law 其实比大语言模型更难。
卫诗婕
我在做资料的时候发现,你这个创业团队,包括你本人,特别强调算法。我之前了解这个行业其他创始人的判断时,经常会听到一句话:算法不重要,或者算法在现阶段不重要;也有人说,有钱就能搞到算法人才。
但你刚才已经解释了,为什么你觉得算法在具身领域很重要。
黄青虬
我觉得首先,算法肯定非常重要,因为它是这波智能的核心。
至于现阶段重不重要,大家的核心观点可能是:现在算法离爆发还没有那么近,所以现阶段不是特别重要。可以等别人爆发了、做成了,再去挖几个人,或者抄一下他的方案,快速做出来,大力出奇迹。
但是这一点我自己不太认同。算法架构本身去抄可能比较容易,但在探索算法的过程中积累下来的算法、人才,以及形成的组织氛围,这些东西其实抄不来。
等到爆发的那一刻,你凭什么有信心马上就能挖来几个人?这几个人来了就能融合在一起,并且有足够的算法能力把东西做出来吗?我觉得这件事情不太成立。
卫诗婕
班长说,抄作业是得不到好成绩的。
黄青虬
还是得有自己的思考过程,这才是在锻炼真正的能力,是长期功夫。
有一点很意外:我们成立了半年,但是花在算力上的投入,可能至少能排到行业前5名。所以从这个现象你就可以看到,大家在算法上的投入,其实没有跟这个行业的热度形成匹配。
卫诗婕
你融了很多钱。你能透露一下,钱最大的流向去了哪里吗?
黄青虬
目前最大的流向应该就是两块:一块是人才,一块是算力。
卫诗婕
算力会在什么样的级别?
黄青虬
应该已经到了每个月1,000万元的级别。
卫诗婕
每个月1,000万元,在整个具身智能行业是一个什么样的水平?
黄青虬
别家的情况我其实不是特别清楚,但至少我觉得能排进前5名。
卫诗婕
这是一个非常微妙的信号,值得品一品。这个行业很多公司声称自己在训练“大脑”。
什么样的级别,能够判断它到底是不是真的在训练“大脑”?
黄青虬
我觉得现阶段,比如达到千卡级别,如果真要做大脑,这是一个门槛。如果确实要做得比较好,我觉得可能需要到万卡级别,才有可能做出一些突破性的成果。
当然再往上,就要看这个行业的发展程度了。
卫诗婕
如果算一笔账,倒推一下,一家独立的初创公司,现阶段得融多少钱,才能支持一个比如18个月的高效训练?
黄青虬
以1,000卡来算,一个月差不多接近1,000万元,一年就是1亿多。至少要融3亿元,才能支撑公司加上其他存储费用,支持两年的算力投入。
这个水平其实基本上也是头部公司早期阶段的融资卡位。如果能融到这笔钱以上,至少会被市场认为是准第一梯队。
卫诗婕
如果融不到这笔钱,基本上就跟训练“大脑”没有什么关系了?
黄青虬
我觉得可以这么理解,因为训练“大脑”确实是一个很烧钱的工作。
卫诗婕
你会做全栈吗?
9. 全栈能力通向可靠量产
黄青虬
会。几乎所有头部公司都做全栈,我觉得有两个核心原因。
第一个是商业上的考虑。在现在的市场环境下,很难只通过软件授权获取商业回报。更多时候还是要软硬一体,把它当成产品卖给客户,才能有更大的商业价值。
卫诗婕
但软硬一体并不意味着一定要做全栈。你刚才说的全栈,是软件、硬件和算法都做;很多全栈公司还会看灵巧手、零部件的自研率。
黄青虬
我理解你说的全栈。我刚才讲的可能是整个系统,也就是软件和硬件都需要做。但是具体到硬件里面,你刚才提到的自研率,我们不追求自研率。
什么东西会自研?如果一个零部件供应商的成熟度、进步速度跟不上我们了,我们会选择自研。
卫诗婕
现在什么自研,什么不自研?
黄青虬
比如零部件,我们现在没有自研。第一个原因是,现阶段人戴上夹爪,我们去酒店试了一下,我戴上夹爪在酒店能干70%的活。但是用算法,机器人现在可能连5%都干不到。
这就说明瓶颈其实还不在执行器。我先把算法从5%提升到65%,算法能提升的空间还很大。所以现阶段如果执行器不是瓶颈,我们就觉得没有必要自研。
卫诗婕
2026年大家都说是具身智能的量产元年。我知道我看到的一些公司已经完成量产,甚至有一些已经声称完成了首个 PMF。
在前人已经做到一些短期成果的情况下,你怎么规划接下来12到18个月要做什么?
黄青虬
首先,我们并不想被市场节奏带着走。一个公司形成 PMF,往往也是在一个比较垂直的赛道里。垂直行业足够多,并不存在说我占了这个工位之后,其他工位就进不去了。
如果只是在一个垂直场景下,有些公司领先了,我们觉得这并没有形成市场垄断,也没有形成真正的壁垒,所以这不是我们现在最着急的事情。
我们最着急的,其实还是两个核心基础能力。
第一个是硬件可靠性。我看到很多机器人公司可能确实可以做一些 demo,但是能不能7×24小时、一年不坏地运行,我相信现在没有哪家机器人公司能做到。这是我们比较关注的第一个技术能力。
第二个技术能力,还是基础模型的能力。做一个垂直工位时,到底花了多大精力专门采集数据、做微调,才能把一个工位完成,这是我们重点考虑的事情。
如果每一个工位都要花很多人、很多算力、很多数据去做,那这个东西从场景上来说也不能 scale up。要尽可能增大泛化能力,减少部署工作量。
在基础模型足够强的情况下,再做一些简单微调,落地到具体场景就是顺其自然的事情,并不需要那么着急。
卫诗婕
刚才聊到你在资本上非常受追捧,因为你在华为已经战功赫赫。所以你本身在算法领域应该很有号召力。
今天投资人投的,其实是创始人在某个绝对有技术壁垒的领域里的人才号召力。我觉得这是一个非常重要的投资取向。是这样吗?
黄青虬
这肯定是其中一个非常重要的因素。另外,把一个 AI 算法做到规模量产、做到产品化的能力和经验,我觉得在这个行业也比较稀缺。
卫诗婕
你觉得这个能力是从自动驾驶发展而来的吗?
黄青虬
这个我们待会儿可以详细聊。
卫诗婕
刚才这1个小时,我们先聚焦了一下你这场创业。待会儿再展开聊细节。
10. 机器人兴趣始于童年
我还想先跟你聊一聊个人履历,有很多我想挖掘和学习的部分。我们可以先从你个人开始聊。
你对机器人的兴趣,最早可以追溯到什么时候?
黄青虬
应该是小学的时候看的一些动画片。当时印象比较深刻的机器人动画片叫《铁甲小宝》,里面有各种可爱的机器人。
有一个红色的、像昆虫一样的机器人,叫卡布达。他们可以变形,会跟人类朋友一起去解决生活中的一些困难。机器人之间也有好的、坏的,会打架。
那个机器人很有意思,还可以给自己加各种装备。比如加一个火箭在后背,就可以飞起来;还有一个装备可以变成摩托车,有点像早期的《变形金刚》。
那时候就会觉得,这个东西太好玩了。如果我有这么一个机器人伙伴就好了,它能帮我实现好多事情。
从那时候开始,我就对机器人感兴趣。后来还看了一些电影,比如《变形金刚》《黑客帝国》,知道了更高层面的命题,比如机器人保护人类、保护世界,就觉得特别有意思。
卫诗婕
你成为状元之后,有决定想去什么地方、哪个学校、哪个专业吗?
黄青虬
我选这个专业确实也跟机器有关系。但那个时候清华的招生老师来了,我刚好是状元,大家都说学校会来“抢状元”,各个学校招生办的老师会直接到你家里,推销他们的学校和专业。
当时清华老师给我推销了很多个专业,我都听不懂。他讲热能、环境,讲了半天他们在做什么,我也没听懂。后来他讲到自动化,说这里面有很多老师在做机器人。
我一听,机器人有意思,于是就报了这个专业。
卫诗婕
事后证明是进对了?
黄青虬
事后证明确实是对了,赶上了这波 AI 热潮。当然这是客观环境,另外确实是自己真正做了之后,觉得还挺好玩,于是一直坚持下来。
卫诗婕
你进了清华,应该去参加 RoboCup 了吧?
黄青虬
在清华4年的时间里,除了吃饭睡觉以外,我感觉有60%的时间花在实验室里。就是赵明国老师的508实验室,在清华主楼的5楼。
里面有各种各样的机器人。我从大一暑假就开始去这个实验室,玩各种机器人。最早玩的是最简单的机器小车,在地上画一条线,让车追着线跑,从这么简单的事情开始。
后来玩自平衡车,就是两轮的车,要写一个控制系统,可能是最简单的 PID 控制,让它一直保持平衡,并且给你送一些东西到指定地点。
再后来加入赵老师的火神队,开始做人形机器人踢足球。RoboCup 这段经历对我影响非常大。
卫诗婕
赵老师也是个传奇。
黄青虬
赵老师是运动控制领域的传奇人物。我觉得赵老师的一个特点,就是比较特立独行,而且非常有自己的坚持。
最早开始做人形运动控制时,赵老师带我们做的算法叫被动行走,建立了一个模型,叫“虚拟斜坡”的步态。
什么意思呢?比如有一个斜坡,放一个球,它会根据重力滚下去。同样的道理,设计某种机械结构,它就可以靠重力垂直下降,顶到之后,后面那只脚再抬起来,根据重心继续往下。它不需要任何动力,就可以一步一步走到坡底。
我们基于这样的建模去模拟它的步态。好处是它是一种动态步伐,效率特别高、特别节能,而且动作特别快。
当然,当时业界主流不是这种做法,业界主流叫 ZMP。大家可能在电视上看过日本的 ASIMO,它就是 ZMP 步法,是第一代人形机器人运动控制最核心的算法。
它是一种静态步法,原理就是每走一步,在任意时刻,重心都落在支撑面的覆盖范围内,永远不会倒,但走得比较慢。
所以赵老师当时坚持做自己的被动行走。我觉得他确实是一个很有坚持、很有自己想法的老师。包括到今天,整个运动控制都在走向 AI 化,但他仍然坚持:在 AI 化的同时,也要学习运动学、动力学这些传统知识,把它们融合进算法里。
我觉得他给我传递了一个很重要的观点:不要随大流,要有自己的看法,做任何事情都要有自己的坚持。
卫诗婕
你在火神队当队长?
黄青虬
我大三的时候是队长。
卫诗婕
怎么当上队长的?
黄青虬
大一、大二的时候,大家都在做运动控制。到大二时发现,我们做运动控制的人才比较多,但是感知系统,也就是识别足球和球门的系统,在实验室里没有特别擅长的人。
当时赵老师就让我去做感知。做完之后,我从感知一路带着大家把整个系统做起来。可能基于这个原因,大家觉得我能给团队带来一些不一样的东西,慢慢对我产生了比较好的信任感。
后来我带着大家重构整个系统,就慢慢变成了队长。
卫诗婕
我们俩本科应该是同年,你是2012年到2016年。
黄青虬
对。
卫诗婕
这期间,机器人运动控制领域有什么大的标志性节点发生吗?
黄青虬
这个时间点应该是从第一代运动控制到第二代运动控制的变迁过程。
刚才说的第一代运动控制是 ZMP,代表是本田 ASIMO。第二代运动控制其实是 MPC 加 WBC,也就是模型预测控制加全身控制。
它的代表机器人是 Atlas,也就是波士顿动力的机器人。那几年波士顿动力特别火,我们每天都能在网上看到它翻跟头、做各种动作的视频,觉得特别厉害。
那几年正好是整个技术从第一代到第二代变迁的过程。
卫诗婕
我后来查了一下,你们火神队也出了一些非常知名的创业公司,比如加速进化,是吧?还有一个叫陈鹏辉的,是你同期的吗?
黄青虬
陈鹏辉是比我大好几届的学长,应该也是火神队远古时期的队长。我进去的时候,他已经毕业了。
加速进化现在还在踢足球,我觉得也是把我们当时队伍的精神发扬光大了。陈鹏辉应该是年级比较低的一个学弟?我跟他确实没有接触,但是他们应该是2025年还是哪一年拿了 RoboCup 的冠军。
卫诗婕
火神队有什么精神气质?
黄青虬
现在很多公司运动控制算法的核心人物,确实都来自火神队,或者跟火神队有或多或少的关联。
我觉得大家可能更多是把人形机器人和运动控制这件事做到极致,然后推到了整个新的机器人行业里。
卫诗婕
大家现在公认宇树的运动控制做得很好。你们这些传统运动控制派,会怎么看宇树这家公司?
黄青虬
宇树确实做得非常好。包括它表现出来的运动性能,以及它展示的这些 demo,确实非常惊艳。
运动控制从第三代发展到今天的第四代,是基于强化学习的这一代。到今天来讲,运动控制技术从算法层面,难度相对于之前没有那么高了,或者说门槛没有那么高了,因为 AI 能做很多事情。
以前运动控制还挺难的,我自己也没有完全学明白。它需要解决很多数学问题,比如线性代数问题。
运动控制本质上是在做什么?你有很多优化目标,希望机器人跑得足够快,希望它的步态足够稳定,希望它不要倒下,这是很多目标。同时可以优化的变量又特别多,因为全身所有关节的扭矩都可以控制。
在输入维度特别高、优化目标又特别多的情况下,这就是一个非常复杂的优化问题,会特别特别难。
但是到了今天,强化学习的方式已经发生了转变。我不再需要对系统做非常细节的数学建模,更多是给出一些 value function,去评判做得好不好。比如倒下了,就应该受到惩罚。
通过设立奖励机制,让模型在仿真里不断 roll out,进行强化学习,最终就能训练出一个好的模型。
宇树在这方面确实做到了领先。但我觉得它更大的领先,在于今天的运动控制很依赖仿真环境,而宇树能够把 sim-to-real gap 做得特别小。
它的硬件,包括整个关节、电机方面的能力,确实也非常强。
卫诗婕
这是一个非常好的问题。因为 sim-to-real gap 大家都会面临。你说它能够把这个差距缩到最小,背后靠的是硬件能力,硬件可控?
黄青虬
我觉得背后主要就是硬件能力。当然里面也有一部分软件,比如电机里面的驱控算法,本身也是软件算法。
核心就是说,我生产100台机器人,每一台的参数都一样,这叫一致性。另一个就是,我有某种办法把这些参数识别出来,也就是参数辨识。识别出来之后放到仿真器里面,而且识别得足够准,那我的仿真环境就准。
卫诗婕
这是可以被追上的吗?
黄青虬
我觉得可以被追上。因为这里面更多是工程经验,并没有特别强的不确定性技术在里面。
我相信后面这些公司只要持续打磨,慢慢都能追上。当然宇树自己也很勤奋。
卫诗婕
但是宇树也在往前跑。
黄青虬
是的。
卫诗婕
那你觉得不确定性就在大脑层面?
黄青虬
我觉得现在整个具身智能领域最不确定的就是大脑。
卫诗婕
但是你刚才又讲了,你的信心有90分。
黄青虬
这个信心更多来自于:虽然我不知道最终它会长什么样,但是我知道只要把基础的东西搭好,把数据做到高质量,再有一个足够好的团队,大家肯定能在探索的氛围中,慢慢试错,把它试出来。
卫诗婕
火神队当年就是这么探索的,在赵明国老师的精神指引下。
黄青虬
我们当时的团队其实非常自由。基本上你想做哪个模块都可以自由选择,不管做运动控制、感知,还是决策系统,也就是机器人的大脑,每个人都可以在自己的方向上不断尝试喜欢的方案。
我觉得特别好玩。
卫诗婕
仙工的赵越上我的节目时,我们全程应该聊了5个小时,其中聊 RoboCup 聊了1小时40分钟。你能够感受到那个创始人的热爱。
他会说,当时去打比赛的那段时间,对他来说真的非常快乐。而且他在这个过程中发现,往往最后能做下来、做得好的,并不是那批所谓最优秀的学生,而是最热爱的学生。
这也指导了他后来创业,只招最热爱的人。
你有什么从火神队沿袭下来的精神吗?
黄青虬
可能最重要的一个东西,就是我觉得细节决定成败。
你会发现,某个步态调得不好,不一定是算法问题,可能只是某个螺丝没拧紧,松动了一下,导致参数变了。
所以在做复杂系统时,要把它拆分得足够细,每个细小模块都要检验,做单模块检验,判断假设把它拆成一个最小系统,它的输入和输出是不是符合预期。
这样才能保证复杂系统组装起来时,每一步都没有问题。因为组装成复杂系统之后,最终发现问题,很难追溯到具体的某个零部件。
每个环节哪怕有1毫米的误差,组合在一起就是几次方。因为它是一个从硬件到软件、再到算法串联起来的系统,所以误差会被放大。
这是我在做机器人过程中培养出来的一个非常重要的特质。
卫诗婕
所以你后来组建的团队,在精神特质或者氛围上,会不会跟当年的火神队有一些类似?
黄青虬
我觉得会。我们会更关注细节。刚才反复讲的数据质量,是我们在华为工作时,以及现在都特别关注的东西。
怎么去检查数据闭环整套算法里的每一个小模块,保证生产出来的数据质量足够高,这是我在做整个 AI 的过程中始终关注的重点。
另一个比较重要的是,我对这个系统的认知其实没有变。虽然操作这个系统的方法在这十几年里发生了翻天覆地的变化,但最终要操作的系统还是一样的:它还是一个双足机器人,通过电机驱动关节,并且给它装上一个大脑。
这个问题本身没有变。所以可能从十几年前开始,我就对这个问题有了一些概念。对系统的这些理解,也会慢慢影响我后来做很多技术选择,之后逐步变得清晰。
卫诗婕
我理解,你们火神队当年参加的比赛,整体上来讲就是人形双足运动控制。在这个大范围里,你负责的是感知和决策那一部分,对吧?
所以相当于在那个阶段,你做的是机器人的小脑,也有一点涉及大脑的部分,可以这么理解吗?
黄青虬
今天看来可能是大脑,但那个时候我们叫它“机械的眼睛”,也就是感知。
我们那个时候的大脑是决策系统,其实非常简单,就是一个状态机:如果看到球和球门,就射门;如果看到球但没看到球门,就转一圈。它是一个基于规则的系统。
甚至一开始做感知时,用的都是非 AI 算法,非常简单粗暴,比如绿色的 RGB 值是多少。
卫诗婕
什么叫 RGB?
黄青虬
自然界的颜色都是通过 RGB,也就是 red、green 和 blue 这3种颜色组合出来的。图像成像原理也是这样,图像上的每一个点、每一个像素,背后其实是3个通道:红色、绿色和蓝色。
它们有不同的深度,也就是不同的深浅,通过组合形成不同的颜色。你看一幅图像,看到的是一个光怪陆离的世界,但在计算机眼里看到的只有 RGB。
它其实就是3个矩阵,每个矩阵里面是一个0到255的数字。我们通过处理这些数字,去识别足球、球门这样的东西。
所以那个时候,机器人看到的世界不是我们看到的世界,可能是小狗看到的世界,只有几种颜色。
卫诗婕
但是你那时候就有这个概念吗?机器人其实是有大脑、小脑系统的?
黄青虬
那个时候我们把它分成感知、决策和控制。不就是今天的 VLA 吗?
卫诗婕
VLA?
黄青虬
你这么说确实有点道理。但是那个时候不太支持语言指定,更多是 V 进去之后,L 被替换掉,A 就是它去做一个动作,也就是控制。
卫诗婕
我发现,从你本科打 RoboCup 比赛开始,你做的是机器人小脑,也就是运动控制;后来到了博士期间,我们待会儿会聊到,你做的有点接近机器人的大脑,跟今天的机器人大脑有关系;再到毕业之后去华为做自动驾驶,你做的是整个系统。
我觉得这一系列路径,跟你后来今天做具身创业非常息息相关。
11. 从机器人转向计算机视觉
在结束本科打比赛这段经历之后,你有没有意识到:自己对小脑这个东西的兴趣程度是多少,以及要不要转向其他领域?因为我看你后来有一个跨度,选择了多模态领域。
黄青虬
这个转变里面其实有两件事情。
第一件事情就是刚才讲的,当时感知没有人做,所以我就去做感知。感知从最开始的传统算法,到后来 ImageNet 出来了,大家开始用 AI 的方式去做,于是接触了一些 AI 算法,开始用卷积神经网络识别足球和球门。
这是我第一次接触 AI,觉得这个东西确实很有魔力。
卫诗婕
这应该是2016年,那时候你快毕业了?
黄青虬
对,大四的时候。那时大家发现,这个东西可以识别非常多的东西。
另外还有一件事,我本科时碰到了汤晓鸥老师。他当时去清华招生,刚组建 MM Lab,同时成立了商汤科技,大概是在2013年、2014年。
商汤当时就在清华科技园,所以我大四有一段时间就在他那里实习。那时我印象特别深,附近有一个公寓叫文津国际公寓。商汤刚成立时租了公寓的一间房,客厅是办公的地方,卧室就是员工睡觉的地方。
当时只有十几个人,大家开始做一些人脸识别、人脸检测这样的算法。基于这段经历,我也算是入门了计算机视觉,确实觉得这个东西太神奇了。
我自己可能也是个脸盲,两个人我都分不清,它竟然能分得清。所以会觉得这个东西非常有发展潜力。
而且它可以用这么简洁的方式解决问题,不需要再计算一大堆数学公式,就完成了机器的自主学习。我觉得这个东西未来肯定有非常广阔的应用场景。
基于这个原因,我就决定做这方面的研究。
卫诗婕
MM Lab 可能普通读者不太熟悉。我觉得它可以视作商汤的技术母体。在相当长一段时间里,无论学术地位、学术成果,还是人才培养,MM Lab 都是一个非常优秀的 AI 实验室。
这跟汤晓鸥教授的风格和理念有关系吗?
黄青虬
我觉得有非常大的关系。汤老师很多理念在今天看来都特别先进。
比如他倡导的“黑羊文化”,给商汤选的吉祥物是一只黑羊。英文里叫 black sheep,意思是一些不合群的孩子、格格不入的孩子。
他想告诉大家,每个人都可以特立独行。他非常尊重个体差异,因为他坚信只有多样化,才能发展出一些不一样的东西。
如果大家都变得同质化,那其实就是一个流水线式的论文生产工厂,这不是他建立这个实验室的初衷。
卫诗婕
你跟他有直接接触吗?
黄青虬
我跟他有一些接触,但当时是这样的:汤老师把我招过去之后,平时带我的是林达华老师,所以我跟林老师接触更多。
汤老师刚开始还没有那么忙,大概一两个月可以见他一次。后来随着商汤壮大,可能半年、一年才能见他一次。
卫诗婕
他是个什么样的人?
黄青虬
我觉得他是一个非常和蔼可亲、而且幽默的人,非常有意思。
早期做研究时,我们整个实验室都知道他的小孩叫明明。他很喜欢拿自己小孩的照片给我们做研究。
比如他当时第一个研究主题,是我们的学长做的。汤老师给小孩拍了很多照片,发现每次挑一张照片特别麻烦,于是就说,我们可以做这样一个研究主题:给我家的小孩做一个相册分类系统,分成去旅游的、在食堂的,以及在其他地方的照片。
卫诗婕
第一种是 close 一个领域,第二种是 open 一个领域。
黄青虬
所谓 close 一个领域,就是终结一个领域。你做出一个特别厉害的算法,做完之后,这个领域的所有问题就解决了,大家再也不需要做研究了。这是他欣赏的第一类研究。
第二类研究,就是提出一个问题。这个问题可能之前大家没有想到,但是特别有研究价值,然后由此 open 一个新的领域。
所以他的很多引领都非常有前瞻性。
卫诗婕
我们也要这样做选题。
所以他是 MM Lab 的精神领袖吗?
黄青虬
是的,汤老师确实是一个非常优秀的精神领袖。
卫诗婕
后来大家得知他去世的消息,在你们这个圈子里会有震动吗?
黄青虬
会。我觉得大家其实都非常遗憾。
汤老师带来的影响不只是 MM Lab。我觉得至少对华人圈,或者至少对中国 AI 事业,都起到了举足轻重的作用。
如果他今天还在,我相信他还能继续带领 AI 行业往前走一步。所以我们确实感到非常遗憾。
卫诗婕
从 MM Lab 里面,无论是汤老师还是林达华老师,你会不会从他们身上找到一些关于应该成为什么样的 leader,甚至领袖的精神指引?
黄青虬
我觉得是有的。
比如刚才说的汤老师给我的几点启发。第一个就是追求卓越。如果做一个 leader,你给团队、给合作的人,大家的追求要足够高。大家说“求其上,得其中”。
第二点,我觉得汤老师是一个非常乐观的人。不管实验室或者公司的压力多大,你永远能看到他在讲段子。他是一个非常幽默、非常乐观的人。
这也给了我很大的感染。在这么大的压力下,你也可以换一种思维去面对困难。只要心态放得好,总能走过去。
卫诗婕
乐观到底是一种天性,还是一种方法?
黄青虬
我觉得应该是一种方法。我自己认为,它可以通过后天受到其他人的影响,慢慢把你塑造成一个乐观的性格。
卫诗婕
你觉得自己天性是偏乐观还是偏悲观?
黄青虬
我现在是非常乐观了,但天性可能不太好说。
卫诗婕
小时候是一个勇敢的人吗?
黄青虬
小时候我觉得也算是比较勇敢。但可能还是因为刚才讲的,成长环境非常自由、包容,可以去探索、去试错。哪怕把一些东西搞砸了,其实也没有关系。
小时候还有一个故事也很有意思。我在幼儿园看科学书,看到母鸡孵鸡蛋。