[BidClub_]
硅谷坐标 Silicon Valley Vector · · 35 min

【特别综艺·上】《从夯到拉》|7位硅谷AI研究员的模型排名游戏

曹卿云 Qingyun CaoBessie董萌王森吴月忻(Crick)周奕超余天呈程明昊

YouTube
TL;DR
  • 模型能力排位没有形成共识:排序官把 GPT-5.5 放在最上方,但揭晓时它的身份是“顶级”而非“夯”,这一局最终“圆满失败”。 答案包括 Gemini、GPT-5.2、GPT-5.5 和 GPT;有人给 Gemini 人上人(“御三家永远都是第三家”),周奕超却直接写拉完了:“在美国还有哪个模型比它更差的?”并补充:“最拉的是不被人记住。”
  • 薪资一题的全场夯是“Meta TBD”,且被主持人称为“公认的”,讨论落点是薪资两极分化:AI 研究员的工资比之前多得多,非 AI 岗位的增长可能受限。 席间还提到 quant 向 AI 的人才迁移正在发生;如果模型能做 auto research,“它也能做矿的 research,而且可能会做得比人要好很多”。
  • Job security 一轮排序全对:Apple 被排在夯位、XAI 拉完了。 主持人排序时以“唯一没有裁过员”的 Apple 作判断依据,但随后有嘉宾指出 Apple 其实也裁员。XAI 的评价是“砍人砍太多了”,并有“遇事不决,先 ban 它”的说法。OpenAI 只拿到人上人,理由是:“感觉没有什么大规模的动荡,但是大家都是悄悄地就不见了。”
  • Work-life balance 一题里,王森解释自己原本想把现在的 OpenAI 和 Anthropic归入“这一代的拉完了”,为避免撞车才改写 Netflix。 收尾的反思更值得记:过去两百年自动化一直试图换取更多自由时间,但“我们确实在干更多的工作,却没有实现更多自己的时间”。
  • AI 时代技能排序是全场逻辑最硬的一轮:empathy 夯、身体健康顶级、做饭人上人、Photoshop NPC、coding 拉完了。 王森的判据是 coding “非常可验证”,写好测试就能验证;Photoshop 还包含较难验证的审美因素。以自身为例,他说从今年一二月份开始就没有打开过 code editor,完全用 agent 写 code。
  • 最强的能力信号藏在闲聊里:一位嘉宾的牌友把读博时想过、距今已约三十年的概率论 open conjecture 发给 GPT-5.5 Pro,模型“然后就证出来了”;朋友们交叉验证后认为是对的,目前正在发第二版。 这被评为“比较夯的周末活动”。
  • 对 AI 泡沫的判断是一个反身性论证:“什么叫 bubble?就是大家都不觉得这个东西是 bubble 的时候,它才是 bubble。现在你每天都会遇到有人说 AI bubble,那它怎么可能是 bubble?” 配套的内部视角是:frontier lab 的员工能比外部更早看到提前一代模型的进展,以及未来十天或一个月可能出现的变化,这被形容为一种特权化体验。
Digest · the substance, structured for research

1. 模型排位:没有形成共识,GPT-5.5 也未被排到“夯”

  • 五张答案牌是 Gemini、Gemini、GPT-5.2、GPT-5.5、GPT。排序官程明昊把 GPT-5.5 放在最上方并判断为“夯”,但揭晓时这张牌的身份是“顶级”,主持人因此说“第一个就错了”,这一轮最终“圆满失败”。
  • 写“夯”的嘉宾选的是 GPT,理由直白:“GPT 付我钱了呀,每个月按时给我打钱”,且“我们公司所有人都用 GPT”。
  • 董萌给 GPT-5.2 排 NPC,理由是它存在时间太短:“我自己现在都不记得它发生了什么事了。”
  • Gemini 的判断分歧最大:吴月忻给它人上人,理由是“御三家永远都是第三家,那只能是它了”;周奕超则给出“拉完了”:“在美国还有哪个模型比它更差的?”他还说,“最拉的是不被人记住。”

2. 薪资:Meta TBD 全场夯,quant 工作也可能被波及

  • “Meta TBD”被排序官放到最上方,揭晓后主持人称其为“公认的”。Robinhood 被排为顶级;Amazon 和 Google 处于较低位置,Google 被填写者特意限定为“Google 非 DeepMind 的那部分”。
  • 这一轮的正经落点是薪资正在两极分化:不做 AI 的厂商,工资以后的增长可能不会那么多,因为 AI 替代了部分工作;AI 研究员的工资则比之前多得多。
  • 更进一步的推演是,最近有很多人从“矿子”转到 AI 赛道,可能以后很多“矿子”的工作也会不存在。如果模型能做 auto research,“它也能做矿的 research,而且可能会做得比人要好很多”。

3. Job security 全对的一轮:Apple 夯、XAI 拉完了、OpenAI“悄悄地就不见了”

  • 吴月忻排序全对:Apple 夯、Google 顶级、OpenAI 人上人、Meta NPC、XAI 拉完了。排序时主持人曾以“唯一没有裁过员”的 Apple 作判断依据,但随后一位嘉宾指出:“Apple 其实也是裁员的。”
  • XAI 的理由零犹豫:“砍人砍太多了”;另一句概括是“遇事不决,先 ban 它”。
  • 写 OpenAI 人上人的解释是全场最扎心的自嘲:“感觉没有什么大规模的动荡,但是大家都是悄悄地就不见了。”
  • 由此引出 AI 取代工作的分歧:一位嘉宾认为时间尺度在“五到十年”,是缓慢但“实实在在发生”的过程,后果是“劳资之间的平衡又会向资方倾斜”;另一位认为“人类的灵感可能永远没有办法被取代”,确定性较低的事情仍有差异;王森则以自身为例——工作还在,但“工作内容、工作性质已经大幅度地变化了”。

4. Work-life balance 与技能排序:可验证的工作先被覆盖,empathy 是夯

  • WLB 一题只有 XAI 被排对。王森解释自己原本想把现在的 OpenAI 和 Anthropic归入“这一代的拉完了”,为避免撞车才改写 Netflix;他听说 Netflix “famous for the benefits”,很 chill。
  • 收尾反思是:过去两百年自动化一直试图让人做更多工作、换取更多自己的时间,但回看历史,“我们确实在干更多的工作,却并没有实现更多自己的时间”。
  • 技能题王森排序全对:empathy 夯、身体健康顶级、做饭人上人、Photoshop NPC、coding 拉完了。核心逻辑是 coding “非常可验证”,写好测试就可以验证;Photoshop 有审美因素,较难验证。
  • 程明昊认为人与人的关系肯定不会被取代,但 communication 未必是真正的 skill;他还说自己有时“不如跟我的猫豆多聊一聊”,因为猫可能理解得更快。主持人问“empathy 什么意思”并由程明昊回答“共情”,随后以 coding model 的口吻开玩笑说他连“不需要验证”的东西都不懂。身体健康顶级的注脚来自另一位嘉宾:“我感觉我们公司招人主要看身体好。”

5. 湾区周末观:上班是顶级,GPT-5.5 Pro 证出三十年前的猜想

  • 周末活动揭晓:下赛道夯;hiking 分列人上人和 NPC;摘樱桃拉完了;上班顶级。湾区往北有 Sonoma 的 track,往南开一个半小时有 Laguna Seca。
  • hiking 被称为湾区“三大俗”之一,滑雪可以夯、摘樱桃拉完了、爬山则是 NPC。关于摘樱桃,现场还打趣说“不劳动才是真正的享乐”,如果只是吃樱桃就该是夯。
  • 程明昊说,周一到周五做的是不得不做的事,周末则可以“上自己想上的班”,并表示每天都要加班。随后一位嘉宾说自己从不觉得在加班,认为“一个人不应该因为自己喜欢工作而感到羞耻”。
  • 另一位嘉宾希望生活中始终有一部分属于自己;还有嘉宾说,愿意周末用 AI 做 side project,把之前很难、甚至不可能做到的事情变得可能。
  • 一位嘉宾分享:自己的牌友在读博时想过一个概率论 open conjecture,那已是三十年前的事;最近把问题发给 GPT-5.5 Pro,模型“然后就证出来了”。朋友们交叉验证后认为结果正确,最近已经在发第二版——这被评为“比较夯的周末活动”。

6. 在 OpenAI 的体感:提前看到未来的特权,与“AI 没有泡沫”

  • 多位嘉宾谈到 talent density 与祛魅并存:同事都很聪明、对工作有激情;一位嘉宾说,进入 frontier lab 后发现许多看似深刻的东西本质上很朴素,很多时候只是人先觉得事情很难,再说服自己不要做。另一个重要收获是“把简单的事情做好、做对、做得靠谱”。印象最深的画面是 offsite 大巴——“我坐过最吵的大巴”,因为每个人都在讨论自己想做的事情。
  • 一位嘉宾指出 frontier lab 的内外部视角存在区隔:内部能看到提前一代的模型,并且比外部更早感知其进步,可能提前看到十天或一个月之外的新变化;这被形容为“这个时代里一种比较特权化的体验”。
  • 另一位嘉宾分享自己此前在 fund 做了五年 quant trader,那里大家会 hide secrets,不太愿意分享工作内容;相比之下,OpenAI 相对更 open。
  • 泡沫问题的反身性回答是:“AI 肯定没有 bubble……什么叫 bubble?就是大家都不觉得这个东西是 bubble 的时候,它才是 bubble。现在你每天都会遇到有人说 AI bubble,那它怎么可能是 bubble?”
  • 快问快答的两个彩蛋:公众对贵司 AI 误解最多的点——“是不是在下一个模型发布之前,上一个模型就会被变笨”;中美 researcher 的差异——“想的不同比想的相同要小很多,大家其实在很多地方的共识是一致的。”
周奕超

在美国还有哪个模型比它更差的?遇事不决,先卖它。

这轱辘差点磨着了。

Speaker 2

差不多,感觉没有什么大规模的动荡,但是大家都是悄悄地就不见了。

Speaker 3

过去半年,硅谷的模型一直在变,人的判断也一直在变。

Speaker 4

我觉得一个人不应该因为自己想要工作而感到羞耻。

Bessie

大家好,我是 Bessie。我是今天的特约主持人,现在在 OpenAI 上班。今天我们不上班,来跟我的同事和好朋友们一起玩游戏吧。

程明昊

大家好,我叫程明昊,我在 OpenAI 工作,具体是在 Post-Training 的一个 team 做 eval 相关的工作。大体上就是两个方向:一个是让我们的 eval 变得更加可信,另外一个是让 eval 尽可能测量真实模型的能力,以及用户更在意的一些能力。

余天呈

大家好,我叫余天呈,我在 OpenAI 做后训练。

周奕超

大家好,我叫周奕超。最近我刚刚加入了一家 AI startup,叫 Coficia[?],做的是 voice agent 相关的问题。工作中我主要负责解决如何让 AI 不那么耳背的问题,学名叫 ASR,一些相关的问题。

董萌

我叫董萌,我在 OpenAI 做 GPU scheduling,给大家分 GPU。

王森

我叫王森,现在在 OpenAI 做 memory 相关的研究。我们主要的工作就是让模型更好地理解你,然后生成更符合你的喜好、更加个性化的回答。

吴月忻(Crick)

大家好,我叫吴月忻(Crick)。我现在也在 OpenAI,做 Reasoning 部分的一些工作,主要是 Test-Time Scaling:怎么让模型能够想得尽可能长,然后让它具备更多的智能。

Bessie

大家好,今天要玩的第一个游戏叫“硅谷共识测试”。5 位玩家随机抽取身份牌,从“夯”到“拉完了”,只有自己知道身份。主持人出题后,大家同时作答。排序官根据大家的答案把 5 位玩家重新排序,最后揭晓身份,看看有没有达成硅谷共识。

我现在给大家发身份牌,第一轮就由明浩来排序。你先坐着就行。大家抽一下自己的身份牌,但是不要告诉别人自己抽到的是什么。

1. 模型能力重新排位

我们第一题是大模型的能力。“夯”就是最有能力的模型,“拉完了”就是你心中稍微逊色一点的模型。请作答,大概有 1 分钟的时间。

OK,现在我有大家的 5 份答案了。明浩同学请你到这个后面来,我们来排个序。

程明昊

我拿到的答案分别是 Gemini、Gemini、GPT-5.2、GPT-5.5 和 GPT。

我现在是这样的:我拿到的是 GPT、Gemini。刚想说大家都选得一样,Gemini、GPT-5.2 和 GPT-5.5。你告诉我,你想怎么样排序?

那个 GPT-5.5 肯定是“夯”,对吧?这个没有疑问。然后这个 GPT 感觉有一点歧义,也没有说是哪个模型。我暂时把这个 GPT 以为是一个比较老的模型,放到“拉完了”。GPT-5.2 是比较老的模型,所以放到 NPC。

两个 Gemini,这个只能通过字迹来判断了。这个蓝色的应该是吴老师的字迹,那吴老师还是要顶级一下。好,就这样。

Bessie

好的,明浩已经做出了自己的选择,我们开始听答案了。

第一个,GPT-5.5,“顶级”。第一个就错了。第二个,Gemini,也错了。第三个,Gemini。采访一下,这是谁写的 Gemini?为什么“拉完了”呀?这个字迹是谁的?你写的?你能讲一下为什么拉完了吗?

周奕超

就是拉完了。

Bessie

好,接下来我们继续看 GPT-5.2。“NPC”。这是谁写的呀?董老师就是太厉害了。

最后一个 GPT,“哼”。大家可以解释一下为什么这个“哼”拉完了吗?谁写的呀?

Speaker 5

我觉得最好的模型不都是下一个吗?

Bessie

OK,这一局圆满失败。

从董老师开始,为什么 GPT-5.2 是 NPC 呢?

董萌

我觉得它存在的时间太短了,我自己现在都不记得它发生了什么事了,所以就是 NPC。

Speaker 5

我写的是“夯”,你写的是顶级 GPT-5.5。因为我觉得它确实挺好的,但是我以为会有人把 Fable[?] 给到“夯”,所以我写这个,大家就能比较判断出来这个是顶级。

Bessie

I see。那我们现在先跳过这两个。写“夯”的同学,你为什么觉得没有写 Fable[?] 呢?

Speaker 5

这 GPT 付我钱了呀,每个月按时给我打钱。而且我们公司所有人都用 GPT。

Bessie

没错,没毛病,搞得像我们给它用爆了一样。

那月忻讲一下,你写的是人上人 Gemini。

吴月忻(Crick)

主要原因在于御三家,御三家永远都是第三家,那只能是它了。

Bessie

很好,很有道理。来,周奕超,“拉完了” Gemini。

周奕超

我在谷歌工作,同学应该都是这个态度。而且在美国还有哪个模型比它更差的吗?都没有人写。对,那是真的拉完了。最拉的是不被人记住。

Bessie

明白。在现在这个时候,它是拉完了。算是在玩游戏的过程中展示了自己对 Gemini、对 Meta、对 xAI,可能对 xAI 是一个例外,大家都有相同的看法,但是对之前的两个东西,大家的想法还是非常不一样的。也能够体会到大家说的,在现在这个 AI industry 工作的环境下,能够有的一种兴奋感。我觉得这是一件非常有意思的事情。

2. 硅谷薪资正在分化

接下来请明昊来当排序官。我们第二题叫做大厂薪资,这里限定一下,是硅谷的大厂。写公司名字,对,大小厂都可以,科技公司就行。

Speaker 6

我是不是把 5 个都排上,夯的金额至少得占一分?

Bessie

是这样的。

OK,我们现在先来看一下大家选择的:Meta、Meta TBD、Amazon、Google 和 Robinhood。来,明浩进行排序吧。

程明昊

这必须得有一个“拉完了”吗?

Bessie

没错。

程明昊

那先把 Meta TBD 放到上面吧,写得这么具体了。中间还有 4 个。这个题目看起来就有点怪,我都没有概念,这些公司我都没在那儿上过班。他俩比较像,让他俩挨着吧。

剩下还有 3 个。Robinhood 之前董老师在那儿上过班,那肯定不能是拉完。但也不一定是董老师写的。要不然就把这个放到 NPC。剩下这两个呢?Google 和 Meta 呢?是不是可以先把他俩交换一下,最后再把他俩排一下?这是要插入排序吗?

他俩要不然就这样吧。

Bessie

OK,我们来看一下最后的结果。

首先,“夯”,Meta TBD,那肯定是这个。恭喜恭喜。这个 Meta 是人上人。下面 Robinhood,顶级。Amazon,Google,NPC。看起来我们这个准确率非常 consistent。

没票。那我们现在每个人讲一下为什么这么选。

董萌

好难解释啊,这么多人情世故。我觉得肯定比 NPC 要好一点,但肯定到不了“夯”的程度。我抽到的是顶级。

Bessie

明白了,勉强可以合格。老东家还是看年纪,对,还是待你不薄啊。

Speaker 7

好,Meta。我知道的是人上人。主要是我猜,我觉得“夯”肯定会有人写 TBD,然后我觉得顶级应该就是剩下那几家大的 AI 厂。之后我觉得 AI 厂不说 AI,对,我觉得 Open 和 Soft,然后之后我觉得 Meta 排在人上人是比较合理的,证明 Robinhood 给得比 OpenAI 要多。董老师下架了。

Bessie

那接下来 Crick 你讲一下,你的“夯”为什么是 Meta TBD?

吴月忻(Crick)

那就是大家都跑路了,都是猪。那明显嘛,对吧?

Bessie

好,公认的,公认的。

Speaker 6

我运气比较差,两次都是拉完了。不过我觉得这次为什么不是 Google 拉完了,是 Amazon 拉呢?Google 待遇挺不错的呀,我知道,但是 Amazon 一般都 famous for tip,对不对?

Bessie

嗯,好的。

Speaker 8

我抽到的是 NPC,我觉得 Google 是最符合我对 NPC 定义的一个公司。是我填的 Google。

Bessie

你讲一讲,你说以前的 Google 是 NPC,还是现在的 Google?

Speaker 8

就是 Google 非 DeepMind 的那部分。

Bessie

OK,就是还可以,但也没有特别突出,就是比较标准的样子。

Speaker 8

嗯。

Bessie

我觉得现在关于大厂的薪资,大家的薪资已经开始两极分化了。一方面,一些不做 AI 的厂,他们的薪资以后的增长可能不会那么多,因为 AI 替代了部分工作。但是对于 AI 研究员来说,那部分工资其实比之前多得多,所以我们才会在上面的部分纠结顺序,在下面的部分也会纠结顺序。

就是确实最近是有很多人从这个矿子来转到 AI 这个赛道上,可能以后很多矿子的工作也会不存在了,因为模型的能力强大了。如果模型能做 auto research 的话,那它不光能做 AI research,也能做矿的 research,而且可能会做得比人要好很多。

我觉得这也算是一个大势所趋吧。

3. 工作生活平衡失守

第三题叫做 work-life balance。大家可以想一想,是公司名,写公司名的 work-life balance。

Speaker 9

快给我一个拉完了。

Bessie

看起来大家都想抢拉完了。好,这就是看手气了。这个公司没有 5 个,那这样吧,我们就给 5 个选项:xAI、OpenAI、DeepSeek、Google DeepMind,还有 Meta。

我现在收到这几份答案:Google、xAI、Google、Netflix、Meta。来,明浩。

程明昊

Easy choice,对吧?这个方向最下面,这个应该是这个吧?我觉得 Netflix 最好。剩下的 Meta 和 Google,据我所知,Google 应该会好一些,是这样吗?

Bessie

嗯。所以你是说 Google 的……OK,这应该没有争议。Netflix 是最好的,然后 Google 和 xAI 最差,肯定也没有争议,对吧?Google 和 Meta 相比,Google 稍微好一点,所以两个 Google 排上面。

OK,我们来揭晓一下。Easy,你的快速选择:Netflix。

很简单,Netflix。待会儿请 Netflix 的人出来解释一下为什么是这个,出来站岗。

第一个是 Google,这是 Crick 的。第二个 Google 是顶级,Meta 是人上人,Netflix 是 NPC,xAI 是拉完了。每次都只对一个,每次都是只有一个,说明这个概率还是挺准的。

那先从董老师来讲一讲,你选到的是顶级。

董萌

都是偏见啊。你周围朋友的 work-life balance 怎么样,你就会觉得他们怎么样。所以我觉得 Google 的 work-life balance 在我眼里还是顶级。肯定有人不这么想,但是我的朋友们是这样的。

Bessie

那接下来王森,你抽到的是 NPC。

王森

我这个挺简单的,我觉得这个应该是毋庸置疑的。

Bessie

Netflix 为什么呢?

王森

因为大家都差不多,对吧?xAI 要是现在的 OpenAI 和 Anthropic,基本都属于这一代的拉完了。为了避免跟大家撞车,我决定有一点区隔度,就换了一下 Netflix。没想到你觉得它非常的 hot。Netflix famous for the benefits,我听说就是很 chill。

Bessie

Netflix。对不起,我认知浅薄了。

王森

没事,以后有机会去体验。

Bessie

来,程明昊说一下,人上人。

程明昊

我就不知道,随便写了一个。

Bessie

Meta。所以你是觉得 Meta 的 work-life balance 还不错,对吗?和大环境比较恶劣的 AI 大厂,比如 OpenAI、Anthropic 什么的相比,Meta 还是更好一点?

程明昊

基于身边人的统计学。

Speaker 7

如果你去看历史的话,其实至少在过去 200 年里,人们一直在试图让我们的工作变得更加自动化。我们的目的都是说,通过自动化,我可以让一个人干更多的工作,然后这样我们就可以有更多的时间来干自己的事情。

但是如果你回看这段历史,会发现我们确实在干更多的工作,但并没有实现更多自己的时间去干自己想做的事。

Bessie

下面第四题是 job security。

4. AI正在重塑工作安全

人上人是 50 分。你们能说一下为什么笑吗?

遇事不决,写 Meta。是因为 Meta 公司太大了,所以各种情况都可能发生,是吗?

我现在收到这次的 5 个答案,而且都不一样:第一个是 OpenAI,第二个是 xAI,第三个是 Apple,第四个是 Google,第五个是 Meta。

来,月忻依次来看,对吧?唯一没有裁过员的人,是不是就只有 Apple 了?我们可以把 Apple 挪到最上。其次,裁得比较少一点的是 Google,对吧?工作我们可以放在顶级,但是它应该不会跟 xAI 在一列。xAI 可以放在这儿。这两个,待会儿某个写 OpenAI 的人可以解释一下。肯定有内部人员填的,给大家一个人上人吧。

然后 Meta 我们放在这儿。

好嘞,我们先来看一个这个:拉完了。xAI 拉完了。我们发现 xAI 的正确率非常高呀,是不是所有正确率都来自于 xAI 的拉完了?

下面 Meta,NPC。哇,我也觉得。xAI 很吓人,你又对了。顶级,Google。哇,全对。太牛了。

Speaker 7

我写的人上人是 OpenAI。我觉得“夯”和顶级肯定不行,但是拉完了也不至于。就是感觉上会有人写 Google、Apple 这种更 secure 的地方,所以人上人吧。差不多,感觉没有什么大规模的动荡,但是大家都是悄悄地就不见了。

Bessie

好的。

周奕超

我是 Google,写的是顶级。我偷瞟到有人写 Apple,然后我猜那个 Apple 就是“夯”,所以我觉得写 Google 应该会被放到顶级那里去。确实从经验来说,好像裁人会少一些。

Bessie

嗯,好的。

Speaker 10

Apple 很 obvious,但其实 Apple 也是裁员的。一超之前是 Apple 的,对,但大家可能都不知道,所以我也是排除法。

Speaker 11

遇事不决,先 ban 它。

Bessie

好的,你这个应该不用多解释了。

Speaker 11

它砍人砍太多了。我觉得它取代各种 job,可能发生的时间尺度是 5 到 10 年这个级别,会是一个更缓慢的过程。但它肯定是实实在在发生的,作为一个后果,就是如果 AI 能取代一些岗位,那意味着劳资之间的平衡又会向资方倾斜,其实不是一个很好的事情。

Speaker 12

我觉得有一天会被取代,但程度不一样。人类的灵感可能永远没有办法被取代,但是灵感出现的时候是不确定的。比如我自己工作的时候经常也活在这种恐惧里,我知道什么时候要解决一个问题,但是不知道什么时候能解决它。

但是 model 本身可能会是一个不一样的东西,因为它的能力边界你可能会知道得更多一点,但是它没有办法做那种灵光一现的事情。不过,一些没有那么确定性的事情还是会被取代。

王森

对于我来说,我不会担心 AI 会取代我的工作,因为我觉得现在能做的事情还是非常多的。当然,以后肯定过了一段时间,我不会做着相同的工作,因为我现在做的工作会被取代。

就像可能 1 年前我还在自己手写代码,然后从今年可能 1、2 月份开始,我就没有打开过代码编辑器,都是完全用 agent 写代码。我觉得这就是说,我的工作还存在,但是我做的工作内容、工作性质已经大幅度变化了。我觉得以后也是会这样。

5. AI时代技能重新定价

Bessie

我们下面一个题目可能就跟公司有关了。我们讲一讲 AI 时代大家觉得最需要的技能,和最不需要的技能。这次王森来排序。

王森

陷入了沉思。都有什么技能?什么是技能?我也不会任何其他的。

我拿到的第一个是 empathy,第二个是身体健康,第三个是 coding,第四个是做饭,第五个是 Photoshop。

Coding 应该是拉完了。“夯”的话,应该在 empathy 和身体健康之间选一个,我可能会给 empathy。Photoshop 的话,感觉应该是 NPC。我感觉现在 AI 做 Photoshop 也能做得挺好的。

身体健康是顶级,做饭是人上人吧,就是有点用,但是没那么大用。

Coding 和 Photoshop 一个是拉完了,一个是 NPC,是因为你觉得现在 image model 还没有到顶,但是 coding 更到顶吗?

我感觉 coding 是一个非常可验证的 task。你只要写好测试,就可以验证。Photoshop 还有审美的因素在里面,其实比较难验证,所以我觉得模型做那个会稍微困难一点。但是我觉得它现在应该也能做得挺好。

Bessie

我们来看一下这个排序怎么样。我们先从“夯”开始看:empathy。第二个,身体健康。做饭,NPC,Photoshop。全对,太牛了。

有一个很愚蠢的问题:empathy 什么意思?

程明昊

共情。

Bessie

你看,不愧是做这种 coding model 的,连不需要验证的 pass 都不懂。无法验证,甚至不认识这个词。不重要,在模型里。

大家来讲一下。我觉得大家这题又让我非常 surprise,大家都能把这题做得很好。你先讲讲。

程明昊

我觉得角度应该就是,人和人的关系肯定不会被取代,但 communication 这种 skill,它也不是有什么硬性标准、一定不会被取代的东西。

很多时候我现在觉得自己很自闭,也不是很想跟周围的人讲话,不如跟我的猫豆多聊一聊,它理解得可能更快一点。所以 communication 也不是一个真正的 skill。但是如果你能觉得自己被理解,或者从情感的角度去看一个问题,如果可以被理解,那都是安排。

Bessie

讲得特别好。

Speaker 13

做饭还是要会做的,特别是在美国,这个技能还是非常有必要的。

Speaker 14

NPC、3 分,Photoshop,我觉得挺合适的吧,Photoshop。

老米股价还没有跌到零,对吧?

Speaker 15

我觉得身体好很重要,我感觉我们公司招人主要看身体好。

Bessie

没毛病,没毛病。

Speaker 15

我是拉完了,然后 coding 是顶级。这就是刚才森哥已经解释过的。Photoshop 这边基本要被取代了。

6. 湾区周末各有玩法

Bessie

我们最后一题做的是湾区。我们讲讲平常自己的生活,讲一讲湾区周末的活动。

第一个选项是下赛道。上班和摘樱桃之间还真的不好说。这个拉完了是吗?

王森

嗯,两个“夯”。对啊,这两个还挺……

Bessie

把摘樱桃放 NPC 吧,我觉得这个季节性比较强。两个 hiking 应该要离得很近,所以上班现在只能拉完了。

我们来看一下这个怎么样。第一个,下赛道,真的是“夯”。Hiking,人上人。这个是 NPC,也是 hiking。下面摘樱桃是拉完了。我们是顶级,不好意思,是顶级。

大家讲一下为什么吧。

Speaker 9

我了解没有那么多,但感觉湾区如果你喜欢体验在封闭道路上开车的话,资源还蛮好的。湾区从三藩市往北开,有一个 Sonoma 的 track;湾区往南开 1 个半小时,有一个叫 Laguna Seca 的 track,其实都是很好的 track。

感觉湾区因为在美国,赛车文化也挺盛行的,还是一个挺好的 sport。但我感觉我已经 too old 来 enjoy 它了。不过我以前还是挺喜欢的。

Speaker 10

摘樱桃,为什么摘樱桃是拉完了呢?

Bessie

因为太俗气?

Speaker 10

樱桃不好吃吗?

Bessie

好吃。

Speaker 10

所以不需要摘,你只要吃。如果是吃樱桃,那就是夯。

Bessie

有道理。不劳动才是真正的享乐。

Speaker 16

这是五个。这是五杠十嘛?那什么活动最平庸呢?在湾区,自然只有 hiking,就是 hiking。

Bessie

OK,来,程明昊讲讲为什么上班是顶级。

程明昊

周一到周五就是做一些不得不做的事情嘛。周末就是上自己想上的班。

Bessie

请问你一般想上什么班呢?

程明昊

周一到周五有很多事情,天天要开会,天天有人来找你。比如说你有一些比较大胆的想法,也可以周末的时候自己做。

Bessie

很棒,不愧是程明昊。OpenAI is lucky to have you。

你们平常加班很严重吗?

程明昊

每天都要加。

Speaker 17

我从来不加班,我从来不觉得我在加班。上班就是上班,我只是在上班。我觉得一个人不应该因为自己喜欢工作而感到羞耻。

Speaker 18

我是 NPC,我的观点跟吴老师基本一样。湾区三大俗,滑雪我给“夯”,摘樱桃给拉完了,所以爬山我给 NPC。我觉得加班不是“夯”。

我还是希望,无论如何,我的生活有一部分属于我。周末我能有一个自己觉得是“夯”的事情,这个“夯”的事情不是家,不是上班。我觉得 definitely,大家都需要有一些自己的时间。

Bessie

其实我觉得程明昊也代表了大家一部分人的想法。像硅谷这样的环境,大家周围的变化是非常剧烈的,所以即使用一部分周末时间,可能也不完全是加班。

Speaker 19

对于我自身来说,我也很乐意用 AI 来做一些自己的 side project,来探索一下,看这个能不能随着这个时代,让自己把一些之前做起来非常艰难,或者说有难度而不可能的事情,变得可能。

我觉得这是非常有意义的一件事情。不一定是加班,但是更多地利用现有的工具,去做一些之前很难达到的事情,我觉得这是让我自己非常兴奋的一件事。

Speaker 20

我只是选了顶级,没有选到“夯”。我觉得“夯”的还是应该做一些促进科学进步的事情,就是那种可以发表、可以对外发表,或者至少在公开社区里讨论的工作。

比如我之前有一个一起打牌的朋友,有一天跟我说,他读博的时候想了很多年的一个概率论 open conjecture,那也是 30 年前的事了。最近他闲得没事儿,跟 GPT 聊天的时候,把问题发给了 GPT-5.5 Pro,然后就证出来了。

然后他就找了一些朋友,大家互相交叉验证了一下,发现是对的。最近已经在发第二版了。我觉得这可以说是比较“夯”的周末活动。

Bessie

我觉得程明昊讲的那句话很有意思:你不应该因为热爱工作而觉得羞耻。

我觉得在 AI Lab 里面,大多数人都很神奇,竟然能招到这一群人。大家都是很 self-motivated,不需要老板说“你要做这个,你要做这个”,大家都是自发地做更多的 work。

但是我们有的时候平常会有一些 shaming。就像我们之前说,这个是学霸。你想说:“我不是学霸,我是学神。”这一类的话,我觉得其实是很好的。一方面,我们不应该因为这个感到羞耻;另一方面,我们也应该更 encourage 这种努力。

OK,这个环节就到这儿结束。

7. OpenAI里的意外收获

Speaker 21

我觉得 OpenAI 是一个 talent density 特别高的地方。你会发现你的同事都特别特别厉害,每天都可以从不同的同事那里学到不同的东西。

Speaker 22

认识了一些有趣的同事。在 OpenAI 最大的收获就是,周围同事一起工作还是比较有趣的,然后能看到大家一起思考不确定的未来,这本身会触发很多思考。

Speaker 23

我的感受是,我觉得现在 OpenAI 跟其他一些 frontier lab 有点类似。大家很多时候内部看到的事情和外部看到的事情有一定的区隔。

比如在内部,大家可以看到一些更提前一代的模型,那些模型表现出来的进步能力,我们能够比外部更早得知。除开在不同的 benchmark 上,我们基本上每天都会用自己的模型,也会对它有更深刻的感知。

所以我觉得,在 OpenAI 工作或者在其他一些 frontier lab,有一个很巨大的优势,就是你能够比别人提前看到 10 天或者 1 个月之外可能产生的一些新的变化。我觉得这是比较荣幸的一件事情,也是这个时代里一种比较特权化的体验。

Speaker 24

就是感觉一切皆有可能。以前进入 AI 这个行业之前,我觉得这个行业非常高大上,frontier lab 里都是一群天才,每天都在想一些非常 fancy 的 research idea。

来了之后觉得,很多很深刻的东西,本质上也是很朴素的。很多时候就是我们自己觉得有些事情很难,然后自己说服自己不要去做这件事。

但是现在其实有这么多技术手段可以帮助我们,就感觉没有什么做不了,一切皆有可能。

Speaker 25

我觉得第一点是,大家都很聪明,并且对自己的工作非常有激情。一个让我印象比较深刻的事情是,我们一起去 offsite 的时候,大家一起坐大巴过去。我觉得那趟大巴是我坐过最吵的大巴,因为每个人都在和别人讨论自己想做的一些事情。

我觉得第二点也比较同意余天呈说的,就是把简单的事情做好、做对,做得靠谱,这是非常重要的一件事情。

还有一个收获就是,在 Chatbot 或者是 Codex 的另外一端,你有机会了解它是怎么运作、怎么生成的,并且有机会去改变它。我觉得这也是一个非常难得的机会。

Speaker 26

在 OpenAI 之前,我是在一个 fund 做了 5 年的 quant trader。具体来说就是做一些 alpha research 和 execution study,所以工作的性质、工作内容挺不一样,但是性质其实比较类似。

比如 execution study,其实也跟 post-training 比较类似。最大的感受是,旷视那边还是会更封闭一些,大家都会 hide secrets,不太愿意告诉别人自己在干什么、事情是怎么做的。但这边相对非常 open,这是我比较喜欢的一点。

Bessie

我觉得 AI 肯定没有 bubble。我的理解是这样的:什么叫 bubble?就是大家都不觉得这个东西是 bubble 的时候,它才是 bubble。现在你每天都会遇到有人说 AI bubble,那它怎么可能是 bubble?

Speaker 27

所以做得比较烂。

Speaker 28

猜 GPT,GPT。

Bessie

这边抢答。GPT,为什么觉得是 GPT?

Speaker 28

因为它非常喜欢用玻璃的框,而且特别多括号。

Bessie

错。

Speaker 29

我们抢答。

Bessie

好。

Speaker 30

你 GPT 搞不好。

Bessie

怎么能是 GPT 呢?这本真没拿呀,大哥。

公众对贵司 AI 误解最多的点是什么?

Speaker 31

我是不是在下一个模型发布之前,上一个模型就会被变笨?

Bessie

你觉得中美 researcher 最大的差异是什么?

Speaker 32

我觉得本质上,想的不同比想的相同要小很多。大家其实在很多地方的共识是一致的。

Bessie

硅谷坐标,好棒啊!第二集更精彩哦!