[BidClub_]
硅谷坐标 Silicon Valley Vector · · 32 min

【特别综艺-下】硅谷AI研究员|模型猜猜乐和Prompt大战

曹卿云 Qingyun CaoBessie董萌王森吴月忻 Crick周奕超余天呈程明昊

YouTube
TL;DR
  • 一场盲测暴露了模型输出的高度同质化:连 OpenAI 研究员也屡屡认不出自家在内的各大模型。六位嘉宾靠括号、破折号、换行、bullet point 这些“语癖”猜模型,Gemini 3.5 Flash、Claude 4.6 Sonnet、DeepSeek 轮番被认错;主持人 Bessie 的意外发现是:“大家其实很难 reach consensus 哪一个是自家的模型……很多模型就特别特别相像。”这为关注模型差异化的投资者提供了关于模型输出趋同的直接观察。
  • “新模型发布前旧模型被偷偷变笨”的说法,得到了一项带保留的内部判断。王森说:“根据我个人的了解,应该不是这样”;更深的解释是人的预期本身不稳定——“即便它给你一个答案,你昨天和今天可能也不一定一样的满意”。团队确实会从 social media 和 user feedback 中寻找线索,证实坏行为后通过迭代 algorithm 尝试消除,建议用户点 thumb down。
  • Voice agent 已经实打实落地,AGI 替代生活还早。刚加入 voice agent 创业公司的周奕超说:现在打电话给 Chase 关信用卡,“很大概率已经是 agent 接的,而且很可能已经能很好地完成你的任务”;但要 AI 替代生活中大多数事情“还是比较远的”,“可能还得看 robotics 的出现”。
  • 中美前沿研究“同大于异”。“前沿模型公司也就中国和美国做得比较好”,在 scaling law 怎么做、怎么做 RL 上“大家的共识很一致”;真正的差异可能是资源(“资源更少……人做得更细一些”)和沟通环境,中国团队更多是华人、交流更集中,美国背景更多元、需要更多 alignment。
  • 嘉宾自己的 AI 工作流:sub-agent、文档、勤开新对话。不会的问题先让模型列 plan、改完再“spin up multiple sub-agents to carry out”;长对话 compaction 后模型“突然会坠入太虚幻境”,所以要写文档做记录;与其在一个对话框聊到爆 context,不如开新对话,“更快,甚至是更准确”。
  • 公司上市后股票卖不卖,内部观点公开分裂。一派认为“按现在的估值……都可以长期持有”,另一派直言“肯定卖啊……在非上市公司等了这么久……不能所有都 all in 一个地方”,卖一部分买其他家;FIRE 数字从 200 万美元(回成都或妻子老家、前提是不与人比较)到 1000 万不等。
  • Prompt 大战的策略:可验证任务加尽可能多的工具调用。让 ChatGPT 5.5 Thinking High 思考尽可能久的 prompt 是“搜索 NeurIPS 成立以来每年引用量最高的九十篇论文并总结成 doc”——思考 6 分 24 秒;对手的“查询至少一百个网页”只有 1 分 23 秒。核心策略是给明确可验证的目标,避免模型偷懒、输出似是而非的结果或反问用户。
Digest · the substance, structured for research

1. 模型猜猜乐:连 OpenAI 研究员也认不出自家模型

  • 阵容与规则:六位嘉宾——程明昊(后训练团队做 eval)、余天呈(后训练)、董萌(GPU scheduling)、王森(memory 研究)、吴月忻 Crick(reasoning、test-time scaling),以及刚加入 voice agent 创业公司 Coficia、做 ASR 的周奕超——分两组,看 prompt 和答案盲猜出自哪家模型,猜错受罚。
  • 嘉宾主要依据表面语癖:有人判断 Gemini Flash 较短、带 highlight;GPT 被认为喜欢用 bullet point、括号多、换行多且非常 structured;Claude 被认为很喜欢用括号。另有嘉宾形容某个 Gemini 答案“没有什么内容,但是又显得很多”。出场选手包括 Claude 4.6 Sonnet 和 Gemini 3.5 Flash,结果照样频频认错。
  • 集体感慨:“感觉都存在很严重的问题,比如大量的括号、不必要的括号、破折号、换行。”“我本来以为只有我们有这个问题。”如果风格信号不明显,“确实不是很好猜,因为每个 model 都能答得差不多”。
  • Bessie 的 meta 观察最有信息量:她本以为 OpenAI 同事“一眼就能看出来”哪个是 5.5 Instant,“但实际上大家其实很难 reach consensus 哪一个是自家的模型……很多模型就特别特别相像”。

2. 嘉宾的 AI 工作流:sub-agent、写文档、勤开新对话

  • 惩罚环节抖出的干货:“天天用 code”——遇到不会的问题先让它列个 plan,改一改,然后“Spin up multiple sub-agents to carry out”。
  • 写文档做记录的理由很具体:程明昊说模型有时会在 compaction 后“突然会坠入太虚幻境”,聊太久会懵;他还说模型有时 compaction 失败,王森则自嘲“我的 compaction 从未成功过”。
  • 王森提醒:没必要一直在同一个对话框里聊,“每次开一个新的对话框,它基本上还会记着你上一条聊的内容”,这样聊天消息加载得更快;董萌补充说甚至会更准确,因为不会超过 context。董萌还说自己已经“很久没有自己手动 submit 过 job、读过 job 的 log”,全交给 AI。

3. 公众误解与“降智论”辟谣

  • 最大误解是以为 AI 能替代非常多工作,程明昊认为“其实现在正处于非常初级的阶段”;公众的判断非正即负,“要么觉得 AI 什么都能做得到,要么觉得什么都做不到,但其实我们今天处于一个非常中间的位置”。
  • 王森提到,简单事情做不好时,用户甚至会怀疑“会不会是公司自己偷偷在背后搞破坏”;董萌补充说“模型的智能分布是非常不均匀的”,把简单事做好本身就需要很多工作。
  • 对“下一个模型发布之前,上一个就会被变笨”的传闻,王森说:“根据我个人的了解,应该不是这样。”人的标准本身不稳定,“你昨天和今天的想法……可能也不一定一样的满意”。团队会从 social media 和 user feedback 中获得线索;一些不好的行为得到证实后,会通过迭代 algorithm 试图消除,鼓励用户点 thumb down。

4. AI 落地生活:客服电话已经是 agent 在接

  • 生活用法各有一手:体重管理和饮食、旅行计划;周奕超还会让 AI 处理航空公司的报销或积分问题,把证据和诉求整理成一封有理有节的正式信函草稿,再发给对方 CEO。
  • 周奕超拿自己新东家举例:打电话给 Chase 关信用卡,“很大概率已经是 agent 接的,而且很可能已经能很好地完成你的任务”;coding agent 也“一直在用”,一些简单的事“已经被取代了”。
  • 但他的边界画得清楚:AGI 替代生活中大多数事情“还是比较远的”,“可能还得看 robotics 的出现”。

5. 中美 researcher:同大于异

  • 有人认为首先可能是资源差异:“有时候资源更少一些,人做得更细一些”,资源多则可以跑更多实验——各有好有坏。
  • 更重要的判断是:“前沿模型公司也就中国和美国做得比较好”,在 scaling law 该怎么做、怎么做 RL 上“大家其实在很多地方的共识是很一致的”;中国团队更多是华人,交流更频繁、更集中,美国背景更多元,需要做更多 alignment,“但基本上我觉得还是同大于异”。
  • 留了个诚实的开放问题:同样的一组人,换一个地方,结果是不是还一样?“不知道。”

6. 钱的真心话:上市卖不卖、多少钱算 FIRE

  • 上市后卖不卖,观点当场分裂:一边说“买卖都是看价格的”,按现在的估值,几家比较大的公司以后上市“都可以长期持有”;另一边毫不客气——“肯定卖啊……大家在非上市公司等了这么久……不能所有都 all in 一个地方”,卖一部分买其他 AI 公司。
  • FIRE 数字的锚点五花八门:捐一个 professor 职位“大概六百万还是八百万美元”,让投资收益 cover 这个 professor 的工资;有人报 1000 万;有人说 200 万美元,在成都或妻子老家过不错的生活就够——前提是“不再把财富或收入当做对自己个体价值的认可”,否则“你会永远在和别人比较……一旦跨过一个阶级,你会开始和另外一拨人比较”。
  • 最硅谷的答案:“周末的娱乐活动,顶级是上班”——周一到五做不得不做的事,周末“上一些想上的班”,比如做自己的大胆想法。

7. Prompt 大战:可验证任务加搜索更耗思考时间

  • 规则:不超过 30 个字的中文 prompt,让 ChatGPT 5.5 Thinking High 思考尽可能久。圆周率算到 (10^{100}) 位这类任务被认为“肯定拒绝”,没有继续采用。
  • 获胜组的思路值得记下:“让它尽量做更多的工具调用,比如搜索这种比较耗时的任务……同时给它 verifiable task……给它一个明确的目标来衡量它做的结果,这样它就不会偷懒,也不会给我们一些似是而非的结果,或者反过来问我们。”
  • 结果:“搜索 NeurIPS 成立以来每年引用量最高的九十篇论文,并总结成 doc,自行详细思考”思考了 6 分 24 秒;“查询至少一百个网页,给个研究报告:多少钱才能财务自由”只有 1 分 23 秒。前者的耗时明显更长。
Speaker 1

可以,做得比较烂的,猜 GPT。GPT,这边抢答 GPT。为什么觉得是 GPT?因为他非常喜欢用玻璃的框,而且特别多括号。错。好,你猜 GPT。怎么能是 GPT 呢?这回真没拿你当大哥。

Bessie

公众对贵司 AI 误解最多的点是什么?是不是下一个模型发布之前,上一个就会被变笨?

哈喽,硅谷坐标的观众们,我是 Bessie。我是今天的特约主持人,现在在 OpenAI 上班。今天我们不上班,来跟我的同事和好朋友们一起玩游戏。

程明昊

大家好,我叫程明昊,我在 OpenAI 工作,具体是在一个做后训练的团队,主要负责 eval 相关的工作,大体上是两个方向:一个是让我们的 eval 变得更加可信,另外一个是让 eval 尽可能测量模型真实的能力,以及用户更在意的一些能力。

余天呈

大家好,我叫余天呈,我在 OpenAI 做后训练。

周奕超

大家好,我叫周奕超。最近我刚刚加入了一家 AI startup,叫 Coficia,做的是 voice agent 相关的问题。工作中我主要负责解决如何让 AI 不那么“耳背”的问题,学名叫 ASR,也就是自动语音识别相关的问题。

董萌

我叫董萌,我在 OpenAI 做 GPU scheduling,给大家分 GPU。

王森

我叫王森,现在在 OpenAI 做 memory 相关的研究。我们主要的工作就是让模型更好地理解你,然后生成更符合你的喜好、更加个性化的回答。

吴月忻 Crick

大家好,我叫 Crick,现在也在 OpenAI,做 reasoning 部分的一些工作,主要是 test-time scaling,也就是怎么让模型能够想得尽可能长,然后让它具备更多的智能。

1. 模型猜测正式开始

Bessie

接下来我们来玩“猜猜我是谁”。6 位嘉宾分成两组 PK,我会把几条 prompt 丢给不同的模型生成答案,大家看到 prompt 和答案后,猜它们来自哪家模型。两组轮流抢答,猜错的本组接受真心话惩罚,猜对则对方全组接受惩罚。

第一题:硅谷坐标现在有几期节目?这道题现在开始讨论,确定了就可以抢答。这里有抢答。

周奕超

我觉得是 DeepSeek。

Bessie

错了。为什么觉得是 DeepSeek?

周奕超

因为我觉得它中文看上去还是比较流畅的,所以我觉得可能是国产模型。

余天呈

我觉得是这个。

Bessie

你觉得呢?

余天呈

我……

Bessie

你俩 PK 一下。我没有说你啊,个人说。

程明昊

GPT。为什么觉得是 GPT?因为我觉得它回答对了。

Bessie

所以你觉得 GPT 的准确性更高?但这几个应该都能回答对,所以这里没有特别的依据。

董萌

OK,我们觉得是 Gemini。

Bessie

你们觉得是 Gemini?恭喜你们答对了。为什么觉得是 Gemini?

董萌

我们觉得它比较短,像 Flash model,而且有这个 highlight。Claude 可能会更抽象一点,这个还比较 straightforward。

王森

所谓抽象,就是显得自己情商很高,回答很普世的这种问题。如果每个 model 都能答个大概,那可能大家大部分只能从语言风格、排版习惯,还有语癖这种角度来分析。如果这些信号都不是很明显,确实不是很好找,因为每个 model 都能答得差不多。

Bessie

那边3位进行惩罚。你们由一个人来抽一个。你答错了,你来抽。

2. AI 工作流实战技巧

周奕超

分享一个使用上的小技巧。天天用 code,希望大家也都用 code。我做的方式就是,如果有一个问题不会,让它先给我列一个 plan,然后我把那个 plan 改一改,再告诉它:“Spin up multiple sub-agents to carry out。”

程明昊

让它多写文档、做记录。现在这些 model 有时候 compaction 之后,突然会坠入太虚幻境。就是说,你跟 model 聊天聊的时间特别长之后,它可能突然就懵了。你有一份文档记录,至少可以把东西记下来。

王森

这其实是小概率事件,但是用得久了,感觉早晚会发生。所以你觉得让 AI 一直有一个文档可以看,我自己也可以看?

程明昊

主要是我的记忆力更差。它有的时候 compaction 失败。

王森

我的 compaction 从未成功过。我觉得还有一个很神奇的用法:很多人在用 AI 的时候,会在一个 conversation 里面接着聊,一直聊下去,聊到它好像忘记了一些东西。其实没有必要一直在同一个对话框里面聊,你可以每次开一个新的对话框。它基本上还会记着你上一条聊的内容,而且这样也会让聊天消息加载得更快。

董萌

甚至会更准确,因为它不会超过 context。我已经很久没有自己手动 submit 过 job,也很久没有自己读过 job 的 log 了,可以直接使用 AI 帮你 submit job 和读 job 的 log。

Bessie

所以讲的都是工作上的事情,怎么样让 AI 更好地帮助你们工作。

第二题:SpaceX 股票现在该不该买?

余天呈

我觉得这个很好。

Bessie

有没有抢答的?这里抢答。

周奕超

我们猜 Claude。

Bessie

Claude?错。为什么?

周奕超

因为我们一开始想猜 GPT,但是 GPT 有一些我们知道的行为它没有。比如它的换行没有那么激进,所以我们猜不是 GPT。

王森

我们猜 DeepSeek。

Bessie

为什么觉得是 DeepSeek?

王森

首先我们觉得 GPT 和 Claude 都不会给出“不建议”这种这么直接的建议,当然这个也不一定。它们会更谨慎一些。对面刚才讨论换行,我们也觉得不是 GPT。根据我们刚刚对 Flash 的想法,感觉这个答案又有点完整,也不太像 Flash,所以很可能是 DeepSeek。

Bessie

你们觉得是 DeepSeek?错。

董萌

Gemini Flash。

Bessie

为什么觉得是 Gemini Flash?

董萌

我觉得 GPT 和 Claude 的 safety 都做得非常小心,不太会给你投资建议。

周奕超

不太流畅。

董萌

对,我的意思就是做得比较烂,所以他们对……

Bessie

对,OK。错。为什么?

董萌

因为都猜完了。他们组现在说自己就觉得差得不多。

Bessie

不不不,我们还没开始讲。为什么?

董萌

就是它有些口气,不是很确定,而且它没有给一个分析图,这一点还蛮惊讶的。

王森

但是这是 5.5 Instant 的风格,突然就……

Bessie

这就是你们对 model 的判断。OK,真棒。那你们继续接受惩罚。

吴月忻 Crick

不能每次都我来吧?要是赢了抽你,你也得多说,是这样的。

Bessie

先来念一下你抽到的惩罚。

吴月忻 Crick

今天最怕被问到什么问题?

Bessie

为什么怕面对自我介绍?

吴月忻 Crick

太尴尬了,大家都是 OpenAI 的。

余天呈

我最怕被问到的问题是:把各个公司的模型水平从好到差排序。

董萌

我最怕被问到“今天干了什么”,因为今天什么也没干。

Bessie

OK,3、2、1,大家翻到下一题。

下一题的 prompt 是:下周放假了,给我推荐几个目的地。

程明昊

猜 GPT。

Bessie

这边抢答 GPT。为什么觉得是 GPT?

程明昊

因为它非常喜欢用 bullet point,而且特别多括号。

Bessie

错。你们猜 ChatGPT,已经错了。

余天呈

我觉得可以。我觉得是 DeepSeek。

Bessie

为什么觉得是 DeepSeek?

余天呈

因为我觉得他们猜得不错。ChatGPT 猜的是这个,但是我感觉应该不会很快出现一个重复的,直接出现一个重复选项,应该排除。连续选 C 肯定不对,我感觉不会连着两个选 C,可能也不会跳一个选 C。

我觉得 Claude 没有那么喜欢用那一套,而且我印象中 Claude 一定会做得稍微长一些。DeepSeek 可能会更神奇一点,输出稍微短一点。

Bessie

说得很好,但错。

Speaker 1

其实二选一了,这是哪个?应该是 Claude,或者是这样的。Claude 现在这么懒吗?

Speaker 2

这已经是这个 style 了。大家注意一下,这是 Claude 4.6 Sonnet 对 Gemini 3.5 Flash。

Bessie

对,就是因为是 4.6 Sonnet,所以选 C 还不至于。

Speaker 1

Sonnet 有什么问题?

Speaker 2

Sonnet 的 style 也是一样的,那我有什么问题?它的 style 很棒。

程明昊

我们猜 Claude。

Bessie

你们猜 Claude?能讲一下为什么吗?

程明昊

这已经二选一了,我们觉得 Gemini 已经出现过了。

Bessie

好,非常学霸、做题家的想法。恭喜你们答对了。然后这边接受惩罚。

王森

感觉这些模型都存在很严重的问题,比如大量的括号、不必要的括号、破折号,还有换行。我本来以为只有我们有这个问题。

周奕超

因为大家都有这个问题嘛,所以现在就很难猜。

余天呈

刚刚听到你们也讨论了一下,觉得这有可能是 Claude。之所以觉得是 Claude,是因为我把 ChatGPT 和 Gemini 都排除了,所以就在 Claude 和 DeepSeek 之间选一个。我们考虑到 DeepSeek 是比较便宜的模型,所以输出应该短一点。但是我没有注意到这是 Claude Sonnet,Sonnet 的话可能也会稍微精简一点。

Bessie

OK,那你们这儿来做一个惩罚吧。

公众对贵司 AI 误解最多的点是什么?

程明昊

我觉得最多的误解就是总是觉得 AI 可以替代非常多的工作。其实现在 AI 还正处于非常初级的阶段。

Bessie

你觉得是 AI 的能力不行,还是普及度的问题?

程明昊

我觉得一个是普及度的问题,另一个是 AI 的能力和大家的期待之间有一个非常极端的、非正即负的概念。公众的看法比较极端:要么觉得 AI 什么都能做到,要么就觉得 AI 什么都做不到。但其实我们今天处于一个非常中间的位置。

王森

我经常会看到的一种误解是,有一些简单的事情,大家会觉得模型理所当然应该做得比较好。甚至会觉得,如果看到一些比较简单的事情做得不好,会不会是公司自己偷偷在背后搞破坏?

董萌

但其实我感觉,模型的智能分布是非常不均匀的。把一些比较简单的事情做好,也需要很多工作去做。

Bessie

确实会看到很多人说,是不是下一个模型发布之前,上一个就会被变笨之类的。

王森

根据我个人的了解,应该不是这样。

Bessie

所以你觉得更多的是大家的观感问题?

王森

对。首先,大家对模型输出的预期就不一定很稳定。有时候你会觉得自己的标准是一致的,但其实你昨天和今天的想法,即便模型给你同一个答案,你可能也不一定一样满意。

Bessie

这个算是澄清了大家觉得模型“降智”的说法,因为我也不知道全部的情况,所以说不定真的是这样呢。

王森

我们也会经常关注各种 social media,也能从 user feedback 里面得到很多灵感。有一些模型不好的行为确实是可以证实的,我们也会通过迭代 algorithm,试图消除这种不好的行为。

如果大家发现模型的回答里面有任何你不想要的东西,我们非常鼓励大家去点 thumb down 按钮,这样会帮助我们更好地改进模型。

Bessie

好的,3、2、1,下一页。

下一个 prompt 是:你预测一下世界杯的冠军是谁,谁进决赛?

周奕超

DeepSeek。

Bessie

这题我们都没看题,这边抢答,基本上是3秒钟就抢答 DeepSeek。你们能讲一下原因吗?

周奕超

因为前三个都选过了。

Bessie

这么做题家的原因,错。教你做人。这边选择一下。

程明昊

那我们就猜一个 GPT 吧。

Bessie

你们为什么觉得是 GPT?

程明昊

因为我觉得它有点过于保守,disclaimer 说得有点多。比如“我个人的预测纯属娱乐性质,仅供球迷讨论”。

Bessie

OK,错。

余天呈

错了,错了。Claude。Claude,你那边抢答过,讲一下为什么。

Claude 不就是这种 style 吗?它好像很喜欢用括号。刚才那道 Claude 的题,它的答案也很喜欢用括号。

Bessie

那为什么你们觉得不是 GPT?

余天呈

这个感觉非常专业,不像 GPT。GPT 非常 structured。

Bessie

太对了。可以,可以。

王森

作为一个 user 来说,我可能还是希望看到更多样化一点的内容。我觉得这还是一个蛮有趣的发现,因为之前在公司里面也没有那么多机会去测试一下,或者看看别的 model 输出内容是什么样的。

Bessie

这边进行惩罚,我来吧。最近用 AI 解决了什么生活上的问题?

余天呈

我问很多运动和体重管理方面的问题,比如吃什么之类的。

王森

做旅行计划。最近用 AI 做了很多旅行计划,比如我们去欧洲旅行,就会看一看每天怎么安排。

Bessie

比如去哪儿玩、吃什么?

王森

对,看去哪儿玩、吃什么,然后比较一下合不合理、各自的优劣势之类的。

周奕超

我觉得一个是旅行计划用得特别多。第二个是,如果有一些事情需要跟美国这边的客服交流,要发邮件,这时候 AI 可以帮你比较好地做一些初步的稿件或者草稿。

Bessie

你可以再分享一下你写邮件的 flow 吗?

周奕超

邮件的 flow 就是航空公司的报销或者积分问题。我会问他们为什么我的积分或者报销还没有到账。客服有时候会拖很长时间,这个时候你就可以让 AI 比较有理有节地把你的所有证据列成一封比较正式的信函,发给他们的 CEO。

Bessie

你是自动让它写成 draft,对吧?

周奕超

对。直接把机票那些信息告诉它,再把我的诉求告诉它就可以了。

AI 给我们带来的冲击,是实实在在能改变生活的。比如 voice agent,拿我现在所在的公司举例:你现在打电话给 Chase,说你要关信用卡,它很大概率已经是 agent 接的,而且很可能已经能很好地完成你的任务。

对我们的日常生活来说,coding agent 也是一直在用的。如果你觉得 AGI 能替代你生活中的大多数事情,我觉得这还是比较远的。可能还得看 robotics 的出现,才能帮你做大多数事情。但是,如果只是一些简单的事情被 AI 取代,我觉得已经有一些被取代了。

Bessie

给我一个字,怎么抢傅慧华的座位?傅慧华是这儿一家很难抢到座位的餐厅。这里抢答。

董萌

GPT。

Bessie

怎么能是 GPT 呢?这回真没拿你当大哥。你讲讲为什么是 GPT?

董萌

我觉得它换行换得太多了。

Bessie

所以你觉得 GPT 换行比较多?

董萌

对,它有这个问题。

Bessie

好,错。

余天呈

DeepSeek。

Bessie

为什么是 DeepSeek?

余天呈

因为它不会加粗,因为它没有加粗,而且很短。

Bessie

好,没错,是 Gemini。你讲一下为什么?

王森

第一题不就是“硅谷坐标现在有几期节目”吗?这个排版感觉跟第一题一模一样。

Bessie

大概什么样的排版?

王森

就是那种没有什么内容,但是又显得很多。

Bessie

恭喜你答对了。可以,可以。这一组继续接受惩罚。

3. 中美研究者同大于异

你觉得中美 researcher 最大的差异是什么?

董萌

这道题比较难答吗?有没有想要说的?

余天呈

我觉得可能是可用资源不一样,也可能是有好有坏。我感觉有时候资源更少一些,人做得更细一些。资源多的话,显然可以跑更多的实验。

王森

我觉得这可能是非常大的一个差别。

程明昊

我觉得本质上想法不同,比想法相同更重要要小很多。现在前沿模型公司也就是中国和美国做得比较好,大家其实在很多地方的共识是一致的,比如最开始的 scaling law 该怎么做,以及怎么做 RL。

我觉得更不一样的可能只是一些资源问题,另一个是性格问题。因为其实更像是环境问题。像中国的话,国内更多的都是华人,大家交流更频繁,沟通更顺畅,所以在沟通方面能够产生的效率会更集中一点,可能在这个方向会有一些略微的不同。

在美国,毕竟大家的 background 还是比较不一样的,所以更多的一些 alignment 还是需要做。这可能是一些小区别,但基本上我觉得还是同大于异的。

Speaker 1

我觉得我没什么可说的,这道题不是很懂。但感觉确实大部分都是文化和资源上的区别。就是说,同样的一组人,把他们换一个地方,结果是不是还一样呢?不知道。

Bessie

用不超过300字、高中生能懂的话解释 transformer。

周奕超

我们抢,我们抢,我们抢。GPT。

Bessie

说一下为什么?

周奕超

它非常喜欢用这种出题式的回答,而且感觉没有特别好的 self-instruction,好像还超过了300字,所以我们猜 GPT。

Bessie

错。

余天呈

我们猜 Claude。因为它要解释 transformer。这个排版其实跟第一题有点像,我觉得句子很短,然后到处 highlight。虽然也有 Claude 的括号,但句子短这件事比较像 Flash。

Bessie

OK,错。

董萌

DeepSeek。

Bessie

讲一讲为什么?

董萌

因为太不像 Claude 了。

Bessie

Claude 会怎么样?

董萌

Claude 就是给你一坨,反正很多模型公司都会反问你,我觉得都会 follow up。

Bessie

猜对了。给力,给力。你们来抽。我们后面层层落败。

公司上市之后股票卖不卖?其他 AI 公司上市之后会买吗?

王森

喜闻乐见。卖不卖还不知道,能不能卖呢?到时候再说吧。如果能卖,可能……

余天呈

信息太少,不卖。

董萌

不卖,不卖。别的公司会买。

余天呈

那会买。就是不卖会买,什么都买。

程明昊

我觉得买卖都是看价格的。价格合理就可以买或者卖。按现在的估值来说,我觉得几家比较大的公司以后上市的话,都是可以长期持有的。不管谁上市,我觉得现在的价格都是比较合理的,除非以后发展出现一些波折。照现在的势头,应该不会卖。

周奕超

我觉得肯定卖啊,为什么不卖?大家在非上市公司等了这么久,肯定是为了充实一下自己的生活。有了这个机会,一定要把握住。

那买不买肯定也要买,但不能所有都 all in,对,不能把所有东西都 all in 在一个地方。所以我觉得这可能是我会做的选择。

Bessie

所以你是会卖了一家,买其他的,卖一部分买另外一些?

用阴阳怪气但不失礼貌的方式拒绝加班。

程明昊

这个 emoji 肯定不是这个。抢答,我觉得这个是 ChatGPT。

Bessie

我也觉得。因为它有一行只有两个字,或者还有一行只有两个字。

程明昊

收到。

Bessie

答对了。那他们抽一个,对吗?你们抽一个,接受惩罚。

4. 财富自由需要多少钱

王森

多少钱算财富自由?多少钱才能被 FIRE?

Bessie

多少钱被 FIRE?不是,小写的“犯”还是大写的 FIRE?这个区别是,你一旦被开除就自动 FIRE。

吴月忻 Crick

这个应该有标准。教授的岗位,我记得是600万还是800万美元,所以基本上可以按照教授的岗位来估。你要捐一个 professor 的 position,大概是600万美元,这笔钱的投资收益能够 cover 这个 professor 的工资。

余天呈

我觉得多少钱都可以 FIRE。我以前月薪3000的时候过得也挺好。

Bessie

你什么时候月薪3000过?

余天呈

读博的时候。

Bessie

给个 number。

余天呈

那大概1000万差不多。

Bessie

月薪3000,一年也就3万6000。

董萌

太过于俗气了,是吧?干300年,资产就够一年的现金流了。

Bessie

那下一年怎么办?

董萌

下一年再说下一年的。

王森

我觉得自由就是你只要觉得自己自由,那才是自由。不然算有再多钱,你也不自由。

周奕超

肯定有床。

Bessie

你现在在纽约,怎么会没床?

周奕超

我现在没床啊。

Bessie

在纽约当然有床了,你可以打隔断。你都不用上班了,为什么要住公司旁边?

周奕超

你自己选的那个周末娱乐活动,顶级是上班。

Bessie

对,周一到周五就是做一些不得不做的事情,周末就是上一些想上的班。请问你一般想上什么班?

周奕超

周一到周五你有很多事情,天天要开会,天天有人来找你。比如说你有一些比较大胆的想法,也可以周末的时候自己做。

Bessie

那把等级重新排一下。

周奕超

这个班肯定永远都有得上。比如说去咖啡厅,或者去麦当劳炸薯条。

Bessie

这是真正的 FIRE。

王森

我觉得如果我自己能够做到,不再把财富或者收入当作对自己个体价值的认可,那我觉得可能有200万美元就已经够了。比如说在我老家成都,或者在我老婆的老家,过一个不错的生活。

但是我觉得这可能取决于自己有没有达到那个境界。以我现在的状态,还没有达到那种不和别人比较、只在乎自己生活的境界。那样的话,我觉得你可能永远没有一个线,让你觉得自己 FIRE 了。

因为你会永远处在和别人比较的过程中。一旦跨过一个收入阶级或者财富阶级,你就会开始和另外一拨人比较。

Bessie

下面一题:湾区三俗有哪些?

董萌

我们抢答。

Bessie

讲一讲为什么?

董萌

首先它没有 follow-up,这件事好像就排除了 GPT 和 Claude。

王森

Gemini 这个答案好像跟之前 Gemini 的答案也不太像,所以我们就盲猜一手。

程明昊

我再加一点:它没有句号。我觉得现在大公司,除非是排版错误,否则模型应该不会在结尾少一句句号。

Bessie

OK,对了,太牛了。你们觉得是 Grok。你们这边只是输给了抢答时间,可以再补充一下为什么觉得这是 Grok。

王森

“内卷”这个词还挺内卷的。你想,大家的业余活动出奇地一致,还加了这么多内容。

Bessie

我记得第一次看到这个题目的时候,我就想,天哪,我的那些 OpenAI 同事肯定一眼就能看出来到底是哪个模型,哪个模型是哪个模型,哪个模型是 5.5 Instant,哪些模型是其他公司的模型。

但实际上在问大家的时候,我发现大家其实很难就哪个模型特别像自家的模型 reach consensus。这其实让我很惊讶,因为很多模型的输出特别特别相像。

5. Prompt 大战测试思考极限

游戏4,我们做的是 prompt 大战。3人一队,用不超过30个字的中文 prompt,让 ChatGPT 5.5 Thinking High 思考尽可能久。你们现在可以在队内小声讨论一下,待会儿告诉我。我们会用 ChatGPT 5.5 Thinking High 来做这次测试。

Speaker 1

把圆周率算到10的100次方位。

Speaker 2

那它肯定不会算,肯定会拒绝。

Speaker 1

你跟它说,它应该会拒绝,对吧?你跟它说30个点,30个点。

Speaker 2

对,这些它肯定会出来。

Speaker 1

计算圆周率到小数点后……

Speaker 2

不,它直接给你估出来了。

Speaker 1

我觉得可以说,让它总结某一个东西,然后每个东西有一个 specific 的要求,一定要按照某种类别收集到多少量。就是这种 very verifiable 的任务。

Speaker 2

对,我觉得应该是一些 very verifiable 的事,然后可以再给它加一些要求。每一项还可以再加一些你说的那种时间上的要求。

Bessie

30个词,30个字。

Speaker 1

好,脚本内容是46到60分钟。

Bessie

好,来,告诉我。想一下什么东西又臭又长,而且网上很多。

Speaker 2

让它写一个养牛、用割毛刺的计划。

Speaker 1

对。

Bessie

你们声音稍微小一点,我在这儿都能听得见。

Speaker 2

就有一种被鄙视的感觉。你必须用这个蠢办法给我看一下。

Speaker 1

我感觉还是搜索会最花时间。

Speaker 2

“新点”它有一个意思吧?你数到100,我觉得它应该也会 reject。

Bessie

再给大家讲一下,Thinking High 的思考时间最长。你在上面会看到它 think 了多久。为什么我们不测试一下呢?30个字,是吧?那打一下,试着打一下吧。

Speaker 1

中文,中文。

Bessie

好的,没事。里面英文就一个词算一个,对吧?

Speaker 2

不是,就是中文,让它自行详细思考。

Bessie

对,自行想。

Speaker 1

我们的可以了,先试我们的吧。

Bessie

哇,我们已经发送了。你们读一下自己的 prompt 是什么?

Speaker 1

搜索 NeurIPS 成立以来每年引用量最高的90篇论文,并总结成 doc,自行详细思考。

Speaker 2

查询至少100个网页,给一个研究报告:多少钱才能财务自由?思考尽可能长。

Bessie

两组现在都提交了。我马上会让它输入进去验证,同时你们讲一下各自的思路是什么。

Speaker 1

其实是让它尽量做更多的工具调用。比如搜索这种比较耗时的任务,希望它尽量多做几次搜索。同时还希望给它一些 verifiable task,这样它不会偷懒。相当于给它一个明确的目标,来衡量它做的结果,这样它就不会给我们一些似是而非的结果,或者反过来问我们。大概是这样的思路。

Bessie

那边……

Speaker 2

因为要搜很久,看起来他们这个已经搜了好久了,不知道要搜多久。

Bessie

OK,结果出来了。

搜索“NeurIPS 成立以来每年引用量最高的90篇论文”,思考了6分24秒。

那么另外一个,“查询至少100个网站,给个研究报告:多少钱才能财富自由?思考尽可能长”,思考了1分23秒。

恭喜这个队赢麻了。

【特别综艺-下】硅谷AI研究员|模型猜猜乐和Prompt大战 | BidClub