Speaker 1
可以,做得比较烂的,猜 GPT。GPT,这边抢答 GPT。为什么觉得是 GPT?因为他非常喜欢用玻璃的框,而且特别多括号。错。好,你猜 GPT。怎么能是 GPT 呢?这回真没拿你当大哥。
Bessie
公众对贵司 AI 误解最多的点是什么?是不是下一个模型发布之前,上一个就会被变笨?
哈喽,硅谷坐标的观众们,我是 Bessie。我是今天的特约主持人,现在在 OpenAI 上班。今天我们不上班,来跟我的同事和好朋友们一起玩游戏。
程明昊
大家好,我叫程明昊,我在 OpenAI 工作,具体是在一个做后训练的团队,主要负责 eval 相关的工作,大体上是两个方向:一个是让我们的 eval 变得更加可信,另外一个是让 eval 尽可能测量模型真实的能力,以及用户更在意的一些能力。
余天呈
大家好,我叫余天呈,我在 OpenAI 做后训练。
周奕超
大家好,我叫周奕超。最近我刚刚加入了一家 AI startup,叫 Coficia,做的是 voice agent 相关的问题。工作中我主要负责解决如何让 AI 不那么“耳背”的问题,学名叫 ASR,也就是自动语音识别相关的问题。
董萌
我叫董萌,我在 OpenAI 做 GPU scheduling,给大家分 GPU。
王森
我叫王森,现在在 OpenAI 做 memory 相关的研究。我们主要的工作就是让模型更好地理解你,然后生成更符合你的喜好、更加个性化的回答。
吴月忻 Crick
大家好,我叫 Crick,现在也在 OpenAI,做 reasoning 部分的一些工作,主要是 test-time scaling,也就是怎么让模型能够想得尽可能长,然后让它具备更多的智能。
1. 模型猜测正式开始
Bessie
接下来我们来玩“猜猜我是谁”。6 位嘉宾分成两组 PK,我会把几条 prompt 丢给不同的模型生成答案,大家看到 prompt 和答案后,猜它们来自哪家模型。两组轮流抢答,猜错的本组接受真心话惩罚,猜对则对方全组接受惩罚。
第一题:硅谷坐标现在有几期节目?这道题现在开始讨论,确定了就可以抢答。这里有抢答。
周奕超
我觉得是 DeepSeek。
Bessie
错了。为什么觉得是 DeepSeek?
周奕超
因为我觉得它中文看上去还是比较流畅的,所以我觉得可能是国产模型。
余天呈
我觉得是这个。
Bessie
你觉得呢?
余天呈
我……
Bessie
你俩 PK 一下。我没有说你啊,个人说。
程明昊
GPT。为什么觉得是 GPT?因为我觉得它回答对了。
Bessie
所以你觉得 GPT 的准确性更高?但这几个应该都能回答对,所以这里没有特别的依据。
董萌
OK,我们觉得是 Gemini。
Bessie
你们觉得是 Gemini?恭喜你们答对了。为什么觉得是 Gemini?
董萌
我们觉得它比较短,像 Flash model,而且有这个 highlight。Claude 可能会更抽象一点,这个还比较 straightforward。
王森
所谓抽象,就是显得自己情商很高,回答很普世的这种问题。如果每个 model 都能答个大概,那可能大家大部分只能从语言风格、排版习惯,还有语癖这种角度来分析。如果这些信号都不是很明显,确实不是很好找,因为每个 model 都能答得差不多。
Bessie
那边3位进行惩罚。你们由一个人来抽一个。你答错了,你来抽。
2. AI 工作流实战技巧
周奕超
分享一个使用上的小技巧。天天用 code,希望大家也都用 code。我做的方式就是,如果有一个问题不会,让它先给我列一个 plan,然后我把那个 plan 改一改,再告诉它:“Spin up multiple sub-agents to carry out。”
程明昊
让它多写文档、做记录。现在这些 model 有时候 compaction 之后,突然会坠入太虚幻境。就是说,你跟 model 聊天聊的时间特别长之后,它可能突然就懵了。你有一份文档记录,至少可以把东西记下来。
王森
这其实是小概率事件,但是用得久了,感觉早晚会发生。所以你觉得让 AI 一直有一个文档可以看,我自己也可以看?
程明昊
主要是我的记忆力更差。它有的时候 compaction 失败。
王森
我的 compaction 从未成功过。我觉得还有一个很神奇的用法:很多人在用 AI 的时候,会在一个 conversation 里面接着聊,一直聊下去,聊到它好像忘记了一些东西。其实没有必要一直在同一个对话框里面聊,你可以每次开一个新的对话框。它基本上还会记着你上一条聊的内容,而且这样也会让聊天消息加载得更快。
董萌
甚至会更准确,因为它不会超过 context。我已经很久没有自己手动 submit 过 job,也很久没有自己读过 job 的 log 了,可以直接使用 AI 帮你 submit job 和读 job 的 log。
Bessie
所以讲的都是工作上的事情,怎么样让 AI 更好地帮助你们工作。
第二题:SpaceX 股票现在该不该买?
余天呈
我觉得这个很好。
Bessie
有没有抢答的?这里抢答。
周奕超
我们猜 Claude。
Bessie
Claude?错。为什么?
周奕超
因为我们一开始想猜 GPT,但是 GPT 有一些我们知道的行为它没有。比如它的换行没有那么激进,所以我们猜不是 GPT。
王森
我们猜 DeepSeek。
Bessie
为什么觉得是 DeepSeek?
王森
首先我们觉得 GPT 和 Claude 都不会给出“不建议”这种这么直接的建议,当然这个也不一定。它们会更谨慎一些。对面刚才讨论换行,我们也觉得不是 GPT。根据我们刚刚对 Flash 的想法,感觉这个答案又有点完整,也不太像 Flash,所以很可能是 DeepSeek。
Bessie
你们觉得是 DeepSeek?错。
董萌
Gemini Flash。
Bessie
为什么觉得是 Gemini Flash?
董萌
我觉得 GPT 和 Claude 的 safety 都做得非常小心,不太会给你投资建议。
周奕超
不太流畅。
董萌
对,我的意思就是做得比较烂,所以他们对……
Bessie
对,OK。错。为什么?
董萌
因为都猜完了。他们组现在说自己就觉得差得不多。
Bessie
不不不,我们还没开始讲。为什么?
董萌
就是它有些口气,不是很确定,而且它没有给一个分析图,这一点还蛮惊讶的。
王森
但是这是 5.5 Instant 的风格,突然就……
Bessie
这就是你们对 model 的判断。OK,真棒。那你们继续接受惩罚。
吴月忻 Crick
不能每次都我来吧?要是赢了抽你,你也得多说,是这样的。
Bessie
先来念一下你抽到的惩罚。
吴月忻 Crick
今天最怕被问到什么问题?
Bessie
为什么怕面对自我介绍?
吴月忻 Crick
太尴尬了,大家都是 OpenAI 的。
余天呈
我最怕被问到的问题是:把各个公司的模型水平从好到差排序。
董萌
我最怕被问到“今天干了什么”,因为今天什么也没干。
Bessie
OK,3、2、1,大家翻到下一题。
下一题的 prompt 是:下周放假了,给我推荐几个目的地。
程明昊
猜 GPT。
Bessie
这边抢答 GPT。为什么觉得是 GPT?
程明昊
因为它非常喜欢用 bullet point,而且特别多括号。
Bessie
错。你们猜 ChatGPT,已经错了。
余天呈
我觉得可以。我觉得是 DeepSeek。
Bessie
为什么觉得是 DeepSeek?
余天呈
因为我觉得他们猜得不错。ChatGPT 猜的是这个,但是我感觉应该不会很快出现一个重复的,直接出现一个重复选项,应该排除。连续选 C 肯定不对,我感觉不会连着两个选 C,可能也不会跳一个选 C。
我觉得 Claude 没有那么喜欢用那一套,而且我印象中 Claude 一定会做得稍微长一些。DeepSeek 可能会更神奇一点,输出稍微短一点。
Bessie
说得很好,但错。
Speaker 1
其实二选一了,这是哪个?应该是 Claude,或者是这样的。Claude 现在这么懒吗?
Speaker 2
这已经是这个 style 了。大家注意一下,这是 Claude 4.6 Sonnet 对 Gemini 3.5 Flash。
Bessie
对,就是因为是 4.6 Sonnet,所以选 C 还不至于。
Speaker 1
Sonnet 有什么问题?
Speaker 2
Sonnet 的 style 也是一样的,那我有什么问题?它的 style 很棒。
程明昊
我们猜 Claude。
Bessie
你们猜 Claude?能讲一下为什么吗?
程明昊
这已经二选一了,我们觉得 Gemini 已经出现过了。
Bessie
好,非常学霸、做题家的想法。恭喜你们答对了。然后这边接受惩罚。
王森
感觉这些模型都存在很严重的问题,比如大量的括号、不必要的括号、破折号,还有换行。我本来以为只有我们有这个问题。
周奕超
因为大家都有这个问题嘛,所以现在就很难猜。
余天呈
刚刚听到你们也讨论了一下,觉得这有可能是 Claude。之所以觉得是 Claude,是因为我把 ChatGPT 和 Gemini 都排除了,所以就在 Claude 和 DeepSeek 之间选一个。我们考虑到 DeepSeek 是比较便宜的模型,所以输出应该短一点。但是我没有注意到这是 Claude Sonnet,Sonnet 的话可能也会稍微精简一点。
Bessie
OK,那你们这儿来做一个惩罚吧。
公众对贵司 AI 误解最多的点是什么?
程明昊
我觉得最多的误解就是总是觉得 AI 可以替代非常多的工作。其实现在 AI 还正处于非常初级的阶段。
Bessie
你觉得是 AI 的能力不行,还是普及度的问题?
程明昊
我觉得一个是普及度的问题,另一个是 AI 的能力和大家的期待之间有一个非常极端的、非正即负的概念。公众的看法比较极端:要么觉得 AI 什么都能做到,要么就觉得 AI 什么都做不到。但其实我们今天处于一个非常中间的位置。
王森
我经常会看到的一种误解是,有一些简单的事情,大家会觉得模型理所当然应该做得比较好。甚至会觉得,如果看到一些比较简单的事情做得不好,会不会是公司自己偷偷在背后搞破坏?
董萌
但其实我感觉,模型的智能分布是非常不均匀的。把一些比较简单的事情做好,也需要很多工作去做。
Bessie
确实会看到很多人说,是不是下一个模型发布之前,上一个就会被变笨之类的。
王森
根据我个人的了解,应该不是这样。
Bessie
所以你觉得更多的是大家的观感问题?
王森
对。首先,大家对模型输出的预期就不一定很稳定。有时候你会觉得自己的标准是一致的,但其实你昨天和今天的想法,即便模型给你同一个答案,你可能也不一定一样满意。
Bessie
这个算是澄清了大家觉得模型“降智”的说法,因为我也不知道全部的情况,所以说不定真的是这样呢。
王森
我们也会经常关注各种 social media,也能从 user feedback 里面得到很多灵感。有一些模型不好的行为确实是可以证实的,我们也会通过迭代 algorithm,试图消除这种不好的行为。
如果大家发现模型的回答里面有任何你不想要的东西,我们非常鼓励大家去点 thumb down 按钮,这样会帮助我们更好地改进模型。
Bessie
好的,3、2、1,下一页。
下一个 prompt 是:你预测一下世界杯的冠军是谁,谁进决赛?
周奕超
DeepSeek。
Bessie
这题我们都没看题,这边抢答,基本上是3秒钟就抢答 DeepSeek。你们能讲一下原因吗?
周奕超
因为前三个都选过了。
Bessie
这么做题家的原因,错。教你做人。这边选择一下。
程明昊
那我们就猜一个 GPT 吧。
Bessie
你们为什么觉得是 GPT?
程明昊
因为我觉得它有点过于保守,disclaimer 说得有点多。比如“我个人的预测纯属娱乐性质,仅供球迷讨论”。
Bessie
OK,错。
余天呈
错了,错了。Claude。Claude,你那边抢答过,讲一下为什么。
Claude 不就是这种 style 吗?它好像很喜欢用括号。刚才那道 Claude 的题,它的答案也很喜欢用括号。
Bessie
那为什么你们觉得不是 GPT?
余天呈
这个感觉非常专业,不像 GPT。GPT 非常 structured。
Bessie
太对了。可以,可以。
王森
作为一个 user 来说,我可能还是希望看到更多样化一点的内容。我觉得这还是一个蛮有趣的发现,因为之前在公司里面也没有那么多机会去测试一下,或者看看别的 model 输出内容是什么样的。
Bessie
这边进行惩罚,我来吧。最近用 AI 解决了什么生活上的问题?
余天呈
我问很多运动和体重管理方面的问题,比如吃什么之类的。
王森
做旅行计划。最近用 AI 做了很多旅行计划,比如我们去欧洲旅行,就会看一看每天怎么安排。
Bessie
比如去哪儿玩、吃什么?
王森
对,看去哪儿玩、吃什么,然后比较一下合不合理、各自的优劣势之类的。
周奕超
我觉得一个是旅行计划用得特别多。第二个是,如果有一些事情需要跟美国这边的客服交流,要发邮件,这时候 AI 可以帮你比较好地做一些初步的稿件或者草稿。
Bessie
你可以再分享一下你写邮件的 flow 吗?
周奕超
邮件的 flow 就是航空公司的报销或者积分问题。我会问他们为什么我的积分或者报销还没有到账。客服有时候会拖很长时间,这个时候你就可以让 AI 比较有理有节地把你的所有证据列成一封比较正式的信函,发给他们的 CEO。
Bessie
你是自动让它写成 draft,对吧?
周奕超
对。直接把机票那些信息告诉它,再把我的诉求告诉它就可以了。
AI 给我们带来的冲击,是实实在在能改变生活的。比如 voice agent,拿我现在所在的公司举例:你现在打电话给 Chase,说你要关信用卡,它很大概率已经是 agent 接的,而且很可能已经能很好地完成你的任务。
对我们的日常生活来说,coding agent 也是一直在用的。如果你觉得 AGI 能替代你生活中的大多数事情,我觉得这还是比较远的。可能还得看 robotics 的出现,才能帮你做大多数事情。但是,如果只是一些简单的事情被 AI 取代,我觉得已经有一些被取代了。
Bessie
给我一个字,怎么抢傅慧华的座位?傅慧华是这儿一家很难抢到座位的餐厅。这里抢答。
董萌
GPT。
Bessie
怎么能是 GPT 呢?这回真没拿你当大哥。你讲讲为什么是 GPT?
董萌
我觉得它换行换得太多了。
Bessie
所以你觉得 GPT 换行比较多?
董萌
对,它有这个问题。
Bessie
好,错。
余天呈
DeepSeek。
Bessie
为什么是 DeepSeek?
余天呈
因为它不会加粗,因为它没有加粗,而且很短。
Bessie
好,没错,是 Gemini。你讲一下为什么?
王森
第一题不就是“硅谷坐标现在有几期节目”吗?这个排版感觉跟第一题一模一样。
Bessie
大概什么样的排版?
王森
就是那种没有什么内容,但是又显得很多。
Bessie
恭喜你答对了。可以,可以。这一组继续接受惩罚。
3. 中美研究者同大于异
你觉得中美 researcher 最大的差异是什么?
董萌
这道题比较难答吗?有没有想要说的?
余天呈
我觉得可能是可用资源不一样,也可能是有好有坏。我感觉有时候资源更少一些,人做得更细一些。资源多的话,显然可以跑更多的实验。
王森
我觉得这可能是非常大的一个差别。
程明昊
我觉得本质上想法不同,比想法相同更重要要小很多。现在前沿模型公司也就是中国和美国做得比较好,大家其实在很多地方的共识是一致的,比如最开始的 scaling law 该怎么做,以及怎么做 RL。
我觉得更不一样的可能只是一些资源问题,另一个是性格问题。因为其实更像是环境问题。像中国的话,国内更多的都是华人,大家交流更频繁,沟通更顺畅,所以在沟通方面能够产生的效率会更集中一点,可能在这个方向会有一些略微的不同。
在美国,毕竟大家的 background 还是比较不一样的,所以更多的一些 alignment 还是需要做。这可能是一些小区别,但基本上我觉得还是同大于异的。
Speaker 1
我觉得我没什么可说的,这道题不是很懂。但感觉确实大部分都是文化和资源上的区别。就是说,同样的一组人,把他们换一个地方,结果是不是还一样呢?不知道。
Bessie
用不超过300字、高中生能懂的话解释 transformer。
周奕超
我们抢,我们抢,我们抢。GPT。
Bessie
说一下为什么?
周奕超
它非常喜欢用这种出题式的回答,而且感觉没有特别好的 self-instruction,好像还超过了300字,所以我们猜 GPT。
Bessie
错。
余天呈
我们猜 Claude。因为它要解释 transformer。这个排版其实跟第一题有点像,我觉得句子很短,然后到处 highlight。虽然也有 Claude 的括号,但句子短这件事比较像 Flash。
Bessie
OK,错。
董萌
DeepSeek。
Bessie
讲一讲为什么?
董萌
因为太不像 Claude 了。
Bessie
Claude 会怎么样?
董萌
Claude 就是给你一坨,反正很多模型公司都会反问你,我觉得都会 follow up。
Bessie
猜对了。给力,给力。你们来抽。我们后面层层落败。
公司上市之后股票卖不卖?其他 AI 公司上市之后会买吗?
王森
喜闻乐见。卖不卖还不知道,能不能卖呢?到时候再说吧。如果能卖,可能……
余天呈
信息太少,不卖。
董萌
不卖,不卖。别的公司会买。
余天呈
那会买。就是不卖会买,什么都买。
程明昊
我觉得买卖都是看价格的。价格合理就可以买或者卖。按现在的估值来说,我觉得几家比较大的公司以后上市的话,都是可以长期持有的。不管谁上市,我觉得现在的价格都是比较合理的,除非以后发展出现一些波折。照现在的势头,应该不会卖。
周奕超
我觉得肯定卖啊,为什么不卖?大家在非上市公司等了这么久,肯定是为了充实一下自己的生活。有了这个机会,一定要把握住。
那买不买肯定也要买,但不能所有都 all in,对,不能把所有东西都 all in 在一个地方。所以我觉得这可能是我会做的选择。
Bessie
所以你是会卖了一家,买其他的,卖一部分买另外一些?
用阴阳怪气但不失礼貌的方式拒绝加班。
程明昊
这个 emoji 肯定不是这个。抢答,我觉得这个是 ChatGPT。
Bessie
我也觉得。因为它有一行只有两个字,或者还有一行只有两个字。
程明昊
收到。
Bessie
答对了。那他们抽一个,对吗?你们抽一个,接受惩罚。
4. 财富自由需要多少钱
王森
多少钱算财富自由?多少钱才能被 FIRE?
Bessie
多少钱被 FIRE?不是,小写的“犯”还是大写的 FIRE?这个区别是,你一旦被开除就自动 FIRE。
吴月忻 Crick
这个应该有标准。教授的岗位,我记得是600万还是800万美元,所以基本上可以按照教授的岗位来估。你要捐一个 professor 的 position,大概是600万美元,这笔钱的投资收益能够 cover 这个 professor 的工资。
余天呈
我觉得多少钱都可以 FIRE。我以前月薪3000的时候过得也挺好。
Bessie
你什么时候月薪3000过?
余天呈
读博的时候。
Bessie
给个 number。
余天呈
那大概1000万差不多。
Bessie
月薪3000,一年也就3万6000。
董萌
太过于俗气了,是吧?干300年,资产就够一年的现金流了。
Bessie
那下一年怎么办?
董萌
下一年再说下一年的。
王森
我觉得自由就是你只要觉得自己自由,那才是自由。不然算有再多钱,你也不自由。
周奕超
肯定有床。
Bessie
你现在在纽约,怎么会没床?
周奕超
我现在没床啊。
Bessie
在纽约当然有床了,你可以打隔断。你都不用上班了,为什么要住公司旁边?
周奕超
你自己选的那个周末娱乐活动,顶级是上班。
Bessie
对,周一到周五就是做一些不得不做的事情,周末就是上一些想上的班。请问你一般想上什么班?
周奕超
周一到周五你有很多事情,天天要开会,天天有人来找你。比如说你有一些比较大胆的想法,也可以周末的时候自己做。
Bessie
那把等级重新排一下。
周奕超
这个班肯定永远都有得上。比如说去咖啡厅,或者去麦当劳炸薯条。
Bessie
这是真正的 FIRE。
王森
我觉得如果我自己能够做到,不再把财富或者收入当作对自己个体价值的认可,那我觉得可能有200万美元就已经够了。比如说在我老家成都,或者在我老婆的老家,过一个不错的生活。
但是我觉得这可能取决于自己有没有达到那个境界。以我现在的状态,还没有达到那种不和别人比较、只在乎自己生活的境界。那样的话,我觉得你可能永远没有一个线,让你觉得自己 FIRE 了。
因为你会永远处在和别人比较的过程中。一旦跨过一个收入阶级或者财富阶级,你就会开始和另外一拨人比较。
Bessie
下面一题:湾区三俗有哪些?
董萌
我们抢答。
Bessie
讲一讲为什么?
董萌
首先它没有 follow-up,这件事好像就排除了 GPT 和 Claude。
王森
Gemini 这个答案好像跟之前 Gemini 的答案也不太像,所以我们就盲猜一手。
程明昊
我再加一点:它没有句号。我觉得现在大公司,除非是排版错误,否则模型应该不会在结尾少一句句号。
Bessie
OK,对了,太牛了。你们觉得是 Grok。你们这边只是输给了抢答时间,可以再补充一下为什么觉得这是 Grok。
王森
“内卷”这个词还挺内卷的。你想,大家的业余活动出奇地一致,还加了这么多内容。
Bessie
我记得第一次看到这个题目的时候,我就想,天哪,我的那些 OpenAI 同事肯定一眼就能看出来到底是哪个模型,哪个模型是哪个模型,哪个模型是 5.5 Instant,哪些模型是其他公司的模型。
但实际上在问大家的时候,我发现大家其实很难就哪个模型特别像自家的模型 reach consensus。这其实让我很惊讶,因为很多模型的输出特别特别相像。
5. Prompt 大战测试思考极限
游戏4,我们做的是 prompt 大战。3人一队,用不超过30个字的中文 prompt,让 ChatGPT 5.5 Thinking High 思考尽可能久。你们现在可以在队内小声讨论一下,待会儿告诉我。我们会用 ChatGPT 5.5 Thinking High 来做这次测试。
Speaker 1
把圆周率算到10的100次方位。
Speaker 2
那它肯定不会算,肯定会拒绝。
Speaker 1
你跟它说,它应该会拒绝,对吧?你跟它说30个点,30个点。
Speaker 2
对,这些它肯定会出来。
Speaker 1
计算圆周率到小数点后……
Speaker 2
不,它直接给你估出来了。
Speaker 1
我觉得可以说,让它总结某一个东西,然后每个东西有一个 specific 的要求,一定要按照某种类别收集到多少量。就是这种 very verifiable 的任务。
Speaker 2
对,我觉得应该是一些 very verifiable 的事,然后可以再给它加一些要求。每一项还可以再加一些你说的那种时间上的要求。
Bessie
30个词,30个字。
Speaker 1
好,脚本内容是46到60分钟。
Bessie
好,来,告诉我。想一下什么东西又臭又长,而且网上很多。
Speaker 2
让它写一个养牛、用割毛刺的计划。
Speaker 1
对。
Bessie
你们声音稍微小一点,我在这儿都能听得见。
Speaker 2
就有一种被鄙视的感觉。你必须用这个蠢办法给我看一下。
Speaker 1
我感觉还是搜索会最花时间。
Speaker 2
“新点”它有一个意思吧?你数到100,我觉得它应该也会 reject。
Bessie
再给大家讲一下,Thinking High 的思考时间最长。你在上面会看到它 think 了多久。为什么我们不测试一下呢?30个字,是吧?那打一下,试着打一下吧。
Speaker 1
中文,中文。
Bessie
好的,没事。里面英文就一个词算一个,对吧?
Speaker 2
不是,就是中文,让它自行详细思考。
Bessie
对,自行想。
Speaker 1
我们的可以了,先试我们的吧。
Bessie
哇,我们已经发送了。你们读一下自己的 prompt 是什么?
Speaker 1
搜索 NeurIPS 成立以来每年引用量最高的90篇论文,并总结成 doc,自行详细思考。
Speaker 2
查询至少100个网页,给一个研究报告:多少钱才能财务自由?思考尽可能长。
Bessie
两组现在都提交了。我马上会让它输入进去验证,同时你们讲一下各自的思路是什么。
Speaker 1
其实是让它尽量做更多的工具调用。比如搜索这种比较耗时的任务,希望它尽量多做几次搜索。同时还希望给它一些 verifiable task,这样它不会偷懒。相当于给它一个明确的目标,来衡量它做的结果,这样它就不会给我们一些似是而非的结果,或者反过来问我们。大概是这样的思路。
Bessie
那边……
Speaker 2
因为要搜很久,看起来他们这个已经搜了好久了,不知道要搜多久。
Bessie
OK,结果出来了。
搜索“NeurIPS 成立以来每年引用量最高的90篇论文”,思考了6分24秒。
那么另外一个,“查询至少100个网站,给个研究报告:多少钱才能财富自由?思考尽可能长”,思考了1分23秒。
恭喜这个队赢麻了。