
如果问一句「现在衡量大模型到底多聪明,最硬的指标是什么」,很多人的答案会指向同一张考卷:GPQA。它的全称是 Graduate-Level Google-Proof Q&A,翻译过来就是「研究生水平、防 Google 搜索的问答基准」。光听名字就知道它想干一件什么事——造一张连搜索引擎都帮不上忙、连人类博士都很难拿高分的考卷,去逼出大模型的真实上限。这篇文章把这篇论文从头拆一遍,讲清楚它为什么难、难在哪、以及它为什么成了今天评测「超级智能」事实上的标尺。
一、论文速览卡
| 论文标题 | GPQA: A Graduate-Level Google-Proof Q&A Benchmark |
| 作者 | David Rein, Betty Li Hou, Asa Cooper Stickland, Jackson Petty, Richard Yuanzhe Pang, Julien Dirani, Julian Michael, Samuel R. Bowman |
| 机构 | 纽约大学(NYU)为主,含 Cohere、Anthropic 等机构研究员 |
| arXiv | 2311.12022(2023 年 11 月 20 日提交) |
| 规模 | 448 道多选题,覆盖生物、物理、化学三门学科 |
| 一句话结论 | 造出一批「人类博士只能答对 65%、连联网搜索都救不了」的超难题目,作为衡量 AI 能否在科学前沿辅助人类、以及人类能否监督超越自己能力的 AI 的标尺。 |
二、为什么这篇论文值得精读
GPQA 的重要性,不在它「又造了一个 benchmark」,而在于它第一个系统性地瞄准了一个此前被忽略的问题:当 AI 比出题的人还厉害时,我们拿什么去衡量它?
传统的评测基准,无论是 MMLU 还是各类问答数据集,都有一个隐含的前提——题目是人类能答对的,所以「人类满分」是理论上限,模型的分数是「离人类还有多远」。但这条路走到头会撞墙:一旦模型的水平逼近甚至超过普通人类出题者,这些题就「失效」了——满分的天花板太低,测不出谁更强。GPQA 反其道而行之,它主动把题目难度抬到「人类博士都很吃力」的区间,为的是给「超越人类能力」的 AI 留出可测量的空间。
更关键的是它的「Google-proof」设计。很多号称「难」的题,其实靠联网搜索就能解决——这在大模型时代是个大问题,因为模型可以调用检索、可以背下海量网络文本。GPQA 的题目刻意设计成「搜不到现成答案」:即使给验证者 30 分钟以上、无限上网,非专家的正确率也只有 34%。这就把「记忆/检索能力」从「推理/专业能力」里剥离了出来,让分数更纯粹地反映模型「真的懂」的程度。
第三个价值,是它直接把评测和「scalable oversight(可扩展监督)」这个前沿问题挂钩。论文说得直白:如果未来我们要靠 AI 去解决很难的科学问题、去发现新知识,那人类怎么去监督和验证一个比自己更强的 AI 的输出?这恰恰是 AI 安全研究最核心的难题之一。GPQA 提供了一块现成的试验田——在「连专家都吃力」的难度上,去测人类监督的可靠性和边界。
正是因为这几点,GPQA 发布后迅速成为头部实验室的「必考科目」:OpenAI 的 o1、Anthropic 的 Claude、DeepSeek-R1 等几乎所有顶级模型的技术报告里,都会专门报告一个叫 GPQA Diamond 的分数。它已经从一个学术数据集,变成了衡量「模型是否具备科研级能力」的行业共识标尺。
三、背景:为什么需要一张「搜不到答案」的考卷
要理解 GPQA 的动机,得先看清传统评测基准的两个「天花板」,它们恰好也是这篇论文想打破的。
第一个天花板:人类上限太低。像 MMLU 这类基准,题目大多是「人类专家能答对、且能轻松答对」的难度。它们的价值在于区分「模型离人类多远」,但一旦模型接近人类水平(比如 GPT-4 时代很多模型在 MMLU 上已经超过 85%),这类题就开始失去区分度——高分挤在一起,测不出「谁更聪明」。要测出「超越人类的智能」,你得先有一张人类自己也考不好的卷子,否则分数到顶就饱和了。
第二个天花板:题目能被「作弊」。互联网上有海量文本,很多「知识题」的答案其实就藏在维基百科、教科书、论文里。大模型要么在预训练时见过,要么可以在推理时联网检索。这意味着「答对」可能反映的是「记忆力好」或「检索能力强」,而不是「真的理解并推理」。GPQA 要的是后者,所以它必须保证题目答案在网上找不到现成的——这就是「Google-proof」的真正含义。
这两点合起来,指向一个更深的焦虑:AI 正在逼近一个「人没法打分」的临界点。如果 AI 能解决连专家都头疼的问题,那我们既需要一张能测出它水平的卷子(上限要够高),也需要一种能验证它答案对错的方法(不能靠搜索)。GPQA 就是冲着这两个缺口去的。
论文作者还点明了一个更现实的应用场景:科学发现。当 AI 被用来「发展新科学知识」时,它的输出可能超出人类当下的认知边界,这时「人类专家」这个裁判本身就不可靠了。GPQA 的难度设计,就是为了模拟「AI 输出超出人类判断能力」的场景,给「可扩展监督」的研究提供一个可复现的测试环境。
四、核心方法:题目是怎么造出来的,又是怎么「防 Google」的
GPQA 的题目不是随便抓来的,而是由领域专家(在读博士或已获博士)逐条手写,再经过一套严格的验证流程。这个过程本身,就是论文最有含金量的部分。
4.1 题目设计:博士出题,难度拉满
数据集的 448 道题覆盖三门硬核学科:生物学、物理学、化学。出题人都是「正在读博或已经拿到博士学位」的领域专家——这个门槛本身就保证了两件事:一是题目足够专业、足够前沿,二是出题人自己清楚「这道题的正确答案是什么、为什么对」。
题目的形式是标准的多选题,但难点在于干扰项的设计。这些错误选项不是随便编的,而是「看起来像那么回事、只有真正的专家才能排除」的选项。换句话说,题目考的不是「记不记得住」,而是「能不能在多个高度相似、都显得合理的选择里,靠专业判断挑出唯一正确的那个」。这种「专家级辨析」的能力,恰恰是检索和记忆最难伪造的。
4.2 验证:用「专家正确率」和「非专家正确率」划定难度
造出题之后,论文做了一件非常关键的事——用两组人分别去验证题目难度,用数据把「到底有多难」钉死:
- 专家验证:让拥有对应领域博士学位(或在读博士)的专家来答题,他们达到 65% 的准确率;如果回溯性地剔除掉专家事后发现的「明显出错」的题目,这个数字能到 74%。
- 非专家验证:让「技能高超但非该领域」的验证者来答,即便他们平均花超过 30 分钟、并且可以无限制地上网搜索,正确率也只有 34%。
这一组数字是整个基准的灵魂。它传达了两层意思:第一,题目难到连专家都只有 65% 的正确率——这意味着「人类满分」几乎不可能,分数天花板被抬到了前所未有的高度;第二,非专家即使联网搜 30 分钟也才 34%——这证明了「Google-proof」是真的,题目答案在网上找不到现成的,检索这条路被堵死了。
34% 这个数字尤其值得琢磨。多选题的「瞎蒙」基线在 25%(四选一)左右,非专家联网搜了 30 分钟也才 34%,说明他们费尽力气也只比随机猜强一点点。这反过来说明:这些题的答案,不是「查」出来的,而是「懂」出来的。没有相应的专业训练,给你再多的搜索时间也是白搭。
4.3 数据集分层:主集、扩展集和 Diamond 子集
论文还提供了几个不同口径的子集,方便不同场景使用。其中最出名的就是 GPQA Diamond——这是一个「高共识」子集,专门挑那些多位专家意见高度一致、且都答对的题目。它的意义在于:这些题的答案足够「客观、无争议」,避免了「专家自己都吵不清」的题目带来的噪声。今天各大模型报告里报的「GPQA Diamond」分数,用的就是这个更干净、更硬的子集。
为什么单独搞一个 Diamond 子集?因为「专家共识」本身是个信号——连多个专家都能一致答对的题,说明它的答案是真正确定、可验证的,用它来打分,分数才不会因为题目本身的模糊性而失真。这也是 GPQA 在工程上做得比很多 benchmark 更讲究的地方。
五、实验结果:人类和 AI 分别考了多少分
论文最核心的一组数据,是「人类」和「当时最强的 AI」在这张卷子上的表现对比。这些数字我逐字列出来,因为它们定义了 GPQA 的难度刻度:
- 人类专家:65%(回溯剔除明显错误后 74%)
- 非专家(联网搜索 30 分钟以上):34%
- GPT-4 最强基线:39%
这组数字摆在一起,结论非常清晰:当时的顶级 AI(GPT-4 基线)在 GPQA 上只有 39%,比人类专家(65%)差了一大截,只比「联网瞎搜的非专家」(34%)略强一点点。换句话说,在「研究生级别的专业深度」上,2023 年底的 GPT-4 还远远达不到博士水平,甚至赢不了「一个聪明的外行拿着搜索引擎」。
这个结果在当时是有点震撼的。因为同一时期,GPT-4 在 MMLU、各类考试上已经能碾压人类平均水平了,但在 GPQA 上却「现了原形」——一旦题目触及真正的专业前沿、且无法靠检索弥补,模型的短板就暴露出来了。这恰恰证明 GPQA 的题目确实「卡在了刀刃上」:它测出的,是模型「真懂」还是「背得多、搜得勤」的区别。
还有一个值得注意的细节:论文的基线是「GPT-4 based」而不是单一提示。作者尝试了多种设定(包括 few-shot、chain-of-thought 等),最强的那个也只到 39%。这说明当时无论怎么「调提示」、怎么「加检索」,都很难在 GPQA 上取得突破——难度是实打实的,不是提示工程能糊弄过去的。
有意思的是,GPQA 发布后的短短一年里,这个 39% 的天花板被迅速打破:后来的 o1、Claude、DeepSeek-R1 等推理模型,在 GPQA Diamond 上纷纷冲到了 70% 甚至更高,逼近乃至反超人类专家的 65%。这反过来印证了 GPQA 的价值——它给「超越人类」的进度留足了测量空间,让业界能清楚地看到「AI 从 39% 爬到 70%+」这条上升曲线,而不是在满分饱和的旧基准上原地打转。
六、局限与争议:这张考卷也不是完美的
GPQA 再硬,也有自己的软肋,论文作者和后来的使用者都指出来过,主要有这么几条:
- 题量偏小、覆盖偏窄:448 道题、三门学科,规模远小于 MMLU 那种上万题的基准。题目越少,抽样的偶然性越大,单看一个分数可能不够稳;而且只覆盖理化生,文科、工科、医学等领域都没涵盖,无法代表「通用智能」的全貌。
- 成本极高、难以大规模复制:每道题都要博士手写 + 双组验证,造 448 道题的边际成本非常高。这决定了它没法像 MMLU 那样「无限扩充」,也意味着题目一旦泄露,整个基准就可能被「污染」。
- 泄露与刷分风险:这是所有静态 benchmark 的通病。GPQA 题目一旦被模型训练语料「背下来」,分数就会虚高。而它的题目又特别精贵,泄露的代价更高。为此后来的模型报告通常会用 GPQA Diamond 这种更严格的子集,并配合「防污染」的说明。
- 「防 Google」不等于「防 AI 检索」:题目设计时防的是「人类上网搜」,但大模型的「检索增强」能力在飞速进化,一些更先进的检索+推理系统可能会找到变通的解法。GPQA 的「Google-proof」特性,随着时间推移会被逐渐侵蚀。
- 多选题形式本身有局限:选择题天然存在「猜」的成分,且无法考察「推导过程」和「创造性」——它测的是「能不能选对」,而不是「能不能做出来」。对科学推理这种需要长篇过程的场景,选择题只是近似。
这些局限,恰恰是 GPQA 之后「评测基准」研究方向要解决的问题。也正因为意识到了泄露和题量的问题,后续出现了各种 GPQA 的「补丁」和「升级版」。但这并不影响 GPQA 作为「第一个把难度天花板抬到博士级」的基准,所奠定的范式地位。
七、横向对比:GPQA 在评测基准谱系里的位置
把 GPQA 放到整个评测基准的演进脉络里看,它的定位会更清楚。
在它之前,主流评测大致分两类:一类是「广度型」,比如 MMLU——57 个学科、上万的题量,考的是「知识覆盖得多广」,但单题难度不高、答案也多能在网上找到;另一类是「能力型」,比如数学(MATH、GSM8K)和代码(HumanEval)——考的是特定技能的熟练度,但学科聚焦、不涉及「跨领域的专业深度」。
GPQA 恰好补上了一个空白:「深度型」评测——题目不多,但每一道都卡在「博士级专业判断」的难度上,且答案无法检索。它和 MMLU 是「互补」而非「竞争」:MMLU 测「广度」,GPQA 测「深度」,两者合起来才能拼出一张更完整的「能力画像」。
它和「可扩展监督」研究的关系,更是它独一无二的地方。其他 benchmark 的定位是「给模型打分」,而 GPQA 的定位还多了一层——给「人类如何监督更强的 AI」这个安全研究问题提供试验场。论文里反复强调的「scalable oversight」,让它超越了一个普通数据集,成为 AI 对齐研究里的一块基石。
至于后来的演进,GPQA 几乎成了「推理模型」时代的通用标尺:从 OpenAI o1 到 DeepSeek-R1,从 Claude 到 Gemini,各家报告里那个「GPQA Diamond」的分数,几乎就是「模型能不能做科研级推理」的同义词。一个 benchmark 能被这么多头部玩家同时采纳,本身就是它权威性的最好证明。
八、总结与启示:这张考卷留给我们三个判断
读完 GPQA,我提炼出三个对理解当下 AI 最有用的判断:
第一,「难度天花板」才是评测的生命线。一个 benchmark 的价值,取决于它能在多大程度上区分「更强的模型」。一旦题目太简单、分数饱和,它就成了摆设。GPQA 的启示是:造题要先想清楚「我要测的上限在哪」,然后故意把难度推到那个上限之上。这对任何做评测的人都是通用原则。
第二,「防作弊」和「防搜索」正在成为评测的必修课。在大模型能检索、能背下互联网的时代,一道「网上能搜到答案」的题,本质上测的是检索能力而非智能。GPQA 用「非专家联网 30 分钟仍只有 34%」这一条,把「检索红利」从分数里剔了出去。未来任何严肃的 benchmark,都得回答「你的题防得住搜索和记忆吗」这个问题。
第三,AI 正在逼近「人类无法裁判」的临界点,这既是挑战也是方向。GPQA 的终极焦虑——「当 AI 比专家更强,谁来判断它对不对」——已经从假想变成了现实。最近一两年的推理模型,在 GPQA Diamond 上已经冲到甚至超过人类专家的水平。这意味着「人类出题、人类打分」的老范式正在失效,「可扩展监督」不再是远虑,而是迫在眉睫的工程问题。关注 GPQA 的人,本质上是在关注「我们还能不能继续给 AI 打分」这件大事。
如果说 MMLU 定义了「大模型的知识广度考卷」,那 GPQA 就定义了「大模型的专业深度标尺」。一个测它知道多少,一个测它懂多深——这张只有 448 道题的考卷,正在替整个人类盯着一件事:那个即将超越我们的智能,到底走到哪一步了。
参考来源
- GPQA 论文(arXiv:2311.12022):arxiv.org/abs/2311.12022
- GPQA 官方数据集仓库:github.com/idavidrein/gpqa


