基准分析
GPQA Diamond 旨在抵御谷歌搜索,前沿模型如今仍突破 95%
GPQA Diamond 的设计旨在让配备搜索工具的人类也无法可靠回答其专家级科学问题。前沿模型如今已达到 89% 至 96% 的正确率,将该基准推向与已退役的 MMLU 相同的饱和状态。

GPQA代表Google-Proof Q&A(谷歌无法回答的问答),这个名称是一个设计约束,而非营销。该数据集中的每个问题都由物理学、化学或生物学领域的博士级专家编写,然后经过非专家人类的测试,这些人类被允许完全、不受限制地使用搜索引擎。如果一个配备搜索引擎的人类无法可靠地找到答案,那么这个问题就合格了。"Diamond"子集是最难的层级:即使是相关领域内的专家,在没有时间压力的情况下,也不总能达成一致的问题。
这确实是一个难以逾越的门槛。但同样,越来越多的前沿模型正在跨越这个门槛。在当前排行榜上,Claude Sonnet 5得分96.2%,GPT-5.6 Sol得分94.6%,Gemini 3.1 Pro得分94.3%,Claude Opus 5和Claude Mythos 5均超过95%。即使是排名更靠后的模型,如Kimi K3(91.5%)、GLM 5.2(90.8%)、DeepSeek V4 Flash(89.2%),其表现区间在GPQA刚推出时也是不可想象的。
一个正在吞噬自身护城河的基准
这与摧毁了MMLU的饱和模式相同,只是来得更快,因为GPQA Diamond是一个更小、更集中的测试。当几乎所有前沿模型都能达到89%或更高时,这个基准就失去了在模型之间进行有意义区分的能力。96.2%和89.2%看起来差距很大,但实际上,这两个分数都描述了模型在实际中正确回答了领域博士也能答对的几乎所有问题。剩余的错误集中在Diamond层级围绕的那些真正有争议的边界案例上,这些信号比基准最初设计意图要窄得多且噪声更大。
相比之下,Humanity's Last Exam中,同样的顶级模型最高得分约为65%。这两个基准正朝着不同方向发展:GPQA Diamond在顶端空间已经所剩无几,而HLE在最佳模型与人类专家表现之间仍有35个百分点的差距。这种对比本身就是有用的信息。它告诉你,GPQA Diamond实际上已经变成了一种确认测试,一种检查模型是否达到研究生级科学推理高门槛的方法,而不是区分当前前沿模型与未来模型的鉴别器。
为何它仍被频繁引用
尽管已经饱和,但GPQA Diamond并没有像MMLU那样被淘汰。部分原因是惯性:运行成本低、易于理解,而且其经过专家验证的问题比多项选择琐事集更难质疑。另一部分原因是,模型在GPQA Diamond上失败仍然是一个真正的危险信号,即使通过它已不再能区分不同模型。研究人员越来越多地将其视为需要达到的底线而非追求的天花板,而HLE以及动态的、抗污染的基准则承担了实际的前沿系统排名工作。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。