SevenTnewS

基准分析

人类最后的考试以2.7%的得分开场。最佳模型仍无法突破65%

人类最后的考试由CAIS和Scale AI构建,旨在接替MMLU成为最难的通用LLM基准。两年过去了,即使Claude Opus 5领先的64.7%得分也远低于90%的人类专家基线。

Emmanuel Fabrice Omgbwa Yasse

2026-07-31 · 最后更新:2026-08-03 · 阅读需 2 分钟

人类最后的考试以2.7%的得分开场。最佳模型仍无法突破65%
来源 : Évaluation et B…·Humanity's Last…·Humanity's Last…

当人类最后的考试(HLE)在2025年初推出时,GPT-4o得分2.7%。Claude 3.5 Sonnet得分4.1%。人类专家基线约为90%。这个差距并非测试校准不当的意外,而是重点所在。HLE由人工智能安全中心和Scale AI构建,专门因为MMLU已经变得不够难,不足以说明任何问题,该项目足够正式,已发表在《自然》杂志上。

该考试有2500个问题,由来自一百多个学术学科的专家编写,其结构旨在抵御毁掉上一代基准的两件事:网络搜索和训练集记忆。没有可以通过流利的填充词来游戏的论文格式。答案要么简短而精确(76%的问题),要么是多项选择题,其干扰项足够复杂,足以惩罚浅层模式匹配(24%)。14%的题目需要阅读图表、曲线图或图像以及文本,因此模型不能仅靠语言过关。

问题从何而来

主题分布告诉您测试实际看重什么:数学占题库的41%,生物学和医学占11%,计算机科学和人工智能占10%,物理学占9%,化学占7%,人文和社会科学占9%,工程学占4%,其余为各种专业领域。它按设计是一门严重的定量考试,更接近博士资格考试而非常识测验。

当前排行榜

根据最新公布的分数,情况如下:

  • Claude Opus 5: 64.7%
  • Claude Mythos 5: 64.5%
  • Claude Opus 4.8: 57.9%
  • Claude Sonnet 5: 57.4%
  • Kimi K3: 56.0%
  • GLM 5.2: 54.7%
  • Claude Fable 5: 53.3%
  • Hy3 (Tencent): 53.2%
  • DeepSeek V4 Flash: 51.6%
  • GPT-5.6 Sol: 47.2%
  • Gemini 3.1 Pro: 44.4%
  • GPT-5.5 Pro: 43.1%

有两件事很突出。首先,具有专用推理模式的模型, , 那些在回答前花费额外推理时间规划和检查自己工作的模型, , 主导了榜单顶部。一旦HLE成为参考测试,原始参数数量就不再是决定因素;将65%的分数与45%的分数区分开来的,越来越看起来像是模型是否能中途发现自己的错误。其次,即使领先者仍然比人类专家基线低25个百分点,而这项测试明确被设计成难以被操纵。

考试也并非完美

HLE自己的早期版本也有错误,HLE-Verified倡议下的审计发现,化学和生物子部分中多达30%的问题包含模糊的提示或错误的参考答案,迫使进行逐个组件的审查。为了不让这个基准像MMLU和GSM8K那样因为未被发现的错误而受损,该项目构建了HLE-Verified来修复它,并构建了HLE-Rolling来持续从科学界添加经过审查的问题。这种愿意审计和重新发布,而不是一成不变地推出固定的问题集并永远捍卫它的意愿,是HLE能够保持其作为该领域最难的通用基准地位的原因之一,而不是像它的前辈一样走向饱和。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。