基准分析
人类最后的考试以2.7%的得分开场。最佳模型仍无法突破65%
人类最后的考试由CAIS和Scale AI构建,旨在接替MMLU成为最难的通用LLM基准。两年过去了,即使Claude Opus 5领先的64.7%得分也远低于90%的人类专家基线。

当人类最后的考试(HLE)在2025年初推出时,GPT-4o得分2.7%。Claude 3.5 Sonnet得分4.1%。人类专家基线约为90%。这个差距并非测试校准不当的意外,而是重点所在。HLE由人工智能安全中心和Scale AI构建,专门因为MMLU已经变得不够难,不足以说明任何问题,该项目足够正式,已发表在《自然》杂志上。
该考试有2500个问题,由来自一百多个学术学科的专家编写,其结构旨在抵御毁掉上一代基准的两件事:网络搜索和训练集记忆。没有可以通过流利的填充词来游戏的论文格式。答案要么简短而精确(76%的问题),要么是多项选择题,其干扰项足够复杂,足以惩罚浅层模式匹配(24%)。14%的题目需要阅读图表、曲线图或图像以及文本,因此模型不能仅靠语言过关。
问题从何而来
主题分布告诉您测试实际看重什么:数学占题库的41%,生物学和医学占11%,计算机科学和人工智能占10%,物理学占9%,化学占7%,人文和社会科学占9%,工程学占4%,其余为各种专业领域。它按设计是一门严重的定量考试,更接近博士资格考试而非常识测验。
当前排行榜
根据最新公布的分数,情况如下:
- Claude Opus 5: 64.7%
- Claude Mythos 5: 64.5%
- Claude Opus 4.8: 57.9%
- Claude Sonnet 5: 57.4%
- Kimi K3: 56.0%
- GLM 5.2: 54.7%
- Claude Fable 5: 53.3%
- Hy3 (Tencent): 53.2%
- DeepSeek V4 Flash: 51.6%
- GPT-5.6 Sol: 47.2%
- Gemini 3.1 Pro: 44.4%
- GPT-5.5 Pro: 43.1%
有两件事很突出。首先,具有专用推理模式的模型, , 那些在回答前花费额外推理时间规划和检查自己工作的模型, , 主导了榜单顶部。一旦HLE成为参考测试,原始参数数量就不再是决定因素;将65%的分数与45%的分数区分开来的,越来越看起来像是模型是否能中途发现自己的错误。其次,即使领先者仍然比人类专家基线低25个百分点,而这项测试明确被设计成难以被操纵。
考试也并非完美
HLE自己的早期版本也有错误,HLE-Verified倡议下的审计发现,化学和生物子部分中多达30%的问题包含模糊的提示或错误的参考答案,迫使进行逐个组件的审查。为了不让这个基准像MMLU和GSM8K那样因为未被发现的错误而受损,该项目构建了HLE-Verified来修复它,并构建了HLE-Rolling来持续从科学界添加经过审查的问题。这种愿意审计和重新发布,而不是一成不变地推出固定的问题集并永远捍卫它的意愿,是HLE能够保持其作为该领域最难的通用基准地位的原因之一,而不是像它的前辈一样走向饱和。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。