特别报道:AI评估
2026年AI基准测试现状:静态测试的崩溃与替代系统的构建
2026年AI基准测试全景深度巡览:MMLU、GSM8K和HumanEval为何失效,动态基准测试和专家级考试(如HLE和GPQA Diamond)如何取代它们,代理式测试和锯齿形智能测试揭示了什么,以及人类偏好、LLM评判和生成式可观测性如何完善整个评估堆栈。

问一个AI实验室其最新模型有多好,他们会给你一堆数字:MMLU、GPQA Diamond、SWE-bench、Elo评分、每百万token的成本。几年前,这些数字对每个人的含义大致相同。现在不是了。该领域在过去两年中,一个接一个地发现,带有公开答案的固定测试有一个保质期,而且这个保质期比两个模型发布之间的间隔还要短。
接下来是业界现在用来衡量模型实际能力的工具导览,旧工具为何失效,以及即便最新工具中仍然存在的问题。
静态基准测试危机
多年来,三个测试几乎主导了所有模型比较:用于通用知识的MMLU,用于算术推理的GSM8K,以及用于代码生成的HumanEval。这三个测试现在都已经过了有用期,原因有两个,且相互叠加。
第一个是数据污染。公开的基准测试问题最终会被有意或无意地抓取到预训练语料库中,一旦发生这种情况,模型就可以通过记忆而非推理来通过测试。对多语言测试集的独立审计发现,大型模型的污染率高达91.8%,记忆化程度直接随参数数量增加。第二个原因是这些测试本身并不像其声誉所暗示的那样干净:审计发现MMLU中大约2%的数学题完全有问题,而GSM8K题库中多达42%的题目存在歧义、标记错误或本身就是错的。前沿模型在MMLU上达到88%到90%看起来像是胜利。但实际上更接近于一个测量底线,这个底线部分建立在有缺陷的问题之上, , 无论技能如何,没人能正确回答。
用可变的答案取代固定的答案
业界的反应不是修补旧测试,而是彻底放弃固定答案。 LiveBench及其兄弟项目LiveCodeBench每周滚动引入新的编程问题和最新开放的代码仓库,因此本周发布的问题不可能污染几个月前训练的模型。ForecastBench和FutureX更进一步,要求模型预测尚未发生的真实金融和地缘政治事件的结果,这些问题在构造上就不存在于任何训练集中。
另外两种方法从不同角度解决同一个问题。LLMEval-Fair维护着一个包含22万个大学水平问题的专有题库,每次评估时抽取新的、未公开的子集,并配备防作弊检测和相对排名而非固定阈值。Flame则更进一步,从学术资料中按需合成全新的问题,并使用检查器代理验证其逻辑,而不是预先存储任何题目。这一切都是有代价的:每周变化的基准测试更难复现,信任转移到了维护生成管道的任何人身上。但研究人员认为,一旦清楚名声和污染会在同一个基准测试上同时出现,这种权衡就是必要的。
专家级考试:HLE和GPQA Diamond
对饱和的另一个反应是编写足够难的题目,使得饱和需要数年而不是数月才会到来。由AI安全中心和Scale AI构建并发表在《自然》杂志上的“人类最后的考试”(Humanity's Last Exam),开始时GPT-4o得分2.7%,而人类专家基线约为90%。两年后,领先模型Claude Opus 5得分为64.7%,仍比专家水平低25分, , 这是一个经过精心设计的测试,明确旨在抵抗网络搜索和记忆化。
GPQA Diamond讲述了一个几乎相反的故事。由博士级专家编写,并经过配备搜索的非专家验证,它同样被设计为抵抗捷径。但前沿模型现在得分在89%到96%之间,Claude Sonnet 5以96.2%领先,这意味着这个测试在高端正在耗尽空间,而HLE仍然有大量空间。这两个基准测试处于饱和曲线的两端,并排运行本身就是有用的信号:它告诉你当前真正的难度前沿在哪里。
智能体评估与锯齿智能问题
对话式和考试式基准测试忽略了完整一类的失败,这种失败只会在模型需要行动而不仅仅是回答时出现。SWE-bench是最鲜明的例证:在精心策划的公开GitHub问题(SWE-bench Verified)上达到96%的模型,在私有的、近期创建的企业仓库(SWE-bench Pro)上崩溃到大约23%,在严格保密的拒留集上进一步下降到15%到18%, , 任何模型提供商都不可能看到这个集合。
除了代码,OSWorld通过界面和命令行测试智能体在真实操作系统管理上的能力,平均准确率从2024年的12%上升到2026年的66.3%,接近72.4%的人类基线。BrowseComp衡量复杂的网页导航,Terminal-Bench 2.1在真实条件下衡量shell脚本编写。
所有这些揭示了一种研究人员现在称之为锯齿智能的模式:同一个模型可以在一个任务上达到世界级,而在相邻任务上令人困惑。Gemini Deep Think在自然语言中以42分中的35分赢得了国际数学奥林匹克金牌。同一个模型在ClockBench上仅获得50.6%, , 一个读取模拟时钟的测试,而普通人得分为90.1%。机器人操作也讲述了类似的故事:在RLBench模拟中89.4%的成功率,一旦将相同模型部署在物理机器人上面临不可预测的真实家庭环境时,崩溃到大约12%。事实证明,抽象和物理接地并不是相同的能力,无论排行榜如何暗示。
人类偏好与评判裁判的裁判
LMSYS Chatbot Arena测量的是任何闭卷测试都无法测量的:人们是否真的喜欢答案。近五百万次盲配对投票现在将顶级实验室排在一个25分的Elo区间内:Anthropic 1503分,xAI 1495分,Google 1494分,OpenAI 1481分,Alibaba 1449分,DeepSeek 1424分,闭源模型比开源权重模型大约有3.3%的优势,中美差距缩小到约2.7%。
由于人类投票无法扩展到实验室想要运行的每一次评估,大多数生产流程依赖于LLM作为裁判:一个前沿模型根据评分标准对其他模型的输出进行评分,成本比人类评委低500到5000倍,与人类评分者的一致性达到80%到90%。分歧并非随机。裁判模型可靠地奖励更长、更复杂结构的答案,无论长度是否增加信息;偏爱在比较中首先出现的回答;并且对任何奉承裁判自身提示框架的答案给予更高的评分。冗长偏差、位置偏差和谄媚现在已成为解读任何裁判评分结果的标准部分。
模型发布后的观察:生产可观测性
上述所有基准测试都不在生产环境中运行。一旦模型发布,另一个技术栈接管,到了2026年,这个技术栈已经成为一个四层学科,据称将部署故障减少了大约60%。追踪工具如W&B Weave、Langsmith和Langfuse记录请求的完整谱系,将每个输出与产生它的精确提示、代码版本、模型和数据集关联起来。质量门控框架如DeepEval、Confident AI和Deepchecks在部署前运行自动回归测试,如果幻觉率超过定义阈值则阻止发布。实时监控工具如Arize Phoenix和Helicone观察实时查询在嵌入空间中的分布,当用户行为开始偏离离线评估集时标记语义漂移。对于检索增强系统,RAGAS分别评分检索和生成组件,将上下文忠实度、答案相关性和检索精度作为不同数字而非一个混合分数来衡量。
另一个排行榜:质量、成本与速度
能力只是购买决策的一半。另一半是模型运行的成本和响应速度,该领域已清晰分为两个架构家族。一方面,重推理模型以延迟换取准确性:GPT-5.6 Sol和Claude Opus 5都报告了可变的、依赖于推理的响应时间,定价为每百万输入token 5美元,每百万输出token 25到30美元。另一方面,蒸馏和速度优化模型追求实时交互:Llama 4 Scout以0.33秒的首token时间推动2600 token/秒,DeepSeek V4 Pro和GLM 5.2结合了百万token上下文窗口和175到347 token/秒的速度,成本仅为顶级闭源模型的一小部分, , DeepSeek V4 Pro定价约为每百万输入0.44美元、输出0.87美元,而Claude Opus 5为输入5美元、输出25美元。这一差距正像任何准确性排行榜一样重塑企业部署的计算方式。
一个严谨的评估协议现在应该是什么样的
综合来看,这一转变相当于给任何仍依赖2023年方法的人一条指令:从任何决定真实技术方向的过程中淘汰MMLU、GSM8K和早期的HumanEval,用审核过的专家考试如HLE-Verified和GPQA Diamond进行推理,用动态基准测试如LiveBench和LLMEval-Fair进行任何需要长期抵抗污染的任务,以及用于任何旨在自主行动的智能体测试, , 在私有的、未发布的代码和接口上运行,而非精心策划的公共数据集。同时搭配持续的生产可观测性,而非一次性的离线分数,因为基准结果与实际部署之间的差距,正是当前AI系统锯齿边缘不断显现的地方。
- 来源 : Stanford HAI — 2026 AI Index Report, Technical Performance
- 来源 : Vellum — LLM Leaderboard 2026
- 来源 : Humanity's Last Exam — official site
- 来源 : LMSYS Chatbot Arena — official site
- 来源 : SWE-bench — official site
- 来源 : Measuring Massive Multitask Language Understanding (MMLU) — original paper
- 来源 : Training Verifiers to Solve Math Word Problems (GSM8K) — original paper
- 来源 : Evaluating Large Language Models Trained on Code (HumanEval) — original paper
- 来源 : GPQA: A Graduate-Level Google-Proof Q&A Benchmark — original paper
- 来源 : SWE-bench: Can Language Models Resolve Real-World GitHub Issues? — original paper
- 来源 : Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference — original paper
- 来源 : LiveBench: A Challenging, Contamination-Free LLM Benchmark — original paper
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。