AI评估
旧的AI基准测试已失效。以下是替代它们的方法。
像MMLU和GSM8K这样的静态基准测试已经饱和且受污染。行业已转向动态再生、专家级考试和智能体任务环境,以真实衡量AI能力。

在近十年的大部分时间里,AI行业依靠三个名字来衡量进展:MMLU、GSM8K、HumanEval。分数攀升,排行榜更迭,每个新模型都被宣称是飞跃。然后,这些数字不再有意义。在MMLU上表现优异的模型,却无法在私有仓库中编写正确的函数。能够解决研究生级别数学问题的系统,却读不懂模拟时钟。
旧的测试已经失效。问题不在于模型变差,而在于基准测试不再能衡量它们声称要衡量的东西。
静态基准的危机与向动态评估的转变
现在,失败的规模已可量化。独立审计发现,大型模型中的污染率高达91.8%,测试问题和答案在预训练阶段已被摄入。研究人员称之为“逐字回忆”的记忆整个字符串的能力随参数数量增长,在没有真正推理的情况下抬高了分数。与此同时,基准本身也存在错误:MMLU Math约有2%的无效问题,而GSM8K显示出高达42%的有缺陷或歧义项。
当MMLU的得分天花板达到90%时,该领域面临一个饱和问题,掩盖了真实的能力差距。一个模型可以通过统计模式匹配而非泛化能力登顶排行榜。
对此的回应是转向无法被操纵的动态和程序化基准。像Flame这样的框架通过自动合成和形式化验证,从学术来源生成新的测试实例,确保没有问题曾在公共网络上出现过。实时基准,如LiveBench、LiveCodeBench、ForecastBench、FutureX,每周从最近的代码仓库和金融预测任务中抽取新问题。LLMEval-Fair维护了一个包含22万道大学级别问题的专有题库,每次会话抽取一个新鲜子集,并结合防作弊逻辑和基于Elo的排名系统。
衡量前沿:专家级认知基准
为了探测推理能力的上限,研究人员构建了“人类最后的考试”(Humanity's Last Exam, HLE),这是一个由人工智能安全中心和Scale AI开发、发表在《自然》杂志上的2500道题目的题库。科目分布颇具启发性:数学占41%,生物学和医学占11%,计算机科学占10%,物理学占9%,化学占7%,人文学科占9%,工程学占4%,其他专业领域占9%。题型严重偏向精确简答题(76%),其余为多选题并配有复杂干扰项。14%的题目包含图表等多模态组件。
最初的成绩惨不忍睹。GPT-4o得分为2.7%,Claude 3.5 Sonnet为4.1%,而人类专家平均基线为90%。到2026年,思考模型已大幅缩小了差距。2026年7月引入的多拓扑推理集成系统PoTRE,通过并行运行四种不同推理模式(一种负责找错,一种负责规划,一种广泛探索,一种直接回答)并决定信任哪一个,在HLE上达到了49.92%的得分。这一提升并未通过扩大模型规模或推理令牌数量实现。
Claude Opus 5在HLE上以64.7%领先,并在GPQA Diamond上达到95%以上。Claude Mythos 5以64.5%的HLE得分和95%以上的GPQA Diamond紧随其后。GPT-5.6 Sol在HLE上得分为47.2%,但在GPQA Diamond上达到94.6%。DeepSeek V4 Flash分别得分为51.6%和89.2%,而Gemini 3.1 Pro达到44.4%和94.3%。
GPQA Diamond作为多模态测试之外最严格的科学基准,仍然以个位数百分点的差距区分领先者。但头条性能因素已经转变:在极端测试上的准确度现在更少依赖于原始参数数量,而更多地取决于模型在令牌发射过程中部署规划与自我纠正子程序的能力。
智能体评估与参差不齐的智能之意外
最严峻的现实检验来自智能体基准,模型必须与真实环境(GitHub问题、操作系统、网页浏览器)进行多轮交互。在SWE-bench Verified上,前沿模型达到70%到95%的成功率。但在SWE-bench Pro(使用私有企业仓库)上,相同系统下降到23.1%到23.3%。在一个完全保密的子集上,最高得分进一步滑落到14.9%到17.8%之间。
这一差距揭示了编码技能中有多少依赖于训练期间见过类似结构。一个在公共数据集上表现优异的系统,一旦遇到从未见过的代码就会停滞不前。
OSWorld是衡量智能体通过图形用户界面和命令行与操作系统交互的基准,展示了另一种进步。平均准确率从2024年的12%上升到2026年的66.3%,接近人类平均水平72.4%。但进展不均衡:SWE-bench Verified最高达96.2%(GPT-5.6 Sol),而人类约为95%;SWE-bench Pro仅为23.3%(Claude Opus 4.1),人类基线估计为90%。OSWorld达到85.0%(Claude Fable 5),人类平均值为72.4%;BrowseComp达到92.2%(GPT-5.6 Sol);而读数模拟时钟的ClockBench最高仅为50.6%(Gemini Deep Think),人类则为90.1%。
解释这些矛盾的现象被称为“参差不齐的智能”。同一个能在国际数学奥林匹克竞赛中获得金牌的模型,可能无法读取时钟。一个在虚拟环境中以89.4%的准确率模拟机械臂操作的模型,当同一任务在真实厨房用真实机器人执行时,成功率会暴跌至12%。这些差距并非随机,它们集中在需要感知基础、过程变异性或对训练数据从未捕捉到的微妙分布偏移具有鲁棒性的任务上。
DeepMind发布了一个框架,正式化了这种不对称性,认为操作严谨性(提高分数)已经远远超过了概念严谨性和认识严谨性(理解分数意味着什么)。该领域在优化指标上投入巨大,但指标一旦成为优化目标就失去了意义。
这就是当前AI评估的核心张力。旧的基准已经失效,新的基准更难作弊。但它们也要求不断更新:每个基准都必须再生、审计,并针对捷径策略进行压力测试。2026年一项关于协议有效性的研究发现,智能体可以恢复公共解决方案、读取评估工件、推断生成器结构,或受益于无效的评分路径,从而在标准智能体基准上使报告分数膨胀0.45到1.00。作者建议每个基准报告都提供证据,证明分数反映了预期的能力,而非最容易获得的捷径。
工具也在与指标共同进化。生产部署现在将离线评估与可观测性堆栈结合, , 来自W&B Weave的追踪、DeepEval的质量门控、Arize Phoenix的语义漂移监控, , 以捕获基准遗漏的失败。但没有任何测试套件能消除怀疑的必要。每一个基准都是代理。问题是这个代理是否仍然指向正确的方向。
- 来源 : Stanford HAI — 2026 AI Index Report, Technical Performance
- 来源 : Humanity's Last Exam — official site
- 来源 : SWE-bench — official site
- 来源 : Measuring Massive Multitask Language Understanding (MMLU) — original paper
- 来源 : Training Verifiers to Solve Math Word Problems (GSM8K) — original paper
- 来源 : Evaluating Large Language Models Trained on Code (HumanEval) — original paper
- 来源 : Humanity's Last Exam — original paper
- 来源 : GPQA: A Graduate-Level Google-Proof Q&A Benchmark — original paper
- 来源 : SWE-bench: Can Language Models Resolve Real-World GitHub Issues? — original paper
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。