基准测试分析
MMLU 多年来主导了AI基准测试,然后模型开始精通答案
MMLU定义了一代人工智能基准测试,但训练数据污染和有缺陷的答案密钥促使前沿实验室转向动态替代方案,如HLE和GPQA Diamond。

MMLU,即大规模多任务语言理解基准,在2020年代初期是衡量语言模型质量的默认标尺。涵盖57个学科,多项选择题形式,从抽象代数到美国外交政策无所不包。它易于运行、易于比较、易于放入新闻稿中。
这种便利性恰恰是它出问题的原因。一旦基准测试的题目是公开文本,它们最终会出现在某人的训练语料中。对多语言测试集的独立审计发现,大型模型的污染率高达91.8%,且模式一致:模型越大,它似乎记住而非推理出的测试内容越多。一个在预训练期间见过题目及其答案的模型并不需要解决任何问题,它只需要回忆。
污染只是问题的一半。测试本身也有漏洞。对MMLU数学子集的审计发现,大约2%的题目根本就是错误的, , 标签错误、措辞模糊、或者数学本身存在问题。2%听起来很小,但要知道每个模型的得分都是与一个包含无人能正确回答的错误题目的天花板进行比较的。
饱和度真正隐藏了什么
到2020年代中期,前沿模型在MMLU上的得分达到了88%到90%。这看起来像是胜利,但实际上接近于测量地板。当大多数模型在测试中挤在高分区间时,测试就无法再告诉你谁真正更好。两个模型在饱和基准上的两分之差,可能反映真实能力,也可能反映哪个模型在错误的2%中更走运。
这正是研究人员现在主张将MMLU从严肃评估中退役的核心论点:它无法再区分真正的推理和统计记忆。一个模型可以通过吸收互联网(包括恰好是MMLU的部分)来取得高分。
取代它的新基准
回应不是修补MMLU,而是构建无法以同样方式被记忆的测试。人类最后的考试被明确设计为MMLU的继承者,题目经过审查以抵抗网络搜索和预训练回忆。GPQA Diamond在研究生级别的科学领域也做了类似的事情。动态基准测试会滚动更新题目库,而不是一次性发布固定题目集并使用多年,这正在成为常态,正是因为静态答案键有保质期。
这并不意味着MMLU毫无价值。它仍然是一个合理的初步检查, , 一个在MMLU上得分很低的模型很可能确实存在问题。但作为排行榜指标,作为实验室用来声称达到最先进水平的数字,其有效性在大家不再考不及格时就已经耗尽。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。