SevenTnewS

基准分析

GSM8K 本应测试小学数学水平,但高达42%的题目存在问题

GSM8K 已成为评估大语言模型算术推理能力的标准测试,但审计发现其题库中的错误率高达42%,这动摇了其分数实际衡量内容的有效性。

Emmanuel Fabrice Omgbwa Yasse

2026-07-29 · 阅读需 2 分钟

GSM8K 本应测试小学数学水平,但高达42%的题目存在问题
来源 : Évaluation et B…·GSM8K — officia…·Training Verifi…

GSM8K(Grade School Math 8K 的缩写)是一个包含约8000道应用题的数据集,题目难度设定在初中水平:火车离站、分摊账单之类的问题。有几年的时间里,它是检验语言模型能否在不丢失主线的情况下串联起多个算术步骤的标准方法。可靠地解出 GSM8K 被视为具备真正的多步推理能力、而非模式匹配的证据。

随后,独立审计开始仔细审读这些题目, , 而不仅仅是拿模型去跑。他们发现这个基准测试存在的是质量问题,而非难度问题。GSM8K 题目池中的错误率被估计高达42%:表述模棱两可的题目、信息缺失的题目,或者参考答案与任何合理的题目解读都不相符的题目。一个模型被标记为“错误”未必意味着它的推理能力比被标记为“正确”的模型差, , 它可能只是把题目读得更仔细了。

为什么这比听起来更重要

2% 的错误率只是噪声。42% 的错误率则意味着,你实际评测的基准与每个人都以为自己在跑的那个根本不是一回事。如果近一半的测试题目不可靠,那么得分本身就不再是算术推理的干净度量,而开始更多地反映模型猜对一套有缺陷的评分标准想要什么答案的能力。

这与 MMLU 遭遇过的污染问题叠加在一起。GSM8K 的题目已足够陈旧且公开,以至于大型模型在预训练期间几乎肯定见过其中许多题目或它们的近似改写。把记忆效应与不可靠的答案结合起来,一个高的 GSM8K 分数告诉你的已不如过去那样能说明模型是否真的会做算术,而更多是说明它是否恰好与数据集作者对那道表述糟糕的题目的理解一致。

各实验室转而使用什么

数学评估并没有消失,而是转向了更难且经过更仔细审计的领域。竞赛风格的数学基准测试取材自近期的奥赛和竞赛题目,更难被污染,仅仅因为这些题目比大多数训练数据截断时间更新。多步推理越来越多地在更广泛的研究生级别考试中接受检验,例如 GPQA DiamondHumanity's Last Exam,在这些考试中数学是众多学科之一而非全部测试内容,且题目质量标准被明确提高:HLE 自身的验证流程正是为了捕捉困扰 GSM8K 的那类错误而构建的。

这绝不意味着 GSM8K 对于快速检查毫无用处。一个连简单应用题都做不好的模型显然有问题。但是,像论文多年来所做的那样,将 GSM8K 分数百分比视为推理能力的精确度量,是建立在一个被证明远不如表面看起来那么可靠的参考答案之上的。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。