SevenTnewS

基准分析

LiveBench拒绝一成不变, , 这正是关键

LiveBench用不断更新的编程问题、代码库和预测问题池取代了固定的答案集,避开了削弱MMLU和GSM8K的数据污染问题。它是向动态评估更广泛转变的一部分,同行还包括LiveCodeBench、ForecastBench和LLMEval-Fair。

Emmanuel Fabrice Omgbwa Yasse

2026-08-03 · 阅读需 2 分钟

LiveBench拒绝一成不变, , 这正是关键
来源 : Évaluation et B…·LiveBench — off…·LiveBench: A Ch…

LiveBench 旨在解决的结构性问题,并非一次性丑闻。任何作为固定数据集发布的基准测试,迟早都会被爬取到预训练语料库中, , 无论是有意为之,还是作为爬取开放网络的附带产物。一旦发生这种情况,模型的分数就不再衡量推理能力,而是开始衡量记忆能力,这正是MMLUGSM8K 所遭遇的情况。LiveBench 的解决方案并非提供一个更好的数据集,而是一个动态变化的数据集。

LiveBench 并非一次性发布固定测试,而是持续地、按周滚动地吸收新问题、近期编程挑战、新近开源的代码仓库以及时事推理问题。本周发布的问题,按定义不可能污染数月前训练的模型。这一单一设计选择,彻底规避了困扰该领域其他基准的污染争议。

更广泛系列的一部分

LiveBench 并非孤军奋战。LiveCodeBench 将相同的实时刷新逻辑应用于从活跃竞赛编程平台中提取的编程问题。ForecastBench 和 FutureX 将这一理念进一步推进到真正未解决的领域,要求模型预测尚未发生的真实金融和地缘政治事件的结果, , 这些问题,按设计,在任何训练集中都没有现成的历史答案。

LLMEval-Fair 采用的方法与之相关但有所不同:它维护着一个包含 22 万道大学水平问题的专有题库,每次评估会话都会抽取全新的、未公开的子集,并结合反作弊检测和相对排名(而非固定阈值)。此外,Flame 作为程序生成框架更进一步:它完全不再存储预先编写的问题,而是从学术源材料中按需合成新问题,用检查代理验证其内在逻辑,并去除可能向模型透露测试内容的框架线索。

代价几何

这一切并非没有代价。每周变化的基准测试更难以复现, , 3 月的分数和 6 月的分数并非严格相同的测试,这给每个人想要的整洁排行榜比较带来了复杂性。它还使信任转移到了维护管道的组织身上:如果运行 LiveBench 的组织开始从有偏见或质量较低的新问题池中抽取,外部审计人员就无法像最终对 GSM8K 所做的那样,对照固定的标准答案进行核查。

至少目前来看,这种权衡是值得的。静态基准测试时代产生了一系列令人尴尬的事后发现:一些多语言测试集的污染率接近 92%,所谓黄金标准数学问题的错误率高达 42%,饱和状态使得排行榜毫无意义。LiveBench 及其实时刷新同类基准的存在,正是因为业界认识到:一个基准真正的保质期,是在它变得足够出名、值得被记忆的那一刻到来的。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。