SevenTnewS

基准分析

三项AI基准测试在现实性能评估中的错误

MMLU等AI基准测试是模型对比的标准,但近期三起案例显示它们遗漏了关键维度。英伟达的Nemotron-4缺乏独立验证,Celeris-1以速度换准确率,而最佳病原体监测AI仅能完成半数任务。证据表明,我们需要能够衡量实际应用中重要因素的评估框架。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-29 · 阅读需 3 分钟

三项AI基准测试在现实性能评估中的错误
来源 : The Limits of A…·Nvidia's Nemotr…·The 158 ms mode…·The 50 percent …

AI基准测试是模型比较的通用标准,但汇率已经失灵。高分MMLU意味着智能;低延迟暗示效率。三个最近的案例证明,这两者都不能保证现实世界的性能。英伟达的Nemotron-4声称相比GPT-4有30%的成本优势,但缺乏经过验证的基准支持。Celeris-1以原始分数无法捕捉的方式用准确率换取速度。而最好的病原体监测AI代理仅能勉强完成一半任务。每个异常都揭示了行业衡量能力时的独特盲点。它们共同表明,标准评估工具包, , MMLU、延迟、准确率, , 不足以预测一个模型在最终部署的混乱、高风险环境中是否能正常工作。

中端模型与缺失的验证

英伟达以宽松的开源许可发布了两种规模的Nemotron-4,分别为8B和34B参数。该公司称,较大的版本在MMLU基准测试中得分与GPT-4相差不到两分,同时推理计算量减少30%。如果得到验证,这将使34B模型成为其规模类别中最强大的开源权重选项之一。但英伟达没有说明它比较的是哪个GPT-4变体,也没有说明两分的差距是基于完整MMLU还是子集。独立的第三方测试尚未确认这一说法。没有这些验证,这些数字就落入了争议空间,其中Llama 3.3 70B、Mistral Large和Qwen 2.5 72B已经聚集在相似的准确率区间。自今年早些时候Kimi K3重塑AI经济学以来,开源权重市场一直在关注成本。Nemotron-4加入了这场讨论,但其性价比声明需要可重复的测试才能改变任何购买决策,正如Nemotron-4基准分析所指出的

当速度重写规则

由独立团队发布的Celeris-1在MMLU-Pro上获得了75.9%的分数,中位响应时间为158毫秒,据速度-质量基准报告。这比GPT-5 mini快八倍,后者在同一测试中只损失了2.6个准确率点。对于每毫秒都至关重要的实时应用来说,这种权衡正是该模型有用之处。但标准排行榜首先按准确率排名,将速度降为脚注。一个能在10%延迟下提供90%准确率的模型对于生产可能是更好的选择,但基准测试并非设计来捕捉这种计算。速度与质量的权衡是真实的,基准测试需要考虑到这一点。Mistral Nano是另一个注重延迟的设计,在内存小于1GB的设备上实现了其更大兄弟模型85%的推理能力,正如Mistral Nano的边缘基准测试所示。这证明了速度-质量权衡并非偶然。Celeris-1将这一逻辑推得更远,这应该引起业界的注意。

没有基准预想到的天花板

BioSecBench-Surveillance在100项基因组监测任务上测试了16种AI代理配置。表现最好的代理达到约50%的准确率。根据BioSecBench-Surveillance研究,错误并非来自选择了错误的工作流程,而是需要湿实验室和疾病监测项目的隐性知识的判断性决策。该论文的作者将这个基准视为测试代理能否在大流行中值得信赖的考验。在50%的水平上,答案显然尚未达到。而且这一差距可能不会仅靠更大的模型来弥补;周边的生物学知识显然无法从公开文本中学习到。错误的系统性表明,仅靠扩大模型规模不太可能弥合差距。该基准突显了MMLU及类似测试无法发现的盲点:在现实世界约束下做出依赖上下文的决策的能力。

从基础重新思考评估

GLUE基准测试曾是语言理解的金标准,但自2022年以来没有出现显著的新分数。模型已经超越了它。同样的模式现在在MMLU上重演,前沿模型接近饱和。这三个异常案例为从单一数字排名转向预测实际性能(即在生产中,而非排行榜上)的指标提供了理由。前进的道路包括平衡速度与准确率的综合分数、逼真的代理环境以及对抗性判断测试。新的基准测试应该是对抗性的、任务特定的,并且能够抵抗

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。