MMLU
2 published articles
人工智能Featured3 min read
基准分析
三项AI基准测试在现实性能评估中的错误
MMLU等AI基准测试是模型对比的标准,但近期三起案例显示它们遗漏了关键维度。英伟达的Nemotron-4缺乏独立验证,Celeris-1以速度换准确率,而最佳病原体监测AI仅能完成半数任务。证据表明,我们需要能够衡量实际应用中重要因素的评估框架。
2026-07-29
基准与测试Featured2 min read
基准测试分析
MMLU 多年来主导了AI基准测试,然后模型开始精通答案
MMLU定义了一代人工智能基准测试,但训练数据污染和有缺陷的答案密钥促使前沿实验室转向动态替代方案,如HLE和GPQA Diamond。
2026-07-28