1 published article
基准分析
MMLU等AI基准测试是模型对比的标准,但近期三起案例显示它们遗漏了关键维度。英伟达的Nemotron-4缺乏独立验证,Celeris-1以速度换准确率,而最佳病原体监测AI仅能完成半数任务。证据表明,我们需要能够衡量实际应用中重要因素的评估框架。
2026-07-29