MMLU
2 published articles
IAFeatured3 min read
Analyse des benchmarks
Ce que trois benchmarks IA ont mal compris sur les performances réelles
Les benchmarks IA comme MMLU sont la norme pour comparer les modèles, mais trois cas récents montrent qu'ils manquent des dimensions critiques. Le Nemotron-4 de Nvidia manque de vérification indépendante, Celeris-1 échange la précision contre la vitesse, et le meilleur IA de surveillance des agents pathogènes n'effectue que la moitié des tâches. Les preuves indiquent un besoin de cadres d'évaluation qui mesurent ce qui compte dans la pratique.
2026-07-29
Tests & BenchmarksFeatured2 min read
Analyse de benchmark
MMLU a dominé l'évaluation de l'IA pendant des années. Puis les modèles ont commencé à réussir le corrigé
MMLU a défini une génération d'évaluation de l'IA, mais la contamination des données d'entraînement et un corrigé erroné ont poussé les laboratoires de pointe vers des successeurs dynamiques comme HLE et GPQA Diamond.
2026-07-28