Saturation des benchmarks
4 published articles
Rapport spécial : Évaluation de l'IA
L'état du benchmarking IA en 2026 : l'effondrement des tests statiques et les systèmes conçus pour les remplacer
Un tour d'horizon complet du paysage du benchmarking IA en 2026 : pourquoi MMLU, GSM8K et HumanEval ont cassé, comment les benchmarks dynamiques et les examens d'experts comme HLE et GPQA Diamond les ont remplacés, ce que révèlent les tests agentiques et d'intelligence irrégulière, et comment les préférences humaines, les juges LLM et l'observabilité en production complètent désormais la pile d'évaluation complète.
2026-08-03
Analyse de benchmark
GPQA Diamond a été conçu pour être à l'épreuve de Google. Les modèles frontaliers dépassent désormais 95% malgré tout
GPQA Diamond a été conçu pour que des humains équipés de moteurs de recherche ne puissent pas répondre de manière fiable à ses questions scientifiques de niveau expert. Les modèles frontaliers franchissent désormais 89% à 96%, poussant le benchmark vers la même saturation qui a retiré MMLU.
2026-08-01
Analyse de benchmark
GSM8K était censé tester les mathématiques de niveau primaire. Jusqu'à 42 % de ses questions ne sont pas valides
GSM8K est devenu un test standard de raisonnement arithmétique dans les LLM, mais des audits ont révélé des taux d'erreur dans son ensemble de questions atteignant 42 %, ce qui compromet ce que ses scores mesurent réellement.
2026-07-29
Analyse de benchmark
MMLU a dominé l'évaluation de l'IA pendant des années. Puis les modèles ont commencé à réussir le corrigé
MMLU a défini une génération d'évaluation de l'IA, mais la contamination des données d'entraînement et un corrigé erroné ont poussé les laboratoires de pointe vers des successeurs dynamiques comme HLE et GPQA Diamond.
2026-07-28