Contamination des données
3 published articles
Rapport spécial : Évaluation de l'IA
L'état du benchmarking IA en 2026 : l'effondrement des tests statiques et les systèmes conçus pour les remplacer
Un tour d'horizon complet du paysage du benchmarking IA en 2026 : pourquoi MMLU, GSM8K et HumanEval ont cassé, comment les benchmarks dynamiques et les examens d'experts comme HLE et GPQA Diamond les ont remplacés, ce que révèlent les tests agentiques et d'intelligence irrégulière, et comment les préférences humaines, les juges LLM et l'observabilité en production complètent désormais la pile d'évaluation complète.
2026-08-03
Analyse de benchmark
LiveBench refuse de rester figé. C'est tout l'intérêt
LiveBench remplace un corrigé fixe par un pool continuellement actualisé de problèmes de codage, de dépôts et de questions de prédiction, contournant la contamination qui a miné MMLU et GSM8K. Cela fait partie d'un virage plus large vers l'évaluation dynamique, aux côtés de LiveCodeBench, ForecastBench et LLMEval-Fair.
2026-08-03
Analyse de benchmark
MMLU a dominé l'évaluation de l'IA pendant des années. Puis les modèles ont commencé à réussir le corrigé
MMLU a défini une génération d'évaluation de l'IA, mais la contamination des données d'entraînement et un corrigé erroné ont poussé les laboratoires de pointe vers des successeurs dynamiques comme HLE et GPQA Diamond.
2026-07-28