Évaluation des LLM
14 published articles
Rapport spécial : Évaluation de l'IA
L'état du benchmarking IA en 2026 : l'effondrement des tests statiques et les systèmes conçus pour les remplacer
Un tour d'horizon complet du paysage du benchmarking IA en 2026 : pourquoi MMLU, GSM8K et HumanEval ont cassé, comment les benchmarks dynamiques et les examens d'experts comme HLE et GPQA Diamond les ont remplacés, ce que révèlent les tests agentiques et d'intelligence irrégulière, et comment les préférences humaines, les juges LLM et l'observabilité en production complètent désormais la pile d'évaluation complète.
2026-08-03
Analyse de benchmark
LiveBench refuse de rester figé. C'est tout l'intérêt
LiveBench remplace un corrigé fixe par un pool continuellement actualisé de problèmes de codage, de dépôts et de questions de prédiction, contournant la contamination qui a miné MMLU et GSM8K. Cela fait partie d'un virage plus large vers l'évaluation dynamique, aux côtés de LiveCodeBench, ForecastBench et LLMEval-Fair.
2026-08-03
Analyse de benchmark
5 millions de votes, 25 points Elo : Dans les coulisses du classement Chatbot Arena que personne ne peut ébranler
LMSYS Chatbot Arena classe les modèles selon les préférences humaines en aveugle sur une échelle Elo, avec près de cinq millions de votes qui resserrent désormais les meilleurs laboratoires dans une bande de 25 points. Les méthodes LLM-en-tant-que-Juge qui permettent de passer à l'échelle cette évaluation comportent leurs propres biais documentés en faveur de la verbosité et de la position.
2026-08-02
Analyse de benchmark
Sur SWE-bench Verified, les meilleurs modèles atteignent 96 %. Sur du code d'entreprise privé, ils dépassent à peine 23 %
SWE-bench Verified donne l'impression que les modèles de pointe sont proches de résoudre le génie logiciel réel, avec des scores supérieurs à 95 %. SWE-bench Pro, exécuté sur des dépôts d'entreprise privés, fait chuter ces mêmes modèles à 23 % ou moins, révélant à quel point le score Verified dépendait de l'exposition aux données publiques.
2026-08-02
Analyse de benchmark
GPQA Diamond a été conçu pour être à l'épreuve de Google. Les modèles frontaliers dépassent désormais 95% malgré tout
GPQA Diamond a été conçu pour que des humains équipés de moteurs de recherche ne puissent pas répondre de manière fiable à ses questions scientifiques de niveau expert. Les modèles frontaliers franchissent désormais 89% à 96%, poussant le benchmark vers la même saturation qui a retiré MMLU.
2026-08-01
Recherche en IA
L'écume dans le raisonnement en chaîne : un nouveau benchmark révèle pourquoi les LLM gaspillent des tokens sur des raisonnements valides mais inutiles
Les LLM génèrent souvent des chaînes de raisonnement correctes mais alourdies par des étapes inutiles. Un nouveau benchmark diagnostique et une méthode de compression montrent que les évaluateurs actuels ignorent totalement cette inefficacité et que la moitié des étapes de raisonnement rédigées par des humains pourraient être compressibles.
2026-07-31
Analyse de benchmark
L'Examen Final de l'Humanité a débuté avec un score de 2,7 %. Les meilleurs modèles ne parviennent toujours pas à dépasser les 65 %
L'Examen Final de l'Humanité a été construit par CAIS et Scale AI pour succéder à MMLU en tant que benchmark général LLM le plus difficile. Deux ans plus tard, même le score de tête de 64,7 % de Claude Opus 5 reste bien en dessous de la référence humaine experte de 90 %.
2026-07-31
Analyse de benchmark
HumanEval a mesuré si l'IA savait coder. Il ne s'est jamais demandé si le code était un vrai travail
Les 164 problèmes de complétion de fonctions de HumanEval sont devenus le test standard des capacités de codage de l'IA, mais la mémorisation et son champ d'action étroit ont laissé un large fossé entre la réussite du benchmark et la gestion d'une base de code réelle, un fossé que SWE-bench a été conçu pour exposer.
2026-07-30
Analyse de benchmark
GSM8K était censé tester les mathématiques de niveau primaire. Jusqu'à 42 % de ses questions ne sont pas valides
GSM8K est devenu un test standard de raisonnement arithmétique dans les LLM, mais des audits ont révélé des taux d'erreur dans son ensemble de questions atteignant 42 %, ce qui compromet ce que ses scores mesurent réellement.
2026-07-29
Analyse de benchmark
MMLU a dominé l'évaluation de l'IA pendant des années. Puis les modèles ont commencé à réussir le corrigé
MMLU a défini une génération d'évaluation de l'IA, mais la contamination des données d'entraînement et un corrigé erroné ont poussé les laboratoires de pointe vers des successeurs dynamiques comme HLE et GPQA Diamond.
2026-07-28
Fondements de l’IA
Pourquoi l’IA ne peut toujours pas s’expliquer : un cadre pour penser la rigueur
Un article de Google DeepMind présente un cadre en trois parties pour penser la rigueur dans l’IA : conceptuelle, épistémique et opérationnelle. Il soutient que les progrès rapides de l’apprentissage profond sont venus de la priorisation de l’itération axée sur la performance par rapport à la compréhension scientifique, et que combler les lacunes nécessitera plus que de meilleurs benchmarks.
2026-07-20
Évaluation des agents
Les benchmarks en sandbox cachent comment les agents échouent vraiment, l'Université de Hong Kong vient de résoudre ce problème
UniClawBench évalue les agents proactifs sur cinq capacités fondamentales dans 400 tâches bilingues réelles, en utilisant des conteneurs Docker en direct et une évaluation en boucle fermée impliquant trois agents. Il dissocie les capacités du modèle de base des choix de framework, révélant où les agents échouent vraiment.
2026-07-13