Analyse de benchmark
GSM8K était censé tester les mathématiques de niveau primaire. Jusqu'à 42 % de ses questions ne sont pas valides
GSM8K est devenu un test standard de raisonnement arithmétique dans les LLM, mais des audits ont révélé des taux d'erreur dans son ensemble de questions atteignant 42 %, ce qui compromet ce que ses scores mesurent réellement.

GSM8K, acronyme de Grade School Math 8K, est un ensemble d'environ 8 000 problèmes de mots de niveau collège : des trains quittant des gares, des personnes se partageant l'addition, ce genre de choses. Pendant quelques années, c'était le moyen standard de vérifier si un modèle de langage pouvait enchaîner plusieurs étapes arithmétiques sans perdre le fil. Résoudre GSM8K de manière fiable était considéré comme une preuve d'un véritable raisonnement multi-étapes, par opposition à la reconnaissance de motifs.
Ensuite, des audits indépendants ont commencé à lire attentivement les questions au lieu de simplement exécuter des modèles dessus. Ce qu'ils ont découvert, c'est un benchmark avec un problème de qualité, pas un problème de difficulté. Les taux d'erreur dans l'ensemble des items de GSM8K ont été estimés jusqu'à 42 % : des questions avec une formulation ambiguë, des informations manquantes, ou des réponses de référence qui ne correspondent à aucune lecture défendable du problème. Un modèle marqué "faux" sur l'un d'eux n'a pas nécessairement un raisonnement moins bon qu'un modèle marqué "correct". Il pourrait simplement lire la question plus attentivement.
Pourquoi cela est plus important qu'il n'y paraît
Un taux d'erreur de 2 % est du bruit. Un taux d'erreur de 42 % est un benchmark différent de celui que tout le monde pense exécuter. Si près de la moitié des items du test ne sont pas fiables, alors le score lui-même cesse d'être une mesure claire du raisonnement arithmétique et commence à refléter quelque chose de plus proche de la capacité d'un modèle à deviner ce qu'une grille d'évaluation défectueuse veut entendre.
Cela s'ajoute au même problème de contamination qui a touché MMLU. Les questions de GSM8K sont assez anciennes et assez publiques pour que les grands modèles en aient presque certainement vu beaucoup, ou des paraphrases proches, lors du pré-entraînement. Combinez la mémorisation avec un corrigé fragile, et un score élevé au GSM8K vous renseigne moins qu'avant sur la capacité réelle d'un modèle à faire les calculs, et davantage sur le fait qu'il ait trouvé la même interprétation d'un problème mal formulé que les auteurs du jeu de données.
Ce que les laboratoires utilisent à la place
L'évaluation en mathématiques n'a pas disparu, elle s'est déplacée vers un territoire plus difficile et plus soigneusement audité. Les benchmarks mathématiques de type compétition, issus de problèmes récents d'olympiades et de concours, sont plus difficiles à contaminer simplement parce que les problèmes sont plus récents que la plupart des dates butoirs d'entraînement. Le raisonnement multi-étapes est de plus en plus testé dans le cadre d'examens de niveau master plus larges comme GPQA Diamond et Humanity's Last Exam, où les mathématiques ne sont qu'une discipline parmi d'autres plutôt que l'intégralité du test, et où la barre de qualité des items est explicitement plus élevée : le propre processus de vérification de HLE a été conçu spécifiquement pour détecter le type d'erreurs qui ont affecté GSM8K.
Rien de tout cela ne signifie que GSM8K est inutile pour une vérification rapide de bon sens. Un modèle qui échoue à des problèmes de mots de base a clairement un problème. Mais considérer un pourcentage GSM8K comme une mesure précise de la capacité de raisonnement, comme les articles l'ont fait pendant des années, suppose un corrigé qui s'avère bien moins solide qu'il n'y paraissait.
L'essentiel de la tech en 3 minutes chaque matin
Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.