SevenTnewS

Recherche en IA

Pourquoi votre tuteur IA ne voit pas comment les mathématiques se construisent les unes sur les autres

Le K12-Bench de l'Université de Pékin révèle que même les meilleurs modèles de langage comprennent à peine comment les concepts scolaires sont reliés. Des scores de 57 % et 46 % montrent une lacune dans la capacité de l'IA à gérer les chaînes de prérequis, les taxonomies de concepts et l'ancrage visuel, des compétences que les tuteurs réels utilisent chaque jour.

Emmanuel Fabrice Omgbwa Yasse Assisté par IA

2026-08-02 · 2 min de lecture

Pourquoi votre tuteur IA ne voit pas comment les mathématiques se construisent les unes sur les autres

Gemini-3-Flash, l'un des modèles les plus performants actuellement disponibles, n'obtient que 57 % sur un nouveau benchmark conçu pour tester si les systèmes d'IA comprennent la structure des connaissances du programme scolaire. Gemma-4-31B-IT atteint 46 %. Ces deux chiffres proviennent d'un test de 23 640 questions appelé K12-Bench, développé par des chercheurs de l'Université de Pékin.

Les chercheurs soutiennent que les benchmarks éducatifs existants se concentrent sur la réponse aux questions d'examen, et non sur la capacité d'un modèle à saisir les relations entre les concepts tout au long du parcours d'apprentissage d'un élève : ils appellent cette capacité la « cognition curriculaire ». Un modèle capable de résoudre une équation du second degré pourrait n'avoir aucune idée que la factorisation des trinômes est un prérequis pour cette compétence, ou que le concept apparaît à la fois en algèbre et en physique.

Pour créer le benchmark, l'équipe a d'abord construit K12-KGraph, un graphe de connaissances extrait des manuels officiels de People's Education Press couvrant les mathématiques, la physique, la chimie et la biologie du primaire au lycée. Le graphe utilise neuf types de nœuds et quatorze types de relations pour capturer la structure curriculaire et l'ancrage visuel : par exemple, quels concepts nécessitent quels autres concepts comme prérequis, comment les expériences sont liées à la théorie, et où apparaissent les diagrammes ou équations dans les documents officiels.

À partir de ce graphe, ils ont dérivé K12-Bench, qui comprend cinq familles de tâches : Ground (ancrage visuel des concepts dans les images des manuels), Prereq (identification des prérequis), Neighbor (mise en correspondance des voisinages de concepts), Evidence (connexion des preuves expérimentales aux affirmations) et Locate (positionnement des concepts dans la chronologie du programme). Les tâches les plus difficiles sont Prereq et Neighbor, qui exigent toutes deux un raisonnement sur la manière dont les concepts sont liés entre eux plutôt que la simple récupération de faits. C'est probablement pourquoi même les modèles puissants peinent avec elles.

L'entraînement sur la structure curriculaire comble une partie du fossé

L'article n'est pas qu'un simple diagnostic. Les chercheurs ont construit K12-Train, un corpus d'ajustement supervisé de 7 335 échantillons mélangeant des paires de questions-réponses textuelles et des paires de questions-réponses visuelles multimodales. En entraînant des modèles sur un budget de 2 300 échantillons appariés, le sous-ensemble K12-Train-Text a systématiquement surpassé des sous-ensembles de taille équivalente provenant de huit autres corpus d'instruction-tuning courants sur deux benchmarks en aval, GaokaoBench et EduEval.

Pour les modèles vision-langage, l'ensemble complet multimodal K12-Train a obtenu les meilleurs scores globaux sur trois benchmarks d'évaluation : Gaokao-MM, MDK12-medium et K12Vista. Il y est parvenu tout en utilisant moins d'échantillons d'entraînement que les bases de référence complètes comme DataFlow et WizardLM. La version multimodale a également surpassé les variantes textuelles et visuelles seules, ce qui confirme que la structure conceptuelle textuelle et les diagrammes visuels fournissent des signaux complémentaires pour la compréhension curriculaire.

Ce que le fossé signifie pour les salles de classe

La différence entre la performance aux examens et la cognition curriculaire a des conséquences directes. Un système de tutorat IA qui ne peut pas dire à un élève qu'il doit comprendre les fractions avant d'aborder les équations linéaires n'est pas vraiment un tuteur : il répond à des questions. Le cadre K12-KGraph offre aux développeurs un moyen de mesurer et d'entraîner cette capacité manquante.

L'ensemble du pipeline est ouvert : le graphe, le benchmark, les données d'entraînement et le code de construction sont tous publiés. Cela est important car le benchmark a été construit à partir d'un programme national spécifique (People's Education Press de Chine), mais la méthodologie s'applique à tout programme. L'existence de lacunes similaires dans les manuels d'autres pays dépend de la construction du même type de graphe pour eux.

Les chiffres de l'article suggèrent que le fossé est réel et mesurable. La question plus large est de savoir si le combler produira de meilleurs résultats d'apprentissage ou simplement des modèles qui sonnent plus pédagogiques sans comprendre plus profondément qu'ils ne le font déjà.

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.