Intelligence artificielle · Mathématiques olympiques
Nemotron atteint le seuil de l'or aux IMO 2026 avec 30/42, sans démonstrateur formel
Les checkpoints de Nemotron 3 Ultra de NVIDIA ont atteint le seuil de la médaille d'or des IMO 2026 sur la seule base de preuves en langage naturel. L'article publie les données, le code et un benchmark de 200 problèmes, mais le score est auto-déclaré.
Emmanuel Fabrice Omgbwa Yasse Assisté par IA
2026-09-21 · 4 min de lecture

Le résumé de « An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics » indique que le système a obtenu 30 points sur 42 aux IMO 2026 et a atteint le seuil de la médaille d'or. C'est tout ce que la page Hugging Face de l'article dit à propos de ce chiffre. Elle ne nomme pas les correcteurs, ne précise pas si le score provient de la notation de la compétition elle-même ou d'un processus interne, et ne détaille pas les 30 points problème par problème. À traiter comme le rapport des auteurs tant que quelqu'un d'extérieur au groupe n'a pas reproduit l'exécution.
La page est plus précise sur les conditions. Le pipeline fonctionne entièrement en langage naturel : pas de démonstrateur formel, pas d'outils externes, pas d'accès à internet.
Trois checkpoints, deux étapes d'entraînement, une passe de sélection
Tout part de Nemotron 3 Ultra. L'équipe a pris le modèle en disponibilité générale et a post-entraîné deux checkpoints spécialisés par-dessus, en s'appuyant sur le fine-tuning supervisé et l'apprentissage par renforcement. Cela place trois modèles dans la boucle de recherche au lieu d'un.
À l'inférence, ces checkpoints pilotent un cycle itératif : générer une preuve candidate, la vérifier, l'affiner, recommencer. Une étape distincte, dotée d'un budget de calcul bien plus lourd, choisit ensuite la soumission finale. Séparer la sélection de la génération est une décision budgétaire. L'essentiel du temps est consacré à l'itération peu coûteuse, et la passe coûteuse est réservée à la décision finale.
Le résumé qualifie le résultat de pipeline de calcul à l'inférence (test-time compute) à modèle ouvert, ce qui accorde autant d'importance à la conception de l'inférence qu'à l'entraînement. Il ne dit pas combien de candidats la recherche génère par problème, comment le vérificateur les note, ni ce que l'étape de sélection optimise. Ces détails déterminent si la recette est transférable.
Ce que contient la publication
L'article livre plus qu'un texte.
| Artefact | Ce qu'il couvre |
|---|---|
| Deux checkpoints post-entraînés | Les modèles spécialisés sur lesquels tourne la recherche |
| Données d'entraînement | Publiées sous les noms nvidia/Nemotron-Math-Proofs-v3-SFT et nvidia/Nemotron-Math-Proofs-v3-RL |
| Code d'entraînement et d'inférence | Le pipeline lui-même |
| Solutions soumises | Les réponses du système aux problèmes des IMO 2026 |
| Nemotron-IMO-Bench | 200 problèmes inédits de niveau olympique |
Deux éléments pèsent plus que les autres. Les solutions soumises sont les vraies réponses du système aux problèmes de la compétition, ce qui rend un audit externe possible. Nemotron-IMO-Bench, de son côté, ajoute 200 problèmes que les auteurs qualifient d'inédits, offrant à la prochaine équipe un jeu de test qui n'a pas déjà été absorbé dans les données d'entraînement.
Sur Hugging Face, le checkpoint nvidia/Nemotron-3-Labs-Ultra-Math-RL apparaît comme un modèle citant l'article, et les deux jeux d'entraînement apparaissent sous les noms nvidia/Nemotron-Math-Proofs-v3-SFT et nvidia/Nemotron-Math-Proofs-v3-RL. C'est une véritable publication. Ce n'est pas encore une reproduction. Entre publier une recette et confirmer qu'elle fonctionne en dehors de l'environnement des auteurs eux-mêmes, il y a un écart que personne n'a comblé.
Pourquoi le langage naturel est la moitié risquée
Les assistants de preuve formels transforment un argument en quelque chose qu'une machine peut vérifier ligne par ligne. Ce pipeline refuse cette voie. Il écrit et raisonne en prose mathématique ordinaire, sans démonstrateur sur lequel s'appuyer et rien d'externe à consulter.
Le compromis est celui de la lisibilité contre la certitude. Les preuves en langage naturel se lisent comme se lit une solution humaine, et le cadrage suggère que c'était le but. Mais l'étape de vérification se trouve à l'intérieur du pipeline évalué, si bien que le système note en partie son propre travail. Un certificat vérifiable par machine n'aurait pas ce problème. Un vérificateur à base de modèle de langage, si.
Le résumé ne décrit pas ce que l'étape de vérification contrôle, à quelle fréquence elle rejette une preuve correcte, ni combien de cycles d'affinement nécessite un problème typique. Sans ces chiffres, l'affirmation de la médaille d'or repose sur un processus de notation que le lecteur ne peut pas inspecter.
Ce que change un pipeline ouvert de niveau or
Si le résultat tient, l'importance réside dans ce qui a été publié plutôt que dans le score. Les poids, les données d'entraînement, le code et les solutions permettent ensemble à un autre laboratoire de tenter la même exécution sans la reconstruire de zéro.
Cela arrive dans un paysage du benchmarking qui s'éloigne déjà des tests statiques. Les jeux de questions fixes ont perdu une grande partie de leur pouvoir diagnostique à mesure que les modèles s'entraînent dessus, et le domaine s'est tourné vers des évaluations dynamiques et des examens de niveau expert. Dans ce contexte, un chiffre olympique auto-déclaré est plus difficile à situer qu'il ne l'était. C'est un chiffre solide, provenant d'une équipe, dans un article, avec une pile d'évaluation construite par les mêmes personnes qui ont construit le système.
C'est la publication qui mérite l'attention. Que 30 sur 42 survive à un audit externe reste une question ouverte.
- Source : Nemotron hit IMO 2026's gold threshold at 30/42, without a formal prover — 2026-09-11
L'essentiel de la tech en 3 minutes chaque matin
Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.