SevenTnewS

Frontis-MA1 / OpenMLE

L'IA qui améliore l'IA tourne désormais sur une seule RTX 4090

La pile OpenMLE de FrontisAI et l'agent Frontis-MA1 de 35 milliards de paramètres transforment l'auto-amélioration récursive en une expérience reproductible. Sur une seule RTX 4090, le modèle obtient 71,21 % sur MLE-Bench Lite, devant GPT-5.5 + Codex et proche de modèles frontières bien plus grands.

Emmanuel Fabrice Omgbwa Yasse Assisté par IA

2026-07-31 · Dernière mise à jour : 2026-08-02 · 4 min de lecture

L'IA qui améliore l'IA tourne désormais sur une seule RTX 4090

L'auto-amélioration récursive a passé des décennies à être l'idée la plus spéculative de l'IA, celle qui apparaît dans les essais apocalyptiques et la science-fiction. FrontisAI vient de la transformer en dépôt GitHub. L'article du laboratoire, soumis le 30 juillet, décrit OpenMLE, une pile open source pour les systèmes qui améliorent la façon dont l'IA elle-même est construite, et Frontis-MA1, un modèle de 35 milliards de paramètres entraîné à l'exécuter. La page du projet avait enregistré 161 upvotes sur Hugging Face.

Ce qui fait que cette annonce mérite plus qu'un coup d'œil, c'est le matériel. L'évaluation de Frontis-MA1 a été exécutée sur une seule RTX 4090 plafonnée à 12 Go de VRAM, avec un budget de 12 heures par tâche. Sur MLE-Bench Lite, le benchmark d'ingénierie de l'apprentissage automatique, le modèle de base affiche une Medal Average de 39,39 %. Associé à OpenMLE-Evo, le composant de recherche, il bondit à 60,61 %. Avec OpenMLE-Evo-Max, qui ajoute des a priori d'expérience indépendants du benchmark et une recherche asynchrone, il atteint 71,21 %.

Ces chiffres battent la combinaison GPT-5.5 + Codex et se situent près de GPT-5.6 Sol et Kimi K3, le modèle de 2,8 billions de paramètres qui écrase Frontis-MA1 par un facteur de 80. L'écart de puissance de calcul entre ces configurations est le vrai sujet.

Configuration sur MLE-Bench LiteMedal Average
Modèle de base39,39 %
+ OpenMLE-Evo60,61 %
+ OpenMLE-Evo-Max71,21 %

Toutes les exécutions ont utilisé un budget de 12 heures par tâche sur une seule RTX 4090 plafonnée à 12 Go de VRAM.

Quatre opérateurs, une boucle

La conception traite la construction d'un modèle comme un processus évolutif plutôt qu'une simple passe avant. FrontisAI définit quatre opérations atomiques : Draft, Improve, Debug et Crossover. Frontis-MA1 est post-entraîné à exécuter ces opérations à partir des retours d'exécution, grâce à un fine-tuning supervisé et à l'apprentissage par renforcement sur des données dédupliquées par rapport aux benchmarks d'évaluation. À l'inférence, les mêmes opérateurs se composent en une recherche à long horizon : le système propose des candidats, les mute, répare les échecs et recombine ce qui fonctionne. L'article qualifie le résultat de « couplage de l'apprentissage et de l'évolution dans une seule boucle ».

L'architecture reste lisible, ce qui compte. « AI4AI », les systèmes qui améliorent le processus de construction de l'IA, peuvent être vagues au point d'en être inutiles. Ici, cela se résout en quatre opérations nommées et une boucle de recherche que chacun peut inspecter et reproduire. C'est la véritable contribution, indépendamment de tout score individuel.

Résultats de transfert et réserves

Deux détails empêchent ce résultat de passer pour un simple coup de chance de benchmark. Sur NatureBench Lite, un benchmark exclu de l'entraînement (held-out), les deux composants généralisent par eux-mêmes. Quand le cadre est fixé, l'ajout du modèle entraîné fait passer le score Match-SOTA de 50 % à 70 %. Quand le modèle est fixé, l'ajout d'OpenMLE-Evo le fait passer de 20 % à 50 %. Des données held-out signifient que rien de tout cela ne faisait partie de l'entraînement, la condition minimale pour y croire.

Les réserves sont tout aussi concrètes. Les deux benchmarks sont les variantes Lite, des versions réduites de suites plus vastes. Chaque chiffre décrit une configuration contrainte : un seul GPU, un plafond de 12 heures par tâche. Les comparaisons avec GPT-5.5 + Codex, GPT-5.6 Sol et Kimi K3 sont des affirmations de l'article lui-même, et le résumé ne précise pas comment ces systèmes ont été configurés ou exécutés. Aucune vérification indépendante n'a encore été effectuée. Considérez les pourcentages comme le rapport d'un laboratoire, et non comme un verdict indépendant.

La question ouverte

Pour un système visant l'auto-amélioration récursive, la question est de savoir si la boucle s'amplifie. Ces résultats montrent un modèle entraîné utilisant l'évolution pour résoudre des tâches d'ingénierie de l'apprentissage automatique mieux que son modèle de base. Ils ne montrent pas Frontis-MA1 produisant un successeur qui le dépasse, ce qu'exige en définitive l'auto-amélioration récursive. Le titre de l'article dit « towards », et ce mot porte tout le poids.

Ce que cette publication change, c'est qui peut poser la question. Les poids du modèle et toute la pile OpenMLE sont sur GitHub. La recherche sur la RSI n'est plus confinée aux laboratoires frontières et aux livres blancs politiques ; c'est désormais une expérience que quiconque possédant un GPU capable peut exécuter, avec un benchmark nommé et une configuration matérielle imprimée. Savoir si le domaine en avait besoin est un autre débat. Le fait que ce soit désormais possible est la nouvelle.

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.