Open Source
OpenForgeRL entraîne des agents IA sans toucher à leurs infrastructures d'inférence
OpenForgeRL utilise un proxy et Kubernetes pour entraîner des agents IA sans modifier leurs infrastructures d'inférence. Lors des tests, OpenForgeGUI a égalé des modèles plusieurs fois plus grands sur des benchmarks de navigation web et de bureau.
Emmanuel Fabrice Omgbwa Yasse Assisté par IA
2026-08-01 · 2 min de lecture

Les agents IA modernes ne se reposent pas sur un seul appel de modèle. Ils dépendent d'infrastructures d'inférence élaborées telles que Claude Code, Codex et OpenClaw pour gérer le raisonnement multi-tours, l'utilisation d'outils et l'accès aux systèmes externes. Ces infrastructures rendent les agents puissants, mais elles rendent aussi l'entraînement difficile. Les piles standard de fine-tuning supervisé et d'apprentissage par renforcement n'ont pas été conçues pour une inférence d'infrastructure stateful et multi-processus. Les chercheurs devaient souvent choisir entre utiliser une infrastructure puissante ou pouvoir s'entraîner du tout.
OpenForgeRL, introduit par une équipe de chercheurs, vise à supprimer ce compromis. Le framework est construit autour d'un proxy léger qui se place entre l'infrastructure et le modèle. Le proxy intercepte les appels de modèle pendant l'inférence, enregistre les entrées et sorties, et les alimente dans une base de code RL standard telle que veRL. Un orchestrateur Kubernetes exécute chaque rollout dans son propre conteneur, en montant en charge à travers les environnements sans nécessiter de modifications de l'infrastructure elle-même.
Les auteurs ont validé le framework sur deux catégories d'agents : les agents code basés sur des outils, qu'ils appellent OpenForgeClaw, et les agents GUI multimodaux, appelés OpenForgeGUI. En utilisant seulement des centaines à quelques milliers de tâches d'entraînement, OpenForgeClaw a obtenu 31.7 pass^3 et 55.9 pass@3 sur ClawEval et 33.7 sur QwenClawBench. OpenForgeGUI a atteint 37.7 sur OSWorld-Verified, 63.0 sur Online-Mind2Web et 72.3 sur WebVoyager. Sur presque tous les benchmarks, les deux agents ont surpassé les bases de référence ouvertes de taille similaire. Dans le cadre GUI, ils ont égalé ou dépassé des modèles plusieurs fois plus grands.
Au-delà des chiffres principaux, l'article examine comment différentes infrastructures répondent à l'entraînement RL. Toutes les infrastructures ne sont pas également entraînables. Certaines se sont avérées beaucoup plus difficiles à apprendre que d'autres. Les chercheurs ont constaté que le RL améliorait systématiquement les facteurs de fiabilité agentique tels que l'auto-vérification, la couverture des outils et la capacité à réaliser des plans multi-étapes. Une faiblesse notable subsistait : la récupération d'erreurs restait médiocre même après l'entraînement, soulignant un écart persistant pour les travaux futurs.
La contribution principale est pratique. OpenForgeRL découple l'entraînement de l'inférence, permettant aux chercheurs d'entraîner des agents directement dans les infrastructures et environnements réels où ils seront finalement déployés. Le code est disponible sous une licence open-source, permettant à d'autres équipes de reproduire et d'étendre les résultats sans infrastructure propriétaire.
- Source : OpenForgeRL trains AI agents without touching their inference harnesses — 2026-07-24
L'essentiel de la tech en 3 minutes chaque matin
Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.