Código abierto
OpenForgeRL entrena agentes de IA sin tocar sus arneses de inferencia
OpenForgeRL utiliza un proxy y Kubernetes para entrenar agentes de IA sin modificar sus arneses de inferencia. En las pruebas, OpenForgeGUI igualó a modelos varias veces más grandes en navegación web y puntos de referencia de escritorio.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-08-01 · Última actualización: 2026-08-03 · 2 min de lectura

Los agentes de IA modernos no dependen de una sola llamada al modelo. Dependen de arneses de inferencia elaborados como Claude Code, Codex y OpenClaw para gestionar el razonamiento multiturno, el uso de herramientas y el acceso a sistemas externos. Estos arneses hacen que los agentes sean potentes, pero también dificultan el entrenamiento. Las pilas estándar de ajuste fino supervisado y aprendizaje por refuerzo no fueron diseñadas para la inferencia de arneses con estado y multiproceso. Los investigadores a menudo tenían que elegir entre usar un arnés potente o poder entrenar en absoluto.
OpenForgeRL, presentado por un equipo de investigadores, busca eliminar ese compromiso. El marco se construye alrededor de un proxy ligero que se sitúa entre el arnés y el modelo. El proxy intercepta las llamadas al modelo durante la inferencia, registra las entradas y salidas, y las introduce en un código base de RL estándar como veRL. Un orquestador de Kubernetes ejecuta cada despliegue en su propio contenedor, escalando entre entornos sin requerir cambios en el arnés mismo.
Los autores validaron el marco en dos categorías de agentes: agentes de código basados en herramientas, a los que llaman OpenForgeClaw, y agentes GUI multimodales, llamados OpenForgeGUI. Utilizando solo cientos a unos pocos miles de tareas de entrenamiento, OpenForgeClaw obtuvo 31.7 pass^3 y 55.9 pass@3 en ClawEval y 33.7 en QwenClawBench. OpenForgeGUI alcanzó 37.7 en OSWorld-Verified, 63.0 en Online-Mind2Web y 72.3 en WebVoyager. En casi todos los puntos de referencia, ambos agentes superaron a las líneas base abiertas de tamaño similar. En el entorno GUI, igualaron o superaron a modelos varias veces más grandes.
Más allá de las cifras principales, el artículo examina cómo diferentes arneses responden al entrenamiento con RL. No todos los arneses son igualmente entrenables. Algunos resultaron sustancialmente más difíciles de aprender que otros. Los investigadores encontraron que el RL mejoró consistentemente factores de confiabilidad del agente como la autoverificación, la cobertura de herramientas y la capacidad de completar planes de múltiples pasos. Una debilidad notable persistió: la recuperación de errores siguió siendo deficiente incluso después del entrenamiento, lo que destaca una brecha persistente para trabajos futuros.
La contribución central es práctica. OpenForgeRL desacopla el entrenamiento de la inferencia, permitiendo a los investigadores entrenar agentes directamente en los arneses y entornos reales donde finalmente serán desplegados. El código está disponible bajo una licencia de código abierto, lo que permite que otros equipos reproduzcan y amplíen los resultados sin infraestructura propietaria.
- Fuente : OpenForgeRL trains AI agents without touching their inference harnesses — 2026-07-24
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.