开源
OpenForgeRL:无需改动推理框架即可训练AI智能体
OpenForgeRL利用代理和Kubernetes,在不修改推理框架的前提下训练AI智能体。测试中,OpenForgeGUI在网页导航与桌面基准测试上达到了数倍于自身规模模型的表现。

现代AI智能体并不依赖于单一的模型调用。它们依赖复杂的推理框架(如Claude Code、Codex和OpenClaw)来管理多轮推理、工具调用以及对外部系统的访问。这些框架赋予了智能体强大的能力,但也使得训练变得困难。标准的监督微调和强化学习堆栈并非为有状态、多进程的框架推理而设计。研究人员常常不得不在使用强大框架与能够训练之间做出选择。
由一组研究人员推出的OpenForgeRL旨在消除这一权衡。该框架围绕一个位于框架与模型之间的轻量级代理构建。该代理在推理过程中拦截模型调用,记录输入和输出,并将其输入标准的强化学习代码库(如veRL)。Kubernetes编排器在各自的容器中运行每个运行实例,跨环境扩展而无需修改框架本身。
作者在两类智能体上验证了该框架:基于工具代码的智能体(称为OpenForgeClaw)和多模态GUI智能体(称为OpenForgeGUI)。仅使用数百到数千个训练任务,OpenForgeClaw在ClawEval上获得了31.7 pass^3和55.9 pass@3,在QwenClawBench上获得了33.7。OpenForgeGUI在OSWorld-Verified上达到37.7,在Online-Mind2Web上达到63.0,在WebVoyager上达到72.3。在几乎所有基准测试中,这两个智能体都优于同等规模的开源基线。在GUI设置中,它们匹敌甚至超越了数倍于自身规模的模型。
除了这些关键数据,论文还探讨了不同框架对强化学习训练的反应。并非所有框架都同样可训练。有些框架的学习难度显著高于其他。研究人员发现,强化学习持续提升了智能体在自我验证、工具覆盖率和完成多步计划能力等可靠性因素上的表现。一个显著的弱点依然存在:即使经过训练,错误恢复能力仍然较差,这凸显了未来工作需要持续弥补的差距。
核心贡献在于其实用性。OpenForgeRL将训练与推理解耦,使研究人员能够直接在智能体最终部署的真实框架和环境中进行训练。代码以开源许可证提供,使得其他团队无需专有基础设施即可复现和扩展结果。
- 来源 : OpenForgeRL trains AI agents without touching their inference harnesses — 2026-07-24
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。