Los investigadores presentan OpenForgeRL, un marco de código abierto que permite el entrenamiento de extremo a extremo de agentes de IA utilizando arneses de inferencia complejos como Claude Code y OpenClaw. El sistema desacopla el entrenamiento de la inferencia mediante un proxy ligero para registrar las llamadas del modelo como datos y un orquestador de Kubernetes para gestionar los despliegues remotos de contenedores.
- OpenForgeRL admite entornos diversos, incluidos agentes basados en herramientas y agentes de navegación GUI multimodales.
- OpenForgeClaw alcanza 31.7 pass^3 en ClawEval y 33.7 en QwenClawBench utilizando solo cientos a unos pocos miles de tareas.
- OpenForgeGUI alcanza 37.7 en OSWorld-Verified, 63.0 en Online-Mind2Web y 72.3 en WebVoyager.
- Ambas variantes superan las líneas base abiertas de tamaño similar e igualan o superan a modelos más grandes en configuraciones GUI.
- El análisis revela que la elección del arnés impacta significativamente la dificultad de aprendizaje y que el RL mejora las métricas de confiabilidad como la autoverificación.
El marco permite a los investigadores entrenar, estudiar y mejorar agentes directamente dentro de los arneses reales y entornos donde se despliegan.