OpenForgeRL es un marco de código abierto que permite a los investigadores entrenar agentes de IA basados en arneses de extremo a extremo utilizando pilas estándar de aprendizaje por refuerzo. Desacopla el entrenamiento de la inferencia mediante el uso de un proxy ligero para registrar las llamadas del modelo como datos y un orquestador de Kubernetes para gestionar las ejecuciones en contenedores remotos.
- El sistema admite entornos diversos, incluidos agentes basados en herramientas/garras y agentes multimodales de navegación por GUI.
- OpenForgeClaw alcanza 31.7 pass^3 en ClawEval y 33.7 en QwenClawBench utilizando solo cientos a unos pocos miles de tareas.
- OpenForgeGUI alcanza 37.7 en OSWorld-Verified, 63.0 en Online-Mind2Web y 72.3 en WebVoyager.
- Ambas variantes superan las líneas base abiertas de tamaño similar e igualan o superan a modelos más grandes en entornos de GUI.
- El análisis revela que la elección del arnés impacta significativamente la dificultad del aprendizaje y que el RL mejora las métricas de fiabilidad como la autoverificación.
El marco permite el estudio y la mejora de los agentes directamente dentro de sus entornos de despliegue, demostrando que el aprendizaje por refuerzo mejora la fiabilidad agéntica a pesar de las debilidades restantes en la recuperación de errores.