OpenForgeRL es un marco de código abierto que permite a los investigadores entrenar agentes de IA basados en arneses de extremo a extremo utilizando pilas estándar de aprendizaje por refuerzo. Logra esto desacoplando el entrenamiento de la inferencia mediante un proxy ligero que registra las llamadas del modelo como datos y un orquestador de Kubernetes que gestiona el despliegue remoto de contenedores.

  • El sistema admite entornos diversos, incluidos agentes basados en herramientas/garras y agentes de navegación GUI multimodales.
  • OpenForgeClaw logró 31.7 pass^3 en ClawEval y 33.7 en QwenClawBench utilizando solo cientos hasta unas pocas miles de tareas.
  • OpenForgeGUI alcanzó 37.7 en OSWorld-Verified, 63.0 en Online-Mind2Web y 72.3 en WebVoyager.
  • Ambas variantes superan las líneas base abiertas de tamaño similar e igualan o superan a modelos más grandes en entornos GUI.
  • El análisis revela que la elección del arnés impacta significativamente la dificultad de aprendizaje y que el RL mejora métricas de fiabilidad como la autoverificación.

El marco permite entrenar agentes directamente en los arneses y entornos reales donde se despliegan, facilitando un estudio y mejora más sencillos del comportamiento agente.