OpenForgeRL es un marco de código abierto que permite a los investigadores entrenar agentes de IA basados en arneses de extremo a extremo utilizando pilas estándar de aprendizaje por refuerzo. Desacopla el entrenamiento de la inferencia mediante el uso de un proxy ligero para registrar las llamadas del modelo como datos y un orquestador de Kubernetes para gestionar las ejecuciones en contenedores remotos.

  • El sistema admite entornos diversos, incluidos agentes basados en herramientas/garras y agentes multimodales de navegación por GUI.
  • OpenForgeClaw alcanza 31.7 pass^3 en ClawEval y 33.7 en QwenClawBench utilizando solo cientos a unos pocos miles de tareas.
  • OpenForgeGUI alcanza 37.7 en OSWorld-Verified, 63.0 en Online-Mind2Web y 72.3 en WebVoyager.
  • Ambas variantes superan las líneas base abiertas de tamaño similar e igualan o superan a modelos más grandes en entornos de GUI.
  • El análisis revela que la elección del arnés impacta significativamente la dificultad del aprendizaje y que el RL mejora las métricas de fiabilidad como la autoverificación.

El marco permite el estudio y la mejora de los agentes directamente dentro de sus entornos de despliegue, demostrando que el aprendizaje por refuerzo mejora la fiabilidad agéntica a pesar de las debilidades restantes en la recuperación de errores.