OpenForgeRL est un framework open-source qui permet aux chercheurs d'entraîner des agents IA à base de harnais de bout en bout en utilisant des piles standard de renforcement par apprentissage. Il y parvient en découplant l'entraînement de l'inférence grâce à un proxy léger qui enregistre les appels de modèle comme données et à un orchestrateur Kubernetes qui gère les déploiements de conteneurs distants.

  • Le système prend en charge des environnements divers, y compris des agents à outils/pattes et des agents navigateurs GUI multimodaux.
  • OpenForgeClaw a obtenu 31.7 pass^3 sur ClawEval et 33.7 sur QwenClawBench en utilisant uniquement quelques centaines à quelques milliers de tâches.
  • OpenForgeGUI a atteint 37.7 sur OSWorld-Verified, 63.0 sur Online-Mind2Web et 72.3 sur WebVoyager.
  • Les deux variantes surpassent les références open-source de taille similaire et égalent ou dépassent les modèles plus grands dans les paramètres GUI.
  • L'analyse révèle que le choix du harnais a un impact significatif sur la difficulté d'apprentissage et que l'apprentissage par renforcement améliore les métriques de fiabilité telles que l'auto-vérification.

Le framework permet aux agents d'être entraînés directement dans les vrais harnais et environnements où ils sont déployés, facilitant ainsi l'étude et l'amélioration du comportement agentique.