OpenForgeRL est un framework open-source qui permet aux chercheurs d'entraîner des agents IA à base de harnais de bout en bout en utilisant des piles d'apprentissage par renforcement standard. Il découple l'entraînement de l'inférence en employant un proxy léger pour enregistrer les appels de modèle comme données et un orchestrateur Kubernetes pour gérer les déploiements dans des conteneurs distants.

  • Le système prend en charge divers environnements, y compris les agents à outils/pattes et les agents navigateurs GUI multimodaux.
  • OpenForgeClaw atteint 31.7 pass^3 sur ClawEval et 33.7 sur QwenClawBench en utilisant uniquement quelques centaines à quelques milliers de tâches.
  • OpenForgeGUI atteint 37.7 sur OSWorld-Verified, 63.0 sur Online-Mind2Web et 72.3 sur WebVoyager.
  • Les deux variantes surpassent les références open de taille similaire et égalent ou dépassent les modèles plus grands dans les paramètres GUI.
  • L'analyse révèle que le choix du harnais a un impact significatif sur la difficulté d'apprentissage et que l'apprentissage par renforcement améliore les métriques de fiabilité telles que l'auto-vérification.

Le framework permet l'étude et l'amélioration des agents directement dans leurs environnements de déploiement, démontrant que l'apprentissage par renforcement améliore la fiabilité agentic malgré les faiblesses persistantes dans la récupération d'erreurs.