Les chercheurs présentent OpenForgeRL, un framework open-source qui permet l'entraînement de bout en bout d'agents IA à l'aide de harnais d'inférence complexes tels que Claude Code et OpenClaw. Le système découple l'entraînement de l'inférence en employant un proxy léger pour enregistrer les appels de modèle comme données et un orchestrateur Kubernetes pour gérer les déploiements de conteneurs distants.
- OpenForgeRL prend en charge des environnements divers, y compris des agents basés sur des outils et des agents navigateurs GUI multimodaux.
- OpenForgeClaw atteint 31.7 pass^3 sur ClawEval et 33.7 sur QwenClawBench en utilisant uniquement quelques centaines à quelques milliers de tâches.
- OpenForgeGUI atteint 37.7 sur OSWorld-Verified, 63.0 sur Online-Mind2Web et 72.3 sur WebVoyager.
- Les deux variantes surpassent les références open-source de taille similaire et égalent ou dépassent les modèles plus grands dans les paramètres GUI.
- L'analyse révèle que le choix du harnais a un impact significatif sur la difficulté d'apprentissage et que le RL améliore les métriques de fiabilité telles que l'auto-vérification.
Le framework permet aux chercheurs d'entraîner, d'étudier et d'améliorer les agents directement au sein des harnais et environnements réels où ils sont déployés.