Pesquisadores apresentam o OpenForgeRL, um framework de código aberto que permite o treinamento de ponta a ponta de agentes de IA usando harnesses de inferência complexos como Claude Code e OpenClaw. O sistema desacopla o treinamento da inferência empregando um proxy leve para registrar chamadas do modelo como dados e um orquestrador Kubernetes para gerenciar implantações remotas de contêineres.
- OpenForgeRL suporta ambientes diversos, incluindo agentes baseados em ferramentas e agentes multimodais de navegador GUI.
- OpenForgeClaw alcança 31.7 pass^3 no ClawEval e 33.7 no QwenClawBench usando apenas centenas a algumas milhares de tarefas.
- OpenForgeGUI atinge 37.7 no OSWorld-Verified, 63.0 no Online-Mind2Web e 72.3 no WebVoyager.
- Ambas as variantes superam as bases abertas de tamanho similar e igualam ou superam modelos maiores em configurações GUI.
- A análise revela que a escolha do harness impacta significativamente a dificuldade de aprendizado e que o RL melhora métricas de confiabilidade como auto-verificação.
O framework permite que pesquisadores treinem, estudem e melhorem agentes diretamente dentro dos harnesses e ambientes reais onde são implantados.