Pesquisadores apresentam o OpenForgeRL, um framework de código aberto que permite o treinamento de ponta a ponta de agentes de IA usando harnesses de inferência complexos como Claude Code e OpenClaw. O sistema desacopla o treinamento da inferência empregando um proxy leve para registrar chamadas do modelo como dados e um orquestrador Kubernetes para gerenciar implantações remotas de contêineres.

  • OpenForgeRL suporta ambientes diversos, incluindo agentes baseados em ferramentas e agentes multimodais de navegador GUI.
  • OpenForgeClaw alcança 31.7 pass^3 no ClawEval e 33.7 no QwenClawBench usando apenas centenas a algumas milhares de tarefas.
  • OpenForgeGUI atinge 37.7 no OSWorld-Verified, 63.0 no Online-Mind2Web e 72.3 no WebVoyager.
  • Ambas as variantes superam as bases abertas de tamanho similar e igualam ou superam modelos maiores em configurações GUI.
  • A análise revela que a escolha do harness impacta significativamente a dificuldade de aprendizado e que o RL melhora métricas de confiabilidade como auto-verificação.

O framework permite que pesquisadores treinem, estudem e melhorem agentes diretamente dentro dos harnesses e ambientes reais onde são implantados.