O OpenForgeRL é um framework de código aberto que permite aos pesquisadores treinar agentes de IA baseados em harness de ponta a ponta usando pilhas padrão de aprendizado por reforço. Ele desacopla o treinamento da inferência ao empregar um proxy leve para registrar as chamadas do modelo como dados e um orquestrador Kubernetes para gerenciar as execuções em contêineres remotos.

  • O sistema suporta ambientes diversos, incluindo agentes baseados em ferramentas/garras e agentes multimodais de navegador GUI.
  • O OpenForgeClaw alcança 31.7 pass^3 no ClawEval e 33.7 no QwenClawBench usando apenas algumas centenas a alguns milhares de tarefas.
  • O OpenForgeGUI atinge 37.7 no OSWorld-Verified, 63.0 no Online-Mind2Web e 72.3 no WebVoyager.
  • Ambas as variantes superam as linhas de base abertas de tamanho semelhante e igualam ou superam modelos maiores em configurações de GUI.
  • A análise revela que a escolha do harness impacta significativamente a dificuldade de aprendizado e que o RL melhora métricas de confiabilidade, como a auto-verificação.

O framework permite o estudo e a melhoria dos agentes diretamente dentro de seus ambientes de implantação, demonstrando que o aprendizado por reforço aumenta a confiabilidade agencial apesar das fraquezas remanescentes na recuperação de erros.