O OpenForgeRL é um framework de código aberto que permite aos pesquisadores treinar agentes de IA baseados em harness de ponta a ponta usando pilhas padrão de aprendizado por reforço. Ele alcança isso desacoplando o treinamento da inferência por meio de um proxy leve que registra as chamadas do modelo como dados e um orquestrador Kubernetes que gerencia os lançamentos remotos de contêineres.

  • O sistema suporta ambientes diversos, incluindo agentes baseados em ferramentas/garras e agentes multimodais de navegador GUI.
  • O OpenForgeClaw alcançou 31,7 pass^3 no ClawEval e 33,7 no QwenClawBench usando apenas algumas centenas a alguns milhares de tarefas.
  • O OpenForgeGUI atingiu 37,7 no OSWorld-Verified, 63,0 no Online-Mind2Web e 72,3 no WebVoyager.
  • Ambas as variantes superam as linhas de base abertas de tamanho semelhante e igualam ou superam modelos maiores em configurações de GUI.
  • A análise revela que a escolha do harness impacta significativamente a dificuldade de aprendizado e que o RL melhora métricas de confiabilidade como auto-verificação.

O framework permite que os agentes sejam treinados diretamente nos harnesses reais e nos ambientes onde são implantados, facilitando o estudo e a melhoria do comportamento agêntico.