OpenForgeRLは、研究者が標準的な強化学習スタックを使用してハーネスベースのAIエージェントをエンドツーエンドで学習できるようにするオープンソースフレームワークです。これは、モデル呼び出しをデータとして記録する軽量プロキシと、リモートコンテナの展開を管理するKubernetesオーケストレーターを通じて、学習と推論を分離することで実現されます。

  • このシステムは、ツール/爪ベースのエージェントやマルチモーダルGUIブラウザエージェントなど、多様な環境をサポートしています。

OpenForgeClawは、数百から数千タスクのみを使用して、ClawEvalで31.7 pass^3、QwenClawBenchで33.7を達成しました。

  • OpenForgeGUIは、OSWorld-Verifiedで37.7、Online-Mind2Webで63.0、WebVoyagerで72.3を達成しました。

両方のバリアントは、同規模のオープンベースラインを上回り、GUI設定ではより大きなモデルと同等かそれ以上の性能を発揮します。

  • 分析により、ハーネスの選択が学習の難しさに大きく影響することが明らかになり、RLが自己検証などの信頼性指標を向上させることが示されました。

このフレームワークにより、エージェントは展開先の実際のハーネスや環境で直接学習できるようになり、エージェント行動の研究と改善が容易になります。