OpenForgeRLは、研究者が標準的な強化学習スタックを使用してハーネスベースのAIエージェントをエンドツーエンドで学習できるようにするオープンソースフレームワークです。モデル呼び出しをデータとして記録する軽量プロキシと、リモートコンテナでのロールアウトを管理するKubernetesオーケストレーターを採用することで、学習と推論を分離します。
- このシステムは、ツール/爪ベースのエージェントやマルチモーダルGUIブラウザエージェントなど、多様な環境をサポートしています。
- OpenForgeClawは、数百から数千人のタスクのみを使用して、ClawEvalで31.7 pass^3、QwenClawBenchで33.7を達成しました。
- OpenForgeGUIは、OSWorld-Verifiedで37.7、Online-Mind2Webで63.0、WebVoyagerで72.3に到達しました。
- 両方のバリアントは、同規模のオープンベースラインを上回り、GUI設定ではより大きなモデルと同等かそれ以上の性能を発揮します。
- 分析により、ハーネスの選択が学習の難しさに大きな影響を与えることが明らかになり、RLが自己検証などの信頼性指標を向上させることが示されました。
このフレームワークは、エージェントを展開環境内で直接研究・改善することを可能にし、エラー回復における残る弱点にもかかわらず、強化学習がエージェントの信頼性を高めることを実証しています。