OpenForgeRL — это фреймворк с открытым исходным кодом, который позволяет исследователям обучать агентов ИИ на основе хабров от начала до конца с использованием стандартных стеков обучения с подкреплением. Он разделяет процессы обучения и вывода, используя легковесный прокси-сервер для записи вызовов модели в виде данных и оркестратор Kubernetes для управления развертываниями в удаленных контейнерах.
- Система поддерживает разнообразные среды, включая агентов на основе инструментов/когтей и мультимодальных браузерных агентов с графическим интерфейсом.
- OpenForgeClaw достигает 31.7 pass^3 на ClawEval и 33.7 на QwenClawBench, используя лишь от нескольких сотен до нескольких тысяч задач.
- OpenForgeGUI достигает 37.7 на OSWorld-Verified, 63.0 на Online-Mind2Web и 72.3 на WebVoyager.
- Обе версии превосходят открытые базовые модели аналогичного размера и соответствуют или превосходят более крупные модели в задачах с графическим интерфейсом.
- Анализ показывает, что выбор хаба существенно влияет на сложность обучения, а обучение с подкреплением улучшает показатели надежности, такие как самопроверка.
Фреймворк позволяет изучать и улучшать агентов непосредственно в их средах развертывания, демонстрируя, что обучение с подкреплением повышает надежность агентов, несмотря на сохраняющиеся недостатки в восстановлении после ошибок.