OpenForgeRL — это фреймворк с открытым исходным кодом, который позволяет исследователям обучать агентов ИИ на основе хабров от начала до конца с использованием стандартных стеков обучения с подкреплением. Это достигается за счёт разделения процессов обучения и вывода через лёгкий прокси-сервер, который записывает вызовы модели как данные, и оркестратора Kubernetes, управляющего удалённым развёртыванием контейнеров.
- Система поддерживает разнообразные среды, включая агентов на основе инструментов/когтей и мультимодальных браузерных агентов с графическим интерфейсом.
- OpenForgeClaw достиг 31.7 pass^3 на ClawEval и 33.7 на QwenClawBench, используя лишь от нескольких сотен до нескольких тысяч задач.
- OpenForgeGUI достиг 37.7 на OSWorld-Verified, 63.0 на Online-Mind2Web и 72.3 на WebVoyager.
- Оба варианта превосходят открытые базовые модели аналогичного размера и соответствуют или превосходят более крупные модели в задачах с графическим интерфейсом.
- Анализ показывает, что выбор хаба существенно влияет на сложность обучения, а обучение с подкреплением улучшает показатели надёжности, такие как самопроверка.
Фреймворк позволяет обучать агентов непосредственно в реальных хабрах и средах, где они развёртываются, облегчая изучение и улучшение агентного поведения.