OpenForgeRL — это фреймворк с открытым исходным кодом, который позволяет исследователям обучать агентов ИИ на основе хабров от начала до конца с использованием стандартных стеков обучения с подкреплением. Это достигается за счёт разделения процессов обучения и вывода через лёгкий прокси-сервер, который записывает вызовы модели как данные, и оркестратора Kubernetes, управляющего удалённым развёртыванием контейнеров.

  • Система поддерживает разнообразные среды, включая агентов на основе инструментов/когтей и мультимодальных браузерных агентов с графическим интерфейсом.
  • OpenForgeClaw достиг 31.7 pass^3 на ClawEval и 33.7 на QwenClawBench, используя лишь от нескольких сотен до нескольких тысяч задач.
  • OpenForgeGUI достиг 37.7 на OSWorld-Verified, 63.0 на Online-Mind2Web и 72.3 на WebVoyager.
  • Оба варианта превосходят открытые базовые модели аналогичного размера и соответствуют или превосходят более крупные модели в задачах с графическим интерфейсом.
  • Анализ показывает, что выбор хаба существенно влияет на сложность обучения, а обучение с подкреплением улучшает показатели надёжности, такие как самопроверка.

Фреймворк позволяет обучать агентов непосредственно в реальных хабрах и средах, где они развёртываются, облегчая изучение и улучшение агентного поведения.