Исследователи представляют OpenForgeRL, фреймворк с открытым исходным кодом, который позволяет осуществлять сквозное обучение ИИ-агентов с использованием сложных инференс-хаингов, таких как Claude Code и OpenClaw. Система разделяет процесс обучения и вывода данных, используя легковесный прокси для записи вызовов модели в виде данных и оркестратор Kubernetes для управления развертыванием удаленных контейнеров.
- OpenForgeRL поддерживает разнообразные среды, включая агентов на основе инструментов и мультимодальных GUI-агентов для браузеров.
- OpenForgeClaw достигает результата 31.7 pass^3 на ClawEval и 33.7 на QwenClawBench, используя лишь от нескольких сотен до нескольких тысяч задач.
- OpenForgeGUI показывает результат 37.7 на OSWorld-Verified, 63.0 на Online-Mind2Web и 72.3 на WebVoyager.
- Обе версии превосходят открытые базовые модели аналогичного размера и соответствуют или превосходят более крупные модели в задачах с графическим интерфейсом.
- Анализ показывает, что выбор хайринга существенно влияет на сложность обучения, а RL улучшает показатели надежности, такие как самопроверка.
Фреймворк позволяет исследователям обучать, изучать и улучшать агентов непосредственно в реальных хайрингах и средах, где они развернуты.