OpenForgeRL은 연구자들이 표준 강화학습 스택을 사용하여 하네스 기반 AI 에이전트를 엔드투엔드로 학습할 수 있게 해주는 오픈소스 프레임워크입니다. 이는 모델 호출을 데이터로 기록하는 경량 프록시와 원격 컨테이너 롤아웃을 관리하는 Kubernetes 오케스트레이터를 통해 학습과 추론을 분리함으로써 이를 달성합니다.
- 이 시스템은 도구/클로 기반 에이전트와 멀티모달 GUI 브라우저 에이전트를 포함한 다양한 환경을 지원합니다.
- OpenForgeClaw는 수백 개에서 수천 개의 작업만 사용하여 ClawEval에서 31.7 pass^3, QwenClawBench에서 33.7의 성능을 달성했습니다.
- OpenForgeGUI는 OSWorld-Verified에서 37.7, Online-Mind2Web에서 63.0, WebVoyager에서 72.3의 점수를 기록했습니다.
- 두 변형 모두 유사한 크기의 오픈 베라인을 능가하며 GUI 설정에서 더 큰 모델과 동등하거나 그 이상의 성능을 보입니다.
- 분석 결과, 하네스 선택이 학습 난이도에 상당한 영향을 미치며 RL이 자기 검증과 같은 신뢰성 지표를 향상시키는 것으로 나타났습니다.
이 프레임워크는 에이전트가 배포되는 실제 하네스와 환경에서 직접 학습할 수 있게 하여, 에이전트 행동의 더 쉬운 연구와 개선을 가능하게 합니다.