OpenForgeRL은 연구자들이 표준 강화학습 스택을 사용하여 하네스 기반 AI 에이전트를 엔드투엔드로 학습할 수 있게 하는 오픈소스 프레임워크입니다. 이는 경량 프록시를 통해 모델 호출을 데이터로 기록하고, 쿠버네티스 오케스트레이터를 사용하여 원격 컨테이너에서 롤아웃을 관리함으로써 학습과 추론을 분리합니다.

  • 이 시스템은 도구/클로 기반 에이전트와 다중 모달 GUI 브라우저 에이전트를 포함한 다양한 환경을 지원합니다.
  • OpenForgeClaw는 수백 개에서 수천 개의 작업만 사용하여 ClawEval에서 31.7 pass^3, QwenClawBench에서 33.7을 달성합니다.
  • OpenForgeGUI는 OSWorld-Verified에서 37.7, Online-Mind2Web에서 63.0, WebVoyager에서 72.3을 기록합니다.
  • 두 변형 모두 유사한 크기의 오픈 베라인을 능가하며 GUI 설정에서 더 큰 모델과 동등하거나 이를 초과합니다.
  • 분석 결과 하네스 선택이 학습 난이도에 상당한 영향을 미치며, RL이 자기 검증과 같은 신뢰성 지표를 향상시킨다는 것이 밝혀졌습니다.

이 프레임워크는 에이전트를 배포 환경 내에서 직접 연구하고 개선할 수 있게 하며, 오류 복구에서의 잔여 약점에도 불구하고 강화학습이 에이전트 신뢰성을 향상시킨다는 것을 보여줍니다.