연구자들은 Claude Code와 OpenClaw과 같은 복잡한 추론 하arness를 사용하여 AI 에이전트를 엔드투엔드 학습할 수 있는 오픈소스 프레임워크인 OpenForgeRL을 제시했습니다. 이 시스템은 경량 프록시를 통해 모델 호출을 데이터로 기록하고 Kubernetes 오케스트레이터를 사용하여 원격 컨테이너 롤아웃을 관리함으로써 학습과 추론을 분리합니다.
- OpenForgeRL은 도구 기반 에이전트와 다중 모달 GUI 브라우저 에이전트를 포함하여 다양한 환경을 지원합니다.
- OpenForgeClaw은 수백에서 수천 개의 작업만 사용하여 ClawEval에서 31.7 pass^3, QwenClawBench에서 33.7을 달성했습니다.
- OpenForgeGUI는 OSWorld-Verified에서 37.7, Online-Mind2Web에서 63.0, WebVoyager에서 72.3을 달성했습니다.
- 두 변형 모두 유사한 크기의 오픈 베라인을 능가하며 GUI 설정에서 더 큰 모델과 동등하거나 이를 상회합니다.
- 분석 결과 하니스 선택이 학습 난이도에 상당한 영향을 미치며, RL이 자기 검증과 같은 신뢰성 지표를 개선하는 것으로 나타났습니다.
이 프레임워크는 연구자들이 에이전트가 배포되는 실제 하니스와 환경 내에서 직접 학습하고 연구하며 개선할 수 있도록 합니다.