Para peneliti menyajikan OpenForgeRL, sebuah kerangka kerja sumber terbuka yang memungkinkan pelatihan end-to-end agen AI menggunakan harness inferensi kompleks seperti Claude Code dan OpenClaw. Sistem ini memisahkan pelatihan dari inferensi dengan menggunakan proxy ringan untuk merekam panggilan model sebagai data dan orkestrator Kubernetes untuk mengelola peluncuran container jarak jauh.

  • OpenForgeRL mendukung berbagai lingkungan, termasuk agen berbasis alat dan agen browser GUI multimodal.
  • OpenForgeClaw mencapai 31.7 pass^3 pada ClawEval dan 33.7 pada QwenClawBench hanya dengan menggunakan ratusan hingga beberapa ribu tugas.
  • OpenForgeGUI mencapai 37.7 pada OSWorld-Verified, 63.0 pada Online-Mind2Web, dan 72.3 pada WebVoyager.
  • Kedua varian tersebut mengungguli baseline sumber terbuka dengan ukuran serupa dan menyamai atau melampaui model yang lebih besar dalam pengaturan GUI.
  • Analisis mengungkapkan bahwa pilihan harness secara signifikan memengaruhi kesulitan pembelajaran dan bahwa RL meningkatkan metrik keandalan seperti verifikasi diri.

Kerangka kerja ini memungkinkan peneliti melatih, mempelajari, dan meningkatkan agen secara langsung di dalam harness dan lingkungan nyata tempat mereka diterapkan.