OpenForgeRL adalah kerangka kerja sumber terbuka yang memungkinkan peneliti melatih agen AI berbasis harness secara end-to-end menggunakan tumpukan pembelajaran penguatan standar. Ia memisahkan pelatihan dari inferensi dengan menggunakan proksi ringan untuk merekam panggilan model sebagai data dan orkestrator Kubernetes untuk mengelola peluncuran di kontainer jarak jauh.

  • Sistem ini mendukung berbagai lingkungan, termasuk agen berbasis alat/cakar dan agen browser GUI multimodal.
  • OpenForgeClaw mencapai 31.7 pass^3 pada ClawEval dan 33.7 pada QwenClawBench hanya dengan menggunakan ratusan hingga beberapa ribu tugas.
  • OpenForgeGUI mencapai 37.7 pada OSWorld-Verified, 63.0 pada Online-Mind2Web, dan 72.3 pada WebVoyager.
  • Kedua varian tersebut mengungguli baseline sumber terbuka dengan ukuran serupa dan menyamai atau melampaui model yang lebih besar dalam pengaturan GUI.
  • Analisis mengungkapkan bahwa pilihan harness secara signifikan memengaruhi kesulitan pembelajaran dan bahwa RL meningkatkan metrik keandalan seperti verifikasi diri.

Kerangka kerja ini memungkinkan studi dan peningkatan agen langsung di lingkungan penempatan mereka, menunjukkan bahwa pembelajaran penguatan meningkatkan keandalan agentic meskipun masih ada kelemahan dalam pemulihan kesalahan.