OpenForgeRL adalah kerangka kerja sumber terbuka yang memungkinkan peneliti melatih agen AI berbasis harness secara end-to-end menggunakan tumpukan pembelajaran penguatan standar. Hal ini dicapai dengan memisahkan pelatihan dari inferensi melalui proksi ringan yang merekam panggilan model sebagai data dan orkestrator Kubernetes yang mengelola peluncuran kontainer jarak jauh.

  • Sistem mendukung beragam lingkungan, termasuk agen berbasis alat/cakar dan agen browser GUI multimodal.
  • OpenForgeClaw mencapai 31.7 pass^3 pada ClawEval dan 33.7 pada QwenClawBench hanya dengan ratusan hingga beberapa ribu tugas.
  • OpenForgeGUI mencapai 37.7 pada OSWorld-Verified, 63.0 pada Online-Mind2Web, dan 72.3 pada WebVoyager.
  • Kedua varian mengungguli baseline sumber terbuka dengan ukuran serupa dan menyamai atau melampaui model yang lebih besar dalam pengaturan GUI.
  • Analisis mengungkapkan bahwa pilihan harness secara signifikan memengaruhi kesulitan pembelajaran dan bahwa RL meningkatkan metrik keandalan seperti verifikasi diri.

Kerangka kerja ini memungkinkan agen dilatih langsung di harness dan lingkungan nyata tempat mereka diterapkan, memfasilitasi studi dan peningkatan perilaku agentic yang lebih mudah.