शोधकर्ताओं ने OpenForgeRL प्रस्तुत किया, एक ओपन-सोर्स फ्रेमवर्क जो Claude Code और OpenClaw जैसी जटिल इनफरेंस हैर्नेस का उपयोग करके AI एजेंट्स के अंत-से-अंत प्रशिक्षण की अनुमति देता है। सिस्टम एक हल्के प्रॉक्सी का उपयोग करके मॉडल कॉल्स को डेटा के रूप में रिकॉर्ड करने और दूरस्थ कंटेनर रोलआउट्स को प्रबंधित करने के लिए Kubernetes ऑर्केस्ट्रेटर का उपयोग करके प्रशिक्षण को इनफरेंस से अलग करता है।

  • OpenForgeRL टूल-आधारित एजेंट्स और मल्टीमोडल GUI ब्राउज़र एजेंट्स सहित विविध वातावरणों का समर्थन करता है।
  • OpenForgeClaw केवल सैकड़ों से लेकर कुछ हजार कार्यों का उपयोग करके ClawEval पर 31.7 pass^3 और QwenClawBench पर 33.7 प्राप्त करता है।
  • OpenForgeGUI OSWorld-Verified पर 37.7, Online-Mind2Web पर 63.0, और WebVoyager पर 72.3 प्राप्त करता है।
  • दोनों संस्करण समान आकार के ओपन बेलाइन्स को पार करते हैं और GUI सेटिंग्स में बड़े मॉडल्स के बराबर या उनसे श्रेष्ठ होते हैं।
  • विश्लेषण से पता चलता है कि हैर्नेस का चयन सीखने की कठिनाई को महत्वपूर्ण रूप से प्रभावित करता है और RL आत्म-सत्यापन जैसे विश्वसनीयता मेट्रिक्स में सुधार लाता है।

फ्रेमवर्क शोधकर्ताओं को उन वास्तविक हैर्नेस और वातावरणों के भीतर सीधे एजेंट्स का प्रशिक्षण, अध्ययन और सुधार करने की अनुमति देता है जहाँ उन्हें तैनात किया जाता है।