OpenForgeRL एक ओपन-सोर्स फ्रेमवर्क है जो शोधकर्ताओं को मान्य पुनर्बल सीखने स्टैक्स का उपयोग करके हार्नेस-आधारित AI एजेंट्स के अंत-से-अंत प्रशिक्षण की अनुमति देता है। यह एक हल्के प्रॉक्सी का उपयोग करके मॉडल कॉल को डेटा के रूप में रिकॉर्ड करने और दूरस्थ कंटेनरों में रोलआउट्स को प्रबंधित करने के लिए Kubernetes ऑर्केस्ट्रेटर का उपयोग करके प्रशिक्षण को इनफरेंस से अलग करता है।
- सिस्टम टूल/क्लॉ-आधारित एजेंट्स और बहुआयामी GUI ब्राउज़र एजेंट्स सहित विविध वातावरणों का समर्थन करता है।
- OpenForgeClaw केवल सैकड़ों से लेकर कुछ हजार कार्यों का उपयोग करके ClawEval पर 31.7 pass^3 और QwenClawBench पर 33.7 प्राप्त करता है।
- OpenForgeGUI OSWorld-Verified पर 37.7, Online-Mind2Web पर 63.0, और WebVoyager पर 72.3 प्राप्त करता है।
- दोनों प्रकार समान आकार के ओपन बेलाइन्स से बेहतर प्रदर्शन करते हैं और GUI सेटिंग्स में बड़े मॉडल को मिलते या पार कर जाते हैं।
- विश्लेषण बताता है कि हार्नेस का चयन सीखने की कठिनाई को महत्वपूर्ण रूप से प्रभावित करता है और RL आत्म-सत्यापन जैसे विश्वसनीयता मेट्रिक्स में सुधार लाता है।
फ्रेमवर्क एजेंट्स के अध्ययन और सुधार को सीधे उनके तैनाती वातावरणों में सक्षम बनाता है, यह दर्शाते हुए कि पुनर्बल सीखने ने त्रुटि पुनर्प्राप्ति में शेष कमजोरियों के बावजूद एजेंटिक विश्वसनीयता को बढ़ाया है।