OpenForgeRL एक ओपन-सोर्स फ्रेमवर्क है जो शोधकर्ताओं को मानक रीइन्फोर्समेंट लर्निंग स्टैक्स का उपयोग करके हैरनेस-आधारित AI एजेंट्स के अंत-से-अंत प्रशिक्षण की अनुमति देता है। यह एक हल्के प्रॉक्सी के माध्यम से प्रशिक्षण को इनफरेंस से अलग करके इसे प्राप्त करता है जो मॉडल कॉल्स को डेटा के रूप में रिकॉर्ड करता है और एक Kubernetes ऑर्केस्ट्रेटर जो रिमोट कंटेनर रोलआउट का प्रबंधन करता है।

  • सिस्टम विविध वातावरणों का समर्थन करता है, जिसमें टूल/क्लॉ-आधारित एजेंट्स और मल्टीमोडल GUI ब्राउज़र एजेंट्स शामिल हैं।
  • OpenForgeClaw ने केवल सैकड़ों से लेकर कुछ हजार कार्यों का उपयोग करते हुए ClawEval पर 31.7 pass^3 और QwenClawBench पर 33.7 हासिल किए।
  • OpenForgeGUI ने OSWorld-Verified पर 37.7, Online-Mind2Web पर 63.0, और WebVoyager पर 72.3 प्राप्त किए।
  • दोनों वेरिएंट्स समान आकार के ओपन बेलाइन्स से बेहतर प्रदर्शन करते हैं और GUI सेटिंग्स में बड़े मॉडल्स को बराबर या पार कर जाते हैं।
  • विश्लेषण से पता चलता है कि हैरनेस का चयन सीखने की कठिनाई को महत्वपूर्ण रूप से प्रभावित करता है और RL आत्म-सत्यापन जैसे विश्वसनीयता मेट्रिक्स में सुधार लाता है।

फ्रेमवर्क एजेंट्स को उनके डिप्लॉयमेंट के वास्तविक हैरनेस और वातावरण में सीधे प्रशिक्षित करने की अनुमति देता है, जिससे एजेंटिक व्यवहार का आसान अध्ययन और सुधार संभव होता है।