يُعد OpenForgeRL إطار عمل مفتوح المصدر يسمح للباحثين بتدريب وكلاء الذكاء الاصطناعي المعتمدين على أدوات بشكل شامل باستخدام حزم التعلم التعزيزي القياسية. ويتحقق من ذلك عن طريق فصل التدريب عن الاستدلال عبر وسيط خفيف الوزن يسجل استدعاءات النموذج كبيانات، ومنسق Kubernetes الذي يدير نشر الحاويات عن بُعد.
- يدعم النظام بيئات متنوعة، بما في ذلك الوكلاء المعتمدون على الأدوات/المخالب والوكلاء متعددي الوسائط المتصفحين لواجهات المستخدم الرسومية.
- حقق OpenForgeClaw نتيجة 31.7 في اختبار ClawEval و33.7 في QwenClawBench باستخدام مئات إلى بضعة آلاف من المهام فقط.
- حققت OpenForgeGUI نتائج بـ 37.7 على OSWorld-Verified، و63.0 على Online-Mind2Web، و72.3 على WebVoyager.
- تفوق كل من النسختين على الأساسيات المفتوحة المماثلة في الحجم وتساوي أو تتفوق على النماذج الأكبر حجماً في إعدادات واجهة المستخدم الرسومية.
- يكشف التحليل أن اختيار الأداة يؤثر بشكل كبير على صعوبة التعلم وأن التعلم التعزيزي يحسن مقاييس الموثوقية مثل التحقق الذاتي.
يمكّن الإطار الوكلاء من التدريب مباشرةً داخل الأدوات والبيئات الحقيقية التي يتم نشرها فيها، مما يسهل دراسة سلوك الوكيل وتحسينه.