يُعد OpenForgeRL إطار عمل مفتوح المصدر يسمح للباحثين بتدريب وكلاء الذكاء الاصطناعي المعتمدين على أدوات بشكل شامل باستخدام مجموعات تعلم التعزيز القياسية. يفصل بين التدريب والاستدلال من خلال استخدام وكيل خفيف الوزن لتسجيل استدعاءات النموذج كبيانات، ومنسق Kubernetes لإدارة عمليات النشر في حاويات عن بُعد.

  • يدعم النظام بيئات متنوعة، بما في ذلك الوكلاء المعتمدين على الأدوات/المخالب والوكلاء متعددي الوسائط المتصفح لواجهات المستخدم الرسومية.
  • يحقق OpenForgeClaw نتيجة 31.7 على ClawEval و33.7 على QwenClawBench باستخدام مئات إلى بضعة آلاف من المهام فقط.
  • يصل OpenForgeGUI إلى 37.7 على OSWorld-Verified، و63.0 على Online-Mind2Web، و72.3 على WebVoyager.
  • يتفوق كلا المتغيرين على الأساسيات المفتوحة ذات الحجم المماثل، ويتساوى أو يتفوق على النماذج الأكبر في إعدادات واجهة المستخدم الرسومية.
  • يكشف التحليل أن اختيار الأداة يؤثر بشكل كبير على صعوبة التعلم، وأن تعلم التعزيز يحسن مقاييس الموثوقية مثل التحقق الذاتي.

يُمكّن الإطار من دراسة الوكلاء وتحسينهم مباشرة داخل بيئات نشرهم، مما يوضح أن تعلم التعزيز يعزز موثوقية الوكلاء رغم نقاط الضعف المتبقية في استعادة الأخطاء.