يقدم الباحثون إطار عمل مفتوح المصدر يُدعى OpenForgeRL، والذي يتيح التدريب المتكامل للوكلاء الذكيين باستخدام أدوات استشعار معقدة مثل Claude Code وOpenClaw. يفصل النظام بين عملية التدريب والاستدعاء من خلال استخدام وكيل خفيف لتسجيل استدعاءات النموذج كبيانات، ومنسق Kubernetes لإدارة نشر الحاويات عن بُعد.

  • يدعم OpenForgeRL بيئات متنوعة، بما في ذلك الوكلاء المعتمدين على الأدوات والوكلاء المتعددة الوسائط للواجهات الرسومية.
  • يحقق OpenForgeClaw نتيجة 31.7 على اختبار ClawEval و33.7 على QwenClawBench باستخدام مئات إلى بضعة آلاف من المهام فقط.
  • يصل OpenForgeGUI إلى نتيجة 37.7 على OSWorld-Verified، و63.0 على Online-Mind2Web، و72.3 على WebVoyager.
  • يتفوق كلا المتغيرين على الخطوط الأساسية المفتوحة ذات الحجم المماثل، ويتساوى أو يتجاوز النماذج الأكبر في إعدادات الواجهات الرسومية.
  • يكشف التحليل أن اختيار أداة الاستشعار يؤثر بشكل كبير على صعوبة التعلم وأن التعلم المعزز يحسن مقاييس الموثوقية مثل التحقق الذاتي.

يمكن للإطار العمل الباحثين من تدريب ودراسة وتحسين الوكلاء مباشرة داخل أدوات الاستشعار والبيئات الحقيقية التي يتم نشرها فيها.