تقدم الورقة البحثية CANOPY (Coverage-ANchored On-PolicY RL)، وهو بروتوكول يعالج مشكلة شح الإشارة والانحراف في السياسة ضمن التعلم المعزز طويل المدى للنماذج المفتوحة الصغيرة. ومن خلال توسيع نطاق استكشاف المهمة نفسها والحفاظ على التحديثات مرتبطة بمسافة KL، تتيح هذه الطريقة للوكلاء التعلم بفعالية من التحقق النهائي للمهمة فقط.

  • يوسع CANOPY نطاق الاستكشاف حتى تظهر الإشارة الطبيعية، متجنباً صمت المكافآت المتفرقة في المهام الصعبة.
  • تُحافظ على التحديثات ضمن السياسة (on-policy) وتُقتصر على رموز الإجراء الخاصة بالوكيل لمنع انحراف السياسة.
  • حققت سياسة Qwen3-14B المدربة باستخدام CANOPY المرتبة الأولى في لوحة المتصدرين العامة لـ AppWorld (فبراير 2026) بنتيجة Test-Normal TGC تبلغ 86.9.
  • رفعت المبادئ نفسها أداء Qwen3.5-9B على SWE-bench Verified بمقدار 16.6 نقطة دون الحاجة إلى إشارات ائتمانية مساعدة أو هياكل داعمة معقدة.

يجادل المؤلفون بأن التعزيز الوكيل (agentic RL) وحده يمكنه دمج القدرات طويلة المدى مباشرة داخل النماذج المفتوحة الصغيرة، مع تخطيط نشر مجموعة التدريب الكاملة.