यह पेपर CANOPY (Coverage-ANchored On-PolicY RL) को पेश करता है, एक प्रोटोकॉल जो छोटे खुले मॉडल्स के लिए लंबे समय तक चलने वाले रीइंफोर्समेंट लर्निंग में सिग्नल की कमी और पॉलिसी ड्रिफ्ट से निपटता है। समान-कार्य अन्वेषण को बढ़ावा देकर और अपडेट्स को KL-अंकित रखकर, यह विधि एजेंटों को केवल कार्य के अंत की सत्यापन से प्रभावी ढंग से सीखने की अनुमति देती है।
- CANOPY प्राकृतिक सिग्नल के वापस आने तक अन्वेषण को बढ़ाता है, कठिन कार्यों पर दुर्लभ पुरस्कारों की खामोशी से बचता है।
- अपडेट्स को on-policy रखा जाता है और एजेंट के अपने एक्शन टोकन तक सीमित किया जाता है ताकि पॉलिसी ड्रिफ्ट रोका जा सके।
- CANOPY के साथ प्रशिक्षित एक Qwen3-14B पॉलिसी ने AppWorld पब्लिक लीडरबोर्ड (फ़रवरी 2026) में Test-Normal TGC 86.9 के साथ शीर्ष स्थान हासिल किया।
- समान सिद्धांतों ने Qwen3.5-9B को SWE-bench Verified पर बिना किसी सहायक क्रेडिट सिग्नल या जटिल ढांचे के 16.6 अंक तक बढ़ाया।
लेखकों का तर्क है कि एजेंटिक RL अकेला लंबे समय तक चलने वाली क्षमता को सीधे छोटे खुले मॉडल्स में आंतरिक कर सकता है, और पूर्ण प्रशिक्षण स्टैक को जारी करने की योजना बनाई गई है।