L'article présente CANOPY (Coverage-ANchored On-PolicY RL), un protocole qui traite la famine de signaux et la dérive de politique dans l'apprentissage par renforcement à long terme pour les petits modèles ouverts. En amplifiant l'exploration sur la même tâche et en maintenant les mises à jour ancrées par KL, la méthode permet aux agents d'apprendre efficacement uniquement grâce à la vérification en fin de tâche.
- CANOPY amplifie l'exploration jusqu'à ce que le signal naturel réapparaisse, évitant le silence des récompenses rares sur les tâches difficiles.
- Les mises à jour sont maintenues on-policy et limitées aux jetons d'action de l'agent pour prévenir la dérive de politique.
- Une politique Qwen3-14B entraînée avec CANOPY a dominé le classement public AppWorld (fév. 2026) avec un TGC Test-Normal de 86,9.
- Les mêmes principes ont amélioré Qwen3.5-9B sur SWE-bench Verified de 16,6 points sans signaux de crédit auxiliaires ni échafaudage élaboré.
Les auteurs soutiennent que le RL agentic seul peut intégrer directement la capacité à long terme dans les petits modèles ouverts, avec la pile d'entraînement complète prévue pour publication.