El artículo presenta CANOPY (Coverage-ANchored On-PolicY RL), un protocolo que aborda la escasez de señales y la deriva de políticas en el aprendizaje por refuerzo a largo plazo para modelos abiertos pequeños. Al escalar la exploración de la misma tarea y mantener las actualizaciones ancladas mediante KL, el método permite que los agentes aprendan eficazmente únicamente a partir de la verificación al final de la tarea.
- CANOPY escala la exploración hasta que reaparece la señal natural, evitando el silencio de las recompensas dispersas en tareas difíciles.
- Las actualizaciones se mantienen dentro de la política y se limitan a los tokens de acción del agente para prevenir la deriva de la política.
- Una política Qwen3-14B entrenada con CANOPY encabezó el tablero de clasificación público de AppWorld (feb. 2026) con un TGC de prueba normalizado de 86,9.
- Los mismos principios elevaron a Qwen3.5-9B en SWE-bench Verified en 16,6 puntos sin señales de crédito auxiliares ni andamiaje elaborado.
Los autores argumentan que el RL agéntico por sí solo puede internalizar la capacidad a largo plazo directamente en modelos abiertos pequeños, con la pila completa de entrenamiento planificada para su lanzamiento.