В статье представлен CANOPY (Coverage-ANchored On-PolicY RL) — протокол, решающий проблему недостатка сигналов и смещения политики в долгосрочном обучении с подкреплением для небольших открытых моделей. За счёт масштабирования исследования в рамках одной задачи и удержания обновлений, привязанных к KL-дивергенции, метод позволяет агентам эффективно учиться исключительно на основе проверки завершения задачи.

  • CANOPY масштабирует исследование до появления естественных сигналов, избегая тишины от разреженных наград на сложных задачах.
  • Обновления остаются в рамках on-policy и ограничиваются токенами действий самого агента для предотвращения смещения политики.
  • Политика Qwen3-14B, обученная с помощью CANOPY, заняла первое место в публичном рейтинге AppWorld (февраль 2026 г.) с показателем Test-Normal TGC 86.9.
  • Те же принципы позволили улучшить результаты Qwen3.5-9B на SWE-bench Verified на 16.6 балла без вспомогательных сигналов кредита или сложной инфраструктуры.

Авторы утверждают, что агентное обучение с подкреплением способно напрямую интернализировать долгосрочные возможности в небольших открытых моделях; полный стек обучения планируется выпустить.