O artigo apresenta o CANOPY (Coverage-ANchored On-PolicY RL), um protocolo que aborda a escassez de sinal e o desvio de política no aprendizado por reforço de longo prazo para modelos abertos pequenos. Ao ampliar a exploração na mesma tarefa e manter as atualizações ancoradas em KL, o método permite que os agentes aprendam eficazmente apenas com a verificação ao final da tarefa.

  • O CANOPY amplia a exploração até que o sinal natural reapareça, evitando o silêncio das recompensas esparsas em tarefas difíceis.
  • As atualizações são mantidas on-policy e confinadas aos tokens de ação do próprio agente para evitar o desvio de política.
  • Uma política Qwen3-14B treinada com CANOPY liderou o ranking público do AppWorld (fev. 2026) com um TGC Test-Normal de 86,9.
  • Os mesmos princípios elevaram o Qwen3.5-9B no SWE-bench Verified em 16,6 pontos, sem sinais de crédito auxiliares ou andaimes elaborados.

Os autores argumentam que o RL agêntico por si só pode internalizar capacidades de longo prazo diretamente em modelos abertos pequenos, com a pilha completa de treinamento planejada para lançamento.