해당 논문은 CANOPY(Coverage-ANchored On-PolicY RL)라는 프로토콜을 소개하며, 이는 작은 오픈 모델의 장기적 강화 학습에서 신호 기아와 정책 드리프트 문제를 해결합니다. 동일한 작업에 대한 탐색을 확장하고 업데이트를 KL-anchored로 유지함으로써 이 방법은 에이전트가 작업 종료 시 검증 정보만으로 효과적으로 학습할 수 있게 합니다.

  • CANOPY는 자연스러운 신호가 다시 나타날 때까지 탐색을 확장하여, 어려운 작업에서 희박한 보상으로 인한 침묵을 피합니다.
  • 업데이트는 on-policy 상태로 유지되며 정책 드리프트를 방지하기 위해 에이전트의 자체 행동 토큰으로 제한됩니다.
  • CANOPY로 훈련된 Qwen3-14B 정책은 AppWorld 공개 리더보드(2026년 2월)에서 Test-Normal TGC 86.9의 점수로 1위를 차지했습니다.
  • 동일한 원리가 보조 크레딧 신호나 복잡한 구조 없이도 SWE-bench Verified에서 Qwen3.5-9B를 16.6점 향상시켰습니다.

저자들은 에이전트 RL만으로 장기적 능력을 작은 오픈 모델에 직접 내재화할 수 있다고 주장하며, 전체 학습 스택의 공개를 계획하고 있습니다.