本論文は、CANOPY(Coverage-ANchored On-PolicY RL)を紹介する。これは、小規模なオープンモデルの長期強化学習における信号不足とポリシードリフトに対処するプロトコルである。同じタスク内の探索をスケーリングし、更新をKL基準で固定することで、この手法はエージェントがタスク終了時の検証のみから効果的に学習できるようにする。

  • CANOPYは自然な信号が再び現れるまで探索をスケーリングし、困難なタスクにおけるスパース報酬の沈黙を回避する。
  • 更新はオンポリシーで保たれ、ポリシードリフトを防ぐためにエージェント自身のアクショントークンに限定される。
  • CANOPYで訓練されたQwen3-14Bポリシーは、AppWorldのパブリックリーダーボード(2026年2月)でTest-Normal TGC 86.9の最高スコアを記録した。
  • 同じ原則が、補助的なクレジット信号や複雑な足場なしに、SWE-bench VerifiedにおけるQwen3.5-9Bのパフォーマンスを16.6ポイント向上させた。

著者らは、エージェント型RLのみが、完全なトレーニングスタックの公開予定とともに、長期能力を小規模なオープンモデルに直接内部化できると主張している。