该论文介绍了 CANOPY(Coverage-ANchored On-PolicY RL),这是一种解决小型开放模型长周期强化学习中信号匮乏和策略漂移问题的协议。通过扩展同任务探索并保持更新以 KL 为锚点,该方法使智能体能够仅从任务结束时的验证中有效学习。
- CANOPY 将探索扩展至自然信号重新出现,避免在困难任务上因稀疏奖励导致的沉默。
- 更新保持在策略内,并限制在智能体自身的动作 token 范围内,以防止策略漂移。
- 使用 CANOPY 训练的 Qwen3-14B 策略在 AppWorld 公共排行榜(2026年2月)上以 Test-Normal TGC 86.9 的成绩登顶。
- 相同的原则使 Qwen3.5-9B 在 SWE-bench Verified 上的表现提升了 16.6 分,无需辅助信用信号或复杂的脚手架。
作者认为,仅靠智能体强化学习即可将长周期能力直接内化到小型开放模型中,完整的训练栈计划发布。