研究者たちは、標準的なオンポリシー蒸留におけるプレフィックス失敗、つまり生徒のエラーが信頼できない教師信号をもたらす問題を解決するために、Relay On-Policy Distillation (Relay-OPD) を導入した。この手法は、教師と生徒の継続における非対称性をトリガーとして使用し、生徒が再開する前に教師が一時的に介入して軌跡を再方向付ける。
- 8つの数学的推論ベンチマークにおいて、Qwen3-4B-Instruct-2507教師とQwen3-0.6B/1.7B-Non-Thinking生徒を利用する。
- すべてのベンチマークで最良または準最良の結果を達成し、1.7Bモデルにおいて標準OPDと比較して平均+5.73%、FastOPDと比較して平均+1.49%の上昇を実現。
- 0.6Bスケールでも一貫した改善が見られ、トレーニング軌跡の長さは50%以上短縮された。
このアプローチは、限られたリレー予算を通じて重要な初期位置に介入を集中させ、生徒の方針からの逸脱を制限しつつ、効率性と精度を大幅に向上させる。