研究人员引入中继在策略蒸馏(Relay-OPD)以解决标准在策略蒸馏中的前缀失败问题,其中学生错误会导致监督不可靠。该方法利用教师-学生延续非对称性作为触发器,使教师短暂接管并重新引导轨迹,随后学生继续。
- 在八个数学推理基准上,使用 Qwen3-4B-Instruct-2507 教师与 Qwen3-0.6B/1.7B-Non-Thinking 学生。
- 在每个基准上取得最佳或次佳结果,对于 1.7B 模型,平均优于标准 OPD +5.73% 和 FastOPD +1.49%。
- 在 0.6B 规模观察到一致的增益,同时训练轨迹长度减少超过 50%。
该方法通过有限的中继预算将干预集中在关键的早期位置,在显著提高效率与准确性的同时,限制偏离学生策略。