研究人员提出无监督在线策略自蒸馏(U-OPSD),该方法仅利用模型自身的生成结果,无需外部监督即可实现大语言模型的训练后性能提升。该方法通过采样多个 rollout 构建伪解(基于多数投票),然后将教师分布蒸馏到模型最长错误完成序列的前缀中。
- 在 AIME24、MATH500 和 AMC23 等基准测试上,U-OPSD 使 Qwen3 非思维模式下的 4B 和 8B 规模基础模型分别提升了 8.5% 和 10.7%。
- 在非思维模式下,其性能平均优于 OPSD 等监督方法 3.2% 和 2.3%。
- 在思维模式下,U-OPSD 的性能与 OPSD 和 GRPO 持平或更优,在 8B 规模下较后者最高提升 1.1%。
该方法证明,通过内部一致性可以实现真正的自蒸馏,为监督训练信号提供了一种有竞争力的替代方案。