研究人员引入了策略内权力蒸馏(OPPD),这是一种通过模仿教师模型的锐化概率分布,使模型在一次生成中输出高质量答案的训练方法。该方法消除了推理过程中对大量候选样本的依赖,同时显著提升了数学和代码基准测试的性能。

  • OPPD 使用序贯蒙特卡洛采样器,其中冻结的教师模型的权力分布权重用于对学生模型生成的候选样本进行最大似然更新。
  • 与相同温度下的未训练基线相比,该方法在 MATH500 上将单次生成准确率提高了多达 23.0 分,在 GSM8K 上提高了 27.3 分。
  • 蒸馏模型的单次生成结果优于使用 64 个候选样本的权力采样方法,恢复了未训练模型中 16 个候选样本所带来的增益的 94%。
  • OPPD 在不使用参考答案的情况下,在 MATH500、GSM8K 和 AIME 上的得分高于使用验证奖励训练的 GRPO;若在 GRPO 之后应用该方法,还可额外提升多达 9.3 分。
  • 该技术将 HumanEval 的准确率提高了多达 5.3 分,并在不同模型家族和尺寸中保持了增益。

该方法使模型能够通过直接参数更新实现通常需要大量采样或额外参考数据才能获得的推理能力提升。