研究人员提出了策略内权力蒸馏(OPPD),这是一种通过模仿教师模型锐化后的概率分布,训练语言模型在一次生成中输出高质量答案的方法。该方法消除了推理过程中对大量候选样本采样的需求,同时显著提升了推理任务的性能。
- OPPD 使用序贯蒙特卡洛采样器,其中冻结的教师模型的权力分布权重用于加权由被训练模型生成的候选项。
- 与相同温度下未经训练的模型相比,该方法将单次生成的准确率在 MATH500 上提高了多达 23.0 分,在 GSM8K 上提高了 27.3 分。
- 蒸馏模型的单次生成结果优于使用 64 个候选项的已发表权力采样方法,并恢复了未训练模型中 16 个候选项所带来的增益的 94%。
- OPPD 在不使用参考答案的情况下,在 MATH500、GSM8K 和 AIME 上的得分高于 GRPO,并且在应用于 GRPO 之后最多可增加 9.3 分。
- 该技术还将 HumanEval 的准确率提高了多达 5.3 分,并且适用于不同的模型家族和规模。
OPPD 提供了一种参数高效的方式来提升推理能力,而无需更改模型的架构或依赖基于搜索的推理。