研究者らは、教師モデルのシャープ化された確率分布を模倣することで、1回のパスで高品質な回答を生成するようモデルを訓練する方法であるオンポリシー・パワー蒸留(OPPD)を紹介した。このアプローチは、推論時の広範な候補サンプリングの必要性を排除しつつ、数学およびコーディングベンチマークでのパフォーマンスを大幅に向上させる。
- OPPDは逐次モンテカルロサンプラーを使用し、凍結された教師のパワー分布が、最尤更新のために学生モデルによって生成された候補に重みを付ける。
- この手法は、同じ温度における未訓練のベースラインと比較して、MATH500で最大23.0ポイント、GSM8Kで27.3ポイント単一生成の精度を向上させる。
- 蒸留モデルからの単一生成は、64個の候補によるパワーサンプリングを上回り、未訓練モデルにおける16個の候補がもたらす利益の94パーセントを回復する。
- OPPDは参照回答を使用せずに、検証済み報酬で訓練されたGRPOよりもMATH500、GSM8K、AIMEで高いスコアを獲得し、GRPO適用後に最大9.3ポイントを追加できる。
- この手法はHumanEvalの精度を最大5.3ポイント向上させ、異なるモデルファミリーおよびサイズ全体で利益を維持する。
この手法により、モデルは重厚なサンプリングや追加の参照データを必要とする典型的な推論改善を、直接のパラメータ更新を通じて達成できる。