研究者らは、教師モデルのシャープ化された確率分布を模倣することで、言語モデルが単一パスで高品質な回答を生成するように訓練する方法であるオンポリシー・パワー蒸留(OPPD)を紹介する。このアプローチは、推論時に広範な候補サンプリングの必要性を排除しつつ、推論タスクのパフォーマンスを大幅に向上させる。

  • OPPDは、凍結された教師のパワー分布が訓練中のモデルによって生成された候補に重みを付ける逐次モンテカルロ・サンプラーを使用する。
  • この手法は、同じ温度における未訓練モデルと比較して、MATH500で最大23.0ポイント、GSM8Kで27.3ポイントの単一生成精度を向上させる。
  • 蒸留モデルからの単一生成は、64個の候補を用いた公開済みのパワーサンプリングを上回り、未訓練モデルにおける16個の候補がもたらす利益の94パーセントを回復する。
  • OPPDは参照回答を使用せずにMATH500、GSM8K、AIMEでGRPOより高いスコアを獲得し、GRPO適用後に最大9.3ポイントを追加できる。
  • この手法はHumanEvalの精度を最大5.3ポイント向上させ、異なるモデルファミリーやサイズ全体で機能する。

OPPDは、モデルのアーキテクチャを変更したり探索ベースの推論を必要としたりすることなく、推論能力を向上させるためのパラメータ効率的な方法を提供する。