研究者らは、知識蒸留における脆弱性や強化学習におけるドリフトに対処するため、教師の知識をポリシー勾配ではなくプロンプトに注入する方法であるZone of Proximal Policy Optimization (ZPPO) を導入した。ZPPOは、難しい問題に対してBinary Candidate-included Questions (BCQ) とNegative Candidate-included Questions (NCQ) を構築し、学生の精度が向上するか、除外されるまでリプレイバッファを介してそれらを再循環させる。

  • ZPPOは、BCQにおいて1つの正しい教師の応答と誤った学生の応答をペアにして識別を強制し、NCQでは学生の失敗を集約して共通のエラーモードを浮上させる。
  • この方法は、27Bの教師モデルを使用して、0.8Bから9BまでのスケールでQwen3.5ファミリーでテストされた。
  • 評価には、16のVLM、10のLLM、5つのVideoタスクを含む31ベンチマークスイートが含まれていた。
  • ZPPOはオフ/オンポリシー蒸留やGRPOを上回り、最も大きな改善が最小モデルスケールで観察された。

教師をポリシー勾配ではなくプロンプト内に保持することで、ZPPOはオンポリシーの仮定を壊すことなく、学生の現在の近接発達領域内での学習を増幅する。