研究者らは、エッジデプロイメントに適したコンパクトなバージョンに大規模ビジョン言語モデルを蒸留するためのマスクプログレッシブ強化学習フレームワークであるMastersを提案する。この手法は、教師と学生のモデル間のサイズギャップによって引き起こされる不安定性に対処する。

  • Mastersは教師の非支配的な重みをマスクして複雑さを軽減し、その後トレーニング中に容量を段階的に回復させてより滑らかな学習を可能にする。
  • マスクされた教師から事前に生成された応答を使用してオフラインRLステージを組み込み、オンラインの思考-回答パラダイムの計算コストを回避する。
  • このフレームワークは2つの補完的な報酬を採用している:応答の正しさを 위한精度報酬と、転移の容易さを定量化する蒸留報酬。

このアプローチにより、学生は長い応答生成プロセスを必要とせずに、豊かかつ効率的なガイダンスを活用して強力なパフォーマンスを達成できる。