研究者は、顕著な推論接頭辞をマスクすることで、コンパクトな視覚言語モデルの視覚証拠の利用能力を向上させる新しい思考-回答蒸留フレームワークを提案しました。このアプローチは、長い思考-回答トレースで一般的に見られる「視覚的忘却」の問題に対処します。これは、学生が拡張された推論中に視覚的な手がかりへの焦点を失う現象です。

この手法は、トークンごとの顕著な推論接頭辞のマスキングを使用して高影響のテキスト手がかりを選択的にブロックし、蒸留の難易度に応じてスケールする自己ペースのマスキング予算スケジュール戦略を採用しています。トレーニング中、これらのマスクは標準的な因果マスクに置き換えられ、学生モデルが次のトークン予測のために視覚情報により強く依存するように強制します。

実験結果は、このアプローチが多モーダル推論ベンチマークにおいて最近のオープンソース VLM、VLM 蒸留、自己蒸留手法を上回ることを示しており、分析により思考プロセス全体を通じて視覚利用が強化されていることが確認されました。