研究者らは、GenRecalを発表しました。これは大規模ビジョン・言語モデル(VLM)からより小さく効率的な対応モデルへ知識を転送する汎用蒸留フレームワークです。本手法は、異なるモデルタイプ間で特徴表現を整列・適応させるためのRe-calibratorを使用し、異種VLMアーキテクチャの課題に対処します。

  • GenRecalは、異なるLLM上に構築され、トークンタイプ、語彙サイズ、インデックス順序が異なるVLM間での効果的な知識転送を可能にします。
  • 複数の困難なベンチマークでの広範な実験により、GenRecalがベースラインパフォーマンスを大幅に向上させることが示されました。
  • 蒸留された小規模モデルは最終的に大規模なオープンソースおよびクローズドソースのVLMを上回ります。

このフレームワークは、以前の蒸留方法に内在するアーキテクチャ上の制限を克服することで、リソース制約のあるデバイス上で高性能なビジョン・言語能力を展開することを可能にします。