研究者らは、マルチモーダル大規模言語モデル(MLLM)における既存の視覚トークンプルーニング手法の失敗の主な原因として、デコーディング中の関連視覚情報シフト(RVIS)を特定しました。これに対処するため、彼らはトレーニング不要のフレームワークであるDecoding-stage Shift-aware Token Pruning(DSTP)を提案し、視覚トークンを変化していく推論要件と整合させます。
- DSTPはデコーディング段階でRVISを補正するトレーニング不要のアドオンです。
- 複雑な推論タスクにおけるプルーニング手法のパフォーマンス低下を大幅に軽減します。
- この手法は視覚理解ベンチマークで一貫したパフォーマンス向上をもたらします。
- DSTPは、多様な最先端アーキテクチャにおいて、最小限の計算オーバーヘッドで汎用性と効率性を示しています。
このアプローチにより、既存のプルーニング技術は複雑な視覚推論に必要な膨大な数の視覚トークンを処理する際に信頼性を維持できます。