Les chercheurs ont identifié le Décalage de l'Information Visuelle Pertinente (RVIS) pendant le décodage comme la cause principale de l'échec des méthodes existantes d'élagage des tokens visuels dans les Modèles de Langage Large Multimodaux (MLLM). Pour remédier à cela, ils proposent l'Élagage de Tokens Aware du Décalage au Stade de Décodage (DSTP), un cadre sans entraînement qui aligne les tokens visuels avec les exigences de raisonnement changeantes.
- DSTP est un module complémentaire sans entraînement qui corrige le RVIS pendant l'étape de décodage.
- Il réduit significativement la dégradation des performances des méthodes d'élagage dans les tâches de raisonnement complexe.
- La méthode offre des gains de performance cohérents sur les benchmarks de compréhension visuelle.
- DSTP démontre une généralisabilité et une efficacité avec une surcharge computationnelle minimale sur diverses architectures de pointe.
Cette approche permet aux techniques d'élagage existantes de maintenir leur fiabilité lors du traitement du vaste nombre de tokens visuels requis pour le raisonnement visuel complexe.