Pesquisadores identificaram o Deslocamento de Informação Visual Relevante (RVIS) durante a decodificação como a causa principal da falha dos métodos existentes de poda de tokens visuais em Modelos de Linguagem Grande Multimodais (MLLMs). Para abordar isso, eles propõem a Poda de Tokens Consciente do Deslocamento na Fase de Decodificação (DSTP), um framework sem treinamento que alinha os tokens visuais com os requisitos de raciocínio em mudança.
- DSTP é um complemento sem treinamento que corrige o RVIS durante a fase de decodificação.
- Ele reduz significativamente a degradação de desempenho dos métodos de poda em tarefas de raciocínio complexo.
- O método produz ganhos de desempenho consistentes em benchmarks de compreensão visual.
- DSTP demonstra generalização e eficiência com sobrecarga computacional mínima em diversas arquiteturas de última geração.
Esta abordagem permite que técnicas de poda existentes mantenham a confiabilidade ao lidar com o vasto número de tokens visuais necessários para o raciocínio visual complexo.