Los investigadores identificaron el Desplazamiento de Información Visual Relevante (RVIS) durante la decodificación como la causa principal del fallo de los métodos existentes de poda de tokens visuales en Modelos de Lenguaje Grande Multimodales (MLLM). Para abordar esto, proponen la Poda de Tokens Consciente del Desplazamiento en la Etapa de Decodificación (DSTP), un marco sin entrenamiento que alinea los tokens visuales con los requisitos cambiantes del razonamiento.
- DSTP es una extensión sin entrenamiento que corrige el RVIS durante la etapa de decodificación.
- Reduce significativamente la degradación del rendimiento de los métodos de poda en tareas de razonamiento complejo.
- El método produce ganancias de rendimiento consistentes en benchmarks de comprensión visual.
- DSTP demuestra generalización y eficiencia con una sobrecarga computacional mínima en diversas arquitecturas de última generación.
Este enfoque permite que las técnicas de poda existentes mantengan la fiabilidad al manejar la gran cantidad de tokens visuales requeridos para el razonamiento visual complejo.