Исследователи выявили сдвиг релевантной визуальной информации (RVIS) во время декодирования как основную причину отказа существующих методов отсечения визуальных токенов в мультимодальных больших языковых моделях (MLLM). Для решения этой проблемы они предлагают метод Decoding-stage Shift-aware Token Pruning (DSTP), не требующий обучения, который согласовывает визуальные токены с меняющимися требованиями рассуждения.
- DSTP — это надстройка, не требующая обучения, которая корректирует RVIS на этапе декодирования.
- Он значительно снижает деградацию производительности методов отсечения в сложных задачах рассуждения.
- Метод обеспечивает стабильный прирост производительности по различным бенчмаркам визуального понимания.
- DSTP демонстрирует обобщаемость и эффективность с минимальными вычислительными накладными расходами в различных современных архитектурах.
Этот подход позволяет существующим техникам отсечения сохранять надежность при обработке огромного количества визуальных токенов, необходимых для сложного визуального рассуждения.