Исследователи выявили сдвиг релевантной визуальной информации (RVIS) во время декодирования как основную причину отказа существующих методов отсечения визуальных токенов в мультимодальных больших языковых моделях (MLLM). Для решения этой проблемы они предлагают метод Decoding-stage Shift-aware Token Pruning (DSTP), не требующий обучения, который согласовывает визуальные токены с меняющимися требованиями рассуждения.

  • DSTP — это надстройка, не требующая обучения, которая корректирует RVIS на этапе декодирования.
  • Он значительно снижает деградацию производительности методов отсечения в сложных задачах рассуждения.
  • Метод обеспечивает стабильный прирост производительности по различным бенчмаркам визуального понимания.
  • DSTP демонстрирует обобщаемость и эффективность с минимальными вычислительными накладными расходами в различных современных архитектурах.

Этот подход позволяет существующим техникам отсечения сохранять надежность при обработке огромного количества визуальных токенов, необходимых для сложного визуального рассуждения.