研究人员在解码过程中发现相关视觉信息偏移(RVIS)是导致现有视觉令牌剪枝方法在多模态大语言模型(MLLM)中失效的主要原因。为解决这一问题,他们提出了无需训练的解码阶段感知偏移令牌剪枝(DSTP),将视觉令牌与变化的推理需求对齐。
- DSTP 是一种无需训练的附加组件,可在解码阶段纠正 RVIS。
- 它显著降低了复杂推理任务中剪枝方法的性能下降。
- 该方法在视觉理解基准测试中带来了持续的性能提升。
- DSTP 在各种最先进的架构中展现出通用性和效率,且计算开销极小。
这种方法使现有的剪枝技术在处理复杂视觉推理所需的海量视觉令牌时能够保持可靠性。