Peneliti mengidentifikasi Pergeseran Informasi Visual Relevan (RVIS) selama dekoding sebagai penyebab utama kegagalan metode pemangkasan token visual yang ada pada Model Bahasa Besar Multimodal (MLLM). Untuk mengatasi hal ini, mereka mengusulkan Pemangkasan Token Sadar Pergeseran Tahap Dekoding (DSTP), sebuah kerangka kerja tanpa pelatihan yang menyelaraskan token visual dengan persyaratan penalaran yang berubah.
- DSTP adalah tambahan tanpa pelatihan yang memperbaiki RVIS selama tahap dekoding.
- Ini secara signifikan mengurangi degradasi kinerja metode pemangkasan dalam tugas penalaran kompleks.
- Metode ini menghasilkan peningkatan kinerja yang konsisten di berbagai benchmark pemahaman visual.
- DSTP menunjukkan generalisasi dan efisiensi dengan overhead komputasi minimal di berbagai arsitektur mutakhir.
Pendekatan ini memungkinkan teknik pemangkasan yang ada untuk mempertahankan keandalan saat menangani jumlah token visual yang sangat besar yang diperlukan untuk penalaran visual yang kompleks.