शोधकर्ताओं ने डिकोडिंग के दौरान प्रासंगिक दृश्य जानकारी शिफ्ट (RVIS) को बहुआयामी बड़े भाषा मॉडलों (MLLMs) में मौजूदा दृश्य टोकन प्रूनिंग विधियों की विफलता का मुख्य कारण पहचाना। इसका समाधान करने के लिए, वे डिकोडिंग-स्टेज शिफ्ट-अवेयर टोकन प्रूनिंग (DSTP) का प्रस्ताव करते हैं, जो एक ट्रेनिंग-फ्री फ्रेमवर्क है जो दृश्य टोकनों को बदलते तर्क आवश्यकताओं के साथ संरेखित करता है।
- DSTP एक ट्रेनिंग-फ्री एड-ऑन है जो डिकोडिंग चरण के दौरान RVIS को ठीक करता है।
- यह जटिल तर्क कार्यों में प्रूनिंग विधियों के प्रदर्शन में गिरावट को काफी कम करता है।
- विधि दृश्य समझ बेंचमार्क्स पर स्थिर प्रदर्शन लाभ देती है।
- DSTP विविध अत्याधुनिक आर्किटेक्चर में न्यूनतम कंप्यूटेशनल ओवरहेड के साथ सामान्यीकरण और दक्षता को प्रदर्शित करता है।
यह दृष्टिकोण मौजूदा प्रूनिंग तकनीकों को जटिल दृश्य तर्क के लिए आवश्यक दृश्य टोकनों की विशाल संख्या को संभालते समय विश्वसनीयता बनाए रखने की अनुमति देता है।