Hugging Face फोरम पर एक स्नातक छात्र VAPO पेपर से अवधारणाओं को Qwen 2.5 Omni 3B मॉडल पर लागू करने के बारे में चर्चा कर रहा है ताकि स्लाइड संदर्भ के साथ ऑडियो ट्रांसक्रिप्शन के दौरान हॉल्युसिनेशन समस्याओं का समाधान किया जा सके।

  • VAPO पेपर की पहचान करता है कि ओमनिमोडल बड़े भाषा मॉडल में विभिन्न टोकन प्रकारों को फ्लैट करना और संयोजित करना दृश्य हस्तक्षेप का कारण बनता है, जिससे ट्रांसक्रिप्शन में काल्पनिक पाठ उत्पन्न होता है।
  • VAPO एक 'समय से अलग की गई नीति' के साथ पुनर्बल सीखने के परिदृश्य का उपयोग करके इसे हल करता है जो दृश्य प्राथमिकता निष्कर्षण को ट्रांसक्रिप्शन से अलग करता है।
  • छात्र पूछता है कि Qwen 2.5 Omni 3B में वास्तुकला संशोधन, जैसे thinker ब्लॉक से पहले एम्बेडिंग्स को कैप्चर करना या स्वयं thinker ब्लॉक को बदलना, क्या दृश्य टोकन को ऑडियो टोकन में हस्तक्षेप करने से रोक सकते हैं।

पोस्ट मौजूदा Qwen वास्तुकला के भीतर इन अलग-थलग करने की रणनीतियों को लागू करने पर तकनीकी मार्गदर्शन की तलाश कर रहा है।