अलिबाबा का Qwen टीम पिछली विजन-भाषा मॉडल्स में अपग्रेड, Qwen2-VL श्रृंखला पेश करता है जो स्थिर रिज़ॉल्यूशन प्रोसेसिंग को Naive Dynamic Resolution तंत्र से बदलता है। इससे मॉडल इनपुट रिज़ॉल्यूशन के आधार पर दृश्य टोकन को गतिशील रूप से समायोजित कर सकता है, विवरण कैप्चर में सुधार करता है और मानव संवेदन प्रक्रियाओं के साथ संरेखित होता है।
- श्रृंखला में 2B, 8B और 72B पैरामीटर वाले ओपन-वेट मॉडल शामिल हैं।
- बहुआयामी रोटेशनल पोजिशन एम्बेडिंग (M-RoPE) का एकीकरण पाठ, छवियों और वीडियो के बीच स्थानीय जानकारी को जोड़ता है।
- Qwen2-VL-72B ने मल्टीमोडल बेंचमार्क्स पर GPT-4o और Claude 3.5 Sonnet के तुलनीय प्रदर्शन प्राप्त किया है।
- आर्किटेक्चर लंबे समय तक चलने वाले वीडियो समझ और बहुभाषी छवि पाठ समझ का समर्थन करता है।
मॉडल्स जटिल तर्क कार्यों के लिए कुशल दृश्य निरूपण प्रदान करने का उद्देश्य रखते हैं, जबकि विभिन्न स्तरों पर प्रतिस्पर्धी प्रदर्शन बनाए रखते हैं।