अलाबा ग्रुप में Qwen टीम ने अपनी विजन-लैंग्वेज श्रृंखला के नवीनतम फ्लैगशिप मॉडल Qwen2.5-VL का विवरण देने वाली एक तकनीकी रिपोर्ट प्रकाशित की है। रिपोर्ट में दृश्य पहचान, वस्तु स्थानीयकरण, दस्तावेज़ पार्सिंग और लंबे वीडियो समझ में महत्वपूर्ण उन्नयन का वर्णन किया गया है।
- मॉडल विभिन्न आकार की छवियों और सेकंड-स्तर की घटना स्थानीयकरण के साथ घंटों तक के वीडियो को संभालने के लिए गतिशील रिज़ॉल्यूशन प्रोसेसिंग और निरंतर समय एन्कोडिंग पेश करता है।
- विंडो एटेंशन के साथ एक नेटिव डायनामिक-रिज़ॉल्यूशन विजन ट्रान्सफॉर्मर (ViT) नेटिव रिज़ॉल्यूशन बनाए रखते हुए कंप्यूटेशनल ओवरहेड को कम करता है।
- प्री-ट्रेनिंग कॉर्पस को 1.2 ट्रिलियन टोकन से बढ़ाकर 4.1 ट्रिलियन टोकन किया गया, जिससे कार्य-विशिष्ट फाइन-ट्यूनिंग के बिना विभिन्न डोमेन में प्रदर्शन में सुधार हुआ।
- फ्लैगशिप Qwen2.5-VL-72B मॉडल GPT-4o और Claude 3.5 Sonnet जैसे राज्य-कला के मॉडलों के बराबर है, जबकि छोटे 7B और 3B वेरिएंट संसाधन-सीमित वातावरण में प्रतिस्पर्धियों को पछाड़ते हैं।
रिपोर्ट इस बात पर जोर देती है कि मॉडल कंप्यूटर और मोबाइल उपकरणों पर तर्क और कार्य निष्पादन के लिए एक इंटरैक्टिव विजन एजेंट के रूप में काम कर सकता है।