Qwen2.5 तकनीकी रिपोर्ट में ओपन-वेट घने विकल्पों और स्वामित्व वाले मिक्स्चर-ऑफ-एक्सपर्ट्स (MoE) मॉडल सहित बड़ी भाषा मॉडल की एक व्यापक श्रृंखला के प्रकाशन का विवरण दिया गया है। अपडेट में प्री-ट्रेनिंग डेटा को 7 ट्रिलियन से 18 ट्रिलियन टोकन तक महत्वपूर्ण रूप से बढ़ाया गया है और सुपरवाइज्ड फाइनट्यूनिंग व रीइंफोर्समेंट लर्निंग के माध्यम से पोस्ट-ट्रेनिंग के लिए 1 मिलियन से अधिक नमूनों का उपयोग किया गया है।
- ओपन-वेट घने मॉडल 0.5B, 1.5B, 3B, 7B, 14B, 32B और 72B पैरामीटर के आकारों में उपलब्ध हैं।
- स्वामित्व वाले MoE मॉडल Qwen2.5-Turbo और Qwen2.5-Plus Alibaba Cloud Model Studio के माध्यम से उपलब्ध हैं।
- फ्लैगशिप Qwen2.5-72B-Instruct पांच गुना छोटा होने के बावजूद Llama-3-405B-Instruct के समान प्रदर्शन दिखाता है।
- संदर्भ लंबाई समर्थन 2K से 8K टोकन तक बढ़ गया है, जबकि Qwen2.5-Turbo 1 मिलियन टोकन तक का समर्थन करता है।
इन सुधारों का उद्देश्य तर्क, कोडिंग और गणित बेंचमार्क्स पर शीर्ष स्तर के प्रदर्शन को बनाए रखते हुए विविध उपयोग मामलों के लिए लागत-प्रभावी समाधान प्रदान करना है।