Qwen टीम ने Qwen1.5 से विकसित होकर पांच नए मॉडल आकारों के साथ Qwen2 सीरीज़ को रिलीज़ किया है: Qwen2-0.5B, Qwen2-1.5B, Qwen2-7B, Qwen2-57B-A14B और Qwen2-72B। ये मॉडल अब Hugging Face और ModelScope पर उपलब्ध हैं।

  • तेज़ इनफरेंस और कम मेमोरी उपयोग के लिए सभी मॉडल आकार Group Query Attention (GQA) का उपयोग करते हैं।
  • बहुभाषी क्षमताओं को बेहतर बनाने के लिए प्रशिक्षण डेटा में अंग्रेजी और चीनी के अलावा 27 अतिरिक्त भाषाएं शामिल हैं।
  • YARN का उपयोग करके Qwen2-7B-Instruct और Qwen2-72B-Instruct 128K टोकन तक बढ़े हुए संदर्भ लंबाई का समर्थन करते हैं।
  • कम पैरामीटर होने के बावजूद, Qwen2-72B मॉडल Llama-3-70B और अपने पूर्ववर्ती Qwen1.5-110B की तुलना में श्रेष्ठ प्रदर्शन दिखाता है।
  • स्वचालित पोस्ट-ट्रेनिंग रणनीतियों के माध्यम से कोडिंग, गणित और सुरक्षा एलाइनमेंट में महत्वपूर्ण सुधार किए गए हैं।

इस रिलीज़ का उद्देश्य प्राकृतिक भाषा समझ, तर्कशास्त्र और बहुभाषी कार्यों में शीर्ष प्रदर्शन के साथ ओपन-सोर्स मॉडल प्रदान करना है, जबकि मजबूत सुरक्षा मानकों को बनाए रखना है।