Qwen2 तकनीकी रिपोर्ट Qwen2 श्रृंखला का परिचय देती है, जो 0.5 से 72 अरब पैरामीटर तक के मौलिक और निर्देश-अनुकूलित बड़े भाषा और बहुआयामी मॉडलों का एक नया समूह है। इस रिलीज में घन संरचनाएं और एक मिक्स्चर-ऑफ-एक्सपर्ट्स मॉडल शामिल हैं, जिसमें फ्लैगशिप Qwen2-72B विभिन्न बेंचमार्क पर प्रोप्राइटरी मॉडल्स के मुकाबले प्रतिस्पर्धी प्रदर्शन दिखाता है।

  • बेस Qwen2-72B मॉडल MMLU पर 84.2, GPQA पर 37.9, HumanEval पर 64.6, GSM8K पर 89.5 और BBH पर 82.4 स्कोर हासिल करता है।
  • निर्देश-अनुकूलित Qwen2-72B-Instruct वेरिएंट MT-Bench पर 9.1, Arena-Hard पर 48.1 और LiveCodeBench पर 35.7 प्राप्त करता है।
  • मॉडल्स अंग्रेजी, चीनी, स्पैनिश, फ्रेंच, जर्मन, अरबी, रूसी, कोरियन, जापानी, थाई और वियतनामी सहित लगभग 30 भाषाओं का समर्थन करते हैं।
  • मॉडल वेट्स Hugging Face और ModelScope पर खुले तौर पर उपलब्ध हैं, जबकि अतिरिक्त कोड और डिप्लॉयमेंट संसाधन GitHub पर प्रदान किए गए हैं।

लेखक समुदाय के नवाचार और सुलभता को बढ़ावा देने के लिए इन वेट्स को रिलीज करते हैं, विभिन्न प्रकार के अनुप्रयोगों और शोध प्रयासों को सुगम बनाने के लिए क्वांटीज़ेशन, फाइन-ट्यूनिंग और डिप्लॉयमेंट के लिए संसाधन प्रदान करते हैं।