Qwen टीम ने Qwen2 तकनीकी रिपोर्ट जारी की है, जिसमें 0.5 से 72 अरब पैरामीटर तक के नए बड़े भाषा मॉडलों (LLM) की एक नई श्रृंखला का परिचय दिया गया है, जिसमें डेंस और मिक्स्चर-ऑफ-एक्सपर्ट्स (MoE) दोनों आर्किटेक्चर शामिल हैं।

  • फ्लैगशिप Qwen2-72B बेस मॉडल ने MMLU पर 84.2, GSM8K पर 89.5 और HumanEval पर 64.6 स्कोर हासिल किए हैं।
  • इंस्ट्रक्शन-ट्यून्ड Qwen2-72B-Instruct वेरिएंट ने MT-Bench पर 9.1 और LiveCodeBench पर 35.7 की रेंच हासिल की है।
  • मॉडल को 7 ट्रिलियन से अधिक टोकन पर प्रशिक्षित किया गया है और यह लगभग 30 भाषाओं का समर्थन करता है।
  • वजन Hugging Face और ModelScope पर सामुदायिक उपयोग के लिए खुले तौर पर उपलब्ध हैं।

इस रिलीज का उद्देश्य ऐसे उच्च-प्रदर्शन वाले आधारभूत मॉडल प्रदान करना है जो प्राइवेट सिस्टम के साथ प्रतिस्पर्धा कर सकें, लेकिन शोध और तैनाती के लिए सुलभ भी रहें।