أطلق فريق Qwen سلسلة Qwen2، متطوراً من Qwen1.5 بخمسة أحجام نماذج جديدة: Qwen2-0.5B، وQwen2-1.5B، وQwen2-7B، وQwen2-57B-A14B، وQwen2-72B. هذه النماذج متاحة الآن على Hugging Face وModelScope.

  • تستخدم جميع أحجام النماذج آلية Group Query Attention (GQA) لتسريع الاستدلال وتقليل استهلاك الذاكرة.
  • تشمل بيانات التدريب 27 لغة إضافية بجانب الإنجليزية والصينية لتحسين القدرات متعددة اللغات.
  • تدعم Qwen2-7B-Instruct وQwen2-72B-Instruct أطوال سياق ممتدة تصل إلى 128K رمز باستخدام YARN.
  • يُظهر نموذج Qwen2-72B أداءً متفوقاً مقارنة بـ Llama-3-70B وسلفه Qwen1.5-110B على الرغم من امتلاكه لمعاملات أقل.
  • تم إحداث تحسينات كبيرة في البرمجة والرياضيات ومواءمة السلامة من خلال استراتيجيات ما بعد التدريب الآلية.

يهدف الإصدار إلى توفير نماذج مفتوحة المصدر بأداء متقدم عبر مهام فهم اللغة الطبيعية والاستدلال والمهام متعددة اللغات مع الحفاظ على معايير سلامة قوية.