يُفصّل التقرير التقني لـ Qwen2.5 إصدار سلسلة شاملة من نماذج اللغة الكبيرة التي تجمع بين المتغيرات الكثيفة مفتوحة الوزن والنماذج الخاصة من نوع مزيج الخبراء (MoE). يؤدي التحديث إلى توسيع نطاق بيانات التدريب المسبق بشكل كبير من 7 تريليون إلى 18 تريليون رمز، ويستخدم أكثر من مليون عينة للتدريب اللاحق عبر الضبط الدقيق الخاضع للإشراف والتعلم التعزيزي.
- النماذج الكثيفة مفتوحة الوزن متاحة بأحجام تتراوح بين 0.5B و1.5B و3B و7B و14B و32B و72B معلمة.
- النماذج الخاصة من نوع MoE وهي Qwen2.5-Turbo وQwen2.5-Plus متاحة عبر منصة Alibaba Cloud Model Studio.
- يتفوق النموذج الرئيسي Qwen2.5-72B-Instruct في الأداء على Llama-3-405B-Instruct رغم كونه أصغر بحجم خمسة أضعاف.
- يزداد دعم طول السياق من 2K إلى 8K رمز، مع دعم Qwen2.5-Turbo لما يصل إلى مليون رمز.
تهدف هذه التحسينات إلى تقديم حلول فعالة من حيث التكلفة لمختلف حالات الاستخدام مع الحفاظ على الأداء الرفيع في معايير الاستدلال والبرمجة والرياضيات.