أطلق فريق Qwen التابع لشركة علي بابا نموذج Qwen3.8-Flash-Next، وهو نموذج متعدد الوسائط مفتوح الأوزان من نوع Mixture-of-Experts مصمم لعرض الطراز المعماري لسلسلة Qwen4 القادمة. يجمع هذا الملف المحفوظ بين هيكل أساسي بحجم 125B وجدول تضمين N-gram بحجم 51B ووحدات تنبؤ متعددة الرموز بحجم 4B، مع تفعيل 6B معلمة فقط لكل رمز.
- المعمارية: تستخدم مزيجاً من Gated DeltaNet (انتباه خطي) لثلاثة أرباع الطبقات و Qwen Sparse Attention للربع الرابع، بالإضافة إلى تدفقات المتبقي المشغلة ومحسن Muon.
- المعايير: حقق 58.7 على DeepSWE 1.1، و62.5 على SWE-bench Pro، و91.9 على LiveCodeBench v6، و95.7 على MathVision مع مفسر الأكواد.
- الكفاءة: تكلفة التدريب تساوي تقريباً تسع تكلفة Qwen3.7-Plus؛ ويُظهر التقديم زيادة في معدل تعبئة أولية تصل إلى 10.2x عند معدلات عالية لاصطدام ذاكرة التخزين المؤقت للبادئة.
- السياق والتخزين: يدعم 262,144 رمزاً بشكل أصلي (قابل للتوسيع إلى 1M عبر YaRN)؛ وحجم الملف المحفوظ بترميز FP8 هو 172.78 GiB، مما يتطلب نشرًا على عدة وحدات معالجة رسومية.
يُعد هذا النموذج عرضاً مبكراً للطراز المعماري لـ Qwen4، حيث يوفر تخفيضات كبيرة في التكاليف وتحسينات في السرعة مع الحفاظ على أداء تنافسي في معايير البرمجة والاستدلال.