أصدرت Z.ai نموذج GLM-5.3-Flash، وهو نموذج MoE متعدد الوسائط يحتوي على 320 مليار معامل مع 18 مليار معامل نشط، بينما أصدر فريق Qwen التابع لـ Alibaba نموذج Qwen3.8-Flash-Next، وهو نموذج بحجم 125 مليار معامل مع 6 مليارات معامل نشط. وعلى الرغم من التطوير المستقل، اعتمد الفريقان تكوينات معمارية متطابقة تقريباً.
- يستخدم كلا النموذجين مزيجاً بنسبة 3:1 من طبقات الانتباه الخطي والكامل لتحقيق التوازن بين الكفاءة والدقة.
- يتم ضغط السياق بمعامل 4 عبر مؤشر مُتعلّم يحدّ من ميزانية الانتباه المتناثر بـ 2048 رمزاً.
- تم استبدال تيار الباقي الواحد بأربعة فروع متوازية ذات بوابة لتحسين التحكم في التدفق وتقليل الحمل الإضافي للذاكرة.
- يعتمد التدريب على مُحسّن Muon مع مصفوفات إسقاط مدمجة مقسّمة إلى تحويلات مستقلة قبل التعامد.
- يختلف الفريقان حول الترميز الموضعي: يتخلى GLM عن RoPE لصالح NoPE، بينما حافظ Qwen على RoPE بعد فشل متغيرات NoPE في إيقاف التوليد ما بعد التدريب.
يشير هذا التقارب إلى اتجاه صناعي مشترك لنمذجة السياق الطويل بكفاءة، رغم أن MiniMax لا يزال معارضاً برفضه الانتباه الخطي بسبب عيوب في الاستدلال.