أطلقت Z.ai نموذج GLM-5.3-Flash، وهو أول نموذج متعدد الوسائط بشكل أصلي في سلسلة GLM-5، ويتميز بهندسة مزيج الخبراء (mixture-of-experts) بإجمالي 320 مليار معامل و18 مليار معامل نشط لكل رمز. يدعم النموذج مدخلات الصور والفيديو ضمن نافذة سياق تتسع لـ 1,048,576 رمز، وهو متاح بموجب رخصة MIT على Hugging Face.

  • يعتمد انتباهًا هجينًا يجمع بين طبقات الانتباه الخطي KDA وطبقات MLA المتناثرة NoPE، مع توجيه الرموز عبر 8 من أصل 288 خبيرًا.
  • تقلل آلية IndexPool من حسابات الانتباه بنسبة تقارب 3 مرات وتقلص ذاكرة التخزين المؤقت KV بمقدار 4.4 مرات مقارنة بـ GLM-5.3.
  • تظهر نتائج الاختبارات القياسية درجات 84.3 على Terminal-Bench 2.1 و63.4 على DeepSWE v1.1، مما يضعه قريبًا من Claude Opus 4.8.
  • تم تحديد أسعار واجهة برمجة التطبيقات بـ $0.15 لكل مليون رمز مدخل و$0.50 لكل مليون رمز مخرج، بينما يتطلب الاستضافة الذاتية حوالي 306 GiB من أوزان FP8.

يهدف النموذج إلى تقديم حل برمجي فعال من حيث التكلفة، وقد تفوق على GLM-5.2 عبر الاختبارات القياسية بنحو عُشر السعر مع الحفاظ على أداء عالٍ في مهام البرمجة الداخلية.