أطلقت Zhipu AI نموذج GLM-5.3-Flash، وهو أول نموذج متعدد الوسائط بشكل أصلي في سلسلة GLM-5 وأول إصدار بوزن مفتوح لهيكلية glm5_next. يُدرَّب النموذج ذو الـ 320 مليار معامل على مجموعة بيانات متعددة الوسائط تحتوي على 30 تريليون رمز (token)، ويتميز بآلية انتباه هجينة تجمع بين الانتباه الخطي والتشتت لتقليل تكاليف معالجة السياقات الطويلة.

  • الهيكلية: تتكون من 45 طبقة تدمج الانتباه الخطي KDA مع الانتباه المشتت على طراز DeepSeek، مستخدمةً اتصالات Hyper-Connections مقيدة بالمجموعة المتعددة (mHC) لتحسين كفاءة التوسع.
  • القدرات متعددة الوسائط: يسمح مشفر ViT المكون من 24 طبقة بإدراج رموز الصور والفيديو في المفردات، ويدعم طول سياق يصل إلى 1,048,576 رمزًا.
  • الأوزان: متوفرة بتنسيقي FP8 (e4m3) و BF16 على منصتي Hugging Face و ModelScope بموجب رخصة MIT.
  • دعم الاستدلال: تم توفير وصفات رسمية لـ vLLM و SGLang، بما في ذلك تكوينات فك التشفير التخميني.

تهدف هذه الإضافة إلى تقديم بديل فعال من حيث التكلفة يقترب من أداء Claude Opus 4.8 في اختبارات البرمجة والوكلاء، مع تقليل تكاليف الاستدلال بشكل كبير.