Zhipu AI ने GLM-5.3-Flash जारी किया है, जो GLM-5 श्रृंखला में पहला नैटिवली बहुमोडल मॉडल और glm5_next आर्किटेक्चर का पहला ओपन-वेट रिलीज है। 320B-पैरामीटर वाला मॉडल एक 30T-टोकन बहुमोडल कॉरपस पर प्रशिक्षित किया गया है और लंबे संदर्भ की सेवा लागत को कम करने के लिए हाइब्रिड स्पार्स और रैखिक ध्यान तंत्र का उपयोग करता है।
- आर्किटेक्चर: स्केलिंग दक्षता के लिए मैनिफोल्ड-कॉन्स्ट्रेप्स्ड हाइपर-कनेक्शन्स (mHC) का उपयोग करते हुए KDA रैखिक ध्यान और DeepSeek-शैली स्पार्स ध्यान को जोड़ने वाली 45 परतें।
- बहुमोडल क्षमताएँ: शब्दावली में छवि और वीडियो टोकन की अनुमति देने वाला एक 24-परत का ViT एन्कोडर, जिसमें अधिकतम 1,048,576 टोकन तक का संदर्भ लंबाई समर्थित है।
- वजन: MIT लाइसेंस के तहत Hugging Face और ModelScope पर FP8 (e4m3) और BF16 प्रारूपों में उपलब्ध।
- इनफरेंस समर्थन: स्पेकुलेटिव डिकोडिंग कॉन्फ़िगरेशन सहित vLLM और SGLang के लिए आधिकारिक रेसिपी प्रदान की गई हैं।
इस रिलीज का उद्देश्य कोडिंग और एजेंटिक बेंचमार्क्स पर Claude Opus 4.8 के प्रदर्शन के करीब पहुँचने वाला एक लागत-प्रभावी विकल्प प्रदान करना है, जबकि इनफरेंस लागत को काफी कम करना है।