Z.ai ने GLM-5.3-Flash जारी किया है, जो GLM-5 श्रृंखला का पहला स्थानीय रूप से बहुआयामी मॉडल है, जिसमें 320 अरब कुल पैरामीटर और प्रति टोकन 18 अरब सक्रिय पैरामीटर के साथ विशेषज्ञों का मिश्रण आर्किटेक्चर है। मॉडल 1,048,576-टोकन संदर्भ विंडो में छवि और वीडियो इनपुट का समर्थन करता है और Hugging Face पर MIT लाइसेंस के तहत उपलब्ध है।
- यह KDA रैखिक-ध्यान परतों को NoPE स्पार्स MLA परतों के साथ जोड़कर हाइब्रिड ध्यान का उपयोग करता है, जिसमें टोकन 288 विशेषज्ञों में से 8 के माध्यम से मार्गित होते हैं।
- एक IndexPool तंत्र GLM-5.3 की तुलना में लगभग 3x ध्यान कंप्यूट को कम करता है और KV कैश को 4.4x तक संकुचित करता है।
- बेंचमार्क में Terminal-Bench 2.1 पर 84.3 और DeepSWE v1.1 पर 63.4 अंक मिले हैं, जो इसे Claude Opus 4.8 के करीब लाता है।
- API मूल्य निर्धारण इनपुट टोकन के लिए $0.15/M और आउटपुट टोकन के लिए $0.50/M पर निर्धारित किया गया है, जबकि स्वयं होस्ट करने के लिए FP8 वजन के लिए लगभग 306 GiB की आवश्यकता होती है।
मॉडल का उद्देश्य एक लागत-प्रभावी कोडिंग समाधान प्रदान करना है, जो बेंचमार्क में GLM-5.2 को लगभग दसवें भाग की कीमत पर हराता हुआ पाया गया है, जबकि आंतरिक कोडिंग कार्यों पर उच्च प्रदर्शन बनाए रखता है।