Z.ai ने 18B सक्रिय पैरामीटर वाले 320B-पैरामीटर बहुआयामी MoE मॉडल GLM-5.3-Flash जारी किया, जबकि Alibaba का Qwen टीम ने 6B सक्रिय पैरामीटर वाला 125B मॉडल Qwen3.8-Flash-Next जारी किया। स्वतंत्र विकास के बावजूद, दोनों टीमों ने लगभग समान आर्किटेक्चर कॉन्फ़िगरेशन अपनाए।
- दोनों मॉडल दक्षता और सटीकता को संतुलित करने के लिए रैखिक और पूर्ण ध्यान परतों का 3:1 मिश्रण उपयोग करते हैं।
- एक सीखा हुआ इंडेक्सर द्वारा संदर्भ को 4 के कारक से संपीड़ित किया जाता है जो विरल ध्यान बजट को 2048 टोकन तक सीमित करता है।
- प्रवाह नियंत्रण में सुधार और मेमोरी ओवरहेड कम करने के लिए एकल अवशेष स्ट्रीम को चार समानांतर गेटेड शाखाओं से बदला गया है।
- प्रशिक्षण में Muon ऑप्टिमाइजर का उपयोग किया जाता है जिसमें फ्यूज्ड प्रोजेक्शन मैट्रिक्स को ऑर्थोगोनलाइज़ेशन से पहले स्वतंत्र रूपांतरणों में विभाजित किया गया है।
- टीमों ने स्थानीय एन्कोडिंग पर असहमत हैं: GLM ने RoPE को छोड़कर NoPE अपनाया, जबकि Qwen ने प्रशिक्षण के बाद उत्पन्न करना बंद करने में NoPE संस्करणों की विफलता के बाद भी RoPI बनाए रखी।
यह सहमति कुशल लंबे-संदर्भ मॉडलिंग के लिए एक साझा उद्योग दिशा का सुझाव देती है, हालांकि MiniMax रैखिक ध्यान को तर्क की कमी के कारण अस्वीकार करने वाले एक असहमत के रूप में बना हुआ है।