ISTA डीप एल्गोरिदम और सिस्टम्स लैब ने विरल मिक्स्चर-ऑफ़-एक्सपर्ट्स मॉडल Qwen3.8-Flash-Next के क्वांटाइज्ड GGUF संस्करण जारी किए हैं, साथ ही एक प्रयोगात्मक क्षमता-लक्षित बिल्ड भी जारी की गई है जिसमें इसके आधे विशेषज्ञों को हटा दिया गया है।
- रिलीज़ में GSQ और RCO तकनीकों का उपयोग करते हुए 2.40 से 3.50 bpw (66.4 से 83.6 GB) की सीमा में चार क्वांटाइज्ड GGUF शामिल हैं।
- 3.50 bpw पर, मॉडल GPQA-Diamond और LiveCodeBench v6 सहित प्रत्येक मूल्यांकन किए गए बेंचमार्क पर BF16 बेस के बराबर है।
- विशेषज्ञ-कटाई वाला कोडर बिल्ड प्रति परत 512 राउटेड विशेषज्ञों में से 256 को हटा देता है, जिसके परिणामस्वरूप प्रति पैरामीटर औसत बिटविडथ 1.89 बिट हो जाता है।
- इस कटाई से रहने वाले कार्य समूह को 29.6 GB तक कम कर दिया गया है, जिससे 176.9B-पैरामीटर वाला मॉडल एकल 32 GB एक्सेलेरेटर में फिट हो जाता है।
क्वांटाइज्ड मॉडल अपने आकार के सापेक्ष उच्च प्रदर्शन बनाए रखते हैं, जबकि कटाई वाला कोडर बिल्ड BF16 आधार की तुलना में SWE-bench Verified का 91.3% और LiveCodeBench v6 स्कोर का 98.7% बनाए रखता है।