मल्टीवर्स कंप्यूटिंग ने क्वांटीज़ेशन-अवेयर हीलिंग (QAH) पेश किया, एक विधि जो संकुचित, क्वांटीज़्ड बड़े भाषा मॉडलों को उनके मूल प्री-कंप्रेशन टीचर्स से सीधे डिस्टिल करती है। 120B पैरामीटर वाले GPT-OSS मॉडल पर लागू किया गया, जो 60B पैरामीटर तक संकुचित और MXFP4 में क्वांटीज़्ड है, इस दृष्टिकोण से एक ऐसा मॉडल तैयार होता है जो 9 में से 7 बेंचमार्क पर अपने पूर्ण-प्रीसिजन bfloat16 संस्करण को हराता है।
- QAH मॉडल LiveCodeBench (66.5 बनाम 66.0) पर मूल 120B टीचर से आगे निकल जाता है और लंबे-संदर्भ तर्क (+7.4 AA-LCR पर) और गणित (+5.6 AIME 2025 पर) में बड़ी छलांग लगाता है।
- क्वांटीज़ेशन-अवेयर ट्रेनिंग (QAT) की तुलना में, QAH लगभग 100 स्टेप्स में शीर्ष प्रदर्शन प्राप्त करता है, जो लगभग 7 गुना तेज है, जबकि QAT में स्टेप 700 के बाद देखी गई तीव्र सटीकता पतन से बचता है।
- यह विधि लंबे-संदर्भ हीलिंग को 32k टोकन तक संभालने के लिए मेमोरी-कुशल चंक्ड KL-डाइवर्जेंस नुकसान का उपयोग करती है, पूरे शब्दावली-सीक्वेंस ग्रिड को मटेरियलाइज़ किए बिना।
यह तकनीक संकुचित मॉडलों को छोटा, सस्ता सेवा करने योग्य और अपने अनकंप्रेश्ड समकक्षों से अधिक सटीक बनाती है, जो प्रभावशाली रूप से दक्षता और क्षमता के बीच सामान्य ट्रेड-ऑफ को उलट देती है।