लेखकों ने क्वांटीज़ेशन-अवेयर हीलिंग (QAH) पेश किया, एक विधि जो संरचनात्मक रूप से संपीड़ित, 4-बिट बड़े भाषा मॉडलों में तर्क और कोडिंग क्षमताओं को पुनर्स्थापित करती है। मानक क्वांटीज़ेशन-अवेयर ट्रेनिंग के विपरीत जो संपीड़ित मॉडल को फिर से फिट करता है, QAH 4-बिट छात्र को सीधे मूल असंपीड़ित मॉडल से डिस्टिल करता है।
- MXFP4 क्वांटीज़ेशन के साथ GPT-OSS 120B को 60B तक कम करने पर लागू, परिणामी Hypernova-60B 9 में से 7 बेंचमार्क्स पर अपने bfloat16 स्रोत के बराबर या बेहतर है।
- दृष्टिकोण लगभग 4 गुना कम वजन मेमोरी और आधे शिक्षक पैरामीटर गणना का उपयोग करता है।
- QAH क्वांटीज़ेशन-अवेयर ट्रेनिंग के समान शीर्ष प्रदर्शन तक लगभग 7 गुना तेज़ी से पहुँचता है और बिना हैंड-ट्यूंड अर्ली स्टॉपिंग के निरंतर ट्रेनिंग के तहत स्थिर रहता है।
यह विधि बहु-सप्ताह हाइपर-पैरामीटर खोज की आवश्यकता के बिना संपीड़ित मॉडल को तैनात करने के लिए एक व्यावहारिक रेसिपी प्रदान करती है।