लेखकों ने क्वांटीज़ेशन-अवेयर हीलिंग (QAH) पेश किया, एक पाइलाइन जो संरचनात्मक संपीड़न और क्वांटीज़ेशन के दौरान खोए गए प्रदर्शन को पुनर्स्थापित करने के लिए अदबाई मॉडलों से सीधे 4-बिट छात्रों को डिस्टिल करता है। GPT-OSS 120B पर लागू, यह विधि Hypernova-60B उत्पन्न करती है, जो 9 में से 7 बेंचमार्क्स पर bfloat16 स्रोत के बराबर या बेहतर प्रदर्शन देता है जबकि लगभग 4 गुना कम वजन मेमोरी का उपयोग करता है।

  • QAH छात्र को सीधे मूल अदबाई मॉडल से डिस्टिल करता है, न कि संपीड़ित चेकपॉइंट को कठिन लेबल्स पर फिर से फिट करने के लिए।
  • दृष्टिकोण लगभग 7 गुना तेज़ी से QAT (क्वांटीज़ेशन-अवेयर ट्रेनिंग) की तुलना में शीर्ष प्रदर्शन प्राप्त करता है और निरंतर ट्रेनिंग के तहत स्थिर रहता है।
  • Hypernova-60B को एक खुले वजन मॉडल के रूप में जारी किया गया है जिसमें शिक्षक के पैरामीटर का आधा हिस्सा है।

लेखकों का उद्देश्य एक डिप्लायबल रेसिपी प्रदान करना है जो कई सप्ताह की हाइपरपैरामीटर खोज से बचाता है, वितरित-ट्रेनिंग बैकएंड्स के बीच महत्वपूर्ण गुणवत्ता अंतरों को नोट करते हुए।