يقدم المؤلفون Quantization-Aware Healing (QAH)، وهو خط أنابيب يقوم بتقطيع طلاب 4 بت مباشرة من النماذج غير المضغوطة لاستعادة الأداء المفقود أثناء الضغط الهيكلي والتكميم. عند تطبيقه على GPT-OSS 120B، ينتج هذا الأسلوب Hypernova-60B، الذي يساوي أو يتفوق على المصدر bfloat16 في 7 من أصل 9 معايير مع استخدام حوالي 4 أضعاف أقل من ذاكرة الأوزان.
- يقوم QAH بتقطيع الطالب مباشرة من النموذج الأصلي غير المضغوط بدلاً من إعادة ضبط نقطة فحص مضغوطة على تسميات صلبة.
- يصل النهج إلى ذروة أداء مماثلة أسرع بحوالي 7 مرات من التدريب الواعي بالتكميم (QAT) ويبقى مستقرًا تحت التدريب المستمر.
- تم إصدار Hypernova-60B كنموذج بأوزان مفتوحة بنصف عدد معاملات المعلم.
يهدف المؤلفون إلى توفير وصفة قابلة للنشر تتجنب البحث عن المعلمات الفائقة لمدة أسابيع متعددة، مع الإشارة إلى فجوات جودة كبيرة بين خلفيات التدريب الموزع.