Para penulis memperkenalkan Quantization-Aware Healing (QAH), sebuah metode untuk memulihkan kemampuan penalaran dan pemrograman pada model bahasa besar 4-bit yang terkompresi secara struktural. Berbeda dengan pelatihan sadar kuantisasi standar yang menyesuaikan ulang model terkompresi, QAH mendistilasi siswa 4-bit langsung dari model asli yang tidak terkompresi.
- Diterapkan pada GPT-OSS 120B yang dikurangi menjadi 60B dengan kuantisasi MXFP4, Hypernova-60B hasil setara atau mengalahkan sumber bfloat16-nya pada 7 dari 9 benchmark.
- Pendekatan ini menggunakan sekitar 4 kali lebih sedikit memori bobot dan setengah jumlah parameter guru.
- QAH mencapai kinerja puncak yang sebanding dengan pelatihan sadar kuantisasi sekitar 7 kali lebih cepat dan tetap stabil di bawah pelatihan berkelanjutan tanpa penghentian dini yang disesuaikan secara manual.
Metode ini memberikan resep praktis untuk menerapkan model terkompresi tanpa memerlukan pencarian hiperparameter selama berminggu-minggu.