Para penulis memperkenalkan Quantization-Aware Healing (QAH), sebuah pipa yang mendistilasi siswa 4-bit langsung dari model tanpa kompresi untuk memulihkan kinerja yang hilang selama kompresi struktural dan kuantisasi. Diterapkan pada GPT-OSS 120B, metode ini menghasilkan Hypernova-60B, yang menyamai atau mengalahkan sumber bfloat16 pada 7 dari 9 benchmark sambil menggunakan sekitar 4 kali lebih sedikit memori bobot.

  • QAH mendistilasi siswa langsung dari model asli tanpa kompresi daripada menyesuaikan kembali checkpoint terkompresi ke label keras.
  • Pendekatan ini mencapai kinerja puncak yang sebanding sekitar 7 kali lebih cepat daripada pelatihan sadar kuantisasi (QAT) dan tetap stabil di bawah pelatihan berkelanjutan.
  • Hypernova-60B dirilis sebagai model bobot terbuka dengan setengah jumlah parameter guru.

Para penulis bertujuan untuk menyediakan resep yang dapat diterapkan yang menghindari pencarian hiperparameter selama beberapa minggu, mencatat kesenjangan kualitas signifikan antara backend pelatihan terdistribusi.