Multiverse Computing memperkenalkan Quantization-Aware Healing (QAH), sebuah metode yang mendistilasi model bahasa besar terkompresi dan terkuantisasi langsung dari guru pra-kompresinya. Diterapkan pada model GPT-OSS 120B yang dikompresi menjadi 60B parameter dan di-kuantisasi ke MXFP4, pendekatan ini menghasilkan model yang mengalahkan versi bfloat16 presisi penuhnya sendiri pada 7 dari 9 benchmark.

  • Model QAH melampaui guru asli 120B pada LiveCodeBench (66.5 vs. 66.0) dan mencapai peningkatan besar dalam penalaran konteks panjang (+7.4 pada AA-LCR) dan matematika (+5.6 pada AIME 2025).
  • Dibandingkan dengan pelatihan aware kuantisasi (QAT), QAH mencapai kinerja puncak dalam sekitar 100 langkah, sekitar 7 kali lebih cepat, sambil menghindari runtuhnya akurasi tajam yang terlihat pada QAT setelah langkah 700.
  • Metode ini menggunakan kerugian divergensi KL chunked hemat memori untuk menangani penyembuhan konteks panjang hingga 32k token tanpa mematerialisasi grid kosakata-penuh-dan-baris.

Teknik ini memungkinkan model terkompresi menjadi lebih kecil, lebih murah untuk dilayani, dan lebih akurat daripada rekan-rekan mereka yang tidak terkompresi, secara efektif membalikkan trade-off biasa antara efisiensi dan kemampuan.