Авторы представляют Quantization-Aware Healing (QAH), метод восстановления способностей к рассуждению и написанию кода в структурно сжатых больших языковых моделях на 4 бита. В отличие от стандартного обучения с учётом квантования, которое переобучает сжатую модель, QAH дистиллирует студента 4-битной модели напрямую из исходной несжатой модели.

  • Применено к GPT-OSS 120B, уменьшенной до 60B с использованием MXFP4 квантования; полученная Hypernova-60B соответствует или превосходит свой источник bfloat16 в 7 из 9 бенчмарков.
  • Подход использует примерно в 4 раза меньше памяти весов и вдвое меньше параметров учителя.
  • QAH достигает пиковой производительности, сопоставимой с обучением с учётом квантования, примерно в 7 раз быстрее и остаётся стабильным при продолжении обучения без ручной настройки ранней остановки.

Метод предоставляет практическое решение для развертывания сжатых моделей без необходимости многомесячного поиска гиперпараметров.