Авторы представляют Quantization-Aware Healing (QAH), метод восстановления способностей к рассуждению и написанию кода в структурно сжатых больших языковых моделях на 4 бита. В отличие от стандартного обучения с учётом квантования, которое переобучает сжатую модель, QAH дистиллирует студента 4-битной модели напрямую из исходной несжатой модели.
- Применено к GPT-OSS 120B, уменьшенной до 60B с использованием MXFP4 квантования; полученная Hypernova-60B соответствует или превосходит свой источник bfloat16 в 7 из 9 бенчмарков.
- Подход использует примерно в 4 раза меньше памяти весов и вдвое меньше параметров учителя.
- QAH достигает пиковой производительности, сопоставимой с обучением с учётом квантования, примерно в 7 раз быстрее и остаётся стабильным при продолжении обучения без ручной настройки ранней остановки.
Метод предоставляет практическое решение для развертывания сжатых моделей без необходимости многомесячного поиска гиперпараметров.