Авторы представляют Quantization-Aware Healing (QAH), конвейер, который дистиллирует студентов 4-битных моделей непосредственно из несжатых моделей для восстановления производительности, потерянной во время структурного сжатия и квантования. Примененный к GPT-OSS 120B, этот метод производит Hypernova-60B, который соответствует или превосходит источник bfloat16 на 7 из 9 бенчмарков, используя примерно в 4 раза меньше памяти весов.
- QAH дистиллирует студента непосредственно из оригинальной несжатой модели, а не переобучает сжатый чекпоинт на жесткие метки.
- Подход достигает сопоставимого пикового производительности примерно в 7 раз быстрее, чем квантование-осознанное обучение (QAT) и остается стабильным при продолжении обучения.
- Hypernova-60B выпущен как модель с открытыми весами с половиной параметра учителя.
Авторы стремятся предоставить развертываемый рецепт, который избегает многомесячных поисков гиперпараметров, отмечая значительные разрывы качества между бэкендами распределенного обучения.