Multiverse Computing представляет Quantization-Aware Healing (QAH), метод, который дистиллирует сжатые, квантованные большие языковые модели непосредственно из их исходных учителей до сжатия. Применённый к модели GPT-OSS 120B, сжатой до 60B параметров и квантованной до MXFP4, подход даёт модель, которая превосходит свою собственную полнопрецизионную версию bfloat16 в 7 из 9 бенчмарков.
- Модель QAH превосходит исходного учителя на 120B в LiveCodeBench (66.5 против 66.0) и демонстрирует значительные улучшения в рассуждениях с длинным контекстом (+7.4 по AA-LCR) и математике (+5.6 по AIME 2025).
- По сравнению с обучением, учитывающим квантование (QAT), QAH достигает пиковой производительности примерно за 100 шагов, что примерно в 7 раз быстрее, избегая резкого падения точности, наблюдаемого в QAT после 700-го шага.
- Метод использует эффективную по памяти потерю KL-дивергенции с разбиением на чанки для обработки восстановления длинного контекста до 32k токенов без материализации полной сетки «словарь-последовательность».
Эта техника позволяет сжатым моделям быть меньше, дешевле в обслуживании и более точными по сравнению с их несжатыми аналогами, эффективно обращая вспять обычный компромисс между эффективностью и возможностями.