Multiverse Computing представляет Quantization-Aware Healing (QAH), метод, который дистиллирует сжатые, квантованные большие языковые модели непосредственно из их исходных учителей до сжатия. Применённый к модели GPT-OSS 120B, сжатой до 60B параметров и квантованной до MXFP4, подход даёт модель, которая превосходит свою собственную полнопрецизионную версию bfloat16 в 7 из 9 бенчмарков.

  • Модель QAH превосходит исходного учителя на 120B в LiveCodeBench (66.5 против 66.0) и демонстрирует значительные улучшения в рассуждениях с длинным контекстом (+7.4 по AA-LCR) и математике (+5.6 по AIME 2025).
  • По сравнению с обучением, учитывающим квантование (QAT), QAH достигает пиковой производительности примерно за 100 шагов, что примерно в 7 раз быстрее, избегая резкого падения точности, наблюдаемого в QAT после 700-го шага.
  • Метод использует эффективную по памяти потерю KL-дивергенции с разбиением на чанки для обработки восстановления длинного контекста до 32k токенов без материализации полной сетки «словарь-последовательность».

Эта техника позволяет сжатым моделям быть меньше, дешевле в обслуживании и более точными по сравнению с их несжатыми аналогами, эффективно обращая вспять обычный компромисс между эффективностью и возможностями.