Os autores introduzem o Quantization-Aware Healing (QAH), um método para recuperar capacidades de raciocínio e codificação em modelos de linguagem grandes de 4 bits estruturalmente comprimidos. Diferente do treinamento consciente de quantização padrão que re-ajusta o modelo comprimido, o QAH destila o estudante de 4 bits diretamente do modelo original não comprimido.

  • Aplicado ao GPT-OSS 120B reduzido para 60B com quantização MXFP4, o Hypernova-60B resultante iguala ou supera sua fonte bfloat16 em 7 dos 9 benchmarks.
  • A abordagem usa aproximadamente 4 vezes menos memória de pesos e metade da contagem de parâmetros do professor.
  • O QAH atinge um pico de desempenho comparável ao treinamento consciente de quantização cerca de 7 vezes mais rápido e permanece estável sob treinamento contínuo sem parada antecipada ajustada manualmente.

O método fornece uma receita prática para implantar modelos comprimidos sem exigir buscas de hiperparâmetros de várias semanas.