Os autores introduzem o Quantization-Aware Healing (QAH), um método para recuperar capacidades de raciocínio e codificação em modelos de linguagem grandes de 4 bits estruturalmente comprimidos. Diferente do treinamento consciente de quantização padrão que re-ajusta o modelo comprimido, o QAH destila o estudante de 4 bits diretamente do modelo original não comprimido.
- Aplicado ao GPT-OSS 120B reduzido para 60B com quantização MXFP4, o Hypernova-60B resultante iguala ou supera sua fonte bfloat16 em 7 dos 9 benchmarks.
- A abordagem usa aproximadamente 4 vezes menos memória de pesos e metade da contagem de parâmetros do professor.
- O QAH atinge um pico de desempenho comparável ao treinamento consciente de quantização cerca de 7 vezes mais rápido e permanece estável sob treinamento contínuo sem parada antecipada ajustada manualmente.
O método fornece uma receita prática para implantar modelos comprimidos sem exigir buscas de hiperparâmetros de várias semanas.