Os autores apresentam Quantization-Aware Healing (QAH), um pipeline que destila estudantes de 4 bits diretamente de modelos não comprimidos para recuperar o desempenho perdido durante a compressão estrutural e quantização. Aplicado ao GPT-OSS 120B, este método produz Hypernova-60B, que iguala ou supera a fonte bfloat16 em 7 dos 9 benchmarks enquanto usa aproximadamente 4 vezes menos memória de peso.
- QAH destila o estudante diretamente do modelo original não comprimido em vez de reajustar um checkpoint comprimido para rótulos duros.
- A abordagem atinge um pico de desempenho comparável cerca de 7 vezes mais rápido que o treinamento consciente de quantização (QAT) e permanece estável sob treinamento contínuo.
- Hypernova-60B é lançado como um modelo de peso aberto com metade da contagem de parâmetros do professor.
Os autores visam fornecer uma receita implantável que evita buscas de hiperparâmetros de várias semanas, notando lacunas significativas de qualidade entre backends de treinamento distribuído.