Los autores presentan Quantization-Aware Healing (QAH), una canalización que destila estudiantes de 4 bits directamente desde modelos sin comprimir para recuperar el rendimiento perdido durante la compresión estructural y cuantización. Aplicado a GPT-OSS 120B, este método produce Hypernova-60B, que iguala o supera al bfloat16 fuente en 7 de 9 benchmarks mientras usa aproximadamente 4 veces menos memoria de peso.

  • QAH destila al estudiante directamente desde el modelo original sin comprimir en lugar de reajustar un checkpoint comprimido a etiquetas duras.
  • El enfoque alcanza un rendimiento pico comparable unas 7 veces más rápido que la capacitación consciente de cuantización (QAT) y permanece estable bajo entrenamiento continuo.
  • Hypernova-60B se libera como un modelo de peso abierto con la mitad del conteo de parámetros del maestro.

Los autores buscan proporcionar una receta desplegable que evite búsquedas de hiperparámetros de varias semanas, notando brechas significativas de calidad entre backends de entrenamiento distribuido.