Los autores presentan Quantization-Aware Healing (QAH), un método para recuperar capacidades de razonamiento y codificación en modelos de lenguaje grandes de 4 bits estructuralmente comprimidos. A diferencia del entrenamiento consciente de la cuantización estándar que re-ajusta el modelo comprimido, QAH destila al estudiante de 4 bits directamente desde el modelo original sin comprimir.

  • Aplicado a GPT-OSS 120B reducido a 60B con cuantización MXFP4, el Hypernova-60B resultante iguala o supera su fuente bfloat16 en 7 de 9 benchmarks.
  • El enfoque utiliza aproximadamente 4 veces menos memoria de pesos y la mitad del recuento de parámetros del maestro.
  • QAH alcanza un rendimiento pico comparable al entrenamiento consciente de la cuantización unas 7 veces más rápido y permanece estable bajo entrenamiento continuo sin parada temprana ajustada a mano.

El método proporciona una receta práctica para desplegar modelos comprimidos sin requerir búsquedas de hiperparámetros de varias semanas.