Los autores presentan Quantization-Aware Healing (QAH), un método para recuperar capacidades de razonamiento y codificación en modelos de lenguaje grandes de 4 bits estructuralmente comprimidos. A diferencia del entrenamiento consciente de la cuantización estándar que re-ajusta el modelo comprimido, QAH destila al estudiante de 4 bits directamente desde el modelo original sin comprimir.
- Aplicado a GPT-OSS 120B reducido a 60B con cuantización MXFP4, el Hypernova-60B resultante iguala o supera su fuente bfloat16 en 7 de 9 benchmarks.
- El enfoque utiliza aproximadamente 4 veces menos memoria de pesos y la mitad del recuento de parámetros del maestro.
- QAH alcanza un rendimiento pico comparable al entrenamiento consciente de la cuantización unas 7 veces más rápido y permanece estable bajo entrenamiento continuo sin parada temprana ajustada a mano.
El método proporciona una receta práctica para desplegar modelos comprimidos sin requerir búsquedas de hiperparámetros de varias semanas.