Les auteurs présentent Quantization-Aware Healing (QAH), un pipeline qui distille des étudiants 4 bits directement depuis des modèles non compressés pour récupérer la performance perdue lors de la compression structurelle et de la quantification. Appliqué à GPT-OSS 120B, cette méthode produit Hypernova-60B, qui égale ou bat la source bfloat16 sur 7 des 9 benchmarks tout en utilisant environ 4 fois moins de mémoire de poids.

  • QAH distille l'étudiant directement depuis le modèle original non compressé plutôt que de réajuster un checkpoint compressé à des étiquettes dures.
  • L'approche atteint une performance pic comparable environ 7 fois plus rapidement que la formation consciente de quantification (QAT) et reste stable sous entraînement continu.
  • Hypernova-60B est publié comme un modèle à poids ouvert avec la moitié du nombre de paramètres du professeur.

Les auteurs visent à fournir une recette déployable qui évite les recherches d'hyperparamètres sur plusieurs semaines, notant des écarts de qualité significatifs entre les backends d'entraînement distribué.