Les auteurs présentent Quantization-Aware Healing (QAH), une méthode pour récupérer les capacités de raisonnement et de codage dans des modèles de langage larges de 4 bits structurellement compressés. Contrairement à l'entraînement conscient de la quantification standard qui réadapte le modèle compressé, QAH distille l'étudiant 4 bits directement depuis le modèle original non compressé.

  • Appliqué à GPT-OSS 120B réduit à 60B avec la quantification MXFP4, le Hypernova-60B résultant égale ou bat sa source bfloat16 sur 7 des 9 benchmarks.
  • L'approche utilise environ 4 fois moins de mémoire de poids et la moitié du nombre de paramètres du professeur.
  • QAH atteint une performance maximale comparable à l'entraînement conscient de la quantification environ 7 fois plus rapidement et reste stable sous un entraînement continu sans arrêt anticipé ajusté manuellement.

La méthode fournit une recette pratique pour déployer des modèles compressés sans nécessiter de recherches d'hyperparamètres sur plusieurs semaines.