Multiverse Computing présente Quantization-Aware Healing (QAH), une méthode qui distille des grands modèles de langage compressés et quantifiés directement à partir de leurs enseignants originaux avant compression. Appliquée à un modèle GPT-OSS 120B compressé à 60B paramètres et quantifié en MXFP4, cette approche produit un modèle qui bat sa propre version pleine précision bfloat16 sur 7 des 9 benchmarks.

  • Le modèle QAH dépasse l'enseignant original de 120B sur LiveCodeBench (66,5 contre 66,0) et réalise d'importantes gains en raisonnement à long contexte (+7,4 sur AA-LCR) et en mathématiques (+5,6 sur AIME 2025).
  • Par rapport à l'entraînement quantization-aware training (QAT), QAH atteint ses performances optimales en environ 100 étapes, soit environ 7 fois plus rapidement, tout en évitant l'effondrement brutal de la précision observé dans le QAT après l'étape 700.
  • La méthode utilise une perte de divergence KL par blocs économe en mémoire pour gérer la guérison du long contexte jusqu'à 32k tokens sans matérialiser la grille complète vocabulaire-séquence.

Cette technique permet aux modèles compressés d'être plus petits, moins coûteux à servir et plus précis que leurs homologues non compressés, inversant efficacement le compromis habituel entre efficacité et capacité.