Multiverse Computingは、Quantization-Aware Healing (QAH) を導入した。これは、圧縮前の教師モデルから直接、圧縮・量子化された大規模言語モデルを蒸留する手法である。60Bパラメータに圧縮されMXFP4で量子化されたGPT-OSS 120Bモデルに適用すると、9つのベンチマークのうち7つでフル精度のbfloat16版を上回る性能を発揮する。

  • QAHモデルはLiveCodeBench(66.5対66.0)で元の120B教師モデルを上回り、長文コンテキスト推論(AA-LCRで+7.4)と数学(AIME 2025で+5.6)で大幅な向上を達成した。
  • 量子化-awareトレーニング(QAT)と比較して、QAHは約100ステップでピーク性能に達し、約7倍高速であり、またQATで見られるステップ700以降の急激な精度低下を回避している。
  • この手法は、メモリ効の良いチャンク化されたKLダイバージェンス損失を用い、フルの語彙対シーケンスグリッドを展開せずに、最大32kトークンまでの長文コンテキストの修復を処理する。

この技術により、圧縮モデルはより小型で推論コストが低く、未圧縮のモデルよりも正確になる。これは、効率性と能力の間の一般的なトレードオフを実質的に逆転させるものである。