著者は、構造的に圧縮された4ビット大規模言語モデルの推論およびコーディング能力を回復させる手法であるQuantization-Aware Healing(QAH)を紹介します。標準的な量子化 aware トレーニングが圧縮モデルを再適合させるのとは異なり、QAHは元の非圧縮モデルから4ビット学生モデルを直接蒸留します。

  • MXFP4量子化を用いてGPT-OSS 120Bを60Bに削減した場合、生成されたHypernova-60Bは9つのベンチマークのうち7つでbfloat16のソースと同等またはそれ以上の性能を発揮しました。
  • このアプローチは重みメモリを約4分の1に抑え、教師モデルのパラメータ数の半分しか使用しません。
  • QAHは量子化 aware トレーニングと比較可能なピークパフォーマンスに約7倍速く到達し、手動で調整された早期終了なしでも継続的なトレーニング中に安定しています。

この手法は、複数週にわたるハイパーパラメータ検索を必要とせずに圧縮モデルを展開するための実用的なレシピを提供します。