著者は Quantization-Aware Healing (QAH) を導入しました。これは、構造的圧縮と量子化中に失われたパフォーマンスを回復するために、非圧縮モデルから直接 4 ビットの学生モデルを蒸留するパイプラインです。GPT-OSS 120B に適用すると、この手法は Hypernova-60B を生成し、9 つのベンチマークのうち 7 つで bfloat16 ソースと同等またはそれ以上のパフォーマンスを発揮しながら、重みメモリを約 4 分の 1 に抑えています。

  • QAH は圧縮されたチェックポイントをハードラベルに再適合させるのではなく、元の非圧縮モデルから直接学生を蒸留します。
  • このアプローチは、量子化 aware トレーニング(QAT)よりも約 7 倍速くピークパフォーマンスに到達し、継続的なトレーニング下でも安定しています。
  • Hypernova-60B は教師の半分のパラメータ数を持つオープンウェイトモデルとして公開されています。

著者は、分散トレーニングバックエンド間の大きな品質ギャップを指摘しつつ、複数週にわたるハイパーパラメータ検索を回避する実用的なレシピを提供することを目指しています。