Multiverse Computingは、オフラインのトップKロジットキャッシングと融合チャンク化カルバック・ライブラ(KL)発散損失を組み合わせることで、大規模言語モデルの知識蒸留に対するメモリ効率の高いアプローチを導入しました。この手法は、教師モデルと生徒モデルを同時にメモリに保持する必要を排除し、VRAM要件を劇的に削減します。

  • システムは教師のトップ100ロジットを一度キャッシュし、トレーニング中に教師モデルをメモリから削除可能にします。
  • 融合チャンク化KL損失はシーケンスをチャンク単位で処理し、完全な語彙-シーケンス行列の実体化を回避します。
  • 32KトークンのコンテキストにおけるピークVRAMは85.2 GiBから5.45 GiBに低下し、15.6倍の削減となります。
  • 32,768トークンでGPT-OSS 20Bを蒸留すると、ハードウェア要件が4つのGPUノードから1つに減少し、スループットは345.7 TFLOP/sに向上します。

これらの変更により、単一のGPU上で長期コンテキストの蒸留が現実的になり、手頃な価格での大規模実験とモデル圧縮が可能になります。