Multiverse Computing memperkenalkan pendekatan hemat memori untuk distilasi pengetahuan model bahasa besar dengan menggabungkan kaching logit top-K offline dan kerugian divergensi Kullback-Leibler (KL) terpotong yang digabungkan. Metode ini menghilangkan kebutuhan untuk menyimpan model guru dan siswa secara bersamaan dalam memori, secara drastis mengurangi persyaratan VRAM.

  • Sistem meng-cache logit top-100 guru sekali, memungkinkan penghapusan guru dari memori selama pelatihan.
  • Kerugian KL terpotong yang digabungkan memproses urutan dalam potongan-potongan, menghindari materialisasi matriks kosakata-urutan penuh.
  • VRAM puncak untuk konteks 32K token turun dari 85.2 GiB menjadi 5.45 GiB, pengurangan 15.6x.
  • Mendistilasi GPT-OSS 20B pada 32,768 token mengurangi kebutuhan perangkat keras dari empat node GPU menjadi satu dan meningkatkan throughput hingga 345.7 TFLOP/s.

Perubahan ini membuat distilasi konteks panjang praktis pada satu GPU, memungkinkan eksperimen skala besar yang terjangkau dan kompresi model.