Multiverse Computing 提出了一种内存高效的大语言模型知识蒸馏方法,将离线 top-K logits 缓存与融合的分块 Kullback-Leibler (KL) 散度损失相结合。该方法消除了同时保留教师模型和学生模型于内存中的需求,大幅降低了 VRAM 要求。
- 系统仅缓存教师的 top-100 logits,允许在训练期间将教师模型从内存中移除。
- 融合的分块 KL 损失以分块方式处理序列,避免了完整词汇-序列矩阵的物化。
- 32K token 上下文的峰值 VRAM 从 85.2 GiB 降至 5.45 GiB,减少了 15.6 倍。
- 在 32,768 tokens 下对 GPT-OSS 20B 进行蒸馏,将硬件需求从四个 GPU 节点减少到一个,并将吞吐量提升至 345.7 TFLOP/s。
这些改进使得单 GPU 上的长上下文蒸馏变得切实可行,从而支持低成本的大规模实验和模型压缩。