Multiverse Computing presenta un enfoque eficiente en memoria para la destilación de conocimiento de modelos de lenguaje grandes, combinando el almacenamiento en caché offline de los top-K logits con una pérdida de divergencia Kullback-Leibler (KL) fusionada por fragmentos. Este método elimina la necesidad de mantener ambos modelos, maestro y estudiante, en memoria simultáneamente, reduciendo drásticamente los requisitos de VRAM.
- El sistema almacena en caché los top-100 logits del maestro una sola vez, lo que permite eliminar al maestro de la memoria durante el entrenamiento.
- Una pérdida KL fusionada por fragmentos procesa secuencias en fragmentos, evitando la materialización de matrices completas de vocabulario y secuencia.
- La VRAM pico para un contexto de 32K tokens baja de 85.2 GiB a 5.45 GiB, una reducción de 15.6x.
- Destilar GPT-OSS 20B con 32,768 tokens reduce la necesidad de hardware de cuatro nodos GPU a uno y aumenta el rendimiento a 345.7 TFLOP/s.
Estos cambios hacen que la destilación de contexto largo sea práctica en una sola GPU, permitiendo experimentación a gran escala accesible y compresión de modelos.