A Multiverse Computing apresenta uma abordagem eficiente em memória para a destilação de conhecimento de modelos de linguagem grandes, combinando o cache offline de top-K logits com uma perda de divergência Kullback-Leibler (KL) em blocos fundidos. Este método elimina a necessidade de manter os modelos professor e aluno na memória simultaneamente, reduzindo drasticamente os requisitos de VRAM.
- O sistema armazena em cache os top-100 logits do professor uma vez, permitindo que o professor seja removido da memória durante o treinamento.
- Uma perda KL em blocos fundidos processa sequências em blocos, evitando a materialização de matrizes completas de vocabulário e sequência.
- O pico de VRAM para um contexto de 32K tokens cai de 85,2 GiB para 5,45 GiB, uma redução de 15,6x.
- A destilação do GPT-OSS 20B em 32.768 tokens reduz a necessidade de hardware de quatro nós de GPU para um e aumenta o throughput para 345,7 TFLOP/s.
Essas mudanças tornam a destilação de contexto longo prática em uma única GPU, permitindo experimentação em larga escala acessível e compressão de modelos.