A Multiverse Computing apresenta uma abordagem eficiente em memória para a destilação de conhecimento de modelos de linguagem grandes, combinando o cache offline de top-K logits com uma perda de divergência Kullback-Leibler (KL) em blocos fundidos. Este método elimina a necessidade de manter os modelos professor e aluno na memória simultaneamente, reduzindo drasticamente os requisitos de VRAM.

  • O sistema armazena em cache os top-100 logits do professor uma vez, permitindo que o professor seja removido da memória durante o treinamento.
  • Uma perda KL em blocos fundidos processa sequências em blocos, evitando a materialização de matrizes completas de vocabulário e sequência.
  • O pico de VRAM para um contexto de 32K tokens cai de 85,2 GiB para 5,45 GiB, uma redução de 15,6x.
  • A destilação do GPT-OSS 20B em 32.768 tokens reduz a necessidade de hardware de quatro nós de GPU para um e aumenta o throughput para 345,7 TFLOP/s.

Essas mudanças tornam a destilação de contexto longo prática em uma única GPU, permitindo experimentação em larga escala acessível e compressão de modelos.