Multiverse Computing présente une approche économe en mémoire pour la distillation de connaissances des grands modèles de langage, combinant la mise en cache hors ligne des logits top-K avec une perte de divergence Kullback-Leibler (KL) fusionnée et fractionnée. Cette méthode supprime le besoin de conserver simultanément les modèles enseignant et élève en mémoire, réduisant drastiquement les exigences en VRAM.

  • Le système met en cache les logits top-100 de l'enseignant une seule fois, permettant de retirer l'enseignant de la mémoire pendant l'entraînement.
  • Une perte KL fusionnée et fractionnée traite les séquences par blocs, évitant la matérialisation des matrices complètes vocabulaire-séquence.
  • La VRAM maximale pour un contexte de 32K tokens passe de 85,2 GiB à 5,45 GiB, soit une réduction de 15,6x.
  • La distillation de GPT-OSS 20B sur 32 768 tokens réduit les besoins matériels de quatre nœuds GPU à un seul et augmente le débit à 345,7 TFLOP/s.

Ces modifications rendent la distillation à long contexte pratique sur un seul GPU, permettant une expérimentation à grande échelle abordable et la compression de modèles.