Multiverse Computing представляет энергоэффективный подход к дистилляции знаний больших языковых моделей, сочетающий офлайн-кэширование топ-K логитов с объединённой кусочной функцией потерь расхождения Кульбака-Лейблера (KL). Этот метод устраняет необходимость одновременного удержания в памяти как учителя, так и ученика, что радикально снижает требования к VRAM.

  • Система один раз кэширует топ-100 логитов учителя, позволяя удалить учителя из памяти во время обучения.
  • Объединённая кусочная функция потерь KL обрабатывает последовательности по фрагментам, избегая материализации полных матриц «словарь-последовательность».
  • Пиковое потребление VRAM для контекста в 32K токенов падает с 85.2 GiB до 5.45 GiB, что составляет снижение в 15.6 раза.
  • Дистилляция GPT-OSS 20B при 32,768 токенах снижает потребность в оборудовании с четырёх GPU-узлов до одного и увеличивает пропускную способность до 345.7 TFLOP/s.

Эти изменения делают дистилляцию длинного контекста практичной на одном GPU, обеспечивая доступные крупномасштабные эксперименты и сжатие моделей.