Проект llama.cpp выпустил версию b10212, которая включает изменение: тензоры Multi-Token Prediction (MTP) теперь загружаются только в случае их фактического использования. Это обновление гарантирует, что тензоры MTP пропускаются при загрузке для остальных моделей, которые поддерживают эту функцию, но не нуждаются в ней.

  • Загружать тензоры MTP условно в зависимости от использования.
  • Пропускать загрузку MTP в моделях, где она не требуется.

Эта оптимизация снижает ненужные накладные расходы памяти для моделей, которые не используют Multi-Token Prediction.