Проект llama.cpp выпустил версию b111440, которая включает исправление для инициализации спекулятивного MTP. Обновление гарантирует повторное резервирование планировщика при изменении флагов извлечения NextN, предотвращая проблемы с немаскированным извлечением.

  • Инициализация спекулятивного MTP теперь включает извлечение NextN в контекстах цели и черновика после создания.
  • Граф trunk сохраняет каждый токен до последнего слоя вместо обрезки до выходных строк.
  • Инвалидация резерва при изменении флагов позволяет следующему вычислению повторно зарезервировать память с новой формой графа.
  • Бинарные файлы доступны для macOS, Linux, Windows, Android и iOS для бэкендов CPU, GPU и NPU.

Это изменение предотвращает ошибки GGML_SCHED_DEBUG_REALLOC, обеспечивая правильное выделение формы батча во время декодирования.