Проект llama.cpp выпустил версию b111440, которая включает исправление для инициализации спекулятивного MTP. Обновление гарантирует повторное резервирование планировщика при изменении флагов извлечения NextN, предотвращая проблемы с немаскированным извлечением.
- Инициализация спекулятивного MTP теперь включает извлечение NextN в контекстах цели и черновика после создания.
- Граф trunk сохраняет каждый токен до последнего слоя вместо обрезки до выходных строк.
- Инвалидация резерва при изменении флагов позволяет следующему вычислению повторно зарезервировать память с новой формой графа.
- Бинарные файлы доступны для macOS, Linux, Windows, Android и iOS для бэкендов CPU, GPU и NPU.
Это изменение предотвращает ошибки GGML_SCHED_DEBUG_REALLOC, обеспечивая правильное выделение формы батча во время декодирования.