Проект llama.cpp выпустил версию b10907, которая включает исправление выделения контекстного ключ-значения кэша Multi-Token Prediction (MTP). Это обновление устраняет проблемы, затрагивающие архитектуры deepseek2, glm4moe и cohere2moe.

  • Исправляет выделение контекстного kv-кэша MTP для моделей deepseek2, glm4moe и cohere2moe.
  • Добавляет инверсное архитектурное гейтирование и комплексное тестирование архитектуры для фильтрации слоев MTP.
  • Упрощает комментарий NextN фильтра и убирает изменения test-llama-archs.

Релиз предоставляет бинарные файлы для macOS (Apple Silicon и Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, OpenCL, Vulkan, OpenVINO, SYCL, ROCm) и openEuler.