Проект llama.cpp выпустил версию b10907, которая включает исправление выделения контекстного ключ-значения кэша Multi-Token Prediction (MTP). Это обновление устраняет проблемы, затрагивающие архитектуры deepseek2, glm4moe и cohere2moe.
- Исправляет выделение контекстного kv-кэша MTP для моделей deepseek2, glm4moe и cohere2moe.
- Добавляет инверсное архитектурное гейтирование и комплексное тестирование архитектуры для фильтрации слоев MTP.
- Упрощает комментарий NextN фильтра и убирает изменения test-llama-archs.
Релиз предоставляет бинарные файлы для macOS (Apple Silicon и Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, OpenCL, Vulkan, OpenVINO, SYCL, ROCm) и openEuler.