Проект llama.cpp выпустил версию b10206, которая вносит специфические изменения в обработку ключ-значительных кэшей в механизмах внимания. Обновление гарантирует, что типы кэшей K и V остаются согласованными для моделей DeepSeek V4.
- Требует идентичные типы кэшей K и V для архитектур DeepSeek V4.
- Включает Flash Attention (FA), когда кэш V квантован.
- Применяет то же требование к типам кэшей K и V для других моделей MLA.
Этот релиз предоставляет бинарные файлы для macOS, Linux, Windows, Android и openEuler для различных аппаратных бэкэндов, включая CPU, CUDA, ROCm, Vulkan, OpenVINO, SYCL и OpenCL.