Проект llama.cpp выпустил версию b10206, которая вносит специфические изменения в обработку ключ-значительных кэшей в механизмах внимания. Обновление гарантирует, что типы кэшей K и V остаются согласованными для моделей DeepSeek V4.

  • Требует идентичные типы кэшей K и V для архитектур DeepSeek V4.
  • Включает Flash Attention (FA), когда кэш V квантован.
  • Применяет то же требование к типам кэшей K и V для других моделей MLA.

Этот релиз предоставляет бинарные файлы для macOS, Linux, Windows, Android и openEuler для различных аппаратных бэкэндов, включая CPU, CUDA, ROCm, Vulkan, OpenVINO, SYCL и OpenCL.