El proyecto llama.cpp ha lanzado la versión b10206, que introduce cambios específicos en cómo se manejan los cachés de clave-valor en los mecanismos de atención. La actualización asegura que los tipos de caché K y V permanezcan consistentes para los modelos DeepSeek V4.

  • Aplica tipos de caché K y V idénticos para las arquitecturas DeepSeek V4.
  • Habilita Flash Attention (FA) cuando el caché V está cuantizado.
  • Aplica la misma aplicación de tipos de caché K y V a otros modelos MLA.

Esta versión proporciona binarios para macOS, Linux, Windows, Android y openEuler en varios backends de hardware que incluyen CPU, CUDA, ROCm, Vulkan, OpenVINO, SYCL y OpenCL.