El proyecto llama.cpp ha lanzado la versión b10206, que introduce cambios específicos en cómo se manejan los cachés de clave-valor en los mecanismos de atención. La actualización asegura que los tipos de caché K y V permanezcan consistentes para los modelos DeepSeek V4.
- Aplica tipos de caché K y V idénticos para las arquitecturas DeepSeek V4.
- Habilita Flash Attention (FA) cuando el caché V está cuantizado.
- Aplica la misma aplicación de tipos de caché K y V a otros modelos MLA.
Esta versión proporciona binarios para macOS, Linux, Windows, Android y openEuler en varios backends de hardware que incluyen CPU, CUDA, ROCm, Vulkan, OpenVINO, SYCL y OpenCL.