O projeto llama.cpp lançou a versão b10206, que introduz mudanças específicas em como os caches de chave-valor são tratados nos mecanismos de atenção. A atualização garante que os tipos de cache K e V permaneçam consistentes para os modelos DeepSeek V4.

  • Impõe tipos de cache K e V idênticos para as arquiteturas DeepSeek V4.
  • Habilita Flash Attention (FA) quando o cache V está quantizado.
  • Aplica a mesma imposição de tipos de cache K e V a outros modelos MLA.

Este lançamento fornece binários para macOS, Linux, Windows, Android e openEuler em vários backends de hardware, incluindo CPU, CUDA, ROCm, Vulkan, OpenVINO, SYCL e OpenCL.