Le projet llama.cpp a publié la version b10206, qui introduit des modifications spécifiques concernant la gestion des caches clé-valeur dans les mécanismes d'attention. La mise à jour garantit que les types de cache K et V restent cohérents pour les modèles DeepSeek V4.

  • Impose des types de cache K et V identiques pour les architectures DeepSeek V4.
  • Active Flash Attention (FA) lorsque le cache V est quantifié.
  • Applique la même imposition de types de cache K et V aux autres modèles MLA.

Cette version fournit des binaires pour macOS, Linux, Windows, Android et openEuler sur divers backends matériels incluant CPU, CUDA, ROCm, Vulkan, OpenVINO, SYCL et OpenCL.