Le projet llama.cpp a publié la version b10781, qui inclut une correction pour le chemin de déquantification de l'attention rapide (FA) Vulkan. La mise à jour résout un problème où le shader vérifiait incorrectement `nb[3]` même lorsque `ne[3] == 1`, ce qui empêchait le chemin de s'activer que lorsque le cache était plein.

  • Ignore la vérification de `nb[3]` lorsque `ne[3] == 1` car le shader ne le lit jamais pour un seul flux.
  • Résout une erreur logique où les vues du cache conservaient la stride du tampon complet, réduisant l'ancienne vérification à `n_kv == kv_size`.
  • Fournit des binaires pour macOS (Apple Silicon et Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm) et openEuler.

Cette correction garantit que le chemin de déquantification FA Vulkan s'active correctement lors de l'inférence plutôt que d'être restreint aux états de cache plein.