Le projet llama.cpp a publié la version b11424, qui inclut une correction pour une erreur d'écriture hors des limites de la mémoire partagée dans le backend Vulkan lors de l'utilisation de Flash Attention.

Cette mise à jour fournit des binaires précompilés pour macOS (Apple Silicon et Intel), Linux (CPU, CUDA, ROCm, OpenVINO, SYCL, Snapdragon), Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, ROCm), Android et iOS. La version inclut également l'interface utilisateur de llama.cpp.

La compilation pour KleidiAI sur macOS Apple Silicon est actuellement désactivée dans cette version.