El proyecto llama.cpp ha lanzado la versión b11424, que incluye una corrección para un error de escritura fuera de los límites de memoria compartida en el backend de Vulkan al usar Flash Attention.

Esta actualización proporciona binarios precompilados para macOS (Apple Silicon e Intel), Linux (CPU, CUDA, ROCm, OpenVINO, SYCL, Snapdragon), Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, ROCm), Android e iOS. El lanzamiento también incluye la interfaz de usuario de llama.cpp.

La compilación para KleidiAI en macOS Apple Silicon está actualmente deshabilitada en esta versión.