O projeto llama.cpp lançou a versão b11424, que inclui uma correção para um erro de escrita fora dos limites da memória compartilhada no backend do Vulkan ao usar o Flash Attention.
Esta atualização fornece binários pré-compilados para macOS (Apple Silicon e Intel), Linux (CPU, CUDA, ROCm, OpenVINO, SYCL, Snapdragon), Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, ROCm), Android e iOS. O lançamento também inclui a interface do usuário do llama.cpp.
A compilação para KleidiAI no macOS Apple Silicon está atualmente desabilitada nesta versão.