Проект llama.cpp выпустил версию b11424, которая содержит исправление ошибки записи за пределами буфера в разделяемой памяти в бэкенде Vulkan при использовании Flash Attention.

Это обновление предоставляет предварительно скомпилированные двоичные файлы для macOS (Apple Silicon и Intel), Linux (CPU, CUDA, ROCm, OpenVINO, SYCL, Snapdragon), Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, ROCm), Android и iOS. В релиз также входит интерфейс пользователя llama.cpp.

Сборка для KleidiAI на macOS Apple Silicon в этой версии временно отключена.