llama.cpp 项目已发布版本 b11424,其中包含对在使用 Flash Attention 时 Vulkan 后端共享内存越界写入错误的修复。
此更新提供了适用于 macOS(Apple Silicon 和 Intel)、Linux(CPU、CUDA、ROCm、OpenVINO、SYCL、Snapdragon)、Windows(CPU、CUDA、Vulkan、OpenVINO、SYCL、ROCm)、Android 和 iOS 的预编译二进制文件。该版本还包含了 llama.cpp 的用户界面。
此版本中 macOS Apple Silicon 上的 KleidiAI 构建当前已禁用。