Rilis b11413 dari llama.cpp memperkenalkan implementasi baru perhatian flash sparse Vulkan yang mendukung tensor Key dan Value terkuantisasi. Pembaruan ini mengatasi masalah kinerja dalam metode kompresi sebelumnya, yang terlalu mahal untuk tugas dekoding dengan jendela konteks besar.
- Pendekatan baru membagi baris menjadi segmen kontigu yang diproses oleh subgrup atau thread, menggunakan penghitungan suara atas muatan koalescen untuk mempertahankan daftar indeks menaik.
- Binari pra-dibangun tersedia untuk macOS (Apple Silicon dan Intel), Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL, Snapdragon), Windows (CPU, Vulkan, CUDA, OpenVINO, SYCL, ROCm), Android, dan iOS.
- Rilis ini juga mencakup UI llama.cpp dan atestasi untuk verifikasi keamanan.