Proyek llama.cpp merilis versi b11140, yang mencakup optimasi CUDA yang mengaktifkan sparse-fa untuk prefill dsv4. Pembaruan ini mengatasi masalah kinerja dalam proses pemindaian mask flash attention dengan membuat template kernel untuk memungkinkan unrolling loop pada waktu kompilasi.
- Loop kueri `flash_attn_mask_to_sparse_indices` sekarang dibatasi pada waktu kompilasi, mengurangi waktu pemindaian dari 46 menjadi 17 mikrodetik untuk bentuk decode sparse dengan 49k kolom.
- Pemeriksaan out-of-bounds untuk pemindaian mask sparse dipindahkan ke kode host, memungkinkan operasi sparse batched pada konteks 49k turun dari 586 menjadi 244 mikrodetik.
Rilis ini menyediakan biner untuk macOS, Linux, Windows, Android, dan openEuler di seluruh backend CPU, GPU, dan NPU.