Proyek llama.cpp telah merilis versi b11062, yang mencakup permintaan tarik (pull request) yang mengaktifkan dukungan Flash Attention (FA) jarang untuk model Qwen4.
Pembaruan ini merupakan bagian dari rilis b11062 yang lebih luas, yang menyediakan biner untuk macOS, Linux, Windows, Android, dan openEuler di CPU, GPU (CUDA, ROCm, Vulkan), dan backend akselerator AI.
Perubahan spesifik yang dirujuk dalam catatan rilis menambahkan kemampuan FA jarang untuk Qwen4 guna meningkatkan efisiensi.