Proyek llama.cpp merilis build b10905, yang mencakup penyetelan spesifik Flash Attention untuk CUDA/HIP pada arsitektur gfx1201. Pembaruan ini berfokus pada mengoptimalkan kinerja untuk GPU AMD RDNA4.
- HIP: Mengaktifkan Flash Attention yang dipercepat perkalian matriks (mma) untuk ukuran kepala 256 pada RDNA4 dan menyetel konfigurasi terkait.
- HIP: Lebih memilih grid Flash Attention whole-tile daripada stream-k pada arsitektur AMD WMMA.
- Merevisi log stream_k untuk meningkatkan alur eksekusi.
- Merevisi log pemilihan kernel untuk penargetan perangkat keras yang lebih baik.
Rilis ini menyediakan biner untuk macOS, Linux, Windows, Android, dan openEuler melalui berbagai backend termasuk CPU, CUDA, ROCm, Vulkan, OpenVINO, SYCL, dan OpenCL.