Rilis llama.cpp b10208 memperkenalkan dukungan SYCL untuk oneMKL GEMM flash attention, memungkinkan akselerasi perangkat keras XMX untuk pemrosesan prompt. Perubahan ini secara signifikan meningkatkan kecepatan inferensi pada GPU Intel Arc dengan memanfaatkan kernel MKL alih-alih jalur TILE default.
- Benchmark kinerja menunjukkan percepatan 1.97x untuk Gemma-4-26B (1473 t/s vs 746 t/s) dan percepatan 1.85x untuk Qwen3.6-27B (609 t/s vs 330 t/s) pada perangkat keras B70/Battlemage.
- Implementasi ini memperbaiki bug tata letak tujuan berselang-seling dalam kernel normalisasi yang sebelumnya merusak output attention untuk sebagian besar model.
- MKL flash attention kini diaktifkan untuk semua jenis cache KV (F16, BF16, F32, dan terkuantisasi), menghapus pembatasan sebelumnya hanya pada cache terkuantisasi.
- Variabel lingkungan baru memungkinkan pengguna mengaktifkan debugging, menonaktifkan fitur ini, atau mengendalikan ambang batas aktivasi melalui GGML_SYCL_ENABLE_MKL_FA.
Pembaruan ini memberikan pengurangan latensi yang substansial untuk operasi prefill multi-token pada perangkat keras Intel yang kompatibel sambil mempertahankan kesetaraan perplexity dengan implementasi standar.