Proyek llama.cpp merilis build b11111, yang memperkenalkan kernel optimasi flash attention berbasis Vulkan untuk jalur split k pada arsitektur Xe-LPG Plus, Xe2, dan Xe3.
- Menambahkan optimasi kernel Intel FA untuk jalur split k di Vulkan.
- Memperbarui kode host untuk menangani pemilihan jalur kernel split k FA.
- Memperbaiki kegagalan uji operator A770 Linux dengan menggunakan coopMatMulAdd() simetris di shader flash_attn_decode_phase_1.
- Menyelesaikan masalah editorconfig dalam file flash_attn_decode_phase_2.comp.
Pembaruan ini menyediakan kemampuan inferensi yang dioptimalkan untuk GPU Intel Arc dan menyelesaikan masalah kompatibilitas driver tertentu pada sistem Linux.