Proyek llama.cpp merilis build b11111, yang memperkenalkan kernel optimasi flash attention berbasis Vulkan untuk jalur split k pada arsitektur Xe-LPG Plus, Xe2, dan Xe3.

  • Menambahkan optimasi kernel Intel FA untuk jalur split k di Vulkan.
  • Memperbarui kode host untuk menangani pemilihan jalur kernel split k FA.
  • Memperbaiki kegagalan uji operator A770 Linux dengan menggunakan coopMatMulAdd() simetris di shader flash_attn_decode_phase_1.
  • Menyelesaikan masalah editorconfig dalam file flash_attn_decode_phase_2.comp.

Pembaruan ini menyediakan kemampuan inferensi yang dioptimalkan untuk GPU Intel Arc dan menyelesaikan masalah kompatibilitas driver tertentu pada sistem Linux.