Proyek llama.cpp merilis build b11232, yang mencakup pembaruan untuk backend ggml-cpu. Rilis ini berfokus pada pengaktifan flash attention bertegel untuk dimensi kepala bukan kelipatan vektor pada arsitektur x86.
- Mengaktifkan flash attention bertegel untuk dimensi kepala bukan kelipatan vektor di x86.
- Menambahkan dukungan AVX2 untuk pemuatan dan penyimpanan termasking di simd_gemm_ukernel_tail.
- Memperbaiki penanganan softcap FA untuk ubin KV yang dipadatkan.
Pembaruan ini menyediakan biner untuk macOS, Linux, Windows, Android, dan openEuler melalui backend CPU, GPU, dan NPU.