Proyek llama.cpp merilis build b11232, yang mencakup pembaruan untuk backend ggml-cpu. Rilis ini berfokus pada pengaktifan flash attention bertegel untuk dimensi kepala bukan kelipatan vektor pada arsitektur x86.

  • Mengaktifkan flash attention bertegel untuk dimensi kepala bukan kelipatan vektor di x86.
  • Menambahkan dukungan AVX2 untuk pemuatan dan penyimpanan termasking di simd_gemm_ukernel_tail.
  • Memperbaiki penanganan softcap FA untuk ubin KV yang dipadatkan.

Pembaruan ini menyediakan biner untuk macOS, Linux, Windows, Android, dan openEuler melalui backend CPU, GPU, dan NPU.