Proyek llama.cpp telah merilis build b10982, yang memperkenalkan dukungan untuk sparse Flash Attention melalui backend Vulkan. Pembaruan ini secara khusus menargetkan model DSV4 dan GLM, memungkinkan mereka memanfaatkan mekanisme perhatian jarang pada perangkat keras GPU yang kompatibel.

  • Menambahkan dukungan sparse Flash Attention untuk DSV4/GLM dalam implementasi Vulkan.
  • Termasuk logika implementasi yang telah disetel dan penambahan pengujian.
  • Memperbaiki perilaku atomicAdd yang nondeterministik.
  • Menambahkan dukungan vektor decode cm2 dan binding f16vec4 untuk vektor decode.
  • Menyederhanakan logika dan meningkatkan konsistensi nama variabel.

Rilis ini menyediakan biner pra-kompilasi untuk macOS, Linux, Windows, Android, dan openEuler di berbagai backend CPU, CUDA, ROCm, OpenVINO, SYCL, dan Vulkan.