Proyek llama.cpp merilis build b11362, yang memperkenalkan kernel flash attention API tensor baru yang mendukung penyimpanan kunci-nilai (KV) F16. Pembaruan ini tersedia di platform macOS, Linux, Windows, Android, dan iOS dengan berbagai opsi backend termasuk CUDA, Vulkan, dan ROCm.

  • Menambahkan kernel FA tensor untuk dimensi tertentu: DK=DV=512, DK=576/DV=512, dan DK=192/DV=128.
  • Kernel baru mendukung mekanisme attention sinks, ALiBi, dan logit softcap.
  • Binari pra-dibangun disediakan untuk backend CPU, GPU (CUDA 12/13, Vulkan, ROCm 10.0), dan NPU (Snapdragon Hexagon).

Rilis ini memungkinkan komputasi perhatian yang lebih efisien pada konfigurasi perangkat keras yang didukung.