Proyek llama.cpp merilis build b11362, yang memperkenalkan kernel flash attention API tensor baru yang mendukung penyimpanan kunci-nilai (KV) F16. Pembaruan ini tersedia di platform macOS, Linux, Windows, Android, dan iOS dengan berbagai opsi backend termasuk CUDA, Vulkan, dan ROCm.
- Menambahkan kernel FA tensor untuk dimensi tertentu: DK=DV=512, DK=576/DV=512, dan DK=192/DV=128.
- Kernel baru mendukung mekanisme attention sinks, ALiBi, dan logit softcap.
- Binari pra-dibangun disediakan untuk backend CPU, GPU (CUDA 12/13, Vulkan, ROCm 10.0), dan NPU (Snapdragon Hexagon).
Rilis ini memungkinkan komputasi perhatian yang lebih efisien pada konfigurasi perangkat keras yang didukung.