O projeto llama.cpp lançou a compilação b11362, que introduz um novo kernel de flash attention para a API tensorial suportando armazenamento de chave-valor (KV) em F16. Esta atualização está disponível nas plataformas macOS, Linux, Windows, Android e iOS com várias opções de backend, incluindo CUDA, Vulkan e ROCm.
- Adiciona kernels FA tensoriais para dimensões específicas: DK=DV=512, DK=576/DV=512 e DK=192/DV=128.
- O novo kernel suporta mecanismos de attention sinks, ALiBi e logit softcap.
- Binários pré-compilados são fornecidos para backends de CPU, GPU (CUDA 12/13, Vulkan, ROCm 10.0) e NPU (Snapdragon Hexagon).
Este lançamento permite um cálculo de atenção mais eficiente em configurações de hardware compatíveis.