El proyecto llama.cpp lanzó la compilación b11362, que introduce un nuevo kernel de flash attention para la API tensorial que admite almacenamiento de claves y valores (KV) en F16. Esta actualización está disponible en las plataformas macOS, Linux, Windows, Android e iOS con varias opciones de backend, incluyendo CUDA, Vulkan y ROCm.

  • Añade kernels FA tensoriales para dimensiones específicas: DK=DV=512, DK=576/DV=512 y DK=192/DV=128.
  • El nuevo kernel admite mecanismos de attention sinks, ALiBi y logit softcap.
  • Se proporcionan binarios precompilados para backends de CPU, GPU (CUDA 12/13, Vulkan, ROCm 10.0) y NPU (Snapdragon Hexagon).

Este lanzamiento permite un cálculo de atención más eficiente en configuraciones de hardware compatibles.