Проект llama.cpp выпустил сборку b11362, которая представляет новое ядро flash attention для тензорного API, поддерживающее хранение ключей и значений (KV) в формате F16. Это обновление доступно на платформах macOS, Linux, Windows, Android и iOS с различными вариантами бэкендов, включая CUDA, Vulkan и ROCm.
- Добавлены тензорные ядра FA для конкретных размерностей: DK=DV=512, DK=576/DV=512 и DK=192/DV=128.
- Новое ядро поддерживает механизмы attention sinks, ALiBi и logit softcap.
- Предоставлены предварительно собранные двоичные файлы для бэкендов CPU, GPU (CUDA 12/13, Vulkan, ROCm 10.0) и NPU (Snapdragon Hexagon).
Это обновление позволяет выполнять вычисления внимания более эффективно на поддерживаемых конфигурациях оборудования.