Проект llama.cpp выпустил сборку b11362, которая представляет новое ядро flash attention для тензорного API, поддерживающее хранение ключей и значений (KV) в формате F16. Это обновление доступно на платформах macOS, Linux, Windows, Android и iOS с различными вариантами бэкендов, включая CUDA, Vulkan и ROCm.

  • Добавлены тензорные ядра FA для конкретных размерностей: DK=DV=512, DK=576/DV=512 и DK=192/DV=128.
  • Новое ядро поддерживает механизмы attention sinks, ALiBi и logit softcap.
  • Предоставлены предварительно собранные двоичные файлы для бэкендов CPU, GPU (CUDA 12/13, Vulkan, ROCm 10.0) и NPU (Snapdragon Hexagon).

Это обновление позволяет выполнять вычисления внимания более эффективно на поддерживаемых конфигурациях оборудования.