Проект llama.cpp выпустил сборку b10982, которая вводит поддержку разреженного Flash Attention через бэкенд Vulkan. Это обновление специально ориентировано на модели DSV4 и GLM, позволяя им использовать механизмы разреженного внимания на совместимом оборудовании GPU.

  • Добавлена поддержка разреженного Flash Attention для DSV4/GLM во внедрении Vulkan.
  • Включена оптимизированная логика реализации и добавлены тесты.
  • Исправлено недетерминированное поведение atomicAdd.
  • Добавлена поддержка векторов декодирования cm2 и привязка f16vec4 для векторов декодирования.
  • Упрощена логика и улучшена согласованность имён переменных.

Релиз предоставляет предварительно скомпилированные бинарные файлы для macOS, Linux, Windows, Android и openEuler через бэкенды CPU, CUDA, ROCm, OpenVINO, SYCL и Vulkan.