Проект llama.cpp выпустил сборку b10982, которая вводит поддержку разреженного Flash Attention через бэкенд Vulkan. Это обновление специально ориентировано на модели DSV4 и GLM, позволяя им использовать механизмы разреженного внимания на совместимом оборудовании GPU.
- Добавлена поддержка разреженного Flash Attention для DSV4/GLM во внедрении Vulkan.
- Включена оптимизированная логика реализации и добавлены тесты.
- Исправлено недетерминированное поведение atomicAdd.
- Добавлена поддержка векторов декодирования cm2 и привязка f16vec4 для векторов декодирования.
- Упрощена логика и улучшена согласованность имён переменных.
Релиз предоставляет предварительно скомпилированные бинарные файлы для macOS, Linux, Windows, Android и openEuler через бэкенды CPU, CUDA, ROCm, OpenVINO, SYCL и Vulkan.