Проект llama.cpp выпустил версию b11140, включающую оптимизацию CUDA, обеспечивающую использование sparse-fa для prefill dsv4. Это обновление решает проблемы производительности в процессе сканирования маски flash attention путем шаблонизации ядер для разворачивания циклов на этапе компиляции.

  • Цикл запросов `flash_attn_mask_to_sparse_indices` теперь ограничен на этапе компиляции, что сокращает время сканирования с 46 до 17 микросекунд для разреженных форм декодирования с 49k столбцов.
  • Проверки выхода за границы для сканирования разреженной маски перенесены в код хоста, что позволяет снизить время выполнения пакетной разреженной операции на контексте 49k с 586 до 244 микросекунд.

Этот релиз предоставляет бинарные файлы для macOS, Linux, Windows, Android и openEuler для бэкендов CPU, GPU и NPU.