Проект llama.cpp выпустил версию b11062, которая включает pull request с поддержкой разреженного Flash Attention (FA) для модели Qwen4.
Это обновление является частью более широкого выпуска b11062, который предоставляет бинарные файлы для macOS, Linux, Windows, Android и openEuler для CPU, GPU (CUDA, ROCm, Vulkan) и ускорителей ИИ.
Конкретное изменение, указанное в примечаниях к выпуску, добавляет возможности разреженного FA для Qwen4 с целью повышения эффективности.