El proyecto llama.cpp ha lanzado la versión b11062, que incluye una solicitud de extracción que habilita el soporte de Flash Attention (FA) disperso para el modelo Qwen4.

Esta actualización es parte del lanzamiento más amplio b11062, que proporciona binarios para macOS, Linux, Windows, Android y openEuler en CPU, GPU (CUDA, ROCm, Vulkan) y backends de aceleradores de IA.

El cambio específico mencionado en las notas de la versión añade capacidades FA dispersas para Qwen4 con el fin de mejorar la eficiencia.