O projeto llama.cpp lançou a versão b11062, que inclui um pull request habilitando o suporte a Flash Attention (FA) esparsa para o modelo Qwen4.
Esta atualização faz parte do lançamento mais amplo b11062, que fornece binários para macOS, Linux, Windows, Android e openEuler em CPU, GPU (CUDA, ROCm, Vulkan) e backends de aceleradores de IA.
A alteração específica mencionada nas notas de lançamento adiciona capacidades FA esparsas para Qwen4 para melhorar a eficiência.