O projeto llama.cpp lançou a compilação b10982, que introduz suporte ao Flash Attention esparsivo por meio do backend Vulkan. Esta atualização direciona-se especificamente aos modelos DSV4 e GLM, permitindo que aproveitem mecanismos de atenção esparsa em hardware de GPU compatível.
- Adiciona suporte a Flash Attention esparsivo para DSV4/GLM na implementação Vulkan.
- Inclui lógica de implementação ajustada e testes adicionados.
- Corrige comportamento não determinístico do atomicAdd.
- Adiciona suporte ao vetor de decodificação cm2 e vinculação f16vec4 para vetores de decodificação.
- Simplifica a lógica e melhora a consistência dos nomes das variáveis.
O lançamento fornece binários pré-compilados para macOS, Linux, Windows, Android e openEuler nos backends CPU, CUDA, ROCm, OpenVINO, SYCL e Vulkan.