O projeto llama.cpp lançou a compilação b10517, introduzindo várias melhorias específicas para Vulkan no caminho de desquantização do flash attention (FA). As principais alterações incluem desquantizar q8_0 KV uma vez em coopmat1, pular o caminho de desquantização FA no coopmat2 e excluir Intel Xe1 do caminho de desquantização FA.
- O Vulkan agora faz fallback em vez de abortar quando o scratch do FA excede maxStorageBufferRange.
- A versão requer um layout específico de KV-cache no caminho de desquantização FA.
- Verificações de permutação para o caminho FA foram ajustadas e o tempo de prealloc_x_need_sync foi corrigido.
- Foram adicionados testes para cenários K/V FA com alocação contígua.
Esta atualização melhora a estabilidade e o desempenho para usuários do Vulkan ao abordar casos extremos no gerenciamento de memória e compatibilidade de hardware.