O projeto llama.cpp lançou a compilação b10517, introduzindo várias melhorias específicas para Vulkan no caminho de desquantização do flash attention (FA). As principais alterações incluem desquantizar q8_0 KV uma vez em coopmat1, pular o caminho de desquantização FA no coopmat2 e excluir Intel Xe1 do caminho de desquantização FA.

  • O Vulkan agora faz fallback em vez de abortar quando o scratch do FA excede maxStorageBufferRange.
  • A versão requer um layout específico de KV-cache no caminho de desquantização FA.
  • Verificações de permutação para o caminho FA foram ajustadas e o tempo de prealloc_x_need_sync foi corrigido.
  • Foram adicionados testes para cenários K/V FA com alocação contígua.

Esta atualização melhora a estabilidade e o desempenho para usuários do Vulkan ao abordar casos extremos no gerenciamento de memória e compatibilidade de hardware.