A versão llama.cpp b10728 introduz uma implementação CUDA do XOR swizzle para os tiles fp16 K,V de memória compartilhada do Flash Attention. Esta atualização também resolve uma condição de corrida na memória compartilhada do Flash Attention em hardware DGX Spark.
- Implementa flash attention com XOR swizzle e tiles fp16 para CUDA.
- Corrige o uso de um ponteiro genérico de 64 bits em vez de um ponteiro compartilhado de 32 bits.
- Adiciona casos de teste para swizzle e limita a sincronização apenas ao caminho swizzled.
- Permite swizzling para formas que não são potências de 2 onde nbatch_2%32==0.
- Refatora a lógica ldmatrix do swizzle do Flash Attention em funções auxiliares.
A versão fornece binários para macOS, Linux, Windows, Android e openEuler através dos backends CPU, CUDA, Vulkan, ROCm, OpenVINO e SYCL.