La version llama.cpp b10728 introduit une implémentation CUDA du XOR swizzle pour les tuiles fp16 K,V de mémoire partagée de Flash Attention. Cette mise à jour résout également une condition de course sur la mémoire partagée de Flash Attention sur le matériel DGX Spark.
- Implémente le flash attention avec XOR swizzle et des tuiles fp16 pour CUDA.
- Corrige l'utilisation d'un pointeur générique 64 bits au lieu d'un pointeur partagé 32 bits.
- Ajoute des cas de test pour le swizzle et limite la synchronisation uniquement au chemin swizzlé.
- Autorise le swizzling pour les formes non puissances de 2 où nbatch_2%32==0.
- Refactorise la logique ldmatrix du swizzle Flash Attention en fonctions utilitaires.
La version fournit des binaires pour macOS, Linux, Windows, Android et openEuler via les backends CPU, CUDA, Vulkan, ROCm, OpenVINO et SYCL.