Le projet llama.cpp a publié la version b11140, qui inclut une optimisation CUDA permettant d'activer sparse-fa pour le préremplissage dsv4. Cette mise à jour résout les problèmes de performance dans le processus de balayage du masque flash attention en templateant les noyaux pour permettre le déroulement des boucles au moment de la compilation.
- La boucle de requête de `flash_attn_mask_to_sparse_indices` est désormais bornée au moment de la compilation, réduisant le temps de balayage de 46 à 17 microsecondes pour les formes de décodage clairsemé avec 49k colonnes.
- Les vérifications hors limites pour le balayage du masque clairsemé ont été déplacées vers le code hôte, permettant à l'opération clairsemée par lots sur un contexte de 49k de passer de 586 à 244 microsecondes.
Cette version fournit des binaires pour macOS, Linux, Windows, Android et openEuler via les backends CPU, GPU et NPU.