La version b11413 de llama.cpp introduit une nouvelle implémentation Vulkan de l'attention flash sparse qui prend en charge les tenseurs de Clé et Valeur quantifiés. Cette mise à jour résout les problèmes de performance de la méthode de compactage précédente, qui était trop coûteuse pour les tâches de décodage avec de grandes fenêtres de contexte.
- La nouvelle approche divise les lignes en segments contigus traités par des sous-groupes ou des threads, utilisant le comptage de votes sur des chargements coalescés pour maintenir une liste d'indices ascendante.
- Des binaires précompilés sont disponibles pour macOS (Apple Silicon et Intel), Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL, Snapdragon), Windows (CPU, Vulkan, CUDA, OpenVINO, SYCL, ROCm), Android et iOS.
- La version inclut également l'interface utilisateur de llama.cpp et des attestations pour la vérification de sécurité.