Le projet llama.cpp a publié la version b10201, qui inclut une amélioration clé du backend ggml-webgpu. Cette mise à jour améliore les performances de flash attention lors de la gestion des caches clé-valeur quantifiés pendant la génération de contexte long.
- Traitement vectoriel amélioré de flash attention pour le cache KV quantifié dans ggml-webgpu.
- Correction de bugs liés à la vérification du type de valeur et mise à jour des commentaires.
- Résolution des erreurs de compilation causées par le rebasing.
- Binaires fournis pour macOS (Apple Silicon, Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, HIP, OpenVINO, SYCL) et openEuler.
Cette version permet aux utilisateurs d'exécuter llama.cpp sur une large gamme de plateformes matérielles tout en bénéficiant de mécanismes d'attention optimisés pour des séquences plus longues.