Le projet llama.cpp a publié la compilation b10813, qui introduit une implémentation OpenCL pour les GPU Adreno utilisant le chemin xmem SDPA (Scaled Dot-Product Attention). Cette mise à jour traite également des erreurs numériques dans les mécanismes GQA et l'attention masquée.
- Ajout du chemin Adreno xmem SDPA pour l'accélération OpenCL.
- Suppression de la substitution de profilage de file spécifique à Adreno.
- Correction des erreurs numériques dans GQA et l'attention masquée.
- Introduction de la variable d'environnement GGML_OPENCL_XMEM_SDPA pour contrôler la fonctionnalité.
La version fournit des binaires pour macOS, Linux, Windows, Android et openEuler via des backends CPU, GPU et matériel spécialisé.