Le projet llama.cpp a publié la compilation b10813, qui introduit une implémentation OpenCL pour les GPU Adreno utilisant le chemin xmem SDPA (Scaled Dot-Product Attention). Cette mise à jour traite également des erreurs numériques dans les mécanismes GQA et l'attention masquée.

  • Ajout du chemin Adreno xmem SDPA pour l'accélération OpenCL.
  • Suppression de la substitution de profilage de file spécifique à Adreno.
  • Correction des erreurs numériques dans GQA et l'attention masquée.
  • Introduction de la variable d'environnement GGML_OPENCL_XMEM_SDPA pour contrôler la fonctionnalité.

La version fournit des binaires pour macOS, Linux, Windows, Android et openEuler via des backends CPU, GPU et matériel spécialisé.