Le projet llama.cpp a publié la compilation b11232, qui inclut des mises à jour pour le backend ggml-cpu. La publication se concentre sur l'activation de l'attention flash en tuiles pour les dimensions de tête non multiples du vecteur sur les architectures x86.
- Activation de l'attention flash en tuiles pour les dimensions de tête non multiples du vecteur sur x86.
- Ajout du support AVX2 pour le chargement et la sauvegarde masqués dans simd_gemm_ukernel_tail.
- Correction de la gestion du softcap FA pour les tuiles KV remplies.
Cette mise à jour fournit des binaires pour macOS, Linux, Windows, Android et openEuler via les backends CPU, GPU et NPU.