Le projet llama.cpp a publié la compilation b11232, qui inclut des mises à jour pour le backend ggml-cpu. La publication se concentre sur l'activation de l'attention flash en tuiles pour les dimensions de tête non multiples du vecteur sur les architectures x86.

  • Activation de l'attention flash en tuiles pour les dimensions de tête non multiples du vecteur sur x86.
  • Ajout du support AVX2 pour le chargement et la sauvegarde masqués dans simd_gemm_ukernel_tail.
  • Correction de la gestion du softcap FA pour les tuiles KV remplies.

Cette mise à jour fournit des binaires pour macOS, Linux, Windows, Android et openEuler via les backends CPU, GPU et NPU.