El proyecto llama.cpp lanzó la compilación b11232, que incluye actualizaciones al backend ggml-cpu. El lanzamiento se centra en habilitar flash attention en mosaico para dimensiones de cabeza no múltiplo del vector en arquitecturas x86.
- Habilitado flash attention en mosaico para dimensiones de cabeza no múltiplo del vector en x86.
- Añadido soporte AVX2 para carga y almacenamiento enmascarado en simd_gemm_ukernel_tail.
- Corregido el manejo de softcap FA para teselas KV rellenas.
Esta actualización proporciona binarios para macOS, Linux, Windows, Android y openEuler a través de backends CPU, GPU y NPU.