O projeto llama.cpp lançou a compilação b11232, que inclui atualizações para o backend ggml-cpu. O lançamento foca em habilitar flash attention em blocos para dimensões de cabeça não múltiplas do vetor em arquiteturas x86.
- Habilitado flash attention em blocos para dimensões de cabeça não múltiplas do vetor no x86.
- Adicionado suporte AVX2 para carregamento e armazenamento mascarado em simd_gemm_ukernel_tail.
- Corrigido o tratamento de softcap FA para tiles KV preenchidos.
Esta atualização fornece binários para macOS, Linux, Windows, Android e openEuler através dos backends CPU, GPU e NPU.