O projeto llama.cpp lançou a compilação b11232, que inclui atualizações para o backend ggml-cpu. O lançamento foca em habilitar flash attention em blocos para dimensões de cabeça não múltiplas do vetor em arquiteturas x86.

  • Habilitado flash attention em blocos para dimensões de cabeça não múltiplas do vetor no x86.
  • Adicionado suporte AVX2 para carregamento e armazenamento mascarado em simd_gemm_ukernel_tail.
  • Corrigido o tratamento de softcap FA para tiles KV preenchidos.

Esta atualização fornece binários para macOS, Linux, Windows, Android e openEuler através dos backends CPU, GPU e NPU.