O projeto llama.cpp lançou a versão b10899, introduzindo melhorias específicas de desempenho em seu backend Vulkan. A atualização foca na otimização de operações matriciais para a família de modelos Qwen e no aprimoramento do desempenho geral com M pequeno.

  • Otimiza mul_mat com m=1 trocando as matrizes A/B no Vulkan.
  • Melhora o desempenho para dimensões M pequenas.
  • Habilita o suporte split_k com valores M pequenos.
  • Ajusta a seleção de blocos pequenos vs. médios para coopmat2 dependendo de M em vez de apenas N.

Essas alterações visam melhorar a eficiência de inferência em hardware compatível com Vulkan, particularmente para modelos como Qwen que se beneficiam das otimizações matriciais especificadas.