O projeto llama.cpp lançou a versão b10899, introduzindo melhorias específicas de desempenho em seu backend Vulkan. A atualização foca na otimização de operações matriciais para a família de modelos Qwen e no aprimoramento do desempenho geral com M pequeno.
- Otimiza mul_mat com m=1 trocando as matrizes A/B no Vulkan.
- Melhora o desempenho para dimensões M pequenas.
- Habilita o suporte split_k com valores M pequenos.
- Ajusta a seleção de blocos pequenos vs. médios para coopmat2 dependendo de M em vez de apenas N.
Essas alterações visam melhorar a eficiência de inferência em hardware compatível com Vulkan, particularmente para modelos como Qwen que se beneficiam das otimizações matriciais especificadas.