El proyecto llama.cpp lanzó la versión b10899, introduciendo mejoras específicas de rendimiento en su backend de Vulkan. La actualización se centra en optimizar las operaciones matriciales para la familia de modelos Qwen y mejorar el rendimiento general con M pequeño.
- Optimiza mul_mat con m=1 intercambiando las matrices A/B en Vulkan.
- Mejora el rendimiento para dimensiones M pequeñas.
- Habilita el soporte split_k con valores M pequeños.
- Ajusta la selección de bloques pequeños vs. medianos para coopmat2 dependiendo de M en lugar de solo N.
Estos cambios tienen como objetivo mejorar la eficiencia de inferencia en hardware compatible con Vulkan, particularmente para modelos como Qwen que se benefician de las optimizaciones matriciales especificadas.