El proyecto llama.cpp lanzó la compilación b10871, introduciendo un shader mul_mat_vec_iq4_xs dedicado para la ruta dmmv en Vulkan. Este cambio reemplaza la implementación genérica de respaldo anterior para mejorar el rendimiento en hardware RDNA4.
- El nuevo shader proporciona una generación de tokens aproximadamente 6-17% más rápida dependiendo del modelo utilizado.
- Se eliminó una rama experimental que intentaba desenrollar completamente el bucle del bloque para n_it <= 8, ya que era funcionalmente equivalente al bucle simple mantenido en el código.
- Los binarios están disponibles para macOS, Linux, Windows, Android y openEuler a través de los backends CPU, CUDA, ROCm, OpenVINO, SYCL y Vulkan.