O projeto llama.cpp lançou a compilação b10871, introduzindo um shader mul_mat_vec_iq4_xs dedicado para o caminho dmmv no Vulkan. Esta alteração substitui a implementação genérica de fallback anterior para melhorar o desempenho em hardware RDNA4.

  • O novo shader fornece uma geração de tokens aproximadamente 6-17% mais rápida, dependendo do modelo utilizado.
  • Um branch experimental que tentava desenrolar completamente o loop do bloco para n_it <= 8 foi removido, pois era funcionalmente equivalente ao loop simples mantido no código.
  • Os binários estão disponíveis para macOS, Linux, Windows, Android e openEuler nos backends CPU, CUDA, ROCm, OpenVINO, SYCL e Vulkan.