O projeto llama.cpp lançou a compilação b10714, que inclui otimizações específicas para o backend do Vulkan direcionado ao hardware AMD Strix Halo. A atualização ajusta as contagens de linhas de multiplicação de matriz por vetor para melhorar o desempenho durante a inferência em lote.

  • Vulkan: Define 4 linhas estáticas para operações mat-vec em arquiteturas RDNA3 com mais de quatro colunas, pois essa configuração tem benchmarks mais rápidos que o padrão.
  • Vulkan: Aplica uma configuração estática de 4 linhas para mul_mat_vec_id em máquinas Strix Halo, provando ser mais rápida em vários tipos e tamanhos de lote em comparação com os padrões.

Essas mudanças fornecem ganhos de desempenho tangíveis para usuários executando llama.cpp em GPUs baseadas em RDNA3 como o Strix Halo.