El proyecto llama.cpp lanzó la compilación b10714, que incluye optimizaciones específicas para el backend de Vulkan dirigido al hardware AMD Strix Halo. La actualización ajusta los conteos de filas de multiplicación de matriz por vector para mejorar el rendimiento durante la inferencia en lotes.

  • Vulkan: Establece 4 filas estáticas para operaciones mat-vec en arquitecturas RDNA3 con más de cuatro columnas, ya que esta configuración tiene mejores resultados en benchmarks que la predeterminada.
  • Vulkan: Aplica una configuración estática de 4 filas para mul_mat_vec_id en máquinas Strix Halo, demostrando ser más rápida en varios tipos y tamaños de lotes en comparación con los valores predeterminados.

Estos cambios proporcionan ganancias de rendimiento tangibles para usuarios que ejecutan llama.cpp en GPUs basadas en RDNA3 como Strix Halo.