La versión llama.cpp b11265 incluye una corrección para el manejo de modelos Mixture of Experts (MoE) por parte del backend de Vulkan. La actualización corrige cómo `mat_mul_id` selecciona los tiles de multiplicación de matrices, abordando un problema de rendimiento donde los trabajadores quedaban inactivos durante el envío.

  • Anteriormente, la selección de tiles dependía del conteo total de tokens, lo cual era incorrecto para las cuadrículas de envío de MoE donde el N real por grupo de trabajo son filas por experto.
  • En modelos como Sarvam 30B con pp128, este error causaba que el selector eligiera tiles para aproximadamente 6 filas activas en lugar de 128.
  • La corrección asegura que todos los trabajadores en un grupo tengan trabajo que hacer, eliminando el tiempo desperdiciado que anteriormente representaba el 55% de la duración del trabajo.

Este cambio mejora la eficiencia de inferencia para modelos MoE en Vulkan al garantizar una distribución adecuada de la carga de trabajo entre los trabajadores de la GPU.