El proyecto llama.cpp lanzó la versión b10675, que incluye una actualización clave a su backend Vulkan. Esta versión añade soporte de hoisting para IDs de fila y conteos de expertos dentro del código del shader.

  • La implementación utiliza IDs de fila elevados en coopmat2.
  • Aborda los comentarios de revisión sobre count_experts utilizando vk_op_count_experts_push_constants en lugar de vectores uint crudos.
  • El truco fastdiv se aplica a la operación div/mod ne00 en count_experts.
  • Los desplazamientos por experto se calculan con subgroupExclusiveAdd donde sea compatible, manteniendo un camino serial como respaldo.

Esta actualización proporciona compilaciones Vulkan optimizadas para macOS, Linux, Windows y Android en varios backends de hardware, incluyendo CUDA, ROCm y OpenCL.