El proyecto llama.cpp lanzó la versión b10675, que incluye una actualización clave a su backend Vulkan. Esta versión añade soporte de hoisting para IDs de fila y conteos de expertos dentro del código del shader.
- La implementación utiliza IDs de fila elevados en coopmat2.
- Aborda los comentarios de revisión sobre count_experts utilizando vk_op_count_experts_push_constants en lugar de vectores uint crudos.
- El truco fastdiv se aplica a la operación div/mod ne00 en count_experts.
- Los desplazamientos por experto se calculan con subgroupExclusiveAdd donde sea compatible, manteniendo un camino serial como respaldo.
Esta actualización proporciona compilaciones Vulkan optimizadas para macOS, Linux, Windows y Android en varios backends de hardware, incluyendo CUDA, ROCm y OpenCL.