O projeto llama.cpp lançou a versão b10675, que inclui uma atualização chave para seu backend Vulkan. Este lançamento adiciona suporte a hoisting para IDs de linha e contagens de especialistas dentro do código do shader.
- A implementação usa IDs de linha elevados no coopmat2.
- Aborda o feedback da revisão sobre count_experts usando vk_op_count_experts_push_constants em vez de vetores uint crus.
- O truque fastdiv é aplicado à operação div/mod ne00 em count_experts.
- Os deslocamentos por especialista são computados com subgroupExclusiveAdd onde suportado, mantendo um caminho serial como fallback.
Esta atualização fornece builds Vulkan otimizados para macOS, Linux, Windows e Android em vários backends de hardware, incluindo CUDA, ROCm e OpenCL.