O projeto llama.cpp aumentou o limite de row-id elevado para a operação mul_mat_id do Vulkan de 256 para 1024 especialistas. Essa mudança aborda gargalos de desempenho em modelos com grandes contagens de especialistas, como Qwen3.8-Flash-Next, que anteriormente executava por um caminho de código mais lento devido a restrições de tamanho de array compartilhado.

A atualização modifica o shader count_experts.comp para usar uma constante MAX_EXPERTS de 1024, aumentando os arrays compartilhados para 12 KiB enquanto permanece dentro da garantia de 16 KiB do Vulkan. No hardware Strix Halo com um batch size de 2048, as multiplicações de matriz de especialista caem de 12,5 para 9,5 ms para iq3_s e de 14,0 para 7,5 ms para iq4_nl por operação. A velocidade de processamento do prompt melhora em aproximadamente 19% em 8k tokens, e os testes do backend MUL_MAT_ID passam com os novos casos de 1024 especialistas.

Essa otimização permite que o llama.cpp manipule eficientemente modelos que excedem o limite anterior de 512 especialistas sem degradação de desempenho em hardware compatível com Vulkan.