O projeto llama.cpp lançou a versão b10704, que atualiza o backend CUDA para usar o caminho otimizado mm_ids_helper para qualquer número de especialistas usados (n_expert_used). Anteriormente, esse caminho rápido era restrito por regras de divisibilidade do tamanho do warp, forçando a maioria das contagens a recuar para uma implementação genérica mais lenta.
- A otimização generaliza o preenchimento para a próxima potência de dois, permitindo casos como n_expert_used = 10 utilizar o caminho rápido.
- Medido no Qwen3.8-Flash-Next com 512 especialistas e 10 usados em contexto de 55k em uma RTX PRO 6000, a velocidade de processamento do prompt aumentou de 2334 para 2600 tokens por segundo.
- O desempenho de geração de tokens permanece inalterado, pois a otimização visa o processamento de tokens em lote.
Esta alteração melhora a latência de inferência para modelos que usam arquiteturas Mixture of Experts, reduzindo a sobrecarga durante o processamento do prompt.