O projeto llama.cpp lançou a versão b10718, que inclui uma atualização significativa em seu backend CUDA. A mudança mais notável é a extensão da fusão Mixture of Experts (MOE) para suportar decodificação especulativa (specdec), abordando limitações anteriores onde a fusão MOE glu e topk-router era restrita a processar apenas um token por vez.
- CUDA: Fusão MOE estendida para specdec, removendo a restrição de único token para as fusões anteriores de MOE glu e topk-router.
- Adicionado suporte ao caso SWIGLU_CLAMP na implementação de fusão MOE multi-token.
- Comentários de revisão do pull request #27621 foram endereçados.
Esta atualização melhora o desempenho de modelos que usam decodificação especulativa, permitindo operações fundidas mais eficientes em GPUs NVIDIA.