O projeto llama.cpp lançou a versão b10718, que inclui uma atualização significativa em seu backend CUDA. A mudança mais notável é a extensão da fusão Mixture of Experts (MOE) para suportar decodificação especulativa (specdec), abordando limitações anteriores onde a fusão MOE glu e topk-router era restrita a processar apenas um token por vez.

  • CUDA: Fusão MOE estendida para specdec, removendo a restrição de único token para as fusões anteriores de MOE glu e topk-router.
  • Adicionado suporte ao caso SWIGLU_CLAMP na implementação de fusão MOE multi-token.
  • Comentários de revisão do pull request #27621 foram endereçados.

Esta atualização melhora o desempenho de modelos que usam decodificação especulativa, permitindo operações fundidas mais eficientes em GPUs NVIDIA.