Le projet llama.cpp a publié la version b10718, qui comprend une mise à jour significative de son backend CUDA. Le changement le plus notable est l'extension de la fusion Mixture of Experts (MOE) pour prendre en charge le décodage spéculatif (specdec), répondant aux limitations précédentes où la fusion MOE glu et topk-router était restreinte au traitement d'un seul token à la fois.
- CUDA : Fusion MOE étendue à specdec, supprimant la restriction de token unique pour les fusions MOE glu et topk-router antérieures.
- Ajout du support du cas SWIGLU_CLAMP à l'implémentation de fusion MOE multi-token.
- Commentaires de revue du pull request #27621 pris en compte.
Cette mise à jour améliore les performances des modèles utilisant le décodage spéculatif en activant des opérations fusionnées plus efficaces sur les GPU NVIDIA.