Le projet llama.cpp a publié la version b10704, qui met à jour le backend CUDA pour utiliser le chemin optimisé mm_ids_helper pour n'importe quel nombre d'experts utilisés (n_expert_used). Auparavant, ce chemin rapide était restreint par les règles de divisibilité de la taille du warp, forçant la plupart des comptes à revenir à une implémentation générique plus lente.

  • L'optimisation généralise le remplissage jusqu'à la puissance deux suivante, permettant des cas comme n_expert_used = 10 d'utiliser le chemin rapide.
  • Mesuré sur Qwen3.8-Flash-Next avec 512 experts et 10 utilisés à un contexte de 55k sur une RTX PRO 6000, la vitesse de traitement du prompt est passée de 2334 à 2600 tokens par seconde.
  • Les performances de génération de tokens restent inchangées car l'optimisation cible le traitement des tokens par lots.

Ce changement améliore la latence d'inférence pour les modèles utilisant des architectures Mixture of Experts en réduisant la surcharge lors du traitement du prompt.