La version llama.cpp b11265 inclut une correction pour la gestion des modèles Mixture of Experts (MoE) par le backend Vulkan. La mise à jour corrige la façon dont `mat_mul_id` sélectionne les tuiles de multiplication matricielle, résolvant un problème de performance où les travailleurs restaient inactifs lors du dispatch.

  • Auparavant, la sélection des tuiles dépendait du nombre total de tokens, ce qui était incorrect pour les grilles de dispatch MoE où le N réel par groupe de travail correspond aux lignes par expert.
  • Sur des modèles comme Sarvam 30B avec pp128, cette erreur amenait le sélecteur à choisir des tuiles pour environ 6 lignes actives au lieu de 128.
  • La correction garantit que tous les travailleurs d'un groupe ont du travail à faire, éliminant le temps perdu qui représentait auparavant 55 % de la durée du job.

Ce changement améliore l'efficacité de l'inférence pour les modèles MoE sur Vulkan en assurant une répartition correcte de la charge de travail entre les travailleurs GPU.