Le projet llama.cpp a publié la version b10899, introduisant des améliorations de performances spécifiques dans son backend Vulkan. La mise à jour se concentre sur l'optimisation des opérations matricielles pour la famille de modèles Qwen et l'amélioration des performances générales avec un M petit.

  • Optimise mul_mat avec m=1 en échangeant les matrices A/B dans Vulkan.
  • Améliore les performances pour les dimensions M petites.
  • Active le support split_k avec de petites valeurs de M.
  • Ajuste la sélection des tuiles petites vs. moyennes pour coopmat2 en fonction de M plutôt que seulement N.

Ces modifications visent à améliorer l'efficacité de l'inférence sur le matériel compatible Vulkan, en particulier pour les modèles comme Qwen qui bénéficient des optimisations matricielles spécifiées.