La version b10677 de llama.cpp corrige un bug critique dans le backend Vulkan où l'absence de dépendances d'alias de vue entraînait un réordonnancement incorrect des nœuds par l'optimiseur de graphe.

  • La correction garantit que `is_src_of` traite correctement deux vues d'un même tenseur comme dépendantes, empêchant les erreurs silencieuses lors du décodage glouton et du décodage spéculatif.
  • Les nœuds avec des opérations telles que NONE, RESHAPE, TRANSPOSE, VIEW ou PERMUTE ne sont plus traités comme des dépendances d'alias, restaurant la liberté de l'optimiseur sans compromettre l'exactitude.
  • Le code est compilé en rendant le paramètre lambda const et en capturant `is_empty` dans `is_src_of`, résolvant les problèmes de visibilité avec les pointeurs non-const.
  • Ce changement corrige spécifiquement les problèmes d'état récurrent pour des modèles comme Qwen3.8 sur du matériel Vulkan AMD et NVIDIA, tandis que CUDA reste inchangé.

La version résout le problème #27805 et fournit des binaires pour macOS, Linux, Windows, Android et openEuler sur CPU, GPU et divers backends d'accélérateurs.