Le projet llama.cpp a publié la compilation b10517, introduisant plusieurs améliorations spécifiques à Vulkan dans le chemin de déquantisation de l'attention flash (FA). Les changements clés incluent la déquantisation de q8_0 KV une fois dans coopmat1, le saut du chemin de déquantisation FA sur coopmat2 et l'exclusion d'Intel Xe1 du chemin de déquantisation FA.

  • Vulkan effectue maintenant un fallback au lieu d'abandonner lorsque le scratch FA dépasse maxStorageBufferRange.
  • La version nécessite une disposition spécifique de KV-cache dans le chemin de déquantisation FA.
  • Les vérifications de permutation pour le chemin FA ont été resserrées et le timing de prealloc_x_need_sync a été corrigé.
  • Des tests ont été ajoutés pour les scénarios K/V FA alloués de manière contiguë.

Cette mise à jour améliore la stabilité et les performances pour les utilisateurs de Vulkan en traitant des cas limites dans la gestion de la mémoire et la compatibilité matérielle.