Le projet llama.cpp a publié la compilation b11111, qui introduit des noyaux d'optimisation flash attention basés sur Vulkan pour les chemins split k sur les architectures Xe-LPG Plus, Xe2 et Xe3.

  • Ajout de l'optimisation du noyau Intel FA pour le chemin split k dans Vulkan.
  • Code hôte mis à jour pour gérer la sélection du chemin du noyau split k FA.
  • Correction des échecs de test d'opérateur A770 sur Linux en utilisant coopMatMulAdd() symétrique dans le shader flash_attn_decode_phase_1.
  • Résolution des problèmes editorconfig dans le fichier flash_attn_decode_phase_2.comp.

Cette mise à jour fournit des capacités d'inférence optimisées pour les GPU Intel Arc et résout des problèmes spécifiques de compatibilité des pilotes sur les systèmes Linux.