La version b10208 de llama.cpp introduit le support SYCL pour l'attention flash GEMM oneMKL, permettant l'accélération matérielle XMX pour le traitement des prompts. Ce changement améliore considérablement la vitesse d'inférence sur les GPU Intel Arc en utilisant des noyaux MKL au lieu du chemin TILE par défaut.
- Les benchmarks de performance montrent un gain de vitesse de 1,97x pour Gemma-4-26B (1473 t/s contre 746 t/s) et de 1,85x pour Qwen3.6-27B (609 t/s contre 330 t/s) sur le matériel B70/Battlemage.
- L'implémentation corrige les bogues de disposition entrelacée des destinations dans le noyau de normalisation qui corrompaient précédemment les sorties d'attention pour la plupart des modèles.
- L'attention flash MKL est désormais activée pour tous les types de cache KV (F16, BF16, F32 et quantifiés), levant les restrictions précédentes limitées aux seuls caches quantifiés.
- De nouvelles variables d'environnement permettent aux utilisateurs d'activer le débogage, de désactiver la fonctionnalité ou de contrôler les seuils d'activation via GGML_SYCL_ENABLE_MKL_FA.
Cette mise à jour offre des réductions substantielles de latence pour les opérations de préremplissage multi-tokens sur le matériel Intel compatible tout en maintenant une perplexité équivalente aux implémentations standard.