La version llama.cpp b11463 inclut une mise à jour SYCL qui active MKL flash attention pour la forme spécifique de Multi-Latent Attention (MLA) de GLM-4.7 Flash, qui était précédemment rejetée par le dispatcher.
- Le changement admet la forme 576/576/512 GQA-20 F16 dans le pipeline MKL et gère V cache comme une vue en stride des lignes K.
- Une tentative de stockage des scores MKL flash attention en F16 pour réduire le trafic mémoire a été incluse, mais a été annulée par la suite dans cette compilation.
- Sur un Intel Arc Pro B70, l'optimisation MLA a amélioré le traitement du prompt (pp8192) de 432.80 à 1292.29 tok/s, soit une accélération de 2.99x.
- La version fournit des binaires pour macOS, Linux, Windows, Android et openEuler sur les backends CPU, CUDA, ROCm, Vulkan, OpenVINO et SYCL.