La version llama.cpp b11463 inclut une mise à jour SYCL qui active MKL flash attention pour la forme spécifique de Multi-Latent Attention (MLA) de GLM-4.7 Flash, qui était précédemment rejetée par le dispatcher.

  • Le changement admet la forme 576/576/512 GQA-20 F16 dans le pipeline MKL et gère V cache comme une vue en stride des lignes K.
  • Une tentative de stockage des scores MKL flash attention en F16 pour réduire le trafic mémoire a été incluse, mais a été annulée par la suite dans cette compilation.
  • Sur un Intel Arc Pro B70, l'optimisation MLA a amélioré le traitement du prompt (pp8192) de 432.80 à 1292.29 tok/s, soit une accélération de 2.99x.
  • La version fournit des binaires pour macOS, Linux, Windows, Android et openEuler sur les backends CPU, CUDA, ROCm, Vulkan, OpenVINO et SYCL.