La versión llama.cpp b11463 incluye una actualización de SYCL que habilita MKL flash attention para la forma específica de Multi-Latent Attention (MLA) de GLM-4.7 Flash, que anteriormente era rechazada por el despachador.
- El cambio admite la forma 576/576/512 GQA-20 F16 en la canalización MKL y maneja V cache como una vista estridada de las filas K.
- Se incluyó un intento de almacenar las puntuaciones de MKL flash attention en F16 para reducir el tráfico de memoria, pero se revirtió posteriormente en esta compilación.
- En un Intel Arc Pro B70, la optimización MLA mejoró el procesamiento del prompt (pp8192) de 432.80 a 1292.29 tok/s, una aceleración de 2.99x.
- La versión proporciona binarios para macOS, Linux, Windows, Android y openEuler en los backends CPU, CUDA, ROCm, Vulkan, OpenVINO y SYCL.