La versión llama.cpp b11463 incluye una actualización de SYCL que habilita MKL flash attention para la forma específica de Multi-Latent Attention (MLA) de GLM-4.7 Flash, que anteriormente era rechazada por el despachador.

  • El cambio admite la forma 576/576/512 GQA-20 F16 en la canalización MKL y maneja V cache como una vista estridada de las filas K.
  • Se incluyó un intento de almacenar las puntuaciones de MKL flash attention en F16 para reducir el tráfico de memoria, pero se revirtió posteriormente en esta compilación.
  • En un Intel Arc Pro B70, la optimización MLA mejoró el procesamiento del prompt (pp8192) de 432.80 a 1292.29 tok/s, una aceleración de 2.99x.
  • La versión proporciona binarios para macOS, Linux, Windows, Android y openEuler en los backends CPU, CUDA, ROCm, Vulkan, OpenVINO y SYCL.