O lançamento llama.cpp b11463 inclui uma atualização SYCL que habilita o MKL flash attention para a forma específica de Multi-Latent Attention (MLA) do GLM-4.7 Flash, que anteriormente era rejeitada pelo despachante.
- A alteração admite a forma 576/576/512 GQA-20 F16 no pipeline MKL e trata o V cache como uma visão em stride das linhas K.
- Uma tentativa de armazenar as pontuações do MKL flash attention em F16 para reduzir o tráfego de memória foi incluída, mas posteriormente revertida nesta compilação.
- Em um Intel Arc Pro B70, a otimização MLA melhorou o processamento do prompt (pp8192) de 432.80 para 1292.29 tok/s, uma aceleração de 2.99x.
- O lançamento fornece binários para macOS, Linux, Windows, Android e openEuler nos backends CPU, CUDA, ROCm, Vulkan, OpenVINO e SYCL.