llama.cpp b11463 版本包含一项 SYCL 更新,该更新启用了针对 GLM-4.7 Flash 特定 Multi-Latent Attention (MLA) 形状的 MKL flash attention,此前该形状被调度器拒绝。
- 此更改允许 576/576/512 GQA-20 F16 形状进入 MKL 流水线,并将 V cache 处理为 K 行的步长视图。
- 包含了一项将 MKL flash attention 分数存储为 F16 以减少内存流量的尝试,但随后在此构建中撤销。
- 在 Intel Arc Pro B70 上,MLA 优化将提示处理 (pp8192) 从 432.80 提升至 1292.29 tok/s,实现了 2.99 倍加速。
- 该版本为 macOS、Linux、Windows、Android 和 openEuler 提供了适用于 CPU、CUDA、ROCm、Vulkan、OpenVINO 和 SYCL 后端的二进制文件。