llama.cpp b10208 版本引入了对 oneMKL GEMM flash attention 的 SYCL 支持,从而启用 XMX 硬件加速以处理提示。这一变更通过利用 MKL 内核而非默认的 TILE 路径,显著提升了 Intel Arc GPU 上的推理速度。

  • 性能基准测试显示,在 B70/Battlemage 硬件上,Gemma-4-26B 的速度提升了 1.97 倍(1473 t/s 对比 746 t/s),Qwen3.6-27B 的速度提升了 1.85 倍(609 t/s 对比 330 t/s)。
  • 该实现修复了 normalize 内核中交错目标布局的 bug,这些 bug 此前会导致大多数模型的注意力输出损坏。
  • MKL flash attention 现已对所有 KV 缓存类型(F16、BF16、F32 和量化)启用,移除了之前仅针对量化缓存的限制。
  • 新的环境变量允许用户通过 GGML_SYCL_ENABLE_MKL_FA 启用调试、禁用该功能或控制激活阈值。

此更新在保持与标准实现相同的困惑度(perplexity)的同时,为兼容 Intel 硬件上的多 token 预填充操作提供了显著的延迟降低。