llama.cpp 项目发布了版本 b10723,其中包括针对 Intel Xe-LP 图形硬件的 OpenCL 特定优化。此次更新侧重于通过调整量化内核来改进张量生成 (TG) 和预填充 (PP) 性能。

  • 调整了 Q4_K 和 Q5_K mul_mv 操作以增加 N_DST 值,从而在 Intel 设备上实现 2x 激活复用。
  • 专门为 Intel 架构实现了 Q4_K 和 Q5_K mul_mm 操作的 8x8 块配置。
  • 将 Q4_K mul_mv 的 N_DST 从 8 增加到 16,以进一步优化数据处理。

此版本为 macOS、Linux、Windows、Android 和 iOS 提供了更新的二进制文件,支持包括 CUDA、Vulkan、ROCm 和 SYCL 在内的各种后端。