llama.cpp 项目发布了版本 b10442,引入了针对 Intel Xe 硬件的特定 Vulkan 优化,同时解决了矩阵乘法例程中的内存安全问题。
- 为 Intel Xe 上的 coopmat mul_mm 添加了 SHMEM_STRIDE_PAD 和 APPLY_SLM_A_RESHAPE 标志。
- 修复了 matmul_shmem_support 中 Intel SHMEM_STRIDE_PAD=0 的共享内存估算。
- 实现了共享 kvalues_mxfp4 的缓存行对齐,以改进数据处理。
- 在缓存行填充更改后,解决了 kvalues_mxfp4 初始化中的越界 (OOB) 读取问题。
- 将 SLM-A 重塑调整限制为 Intel Windows 驱动程序,并在必要时还原 mxfp4 缓存行填充。
此版本为 macOS、Linux、Windows、Android 和 openEuler 提供了更新的二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO 和 SYCL 后端。