llama.cpp 项目发布了构建版本 b10322,其中包含一项性能优化,可在 SYCL 后端合并 SSM_CONV 窗口加载。
- 在 Arc Pro B70 上,交错的 A/B 测试显示,对于特定的张量形状,速度提升了 1.85x 到 1.87x,而在 n_t=1 时变化可忽略不计。
- 在 Qwen35 27B Q4_K - Medium 模型(64 个块中有 48 个块运行 ssm_conv)上的基准测试表明,提示处理时间改善了 +2.2%。
- 该版本提供了适用于 macOS (Apple Silicon 和 Intel)、iOS、Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL)、Android、Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, HIP) 和 openEuler 的二进制文件。
此更新提高了在兼容硬件上利用 SSM_CONV 操作的工作负载的推理吞吐量。