llama.cpp b10256 版本包含一项更改,用于并行化 SYCL 设备的非连续拼接内核。此次更新将启动几何结构从单通道工作组修改为使用 `SYCL_CONCAT_BLOCK_SIZE` 的工作组。
- SYCL 非连续拼接内核现在启动更宽的工作组以提高并行度。
- 在配备 Qwen3.6-27B 的 Arc Pro B70 上的基准测试显示吞吐量增加了 9.4%(从 920 到 1006 tok/s)。
- 该版本为 macOS、Linux、Windows、Android 和 openEuler 提供了适用于 CPU、CUDA、Vulkan、ROCm、OpenVINO 和 SYCL 后端的二进制文件。
此优化提升了使用 SYCL 后端的 Intel GPU 上的推理性能。