llama.cpp 项目发布了版本 b10795,其中包括针对 SYCL 后端的新的优化。此更新启用了在 GGML_SYCL_ENABLE_FUSION 标志下对 RMS_NORM+MUL+ADD 和 ADD+ADD 残差链的融合。

  • 融合的 ADD+ADD 操作重用了与独立 add() 函数相同的广播索引和类型矩阵,支持 f32、f16、i32、i16、bf16 和非连续数据。
  • 融合逻辑中不支持的组合会回退到两次单独的 add() 启动以保持兼容性。

此版本为 macOS、Linux、Windows、Android 和 openEuler 提供了二进制文件,适用于包括 CUDA、ROCm、Vulkan 和 OpenVINO 在内的各种硬件加速器。