llama.cpp 项目发布了 b10330 版本,引入了一项 CUDA 优化,将 rms_norm、乘法和 RoPE 操作融合到单个内核中。此更改伴随着对融合操作的内存范围检查以及针对广播权重的新测试用例。

  • CUDA: 融合 rms_norm + mul + rope (+ view + set_rows)
  • tests: 向 rms_norm_mul_rope 添加广播权重用例
  • CUDA: 在 rms_norm rope 融合前检查内存范围
  • CUDA: 在 rope set_rows 融合中检查内存范围

该版本为 macOS、Linux、Windows、Android 和 iOS 提供了二进制文件,支持包括 CPU、Vulkan、ROCm、OpenVINO、SYCL 和 HIP 在内的各种硬件后端。