llama.cpp 项目发布了 b10164 版本,引入了一种新的分块 SSD 矩阵乘法实现,旨在加速 Mamba-2 模型的预填充阶段。

  • ggml-cuda: 为 Mamba-2 预填充加速添加分块 SSD 矩阵乘法
  • CUDA SSD 通过将 s0_stride_seq 提升为 int64_t 修复正确性,并改进 ssm_ssd_prepare_dt_kernel 中的内存合并
  • 将 M 矩阵融合到 pre_matmul 内核中
  • 修复了 prepare_dt 回退扫描循环中的 sdata 读写竞争条件
  • 为 CUDA、HIP、MUSA 和 MSVC 添加了 SSD CICD 修复

此更新为特定的状态空间模型架构提供了优化的 GPU 内核,同时保持与 CPU、Vulkan、ROCm、OpenVINO 和 SYCL 后端的广泛兼容性。