llama.cpp 项目发布了 b10632 版本,通过 ggml-metal 引入了针对 Mamba-2 预填充的分块 SSD MMA 优化。

  • 为 Metal 上的多 token 预填充添加了 WIP 分块 SSD SSM_SCAN 内核。
  • 弃用标量 SSD 路径,改用与顺序尾部结合的 MMA。
  • 保留 K 个 token 用于顺序内核回滚快照,并重置 MMA 和 seq tail 之间的并发。
  • 使用模板专门化 ssm_scan 尾部,并更新常量以提高清晰度。

此更新为 macOS、iOS、Linux、Windows、Android 和 openEuler 提供了二进制文件,支持包括 CPU、CUDA、ROCm、Vulkan 和 OpenVINO 在内的各种硬件后端。