llama.cpp 项目发布了构建版本 b10605,其中包含针对 Mamba2 架构的关键优化。该更新将 Mamba2 模型的输入和输出投影展平,以调度通用矩阵乘法 (GEMM) 操作,而不是通用矩阵向量 (GEMV) 操作。

  • 展平 mamba2 的输入/输出投影以启用 GMM 调度而非 GEMV。
  • 移除 Mamba2 实现内部冗余的输出重塑操作。

此版本为 macOS、Linux、Windows、Android 和 openEuler 提供二进制文件,支持包括 CPU、CUDA、ROCm、Vulkan 和 OpenVINO 在内的各种硬件后端。