llama.cpp 项目发布了构建版本 b11060,其中包括对 Mamba 模型的修复,以确保时间步投影输入是连续的。此更改解决了 Mamba 实现中的内存布局问题。
- Mamba 模块现在使时间步投影输入连续,以防止错误。
- 后续优化跳过了 Mamba 路径中归一化后的连续复制操作。
- 该版本为 macOS(Apple Silicon 和 Intel)、iOS、Linux(CPU、Vulkan、CUDA 12/13、ROCm、OpenVINO、SYCL)、Windows(CPU、OpenCL、CUDA 12/13、Vulkan、OpenVINO、SYCL、ROCm)、Android 和 openEuler 提供了二进制文件。
此更新确保了基于 Mamba 的模型的稳定性,同时在 llama.cpp 生态系统中保持广泛的硬件支持。