The llama.cpp project released version b10632, which introduces a chunked SSD MMA optimization for Mamba-2 prefill via ggml-metal.
- Adds WIP chunked SSD SSM_SCAN kernels for multi-token prefill on Metal.
- Drops the scalar SSD path in favor of MMA combined with a sequential tail.
- Reserves K tokens for sequential kernel rollback snapshots and resets concurrency between MMA and seq tail.
- Specializes ssm_scan tail with a template and updates constants for clarity.
This update provides binaries for macOS, iOS, Linux, Windows, Android, and openEuler across various hardware backends including CPU, CUDA, ROCm, Vulkan, and OpenVINO.