The llama.cpp project released version b10632, which introduces a chunked SSD MMA optimization for Mamba-2 prefill via ggml-metal.

  • Adds WIP chunked SSD SSM_SCAN kernels for multi-token prefill on Metal.
  • Drops the scalar SSD path in favor of MMA combined with a sequential tail.
  • Reserves K tokens for sequential kernel rollback snapshots and resets concurrency between MMA and seq tail.
  • Specializes ssm_scan tail with a template and updates constants for clarity.

This update provides binaries for macOS, iOS, Linux, Windows, Android, and openEuler across various hardware backends including CPU, CUDA, ROCm, Vulkan, and OpenVINO.