Proyek llama.cpp merilis versi b10632, yang memperkenalkan optimasi MMA SSD chunked untuk prefill Mamba-2 melalui ggml-metal.

  • Menambahkan kernel WIP SSM_SCAN SSD chunked untuk prefill multi-token di Metal.
  • Melepas jalur SSD skalar demi MMA yang digabungkan dengan ekor sekuensial.
  • Menyisihkan K token untuk snapshot rollback kernel sekuensial dan mereset konkurensi antara MMA dan seq tail.
  • Menspesialisasikan ekor ssm_scan dengan template dan memperbarui konstanta untuk kejelasan.

Pembaruan ini menyediakan biner untuk macOS, iOS, Linux, Windows, Android, dan openEuler di berbagai backend perangkat keras termasuk CPU, CUDA, ROCm, Vulkan, dan OpenVINO.