El proyecto llama.cpp lanzó la versión b10632, que introduce una optimización de MMA SSD fragmentado para el prellenado de Mamba-2 a través de ggml-metal.

  • Añade kernels WIP de SSM_SCAN SSD fragmentado para prellenado multi-token en Metal.
  • Elimina la ruta SSD escalar en favor de MMA combinado con una cola secuencial.
  • Reserva K tokens para instantáneas de retroceso del kernel secuencial y restablece la concurrencia entre MMA y seq tail.
  • Especializa la cola ssm_scan con una plantilla y actualiza las constantes para mayor claridad.

Esta actualización proporciona binarios para macOS, iOS, Linux, Windows, Android y openEuler en varios backends de hardware, incluyendo CPU, CUDA, ROCm, Vulkan y OpenVINO.