El proyecto llama.cpp lanzó la versión b10632, que introduce una optimización de MMA SSD fragmentado para el prellenado de Mamba-2 a través de ggml-metal.
- Añade kernels WIP de SSM_SCAN SSD fragmentado para prellenado multi-token en Metal.
- Elimina la ruta SSD escalar en favor de MMA combinado con una cola secuencial.
- Reserva K tokens para instantáneas de retroceso del kernel secuencial y restablece la concurrencia entre MMA y seq tail.
- Especializa la cola ssm_scan con una plantilla y actualiza las constantes para mayor claridad.
Esta actualización proporciona binarios para macOS, iOS, Linux, Windows, Android y openEuler en varios backends de hardware, incluyendo CPU, CUDA, ROCm, Vulkan y OpenVINO.