O projeto llama.cpp lançou a versão b10632, que introduz uma otimização de MMA SSD em chunks para o prefill do Mamba-2 via ggml-metal.
- Adiciona kernels WIP de SSM_SCAN SSD em chunks para prefill multi-token no Metal.
- Remove o caminho SSD escalar em favor do MMA combinado com uma cauda sequencial.
- Reserva K tokens para snapshots de rollback do kernel sequencial e redefine a concorrência entre MMA e seq tail.
- Especializa a cauda ssm_scan com um template e atualiza constantes para clareza.
Esta atualização fornece binários para macOS, iOS, Linux, Windows, Android e openEuler em vários backends de hardware, incluindo CPU, CUDA, ROCm, Vulkan e OpenVINO.