O projeto llama.cpp lançou a versão b10632, que introduz uma otimização de MMA SSD em chunks para o prefill do Mamba-2 via ggml-metal.

  • Adiciona kernels WIP de SSM_SCAN SSD em chunks para prefill multi-token no Metal.
  • Remove o caminho SSD escalar em favor do MMA combinado com uma cauda sequencial.
  • Reserva K tokens para snapshots de rollback do kernel sequencial e redefine a concorrência entre MMA e seq tail.
  • Especializa a cauda ssm_scan com um template e atualiza constantes para clareza.

Esta atualização fornece binários para macOS, iOS, Linux, Windows, Android e openEuler em vários backends de hardware, incluindo CPU, CUDA, ROCm, Vulkan e OpenVINO.