O projeto llama.cpp lançou a versão b10164, introduzindo uma nova implementação de multiplicação de matriz SSD em blocos projetada para acelerar a fase de prefill dos modelos Mamba-2.
- ggml-cuda: adicionar matmul SSD em blocos para aceleração do prefill do Mamba-2
- Correções de correção do CUDA SSD promovendo s0_stride_seq para int64_t e melhorando o agrupamento de memória no ssm_ssd_prepare_dt_kernel
- Materialização fundida da matriz M no kernel pre_matmul
- Corrigida a corrida de leitura-escrita sdata no loop de varredura de fallback do prepare_dt
- Adicionadas correções de SSD CICD para CUDA, HIP, MUSA e MSVC
Esta atualização fornece kernels GPU otimizados para arquiteturas específicas de modelos de espaço de estados, mantendo ampla compatibilidade com os backends CPU, Vulkan, ROCm, OpenVINO e SYCL.