O projeto llama.cpp lançou a versão b10164, introduzindo uma nova implementação de multiplicação de matriz SSD em blocos projetada para acelerar a fase de prefill dos modelos Mamba-2.

  • ggml-cuda: adicionar matmul SSD em blocos para aceleração do prefill do Mamba-2
  • Correções de correção do CUDA SSD promovendo s0_stride_seq para int64_t e melhorando o agrupamento de memória no ssm_ssd_prepare_dt_kernel
  • Materialização fundida da matriz M no kernel pre_matmul
  • Corrigida a corrida de leitura-escrita sdata no loop de varredura de fallback do prepare_dt
  • Adicionadas correções de SSD CICD para CUDA, HIP, MUSA e MSVC

Esta atualização fornece kernels GPU otimizados para arquiteturas específicas de modelos de espaço de estados, mantendo ampla compatibilidade com os backends CPU, Vulkan, ROCm, OpenVINO e SYCL.