El proyecto llama.cpp lanzó la versión b10164, introduciendo una nueva implementación de multiplicación de matrices SSD fragmentada diseñada para acelerar la fase de prefill de los modelos Mamba-2.

  • ggml-cuda: añadir matmul SSD fragmentado para acelerar el prefill de Mamba-2
  • Correcciones de corrección de CUDA SSD promoviendo s0_stride_seq a int64_t y mejorando la coalescencia de memoria en ssm_ssd_prepare_dt_kernel
  • Materialización fusionada de la matriz M en el kernel pre_matmul
  • Corregida la carrera de lectura-escritura sdata en el bucle de escaneo de respaldo de prepare_dt
  • Añadidas correcciones de SSD CICD para CUDA, HIP, MUSA y MSVC

Esta actualización proporciona kernels GPU optimizados para arquitecturas específicas de modelos de espacio de estados mientras mantiene una amplia compatibilidad con los backends CPU, Vulkan, ROCm, OpenVINO y SYCL.