El proyecto llama.cpp lanzó la versión b10164, introduciendo una nueva implementación de multiplicación de matrices SSD fragmentada diseñada para acelerar la fase de prefill de los modelos Mamba-2.
- ggml-cuda: añadir matmul SSD fragmentado para acelerar el prefill de Mamba-2
- Correcciones de corrección de CUDA SSD promoviendo s0_stride_seq a int64_t y mejorando la coalescencia de memoria en ssm_ssd_prepare_dt_kernel
- Materialización fusionada de la matriz M en el kernel pre_matmul
- Corregida la carrera de lectura-escritura sdata en el bucle de escaneo de respaldo de prepare_dt
- Añadidas correcciones de SSD CICD para CUDA, HIP, MUSA y MSVC
Esta actualización proporciona kernels GPU optimizados para arquitecturas específicas de modelos de espacio de estados mientras mantiene una amplia compatibilidad con los backends CPU, Vulkan, ROCm, OpenVINO y SYCL.