El proyecto llama.cpp lanzó la compilación b11060, que incluye una corrección para el modelo Mamba para garantizar que la entrada de proyección del paso de tiempo sea contigua. Este cambio aborda problemas de disposición de memoria dentro de la implementación de Mamba.

  • El módulo Mamba ahora hace que la entrada de proyección del paso de tiempo sea contigua para prevenir errores.
  • Una optimización posterior omite la operación de copia contigua después de la normalización en la ruta de Mamba.
  • La versión proporciona binarios para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL), Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android y openEuler.

Esta actualización garantiza la estabilidad para los modelos basados en Mamba mientras mantiene un amplio soporte de hardware en el ecosistema llama.cpp.