El proyecto llama.cpp lanzó la compilación b10605, que incluye una optimización clave para la arquitectura Mamba2. La actualización aplanea las proyecciones de entrada y salida de los modelos Mamba2 para enviar operaciones de Multiplicación General de Matrices (GEMM) en lugar de operaciones de Multiplicación General de Matriz por Vector (GEMV).

  • Aplanea las proyecciones in/out de mamba2 para habilitar el envío de GMM en lugar de GEMV.
  • Elimina las operaciones redundantes de reorganización de salida dentro de la implementación de Mamba2.

Esta versión proporciona binarios para macOS, Linux, Windows, Android y openEuler a través de varios backends de hardware que incluyen CPU, CUDA, ROCm, Vulkan y OpenVINO.