Le projet llama.cpp a publié la compilation b10605, qui inclut une optimisation clé pour l'architecture Mamba2. La mise à jour aplatie les projections d'entrée et de sortie des modèles Mamba2 pour dispatcher des opérations de Multiplication Générale de Matrices (GEMM) au lieu d'opérations de Multiplication Générale de Matrice par Vecteur (GEMV).
- Aplatit les projections in/out de mamba2 pour permettre le dispatch de GMM plutôt que GEMV.
- Supprime les opérations de redimensionnement de sortie redondantes au sein de l'implémentation de Mamba2.
Cette version fournit des binaires pour macOS, Linux, Windows, Android et openEuler sur divers backends matériels incluant CPU, CUDA, ROCm, Vulkan et OpenVINO.