O projeto llama.cpp lançou a compilação b10605, que inclui uma otimização chave para a arquitetura Mamba2. A atualização achata as projeções de entrada e saída dos modelos Mamba2 para despachar operações de Multiplicação Geral de Matrizes (GEMM) em vez de operações de Multiplicação Geral de Matriz por Vetor (GEMV).
- Achata as projeções in/out do mamba2 para permitir o despacho de GMM em vez de GEMV.
- Remove operações redundantes de reconfiguração de saída dentro da implementação do Mamba2.
Este lançamento fornece binários para macOS, Linux, Windows, Android e openEuler através de vários backends de hardware incluindo CPU, CUDA, ROCm, Vulkan e OpenVINO.