llama.cpp 프로젝트는 Mamba2 아키텍처를 위한 핵심 최적화를 포함한 빌드 b10605를 출시했습니다. 이 업데이트는 Mamba2 모델의 입력 및 출력 투영을 평탄화하여 일반 행렬-벡터(GEMV) 연산 대신 일반 행렬 곱셈(GEMM) 연산을 디스패치합니다.
- GEMV 대신 GMM 디스패칭을 활성화하기 위해 mamba2 입출력 투영을 평탄화합니다.
- Mamba2 구현 내의 중복 출력 리쉐이프 연산을 제거합니다.
이 릴리스는 CPU, CUDA, ROCm, Vulkan 및 OpenVINO을 포함한 다양한 하드웨어 백엔드에서 macOS, Linux, Windows, Android 및 openEuler용 바이너리를 제공합니다.