Proyek llama.cpp merilis build b10605, yang mencakup optimisasi kunci untuk arsitektur Mamba2. Pembaruan ini meratakan proyeksi input dan output model Mamba2 untuk mengirim operasi Perkalian Matriks Umum (GEMM) alih-alih operasi Perkalian Matriks Umum oleh Vektor (GEMV).
- Meratakan proyeksi in/out mamba2 untuk memungkinkan pengiriman GMM daripada GEMV.
- Menghapus operasi reshaping output yang redundan di dalam implementasi Mamba2.
Rilis ini menyediakan biner untuk macOS, Linux, Windows, Android, dan openEuler di berbagai backend perangkat keras termasuk CPU, CUDA, ROCm, Vulkan, dan OpenVINO.