llama.cpp परियोजना ने Mamba2 आर्किटेक्चर के लिए एक महत्वपूर्ण अनुकूलन शामिल करते हुए बिल्ड b10605 जारी किया। अपडेट Mamba2 मॉडल के इनपुट और आउटपुट प्रक्षेपणों को सामान्य मैट्रिक्स वेक्टर (GEMV) संचालन के बजाय सामान्य मैट्रिक्स गुणा (GEMM) संचालनों को डिस्पैच करने के लिए फ्लैट करता है।

  • GEMV के बजाय GMM डिस्पैचिंग को सक्षम बनाने के लिए mamba2 इन/आउट प्रक्षेपणों को फ्लैट करता है।
  • Mamba2 कार्यान्वयन के भीतर अनावश्यक आउटपुट रीशेप संचालनों को हटाता है।

इस रिलीज़ में CPU, CUDA, ROCm, Vulkan और OpenVINO सहित विभिन्न हार्डवेयर बैकएंड्स पर macOS, Linux, Windows, Android और openEuler के लिए बाइनरी प्रदान करता है।