llama.cpp परियोजना ने संस्करण b10164 जारी किया, जिसने Mamba-2 मॉडल के प्रीफिल चरण को तेज करने के लिए डिज़ाइन किए गए नए चंक किए गए SSD मैट्रिक्स गुणन कार्यान्वयन का परिचय दिया।

  • ggml-cuda: Mamba-2 प्रीफिल त्वरण के लिए चंक किए गए SSD मैट्रिक्स गुणन जोड़ें
  • s0_stride_seq को int64_t में बढ़ाकर और ssm_ssd_prepare_dt_kernel में मेमोरी कोएलिसिंग को बेहतर बनाकर CUDA SSD सहीता ठीक की गई
  • pre_matmul कर्नेल में M मैट्रिक्स का फ्यूज्ड सामग्रीकरण
  • prepare_dt फॉलबैक स्कैन लूप में sdata रीड-राइट रेस को ठीक किया गया
  • CUDA, HIP, MUSA और MSVC के लिए SSD CICD ठीक किए जोड़े गए

यह अद्यतन विशिष्ट स्टेट-स्पेस मॉडल आर्किटेक्चर के लिए अनुकूलित GPU कर्नेल प्रदान करता है जबकि CPU, Vulkan, ROCm, OpenVINO और SYCL बैकएंड्स के साथ व्यापक संगतता बनाए रखता है।