llama.cpp प्रोजेक्ट ने बिल्ड b11370 जारी किया है, जिसमें व्हेक्टर क्वान्टाइज़ेशन (MMVQ) के साथ MoE मिक्सचर आर्किटेक्चर में साझा विशेषज्ञों को फ्यूज करने के लिए एक CUDA अनुकूलन शामिल है। यह बदलाव pull request #29184 का हिस्सा है और stride_col_dst के लिए बफ़र नल चेक और तर्क हैंडलिंग को भी संबोधित करता है।

  • CUDA बैकएंड्स के लिए MMVQ में साझा विशेषज्ञों को फ्यूज करता है।
  • स्थिरता बढ़ाने के लिए बफ़र्स के लिए नल चेक जोड़ता है।
  • stride_col_dst को फ्यूजन तर्कों में ले जाता है।

यह रिलीज़ CPU, Vulkan, ROCm, OpenVINO, SYCL और Snapdragon सहित विभिन्न हार्डवेयर एक्सेलेरेटर के लिए macOS, Linux, Windows, Android और iOS के लिए अपडेटेड बाइनरी प्रदान करती है।