llama.cpp प्रोजेक्ट ने बिल्ड b10181 जारी किया, जिसमें ggml-cuda में एक सुधार शामिल है जो 48 KiB से कम प्रति-ब्लॉक शेयर्ड मेमोरी वाले GPUs पर मैट्रिक्स मल्टीप्लिकेशन क्वैंटाइज़ेशन (MMQ) को अक्षम करता है। पहले, MMQ कॉन्फ़िगरेशन में न्यूनतम 48 KiB की धारणा होती थी, जिससे NVIDIA Pascal GPUs और Moore Threads MTT S70 जैसे डिवाइसों पर फाटल एरर्स आते थे जहाँ टाइल साइज उपलब्ध मेमोरी से अधिक हो जाती थी।

  • इस सुधार ने `ggml_cuda_should_use_mmq()` में एक गार्ड जोड़ा है जो MMQ टाइल्स का चयन करने से पहले शेयर्ड मेमोरी बजट की जाँच करता है।
  • अपर्याप्त मेमोरी वाले डिवाइस अब प्रीफिल के दौरान BLAS पथ पर वापस आ जाते हैं, जिससे कोर डंप से बचा जाता है और टोकन जनरेशन प्रदर्शन बनाए रहता है।
  • यह बदलाव किसी भी CUDA डिवाइस पर लागू होता है जो प्रति-ब्लॉक 48 KiB से कम शेयर्ड मेमोरी रिपोर्ट करता है, न कि केवल विशिष्ट MUSA QY1 डिवाइसों पर।

यह अपडेट सीमित शेयर्ड मेमोरी वाले पुराने या विशेष हार्डवेयर पर क्रैश को रोकता है, संगत BLAS बैकएंड का स्वचालित रूप से उपयोग करके स्थिर इनफरेंस सुनिश्चित करता है।