llama.cpp प्रोजेक्ट ने बिल्ड b11282 जारी किया, जिसमें MUSA डिवाइस पास के लिए `CUDA_ARCH` मैक्रो को परिभाषित करने का फिक्स शामिल है। पहले, MUSA वेंडर हेडर ने इस वेरिएबल को परिभाषित नहीं किया था, जिससे साझा ggml-cuda स्रोतों में आर्किटेक्चर टेस्ट शून्य पर मूल्यांकन हो गए और खाली कर्नेल बॉडी का कारण बना।

  • फिक्स HIP बैकएंड की तरह नवीनतम आर्किटेक्चर की रिपोर्ट करता है जबकि MUSA के साथ असंगत NVIDIA-केवल सुविधाओं को स्पष्ट रूप से बाहर रखता है।
  • `CUDA_ARCH` अब CUB के डिटेक्शन लॉजिक और nvcc व्यवहार के साथ मिलान करने के लिए केवल डिवाइस पास के लिए परिभाषित किया गया है।
  • आर्किटेक्चर तुलना में अनावश्यक `defined(CUDA_ARCH)` जांचें हटा दी गईं क्योंकि CUDA और MUSA के लिए होस्ट पास में मैक्रो अपरिभाषित है।

यह बदलाव सुनिश्चित करता है कि आर्किटेक्चर पर गेटेड कर्नेल बॉडी, जैसे q8_0 -> f16 डीक्वांटीज़ेशन कर्नेल, MUSA डिवाइस के लिए सही तरीके से कंपाइल होते हैं और खाली बॉडी में विस्तारित नहीं होते।