llama.cpp प्रोजेक्ट ने बिल्ड b10534 जारी किया, जिसने CUDA पर क्वांटाइज्ड डिकोडिंग के दौरान वेक्टर और टेंसर-कोर पथों के बीच क्रॉसओवर को ट्यून करने के लिए हार्डवेयर-विशिष्ट स्विच पॉइंट्स पेश किए हैं।
- रिलीज़ में GGML_CUDA_MMVQ_MAX के माध्यम से रनटाइम कॉन्फ़िगरेशन जोड़ा गया है, जहां कर्नेल mul_mat_vec_q से MMQ पर स्विच होने वाले बैच साइज थ्रेशोल्ड को समायोजित किया जा सकता है।
- ब्लैकवेल, DGX स्पार्क और आदा आर्किटेक्चर के लिए विशिष्ट स्विच पॉइंट मान अब शामिल हैं, जिससे पर्यावरण चरों पर निर्भरता कम हुई है।
- इस थ्रेशोल्ड को कम करने से बड़े बैच int8 MMQ टेंसर-कोर पथ की ओर निर्देशित होते हैं, जिससे Q4_K घन मॉडल के लिए RTX 5090 पर बैच साइज 8 पर मापा गया 23-41% गति वृद्धि मिली है।
- इस अपडेट में CPU, CUDA, Vulkan, ROCm, OpenVINO और SYCL बैकएंड्स के लिए macOS, Linux, Windows, Android और openEuler के लिए बाइनरी शामिल हैं।
यह बदलाव बैच साइज और हार्डवेयर क्षमताओं के आधार पर सबसे कुशल कर्नेल पथ को स्वचालित रूप से चुनकर आधुनिक NVIDIA GPU पर इनफरेंस प्रदर्शन में सुधार करता है।