llama.cpp प्रोजेक्ट ने बिल्ड b10782 जारी किया, जो मल्टी-GPU सेटअप में CUDA बैकएंड के लिए एक महत्वपूर्ण समस्या को दूर करता है। अपडेट हर स्प्लिट के लिए कन्करेंट स्ट्रीम्स की अनुमति देता है और CUDA ग्राफ़ अनुकूलन को कई डिवाइसों पर सही ढंग से चलने सक्षम बनाता है।
- एक बग को ठीक किया जहां CUDA इवेंट्स निर्माण के दौरान वर्तमान GPU को गलत तरीके से बांधे जाते थे, जिससे मल्टी-GPU ग्राफ़ अनुकूलन छोड़ दिया जाता था।
- `ggml_cuda_set_device` के माध्यम से स्पष्ट डिवाइस सेटिंग लागू की गई है ताकि सुनिश्चित किया जा सके कि अनुकूलन प्रत्येक डिवाइस के लिए सही स्प्लिट पर लागू हों।
- यह फिक्स केवल तभी सक्रिय होता है जब `GGML_CUDA_GRAPH_OPT=1` सक्षम हो; डिफ़ॉल्ट व्यवस्था अपरिवर्तित रहती है।
यह बदलाव सुनिश्चित करता है कि ग्राफ़ अनुकूलन हर स्प्लिट के लिए एक बार चले, न कि छोड़ा जाए, जिससे मल्टी-GPU इनफरेंस सही ढंग से CUDA त्वरण का उपयोग कर सके।