llama.cpp प्रोजेक्ट ने संस्करण b10840 जारी किया, जिसमें CUDA इनफरेंस के लिए प्रदर्शन अनुकूलन शामिल हैं। अपडेट ने mmvq (मैट्रिक्स-वेक्टर गुणन) को तेज करने के लिए Q4_K और Q5_K क्वांटीज़ेशन फॉर्मेट्स के लिए branchless कंप्यूटेशन लागू किया है।
- branchless unpacking mmvq में प्रत्येक कॉलम के लिए स्केल पुनः निष्पादन को रोकता है, 1 से अधिक बैच साइज़ पर प्रदर्शन सुधारता है।
- L2 prefetch लॉजिक DGX Spark हार्डवेयर के लिए विशेष रूप से gated है ताकि लाभ प्राप्त किए जाएं।
- mmvq L2 prefetch गार्ड को CUDA के साथ MUSA और HIP बैकएंड का समर्थन करने के लिए विस्तारित किया गया है।
- Q4_K के लिए स्विच पॉइंट्स को मॉडलों की एक व्यापक श्रृंखला को समायोजित करने के लिए अपडेट किए गए हैं।
ये बदलाव उन उपयोगकर्ताओं के लिए मापनीय प्रदर्शन सुधार प्रदान करते हैं जो 1 से अधिक बैच साइज़ के साथ DGX Spark सिस्टम पर llama.cpp चला रहे हैं।