llama.cpp प्रोजेक्ट ने संस्करण b11335 जारी किया, जिसमें Volta GPUs के लिए एक CUDA अनुकूलन शामिल है। अपडेट sm_70 आर्किटेक्चर को सामान्य कॉन्फ़िगरेशन में गिरने के बजाय मौजूदा Turing MMVQ nwarps तालिका पर रूट करता है।
- Volta (sm_70) अब K-quant batch-1 डिकोड के लिए TURING ट्यूनिंग का उपयोग करता है, warp गिनती को 4 से 2 में बदल देता है।
- Qwen3.8-27B के साथ एक Tesla V100 पर बेंचमार्क +3.17% थ्रूपुट वृद्धि (+1.091 t/s) दिखाते हैं, जिसमें बिट-समान प्लेक्सिटी है।
- यह बदलाव anyei/llamacpp-v100 फर्क से लिया गया है और डिवाइस और होस्ट तालिका चयनकर्ताओं दोनों पर लागू होता है।
यह समायोजन मॉडल सटीकता को प्रभावित किए बिना Volta हार्डवेयर पर इनफरेंस गति को बेहतर बनाता है।