llama.cpp प्रोजेक्ट ने संस्करण b10791 जारी किया, जिसमें क्वांटाइज्ड लैंग्वेज मॉडल हेड और डिकोडिंग GEMV ऑपरेशन के लिए महत्वपूर्ण OpenCL अनुकूलन शामिल हैं। इस अपडेट में स्पेकुलेटिव डिकोडिंग और मल्टी-टोकन प्रिडिक्शन से संबंधित मिडियम-बैच GEMM में सुधार भी शामिल है।
- स्पेकुलेटिव डिकोडिंग/MTP के लिए opencl quant lm_head / decode GEMV और मिडियम-बैच GEMV को अनुकूलित करता है।
- non-Adreno बिल्ड्स के लिए q4_K/q6_K tiled_ns convert-kernel रजिस्ट्रेशन की सुरक्षा करता है।
- q4_K MUL_MAT+GLU फ्यूजन डिस्पैच को विशेष रूप से Adreno हार्डवेयर तक सीमित करता है।
- q4_K GLU फ्यूजन गेट में noshuffle वेट लेआउट की आवश्यकता होती है।
- असंगत रो स्ट्राइड पर वेक्टराइज्ड f16 mrow GEMV पथ को चुनने से रोकता है।
- केवल उन स्थानों में q4_K split-K डिकोड GEMV सक्षम करता है जहां प्रदर्शन लाभ मापा गया है।
- tiled lm_head/embed GEMV डिफ़ॉल्ट्स को X2E/A8X आर्किटेक्चर तक सीमित करता है।
इस रिलीज में CPU, GPU और विभिन्न एक्सेलेरेटर बैकएंड के लिए macOS, iOS, Linux, Windows, Android और openEuler के लिए बाइनरी प्रदान की गई हैं।