llama.cpp परियोजना ने संस्करण b10726 जारी किया, जिसमें IQ क्वांटाइज्ड मॉडल्स में बड़े बैच आकारों को प्रसंस्कृत करने के लिए महत्वपूर्ण प्रदर्शन अनुकूलन शामिल हैं। प्राथमिक अपडेट बैच्ड GEMM संचालन के माध्यम से ग्रिड IQ क्वांट्स को त्वरित करने के लिए AVX2 निर्देशों का लाभ उठाता है।
- ग्रिड IQ क्वांट्स के लिए बैच्ड GEMM कार्यान्वयन
- गति के लिए कम threshold के साथ IQ पैनल डिकोड का वेक्टराइजेशन
- ggml_gemm_iqp_8x8_q8_K_p4 kernel का परिचय और gather बफर की हटाई
- सिंगल-सोर्स gather लेआउट, गेट बायस, और IQ पैनल्स के लिए वेक्टराइज्ड इंटरलीव
- IQP कवरेज के लिए NUMA फॉलबैक समर्थन और 10-पंक्ति बैच परीक्षणों का जोड़
यह रिलीज़ संगत हार्डवेयर पर IQ मॉडल चला रहे उपयोगकर्ताओं के लिए तेज़ इनफरेंस क्षमताएं प्रदान करती है।