llama.cpp परियोजना ने अपने सामान्य कम-पंक्ति मैट्रिक्स मल्टीप्लाई (MMA) कर्नेल का विस्तार करके अतिरिक्त स्रोत डेटा प्रकारों को समर्थन दिया है, जिसमें BF16, Q1_0, Q2_0, MXFP4, Q2_K, Q3_K, TQ2_0 और विभिन्न IQ प्रकार शामिल हैं। यह अपडेट अनुकूलित कर्नेल को 16-वजन डिक्वांटाइज़र वाले किसी भी प्रकार को संभालने की अनुमति देता है, जिसमें M3 Ultra हार्डवेयर पर विशिष्ट पंक्ति गणना सीमाओं को लागू किया जाता है जहां प्रदर्शन वर्तमान कर्नेल से अधिक होने लगता है।

  • नए समर्थन में BF16, Q1_0, Q2_0, MXFP4, Q2_K, Q3_K, TQ2_0 और IQ प्रकार शामिल हैं।
  • प्रदर्शन सीमाएं प्रकार के अनुसार भिन्न होती हैं: TQ2_0 के लिए 5 पंक्तियाँ, BF16 के लिए 4, MXFP4/Q2_0/Q2_K/IQ4_NL के लिए 3 और अन्य के लिए 2।
  • M3 Ultra पर बेंचमार्क परिणाम पंक्ति गणना और कर्नेल ओवरलैप के आधार पर 0.23 से 1.01 तक प्रदर्शन अनुपात दिखाते हैं।

इस बदलाव ने कम पंक्ति गणना पर MMA कर्नेल की क्षमताओं का लाभ उठाकर विस्तृत मात्रांकन प्रारूपों के लिए निष्पादन दक्षता में सुधार किया है।