मेटल बैकएंड ने 2 से 16 स्रोत पंक्तियों के लिए नए मैट्रिक्स गुणन कर्नल्स पेश किए हैं, जो टेंसर API से रहित Apple Silicon उपकरणों पर तेज स्पेकुलेटिव डिकोडिंग को सक्षम बनाते हैं। ये कर्नल्स वजन को एक बार डिक्वांटाइज़ करते हैं और थ्रेडग्रुप्स के बीच K आयामों को विभाजित करते हैं, जिससे पिछले mat-vec दृष्टिकोणों की तुलना में महत्वपूर्ण प्रदर्शन लाभ मिलते हैं।
- Q4_0, Q8_0, Q5_K के लिए विशिष्ट MMA कर्नल्स को लागू करते हैं, और F32, F16 और अन्य क्वांटाइज़ेशन प्रकारों के लिए सामान्य पथ प्रदान करते हैं।
- MTLGPUFamilyApple7+ हार्डवेयर पर इन कर्नल्स को सक्रिय करते हैं जब पंक्ति गणना ऐसी सीमाओं से अधिक हो जाती है जहां वे mat-vec कर्नल्स की तुलना में बेहतर प्रदर्शन करते हैं।
- MUL_MAT + ADD संचालनों को जोड़ने और एकल डिस्पैच में 16 आसन्न समान-लेआउट f32 कॉपी को बैच करने के लिए फ्यूजन तर्क जोड़ते हैं।
- फ्यूज्ड ग्रुप्स के लिए डिवाइस गुणों, कन्करेंसी जांचों और व्यू ट्रैकिंग को संभालने के लिए ग्राफ ऑप्टिमाइजर और एनकोडर को अपडेट करते हैं।
यह अनुकूलन M3 Ultra हार्डवेयर पर स्पेकुलेटिव डिकोडिंग में प्रदर्मान पश्चगमनों को हल करता है, यह सुनिश्चित करके कि टेंसर संचालन छोटे बैच आकार के साथ भी कुशल बने रहते हैं।