llama.cpp प्रोजेक्ट ने दो पीढ़ियों के Adreno GPUs पर मैट्रिक्स गुणन प्रदर्शन में सुधार के लिए अपने OpenCL बैकएंड को अपडेट किया है। परिवर्तन मुख्य रूप से X2E पीढ़ी को लक्षित करते हैं, xmem F16xF32 GEMM पथ को डिफ़ॉल्ट रूप से सक्षम करके और A7X पीढ़ी के लिए हैंडलिंग को अनुकूलित करके।
- X2E उपकरणों के लिए Adreno xmem F16xF32 GEMM को डिफ़ॉल्ट रूप से सक्षम किया गया, जिसके लिए पहले एक opt-in पर्यावरण चर की आवश्यकता थी।
- रजिस्टर स्पिलिंग समस्याओं से बचने के लिए बैच किए गए ऑपरेशनों को प्रति-पंक्ति कर्नेल की ओर रूट करके Adreno A7X कंपाइलर पर tiled f32 GEMM को bypass किया गया।
- xmem अनुकूलन ने gpt-oss-20b के लिए Adreno X2-90 उपकरणों पर लगभग 25% प्रीफिल स्पीडअप प्रदान किया, जबकि A7X बायपास ने gemma-3n-E4B पर लगभग 9% सुधार दिया।
ये अनुकूलन पुराने और नए Adreno सिलिकॉन में विशिष्ट कंपाइलर अक्षमताओं को संबोधित करते हैं, मॉडल प्रीफिल चरणों के दौरान धीमे matmul कर्नेल्स में व्यतीत GPU समय को कम करते हैं।