قام مشروع llama.cpp بتحديث الخلفية الخاصة بـ OpenCL لتحسين أداء ضرب المصفوفات على جيلين من وحدات معالجة الرسومات Adreno. تركز التغييرات بشكل أساسي على جيل X2E عن طريق تفعيل مسار GEMM xmem F16xF32 افتراضياً وتحسين التعامل مع جيل A7X.
- تفعيل افتراضي لمسار GEMM xmem F16xF32 الخاص بـ Adreno للأجهزة من طراز X2E، والتي كانت تتطلب سابقاً متغير بيئة لتفعيلها يدوياً.
- تجاوز مسار GEMM tiled f32 على مترجم Adreno A7X عن طريق توجيه العمليات المكدسة إلى نواة مخصصة لكل صف لتجنب مشاكل إزاحة المسجلات (register spilling).
- يوفر تحسين xmem تسارعاً في سرعة الحشو (prefill) بنسبة 25% تقريباً على gpt-oss-20b لأجهزة Adreno X2-90، بينما يحقق تجاوز A7X تحسناً بنسبة 9% على gemma-3n-E4B.
تعالج هذه التحسينات عدم الكفاءة المحددة في المترجم داخل شرائح Adreno القديمة والأحدث، مما يقلل من وقت وحدة معالجة الرسومات المستغرق في نوى ضرب المصفوفات البطيئة أثناء مراحل حشو النموذج.