أصدر مشروع llama.cpp الإصدار b10791، الذي يقدم تحسينات كبيرة لـ OpenCL لرؤوس نماذج اللغة المكمّمة وعمليات GEMV في الترميز. يتضمن هذا التحديث أيضًا تحسينات لـ GEMM بمتوسط الدُفعات ذات الصلة بالترميز التخميني والتنبؤ بعدة رموز.
- يحسّن opencl quant lm_head / decode GEMV و medium-batch GEMM للترميز التخميني/MTP.
- يحمي تسجيل q4_K/q6_K tiled_ns convert-kernel لعمليات البناء غير الخاصة بـ Adreno.
- يوجّه دمج q4_K MUL_MAT+GLU بشكل خاص إلى عتاد Adreno.
- يتطلب تخطيط الأوزان noshuffle في بوابة دمج q4_K GLU.
- يمنع المسار المتجهي f16 mrow GEMV على خطوات الصفوف غير المحاذاة.
- يمكّن q4_K split-K decode GEMV فقط حيث تم قياس مكاسب الأداء.
- يقيّد الافتراضيات لـ tiled lm_head/embed GEMV إلى معماريات X2E/A8X.
يوفر الإصدار ثنائيات لأنظمة macOS و iOS و Linux و Windows و Android و openEuler عبر وحدات المعالجة المركزية، ووحدات معالجة الرسومات، ومجموعة متنوعة من الخلفيات المسرّعة.