تحديث إصدار llama.cpp b11405 للخلفية CUDA من خلال توزيع فهرس البرق عبر المفاتيح والرموز لـ 4 رؤوس، مما يعالج مشكلات الأداء مع أعداد الرؤوس الصغيرة.
- يقوم النواة بتخزين استعلامات وأوزان جميع الرؤوس في وقت واحد، وتوسيع كل عنصر مفتوح بدقة نصفية مرة واحدة لتغذية جميع الرؤوس دون الحاجة إلى رحلة دوران عائمة.
- تبقى الاستعلامات في الدقة العائمة داخل الذاكرة المشتركة لمنع التزاحم من منتجات half2 عندما يتجاوز q * k نطاق f16.
- الآن تقوم كل خامة بتقييم مفتاحين لرمز واحد، مما يقلل من قراءات الذاكرة المشتركة ويحافظ على gfx908 عند 63 VGPRs دون انسكاب المسجل.
- يجعل هذا التحسين النواة أسرع بـ 36 مرة على R9700 وأسرع قليلاً على الأجهزة CUDA.
يوفر الإصدار ثنائيات لأنظمة macOS وLinux وWindows وAndroid وopenEuler عبر خلفيات CPU وGPU (CUDA، ROCm، Vulkan، OpenCL) وNPU.