أصدر مشروع llama.cpp البناء b11266، الذي يتضمن تحسينًا لـ Vulkan يحمّل مصفوفات A من نوع F32 بعنصرين في كل مرة عندما تكون محاذاة بعامل 2. يعالج هذا التغيير مشكلات الأداء على الأجهزة من Intel حيث يكون تحميل الأعداد العائمة واحدًا تلو الآخر غير كفء، كما يصحح نقص التحقق من صحة محاذاة `a_offset` في التصحيح الأصلي.

  • يستغل التعديل منطق التحميل الحالي المحاذاة بعامل 2 الموجود في `mul_mat_vec` لتحسين الإنتاجية على معماريات Intel BMG.
  • أظهرت نتائج الاختبارات المعيارية على جهاز Intel B60 تسريعات كبيرة لأشكال محددة من ضرب المصفوفات، حيث ارتفع الأداء من 153.08 GFLOPS إلى 221.66 GFLOPS لحالة اختبار واحدة، ووصل إلى 1.63 TFLOPS لحالة أخرى.
  • يوفر الإصدار ملفات ثنائية لنظام macOS (Apple Silicon وIntel)، وLinux (CPU، Vulkan، CUDA، ROCm، OpenVINO، SYCL، Snapdragon)، وAndroid، وWindows، وopenEuler.

يحسّن هذا التحديث أداء الاستدلال على وحدات معالجة الرسومات من Intel باستخدام الخلفية (backend) الخاصة بـ Vulkan من خلال تحسين أنماط الوصول إلى الذاكرة لعمليات مصفوفات الأعداد العائمة.