أصدر مشروع llama.cpp الإصدار b10840، الذي يقدم تحسينات للأداء لاستدلال CUDA. يطبق التحديث حسابًا غير مشروط لتنسيقات التكميم Q4_K و Q5_K لتسريع ضرب المصفوفة-المتجه (mmvq).
- يمنع فك الضغط غير المشروط إعادة تنفيذ المقياس لكل عمود في mmvq، مما يحسن الأداء عند أحجام دفعات أكبر من 1.
- يتم تحجيم منطق الوصول المسبق L2 بشكل خاص لأجهزة DGX Spark لضمان تحقيق المكاسب.
- تم توسيع حارس الوصول المسبق L2 لـ mmvq لدعم خلفيات MUSA و HIP جنبًا إلى جنب مع CUDA.
- تم تحديث نقاط التبديل لـ Q4_K لاستيعاب نطاق أوسع من النماذج.
توفر هذه التغييرات تحسينات أداء قابلة للقياس للمستخدمين الذين يشغلون llama.cpp على أنظمة DGX Spark بأحجام دفعات تتجاوز واحدًا.