أصدر مشروع llama.cpp الإصدار b10534، الذي يقدم نقاط تبديل خاصة بالعتاد لضبط نقطة الانتقال بين مسارات النواة المتجهة ونوى المصفوفات أثناء فك التشفير المُكمَّم على CUDA.
- يضيف الإصدار تكوينًا في وقت التشغيل عبر GGML_CUDA_MMVQ_MAX لضبط عتبة حجم الدفعة حيث ينتقل النواة من mul_mat_vec_q إلى MMQ.
- تُدرج الآن قيم نقاط التبديل المحددة لعمارات Blackwell وDGX Spark وAda، مما يقلل الاعتماد على متغيرات البيئة.
- يؤدي خفض هذه العتبة إلى توجيه دفعات أكبر نحو مسار نوى المصفوفات int8 MMQ، مما يحقق تسارعًا مقاسًا بنسبة 23-41% عند حجم دفعة 8 على RTX 5090 للنماذج الكثيفة Q4_K.
- يتضمن التحديث ثنائيات لأنظمة macOS وLinux وWindows وAndroid وopenEuler عبر خلفيات CPU وCUDA وVulkan وROCm وOpenVINO وSYCL.
يحسّن هذا التغيير أداء الاستدلال على وحدات معالجة الرسومات الحديثة من NVIDIA عن طريق اختيار مسار النواة الأكثر كفاءة تلقائيًا بناءً على حجم الدفعة وقدرات العتاد.