زاد مشروع llama.cpp الحد المرفوع لـ row-id لعملية Vulkan mul_mat_id من 256 إلى 1024 خبيرًا. يعالج هذا التغيير اختناقات الأداء في النماذج ذات أعداد الخبراء الكبيرة، مثل Qwen3.8-Flash-Next، الذي كان يعمل سابقًا على مسار كود أبطأ بسبب قيود حجم المصفوفة المشتركة.
يعدّل التحديث شيفرة count_experts.comp لاستخدام ثابت MAX_EXPERTS بقيمة 1024، مما يزيد المصفوفات المشتركة إلى 12 KiB مع البقاء ضمن ضمان Vulkan البالغ 16 KiB. على عتاد Strix Halo بحجم دفعة يبلغ 2048، تنخفض عمليات ضرب مصفوفات الخبراء من 12.5 إلى 9.5 مللي ثانية لـ iq3_s ومن 14.0 إلى 7.5 مللي ثانية لـ iq4_nl لكل عملية. تتحسن سرعة معالجة الطلب بنسبة تقارب 19% عند 8k توكن، وتنجح اختبارات الخلفية MUL_MAT_ID مع حالات الخبراء الجديدة البالغة 1024.
يتيح هذا التحسين لـ llama.cpp التعامل بكفاءة مع النماذج التي تتجاوز عتبة الخبراء السابقة البالغة 512 دون تدهور الأداء على العتاد المتوافق مع Vulkan.