يتضمن إصدار llama.cpp b11265 إصلاحًا لمعالجة نماذج Mixture of Experts (MoE) بواسطة الخلفية الخلفية Vulkan. يصحّج التحديث كيفية اختيار `mat_mul_id` لبلاطات الضرب المصفوفي، مما يعالج مشكلة أداء كانت تترك فيها العمال في حالة خمول أثناء التوجيه.
- سابقاً، اعتمد اختيار البلاطات على العدد الإجمالي للرموز، وهو أمر غير صحيح لشبكات توجيه MoE حيث يكون N الحقيقي لكل مجموعة عمل هو الصفوف لكل خبير.
- في نماذج مثل Sarvam 30B مع pp128، تسبب هذا الخطأ في اختيار المجمع لبلاطات لحوالي 6 صفوف نشطة بدلاً من 128.
- يضمن الإصلاح أن يكون لدى جميع العمال في المجموعة عمل للقيام به، مما يلغي الوقت الضائع الذي كان يشكل سابقاً 55% من مدة المهمة.
يحسّن هذا التغيير كفاءة الاستدلال لنماذج MoE على Vulkan من خلال ضمان توزيع عبء العمل بشكل صحيح بين عمال GPU.