أصدر مشروع llama.cpp الإصدار b10704، الذي يحدث الخلفية الخلفية لـ CUDA لاستخدام المسار المحسّن mm_ids_helper لأي عدد من الخبراء المستخدمين (n_expert_used). في السابق، كان هذا المسار السريع مقيدًا بقواعد قابلية القسمة لحجم warp، مما أجبر معظم العدادات على العودة إلى تنفيذ عام أبطأ.
- تعمم التحسين الحشو إلى القوة التالية للرقم 2، مما يسمح بحالات مثل n_expert_used = 10 باستخدام المسار السريع.
- تم القياس على Qwen3.8-Flash-Next مع 512 خبير و10 مستخدمين في سياق 55k على RTX PRO 6000، وزاد سرعة معالجة الطلب من 2334 إلى 2600 رمزًا في الثانية.
- يبقى أداء توليد الرموز دون تأثير لأن التحسين يستهدف معالجة الرموز المكدسة.
يحسن هذا التغيير زمن الوصول للاستنتاج للنماذج التي تستخدم هندسات Mixture of Experts عن طريق تقليل الحمل الزائد أثناء معالجة الطلب.