أصدر مشروع llama.cpp الإصدار b10730، الذي يتضمن تحسينات لهيكل نموذج Qwen4exp. تتضمن التغيير الرئيسي جمع رؤوس الفهرس على شرائح بدلاً من استخدام عملية النقل وجمع الصفوف، مما يقلل من عبء نسخ الذاكرة.

  • زادت سرعة معالجة الأوامر من 2170 إلى 2366 رمز في الثانية على جهاز RTX PRO 6000 مع Qwen3.8-Flash-Next UD-Q4_K_XL.
  • يلغي التحسين متطلبات موتر متصل زائدة عن الحاجة لاستعلام الفهرس، حيث يعيد rope تخصيص موتر متصل جديدًا.
  • تبقى سرعة التوليد دون تغيير، لكن المكاسب في معالجة الأوامر تتناسب مع طول السياق وحجم الدفعة الفرعية (ubatch).
  • لم يتغير الإخراج الجشع رمزًا تلو رمز مقارنة بالإصدارات السابقة.

يُحسّن هذا التحديث الكفاءة لعمليات الاستدلال طويلة السياق التي تتضمن نماذج Qwen4exp من خلال تقليل الهدر الحسابي أثناء مرحلة معالجة الأوامر.