يُطلق إصدار llama.cpp b11372 تحسينات لفهرس البرق الخاص بنموذج qwen4exp، وذلك بشكل أساسي عن طريق تقليل الذاكرة المطلوبة لدرجات الفهرسة أثناء معالجة السياقات الطويلة إلى النصف. يتحقق ذلك من خلال حساب درجات الرؤوس في مكانها بدلاً من إنشاء موترات منفصلة لكل رأس.

  • يعيد فهرس qwen4exp الآن استخدام مخازن المؤقتة للمُخصِّص ويحسب الدرجات عبر ggml_lightning_indexer لتقليل الاستخدام الذروة للذاكرة.
  • تمت إضافة دعم الخلفية CUDA لفهرس البرق مع 4 رؤوس، وتوجيهها إلى نواة المتجهات.
  • تم تحديث خلفية Metal لقراءة عدد الرؤوس من ثابت دالة، مما يسمح بتشغيل أي عدد من الرؤوس دون تغييرات في الكود.
  • تقوم خلفية Vulkan بتقسيم فهرس البرق على المفاتيح والرموز باستخدام الذاكرة المشتركة وضرب النقاط fp16.

تحسّن هذه التغييرات كفاءة الذاكرة لنماذج qwen4exp ذات السياقات الطويلة مع الحفاظ على حجم مخزن الحوسبة وسرعتها.