أصدر مشروع llama.cpp الإصدار b10707، الذي يتضمن تحسينًا للأداء في معالجة ذاكرة التخزين المؤقت للقيم الرئيسية (KV). يعدّل التحديث الدالة `for_each_token_in` لإيقاف المسح بمجرد رؤية جميع التسلسلات داخل خلية محددة، بدلاً من التكرار عبر جميع التسلسلات القصوى الممكنة.

  • يستهدف هذا التغيير مسار n-gram عبر المُدعو `get_prev_tokens`.
  • على جهاز RTX PRO 6000 مع Qwen3.8-Flash-Next UD-Q4_K_XL، زادت سرعة التوليد من 56.3 إلى 74.3 رمزًا في الثانية عند سياق بحجم 55k.
  • عند سياق بحجم 132k، تحسّنت سرعة التوليد من 33.6 إلى 50.9 رمزًا في الثانية.
  • يتناسب التحسين مع عدد الخلايا المستخدمة، مما يجعل المكاسب أكثر وضوحًا عند السياقات الأطول مع ترك معالجة المطالب دون تغيير.

يوفر الإصدار ثنائيات لأنظمة macOS (Apple Silicon وIntel)، وLinux (CPU، Vulkan، ROCm، OpenVINO، SYCL)، وAndroid، وWindows (CPU، CUDA، Vulkan، OpenVINO، SYCL، ROCm)، وopenEuler.