أصدر مشروع llama.cpp الإصدار b10750، الذي يعيد تنظيم إدارة خلايا المفتاح والقيمة لتحسين فهرسة موضع التسلسل والبحث في سجلات n-gram.

  • تم إعادة بناء الدالة `get_prev_tokens()` لإجراء عمليات بحث مباشرة بدلاً من اجتياز جميع الخلايا المستخدمة في كل ubatch.
  • يخزن الفهرس الداخلي الآن أزواج `(pos, cell)` في `std::set`، مما يتيح استرجاعاً بوقت لوغاريتمي عبر الطريقة الجديدة `seq_pos_tok_le`.
  • يلغي هذا التغيير الحاجة إلى منطق البحث بالنافذة القديمة وسد فجوات M-RoPE الاحتياطي.
  • أظهرت المقاييس على Qwen3.8-Flash-Next UD-Q4_K_XL بسياق 71k زيادة بنسبة 4.9% في سرعة توليد الرموز (من 69.3 إلى 72.7 t/s) مع بقاء أداء التعبئة مسامياً دون تغيير.

يقلل التحسين من الحمل الحسابي أثناء الاستدلال، مما يؤدي إلى توليد نص أسرع في السيناريئات ذات السياق الطويل.