Proyek llama.cpp merilis build b10750, yang melakukan refactor manajemen sel kunci-nilai untuk meningkatkan pengindeksan posisi urutan dan pencarian riwayat n-gram.

  • Fungsi `get_prev_tokens()` dibangun ulang untuk melakukan pencarian langsung alih-alih menelusuri semua sel yang digunakan pada setiap ubatch.
  • Indeks internal sekarang menyimpan pasangan `(pos, cell)` dalam `std::set`, memungkinkan pengambilan waktu logaritmik melalui metode baru `seq_pos_tok_le`.
  • Perubahan ini menghilangkan kebutuhan akan logika fallback jendela lama dan celah M-RoPE.
  • Benchmark pada Qwen3.8-Flash-Next UD-Q4_K_XL dengan konteks 71k menunjukkan peningkatan kecepatan generasi token sebesar 4,9% (dari 69,3 menjadi 72,7 t/s) dengan kinerja prefill yang tidak berubah.

Optimasi ini mengurangi overhead komputasi selama inferensi, menghasilkan generasi teks yang lebih cepat untuk skenario konteks panjang.