Proyek llama.cpp merilis versi b10707, yang mencakup optimasi kinerja pada penanganan cache nilai-kunci (KV). Pembaruan ini memodifikasi fungsi `for_each_token_in` untuk menghentikan pemindaian begitu semua sekuens dalam sel tertentu telah dilihat, alih-alih mengiterasi melalui semua sekuens maksimum yang mungkin.

  • Perubahan ini menargetkan jalur n-gram melalui pemanggil `get_prev_tokens`.
  • Pada RTX PRO 6000 dengan Qwen3.8-Flash-Next UD-Q4_K_XL, kecepatan generasi meningkat dari 56,3 menjadi 74,3 tok/s pada konteks 55k.
  • Pada konteks 132k, kecepatan generasi meningkat dari 33,6 menjadi 50,9 tok/s.
  • Optimasi ini berskala dengan jumlah sel yang digunakan, sehingga keuntungan lebih terlihat pada konteks yang lebih panjang sambil membiarkan pemrosesan prompt tetap tidak berubah.

Rilis ini menyediakan biner untuk macOS (Apple Silicon dan Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, ROCm), dan openEuler.