Proyek llama.cpp merilis build b10724, yang secara signifikan meningkatkan kinerja pemulihan sel KV cache non-kontigu dengan melakukan batching bacaan scatter per jalankanan kontinu.

  • Pemulihan keadaan dioptimalkan untuk buffer cincin terfragmentasi dengan menghitung sebelumnya indeks tujuan berurutan dan menggunakan salinan tunggal alih-alih salinan sel individu.
  • Memperbaiki kegagalan asersi pada pembaca perangkat saat jumlah tensor simpan dan pemulihan cocok tetapi chunking berbeda, kembali ke salinan kursor byte.
  • Menambahkan pengujian host dan di perangkat yang memverifikasi pemulihan keadaan identik byte demi byte untuk sel urutan berselang-seli.

Optimasi ini mengurangi jumlah salinan memori yang diperlukan untuk pemulihan besar dari lebih dari 1,3 juta menjadi hanya 224, memangkas waktu pemulihan dari puluhan detik menjadi kurang dari setengah detik.