Proyek llama.cpp merilis build b10724, yang secara signifikan meningkatkan kinerja pemulihan sel KV cache non-kontigu dengan melakukan batching bacaan scatter per jalankanan kontinu.
- Pemulihan keadaan dioptimalkan untuk buffer cincin terfragmentasi dengan menghitung sebelumnya indeks tujuan berurutan dan menggunakan salinan tunggal alih-alih salinan sel individu.
- Memperbaiki kegagalan asersi pada pembaca perangkat saat jumlah tensor simpan dan pemulihan cocok tetapi chunking berbeda, kembali ke salinan kursor byte.
- Menambahkan pengujian host dan di perangkat yang memverifikasi pemulihan keadaan identik byte demi byte untuk sel urutan berselang-seli.
Optimasi ini mengurangi jumlah salinan memori yang diperlukan untuk pemulihan besar dari lebih dari 1,3 juta menjadi hanya 224, memangkas waktu pemulihan dari puluhan detik menjadi kurang dari setengah detik.