Le projet llama.cpp a publié la compilation b10724, qui améliore considérablement les performances de restauration des cellules KV cache non contiguës en regroupant les lectures scatter par exécution continue.
- Restauration de l'état optimisée pour les tampons circulaires fragmentés en précalculant les indices consécutifs de destination et en utilisant des copies uniques au lieu de copies individuelles de cellules.
- Correction d'une erreur d'assertion dans le lecteur sur appareil lorsque les comptes de tenseurs de sauvegarde et de restauration correspondaient mais que le fractionnement différait, avec un retour à une copie par curseur d'octets.
- Ajout de tests sur l'hôte et sur l'appareil vérifiant la restauration identique octet par octet de l'état pour les cellules de séquence entrelacée.
Cette optimisation réduit le nombre de copies mémoire requises pour les grandes restaurations de plus de 1,3 million à seulement 224, réduisant le temps de restauration de dizaines de secondes à moins d'une demi-seconde.