Le projet llama.cpp a publié la version b10707, qui inclut une optimisation de performance pour la gestion du cache clé-valeur (KV). La mise à jour modifie la fonction `for_each_token_in` pour arrêter le balayage dès que toutes les séquences au sein d'une cellule spécifique ont été traitées, plutôt que d'itérer sur toutes les séquences maximales possibles.
- Ce changement cible le chemin n-gram via l'appelant `get_prev_tokens`.
- Sur une RTX PRO 6000 avec Qwen3.8-Flash-Next UD-Q4_K_XL, la vitesse de génération est passée de 56,3 à 74,3 tokens par seconde pour un contexte de 55k.
- Pour un contexte de 132k, la vitesse de génération est passée de 33,6 à 50,9 tokens par seconde.
- L'optimisation évolue avec le nombre de cellules utilisées, rendant les gains plus visibles sur les contextes plus longs tout en laissant le traitement du prompt inchangé.
La publication fournit des binaires pour macOS (Apple Silicon et Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, ROCm) et openEuler.