Le projet llama.cpp a publié la compilation b10584, traitant un problème critique où la taille du contexte de brouillon ne correspondait pas au contexte cible, provoquant l'échec des requêtes du serveur avec des erreurs 500.
- Le serveur garantit désormais que le contexte de brouillon suit la taille du contexte cible, empêchant les échecs de décodage lorsque les slots sont remplis au-delà des limites précédentes.
- La réservation de mémoire pour le modèle de brouillon est mesurée sur le plus grand contexte que la cible peut accepter, permettant aux contextes partageant des cellules avec la cible d'abandonner la substitution kv_size.
- La fonction fit prend désormais en compte un deuxième modèle optionnel, garantissant que sa mémoire est mesurée chaque fois que le contexte principal change pour maintenir le chemin reduce exact.
Cette mise à jour résout les problèmes de stabilité dans les déploiements du serveur en alignant dynamiquement les tailles des contextes de brouillon et cible.