La version b10144 de llama.cpp traite des problèmes critiques dans le serveur et l'interface utilisateur concernant les flux résumables, en corrigeant spécifiquement la gestion des noms de modèles contenant des barres obliques. Elle résout également des bugs où les requêtes n'étaient pas correctement annulées ou reprises pendant le chargement du modèle.
- Refactorise les itinéraires de flux résumables pour utiliser la chaîne de requête `conv_id`, permettant aux noms de modèles contenant des barres obliques de survivre à l'encodage en mode routeur.
- Annule les requêtes en attente lorsque leur flux est arrêté pendant le chargement du modèle en enregistrant la conversation avant l'attente du chargement automatique.
- Permet de reprendre un flux après un rechargement de page pendant le chargement du modèle en détachant les requêtes de session des sockets client et en renvoyant un code 503 pour les nouvelles tentatives.
- Restaure la visibilité de la progression du chargement du modèle dans l'interface utilisateur après un rafraîchissement de page en persistant l'état du flux en attente.
Ces modifications garantissent que les conversations restent robustes face aux déconnexions client et aux problèmes d'encodage URL, empêchant les requêtes orphelines et la perte de sessions pendant la phase de chargement du modèle.