Le projet llama.cpp a publié la version b10313, qui introduit un planificateur LRU (Least Recently Used) pour son composant serveur. Cette mise à jour inclut la gestion de la fusion des requêtes et des corrections pour les cas de streaming.
- Le serveur prend désormais en charge un planificateur LRU pour gérer les connexions.
- La logique de fusion des requêtes a été implémentée pour gérer les sorties de la file d'attente.
- Des tests ont été ajoutés pour vérifier le nouveau comportement de planification.
- Un bug affectant le cas de streaming a été corrigé.
Cette version fournit des binaires mis à jour pour macOS, Linux, Windows, Android et iOS sur divers backends matériels, y compris CPU, CUDA, Vulkan, ROCm et OpenVINO.