Le projet llama.cpp a publié la version b10313, qui introduit un planificateur LRU (Least Recently Used) pour son composant serveur. Cette mise à jour inclut la gestion de la fusion des requêtes et des corrections pour les cas de streaming.

  • Le serveur prend désormais en charge un planificateur LRU pour gérer les connexions.
  • La logique de fusion des requêtes a été implémentée pour gérer les sorties de la file d'attente.
  • Des tests ont été ajoutés pour vérifier le nouveau comportement de planification.
  • Un bug affectant le cas de streaming a été corrigé.

Cette version fournit des binaires mis à jour pour macOS, Linux, Windows, Android et iOS sur divers backends matériels, y compris CPU, CUDA, Vulkan, ROCm et OpenVINO.