Le projet llama.cpp a publié la version b10519, qui inclut une refonte significative du mécanisme de gestion du sommeil du serveur. Ce changement permet au point de terminaison /metrics de rester accessible pendant que le serveur est en état de veille.
- Refonte de la logique on_sleeping_state et séparation des tâches/résultats des métriques et des slots.
- Ajout de réponses mises en cache et correction d'une condition de course dans le minuteur de tâche des métriques.
- Correction de get_res_model_info et mise à jour de la documentation.
- Fourniture de binaires pour macOS (Apple Silicon/Intel), Linux (CPU, Vulkan, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, ROCm), Android et openEuler.