Le projet llama.cpp a publié la version b10429, qui modifie le serveur pour permettre l'accès aux points de terminaison /metrics et /slots pendant que llama_decode() s'exécute.

  • La mise à jour modifie server_queue::worker pour appeler llama_decode à l'intérieur de yield_to_queue.
  • Elle gère également process_mtmd_chunk pendant cette opération.
  • Les binaires sont disponibles pour macOS (Apple Silicon et Intel), Linux (CPU, Vulkan, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm) et openEuler.

Cette mise à jour améliore la réactivité du serveur en empêchant le blocage des points de terminaison pendant l'inférence du modèle.