El proyecto llama.cpp lanzó la versión b10429, que modifica el servidor para permitir el acceso a los puntos finales /metrics y /slots mientras llama_decode() está en ejecución.

  • El cambio actualiza server_queue::worker para llamar a llama_decode dentro de yield_to_queue.
  • También maneja process_mtmd_chunk durante esta operación.
  • Los binarios están disponibles para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm) y openEuler.

Esta actualización mejora la capacidad de respuesta del servidor al evitar el bloqueo de los puntos finales durante la inferencia del modelo.