El proyecto llama.cpp lanzó la versión b10429, que modifica el servidor para permitir el acceso a los puntos finales /metrics y /slots mientras llama_decode() está en ejecución.
- El cambio actualiza server_queue::worker para llamar a llama_decode dentro de yield_to_queue.
- También maneja process_mtmd_chunk durante esta operación.
- Los binarios están disponibles para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm) y openEuler.
Esta actualización mejora la capacidad de respuesta del servidor al evitar el bloqueo de los puntos finales durante la inferencia del modelo.