O projeto llama.cpp lançou a versão b10429, que modifica o servidor para permitir o acesso aos endpoints /metrics e /slots enquanto llama_decode() está em execução.

  • A alteração atualiza server_queue::worker para chamar llama_decode dentro de yield_to_queue.
  • Ela também processa process_mtmd_chunk durante esta operação.
  • Os binários estão disponíveis para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm) e openEuler.

Esta atualização melhora a capacidade de resposta do servidor ao evitar o bloqueio dos endpoints durante a inferência do modelo.