llama.cpp 프로젝트는 llama_decode()가 실행되는 동안 /metrics 및 /slots 엔드포인트에 접근할 수 있도록 서버를 수정하는 버전 b10429을 출시했습니다.

  • 이 변경은 server_queue::worker가 yield_to_queue 내에서 llama_decode를 호출하도록 업데이트합니다.
  • 또한 이 작업 동안 process_mtmd_chunk도 처리합니다.
  • 바이너리는 macOS (Apple Silicon 및 Intel), Linux (CPU, Vulkan, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm) 및 openEuler에서 사용할 수 있습니다.

이 업데이트는 모델 추론 동안 엔드포인트가 차단되는 것을 방지하여 서버의 응답성을 향상시킵니다.