llama.cpp 项目发布了版本 b10429,该版本修改了服务器,使其在 llama_decode() 执行期间允许访问 /metrics 和 /slots 端点。
- 此更改更新了 server_queue::worker,使其在 yield_to_queue 内部调用 llama_decode。
- 它还在此操作期间处理 process_mtmd_chunk。
- 二进制文件适用于 macOS(Apple Silicon 和 Intel)、Linux(CPU、Vulkan、OpenVINO、SYCL)、Android、Windows(CPU、CUDA 12/13、Vulkan、OpenVINO、SYCL、ROCm)和 openEuler。
此更新通过防止在模型推理期间阻塞端点,提高了服务器的响应能力。