llama.cpp 项目发布了版本 b10282,引入了用于推测解码的新监控功能。服务器现在在其 /metrics 端点中包含了 spec-decode 计数器,允许用户跟踪与此功能相关的性能指标。
- 在 /metrics 端点添加了 spec-decode 计数器以实现更好的可观测性。
- 根据审查反馈,将参数名称与 vLLM 完全对齐。
- 提供了适用于 macOS (Apple Silicon 和 Intel)、iOS、Linux (CPU、Vulkan、ROCm、OpenVINO、SYCL)、Android、Windows (CPU、CUDA、Vulkan、OpenVINO、SYCL、HIP) 和 openEuler 的二进制文件。
此更新在保持与 vLLM 参数命名约定兼容性的同时,增强了监控推测解码性能的能力。