llama.cpp 프로젝트는 추론 디코딩을 위한 새로운 모니터링 기능을 도입한 버전 b10282를 출시했습니다. 서버는 이제 /metrics 엔드포인트에 spec-decode 카운터를 포함하여 사용자가 이 기능과 관련된 성능 메트릭을 추적할 수 있습니다.
- 더 나은 관찰성을 위해 /metrics 엔드포인트에 spec-decode 카운터 추가.
- 리뷰 피드백을 따라 vLLM과 정확히 일치하는 매개변수 이름 제공.
- macOS (Apple Silicon 및 Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, HIP) 및 openEuler용 바이너리 제공.
이 업데이트는 vLLM 매개변수 명명 규칙과의 호환성을 유지하면서 추론 디코딩 성능을 모니터링하는 능력을 향상시킵니다.