El proyecto llama.cpp ha lanzado la versión b10282, que introduce nuevas capacidades de monitoreo para la decodificación especulativa. El servidor ahora incluye contadores de spec-decode en su endpoint /metrics, permitiendo a los usuarios rastrear las métricas de rendimiento relacionadas con esta función.
- Añadidos contadores de spec-decode al endpoint /metrics para una mejor observabilidad.
- Los nombres de los parámetros se alinearon exactamente con vLLM siguiendo los comentarios de la revisión.
- Se proporcionaron binarios para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, HIP) y openEuler.
Esta actualización mejora la capacidad de monitorear el rendimiento de la decodificación especulativa mientras mantiene la compatibilidad con las convenciones de nomenclatura de parámetros de vLLM.