Le projet llama.cpp a publié la version b10282, qui introduit de nouvelles capacités de surveillance pour le décodage spéculatif. Le serveur inclut désormais des compteurs spec-decode dans son point de terminaison /metrics, permettant aux utilisateurs de suivre les métriques de performance liées à cette fonctionnalité.
- Ajout de compteurs spec-decode au point de terminaison /metrics pour une meilleure observabilité.
- Alignement exact des noms de paramètres sur vLLM suite aux commentaires de révision.
- Fourniture de binaires pour macOS (Apple Silicon et Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, HIP) et openEuler.
Cette mise à jour améliore la capacité de surveiller les performances du décodage spéculatif tout en maintenant la compatibilité avec les conventions de nommage des paramètres de vLLM.