O projeto llama.cpp lançou a versão b10282, que introduz novas capacidades de monitoramento para decodificação especulativa. O servidor agora inclui contadores de spec-decode em seu endpoint /metrics, permitindo que os usuários acompanhem as métricas de desempenho relacionadas a este recurso.

  • Adicionados contadores de spec-decode ao endpoint /metrics para melhor observabilidade.
  • Nomes de parâmetros alinhados exatamente com vLLM seguindo feedback da revisão.
  • Fornecidos binários para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, HIP) e openEuler.

Esta atualização melhora a capacidade de monitorar o desempenho da decodificação especulativa enquanto mantém a compatibilidade com as convenções de nomenclatura de parâmetros do vLLM.