llama.cpp プロジェクトはバージョン b10282 をリリースし、推論デコーディングの新しいモニタリング機能を紹介しました。サーバーは now /metrics エンドポイントに spec-decode カウンターを含み、ユーザーはこの機能に関連するパフォーマンスメトリクスを追跡できます。

  • 監視性を向上させるため、/metrics エンドポイントに spec-decode カウンターを追加。
  • レビューのフィードバックに従い、パラメータ名を vLLM と完全に一致させました。
  • macOS (Apple Silicon および Intel)、iOS、Linux (CPU、Vulkan、ROCm、OpenVINO、SYCL)、Android、Windows (CPU、CUDA、Vulkan、OpenVINO、SYCL、HIP)、openEuler 用のバイナリを提供。

このアップデートは、vLLM のパラメータ命名規則との互換性を維持しつつ、推論デコーディングのパフォーマンスを監視する能力を向上させます。