Proyek llama.cpp telah merilis versi b10282, yang memperkenalkan kemampuan pemantauan baru untuk decoding spekulatif. Server sekarang menyertakan penghitung spec-decode di endpoint /metrics-nya, memungkinkan pengguna melacak metrik kinerja terkait fitur ini.

  • Menambahkan penghitung spec-decode ke endpoint /metrics untuk observabilitas yang lebih baik.
  • Menyelaraskan nama parameter secara tepat dengan vLLM setelah umpan balik tinjauan.
  • Menyediakan biner untuk macOS (Apple Silicon dan Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, HIP), dan openEuler.

Pembaruan ini meningkatkan kemampuan untuk memantau kinerja decoding spekulatif sambil mempertahankan kompatibilitas dengan konvensi penamaan parameter vLLM.