Проект llama.cpp выпустил версию b10282, которая внедряет новые возможности мониторинга для спекулятивного декодирования. Сервер теперь включает счетчики spec-decode в своей конечной точке /metrics, позволяя пользователям отслеживать метрики производительности, связанные с этой функцией.

  • Добавлены счетчики spec-decode в конечную точку /metrics для лучшей наблюдаемости.
  • Имена параметров точно согласованы с vLLM после получения обратной связи при рецензировании.
  • Предоставлены бинарные файлы для macOS (Apple Silicon и Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, HIP) и openEuler.

Это обновление улучшает возможность мониторинга производительности спекулятивного декодирования при сохранении совместимости с соглашениями об именовании параметров vLLM.