Проект llama.cpp выпустил версию b10429, которая изменяет сервер, позволяя обращаться к конечным точкам /metrics и /slots во время выполнения llama_decode().

  • Изменение обновляет server_queue::worker для вызова llama_decode внутри yield_to_queue.
  • Оно также обрабатывает process_mtmd_chunk во время этой операции.
  • Бинарные файлы доступны для macOS (Apple Silicon и Intel), Linux (CPU, Vulkan, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm) и openEuler.

Это обновление улучшает отзывчивость сервера, предотвращая блокировку конечных точек во время вывода модели.