Proyek llama.cpp merilis versi b10429, yang memodifikasi server untuk mengizinkan akses ke endpoint /metrics dan /slots saat llama_decode() sedang dieksekusi.

  • Perubahan ini memperbarui server_queue::worker untuk memanggil llama_decode di dalam yield_to_queue.
  • Ini juga menangani process_mtmd_chunk selama operasi ini.
  • Binari tersedia untuk macOS (Apple Silicon dan Intel), Linux (CPU, Vulkan, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), dan openEuler.

Pembaruan ini meningkatkan responsivitas server dengan mencegah blokir endpoint selama inferensi model.