Proyek llama.cpp merilis versi b10429, yang memodifikasi server untuk mengizinkan akses ke endpoint /metrics dan /slots saat llama_decode() sedang dieksekusi.
- Perubahan ini memperbarui server_queue::worker untuk memanggil llama_decode di dalam yield_to_queue.
- Ini juga menangani process_mtmd_chunk selama operasi ini.
- Binari tersedia untuk macOS (Apple Silicon dan Intel), Linux (CPU, Vulkan, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), dan openEuler.
Pembaruan ini meningkatkan responsivitas server dengan mencegah blokir endpoint selama inferensi model.