Proyek llama.cpp merilis versi b10519, yang mencakup refaktor signifikan pada mekanisme penanganan tidur server. Perubahan ini memungkinkan endpoint /metrics tetap dapat diakses saat server berada dalam keadaan tidur.

  • Melakukan refaktor logika on_sleeping_state dan memisahkan tugas/hasil metrik dan slot.
  • Menambahkan respons ter-cache dan memperbaiki kondisi balapan pada timer tugas metrik.
  • Memperbaiki get_res_model_info dan memperbarui dokumentasi.
  • Menyediakan biner untuk macOS (Apple Silicon/Intel), Linux (CPU, Vulkan, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, ROCm), Android, dan openEuler.