أصدر مشروع llama.cpp الإصدار b10429، الذي يعدل الخادم للسماح بالوصول إلى نقاط النهاية /metrics و /slots أثناء تنفيذ llama_decode().

  • يحدث التغيير server_queue::worker لاستدعاء llama_decode داخل yield_to_queue.
  • كما يعالج process_mtmd_chunk أثناء هذه العملية.
  • تتوفر الملفات الثنائية لأنظمة macOS (Apple Silicon و Intel)، Linux (CPU، Vulkan، OpenVINO، SYCL)، Android، Windows (CPU، CUDA 12/13، Vulkan، OpenVINO، SYCL، ROCm)، و openEuler.

يحسن هذا التحديث استجابة الخادم عن طريق منع حظر نقاط النهاية أثناء استدلال النموذج.