أصدر مشروع llama.cpp الإصدار b10429، الذي يعدل الخادم للسماح بالوصول إلى نقاط النهاية /metrics و /slots أثناء تنفيذ llama_decode().
- يحدث التغيير server_queue::worker لاستدعاء llama_decode داخل yield_to_queue.
- كما يعالج process_mtmd_chunk أثناء هذه العملية.
- تتوفر الملفات الثنائية لأنظمة macOS (Apple Silicon و Intel)، Linux (CPU، Vulkan، OpenVINO، SYCL)، Android، Windows (CPU، CUDA 12/13، Vulkan، OpenVINO، SYCL، ROCm)، و openEuler.
يحسن هذا التحديث استجابة الخادم عن طريق منع حظر نقاط النهاية أثناء استدلال النموذج.