llama.cpp प्रोजेक्ट ने संस्करण b10429 जारी किया, जो सर्वर को संशोधित करता है ताकि llama_decode() चल रहे होने पर /metrics और /slots एंडपॉइंट्स तक पहुंच की अनुमति मिल सके।

  • यह बदलाव server_queue::worker को yield_to_queue के अंदर llama_decode को कॉल करने के लिए अपडेट करता है।
  • यह इस ऑपरेशन के दौरान process_mtmd_chunk को भी संभालता है।
  • बाइनरी macOS (Apple Silicon और Intel), Linux (CPU, Vulkan, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), और openEuler के लिए उपलब्ध हैं।

यह अपडेट मॉडल इनफरेंस के दौरान एंडपॉइंट ब्लॉकिंग को रोककर सर्वर की प्रतिक्रिया क्षमता को बेहतर बनाता है।