llama.cpp प्रोजेक्ट ने संस्करण b10199 जारी किया है, जिसने अपने सर्वर घटक में नई क्षमताएं पेश की हैं। प्राथमिक अपडेट सर्वर को अगले टोकन उत्पन्न करने के लिए एम्बेडिंग का समर्थन करने सक्षम बनाता है, विशेष रूप से नमूना किए गए टोकनों के एम्बेडिंग के लिए समर्थन जोड़ता है।

  • सर्वर अब अगले-टोकन पूर्वानुमान कार्यप्रवाह को सुविधाजनक बनाने के लिए नमूना किए गए टोकनों के लिए एम्बेडिंग जनरेशन का समर्थन करता है।
  • ~server_batch() डीस्ट्रक्टर में एक ठीक किया गया था।
  • इस रिलीज़ में KleidiAI के साथ macOS Apple Silicon (arm64) बिल्ड्स अक्षम हैं।
  • CPU, CUDA, Vulkan, ROCm, OpenVINO, SYCL, और OpenCL बैकएंड्स के लिए Linux, Windows, Android, और macOS के लिए पूर्व-निर्मित बाइनरी उपलब्ध हैं।

यह अपडेट उन उपयोगकर्ताओं को सुविधा प्रदान करता है जो llama.cpp सर्वर का लाभ उठा रहे हैं, जिससे वे जनरेशन के दौरान टोकन एम्बेडिंग तक सीधे पहुंच सकते हैं, जो आउटपुट टोकनों के सदिश निरूपण की आवश्यकता वाली अनुप्रयोगों के लिए उपयोगी है।