llama.cpp प्रोजेक्ट ने संस्करण 0.5.0 जारी किया है, जिसका ध्यान बैकएंड प्रदर्शन, व्यापक मॉडल कवरेज और अधिक मजबूत सर्वर संचालन पर है। यह अपडेट HRM-Text (DFM Mimir 1B) और MiMo-V2.6 जैसे नए आर्किटेक्चर्स के लिए समर्थन पेश करता है, जबकि CUDA और Metal अनुकूलनों के माध्यम से गणनात्मक दक्षता में उल्लेखनीय सुधार करता है।

  • अंतर्निहित GEMM का उपयोग करके CUDA conv2d संचालन को त्वरित करता है।
  • Metal MoE और SSM_CONV फ्यूजन अनुकूलन जोड़ता है।
  • सर्वर को कॉमा-सेपरेटेड TCP पते और UNIX सोकेट्स के माध्यम से कई पतों से बाइंड करने की अनुमति देता है।
  • input_image समर्थन जोड़कर फंक्शन कॉल से छवि आउटपुट सक्षम करता है।

ggml को v0.25.0 तक अपडेट करता है, जिससे बैकएंड्स में हाइपर-कनेक्शन और फ्लैश-एटेंशन समर्थन का विस्तार होता है।

रिलीज राउटर-स्पॉन्डेड चिल्ड्रन के लिए स्थिरता को बेहतर बनाती है और कई चैट पार्सर समस्याओं को ठीक करती है, जिससे उत्पादन वातावरण में llama.cpp तैनात करने वाले उपयोगकर्ताओं के लिए अधिक विश्वसनीय संचालन सुनिश्चित होता है।