vLLM परियोजना ने संस्करण 0.29.0 जारी किया, जिसमें घन प्रीफ़िक्स कैश से संबंधित एक मुख्य बग फिक्स शामिल है।
- अपडेट विशेष रूप से हाइब्रिड मॉडलों के लिए घन प्रीफ़िक्स कैश डिफ़ॉल्ट सेटिंग लागू करता है।
vLLM परियोजना ने संस्करण 0.29.0 जारी किया, जिसमें घन प्रीफ़िक्स कैश से संबंधित एक मुख्य बग फिक्स शामिल है।
llama.cpp प्रोजेक्ट ने संस्करण b10891 जारी किया, जो PowerVR GPU पर एक महत्वपूर्ण स्थिरता समस्या को संबोधित करता है। अपडेट Vulkan बैकएंड को डीक्वांटाइज़्ड मैट्रिक्स-वेक्टर मल्टीप्लिकेशन (dmmv) संचालन के लिए साझा-स्मृति ह्रास पर वापस जाने के लिए संशोधित करता है।
DeepSeek AI ने DeepSeek-V4.1-Flash जारी किया है, जो एक बहुमोडल मिक्स्चर-ऑफ-एक्सपर्ट्स मॉडल है जिसमें 1-मिलियन-टोकन संदर्भ विंडो और FP4 KV कैश शामिल है जो प्रति टोकन 890 बाइट के वैश्विक कैश फुटप्रिंट को कम करता है। मॉडल एक कारणवादी एन्कोडर-डीकोडर आर्किटेक्चर और कॉम्प्रेस्ड स्पार्स एटेंशन 2 (CSA2) का उपयोग करता है जो प्रदर्शन बनाए रखते हुए मेमोरी की आवश्यकताओं को काफी कम करता है।
llama.cpp प्रोजेक्ट ने b10889 बिल्ड जारी की है, जिसमें एक मेमोरी ऑप्टिमाइजेशन शामिल है जो इंडेक्सर के लिए V कैश आवंटित करने से बचता है क्योंकि इसका उपयोग नहीं किया जाता है।
llama.cpp परियोजना ने बिल्ड b10888 जारी किया है, जिसमें Vulkan बैकएंड में GPU प्रोफ़ाइलर्स के लिए कमांड-बफर डीबग लेबल्स जोड़ने की एक नई सुविधा शामिल है।
llama.cpp प्रोजेक्ट ने बिल्ड b10886 जारी किया, जिसने s390x आर्किटेक्चर के लिए Q1_0 वेक्टर इनट्रिंसिक समर्थन पेश किया। इस अपडेट में `ggml_vec_dot_q1_0_q8_0` का कार्यान्वयन शामिल है और नई क्षमता को प्रतिबिंबित करने के लिए दस्तावेज़ीकरण को अपडेट किया गया है।
हम ट्रैफ़िक मापने और साइट को बेहतर बनाने के लिए कुकीज़ का उपयोग करते हैं। आप एनालिटिक्स कुकीज़ स्वीकार या अस्वीकार कर सकते हैं। गोपनीयता नीति