Local inference
github llama.cpp · 1 घंटे पहले · 10 बार देखा गया लाइव

llama.cpp b11120 ने Vulkan के आंतरिक प्रतीकों को छिपाकर स्टेट विनाश की समस्या को ठीक किया

llama.cpp परियोजना ने संस्करण b11120 जारी किया, जिसने आंतरिक प्रतीकों को छिपाकर Vulkan बैकएंड में एक गंभीर बग को ठीक किया। यह बदलाव उन डुप्लिकेट-dlopen स्टेट विनाश समस्याओं को रोकता है जो तब होती थीं जब आंतरिक प्रतीक एक्सपोर्ट किए जाते थे।

github llama.cpp · 6 घंटे पहले · 13 बार देखा गया

llama.cpp b11118 ने HVX FA मस्क हैंडलिंग के लिए डायरेक्ट-मैप्ड DMA कैश पेश किया

llama.cpp प्रोजेक्ट ने बिल्ड b11118 जारी किया है, जिसमें एक नया hex-dma फीचर शामिल है जो एक डायरेक्ट-मैप्ड DMA कैश पेश करता है जो Hexagon Vector eXtended (HVX) FA मस्क हैंडलिंग के लिए अधिक उपयुक्त है।

github llama.cpp · 17 घंटे पहले · 9 बार देखा गया

llama.cpp ने HunyuanOCR के लिए DFlash समर्थन जोड़ा और ड्राफ्ट रूपांतरण में सुधार किया

llama.cpp परियोजना ने लक्ष्य ग्राफ़ में परत इनपुट टेंसर को उजागर करके, HunyuanOCR मॉडल के साथ DFlash स्पेकुलेटिव डिकोडिंग का समर्थन जोड़ा है। इस बदलाव से ड्राफ्ट मॉडल अवशेष स्ट्रीम को पढ़ सकता है, जिससे छवि अनुरोध लगभग 0.5 की ड्राफ्ट स्वीकृति दर के साथ और गैर-स्पेकुलेटिव रन के सापेक्ष बाइट-समान OCR आउटपुट के साथ सफलतापूर्वक चल सकते हैं।

github llama.cpp · 17 घंटे पहले · 13 बार देखा गया

llama.cpp b11104 ने llama-server को कई पते बांधने का समर्थन जोड़ा है

llama.cpp प्रोजेक्ट ने संस्करण b11104 जारी किया, जिसमें एक नई सुविधा शामिल है जो llama-server घटक को एक साथ कई नेटवर्क पतों से बांधने की अनुमति देती है।

lab Hugging Face Blog · 21 घंटे पहले · 10 बार देखा गया

स्थानीय निष्पादन के लिए ggml kernels के माध्यम से Transformers में GGUF समर्थन जोड़ा गया

Hugging Face की Transformers लाइब्रेरी अब GGUF क्वांटाइज्ड मॉडल लोड करने का समर्थन करती है, जिसमें llama.cpp के निकट प्रदर्शन लाने के लिए underlying ggml kernels का उपयोग किया गया है। इस एकीकरण से डेवलपर्स को समर्थित हार्डवेयर पर मानक PyTorch-आधारित API के भीतर ही क्वांटाइज्ड चेकपॉइंट्स चلانے की सुविधा मिलती है।

lab Hugging Face Blog · 1 दिन पहले · 11 बार देखा गया

oMLX के निर्माता जून किम MLX समुदाय का समर्थन करने के लिए Hugging Face में शामिल हुए

oMLX के निर्माता और रखरखावकर्ता जून किम ने MLX समुदाय का समर्थन करने के लिए Hugging Face में शामिल हो गए हैं। यह कदम ओपन-सोर्स प्रोजेक्ट को एक साइड जॉब से पूरी तरह बनाए रखी गई और वित्त पोषित पहल में बदलने के द्वारा स्थिरता और तेज़ विकास प्रदान करने के उद्देश्य से है।

media Hugging Face Forums · 1 दिन पहले · 11 बार देखा गया

स्थानीय ग्रीक उपयोग के लिए Llama-Krikri-8B-Instruct को अक्षम करने की कार्यप्रणाली की खोज

एक उपयोगकर्ता ilsp/Llama-Krikri-8B-Instruct चेकपॉइंट का उपयोग करके स्थानीय तैनाती के लिए एक अनियंत्रित, ग्रीक-स्थानीय बड़े भाषा मॉडल बनाने की योजना बना रहा है। प्रस्तावित योजना में Heretic (heretic-llm) के साथ मॉडल को अक्षम करना, इसे GGUF Q4_K_M फ़ॉर्मेट में परिवर्तित करना, और Vulkan के माध्यम से AMD Ryzen AI MAX+ 395 प्रोसेसर से लैस GMKtec EVO-X3 पर निष्पादन शामिल है।

github llama.cpp · 1 दिन पहले · 14 बार देखा गया

llama.cpp b11090 ने sm_70 टाइल कंपाइलेशन त्रुटि को ठीक किया

llama.cpp प्रोजेक्ट ने संस्करण b11090 जारी किया, जिसमें sm_70 टाइल कंपाइलेशन त्रुटि के लिए एक सुधार शामिल है। अपडेट ने Volta आर्किटेक्चर के साथ असंगतता को हल करने के लिए 5-तर्क load_ldmatrix फ़ंक्शन के टाइल आकार को सामान्य बना दिया है।

github llama.cpp · 2 दिन पहले · 12 बार देखा गया

कॉन्फ़िगर करने योग्य टेंसर डेटा स्टैंडर्ड डेविएशन और सुधारे गए परीक्षण उपकरणों के साथ llama.cpp b11081 रिलीज़

llama.cpp प्रोजेक्ट ने बिल्ड b11081 जारी किया है, जिसमें `test-llama-archs` परीक्षण इंफ्रास्ट्रक्चर में कई अपडेट शामिल हैं। मुख्य बदलावों में टेंसर डेटा स्टैंडर्ड डेविएशन को कॉन्फ़िगर करने योग्य बनाना, उपयोग उदाहरणों का विस्तार करना और आर्किटेक्चर रेगेक्स पैटर्न के लिए समर्थन जोड़ना शामिल हैं।

github llama.cpp · 2 दिन पहले · 11 बार देखा गया

llama.cpp b11074 ने JSON enum हैंडलिंग ठीक की

llama.cpp प्रोजेक्ट ने बिल्ड b11074 जारी किया, जिसमें JSON enum हैंडलिंग के लिए एक सुधार शामिल है। अपडेट में enum मानों के लिए common_json_value समर्थन जोड़ा गया है और कोड को सरल बनाया गया है जिसमें enum कंस्ट्रक्टर को अंतर्निहित प्रकार के कंस्ट्रक्टर पर सौंप दिया गया है।

github llama.cpp · 3 दिन पहले · 16 बार देखा गया

llama.cpp b11060 में Mamba के समय-चरण प्रक्षेपण को ठीक किया गया और सतत कॉपी को छोड़ा गया

llama.cpp परियोजना ने बिल्ड b11060 जारी किया, जिसमें Mamba मॉडल के लिए एक सुधार शामिल है ताकि समय-चरण प्रक्षेपण इनपुट सतत हो। यह बदलाव Mamba कार्यान्वयन के भीतर मेमोरी लेआउट समस्याओं को दूर करता है।

github llama.cpp · 4 दिन पहले · 16 बार देखा गया

llama.cpp b11054 ने TOP_K समर्थन के लिए Hexagon को सक्षम किया

llama.cpp परियोजना ने संस्करण b11054 जारी किया, जिसमें Qualcomm Hexagon DSPs पर TOP_K ऑपरेटर के लिए समर्थन जोड़ा गया है। इस अपडेट में सिंगल-रो प्रसंस्करण के लिए अनुकूलन और रो विभाजन के लिए सुधार शामिल हैं।

github llama.cpp · 4 दिन पहले · 29 बार देखा गया

llama.cpp b11053 मॉडल स्रोत दिखाकर सर्वर स्टार्टअप लॉग को बेहतर बनाता है

llama.cpp प्रोजेक्ट ने संस्करण b11053 जारी किया, जिसमें सर्वर के स्टार्टअप लॉग संदेशों में एक विशिष्ट सुधार शामिल है। यह बदलाव मॉडल कैसे लोड किए जाते हैं, इसकी दृश्यता को बढ़ाता है, cryptic मार्करों को स्पष्ट स्रोत टैग्स से बदलकर।

github llama.cpp · 4 दिन पहले · 19 बार देखा गया

llama.cpp b11048 में qwen4exp HC ऑप्स और नए बाइनरी जोड़े गए

llama.cpp प्रोजेक्ट ने बिल्ड b11048 जारी किया है, जिसमें qwen4exp द्वारा उपयोग किए जाने वाले नए DSV4 HC ऑप वेरिएंट्स के लिए समर्थन शामिल है। इस अपडेट में प्रति-तत्व सिग्मॉइड गेट के साथ hc_pre और पहचान मिक्सिंग के साथ hc_post के लिए विशिष्ट कार्यान्वयन शामिल हैं।

media Hugging Face Forums · 4 दिन पहले · 9 बार देखा गया

GTX/RTX कार्ड्स के लिए Celestium CARE NVIDIA संस्करण जारी

NVIDIA के लिए Celestium CARE का संस्करण पूर्ण हो गया है और GTX व RTX ग्राफिक्स कार्ड्स के लिए एक पेशेवर उपकरण के रूप में उपलब्ध कराया गया है। यह VRAM सफाई, ऑटो-सफाई शेड्यूल और पूर्ण टेलीमेट्री मॉनिटरिंग जैसे सुविधाओं को प्रदान करने के लिए NVML का उपयोग करता है।

github llama.cpp · 4 दिन पहले · 21 बार देखा गया

llama.cpp b11046 ने flash_attn_f32_f16_bin kernel के लिए OpenCL समर्थन जोड़ा है

llama.cpp परियोजना ने संस्करण b11046 जारी किया, जिसने `flash_attn_f32_f16_bin` kernel के लिए OpenCL समर्थन पेश किया। इस अपडेट में OpenCL उपकरणों पर Flash Attention के लिए सुरक्षित prefill कार्यक्षमता भी शामिल है।

github llama.cpp · 5 दिन पहले · 18 बार देखा गया

llama.cpp b11042 ने A8 Q6_K बाइनरी कर्नेल जोड़ा है

llama.cpp परियोजना ने संस्करण b11042 जारी किया है, जिसमें A8 Q6_K गैर-MoE मॉडलों के लिए एक नया OpenCL बाइनरी कर्नेल पेश किया गया है। इस अपडेट में OpenCL बैकएंड के भीतर लेआउट संगतता के लिए ठीक किए गए हैं।