Local inference
media Hugging Face Forums · 2 घंटे पहले · 2 बार देखा गया

vLLM Launcher स्थानीय LLM इनफरेंस के लिए विंडोज डेस्कटॉप वर्कबेंच प्रदान करता है

vLLM Launcher नामक एक नया परियोजना WSL2 के माध्यम से स्थानीय बड़े भाषा मॉडल इनफरेंस को प्रबंधित करने के लिए डिज़ाइन किए गए विंडोज डेस्कटॉप एप्लिकेशन के रूप में जारी किया गया है। यह टूल उपयोगकर्ताओं को एकल ग्राफिकल इंटरफ़ेस से vLLM, SGLang और llama.cpp सहित कई इंजन बैकएंड्स को नियंत्रित करने की अनुमति देता है।

github llama.cpp · 15 घंटे पहले

llama.cpp b10330 CUDA पर rms_norm, mul और rope को फ्यूज करता है

llama.cpp प्रोजेक्ट ने संस्करण b10330 जारी किया है, जिसमें एक CUDA अनुकूलन पेश किया गया है जो rms_norm, गुणा और RoPE ऑपरेशन को एकल kernel में फ्यूज करता है। इस बदलाव के साथ फ्यूज किए गए ऑपरेशन के लिए मेमोरी रेंज चेक और ब्रॉडकास्ट वेट्स के लिए नए टेस्ट केस शामिल हैं।

github llama.cpp · 16 घंटे पहले · 5 बार देखा गया

llama.cpp b10328 ने Docker के माध्यम से सर्वर टूल अलगाव जोड़ा है

llama.cpp परियोजना ने बिल्ड b10328 जारी किया है, जिसने Docker का उपयोग करके सर्वर घटक के भीतर टूल्स को अलग करने के लिए प्रारंभिक समर्थन पेश किया है। इस अपडेट में टूल I/O सैंडबॉक्स को अलग करने और प्रासंगिक कॉन्फ़िगरेशन फ्लैग को पुनः नामित करने के लिए दस्तावेज़ीकरण और कोड अनुकूलन शामिल हैं।

github llama.cpp · 16 घंटे पहले

llama.cpp b10329 केवल तभी वर्किंग डायरेक्टरी दिखाता है जब कोई टूल उसे पढ़ता है

llama.cpp सर्वर और UI को वर्किंग डायरेक्टरी नियंत्रण की शर्तवाट प्रदर्शित करने के लिए अपडेट किया गया है। पहले, यह तब भी दिखाई देता था जब कोई भी बिल्ट-इन टूल एक्सपोज़ किया जाता था, भले ही कोई टूल वास्तव में इसका उपयोग न कर रहा हो।

github llama.cpp · 1 दिन पहले · 2 बार देखा गया

llama.cpp b10327 में क्वांटाइज्ड कॉपी kernel में थ्रेड/ब्लॉक गणना ठीक करता है

llama.cpp प्रोजेक्ट ने संस्करण b10327 जारी किया, जिसमें CUDA पर क्वांटाइज्ड कॉपी kernel लॉन्च में थ्रेड और ब्लॉक गणना के लिए एक सुधार शामिल है। यह अपडेट pull request #26731 में पहचाने गए एक मुद्दे को संबोधित करता है।

github llama.cpp · 2 दिन पहले · 3 बार देखा गया

llama.cpp b10313 सर्वर में LRU शेड्यूलर जोड़ता है

llama.cpp परियोजना ने संस्करण b10313 जारी किया है, जिसने इसके सर्वर घटक के लिए एक नवीनतम उपयोग किए गए (LRU) शेड्यूलर को पेश किया है। इस अपडेट में अनुरोध कोalescense का प्रबंधन और स्ट्रीमिंग मामलों के लिए ठीक शामिल हैं।

github llama.cpp · 2 दिन पहले · 1 बार देखा गया

भीड़भाड़ वाले मॉडल्स के लिए सर्वर फिक्स के साथ llama.cpp b10312 रिलीज़

llama.cpp प्रोजेक्ट ने संस्करण b10312 जारी किया है, जिसमें सर्वर घटक को एक विशिष्ट अपडेट शामिल है। मुख्य बदलाव उस समस्या को संबोधित करता है जहाँ भीड़भाड़ वाले मॉडल्स राउटर से बाहर निकाल दिए जा रहे थे।

github llama.cpp · 2 दिन पहले · 1 बार देखा गया

llama.cpp b10307 ने SYCL NVFP4 पार्सिंग को ठीक किया

llama.cpp प्रोजेक्ट ने संस्करण b10307 जारी किया, जिसमें NVFP4 क्वांटीज़ेशन में उपयोग किए जाने वाले UE4M3 स्केलिंग कारकों को सही ढंग से पार्स करने के लिए SYCL GPU कोड में एक सुधार शामिल है।

github llama.cpp · 2 दिन पहले

llama.cpp b10298 ने mtmd मॉड्यूल के लिए चंक सेव/लोड फ़ंक्शन जोड़ा है

llama.cpp प्रोजेक्ट ने b10298 बिल्ड जारी किया है, जिसने mtmd मॉड्यूल के लिए एक नया चंक सेव और लोड फ़ंक्शन पेश किया है। इस अपडेट में कोड की सफाई और अतिरिक्त परीक्षण भी शामिल हैं।

github llama.cpp · 4 दिन पहले · 1 बार देखा गया

llama.cpp b10282 ने /metrics एंडपॉइंट में spec-decode काउंटर जोड़े हैं

llama.cpp परियोजना ने संस्करण b10282 जारी किया है, जिसमें अनुमानित डिकोडिंग के लिए नए मॉनिटरिंग क्षमताएं पेश की गई हैं। सर्वर अब अपने /metrics एंडपॉइंट में spec-decode काउंटर शामिल करता है, जिससे उपयोगकर्ता इस सुविधा से संबंधित प्रदर्शन मापदंडों को ट्रैक कर सकते हैं।

github llama.cpp · 5 दिन पहले · 3 बार देखा गया

llama.cpp b10271 में प्रति-संवाद कार्य निर्देशिका और विंडोज पथ समर्थन जोड़ा गया

llama.cpp b10271 रिलीज़ ने UI में प्रति-संवाद कार्य निर्देशिका सुविधा को पेश किया है, जिससे उपयोगकर्ता प्रत्येक चैट सत्र के लिए निर्देशिकाओं को स्वतंत्र रूप से सेट और नेविगेट कर सकते हैं।

github llama.cpp · 5 दिन पहले · 5 बार देखा गया

llama.cpp b10270 ने Qwen3-TTS समर्थन जोड़ा है और llama-tts में ब्रेकिंग बदलाव किए हैं

llama.cpp प्रोजेक्ट ने संस्करण b10270 जारी किया, जिसमें Qwen3-TTS मॉडल के लिए समर्थन पेश किया गया है। इस अपडेट में llama-tts बाइनरी के लिए एक ब्रेकिंग बदलाव शामिल है और नए टेक्स्ट-टू-स्पीच वर्कफ़्लो को संभालने के लिए महत्वपूर्ण आर्किटेक्चरल संशोधन लागू किए गए हैं।

github llama.cpp · 5 दिन पहले

llama.cpp b10259 लोड के दौरान टेंसर को पुनः आकार देने की अनुमति देता है

llama.cpp प्रोजेक्ट ने बिल्ड b10259 जारी किया है, जो लोडिंग प्रक्रिया के दौरान टेंसर को पुनः आकार देने की क्षमता पेश करता है।

github llama.cpp · 5 दिन पहले · 3 बार देखा गया

llama.cpp b10254 ने DeepSeek V4 Flash 0731 टेम्पलेट जोड़ा और V4 टेम्पलेट्स को अपडेट किया

llama.cpp प्रोजेक्ट ने संस्करण b10254 जारी किया, जिसमें DeepSeek V4 Flash 0731 मॉडल के लिए एक नया चैट टेम्पलेट पेश किया गया है, साथ ही मौजूदा DeepSeek V4 टेम्पलेट्स में अपडेट किए गए हैं।

github llama.cpp · 6 दिन पहले · 2 बार देखा गया

llama.cpp b10238 ने Qwen3-Next के लिए MTP समर्थन जोड़ा

llama.cpp प्रोजेक्ट ने b10238 बिल्ड जारी किया, जिसमें Qwen3-Next मॉडल परिवार के लिए Multi-Token Prediction (MTP) समर्थन पेश किया गया है। इस अपडेट में MTP परतों को हैंडल करने के लिए विशिष्ट कार्यान्वयन बदलाव और कोडबेस के भीतर पायथन टाइप चेकिंग से संबंधित सुधार शामिल हैं।

github llama.cpp · 7 दिन पहले · 7 बार देखा गया

llama.cpp b10232 ने Metal में DeepSeek V4 हाइपर-कनेक्शन लागू किए

llama.cpp प्रोजेक्ट ने बिल्ड b10232 जारी किया, जिसमें Metal बैकएंड के माध्यम से DeepSeek V4 हाइपर-कनेक्शन का समर्थन पेश किया गया है। इस अपडेट में GGML_OP_DSV4_HC_COMB, GGML_OP_DSV4_HC_PRE और GGML_OP_DSV4_HC_POST ऑपरेशन की कार्यान्वयन जोड़ा गया है।

github llama.cpp · 8 दिन पहले · 10 बार देखा गया

llama.cpp b10219 चैट इतिहास में reasoning_content को बनाए रखता है

llama.cpp प्रोजेक्ट ने संस्करण b10219 जारी किया, जिसमें चैट इतिहास के भीतर तर्क सामग्री को बनाए रखने के लिए CLI के लिए एक सुधार शामिल है। पहले, जबकि `llama-cli` प्रदर्शन के लिए स्ट्रीम से तर्क एकत्र करता था, यह संदेशों में केवल सहायक सामग्री को संग्रहीत करता था, जिससे `--reasoning-preserve` फ्लैग बाद की बारी में पूर्व विचारों को फिर से इंजेक्ट करने में असमर्थ था।

github llama.cpp · 9 दिन पहले · 9 बार देखा गया

llama.cpp b10213 में घुमाए गए kv कैश क्वांटीकरण के लिए समर्थन जोड़ा गया

llama.cpp परियोजना ने संस्करण b10213 जारी किया है, जिसमें घुमाए गए कुंजी-मान कैश क्वांटीकरण के लिए समर्थन पेश किया गया है। यह अपडेट विभिन्न प्लेटफार्मों और हार्डवेयर त्वरकों पर उपलब्ध है।