Inference efficiency
media Hugging Face Forums · 2 घंटे पहले · 2 बार देखा गया

vLLM Launcher स्थानीय LLM इनफरेंस के लिए विंडोज डेस्कटॉप वर्कबेंच प्रदान करता है

vLLM Launcher नामक एक नया परियोजना WSL2 के माध्यम से स्थानीय बड़े भाषा मॉडल इनफरेंस को प्रबंधित करने के लिए डिज़ाइन किए गए विंडोज डेस्कटॉप एप्लिकेशन के रूप में जारी किया गया है। यह टूल उपयोगकर्ताओं को एकल ग्राफिकल इंटरफ़ेस से vLLM, SGLang और llama.cpp सहित कई इंजन बैकएंड्स को नियंत्रित करने की अनुमति देता है।

github llama.cpp · 9 घंटे पहले · 4 बार देखा गया

llama.cpp b10331 सर्वर get_info को सही अलग कार्य निर्देशिका रिपोर्ट करने के लिए ठीक करता है

llama.cpp परियोजना ने बिल्ड b10331 जारी किया, जिसमें सर्वर के `get_info` एंडपॉइंट के लिए एक सुधार शामिल है। पहले, जब कोई स्पष्ट वर्तमान कार्य निर्देशिका प्रदान नहीं की जाती थी, तो फ़ंक्शन गलत रूप से सर्वर प्रक्रिया की कार्य निर्देशिका पर वापस चला जाता था, भले ही tools runtime कॉन्फ़िगर किया गया हो।

github llama.cpp · 15 घंटे पहले

llama.cpp b10330 CUDA पर rms_norm, mul और rope को फ्यूज करता है

llama.cpp प्रोजेक्ट ने संस्करण b10330 जारी किया है, जिसमें एक CUDA अनुकूलन पेश किया गया है जो rms_norm, गुणा और RoPE ऑपरेशन को एकल kernel में फ्यूज करता है। इस बदलाव के साथ फ्यूज किए गए ऑपरेशन के लिए मेमोरी रेंज चेक और ब्रॉडकास्ट वेट्स के लिए नए टेस्ट केस शामिल हैं।

github llama.cpp · 16 घंटे पहले · 5 बार देखा गया

llama.cpp b10328 ने Docker के माध्यम से सर्वर टूल अलगाव जोड़ा है

llama.cpp परियोजना ने बिल्ड b10328 जारी किया है, जिसने Docker का उपयोग करके सर्वर घटक के भीतर टूल्स को अलग करने के लिए प्रारंभिक समर्थन पेश किया है। इस अपडेट में टूल I/O सैंडबॉक्स को अलग करने और प्रासंगिक कॉन्फ़िगरेशन फ्लैग को पुनः नामित करने के लिए दस्तावेज़ीकरण और कोड अनुकूलन शामिल हैं।

github llama.cpp · 1 दिन पहले · 2 बार देखा गया

llama.cpp b10327 में क्वांटाइज्ड कॉपी kernel में थ्रेड/ब्लॉक गणना ठीक करता है

llama.cpp प्रोजेक्ट ने संस्करण b10327 जारी किया, जिसमें CUDA पर क्वांटाइज्ड कॉपी kernel लॉन्च में थ्रेड और ब्लॉक गणना के लिए एक सुधार शामिल है। यह अपडेट pull request #26731 में पहचाने गए एक मुद्दे को संबोधित करता है।

github llama.cpp · 1 दिन पहले · 2 बार देखा गया

llama.cpp b10326 टाइमिंग में वोकॉडर पास को शामिल करता है

llama.cpp प्रोजेक्ट ने बिल्ड b10326 जारी किया, जो वोकॉडर पास को शामिल करके टाइमिंग मापन की गणना के तरीके को संशोधित करता है।

github llama.cpp · 2 दिन पहले

llama.cpp b10321 ने आंशिक simdgroup पंक्ति लंबाई के लिए NORM/RMS_NORM को ठीक किया

llama.cpp प्रोजेक्ट ने संस्करण b10321 जारी किया, जिसमें Metal पर GGML_OP_NORM और GGML_OP_RMS_NORM संचालनों के लिए एक महत्वपूर्ण सुधार शामिल है। यह अपडेट एक समस्या को हल करता है जहां थ्रेडगुप्स का आकार आंशिक SIMD समूह छोड़ने के लिए निर्धारित होता था, जिसके कारण गिराए गए आंशिक योगों के कारण माध्य और प्रसरण की गणना गलत हो जाती थी।

github llama.cpp · 2 दिन पहले · 1 बार देखा गया

llama.cpp b10322 ~1.85x गति वृद्धि के लिए SSM_CONV विंडो लोड्स को coalesce करता है

llama.cpp प्रोजेक्ट ने बिल्ड b10322 जारी किया, जिसमें SYCL बैकएंड में SSM_CONV विंडो लोड्स को coalesce करने वाला एक प्रदर्शन अनुकूलन शामिल है।

github llama.cpp · 2 दिन पहले · 3 बार देखा गया

llama.cpp b10313 सर्वर में LRU शेड्यूलर जोड़ता है

llama.cpp परियोजना ने संस्करण b10313 जारी किया है, जिसने इसके सर्वर घटक के लिए एक नवीनतम उपयोग किए गए (LRU) शेड्यूलर को पेश किया है। इस अपडेट में अनुरोध कोalescense का प्रबंधन और स्ट्रीमिंग मामलों के लिए ठीक शामिल हैं।

github llama.cpp · 2 दिन पहले

llama.cpp b10311 Qwen3-TTS टेक्स्ट स्ट्रीम डुप्लिकेशन को ठीक करता है

llama.cpp प्रोजेक्ट ने बिल्ड b10311 जारी किया, जिसमें Qwen3-TTS पाइलाइन के लिए एक सुधार शामिल है। अपडेट ने उस समस्या को हल कर दिया जहां मॉडल जनरेशन के दौरान इनपुट उच्चारण को दो बार पढ़ता था।

github llama.cpp · 2 दिन पहले · 1 बार देखा गया

भीड़भाड़ वाले मॉडल्स के लिए सर्वर फिक्स के साथ llama.cpp b10312 रिलीज़

llama.cpp प्रोजेक्ट ने संस्करण b10312 जारी किया है, जिसमें सर्वर घटक को एक विशिष्ट अपडेट शामिल है। मुख्य बदलाव उस समस्या को संबोधित करता है जहाँ भीड़भाड़ वाले मॉडल्स राउटर से बाहर निकाल दिए जा रहे थे।

github llama.cpp · 2 दिन पहले · 1 बार देखा गया

llama.cpp b10307 ने SYCL NVFP4 पार्सिंग को ठीक किया

llama.cpp प्रोजेक्ट ने संस्करण b10307 जारी किया, जिसमें NVFP4 क्वांटीज़ेशन में उपयोग किए जाने वाले UE4M3 स्केलिंग कारकों को सही ढंग से पार्स करने के लिए SYCL GPU कोड में एक सुधार शामिल है।

github llama.cpp · 2 दिन पहले

llama.cpp b10305 ने DSv4 OPs के लिए SYCL समर्थन जोड़ा है

llama.cpp परियोजना ने बिल्ड b10305 जारी किया है, जिसने SYCL बैकएंड में विशिष्ट DSv4 संचालनों के लिए समर्थन पेश किया है। इस अपडेट में LIGHTNING_INDEXER, DSV4_HC_COMB, DSV4_HC_POST और DSV4_HC_PRE ऑपरेटरों का कार्यान्वयन शामिल है।

github llama.cpp · 2 दिन पहले · 1 बार देखा गया

llama.cpp b10306 में SYCL GLU फ्लैट पथ जोड़ा गया और कर्नेल संघीकृत किए गए

llama.cpp b10306 रिलीज ने SYCL बैकएंड के लिए प्रदर्शन अनुकूलन पेश किए, विशेष रूप से गेटेड लीनियर यूनिट (GLU) ऑपरेशन को टारगेट करते हुए। अपडेट में फ्यूज़्ड GLU ऑप्स के लिए एक सतत तेज़ पथ जोड़ा गया है और पहले अलग-अलग कर्नेल को एक सामान्य लॉन्चर साझा करने के लिए संघीकृत किया गया है।

github llama.cpp · 2 दिन पहले

llama.cpp b10298 ने mtmd मॉड्यूल के लिए चंक सेव/लोड फ़ंक्शन जोड़ा है

llama.cpp प्रोजेक्ट ने b10298 बिल्ड जारी किया है, जिसने mtmd मॉड्यूल के लिए एक नया चंक सेव और लोड फ़ंक्शन पेश किया है। इस अपडेट में कोड की सफाई और अतिरिक्त परीक्षण भी शामिल हैं।

github llama.cpp · 3 दिन पहले · 3 बार देखा गया

llama.cpp b10293 ने gfx1151 के लिए ROCm CI जोड़ा और RDNA3.5 इनफरेंस को ठीक किया

llama.cpp प्रोजेक्ट ने बिल्ड b10293 जारी किया, जिसमें gfx1151 आर्किटेक्चर के लिए AMD ROCm निरंतर एकीकरण शामिल है और RDNA3.5 GPU पर सटीकता की समस्याओं को हल किया गया है।

github llama.cpp · 3 दिन पहले · 1 बार देखा गया

llama.cpp b10291 वुल्कन सबमिशन बैचिंग को ठीक करता है और DeviceLost डीबग टूल्स जोड़ता है

llama.cpp प्रोजेक्ट ने संस्करण b10291 जारी किया है, जिसमें वुल्कन बैकएंड के लिए महत्वपूर्ण सुधारों के साथ-साथ मानक प्लेटफ़ॉर्म अपडेट भी शामिल हैं। प्राथमिक तकनीकी परिवर्तन सबमिशन बैचिंग आकार की समस्याओं को संबोधित करते हैं और ड्राइवर त्रुटियों के लिए नए निदान क्षमताएं पेश करते हैं।

github llama.cpp · 3 दिन पहले

ऑडियो ग्राफ निष्पादन ठीक करने के लिए llama.cpp b10290 में ggml_build_forward_order जोड़ा गया

llama.cpp प्रोजेक्ट ने ggml लाइब्रेरी में एक नई `ggml_build_forward_order` फ़ंक्शन पेश करते हुए बिल्ड b10290 जारी किया। यह बदलाव mtmd ऑडियो ग्राफ में एक बग को संबोधित करता है, जहां शुद्ध ऑर्डरिंग संकेत के रूप में `ggml_build_forward_expand` का उपयोग करने से अचयनित शाखाएं पुराने इनपुट के साथ निष्पादित हो रही थीं।

github llama.cpp · 3 दिन पहले · 2 बार देखा गया

llama.cpp b10289 ने file_glob_search को सुरक्षित किया और विंडोज पथ हैंडलिंग में सुधार किया

llama.cpp b10289 रिलीज ने सर्वर के file_glob_search डायरेक्टरी वॉक को मजबूत किया है ताकि विंडोज जंक्शन्स पर अनंत लूप से बचा जा सके और पढ़ने योग्य न होने वाली डायरेक्ट्रीज़ के लिए त्रुटि रिपोर्टिंग में सुधार किया गया है।

media Hugging Face Forums · 3 दिन पहले · 1 बार देखा गया

QuantCheck चेतावनी देता है कि अंतिम चेकपॉइंट को 4-बिट क्वांटीकरण के लिए सर्वोत्तम मानने से बचें

QuantCheck नामक एक नया टूल इस बात पर प्रकाश डालता है कि प्रीट्रेनिंग का अंतिम चेकपॉइंट 4-बिट क्वांटीकरण के लिए इष्टतम विकल्प नहीं हो सकता है, क्योंकि बेंचमार्क्स समान रह सकते हैं जबकि भंगुरता बढ़ जाती है। लेखक ने Pythia-160m पर इस पैटर्न को देखा, जहाँ अंतिम चेकपॉइंट ने गुणवत्ता में लगभग चार गुना अधिक नुकसान झेला, जबकि समान गुणवत्ता वाला एक पूर्व चेकपॉइंट था।