विषय · Local inference
github llama.cpp · 1 घंटे पहले · 1 बार देखा गया लाइव

llama.cpp b10763 डिफ़ॉल्ट रूप से preserve_reasoning सक्षम करता है

llama.cpp प्रोजेक्ट ने बिल्ड b10763 जारी किया, जो `preserve_reasoning` चैट टेम्पलेट कीवर्ड आर्गुमेंट के डिफ़ॉल्ट व्यवहार को बदलता है। सर्वर अब इस kwarg की प्रभावी स्थिति को लॉग करता है और चेतावनी देता है जब यह उन टेम्पलेट्स पर डिफ़ॉल्ट रूप से सक्षम होता है जो इसे समर्थित करते हैं।

github llama.cpp · 8 घंटे पहले · 1 बार देखा गया

llama.cpp b10760 Qwen3-tts-0.6b इनफरेंस स्थिरता को ठीक करता है

llama.cpp प्रोजेक्ट ने बिल्ड b10760 जारी किया, जिसमें संख्यात्मक अस्थिरता को रोकने के लिए Qwen3-tts-0.6B मॉडल के लिए विशिष्ट ठीक शामिल हैं।

media MarkTechPost · 9 घंटे पहले

Perplexity ने Mac पर डिवाइस-साइड PII गेटिंग के साथ हाइब्रिड कंप्यूट लॉन्च किया

Perplexity ने Mac के लिए एक हाइब्रिड कंप्यूट फीचर जारी किया है जो एजेंटिक टास्क को क्लाउड फ्रंटियर मॉडल और लोकल मॉडल के बीच विभाजित करता है, संवेदनशील डेटा को हैंडल करने के लिए एक डिवाइस-साइड प्राइवेसी गेट का उपयोग करते हुए। इससे उपयोगकर्ता शक्तिशाली क्लाउड रीजनिंग का लाभ उठा सकते हैं जबकि डील दस्तावेज़ों या क्लाइंट रिकॉर्ड्स जैसे निजी फ़ाइलें पूरी तरह से उनके हार्डवेयर पर सुरक्षित रहती हैं।

github llama.cpp · 23 घंटे पहले · 1 बार देखा गया

llama.cpp b10751 में CUDA के लिए MoE वजनित विशेषज्ञ न्यूनीकरण को फ्यूज किया गया

llama.cpp परियोजना ने बिल्ड b10751 जारी किया, जिसने CUDA पर MoE (Mixture of Experts) वजनित विशेषज्ञ न्यूनीकरण के लिए एक फ्यूस्ड_kernel_ पेश किया। यह अनुकूलन मध्यवर्ती ग्लोबल-मेमोरी ट्रैफ़िक को कम करने के लिए दो भौतिक kernels चलाते हुए पूर्व की बेसलाइन को एकल वजन-न्यूनीकरण kernel से बदल देता है।

github llama.cpp · 1 दिन पहले · 1 बार देखा गया

llama.cpp b10750 ने KV कैश n-ग्राम खोज को अनुकूलित किया, जिससे थ्रूपुट में 4.9% की वृद्धि हुई

llama.cpp प्रोजेक्ट ने बिल्ड b10750 जारी किया, जिसने क्रम स्थिति इंडेक्सिंग और n-ग्राम इतिहास खोजों को बेहतर बनाने के लिए कुंजी-मान सेल प्रबंधन को पुनर्गठित किया।

github llama.cpp · 1 दिन पहले · 1 बार देखा गया

llama.cpp b10742 ने A18 Pro के लिए fa-vec ट्यूनिंग्स जोड़ी हैं

llama.cpp परियोजना ने संस्करण b10742 जारी किया है, जिसमें एक नई सुविधा शामिल है जो MacBook Neo में पाए जाने वाले Apple A18 Pro चिप के लिए विशेष रूप से तेज़ वेक्टर (fa-vec) ट्यूनिंग्स जोड़ती है।

github llama.cpp · 1 दिन पहले · 1 बार देखा गया

llama.cpp b10739 ने M2 Max के लिए fa-vec ट्यूनिंग जोड़ी

llama.cpp प्रोजेक्ट ने संस्करण b10739 जारी किया है, जिसमें Apple के M2 Max हार्डवेयर के लिए एक विशिष्ट प्रदर्शन अनुकूलन शामिल है। इस अपडेट में M2 Max के 30 GPU कोर के लिए अनुकूलित फास्ट एटेंशन वेक्टर (fa-vec) ट्यूनिंग पेश की गई है।

lab Hugging Face Blog · 1 दिन पहले · 4 बार देखा गया

Hugging Face ने 207 WebGPU kernels और एक ब्राउज़र बेंचमार्किंग टूल जारी किया

Hugging Face ने @huggingface/kernels जारी किया है, जो Hugging Face Hub से अनुकूलित WebGPU kernels को लोड और चलाने के लिए एक लाइब्रेरी है, जिसके साथ 207 kernels का प्रारंभिक संग्रह भी शामिल है। इस रिलीज़ में Fleet भी पेश किया गया है, जो उपयोगकर्ताओं के डिवाइस से प्रदर्शन और सटीकता के सबूतों को समूह द्वारा इकट्ठा करके एक इन-ब्राउज़र GPU बेंचमार्किंग सूट है।

github llama.cpp · 1 दिन पहले · 2 बार देखा गया

llama.cpp b10734 ने M5+/A19+ पर Metal 4.0 tensor API सक्षम किया

llama.cpp प्रोजेक्ट ने संस्करण b10734 जारी किया, जिसमें M5+ या A19+ चिप्स वाले डिवाइसों के लिए Metal 4.0 tensor API को सक्षम करने के लिए एक अपडेट शामिल है।

media r/LocalLLaMA · 2 दिन पहले · 4 बार देखा गया

ExLlamaV3 ने MoE विशेषज्ञों के लिए CPU ऑफलोड और नए GLM-5.3-Flash, Qwen3.8-Flash मॉडल जोड़े हैं

Turboderp ने ExLlamaV3 में महत्वपूर्ण अपडेट जारी किए हैं, जिसमें Mixture of Experts (MoE) विशेषज्ञों के लिए CPU ऑफलोड क्षमताएं शामिल हैं। इस अपडेट में हाल ही में जारी GLM-5.3-Flash और Qwen3.8-Flash मॉडल के लिए समर्थन भी शामिल है।

github llama.cpp · 2 दिन पहले · 3 बार देखा गया

llama.cpp b10724 kv-cache स्थिति पुनर्स्थापना को अनुकूलित करता है ताकि कॉपी की संख्या 1.3M से घटकर 224 हो जाए

llama.cpp प्रोजेक्ट ने बिल्ड b10724 जारी किया, जो सतत रन के प्रति बैचिंग स्कैटर रीड्स द्वारा गैर-संतत KV कैश सेल को पुनर्स्थापित करने की प्रदर्शन में महत्वपूर्ण सुधार करता है।

github llama.cpp · 2 दिन पहले · 6 बार देखा गया

llama.cpp b10721 ने WebGPU क्रैश ठीक किया और विंडोज़ के लिए CUDA 13.4 समर्थन जोड़ा

llama.cpp प्रोजेक्ट ने बिल्ड b10721 जारी किया है, जिसमें WebGPU बैकएंड के लिए एक महत्वपूर्ण सुधार और विंडोज़ पर हार्डवेयर समर्थन का विस्तार शामिल है।

github llama.cpp · 2 दिन पहले · 9 बार देखा गया

llama.cpp b10718 ने MOE फ्यूजन को specdec और मल्टी-टोकन तक विस्तारित किया

llama.cpp प्रोजेक्ट ने संस्करण b10718 जारी किया, जिसमें इसके CUDA बैकएंड में एक महत्वपूर्ण अपडेट शामिल है। सबसे उल्लेखनीय बदलाव Mixture of Experts (MOE) फ्यूजन को स्पेकुलेटिव डिकोडिंग (specdec) का समर्थन करने के लिए विस्तारित करना है, जिसने पिछली सीमाओं को दूर किया जहाँ MOE glu फ्यूजन और topk-router फ्यूजन केवल एक समय में एक टोकन प्रसंस्करण तक सीमित थे।

github llama.cpp · 2 दिन पहले · 4 बार देखा गया

llama.cpp b10715 KV cache injection में DFlash encoder को fuse करता है

llama.cpp प्रोजेक्ट ने build b10715 जारी किया, जिसमें DFlash implementation के लिए एक महत्वपूर्ण optimization शामिल है। DFlash encoder अब decoding के दौरान KV cache injection प्रक्रिया में सीधे fuse हो गया है।

github llama.cpp · 2 दिन पहले · 4 बार देखा गया

llama.cpp b10714 ने Strix Halo के लिए Vulkan mat-vec पंक्तियों को ट्यून किया

llama.cpp प्रोजेक्ट ने बिल्ड b10714 जारी किया, जिसमें AMD Strix Halo हार्डवेयर को लक्षित करने वाले Vulkan बैकएंड के लिए विशिष्ट अनुकूलन शामिल हैं। अपडेट ने बैच्ड इनफरेंस के दौरान प्रदर्शन में सुधार के लिए मैट्रिक्स-वेक्टर गुणन पंक्ति गणनाओं को समायोजित किया।

github llama.cpp · 3 दिन पहले · 5 बार देखा गया

llama.cpp b10706 में SWIGLU_CLAMP और Vulkan शेडर समर्थन जोड़ा गया

llama.cpp परियोजना ने ggml बैकएंड में नई कार्यक्षमता पेश करते हुए बिल्ड b10706 जारी किया है। इस अपडेट में SWIGLU_CLAMP का जोड़ और एक नया Vulkan शेडर कार्यान्वयन शामिल है।

github llama.cpp · 3 दिन पहले · 12 बार देखा गया

llama.cpp b10707 तेज़ जनरेशन के लिए KV कैश सेल स्कैनिंग को अनुकूलित करता है

llama.cpp प्रोजेक्ट ने संस्करण b10707 जारी किया, जिसमें कुंजी-मान (KV) कैश हैंडलिंग के लिए एक प्रदर्शन अनुकूलन शामिल है। अपडेट `for_each_token_in` फ़ंक्शन को संशोधित करता है ताकि एक विशिष्ट सेल के भीतर सभी सीक्वेंस देखे जाने पर स्कैनिंग बंद हो जाए, न कि सभी संभावित अधिकतम सीक्वेंस पर पुनरावृत्ति की जाए।

github llama.cpp · 4 दिन पहले · 2 बार देखा गया

llama.cpp b10688 ने M2 के लिए fa-vec ट्यूनिंग्स जोड़ी हैं

llama.cpp प्रोजेक्ट ने बिल्ड b10688 जारी किया है, जिसमें M2 आर्किटेक्चर के लिए तेज़ वेक्टर (fa-vec) ट्यूनिंग्स जोड़ने वाला एक पुल रिक्वेस्ट शामिल है।

github llama.cpp · 4 दिन पहले · 8 बार देखा गया

llama.cpp ने Adreno GPUs पर xmem GEMM सक्षम किया और tiled f32 को bypass किया

llama.cpp प्रोजेक्ट ने दो पीढ़ियों के Adreno GPUs पर मैट्रिक्स गुणन प्रदर्शन में सुधार के लिए अपने OpenCL बैकएंड को अपडेट किया है। परिवर्तन मुख्य रूप से X2E पीढ़ी को लक्षित करते हैं, xmem F16xF32 GEMM पथ को डिफ़ॉल्ट रूप से सक्षम करके और A7X पीढ़ी के लिए हैंडलिंग को अनुकूलित करके।

github llama.cpp · 4 दिन पहले · 8 बार देखा गया

llama.cpp b10684 ने SYCL --fit के लिए VRAM अकाउंटिंग में सुधार किया

llama.cpp प्रोजेक्ट ने संस्करण b10684 जारी किया, जिसमें SYCL बैकएंड के लिए एक विशिष्ट फिक्स शामिल है ताकि `--fit` फ्लैग `--fit-target` को अधिक सटीकता से सम्मानित करे।