स्रोत · llama.cpp
github llama.cpp · अभी अभी लाइव

llama.cpp b10435 ने jinja gather_string_parts में द्विघात लागत को ठीक किया

llama.cpp परियोजना ने संस्करण b10435 जारी किया है, जो Jinja टेम्पलेट इंजन के भीतर एक प्रदर्शन समस्या को संबोधित करता है। प्राथमिक परिवर्तन `gather_string_parts` फ़ंक्शन में द्विघात समय जटिलता बग को ठीक करता है।

github llama.cpp · 3 घंटे पहले

llama.cpp b10434 टेम्पलेट्स को reasoning_effort पास करता है

llama.cpp प्रोजेक्ट ने बिल्ड b10434 जारी किया, जिसने Jinja टेम्पलेट्स में `reasoning_effort` पैरामीटर पास करने का समर्थन जोड़ा। इस बदलाव से OpenAI Chat Completions के `reasoning_effort` मानों को संग्रहीत और जनरेशन के दौरान उपलब्ध कराया जाता है।

github llama.cpp · 5 घंटे पहले · 1 बार देखा गया

llama.cpp b10431 ने SSM मॉडल के लिए पुनरावर्ती स्थिति रोलबैक जोड़ा है

llama.cpp परियोजना ने संस्करण b10431 जारी किया, जिसने ggml_ssm_scan संचालन में पुनरावर्ती स्थिति (RS) रोलबैक के लिए समर्थन पेश किया। इस बदलाव से CPU और CUDA बैकएंड पर Nemotron मॉडल के लिए RS रोलबैक सक्षम हो जाता है।

github llama.cpp · 9 घंटे पहले · 1 बार देखा गया

llama.cpp b10429 llama_decode() के दौरान /metrics और /slots तक पहुंचने की अनुमति देता है

llama.cpp प्रोजेक्ट ने संस्करण b10429 जारी किया, जो सर्वर को संशोधित करता है ताकि llama_decode() चल रहे होने पर /metrics और /slots एंडपॉइंट्स तक पहुंच की अनुमति मिल सके।

github llama.cpp · 10 घंटे पहले · 1 बार देखा गया

llama.cpp b10430 आभासी igpu उपकरणों की अनुमति देता है

llama.cpp परियोजना ने संस्करण b10430 जारी किया है, जो आभासी एकीकृत GPU (igpu) उपकरणों के लिए समर्थन पेश करता है। इस अपडेट में कोडबेस के भीतर सुधारे गए कमेंट्स भी शामिल हैं।

github llama.cpp · 15 घंटे पहले · 1 बार देखा गया

llama.cpp b10427 SYCL FFN ऑप्स को फ्यूज़ करता है, थ्रूपुट में 12.4% तक वृद्धि

llama.cpp प्रोजेक्ट ने संस्करण b10427 जारी किया, जिसमें SYCL के माध्यम से Intel Arc GPUs के लिए एक प्रदर्शन अनुकूलन शामिल है। अपडेट q4_K घन फीड-फॉरवर्ड नेटवर्क (FFN) परत के भीतर gate, up और GLU ऑप्स के विलय को लागू करता है।

github llama.cpp · 16 घंटे पहले · 2 बार देखा गया

llama.cpp b10425 गेटेड-डेल्टा-नेट स्टेट राइटबैक को फ्यूज़ करता है, +1.2% स्पीडअप

llama.cpp प्रोजेक्ट ने संस्करण b10425 जारी किया है, जिसमें गेटेड-डेल्टा-नेट स्टेट राइटबैक कॉपी को फ्यूज़ करने के लिए SYCL अनुकूलन का पोर्ट शामिल है।

github llama.cpp · 1 दिन पहले

llama.cpp b10418 ने SYCL के लिए होस्ट पिंडेड मेमोरी समर्थन जोड़ा है

llama.cpp परियोजना ने संस्करण b10418 जारी किया, जिसमें SYCL में होस्ट-से-डिवाइस मेमोरी एक्सेस को बेहतर बनाने के लिए होस्ट पिंडेड मेमोरी का समर्थन शामिल है। यह अपडेट बैकएंड कार्यान्वयन के भीतर थ्रेड-सुरक्षा समस्याओं को दूर करता है।

github llama.cpp · 1 दिन पहले

llama.cpp के OpenVINO बैकएंड में Qwen3.5 समर्थन और मेमोरी अनुकूलन शामिल

llama.cpp परियोजना ने अपने OpenVINO बैकएंड में महत्वपूर्ण अपडेट मर्ज किए हैं, जिनमें मुख्य रूप से Qwen3.5 मॉडल परिवार के लिए समर्थन सक्षम किया गया है और कई मेमोरी अनुकूलन तकनीकों को पेश किया गया है।

github llama.cpp · 1 दिन पहले

llama.cpp b10416 ने llama.app पर पुराने UI कैश को ठीक किया

llama.cpp प्रोजेक्ट ने बिल्ड b10416 जारी की, जिसने llama.app वेबसाइट पर एक कैशिंग समस्या को संबोधित किया जहाँ index.html फ़ाइल अपरिवर्तनीय हेडर्स के कारण पुराने बिल्ड्स से पिन्ड थी।

github llama.cpp · 1 दिन पहले · 1 बार देखा गया

llama.cpp b10413 में GGUF मेटाडेटा से ड्राफ्ट स्पेक टाइप का ऑटो-डिटेक्शन जोड़ा गया

llama.cpp प्रोजेक्ट ने संस्करण b10413 जारी किया, जिसमें ड्राफ्ट GGUF मॉडल मेटाडेटा से सीधे स्पेकुलेटिव डिकोडिंग स्पेसिफिकेशन टाइप का स्वचालित डिटेक्शन पेश किया गया है।

github llama.cpp · 1 दिन पहले · 1 बार देखा गया

llama.cpp b10414 में TQ2_0 समर्थन और mul_mv kernel का अनुकूलन शामिल है

llama.cpp परियोजना ने build b10414 जारी किया, जिसमें Metal बैकएंड के लिए GGML_TYPE_TQ2_0 टर्नरी क्वांटाइज़ेशन प्रकार का समर्थन पेश किया गया है। इस अपडेट में सतत टेन्सर (cont) mul_mv kernel के लिए अनुकूलन भी शामिल हैं।

github llama.cpp · 1 दिन पहले · 1 बार देखा गया

llama.cpp b10412 ने dflash और dspark के लिए बैकएंड सैंपलिंग सक्षम की है

llama.cpp परियोजना ने संस्करण b10412 जारी किया है, जो dflash और dspark दोनों बैकएंड्स के लिए बैकएंड सैंपलिंग समर्थन पेश करता है। यह अपडेट बैकएंड सैंपलिंग तर्क के भीतर 0 से अधिक p_min मानों को भी सक्षम बनाता है और संबंधित सुरक्षा उपाय जोड़ता है।

github llama.cpp · 1 दिन पहले · 1 बार देखा गया

llama.cpp b10410 ने gemm non-oneDNN पथ में अलग fp32 प्रकार प्रमोशन को हटा दिया

llama.cpp परियोजना ने संस्करण b10410 जारी किया है, जिसमें SYCL बैकएंड के लिए कोड परिवर्तन शामिल है। इस अपडेट ने GEMM non-oneDNN पथ में अलग fp32 प्रकार प्रमोशन को हटा दिया और इसके बजाय स्वचालित fp16 प्रमोशन का उपयोग किया है।

github llama.cpp · 1 दिन पहले · 7 बार देखा गया

llama.cpp b10408 में Q3_K ESIMD kernel जोड़ा गया और नियंत्रण रनटाइम पर स्थानांतरित किया गया

llama.cpp प्रोजेक्ट ने संस्करण b10408 जारी किया, जिसमें Intel GPUs के लिए DMMV Q3_K ESIMD kernel पेश किया गया है। इस रिलीज़ में नए Q4_K और Q6_K ESIMD kernels भी शामिल हैं और कोडबेस को पुनर्लेखित किया गया है ताकि ESIMD का नियंत्रण कंपाइल टाइम के बजाय रनटाइम पर किया जा सके।

github llama.cpp · 3 दिन पहले · 9 बार देखा गया

llama.cpp b10369 में pocket-tts समर्थन जोड़ा गया है, CUDA जनरेशन 80% तेज

llama.cpp प्रोजेक्ट ने बिल्ड b10369 जारी किया, जिसमें pocket-tts टेक्स्ट-टू-स्पीच मॉडल के लिए समर्थन शामिल है। इस अपडेट में प्रदर्शन को अनुकूलित करने के लिए GEMM और col2im का उपयोग करके ट्रांसपोज्ड कन्वोल्यूशन्स की एक नई कार्यान्वयन शामिल है।

github llama.cpp · 3 दिन पहले · 9 बार देखा गया

llama.cpp b10361 ने EXAONE 4.5 के लिए SWA को ठीक किया और मेटाडेटा पथ में TENSOR_SKIP को छोड़ा

llama.cpp b10361 रिलीज़ ने एक गंभीर बग को संबोधित किया जहाँ लोडिंग के दौरान गलत पैरामीटर ऑर्डरिंग के कारण LGAI-EXAONE 4.5 मॉडल के लिए स्लाइविंग विंडो एटेंशन (SWA) सक्षम नहीं था।

github llama.cpp · 4 दिन पहले · 4 बार देखा गया

llama.cpp b10356 ने ROCm को 7.14 पर अपडेट किया और विंडोज़ CUDA 13 समर्थन जोड़ा

llama.cpp प्रोजेक्ट ने संस्करण b10356 जारी किया है, जो मुख्य रूप से बिल्ड इंफ्रास्ट्रक्चर को लक्षित करता है, ROCm बैकएंड को संस्करण 7.2.1 से 7.14 में बदलकर। यह अपडेट ROCm 7.14 के उत्पादन रिलीज़ होने के साथ संगत है, जो TheRock बिल्ड सिस्टम का उपयोग करने वाला पहला रिलीज़ है और Linux और विंडोज़ दोनों के लिए मल्टी-आर्च व्हील्स का उपयोग करने के लिए CI जॉब्स को माइग्रेट करने से जुड़ा है।

github llama.cpp · 4 दिन पहले · 4 बार देखा गया

llama.cpp b10355 में टोकन अनुमान के साथ बहु-आउटपुट बैकएंड सैंपलिंग जोड़ी गई है

llama.cpp प्रोजेक्ट ने संस्करण b10355 जारी किया, जिसमें बहु-आउटपुट बैकएंड सैंपलिंग के लिए समर्थन पेश किया गया है। इस अपडेट से टोकन अनुमान के साथ बैकएंड सैंपलिंग को सक्षम किया जाता है और एक अनुक्रम के लिए अधिकतम आउटपुट की घोषणा करने के लिए एक संख्यात्मक संदर्भ पैरामीटर जोड़ा गया है।

github llama.cpp · 4 दिन पहले · 9 बार देखा गया

llama.cpp b10353 ने CUDA और Metal ROLL kernels में मौन गलत परिणामों को ठीक किया

llama.cpp परियोजना ने b10353 बिल्ड जारी किया, जो CUDA और Metal backends में ggml_roll ऑपरेशन में एक महत्वपूर्ण बग को संबोधित करता है। पहले, permuted (non-contiguous) source tensors ने मौन रूप से गलत परिणाम उत्पन्न किए क्योंकि इन backends ने stride जानकारी को नजरअंदाज कर दिया।