स्रोत · llama.cpp
github llama.cpp · 7 घंटे पहले · 2 बार देखा गया

llama.cpp b11284 में quantized weight views पर OpenVINO GET_ROWS की समस्या का समाधान

llama.cpp प्रोजेक्ट ने build b11284 जारी किया है, जिसमें quantized weight views पर GETROWS ऑपरेशन को सही ढंग से हैंडल करने के लिए OpenVINO backend में एक सुधार शामिल है।

github llama.cpp · 8 घंटे पहले · 1 बार देखा गया

llama.cpp b11280 रिलीज में पिंडेड होस्ट बफर्स के साथ टेंसर ऑलरिड्यूक सिंक कम होता है

llama.cpp प्रोजेक्ट ने संस्करण b11280 जारी किया है, जिसमें पिंडेड होस्ट बफर्स का उपयोग करके टेंसर ऑलरिड्यूक सिंक को कम करने के लिए एक बदलाव शामिल है।

github llama.cpp · 9 घंटे पहले · 1 बार देखा गया

llama.cpp b11282 ने MUSA डिवाइस पास के लिए CUDA_ARCH परिभाषित किया

llama.cpp प्रोजेक्ट ने बिल्ड b11282 जारी किया, जिसमें MUSA डिवाइस पास के लिए `CUDA_ARCH` मैक्रो को परिभाषित करने का फिक्स शामिल है। पहले, MUSA वेंडर हेडर ने इस वेरिएबल को परिभाषित नहीं किया था, जिससे साझा ggml-cuda स्रोतों में आर्किटेक्चर टेस्ट शून्य पर मूल्यांकन हो गए और खाली कर्नेल बॉडी का कारण बना।

github llama.cpp · 10 घंटे पहले · 2 बार देखा गया

llama.cpp ने k-pool और MTP फिक्स के साथ GLM-5.3-Flash समर्थन जोड़ा

llama.cpp प्रोजेक्ट ने GLM-5.3-Flash (GLM5-Next) मॉडल आर्किटेक्चर के लिए प्रारंभिक समर्थन जोड़ा है, जिसमें हाइब्रिड-इंडेक्स मेमोरी में माइग्रेशन और शुरुआती मल्टी-टोकन प्रेडिक्शन (MTP) क्षमताएं शामिल हैं।

github llama.cpp · 11 घंटे पहले · 2 बार देखा गया

llama.cpp b11273 में ModernBERT रीरैंकरर्स के लिए classifier_pooling समर्थन जोड़ा गया

llama.cpp परियोजना ने बिल्ड b11273 जारी किया, जिसने रीरैंकिंग मॉडल्स में `classifier_pooling` विधि के लिए समर्थन पेश किया, विशेष रूप से ModernBERT आर्किटेक्चर्स को लक्षित करते हुए।

github llama.cpp · 12 घंटे पहले · 2 बार देखा गया

llama.cpp b11272 हेक्सगॉन कॉन्कैट ऑपरेशन को अनुकूलित करता है

llama.cpp प्रोजेक्ट ने b11272 बिल्ड जारी किया, जिसमें हेक्सगॉन बैकएंड के लिए अनुकूलन शामिल हैं। प्राथमिक बदलाव क्वालकॉम स्नैपड्रैगन हार्डवेयर पर प्रदर्शन में सुधार के लिए कॉन्कैनेशन ऑपरेशन को अनुकूलित करने पर केंद्रित है।

github llama.cpp · 19 घंटे पहले · 2 बार देखा गया

llama.cpp b11266 में Intel के लिए Vulkan पर F32 A मैट्रिक्स एक बार में 2 लोड होते हैं

llama.cpp प्रोजेक्ट ने बिल्ड b11266 जारी किया, जिसमें एक Vulkan अनुकूलन शामिल है जो F32 A मैट्रिक्स को 2-अलाइन होने पर एक बार में दो तत्व लोड करता है। यह बदलाव Intel हार्डवेयर पर प्रदर्शन समस्याओं को दूर करता है जहाँ फ्लोट्स को एक-एक करके लोड करना अक्षम है, और यह मूल पैच में `a_offset` अलाइनमेंट के लिए अनुपलब्ध सत्यापन को भी ठीक करता है।

github llama.cpp · 21 घंटे पहले · 1 बार देखा गया

llama.cpp b11265 में Vulkan MOE matmul टाइल चयन की मरम्मत

llama.cpp b11265 रिलीज़ में Vulkan बैकएंड द्वारा Mixture of Experts (MoE) मॉडल्स के हैंडलिंग के लिए एक सुधार शामिल है। अपडेट `mat_mul_id` द्वारा मैट्रिक्स गुणा टाइल्स को कैसे चुना जाता है, इसे ठीक करता है, जिससे डिस्पैच के दौरान वर्कर्स के निष्क्रिय रहने की प्रदर्शन समस्या का समाधान होता है।

github llama.cpp · 1 दिन पहले · 7 बार देखा गया

llama.cpp b11260 ने FP32 GELU_ERF और GEGLU_ERF के लिए समर्थन जोड़ा

llama.cpp परियोजना ने Hexagon बैकएंड में FP32 GELU_ERF और GEGLU_ERF सक्रियण फ़ंक्शंस के लिए समर्थन पेश करते हुए संस्करण b11260 जारी किया है। इस अपडेट में संबंधित कर्नेल के भीतर रजिस्टर प्रेशर कम करने के लिए अनुकूलन भी शामिल हैं।

github llama.cpp · 1 दिन पहले · 1 बार देखा गया

llama.cpp b11258 जब UI सर्व नहीं किया जाता है तो बिल्ट-इन UI service worker हटा देता है

llama.cpp प्रोजेक्ट ने b11258 बिल्ड जारी की, जिसमें बिल्ट-इन वेब इंटरफ़ेस के service worker व्यवहार के लिए एक ठीक शामिल है। पहले, `--path` या `--no-ui` जैसे फ्लैग का उपयोग करने से ब्राउज़र UI के कैश किए गए संस्करणों को बनाए रखते थे क्योंकि सर्वर `/sw.js` के लिए 404 लौटाता था, जो service worker हटाने को ट्रिगर नहीं करता।

github llama.cpp · 1 दिन पहले · 7 बार देखा गया

llama.cpp b11254 पाइपलाइन समानांतरता के लिए ग्राफ इनपुट संग्रह में सुधार

llama.cpp प्रोजेक्ट ने बिल्ड b11254 जारी किया है, जिसमें कंप्यूटेशन ग्राफ में इनपुट टेंसरों को कैसे एकत्र किया जाता है, इसके लिए एक सुधार शामिल है। पहले, `graph_inputs` ग्राफ विभाजन के दौरान भरा जाता था, जिससे पाइपलाइन समानांतरता में समस्याएं उत्पन्न होती थीं जहाँ अलग-अलग इनपुट्स का उपयोग करने वाले बैचों के बीच स्विच करने से बेमेल बैकएंड आईडी तुलना और शेड्यूलर को पुनः आरक्षण पर मजबूर करना होता था।

github llama.cpp · 2 दिन पहले · 3 बार देखा गया

llama.cpp b11240 में /v1/embeddings के लिए टाइप्ड मल्टीमोडल इनपुट सपोर्ट जोड़ा गया

llama.cpp सर्वर अब /v1/embeddings एंडपॉइंट के लिए टाइप्ड कंटेंट (विजन, ऑडियो, वीडियो) इनपुट का समर्थन करता है। यह अपडेट ओपेनएआई-स्टाइल से बंद किए गए कंटेंट ऐरे को स्वीकार करके मल्टीमोडल एम्बेडिंग अनुरोधों को सक्षम बनाता है, जिससे टेक्स्ट और image_url हिस्सों को एक साथ प्रोसेस किया जा सकता है।

github llama.cpp · 2 दिन पहले · 4 बार देखा गया

llama.cpp b11238 में ggml_pad_ext जोड़ा गया है बाएं पैडिंग के लिए और DFlash2 टैप्स को छोड़ दिया गया है

llama.cpp प्रोजेक्ट ने बिल्ड b11238 जारी किया, जिसमें नई `ggml_pad_ext` फ़ंक्शन के माध्यम से एक समान बाएं पैडिंग कार्यान्वयन पेश किया गया है। यह बदलाव Parakeet, LFM2-Audio, Granite Speech और Gemma 4 जैसे ऑडियो एन्कोडर्स द्वारा उपयोग किए गए पिछले तरीकों को संघित करता है, जिससे Gemma 4 के लिए बिट-समान एम्बेडिंग सुनिश्चित होती है और बैकएंड समर्थन सरल होता है।

github llama.cpp · 2 दिन पहले · 5 बार देखा गया

llama.cpp b11232 x86 पर टाइल्ड फ्लैश एटेंशन सक्षम करता है

llama.cpp प्रोजेक्ट ने बिल्ड b11232 जारी किया, जिसमें ggml-cpu बैकएंड के लिए अपडेट शामिल हैं। रिलीज का ध्यान x86 आर्किटेक्चर पर नॉन-वैक्टर-मल्टिपल हेड डायमेंशन के लिए टाइल्ड फ्लैश एटेंशन सक्षम करने पर केंद्रित है।

github llama.cpp · 2 दिन पहले · 3 बार देखा गया

llama.cpp b11228 ने Metal GGML_OP_PAD में बाएं और वृत्ताकार पैडिंग समर्थन जोड़ा

llama.cpp b11228 रिलीज ने Metal बैकएंड की GGML_OP_PAD ऑपरेशन में बाएं और वृत्ताकार पैडिंग के लिए समर्थन पेश किया, जिसे CPU, CUDA और Vulkan कार्यान्वयनों के साथ संरेखित किया गया है। यह बदलाव क्रमबद्ध स्रोतों में दाईं ओर की पैडिंग समस्याओं को ठीक करता है और विभिन्न हार्डवेयर बैकएंड्स के बीच स्थिर व्यवहार सुनिश्चित करता है।

github llama.cpp · 2 दिन पहले · 4 बार देखा गया

llama.cpp b11227 तेज दृश्य निष्पादन के लिए causal_attn टॉगलिंग को अनुकूलित करता है

llama.cpp परियोजना ने बिल्ड b11227 जारी किया, जिसमें बहुआयामी प्रसंस्करण के दौरान `causal_attn` फ्लैग के हैंडलिंग के लिए विशेष रूप से लक्षित प्रदर्शन अनुकूलन शामिल हैं।

github llama.cpp · 3 दिन पहले · 3 बार देखा गया

llama.cpp b11224 ने strided KV cache views पर Vulkan mul_mat के गलत परिणाम ठीक किए

llama.cpp b11224 रिलीज में Vulkan बैकएंड में मैट्रिक्स गुणा ऑपरेशन जब KV caches जैसे बड़े, strided टेन्सर के स्लाइस पढ़ते हैं तो गलत कंप्यूटेशन परिणामों को संबोधित करता है।

github llama.cpp · 3 दिन पहले · 6 बार देखा गया

llama.cpp b11223 कारण-संबंधित LLM रीरैंकर के लिए RANK pooling batch splitting की अनुमति देता है

llama.cpp सर्वर अब Qwen3 और Qwen3-VL जैसे कारण-संबंधित LLM रीरैंकर के लिए RANK pooling batch splitting की अनुमति देता है, जिससे लंबे दस्तावेज़ों और बहुआयामी रीरैंकिंग को तोड़ने वाली पिछली सीमाओं को हल किया गया है।

github llama.cpp · 3 दिन पहले · 13 बार देखा गया

llama.cpp b11216 में 512 से अधिक ब्लॉक चौड़ाई के लिए SYCL FWHT kernels जोड़े गए

llama.cpp b11216 रिलीज़ ने SYCL बैकएंड में Fast Walsh-Hadamard Transform (FWHT) kernels पेश किए हैं जो 512 से बड़ी ब्लॉक चौड़ाई का समर्थन करते हैं। पहले, बड़ी चौड़ाई O(n^2) जटिलता के साथ एक घनत्वपूर्ण GEMM पर वापस आ जाती थी; यह बदलाव इन आकारों के लिए O(n log n) प्रदर्शन सक्षम बनाता है।

github llama.cpp · 3 दिन पहले · 14 बार देखा गया

llama.cpp b11214 बड़े बैच साइज़ के लिए CDNA पर fattn-mma kernel सक्षम करता है

llama.cpp प्रोजेक्ट ने संस्करण b11214 जारी किया है, जिसमें HIP backend के लिए एक महत्वपूर्ण अपडेट शामिल है। यह रिलीज dkq > 256 होने पर CDNA आर्किटेक्चर पर fattn-mma kernel सक्षम करती है, विशेष रूप से बड़े बैच साइज़ के लिए प्रदर्शन सुधारों को लक्षित करती है।