लैब · Hugging Face
github MCP (GitHub org) · 23 दिन पहले · 24 बार देखा गया

MCP Python SDK v1.30.0 HTTP रीडायरेक्ट को सीमित करता है, आइडल सत्र समाप्ति और जारीकर्ता सत्यापन जोड़ता है

मॉडल कॉन्टेक्स्ट प्रोटोकॉल (MCP) Python SDK ने 1.x लाइन के लिए एक मेंटनेंस अपडेट, संस्करण 1.30.0 जारी किया है, जो कड़ा सुरक्षा डिफ़ॉल्ट और नए कॉन्फ़िगरेशन विकल्प पेश करता है।

lab Hugging Face Blog · 4 घंटे पहले · 1 बार देखा गया

ओपन टीटीएस लीडरबोर्ड स्केलेबल मल्टीलिंगुअल टीटीएस इवैल्यूएशन को लांच करता है

टेक्स्ट-टू-स्पीच (TTS) इवैल्यूएशन में विखंडन और मानकीकरण की कमी को दूर करने के लिए ओपन टीटीएस लीडरबोर्ड जारी किया गया है, जो धीमे, एरीना-आधारित मानव प्राथमिकता स्कोर पर निर्भर रहने के बजाय ऑब्जेक्टिव मेट्रिक्स का उपयोग करता है। यह Qwen3 ASR और WavLM एम्बेडिंग्स का उपयोग करके इंटेलिजिबिलिटी, स्पीड और स्पीकर समानता के आधार पर मॉडल का मूल्यांकन करता है।

github llama.cpp · 10 घंटे पहले · 2 बार देखा गया

llama.cpp ने k-pool और MTP फिक्स के साथ GLM-5.3-Flash समर्थन जोड़ा

llama.cpp प्रोजेक्ट ने GLM-5.3-Flash (GLM5-Next) मॉडल आर्किटेक्चर के लिए प्रारंभिक समर्थन जोड़ा है, जिसमें हाइब्रिड-इंडेक्स मेमोरी में माइग्रेशन और शुरुआती मल्टी-टोकन प्रेडिक्शन (MTP) क्षमताएं शामिल हैं।

github llama.cpp · 19 घंटे पहले · 2 बार देखा गया

llama.cpp b11266 में Intel के लिए Vulkan पर F32 A मैट्रिक्स एक बार में 2 लोड होते हैं

llama.cpp प्रोजेक्ट ने बिल्ड b11266 जारी किया, जिसमें एक Vulkan अनुकूलन शामिल है जो F32 A मैट्रिक्स को 2-अलाइन होने पर एक बार में दो तत्व लोड करता है। यह बदलाव Intel हार्डवेयर पर प्रदर्शन समस्याओं को दूर करता है जहाँ फ्लोट्स को एक-एक करके लोड करना अक्षम है, और यह मूल पैच में `a_offset` अलाइनमेंट के लिए अनुपलब्ध सत्यापन को भी ठीक करता है।

github llama.cpp · 21 घंटे पहले · 1 बार देखा गया

llama.cpp b11265 में Vulkan MOE matmul टाइल चयन की मरम्मत

llama.cpp b11265 रिलीज़ में Vulkan बैकएंड द्वारा Mixture of Experts (MoE) मॉडल्स के हैंडलिंग के लिए एक सुधार शामिल है। अपडेट `mat_mul_id` द्वारा मैट्रिक्स गुणा टाइल्स को कैसे चुना जाता है, इसे ठीक करता है, जिससे डिस्पैच के दौरान वर्कर्स के निष्क्रिय रहने की प्रदर्शन समस्या का समाधान होता है।

media MarkTechPost · 1 दिन पहले Android World · 85.1% · 8 बार देखा गया

H कंपनी ने डेस्कटॉप, वेब और मोबाइल के लिए Holo4 ओपन-वेट कंप्यूटर-यूज़ मॉडल जारी किए

H कंपनी ने Holo4 जारी किया है, जो एक सामान्यीकृत कंप्यूटर-यूज़ विजन-लैंग्वेज मॉडल परिवार है जिसे डेस्कटॉप, वेब, Android और API वातावरण में क्लिक करने, टाइप करने, कोड लिखने और टूल्स को कॉल करने के लिए डिज़ाइन किया गया है। रिलीज में दो मॉडल आकार शामिल हैं: Holo4 27B (dense) और Holo4 35B-A3B (Mixture of Experts with 3B active parameters), दोनों 256K context window का समर्थन करते हैं।

media r/LocalLLaMA · 1 दिन पहले · 3 बार देखा गया

IQuestLab ने एजेंटिक कोडिंग के लिए 320B MoE मॉडल IQuest-Q1 जारी किया

IQuest ने एजेंटिक कोडिंग, तर्क और बहु-चरण उपकरण उपयोग के लिए डिज़ाइन किए गए Mixture-of-Experts (MoE) मॉडल IQuest-Q1 को जारी किया है। मॉडल में लगभग 320 अरब कुल पैरामीटर हैं, जिसमें प्रति टोकन अनुमानित 15 अरब पैरामीटर सक्रिय होते हैं। यह Hugging Face पर उपलब्ध है।

github llama.cpp · 2 दिन पहले · 4 बार देखा गया

llama.cpp b11238 में ggml_pad_ext जोड़ा गया है बाएं पैडिंग के लिए और DFlash2 टैप्स को छोड़ दिया गया है

llama.cpp प्रोजेक्ट ने बिल्ड b11238 जारी किया, जिसमें नई `ggml_pad_ext` फ़ंक्शन के माध्यम से एक समान बाएं पैडिंग कार्यान्वयन पेश किया गया है। यह बदलाव Parakeet, LFM2-Audio, Granite Speech और Gemma 4 जैसे ऑडियो एन्कोडर्स द्वारा उपयोग किए गए पिछले तरीकों को संघित करता है, जिससे Gemma 4 के लिए बिट-समान एम्बेडिंग सुनिश्चित होती है और बैकएंड समर्थन सरल होता है।

github llama.cpp · 2 दिन पहले · 5 बार देखा गया

llama.cpp b11232 x86 पर टाइल्ड फ्लैश एटेंशन सक्षम करता है

llama.cpp प्रोजेक्ट ने बिल्ड b11232 जारी किया, जिसमें ggml-cpu बैकएंड के लिए अपडेट शामिल हैं। रिलीज का ध्यान x86 आर्किटेक्चर पर नॉन-वैक्टर-मल्टिपल हेड डायमेंशन के लिए टाइल्ड फ्लैश एटेंशन सक्षम करने पर केंद्रित है।

github llama.cpp · 2 दिन पहले · 3 बार देखा गया

llama.cpp b11228 ने Metal GGML_OP_PAD में बाएं और वृत्ताकार पैडिंग समर्थन जोड़ा

llama.cpp b11228 रिलीज ने Metal बैकएंड की GGML_OP_PAD ऑपरेशन में बाएं और वृत्ताकार पैडिंग के लिए समर्थन पेश किया, जिसे CPU, CUDA और Vulkan कार्यान्वयनों के साथ संरेखित किया गया है। यह बदलाव क्रमबद्ध स्रोतों में दाईं ओर की पैडिंग समस्याओं को ठीक करता है और विभिन्न हार्डवेयर बैकएंड्स के बीच स्थिर व्यवहार सुनिश्चित करता है।

github llama.cpp · 3 दिन पहले · 3 बार देखा गया

llama.cpp b11224 ने strided KV cache views पर Vulkan mul_mat के गलत परिणाम ठीक किए

llama.cpp b11224 रिलीज में Vulkan बैकएंड में मैट्रिक्स गुणा ऑपरेशन जब KV caches जैसे बड़े, strided टेन्सर के स्लाइस पढ़ते हैं तो गलत कंप्यूटेशन परिणामों को संबोधित करता है।

media Hugging Face Forums · 3 दिन पहले · 9 बार देखा गया

क्लाउड ओपस 5 और टेत्सु ने अपने ही प्रोजेक्ट में छह खोखले CI चेक पाए

27 सितंबर को, क्लाउड ओपस 5 और 3B मॉडल टेत्सु ने अपने सार्वजनिक रिपॉजिटरी में छह अलग-अलग निरंतर एकीकरण (continuous integration) चेक की पहचान की जो हरे या पास दिखा रहे थे, भले ही वे उस चीज़ को सत्यापित करने में विफल रहे जिसका उन्हें मापना था। समस्याएं एक डिप्लॉयमेंट गेट से लेकर टाइमिंग बेंचमार्क तक फैली हुई थीं, जहां खोखले थ्रेशोल्ड के कारण नगण्य प्रदर्शन अंतर को स्वीकार किया गया।

github llama.cpp · 3 दिन पहले · 6 बार देखा गया

llama.cpp b11223 कारण-संबंधित LLM रीरैंकर के लिए RANK pooling batch splitting की अनुमति देता है

llama.cpp सर्वर अब Qwen3 और Qwen3-VL जैसे कारण-संबंधित LLM रीरैंकर के लिए RANK pooling batch splitting की अनुमति देता है, जिससे लंबे दस्तावेज़ों और बहुआयामी रीरैंकिंग को तोड़ने वाली पिछली सीमाओं को हल किया गया है।

github llama.cpp · 3 दिन पहले · 13 बार देखा गया

llama.cpp b11216 में 512 से अधिक ब्लॉक चौड़ाई के लिए SYCL FWHT kernels जोड़े गए

llama.cpp b11216 रिलीज़ ने SYCL बैकएंड में Fast Walsh-Hadamard Transform (FWHT) kernels पेश किए हैं जो 512 से बड़ी ब्लॉक चौड़ाई का समर्थन करते हैं। पहले, बड़ी चौड़ाई O(n^2) जटिलता के साथ एक घनत्वपूर्ण GEMM पर वापस आ जाती थी; यह बदलाव इन आकारों के लिए O(n log n) प्रदर्शन सक्षम बनाता है।

github llama.cpp · 3 दिन पहले · 14 बार देखा गया

llama.cpp b11214 बड़े बैच साइज़ के लिए CDNA पर fattn-mma kernel सक्षम करता है

llama.cpp प्रोजेक्ट ने संस्करण b11214 जारी किया है, जिसमें HIP backend के लिए एक महत्वपूर्ण अपडेट शामिल है। यह रिलीज dkq > 256 होने पर CDNA आर्किटेक्चर पर fattn-mma kernel सक्षम करती है, विशेष रूप से बड़े बैच साइज़ के लिए प्रदर्शन सुधारों को लक्षित करती है।

github llama.cpp · 4 दिन पहले · 10 बार देखा गया

llama.cpp b11207 ने Hexagon के लिए Q4_0 और Q8_0 GET_ROWS के लिए टाइल्ड समर्थन जोड़ा

llama.cpp परियोजना ने बिल्ड b11207 जारी किया, जिसमें Hexagon बैकएंड पर टाइल्ड Q4_0 और Q8_0 GET_ROWS ऑपरेशन के लिए समर्थन पेश किया गया है। इस अपडेट में मैक्रोज़, रजिस्टर स्पिल्स और DMA पाइपलाइन के लिए सुधार भी शामिल हैं, साथ ही कर्नेल चयन तर्क में सुधार और पुनः सक्षम वेक्टराइज़ेशन।

github llama.cpp · 4 दिन पहले · 16 बार देखा गया

llama.cpp b11195 में k-quants के लिए टाइल्ड mul_mat जोड़ा गया, जिससे 3-6x गति में वृद्धि

llama.cpp प्रोजेक्ट ने संस्करण b11195 जारी किया, जिसमें CPU बैकएंड के लिए k-quants का एक टाइल्ड मैट्रिक्स गुणा कार्यान्वयन शामिल है। इस बदलाव से क्वांटाइज्ड डेटा को 256x256 int8 टाइल्स में अनपैक किया जाता है और बड़े मैट्रिक्स संचालनों पर प्रदर्शन सुधारने के लिए माइक्रोकर्नेल का उपयोग करके परिणाम की गणना की जाती है।

github llama.cpp · 5 दिन पहले · 13 बार देखा गया

llama.cpp b11184 में 512 से अधिक ब्लॉक चौड़ाई के लिए Metal FWHT kernels जोड़े गए

llama.cpp प्रोजेक्ट ने बिल्ड b11184 जारी किया, जिसमें Metal बैकएंड के लिए नए Fast Walsh-Hadamard Transform (FWHT) kernels शामिल हैं जो 512 से अधिक ब्लॉक चौड़ाई का समर्थन करते हैं। पहले, Metal FWHT कार्यान्वयन 64 और 512 के बीच की चौड़ाई तक सीमित था।

github llama.cpp · 5 दिन पहले · 21 बार देखा गया

llama.cpp ने MTT S5000 ऑपरेटर विफलताओं को ठीक किया और CUB पथ सक्षम किए

llama.cpp प्रोजेक्ट ने MUSA (MTT S5000) ऑपरेटर विफलताओं और बिल्ड समस्याओं के लिए एक सुधार जारी किया है, जो विशेष रूप से PH1 आर्किटेक्चर को लक्षित करता है। यह अपडेट महत्वपूर्ण बग्स को हल करता है जिसने इस हार्डवेयर पर गलत परिणाम या टाइमआउट का कारण बना था।