Inference efficiency
github llama.cpp · 1 घंटे पहले · 10 बार देखा गया लाइव

llama.cpp b11120 ने Vulkan के आंतरिक प्रतीकों को छिपाकर स्टेट विनाश की समस्या को ठीक किया

llama.cpp परियोजना ने संस्करण b11120 जारी किया, जिसने आंतरिक प्रतीकों को छिपाकर Vulkan बैकएंड में एक गंभीर बग को ठीक किया। यह बदलाव उन डुप्लिकेट-dlopen स्टेट विनाश समस्याओं को रोकता है जो तब होती थीं जब आंतरिक प्रतीक एक्सपोर्ट किए जाते थे।

arxiv arXiv cs.AI · 4 घंटे पहले · 9 बार देखा गया

क्लिफकंपैक्शन कोडिंग एजेंट के खर्चों को 50% कम करता है जबकि प्रदर्शन बनाए रखता है

शोधकर्ताओं ने क्लिफकंपैक्शन पेश किया, एक ऑटोकंपैक्शन तकनीक जो बाउंडेड कॉन्टेक्स्ट के तहत लॉन्ग-होराइजन कोडिंग एजेंट्स के लिए खर्चों को 50% तक कम करने के लिए डिज़ाइन की गई है। विधि टर्मिनल-बेंच पर प्रदर्शन बनाए रखती या सुधारती है और ट्रंकेशन के माध्यम से न कि पुनः वाक्य रचना के माध्यम से संपीड़ित जानकारी को विश्वसनीय रखकर कर्नेलबेंच पर शीर्ष-प्रदर्शन प्राप्त करती है।

arxiv arXiv cs.LG · 5 घंटे पहले · 9 बार देखा गया

क्लिफकंपैक्शन लंबे-अवधि कोडिंग एजेंट के खर्चों को 50% तक कम करता है, प्रदर्शन बनाए रखते हुए

शोधकर्ताओं ने क्लिफकंपैक्शन पेश किया, एक ऑटोकंपैक्शन तकनीक जो लाखों टोकन संभालने वाले एजेंट्स के लिए डिज़ाइन की गई है, जो सीमित संदर्भ में खर्चों को 50% तक कम करती है। विधि टर्मिनल-बेंच पर प्रदर्शन बनाए रखती या सुधारती है और पुनः वर्णन करने के बजाय जानकारी को सटीक रखकर कर्नेलबेंच पर शीर्ष स्तर का परिणाम प्राप्त करती है।

github llama.cpp · 6 घंटे पहले · 13 बार देखा गया

llama.cpp b11118 ने HVX FA मस्क हैंडलिंग के लिए डायरेक्ट-मैप्ड DMA कैश पेश किया

llama.cpp प्रोजेक्ट ने बिल्ड b11118 जारी किया है, जिसमें एक नया hex-dma फीचर शामिल है जो एक डायरेक्ट-मैप्ड DMA कैश पेश करता है जो Hexagon Vector eXtended (HVX) FA मस्क हैंडलिंग के लिए अधिक उपयुक्त है।

lab OpenAI News · 11 घंटे पहले · 16 बार देखा गया

GPT-6 Astra का उपयोग करके शोध के समय और लागत को आधा करें

पैरलल ने अपनी AI एजेंट इंफ्रास्ट्रक्चर में OpenAI के GPT-6 Astra को एकीकृत किया है, जिससे पिछली मॉडलों की तुलना में शोध के समय और कोड लागत दोनों में 50% की कमी आई है। कंपनी का कहना है कि नई मॉडल एजेंटों को उच्च गुणवत्ता वाले आउटपुट बनाए रखते हुए जटिल ज्ञान कार्य को काफी तेजी से पूरा करने की अनुमति देती है।

github llama.cpp · 14 घंटे पहले · 11 बार देखा गया

llama.cpp b11111 ने Intel Xe के लिए flash attention ऑप्टिमाइजेशन kernels जोड़े हैं

llama.cpp प्रोजेक्ट ने बिल्ड b11111 जारी किया, जिसमें Xe-LPG Plus, Xe2, और Xe3 आर्किटेक्चर पर split k पथों के लिए Vulkan-आधारित flash attention ऑप्टिमाइजेशन kernels शामिल हैं।

github llama.cpp · 17 घंटे पहले · 9 बार देखा गया

llama.cpp ने HunyuanOCR के लिए DFlash समर्थन जोड़ा और ड्राफ्ट रूपांतरण में सुधार किया

llama.cpp परियोजना ने लक्ष्य ग्राफ़ में परत इनपुट टेंसर को उजागर करके, HunyuanOCR मॉडल के साथ DFlash स्पेकुलेटिव डिकोडिंग का समर्थन जोड़ा है। इस बदलाव से ड्राफ्ट मॉडल अवशेष स्ट्रीम को पढ़ सकता है, जिससे छवि अनुरोध लगभग 0.5 की ड्राफ्ट स्वीकृति दर के साथ और गैर-स्पेकुलेटिव रन के सापेक्ष बाइट-समान OCR आउटपुट के साथ सफलतापूर्वक चल सकते हैं।

github llama.cpp · 17 घंटे पहले · 13 बार देखा गया

llama.cpp b11104 ने llama-server को कई पते बांधने का समर्थन जोड़ा है

llama.cpp प्रोजेक्ट ने संस्करण b11104 जारी किया, जिसमें एक नई सुविधा शामिल है जो llama-server घटक को एक साथ कई नेटवर्क पतों से बांधने की अनुमति देती है।

github llama.cpp · 20 घंटे पहले · 11 बार देखा गया

llama.cpp b11101 रिलीज llama के लिए बार-बार find_package कॉल की अनुमति देती है

llama.cpp प्रोजेक्ट ने संस्करण b11101 जारी किया है, जिसमें एक बिल्ड सिस्टम फिक्स शामिल है जो llama लाइब्रेरी के लिए बार-बार find_package कॉल की अनुमति देता है।

lab Hugging Face Blog · 21 घंटे पहले · 10 बार देखा गया

स्थानीय निष्पादन के लिए ggml kernels के माध्यम से Transformers में GGUF समर्थन जोड़ा गया

Hugging Face की Transformers लाइब्रेरी अब GGUF क्वांटाइज्ड मॉडल लोड करने का समर्थन करती है, जिसमें llama.cpp के निकट प्रदर्शन लाने के लिए underlying ggml kernels का उपयोग किया गया है। इस एकीकरण से डेवलपर्स को समर्थित हार्डवेयर पर मानक PyTorch-आधारित API के भीतर ही क्वांटाइज्ड चेकपॉइंट्स चلانے की सुविधा मिलती है।

github llama.cpp · 1 दिन पहले · 11 बार देखा गया

llama.cpp b11100 ने Muse Glimmer टूल-कॉल पार्सर त्रुटि को ठीक किया

llama.cpp प्रोजेक्ट ने बिल्ड b11100 जारी किया, जो Muse Glimmer मॉडल के साथ एक विशिष्ट पार्सिंग समस्या को संबोधित करता है। प्राथमिक परिवर्तन इस मॉडल के लिए टूल-कॉल निष्पादन के दौरान सामने आए पहले पार्सर त्रुटि को ठीक करने से संबंधित है।

media Hugging Face Forums · 1 दिन पहले · 7 बार देखा गया

OLMo-core में Muon और Dion3 ऑप्टिमाइज़र समस्याओं को डीबग करते हुए Jen Wei

Jen Wei ने आने वाले PyTorch Conference भाषण के लिए OLMo-core के भीतर AdamW, Muon, और नवीनतम Dion3 कार्यान्वयन का परीक्षण करते समय लर्निंग रेट डेथ स्पाइरल का सामना किया।

media Hugging Face Forums · 1 दिन पहले · 11 बार देखा गया

स्थानीय ग्रीक उपयोग के लिए Llama-Krikri-8B-Instruct को अक्षम करने की कार्यप्रणाली की खोज

एक उपयोगकर्ता ilsp/Llama-Krikri-8B-Instruct चेकपॉइंट का उपयोग करके स्थानीय तैनाती के लिए एक अनियंत्रित, ग्रीक-स्थानीय बड़े भाषा मॉडल बनाने की योजना बना रहा है। प्रस्तावित योजना में Heretic (heretic-llm) के साथ मॉडल को अक्षम करना, इसे GGUF Q4_K_M फ़ॉर्मेट में परिवर्तित करना, और Vulkan के माध्यम से AMD Ryzen AI MAX+ 395 प्रोसेसर से लैस GMKtec EVO-X3 पर निष्पादन शामिल है।

media Together AI Blog · 1 दिन पहले · 11 बार देखा गया

Together AI ने Canary रोलआउट्स पेश किए हैं ताकि बिना डाउनटाइम के उत्पादन में मॉडल अपग्रेड किए जा सकें

Together AI ने Canary रोलआउट्स पेश किए हैं, जो एक फीचर है जो गेटेड चरणों में वर्तमान मॉडल से नए चेकपॉइंट पर लाइव ट्रैफिक को माइग्रेट करता है। यह सिस्टम हेल्थ चेक्स और या तो मेट्रिक गेट्स चलाने के द्वारा मॉडल स्विच करने के लिए सुरक्षा तंत्र को स्वचालित करता है, जिससे प्रदर्शन में गिरावट आने पर स्वचालित रूप से रोक और वापसी की जा सकती है।

arxiv arXiv cs.AI · 1 दिन पहले · 9 बार देखा गया

एजेंटरूटर स्तर-स्तरीय मॉडल रूटिंग के माध्यम से एजेंटिक वर्कफ़्लो लागत को 72% तक कम करता है

शोधकर्ताओं ने एजेंटरूटर का प्रस्ताव दिया, जो एक हल्का क्लासिफायर है जो प्रत्येक कार्य के लिए फ्रंटियर मॉडल का उपयोग करने के बजाय व्यक्तिगत ट्रैजेक्टरी चरणों को उचित मॉडल स्तरों पर रूट करके बहु-चरण एजेंटिक वर्कफ़्लो को अनुकूलित करता है। यह सिस्टम मौजूदा समाधानों की अक्षमता को दूर करता है जो एक ही एजेंट सत्र के भीतर बदलते उप-कार्य जटिलता को नजरअंदाज करते हैं।

github llama.cpp · 1 दिन पहले · 13 बार देखा गया

llama.cpp b11095 में HMX-अनुकूलित GATED_DELTA_NET जोड़ा गया है और DDR पढ़ने को कम किया गया है

llama.cpp b11095 रिलीज़ ने HMX के लिए अनुकूलित GATED_DELTA_NET (GDN) का नया कार्यान्वयन पेश किया है, साथ ही Hexagon और Flash Attention kernels के लिए विभिन्न अनुकूलन भी हैं।

arxiv arXiv cs.CL · 1 दिन पहले · 11 बार देखा गया

एजेंटरूटर स्तर-स्तरीय मॉडल रूटिंग के माध्यम से एजेंटिक वर्कफ़्लो लागत को 72% तक कम करता है

शोधकर्ताओं ने एजेंटरूटर प्रस्तावित किया, जो एक हल्का क्लासिफायर है जो बहु-चरण एजेंटिक वर्कफ़्लो को अनुकूलित करता है, व्यक्तिगत ट्रैजेक्टरी चरणों को उचित मॉडल टियर में रूट करके, न कि सभी कार्यों के लिए एकल फ्रंटियर मॉडल का उपयोग करके। यह सिस्टम उन एंटरप्राइज सिस्टम की अक्षमता को दूर करता है जो छोटे मॉडल समान रूप से संभाल सकते हैं, ऐसे सबटास्क्स पर अपनी इनफरेंस बजट के 60-80% को व्यर्थ करते हैं।

github llama.cpp · 1 दिन पहले · 14 बार देखा गया

llama.cpp b11090 ने sm_70 टाइल कंपाइलेशन त्रुटि को ठीक किया

llama.cpp प्रोजेक्ट ने संस्करण b11090 जारी किया, जिसमें sm_70 टाइल कंपाइलेशन त्रुटि के लिए एक सुधार शामिल है। अपडेट ने Volta आर्किटेक्चर के साथ असंगतता को हल करने के लिए 5-तर्क load_ldmatrix फ़ंक्शन के टाइल आकार को सामान्य बना दिया है।