विषय · Inference efficiency
lab Microsoft Research Blog · 7 दिन पहले · 28 बार देखा गया

माइक्रोसॉफ्ट रिसर्च दिखाता है कि भौतिक एआई इनफरेंस को ऑफलोड करने से रोबोट की प्रदर्शन और बैटरी जीवन में सुधार होता है

माइक्रोसॉफ्ट रिसर्च इस धारणा को चुनौती देता है कि भौतिक एआई इनफरेंस को केवल ऑनबोर्ड रोबोट GPUs पर चलाना आवश्यक है, यह प्रदर्शित करते हुए कि edge या क्लाउड इंफ्रास्ट्रक्चर पर ऑफलोडिंग मोबाइल मैनिपुलेशन वर्कलोड्स को महत्वपूर्ण रूप से बढ़ाता है। रोबोटिक्स वर्कलोड्स के उनके व्यवस्थित अध्ययन से पता चलता है कि ऑनबोर्ड कंप्यूट पर निर्भर रहने से प्रदर्शन, बैटरी जीवन और स्केलेबिलिटी सीमित हो जाती है।

lab OpenAI News · 8 दिन पहले · 24 बार देखा गया

GPT-6 Astra का उपयोग करके शोध के समय और लागत को आधा करें

पैरलल ने अपनी AI एजेंट इंफ्रास्ट्रक्चर में OpenAI के GPT-6 Astra को एकीकृत किया है, जिससे पिछली मॉडलों की तुलना में शोध के समय और कोड लागत दोनों में 50% की कमी आई है। कंपनी का कहना है कि नई मॉडल एजेंटों को उच्च गुणवत्ता वाले आउटपुट बनाए रखते हुए जटिल ज्ञान कार्य को काफी तेजी से पूरा करने की अनुमति देती है।

lab NVIDIA Research · 16 दिन पहले · 20 बार देखा गया

FastGen-PDD तेज़ वीडियो और छवि निर्माण के लिए समानांतर डिकोडिंग डिस्टिलेशन पेश करता है

शोधकर्ताओं ने पैरेलल डिकोडिंग डिस्टिलेशन (PDD) का परिचय दिया, जो एक सरलीकृत ट्रेजेक्ट्री-आधारित विधि है जो डिफ्यूजन और फ्लो मैचिंग मॉडल्स में इनफरेंस को तेज़ करने के लिए बनाई गई है। वर्तमान दृष्टिकोणों के विपरीत जो ऑप्टिमाइज़ करने में कठिन वैरिएशनल स्कोर डिस्टिलेशन और एडवर्शियल लॉसेस पर निर्भर करते हैं, PDD नेटवर्क मूल्यांकन के दौरान कई डीनोइजिंग चरणों की भविष्यवाणी करता है।

lab NVIDIA Research · 19 दिन पहले · 24 बार देखा गया

disk-oblivious ANN खोज के लिए Onyx ने लागत में 1.7-9.9x और लेटेंसी में 2.3-12.3x की कमी हासिल की

शोधकर्ताओं ने Onyx का प्रस्ताव रखा है, जो disk-oblivious अनुमानित निकटतम पड़ोसी (ANN) खोज के लिए एक लागत-कुशल दृष्टिकोण है जो state-of-the-art ORAM-ANN सिस्टम के डिज़ाइन को उलटकर बैंडविड्थ और एक्सेस गिनती के बीच संतुलन बनाता है।

lab NVIDIA Research · 19 दिन पहले · 28 बार देखा गया

GPU-त्वरित निजी जानकारी प्राप्ति के लिए NVIDIA ने GPIR जारी किया

NVIDIA के शोधकर्ताओं ने GPIR पेश किया है, एक ऐसा सिस्टम जो लैटिस-आधारित प्रोटोकॉल में अंतर्निहित उच्च सर्वर-साइड कंप्यूटेशन और मेमोरी ट्रैफिक को संबोधित करके GPU पर निजी जानकारी प्राप्ति (PIR) को त्वरित करता है। सिस्टम एक चरण-जागरूक हाइब्रिड एक्जीक्यूशन मॉडल का उपयोग करता है जो ऑन-चिप डेटा पुन: उपयोग को अधिकतम करने के लिए ऑपरेशन-स्तर और चरण-स्तरीय kernels के बीच गतिशील रूप से स्विच करता है।

lab NVIDIA Research · 19 दिन पहले · 26 बार देखा गया

PPML के लिए MPC और FHE की प्रदर्शन और लागत का वर्गीकरण NVIDIA द्वारा

एक नया अध्ययन गोपनीयता-संरक्षित मशीन लर्निंग इनफरेंस के लिए सुरक्षित बहु-पार्टी कंप्यूटेशन (MPC) और पूर्ण होमोमॉर्फिक एन्क्रिप्शन (FHE) का एक एकीकृत सिस्टम-स्तर वर्गीकरण प्रस्तुत करता है। कार्य दो MPC प्रकारों — अंकगणितीय/बाइनरी शेयरिंग रूपांतरण और फंक्शन सीक्रेट शेयरिंग — का FHE के साथ कई CNN और Transformer मॉडल पर मूल्यांकन करता है।

lab OpenAI News · 19 दिन पहले · 37 बार देखा गया

OpenAI ने Habitat स्टोरेज सेवा को प्रति सेकंड 70 मिलियन अनुरोधों तक स्केल किया

OpenAI ने अपने आंतरिक ऑनलाइन स्टोरेज प्लेटफ़ॉर्म, Habitat, को लगभग 40 भौगोलिक क्षेत्रों में एक अरब से अधिक साप्ताहिक ChatGPT उपयोगकर्ताओं के लिए प्रति सेकंड 70 मिलियन से अधिक अनुरोधों को संभालने के लिए स्केल किया है। सिस्टम अब 500 पेटाबाइट से अधिक डेटा प्रदान कर रहा है, जो एक साधारण Python क्लाइंट-साइड लाइब्रेरी से विकसित होकर एक जटिल वितरित सेवा बन गया है।

media AI News (smol.ai) · 18 दिन पहले · 51 बार देखा गया

DeepSeek ने V4.1-Flash लॉन्च किया, जो अत्यंत निष्पादन दक्षता पर केंद्रित एक ओपन-वेट मॉडल है

DeepSeek ने V4.1-Flash जारी किया है, जो अत्यंत निष्पादन दक्षता और कम लागत के लिए डिज़ाइन किया गया एक नया ओपन-वेट फ्लैगशिप मॉडल है। यह मॉडल सक्रिय कंप्यूटेशन और KV/cache लागत को काफी कम करने के लिए एक कारणिक एन्कोडर-डीकोडर आर्किटेक्चर का उपयोग करता है।

media Latent Space · 19 दिन पहले · 34 बार देखा गया

DeepSeek ने कुशल इनफरेंस के लिए 763B-P8B-D16B आर्किटेक्चर के साथ v4.1-Flash जारी किया

DeepSeek ने DeepSeek v4.1-Flash लॉन्च किया है, जो एक नया ओपन-वेट फ्लैगशिप मॉडल है जिसमें इनफरेंस दक्षता को अधिकतम करने और लागत कम करने के लिए डिज़ाइन की गई एक नई कारणवादी एन्कोडर-डीकोडर आर्किटेक्चर शामिल है।

media MarkTechPost · 20 दिन पहले · 55 बार देखा गया

DeepSeek ने 1M संदर्भ और FP4 KV कैश के साथ DeepSeek-V4.1-Flash जारी किया

DeepSeek AI ने DeepSeek-V4.1-Flash जारी किया है, जो एक बहुमोडल मिक्स्चर-ऑफ-एक्सपर्ट्स मॉडल है जिसमें 1-मिलियन-टोकन संदर्भ विंडो और FP4 KV कैश शामिल है जो प्रति टोकन 890 बाइट के वैश्विक कैश फुटप्रिंट को कम करता है। मॉडल एक कारणवादी एन्कोडर-डीकोडर आर्किटेक्चर और कॉम्प्रेस्ड स्पार्स एटेंशन 2 (CSA2) का उपयोग करता है जो प्रदर्शन बनाए रखते हुए मेमोरी की आवश्यकताओं को काफी कम करता है।

github vLLM · 22 दिन पहले · 29 बार देखा गया

vLLM v0.29.0 हाइब्रिड मॉडलों के लिए डिफ़ॉल्ट घन प्रीफ़िक्स कैश लागू करता है

vLLM परियोजना ने संस्करण 0.29.0 जारी किया, जिसमें घन प्रीफ़िक्स कैश से संबंधित एक मुख्य बग फिक्स शामिल है।

github vLLM · 23 दिन पहले · 18 बार देखा गया

v0.29.0rc5 ने Mamba के लिए prefix_cache_retention_interval को डिफ़ॉल्ट रूप से dense पर बदल दिया है

v0.29.0rc5 रिलीज़ ने विशेष रूप से Mamba मॉडलों के लिए `prefix_cache_retention_interval` पैरामीटर के डिफ़ॉल्ट मान को `dense` पर अपडेट किया है।

github llama.cpp · 6 घंटे पहले · 2 बार देखा गया

llama.cpp b11284 में quantized weight views पर OpenVINO GET_ROWS की समस्या का समाधान

llama.cpp प्रोजेक्ट ने build b11284 जारी किया है, जिसमें quantized weight views पर GETROWS ऑपरेशन को सही ढंग से हैंडल करने के लिए OpenVINO backend में एक सुधार शामिल है।

github llama.cpp · 7 घंटे पहले · 1 बार देखा गया

llama.cpp b11280 रिलीज में पिंडेड होस्ट बफर्स के साथ टेंसर ऑलरिड्यूक सिंक कम होता है

llama.cpp प्रोजेक्ट ने संस्करण b11280 जारी किया है, जिसमें पिंडेड होस्ट बफर्स का उपयोग करके टेंसर ऑलरिड्यूक सिंक को कम करने के लिए एक बदलाव शामिल है।

github llama.cpp · 8 घंटे पहले · 1 बार देखा गया

llama.cpp b11282 ने MUSA डिवाइस पास के लिए CUDA_ARCH परिभाषित किया

llama.cpp प्रोजेक्ट ने बिल्ड b11282 जारी किया, जिसमें MUSA डिवाइस पास के लिए `CUDA_ARCH` मैक्रो को परिभाषित करने का फिक्स शामिल है। पहले, MUSA वेंडर हेडर ने इस वेरिएबल को परिभाषित नहीं किया था, जिससे साझा ggml-cuda स्रोतों में आर्किटेक्चर टेस्ट शून्य पर मूल्यांकन हो गए और खाली कर्नेल बॉडी का कारण बना।

github llama.cpp · 9 घंटे पहले · 2 बार देखा गया

llama.cpp ने k-pool और MTP फिक्स के साथ GLM-5.3-Flash समर्थन जोड़ा

llama.cpp प्रोजेक्ट ने GLM-5.3-Flash (GLM5-Next) मॉडल आर्किटेक्चर के लिए प्रारंभिक समर्थन जोड़ा है, जिसमें हाइब्रिड-इंडेक्स मेमोरी में माइग्रेशन और शुरुआती मल्टी-टोकन प्रेडिक्शन (MTP) क्षमताएं शामिल हैं।

github llama.cpp · 10 घंटे पहले · 2 बार देखा गया

llama.cpp b11273 में ModernBERT रीरैंकरर्स के लिए classifier_pooling समर्थन जोड़ा गया

llama.cpp परियोजना ने बिल्ड b11273 जारी किया, जिसने रीरैंकिंग मॉडल्स में `classifier_pooling` विधि के लिए समर्थन पेश किया, विशेष रूप से ModernBERT आर्किटेक्चर्स को लक्षित करते हुए।

github llama.cpp · 11 घंटे पहले · 2 बार देखा गया

llama.cpp b11272 हेक्सगॉन कॉन्कैट ऑपरेशन को अनुकूलित करता है

llama.cpp प्रोजेक्ट ने b11272 बिल्ड जारी किया, जिसमें हेक्सगॉन बैकएंड के लिए अनुकूलन शामिल हैं। प्राथमिक बदलाव क्वालकॉम स्नैपड्रैगन हार्डवेयर पर प्रदर्शन में सुधार के लिए कॉन्कैनेशन ऑपरेशन को अनुकूलित करने पर केंद्रित है।

arxiv arXiv cs.CL · 16 घंटे पहले · 1 बार देखा गया

संदर्भ भाषा मॉडल संदर्भ को संपादन योग्य फ़ाइलों के रूप में स्वतः प्रबंधित करते हैं

शोधकर्ताओं ने संदर्भ भाषा मॉडल (CLMs) का परिचय दिया है, जो एक नई आर्किटेक्चर है जो मॉडल के संदर्भ विंडो को एक संपादन योग्य फ़ाइल के रूप में मानती है, जिससे मॉडल अपने स्मृति में बिना किसी प्रतिबंध के अद्यतन कर सकता है। यह दृष्टिकोण संदर्भ प्रबंधन को बाहरी हार्नेस नियंत्रण से आंतरिक मॉडल व्यवहार की ओर स्थानांतरित करता है, जिससे संदर्भ-प्रबंधन रणनीतियों का संदर्भ-में और पैरामीट्रिक सीखना संभव होता है।

media Hugging Face Forums · 18 घंटे पहले · 1 बार देखा गया

AI Hardware Fit मॉडल की VRAM आवश्यकताओं को GPU चयन से जोड़ता है

AI Hardware Fit के निर्माता ने एक मुफ्त, ओपन-सोर्स ब्राउज़र टूल जारी किया है, जिसका डिज़ाइन उपयोगकर्ताओं की मदद करने के लिए किया गया है कि वे यह निर्धारित कर सकें कि कोई लोकल मॉडल उनके GPU पर फिट होगा या नहीं और उपयुक्त हार्डवेयर विकल्पों की तुलना कर सकें। टूल विभिन्न स्रोतों से मॉडल फ़ाइलों, क्वांटीज़ेशन, कॉन्टेक्स्ट लंबाई और रनटाइम समर्थन को जोड़ने की जटिलता को दूर करता है।