Hardware & chips
media r/LocalLLaMA · 1 दिन पहले · 11 बार देखा गया

अलिबाबा 5 ट्रिलियन से 10 ट्रिलियन पैरामीटर के साथ AI मॉडल की योजना बना रहा है और नया चिप प्रकट करता है

अलिबाबा ने 5 ट्रिलियन से 10 ट्रिलियन पैरामीटर वाले एक कृत्रिम बुद्धिमत्ता मॉडल को विकसित करने की योजनाओं की घोषणा की है। इस रोडमैप के साथ, कंपनी ने अपनी बुनियादी ढांचा आवश्यकताओं का समर्थन करने के लिए डिज़ाइन किए गए एक नए कस्टम चिप को भी प्रकट किया।

media r/LocalLLaMA · 2 दिन पहले · 11 बार देखा गया

हुआवेई ने चीन में अपनी मांग आपूर्ति से अधिक होने के कारण वैश्विक एआई चिप रोलआउट को स्थगित कर दिया

हुआवेई ने अपने कृत्रिम बुद्धिमत्ता चिप्स के अंतर्राष्ट्रीय विस्तार को रोका है क्योंकि चीन के भीतर घरेलू मांग उपलब्ध आपूर्ति से अधिक हो रही है। इस रणनीतिक बदलाव का मतलब है कि प्रतिस्पर्धी AMD और Nvidia अब हुआवेई के वैश्विक बाजार प्रवेश से तुरंत दबाव का सामना नहीं कर रहे हैं।

media Hugging Face Forums · 3 दिन पहले · 16 बार देखा गया

प्रोग्रेसिव मॉडल ग्रोथ और ट्रान्सफॉर्मर्स के लिए ओपन हार्डवेयर प्रोफाइल का प्रस्ताव

Hugging Face पर एक प्रस्ताव AI में दो जुड़े हुए समस्याओं पर चर्चा करता है: अलग-अलग बड़े मॉडल के प्रशिक्षण पर निर्भरता और इकोसिस्टम की सामान्य उद्देश्य GPU पर निर्भरता।

github llama.cpp · 3 दिन पहले · 20 बार देखा गया

llama.cpp b11059 में Metal FWHT कुंजल के लिए F16 समर्थन जोड़ा गया

llama.cpp परियोजना ने बिल्ड b11059 जारी किया, जिसमें Apple Silicon हार्डवेयर के लिए Metal बैकएंड में महत्वपूर्ण अपडेट शामिल हैं। प्राथमिक परिवर्तन फास्ट वालश-हैडामार्ड ट्रांसफॉर्म (FWHT) कुंजल में F16 इनपुट समर्थन जोड़ना है, जिससे यह बिना किसी रूपांतरित कॉपी की आवश्यकता के सीधे F16 स्रोतों को पढ़ सकता है।

github llama.cpp · 5 दिन पहले · 21 बार देखा गया

llama.cpp ने Vulkan mul_mat_id विशेषज्ञ सीमा को 1024 तक बढ़ा दिया

llama.cpp परियोजना ने Vulkan mul_mat_id संचालन के लिए hoisted row-id सीमा को 256 विशेषज्ञों से बढ़ाकर 1024 विशेषज्ञ कर दिया है। यह बदलाव Qwen3.8-Flash-Next जैसे बड़े विशेषज्ञ गणना वाले मॉडलों में प्रदर्शन की बाधाओं को दूर करता है, जो पहले साझा सरणी आकार की सीमाओं के कारण धीमी कोड पथ पर चलते थे।

github llama.cpp · 7 दिन पहले · 17 बार देखा गया

llama.cpp b10997 ने RDNA3.5 के लिए MoE टाइल हीयूरिस्टिक को विस्तारित किया

llama.cpp प्रोजेक्ट ने संस्करण b10997 जारी किया, जिसमें Mixture of Experts (MoE) ncols_opt टाइल हीयूरिस्टिक में RDNA3.5 आर्किटेक्चर का समर्थन करने के लिए एक बदलाव शामिल है।

github llama.cpp · 7 दिन पहले · 20 बार देखा गया

llama.cpp b10994 ने बड़ी एक्टिवेशन के लिए mul_mm_id में Metal NaN को ठीक किया

llama.cpp b10994 रिलीज़ में Metal बैकएंड के लिए एक सुधार शामिल है जो `mul_mm_id` ऑपरेशन में NaN आउटपुट को हल करता है जब एक्टिवेशन मान f16 रेंज से अधिक हो जाते हैं। यह दोष पहले Apple Silicon डिवाइस पर 32 टोकन या उससे अधिक के प्रीफिल चरणों के दौरान Mistral Small 4 जैसे मॉडलों द्वारा पूरी तरह से NaN शब्दावली उत्पन्न करने का कारण बनता था।

lab NVIDIA Research · 7 दिन पहले · 16 बार देखा गया

ShareMMU कम ओवरहेड के साथ अविश्वसनीय एक्सेलेरेटरों के बीच सुरक्षित पता अनुवाद साझाकरण सक्षम बनाता है

शोधकर्ताओं ने ShareMMU प्रस्तुत किया, एक IOMMU डिज़ाइन जो कई अविश्वसनीय एक्सेलेरेटरों को साझा वirtual पता स्थान में पूर्व-अनुवादित पतों को सुरक्षित रूप से पुन: उपयोग करने की अनुमति देता है। यह दृष्टिकोण बड़े साझा अनुवाद लुकसाइड बफर (TLBs) से जुड़ी साइड-चैनल जोखिमों को कम करता है जबकि उच्च प्रदर्शन बनाए रखता है।

media Hugging Face Forums · 9 दिन पहले · 18 बार देखा गया

RTX 4060 Laptop पर MOLT ने Unsloth की तुलना में Qwen 1.5B QLoRA फाइन-ट्यूनिंग को 23% तेज किया

लेखक ने उपभोक्ता NVIDIA GPU पर थर्मली अवेयर QLoRA फाइन-ट्यूनिंग के लिए Windows-फर्स्ट रनटाइम MOLT बनाया है, और RTX 4060 Laptop GPU पर एक मिलियन Qwen 1.5B ट्रेनिंग टारगेट का उपयोग करके इसका Unsloth के साथ बेंचमार्क किया है।

media r/LocalLLaMA · 11 दिन पहले · 22 बार देखा गया

कस्टम कोड DeepSeek V4.1 को A100 GPUs पर आधिकारिक API से तेज़ चलाता है

एक उपयोगकर्ता ने एक कस्टम कार्यान्वयन विकसित किया है जो DeepSeek V4.1 मॉडल को NVIDIA A100 GPUs पर आधिकारिक API से बेहतर प्रदर्शन के साथ चलाने की अनुमति देता है।

media Hugging Face Forums · 11 दिन पहले · 13 बार देखा गया

मेमोरी-बजट-अवेयर एक्जीक्यूशन के साथ वेंडर-न्यूट्रल AI रनटाइम का प्रस्ताव

हगिंग फेस फोरम पर एक प्रस्ताव सामान्य GPU एक्जीक्यूशन और मेमोरी-मैनेजमेंट लेयर की रूपरेखा तैयार करता है, जिसे NVIDIA, AMD और Intel जैसे विशिष्ट हार्डवेयर वेंडर्स से एप्लिकेशन कोड को अलग करने के लिए डिज़ाइन किया गया है। इसका उद्देश्य उपयोगकर्ताओं को मैन्युअल रूप से बैकएंड-विशिष्ट फ्लैग, डिवाइस मैप्स या ऑफलोडिंग रणनीतियों को कॉन्फ़िगर करने के बजाय एक मेमोरी बजट निर्धारित करने की अनुमति देना है।

lab NVIDIA Research · 11 दिन पहले · 20 बार देखा गया

disk-oblivious ANN खोज के लिए Onyx ने लागत में 1.7-9.9x और लेटेंसी में 2.3-12.3x की कमी हासिल की

शोधकर्ताओं ने Onyx का प्रस्ताव रखा है, जो disk-oblivious अनुमानित निकटतम पड़ोसी (ANN) खोज के लिए एक लागत-कुशल दृष्टिकोण है जो state-of-the-art ORAM-ANN सिस्टम के डिज़ाइन को उलटकर बैंडविड्थ और एक्सेस गिनती के बीच संतुलन बनाता है।

lab NVIDIA Research · 11 दिन पहले · 21 बार देखा गया

GPU-त्वरित निजी जानकारी प्राप्ति के लिए NVIDIA ने GPIR जारी किया

NVIDIA के शोधकर्ताओं ने GPIR पेश किया है, एक ऐसा सिस्टम जो लैटिस-आधारित प्रोटोकॉल में अंतर्निहित उच्च सर्वर-साइड कंप्यूटेशन और मेमोरी ट्रैफिक को संबोधित करके GPU पर निजी जानकारी प्राप्ति (PIR) को त्वरित करता है। सिस्टम एक चरण-जागरूक हाइब्रिड एक्जीक्यूशन मॉडल का उपयोग करता है जो ऑन-चिप डेटा पुन: उपयोग को अधिकतम करने के लिए ऑपरेशन-स्तर और चरण-स्तरीय kernels के बीच गतिशील रूप से स्विच करता है।

lab NVIDIA Research · 11 दिन पहले · 21 बार देखा गया

PPML के लिए MPC और FHE की प्रदर्शन और लागत का वर्गीकरण NVIDIA द्वारा

एक नया अध्ययन गोपनीयता-संरक्षित मशीन लर्निंग इनफरेंस के लिए सुरक्षित बहु-पार्टी कंप्यूटेशन (MPC) और पूर्ण होमोमॉर्फिक एन्क्रिप्शन (FHE) का एक एकीकृत सिस्टम-स्तर वर्गीकरण प्रस्तुत करता है। कार्य दो MPC प्रकारों — अंकगणितीय/बाइनरी शेयरिंग रूपांतरण और फंक्शन सीक्रेट शेयरिंग — का FHE के साथ कई CNN और Transformer मॉडल पर मूल्यांकन करता है।

media Together AI Blog · 13 दिन पहले · 59 बार देखा गया

Together AI ने NVIDIA Vera Rubin NVL72 के लिए ThunderKittens GEMMs को अनुकूलित किया

Together AI के कर्नेल टीम ने NVIDIA Vera Rubin NVL72 प्लेटफ़ॉर्म में नई सुविधाओं का लाभ उठाने के लिए ThunderKittens लाइब्रेरी को अनुकूलित किया है, विशेष रूप से NVFP4 और FP8 मैट्रिक्स गुणन के लिए बेहतर प्रदर्शन पर केंद्रित।

media Together AI Blog · 13 दिन पहले · 16 बार देखा गया

Together GPU Clusters में 50% लागत पर preemptible नोड्स जोड़े गए

Together AI ने Kubernetes पर Together GPU Clusters के लिए preemptible compute की सार्वजनिक पूर्वावलोकन की घोषणा की है, जो interruption-tolerant workloads के लिए कम लागत वाला विकल्प प्रदान करता है। Preemptible nodes unused NVIDIA accelerated capacity का उपयोग करते हैं और on-demand दर का 50% फ्लैट शुल्क लिया जाता है।

github llama.cpp · 13 दिन पहले · 19 बार देखा गया

llama.cpp b10891 ने साझा-स्मृति ह्रास पर वापस जाने के द्वारा PowerVR Vulkan क्रैश को ठीक किया

llama.cpp प्रोजेक्ट ने संस्करण b10891 जारी किया, जो PowerVR GPU पर एक महत्वपूर्ण स्थिरता समस्या को संबोधित करता है। अपडेट Vulkan बैकएंड को डीक्वांटाइज़्ड मैट्रिक्स-वेक्टर मल्टीप्लिकेशन (dmmv) संचालन के लिए साझा-स्मृति ह्रास पर वापस जाने के लिए संशोधित करता है।

lab OpenAI News · 15 दिन पहले · 39 बार देखा गया

MIT का GPT-5.6 Sol Codex के माध्यम से क्वांटम चिप कैलिब्रेशन को स्वचालित करता है

MIT के इंजीनियरिंग क्वांटम सिस्टम्स ग्रुप की बेट्रिस यानकेलेविच ने सुपरकंडक्टिंग क्यूबिट्स पर नियमित मापों को स्वतंत्र रूप से चलाने और परिष्कृत करने के लिए Codex के साथ एकीकृत GPT‑5.6 Sol का उपयोग किया। इस एकीकरण से AI एजेंट प्रयोगशाला सॉफ़्टवेयर को संचालित कर सकता है, परिणामों का विश्लेषण कर सकता है और निरंतर मानवीय निगरानी के बिना अगले चरणों का निर्णय ले सकता है।

media TLDR AI · 15 दिन पहले · 26 बार देखा गया

Anthropic ने $517B कंप्यूट सुरक्षित किया; OpenAI मैनेज्ड एजेंट्स की तैयारी कर रहा है

Anthropic ने पिछले 11 महीनों में Google और AWS के साथ मुख्य रूप से, 14.8GW के बराबर $517 अरब की कंप्यूट क्षमता लीज पर सुरक्षित की है। इस विस्तार में Akamai और Fluidstack जैसे क्लाउड प्रदाताओं के साथ बड़े सौदे और Nscale के साथ $45 अरब का समझौता शामिल है।

github llama.cpp · 16 दिन पहले · 44 बार देखा गया

llama.cpp b10839 में Vulkan GET_ROWS असंगत ऑफ़सेट क्रैश ठीक किए गए

llama.cpp प्रोजेक्ट ने संस्करण b10839 जारी किया, जिसने टेंसर पंक्ति पुनर्प्राप्ति संचालनों के दौरान असंगत ऑफ़सेट के कारण Vulkan बैकएंड में होने वाले कठोर क्रैश को हल किया। पहले, Qwen3-TTS और Qwen3-VL जैसे मॉडल्स `ggml_view` का उपयोग करते समय शून्येतर दृश्य ऑफ़सेट के साथ विफल हो जाते थे क्योंकि शेडर `minStorageBufferOffsetAlignment` के सापेक्ष संरेखण उल्लंघनों पर एक्सर्ट करता था। यह अपडेट क्वांटाइज्ड और अ-क्वांटाइज्ड दोनों पथों में संरेखित ऑफ़सेट के लिए नेटिव समर्थन लागू करता है, जिससे CPU फॉलबैक की आवश्यकता समाप्त हो जाती है।