Hardware & chips
github llama.cpp · 2 दिन पहले · 1 बार देखा गया

llama.cpp b10306 में SYCL GLU फ्लैट पथ जोड़ा गया और कर्नेल संघीकृत किए गए

llama.cpp b10306 रिलीज ने SYCL बैकएंड के लिए प्रदर्शन अनुकूलन पेश किए, विशेष रूप से गेटेड लीनियर यूनिट (GLU) ऑपरेशन को टारगेट करते हुए। अपडेट में फ्यूज़्ड GLU ऑप्स के लिए एक सतत तेज़ पथ जोड़ा गया है और पहले अलग-अलग कर्नेल को एक सामान्य लॉन्चर साझा करने के लिए संघीकृत किया गया है।

github llama.cpp · 5 दिन पहले · 2 बार देखा गया

llama.cpp b10255 ने non-FP16 KV कैशे के लिए oneDNN SDPA का विस्तार किया

llama.cpp b10255 रिलीज़ ने एक-कंप्यूटेशनल डेटा न्यूमेरिक (oneDNN) SDPA पथ को गैर-FP16 कुंजी-मान्यता (KV) कैशे का समर्थन करने के लिए विस्तारित किया, जिसमें Q4_0–Q8_0 क्वांटाइज्ड फॉर्मेट और FP32 शामिल हैं। इस अपडेट से फ्यूज्ड सिस्टोलिक कोरल को नेटिव FP16 पथ की तरह ही चलने में सक्षम बनाया गया है, जिसमें प्रोसेसिंग से पहले K/V टेंसर को डेक्वांटाइज़ या घनत्वपूर्ण FP16 में रूपांतरित किया जाता है।

media r/LocalLLaMA · 10 दिन पहले · 1 बार देखा गया

DeepSeek V4 Flash पर Lucebox और AMD ने Nvidia DGX Spark को 3.63x से बेहतर किया

Lucebox ने Nvidia DGX Spark की तुलना में अनुमानन गति में श्रेष्ठता प्रदर्शित करने के लिए AMD के साथ साझेदारी की है। यह सिस्टम पूरे 284B DeepSeek V4 Flash मॉडल को चलाने के लिए एक AMD Radeon AI PRO R9700 GPU और Strix Halo प्रोसेसर को जोड़ता है।

lab Hugging Face Blog · 10 दिन पहले · 2 बार देखा गया

GPU प्रबंधन: निष्क्रिय GPU नए भूमिगत विमान हैं क्यों

लेख का तर्क है कि मॉडल बुद्धिमत्ता के बजाय, GPU उपयोगिता उद्यम AI में प्राथमिक बाधा बन गई है, जिसमें एयरलाइन विमानों की उपयोगिता से समानता खींची गई है जहां लागत उपयोग चाहे कुछ भी हो, प्रति घंटा जुड़ती रहती है।

media Hugging Face Forums · 12 दिन पहले · 1 बार देखा गया

पेशिएंस स्ट्रोंग तंत्रिका नेटवर्क को अर्धचालक उपकरण के रूप में बनाने का प्रस्ताव रखती है

पेशिएंस स्ट्रोंग का तर्क है कि वर्तमान तंत्रिका नेटवर्क सॉफ़्टवेयर में सर्किट को एमुलेट करके, भौतिक हार्डवेयर के रूप में उन्हें लागू करने के बजाय, अत्यधिक कंप्यूट पावर का उपभोग करते हैं। पेपर इस एमुलेशन को एक अर्धचालक उपकरण से बदलने का सुझाव देता है जहाँ वजन और बायस गैर-वाष्पशील मेमोरी में संग्रहीत होते हैं।

lab Hugging Face Blog · 12 दिन पहले

Ai2 ने ग्रह-स्तर की भौगोलिक निष्कर्षण के लिए OlmoEarth प्लेटफ़ॉर्म जारी किया

Ai2 ने OlmoEarth प्लेटफ़ॉर्म लॉन्च किया है, एक इंफ्रास्ट्रक्चर सिस्टम जिसे फाइन-ट्यूनिंग से लेकर बड़े स्तर के निष्कर्षण तक पृथ्वी अवलोकन फाउंडेशन मॉडल्स को ले जाने के लिए डिज़ाइन किया गया है। यह प्लेटफ़ॉर्म कई प्रदाताओं और रिज़ोल्यूशन पर टेराबाइट्स बहुमोडल उपग्रह डेटा के प्रसंस्करण की इंजीनियरिंग चुनौतियों को संबोधित करता है।

media r/LocalLLaMA · 13 दिन पहले · 1 बार देखा गया

Kimi K3 वजन रिलीज़; A100s, H200s, B300s पर तैनाती की योजना

Moonshot ने Hugging Face पर अपने Kimi K3 मॉडल के वजन जारी किए हैं, जिनमें 2.8 ट्रिलियन पैरामीटर और mixture-of-experts आर्किटेक्चर है जिसमें प्रति टोकन 16 सक्रिय विशेषज्ञ हैं। टीम इस सप्ताह के अंत तक A100, H200 और B300 GPU पर मॉडल तैनात करने की योजना बना रही है, और बेंचमार्क परिणाम इस सप्ताह की उम्मीद है।

github llama.cpp · 16 दिन पहले · 2 बार देखा गया

llama.cpp b10099 ने CUDA पर NVFP4 W4A4 क्वांटीज़ेशन को बेहतर बनाया

llama.cpp प्रोजेक्ट ने संस्करण b10099 जारी किया, जिसमें NVFP4 W4A4 सक्रियण क्वांटीज़ेशन में सुधार के लिए CUDA बैकएंड में एक महत्वपूर्ण अपडेट शामिल है।

lab IBM Research (Granite) · 16 दिन पहले

सिलिकॉन-स्पिन क्यूबिट विशेषज्ञता के लिए IBM ने HRL Laboratories को अधिग्रहित किया

IBM ने HRL Laboratories को अधिग्रहित करने के लिए एक निश्चित समझौते पर हस्ताक्षर किए हैं, जो वैज्ञानिक योगदान में लगभग 80 वर्षों की ऐतिहासिक शोध संस्था है। इस अधिग्रहण का उद्देश्य सिलिकॉन-स्पिन क्यूबिट इंजीनियरिंग में HRL की उन्नत विशेषज्ञता को एकीकृत करके IBM के क्वांटम कंप्यूटिंग दृष्टिकोण को तेज करना है।

media TLDR AI · 17 दिन पहले · 1 बार देखा गया

AMD + Anthropic समझौता: AMD MI450 चिप्स आपूर्ति करेगा और $5B निवेश करेगा

AMD और Anthropic ने AI सर्वरों पर अरबों डॉलर के एक प्रमुख समझौते पर हस्ताक्षर किए हैं, जिसमें Anthropic अगले वर्ष की पहले छमाही से AMD के Instinct MI450 चिप्स के 2 गीगावाट तक खरीदेगा। इसके साथ ही, विशिष्ट तैनाती के मील के पत्थरों को पूरा करने पर AMD, Anthropic में $5 बिलियन तक निवेश करेगा, जबकि दोनों कंपनियां हार्डवेयर के लिए उपयुक्त डेटा सेंटर की पहचान करने पर सहयोग करेंगी।

arxiv arXiv cs.AI · 17 दिन पहले · 4 बार देखा गया

SLAI T-Rex, Ascend SuperPOD पर DeepSeek-V4 के पूर्ण-पैरामीटर पोस्ट-ट्रेनिंग को सक्षम बनाता है

SLAI ने T-Rex पेश किया, जो Ascend NPU SuperPOD पर ट्रिलियन-पैरामीटर-स्केल MoE मॉडल्स के पूर्ण-पैरामीटर पोस्ट-ट्रेनिंग के लिए एक एंड-टू-एंड ऑप्टिमाइजेशन फ्रेमवर्क है। लक्ष्य वर्कलोड के रूप में DeepSeek-V4 मॉडल फैमिली का उपयोग करते हुए, सिस्टम हियरार्किकल पैरेलेलिज्म और कर्नेल एक्जीक्यूशन ऑप्टिमाइजेशन के माध्यम से मेमोरी प्रेशर और कम्युनिकेशन ओवरहेड को संबोधित करता है।

arxiv arXiv cs.CL · 17 दिन पहले · 1 बार देखा गया

SLAI T-Rex, Ascend SuperPOD पर DeepSeek-V4 का पूर्ण-पैरामीटर पोस्ट-ट्रेनिंग सक्षम बनाता है

SLAI ने T-Rex पेश किया है, जो Ascend NPU SuperPOD पर ट्रिलियन-पैरामीटर स्केल MoE मॉडल्स के पूर्ण-पैरामीटर पोस्ट-ट्रेनिंग के लिए एक एंड-टू-एंड ऑप्टिमाइजेशन फ्रेमवर्क है। DeepSeek-V4 मॉडल फैमिली को टारगेट वर्कलोड के रूप में उपयोग करते हुए, सिस्टम हियरार्किकल पैरेलेलिज्म और कर्नेल एक्जीक्यूशन ऑप्टिमाइजेशन के माध्यम से मेमोरी प्रेशर और कम्युनिकेशन ओवरहेड को संबोधित करता है।

lab IBM Research (Granite) · 17 दिन पहले

IBM ने अमेरिकी ऊर्जा विभाग की जीनिस मिशन के लिए 50 मिलियन डॉलर का क्वांटम एक्सेस प्रतिबद्ध किया

अमेरिकी ऊर्जा विभाग (DoE) ने IBM को जीनिस मिशन आवेदन अनुरोध के तहत एक परियोजना का नेतृत्व करने के लिए चुना है, जिसमें इस पहल का समर्थन करने के लिए क्वांटम कंप्यूट एक्सेस के रूप में 50 मिलियन डॉलर तक प्रतिबद्ध किए गए हैं।

lab OpenAI News · 18 दिन पहले · 2 बार देखा गया

एफिंगहम काउंटी में प्रोजेक्ट कैमेलिया डेटा सेंटर के लिए ओपनएआई ने प्रतिबद्धताओं की रूपरेखा तैयार की

ओपनएआई ने जॉर्जिया के एफिंगहम काउंटी में एक दीर्घकालिक डेटासेंटर परियोजना, प्रोजेक्ट कैमेलिया के लिए विवरण की घोषणा की है, जिसमें बिजली, पानी और स्थानीय लाभों से संबंधित अपनी प्रारंभिक सामुदायिक प्रतिबद्धताओं का उल्लेख किया गया है। कंपनी 2028 और 2032 के बीच 3.2 gigawatts बिजली की आपूर्ति के लिए जॉर्जिया पावर कंपनी के साथ अनुबंध कर रही है।

media TLDR AI · 19 दिन पहले · 2 बार देखा गया

AMD Helios रैक-स्केल AI सिस्टम, Kimi Work एजेंट, Ramp Router बचत

यह TLDR AI न्यूज़लेटर AI उद्योग में कई विकास को कवर करता है, जिसमें नया हार्डवेयर, सॉफ़्टवेयर एजेंट और राउटिंग अनुकूलन शामिल हैं।

media Together AI Blog · 20 दिन पहले · 2 बार देखा गया

Together AI और Y Combinator ने YC स्टार्टअप्स के लिए समर्पित GPU क्लस्टर लॉन्च किया

Together AI और Y Combinator ने Y Combinator के AI-नेटिव स्टार्टअप्स के पोर्टफोलियो के लिए समर्पित पहला GPU क्लस्टर प्रदान करने के लिए एक साझेदारी की घोषणा की है। यह पहल लंबी अवधि की प्रतिबद्धताओं की आवश्यकता के बिना प्रशिक्षण और निष्कर्षण के लिए लचीली, लागत-प्रभावी इंफ्रास्ट्रक्चर प्रदान करके कंप्यूट एक्सेस की महत्वपूर्ण बाधा को हल करने का लक्ष्य रखती है।

media r/LocalLLaMA · 21 दिन पहले · 2 बार देखा गया

GPU की कमी के कारण Moonshot AI नए सब्सक्रिप्शन और मुफ्त एक्सेस को रोक रहा है

चीनी कृत्रिम बुद्धिमत्ता कंपनी Moonshot AI चीन में GPU क्षमता से वंचित होने वाली पहली कंपनी बन गई है। इसके परिणामस्वरूप, कंपनी ने उपयोगकर्ताओं के लिए नए सब्सक्रिप्शन रोकने और मुफ्त एक्सेस समाप्त करने का निर्णय लिया है।

media Together AI Blog · 24 दिन पहले

Together AI GPU इनफरेंस के लिए 99%, 99.9% और 99.99% अपटाइम का अर्थ समझाता है

Together AI GPU इनफरेंस के लिए विभिन्न विश्वसनीयता स्तरों को प्राप्त करने की आवश्यक विशिष्ट आर्किटेक्चरल आवश्यकताओं का विवरण देता है, यह तर्क देते हुए कि मानक SLA संख्याएं अक्सर वास्तविक फेलिंग डोमेन को छुपाती हैं।

lab NVIDIA Technical Blog · 24 दिन पहले · 2 बार देखा गया

एनविडिया एजेंटिक AI फैक्ट्रियों को स्केल करने के लिए ब्लूफील्ड सह-डिज़ाइन का प्रस्ताव देती है

एनविडिया बताती है कि इसके ब्लूफील्ड प्रोसेसर के साथ अत्यंत सह-डिज़ाइन एजेंटिक AI वर्कलोड्स द्वारा उत्पन्न बुनियादी ढांचे की चुनौतियों को कैसे संबोधित कर सकता है। कंपनी का तर्क है कि जैसे-जैसे एजेंटिक सिस्टम मॉडल कॉल्स, टूल इंटरैक्शन और डेटा लुकअप की जटिल श्रृंखलाओं को ट्रिगर करते हैं, पारंपरिक बुनियादी ढांचे के पैटर्न प्रदर्शन बनाए रखने के लिए अपर्याप्त हो जाते हैं।

lab NVIDIA Technical Blog · 24 दिन पहले

NVIDIA CUDA 13.3 में नेटिव कैरीलेस मल्टीप्लिकेशन समर्थन जोड़ा गया

NVIDIA ने CUDA 13.3 में कैरीलेस मल्टीप्लिकेशन के लिए एक नया PTX निर्देश पेश किया है, जिसने एक लंबे समय से चली आ रही कमी को दूर किया है जहां GPUs को इस ऑपरेशन के लिए नेटिव समर्थन नहीं था, भले ही x86 CPUs पर यह पंद्रह साल से अधिक समय से मौजूद हो।