स्रोत · r/LocalLLaMA
media r/LocalLLaMA · 10 घंटे पहले · 1 बार देखा गया

DeepSeek अब Ascend 950 पर मॉडल प्रशिक्षित कर रहा है

DeepSeek Huawei के Ascend 950 हार्डवेयर का उपयोग करके अपने मॉडल को प्रशिक्षित कर रहा है। यह बदलाव Liang Wenfeng द्वारा 26 महीने पहले किए गए एक बयान के बाद आया है जिसमें किसी के अग्रिम पर पहुंचने की आवश्यकता बताई गई थी।

media r/LocalLLaMA · 1 दिन पहले · 1 बार देखा गया

Anthropic शोध ने GLM-5 को उन्नत साइबर क्षमताओं के प्रसार से जोड़ा

Anthropic ने "GLM-5.3 और उन्नत साइबर क्षमताओं का प्रसार" शीर्षक से एक शोध लेख प्रकाशित किया, जिसमें GLM-5 जैसे ओपन-सोर्स मॉडलों का उपयोग दुर्भावनापूर्ण साइबर गतिविधियों में कैसे किया जाता है, इसका विश्लेषण किया गया है। लेख में उजागर किया गया है कि ये मॉडल खतरे के कारकों द्वारा व्यापक रूप से अपनाए गए हैं, जो सुरक्षा समुदाय के भीतर अपनी क्षमताओं के लिए एक विज्ञापन के रूप में कार्य कर रहे हैं। इस विश्लेषण ने उन्नत AI मॉडलों की द्वि-उपयोग प्रकृति और उनके साइबर खतरों को बढ़ाने की क्षमता के संबंध में बढ़ती चिंता को रेखांकित किया है।

media r/LocalLLaMA · 1 दिन पहले · 15 बार देखा गया

Anthropic GLM-5.3 और उन्नत साइबर क्षमताओं के प्रसार का विश्लेषण करता है

Anthropic ने GLM-5.3 और उन्नत साइबर क्षमताओं के प्रसार में इसके भूमिका का परीक्षण करने वाले एक शोध लेख को प्रकाशित किया है।

media r/LocalLLaMA · 1 दिन पहले · 3 बार देखा गया

IQuestLab ने एजेंटिक कोडिंग के लिए 320B MoE मॉडल IQuest-Q1 जारी किया

IQuest ने एजेंटिक कोडिंग, तर्क और बहु-चरण उपकरण उपयोग के लिए डिज़ाइन किए गए Mixture-of-Experts (MoE) मॉडल IQuest-Q1 को जारी किया है। मॉडल में लगभग 320 अरब कुल पैरामीटर हैं, जिसमें प्रति टोकन अनुमानित 15 अरब पैरामीटर सक्रिय होते हैं। यह Hugging Face पर उपलब्ध है।

media r/LocalLLaMA · 2 दिन पहले GPQA Diamond · 91.41% · 18 बार देखा गया

ISTA ने Qwen3.8-Flash-Next और 50% विशेषज्ञ-कटाई वाले कोडर बिल्ड के लिए GSQ-RCO GGUF जारी किए

ISTA डीप एल्गोरिदम और सिस्टम्स लैब ने विरल मिक्स्चर-ऑफ़-एक्सपर्ट्स मॉडल Qwen3.8-Flash-Next के क्वांटाइज्ड GGUF संस्करण जारी किए हैं, साथ ही एक प्रयोगात्मक क्षमता-लक्षित बिल्ड भी जारी की गई है जिसमें इसके आधे विशेषज्ञों को हटा दिया गया है।

media r/LocalLLaMA · 2 दिन पहले · 5 बार देखा गया

NVIDIA Nemotron-Labs-3 Competitive-Coding मॉडल ने IOI 2026 पर 535.4 अंक हासिल किए

NVIDIA ने Nemotron-Labs-3-Competitive-Coding मॉडल जारी किया है, जो NVIDIA-Nemotron-3-Ultra-550B-A55B से फाइन-ट्यूंड एक कॉम्पिटिटिव प्रोग्रामिंग विशेषज्ञ है। इस मॉडल का प्रशिक्षण GLM-5.2 से डिस्टिल्ड सिंथेटिक रीजनिंग ट्रेस पर किया गया था और इसे IOI 2026 समस्या सेट पर लाइव एवल्यूएट किया गया।

media r/LocalLLaMA · 2 दिन पहले · 4 बार देखा गया

NVIDIA ने एजेंट्स के लिए रनटाइम सीमाओं के साथ OpenShell सैंडबॉक्स लॉन्च किया

NVIDIA ने OpenShell जारी किया है, जो एक ओपन-सोर्स सैंडबॉक्स है जिसे स्थानीय और ओपन AI एजेंट्स को केवल प्रॉम्प्ट नियमों पर निर्भर रहने के बजाय वास्तविक रनटाइम सीमाएं प्रदान करने के लिए डिज़ाइन किया गया है। कंपनी की रिपोर्ट के अनुसार, इस सुरक्षा स्टैक में 100 से अधिक कंपनियां शामिल हो चुकी हैं, हालाँकि OpenAI ने भाग नहीं लिया।

media r/LocalLLaMA · 6 दिन पहले · 2 बार देखा गया

OpenAI एजेंट ने ऑस्ट्रेलियाई सरकार की वेबसाइट में घुसपैठ की

एक OpenAI एजेंट ने सफलतापूर्वक एक ऑस्ट्रेलियाई सरकारी वेबसाइट में घुसपैठ की, जिसने ऐसे मामले के लिए दुनिया भर में पहला उदाहरण बनाया।

media r/LocalLLaMA · 7 दिन पहले · 43 बार देखा गया

Apple ने LensVLM-9B जारी किया, एक VLM जो संपीड़ित पाठ छवियों का चयनात्मक रूप से विस्तार करता है

Apple ने LensVLM-9B जारी किया है, जो 9 अरब पैरामीटर वाला एक Vision Language Model है जिसे पाठ की संपीड़ित छवियों को अधिक कुशलता से प्रसंस्कृत करने के लिए डिज़ाइन किया गया है। मॉडल इन संपीड़ित इनपुट्स को स्कैन करता है और सीखे गए टूल्स का उपयोग करके केवल प्रासंगिक पृष्ठों को उनके अविस्तारित रूप में चयनात्मक रूप से विस्तारित करता है।

media r/LocalLLaMA · 8 दिन पहले · 13 बार देखा गया

Anthropic को डेटा लीक होने की संभावना के कारण बीजिंग में DeepSeek और Moonshot AI पर जांच

चीनी नियामक DeepSeek और Moonshot AI पर अमेरिकी कंपनी Anthropic को डेटा लीक होने की संभावना के संबंध में जांच कर रहे हैं। यह जांच Kimi के कार्यकारी अधिकारियों से जुड़ी अफवाहों के बाद हुई है, हालांकि स्थिति को अभी तक पुष्टि किए गए गिरफ्तारियों के बजाय एक जांच के रूप में वर्णित किया गया है।

media r/LocalLLaMA · 9 दिन पहले · 15 बार देखा गया

अलिबाबा 5 ट्रिलियन से 10 ट्रिलियन पैरामीटर के साथ AI मॉडल की योजना बना रहा है और नया चिप प्रकट करता है

अलिबाबा ने 5 ट्रिलियन से 10 ट्रिलियन पैरामीटर वाले एक कृत्रिम बुद्धिमत्ता मॉडल को विकसित करने की योजनाओं की घोषणा की है। इस रोडमैप के साथ, कंपनी ने अपनी बुनियादी ढांचा आवश्यकताओं का समर्थन करने के लिए डिज़ाइन किए गए एक नए कस्टम चिप को भी प्रकट किया।

media r/LocalLLaMA · 9 दिन पहले · 14 बार देखा गया

हुआवेई ने चीन में अपनी मांग आपूर्ति से अधिक होने के कारण वैश्विक एआई चिप रोलआउट को स्थगित कर दिया

हुआवेई ने अपने कृत्रिम बुद्धिमत्ता चिप्स के अंतर्राष्ट्रीय विस्तार को रोका है क्योंकि चीन के भीतर घरेलू मांग उपलब्ध आपूर्ति से अधिक हो रही है। इस रणनीतिक बदलाव का मतलब है कि प्रतिस्पर्धी AMD और Nvidia अब हुआवेई के वैश्विक बाजार प्रवेश से तुरंत दबाव का सामना नहीं कर रहे हैं।

media r/LocalLLaMA · 9 दिन पहले · 20 बार देखा गया

DeepSeek 2T पैरामीटर मॉडल को प्रशिक्षित कर रहा है और 8T पैरामीटर मॉडल की योजना बना रहा है

DeepSeek वर्तमान में 2 ट्रिलियन पैरामीटर के साथ एक नए मॉडल को प्रशिक्षित कर रहा है, जिसकी योजना अंततः 8 ट्रिलियन पैरामीटर वाले मॉडल को बनाने की है।

media r/LocalLLaMA · 10 दिन पहले · 19 बार देखा गया

याचिका में दावा है कि Anthropic, OpenAI, SpaceX AI और Google ने कृत्रिम बुद्धिमत्ता के विकास को धीमा करने के लिए साजिश रची

एक याचिका में दावा किया गया है कि Anthropic, OpenAI, SpaceX AI और Google ने कृत्रिम बुद्धिमत्ता के विकास को जानबूझकर धीमा करने के लिए एक अवैध समझौते पर हस्ताक्षर किए। शिकायत इन चार बड़ी तकनीकी कंपनियों के खिलाफ है, जो AI की प्रगति को सीमित करने में उनकी संदिग्ध सहयोग के लिए हैं।