लैब · DeepSeek
lab DeepSeek API Docs · 21 दिन पहले Codeforces (Elo) · 3471.0Elo · 68 बार देखा गया

DeepSeek ने मूल बहुआयामी समर्थन के साथ V4.1-Flash मॉडल जारी किया

DeepSeek ने आधिकारिक तौर पर DeepSeek-V4.1-Flash मॉडल जारी किया है, जो इसके नए आर्किटेक्चर परिवार का सबसे छोटा सदस्य है और जिसमें मूल बहुआयामी दृश्य समझ शामिल है। यह नया आर्किटेक्चर बड़े मॉडलों के लिए उच्चतर क्षमता छत, तेज़ इनफरेंस गति, उच्च थ्रूपुट और बेहतर स्केलिंग संभावना प्रदान करने के लिए डिज़ाइन किया गया है।

media AI News (smol.ai) · 18 दिन पहले · 51 बार देखा गया

DeepSeek ने V4.1-Flash लॉन्च किया, जो अत्यंत निष्पादन दक्षता पर केंद्रित एक ओपन-वेट मॉडल है

DeepSeek ने V4.1-Flash जारी किया है, जो अत्यंत निष्पादन दक्षता और कम लागत के लिए डिज़ाइन किया गया एक नया ओपन-वेट फ्लैगशिप मॉडल है। यह मॉडल सक्रिय कंप्यूटेशन और KV/cache लागत को काफी कम करने के लिए एक कारणिक एन्कोडर-डीकोडर आर्किटेक्चर का उपयोग करता है।

media Latent Space · 19 दिन पहले · 34 बार देखा गया

DeepSeek ने कुशल इनफरेंस के लिए 763B-P8B-D16B आर्किटेक्चर के साथ v4.1-Flash जारी किया

DeepSeek ने DeepSeek v4.1-Flash लॉन्च किया है, जो एक नया ओपन-वेट फ्लैगशिप मॉडल है जिसमें इनफरेंस दक्षता को अधिकतम करने और लागत कम करने के लिए डिज़ाइन की गई एक नई कारणवादी एन्कोडर-डीकोडर आर्किटेक्चर शामिल है।

media MarkTechPost · 20 दिन पहले · 55 बार देखा गया

DeepSeek ने 1M संदर्भ और FP4 KV कैश के साथ DeepSeek-V4.1-Flash जारी किया

DeepSeek AI ने DeepSeek-V4.1-Flash जारी किया है, जो एक बहुमोडल मिक्स्चर-ऑफ-एक्सपर्ट्स मॉडल है जिसमें 1-मिलियन-टोकन संदर्भ विंडो और FP4 KV कैश शामिल है जो प्रति टोकन 890 बाइट के वैश्विक कैश फुटप्रिंट को कम करता है। मॉडल एक कारणवादी एन्कोडर-डीकोडर आर्किटेक्चर और कॉम्प्रेस्ड स्पार्स एटेंशन 2 (CSA2) का उपयोग करता है जो प्रदर्शन बनाए रखते हुए मेमोरी की आवश्यकताओं को काफी कम करता है।

media r/LocalLLaMA · 10 घंटे पहले · 1 बार देखा गया

DeepSeek अब Ascend 950 पर मॉडल प्रशिक्षित कर रहा है

DeepSeek Huawei के Ascend 950 हार्डवेयर का उपयोग करके अपने मॉडल को प्रशिक्षित कर रहा है। यह बदलाव Liang Wenfeng द्वारा 26 महीने पहले किए गए एक बयान के बाद आया है जिसमें किसी के अग्रिम पर पहुंचने की आवश्यकता बताई गई थी।

media r/LocalLLaMA · 8 दिन पहले · 13 बार देखा गया

Anthropic को डेटा लीक होने की संभावना के कारण बीजिंग में DeepSeek और Moonshot AI पर जांच

चीनी नियामक DeepSeek और Moonshot AI पर अमेरिकी कंपनी Anthropic को डेटा लीक होने की संभावना के संबंध में जांच कर रहे हैं। यह जांच Kimi के कार्यकारी अधिकारियों से जुड़ी अफवाहों के बाद हुई है, हालांकि स्थिति को अभी तक पुष्टि किए गए गिरफ्तारियों के बजाय एक जांच के रूप में वर्णित किया गया है।

media r/LocalLLaMA · 9 दिन पहले · 20 बार देखा गया

DeepSeek 2T पैरामीटर मॉडल को प्रशिक्षित कर रहा है और 8T पैरामीटर मॉडल की योजना बना रहा है

DeepSeek वर्तमान में 2 ट्रिलियन पैरामीटर के साथ एक नए मॉडल को प्रशिक्षित कर रहा है, जिसकी योजना अंततः 8 ट्रिलियन पैरामीटर वाले मॉडल को बनाने की है।

arxiv arXiv cs.AI · 10 दिन पहले · 24 बार देखा गया

CodeMidas स्रोत कोड का उपयोग करके एजेंटिक कोडिंग RL पर्यावरणों को स्केल करता है

शोधकर्ताओं ने CodeMidas पेश किया, जो एक एजेंटिक पाइपलाइन है जो ओपन-सोर्स कोडबेसेस में कार्यान्वित फ़ंक्शनलिटी से पुनर्बल सीखने (reinforcement learning) पर्यावरण बनाती है, स्रोत कोड को एकमात्र इनपुट के रूप में उपयोग करके। विधि एजेंटिक कंप्यूट को फ़ंक्शनलिटी का अन्वेषण करने, निष्पादन-आधारित परीक्षण बनाने और बार-बार रोलआउट के माध्यम से कार्यों की सत्यापन करने के लिए आवंटित करती है, जिसके परिणामस्वरूप 23 प्रोग्रामिंग भाषाओं में 5,545 प्रशिक्षण कार्यों का एक डेटासेट बनता है। इन कार्यों पर GRPO के साथ MiMo-V2.5 को प्रशिक्षित करने से DeepSWE (+11.7%), ProgramBench (+17%) और Terminal-Bench v2.1 (+8.5%) सहित पांच विविध बेनचमार्क्स पर प्रदर्शन में सुधार होता है। ट्रैजेक्टरी विश्लेषण संकेत देता है कि RL-प्रशिक्षित एजेंट ने बेहतर व्यवहार प्रदर्शित किए, जैसे कोडबेस का अधिक अन्वेषण और अधिक विविध स्वयं सत्यापन। ये परिणाम स्रोत कोड को स्केलेबल आधार के रूप में स्थापित करते हैं जो विविध सॉफ्टवेयर कार्यों में कोडिंग एजेंट्स को बेहतर बनाने वाले RL पर्यावरण बनाने के लिए उपयोगी है।

arxiv arXiv cs.CL · 13 दिन पहले · 32 बार देखा गया

DeepSeek ने V4.1-Flash जारी की जिसमें KV कैश फुटप्रिंट 890 बाइट्स/टोकन है

DeepSeek ने DeepSeek-V4.1-Flash जारी किया है, जो एक बहुआयामी Mixture-of-Experts मॉडल है जिसे एजेंटिक वर्कलोड में लंबे संदर्भ की गणना और बड़े KV कैश के उच्च खर्च को दूर करने के लिए डिज़ाइन किया गया है।

arxiv arXiv cs.AI · 15 दिन पहले · 27 बार देखा गया

एट्रिया डॉन प्रीव्यू: वैज्ञानिक शोध के लिए फाउंडेशन एजेंटिक लैंग्वेज मॉडल

एट्रिया डॉन प्रीव्यू एक फाउंडेशन एजेंटिक लैंग्वेज मॉडल है जो वैज्ञानिक शोध और इंजीनियरिंग वर्कफ़्लो के लिए डिज़ाइन किया गया है, जिसका प्रशिक्षण टूल-मध्यस्थता वाले इंटरैक्शन को एक्सेकुटेबल एन्वायरनमेंट से जोड़ने वाली एक वेरिफिएबल एक्सपीरियंस पाइपलाइन के माध्यम से किया गया है। वास्तविक शोध, इंजीनियरिंग और डिजिटल कार्य को कवर करने वाले 16 बेंचमार्क में, यह मॉडल फ्रंटियर एजेंट्स के साथ प्रतिस्पर्धी है और उनमें से पांच पर उच्चतम रिपोर्ट किए गए स्कोर प्राप्त करता है।

media r/LocalLLaMA · 18 दिन पहले · 26 बार देखा गया

कस्टम कोड DeepSeek V4.1 को A100 GPUs पर आधिकारिक API से तेज़ चलाता है

एक उपयोगकर्ता ने एक कस्टम कार्यान्वयन विकसित किया है जो DeepSeek V4.1 मॉडल को NVIDIA A100 GPUs पर आधिकारिक API से बेहतर प्रदर्शन के साथ चलाने की अनुमति देता है।

media r/LocalLLaMA · 20 दिन पहले · 23 बार देखा गया

DeepSeek V4.1 Flash रिलीज वीडियो में बेहतर गतिशील वीडियो जनरेशन दिखाता है

एक उपयोगकर्ता ने नई रिलीज़ की गई DeepSeek V4.1 Flash मॉडल का उपयोग करके बनाया गया वीडियो प्रकाशित किया है ताकि गतिशील वीडियो संश्लेषण में इसकी क्षमताओं का परीक्षण किया जा सके।

media r/LocalLLaMA · 21 दिन पहले · 25 बार देखा गया

DeepSeek ने V4-1 Flash जारी किया, जो 1M टोकन संदर्भ के साथ 552B MoE मॉडल है

DeepSeek ने अपना नया मॉडल DeepSeek V4-1 Flash जारी किया है। यह एक बहुआयामी Mixture-of-Experts (MoE) मॉडल है जिसमें 552 अरब पैरामीटर का बैकबोन है।

media r/LocalLLaMA · 21 दिन पहले · 56 बार देखा गया

DeepSeek ने कम लागत और उच्च गति के साथ 552B MoE मॉडल V4.1 Flash जारी किया

DeepSeek ने आधिकारिक तौर पर DeepSeek V4.1 Flash मॉडल जारी किया है, जो अपने नए आर्किटेक्चर श्रृंखला में सबसे छोटा प्रवेश बिंदु है और जिसमें नेटिव मल्टीमोडल विज़ुअल समझ शामिल है। Causal-Encoder-Decoder डिज़ाइन पर निर्मित, यह एक 552B-पैरामीटर Mixture of Experts (MoE) मॉडल है जो इनपुट साइड पर केवल 8B पैरामीटर और आउटपुट साइड पर 16B सक्रिय करता है।

media r/LocalLLaMA · 22 दिन पहले · 20 बार देखा गया

DeepSeek ने DeepSeek V4 Pro मॉडल को नरवी से निष्क्रिय कर दिया है

DeepSeek ने DeepSeek V4 Pro मॉडल को नरवी से निष्क्रिय कर दिया है। इस कार्रवाई से उनके AI सिस्टम के इस विशिष्ट संस्करण की उपलब्धता का अंत होता है।

media r/LocalLLaMA · 22 दिन पहले · 42 बार देखा गया

DeepSeek ने DeepSeek V4.1 Flash के लिए आंतरिक बीटा खोला है जिसमें नैटिव मल्टीमोडल समर्थन है

DeepSeek ने अपने DeepSeek V4.1 Flash मॉडल के एक मध्यवर्ती संस्करण के लिए आंतरिक बीटा परीक्षण खोल दिया है, जो अब API के माध्यम से उपलब्ध है।