Benchmark results
media r/LocalLLaMA · 2 दिन पहले · 1 बार देखा गया

ARC-AGI पर DeepSeek V4 Flash 0731 के परिणाम

लेख में DeepSeek V4 Flash 0731 मॉडल के लिए ARC-AGI बेंचमार्क परिणाम प्रस्तुत किए गए हैं। यह ARC Prize संगठन द्वारा होस्ट की गई आधिकारिक परिणाम पृष्ठ से लिंक करता है।

media The Batch · 2 दिन पहले Code Arena (Elo) · 1577.0Elo · 1 बार देखा गया

DeepSeek ने V4-Flash-0731 जारी किया, कम लागत में V4-Pro से बेहतर प्रदर्शन

DeepSeek ने DeepSeek-V4-Flash-0731 जारी किया है, जो अपने छोटे "Flash" मॉडल का एक अपडेटेड संस्करण है जो स्वतंत्र बेंचमार्क पर बड़े DeepSeek-V4-Pro से बेहतर प्रदर्शन करता है। इस रिलीज में मूल Mixture-of-Experts आर्किटेक्चर को 284 अरब कुल पैरामीटर के साथ बनाए रखते हुए एक नया फाइन-ट्यूनिंग प्रक्रिया का उपयोग किया गया है।

media Together AI Blog · 2 दिन पहले DeepSWE · 67.2% · 7 बार देखा गया

DeepSeek-V4 Flash 0731 बनाम GPT-5.6 Luna: DeepSWE पर लागत और कोडिंग

DeepSWE बेंचमार्क पर DeepSeek-V4 Flash 0731 और GPT-5.6 Luna की तुलना से पता चलता है कि जबकि GPT-5.6 Luna एक बेहतर इंजीनियर है, दोनों मॉडलों का उपयोग करने वाला कैस्केड रणनीति कम लागत में उच्च सटीकता प्रदान करती है।

media r/LocalLLaMA · 2 दिन पहले

कृत्रिम विश्लेषण द्वारा ओपस 5 से आगे, क्वेन 3.8 मैक्स को सर्वश्रेष्ठ समग्र मॉडल के रूप में रैंक किया गया

कृत्रिम विश्लेषण ने अपने एजेंटिक इंडेक्स को अपडेट किया है और क्वेन 3.8 मैक्स को सर्वश्रेष्ठ समग्र मॉडल के रूप में रैंक किया है, इसे ओपस 5 से आगे रखते हुए।

arxiv arXiv cs.AI · 3 दिन पहले

SciCode-Verified बेंचमार्क की त्रुटियों को ठीक करके मॉडलों की वास्तविक वैज्ञानिक-कोडिंग क्षमता को उजागर करता है

लेखकों ने पहचाना कि SciCode बेंचमार्क पर स्कोर में रुकावट का कारण मॉडल क्षमता की सीमाएं नहीं, बल्कि मूल्यांकन उपकरण में महत्वपूर्ण त्रुटियां हैं। 65 परीक्षण समस्याओं के एक क्षेत्र विशेषज्ञ द्वारा किए गए ऑडिट में 263 त्रुटियां पाई गईं, जिनमें से 192 ने गैर-पुनरुत्पादित स्वर्ग उत्तरों और अत्यधिक कठोर सहिष्णुता जैसे मुद्दों के कारण सही समाधानों को गलत तरीके से अस्वीकार कर दिया।

media AI News (smol.ai) · 4 दिन पहले Terminal-Bench 2 · 67.4% · 8 बार देखा गया

अलibaba ने 2.4T पैरामीटर और आगामी ओपन वेट्स के साथ Qwen3.8-Max की घोषणा की

अलibaba ने अपने नए फ्लैगशिप मॉडल के रूप में Qwen3.8-Max की घोषणा की है, जिसे लंबे समय तक चलने वाले एजेंटिक कार्य, कोडिंग और बहुआयामी तर्क पर केंद्रित 2.4T-पैरामीटर स्पार्स आर्किटेक्चर के रूप में वर्णित किया गया है। कंपनी ने पुष्टि की कि Qwen3.8-Max के लिए ओपन वेट्स अगले सप्ताह ओपन-वेट Qwen3.8-27B वेरिएंट के साथ जारी किए जाएंगे।

media r/LocalLLaMA · 4 दिन पहले · 2 बार देखा गया

Debate Benchmark में Qwen 3.8 Max ने 1588 अंक हासिल किए, जो Qwen 3.7 Max के 1462 से अधिक है

Qwen 3.8 Max ने Debate Benchmark में 1588 का स्कोर प्राप्त किया, जिसने Qwen 3.7 Max के 1462 के स्कोर को बेहतर बनाया। यह बेंचमार्क इस बात का मूल्यांकन करता है कि विभिन्न विषयों पर प्रतिद्वंद्वी, बहु-चरण वाली विरोधता के तहत बड़े भाषा मॉडल कितनी अच्छे से तर्क को बनाए रखते हैं।

media r/LocalLLaMA · 6 दिन पहले · 2 बार देखा गया

एजेंटिक कार्यों में गति और लागत पर ओपन-वेट मॉडल में DeepSeek v4 flash अग्रणी

कठिन एजेंटिक कार्यों पर ओपन-वेट मॉडल के आंतरिक मूल्यांकन ने पाया कि DeepSeek v4 flash अपने समकक्षों में सबसे तेज़ और सस्ता विकल्प है। इस परीक्षण में कई अनुप्रयोगों में लंबे समय तक चलने वाले वर्कफ़्लो शामिल थे, जिनका मूल्यांकन पूर्ण सफलता की आवश्यकता वाले निर्धारक जाँच द्वारा किया गया था।

media r/LocalLLaMA · 6 दिन पहले · 11 बार देखा गया

बेंचमार्क्स पर Qwen3.8-Max ने Kimi K3 और DeepSeek V4 Flash के बराबर प्रदर्शन किया

Qwen3.8-Max (2.4T) एक नया ओपन-वेट मॉडल है जो सभी बेंचमार्क श्रेणियों में Kimi K3 और DeepSeek V4 Flash के करीब प्रदर्शन करता है, जबकि कोडिंग और सॉफ़्टवेयर कार्यों में बेहतर प्रदर्शन दिखाता है।

media Hugging Face Forums · 7 दिन पहले · 8 बार देखा गया

लेवेंट बुलुट ने वस्तुनिष्ठ प्रक्षेपण पर एलएलएम टिप्पणी विश्वसनीयता का बेंचमार्क किया

लेवेंट बुलुट ने तुर्की कथा संकलन के लिए मशीन-जनित टिप्पणियों की विश्वसनीयता का मूल्यांकन करने वाले तीन अध्ययनों वाला एक बेंचमार्क प्रकाशित किया, जिसमें स्वचालित रेटर्स और मानव निर्णय के बीच महत्वपूर्ण असंगतियां सामने आईं। इस अध्ययन ने नियम-आधारित डिटेक्टरों और Gemini 2.5 Flash, Grok, ChatGPT 5.5, और Claude Fable 5 High जैसे मॉडल का उपयोग करके 120 और 100 दृश्यों में छह द्विआधारी कला विशेषताओं का परीक्षण किया।

media r/LocalLLaMA · 8 दिन पहले · 6 बार देखा गया

DeepSeek-V4-Flash-0731 ने 50 की बुद्धिमत्ता स्कोर प्राप्त की

DeepSeek-V4-Flash-0731 मॉडल ने 50 का इंटेलिजेंस इंडेक्स स्कोर प्राप्त किया है, जो मार्च 2026 के शीर्ष फ्रंटियर मॉडल्स के प्रदर्शन से मेल खाता है, जिनका स्कोर 51 था।

media r/LocalLLaMA · 9 दिन पहले · 3 बार देखा गया

284B कुल और 13B सक्रिय पैरामीटर के साथ ओपन वेट्स DeepSeek v4 flash कीमतों में कमी मजबूर करता है

Reddit पर घूम रहा एक अनुवादित मेम इंगित करता है कि प्रतिस्पर्धा के दबाव के कारण एक प्रतिद्वंद्वी को अपनी कीमतें 80% कम करनी पड़ीं। इस ओपन वेट्स मॉडल में 284 बिलियन कुल पैरामीटर और 13 बिलियन सक्रिय पैरामीटर हैं, जो श्रेष्ठ मूल्य-प्रदर्शन मापदंड प्रदान करते हैं।

media r/LocalLLaMA · 9 दिन पहले · 1 बार देखा गया

DeepSeek V4 Flash GA ने DeepSWE पर Sonnet 5 और Grok 4.5 के बराबर रैंक हासिल की

DeepSeek का दावा है कि इसका नया सामान्य रूप से उपलब्ध मॉडल, DeepSeek V4 Flash, DeepSWE बेंचमार्क पर Anthropic's Sonnet 5 और xAI's Grok 4.5 के साथ प्रदर्शन में समानता हासिल करता है।

media r/LocalLLaMA · 9 दिन पहले Artificial Analysis Intelligence Index · 50.0% · 2 बार देखा गया

ArtificialAnalysis इंडेक्स में DeepSeek V4-Flash ने 50 हासिल किए

नया DeepSeek V4-Flash मॉडल ArtificialAnalysis इंडेक्स पर 50 अंक प्राप्त करने में सफल रहा है। इस परिणाम के आधार पर यह GLM-5.2 और GPT-5.6 Luna से केवल एक अंक नीचे है।

media r/LocalLLaMA · 9 दिन पहले · 13 बार देखा गया

Terminal Bench और Toolathlon स्कोर में सुधार के साथ DeepSeek V4 Flash अपडेट

DeepSeek ने अपने V4 Flash मॉडल को अपडेट किया है, जिसने 2026-07-31 को एक नया संस्करण जारी किया जो पिछले प्रीव्यू की तुलना में महत्वपूर्ण प्रदर्शन लाभ दिखाता है। इस अपडेट में कई नए बेंचमार्क के लिए परिणाम पेश किए गए हैं और मौजूदा बेंचमार्क पर स्कोर में सुधार हुआ है।

media r/LocalLLaMA · 9 दिन पहले

Kimi K3 ने एक-शॉट HTML जनरेशन में Opus 4.8 को हरा दिया

एक उपयोगकर्ता ने Sonnet 4.6 का उपयोग करके 34 एक-शॉट प्रॉम्प्ट चलाकर और परिणामी HTML, स्क्रीनशॉट और GIF का मूल्यांकन करके Claude Opus 4.8 के खिलाफ Kimi K3 का मूल्यांकन किया। मूल्यांकन से पता चला कि Kimi K3 ने Opus 4.8 की तुलना में बेहतर परिणाम दिए।