ARC-AGI पर DeepSeek V4 Flash 0731 के परिणाम
लेख में DeepSeek V4 Flash 0731 मॉडल के लिए ARC-AGI बेंचमार्क परिणाम प्रस्तुत किए गए हैं। यह ARC Prize संगठन द्वारा होस्ट की गई आधिकारिक परिणाम पृष्ठ से लिंक करता है।
लेख में DeepSeek V4 Flash 0731 मॉडल के लिए ARC-AGI बेंचमार्क परिणाम प्रस्तुत किए गए हैं। यह ARC Prize संगठन द्वारा होस्ट की गई आधिकारिक परिणाम पृष्ठ से लिंक करता है।
DeepSeek ने DeepSeek-V4-Flash-0731 जारी किया है, जो अपने छोटे "Flash" मॉडल का एक अपडेटेड संस्करण है जो स्वतंत्र बेंचमार्क पर बड़े DeepSeek-V4-Pro से बेहतर प्रदर्शन करता है। इस रिलीज में मूल Mixture-of-Experts आर्किटेक्चर को 284 अरब कुल पैरामीटर के साथ बनाए रखते हुए एक नया फाइन-ट्यूनिंग प्रक्रिया का उपयोग किया गया है।
DeepSWE बेंचमार्क पर DeepSeek-V4 Flash 0731 और GPT-5.6 Luna की तुलना से पता चलता है कि जबकि GPT-5.6 Luna एक बेहतर इंजीनियर है, दोनों मॉडलों का उपयोग करने वाला कैस्केड रणनीति कम लागत में उच्च सटीकता प्रदान करती है।
कृत्रिम विश्लेषण ने अपने एजेंटिक इंडेक्स को अपडेट किया है और क्वेन 3.8 मैक्स को सर्वश्रेष्ठ समग्र मॉडल के रूप में रैंक किया है, इसे ओपस 5 से आगे रखते हुए।
लेखकों ने पहचाना कि SciCode बेंचमार्क पर स्कोर में रुकावट का कारण मॉडल क्षमता की सीमाएं नहीं, बल्कि मूल्यांकन उपकरण में महत्वपूर्ण त्रुटियां हैं। 65 परीक्षण समस्याओं के एक क्षेत्र विशेषज्ञ द्वारा किए गए ऑडिट में 263 त्रुटियां पाई गईं, जिनमें से 192 ने गैर-पुनरुत्पादित स्वर्ग उत्तरों और अत्यधिक कठोर सहिष्णुता जैसे मुद्दों के कारण सही समाधानों को गलत तरीके से अस्वीकार कर दिया।
अलibaba ने अपने नए फ्लैगशिप मॉडल के रूप में Qwen3.8-Max की घोषणा की है, जिसे लंबे समय तक चलने वाले एजेंटिक कार्य, कोडिंग और बहुआयामी तर्क पर केंद्रित 2.4T-पैरामीटर स्पार्स आर्किटेक्चर के रूप में वर्णित किया गया है। कंपनी ने पुष्टि की कि Qwen3.8-Max के लिए ओपन वेट्स अगले सप्ताह ओपन-वेट Qwen3.8-27B वेरिएंट के साथ जारी किए जाएंगे।
Qwen 3.8 Max ने Debate Benchmark में 1588 का स्कोर प्राप्त किया, जिसने Qwen 3.7 Max के 1462 के स्कोर को बेहतर बनाया। यह बेंचमार्क इस बात का मूल्यांकन करता है कि विभिन्न विषयों पर प्रतिद्वंद्वी, बहु-चरण वाली विरोधता के तहत बड़े भाषा मॉडल कितनी अच्छे से तर्क को बनाए रखते हैं।
कठिन एजेंटिक कार्यों पर ओपन-वेट मॉडल के आंतरिक मूल्यांकन ने पाया कि DeepSeek v4 flash अपने समकक्षों में सबसे तेज़ और सस्ता विकल्प है। इस परीक्षण में कई अनुप्रयोगों में लंबे समय तक चलने वाले वर्कफ़्लो शामिल थे, जिनका मूल्यांकन पूर्ण सफलता की आवश्यकता वाले निर्धारक जाँच द्वारा किया गया था।
Qwen3.8-Max (2.4T) एक नया ओपन-वेट मॉडल है जो सभी बेंचमार्क श्रेणियों में Kimi K3 और DeepSeek V4 Flash के करीब प्रदर्शन करता है, जबकि कोडिंग और सॉफ़्टवेयर कार्यों में बेहतर प्रदर्शन दिखाता है।
Qwen 3.8-Mx जारी किया गया है और वर्तमान में Claude Fable 5 Max के पीछे Vision Arena लीडरबोर्ड में #2 स्थान पर है।
लेख में घोषणा की गई है कि DeepSeek-V4-Flash-0731 मॉडल ने एक शतरंज बेंचमार्क पर Fable-5, Sol और Kimi-K3 को पछाड़ दिया है।
लेवेंट बुलुट ने तुर्की कथा संकलन के लिए मशीन-जनित टिप्पणियों की विश्वसनीयता का मूल्यांकन करने वाले तीन अध्ययनों वाला एक बेंचमार्क प्रकाशित किया, जिसमें स्वचालित रेटर्स और मानव निर्णय के बीच महत्वपूर्ण असंगतियां सामने आईं। इस अध्ययन ने नियम-आधारित डिटेक्टरों और Gemini 2.5 Flash, Grok, ChatGPT 5.5, और Claude Fable 5 High जैसे मॉडल का उपयोग करके 120 और 100 दृश्यों में छह द्विआधारी कला विशेषताओं का परीक्षण किया।
DeepSeek-V4-Flash-0731 मॉडल ने 50 का इंटेलिजेंस इंडेक्स स्कोर प्राप्त किया है, जो मार्च 2026 के शीर्ष फ्रंटियर मॉडल्स के प्रदर्शन से मेल खाता है, जिनका स्कोर 51 था।
Reddit पर घूम रहा एक अनुवादित मेम इंगित करता है कि प्रतिस्पर्धा के दबाव के कारण एक प्रतिद्वंद्वी को अपनी कीमतें 80% कम करनी पड़ीं। इस ओपन वेट्स मॉडल में 284 बिलियन कुल पैरामीटर और 13 बिलियन सक्रिय पैरामीटर हैं, जो श्रेष्ठ मूल्य-प्रदर्शन मापदंड प्रदान करते हैं।
DeepSeek का दावा है कि इसका नया सामान्य रूप से उपलब्ध मॉडल, DeepSeek V4 Flash, DeepSWE बेंचमार्क पर Anthropic's Sonnet 5 और xAI's Grok 4.5 के साथ प्रदर्शन में समानता हासिल करता है।
DeepSeek-V4-Flash-0731 मॉडल अब विभिन्न बेंचमार्क परीक्षणों में DeepSeek-V4-Pro-Preview से काफी बेहतर प्रदर्शन कर रहा है।
नया DeepSeek V4-Flash मॉडल ArtificialAnalysis इंडेक्स पर 50 अंक प्राप्त करने में सफल रहा है। इस परिणाम के आधार पर यह GLM-5.2 और GPT-5.6 Luna से केवल एक अंक नीचे है।
DeepSeek-V4-Flash-0731 मॉडल अपने पूर्ववर्ती के समान मूल्य बनाए रखते हुए GLM 5.2 से बेहतर प्रदर्शन करता है।
DeepSeek ने अपने V4 Flash मॉडल को अपडेट किया है, जिसने 2026-07-31 को एक नया संस्करण जारी किया जो पिछले प्रीव्यू की तुलना में महत्वपूर्ण प्रदर्शन लाभ दिखाता है। इस अपडेट में कई नए बेंचमार्क के लिए परिणाम पेश किए गए हैं और मौजूदा बेंचमार्क पर स्कोर में सुधार हुआ है।
एक उपयोगकर्ता ने Sonnet 4.6 का उपयोग करके 34 एक-शॉट प्रॉम्प्ट चलाकर और परिणामी HTML, स्क्रीनशॉट और GIF का मूल्यांकन करके Claude Opus 4.8 के खिलाफ Kimi K3 का मूल्यांकन किया। मूल्यांकन से पता चला कि Kimi K3 ने Opus 4.8 की तुलना में बेहतर परिणाम दिए।