विषय · Benchmark results
media Interconnects · अभी अभी लाइव

Z.ai ने GLM-5.3 को विस्तारित पोस्ट-ट्रेनिंग के साथ जारी किया

Z.ai ने GLM-5.3 की घोषणा की, एक नया मॉडल जो अपने GLM-5.2 बेस मॉडल के पोस्ट-ट्रेनिंग को बढ़ाकर एजेंटिक कोडिंग बेंचमार्क्स पर फ्रंटियर प्रदर्शन हासिल करता है। ~750B पैरामीटर वाला मॉडल वर्तमान में Kimi K3 से आगे है और विभिन्न बेंचमार्क्स पर Claude Fable 5 और GPT-5.6-Sol के बराबर या उससे अधिक है।

media Together AI Blog · 8 दिन पहले DeepSWE · 67.2% · 18 बार देखा गया

DeepSeek-V4 Flash 0731 बनाम GPT-5.6 Luna: DeepSWE पर लागत और कोडिंग

DeepSWE बेंचमार्क पर DeepSeek-V4 Flash 0731 और GPT-5.6 Luna की तुलना से पता चलता है कि जबकि GPT-5.6 Luna एक बेहतर इंजीनियर है, दोनों मॉडलों का उपयोग करने वाला कैस्केड रणनीति कम लागत में उच्च सटीकता प्रदान करती है।

media AI News (smol.ai) · 10 दिन पहले Terminal-Bench 2 · 67.4% · 21 बार देखा गया

अलibaba ने 2.4T पैरामीटर और आगामी ओपन वेट्स के साथ Qwen3.8-Max की घोषणा की

अलibaba ने अपने नए फ्लैगशिप मॉडल के रूप में Qwen3.8-Max की घोषणा की है, जिसे लंबे समय तक चलने वाले एजेंटिक कार्य, कोडिंग और बहुआयामी तर्क पर केंद्रित 2.4T-पैरामीटर स्पार्स आर्किटेक्चर के रूप में वर्णित किया गया है। कंपनी ने पुष्टि की कि Qwen3.8-Max के लिए ओपन वेट्स अगले सप्ताह ओपन-वेट Qwen3.8-27B वेरिएंट के साथ जारी किए जाएंगे।

media r/LocalLLaMA · 15 दिन पहले · 15 बार देखा गया

Terminal Bench और Toolathlon स्कोर में सुधार के साथ DeepSeek V4 Flash अपडेट

DeepSeek ने अपने V4 Flash मॉडल को अपडेट किया है, जिसने 2026-07-31 को एक नया संस्करण जारी किया जो पिछले प्रीव्यू की तुलना में महत्वपूर्ण प्रदर्शन लाभ दिखाता है। इस अपडेट में कई नए बेंचमार्क के लिए परिणाम पेश किए गए हैं और मौजूदा बेंचमार्क पर स्कोर में सुधार हुआ है।

media Together AI Blog · 19 दिन पहले DeepSWE · 72.7% · 14 बार देखा गया

Kimi K3 ने DeepSWE pass@4 पर GPT-5.6 Sol को हराया और लागत 64% कम की

DeepSWE बेंचमार्क पर Kimi K3 और GPT-5.6 Sol की तुलना से पता चलता है कि जबकि GPT-5.6 Sol सिंगल-शॉट गुणवत्ता में अग्रणी है (72.7% बनाम 68.5%), Kimi K3 कम लागत पर k > 1 के लिए उच्च pass@k स्कोर हासिल करता है।

media AI News (smol.ai) · 21 दिन पहले · 6 बार देखा गया

Anthropic ने Claude Opus 5 लॉन्च किया, जिसने बेंचमार्क विवाद को जन्म दिया

Anthropic ने Claude Opus 5 मॉडल लॉन्च किया है, जिसने कोडिंग और सामान्य क्षमता मेट्रिक्स पर इसके प्रदर्शन की जांच और फ्रंटियर मॉडल मूल्यांकन के बारे में फिर से बहस को बढ़ावा दिया।

media Latent Space · 21 दिन पहले · 4 बार देखा गया

Anthropic ने ECI 159 के साथ Claude Opus 5 लॉन्च किया

Anthropic ने Claude Opus 5 जारी किया है, एक नया फ्रंटियर मॉडल जिसने बेंचमार्क स्कोर और व्यावहारिक प्रदर्शन को लेकर महत्वपूर्ण चर्चा को जन्म दिया है। Epoch AI से स्वतंत्र मूल्यांकन ने नए मॉडल के लिए Epoch Capabilities Index (ECI) 159 और SWE-ECI 161 की रिपोर्ट की है।

media Together AI Blog · 21 दिन पहले · 8 बार देखा गया

एक-तिहाई लागत पर DeepSWE गुणवत्ता में Claude Fable 5 के बराबर Kimi K3

Moonshot AI से आया एक ओपन-वेइट मॉडल Kimi K3, DeepSWE बेंचमार्क पर Anthropic के Claude Fable 5 के तुलनीय प्रदर्शन प्राप्त करता है जबकि प्रति कार्य लागत काफी कम होती है। 16 जुलाई 2026 के मूल्यांकन में, Kimi K3 ने pass@1 में 68.5% हासिल किया, जबकि Fable 5 का स्कोर 69.9% था, लेकिन बहु-प्रयास परिदृश्यों में इसने बेहतर प्रदर्शन दिखाया और श्रेष्ठ लागत दक्षता प्रदान की।

arxiv τ²-bench (tau2-bench) · 23 दिन पहले · 3 बार देखा गया

τ-bench 1.0.1 ने सावधान एजेंट व्यवहार को दंडित करने से रोकने के लिए banking_knowledge ग्रेडिंग में सुधार किया है

सिएरा रिसर्च ने τ-bench 1.0.1 जारी किया, जो `banking_knowledge` कार्य के ग्रेडिंग योजना को ठीक करता है ताकि सावधान सत्यापन पढ़ाई के लिए एजेंटों को दंडित करना बंद हो जाए और कई डेटा असंगतियों को ठीक किया जाए। अपडेट यह सुनिश्चित करता है कि री-ग्रेडिंग लीडरबोर्ड ट्रैजेक्ट्री केवल स्कोर बढ़ाती है, बिना किसी पहले पास होने वाले सिमुलेशन को विफल किए।

media Interconnects · 25 दिन पहले · 4 बार देखा गया

Moonshot AI ने Kimi K3 जारी किया, एक 2.8T पैरामीटर MoE मॉडल

16 जुलाई को, Moonshot AI ने अपना नवीनतम फ्लैगशिप मॉडल, Kimi K3, जारी किया, जो 2.8 ट्रिलियन पैरामीटर वाले Mixture of Experts (MoE) आर्किटेक्चर है। कंपनी ने 27 जुलाई को मॉडल के वजन जारी करने का वादा किया है।

media AI News (smol.ai) · 28 दिन पहले · 6 बार देखा गया

मूनशॉट ने किमी K3 जारी किया, जो मजबूत कोडिंग और दक्षता वाला एक चीनी ओपन-वेट मॉडल है

मूनशॉट ने किमी K3 जारी किया है, एक ओपन-वेट मॉडल जिसने चीनी मॉडल्स के फ्रंटियर के कितने करीब हैं, इसकी पुनः समीक्षा को प्रेरित किया है। इस रिलीज़ की विशेषता कोडिंग, एजेंटिक टास्क और लंबे-अवधि ज्ञान कार्य में मजबूत प्रदर्शन है।

media Latent Space · 29 दिन पहले · 3 बार देखा गया

Moonshot AI ने 2.8T पैरामीटर वाले ओपन फ्रंटियर मॉडल Kimi K3 को लॉन्च किया

Moonshot AI ने Kimi K3, एक नया फ्रंटियर-क्लास ओपन-वेइट्स मॉडल पेश किया है जिसमें 2.8 ट्रिलियन कुल पैरामीटर और नेटिव मल्टीमोडल इनपुट क्षमताएं हैं। इसे आधिकारिक तौर पर "ओपन फ्रंटियर इंटेलिजेंस" के रूप में स्थित किया गया है, यह मॉडल 1 मिलियन-टोकन संदर्भ विंडो का समर्थन करता है और दक्षता को बढ़ाने के लिए Kimi Delta Attention (KDA) और Attention Residuals जैसे नवीन आर्किटेक्चरल घटकों का उपयोग करता है।

media AI News (smol.ai) · 29 दिन पहले · 4 बार देखा गया

मूनशॉट ने 2.8T पैरामीटर वाले ओपन-वेइट्स मॉडल किमी K3 को लॉन्च किया

मूनशॉट AI ने किमी K3 को लॉन्च किया है, जो 2.8 ट्रिलियन पैरामीटर और नेटिव मल्टीमोडल इनपुट के साथ एक फ्रंटियर-क्लास ओपन-वेइट्स मॉडल है। इस मॉडल में लंबे संदर्भों में तेज़ डिकोडिंग के लिए किमी डेल्टा एटेंशन (KDA) शामिल है और इसे लंबी अवधि के एजेंटिक कोडिंग वर्कफ़्लो के लिए स्थित किया गया है।

blog Simon Willison · 29 दिन पहले · 12 बार देखा गया

Moonshot AI ने उच्च मूल्य के साथ 2.8T पैरामीटर वाले मॉडल Kimi K3 की घोषणा की

चीनी एआई लैब Moonshot AI ने Kimi K3 की घोषणा की है, जिसे उन्होंने अपने अब तक के सबसे सक्षम मॉडल के रूप में वर्णित किया है जिसमें 2.8 ट्रिलियन पैरामीटर हैं। मॉडल वर्तमान में वेबसाइट और API के माध्यम से उपलब्ध है, और 27 जुलाई 2026 तक ओपन वेट रिलीज की गारंटी दी गई है।

lab Hugging Face Blog · 29 दिन पहले · 2 बार देखा गया

विशेषज्ञता के माध्यम से DharmaOCR ने ब्राज़ीलियन पुर्तगाली पर नए मॉडलों को पछाड़ दिया

DharmaOCR डोमेन-विशिष्ट प्रशिक्षण के माध्यम से ब्राज़ीलियन पुर्तगाली पर Mistral OCR4 और Unlimited-OCR की तुलना में उच्चतर निष्कर्षण गुणवत्ता और स्थिरता हासिल करता है।

media Latent Space · 15 घंटे पहले · 1 बार देखा गया

Gemini 3.7 Flash अपडेट GDM को फिर से प्रमुखता में लाता है

लेख Gemini 3.7 Flash अपडेट से एक चार्ट पर प्रकाश डालता है, जो दिखाता है कि पिछले संस्करण, विशेष रूप से 3.5 और 3.6 Flash, हाल के Claude 4.8+ और GPT 5.5+ श्रृंखला मॉडल के पीछे रह गए थे।

media r/LocalLLaMA · 15 घंटे पहले · 1 बार देखा गया

DeepSeek DSv4 Flash 0731 किफ़ायती हार्डवेयर पर उच्च प्रदर्शन प्राप्त करता है

एक Reddit उपयोगकर्ता ने DeepSeek DSv4 Flash 0731 मॉडल को हाइलाइट किया, इसकी लागूत के सापेक्ष इसके शक्तिशाली प्रदर्शन क्षमताओं पर ध्यान दिया। पोस्ट में दावे का समर्थन करने के लिए Artificial Analysis Intelligence Index v4.1.1 का हवाला दिया गया है कि मॉडल असाधारण रूप से अच्छा प्रदर्शन करता है।

arxiv arXiv cs.AI · 2 दिन पहले HealthBench · 51.9% · 4 बार देखा गया

VITA क्लिनिकल RAG HealthBench पर फ्रंटियर LLMs के बराबर या बेहतर प्रदर्शन करता है

VITA नामक एक विशेष रूप से बनाया गया रीट्रीवल-अगमेंटेड जनरेशन सिस्टम, जो कम और मध्यम आय वाले क्षेत्रों के लिए डिज़ाइन किया गया था, का HealthBench बेंचमार्क पर सामान्य उद्देश्य वाले बड़े भाषा मॉडल्स के साथ मूल्यांकन किया गया। अध्ययन दिखाता है कि कॉर्पस-विशिष्ट डिज़ाइन नए फ्रंटियर मॉडल्स जारी होने के बावजूद प्रतिस्पर्धी प्रदर्शन बनाए रख सकता है।