ARC-AGI-3 पर GPT-5.6 के स्कोर तीन गुने हुए दो API सेटिंग्स से
GPT-5.6 के लिए दो विशिष्ट API सेटिंग्स सक्षम करने से ARC-AGI-3 बेंचमार्क पर इसके प्रदर्शन स्कोर तीन गुना हो गए।
GPT-5.6 के लिए दो विशिष्ट API सेटिंग्स सक्षम करने से ARC-AGI-3 बेंचमार्क पर इसके प्रदर्शन स्कोर तीन गुना हो गए।
Z.ai ने GLM-5.3 की घोषणा की, एक नया मॉडल जो अपने GLM-5.2 बेस मॉडल के पोस्ट-ट्रेनिंग को बढ़ाकर एजेंटिक कोडिंग बेंचमार्क्स पर फ्रंटियर प्रदर्शन हासिल करता है। ~750B पैरामीटर वाला मॉडल वर्तमान में Kimi K3 से आगे है और विभिन्न बेंचमार्क्स पर Claude Fable 5 और GPT-5.6-Sol के बराबर या उससे अधिक है।
DeepSWE बेंचमार्क पर DeepSeek-V4 Flash 0731 और GPT-5.6 Luna की तुलना से पता चलता है कि जबकि GPT-5.6 Luna एक बेहतर इंजीनियर है, दोनों मॉडलों का उपयोग करने वाला कैस्केड रणनीति कम लागत में उच्च सटीकता प्रदान करती है।
अलibaba ने अपने नए फ्लैगशिप मॉडल के रूप में Qwen3.8-Max की घोषणा की है, जिसे लंबे समय तक चलने वाले एजेंटिक कार्य, कोडिंग और बहुआयामी तर्क पर केंद्रित 2.4T-पैरामीटर स्पार्स आर्किटेक्चर के रूप में वर्णित किया गया है। कंपनी ने पुष्टि की कि Qwen3.8-Max के लिए ओपन वेट्स अगले सप्ताह ओपन-वेट Qwen3.8-27B वेरिएंट के साथ जारी किए जाएंगे।
DeepSeek ने अपने V4 Flash मॉडल को अपडेट किया है, जिसने 2026-07-31 को एक नया संस्करण जारी किया जो पिछले प्रीव्यू की तुलना में महत्वपूर्ण प्रदर्शन लाभ दिखाता है। इस अपडेट में कई नए बेंचमार्क के लिए परिणाम पेश किए गए हैं और मौजूदा बेंचमार्क पर स्कोर में सुधार हुआ है।
DeepSWE बेंचमार्क पर Kimi K3 और GPT-5.6 Sol की तुलना से पता चलता है कि जबकि GPT-5.6 Sol सिंगल-शॉट गुणवत्ता में अग्रणी है (72.7% बनाम 68.5%), Kimi K3 कम लागत पर k > 1 के लिए उच्च pass@k स्कोर हासिल करता है।
Anthropic ने Claude Opus 5 मॉडल लॉन्च किया है, जिसने कोडिंग और सामान्य क्षमता मेट्रिक्स पर इसके प्रदर्शन की जांच और फ्रंटियर मॉडल मूल्यांकन के बारे में फिर से बहस को बढ़ावा दिया।
Anthropic ने Claude Opus 5 जारी किया है, एक नया फ्रंटियर मॉडल जिसने बेंचमार्क स्कोर और व्यावहारिक प्रदर्शन को लेकर महत्वपूर्ण चर्चा को जन्म दिया है। Epoch AI से स्वतंत्र मूल्यांकन ने नए मॉडल के लिए Epoch Capabilities Index (ECI) 159 और SWE-ECI 161 की रिपोर्ट की है।
Moonshot AI से आया एक ओपन-वेइट मॉडल Kimi K3, DeepSWE बेंचमार्क पर Anthropic के Claude Fable 5 के तुलनीय प्रदर्शन प्राप्त करता है जबकि प्रति कार्य लागत काफी कम होती है। 16 जुलाई 2026 के मूल्यांकन में, Kimi K3 ने pass@1 में 68.5% हासिल किया, जबकि Fable 5 का स्कोर 69.9% था, लेकिन बहु-प्रयास परिदृश्यों में इसने बेहतर प्रदर्शन दिखाया और श्रेष्ठ लागत दक्षता प्रदान की।
सिएरा रिसर्च ने τ-bench 1.0.1 जारी किया, जो `banking_knowledge` कार्य के ग्रेडिंग योजना को ठीक करता है ताकि सावधान सत्यापन पढ़ाई के लिए एजेंटों को दंडित करना बंद हो जाए और कई डेटा असंगतियों को ठीक किया जाए। अपडेट यह सुनिश्चित करता है कि री-ग्रेडिंग लीडरबोर्ड ट्रैजेक्ट्री केवल स्कोर बढ़ाती है, बिना किसी पहले पास होने वाले सिमुलेशन को विफल किए।
16 जुलाई को, Moonshot AI ने अपना नवीनतम फ्लैगशिप मॉडल, Kimi K3, जारी किया, जो 2.8 ट्रिलियन पैरामीटर वाले Mixture of Experts (MoE) आर्किटेक्चर है। कंपनी ने 27 जुलाई को मॉडल के वजन जारी करने का वादा किया है।
मूनशॉट ने किमी K3 जारी किया है, एक ओपन-वेट मॉडल जिसने चीनी मॉडल्स के फ्रंटियर के कितने करीब हैं, इसकी पुनः समीक्षा को प्रेरित किया है। इस रिलीज़ की विशेषता कोडिंग, एजेंटिक टास्क और लंबे-अवधि ज्ञान कार्य में मजबूत प्रदर्शन है।
Moonshot AI ने Kimi K3, एक नया फ्रंटियर-क्लास ओपन-वेइट्स मॉडल पेश किया है जिसमें 2.8 ट्रिलियन कुल पैरामीटर और नेटिव मल्टीमोडल इनपुट क्षमताएं हैं। इसे आधिकारिक तौर पर "ओपन फ्रंटियर इंटेलिजेंस" के रूप में स्थित किया गया है, यह मॉडल 1 मिलियन-टोकन संदर्भ विंडो का समर्थन करता है और दक्षता को बढ़ाने के लिए Kimi Delta Attention (KDA) और Attention Residuals जैसे नवीन आर्किटेक्चरल घटकों का उपयोग करता है।
मूनशॉट AI ने किमी K3 को लॉन्च किया है, जो 2.8 ट्रिलियन पैरामीटर और नेटिव मल्टीमोडल इनपुट के साथ एक फ्रंटियर-क्लास ओपन-वेइट्स मॉडल है। इस मॉडल में लंबे संदर्भों में तेज़ डिकोडिंग के लिए किमी डेल्टा एटेंशन (KDA) शामिल है और इसे लंबी अवधि के एजेंटिक कोडिंग वर्कफ़्लो के लिए स्थित किया गया है।
चीनी एआई लैब Moonshot AI ने Kimi K3 की घोषणा की है, जिसे उन्होंने अपने अब तक के सबसे सक्षम मॉडल के रूप में वर्णित किया है जिसमें 2.8 ट्रिलियन पैरामीटर हैं। मॉडल वर्तमान में वेबसाइट और API के माध्यम से उपलब्ध है, और 27 जुलाई 2026 तक ओपन वेट रिलीज की गारंटी दी गई है।
DharmaOCR डोमेन-विशिष्ट प्रशिक्षण के माध्यम से ब्राज़ीलियन पुर्तगाली पर Mistral OCR4 और Unlimited-OCR की तुलना में उच्चतर निष्कर्षण गुणवत्ता और स्थिरता हासिल करता है।
Qwen ने Qwen3.8-27B मॉडल जारी किया है, जो ModelScope और Hugging Face पर डाउनलोड के लिए उपलब्ध है।
लेख Gemini 3.7 Flash अपडेट से एक चार्ट पर प्रकाश डालता है, जो दिखाता है कि पिछले संस्करण, विशेष रूप से 3.5 और 3.6 Flash, हाल के Claude 4.8+ और GPT 5.5+ श्रृंखला मॉडल के पीछे रह गए थे।
एक Reddit उपयोगकर्ता ने DeepSeek DSv4 Flash 0731 मॉडल को हाइलाइट किया, इसकी लागूत के सापेक्ष इसके शक्तिशाली प्रदर्शन क्षमताओं पर ध्यान दिया। पोस्ट में दावे का समर्थन करने के लिए Artificial Analysis Intelligence Index v4.1.1 का हवाला दिया गया है कि मॉडल असाधारण रूप से अच्छा प्रदर्शन करता है।
VITA नामक एक विशेष रूप से बनाया गया रीट्रीवल-अगमेंटेड जनरेशन सिस्टम, जो कम और मध्यम आय वाले क्षेत्रों के लिए डिज़ाइन किया गया था, का HealthBench बेंचमार्क पर सामान्य उद्देश्य वाले बड़े भाषा मॉडल्स के साथ मूल्यांकन किया गया। अध्ययन दिखाता है कि कॉर्पस-विशिष्ट डिज़ाइन नए फ्रंटियर मॉडल्स जारी होने के बावजूद प्रतिस्पर्धी प्रदर्शन बनाए रख सकता है।