Kimi K3 ने AfterQuery के SpreadsheetBench 2 मूल्यांकन में शीर्ष स्थान प्राप्त किया है। इस परिणाम ने इसे इस विशिष्ट बेंचमार्क में Claude Fable 5 से आगे रख दिया है।
AfterQuery के SpreadsheetBench 2 पर Kimi K3 ने #1 स्थान हासिल किया, Claude Fable 5 को पार कर गया
Doctorina ने कृत्रिम पोलिश प्राथमिक स्वास्थ्य देखभाल निदान में चिकित्सकों को हरा दिया
एक अध्ययन ने 150 कृत्रिम पोलिश-भाषा प्राथमिक स्वास्थ्य देखभाल परामर्शों में क्लिनिकल AI सिस्टम Doctorina की तुलना आठ चिकित्सकों और चार स्वतंत्र फ्रंटियर भाषा मॉडलों से की।
Kimi K3 ने एक-शॉट HTML जनरेशन में Opus 4.8 को हरा दिया
एक उपयोगकर्ता ने Sonnet 4.6 का उपयोग करके 34 एक-शॉट प्रॉम्प्ट चलाकर और परिणामी HTML, स्क्रीनशॉट और GIF का मूल्यांकन करके Claude Opus 4.8 के खिलाफ Kimi K3 का मूल्यांकन किया। मूल्यांकन से पता चला कि Kimi K3 ने Opus 4.8 की तुलना में बेहतर परिणाम दिए।
एक-तिहाई लागत पर DeepSWE गुणवत्ता में Claude Fable 5 के बराबर Kimi K3
Moonshot AI से आया एक ओपन-वेइट मॉडल Kimi K3, DeepSWE बेंचमार्क पर Anthropic के Claude Fable 5 के तुलनीय प्रदर्शन प्राप्त करता है जबकि प्रति कार्य लागत काफी कम होती है। 16 जुलाई 2026 के मूल्यांकन में, Kimi K3 ने pass@1 में 68.5% हासिल किया, जबकि Fable 5 का स्कोर 69.9% था, लेकिन बहु-प्रयास परिदृश्यों में इसने बेहतर प्रदर्शन दिखाया और श्रेष्ठ लागत दक्षता प्रदान की।
Kimi K3 एजेंट एरिना पर ओपस के सोचने के स्तर के बराबर रैंक करता है
एजेंट एरिना लीडरबोर्ड के अनुसार, किमी K3 गैर-दृश्य कार्यों में ओपस के समान स्तर पर प्रदर्शन करता है। हालांकि कुछ उपयोगकर्ताओं ने नोट किया है कि ओपस को दृश्य क्षमताओं में फायदा हो सकता है, रैंकिंग अन्य उपयोग मामलों के लिए समानता को दर्शाती है।
Kimi K3 (max) ने Simple Bench पर Sonnet 5 को हराया
लेख में बताया गया है कि Kimi K3 (max), Simple Bench बेंचमार्क पर Sonnet 5 से बेहतर प्रदर्शन करता है।