लेख में बताया गया है कि Kimi K3 (max), Simple Bench बेंचमार्क पर Sonnet 5 से बेहतर प्रदर्शन करता है।
- इस विशिष्ट मूल्यांकन पर Kimi K3 (max) ने Sonnet 5 की तुलना में उच्च स्कोर हासिल किया है।
लेख में बताया गया है कि Kimi K3 (max), Simple Bench बेंचमार्क पर Sonnet 5 से बेहतर प्रदर्शन करता है।
एक अध्ययन ने 150 कृत्रिम पोलिश-भाषा प्राथमिक स्वास्थ्य देखभाल परामर्शों में क्लिनिकल AI सिस्टम Doctorina की तुलना आठ चिकित्सकों और चार स्वतंत्र फ्रंटियर भाषा मॉडलों से की।
एक उपयोगकर्ता ने Sonnet 4.6 का उपयोग करके 34 एक-शॉट प्रॉम्प्ट चलाकर और परिणामी HTML, स्क्रीनशॉट और GIF का मूल्यांकन करके Claude Opus 4.8 के खिलाफ Kimi K3 का मूल्यांकन किया। मूल्यांकन से पता चला कि Kimi K3 ने Opus 4.8 की तुलना में बेहतर परिणाम दिए।
Moonshot AI से आया एक ओपन-वेइट मॉडल Kimi K3, DeepSWE बेंचमार्क पर Anthropic के Claude Fable 5 के तुलनीय प्रदर्शन प्राप्त करता है जबकि प्रति कार्य लागत काफी कम होती है। 16 जुलाई 2026 के मूल्यांकन में, Kimi K3 ने pass@1 में 68.5% हासिल किया, जबकि Fable 5 का स्कोर 69.9% था, लेकिन बहु-प्रयास परिदृश्यों में इसने बेहतर प्रदर्शन दिखाया और श्रेष्ठ लागत दक्षता प्रदान की।
एजेंट एरिना लीडरबोर्ड के अनुसार, किमी K3 गैर-दृश्य कार्यों में ओपस के समान स्तर पर प्रदर्शन करता है। हालांकि कुछ उपयोगकर्ताओं ने नोट किया है कि ओपस को दृश्य क्षमताओं में फायदा हो सकता है, रैंकिंग अन्य उपयोग मामलों के लिए समानता को दर्शाती है।
Kimi K3 ने AfterQuery के SpreadsheetBench 2 मूल्यांकन में शीर्ष स्थान प्राप्त किया है। इस परिणाम ने इसे इस विशिष्ट बेंचमार्क में Claude Fable 5 से आगे रख दिया है।
हम ट्रैफ़िक मापने और साइट को बेहतर बनाने के लिए कुकीज़ का उपयोग करते हैं। आप एनालिटिक्स कुकीज़ स्वीकार या अस्वीकार कर सकते हैं। गोपनीयता नीति