Kimi K3 ने arena.ai पर नए FullStack लीडरबोर्ड में शीर्ष स्थान हासिल किया है।
मॉडल ने इस हाल ही में पेश किए गए बेंचमार्क में शीर्ष स्थान प्राप्त किया।
Kimi K3 ने arena.ai पर नए FullStack लीडरबोर्ड में शीर्ष स्थान हासिल किया है।
मॉडल ने इस हाल ही में पेश किए गए बेंचमार्क में शीर्ष स्थान प्राप्त किया।
एक उपयोगकर्ता ने Sonnet 4.6 का उपयोग करके 34 एक-शॉट प्रॉम्प्ट चलाकर और परिणामी HTML, स्क्रीनशॉट और GIF का मूल्यांकन करके Claude Opus 4.8 के खिलाफ Kimi K3 का मूल्यांकन किया। मूल्यांकन से पता चला कि Kimi K3 ने Opus 4.8 की तुलना में बेहतर परिणाम दिए।
DeepSWE बेंचमार्क पर Kimi K3 और GPT-5.6 Sol की तुलना से पता चलता है कि जबकि GPT-5.6 Sol सिंगल-शॉट गुणवत्ता में अग्रणी है (72.7% बनाम 68.5%), Kimi K3 कम लागत पर k > 1 के लिए उच्च pass@k स्कोर हासिल करता है।
Moonshot AI से आया एक ओपन-वेइट मॉडल Kimi K3, DeepSWE बेंचमार्क पर Anthropic के Claude Fable 5 के तुलनीय प्रदर्शन प्राप्त करता है जबकि प्रति कार्य लागत काफी कम होती है। 16 जुलाई 2026 के मूल्यांकन में, Kimi K3 ने pass@1 में 68.5% हासिल किया, जबकि Fable 5 का स्कोर 69.9% था, लेकिन बहु-प्रयास परिदृश्यों में इसने बेहतर प्रदर्शन दिखाया और श्रेष्ठ लागत दक्षता प्रदान की।
Artificial Analysis के अनुसार, Kimi-K3 का रिलीज़ खुले-स्रोत और बंद-स्रोत AI फ्रंटियर्स के बीच समय अंतराल को केवल 1.5 महीने तक कम कर दिया है।
एजेंट एरिना लीडरबोर्ड के अनुसार, किमी K3 गैर-दृश्य कार्यों में ओपस के समान स्तर पर प्रदर्शन करता है। हालांकि कुछ उपयोगकर्ताओं ने नोट किया है कि ओपस को दृश्य क्षमताओं में फायदा हो सकता है, रैंकिंग अन्य उपयोग मामलों के लिए समानता को दर्शाती है।
हम ट्रैफ़िक मापने और साइट को बेहतर बनाने के लिए कुकीज़ का उपयोग करते हैं। आप एनालिटिक्स कुकीज़ स्वीकार या अस्वीकार कर सकते हैं। गोपनीयता नीति