Moonshot AI से आया एक ओपन-वेइट मॉडल Kimi K3, DeepSWE बेंचमार्क पर Anthropic के Claude Fable 5 के तुलनीय प्रदर्शन प्राप्त करता है जबकि प्रति कार्य लागत काफी कम होती है। 16 जुलाई 2026 के मूल्यांकन में, Kimi K3 ने pass@1 में 68.5% हासिल किया, जबकि Fable 5 का स्कोर 69.9% था, लेकिन बहु-प्रयास परिदृश्यों में इसने बेहतर प्रदर्शन दिखाया और श्रेष्ठ लागत दक्षता प्रदान की।
- Kimi K3 की लागत प्रति रोलआउट $4.65 है, जबकि Claude Fable 5 की लागत $13.41 है, जिससे प्रति डॉलर 2.8x अधिक कार्य हल किए जाते हैं।
- जबकि एकल-प्रयास विश्वसनीयता में Fable 5 आगे है (69.9% बनाम 68.5%), Kimi K3 pass@2 (82.0% बनाम 80.2%) और pass@4 (89.4% बनाम 88.5%) में जीतता है।
- Kimi K3 कार्यों के एक विस्तृत श्रेणी को कवर करता है, 107 अद्वितीय कार्यों की तुलना में 101 अद्वितीय कार्यों को हल करता है, और Go में मजबूत प्रदर्शन दिखाता है।
- मॉडल्स उच्च सहसंबंध (0.72) और समान विफलता पैटर्न प्रदर्शित करते हैं, जिसका अर्थ है कि वे साथ जोड़ने पर महत्वपूर्ण विविधता प्रदान नहीं करते हैं।
Kimi K3 को अपनी ओपन-वेइट प्रकृति और कम लागत के कारण उच्च-आयतन या पुनः-प्रयास-सहिष्णु एजेंट कार्य के लिए एक तार्किक डिफ़ॉल्ट के रूप में स्थापित किया गया है, हालांकि एकल-प्रयास विश्वसनीयता में Fable 5 की थोड़ी सी बढ़त है।