DeepSWE बेंचमार्क पर Kimi K3 और GPT-5.6 Sol की तुलना से पता चलता है कि जबकि GPT-5.6 Sol सिंगल-शॉट गुणवत्ता में अग्रणी है (72.7% बनाम 68.5%), Kimi K3 कम लागत पर k > 1 के लिए उच्च pass@k स्कोर हासिल करता है।
- Kimi K3 pass@2 (82.0% बनाम 81.0%) और pass@4 (89.4% बनाम 85.8%) में जीतता है, किसी भी फ्लैगशिप-स्तरीय कॉन्फ़िगरेशन का सर्वश्रेष्ठ pass@4 हासिल करता है।
- Kimi K3 की लागत रोलआउट प्रति $4.65 है, जबकि GPT-5.6 Sol की लागत $8.37 है, जो डॉलर प्रति 2.8x अधिक कार्य हल करता है।
- मॉडल काफी भिन्न हैं (0.46 सहसंबंध) और अलग-अलग विफल होते हैं, जिससे Sol में एस्केलेशन के साथ एक Kimi-फर्स्ट कैस्केड 113 कार्यों में से 108 को कवर करने की अनुमति देता है।
- GPT-5.6 Sol अधिक विश्वसनीय है, चारों बार 61 कार्यों को हल करता है जबकि Kimi K3 के 45 हैं, लेकिन रोलआउट प्रति अधिक समय लेता है (17 मिनट बनाम 66 मिनट)।
दोनों मॉडलों के बीच राउटिंग एक मजबूत व्यावहारिक समाधान प्रदान करती है, जिसमें Kimi-फर्स्ट कैस्केड लगभग 85.6% सटीकता प्राप्त करता है और GPT-5.6 Sol का अकेले उपयोग करने की तुलना में सस्ता होता है।