Cognition ने SWE-2 जारी किया है, जो आज तक इसका सबसे सक्षम कोडिंग मॉडल है, जिसका Moonshot AI के 2.8T-पैरामीटर वाले ओपन मॉडल Kimi K3 से पुनर्बल सीखने (reinforcement learning) के साथ पोस्ट-ट्रेनिंग की गई है। FrontierCode 1.1 Main पर मॉडल ने 50.0% स्कोर हासिल किया, जो इसे Fable 5.1 से केवल एक अंक पीछे रखता है, जबकि लागत 64% कम है।
- SWE-2 Cognition का पहला मॉडल है जिसमें चयन योग्य तर्क-प्रयास स्तर हैं, जिन्हें पेरेटो-सूचित लागत दंडों के साथ एक ही RL रन में प्रशिक्षित किया गया था।
- DeepSWE 1.1 पर इसने 73.0% और Terminal-Bench 2.1 पर 92.8% स्कोर हासिल किया, जिसने हर पंक्ति में अपने Kimi K3 बेस को हरा दिया।
- FrontierCode पर SWE-1.7 की तुलना में SWE-2 मीडियम ने टर्न को 58% और लागत को 81% कम कर दिया, जबकि पहले वास्तविक एडिट करने में मध्यक (median) 18 चरण लगे, जबकि पिछले संस्करण में 48 चरण लगे थे।
- यह मॉडल ओपन वेट्स या स्टैंडअलोन API के रूप में उपलब्ध नहीं है; यह केवल Devin Desktop, CLI और आगामी Web/Fusion संस्करणों के अंदर चलता है।
इस रिलीज से यह प्रदर्शित होता है कि बहु-ट्रिलियन-पैरामीटर क्षेत्र में RL को स्केलिंग करने से Cognition को K3 के ऊपर काफी हद तक सुधार का अवसर मिलता है, जिससे कई बेंचमार्क पर 5 से 6 अंक की वृद्धि होती है।