أطلقت Cognition SWE-2، وهو أكثر نماذج البرمجة قدرةً حتى الآن، وقد خضع لتدريب لاحق باستخدام التعزيز من التعلم المعزز (RL) المستمد من النموذج المفتوح ذي 2.8 تريليون معلمة الخاص بـ Moonshot AI، والمسمى Kimi K3. حقق النموذج نتيجة بنسبة 50.0% على FrontierCode 1.1 Main، مما يضعه ضمن نقطة واحدة من Fable 5.1 مع تشغيل بتكلفة أقل بنسبة 64%.
- SWE-2 هو أول نموذج لـ Cognition بمستويات جهد استدلال قابلة للاختيار، وقد تم تدريب جميعها في عملية تعزيز واحدة (RL) باستخدام عقوبات تكلفة مستنيرة بمنحنى باريتو.
- يحقق نتيجة بنسبة 73.0% على DeepSWE 1.1 و92.8% على Terminal-Bench 2.1، متفوقاً على أساسه Kimi K3 في كل الصفوف.
- يقلل SWE-2 متوسط عدد المراحل بنسبة 58% والتكاليف بنسبة 81% مقارنة بـ SWE-1.7 على FrontierCode، بينما يقوم بتحريره الحقيقي الأول بعد وسيط 18 خطوة مقابل 48 للنسخة السابقة.
- النموذج غير متاح كأوزان مفتوحة أو عبر واجهة برمجة تطبيقات (API) مستقلة؛ بل يعمل حصرياً داخل Devin Desktop وCLI والنسخ القادمة من Web/Fusion.
تُظهر الإصدار أن توسيع نطاق التعلم المعزز إلى نظام متعدد التريليونات من المعاملات يسمح لـ Cognition بإيجاد هامش كبير إضافي فوق K3، مما يضيف من 5 إلى 6 نقاط على العديد من معايير التقييم.