Cognition telah merilis SWE-2, model pemrograman paling mampunya hingga saat ini, yang dipasca-pelatihan dengan pembelajaran penguatan dari model terbuka 2,8T-parameter Moonshot AI, Kimi K3. Model ini mencetak skor 50,0% pada FrontierCode 1.1 Main, menempatkannya dalam jarak satu poin dari Fable 5.1 sambil beroperasi dengan biaya 64% lebih rendah.

  • SWE-2 adalah model pertama Cognition dengan tingkat upaya penalaran yang dapat dipilih, semuanya dilatih dalam satu run RL menggunakan penalti biaya berbasis Pareto.
  • Model ini mencapai skor 73,0% pada DeepSWE 1.1 dan 92,8% pada Terminal-Bench 2.1, mengalahkan basis Kimi K3-nya di setiap baris.
  • SWE-2 medium mengurangi jumlah putaran sebesar 58% dan biaya sebesar 81% dibandingkan dengan SWE-1.7 pada FrontierCode, sambil melakukan suntingan nyata pertamanya setelah median 18 langkah versus 48 untuk versi sebelumnya.
  • Model ini tidak tersedia sebagai bobot terbuka atau melalui API mandiri; model ini hanya berjalan di dalam Devin Desktop, CLI, dan versi Web/Fusion yang akan datang.

Rilis ini menunjukkan bahwa penskalaan RL ke rezim multi-triliun-parameter memungkinkan Cognition menemukan ruang gerak substansial di atas K3, menambah 5 hingga 6 poin pada banyak benchmark.