Cognition a publié SWE-2, son modèle de codage le plus performant à ce jour, qui a été post-entraîné par apprentissage par renforcement à partir du modèle ouvert Kimi K3 de Moonshot AI, comptant 2,8 billions de paramètres. Le modèle obtient un score de 50,0 % sur FrontierCode 1.1 Main, le plaçant à un point de Fable 5.1 tout en fonctionnant avec des coûts réduits de 64 %.

  • SWE-2 est le premier modèle de Cognition doté de niveaux d'effort de raisonnement sélectionnables, tous entraînés lors d'une seule exécution RL utilisant des pénalités de coût informées par la courbe de Pareto.
  • Il atteint un score de 73,0 % sur DeepSWE 1.1 et de 92,8 % sur Terminal-Bench 2.1, battant son modèle de base Kimi K3 sur chaque ligne.
  • SWE-2 medium réduit le nombre de tours de 58 % et les coûts de 81 % par rapport à SWE-1.7 sur FrontierCode, tout en effectuant sa première modification réelle après une médiane de 18 étapes contre 48 pour la version précédente.
  • Le modèle n'est pas disponible sous forme de poids ouverts ni via une API autonome ; il s'exécute exclusivement dans Devin Desktop, CLI et les futures versions Web/Fusion.

La publication démontre que l'extension du RL au régime multi-billions de paramètres permet à Cognition de trouver une marge de progression substantielle sur K3, ajoutant 5 à 6 points sur de nombreux benchmarks.