Cognition ha lanzado SWE-2, su modelo de codificación más capaz hasta la fecha, que se ha post-entrenado con aprendizaje por refuerzo a partir del modelo abierto de 2.8T parámetros de Moonshot AI, Kimi K3. El modelo obtiene un 50.0% en FrontierCode 1.1 Main, situándose a un punto de Fable 5.1 mientras opera con un coste un 64% menor.
- SWE-2 es el primer modelo de Cognition con niveles de esfuerzo de razonamiento seleccionables, todos entrenados en una única ejecución de RL utilizando penalizaciones de coste informadas por Pareto.
- Alcanza una puntuación del 73.0% en DeepSWE 1.1 y del 92.8% en Terminal-Bench 2.1, superando a su base Kimi K3 en cada fila.
- SWE-2 medium reduce el número de turnos un 58% y los costes un 81% en comparación con SWE-1.7 en FrontierCode, mientras realiza su primera edición real tras una mediana de 18 pasos frente a los 48 de la versión anterior.
- El modelo no está disponible como pesos abiertos ni mediante API independiente; se ejecuta exclusivamente dentro de Devin Desktop, CLI y las próximas versiones Web/Fusion.
El lanzamiento demuestra que escalar el RL al régimen de múltiples billones de parámetros permite a Cognition encontrar un margen sustancial sobre K3, añadiendo entre 5 y 6 puntos en muchos benchmarks.