A Cognition lançou o SWE-2, seu modelo de codificação mais capaz até o momento, que foi pós-treinado com aprendizado por reforço a partir do modelo aberto de 2,8T parâmetros da Moonshot AI, o Kimi K3. O modelo obtém 50,0% no FrontierCode 1.1 Main, posicionando-se a um ponto de distância do Fable 5.1 enquanto opera com 64% menos custo.

  • O SWE-2 é o primeiro modelo da Cognition com níveis de esforço de raciocínio selecionáveis, todos treinados em uma única execução de RL usando penalidades de custo informadas por Pareto.
  • Ele alcança uma pontuação de 73,0% no DeepSWE 1.1 e 92,8% no Terminal-Bench 2.1, superando sua base Kimi K3 em todas as linhas.
  • O SWE-2 medium reduz o número de rodadas em 58% e os custos em 81% em comparação com o SWE-1.7 no FrontierCode, enquanto realiza sua primeira edição real após uma mediana de 18 passos, contra 48 da versão anterior.
  • O modelo não está disponível como pesos abertos ou via API independente; ele roda exclusivamente dentro do Devin Desktop, CLI e das próximas versões Web/Fusion.

O lançamento demonstra que escalar o RL para o regime de múltiplos trilhões de parâmetros permite à Cognition encontrar uma margem significativa de melhoria sobre o K3, adicionando 5 a 6 pontos em muitos benchmarks.