Cognition은 Moonshot AI의 2.8T 파라미터 오픈 모델인 Kimi K3를 강화학습으로 사후 학습한 가장 뛰어난 코딩 모델 SWE-2를 출시했습니다. 이 모델은 FrontierCode 1.1 Main에서 50.0%의 점수를 기록했으며, 비용은 64% 절감하면서 Fable 5.1과 단 한 점 차이로 경쟁하고 있습니다.

  • SWE-2는 파레토 기반 비용 패널티를 사용하여 단일 RL 실행으로 모든 추론 노력 수준을 학습한 Cognition의 첫 번째 모델입니다.
  • DeepSWE 1.1에서 73.0%, Terminal-Bench 2.1에서 92.8%의 점수를 기록하여 Kimi K3 베이스라인보다 모든 항목에서 우위를 점했습니다.
  • FrontierCode에서 SWE-2 medium은 SWE-1.7 대비 턴 수를 58%, 비용을 81% 절감했으며, 첫 번째 실제 수정까지 중앙값 기준 18단계가 걸린 반면 이전 버전은 48단계였습니다.
  • 이 모델은 오픈 가중치나 독립형 API로 제공되지 않으며, Devin Desktop, CLI 및 향후 출시될 Web/Fusion 버전에서만 실행됩니다.

이번 릴리스는 다중 조 단위 파라미터 규모에서 강화학습을 확장하는 것이 Cognition에게 K3 위에 상당한 여지를 제공하며, 많은 벤치마크에서 5~6점의 향상을 가져왔음을 보여줍니다.