Cognition выпустила SWE-2, свою самую мощную модель для программирования на сегодняшний день, которая прошла постобучение методом подкрепления от открытой модели Moonshot AI с 2.8 триллиона параметров — Kimi K3. Модель набрала 50.0% в FrontierCode 1.1 Main, что всего на один балл меньше, чем у Fable 5.1, при этом затраты оказались на 64% ниже.

  • SWE-2 — первая модель Cognition с настраиваемыми уровнями усилий на рассуждение, все они обучены в ходе одного запуска RL с использованием штрафов за стоимость, основанных на анализе Парето.
  • Она набрала 73.0% в DeepSWE 1.1 и 92.8% в Terminal-Bench 2.1, превзойдя свою базовую модель Kimi K3 по всем показателям.
  • SWE-2 medium сокращает количество шагов на 58% и затраты на 81% по сравнению с SWE-1.7 в FrontierCode, при этом совершая первое реальное редактирование после медианных 18 шагов против 48 у предыдущей версии.
  • Модель недоступна в виде открытых весов или через отдельный API; она работает исключительно внутри Devin Desktop, CLI и forthcoming версий Web/Fusion.

Выпуск демонстрирует, что масштабирование RL до режима с многотриллионными параметрами позволяет Cognition найти значительный запас прочности поверх K3, добавляя 5–6 баллов во многих бенчмарках.