Cognition发布了SWE-2,这是其迄今为止最强大的编码模型,该模型在Moonshot AI的2.8T参数开源模型Kimi K3的基础上通过强化学习进行了后训练。该模型在FrontierCode 1.1 Main上得分50.0%,仅比Fable 5.1低一分,同时成本降低了64%。
- SWE-2是Cognition首款具有可选推理强度级别的模型,所有级别均使用帕累托 informed 成本惩罚在一次RL训练中完成。
- 它在DeepSWE 1.1上得分73.0%,在Terminal-Bench 2.1上得分92.8%,在每一行指标上都超越了其Kimi K3基座模型。
- 与SWE-1.7相比,SWE-2 medium在FrontierCode上将回合数减少了58%,成本降低了81%,同时首次进行实际编辑的中位步数为18步,而上一版本为48步。
- 该模型未以开源权重或独立API形式提供;它仅在Devin Desktop、CLI以及即将推出的Web/Fusion版本中运行。
此次发布表明,将RL扩展到万亿参数规模使Cognition能够在K3之上找到显著的提升空间,在多个基准测试中增加了5到6分。