동찰 Beating AI 속보, Coding Agent Devin의 모회사 Cognition이 새로운 프로그래밍 모델 SWE-2를 발표했다. 이는 월지암면의 2.8T 파라미터 Kimi K3를 기반으로 직접 강화학습을 계속 진행한 것으로, 추가 훈련 후 여러 프로그래밍 평가에서 약 5~6%포인트 더 향상되었다.
Cognition 자체의 FrontierCode 1.1 Main에서 SWE-2는 50.0%를 기록하며 GPT-5.6 Sol의 47.5%와 Grok 4.6의 48.0%를 넘어섰다. Fable 5.1의 50.9%와는 불과 0.9%포인트 차이지만 비용은 64% 낮다. GPT-6 Astra는 53.3%를 기록했으며, SWE-2는 이와 3.3%포인트 차이이고 비용은 약 4분의 1 수준이다.
SWE-2는 이전 세대보다 시행착오도 훨씬 적다. 중간 추론 강도에서 작업 완료에 필요한 상호작용 라운드가 58% 줄었고 평균 비용은 81% 감소했다. 다만 더 어려운 Terminal-Bench 4에서는 SWE-2가 27.3%에 그쳐 Astra의 57.9%와 Fable 5.1의 55.8%보다 현저히 낮아, 아직 프런티어 모델을 전면적으로 따라잡았다고는 할 수 없다.
SWE-2는 이미 Devin Desktop과 CLI에 출시되었으며 Devin Web과 Fusion에도 순차적으로 적용되고 있다.