Cognition의 SWE-2, Terminal-Bench 2.1에서 92.8점 달성
Cognition's SWE-2 achieves 92.8 on Terminal-Bench 2.1

Cognition이 Kimi K3 기반에 자체 포스트트레이닝을 더한 SWE-2를 공개했다. MoE 구조로 총 2.8T 파라미터, 토큰당 104B가 활성화되며, Cognition이 처음으로 멀티트릴리언 파라미터 규모에서 RL을 확장한 모델이다. FrontierCode 1.1 Main 50.0, Terminal-Bench 2.1 92.8을 기록했지만 Terminal-Bench 4.0에서는 27.3으로 프론티어 모델에 크게 뒤진다. 가중치는 비공개이며 Devin Desktop과 CLI에서 사용 가능하다.
Terminal-Bench 4.0은 SWE-2의 약점으로, 27.3점은 Fable 5.1(55.8)과 GPT-6 Astra(57.9)에 크게 뒤처진다. 장기 호라이즌 에이전트 작업이 바로 프론티어와의 격차가 남아 있는 영역이다.
HN 토론
27- samusiam
이제 사실상 쓸모없는(즉, 포화되고 오염된) 벤치마크나 다름없다.
- forgot-my-pw
Terminal Bench 2/2.1은 거의 다 풀린 것 같으니, 그건 그렇게까지 깊게 볼 필요는 없을 듯? Terminal Bench 4 점수는 그저 그렇다.
그래도 꽤 인상적이긴 하다.
- captainregex
swe에 대한 내 개인적인 경험은… 그닥 좋지 않았다. 이 벤치마크들을 얼마나 믿어야 할지 잘 모르겠고, '아마 틀렸을지라도 일단 내뱉는' 스타일이라 좀 그렇지만, 뭐 공짜니까.