Cognition, SWE-2로 Fable 5.1에 1점 차 추격…비용은 64% 저렴
Cognition launches new SWE-2 model, Rivaling Fable 5.1 and GPT-Astra

Cognition이 새로운 코딩 모델 SWE-2를 공개했다. FrontierCode 1.1 Main에서 50.0%를 기록해 Fable 5.1(50.9%)에 1점 차로 따라붙었고, 비용은 64% 저렴하다. 2.8T 파라미터 Kimi K3를 기반으로 강화학습을 확장해 모든 추론 노력 수준을 한 번에 훈련하는 알고리즘을 적용, 파레토 프런티어를 밀어 올렸다. Devin Desktop과 CLI에서 오늘부터 사용 가능하다.
SWE-2 medium은 SWE-1.7보다 높은 점수를 기록하면서도 평균 58% 적은 턴과 81% 적은 비용을 사용한다.
HN 토론
142- postalcoder
회의적인 시각을 갖고 싶다면, Terminal Bench 2.1(92.8%)과 Terminal Bench 4 점수(27.3%) 사이의 엄청난 격차를 보면 된다.
Terminal Bench 4는 몇 주 전에 공개됐으니, 두 점수 사이의 차이는 "이 모델이 새로운 문제에 얼마나 잘 일반화되는가"로 해석할 수 있다. 더 노골적으로 말하자면: "이 모델이 벤치마크에 얼마나 과적합됐는가?"
- gruez
Cognition, 몇 년 전에 upwork 작업을 자율적으로 완수할 수 있다고 주장하는 코딩 봇을 시연했지만, 자세히 살펴보니 제대로 돌아가지도 않았고 요청받은 것조차 완수하지 못했던 바로 그 회사?
https://www.youtube.com/watch?v=tNmgmwEtoWE
다른 사람들이 언급했듯이 이건 이미 상당히 유능한 Kimi k3를 사후 학습한 것이므로 그렇게 나쁠 수는 없겠지만, 성능 향상 주장은 약간 걸러서 들어야 한다.
- nullbio
모델 통계는 어디 있나? 이거 오픈 웨이트인가? 아니라면 왜 내가 DeepSeek Flash 4.1 대신 이걸 써야 하나?
경쟁하는 연구소들은 아무도 또 다른 클로즈드 웨이트 모델 제공자를 원하지 않는다는 걸 깨달아야 한다고 본다... 우리는 지금 있는 두 곳조차 만족스럽지 않고, 그들의 날은 완전히 다 끝나가고 있다. DeepSeek 4.1 flash가 정말 벤치마크만큼 좋다면, 아마 한 달 안에 사용자의 1/3이 클로즈드 웨이트 모델을 버리고 더 통제 가능한(혹은 더 저렴한) 무언가로 옮겨갈 것이다.
큰 연구소들은 새 모델을 공개하고 첫 주가 지나면 양자화하는 걸 좋아한다. OpenRouter에서 아주 저렴한 API 요금을 쓰면 그런 문제는 없다. DS 4.1 flash는 fast mode Astra보다도 빠르다. OAI의 구독 요금제는 가성비가 좋지만, 이제 이런 새로운 오픈 웨이트 모델들은 API 사용 요금이 거의 비슷할 정도로 싸다. 두 거대 연구소에 더 이상 얽매이지 않을 날이 정말 기다려진다. Anthropic과 그들이 자금을 대는 NGO들이 요즘 이렇게 공포 마케팅을 하는 것도 이해가 간다.
- captainregex
나는 회의적이다. 결국 중요한 건 실제 경험이고, 내 주변에(Devin을 쓰는 곳에서) SWE에 대해 무료라는 것 외에 좋은 말을 하는 사람이 없다. 내가 틀렸으면 좋겠고 이번에는 그렇게 나쁘지 않기를 바란다.
- TheJCDenton
> SWE-2는 Kimi K3를 사후 학습한 것이다
한편으로는 완전히 새로운 모델일 거라 기대했는데, 다른 한편으로는 K3를 RL해서 Fable 5 수준의 성능을 낸다는 건 이런 게 아마 가능하다는 걸 보여주는 것이니 좋은 일이다.
- pkilgore
Devin이 내가 써본 제품 중 가장 일관되게 형편없는 제품인데 그게 무슨 상관이 있을지 모르겠다. 그리고 그래, 다시 써봤다. 그들은 광고판에 돈을 낭비했다.
- bobtheborg
SWE 1.6은 작은 작업에는 훌륭했다. 매우 빠르고 충분히 좋았다. 1.7은 나에게 쓸 수 없는 수준이었다. GLM 5.2보다 생각하는 데 시간이 더 걸렸고 대체로 맴돌기만 하는 것 같았다. 써봤지만 포기했다.
2가 기대된다 -- 어쩌면 쓸 만할지도
- mydreamof
벤치마킹용으로 만든 것 같다? 예를 들어 Terminal-Bench 4에서는 좋은 결과가 없다. 그리고 왜 다른 벤치마크는 보여주지 않나?