CognitionのSWE-2、Fable 5.1に1ポイント差で64%安いコーディングモデルを実現
Cognition launches new SWE-2 model, Rivaling Fable 5.1 and GPT-Astra

Cognitionが新モデルSWE-2を発表した。FrontierCode 1.1 Mainで50.0%を記録し、Fable 5.1に1ポイント差まで迫りながらコストは64%削減。Kimi K3をベースに、マルチ兆パラメータ規模のRLを初めて適用し、全推論努力レベルを単一実行で訓練する新アルゴリズムを導入。SWE-1.7比で58%少ないターン数、81%低コストで高い性能を実現している。
SWE-2 mediumはSWE-1.7よりも高いスコアを出しながら、ターン数は58%少なく、平均コストは81%削減されている。
HNでの議論
150- postalcoder
懐疑的になる理由を探しているなら、Terminal Bench 2.1(92.8%)とTerminal Bench 4のスコア(27.3%)の間にある巨大な差を見ればいい。
Terminal Bench 4は数週間前にリリースされたばかりなので、この2つのスコアの差は「このモデルが新しい問題にどれだけ汎化できるか」と解釈できる。もっと露骨に言えば「このモデルはどれだけベンチマックスされているか」だ。
- gruez
Cognition、つまり数年前にUpworkのタスクを自律的に完了できると謳ったコーディングボットをデモしたが、よく調べると制御不能で、要求されたことすら完了できていなかったあの会社か?
https://www.youtube.com/watch?v=tNmgmwEtoWE
他の人も言及しているように、これはKimi k3からポストトレーニングされたもので、すでにかなり有能なので、それほど悪いはずはないが、主張されているパフォーマンスの向上は割り引いて聞くべきだ。
- nullbio
モデルの統計はどこだ?これはオープンウェイトか?そうでなければ、なぜDeepSeek Flash 4.1ではなくこれを使うんだ?
競合する研究所は、誰ももう一つのクローズドウェイトモデルプロバイダーを望んでいないことに気づくべきだと思う…我々は現在の2つにも満足していないし、彼らの時代は完全に終わりに近づいている。DeepSeek 4.1 flashがベンチマーク通りに本当に優れているなら、おそらく1ヶ月以内にユーザーの3分の1がクローズドウェイトモデルから、よりコントロールできる(あるいはより安価な)ものへと移行するだろう。
大手研究所は新しいモデルをリリースし、最初の週が過ぎると量子化するのが大好きだ。OpenRouterで激安のAPIレートを使えばそんな問題はない。DS 4.1 flashはfast mode Astraよりも速い。OAIのサブスクリプション料金は良い価値だが、今やこれらの新しいオープンウェイトモデルはAPI使用料金でほぼ同じくらい安い。正直、もう二大研究所に縛られない日が待ちきれない。今、Anthropicとその資金提供を受けたNGOからこれほど恐怖を煽る動きがあるのも不思議ではない。
- captainregex
私は懐疑的だ。結局大事なのは実際に使った経験で、私の周りには(Devinショップで)SWEについて無料だということ以外に良いことを言う人はいない。間違っていてほしいし、今回はそれほど悪くないことを願う。
- TheJCDenton
> SWE-2はKimi K3からポストトレーニングされている
一方で完全に新しいモデルを期待していたが、他方ではRLを施したK3がFable 5の能力に到達したということで、これがおそらく可能であることを示しており、それは良いことだ。
- pkilgore
Devinが私が使った中で最も一貫してクソな製品であることを考えると、関係あるかどうかわからない。そう、また試したよ、彼らは看板に金を無駄にした。
- bobtheborg
SWE 1.6は小さなタスクには素晴らしかった。非常に速く、十分だった。1.7は私には使えなかった。GLM 5.2よりも考えるのに時間がかかり、概して堂々巡りしているようだった。試したが放棄した。
2に期待している——使えるようになるかもしれない。
- mydreamof
ベンチマックスしているように見える?例えばTerminal-Bench 4では良い結果が出ていない。それに他のベンチマークをなぜ見せない?