CognitionのSWE-2、Fable 5.1に1ポイント差で64%安いコーディングモデルを実現

Cognition launches new SWE-2 model, Rivaling Fable 5.1 and GPT-Astra

CognitionのSWE-2、Fable 5.1に1ポイント差で64%安いコーディングモデルを実現

Cognitionが新モデルSWE-2を発表した。FrontierCode 1.1 Mainで50.0%を記録し、Fable 5.1に1ポイント差まで迫りながらコストは64%削減。Kimi K3をベースに、マルチ兆パラメータ規模のRLを初めて適用し、全推論努力レベルを単一実行で訓練する新アルゴリズムを導入。SWE-1.7比で58%少ないターン数、81%低コストで高い性能を実現している。

SWE-2 mediumはSWE-1.7よりも高いスコアを出しながら、ターン数は58%少なく、平均コストは81%削減されている。
  1. postalcoder

    懐疑的になる理由を探しているなら、Terminal Bench 2.1(92.8%)とTerminal Bench 4のスコア(27.3%)の間にある巨大な差を見ればいい。

    Terminal Bench 4は数週間前にリリースされたばかりなので、この2つのスコアの差は「このモデルが新しい問題にどれだけ汎化できるか」と解釈できる。もっと露骨に言えば「このモデルはどれだけベンチマックスされているか」だ。

  2. gruez

    Cognition、つまり数年前にUpworkのタスクを自律的に完了できると謳ったコーディングボットをデモしたが、よく調べると制御不能で、要求されたことすら完了できていなかったあの会社か?

    https://www.youtube.com/watch?v=tNmgmwEtoWE

    他の人も言及しているように、これはKimi k3からポストトレーニングされたもので、すでにかなり有能なので、それほど悪いはずはないが、主張されているパフォーマンスの向上は割り引いて聞くべきだ。

  3. nullbio

    モデルの統計はどこだ?これはオープンウェイトか?そうでなければ、なぜDeepSeek Flash 4.1ではなくこれを使うんだ?

    競合する研究所は、誰ももう一つのクローズドウェイトモデルプロバイダーを望んでいないことに気づくべきだと思う…我々は現在の2つにも満足していないし、彼らの時代は完全に終わりに近づいている。DeepSeek 4.1 flashがベンチマーク通りに本当に優れているなら、おそらく1ヶ月以内にユーザーの3分の1がクローズドウェイトモデルから、よりコントロールできる(あるいはより安価な)ものへと移行するだろう。

    大手研究所は新しいモデルをリリースし、最初の週が過ぎると量子化するのが大好きだ。OpenRouterで激安のAPIレートを使えばそんな問題はない。DS 4.1 flashはfast mode Astraよりも速い。OAIのサブスクリプション料金は良い価値だが、今やこれらの新しいオープンウェイトモデルはAPI使用料金でほぼ同じくらい安い。正直、もう二大研究所に縛られない日が待ちきれない。今、Anthropicとその資金提供を受けたNGOからこれほど恐怖を煽る動きがあるのも不思議ではない。

  4. captainregex

    私は懐疑的だ。結局大事なのは実際に使った経験で、私の周りには(Devinショップで)SWEについて無料だということ以外に良いことを言う人はいない。間違っていてほしいし、今回はそれほど悪くないことを願う。

  5. TheJCDenton

    > SWE-2はKimi K3からポストトレーニングされている

    一方で完全に新しいモデルを期待していたが、他方ではRLを施したK3がFable 5の能力に到達したということで、これがおそらく可能であることを示しており、それは良いことだ。

  6. pkilgore

    Devinが私が使った中で最も一貫してクソな製品であることを考えると、関係あるかどうかわからない。そう、また試したよ、彼らは看板に金を無駄にした。

  7. bobtheborg

    SWE 1.6は小さなタスクには素晴らしかった。非常に速く、十分だった。1.7は私には使えなかった。GLM 5.2よりも考えるのに時間がかかり、概して堂々巡りしているようだった。試したが放棄した。

    2に期待している——使えるようになるかもしれない。

  8. mydreamof

    ベンチマックスしているように見える?例えばTerminal-Bench 4では良い結果が出ていない。それに他のベンチマークをなぜ見せない?

この日のほかの記事

2026-09-10