CognitionのSWE-2がTerminal-Bench 2.1で92.8を達成
Cognition's SWE-2 achieves 92.8 on Terminal-Bench 2.1

CognitionはKimi K3をベースに事後学習したSWE-2を発表。2.8TパラメータのMoEモデルで、FrontierCode 1.1 Mainで50.0、Terminal-Bench 2.1で92.8を記録し、Fable 5.1やGPT-6 Astraに迫る性能を主張。一方、長期的なエージェント作業を測るTerminal-Bench 4.0では27.3と後れを取る。重みは非公開で、Devin DesktopとCLIで利用可能。
Terminal-Bench 2.1は公開表の中で最高の数字だ。弱点はTerminal-Bench 4.0で、SWE-2の27.3はFable 5.1(55.8)とGPT-6 Astra(57.9)に大差で及ばない——長期的なエージェント作業こそが、フロンティアとのギャップがまだ残る領域である。
HNでの議論
27- samusiam
これは今やほぼ無意味な(つまり飽和して汚染された)ベンチマークだ。
- forgot-my-pw
Terminal Bench 2/2.1はほぼ解決済みに見えるから、そこまで真剣に評価すべきではないのかも?彼らのTerminal Bench 4のスコアはまあまあだ。
それでもかなり印象的ではあるけどね。
- captainregex
SWEに関する個人的な経験は…最適とは言い難い。これらのベンチマークをどこまで信じていいのか分からないし、「おそらく間違っているとしてもとにかく口に出して言う」というスタイルがとても強い。でもまあ、無料だからね。