Cognition's SWE-2 erreicht 92,8 auf Terminal-Bench 2.1
Cognition's SWE-2 achieves 92.8 on Terminal-Bench 2.1

Cognition hat SWE-2 veröffentlicht, ein MoE-Modell mit 2,8 Billionen Parametern, das auf Kimi K3 aufbaut und erstmals RL im Billionenbereich skaliert. Es erzielt 92,8 auf Terminal-Bench 2.1 und 50,0 auf FrontierCode 1.1 – nur einen Punkt hinter Fable 5.1, aber zu 64 % geringeren Kosten. Schwachpunkt bleibt Terminal-Bench 4.0 mit 27,3. Die Gewichte sind proprietär, verfügbar in Devin Desktop und CLI.
Der Schwachpunkt ist Terminal-Bench 4.0, wo SWE-2 mit 27,3 deutlich hinter Fable 5.1 (55,8) und GPT-6 Astra (57,9) zurückliegt – langfristige agentische Arbeit ist der Bereich, in dem die Lücke zur Frontier noch besteht.
- samusiam
Was mittlerweile so ziemlich ein nutzloser (d. h. gesättigter, kontaminierter) Benchmark ist.
- forgot-my-pw
Terminal Bench 2/2.1 scheint fast gelöst zu sein, also sollten wir das wohl nicht zu genau betrachten? Ihr Terminal Bench 4 Score ist so lala.
Trotzdem ziemlich beeindruckend.
- captainregex
meine persönliche Erfahrung mit swe war … suboptimal. Ich bin mir nicht sicher, wie viel ich auf diese Benchmarks gebe, und es hat einen sehr „einfach rausplatzen, auch wenn es wahrscheinlich nicht stimmt“-Stil, aber hey, es ist kostenlos.