Cognition's SWE-2 erreicht 92,8 auf Terminal-Bench 2.1

Cognition's SWE-2 achieves 92.8 on Terminal-Bench 2.1

Cognition's SWE-2 erreicht 92,8 auf Terminal-Bench 2.1

Cognition hat SWE-2 veröffentlicht, ein MoE-Modell mit 2,8 Billionen Parametern, das auf Kimi K3 aufbaut und erstmals RL im Billionenbereich skaliert. Es erzielt 92,8 auf Terminal-Bench 2.1 und 50,0 auf FrontierCode 1.1 – nur einen Punkt hinter Fable 5.1, aber zu 64 % geringeren Kosten. Schwachpunkt bleibt Terminal-Bench 4.0 mit 27,3. Die Gewichte sind proprietär, verfügbar in Devin Desktop und CLI.

Der Schwachpunkt ist Terminal-Bench 4.0, wo SWE-2 mit 27,3 deutlich hinter Fable 5.1 (55,8) und GPT-6 Astra (57,9) zurückliegt – langfristige agentische Arbeit ist der Bereich, in dem die Lücke zur Frontier noch besteht.
  1. samusiam

    Was mittlerweile so ziemlich ein nutzloser (d. h. gesättigter, kontaminierter) Benchmark ist.

  2. forgot-my-pw

    Terminal Bench 2/2.1 scheint fast gelöst zu sein, also sollten wir das wohl nicht zu genau betrachten? Ihr Terminal Bench 4 Score ist so lala.

    Trotzdem ziemlich beeindruckend.

  3. captainregex

    meine persönliche Erfahrung mit swe war … suboptimal. Ich bin mir nicht sicher, wie viel ich auf diese Benchmarks gebe, und es hat einen sehr „einfach rausplatzen, auch wenn es wahrscheinlich nicht stimmt“-Stil, aber hey, es ist kostenlos.

Mehr von diesem Tag

2026-09-10