Cognition stellt SWE-2 vor: 50 % auf FrontierCode, 64 % günstiger als Fable 5.1

Cognition launches new SWE-2 model, Rivaling Fable 5.1 and GPT-Astra

Cognition stellt SWE-2 vor: 50 % auf FrontierCode, 64 % günstiger als Fable 5.1

Cognition hat SWE-2 veröffentlicht, ein Coding-Modell, das auf FrontierCode 1.1 Main 50,0 % erreicht – nur einen Punkt hinter Fable 5.1, aber 64 % kostengünstiger. Basierend auf Kimi K3 mit 2,8 Billionen Parametern skalierte das Team RL erstmals auf Billionen-Parameter und trainierte alle Effizienzstufen in einem Durchlauf. SWE-2 ist ab sofort in Devin Desktop und CLI verfügbar.

Auf FrontierCode 1.1 Main erreicht SWE-2 medium eine höhere Punktzahl als SWE-1.7, benötigt dabei 58 % weniger Turns und kostet im Durchschnitt 81 % weniger.
  1. postalcoder

    Wenn du einen Grund zur Skepsis suchst, brauchst du nicht weiter zu schauen als das massive Delta zwischen dem Terminal Bench 2.1 (92,8 %) und dem Terminal Bench 4 Score (27,3 %).

    Terminal Bench 4 wurde vor ein paar Wochen veröffentlicht, also kann man den Unterschied zwischen den beiden Scores interpretieren als "wie gut generalisiert dieses Modell auf neue Probleme"? Etwas platter gesagt: "Wie benchmaxxt ist dieses Modell?"

  2. gruez

    Cognition, dieselbe Firma, die vor ein paar Jahren einen Coding-Bot vorgeführt hat, der angeblich autonom Upwork-Aufgaben erledigen konnte, aber bei genauerem Hinsehen aus dem Ruder lief und nicht einmal das erledigte, was verlangt war?

    https://www.youtube.com/watch?v=tNmgmwEtoWE

    Wie andere schon erwähnt haben, ist das ein post-trainiertes Modell auf Basis von Kimi k3, das ohnehin schon ziemlich fähig ist, also kann es nicht so schlecht sein, aber alle behaupteten Leistungsverbesserungen sollte man mit Vorsicht genießen.

  3. nullbio

    Wo sind die Modell-Statistiken? Ist das Open-Weights? Wenn nicht, warum sollte ich das statt DeepSeek Flash 4.1 nutzen?

    Ich denke, diese konkurrierenden Labs müssen begreifen, dass niemand einen weiteren Closed-Weight-Modellanbieter will... Wir sind mit den zwei, die wir gerade haben, nicht einmal zufrieden, und ihre Tage sind komplett gezählt. Wenn DeepSeek 4.1 Flash wirklich so gut ist, wie es in den Benchmarks abschneidet, sind wir wahrscheinlich einen Monat davon entfernt, dass ein Drittel der Nutzer von den Closed-Weight-Modellen zu etwas wechselt, über das sie mehr Kontrolle haben (oder das billiger ist).

    Die großen Labs lieben es, ihr neues Modell zu veröffentlichen und es nach der ersten Woche zu quantisieren. Dieses Problem hast du nicht, wenn du supergünstige API-Raten auf OpenRouter nutzt. DS 4.1 Flash ist außerdem schneller als der Fast Mode von Astra. OAIs Abo-Preise sind ein gutes Angebot, aber jetzt sind diese neuen Open-Weight-Modelle bei den API-Nutzungsraten fast genauso günstig. Ich kann ehrlich gesagt den Tag kaum erwarten, an dem wir nicht mehr den zwei großen Labs ausgeliefert sind. Kein Wunder, dass gerade so viel Angstmache von Anthropic und ihren finanzierten NGOs betrieben wird.

  4. captainregex

    Ich bin skeptisch. Gelebte Erfahrung ist, was zählt, und ich habe niemanden in meinem Umfeld (Devin-Shop), der Gutes über SWE sagt, außer dass es kostenlos ist. Hoffe, ich irre mich und es ist diesmal nicht so schlimm

  5. TheJCDenton

    > SWE-2 ist post-trainiert aus Kimi K3

    Einerseits hätte ich ein komplett neues Modell erwartet, andererseits ist es ein RL-tes K3, das Fable-5-Fähigkeiten erreicht, was zeigt, dass das wohl möglich ist, was schön ist.

  6. pkilgore

    Nicht sicher, ob es eine Rolle spielt, wenn Devin das mit Abstand durchgängig beschissenste Produkt ist, das ich je benutzt habe. Und ja, ich habe es erneut versucht, sie haben das Geld für die Billboards verschwendet.

  7. bobtheborg

    SWE 1.6 war großartig für kleine Aufgaben. Sehr schnell und gut genug. 1.7 war für mich unbrauchbar. Brauchte mehr Zeit zum Nachdenken als GLM 5.2 und schien generell im Kreis zu laufen. Ich habe es ausprobiert, aber wieder aufgegeben.

    Freue mich auf 2 – vielleicht ist es dann brauchbar

  8. mydreamof

    Sieht nach Benchmaxxing aus? Zum Beispiel bei Terminal-Bench 4 hat es keine großartigen Ergebnisse. Und warum nicht auch andere Benchmarks zeigen?

Mehr von diesem Tag

2026-09-10