Cognition выпустила SWE-2: 92.8 на Terminal-Bench 2.1, но провал на Terminal-Bench 4.0
Cognition's SWE-2 achieves 92.8 on Terminal-Bench 2.1

Cognition представила SWE-2 — модель на базе Kimi K3 с 2.8T параметров (MoE, 104B активных), дообученную с RL в триллионном масштабе. Она набирает 92.8 на Terminal-Bench 2.1 и 50.0 на FrontierCode 1.1, отставая от Claude Fable 5.1 и GPT-6 Astra всего на 1–3 балла при заявленной цене на 64% ниже. Однако на Terminal-Bench 4.0 результат скромный — 27.3 против 55.8 и 57.9 у конкурентов. Веса закрыты, доступ только через Devin Desktop и CLI.
Слабое место — Terminal-Bench 4.0, где 27.3 у SWE-2 сильно отстаёт от Fable 5.1 (55.8) и GPT-6 Astra (57.9): долгосрочная агентная работа — это то место, где разрыв с фронтиром всё ещё живёт.
- samusiam
Что сейчас практически бесполезный (то есть насыщенный, загрязнённый) бенчмарк.
- forgot-my-pw
Terminal Bench 2/2.1, похоже, почти решён, так что, наверное, не стоит слишком к нему присматриваться? Их результат на Terminal Bench 4 так себе.
Всё равно довольно впечатляюще, хотя.
- captainregex
мой личный опыт с swe был… неоптимальным. Не уверен, насколько я верю этим бенчмаркам, и у него очень стиль «просто ляпнуть, даже если, вероятно, неправильно», но эй, это бесплатно.