Cognition выпускает SWE-2: на 64% дешевле Fable 5.1 при почти том же результате
Cognition launches new SWE-2 model, Rivaling Fable 5.1 and GPT-Astra

Cognition представила SWE-2 — свою самую продвинутую модель для программирования. Она достигает 50,0% на FrontierCode 1.1 Main, отставая от Fable 5.1 всего на один пункт, но обходясь на 64% дешевле. SWE-2 дообучена на Kimi K3 с 2,8 трлн параметров. Впервые RL масштабирован до мультитриллионного режима: единый прогон обучает все уровни усилий, а линейный штраф за стоимость настраивается по наклону кривой Парето. Модель уже доступна в Devin Desktop и CLI.
SWE-2 medium набирает больше баллов, чем SWE-1.7, совершая на 58% меньше шагов и обходясь в среднем на 81% дешевле.
- postalcoder
Если вы ищете повод для скепсиса, посмотрите на огромную разницу между Terminal Bench 2.1 (92.8%) и результатом Terminal Bench 4 (27.3%).
Terminal Bench 4 вышел пару недель назад, так что разницу между этими двумя оценками можно интерпретировать как «насколько хорошо эта модель обобщается на новые задачи»? Грубее говоря: «насколько эта модель заточена под бенчмарки?»
- gruez
Cognition — та же компания, которая несколько лет назад демонстрировала бота для программирования, якобы способного автономно выполнять задачи на Upwork, но при ближайшем рассмотрении он сходил с рельсов и даже не выполнял то, что просили?
https://www.youtube.com/watch?v=tNmgmwEtoWE
Как уже отмечали другие, это дообученная версия Kimi k3, которая и так довольно способная, так что всё не может быть настолько плохо, но любые заявленные улучшения производительности следует воспринимать с долей скепсиса.
- nullbio
Где характеристики модели? Это открытые веса? Если нет, почему я должен использовать это вместо DeepSeek Flash 4.1?
Я думаю, эти конкурирующие лаборатории должны понять, что никто не хочет ещё одного поставщика закрытых моделей... Мы даже недовольны теми двумя, что у нас есть сейчас, и их дни сочтены. Если DeepSeek 4.1 flash действительно так хорош, как показывают бенчмарки, вероятно, через месяц треть пользователей уйдёт от закрытых моделей в пользу чего-то, что они контролируют (или что дешевле).
Крупные лаборатории любят выпускать новую модель и квантовать её после первой недели. С грязно дешёвыми тарифами API на OpenRouter такой проблемы нет. DS 4.1 flash также быстрее, чем fast mode Astra. Подписочные тарифы OAI — хорошее соотношение цены и качества, но теперь эти новые открытые модели почти так же дешевы по тарифам API. Честно говоря, не могу дождаться дня, когда мы больше не будем зависеть от двух крупных лабораторий. Неудивительно, что сейчас столько страха нагнетают Anthropic и финансируемые ими НКО.
- captainregex
Я скептически настроен. Важен реальный опыт, а у меня нет никого (из магазина Devin), кто говорил бы о SWE что-то хорошее, кроме того, что это бесплатно. Надеюсь, я ошибаюсь и на этот раз всё не так плохо.
- TheJCDenton
> SWE-2 дообучена на основе Kimi K3
С одной стороны, я ожидал совершенно новую модель, с другой — это RL-обученная K3, достигающая возможностей Fable 5, что демонстрирует, что это, вероятно, возможно, и это приятно.
- pkilgore
Не уверен, что это имеет значение, когда Devin — самый стабильно дерьмовый продукт, которым я пользовался. И да, я попробовал снова, они зря потратили деньги на билборды.
- bobtheborg
SWE 1.6 был отличным для небольших задач. Очень быстрый и достаточно хороший. 1.7 для меня был непригоден. Тратил больше времени на размышления, чем GLM 5.2, и, казалось, в целом ходил по кругу. Я попробовал, но забросил.
Жду 2 — может, будет пригоден.
- mydreamof
Похоже на заточку под бенчмарки? Например, для Terminal-Bench 4 у него не очень хорошие результаты. И почему не показать другие бенчмарки?