Cognition 发布 SWE-2,挑战 Fable 5.1 与 GPT-Astra
Cognition launches new SWE-2 model, Rivaling Fable 5.1 and GPT-Astra

Cognition 团队推出了最新的 SWE-2 模型,在 FrontierCode 1.1 基准测试中取得 50.0% 的分数,性能逼近 Fable 5.1,但成本却降低了 64%。这是首次将强化学习(RL)扩展到万亿参数规模,通过创新的算法在单次训练中覆盖所有推理努力等级。SWE-2 基于 Kimi K3 进行后训练,在保持高性能的同时大幅提升了效率:中等努力等级下,它比 SWE-1.7 减少 58% 的操作步数,成本降低 81%。该模型展现出更强的工程判断力,能更精准地探索代码库,避免过度思考,并在测试覆盖和验证纪律上表现优异。SWE-2 现已在 Devin Desktop、CLI 及 Web 平台上线,标志着代码智能体在成本与性能帕累托前沿上的重大突破。
SWE-2 在 FrontierCode 1.1 基准测试中取得 50.0% 的分数,性能逼近 Fable 5.1,但成本却降低了 64%。
HN 评论区
172- postalcoder
如果你想找理由保持怀疑,看看 Terminal Bench 2.1(92.8%)和 Terminal Bench 4 分数(27.3%)之间巨大的落差就行了。
Terminal Bench 4 是几周前发布的,所以你看到的这两个分数之间的差异,可以解读为“这个模型对新问题的泛化能力如何?”。更直白地说:“这个模型被刷榜刷得有多严重?”
- gruez
Cognition 就是几年前演示过一个号称能自主完成 Upwork 任务的编程机器人,但仔细一看却发现它完全跑偏,连被要求做的事都没完成的同一家公司?
https://www.youtube.com/watch?v=tNmgmwEtoWE
正如其他人提到的,这是基于 Kimi k3 后训练的,而 Kimi k3 本身已经相当强大,所以它不可能太差,但任何声称的性能提升都应该打个折扣看待。
- nullbio
模型参数呢?这是开源权重的吗?如果不是,我为什么要用它而不是 DeepSeek Flash 4.1?
我觉得这些竞争的实验室需要意识到,没人想要另一个闭源权重模型提供商了……我们对现有的两个都不满意,它们的时日已屈指可数。如果 DeepSeek 4.1 flash 真的像它在基准测试中表现的那样好,我们可能离三分之一的用户转向更可控(或更便宜)的模型只有一个月的时间了。
大实验室喜欢发布新模型,然后在一周后才进行量化。使用 OpenRouter 上极其便宜的 API 费率就没有这个问题。DS 4.1 flash 也比 Astra 的快速模式更快。OAI 的订阅费率性价比不错,但现在这些新的开源权重模型在 API 使用费率上也几乎一样便宜。我真心期待不再受制于两大实验室的那一天。难怪目前 Anthropic 及其资助的 NGO 正在大肆制造恐慌。
- pkilgore
不确定这是否重要,因为 Devin 是我用过的最 consistently 烂的产品。是的,我又试了一次,他们把钱浪费在了广告牌上。
- TheJCDenton
> SWE-2 是基于 Kimi K3 后训练的
一方面,我本来期待一个全新的模型;另一方面,这是一个经过 RL 强化、具备 Fable 5 能力的 K3,这证明了这种可能性,这挺好的。
- mydreamof
看起来像是刷榜?比如在 Terminal-Bench 4 上结果就不太好。为什么不展示其他基准测试呢?
- bobtheborg
SWE 1.6 对于小任务很棒。速度很快,也够用了。1.7 对我来说完全没法用。思考时间比 GLM 5.2 还长,而且看起来总是在原地打转。我试过了,但放弃了。
期待 2.0 版本——也许这次能用了。
- captainregex
我持怀疑态度。实际使用体验才是最重要的,我生活中没人(Devin 商店)对 SWE 说好话,除了说它是免费的。希望我错了,这次没那么糟。