Cognition的SWE-2在Terminal-Bench 2.1获92.8分
Cognition's SWE-2 achieves 92.8 on Terminal-Bench 2.1

Cognition推出了基于Kimi K3基座微调的SWE-2模型,在Terminal-Bench 2.1基准测试中取得了92.8的领先分数。这款拥有2.8万亿总参数的MoE模型,通过强化学习在代理编程领域实现了显著突破。相比前代SWE-1.7,SWE-2在保持性能的同时,将平均运行步骤从127步大幅降低至53步,首次编辑的中位步骤也缩短至18步。尽管在长程任务Terminal-Bench 4.0上仍有差距,但其在FrontierCode 1.1上的表现已逼近Claude Fable 5.1和GPT-6 Astra,且声称成本降低了64%。目前该模型仅通过Devin Desktop和CLI提供服务,未开放权重下载。
SWE-2在Terminal-Bench 2.1上取得了92.8分,这是已发布表格中的最高分数。
HN 评论区
25- forgot-my-pw
Terminal Bench 2/2.1 看起来几乎已经被攻克了,所以我们大概不该太看重这个分数?他们在 Terminal Bench 4 上的得分也就那样。
不过还是很 impressive。
- samusiam
这基本上已经是一个毫无用处(即饱和、污染)的基准测试了。
- captainregex
我个人使用 SWE 的体验……不太理想。我不太确定该在多大程度上相信这些基准测试,它有一种“不管对不对先脱口而出”的风格,但嘿,反正免费。