Cognition的SWE-2在Terminal-Bench 2.1获92.8分

Cognition's SWE-2 achieves 92.8 on Terminal-Bench 2.1

Cognition的SWE-2在Terminal-Bench 2.1获92.8分

Cognition推出了基于Kimi K3基座微调的SWE-2模型,在Terminal-Bench 2.1基准测试中取得了92.8的领先分数。这款拥有2.8万亿总参数的MoE模型,通过强化学习在代理编程领域实现了显著突破。相比前代SWE-1.7,SWE-2在保持性能的同时,将平均运行步骤从127步大幅降低至53步,首次编辑的中位步骤也缩短至18步。尽管在长程任务Terminal-Bench 4.0上仍有差距,但其在FrontierCode 1.1上的表现已逼近Claude Fable 5.1和GPT-6 Astra,且声称成本降低了64%。目前该模型仅通过Devin Desktop和CLI提供服务,未开放权重下载。

SWE-2在Terminal-Bench 2.1上取得了92.8分,这是已发布表格中的最高分数。
  1. forgot-my-pw

    Terminal Bench 2/2.1 看起来几乎已经被攻克了,所以我们大概不该太看重这个分数?他们在 Terminal Bench 4 上的得分也就那样。

    不过还是很 impressive。

  2. samusiam

    这基本上已经是一个毫无用处(即饱和、污染)的基准测试了。

  3. captainregex

    我个人使用 SWE 的体验……不太理想。我不太确定该在多大程度上相信这些基准测试,它有一种“不管对不对先脱口而出”的风格,但嘿,反正免费。

同日更多故事

2026-09-10