SWE-1.7 性能逼近 GPT-5.5 与 Opus
SWE-1.7 Reach Near GPT 5.5 and Opus Intelligence

我们正式推出 SWE-1.7,这是目前训练出的最强模型,以极低的成本实现了前沿级智能。基于 Kimi K2.7 基座,我们突破了所谓的“后训练天花板”,证明强化学习(RL)能带来远超预期的能力提升。通过优化熵保持策略、跨三洲的多集群训练架构、高质量数据筛选以及长周期任务的自我压缩技术,SWE-1.7 在 FrontierCode 等基准测试中表现卓越,性能直逼 GPT-5.5 和 Opus。现在,你可以通过 Devin 平台体验这一革命性成果。
SWE-1.7 从已经经过广泛强化学习后训练的 Kimi K2.7 基座训练而来,我们训练带来的巨大额外增益挑战了‘后训练天花板’的概念,并表明强化学习可以将能力推向比此前认为的更远的地方。
- 有开发者指出,在代码生成中混用'budget models'处理基础工作往往导致灾难性后果,如产生荒谬的文档或兼容自身引入的bug,反而不如全程使用大模型高效。
- 一位从业者批评当前AI代码代理的订阅模式,认为Devin等工具相比Cursor或Codex性价比极低,且存在通过补贴烧钱维持不可持续定价的嫌疑。
- 针对SWE-1.7等基准测试,有评论者质疑其有效性,认为AI只是学会了编写能通过测试的代码,而非真正解决业务逻辑问题,且主观实战体验比分数更具参考价值。
- 有观点认为,付费购买前沿模型(frontier models)仅能获得微弱的性能提升,而低成本模型在短短几个月内的进步已远超高价模型过去的水平,边际效益极低。
- 部分用户提出,与其依赖单一工具,不如利用Devin Desktop等支持ACP协议的框架,混合搭配Opus、SWE、GLM等不同模型分别负责探索、构建和验证,以平衡成本与质量。