AI 能否独立搞定大型软件项目?

What's the largest software project AI can complete on its own?

AI 能否独立搞定大型软件项目?

MirrorCode 是 Epoch AI 与 METR 联合推出的新基准,旨在测试 AI 在长周期编程任务中的真实能力。不同于以往仅关注修 bug 或实现小功能的测试,MirrorCode 要求 AI 在无法访问原始代码的情况下,从头到尾完整重写整个程序,且输出必须与原版完全一致。该基准涵盖了 Unix 工具、生物信息学、加密等 25 个领域的复杂项目。实验显示,Claude Opus 4.7 仅用 14 小时就重写了包含约 1.6 万行代码的 gotree 工具,而人类工程师独立完成可能需要数周。尽管存在数据污染的风险,但结果显示 AI 已具备处理此类高难度、长周期软件工程任务的潜力,且该基准已开源供社区验证。

在 MirrorCode 任务中,AI 模型被要求从头到尾完整重写整个程序,且无法访问原始源代码。
  1. Jdstanhope

    我一直在用 Claude 构建一个用 Rust 写的 Bash 克隆版(https://github.com/jdstanhope/huck)。这个项目已经持续了 81 天,提交了 2600 次,覆盖了相当多的功能,现在我已经能加载 .bashrc 并配合一些扩展使用了。整体进展不错,但有时它为了修复几行代码会花上几个小时,或者尽管有超过 3000 个测试用例,它还是会抗拒进行大的改动。

    话虽如此,我仍然需要定期引导它,直到最近才让它尝试自主修复小到中等的 bug。下一阶段是尝试让它进入循环,去修复它自己识别出的 100 个问题,并让大部分 Bash 测试套件通过。

  2. gipp

    “复现已有的软件”这个问题,出于多种原因,似乎很难很好地推广到“开发新软件”上。

  3. jph

    我在看这些报告,再看看我和 Claude 的对话记录。在最近的一次中,它陷入了一个死循环,修复一个问题却破坏了另一个,来回折腾了 10 次,直到我注意到并给了它提示。还有时候它开始不停地写 "echo",我也不知道是为了什么。我不禁想问,你怎么能不做那个掌舵的人呢?你怎么能让这些代理自由漫游,却指望它们真正完成事情?

  4. sreekanth850

    我正在用 Claude Fable 实验一些规模较大的软件项目,结果让我很惊讶。

    - 项目组合管理软件。目前效果不错。这是无引导的实验:Fable 负责研究功能想法并制定计划,然后由 Opus 5 实现,我不在循环中。功能包括认证服务器、全文搜索、审计日志、资源平衡、高可用/灾难恢复(HA/DR)、基础设施即代码(IaC)等。

    - 在仅演示环境中进行的 FHIR 和 SNOMED 医疗软件实验。目前结果喜忧参半。这是有引导的实验:FHIR 规范和 SNOMED 规范非常详尽,我全程参与。Fable 计划制定得还行,但 Opus 5 却经常陷入混乱,钻进很多死胡同。

  5. thisisauserid

    我们(3 人团队)从零开始用 .NET 构建了一个用于调查搜索的检索引擎,AI 完成了大部分后端实现,而人类负责设计、架构和前端。开发采用了基于任务的增量方法。包含超过 3,000 个测试和详尽的文档,并针对使用 NATS 和基于磁盘的 WAL 的异步摄取进行了优化。

    它包含自定义 WAL、结构感知的语义分块、摄取和索引管道、混合(RRF)检索、文本和向量检索、查询级别的 ACL 感知过滤、查询分类器、引用跟踪,以及一个在单表上执行融合检索的 CrateDB 后端。

    总代码行数:18 万行。

    状态:正由州级机构评估,用于对遗留文档进行调查搜索。

    使用的工具:Codex、Luna,以及早期的 Codex 5.3 和 GPT-4 Mini。

同日更多故事

2026-08-03