AI 能否独立搞定大型软件项目?
What's the largest software project AI can complete on its own?

MirrorCode 是 Epoch AI 与 METR 联合推出的新基准,旨在测试 AI 在长周期编程任务中的真实能力。不同于以往仅关注修 bug 或实现小功能的测试,MirrorCode 要求 AI 在无法访问原始代码的情况下,从头到尾完整重写整个程序,且输出必须与原版完全一致。该基准涵盖了 Unix 工具、生物信息学、加密等 25 个领域的复杂项目。实验显示,Claude Opus 4.7 仅用 14 小时就重写了包含约 1.6 万行代码的 gotree 工具,而人类工程师独立完成可能需要数周。尽管存在数据污染的风险,但结果显示 AI 已具备处理此类高难度、长周期软件工程任务的潜力,且该基准已开源供社区验证。
在 MirrorCode 任务中,AI 模型被要求从头到尾完整重写整个程序,且无法访问原始源代码。