AI 代理开发:是未来还是 Vapourware?
Is it all just vapourware?

最近我尝试了 ONA 等 AI 代理开发工具,却深感挫败。这些产品由拥有无限 token 的工程师构建,却缺乏系统性的 QA 和用户体验测试。原本期待 AI 能帮我处理繁琐流程,结果却陷入了登录失败、调试集成和消耗昂贵 compute units 的泥潭。营销宣传与实际体验的巨大落差,让我不禁怀疑:如果代理开发真如宣传般高效,这些公司为何连自己的产品都做不好?我们真正需要的是能消除摩擦的工具,而不是制造更多麻烦的 Vapourware。
如果代理开发真能像他们宣称的那样运作,那么销售这些工具的公司本该是主要受益者,他们理应推出市场上最完善、最有用的软件。
HN 评论区
189- 20k
如果代理式开发(agentic development)真能像他们宣称的那样运作,
我觉得最有趣的一点是,宣传口径与开源世界中可验证的观测数据之间存在着巨大的鸿沟。主要的开源项目大多开始禁止 LLM 了,因为 LLM 用户提交的贡献普遍糟糕且毫无帮助。似乎没有任何一个大型项目发现生成代码能带来显著的生产力提升,共识似乎是这仅仅导致了大量质量低劣的贡献,而且这些垃圾代码在初期更难被一眼识破。
我经常看到有人声称自己使用 LLM 代码生成后生产力提升了 10 倍,我不禁好奇那些代码都去哪了。难道这些增益只存在于专有项目中,而没有一个人将他们新获得的工程能力哪怕投入一小部分到比如 Godot 这样的项目里?为什么只有那些低质量 LLM 代码生成的用户会给开源项目发 PR,而那些真正懂得如何正确使用它的高级工程师却从不这么做?
如果你看看大型开源项目的领域,几乎找不到任何 AI 代码生成存在的证据。去浏览你最喜欢的关键工具,寻找那些已合并到代码库中的 AI 生成 PR,相比于 LLM 禁令之前人类编写的 PR,可能只有寥寥几个。事实证明,一旦你拥有了可验证、开放的……
- lordnacho
我不明白你怎么能说这全是 Vapourware(画饼)。
两年前,我还不能只是粗略描述一下我的待办事项然后就让代码被修复。我必须自己敲代码,运行它,查看日志,修复工具链问题,等等。那很繁琐。或者我得找个初级工程师来做。
现在我能相当快地完成这些事,而且不需要那么高度集中注意力。
显然,它不是画饼。
它确实交付了东西。我们还没完全弄清楚如何最好地利用这些东西,但那里肯定有能用的东西。
我感觉很多人感到沮丧,是因为微小的增益被组织内部的混乱所吞噬,而不是因为工具本身不好用。
- badlibrarian
现在是 2026 年 8 月 9 日,如果你是一名软件工程师,却还没有经历过多次“天哪,我不敢相信它居然做到了”的时刻,那么是时候考虑转行了。
- solomonb
这个领域的更迭速度让 JavaScript 都相形见绌。举个例子,仅仅过了几个月,据我所知,已经没人再谈论 openclaw 了。
- jeffreyrogers
在我用它来开发真实产品之前,我对代理式编码(agentic coding)相当怀疑。虽然我仍然必须深度参与 LLM 为我编写的代码的规划工作,但它们写代码的速度比我快得多,而且它们比我更了解边缘情况,因此能处理我会遗漏的边缘情况/细微 bug。我曾因编写从汇编语言到前端 JavaScript 的各个层级代码而获得报酬,但我并非在所有领域都同样擅长。在某些领域我仍然能胜过 LLM,但在我不擅长的领域,它们做得比我原本能做的要好得多。
我仍然认为自己在做的是软件工程,我很高兴在使用代理之前拥有多年的专业和业余开发经验,因为我认为这赋予了我做出良好架构决策的能力(并帮助我在 LLM 想要做次优选择时将其拉回正轨),但我实际编写代码的参与度正在迅速归零。话虽如此,它们并不完美,仍然会引入 bug,但我相信目前产品的质量高于我在代理式编码出现之前所能创造的质量。
我发现以下措施有助于保持高质量:
- 视觉回归测试(在提交前检测 UI bug)
- 接口和应用程序行为的模糊测试(Fuzz testing)
- 为任何我或 LLM 修复的 bug 自动添加回归测试
- 记录/告警,跟踪应用程序中触发的错误/不变量违反情况
- 在仪表板上展示的性能指标。
Al …
- firasd
我想知道是否有人在搞“cargo culting”(盲目跟风/迷信仪式)。
肯定有些公司里的人只是把一群代理(agent swarm)指向 50 个 Github 工单,然后说“上吧伙计们”,因此他们需要大量的编排工具。但对于我们其他人来说,我们真的需要 AI 来完成所有的构建步骤和测试步骤吗……还是我们只需要那个点击按钮后运行的新功能,然后我们自己在浏览器里检查就行了?我需要的 AI 是代码生成,而不是“冒烟测试”和那些 tsc 的折腾。我愿意自己花点脑力一步步弄清楚这个功能。
这其实让我怀疑,是否有些人只是不太喜欢这种“好的,先看看端点返回的 JSON 结构”,“好的,现在做一个简单的表单”之类的逐步构建过程。
- protimewaster
> 我原本很乐观,但一旦把它连接到我的一个项目上,它并没有在我的待办事项清单上实现神奇的无人值守进度,而是花光了我大约 20 美元的“ona 计算单元”(不管那是什么),在那儿折腾,试图从 linear 获取待办事项,以便从中选一个开始。
这就是我不太愿意尝试很多这类 AI 产品的原因之一。这感觉像是在赌博。也许我会花 20 美元买 token,最后得到一个很棒的成果。或者也许我会花 20 美元买 token,最后一无所获,然后庆幸我只损失了 20 美元。
- simonw
当这篇文章提到 ONA 时,它指的是 https://ona.com/ —— 一家在几个月前被 OpenAI 收购的云代理服务。
(我不建议仅基于那款特定产品来评估整个代码代理领域。)