Prompt 不是真的:Dan 的 Agent 实战反思

Prompts Aren't Real

我是 Dan,在洛杉矶做了 25 年工程。最近我尝试让 Agent 在生产环境中可靠运行,这既令人兴奋又充满挑战。我发现 LLM 虽然强大,但在规模化监控下,其不可靠性会暴露无遗。很多人认为精心编写 Prompt 是关键,但我发现这其实是个误区。随着上下文增加,新 Prompt 会破坏原有行为,且模型行为难以预测。我的解决方案是放弃手动调优,转而使用 pass^k 测试和自动化优化器(如 GEPA)来迭代 Prompt。最终生成的 Prompt 可能看起来毫无逻辑,但只要测试通过,它就是有效的。

在工程卓越与彻底的心理崩溃之间,那层帷幕从未如此稀薄。

同日更多故事

2026-09-20