前沿模型只需一次编辑,成本立省

You only need the frontier model for one single edit

前沿模型只需一次编辑,成本立省

别再迷信让Opus做规划、Flash做执行的'高级架构'了,这反而会让成本飙升14%。我们发现,AI Agent的账单大头根本不是代码编写,而是阅读上下文。让昂贵的模型反复阅读文件,再让廉价模型重新阅读一遍,简直是双重浪费。真正的省钱秘籍是/prewalk策略:让前沿模型在探索后完成第一次有效编辑,随即无缝切换到廉价模型。这样既保留了深度理解,又避免了重复阅读的高昂Token成本,让任务执行快1.9倍,成本却更低。

Opus修复问题并不花钱,Opus阅读内容才真正烧钱。
  1. robbie-c

    我恳请大家自己动手写文章,别把活儿都丢给 Claude。

    我想要的是专家观点,如果只是想问 LLM,我自己就有。

    这篇文章怎么连一次 KV cache 都没提?

  2. nxtfari

    这招真聪明,正如作者所说,是老点子但用得巧妙。

    万一有人想要个总结:别搞 one-shot,别用 plan 模式然后把计划丢给廉价的执行者;让前沿模型去探索,生成待办清单,等它觉得有把握了再开始;在第一次代码编辑后让它停下,然后把上下文预填给廉价执行者继续干活。

  3. Too

    > 错误出在架构图的上游。人们给 Agent 定价的方式和给人定价一样:高级人员的时间很贵,所以要尽量减少高级人员的参与。

    > 但 Agent 一天中最贵的部分不是修复、构建,甚至不是思考。Opus 修复东西不花钱,Opus 阅读东西才花钱。

    呵,又是重新发现 Agent 和人类很像。等我研究完一个 Jira 工单,把它梳理得足够清晰好外包出去时,我干脆自己把代码写了得了。

  4. unholiness

    没提 KV cache,这可是中途切换模型最大的忌讳之一。一旦你付了钱,比如 5 万输入 token 和 5 万输出 token 的 Opus 4.8,在它构建过程中读取那 10 万上下文缓存时,你就不用再付 token 费用了。切换到另一个模型,你得先付 10 万输入 token 的费用,把上下文加载进去并建立它独有的 KV cache。

    这篇文章可能有些真知灼见,即这 10 万的工作上下文其实比试图把发现总结成计划更好。它说得也对,交接点正是编辑上下文(移除规划指令)的完美时机。但它没提到这是个权衡:计划更小,所以下一个模型的“入职”成本更低。对于一次性任务来说,这似乎很划算。如果没错的话,这对 LLM 来说基本上就是“计划无用,规划一切”。

    我的问题是,我觉得计划是有用的。我想审查并编辑它们。我想让它们为即将到来的代码审查提供背景(即使没有人审)。LLM 在解释当下为什么要这么做方面臭名昭著。人类在承认“没什么理由”这方面也臭名昭著。我觉得人类在这里是对的,为了弥合这个差距,我希望我的 PR、文档和注释里都充斥着理由。计划对此很有帮助。

  5. figmert

    我之所以采用先规划再实施,是因为我可以调整计划;而如果让它直接开始实施,它可能会(而且经常确实会)做出错误的决定,这些决定更难调整,或者我事后还得去调整。

同日更多故事

2026-07-20