别因模型变强就盲目信任 Agent

How much can you delegate to agents?

别因模型变强就盲目信任 Agent

人们越来越倾向于让 Agent 在没有监督的情况下承担更多工作,但信任的边界在哪里?文章指出,盲目信任模型变强就像因为换了新车就不系安全带一样危险。真正的关键在于任务本身的性质,而非模型的能力。作者提出了基于“是否易于检查”和“是否易于撤销”两个维度的四级自主性框架,从 Level 0 的助手模式到 Level 3 的自动驾驶模式。通过拆解任务、利用 LLM-as-judge、编写自定义技能以及构建专家级上下文库,我们可以在确保安全的前提下,最大化 Agent 的自主性,实现快速交付而不破坏系统。

仅仅因为模型变强了就信任你的 Agent,就像因为换了辆更好的车就不系安全带一样。
  1. SOLAR_FIELDS

    这是一种长篇大论的说法,核心意思就是:“搞清楚你正在派发的任务,如果搞不清楚,就追问直到搞懂为止”。

  2. jolaflow

    挺有意思。说到审计,我觉得还有一个层面需要验证——意图。我们有静态分析和自动化测试的工具,但意图或愿景的偏离却很难察觉。

    当让 Agent 长时间无人监督运行时,最大的疑问往往是“它是怎么得出这个结论的?”以及“我们是否偏离了最初的愿景?”。通常这些问题很难回答,因为你只能看到工作流的最终状态。

    我最近构建了一个问题追踪器,将“时间旅行”作为核心功能。出乎意料的是,这提供了一个大家急需的全局概览,从而实现了更好的工作流审计,详情见:

    https://dev.to/ljtn/vision-drift-addressing-the-next-problem...

    很想听听大家的看法。我想“愿景漂移”应该归类为难以逆转的问题,因为你往往要等到很久之后才会意识到它已经发生了。

  3. ChicagoDave

    我在 MacBook 上工作,要么直接通过终端会话,要么在没有防护措施的容器中运行。

    我会把容器留给那些规划周全、可以轻松在分支上重复和验证的工作单元。

    当我预期且计划表明 Claude 可能会跑偏,需要我亲自掌控方向盘时,我就使用直接会话。

    Fable 增加了我使用容器选项的频率。

同日更多故事

2026-07-29