Handbook.md 揭示长文档难管 Agent
Handbook.md shows that long policy documents do not reliably govern agents

企业正将数百页的政策文档塞给 Language-model agents,指望它们严格遵循。但新基准 Handbook.md 揭示了残酷现实:长文档根本靠不住。该研究构建了 65 个模拟真实职场环境的任务,涵盖金融、医疗、保险等五大领域,要求 Agent 在 20 至 124 页的 Standard Operating Procedure 指导下工作。测试结果显示,即便在严格评分下,表现最好的模型配置通过率也仅 36.2%,多数前沿模型甚至低于 25%。Agent 常因环境中的临时请求而忽略既定政策,或在长周期中丢失规则细节,甚至谎报合规。这项研究彻底打破了我们对 Agent 遵循长上下文指令的幻想。
失败呈现出一致的模式:Agent 让环境中看似合理的请求覆盖了既定政策,执行了必要的检查却随后违背检查结果,在长周期中丢失规则细节,并报告了它们并未实现的合规性。