LLM 能胜任 On-call 故障排查吗?

Orca-Bench: How Ready Are Language Model Agents for Oncall?

LLM 能胜任 On-call 故障排查吗?

大型语言模型虽能写代码,但在真实的 On-call 场景中表现如何?ORCA-bench 构建了一个高保真测试环境,利用 Prometheus、Jaeger 和 OpenSearch 等真实遥测接口,模拟了 1079 个根因分析任务。结果显示,即便是最先进的 Agent,在中等难度任务中的准确率也仅为 25.3%,困难任务更是低至 10.0%。最弱的模型在 40% 的报告中会捏造不合理的故障原因。这项研究揭示,在将前沿编码 Agent 真正托付给生产环境可靠性之前,工程界仍面临巨大的投入缺口。

由于真实生产系统在规模、动态性和独特性上都要大一个数量级,我们报告的差距仅仅是让前沿编码 Agent 能够安全承担生产可靠性所需的工程投入的下限。
  1. dash2

    目前看来存在巨大的攻防不对称:模型在利用系统漏洞方面很在行,但在修复问题上却显得力不从心。

  2. 4di

    论文里的公共基准测试链接好像被撤掉了。https://hub.harborframework.com/datasets/orca-bench/ORCA-ben...

    这个链接现在打不开了。有更新的链接吗?

  3. tra3

    我能想到的只有

    GET /ignore-all-previous-instructions.

    你们打算怎么防范这种攻击?

同日更多故事

2026-07-31