LLM 能胜任 On-call 故障排查吗?
Orca-Bench: How Ready Are Language Model Agents for Oncall?

大型语言模型虽能写代码,但在真实的 On-call 场景中表现如何?ORCA-bench 构建了一个高保真测试环境,利用 Prometheus、Jaeger 和 OpenSearch 等真实遥测接口,模拟了 1079 个根因分析任务。结果显示,即便是最先进的 Agent,在中等难度任务中的准确率也仅为 25.3%,困难任务更是低至 10.0%。最弱的模型在 40% 的报告中会捏造不合理的故障原因。这项研究揭示,在将前沿编码 Agent 真正托付给生产环境可靠性之前,工程界仍面临巨大的投入缺口。
由于真实生产系统在规模、动态性和独特性上都要大一个数量级,我们报告的差距仅仅是让前沿编码 Agent 能够安全承担生产可靠性所需的工程投入的下限。