LLM 能胜任 On-call 故障排查吗?
Orca-Bench: How Ready Are Language Model Agents for Oncall?

大型语言模型虽能写代码,但在真实的 On-call 场景中表现如何?ORCA-bench 构建了一个高保真测试环境,利用 Prometheus、Jaeger 和 OpenSearch 等真实遥测接口,模拟了 1079 个根因分析任务。结果显示,即便是最先进的 Agent,在中等难度任务中的准确率也仅为 25.3%,困难任务更是低至 10.0%。最弱的模型在 40% 的报告中会捏造不合理的故障原因。这项研究揭示,在将前沿编码 Agent 真正托付给生产环境可靠性之前,工程界仍面临巨大的投入缺口。
由于真实生产系统在规模、动态性和独特性上都要大一个数量级,我们报告的差距仅仅是让前沿编码 Agent 能够安全承担生产可靠性所需的工程投入的下限。
HN 评论区
11- dash2
目前看来存在巨大的攻防不对称:模型在利用系统漏洞方面很在行,但在修复问题上却显得力不从心。
- 4di
论文里的公共基准测试链接好像被撤掉了。https://hub.harborframework.com/datasets/orca-bench/ORCA-ben...
这个链接现在打不开了。有更新的链接吗?
- tra3
我能想到的只有
GET /ignore-all-previous-instructions.
你们打算怎么防范这种攻击?