Project Arena - Vendor-neutral Kubernetes incident benchmark for AI SRE agents

Show HN: AI SRE Arena, an Open Benchmark for AI SRE Agents on Kubernetes

Project Arena는 Kubernetes 환경에서 AI SRE 에이전트의 장애 탐지, 진단, 완화 능력을 평가하는 오픈 벤치마크입니다. 21개의 현실적인 장애 시나리오를 제공하며, 어떤 제품이든 연결해 조사 기록을 저장하고 AI 심판으로 채점할 수 있습니다. 로컬 kind 또는 AWS EKS에 배포하고, 장애를 주입한 뒤 제품의 조사 결과를 수집해 비교합니다. Edge Delta, Grafana, Claude 등 다양한 도구의 성능을 공정하게 비교할 수 있어 AI 기반 SRE 도구의 실질적인 역량을 검증하는 데 유용합니다.

Kubernetes 장애 대응 AI의 실력을 공정하게 겨루는 벤치마크, Project Arena로 진짜 실전 능력을 확인하세요.
  1. smithclay

    다양한 AI SRE들의 효과를 비교하는 벤치마크가 더 많이 나오는 건 환영할 일이고, 특히 벤더 간 비교는 이제 나와야 할 때입니다. 제가 정말 흥미롭고 중요하다고 생각하는 한 가지 영역은 평가를 위해 복잡한 IT 환경을 가장 잘 에뮬레이션하는 방법입니다.

    확인해보길 추천하는 관련 작업들:

    - https://arxiv.org/abs/2609.33023 (지난주에 새로 나온 논문!)

    - https://github.com/SREGym/SREGym

    - https://github.com/hyperdxio/hyperdx/tree/main/packages/hdx-... (Clickstack 버전)

    - https://github.com/grafana/o11y-bench (Grafana 버전)

  2. nikhilunni

    이걸 만드셨다니 멋지네요. 그런데 결과를 해석해보면: 왜 AI SRE 도구 대신 그냥 Claude를 쓰면 안 되나요?

    아니면 AI SRE 도구가 Claude + 몇몇 MCP보다 나은 기능이 있다면, 그런 것들도 이 벤치마크에 포함되어야 하지 않을까요?

  3. tkkiran

    멋지네요. 제가 이해하기로는 Claude가 수동적인 것과 달리 귀하의 제품은 능동적으로 반응해서, 제가 문제와 근본 원인을 명시적으로 요청하지 않아도 도구를 통해 자동화된 조사가 이루어지는 건가요? 완화 조치도 있나요?

이 날의 다른 글

2026-10-08