Project Arena - Vendor-neutral Kubernetes AI SRE benchmark
Show HN: AI SRE Arena, an Open Benchmark for AI SRE Agents on Kubernetes
Project Arena ist ein offener, anbieterneutraler Benchmark für AI SRE Agents auf Kubernetes. Es deployt eine disposable Kubernetes-Umgebung, injiziert 21 realistische Fault-Szenarien und bewertet die Untersuchungen verschiedener AI-Tools anhand von Detection, Root-Cause-Analyse, Blast Radius, Mitigation und Implementation Readiness. Ein konfigurierbarer AI-Judge sorgt für faire, reproduzierbare Vergleiche. Der Benchmark unterstützt lokale kind-Cluster und AWS EKS, lässt sich mit eigenen Produkten verbinden und liefert detaillierte Ergebnisse inklusive CSV-Export. So können Teams die Incident-Response-Fähigkeiten ihrer AI-Agents objektiv messen und verbessern.
Ein anbieterneutraler Kubernetes-Incident-Benchmark zum Testen von AI-Untersuchungstools über Detection, Diagnose und Mitigation hinweg.
- smithclay
Mehr Benchmarks, die die Effektivität verschiedener AI SREs vergleichen, sind willkommen und längst überfällig: besonders Vergleiche zwischen Anbietern. Ein Bereich, der meiner Meinung nach wirklich interessant und wichtig werden wird, ist der beste Weg, komplexe IT-Umgebungen für Evals zu emulieren.
Einige verwandte Arbeiten, die ich empfehle:
- https://arxiv.org/abs/2609.33023 (letzte Woche neu!)
- https://github.com/SREGym/SREGym
- https://github.com/hyperdxio/hyperdx/tree/main/packages/hdx-... (Clickstacks Version)
- https://github.com/grafana/o11y-bench (Grafanas Version)
- nikhilunni
Cool, dass ihr das erstellt habt, aber zur Interpretation der Ergebnisse: Warum sollte ich nicht einfach Claude anstelle eines AI SRE-Tools verwenden?
Oder wenn es Funktionen eines AI SRE-Tools gibt, die es besser machen als Claude + einige MCPs, sollten diese dann nicht im selben Benchmark erfasst werden?
- tkkiran
Cool, wie ich sehe, reagiert euer Produkt proaktiv, anstatt dass Claude reaktiv ist, sodass mit euren Tools automatisierte Untersuchungen stattfinden, ohne dass ich explizit das Problem und die Grundursache anfragen muss, wie ich es verstehe? Habt ihr auch Mitigationen?