Project Arena - AI SREエージェント向けKubernetesインシデントベンチマーク

Show HN: AI SRE Arena, an Open Benchmark for AI SRE Agents on Kubernetes

Project Arenaは、Kubernetes上のインシデント調査ツールを公平に評価するためのベンダーニュートラルなオープンベンチマークです。21種類の障害シナリオを実際のクラスタに注入し、検知・根本原因分析・影響範囲・緩和策の実装準備度をスコアリングします。ローカルのkindまたはAWS EKSに対応し、任意のAI SRE製品を接続可能。設定可能なAIジャッジが調査結果を採点し、Edge Delta、Grafana、Claudeなどの結果を同一条件で比較できます。

ベンダーに依存せず、あらゆるAI調査ツールを同じKubernetes障害シナリオで検証し、その実力を公平に比較できる場を提供します。
  1. smithclay

    様々なAI SREの有効性を比較するベンチマーク、特にベンダー間の比較は歓迎すべきであり、待ち望まれていました。非常に興味深く、かつ重要になると思われる分野の一つは、評価のために複雑なIT環境をエミュレートする最善の方法です。

    関連する研究として以下をお勧めします:

    - https://arxiv.org/abs/2609.33023 (先週公開されたばかり!)

    - https://github.com/SREGym/SREGym

    - https://github.com/hyperdxio/hyperdx/tree/main/packages/hdx-... (Clickstackのバージョン)

    - https://github.com/grafana/o11y-bench (Grafanaのバージョン)

  2. nikhilunni

    皆さんがこれを作成したのは素晴らしいですが、結果をどう解釈すればいいのでしょう:なぜAI SREツールを使う必要があるのでしょうか?Claudeをそのまま使えばいいのでは?

    あるいは、AI SREツールがClaude + いくつかのMCPよりも優れている点があるなら、それも同じベンチマークで評価されるべきではないでしょうか?

  3. tkkiran

    素晴らしいですね。私の理解では、Claudeが受動的なのに対し、あなたの製品は能動的に反応するので、問題と根本原因を明示的に尋ねなくても自動調査が行われるということですか?また、緩和策も用意されていますか?

この日のほかの記事

2026-10-08