AI SRE Arena - Open benchmark para agentes de IA en Kubernetes
Show HN: AI SRE Arena, an Open Benchmark for AI SRE Agents on Kubernetes
AI SRE Arena es un benchmark abierto y neutral que permite evaluar herramientas de investigación de IA en incidentes reales de Kubernetes. Despliega un clúster con fallos controlados, conecta tu producto de observabilidad, captura los registros de investigación y compáralos con un juez de IA configurable. Incluye 21 escenarios de fallo y una suite reducida de 6, con soporte para clústeres locales kind o AWS EKS. Ideal para equipos que quieren medir la detección, el diagnóstico y la mitigación de sus agentes de IA en un entorno reproducible y justo.
Un benchmark neutral que permite comparar investigaciones de IA en Kubernetes con un juez configurable, midiendo detección, causa raíz, alcance y mitigación.
- smithclay
Siempre es bienvenido y ya era hora de tener más benchmarks que comparen la efectividad de los distintos SRE de IA: especialmente comparaciones entre proveedores. Un área que creo que va a ser realmente interesante e importante es la mejor forma de emular entornos de TI complejos para las evals.
Algo de trabajo relacionado que recomiendo echar un vistazo:
- https://arxiv.org/abs/2609.33023 (¡nuevo la semana pasada!)
- https://github.com/SREGym/SREGym
- https://github.com/hyperdxio/hyperdx/tree/main/packages/hdx-... (la versión de Clickstack)
- https://github.com/grafana/o11y-bench (la versión de Grafana)
- nikhilunni
Genial que hayáis creado esto, pero interpretando los resultados: ¿por qué no iba a usar simplemente Claude en lugar de una herramienta de SRE de IA?
O si hay algunas características de una herramienta de SRE de IA que la hacen mejor que Claude + algunos MCPs, ¿deberían recogerse en este mismo benchmark?
- tkkiran
Genial, por lo que veo tu producto reacciona de forma proactiva en lugar de que Claude sea reactivo, así que con vuestras herramientas las investigaciones automatizadas ocurren sin que yo pregunte explícitamente por el problema y la causa raíz, ¿lo entiendo bien? ¿También tenéis mitigaciones?