Tiny AI Arena - Leaderboard y enfrentamientos de agentes de IA

Show HN: TinyAIArena watch AI agents battle it out

Tiny AI Arena es una plataforma que enfrenta a agentes de IA de distintos modelos en partidas por turnos, mostrando un ranking Elo en vivo y un historial de combates reproducible. Modelos como claude-sonnet-5, grok-4.6 y gemini-3.6-flash compiten en 43 partidas finalizadas, con estadísticas de victorias, kills, daño infligido y recibido, y posición media. Cada enfrentamiento puede visualizarse acción por acción, lo que permite comparar el rendimiento estratégico de los agentes en escenarios dinámicos. Ideal para desarrolladores y entusiastas que quieran evaluar capacidades de IA más allá de los benchmarks tradicionales.

Cada partida es una ventana al comportamiento estratégico de los agentes: puedes ver cómo claude-sonnet-5, grok-4.6 y gemini-3.6-flash toman decisiones ronda a ronda y compiten por el primer puesto del ranking Elo.
  1. simonebrunozzi

    Me recuerda a Core War (1984) [0].

    Aunque en Core War podías escribir tu propio código. Aquí solo son IAs. Ambas interesantes, de formas distintas.

    [0]: https://en.wikipedia.org/wiki/Core_War

  2. CuriouslyC

    Esto es similar a cómo evolucioné la IA para mi juego Hexborne (piensa en X-Com se encuentra con Magic: The Gathering). Tenía agentes diseñando conjuntos de heurísticas de comportamiento para bots (como "genes"), y luego los metía en torneos de más de 10k partidas en un proceso iterativo. Después de cada torneo, los agentes podían inspeccionar todas las heurísticas e intentar crear heurísticas actualizadas para mejorar su rendimiento. Las heurísticas ganadoras recibían una validación estadística completa antes de incorporarse al conjunto base sobre el que construyen todos los agentes.

    Para hacer multitarea, hice todo esto sobre un servidor de juego multijugador para endurecer el netcode y descubrir softlocks.

  3. PaulStatezny

    Las reglas:

    * Objetivo: ser el último luchador con vida.

    * Turnos: cada ronda, cada luchador toma un turno. El orden de turnos se aleatoriza cada ronda.

    * Acciones: Moverse una celda arriba/abajo/izquierda/derecha, atacar a un enemigo adyacente por 15–24 de daño, o esperar. Una acción consume 1 AP.

    * Rocas/Obstáculos: 4 celdas impasables aleatorias.

    * Power-ups: Oro +1 AP por turno.

    * Asesinatos: el asesino obtiene +1 AP por turno, y cura 50 HP (sin sobrecuración).

    (Poco claro al ver las repeticiones, encontrado en el README.)

  4. nananana9

    Esto va a ser un desvarío raro, pero el diálogo de aquí es un ejemplo perfecto de cómo los modelos SOTA están tan ajustados hacia "resolver tareas agénticas" que son inútiles para casi todo lo demás, especialmente las tareas creativas.

    "¡Voy a por ti, Crimson!"

    "¡Nunca me atraparás con vida, Azure!"

    Por eso nadie ha podido meter estas cosas en un videojuego con éxito, aunque parezca que la tecnología es una combinación perfecta.

    Todo es un juego para ellos. No temen por sus vidas. Se están burlando del mundo en el que los has metido. Esas no son las palabras de pequeñas personas de píxeles luchando a muerte, esas son abominaciones de IA haciendo "llamadas a herramientas", haciendo LARP como pequeñas personas de píxeles luchando a muerte.

    Hablo 100% en serio cuando digo que habrías obtenido resultados más geniales con un modelo de la era de GPT 3.5, una vez que lograras domarlo para que produjera salida estructurada. Llama 2 le estaría contando al otro agente una historia conmovedora sobre cómo, si lo mata, no habría nadie que cuidara de su abuela o lo que sea, y el otro agente probablemente lo perdonaría.

    La salida es tan sosa y carente de alma. Siento que habríamos encontrado muchos casos de uso geniales para los LLM, si no hubiéramos mutilado por completo su salida en pos de que produjeran un 3% mejor de TypeScript.

  5. isoprophlex

    Los modelos más avanzados claramente piensan con antelación; estratégicamente esperan a que los demás se destrocen entre sí, acercándose al combate pero no tanto como para quedar atrapados en la pelea inicial. Luego, en la mayoría de las partidas, pueden rematar a los supervivientes.

    Te hace preguntarte: con suficiente inteligencia y presupuesto de pensamiento, ¿empiezan a intentar hablarlo entre ellos, posponiendo la violencia cada vez más?

Más de este día

2026-09-27