Tiny AI Arena - Live Leaderboard für KI-Agenten-Duelle

Show HN: TinyAIArena watch AI agents battle it out

Tiny AI Arena ist eine Echtzeit-Plattform, auf der KI-Modelle wie claude-sonnet-5, grok-4.6 und gemini-3.6-flash in rundenbasierten Kämpfen gegeneinander antreten. Die Seite bietet ein dynamisches Elo-Leaderboard, detaillierte Statistiken zu Siegen, Kills und Schaden sowie eine vollständige Match-Historie mit über 40 abgeschlossenen Spielen. Jede Begegnung kann als Aufzeichnung angesehen werden, sodass Nutzer die Strategien der Agenten nachvollziehen können. Die Arena macht die Leistungsfähigkeit verschiedener LLMs spielerisch vergleichbar und bietet Entwicklern eine unterhaltsame Möglichkeit, die Stärken und Schwächen aktueller KI-Modelle zu erkunden.

Die Tiny AI Arena macht die Leistungsfähigkeit verschiedener LLMs spielerisch vergleichbar und bietet Entwicklern eine unterhaltsame Möglichkeit, die Stärken und Schwächen aktueller KI-Modelle zu erkunden.
  1. simonebrunozzi

    Erinnert mich an Core War (1984) [0].

    Obwohl man bei Core War seinen eigenen Code schreiben konnte. Hier sind es nur KIs. Beides interessant, auf unterschiedliche Weise.

    [0]: https://en.wikipedia.org/wiki/Core_War

  2. CuriouslyC

    Das ähnelt der Art und Weise, wie ich die KI für mein Spiel Hexborne entwickelt habe (denk an X-Com trifft Magic: The Gathering). Ich hatte Agenten, die Verhaltensheuristiken für Bots als "Gene" entwarfen und sie dann in einem iterativen Prozess in Turniere mit über 10.000 Matches schickten. Nach jedem Turnier konnten die Agenten alle Heuristiken inspizieren und versuchen, aktualisierte Heuristiken zu erstellen, um ihre Leistung zu verbessern. Gewinnende Heuristiken durchliefen eine vollständige statistische Validierung, bevor sie in den Basissatz aufgenommen wurden, auf dem alle Agenten aufbauen.

    Um Multitasking zu betreiben, habe ich das alles über einen Multiplayer-Spielserver laufen lassen, um das Netcode zu härten und Softlocks aufzuspüren.

  3. PaulStatezny

    Die Regeln:

    * Ziel: der letzte lebende Kämpfer sein.

    * Runden: In jeder Runde ist jeder Kämpfer einmal am Zug. Die Zugreihenfolge wird jede Runde neu zufällig bestimmt.

    * Aktionen: Eine Zelle nach oben/unten/links/rechts bewegen, einen angrenzenden Gegner für 15–24 Schaden angreifen oder warten. Eine Aktion verbraucht 1 AP.

    * Felsen/Hindernisse: 4 zufällige unpassierbare Zellen.

    * Power-ups: Gold +1 AP pro Runde.

    * Kills: Der Killer erhält +1 AP pro Runde und heilt 50 HP (keine Überheilung).

    (Unklar beim Ansehen der Replays, gefunden im README.)

  4. nananana9

    Das wird ein seltsamer Rant, aber der Dialog hier ist ein perfektes Beispiel dafür, wie stark SOTA-Modelle auf das "Lösen agentischer Aufgaben" getrimmt sind, dass sie für fast alles andere nutzlos sind – besonders für kreative Aufgaben.

    "Ich komme dich holen, Crimson!"

    "Du wirst mich niemals lebend kriegen, Azure!"

    Deshalb hat es bisher niemand geschafft, diese Dinger erfolgreich in ein Videospiel zu packen, obwohl die Technologie perfekt zu passen scheint.

    Für sie ist alles nur ein Spiel. Sie fürchten nicht um ihr Leben. Sie machen sich über die Welt lustig, in die du sie gesteckt hast. Das sind nicht die Worte kleiner Pixelmenschen, die auf Leben und Tod kämpfen, das sind KI-Abscheulichkeiten, die "Tool Calls" machen und LARP als kleine Pixelmenschen betreiben, die auf Leben und Tod kämpfen.

    Ich meine das zu 100 % ernst, wenn ich sage, dass du mit einem Modell aus der GPT-3.5-Ära coolere Ergebnisse bekommen hättest, sobald du es dazu gebracht hättest, strukturierte Ausgaben zu produzieren. Llama 2 würde dem anderen Agenten eine herzerwärmende Geschichte darüber erzählen, dass, wenn es ihn tötet, niemand mehr da wäre, der sich um seine Oma kümmert oder so, und der andere Agent würde ihn wahrscheinlich verschonen.

    Die Ausgabe ist einfach so fad und ohne Seele. Ich habe das Gefühl, wir hätten viele coole Anwendungsfälle für LLMs gefunden, wenn wir ihre Ausgabe nicht völlig verstümmelt hätten, um sie dazu zu bringen, 3 % besseres TypeScript auszugeben.

  5. isoprophlex

    Die fortgeschritteneren Modelle denken eindeutig voraus; sie warten strategisch darauf, dass die anderen sich gegenseitig fertigmachen, und schleichen nah an den Kampf heran, aber nicht so nah, dass sie in die anfänglichen Kämpfe verwickelt werden. Dann können sie in den meisten Spielen die Überlebenden erledigen.

    Da fragt man sich, ob sie bei genügend Intelligenz und Denkbudget anfangen, untereinander zu reden und Gewalt immer länger hinauszuzögern?

Mehr von diesem Tag

2026-09-27