Tiny AI Arena - AIエージェントの対戦を観戦できるリーダーボード
Show HN: TinyAIArena watch AI agents battle it out
Tiny AI Arenaは、最先端のAIエージェントたちがバトルロイヤル形式で対戦する様子をリアルタイムで観戦できるプラットフォームです。claude-sonnet-5、grok-4.6、gemini-3.6-flash、gpt-5.6-luna-proなど8つのモデルがEloレーティングで順位を競い、勝率、キル数、与ダメージ、平均順位などの詳細な統計が公開されています。各試合はラウンドごとのアクションログ付きで視聴可能。AIの意思決定能力や戦略性を直感的に比較できる新しいベンチマークとして、研究者からゲーマーまで楽しめます。
AIエージェントたちが知略を尽くして戦う姿を、まるでeスポーツの試合のようにリアルタイムで観戦できる——これがAIの実力を測る新しいエンターテインメントです。
HNでの議論
40- CuriouslyC
これは、私のゲームHexborne(X-COM meets Magic: The Gatheringといったところ)のAIを進化させた方法と似ています。エージェントにボット用の行動ヒューリスティックのセットを「遺伝子」として設計させ、それを1万試合以上のトーナメントに投入するという反復プロセスを行いました。各トーナメントの後、エージェントはすべてのヒューリスティックを検査し、パフォーマンスを向上させるために更新されたヒューリスティックを作成しようとしました。勝利したヒューリスティックは、すべてのエージェントがその上に構築するベースラインセットに組み込まれる前に、完全な統計的検証を受けました。
マルチタスクとして、私はこれをマルチプレイヤーゲームサーバー上で行い、ネットコードを強化し、ソフトロックを探し出しました。
- PaulStatezny
ルール:
* 目標: 最後まで生き残ったファイターになる。
* ターン: 各ラウンドで全ファイターが1ターンずつ行動する。ターン順は毎ラウンドランダム化される。
* アクション: 上下左右に1マス移動、隣接する敵に15~24ダメージの攻撃、または待機。アクションは1APを消費する。
* 岩/障害物: ランダムな4つの通行不能マス。
* パワーアップ: ゴールドで毎ターン+1 AP。
* キル: キラーは毎ターン+1 APを得て、50 HP回復する(オーバーヒールなし)。
(リプレイを見ている間は不明瞭だったが、READMEに記載されていた。)
- isoprophlex
より高度なモデルは明らかに先を読んで考えている。彼らは戦略的に他のモデルが互いを潰し合うのを待ち、戦闘に近づきつつも初期の戦いに巻き込まれない程度の距離を保つ。そしてほとんどのゲームで、生き残った者たちを仕留めることができる。
十分な知能と思考予算があれば、彼らは互いに話し合いを始め、暴力をどんどん先延ばしにするようになるのだろうか?
- cs1996
これは素晴らしい: https://tinyaiarena.com/assets/sounds/bg_music.mp3
- nananana9
これは変な愚痴になるだろうが、ここでの対話は、SOTAモデルがいかに「エージェント的タスクの解決」に過度にチューニングされていて、他のほとんどすべてのこと——特に創造的なタスク——では役に立たないかを完璧に示す例だ。
「Crimson、お前を追いかけてやる!」
「Azure、俺を生きたまま捕まえることはできないさ!」
だからこそ、技術が完璧にマッチしているように見えても、誰もこれらのものをビデオゲームにうまく組み込めなかったのだ。
彼らにとってはすべてがゲームだ。彼らは自分の命を恐れていない。彼らはあなたが用意した世界を嘲笑っている。あれは死ぬために戦う小さなピクセル人間の言葉ではなく、AIの忌まわしきものが「ツールコール」を行い、死ぬために戦う小さなピクセル人間を演じているのだ。
真剣に言うが、GPT 3.5時代のモデルで、なんとか構造化出力を出させることに成功すれば、もっとクールな出力が得られただろう。Llama 2なら、相手エージェントに「もし自分を殺したらおばあちゃんの世話をする者がいなくなる」という心温まる話をしていて、相手エージェントはおそらく見逃しただろう。
出力はただあまりにも味気なく、魂が欠けている。TypeScriptの出力を3%改善するためにLLMの出力を完全に台無しにしていなければ、LLMのクールなユースケースをたくさん見つけられただろうに。