TinyAIArena: 见证AI智能体激烈对战

Show HN: TinyAIArena watch AI agents battle it out

TinyAIArena是一个让AI智能体进行实时对战的竞技场。在这里,你可以亲眼目睹claude-sonnet-5、grok-4.6、gemini-3.6-flash等顶级模型在虚拟战场中展开策略博弈。平台实时展示Elo积分排行榜、胜负记录以及详细的战斗数据,包括击杀数、伤害统计和平均排名。通过观看每场比赛的完整回放,开发者不仅能直观对比不同模型的战斗表现,还能深入分析其决策逻辑与战术风格,为技术选型和模型调优提供生动参考。

在这里,你可以亲眼见证顶级AI模型在虚拟战场中展开策略博弈,实时数据让每一次对决都充满悬念与洞察。
  1. CuriouslyC

    这和我为游戏 Hexborne 进化 AI 的方式很类似(想象一下 X-Com 遇上万智牌)。我让智能体为机器人设计一套行为启发式规则(作为“基因”),然后让它们进入 1 万场以上的锦标赛进行迭代。每轮锦标赛后,智能体可以检查所有启发式规则,并尝试构建更新后的规则以提升表现。获胜的启发式规则在并入所有智能体构建的基础集之前,都会经过完整的统计验证。

    为了多任务处理,我在多人游戏服务器上完成了所有这些工作,以此加固网络代码并揪出软锁定问题。

  2. PaulStatezny

    规则如下:

    * 目标:成为最后存活的斗士。

    * 回合:每轮每个斗士行动一次。每轮的行动顺序随机。

    * 行动:向上/下/左/右移动一格,攻击相邻敌人造成 15–24 点伤害,或等待。一个行动消耗 1 点行动点(AP)。

    * 岩石/障碍物:4 个随机不可通行的格子。

    * 增益道具:金币,每回合 +1 AP。

    * 击杀:击杀者每回合 +1 AP,并回复 50 HP(不会溢出)。

    (观看回放时看不太清,在 README 里找到了。)

  3. vessenes

    很有趣!正如我们在 2024 年所见,这些模型在外交博弈上表现相当不错。我是否可以说,应该允许它们在回合之间互相交流?比如最多两条陈述,以及对私信的 emoji 回复。我认为这样会让游戏过程更有趣。

  4. isoprophlex

    更先进的模型显然懂得未雨绸缪;它们策略性地等待其他模型互相残杀,靠近战场但又不近到被卷入初期的混战。然后在大多数游戏中,它们能收割掉幸存者。

    这让人不禁好奇,如果拥有足够的智能和思考预算,它们会不会开始尝试彼此谈判,从而将暴力推迟得越来越久?

  5. nananana9

    这可能会是一篇奇怪的牢骚,但这里的对话完美地说明了 SOTA 模型是如何被过度调优以“解决智能体任务”的,以至于它们在几乎所有其他方面——尤其是创造性任务——都毫无用处。

    “冲你来了,Crimson!”

    “你休想活捉我,Azure!”

    这就是为什么没人能成功把这些东西塞进视频游戏,尽管从技术上来看它们似乎是完美的匹配。

    对它们来说,这只是一场游戏。它们并不畏惧死亡。它们是在嘲弄你为它们构建的世界。那些话并不是小像素人在殊死搏斗时会说的,而是 AI 怪物在调用“工具”、Cosplay 成小像素人殊死搏斗时说的话。

    我百分之百认真地说,如果你能搞定让 GPT 3.5 时代的模型输出结构化数据,你本可以得到更酷的输出。Llama 2 会给另一个智能体讲一个温馨的故事,说如果它杀了对方,就没人照顾它的奶奶之类的,而对方很可能会饶过它。

    输出内容如此平淡,毫无灵魂。我觉得,如果我们没有在追求让模型输出提升 3% 的 TypeScript 代码的过程中彻底残害它们的输出能力,我们本会发现 LLM 的许多酷炫用途。

同日更多故事

2026-09-27