Jevman: 评测AI决策模型的吃豆人基准
Show HN: Jevman – AI decision models play Pac-Man

Jevman 是一个专为 AI 决策模型设计的吃豆人基准测试平台。它让 TypeSafe、OpenAI、Cloudflare 等顶尖模型在经典吃豆人游戏中同台竞技,通过 100 场真实对战数据,直观展示各模型在得分、生存时间、延迟及成本上的表现。作为开源项目,Jevman 允许任何通过 HTTP 接口运行的模型参与测试,只需简单配置即可将你的模型加入排行榜。这不仅是对模型实时决策能力的趣味挑战,更是评估 AI 在动态环境中表现的高效工具。
Jevman 是开源的,任何基于 HTTP 端点的模型都能参与挑战:无论是云端托管模型、微调版本,还是运行在你笔记本电脑上的本地模型。