Pac-Bench: 评测模型单次生成吃豆人游戏
Show HN: Pac-Bench – How well can models one-shot a Pac-Man game?
Pac-Bench 是一个独特的基准测试平台,旨在挑战大语言模型的单次生成能力,看它们能否仅凭简短提示就完整复现经典的 Pac-Man 游戏。该项目汇集了来自 OpenAI、Anthropic、Google 等厂商的最新模型表现,详细记录了运行时间、Token 消耗及代码成本。无论是使用 Claude Code 配合 OpenRouter,还是 Antigravity 结合 Gemini,每个实验都力求真实还原开发场景。通过对比不同模型的代码生成质量与效率,Pac-Bench 为开发者提供了直观的模型能力参考,让技术选型不再盲目。
我们好奇的是,这些模型能否仅凭一次提示就完美复现 Pac-Man 游戏?
HN 评论区
22- strataspace
我也用 DOOM 试过。Fable 5 做得相当烂。Astra 生成的动画精灵相当疯狂,考虑到这一点,表现已经不错了。
这些游戏居然能玩,而且代码水平比我强 100 倍,从某个角度来看,这挺让人沮丧的。那个 ThreeJS 的大佬发帖说他对继续做下去感到泄气,虽然我从来不是那种在 WebGL 上折腾太多的开发者,但我也感同身受。
- _matthew_
我觉得把提示词设得那么短没意义。这基本上是在评测模型如何解读一个过于模糊的提示词。如果我们要以此为评分标准,提示词至少应该是“在单个 HTML 页面中创建一个吃豆人克隆版,并忠实于原作”。
- jmathai
这个提示词是测试模型如何填补缺失上下文的好方法,因为它太笼统了。它们确实在进步。
还记得人们认为你只要在提示词里写上“你是一位熟练的作家……”就是天才的时候吗?