PacBench - モデルがPac-Manをワンショットでどこまで攻略できるかをベンチマーク

Show HN: Pac-Bench – How well can models one-shot a Pac-Man game?

PacBenchは、AIモデルがPac-Manをどれだけワンショットで攻略できるかを評価するベンチマークです。Claude Code、OpenRouter、Gemini、Grok Bot、gpt-6 Codexなど複数のモデルを対象に、実行時間やトークン数、コスト、HTMLサイズなどの統計を収集・比較。モデルごとの性能を客観的に測定し、AIのゲーム理解度やコード生成能力を可視化します。GitHubで公開されており、誰でも結果を確認できます。

モデルがPac-Manをワンショットでどれだけ攻略できるか、その実力をベンチマークで明らかにします。
  1. yambam

    これは数十年前、友人たちと私が、それぞれが10時間以内にできるだけ完全なPac-Manクローンを個人で作るという挑戦をしたことを思い出させる。私たちは誰もゲームプログラミングやグラフィックコーディングの経験がなかった。とても楽しかったし、みんな多くのことを学んだ。

    結局誰も完全なクローンは作れなかったが、ピクセルパーフェクトなグラフィックとゲームプレイの正確さなど、それぞれが異なる点に焦点を当てるようになったこと、そして何をしているのかよくわかっていないにもかかわらず、既存のスキルを挑戦に持ち込んだことが好きだった。

    もしAIモデルが利用可能だったら、自分たちで解決する喜びを台無しにしていただろうと思う。その経験を持たない次の世代の開発者たちには少し悲しい気持ちになる。

  2. drcxd

    面白い、最近私は自分でPac-Manのクローンを作っている。LLMの実装は多くの詳細を失う。オリジナルのゲームを1:1で再現しているわけではない。例えば、ゴーストの挙動がオリジナルと同じではない。自分でゲームを実装していなければ、違いはわからないだろう。LLMが生成したものはオリジナルのゲームのように見えるが、そうではない。

  3. _matthew_

    プロンプトがそんなに短いのは意味がないと思う。これは基本的に、モデルが過度に曖昧なプロンプトをどう解釈するかのベンチマークだ。もしそれを評価するなら、少なくとも「Create a pacman clone in a single html page. Make it faithful to the original」であるべきだ。

  4. weitendorf

    失礼かもしれないが、正直これは面白くも有用なベンチマークだとは思わない。

    明らかに何か新しいRLAAS/データセット/環境が使われている(それほど複雑でもなさそうだ。あるLLMがゲームプレイがオリジナルゲームとして認識できるかどうかを判断し、別のLLMが論理的/意味的に同一のバージョンのゲームを実装しようとしている)。だからこのワークロードでの性能向上がこれほど劇的だったのだ。

    そのせいで、このベンチマークはすぐにすべてが0→1になるだろう。

  5. jmathai

    このプロンプトはとても曖昧なので、モデルが欠落したコンテキストをどれだけうまく補完できるかをテストする良い方法だ。確実に改善している。

    「あなたは熟練したライターです…」というプロンプトで天才扱いされた時代を覚えているだろうか。

この日のほかの記事

2026-09-29