Pac-Bench - Benchmarking AI models on one-shot Pac-Man

Show HN: Pac-Bench – How well can models one-shot a Pac-Man game?

Pac-Bench ist ein Benchmark, der testet, wie gut KI-Modelle Pac-Man in nur einem Versuch (one-shot) erstellen können. Entwickler reichen kurze Prompts ein, und Modelle wie GPT-6, Grok und Gemini generieren spielbare Pac-Man-Varianten. Die Plattform vergleicht Leistung, Token-Verbrauch und Kosten und bietet eine einzigartige Möglichkeit, die Kreativität und Effizienz moderner LLMs zu messen. Ein unterhaltsamer und aufschlussreicher Wettbewerb für KI-Enthusiasten.

Modelle müssen Pac-Man mit nur einem einzigen Versuch erstellen – ein spannender Test für ihre Fähigkeiten.
  1. yambam

    Das erinnert mich an ein paar Jahrzehnte zurück, als ein paar Freunde und ich uns selbst eine Challenge gestellt haben: jeder von uns sollte in 10 Stunden so viel wie möglich von einem Pac-Man-Klon erstellen. Keiner von uns hatte irgendeine Erfahrung mit Spieleprogrammierung oder Grafikprogrammierung. Es hat riesigen Spaß gemacht und wir haben alle viel gelernt.

    Am Ende hatte keiner einen vollständigen Klon, aber ich fand es toll, wie wir uns alle auf unterschiedliche Dinge konzentriert haben, etwa pixelgenaue Grafik versus Genauigkeit im Gameplay, und wie wir alle unsere vorhandenen Fähigkeiten in die Challenge eingebracht haben, obwohl wir eigentlich nicht wirklich wussten, was wir taten.

    Ich vermute, wenn wir KI-Modelle zur Verfügung gehabt hätten, hätte das den Spaß verdorben, es selbst herauszufinden. Ich bin irgendwie traurig für die nächste Generation von Entwicklern, die diese Erfahrung nicht machen wird.

  2. drcxd

    Interessant, ich arbeite gerade an meinem eigenen Pac-Man-Klon. LLM-Implementierungen verlieren viele Details. Sie sind keine 1:1-Nachbildung des Originalspiels. Zum Beispiel ist das Verhalten der Geister nicht dasselbe wie im Original. Wenn ich das Spiel nicht selbst implementiert hätte, könnte ich die Unterschiede nicht erkennen. Was das LLM produziert, sieht aus wie das Originalspiel, ist es aber nicht.

  3. _matthew_

    Ich glaube nicht, dass es Sinn ergibt, den Prompt so kurz zu halten. Das ist im Grunde ein Benchmark dafür, wie Modelle einen übermäßig vagen Prompt interpretieren. Es sollte zumindest „Erstelle einen Pac-Man-Klon auf einer einzelnen HTML-Seite. Mach ihn originalgetreu“ heißen, wenn das das ist, worauf wir bewerten.

  4. weitendorf

    Ich werde mal unhöflich sein und sagen, dass ich das ehrlich gesagt nicht für einen interessanten oder nützlichen Benchmark halte.

    Offensichtlich wird dafür jetzt ein neues RLAAS/Dataset/Env verwendet (es scheint nicht einmal besonders kompliziert zu sein: Man hat ein LLM, das beurteilt, ob das Gameplay als das Originalspiel erkennbar ist oder nicht, und ein anderes, das versucht, eine logisch/semantisch identische Version des Spiels zu implementieren). Deshalb war die Leistungsverbesserung bei dieser Aufgabe so dramatisch.

    Alles wird bei diesem Benchmark in kurzer Zeit von 0 auf 1 gehen, genau deswegen.

  5. jmathai

    Dieser Prompt ist eine gute Möglichkeit zu testen, wie gut Modelle fehlenden Kontext ergänzen, weil er so nichtssagend ist. Sie werden definitiv besser.

    Erinnert ihr euch, als Leute dich für einen Prompt wie „Du bist ein begabter Autor....“ für ein Genie hielten?

Mehr von diesem Tag

2026-09-29