PacBench - Benchmark de IA para jugar Pac-Man en un solo intento
Show HN: Pac-Bench – How well can models one-shot a Pac-Man game?
PacBench es un benchmark que evalúa qué tan bien los modelos de IA pueden jugar Pac-Man en un solo intento, sin entrenamiento previo. La plataforma compara modelos como Claude Code, Antigravity con Gemini, Grok Bot y gpt-6 Codex, midiendo métricas como tiempo de ejecución, uso de tokens y costos. Cada entrada incluye el código HTML generado, permitiendo ver el resultado final. Es una herramienta ideal para desarrolladores e investigadores que desean medir la capacidad de razonamiento y creatividad de los LLM en tareas lúdicas y complejas. El proyecto está disponible en GitHub y ofrece una ventana única al rendimiento práctico de la IA.
PacBench muestra cuán lejos puede llegar un modelo de IA cuando se enfrenta a un desafío clásico como Pac-Man en un solo intento.
- yambam
Esto me recuerda a hace un par de décadas, cuando unos amigos y yo nos propusimos el reto de, individualmente, crear cada uno tanto como fuera posible de un clon de Pac-Man en 10 horas. Ninguno de nosotros tenía experiencia en programación de juegos ni en código de gráficos. Fue muy divertido y todos aprendimos mucho.
Ninguno terminó con un clon completo, pero me encantó cómo acabamos centrándonos en cosas diferentes, como gráficos con píxeles perfectos frente a la precisión en la jugabilidad, y cómo todos aportamos nuestras habilidades existentes al reto a pesar de no saber realmente lo que estábamos haciendo.
Creo que si hubiéramos tenido modelos de IA disponibles, habría arruinado el placer de descubrirlo por nosotros mismos. Me siento un poco triste por la próxima generación de desarrolladores que no tendrán esa experiencia.
- drcxd
Interesante, recientemente estoy trabajando en mi propio clon de Pac-Man. Las implementaciones de LLM pierden muchos detalles. No son una réplica 1:1 del juego original. Por ejemplo, el comportamiento de los fantasmas no es el mismo que el original. Si no hubiera implementado el juego yo mismo, no podría notar las diferencias. Lo que producen los LLM se parece al juego original, pero no lo son.
- _matthew_
No creo que tenga sentido que el prompt sea tan corto. Esto es básicamente un benchmark de cómo los modelos interpretan un prompt demasiado vago. Debería ser al menos "Crea un clon de Pac-Man en una sola página HTML. Hazlo fiel al original" si es eso lo que estamos evaluando.
- weitendorf
Voy a ser grosero y decir que no creo que este sea un benchmark interesante o útil, la verdad.
Claramente se está usando ahora algún nuevo RLAAS/dataset/env para esto (ni siquiera parece tan complicado, tienes un juez LLM que determina si la jugabilidad es reconocible como el juego original o no y otro que intenta implementar una versión lógica/semánticamente idéntica del juego). Es por eso que la mejora de rendimiento en esta carga de trabajo ha sido tan drástica.
Todo va a pasar de 0 a 1 en este benchmark en poco tiempo debido a eso.
- jmathai
Este prompt es una buena forma de probar qué tan bien los modelos rellenan el contexto faltante porque es tan poco descriptivo. Definitivamente están mejorando.
¿Recuerdas cuando la gente te consideraba un genio por usar un prompt como "Eres un escritor experto..."?