Jevman - Pac-Man benchmark for AI decision models

Show HN: Jevman – AI decision models play Pac-Man

Jevman - Pac-Man benchmark for AI decision models

Jevman es un benchmark open source que evalúa modelos de decisión de IA jugando al clásico Pac-Man. Cada modelo se conecta mediante un endpoint HTTP y recibe el laberinto en JSON, debiendo elegir una dirección en cada cruce con un límite de 2 segundos. Se enfrentan a los fantasmas clásicos en 100 partidas, midiendo puntuación media, supervivencia, latencia y coste. Modelos como jev 1.13 de TypeSafe, GPT-6 Luna de OpenAI, Clef Flash de Cloudflare y Kev 4B compiten en una tabla de clasificación. Cualquiera puede añadir su propio modelo con un pull request y verificar resultados mediante repeticiones exactas.

Cada partida se graba y se reproduce exactamente, así que cualquier resultado puede comprobarse.
  1. nico

    Muy interesante, ¿también estás probando modelos/clasificadores locales que se puedan ejecutar/entrenar en CPU?

    Entrené algunos para hacer cosas interesantes, como jugar a Doom: https://github.com/nicobrenner/jeffy

    Voy a intentar entrenar uno para este benchmark, parece divertido

  2. bayarearefugee

    Pagar 2 centavos por partida para evitar jugarlo.

    ¿Qué clase de realidad es esta?

  3. NichoPaolucci

    Esto está genial. Al menos sigo siendo mejor que los modelos en el Pac-Man.

    También me encanta la idea de un fondo común para que los usuarios prueben cosas. Estaba considerando un enfoque más de crowdfunding para uno de mis proyectos de juguete, algo como... Darle $10 en créditos para empezar y de alguna manera permitir que los usuarios aporten un dólar si quieren.

Más de este día

2026-10-09