Jevman - Pac-Man benchmark for AI decision models

Show HN: Jevman – AI decision models play Pac-Man

Jevman - Pac-Man benchmark for AI decision models

Jevman — это открытый бенчмарк, который оценивает способность AI-моделей принимать решения в реальном времени, играя в классический Pac-Man. Каждая модель управляет Пакманом на каждом перекрёстке, получая состояние лабиринта в JSON и возвращая вероятности направлений. Шесть моделей, включая jev 1.13, GPT-6 Luna, Clef Flash, Clef, Kev 4B и Laya, сыграли по 100 игр против призраков. Результаты показали разброс от 639 до 2 750 очков. Любой может протестировать свою модель, разместив её за HTTP-эндпоинтом и запустив бенчмарк одной командой. Все игры записываются и могут быть воспроизведены для проверки.

Jevman — это открытый бенчмарк, и любая модель за HTTP-эндпоинтом может играть в него: размещённая в облаке, дообученная или запущенная на вашем ноутбуке.
  1. nico

    Очень круто, а вы также тестируете локальные модели/классификаторы, которые можно запускать и обучать на CPU?

    Я обучил несколько, чтобы они делали интересные вещи, включая игру в doom: https://github.com/nicobrenner/jeffy

    Попробую обучить одну для этого бенчмарка, звучит весело

  2. bayarearefugee

    Платить 2 цента за игру, чтобы не играть в неё.

    Что вообще за реальность.

  3. NichoPaolucci

    Это классно. По крайней мере, я всё ещё лучше моделей играю в pac-man.

    Ещё нравится идея общего пула, чтобы пользователи могли пробовать разные вещи. Я рассматривал скорее краудфандинговый подход для одного из своих игрушечных проектов, что-то вроде... Дать ему $10 кредитов для начала и как-то позволить пользователям докидывать бакс, если захочется.

Ещё за этот день

2026-10-09