Jevman - Pac-Man benchmark for AI decision models
Show HN: Jevman – AI decision models play Pac-Man

Jevman — это открытый бенчмарк, который оценивает способность AI-моделей принимать решения в реальном времени, играя в классический Pac-Man. Каждая модель управляет Пакманом на каждом перекрёстке, получая состояние лабиринта в JSON и возвращая вероятности направлений. Шесть моделей, включая jev 1.13, GPT-6 Luna, Clef Flash, Clef, Kev 4B и Laya, сыграли по 100 игр против призраков. Результаты показали разброс от 639 до 2 750 очков. Любой может протестировать свою модель, разместив её за HTTP-эндпоинтом и запустив бенчмарк одной командой. Все игры записываются и могут быть воспроизведены для проверки.
Jevman — это открытый бенчмарк, и любая модель за HTTP-эндпоинтом может играть в него: размещённая в облаке, дообученная или запущенная на вашем ноутбуке.
- nico
Очень круто, а вы также тестируете локальные модели/классификаторы, которые можно запускать и обучать на CPU?
Я обучил несколько, чтобы они делали интересные вещи, включая игру в doom: https://github.com/nicobrenner/jeffy
Попробую обучить одну для этого бенчмарка, звучит весело
- bayarearefugee
Платить 2 цента за игру, чтобы не играть в неё.
Что вообще за реальность.
- NichoPaolucci
Это классно. По крайней мере, я всё ещё лучше моделей играю в pac-man.
Ещё нравится идея общего пула, чтобы пользователи могли пробовать разные вещи. Я рассматривал скорее краудфандинговый подход для одного из своих игрушечных проектов, что-то вроде... Дать ему $10 кредитов для начала и как-то позволить пользователям докидывать бакс, если захочется.