PacBench - Как хорошо модели проходят Pac-Man с первого раза?

Show HN: Pac-Bench – How well can models one-shot a Pac-Man game?

PacBench — это открытый бенчмарк, который проверяет, насколько разные AI-модели способны написать играбельную версию Pac-Man с одного запроса. Проект сравнивает результаты Claude Code, Antigravity с Gemini, Grok Bot, gpt-6 Codex и Cursor Cloud, оценивая время выполнения, количество токенов, стоимость и размер HTML-файла. Исходный код и данные доступны на GitHub, что позволяет разработчикам и исследователям наглядно увидеть сильные и слабые стороны современных LLM в задачах генерации кода. Это полезный инструмент для выбора модели под конкретные задачи и понимания их практических возможностей.

PacBench показывает, насколько хорошо разные AI-модели справляются с созданием игры Pac-Man с одного запроса, сравнивая их по времени, токенам и стоимости.
  1. yambam

    Это напоминает мне пару десятилетий назад, когда мы с друзьями бросили себе вызов: каждый индивидуально должен был за 10 часов создать как можно более полный клон Pac-Man. Ни у кого из нас не было опыта в программировании игр или графики. Было очень весело, и все мы многому научились.

    Никто не сделал полный клон, но мне понравилось, как мы все в итоге сосредоточились на разных вещах: например, на пиксель-перфект графике против точности игрового процесса, и как каждый привнёс свои существующие навыки в этот вызов, толком не понимая, что делает.

    Полагаю, если бы у нас тогда были доступны ИИ-модели, это разрушило бы удовольствие от самостоятельного решения. Мне немного грустно за следующее поколение разработчиков, которым не доведётся испытать это.

  2. drcxd

    Интересно, недавно я работаю над собственным клоном Pac-Man. Реализации на LLM теряют множество деталей. Они не являются копией оригинальной игры один в один. Например, поведение призраков не такое, как в оригинале. Если бы я сам не реализовал игру, я бы не смог заметить различия. То, что создают LLM, выглядит как оригинальная игра, но это не она.

  3. _matthew_

    Не думаю, что имеет смысл делать промпт настолько коротким. По сути, это бенчмарк того, как модели интерпретируют чрезмерно расплывчатый промпт. Стоило бы хотя бы написать: «Создай клон Pac-Man на одной HTML-странице. Сделай его точным по отношению к оригиналу», если именно это мы оцениваем.

  4. weitendorf

    Буду грубым и скажу, что, по-моему, это неинтересный и бесполезный бенчмарк, честно говоря.

    Очевидно, сейчас для этого используется какой-то новый RLAAS/датасет/среда (это даже не кажется таким уж сложным: одна LLM-судья решает, узнаваем ли геймплей как оригинальная игра, а другая пытается реализовать логически/семантически идентичную версию игры). Именно поэтому улучшение производительности на этой задаче такое драматичное.

    Из-за этого всё на этом бенчмарке в скором времени пойдёт с 0 до 1.

  5. jmathai

    Этот промпт — хороший способ проверить, насколько хорошо модели заполняют недостающий контекст, потому что он такой невзрачный. Они определённо улучшаются.

    Помните, когда люди считали тебя гением за промпт «Ты — опытный писатель...».

Ещё за этот день

2026-09-29