PacBench - AI 모델의 팩맨 원샷 성능 벤치마크
Show HN: Pac-Bench – How well can models one-shot a Pac-Man game?
PacBench는 다양한 AI 모델이 단 한 번의 프롬프트로 팩맨 게임을 얼마나 잘 구현하는지 평가하는 공개 벤치마크입니다. Claude Code, Antigravity, Gemini, Grok Bot, gpt-6 Codex 등 여러 모델의 결과를 비교하며, 실행 시간, 토큰 수, 비용, HTML 크기 등의 지표를 제공합니다. GitHub에서 소스 코드를 확인할 수 있어 AI 모델의 창의적 문제 해결 능력을 직접 살펴볼 수 있습니다.
AI 모델이 단 한 번의 시도로 팩맨 게임을 얼마나 잘 만들어내는지 직접 확인해보세요.
HN 토론
45- yambam
이건 몇십 년 전에 친구 몇 명이랑 각자 10시간 안에 최대한 완성도 높은 Pac-Man 클론을 만들어보는 도전을 했던 게 떠오르네요. 우리 중 아무도 게임 프로그래밍이나 그래픽 코딩 경험이 없었어요. 정말 재미있었고 다들 많이 배웠죠.
아무도 완전한 클론을 만들지는 못했지만, 픽셀 단위로 완벽한 그래픽에 집중한 사람도 있고 게임플레이 정확도에 집중한 사람도 있는 등 각자 다른 부분에 집중하게 된 점, 그리고 뭘 하는지도 잘 모르면서 각자 가진 기존 기술을 도전에 쏟아부은 점이 정말 좋았어요.
만약 그때 AI 모델이 있었다면 스스로 해결해 나가는 즐거움을 망쳤을 것 같아요. 그런 경험을 못 하게 될 다음 세대 개발자들이 좀 안타깝네요.
- drcxd
흥미롭네요, 최근에 저도 Pac-Man 클론을 직접 만들고 있어요. LLM 구현은 세부 사항을 많이 놓쳐요. 원작을 1:1로 재현하지 못하죠. 예를 들어 고스트의 행동이 원작과 같지 않아요. 제가 직접 게임을 구현해보지 않았다면 차이점을 알 수 없었을 거예요. LLM이 만든 건 원작 게임처럼 보이지만, 실제로는 아니에요.
- _matthew_
프롬프트가 저렇게 짧은 게 말이 된다고 생각하지 않아요. 이건 사실 모델이 지나치게 모호한 프롬프트를 어떻게 해석하는지에 대한 벤치마크잖아요. 적어도 "단일 HTML 페이지에 Pac-Man 클론을 만들어라. 원작에 충실하게 만들어라" 정도는 되어야 그걸 기준으로 평가하는 거죠.
- weitendorf
실례를 무릅쓰고 말하자면, 이건 흥미롭거나 유용한 벤치마크가 아니라고 생각해요.
분명히 지금 이걸 위해 새로운 RLAAS/데이터셋/환경이 쓰이고 있는 것 같아요(그렇게 복잡해 보이지도 않아요. 하나의 LLM이 게임플레이가 원작 게임으로 인식 가능한지 판단하고, 다른 하나는 논리적/의미적으로 동일한 버전의 게임을 구현하려고 하는 거죠). 그래서 이 작업에서의 성능 향상이 그렇게 극적으로 나타난 거고요.
그 때문에 이 벤치마크는 곧 모든 모델이 0에서 1로 갈 거예요.
- jmathai
이 프롬프트는 너무 두루뭉술해서 모델이 빠진 맥락을 얼마나 잘 채우는지 테스트하기에 좋은 방법이에요. 확실히 나아지고 있네요.
"당신은 능숙한 작가입니다...." 같은 프롬프트를 쓰면 천재 취급받던 시절이 기억나네요.