AI 연구소는 '펠리컨 맥시밍'을 하고 있을까? 1,008개 SVG 실험 결과
Are AI Labs Pelicanmaxxing?

Simon Willison의 'SVG로 자전거 타는 펠리컨 그리기' 프롬프트는 비공식 AI 벤치마크로 유명해졌습니다. Dylan Castillo는 7개 최첨단 모델(GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash 등)로 1,008개의 SVG를 생성하고, LLM 심사위원과 회귀 분석을 통해 AI 연구소들이 이 벤치마크에 맞춰 모델을 최적화했는지('pelicanmaxxing') 조사했습니다. 결과는 명확했습니다. 펠리컨 순위는 8개 동물 중 6위, 자전거는 6개 탈것 중 5위였고, 특정 조합에 대한 유의미한 향상도 없었습니다. 단, Gemini 3.5 Flash의 자전거 효과만 통계적으로 유의했지만, 다중 비교 보정 후에는 사라졌습니다. 저자는 벤치마크 최적화의 증거를 찾지 못했지만, 실험의 한계(단일 LLM 판정, SVG 전반 최적화 가능성)를 인정합니다.
AI 연구소들이 벤치마크에 맞춰 훈련했다면 펠리컨이 상위에 있을 것으로 예상했지만, 실제로는 8개 동물 중 6위에 그쳤습니다.