GPT-5.6, Grok 4.5, Claude, Muse Spark: 12개 모델이 같은 4개 앱을 만들었다

GPT-5.6, Grok 4.5, Claude, and Muse Spark build the same 4 apps

GPT-5.6, Grok 4.5, Claude, Muse Spark: 12개 모델이 같은 4개 앱을 만들었다

tryai.dev가 지난 빌드오프에 대한 HN 피드백을 반영해 더 큰 규모의 대결을 진행했습니다. GPT-5.6(Sol/Terra/Luna), Grok 4.5, Claude Opus 4.8, Claude Fable 5, Muse Spark 1.1, 그리고 GLM-5.2, Qwen 3.7 Plus, DeepSeek V4 Pro, Kimi K2.6 등 오픈웨이트 모델까지 총 12개 모델이 레이캐스터, 루빅스 큐브, 계산기, 게임 오브 라이프 등 4개 앱을 각 5번씩 만들었습니다. 모든 시도물을 공개하며, 성공률과 비용, 시간을 비교했습니다. 레이캐스터에선 GPT-5.6 Sol이, 루빅스 큐브에선 Claude Fable 5가, 계산기에선 Claude가, 게임 오브 라이프에선 Grok 4.5가 두각을 나타냈습니다.

Muse Spark 1.1은 작동할 때 놀라울 정도로 훌륭했습니다. 다섯 번 중 세 번은 망가졌지만, 작동한 결과물은 Fable과 Sol에 버금갔고 Grok과 Opus보다 나았습니다.