ARC-AGI-3 리더보드 공개: 최신 AI 모델들, 비용 대비 성능 격차 드러나
ARC-AGI Leaderboard

ARC Prize가 ARC-AGI-3 리더보드를 공개했습니다. 이 벤치마크는 에이전트가 새로운 인터랙티브 환경에 즉각 적응하는 능력을 측정합니다. 현재 1위는 Anthropic의 Claude Opus 5로 30.2%의 정확도를 기록했으며, OpenAI의 GPT-5.6 Sol (Max)이 7.8%로 뒤를 잇습니다. 리더보드는 모델의 성능과 비용 간의 관계를 보여주며, 추론 시간을 늘릴수록 성능이 어떻게 달라지는지 추세선으로 나타냅니다. 또한 Kaggle 대회 참가자들은 $50의 제한된 컴퓨팅 예산으로 경쟁력 있는 결과를 내는 등 효율성의 중요성을 강조합니다.
진정한 지능은 단지 문제를 해결하는 것만이 아니라, 최소한의 자원으로 효율적으로 해결하는 것입니다.