Claude Opus 5 de Anthropic lidera ARC-AGI-3 con 30.2%, pero el costo por tarea se dispara a $20.7K

ARC-AGI Leaderboard

Claude Opus 5 de Anthropic lidera ARC-AGI-3 con 30.2%, pero el costo por tarea se dispara a $20.7K

El leaderboard de ARC Prize revela que Claude Opus 5 de Anthropic alcanza un 30.2% en ARC-AGI-3, superando a GPT-5.6 Sol de OpenAI (7.8%) y a Grok 4.5 de xAI (0.3%). Sin embargo, el costo por tarea es de $20.7K, muy por encima de los $25.1K de GPT-5.6 Sol. ARC-AGI-3, que evalúa la adaptación en entornos interactivos novedosos, sigue siendo un desafío: los modelos de razonamiento como CoT muestran mejoras, pero la eficiencia es clave. La tabla incluye sistemas de Anthropic, OpenAI, xAI, Google y otros, con métricas de costo, precisión y enlaces a papers.

La inteligencia real no se trata solo de resolver problemas, sino de resolverlos eficientemente con recursos mínimos.

Más de este día

2026-07-25