Anthropic lanza el Índice de Razonamiento Conceptual: los modelos aún están lejos de la perfección

Anthropic: Introducing The Conceptual Reasoning Index

Anthropic lanza el Índice de Razonamiento Conceptual: los modelos aún están lejos de la perfección

Anthropic y Redwood Research presentan el Índice de Razonamiento Conceptual (CRI), que agrega tres benchmarks (LMCA, ACCoRD y DTBench) para medir la capacidad de los modelos de IA de razonar sobre cuestiones conceptuales sin retroalimentación empírica. El mejor modelo, Opus 5, obtiene 73.6 sobre un techo estimado de 91. Los resultados muestran un progreso lineal desde 2024, pero aún lejos de saturar en LMCA y ACCoRD, mientras que DTBench ya está cerca del techo.

Una esperanza central para gestionar los riesgos de la IA es que las IA nos ayuden a entender nuestra situación, planificar lo que viene y desarrollar mitigaciones de riesgos.

Más de este día

2026-08-13