Anthropic、AIの「概念的推論」能力を測る新指標CRIを公開
Anthropic: Introducing The Conceptual Reasoning Index

AnthropicとRedwood Researchは、AIのリスク軽減に不可欠な概念的推論能力を評価する3つのベンチマーク(LMCA、ACCoRD、DTBench)を開発し、それらを統合したConceptual Reasoning Index(CRI)を公開した。CRIの最高スコアはAnthropicのOpus 5で73.6点(満点は約91)であり、モデルの性能は2024年後半からほぼ直線的に向上している。DTBenchはほぼ飽和状態だが、LMCAとACCoRDはまだ改善の余地が大きい。
残念ながら、高度なAIによるリスク低減には、このようなタスクが多く含まれている。