Anthropic: Konzeptueller Denkindex misst, wie gut KI bei philosophischen Fragen argumentiert
Anthropic: Introducing The Conceptual Reasoning Index

Anthropic und Redwood Research stellen den Conceptual Reasoning Index (CRI) vor, der die Fähigkeit von KI-Modellen bewertet, über konzeptionelle Fragen zu argumentieren, bei denen es keine empirische Überprüfung gibt. Der Index kombiniert drei Benchmarks: LMCA (Argumentationsqualität), ACCoRD (logische Konsistenz) und DTBench (Entscheidungstheorie). Die besten Modelle erreichen 73,6 von 91 möglichen Punkten; DTBench ist bereits nahe der Sättigung, während LMCA und ACCoRD noch Luft nach oben haben. Die Autoren argumentieren, dass diese Fähigkeiten entscheidend sind, um KI-Risiken zu managen.
Die höchste Punktzahl erreicht Opus 5 mit 73,6 (95 % KI: ± 2,1), immer noch deutlich unter der geschätzten Obergrenze von etwa 91.