Anthropic、AIの「概念的推論」能力を測る新指標CRIを公開
Anthropic: Introducing The Conceptual Reasoning Index

AnthropicとRedwood Researchは、AIのリスク軽減に不可欠な概念的推論能力を評価する3つのベンチマーク(LMCA、ACCoRD、DTBench)を開発し、それらを統合したConceptual Reasoning Index(CRI)を公開した。CRIの最高スコアはAnthropicのOpus 5で73.6点(満点は約91)であり、モデルの性能は2024年後半からほぼ直線的に向上している。DTBenchはほぼ飽和状態だが、LMCAとACCoRDはまだ改善の余地が大きい。
残念ながら、高度なAIによるリスク低減には、このようなタスクが多く含まれている。
HNでの議論
54- lanyard-textile
ああ、そうですか——クローズドソースのベンチマークで、Anthropicが金を払って作って、Anthropicが最高位にランクされた。0/10
- andsoitis
冒頭の一文:
> AIリスクを管理するための核となる希望は、AIが私たちの状況を理解するのを助けてくれることだ
そこで一旦止めて、その前提について深く考えてみてほしい。
- xlayn
私たちは、一般大衆が使えるのは最良かつ最も安全なAIだけを保証するための政策を作ることを可能にする、この指標というアイデアを完全に思いついた....
まったく利益相反もロビー活動もありません
そして、これはあの中国のモデルとは関係ありません... HDとホンダの話と同じではありません...
信じてください、これはボーイングが自社で認証や検査を行うのと同じ種類の素晴らしいことです!
-- 最初の返信: あの愚かなモデルたち、それを使う人たち、彼らは1+1を足すのにしか使えない
-- もう一つ: 彼らも同じことをするだろうから、誰が気にするんだ...
-- バルブの男は嫌な奴で、独占状態にある...
- onomojo
新しいベンチマークを発明したら、見てください、私たちがトップです。他のみんなは私たちに比べて劣っています。特にあの汚いオープンモデルたちは。
- eutropia
これは、AIアライメントの重要な方向性へのささやかな第一歩です。著者らが指摘するように、AIアライメントの作業は通常、経験的に検証しにくく、数学的にモデル化しにくいタスクで構成されているため、通常のRL技術では扱いにくいのです。
私はACCoRDベンチマークが最も興味深いと思います。なぜなら、理論的には、同じモデルの2つのインスタンスをテストするベースラインモードから、`P(A) ≥ P(A&B)` をそれぞれテストして、`P(A)≥ P(A&B) && P(A) ≥ P(A&C) && P(A&B) ≥ P(A&B&C) && P(A&C) ≥ P(A&B&C) ...` などと拡張できるからです。
つまり、モデルインスタンスの群れを集合的に測定して、一貫性をさらに確信を持って確認できるということですよね?
いずれにせよ、モデルの信念の一貫性を測定するという基本的なアイデアだけでも、内省的な手法でモデルにどれだけの信頼を置けるかを制限する能力を向上させます。