Anthropic、2026年8月のリスク報告書でAIの壊滅的リスクを詳細評価
Anthropic Risk August 2026 [pdf]
Anthropicは2026年8月のリスク報告書を公開し、同社のAIシステムがもたらす壊滅的リスクを包括的に評価した。報告書は、高リスク環境での誤調整、自動化された研究開発、化学・生物兵器の製造という3つの主要な脅威モデルに焦点を当て、各リスクの可能性と影響を分析している。また、リスク軽減策の有効性や、安全性プロセスの失敗事例、AI開発の加速ダイナミクスなども考察している。
我々は、既知の誤調整による壊滅的被害は軽減される可能性が高いと評価しているが、未知の広範な誤調整のリスクは依然として存在する。
HNでの議論
58- datadrivenangel
「当社の社内AI研究開発の取り組みは、AI支援がない場合よりも大幅に速いと考えていますが、まだ2倍には達していません(ただし、不確実であり、測定は困難です)」
つまり、Anthropicは自社の生産性がAIによって2倍にもなっていないと考えているわけですね。興味深いデータポイントです。
- modeless
つまり、1か月前の時点で、彼らの最強の社内モデルはMythosよりも「いくぶん能力が高い」ものの、「Claude Opus 4.6からMythos Previewへの移行で観察されたような能力の飛躍は示していない」ということだ。Mythosのトレーニング完了から5か月以上経っているのだから、その頃にはかなり高性能なモデルを用意していると思っていた。今頃になってようやくそれを持っているか、それとも中国の競合他社が私が思っていたよりも追い上げてきているかのどちらかだ。
- 12ahGA
AI企業はスティーブ・バノンのようにゾーンを氾濫させている。誰にも考える時間を与えない。
- internetter
「請負業者が当社のモデルを評価するための人間のフィードバックデータを収集するシステムを通過するすべてのトラフィックは、生物学的分類子をブロックせずに実行された」
「合計で約1億3300万件のやり取りに達した」
これは結果的に比較的無害だったが、それでも多数のサンドボックスエスケープや、以前にはカスタムURLを介して未公開モデルにアクセスできたことなど、数多くの問題の中で、これは依然として懸念される。これらの企業は、自分たちが負っている責任に十分な重みを与えていないと思う。このような問題は他にどれだけ存在するのだろうか?
- _ache_
Anthropicが「AGIリスク」についてあれほど語りながら、破産リスクについては十分に語らないのはおかしい。