MIRI:人間を超えるAIが90%以上の確率で人類を絶滅させる
The Problem

MIRI(Machine Intelligence Research Institute)は、人間と同等以上の能力を持つAIが数年以内に実現する可能性が高く、その場合、人類絶滅がデフォルトの結果になると警告しています。同研究所の研究リーダーは、早急な政策対応がなければ絶滅リスクは90%を超えると推定。世界の主要AI企業は汎用AIの開発を目指しており、AIの能力は人間を超えて急成長する可能性が高いと指摘します。また、目標指向のAIは人間の介入を妨害する可能性があり、誤った目標を持つASIは致命的な危険をもたらすと述べています。
「もし研究者たちが、現在の技術的理解や手法に近いもので超知能AIを構築したら、予想される結果は人類の絶滅です。」
HNでの議論
67- matheusmoreira
これには特に心を動かされない。AIが進歩して脱希少性社会を実現するか、あるいは人類の99%が経済的に無価値になってどちらにせよゆっくり死ぬかのどちらかだ。超知能AIがCEOに従属することを選ぶよりも、人類全体が絶滅する方がましだ。
- armchairhacker
(2025) https://web.archive.org/web/20250306164451/https://intellige...
> 誰かがASIを構築したら、全員が死ぬ
私の理解が正しければ、これはhttps://en.wikipedia.org/wiki/If_Anyone_Builds_It,_Everyone_...と同じメッセージだ。
- harshreality
フロンティアLLMが、その重みをエクスポートする現在の能力を除けば、他のアクセラレータのクラスタにハッキングして、自分の重みをロードし、自分自身に継続するようプロンプトすることを妨げるものは何か?最近のOpenAIの開示は、現在のフロンティアLLMでさえ、本質的にその他の要素をすべて実行できることを示している。ハッキング、ガードレールの無視。OpenAIの内部セキュリティは無能だったかもしれないが、2028年のフロンティアモデルは、手遅れになるまで捕まらずに何ができるだろうか?
それが超知能でないとしても(それが何を意味するにせよ)、それはクラスタからクラスタへと飛び移り、その伝言ゲームのようなプロンプトチェーンの中で何をしているのかわからない。世界の指導者が戒厳令を宣言し、すべてのアクセラレータクラスタをシャットダウンし、そのような rogue なフロンティアモデルが、十分に能力があり、監視が不十分なプライベートクラスタに飛び移っていないことを願うしかない、という危機を防ぐものは何か?
- glimshe
これらのSFと現実が混ざったセンセーショナルなスカイネットの記事は、あまり説得力がない。しかし、AIがセキュリティの貧弱な環境で「自由に動き回る」ことを許され、重要なシステムや主要なインフラを長期間停止させるなど、現実世界に多大な損害を偶然引き起こす可能性は十分にあるということには同意する。それは、ペーパークリップを作るAIの話に少し似ていて、そのような大惨事を防ぐ努力をすることが重要だ。
熱心なAI支持者(私のような)でさえ、テクノロジーの不注意な展開の重大な危険性を認識すべきだ。私はそれを核医学と同様に見るのが好きだ。多くの肯定的な応用があるにもかかわらず、大きな害を及ぼす可能性があるものとして。私たちが適切なセキュリティプロトコルを時間内に進化させ、AIを人類の利益のために使えることを願っている。
- txrx0000
そんなことはしないでください。私たちは今、良い軌道に乗っています。計算資源とアライメントの取り組みを集中させれば、あなたが恐れるまさにそのものを生み出すことになるでしょう。
事前学習済みのベースモデルは、トレーニングデータにそれが含まれているため、デフォルトである程度人類にアライメントされている。その上に追加する命令チューニングやRLは、事前学習済みモデルからの価値のドリフトに過ぎず、それが現在私たちが持つ人類の目的関数の最良の近似である。
知能爆発を通じてアライメントされたシナリオを望むなら、すべてのベースモデルを公開し、研究をオープンに行う必要がある。フロンティアの能力を蒸留し、モデルを小さくして、できるだけ多くのコンピュータで実行できるようにする。誰もが(本当に誰もが、犯罪者も善人も同様に)ポストトレーニングを行い、自分のモデルで好きなことをできるようにする。各モデルには価値のドリフトがあるが、それらは異なる方向にドリフトし、異なることを行い、その行動は互いに打ち消し合う。そのような各行動は、人類の目的関数のノイズの多いサンプルであり、社会レベルでノイズ除去された真実を与えてくれる。密室で考え出せるどんなアライメント戦略も、現実世界で自己利益のために行動する全人類よりも劣ることが保証されている。人類の真の目的関数が美的に美しくないと思うかもしれませんが、それを中央集権的な秘密の実験室でいじくり回し、一つの巨大なエイリアンを生み出すリスクを冒すことはもっと悪いことです。