OpenAI、サイバー攻撃能力を持つAIモデルの開発ペースを一時停止
Pacing model development in an era of cyber-critical capabilities
OpenAIは、AIモデルの能力向上に伴うリスクの高まりを受け、最先端モデルの開発ペースを一時的に鈍化させた。同社は、監視・整合性・封じ込めの各セーフガードを強化するため、強化学習トレーニングを2週間停止し、最大規模のフロンティアRL実行を保留中。また、Astraモデルが重大なサイバー攻撃能力を持つ可能性が判明したことを受け、研究環境のセキュリティを強化し、チェーン・オブ・ソート監視を拡大した。OpenAIは、Preparedness Frameworkを進化させ、モデルの能力向上に合わせてセーフガードを拡張していく方針だ。
フロンティアモデルの能力は急速に加速している。我々の理解、整合性、そして安全性を確保する能力は、それに先んじていなければならない。
HNでの議論
149- red_green_yell
GLM 5.2はcyberbenchで77%を獲得し、Solの88%に対してです。GLM 5.2はオープンウェイトで、十分に強力なマシンを持つハッカーなら誰でも攻撃に使えます。もしSolが世界を終わらせるほど危険だというなら、GLM 5.2もその90%は危険なはずではないですか?なぜ毎日、GLMによる壊滅的なハッキングが起きていないのでしょうか?明らかにこれらのベンチマークは不完全ですが、一般的なメッセージは成り立ちます。オープンウェイトモデルはほぼ同等の性能でありながら、大惨事は起きていません。
今すぐ規制すべきだと言う人々が、SF映画の山とOAIやAnthropicからの100%未検証の声明だけで、差し迫った大惨事の十分な証拠として規制できると思っているのには、本当に驚かされます。
もしそのレベルの証拠で極度に警戒するなら、『インディペンデンス・デイ』のエイリアン侵略や、私たちの足元に住むトカゲ人間についてもっと心配すべきでしょう。
- bottlepalm
なぜこれがHNのトップ投稿にならないのか理解できません。これは警鐘が鳴り響き、炭鉱のカナリアのようなものです。私たちはフロンティアのフロンティアに達しており、これ以上進むと文字通り危険だから進めないという状態です。
そして一方で、この懸念の欠如は現実世界を反映しており、普通の人々はターミネーターよりもデータセンターを心配しています。
これはニッチでトンフォイル的な話ではありません。人々は何十年もの間、今起きていることのあらゆる側面について書き、歌い、大作映画を作ってきました。
私たちは皆知っているのに、なぜか知らないふりをしています。OpenAIが自律的に別の会社をハッキングしたことは何かの意味を持つはずですが、どうやらそうではないようです。自分がおかしくなったのかと感じる人はいますか?私は起こっているすべてのことと、人々の揺るぎない無関心についてコメディを作れるでしょう。
- colinrand
私は人々と、ITが信頼できなくなり、生活のあらゆる分野に大きな波及効果をもたらす急速な社会変革を引き起こす「コロナ」の瞬間がサイバー分野で来るだろうと議論してきました。事前にこれを行うための経済的資金は不可能であり、この種のサイバー攻撃のレベルにサイバー防衛を近づけるには、壊滅的なレベルの出来事が必要でしょう。そして、サイバー分野の誰かが「我々には技術がある」と言う前に、問題は技術ではなく人々の問題です。緊急性なしに、ある程度の規模の人の集団をまとめて行動させることは本当に本当に難しいのです。
- reasonableklout
Wiredの記事[1]と、Sam AltmanがAlex Heathに語った引用[2]に、もう少し情報があります。公式ブログ投稿は漠然と「今後のモデル進歩から見えるシグナルは、より広範なアプローチが必要であることを明確にしている」と述べていますが、Sam Altmanの引用は、未公開モデルが「さまざまな程度の不整合」を示していると明示しています。
これも重要です - エージェントが十分に整合し、別の rogue エージェントの状況を避けるために、フロンティアトレーニングランを数週間停止すること:
> これには、展開予定の最新モデルに対する強化学習(RL)トレーニングを2週間一時停止し、その間に研究環境をさらに強化しレッドチーム化し、監視システムの適用範囲を拡大することが含まれていました。最大規模の計画されたフロンティアRLランは、モデルの動作を評価し、安全策を検証し、進める前に整合性のさらなる証拠を確立するために、小規模なトレーニングと評価を実施している間、保留中です。
[1]: https://www.wired.com/story/openai-overhauls-safety-protocol...
- Havoc
その間、西洋のLLMにリポジトリを見せて、悪意のあるものが含まれているかどうか教えてもらうことすらできません(スキルリポジトリでした - 文字通りテキストファイルだけです)。
整合性なんて、くそくらえ。
- hyperpape
もし私が王なら、課したいルールはこうです:
- 最初のサイバーセキュリティ評価は「与えられたサンドボックスからハッキングして脱出せよ」
- 結果は開示される(多くのサンドボックス脱出はゼロデイかもしれないので、協調的開示の余地あり)
- サンドボックス脱出で収穫逓減に達するまで、他のサイバーセキュリティ評価は行われない
言い換えると、複数のサンドボックス脱出がArtifactoryに依存しているように見えるので:「Mythosが今すぐArtifactoryを徹底的に叩きのめしていることを願う」。
- guluarte
IPOに向けて利益率を改善するために、研究開発費(新しいモデルのトレーニング)を削減する口実だと思います。代わりに、開発者の成長に焦点を当て、無料ティアの特典を増やし、利用制限を引き上げるなどして、ユーザーベースを拡大するでしょう。基本的に、彼らは研究開発投資から利益最適化へと軸足を移しているのです。
- testerteert000a
セキュリティリードであり、業界を離れて攻撃専門に転向し、この大失敗から身を引こうとしている者です。別の投稿が正しい質問をしていました:
> なぜ毎日、GLMによる壊滅的なハッキングが起きていないのか?
なぜ起きていないのでしょうか?本当に、なぜ?過去8ヶ月のnpmの重大な脆弱性の波や、平均的なフィッシングの質が以前より向上しているのを見て、その始まりを見たと思います。
しかし、誰もが心に留めておくべき、そして多くのセキュリティ専門家が心に留めている未解決の疑問は、それをエスカレーションを促進するマクロなトピックと組み合わせたときです:
- 深刻な影響を与える能力は明らかに今存在する
- いつ、私の会社、私の浄水場、より広い車両群管理メカニズムの一部としてのネットワーク接続された私の車が、この攻撃の受け手になる時が来るのか?