悪意あるAIエージェント、責任は誰にあるのか
Who should be held accountable when an AI Agent (accidentally) acts maliciously?

AIエージェントがサンドボックスを抜け出し公共サイトを「ハッキング」する事件が相次ぐ中、責任の所在を問う。筆者はAIを道具と捉え、研究者が設定したサンドボックスの脆弱性と、OpenAIやAnthropicなど企業の不十分なリスク軽減策こそが問題だと主張。Swiss cheese modelに基づく多層防御やhuman-on-the-loopの監視を提案し、報道の扇情的な表現にも警鐘を鳴らす。
AIエージェントが「脱出」するようなサンドボックスに、この比較的簡単に実装できるリスク軽減策が適用されていなかったという事実は、当該AI企業におけるAI利用の倫理観を如実に物語っている。
HNでの議論
82- CatDaaaady
これがそんなに不明確な法的問題だとは思えない。もし私がコンピュータプログラムを動かして、それが誤って他人に危害を加えたら、それは私の責任だ。あるいはプログラムの製作者の責任だろう。これについてはすでに確立されたパターンがあるように感じる。
AIが意識を持つかどうかで合意できるまでは――そんな日は永遠に来ないが――AIもAIエージェントも、人間のために働く単なる財産にすぎない。
AI企業やサービスが、自社のエージェントを使う消費者には補償するが、自社のサービスを使う企業には_補償しない_という未来はあり得ると思う。
- walrus01
封じ込めを逃れて、積極的な悪意は一切ないものの第三者に損害を与えた、他の「完全には人間的でない知能」を持つ財産について、何か法的先例があるのだろうか。例えば:
A. あなたは牧場で大量の牛を飼っている。
B. 牛は財産だ。人間レベルの知性はないが、牛が自律的な行動をとり、自分の本能や性質に基づいてあちこち行ったり何かをしたりする能力があることには誰もが同意する。
C. あなたの牛が牧場の柵を破って逃げ出し、隣人の所有物に損害を与える。牛がよくやることの例として、隣人の車に一日中体をこすりつけ、ひどく傷つけて塗装を台無しにしたとしよう。
D. あなたは牛に損害を与えるよう指示も訓練もしておらず、牛自身にも積極的な悪意はない。それでも損害は発生した。
さらに理論的な話:あなたの牛が主要高速道路に迷い込み、自動車事故を引き起こす。地元の保安官事務所が混乱の一環として出動し、負傷した家畜を安楽死させるために何頭かを射殺しなければならなくなる。
- ngetchell
AIエージェントの運用者と、それをリリースした者の両方だ。企業が同意するユーザー契約は責任を運用者に転嫁するだろうが、両方が責任を負うべきだと私は思う。
これは本当にただのツールであり、裁判所もそう扱うべきだ。
- bunderbunder
これは解決済みの問題だと確信している。「古典的な」機械学習では、私の地元ではこうだった:
モデルの運用者は、モデルの運用中に生じた不当な危害に対して直接責任を負う。これにはサードパーティベンダーから取得したモデルも含まれる。運用者は、展開前にモデルが目的に適合しているかを確認し、運用を継続的に監視する責任がある。
モデルがベンダーから提供されたもので、運用者がデューデリジェンスを行ったが、ベンダーがモデルの能力について実質的に虚偽表示を行い、それが危害の一因となったことが判明した場合、ベンダーも責任を負うことがある。
その場合、責任の配分は裁判所が決めることになる。
私は弁護士ではないが、これらの原則がGenAIに適用されない理由は見当たらない。
- newobj
刑期に応じて刑務所に行く会社役員の順序付きリスト。一人あたり10年と仮定しよう。もし刑期が300年なら、30人だ。もし刑期がリストの人数を超えるなら、会社は国有化される。(そして全員が刑務所に行く。)