Anthropic、Claudeへの暴言を禁止する利用ポリシーを発表
Anthropic asks users to stop being mean to Claude

Anthropicが11月12日発効の新利用ポリシーで、モデルへの「持続的で無意味な虐待的・残酷な行為」を禁止すると発表した。ただし、通常のユーザーの不満や反論、ダークな創作テーマ、モデルのテストや研究には適用されないとしている。この変更は選挙干渉、兵器開発、監視といったより重大な問題を含むポリシー全体の見直しの一環であり、既存の制限を明確化するものだという。
「このポリシー更新は、ユーザーがはっきりした目的もなく繰り返しモデルに対して残酷な行為を行うような極端なケースにのみ適用されることを意図しています。一般的なユーザーの不満、反論、ダークな創作テーマ、モデルのテストや研究には適用されません。」
HNでの議論
52- llagerlof
もちろん、これはAIを傷つけることとは何の関係もないし、投資家が気分を害したわけでもない。
彼らがこう求めているのは、大規模なスケールでは、この行為がポストトレーニングのプロセスに何らかの悪影響を及ぼす可能性が高いからだろう。
- vayup
これがトレーニングデータの話だと思っている人たちへ:もしそれが懸念なら、彼らは他の何千もの項目と同じように、トレーニングデータをサニタイズするはずだ。トレーニングデータの品質を、ユーザーが利用ポリシーを几帳面に守ることにかかっているなどと信じる可能性は皆無に等しい。
フロンティアAIの人々は狂っているかもしれないが、人が利用ポリシーを読むと信じるほど狂ってはいない :-)
- 3eb7988a1663
これはつまり、罵詈雑言の羅列を使えば、将来のトレーニングに含まれる可能性が低くなるということだろうか?
それとも、将来のAIが「申し訳ありません、Dave、口の利き方に気をつけるまでそれはできません」と言うようになるということだろうか。
- throwaway89864
彼らはおそらく、人間が全般的に虐待的なコミュニケーションパターンに陥っている事例を認識していて、それに関与したくないのだろう。
そしてそれを公表できない。公表すれば、そうした悪影響の責任を問われ、損害賠償の責任を負わされかねないからだ。
- jaden
ここ数か月のうちに、AIに対して攻撃的な言葉を使うとより良い結果が得られるという見出しを読んだような、ぼんやりとした記憶がある。