LLMの「言語的不透明性」により、言語ベースのセキュリティは根本的に破綻する

The Implications of Linguistic Illegibility for LLM Security

LLMの内部計算は言語ではなく活性化空間上の数学として行われ、外部に出力される言語や機構的に抽出された特徴はモデルの思考を正確に反映しない。この「言語的不透明性」が常に起こり得るなら、chain-of-thought監視や憲法的自己批判など言語的自己報告に依存するセキュリティは完全には健全たり得ない。論文は、モデルの出力をtaint trackingで追跡するサンドボックスを提案し、仮想化や第三者監査と組み合わせることで言語モニタリングの下支えとなる防護層を形成し、最近のフロンティアモデルによるサンドボックス攻撃を緩和できたと論じる。

言語的不透明性が常に可能であるなら、モデルの言語的自己報告に依存するセキュリティ機構(例:chain-of-thought監視、憲法的自己批判、言語的に定義された特徴ベクトルのための活性化プロービング)は決して完全には健全たり得ず、モデルサンドボックスはモデルの言語的状態を読むことに全く依存しない保証を持つ分離技術を常に必要とするだろう。

この日のほかの記事

2026-09-18