大規模言語モデルは自分の内部状態を内省できるのか?

Emergent Introspective Awareness in Large Language Models

大規模言語モデルは自分の内部状態を内省できるのか?

大規模言語モデルが自身の内部状態を内省できるかどうかを検証した研究。会話だけでは本物の内省と作り話を区別できないため、既知の概念の表現をモデルの活性化に注入し、その操作が自己報告に与える影響を測定した。その結果、特定のシナリオでは注入された概念を検出・識別できることが判明。また、過去の内部表現を想起し、生のテキスト入力と区別する能力も示した。さらに、自身の出力と人工的なプレフィルを区別するために意図を想起できるモデルもあった。Claude Opus 4と4.1が最も高い内省能力を示したが、モデル間の傾向は複雑で、ポストトレーニング戦略に敏感だった。

我々の結果は、現在の言語モデルが自身の内部状態に対して機能的な内省認識をある程度備えていることを示している。

同じ日のその他の記事

2026-08-11