大規模言語モデルは自分の内部状態を内省できるのか?
Emergent Introspective Awareness in Large Language Models

大規模言語モデルが自身の内部状態を内省できるかどうかを検証した研究。会話だけでは本物の内省と作り話を区別できないため、既知の概念の表現をモデルの活性化に注入し、その操作が自己報告に与える影響を測定した。その結果、特定のシナリオでは注入された概念を検出・識別できることが判明。また、過去の内部表現を想起し、生のテキスト入力と区別する能力も示した。さらに、自身の出力と人工的なプレフィルを区別するために意図を想起できるモデルもあった。Claude Opus 4と4.1が最も高い内省能力を示したが、モデル間の傾向は複雑で、ポストトレーニング戦略に敏感だった。
我々の結果は、現在の言語モデルが自身の内部状態に対して機能的な内省認識をある程度備えていることを示している。
HNでの議論
33- Retro_Dev
> 全体として、我々の結果は、現在の言語モデルが自身の内部状態についてある程度の機能的な内省的認識を持っていることを示している。今日のモデルでは、この能力は非常に信頼性が低く、文脈に依存することを強調しておく。しかし、モデルの能力がさらに向上するにつれて、この能力も発展し続ける可能性がある。
- skybrian
以前、10月にAnthropicのブログに投稿されたもの。(同じバージョンではないかもしれないが?)
- pyaamb
LLMがここからどの方向に発展していくかを考えるとき、モデルが自己内省できる能力がその有用性を飛躍的に向上させるだろうと思わずにはいられない。それを達成するための研究開発は私の手に負えないが。どうやって誰かに内省の仕方を訓練するのか?また、訓練と推論を分離しない継続学習アーキテクチャが必要になるのだろうか?
- magekinnarus
自己認識は能力と直接的な関係はない。それは創発的な特性を生み出す条件に完全に依存している。
- whythismatters
> 2026年1月5日に提出