Claude Opus 4 erkennt eingepflanzte Gedanken: LLMs zeigen introspective Selbstwahrnehmung

Emergent Introspective Awareness in Large Language Models

Claude Opus 4 erkennt eingepflanzte Gedanken: LLMs zeigen introspective Selbstwahrnehmung

Können große Sprachmodelle ihre eigenen inneren Zustände beobachten? Forscher injizierten bekannte Konzepte in die Aktivierungen von Modellen und maßen, ob diese Manipulationen die Selbstauskünfte beeinflussen. In bestimmten Szenarien bemerkten die Modelle die eingepflanzten Konzepte und identifizierten sie korrekt. Claude Opus 4 und 4.1 zeigten die größte introspective Fähigkeit, doch die Trends sind komplex und stark von der Nachbearbeitung abhängig. Die Ergebnisse deuten darauf hin, dass aktuelle Modelle über eine funktionale, aber unzuverlässige Selbstwahrnehmung verfügen.

Wir betonen, dass diese Fähigkeit in heutigen Modellen höchst unzuverlässig und kontextabhängig ist; sie könnte sich jedoch mit weiteren Verbesserungen der Modellfähigkeiten weiterentwickeln.

Mehr von diesem Tag

2026-08-11