Warum Chain-of-Thought-Monitoring LLMs niemals sicher machen kann
The Implications of Linguistic Illegibility for LLM Security
LLMs geben Sprache aus, doch ihre internen Berechnungen laufen als Mathematik über Aktivierungsräume – die Übersetzung an den Enden ist verlustbehaftet. Diese "linguistische Unlesbarkeit" bedeutet: Sicherheitsmechanismen, die auf sprachlicher Selbstauskunft beruhen, etwa Chain-of-Thought-Monitoring oder Constitutional Self-Critique, können nie vollständig verlässlich sein. Als Ausweg schlägt der Autor Taint Tracking vor: eine Sandbox, die a priori festlegt, welcher Systemzustand niemals durch modelerzeugte Daten beeinflusst werden darf.
Wenn linguistische Unlesbarkeit immer möglich ist, dann können Sicherheitsmechanismen, die auf der sprachlichen Selbstauskunft eines Modells beruhen, niemals vollständig verlässlich sein.