Warum keine LLM-Wahrheitsprobe existieren kann: Ein Tarski-Angriff

Truth is not a direction: a Tarski attack on LLM probes

Warum keine LLM-Wahrheitsprobe existieren kann: Ein Tarski-Angriff

Ich zeige, dass keine Probe im Embedding-Raum von LLMs die Wahrheit exakt erfassen kann. Ähnlich wie Gödels Unvollständigkeitssatz führt die Selbstreferenz in ausgedrückten Sprachen zu einem Paradoxon. Selbst wenn einfache Klassifikatoren gut funktionieren, scheitern sie an diagonalen Angriffen, die ihre eigene Ausgabe beschreiben.

Keine definierbare Probe über dem Repräsentationsraum eines Modells kann die Wahrheit für eine Sprache exakt erfassen, die reichhaltig genug ist, um diese Probe und ihre Ausgaben zu beschreiben.

Mehr von diesem Tag

2026-07-29