Warum keine LLM-Wahrheitsprobe existieren kann: Ein Tarski-Angriff
Truth is not a direction: a Tarski attack on LLM probes

Ich zeige, dass keine Probe im Embedding-Raum von LLMs die Wahrheit exakt erfassen kann. Ähnlich wie Gödels Unvollständigkeitssatz führt die Selbstreferenz in ausgedrückten Sprachen zu einem Paradoxon. Selbst wenn einfache Klassifikatoren gut funktionieren, scheitern sie an diagonalen Angriffen, die ihre eigene Ausgabe beschreiben.
Keine definierbare Probe über dem Repräsentationsraum eines Modells kann die Wahrheit für eine Sprache exakt erfassen, die reichhaltig genug ist, um diese Probe und ihre Ausgaben zu beschreiben.