真理は方向ではない:LLM 探針に対する Tarski 攻撃
Truth is not a direction: a Tarski attack on LLM probes

LLM の埋め込み空間に「真理」を示す方向が存在するという仮説について、Tarski の自己言及のパラドックスを用いて反論します。言語モデルは自身の出力を記述できるほど表現力が高いため、万能な真理探針は数学的に存在し得ません。単なる方向への投影では、論理的な矛盾を回避できず、AI が絶対的な真理の神として機能することは不可能であることを示します。
「モデルの表現空間上で定義可能な探針は、その探針自体と出力を記述できるほど豊かな言語に対して、真理を正確に捉えることは決してできない。」