La verdad no es una dirección: un ataque de Tarski a las sondas de LLM
Truth is not a direction: a Tarski attack on LLM probes

Demuestro que ninguna sonda sobre el espacio de embeddings de un LLM puede capturar la verdad universal. Aunque las sondas lineales funcionan bien en casos simples, un ataque diagonal basado en la paradoja de Tarski revela que cualquier lenguaje lo suficientemente expresivo para describir su propia semántica no puede contener un predicado de verdad total. Por tanto, los oráculos de verdad en IA son matemáticamente imposibles.
No hay ninguna sonda definible sobre el espacio de representación de un modelo que pueda capturar exactamente la verdad para cualquier lenguaje lo suficientemente rico como para describir esa sonda y sus salidas.