La verdad no es una dirección: un ataque de Tarski a las sondas de LLM

Truth is not a direction: a Tarski attack on LLM probes

La verdad no es una dirección: un ataque de Tarski a las sondas de LLM

Demuestro que ninguna sonda sobre el espacio de embeddings de un LLM puede capturar la verdad universal. Aunque las sondas lineales funcionan bien en casos simples, un ataque diagonal basado en la paradoja de Tarski revela que cualquier lenguaje lo suficientemente expresivo para describir su propia semántica no puede contener un predicado de verdad total. Por tanto, los oráculos de verdad en IA son matemáticamente imposibles.

No hay ninguna sonda definible sobre el espacio de representación de un modelo que pueda capturar exactamente la verdad para cualquier lenguaje lo suficientemente rico como para describir esa sonda y sus salidas.
  1. kstenerud

    Puede parecer absurdo incluso sugerir que las IAs superhumanas podrían funcionar como un oráculo de la verdad (a mí me lo parece), pero hay dos razones para tomárselo en serio. Primero, es así como la gran mayoría de la gente las usará en la práctica. Ya están reemplazando los resultados de búsqueda estándar de Google, y he tenido muchas discusiones que terminaron con personas delegando la autoridad final sobre la verdad a una IA.

    Ya hay organizaciones aprovechando esto, produciendo activamente "propaganda para IA", es decir, propaganda dirigida a los propios LLM para influir en su comprensión de lo que es verdadero y doblarla hacia las agendas de actores poderosos. Ni siquiera ocultan el hecho de que están haciendo esto.

  2. baq

    El título es un poco clickbait, pero el contenido vale la pena leerlo: llegué con mi horca lista y me fui de acuerdo con prácticamente todo, con preguntas como '¿qué pasaría si la sonda pudiera devolver 3 dimensiones: veracidad, confianza en el conocimiento y decidibilidad?'

    Además, la observación de que la gente trata a los LLM como oráculos cuando son todo lo contrario es totalmente acertada, algo en lo que también he estado pensando y que es bastante aterrador.

  3. Legend2440

    Creo que este artículo empuja la premisa más allá de lo razonable.

    Lo mejor que cualquiera espera de un "vector de verdad" de un LLM es que codifique la creencia del modelo sobre si la afirmación es verdadera. Por supuesto, un oráculo de la verdad perfecto es imposible.

  4. aesthesia

    Divertido, aunque, como se insinúa al final, el punto de las sondas de "verdad" de los LLM es medir el juicio interno del modelo sobre la veracidad. No hay razón para que este juicio, incluso si se mide con un 100% de precisión, no pueda ser erróneo o lógicamente inconsistente.

  5. tomaskafka

    > Segundo, algunas personas realmente creen en una especie de espacio de representación platónico en el que convergen todos los modelos y que representa el estado "verdadero" del mundo. Si la verdad es de hecho una parte objetiva del mundo, entonces podrías esperar que surgiera una dirección universal de la verdad a medida que los modelos mejoren. Esto

    Esto suena realmente a todas esas historias de ciencia ficción con gente intentando encontrar a Dios en la computadora.

    ¿Cómo podría estar ahí, en el espejo desordenado de textos raspados de internet?

Más de este día

2026-07-29