Scott Aaronson: la autorreferencia no fue necesaria para crear la inteligencia conversacional
LLMs and Self-Referentiality
Scott Aaronson reflexiona sobre cómo los LLMs han logrado una inteligencia conversacional sin necesidad de incorporar explícitamente la autorreferencia o los "bucles extraños" que Douglas Hofstadter y Roger Penrose consideraban esenciales. Aaronson argumenta que la capacidad de los modelos para hablar de sí mismos surgió como un subproducto de su entrenamiento en vastos corpus de texto, al igual que la autorreferencia emerge de la universalidad en sistemas formales o computadoras. Sostiene que las ideas que realmente se han validado son las que vinculan inteligencia con predicción, compresión y complejidad de Kolmogorov, mientras que la autorreferencia explícita debería ser enterrada entre las grandes ideas erróneas de la historia. La conciencia y la experiencia subjetiva siguen siendo misterios sin resolver.
Pero la idea de que necesitarías autorreferencialidad explícita antes de poder obtener una inteligencia conversacional convincente y que cambie el mundo, que sea enterrada en una Abadía de Westminster o en el Cementerio Nacional de Arlington para las ideas erróneas más importantes de la historia humana: geocentrismo, la física teleológica de Aristóteles, el éter, el flogisto, la psicología de Freud, la predicción de Marx de un levantamiento obrero seguido de una utopía sin clases, etc. Pero enterrada necesita estar.
- thatjoeoverthr
Su falta de autorreferencia es un problema central que subyace a muchos de los fallos que ocurren durante la inferencia, pero su amplitud combinada con el arnés de agente lo cubre bien, así que requiere un poco de indagación para presenciarlo. El fenómeno de la "alucinación" es exactamente esto. No conocen el alcance de su propio conocimiento y simplemente dicen cosas, así que si sales del rango esperado, hay una mayor probabilidad de que emitan afirmaciones que no son ciertas. RAG (no me refiero a índices de embeddings, sino a cualquier ingesta de información, como un arnés de agente que ejecuta una búsqueda) es algo efectivo para cubrir esto, lo suficiente como para hacerlos muy útiles. Pero cuando falla, generalmente es por las mismas razones. Tiene cierta naturaleza y a veces te topas con ella.
Pero supongo que no perjudica su razonamiento.
- m-hodges
He usado conceptos de GEB mucho en mi pensamiento sobre cómo funcionan los LLM.
Sobre la autorreferencialidad y el rompecabezas MU: https://matthodges.com/posts/2025-04-21-openai-o4-mini-high-...
Sobre los límites gödelianos de la IA segura mediante prompts: https://matthodges.com/posts/2025-08-26-music-to-break-model...
Sobre la línea difusa entre el reconocimiento de patrones y el razonamiento: https://matthodges.com/posts/2026-08-19-bongard-problems/
Me alegra que el autor de este post termine con:
> ¿Qué queda? La conciencia
porque cuando he leído (y releído) GEB, encuentro que el libro es mucho más profundo que un simple umbral para la inteligencia conversacional.
- gwd
Dos comentarios al respecto, tratando de adoptar un enfoque de "qué hipótesis se ajusta a la evidencia".
Primero, que un LLM describa su propia experiencia no es realmente prueba de que tenga alguna experiencia de la que ser consciente, del mismo modo que un LLM que afirma con confianza cualquier otro hecho no significa que sepa que ese hecho es verdadero. Los LLM describirán música o sabores, a pesar de que nunca han oído ni probado nada, basándose solo en lo que han leído sobre ellos. De la misma manera, un "autocompletado picante no consciente" produciría un LLM que hablara de su propia experiencia, basándose solo en la entrada que tiene de personas hablando de su propia experiencia.
Dicho esto / en segundo lugar, por lo poco que entiendo de la arquitectura de los LLM, creo que hay un gran número de mecanismos autorreferenciales incorporados. Por un lado, casi todos los transformers tienen una "capa residual", con varias redes neuronales que esencialmente la leen y la modifican. Esto efectivamente forma un bucle. Además, el mecanismo de "pensamiento" le permite leer lo que ha escrito y generar más cosas, lo que de nuevo es un bucle.
Así que, tal vez la gente no pensó: "Oye, deberíamos construir algunos bucles, quizás eso lo haga consciente". Pero si el "bucle extraño" es lo que define la conciencia, hay muchos bucles ahí dentro sobre los cuales un bucle extraño podría concebiblemente formarse.
- macleginn
"¿Pero la idea de que necesitarías autorreferencialidad explícita antes de poder obtener una inteligencia conversacional convincente y que cambie el mundo?" — ¿alguien ha formulado alguna vez esta idea real o algo lógicamente equivalente? Esto parece un hombre de paja poderoso.
- killerstorm
Quizás la autorreferencialidad "verdadera" no fue necesaria. Pero parece que la "retroalimentación dinámica" es esencial, y parece ser adyacente a la autorreferencialidad.
Si observamos el proceso de optimización, primero hace una pasada hacia adelante que produce la salida. Luego examina los cálculos que ocurrieron durante la pasada hacia adelante (con esto me refiero a la retropropagación), y ajusta los parámetros de tal manera que podría producir una mejor salida.
Formulado de esta manera, suena como autorreferencialidad (¡el sistema examina lo que acaba de hacer!), pero, por supuesto, la implementación es bastante simple: solo almacena las activaciones de la pasada hacia adelante. Y el proceso de entrenamiento incluye no solo el código que hace la pasada hacia adelante, sino también una descripción completa de ese cálculo que permite hacer la pasada hacia atrás. Así que es una especie de autorreferencialidad desenrollada que no es difícil de implementar.
Quizás se pueda implementar un aprendizaje más eficiente si los investigadores descubren un truco para evitar dos pasadas separadas y distintas. Nuestros cerebros no hacen una retropropagación global y son más eficientes en cuanto a muestras.