Las redes neuronales esconden estructuras simbólicas, según un estudio

The Emergent Symbolic Structure of Artificial Neural Networks

Un estudio de arXiv revela que las redes neuronales, incluidos los grandes modelos de lenguaje (LLMs), pueden aproximarse mediante estructuras simbólicas cerradas. Los investigadores reemplazaron el proceso generador de representaciones con ecuaciones que instancian dichas estructuras, manteniendo el comportamiento del modelo casi intacto en aritmética, lógica, código y lenguaje. Además, lograron modificar el comportamiento de un LLM con intervenciones precisas en sus representaciones internas, demostrando que estas estructuras son funcionalmente relevantes. El hallazgo sugiere una reconciliación entre las concepciones simbólicas de la inteligencia y el enfoque vectorial de la IA moderna.

A pesar de las apariencias, quizás las representaciones internas de las redes neuronales realizan implícitamente una estructura simbólica.
  1. sigpwned

    Las grandes preguntas que me llevo son:

    (1) Afirman producir representaciones/aproximaciones simbólicas en forma cerrada aparentemente biyectivas de, entre otras cosas, LLMs. ¿Evaluar estas representaciones en forma cerrada es más eficiente computacionalmente? Las implicaciones son potencialmente enormes. Sería esencialmente destilación analítica. Una fábula en un chip y no un centro de datos sería importante — y disruptiva — en muchos sentidos.

    (2) Los enfoques simbólicos no supervisados, e incluso supervisados, para resolver problemas se descomponen debido a la explosión combinatoria, entre otras cosas. Esto podría permitirnos tratar el entrenamiento e inferencia de LLMs como un algoritmo de búsqueda de nuevos enfoques simbólicos para resolver nuevas clases de problemas complejos hasta ahora inalcanzables mediante otros métodos. Si eso funciona, sospecho que también es un bucle de retroalimentación: los aprendizajes de una representación impulsan avances en la otra. Esto también aumentaría el valor económico de los grandes entrenamientos, ya que el modelo en sí ahora es valioso, no solo su inferencia.

    (3) Según lo anterior, ¿puede esto impulsar el diseño de LLMs hacia mayores capacidades?

    La relación entre esto y la observación del espacio J de Anthropic también es interesante. Sin embargo, esto es mucho, mucho más profundo y directamente accionable.

    EDIT: Pasé mis preguntas por Sonnet — sí, aprecio la ironía — y no fue muy optimista sobre las preguntas (1) y (2), pero pensó que (3) era razonable. En cualquier caso, este es un gran artículo. Reflexionando, creo que la apa...

  2. jsrozner

    Un gran problema con algunos de estos enfoques de interpretabilidad supervisada* es que pueden encontrar estructura espuria. (Hay muchas formas de hacer que el modelo haga lo que quieres; que es más o menos lo que mostraron Hewitt y Liang 2019). Este artículo contrasta con un método anterior, DAS (búsqueda de alineación distribuida) en la página 20. Estos y métodos relacionados se basan en teorías de abstracción causal, que son excelentes en teoría, pero más difíciles en la práctica. DAS, por ejemplo, ha enfrentado numerosas críticas recientes (Makelov 2024, Meloux 2025, Sutter 2025, Grant 2026, Kumon 2026). Mi favorito es el bastante accesible Meloux et al.; Sutter 2025 también es realmente bueno, pero se basa en un tipo de argumento de números reales que permite una codificación sin pérdidas de cada entrada.

    Mi próximo artículo en EMNLP ofrece una alternativa que fundamenta la noción de representación en una noción muy simple del efecto que tiene en el aprendizaje/comportamiento del modelo cuando lo perturbas adversarialmente. Por ejemplo, si le digo a un modelo que en el contexto "vi un pato graznando" debería reemplazar 'pato' con 'glam', ¿cuánto desea reemplazar 'pato' con 'glam' en "necesito esquivar la reunión" (duck out) vs. "en el parque un pato protegía a sus patitos"? Este método resulta funcionar bastante bien, y como usamos solo un ejemplo, evita la necesidad de supervisión.

    El artículo vinculado argumenta que su método, DISCOVER, no está supervisado de la misma manera que DAS, ya que no optimiza directamente el efecto causal. Solo lo he hojeado, pero yo...

  3. gps372

    Mientras reviso el artículo, me preguntaba por qué esto es más interesante que poder recuperar programas Java a partir del bytecode. Así que le hice la misma pregunta a Copilot. Me dijo que - "¡Honestamente, aquí es donde se nota la diferencia entre un ingeniero y un investigador!".

  4. jkingsman

    Las matemáticas y la experimentación central aquí están más allá de mis habilidades, pero lo que creo entender es que hay posibles patrones más profundos de representación que existen en los LLMs y que son destilaciones de relaciones conceptuales centrales en la gramática que podemos comprender en un sentido matemático en lugar del aparente ruido disperso en capas que, de alguna manera, sin interpretabilidad (en un sentido significativo), se resuelve en gramática/inferencias correctas.

    Eso es bastante genial. Espero haberlo entendido más o menos bien.

  5. 4b11b4

    Suena razonable... Que el modelo a veces aprende una representación vectorial con pérdida de algo de naturaleza simbólica... Claro, ¿una red neuronal puede aproximar una función?

    Dicen que esto se cumple en... ¿Algunos ejemplos que encontraron?

    No sé lo suficiente sobre esta área

Más de este día

2026-09-02