Нейросети скрыто используют символические структуры: новое исследование

The Emergent Symbolic Structure of Artificial Neural Networks

Исследователи из arXiv показали, что внутренние представления нейросетей, включая большие языковые модели (LLM), можно точно аппроксимировать символическими структурами. Они заменили процесс генерации представлений замкнутым уравнением, реализующим символическую структуру, и поведение сетей практически не изменилось. Это справедливо для небольших сетей, обученных манипулировать списками, и для LLM в арифметике, логике, коде и языке. Более того, точные вмешательства во внутренние представления позволили целенаправленно менять поведение LLM, что подтверждает зависимость от выявленных структур. Работа предлагает способ примирить символические концепции интеллекта с векторной природой современного ИИ.

Несмотря на видимость, возможно, внутренние представления нейронных сетей неявно реализуют символическую структуру.
  1. jsrozner

    Большая проблема некоторых из этих контролируемых* подходов к интерпретируемости заключается в том, что они могут находить ложные структуры. (Существует множество способов заставить модель делать то, что вы хотите; примерно это показали Хьюитт и Лян в 2019 году). В этой статье проводится сравнение с предыдущим методом DAS (поиск распределённых соответствий) на странице 20. Эти и родственные методы опираются на теории каузальной абстракции, которые хороши в теории, но сложнее на практике. DAS, например, столкнулся с многочисленной недавней критикой (Макелов 2024, Мелу 2025, Суттер 2025, Грант 2026, Кумон 2026). Мне больше всего нравится довольно доступная работа Мелу и др.; Суттер 2025 тоже очень хорош, но опирается на своего рода аргумент с вещественными числами, который допускает без потерь кодирование каждого входа.

    Моя предстоящая статья на EMNLP предлагает альтернативу, которая вместо этого обосновывает понятие представления на очень простой идее его влияния на обучение/поведение модели, когда вы применяете к нему состязательное возмущение. Например, если я говорю модели, что в контексте "I saw a duck quacking" она должна заменить 'duck' на 'glam', насколько сильно она хочет заменить 'duck' на 'glam' во фразе "I need to duck out of the meeting" по сравнению с "At the park a duck protected her ducklings". Этот метод оказывается довольно хорошо работающим, и, поскольку мы используем только один пример, он позволяет избежать необходимости контроля.

    В связанной статье утверждается, что их метод DISCOVER не является контролируемым в том же смысле, что и DAS, поскольку он напрямую не оптимизирует причинно-следственный эффект. Я только бегло просмотрел её, но я […]

  2. sigpwned

    Крупные вопросы, которые я выношу из этого:

    (1) Они утверждают, что создают, по-видимому, биективные замкнутые символические представления/аппроксимации, среди прочего, LLM. Является ли оценка этих замкнутых представлений более вычислительно эффективной? Последствия этого потенциально огромны. Это была бы по сути аналитическая дистилляция. Басня на чипе, а не в дата-центре, была бы важна — и разрушительна — во многих отношениях.

    (2) Неконтролируемые и даже контролируемые символические подходы к решению проблем разрушаются из-за комбинаторного взрыва, среди прочего. Это потенциально могло бы позволить нам рассматривать обучение и инференс LLM как алгоритм поиска новых символических подходов к решению новых классов сложных проблем, ранее недостижимых другими подходами. Если это сработает, я подозреваю, что это также будет петля обратной связи — знания, полученные из одного представления, продвигают достижения в другом. Это также увеличило бы экономическую ценность больших обучающих прогонов, поскольку сама модель теперь ценна, а не только её инференс.

    (3) Согласно вышесказанному, может ли это подтолкнуть разработку LLM к большим возможностям?

    Связь между этим и наблюдением J-space от Anthropic также интересна. Однако это гораздо, гораздо глубже и более непосредственно применимо.

    ПРИМЕЧАНИЕ: Я прогнал свои вопросы через Sonnet — да, я осознаю иронию — и он был не слишком оптимистичен по вопросам (1) и (2), но считал (3) разумным. В любом случае, это довольно серьёзная статья. Поразмыслив, я действительно думаю, что […]

  3. gps372

    Пока я читаю статью, мне интересно, почему это более интересно, чем возможность восстанавливать Java-программы из байт-кода. Поэтому я задал тот же вопрос Copilot. Он сказал мне, что — "Честно говоря, здесь проявляется разница между инженером и исследователем!"

  4. jkingsman

    Математика и основные эксперименты здесь выше моих способностей, но, как я понимаю, существуют возможные более глубокие паттерны представления, которые существуют в LLM и которые являются дистилляцией основных концептуальных отношений в грамматике, которые мы можем осмыслить математически, а не как кажущийся размазанным по слоям шум, который каким-то образом, неинтерпретируемо (в значимом смысле), разрешается в правильную грамматику/выводы.

    Это довольно круто. Надеюсь, я понял это примерно правильно.

  5. 4b11b4

    Звучит разумно... Что модель иногда изучает представление с потерями в виде вектора чего-то символического по своей природе... Конечно, нейросеть может аппроксимировать функцию?

    Они говорят, что это справедливо для... Некоторых примеров, которые они нашли?

    Я недостаточно знаю об этой области

Ещё за этот день

2026-09-02