神经网络内部竟藏着符号结构?
The Emergent Symbolic Structure of Artificial Neural Networks
现代 AI 系统看似基于连续向量,却在逻辑、代码等需要符号处理的领域表现卓越,这背后究竟有何玄机?最新研究提出,神经网络内部可能隐含着符号结构。研究人员发现,无论是小型网络还是大型语言模型(LLM),其向量表示都能被符号结构精准近似。更令人惊讶的是,通过直接干预这些识别出的符号结构,可以精准修改 LLM 的行为。这一发现为调和传统符号智能观与现代向量 AI 提供了全新视角,揭示了神经网络运作的深层逻辑。
尽管表面上看并非如此,但神经网络的内部表征或许隐式地实现了符号结构。
HN 评论区
64- sigpwned
我从中得出的几个核心问题是:
(1) 他们声称能够生成(包括 LLM 在内的)看似双射的闭式符号表示/近似。评估这些闭式表示在计算上是否更高效?如果答案是肯定的,其影响可能巨大。这本质上就是解析蒸馏(analytic distillation)。将“寓言”(Fable)部署在芯片上而非数据中心,在许多方面都至关重要——且具有颠覆性。
(2) 无监督甚至监督式的符号化问题解决途径,往往会因组合爆炸等问题而失效。这可能让我们将 LLM 的训练和推理视为一种搜索算法,用于寻找解决以往其他方法无法触及的新型复杂问题类别的全新符号化方案。如果这行得通,我怀疑这也是一种反馈循环——一种表示形式的学习成果会推动另一种的进步。这也提升了大规模训练运行的经济价值,因为模型本身变得有价值,而不仅仅是其推理能力。
(3) 基于上述,这能否推动 LLM 设计迈向更强的能力?
这一点与 Anthropic 的 J-space 观察之间的关系也很有趣。不过,这项工作的深度要深得多,且更具直接可操作性。
编辑:我把我的问题拿给 Sonnet 跑了一遍——是的,我欣赏这种讽刺——它对问题 (1) 和 (2) 并不太乐观,但认为 (3) 是合理的。无论如何,这是一篇相当不错的论文。反思之后,我认为 appa […]
- jsrozner
某些监督式*可解释性方法的一个大问题是,它们可能会发现虚假结构。(让模型按你希望的方式行事有很多方法;这大致就是 Hewitt 和 Liang 在 2019 年展示的内容)。这篇论文在第 20 页将其与之前的方法 DAS(分布式对齐搜索)进行了对比。这些及相关方法都建立在因果抽象理论之上,理论上很棒,但实践中更难。例如,DAS 最近就面临诸多批评(Makelov 2024, Meloux 2025, Sutter 2025, Grant 2026, Kumon 2026)。我最喜欢的是相当易懂的 Meloux 等人;Sutter 2025 也非常出色,但它依赖一种实数论证,允许对每个输入进行无损编码。
我即将在 EMNLP 发表的论文提供了一种替代方案,它将“表示”的概念建立在非常简单的概念之上:即当你对其进行对抗性扰动时,它对模型学习/行为产生的影响。例如,如果我告诉模型在上下文“我看到一只鸭子在嘎嘎叫”中应将 'duck' 替换为 'glam',那么它在“我需要溜出会议”与“在公园里,一只鸭子保护着她的幼鸭”这两个句子中,分别有多大的意愿将 'duck' 替换为 'glam'?事实证明这种方法效果相当不错,而且由于我们只使用单个示例,因此避免了需要监督数据。
链接中的论文认为他们的方法 DISCOVER 与 DAS 不同,不是监督式的,因为它不直接优化因果效应。我只是粗略浏览了一下,但 I […]
- squidbeak
阅读这类内容(作为外行),将这些东西贬低为‘下一个词预测器’似乎荒谬地简化了问题。迟早我们得承认,‘选择’(selection)比‘预测’(prediction)是更准确的术语。
- gps372
在阅读这篇文章时,我不禁在想,这比能够从字节码恢复 Java 程序有什么更有趣的地方。所以我问了 Copilot 同样的问题。它回答说——“老实说,这正是工程师和研究者之间区别显现的地方!”
- jkingsman
这里的数学和核心实验超出了我的能力范围,但我理解的是:LLM 中可能存在更深层次的表示模式,这些模式是语法核心概念关系的蒸馏,我们可以从数学角度理解它们,而不是那种看似被层间涂抹的噪声,却又以某种无法解释(在有意义层面上)的方式解析为正确的语法/推理。
这很酷。希望我理解得大致正确。