Transformer 电路的数学框架与归纳头
A Mathematical Framework for Transformer Circuits (2021)
随着 GPT-3 等 Transformer 模型的广泛应用,其内部运作机制却日益成为黑盒。本文提出了一套数学框架,旨在通过逆向工程拆解这些模型的底层逻辑。研究聚焦于仅包含 Attention 层的简化模型,发现零层模型仅统计二元语法,而两层模型则能通过 Attention 头的组合实现复杂的“归纳头”算法,从而解释上下文学习能力。文章揭示了 Attention 头作为独立运算单元的特性,以及残差流作为通信通道的本质,为理解大模型的安全性与行为提供了新的视角。
机制可解释性试图逆向工程 Transformer 执行的详细计算,就像程序员尝试将复杂的二进制文件逆向为人类可读的源代码。
HN 评论区
17- libraryofbabel
让我感到震惊的是,考虑到 LLM 展现出的那些近乎外星般的能力,大众对机械可解释性(mechinterp)的关注度竟然如此之低——这篇论文以及随后 transformer-circuits.pub 发布的一系列文章,在几年后必将被视为经典的基础性工作。