图解Transformer:从GPT-2看大模型
Transformers Explained Visually

Transformer架构彻底改变了人工智能的发展轨迹,它不仅是OpenAI的GPT、Meta的Llama和Google的Gemini等文本生成模型的基石,更在音频生成、图像识别乃至蛋白质结构预测等领域展现出惊人 versatility。本文通过可视化方式,深入拆解GPT-2模型的核心运作机制:从文本分词(Tokenization)和向量嵌入(Embedding),到核心的自注意力机制(Self-Attention)如何捕捉长距离依赖,再到MLP层如何提炼特征。你将直观看到模型如何通过Query、Key、Value矩阵计算注意力分数,以及Temperature、top-k等参数如何影响最终输出的创造性与确定性。这是一次通往大模型内部世界的清晰旅程。
Transformer的核心创新与强大之处在于其自注意力机制,这使得模型能够处理整个序列,并比之前的架构更有效地捕捉长距离依赖关系。
HN 评论区
87- andblac
做得漂亮。对我来说,attention heads 最迷人的地方在于 Attention 矩阵已经计算完毕并正与 Value 向量相乘的那个环节。它的表现完全就像把 Value 向量推过一个普通网络中的 Dense 层,而 Attention 矩阵构成了该层的权重。因此,attention head 就是在训练过程中学会如何动态地从 Key 和 Query 构建这个小型的单层网络,用于推理阶段。这就是关键所在。这一点在 LLM 架构的讲解中很少被强调,而在我看来,它之所以能如此出色地工作,实在令人惊叹。在这个特定的可视化中,如果你点击浏览,很容易就能观察到这一机制。
- robrenaud
关于 temperature 的解释:
> “与其选择概率最高的 token,我们可以使用不同的选择策略来平衡生成文本中的安全性和创造性”。
“安全性”这个词在这里用错了。
Temperature 0 生成的文本实际上有一种奇怪的“缺乏惊喜”的特质,使其显得不自然。[1]
> “高概率的文本可能枯燥或重复。人类使用语言作为传递信息的手段,旨在以同时高效且最小化错误的方式进行;事实上,心理语言学研究表明,人类在字符串中选择每个词时,都潜意识地抱着这个目标。”
我会完全删掉关于 dropout 的解释。据我所知,它已经不再是现代方案的一部分了。
至于用单个交互式可视化来解释 transformers 的宏大目标,我很难想象一个人能同时全新理解 word embeddings(2014 年 word2vec 让我大开眼界)以及 attention 机制。
我正在为我明天在 Deep Learning Study Group (SF) 上关于“Full Bandwidth Transformers”[2] 的演讲制作自己的可视化(非本地参与者可通过 Zoom 参加)[3]。它并非旨在独立存在或脱离上下文,但我非常希望能得到一些反馈。
https://rrenaud.github.io/fullbandwidth_transformer_viz/
[1] https://arxiv.org/abs/2202.00666
[2] https://arxiv.org/abs/2608.08888
[3] https://www.meetup.com/deep-learning-sf/events/316601593/
- utopcell
很棒的一个网站,描述直观易懂。我以前也发现 [1] 非常有用。
- noncovalence
嗯,我想知道为什么我的笔记本电脑在仅仅浏览 HN 时突然掉到 5 fps?
后台那个作恶的标签页: