Transformerの仕組みを視覚的に完全解説、GPT-2で内部動作を追う
Transformers Explained Visually

Transformer Explainerは、GPT-2(small)の124万パラメータモデルをブラウザ上で動かし、テキスト生成の仕組みを視覚的に解説するインタラクティブツールだ。トークン化から埋め込み、マルチヘッド自己注意、MLP、出力確率まで、各ステップを図解。特に、Query・Key・Valueの役割を検索エンジンに例えて直感的に説明している点がユニーク。
Query(Q)は検索エンジンのバーに打ち込む検索テキストだ。これは「もっと情報を見つけたい」トークンである。Key(K)は検索結果ウィンドウに表示される各ウェブページのタイトルだ。クエリが注目できる可能性のあるトークンを表す。Value(V)は表示されるウェブページの実際の内容である。
HNでの議論
87- noncovalence
うーん、HNをブラウジングしているだけなのに、なんで突然ラップトップが5fpsくらいしか出なくなったんだろう?
バックグラウンドで開いている、あの悪名高い「10秒で2.2GBのRAM使用」タブが原因か:
- jasonjmcghee
初心者には、これ以上おすすめできないくらい勧めたいのが、The Illustrated Transformerだ:
- andblac
よくできてる。私にとってアテンションヘッドの最も魅力的な点は、Attention行列がすでに計算され、Valueベクトルと掛け合わされる部分だ。これは、通常のネットワークのDense層にValueベクトルを通すのと全く同じように振る舞い、Attention行列がその層の重みを形成している。つまり、アテンションヘッドは、推論中にKeyとQueryからこの小さな単層ネットワークを動的に構築するように訓練されている。そして、そこがポイントだ。LLMアーキテクチャの説明ではめったに強調されないし、私にとってこれがとてもうまく機能するのは驚くべきことだ。このメカニズムは、この可視化をクリックして進めていくと簡単に観察できる。
- throw0101a
EEの学位を持つ者として(ただしシステム管理者だが)、この「transformer」という用語の使われ方にはいつも混乱する。:)
(暗号学ではなく暗号通貨を指す「crypto」も同様だ。)
- robrenaud
温度の説明について:
> 「最も確率の高いトークンを選ぶ代わりに、生成テキストの安全性と創造性のバランスを取るために、異なる選択戦略を使うことができる」。
ここで「安全性」は間違いなく間違った言葉だ。
温度0で生成されたテキストは、実際には奇妙な「驚きのなさ」という特徴があり、人工的に見える。[1]
> 「高確率のテキストは退屈だったり繰り返しになったりする。人間は情報を伝達する手段として言語を使い、効率的かつエラーを最小化する方法で同時にそうしようと努める。実際、心理言語学の研究は、人間がこの無意識の目標を持って文字列内の各単語を選ぶことを示唆している。」
ドロップアウトの説明は完全に削除するだろう。私の知る限り、それはもはや現代のレシピの一部ではない。
単一のインタラクティブな可視化でTransformerを説明するという野心的な目標については、ある人が新たに単語埋め込み(word2vecは2014年に私の心を揺さぶった)を理解し、同時にアテンションの理解も得るというのは、ちょっと想像しにくい。
私は明日、Deep Learning Study Group (SF)(非地元民向けにZoomでも)[3]で行う「Full Bandwidth Transformers」[2]に関するプレゼンテーション用に、独自の可視化を作成している。これは単独/文脈自由を意図したものではないが、フィードバックが欲しい。
https://rrenaud.github.io/fullbandwidth_transformer_viz/
[1] https://arxiv.org/abs/2202.00666
[2] https://arxiv.org/abs/2608.08888
[3] https://www.meetup.com/deep-learning-sf/events/316601593/