Transformerの内部回路を数学で解き明かす——2層モデルに潜む「induction head」
A Mathematical Framework for Transformer Circuits (2021)
Transformerの内部計算を機械論的に解釈するため、2層以下のattention-onlyモデルを数学的に分解した研究。attention headを独立した加算操作と捉え、QK回路とOV回路に分離。2層モデルではheadの合成により「induction head」が生じ、in-context learningを実現することを発見。重みから直接アルゴリズムを検出できることを示した。
特定のattention head——我々が「induction head」と呼ぶもの——がこれらの小規模モデルにおけるin-context learningを説明でき、これらのheadは少なくとも2つのattention層を持つモデルでのみ発達することを発見した。
HNでの議論
17- myself248
B-H曲線や励磁電流については何も触れていない。きっと別の種類のトランス、別の種類の回路の話なんだろう。
- _jayhack_
LLMが示した異質な能力を考えると、一般大衆がmechinterpにほとんど関心を示さないのは衝撃的だ。これとそれに続くtransformer-circuits.pubの出版物は、数年後には古典的で基礎的な研究と見なされるだろう。
- amelius
> 以前のプロジェクトであるDistill Circuitsスレッドは、視覚モデルのリバースエンジニアリングを試みたが、これまでのところトランスフォーマーや言語モデルに匹敵するプロジェクトは存在しない。
それはどの程度成功したのか?