Transformerの内部回路を数学で解き明かす——2層モデルに潜む「induction head」

A Mathematical Framework for Transformer Circuits (2021)

Transformerの内部計算を機械論的に解釈するため、2層以下のattention-onlyモデルを数学的に分解した研究。attention headを独立した加算操作と捉え、QK回路とOV回路に分離。2層モデルではheadの合成により「induction head」が生じ、in-context learningを実現することを発見。重みから直接アルゴリズムを検出できることを示した。

特定のattention head——我々が「induction head」と呼ぶもの——がこれらの小規模モデルにおけるin-context learningを説明でき、これらのheadは少なくとも2つのattention層を持つモデルでのみ発達することを発見した。
  1. myself248

    B-H曲線や励磁電流については何も触れていない。きっと別の種類のトランス、別の種類の回路の話なんだろう。

  2. _jayhack_

    LLMが示した異質な能力を考えると、一般大衆がmechinterpにほとんど関心を示さないのは衝撃的だ。これとそれに続くtransformer-circuits.pubの出版物は、数年後には古典的で基礎的な研究と見なされるだろう。

  3. amelius

    > 以前のプロジェクトであるDistill Circuitsスレッドは、視覚モデルのリバースエンジニアリングを試みたが、これまでのところトランスフォーマーや言語モデルに匹敵するプロジェクトは存在しない。

    それはどの程度成功したのか?

この日のほかの記事

2026-09-12