Transformer 내부를 수학으로 해부하다: 2층 이하 모델에서 발견한 induction head
A Mathematical Framework for Transformer Circuits (2021)
Transformer 언어 모델의 내부 동작을 역설계하는 mechanistic interpretability 연구. 2층 이하의 attention-only toy 모델을 분석해 zero layer는 bigram 통계, 1층은 skip-trigram, 2층은 attention head 조합으로 더 복잡한 알고리즘을 구현함을 보인다. 특히 2층에서만 나타나는 induction head가 in-context learning을 설명하며, 이는 더 큰 모델로 이어지는 중요한 전환점이다.
특히 우리가 “induction head”라고 부르는 특정 attention head가 이 작은 모델들의 in-context learning을 설명할 수 있으며, 이 head는 최소 두 개의 attention layer가 있는 모델에서만 발달한다는 사실을 발견했다.