Induction Heads: Der Schlüssel zum In-Context-Learning von Transformern
A Mathematical Framework for Transformer Circuits (2021)
Diese Arbeit entwickelt ein mathematisches Framework, um Transformer rückwärts zu entschlüsseln. Durch die Analyse von attention-only Modellen mit bis zu zwei Schichten zeigen die Autoren, dass Attention-Heads als unabhängige, additive Operationen im Residualstrom verstanden werden können. Besonders bemerkenswert: Induktions-Heads, die erst ab zwei Schichten auftreten, erklären In-Context-Learning. Die Erkenntnisse legen den Grundstein für mechanistische Interpretierbarkeit großer Sprachmodelle.
Wir stellen fest, dass bestimmte Attention-Heads, die wir als „Induktions-Heads“ bezeichnen, das In-Context-Learning in diesen kleinen Modellen erklären können und dass sich diese Heads nur in Modellen mit mindestens zwei Attention-Schichten entwickeln.