Математический фреймворк вскрывает внутренние алгоритмы трансформеров
A Mathematical Framework for Transformer Circuits (2021)
Исследователи из команды Transformer Circuits предлагают математический подход к механистической интерпретации трансформеров. Они анализируют игрушечные модели без MLP-слоёв и показывают, что однослойные трансформеры реализуют биграммы и «скип-триграммы», а двухслойные — композиции голов внимания, включая induction heads, объясняющие in-context обучение. Работа закладывает основу для обратной разработки больших языковых моделей.
Мы обнаружили, что конкретные головы внимания, которые мы называем «induction heads», могут объяснить in-context обучение в этих малых моделях, и что эти головы развиваются только в моделях как минимум с двумя слоями внимания.