Математический фреймворк вскрывает внутренние алгоритмы трансформеров

A Mathematical Framework for Transformer Circuits (2021)

Исследователи из команды Transformer Circuits предлагают математический подход к механистической интерпретации трансформеров. Они анализируют игрушечные модели без MLP-слоёв и показывают, что однослойные трансформеры реализуют биграммы и «скип-триграммы», а двухслойные — композиции голов внимания, включая induction heads, объясняющие in-context обучение. Работа закладывает основу для обратной разработки больших языковых моделей.

Мы обнаружили, что конкретные головы внимания, которые мы называем «induction heads», могут объяснить in-context обучение в этих малых моделях, и что эти головы развиваются только в моделях как минимум с двумя слоями внимания.

Ещё за этот день

2026-09-12