Un marco matemático para entender los transformer

A Mathematical Framework for Transformer Circuits (2021)

Investigadores de Anthropic proponen un marco matemático para la interpretabilidad mecanicista de transformers. Al simplificar el modelo a capas de atención sin MLP, descubren que las cabezas de atención operan de forma independiente y aditiva, y que las 'induction heads' explican el aprendizaje en contexto en modelos de dos capas. Este enfoque permite descomponer el residual stream en canales de comunicación y allana el camino para futuros avances en la comprensión de modelos más grandes.

Las 'induction heads' pueden explicar el aprendizaje en contexto en estos modelos pequeños, y estas cabezas solo se desarrollan en modelos con al menos dos capas de atención.

Más de este día

2026-09-12