Transformer visuell erklärt: So funktioniert GPT-2 im Detail
Transformers Explained Visually

Der Transformer Explainer ist ein interaktives Tool, das die Funktionsweise von Transformer-Modellen am Beispiel von GPT-2 (small) mit 124 Millionen Parametern veranschaulicht. Es zeigt Schritt für Schritt, wie Text in Token zerlegt, in Embeddings umgewandelt und durch 12 Transformer-Blöcke mit Multi-Head Self-Attention und MLP verarbeitet wird, bis hin zur Wahrscheinlichkeitsverteilung für das nächste Token. Die Visualisierung macht die komplexe Architektur greifbar und dient als Einstieg in moderne LLMs.
Die Kerninnovation und Stärke von Transformern liegt in der Nutzung des Self-Attention-Mechanismus, der es ihnen ermöglicht, gesamte Sequenzen zu verarbeiten und weitreichende Abhängigkeiten effektiver zu erfassen als frühere Architekturen.