LLM Attention Visualizer - Interaktive Visualisierung des Attention-Mechanismus
Show HN: LLM Attention Visualization
Der LLM Attention Visualizer macht den Attention-Mechanismus großer Sprachmodelle sichtbar. Tippen oder fahren Sie mit der Maus über generierte Token, um zu sehen, welche vorherigen Token die Generierung beeinflusst haben. Die Visualisierung zeigt, wie das Modell Informationen aus verschiedenen Quellen kombiniert, z.B. beim Kopieren von Adressen oder beim Reparieren von Code. Das Tool nutzt ein kleines Modell (600 Millionen Parameter) und läuft direkt im Browser. Vorgefertigte Beispiele laden sofort, eine eigene Generierung ist über ein instrumentiertes ONNX-Modell möglich. Der Code ist auf GitHub verfügbar.
Mit diesem Mechanismus kann man sehen, dass das Modell nicht die gesamte Sequenz aus begrenzten internen Zuständen vorhersagt – da es Zugriff auf alle vorherigen Token hat, kann es einfach entscheiden, welche Token es beim Kopieren heranzieht, wodurch die Fehlerwahrscheinlichkeit sehr gering ist.
- MCP123
Das ist großartig, danke. Ich muss das am Freitag unterrichten, also perfektes Timing. Es ist schwer, den Attention-Mechanismus so zu erklären, dass er intuitiv wird, weil das Gewichtungsschema nicht viel zur Intuition beiträgt. Eine solche Visualisierung hilft sehr. Bitte verschiebt die Seite nicht, da ich darauf verlinken werde!
- fuddle
Das ist großartig, ich habe mehrere Bücher gelesen und Videos über den Attention-Mechanismus angeschaut. Jetzt, wo ich es verstehe, ist das das klarste Beispiel, das ich gesehen habe, wie Attention funktioniert.
- wopak
Nett, die Kombination von Informationen aus zwei Phrasen ist ohne ein solches Werkzeug schwer zu erkennen. Machst du dir Sorgen, dass Attention in späteren Schichten von früheren Schichten übertönt wird, nur weil mehr von ihnen zur Summe beitragen?