B200 Attention Kernel: Von Null auf 94,4 % von FlashAttention-4 in 60 Diagrammen
B200 Attention Kernel from Scratch to Near-SOTA in 60 Diagrams

Dieser Blogbeitrag baut einen dichten B200-Attention-Kernel in CUDA und etwas PTX von Grund auf auf – von einer Baseline bis zu 94,4 % der FlashAttention-4-Leistung für 4K-, 8K- und 16K-Sequenzlängen. Der Fokus liegt auf einer visuellen Einführung: 60 Diagramme erklären Schritt für Schritt, wie der naive Kernel funktioniert und wie Optimierungen wie Online-Softmax und Overlapping mit Tensor-Core-MMAs die Leistung steigern. Als Abschlussprojekt wird der Kernel in ein Video-Generierungsmodell integriert. Der Autor erklärt Blackwell-spezifische Konzepte wie tcgen05 und TMEM und richtet sich an Leser mit CUDA-Grundkenntnissen, aber ohne Blackwell-Erfahrung.
Es ist einer der schwierigsten Kernel überhaupt, der auf der neuesten Hardware läuft, also wird es Spaß machen.