Flash-MSA: Erste Open-Source-Trainingskernel für sparse Attention auf Hopper und Blackwell

Flash-MSA: Accelerating Million-Token Training with Sparse Attention Kernels

Flash-MSA: Erste Open-Source-Trainingskernel für sparse Attention auf Hopper und Blackwell

Frontier-Modelle wie DeepSeek-V4 und GLM-5.2 setzen auf sparse Attention, um die Inferenz zu beschleunigen, aber effiziente Trainingskernel dafür fehlten bisher. Flash-MSA schließt diese Lücke: Es ist die erste performante Open-Source-Implementierung von MiniMax Sparse Attention (MSA) für Hopper- und Blackwell-GPUs. Die Kernel nutzen Block-Sparsity, GQA statt MLA und eine fusionierte Rückwärtspropagation, die Proxy- und Haupt-Attention gemeinsam trainiert. Dadurch skaliert das Training auf Millionen Tokens, ohne dass die Aufmerksamkeit quadratisch wird. Benchmarks zeigen eine Korrektheit von über 0,99 im Vergleich zu einer eager PyTorch-Implementierung.

In der gesamten Trainingsiteration ist nur der Proxy-Forward quadratisch in der Kontextlänge – alles andere nutzt die gecachten sparse Blöcke aus dem Proxy-Forward.

Mehr von diesem Tag

2026-07-12