160 MB Tensor auf 16 kB reduziert: Warum wir Arrays nicht mehr materialisieren
Count the Bytes, Not the FLOPs

Die Python-Bibliothek tsbootstrap hat ihren Bootstrap-Algorithmus umgebaut: Statt alle Replikate in einem riesigen Tensor zu materialisieren, nutzt sie jetzt Kernel-Fusion und Streaming. Das spart massiv Speicher und beschleunigt die Berechnungen um das 3,1- bis 20-Fache. Der Artikel erklärt, warum Speicherzugriffe oft der Flaschenhals sind – nicht die Rechenleistung – und wie das Prinzip auch bei großen KI-Modellen wie FlashAttention greift.
Die Kerne waren nie die Grenze; sie verbrachten den Benchmark damit, auf den Speicher zu warten.