160 MB Tensor auf 16 kB reduziert: Warum wir Arrays nicht mehr materialisieren

Count the Bytes, Not the FLOPs

160 MB Tensor auf 16 kB reduziert: Warum wir Arrays nicht mehr materialisieren

Die Python-Bibliothek tsbootstrap hat ihren Bootstrap-Algorithmus umgebaut: Statt alle Replikate in einem riesigen Tensor zu materialisieren, nutzt sie jetzt Kernel-Fusion und Streaming. Das spart massiv Speicher und beschleunigt die Berechnungen um das 3,1- bis 20-Fache. Der Artikel erklärt, warum Speicherzugriffe oft der Flaschenhals sind – nicht die Rechenleistung – und wie das Prinzip auch bei großen KI-Modellen wie FlashAttention greift.

Die Kerne waren nie die Grenze; sie verbrachten den Benchmark damit, auf den Speicher zu warten.

Mehr von diesem Tag

2026-07-17