Block-Low-Rank-Inferenz: 3,76× schnellere Foundation Models auf GPUs mit wenig Speicher
Accelerating Block Low-Rank Foundation Model Inference on MemoryConstrained GPUs

Block-Low-Rank-Kompression (BLR) wie Monarch und BLAST verspricht kleinere Foundation Models bei erhaltener Genauigkeit. Doch auf speicherlimitierten GPUs wie der Jetson Orin Nano oder A40 verpuffen die theoretischen Vorteile: Multi-Token-Inferenz wird zum Memory-Engpass. Eine Roofline-Analyse deckt auf, dass zusätzlicher Datenverkehr und PyTorch-Compiler-Limits die linearen Schichten in den speichergebundenen Bereich drücken. Die Forscher entwickeln daher eigene Triton-Kernel mit partieller Fusion, Umordnung von Operationen und speicheroptimierten Layouts. Auf NVIDIA-GPUs erreichen sie so bis zu 3,76× Beschleunigung und 3× Modellkompression gegenüber dichten PyTorch-Baselines – getestet mit Llama-7B/1B, GPT2-S, DiT-XL/2 und ViT-B.
Unsere Kernel liefern auf speicherlimitierten NVIDIA-GPUs wie Jetson Orin Nano und A40 bis zu 3,76× Beschleunigung und 3× Modellkompression gegenüber dichten PyTorch-Baselines mit CUDA-Backend und Compiler-Optimierungen.