Kernels Triton aceleran hasta 3.76× la inferencia de modelos de fundación comprimidos en GPUs con memoria limitada
Accelerating Block Low-Rank Foundation Model Inference on MemoryConstrained GPUs

La compresión de bajo rango por bloques (BLR) reduce el tamaño y el costo computacional de los modelos de fundación, pero en GPUs con memoria limitada la inferencia multi-token puede volverse limitada por memoria, degradando el rendimiento. Un análisis roofline de Monarch y BLAST revela que las optimizaciones del compilador de PyTorch no bastan. Este trabajo presenta kernels Triton con fusión parcial y diseños de memoria optimizados que logran aceleraciones de hasta 3.76× y una compresión de 3× en comparación con las líneas base densas de PyTorch en GPUs como Jetson Orin Nano y A40, manteniendo la precisión en modelos como Llama-7B, GPT2-S, DiT-XL/2 y ViT-B.
Nuestros kernels ofrecen aceleraciones de hasta 3.76× y una compresión del tamaño del modelo de 3× en comparación con las líneas base densas de PyTorch que usan backend CUDA y optimizaciones a nivel de compilador.