FIBER:解耦线程与寄存器,重塑GPU执行模型
A Thread-Register Decoupled GPU Execution Model for Efficient Tensor Computation

现代GPU虽然不断集成Tensor Core,但在处理混合非GEMM操作的AI工作负载时,仍受限于固定并行度和粗粒度调度。这项研究提出了FIBER架构,通过扩展GPU的SIMT模型,将执行实例fiber与私有寄存器所有权解耦。fiber仅携带最小控制状态,通过共享视图访问SM寄存器,实现了动态并行扩展和细粒度的寄存器级数据流调度。在典型的混合精度LLM服务场景下,FIBER在Ampere架构上实现了2.25倍的端到端加速,在Hopper和Blackwell上分别达到1.8倍和2.09倍,为矩阵操作数供应提供了无冗余的新方案。
我们识别出的根本瓶颈在于固定并行度和粗粒度调度,这两者都被现代AI工作负载所暴露,这些工作负载将多样化的非GEMM操作与GEMM交织在一起。