MLA 与 MTP 为何互斥:算术强度揭秘
Attention Through Arithmetic Intensity

阅读 Su Jianlin 的文章时,我注意到一个有趣观点:MLA 在解码阶段像极了 head_dims 大于 512 的 MQA,提前消耗了大量算力,导致与 MTP 难以兼容。顺着这个疑问深入探究,我发现了“算术强度”(Arithmetic Intensity)这一关键指标。文章通过推导 MHA、GQA、MQA 和 MLA 在单 token 解码时的 FLOPs 与 HBM 字节比,揭示了 MLA 独特的常数因子如何改变 GPU 的瓶颈状态。当算术强度跨越硬件阈值,工作负载从内存受限转向计算受限,这正是 MLA 与 MTP 产生冲突的数学根源。
低算术强度意味着 GPU 大部分时间都在搬运数据,而高算术强度则意味着每份数据一旦到达就会被重复用于大量算术运算。