AMD MI450 上的 Gluon 内核优化实战
Attention Decode on AMD MI450 GPUs: A Gluon Kernel Optimization Guide

随着 Agentic AI 应用的兴起,LLM 推理正面临前所未有的挑战,单次请求可能涉及百万级 token。在文本生成阶段,性能瓶颈已从计算单元转移至内存系统。AMD Instinct MI450 系列 GPU 凭借 TDM 硬件单元和 Workgroup Clusters 等新特性,为内存敏感型 AI 负载提供了全新解决方案。本文以 Attention Decode 为例,深入解析如何利用 Gluon 语言设计高性能内核,通过优化张量布局、数据加载、流水线及 Split-k 并行化策略,最终在 MI450 上实现了高达 85% 的 HBM 峰值带宽利用率。
随着文本生成阶段的推进,每个新 token 必须关注 KV cache 中的所有历史 token,导致内核需要反复从 HBM 读取过往状态,性能瓶颈因此从计算单元转移到了内存系统。