AMD MI450 上的 Gluon 内核优化实战

Attention Decode on AMD MI450 GPUs: A Gluon Kernel Optimization Guide

AMD MI450 上的 Gluon 内核优化实战

随着 Agentic AI 应用的兴起,LLM 推理正面临前所未有的挑战,单次请求可能涉及百万级 token。在文本生成阶段,性能瓶颈已从计算单元转移至内存系统。AMD Instinct MI450 系列 GPU 凭借 TDM 硬件单元和 Workgroup Clusters 等新特性,为内存敏感型 AI 负载提供了全新解决方案。本文以 Attention Decode 为例,深入解析如何利用 Gluon 语言设计高性能内核,通过优化张量布局、数据加载、流水线及 Split-k 并行化策略,最终在 MI450 上实现了高达 85% 的 HBM 峰值带宽利用率。

随着文本生成阶段的推进,每个新 token 必须关注 KV cache 中的所有历史 token,导致内核需要反复从 HBM 读取过往状态,性能瓶颈因此从计算单元转移到了内存系统。

同日更多故事

2026-08-01