AMD MI450 上的 Gluon 内核优化实战
Attention Decode on AMD MI450 GPUs: A Gluon Kernel Optimization Guide

随着 Agentic AI 应用的兴起,LLM 推理正面临前所未有的挑战,单次请求可能涉及百万级 token。在文本生成阶段,性能瓶颈已从计算单元转移至内存系统。AMD Instinct MI450 系列 GPU 凭借 TDM 硬件单元和 Workgroup Clusters 等新特性,为内存敏感型 AI 负载提供了全新解决方案。本文以 Attention Decode 为例,深入解析如何利用 Gluon 语言设计高性能内核,通过优化张量布局、数据加载、流水线及 Split-k 并行化策略,最终在 MI450 上实现了高达 85% 的 HBM 峰值带宽利用率。
随着文本生成阶段的推进,每个新 token 必须关注 KV cache 中的所有历史 token,导致内核需要反复从 HBM 读取过往状态,性能瓶颈因此从计算单元转移到了内存系统。
HN 评论区
11- touisteur
虽然我很欣赏这类文章,也乐见 AMD 多写一些偏技术向的内容,但无法引用前驱者(NVIDIA)的对应术语,确实让人感到受限,甚至别扭。明明架构和编程模型非常相似,却又要造一批新行话……HIP 和 ROCm 在让 CUDA 开发者轻松移植方面其实已经取得了惊人进展。我知道追赶一个你无法掌控的(垄断者)移动靶很糟糕……但我感觉这正是那“千刀万剐”中的一刀。
- broadsidepicnic
那我什么时候能买到 MI350 来给我的家庭实验室用?