AMD MI450 上的 Gluon 内核优化实战

Attention Decode on AMD MI450 GPUs: A Gluon Kernel Optimization Guide

AMD MI450 上的 Gluon 内核优化实战

随着 Agentic AI 应用的兴起,LLM 推理正面临前所未有的挑战,单次请求可能涉及百万级 token。在文本生成阶段,性能瓶颈已从计算单元转移至内存系统。AMD Instinct MI450 系列 GPU 凭借 TDM 硬件单元和 Workgroup Clusters 等新特性,为内存敏感型 AI 负载提供了全新解决方案。本文以 Attention Decode 为例,深入解析如何利用 Gluon 语言设计高性能内核,通过优化张量布局、数据加载、流水线及 Split-k 并行化策略,最终在 MI450 上实现了高达 85% 的 HBM 峰值带宽利用率。

随着文本生成阶段的推进,每个新 token 必须关注 KV cache 中的所有历史 token,导致内核需要反复从 HBM 读取过往状态,性能瓶颈因此从计算单元转移到了内存系统。
  1. touisteur

    虽然我很欣赏这类文章,也乐见 AMD 多写一些偏技术向的内容,但无法引用前驱者(NVIDIA)的对应术语,确实让人感到受限,甚至别扭。明明架构和编程模型非常相似,却又要造一批新行话……HIP 和 ROCm 在让 CUDA 开发者轻松移植方面其实已经取得了惊人进展。我知道追赶一个你无法掌控的(垄断者)移动靶很糟糕……但我感觉这正是那“千刀万剐”中的一刀。

  2. broadsidepicnic

    那我什么时候能买到 MI350 来给我的家庭实验室用?

同日更多故事

2026-08-01