Gluon-Kernel-Optimierung für AMD MI450 GPUs im Attention Decode

Attention Decode on AMD MI450 GPUs: A Gluon Kernel Optimization Guide

Gluon-Kernel-Optimierung für AMD MI450 GPUs im Attention Decode

Ich zeige, wie sich der Performance-Flaschenhals bei LLM-Inferenz von der Rechenleistung zum Speichersystem verlagert. Mit der AMD Instinct MI450 nutzen wir neue Hardware-Features wie TDM und Workgroup Clusters, um einen hochoptimierten Gluon-Kernel zu entwickeln. Dieser erreicht 85% der maximalen HBM-Bandbreite und demonstriert effiziente Strategien für memory-sensitive AI-Workloads.

Der Performance-Flaschenhals verlagert sich von den Compute Units zum Speichersystem, da jeder neue Token auf alle vorherigen Tokens im KV-Cache zugreifen muss.
  1. touisteur

    So sehr ich diese Artikel auch genieße und es begrüße, dass AMD mehr technische Beiträge veröffentlicht, fühlt es sich doch eingeschränkt, ja sogar angespannt an, nicht die entsprechenden Begriffe aus dem Vorläufer hier (NVIDIA) zitieren zu können. Ein weiterer Haufen Jargon für sehr ähnliche Architekturen und Programmiermodelle... HIP und ROCm haben tatsächlich erstaunliche Fortschritte gemacht, um das Portieren von CUDA-Entwicklern zu erleichtern, und ich weiß, dass es schlecht ist, hinter einem (monopolistischen) Ziel herzurennen, das man nicht kontrollieren kann... aber ich habe das Gefühl, dass dies Teil der tausend kleinen Schnitte ist.

  2. broadsidepicnic

    Also, wann kann ich MI350s für mein Homelab kaufen?

Mehr von diesem Tag

2026-08-01