DeepSeek V4 Flash läuft auf einer einzelnen AMD MI300X – 168,6 Tokens pro Sekunde
DeepSeek V4 Flash on a Single AMD MI300X
Ein Entwickler zeigt, wie sich das 304B-Parameter-Modell DeepSeek V4 Flash auf einer einzelnen AMD MI300X-GPU in Produktion betreiben lässt. Das gesamte Modell passt in den HBM-Speicher, ohne Quantisierung oder Offloading. Nötig waren Patches für FP8-Format, MoE-Routing und Kernel-Shapes. Die Ergebnisse: 168,6 Tokens pro Sekunde im Single-Stream-Decode, bis zu 8,5K Tokens pro Sekunde beim Prefill und 830 Tokens pro Sekunde bei 64 gleichzeitigen Streams.
Ein Kernel, der auf MI300X OCP-Semantik annimmt, kann im Skalenbereich um den Faktor zwei danebenliegen.