单卡 AMD MI300X 跑满 DeepSeek V4

DeepSeek V4 Flash on a Single AMD MI300X

我在单张 AMD MI300X 上成功部署了 DeepSeek-V4-Flash 模型,无需额外的权重量化或卸载。通过修复 FP8 格式兼容性、MoE 路由及内核调优,该配置在 192GB HBM 中完整容纳了 304B 参数模型。实测单流解码速度达 168.6 tok/s,Prefill 速度突破 8.5K tok/s,甚至能支撑 64 路并发而不报错。这份生产级配置包含 Docker Compose 栈、SHA-256 校验及针对 gfx942 的 AITER 调优表,为在 AMD 硬件上运行大模型提供了可靠的参考方案。

对于 304B 参数的检查点,其显存容量允许简单的单 GPU 部署:整个模型无需 PCIe 权重流或层卸载即可完全放入 HBM 中。

同日更多故事

2026-08-04