AMD MI300X 단일 GPU에서 DeepSeek V4 Flash 실행, 168.6 tok/s 달성
DeepSeek V4 Flash on a Single AMD MI300X
GitHub 사용자 ryanzhou가 단일 AMD MI300X GPU에서 DeepSeek V4 Flash 0731 체크포인트를 프로덕션 환경에서 실행하는 설정을 공개했습니다. vLLM ROCm nightly와 AITER를 활용해 FP8 형식 비호환성, MoE 라우팅 버그, 추측 디코딩 문제 등을 해결했으며, 추가 양자화나 오프로드 없이 156.67 GiB의 가중치를 HBM에 적재했습니다. 성능 결과는 단일 스트림 디코드 168.6 tok/s, 프리필 약 7.9–8.5K tok/s, 64개 동시 스트림에서도 830 tok/s 집계 처리량을 기록했습니다. 또한 256K 컨텍스트 검증, CPU 오프로드를 포함한 하이브리드 KV 캐시 전략, DSpark-7 추측 디코딩 등 세부 구성과 패치가 포함되어 있습니다.
MI300X에서 OCP 의미론을 가정하는 커널은 스케일 도메인에서 2배 오차가 발생할 수 있습니다. 이 FP8 구현에서의 정확성이 최우선이었고, 성능 튜닝은 그 다음이었습니다.