24GB GPU에서 256K 컨텍스트로 Qwen3.8 27B: MTP로 초당 50토큰 달성
Qwen3.8-27B at 256K on a 24GB RTX PRO 4000 SFF (432 GB/s): 50 tok/s with MTP

RTX PRO 4000 SFF(24GB)에서 Qwen3.8 27B 모델을 256K 컨텍스트로 실행한 실험 결과, 맞춤형 llama.cpp 빌드와 NVFP4 하이브리드 양자화, MTP(Multi-Token Prediction)를 결합해 평균 50.44 tok/s를 달성했습니다. 순수 타깃 디코딩 대비 MTP로 2.81배 속도 향상, 클린 master 대비 21.97% 향상입니다. 핵심은 단일 구성 요소가 아닌 양자화, 드래프터, CUDA 커널, 메모리 레이아웃 간의 정합성에 있었습니다. NVFP4 기성 양자화는 품질 저하로 실패했고, Hermes 데이터로 보정한 하이브리드 양자화가 Q4_1 수준의 품질을 유지하면서 더 빠른 속도를 제공했습니다. MTP 드래프터의 정밀도를 높이면 오히려 성능이 떨어졌으며, 이는 드래프터와 타깃이 하나의 양자화 시스템으로 동작하기 때문입니다.
구성 요소 중 어느 것도 단독으로 이긴 것이 없습니다. 승리한 설정은 양자화, 드래프터, CUDA 커널, 메모리 레이아웃, 워크로드 사이의 조화에서 나왔습니다.