Nari Labs, Qwen3-TTS 서빙 속도를 50ms 아래로 끌어내다
How we made a text-to-speech model respond in sub-50 ms

Nari Labs가 Qwen3-TTS 1.7B CustomVoice 모델을 NVIDIA H100 SXM 한 대에서 p95 기준 50ms 미만의 TTFA(첫 오디오 도달 시간)와 초당 10건의 요청 처리, 그리고 실시간 재생을 동시에 달성했다고 발표했다. 이는 기존 vLLM-Omni, SGLang-Omni, VoxServe, M* 등의 구현을 튜닝한 결과와 비교했을 때 유일한 성과다. 핵심은 Talker, Code Predictor, Codec을 하나의 스케줄러로 통합하고, 첫 오디오 전후의 우선순위를 다르게 두며, Code Predictor의 고정된 구조를 CUDA 그래프로 활용하고, Codec의 상태 캐시를 도입한 점이다. 이를 통해 100만 자당 약 2달러의 비용으로 고속 TTS 서비스를 제공할 수 있다고 한다.
우리의 스케줄러는 긴급한 요청을 앵커로 선택하고 나머지 배치를 호환 가능한 작업으로 채워, 중요한 요청이 데드라인을 맞추면서도 GPU를 효율적으로 사용하게 한다.