Nari Labs, Qwen3-TTS 서빙 속도를 50ms 아래로 끌어내다
How we made a text-to-speech model respond in sub-50 ms

Nari Labs가 Qwen3-TTS 1.7B CustomVoice 모델을 NVIDIA H100 SXM 한 대에서 p95 기준 50ms 미만의 TTFA(첫 오디오 도달 시간)와 초당 10건의 요청 처리, 그리고 실시간 재생을 동시에 달성했다고 발표했다. 이는 기존 vLLM-Omni, SGLang-Omni, VoxServe, M* 등의 구현을 튜닝한 결과와 비교했을 때 유일한 성과다. 핵심은 Talker, Code Predictor, Codec을 하나의 스케줄러로 통합하고, 첫 오디오 전후의 우선순위를 다르게 두며, Code Predictor의 고정된 구조를 CUDA 그래프로 활용하고, Codec의 상태 캐시를 도입한 점이다. 이를 통해 100만 자당 약 2달러의 비용으로 고속 TTS 서비스를 제공할 수 있다고 한다.
우리의 스케줄러는 긴급한 요청을 앵커로 선택하고 나머지 배치를 호환 가능한 작업으로 채워, 중요한 요청이 데드라인을 맞추면서도 GPU를 효율적으로 사용하게 한다.
HN 토론
41- vivzkestrel
음성 실시간 애플리케이션에서 첫 오디오까지의 시간(TTFA)은 매우 중요합니다. 오픈소스 구현(vLLM-Omni, SGLang-Omni 등)은 종종 프로덕션 환경에서 너무 느리고, 더 낮은 지연 시간을 추구하면 실시간 재생에 문제가 생길 수 있습니다. 우리는 이를 해결하고자 했습니다.
우리는 인기 있는 오픈소스 TTS 모델인 qwen3-tts를 최적화하여 H100 1개에서 초당 10건의 요청에 대해 p95 TTFA 34ms를 달성했습니다. 구현과 벤치마크, 그리고 어떻게 수행했는지에 대한 분석을 오픈소스로 공개합니다.
- toebee
직접 음성 어시스턴트를 구축해 본 사람으로서(https://github.com/acatovic/ova) 많은 다른 서비스와 모델을 시도해 본 결과, 진정한 승리는 이 기술이 기기 내에서 실행될 때라고 생각합니다. 여기서 '기기 내'란 H100이 아니라, 휴대폰에서 매우 저렴하게 실행될 수 있다는 뜻입니다. 저는 현재 매우 빠른 Pocket TTS를 사용 중이고, 또한 Chatterbox와 Fish Audio S2 Pro(Mac/PC용)도 사용해 봤습니다. 우리는 아주 가까이 왔지만, 아직 멀었다고 느낍니다. 품질은 놀랍지만, 이것을 한 단계 더 끌어올려 모바일에서 실행할 수 있게 만들 수 있을까요? 그러려면 무엇이 필요할까요?
- armcat
이 주제는 제가 1년 동안 로컬 음성 에이전트를 구축해 온 것과 정확히 일치합니다. 저는 다양한 모델을 시도해 왔고, 여러 달에 걸쳐 튜닝한 omni voice에 대한 맞춤형 구현을 가지고 있습니다. 그 모델의 24 스텝에서 200ms보다 빠른 TTFA를 달성한 적은 없지만, 그 이유는... 품질 때문입니다. 많은 TTS 모델에서 개선의 여지가 크다는 것을 발견했습니다. 그러나 결국 도달하게 되는 품질의 한계가 있으며, 더 빠른 지연 시간을 위해 품질을 낮추는 것은 가치가 없습니다. 정말 좋은 음성 에이전트를 만들 때 음성 품질, 억양, 표현 등이 매우 중요합니다. 이 구현을 시도해 보고 그 출력 품질이 제 기대에 부합하는지 확인하는 것이 흥미로울 것입니다. 만약 그렇다면 정말 훌륭한 일입니다.