Nari Labs logra que su TTS responda en menos de 50 ms
How we made a text-to-speech model respond in sub-50 ms

Nari Labs presenta una implementación de Qwen3-TTS 1.7B CustomVoice que alcanza 10 peticiones por segundo y un p95 de tiempo hasta el primer audio audible de menos de 50 ms en una sola NVIDIA H100 SXM, manteniendo reproducción en tiempo real. Comparan cinco motores de inferencia, incluyendo vLLM-Omni y SGLang-Omni, y solo el suyo logra ese rendimiento. Optimizan mediante un planificador unificado para los tres módulos del modelo, eliminación de silencio inicial y caché de estado en el codec. El coste estimado es de ~2 dólares por millón de caracteres, frente a los 100 dólares de ElevenLabs V3.
Nuestro planificador selecciona una solicitud urgente como ancla y llena el resto del lote con trabajo compatible, lo que ayuda a que la solicitud crítica cumpla su plazo mientras se utiliza eficazmente la GPU.