Nari Labs logra que su TTS responda en menos de 50 ms
How we made a text-to-speech model respond in sub-50 ms

Nari Labs presenta una implementación de Qwen3-TTS 1.7B CustomVoice que alcanza 10 peticiones por segundo y un p95 de tiempo hasta el primer audio audible de menos de 50 ms en una sola NVIDIA H100 SXM, manteniendo reproducción en tiempo real. Comparan cinco motores de inferencia, incluyendo vLLM-Omni y SGLang-Omni, y solo el suyo logra ese rendimiento. Optimizan mediante un planificador unificado para los tres módulos del modelo, eliminación de silencio inicial y caché de estado en el codec. El coste estimado es de ~2 dólares por millón de caracteres, frente a los 100 dólares de ElevenLabs V3.
Nuestro planificador selecciona una solicitud urgente como ancla y llena el resto del lote con trabajo compatible, lo que ayuda a que la solicitud crítica cumpla su plazo mientras se utiliza eficazmente la GPU.
- toebee
El tiempo hasta el primer audio (TTFA) es crítico para aplicaciones de voz en tiempo real. Las implementaciones de código abierto (p. ej., vLLM-Omni, SGLang-Omni) suelen ser demasiado lentas para producción y pueden tener problemas con la reproducción en tiempo real si buscas menor latencia. Queríamos arreglar eso. Optimizamos qwen3-tts, un modelo TTS de código abierto popular, para lograr 34 ms p95 TTFA a 10 solicitudes por segundo en 1 x H100. Publicamos la implementación y el benchmark, así como un desglose de cómo se hizo. github: https://github.com/nari-labs/nari-qwen3-tts
- armcat
Habiendo construido mi propio asistente de voz (https://github.com/acatovic/ova) y probado muchos otros servicios y modelos, siento que la verdadera victoria es cuando esto está en el dispositivo, y por 'en el dispositivo' me refiero a que sea muy barato de ejecutar en un teléfono, y no H100. He estado usando Pocket TTS, que es súper rápido, y también Chatterbox y Fish Audio S2 Pro (en Mac/PC); siento que estamos tan cerca, pero aún tan lejos. La calidad es asombrosa, pero ¿podemos llevar esto al siguiente nivel y hacer que funcione en móvil? ¿Qué se necesitaría?
- nowittyusername
Esto es justo lo mío, ya que he estado construyendo un agente de voz local durante un año. He probado muchos modelos diferentes y tengo una implementación personalizada para omni voice que he ajustado durante muchos meses. Nunca he podido lograr menos de 200 ms de TTFA para ese modelo con 24 pasos, pero la razón es... la calidad. Encuentro que hay mucho margen de mejora en muchos modelos TTS existentes, por un margen enorme. Pero también hay un muro de calidad que eventualmente alcanzas y donde la compensación de menor latencia pero menor calidad no vale la pena. Al hacer un agente de voz que suene realmente bien, la calidad de la voz, la cadencia, la expresión, etc., importan mucho. Será interesante probar esta implementación y ver si sus salidas de calidad cumplen mis expectativas; si es así, buen trabajo de verdad.