Enviar cada solicitud dos veces reduce la latencia de LLM mejor que el nivel prioritario
A simple fix for LLM tail latency

En HOAi, un agente de voz que atiende llamadas, las respuestas lentas de LLM causaban silencios incómodos y colgadas. Compararon el nivel prioritario de OpenAI (2x costo) con enviar cada solicitud dos veces en el nivel estándar y quedarse con la respuesta más rápida. Replicando 50 solicitudes reales, el envío doble superó al nivel prioritario: el peor tiempo hasta el primer token bajó de 4.2s a 1.2s, y el peor tiempo total de 9.8s a 3.5s, igualando la mediana. Esta solución simple funciona cuando las respuestas lentas son raras e independientes, y reduce drásticamente los silencios de 10 segundos.
Enviar la solicitud dos veces superó claramente al nivel prioritario.