Enviar cada solicitud dos veces reduce la latencia de LLM mejor que el nivel prioritario

A simple fix for LLM tail latency

Enviar cada solicitud dos veces reduce la latencia de LLM mejor que el nivel prioritario

En HOAi, un agente de voz que atiende llamadas, las respuestas lentas de LLM causaban silencios incómodos y colgadas. Compararon el nivel prioritario de OpenAI (2x costo) con enviar cada solicitud dos veces en el nivel estándar y quedarse con la respuesta más rápida. Replicando 50 solicitudes reales, el envío doble superó al nivel prioritario: el peor tiempo hasta el primer token bajó de 4.2s a 1.2s, y el peor tiempo total de 9.8s a 3.5s, igualando la mediana. Esta solución simple funciona cuando las respuestas lentas son raras e independientes, y reduce drásticamente los silencios de 10 segundos.

Enviar la solicitud dos veces superó claramente al nivel prioritario.

Más de este día

2026-08-17