LLM 延迟太高?试试把请求发两次

A simple fix for LLM tail latency

LLM 延迟太高?试试把请求发两次

当 LLM 响应过慢影响实时体验时,很多人会直接升级付费的 Priority tier。但 HOAi 团队发现了一个更简单的方案:将每个请求发送两次,然后取响应更快的那一个。在语音助手场景中,偶尔出现的 10 到 20 秒延迟会导致通话尴尬中断。通过对比测试,发送两次请求的策略在 p99 延迟和 worst-case 表现上,均显著优于 OpenAI 的付费优先层级,且成本更低。只要慢响应是罕见且独立的,这种简单技巧就能大幅减少长沉默,让实时交互更流畅。

在支付更快的服务层级费用之前,先测试一下将请求发送两次的效果,你可能会在成本不变的情况下获得更低的延迟。
  1. Groxx

    这听起来更像是 Fast Fallback 的活儿:https://en.wikipedia.org/wiki/Happy_Eyeballs

  2. nine_k

    发送两个完全相同的并行请求是经典做法。但从逻辑上讲,这也会让成本翻倍。

    我会在第一个请求在比如说 1 秒内没能返回第一个 token 时,再发送第二个请求。这样,如果第一个请求卡住了(这是一种罕见情况),我们就有机会补救。

    我好奇的是,LLM 服务商的高可用层级是否会在内部做类似的事情。

  3. dvaplima

    这转折真有意思,有没有人做过除了语音/通话以外的其他类型请求(优先级 vs 发两次)的基准测试?还是说现有的测试已经涵盖了这些?

同日更多故事

2026-08-17