LLM 延迟太高?试试把请求发两次
A simple fix for LLM tail latency

当 LLM 响应过慢影响实时体验时,很多人会直接升级付费的 Priority tier。但 HOAi 团队发现了一个更简单的方案:将每个请求发送两次,然后取响应更快的那一个。在语音助手场景中,偶尔出现的 10 到 20 秒延迟会导致通话尴尬中断。通过对比测试,发送两次请求的策略在 p99 延迟和 worst-case 表现上,均显著优于 OpenAI 的付费优先层级,且成本更低。只要慢响应是罕见且独立的,这种简单技巧就能大幅减少长沉默,让实时交互更流畅。
在支付更快的服务层级费用之前,先测试一下将请求发送两次的效果,你可能会在成本不变的情况下获得更低的延迟。
- Groxx
这听起来更像是 Fast Fallback 的活儿:https://en.wikipedia.org/wiki/Happy_Eyeballs
- nine_k
发送两个完全相同的并行请求是经典做法。但从逻辑上讲,这也会让成本翻倍。
我会在第一个请求在比如说 1 秒内没能返回第一个 token 时,再发送第二个请求。这样,如果第一个请求卡住了(这是一种罕见情况),我们就有机会补救。
我好奇的是,LLM 服务商的高可用层级是否会在内部做类似的事情。
- dvaplima
这转折真有意思,有没有人做过除了语音/通话以外的其他类型请求(优先级 vs 发两次)的基准测试?还是说现有的测试已经涵盖了这些?