LLMの応答遅延、二重送信で劇的改善——最悪9.8秒→3.5秒
A simple fix for LLM tail latency

HOAiの音声エージェント開発チームが、LLMの応答遅延(テールレイテンシ)対策として、優先サービス層へのアップグレードではなく、全リクエストを2回送信して速い方を使う手法を検証。50件の実運用リクエストを比較した結果、標準層の二重送信は優先層を上回り、最悪の完全応答時間は9.8秒から3.5秒に短縮された。遅延がまれで独立している場合に有効で、通話中の長い沈黙を大幅に削減できるという。
リクエストを2回送信すれば、同じターンで両方のコピーが遅くなる可能性は低くなります。
HNでの議論
18- ak_t
すべてのリクエストを二重送信する必要はなく、時間内に返ってこなかったものだけを送ればいい。p95レイテンシなどのしきい値まで待ってから、バックアップリクエストを送る。先に返ってきた方のレスポンスを使えば、コストを倍増させることなくテールレイテンシを削減できる。なぜなら、重複するのはテールのごく一部のリクエストだけだからだ。Googleはこれを「ヘッジリクエスト」と呼んでいる: https://cacm.acm.org/research/the-tail-at-scale/
- Groxx
これは代わりにFast Fallbackの出番では?: https://en.wikipedia.org/wiki/Happy_Eyeballs
- nine_k
同一の並行リクエストを2つ送るのは古典的なアプローチだ。しかし、論理的に言えば、コストも倍になるはず。私は、最初のリクエストが例えば1秒以内に最初のトークンを返さなかった場合に、2つ目のリクエストを送るだろう。そうすれば、最初のリクエストが停滞している可能性があり、それはまれなイベントだ。LLMプロバイダーの高可用性ティアが内部で同様のことをしているのか興味がある。