LLM 꼬리 지연 시간을 해결하는 간단한 방법: 요청을 두 번 보내세요
A simple fix for LLM tail latency

실시간 음성 에이전트에서 LLM 응답이 느리면 사용자가 끊을 수 있습니다. HOAi는 표준 티어에서 모든 요청을 두 번 보내 더 빠른 응답을 사용하는 방법으로, 우선 티어를 쓰는 것보다 더 나은 지연 시간을 얻을 수 있음을 발견했습니다. 50개의 실제 요청을 재생한 결과, 최악의 경우 첫 토큰 시간은 4.2초에서 1.2초로, 전체 응답 시간은 9.8초에서 3.5초로 줄었습니다. 느린 응답이 드물고 독립적일 때 이 방법은 비용을 두 배로 늘리지 않고도 꼬리 지연 시간을 크게 줄일 수 있습니다.
요청을 두 번 보내는 것이 우선 티어보다 확실히 더 나은 성능을 보였습니다.