소형 LLM으로 RAG 컨텍스트 68% 제거, kapa.ai의 비용 절감 비결
Pruning RAG context down to what the answer actually needs

kapa.ai는 RAG 기반 AI 어시스턴트의 비용을 줄이기 위해, 리트리버와 생성 모델 사이에 작고 저렴한 LLM을 추가했습니다. 이 프루너(pruner)는 질문과 검색된 청크를 함께 보고, 답변에 불필요한 청크를 제거합니다. 그 결과, 컨텍스트의 약 68%를 버리면서도 답변에 필요한 청크의 96%를 유지했고, 쿼리당 비용을 약 34% 절감했습니다. 이 글은 단순한 상위-K 잘라내기나 앵커 문서 방식이 실패한 이유와, LLM이 청크를 5단계로 평가하는 리스트와이즈 방식의 설계 및 결과를 설명합니다.
리트리버는 최대 재현율을 목표로 하며 생성기가 노이즈를 무시할 것이라고 믿지만, 생성기는 무시하는 모든 청크에 대해 비용을 지불합니다.