grep만으로 최신 RAG 파이프라인과 동급 성능, 단 5배 느리다
Benchmarking retrieval for agents on messy real-world company knowledge

kapa.ai가 실제 기업 지식(문서, 티켓, 채팅, 위키, 코드)에 대한 검색 성능을 측정하려고 1,000개의 평가 케이스로 구성된 Company Knowledge Bench를 만들었다. 7개 검색기를 비교한 결과, 대형 모델에 grep만 달아도 튜닝된 RAG 파이프라인과 같은 0.61점을 기록했지만 5배 느렸다. Kapa의 에이전트형 검색기인 Deep 모드는 약 5초에 0.65점으로 가장 높았다. 고정 파이프라인에서는 리랭커 추가가 적은 비용으로 큰 성능 향상을 가져왔다.
최전선 모델에 grep만 달아도 튜닝된 최신 검색 파이프라인과 같은 0.61점을 기록했지만, 5배 더 오래 걸린다.